Configurar un evaluador
1
Instalar el SDK del evaluador
Instala el SDK y el servidor necesario para ejecutarlo.
2
Definir qué puntuar
Crea
evaluator.py. Este ejemplo comprueba si una sesión contiene llamadas a herramientas fallidas.3
Ejecutar y probarlo localmente
Establece un token compartido, inicia el evaluador y confirma que el endpoint de salud responde.En otra terminal:
Conectar el evaluador a Failproof AI
- Despliega el evaluador en una URL HTTPS accesible por Failproof AI Cloud.
- Configura
EVALUATOR_ENDPOINTcon esa URL y estableceEVALUATOR_TOKENcon el mismo token utilizado por el evaluador. Para Cloud gestionado, contacta con support@befailproof.ai para configurar la conexión. - Ejecuta una evaluación y confirma que las puntuaciones aparecen en Failproof AI.
- Panel de control
- CLI
Abre una sesión completada en Observar → Sesiones y selecciona Ejecutar evaluación si no se evaluó automáticamente. Revisa el estado, las puntuaciones, el razonamiento y el resumen en el panel de Evaluación de la sesión.Usa Observar → Evaluaciones para comparar puntuaciones entre agentes o entornos. Usa Observar → Métricas para latencia, coste, tokens y otras mediciones numéricas.Comienza con una sesión para confirmar que el evaluador devolvió las claves de puntuación esperadas y un razonamiento útil para esa ejecución específica.
Una vez que los resultados individuales se vean correctos, usa el panel de evaluación para comparar esas puntuaciones a lo largo del tiempo y entre agentes o entornos.
Un gráfico saludable debe usar nombres de puntuación estables; cambiar una clave crea una serie separada.


EVALUATOR_ENDPOINT en el proceso del servidor. Reinicia el servidor después de cambiar las variables de entorno del evaluador.
El servicio expone GET /health, GET /config, POST /evaluate y opcionalmente GET /evaluate/{job_id}. Devuelve JobPending para trabajo asíncrono y registra @app.job_lookup para que Failproof AI pueda consultarlo periódicamente.
Cuando se configura un token, todas las rutas excepto health requieren el mismo token bearer que Failproof AI envía como EVALUATOR_TOKEN.
Tipos del SDK
Decoradores y rutas
El SDK limita los cuerpos de las solicitudes de evaluación a 25 MiB. Los campos desconocidos en las solicitudes se ignoran para que los servicios permanezcan compatibles a medida que crece el contrato de eventos.
Devolver trabajo asíncrono
UsaJobPending cuando la evaluación no pueda completarse dentro de una sola solicitud. El ID del trabajo es opaco para Failproof AI y debe permanecer resoluble por tu servicio hasta que el resultado sea recogido o expire el tiempo de espera del servidor.
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs y luego el EVALUATOR_POLLING_INTERVAL_SECS del servidor. Los valores se limitan entre 1 segundo y 1 hora. El límite de sondeo en tiempo real predeterminado del servidor es de una hora.
Campos de solicitud y respuesta
Configuración para operadores del servidor
La evaluación automática aplica a todo el despliegue y permanece deshabilitada cuandoEVALUATOR_ENDPOINT está ausente.
El servidor también puede restringir qué organizaciones utilizan el evaluador global del despliegue. Trata los cambios en el endpoint, token, reintentos y restricciones de organización como configuración del operador y reinicia o renueva el servidor tras modificarlos.
Seguridad y operaciones
- Pon el evaluador detrás de HTTPS cuando el tráfico cruce un límite de red de confianza.
- Configura un token bearer no vacío y mantenlo idéntico en ambos servicios.
- No registres el token ni los prompts sensibles completos de los payloads de las solicitudes.
- Haz que los manejadores síncronos sean idempotentes; los reintentos pueden repetir una solicitud.
- Persiste el estado de los trabajos asíncronos fuera de la memoria del proceso en producción.
- Devuelve claves de puntuación estables. Renombrar una clave crea una nueva serie en el gráfico en lugar de modificar la anterior.
eval received, eval responded, job lookup, config returned, auth rejected y excepciones de manejadores. No configura manejadores de registro; utiliza la configuración de registro de la aplicación anfitriona.
