Skip to main content
Un evaluador recibe una sesión de agente completada y devuelve las señales de calidad que te interesan: puntuaciones numéricas, una explicación para cada puntuación y un resumen opcional. Failproof AI almacena estos resultados junto al rastreo y los representa gráficamente a través de agentes y entornos.

Configurar un evaluador

1

Instalar el SDK del evaluador

Instala el SDK y el servidor necesario para ejecutarlo.
2

Definir qué puntuar

Crea evaluator.py. Este ejemplo comprueba si una sesión contiene llamadas a herramientas fallidas.
3

Ejecutar y probarlo localmente

Establece un token compartido, inicia el evaluador y confirma que el endpoint de salud responde.
En otra terminal:

Conectar el evaluador a Failproof AI

  1. Despliega el evaluador en una URL HTTPS accesible por Failproof AI Cloud.
  2. Configura EVALUATOR_ENDPOINT con esa URL y establece EVALUATOR_TOKEN con el mismo token utilizado por el evaluador. Para Cloud gestionado, contacta con support@befailproof.ai para configurar la conexión.
  3. Ejecuta una evaluación y confirma que las puntuaciones aparecen en Failproof AI.
Abre una sesión completada en Observar → Sesiones y selecciona Ejecutar evaluación si no se evaluó automáticamente. Revisa el estado, las puntuaciones, el razonamiento y el resumen en el panel de Evaluación de la sesión.Usa Observar → Evaluaciones para comparar puntuaciones entre agentes o entornos. Usa Observar → Métricas para latencia, coste, tokens y otras mediciones numéricas.Comienza con una sesión para confirmar que el evaluador devolvió las claves de puntuación esperadas y un razonamiento útil para esa ejecución específica.Vista detallada de una sesión mostrando puntuaciones de evaluación y razonamiento junto a su rastreo.Una vez que los resultados individuales se vean correctos, usa el panel de evaluación para comparar esas puntuaciones a lo largo del tiempo y entre agentes o entornos.Panel de calidad con gráficas de puntuaciones del evaluador a lo largo del tiempo.Un gráfico saludable debe usar nombres de puntuación estables; cambiar una clave crea una serie separada.
Para una instancia de Cloud auto-alojada, la evaluación automática está deshabilitada hasta que se establezca EVALUATOR_ENDPOINT en el proceso del servidor. Reinicia el servidor después de cambiar las variables de entorno del evaluador. El servicio expone GET /health, GET /config, POST /evaluate y opcionalmente GET /evaluate/{job_id}. Devuelve JobPending para trabajo asíncrono y registra @app.job_lookup para que Failproof AI pueda consultarlo periódicamente. Cuando se configura un token, todas las rutas excepto health requieren el mismo token bearer que Failproof AI envía como EVALUATOR_TOKEN.

Tipos del SDK

Decoradores y rutas

El SDK limita los cuerpos de las solicitudes de evaluación a 25 MiB. Los campos desconocidos en las solicitudes se ignoran para que los servicios permanezcan compatibles a medida que crece el contrato de eventos.

Devolver trabajo asíncrono

Usa JobPending cuando la evaluación no pueda completarse dentro de una sola solicitud. El ID del trabajo es opaco para Failproof AI y debe permanecer resoluble por tu servicio hasta que el resultado sea recogido o expire el tiempo de espera del servidor.
La cadencia de sondeo se selecciona en este orden: JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs y luego el EVALUATOR_POLLING_INTERVAL_SECS del servidor. Los valores se limitan entre 1 segundo y 1 hora. El límite de sondeo en tiempo real predeterminado del servidor es de una hora.

Campos de solicitud y respuesta

Configuración para operadores del servidor

La evaluación automática aplica a todo el despliegue y permanece deshabilitada cuando EVALUATOR_ENDPOINT está ausente. El servidor también puede restringir qué organizaciones utilizan el evaluador global del despliegue. Trata los cambios en el endpoint, token, reintentos y restricciones de organización como configuración del operador y reinicia o renueva el servidor tras modificarlos.

Seguridad y operaciones

  • Pon el evaluador detrás de HTTPS cuando el tráfico cruce un límite de red de confianza.
  • Configura un token bearer no vacío y mantenlo idéntico en ambos servicios.
  • No registres el token ni los prompts sensibles completos de los payloads de las solicitudes.
  • Haz que los manejadores síncronos sean idempotentes; los reintentos pueden repetir una solicitud.
  • Persiste el estado de los trabajos asíncronos fuera de la memoria del proceso en producción.
  • Devuelve claves de puntuación estables. Renombrar una clave crea una nueva serie en el gráfico en lugar de modificar la anterior.
El SDK emite registros de ciclo de vida estructurados como eval received, eval responded, job lookup, config returned, auth rejected y excepciones de manejadores. No configura manejadores de registro; utiliza la configuración de registro de la aplicación anfitriona.