Skip to main content
Las evaluaciones en línea aplican criterios consistentes a las sesiones de agentes. Úsalas para señales que deban medirse continuamente, en lugar de investigarse únicamente durante una auditoría.

Revisar la calidad de las evaluaciones

  1. Ve a Observe → Evaluations.
  2. Agrega una serie y elige el agente, el entorno, la puntuación de evaluación, la estadística y la curva.
  3. Agrega series para comparar entornos, agentes o claves de puntuación.
  4. Selecciona un resultado para abrir las sesiones correspondientes o compartir la vista filtrada. Usa Observe → Metrics para latencia, tokens, costo y otros valores de magnitud. Un panel de calidad que muestra las puntuaciones de evaluación promedio y las tendencias a lo largo del tiempo.
Abre una sesión desde el desglose para inspeccionar el razonamiento por puntuación:Una vista de detalle de sesión que muestra las puntuaciones de evaluación y el razonamiento junto a la traza completa.
Un evaluador recibe la identidad de la sesión, el entorno, las marcas de tiempo y los eventos ordenados. Puede devolver claves de puntuación numéricas con razonamiento opcional y un resumen. Los evaluadores de larga duración pueden devolver un trabajo pendiente y ser consultados posteriormente.

Buenos objetivos de evaluación

  • Completitud o corrección de tareas
  • Fundamentación y riesgo de alucinaciones
  • Selección de herramientas y eficiencia de herramientas
  • Cumplimiento de políticas o procesos
  • Presupuestos de costo y latencia
  • Escalado humano requerido

De la puntuación a la respuesta

Muestra las puntuaciones en paneles para rastrear tendencias. Crea alertas para umbrales o condiciones compuestas. Cuando una puntuación disminuye en una población, ejecuta una auditoría para investigar el motivo; cuando la causa es una acción repetible, despliega una política.

Construir un evaluador

Implementa evaluaciones síncronas o asíncronas con el SDK de evaluadores de Python.