Skip to main content
Las evaluaciones en línea aplican criterios consistentes a las sesiones de agentes. Úsalas para señales que deben medirse de forma continua, en lugar de investigarse únicamente durante una auditoría.

Revisar la calidad de las evaluaciones

  1. Ve a Observe → Evaluations.
  2. Añade una serie y elige el agente, el entorno, la puntuación de evaluación, la estadística y la curva.
  3. Añade series para comparar entornos, agentes o claves de puntuación.
  4. Selecciona un resultado para abrir las sesiones correspondientes o compartir la vista filtrada. Usa Observe → Metrics para latencia, tokens, costo y otros valores de magnitud. Panel de calidad que muestra puntuaciones de evaluación promedio y tendencias a lo largo del tiempo.
Abre una sesión desde el desglose para inspeccionar el razonamiento por puntuación:Vista detallada de una sesión que muestra puntuaciones de evaluación y razonamiento junto al rastro completo.
Un evaluador recibe la identidad de la sesión, el entorno, las marcas de tiempo y los eventos ordenados. Puede devolver claves de puntuación numéricas con razonamiento opcional y un resumen. Los evaluadores de larga duración pueden devolver un trabajo pendiente y ser consultados más tarde.

Buenos objetivos de evaluación

  • Finalización o corrección de tareas
  • Fundamentación y riesgo de alucinación
  • Selección de herramientas y eficiencia en su uso
  • Cumplimiento de políticas o procesos
  • Presupuestos de costo y latencia
  • Escalación humana requerida

De la puntuación a la respuesta

Muestra las puntuaciones en paneles para rastrear tendencias. Crea alertas para umbrales o condiciones compuestas. Cuando una puntuación disminuye en una población, realiza una auditoría para investigar el motivo; cuando la causa es una acción repetible, despliega una política.

Construir un evaluador

Implementa evaluaciones síncronas o asíncronas con el SDK de evaluadores de Python.