Generar a partir de una descripción
- Ve a Analyze → eval authoring y selecciona new eval.
- Describe qué medir en lenguaje natural, o elige entre start from an example…, y selecciona draft.
- Revisa los campos y el código que se rellena automáticamente, luego pruébalo y despliégalo.

Configurar los campos
Usa la condición para limitar el alcance de una evaluación a los agentes y entornos para los que está pensada:
Escribir el código tú mismo
El evaluator code es una expresión Python que devuelveEvalResult(...), con session en el ámbito. Esta expresión calcula la proporción de resultados de herramientas que volvieron correctamente:
score= para una evaluación de puntuación, o una entrada metrics o assertions con el nombre de la clave para una métrica o una aserción. Otras métricas y aserciones se incluyen junto a ella, con hasta 25 resultados por ejecución.
No hay nada más accesible: sin imports y sin atributos más allá de los datos de sesión y los métodos simples de cadenas y diccionarios como
get, lower y split, que deben invocarse en lugar de referenciarse. Las claves de payload son las que envíen tus agentes — status más arriba es solo un ejemplo — así que léelas desde una sesión real. format ordena el código y fix le pide al asistente que lo repare. El código puede tener hasta 128 KiB, y la condición hasta 16 KiB.


