- una puntuación de 0 a 1, opcionalmente marcada como aprobada o fallida
- una métrica, como un conteo, una duración o un costo, con su unidad
- una aserción, que aprobó o no
Dos tipos de evaluador
El Python alojado es deliberadamente simple: una expresión, sin imports, sin red. Todo lo que necesite un modelo —un juez LLM que evalúe si una respuesta fue relevante, por ejemplo— se ejecuta en tu propio worker. Ninguno de los dos tipos necesita una conexión entrante: los workers toman las sesiones finalizadas y envían los resultados mediante HTTPS saliente.
Cada organización evalúa sus propios agentes
Las evaluaciones pertenecen a la organización que las define. Cada organización en una instancia escribe las suyas propias —sus propios checks, condiciones, umbrales y etiquetas—, las versiona y despliega sin afectar a ninguna otra, y solo ve sus propios resultados. Filtra esos resultados por agente, entorno, evaluación y tiempo, o consúltale al asistente sobre ellos.Del primer borrador a puntuaciones en producción
1
Escríbela
Describe qué medir y deja que el asistente haga el borrador, o escríbela tú mismo. Ver Escribir una evaluación.
2
Pruébala
Ejecútala contra sesiones reales antes de publicarla; nada se almacena. Ver Probar una evaluación.
3
Despliégala y versionala
Despliega una versión inmutable, publica nuevas versiones a medida que evoluciona, y vuelve a una versión anterior si es necesario. Ver Desplegar y versionar.
4
Lee los resultados
Visualiza las puntuaciones a lo largo del tiempo, compara agentes y entornos, y consulta al asistente. Ver Leer resultados de evaluaciones.

