
Deja de revisar ejecuciones manualmente
Antes tenías que verificar un puñado de ejecuciones y esperar que el resto estuviera bien. Ahora cada sesión completada se puntúa en el momento en que termina, en las dimensiones que te importan: utilidad, eficiencia de herramientas, factualidad, seguridad, lo que sea que defina tu estándar de calidad. Tú defines las claves de puntuación; Failproof AI Observability almacena, sigue las tendencias y muestra lo que tu evaluador devuelva. Ninguna ejecución queda sin puntuar, y dejas de enterarte de una regresión a través de un ticket de soporte. Las puntuaciones aparecen en la cuadrícula de sesiones en/<org-slug>/sessions (barra lateral → observe → sessions), con un grupo de distintivos por fila. ¿Quieres solo las ejecuciones que no alcanzaron el nivel? Filtra la cuadrícula por rango de puntuación, por ejemplo utilidad por debajo de 0,5, y obtén exactamente las ejecuciones que vale la pena revisar. Ver las puntuaciones requiere el permiso evaluations:read.
Descubre por qué una ejecución obtuvo una puntuación baja
Un número te dice que una ejecución fue débil; la página de sesión te dice por qué. Abre cualquier ejecución y el panel lateral derecho muestra primero el resumen general, seguido de una barra por dimensión con el razonamiento propio de tu evaluador debajo de cada una, de modo que pasas de “esto obtuvo 0,4 en factualidad” a la afirmación exacta que falló en cuestión de segundos.
evaluations:trigger) vuelve a puntuar la sesión en el lugar y añade el nuevo resultado a su línea de tiempo, de modo que las puntuaciones anteriores permanecen visibles como historial. Lo encontrarás en /<org-slug>/sessions/<session-id>.
Observa la tendencia de calidad en toda la flota
Una ejecución con puntuación baja es ruido; un grupo entero descendiendo es una señal. Los dashboards guardados convierten tus puntuaciones en una tendencia que puedes monitorear de un vistazo: utilidad promedio esta semana frente a la anterior, por agente, por entorno.
/<org-slug>/dashboards (barra lateral → analyze → dashboards), se comparten en toda tu organización, y cada tarjeta agrupa las sesiones correspondientes: cuántas hay, el promedio de cada puntuación destacada y una minigráfica de tendencia. “Open in sessions” te lleva directamente a las ejecuciones prefiltradas detrás de cualquier número. Para verlos se requiere dashboards:read más evaluations:read.
Conecta un evaluador una sola vez
La puntuación es opcional y permanece completamente desactivada hasta que apuntes Failproof AI Observability a un puntuador. Configuras un pequeño servicio HTTP (Observability incluye una referencia funcional que puedes copiar), estableces dos valores en tu servidor, y a partir de entonces todas las ejecuciones se puntúan automáticamente. La guía completa, el contrato de puntuación y el SDK están disponibles en la guía detallada. ¿No sabes qué dimensiones vale la pena puntuar en primer lugar? La habilidad de agente evaluador hace que tu agente de codificación lo determine en función de tus propias sesiones, y luego construye y despliega el servicio.Relacionado
- Suite de evaluación: conecta tu evaluador, el contrato de puntuación y el SDK.
- Habilidad de agente evaluador: deja que un agente de codificación elija tus dimensiones de puntuación y construya el evaluador.
- Sesiones: la cuadrícula ejecución por ejecución donde aparecen las puntuaciones.
- Dashboards: guarda y comparte tendencias de calidad en toda tu organización.
- Auditorías: la otra función de calidad automática de Observability, para investigaciones entre sesiones.

