Skip to main content
Failproof AI Observability es una plataforma autoalojada para observar, evaluar y mejorar tus agentes de IA en producción. Registra todo lo que hacen tus agentes (cada llamada a herramientas, petición al modelo, hook y error), puntúa la calidad de cada ejecución y pone de manifiesto los fallos que no sabías que debías buscar, todo ello en un panel de control que ejecutas dentro de tu propia infraestructura. Si despliegas agentes de IA y estás cansado de adivinar por qué falló una ejecución, esta es la página por la que empezar. Explica qué te ofrece Failproof AI Observability y cómo encajan las piezas, antes de que instales nada.
Failproof AI Observability es un producto empresarial de Failproof AI. ¿Quieres verlo en acción? Solicita una demo: escribe a nikita@befailproof.ai.
Una sesión de Failproof AI Observability dibujada como un grafo de ejecución estilo git junto a su cronología de eventos, con un desglose por ejecución de herramientas, modelos y hooks en el panel derecho Cada ejecución del agente se representa como un grafo de ejecución estilo git (izquierda) junto a su cronología de eventos. Los subagentes paralelos tienen su propio carril; el panel derecho desglosa las herramientas, modelos, hooks y gasto en tokens de la ejecución.

Vélo en acción

Dos vídeos cortos muestran las dos cosas a las que los equipos recurren primero: trazar una ejecución y detectar fallos automáticamente.
Trazado de agentes: sigue una única ejecución paso a paso, desde el objetivo hasta las herramientas y la respuesta final.
Failproof Audit: deja que Failproof AI Observability analice tus registros entre sesiones y te indique qué debes corregir.

Por qué los equipos lo usan

  • Ve lo que tu agente hizo realmente. Cada ejecución se convierte en un grafo de ejecución legible estilo git: qué herramientas se ejecutaron en paralelo, qué subagentes se ramificaron, dónde se atascó y cuánto consumió.
  • Detecta regresiones de calidad automáticamente. Conecta un pequeño servicio de puntuación y Failproof AI Observability puntuará cada ejecución completada, de modo que una caída en utilidad o un pico en alucinaciones aparecerá por sí solo.
  • Encuentra fallos para los que no escribiste ninguna regla. Las auditorías recurrentes analizan tus registros entre sesiones en busca de clústeres de errores, valores atípicos de latencia, puntuaciones bajas y ejecuciones bloqueadas, y te entregan hallazgos clasificados y respaldados por evidencias.
  • Recibe alertas cuando importa. Las reglas de umbral se activan por tasa de error, latencia, coste o puntuaciones del evaluador, y abren incidentes que puedes reconocer, asignar y resolver.
  • Haz preguntas en lenguaje natural. Un asistente de IA integrado en el panel responde preguntas como «¿cómo evoluciona la calidad en producción esta semana?» sobre tus propios datos. Cualquier cambio que realice requiere aprobación.
  • Mantén el control de tus datos. Failproof AI Observability es autoalojada: los eventos, los prompts y los análisis permanecen en la infraestructura que tú controlas.

Qué obtienes

Failproof AI Observability se organiza en torno a tres conceptos (observar, analizar y administrar), reflejados en la barra lateral izquierda del panel de control. Observar (la verdad bruta de lo que ocurrió):
  • Flujo de eventos: el rastro en tiempo real, paso a paso, de cada ejecución (llamadas a herramientas, llamadas al modelo, hooks, errores).
  • Sesiones: esos eventos agrupados en una fila por ejecución, cada una lista para ser puntuada, con un grafo de ejecución estilo git.
  • Métricas de rendimiento: mapas de calor de latencia por superficie y valores p50/p95/p99 para modelos, herramientas y hooks, para que un pico en la cola destaque sobre la mediana.
  • Seguimiento de errores: una única superficie de triaje para todo lo que salió mal, a un clic de una alerta activa.
La página de observación de Tools: un mapa de calor de latencia, una banda de percentiles y una barra de distribución de herramientas en 24 intervalos de tiempo Cada superficie de observación combina un minigráfico y valores p50/p95/p99 con un mapa de calor de latencia y una banda de percentiles. Mostrado aquí: Tools. Analizar (convertir la actividad en respuestas):
  • Consultas y paneles: SQL guardado sobre tus eventos y evaluaciones, representado en paneles compartidos con ámbito de organización.
  • Evaluaciones: puntuaciones de calidad producidas por tu propio servicio evaluador, con el razonamiento por puntuación.
  • Auditorías: investigaciones recurrentes que detectan patrones de fallo entre sesiones.
  • Alertas e incidentes: reglas de umbral que te notifican, más un flujo de trabajo de incidentes para gestionarlos.
Interfaces (accede a tus datos a tu manera):
  • CLI: gestiona todo tu despliegue desde el terminal o un script, y deja que un agente de codificación lo haga por ti en lenguaje natural.
  • Asistente de IA: haz preguntas sobre tus agentes en lenguaje natural, directamente desde el panel de control.
  • REST API: todo lo que hacen el panel y la CLI está respaldado por una REST API que puedes llamar directamente con una clave de API con ámbito definido — ingesta eventos, consulta sesiones y evaluaciones, y gestiona paneles, alertas, auditorías, usuarios y claves, para poder integrar Failproof AI Observability en tus propias herramientas.
Administrar (gestiónalo para tu equipo):
  • Claves de API: tokens con ámbito para el colector, el panel y el asistente.
  • Usuarios: inicio de sesión sin contraseña, basado en correo electrónico, con lista de permitidos.
  • Configuración: configuración por organización, incluidas las anulaciones de ventana de contexto de los modelos.

Cómo encajan las piezas

Los datos fluyen en una sola dirección, desde el código de tu agente hasta el panel de control: tu agente (a través del SDK de Python) emite eventos al agenteye-collector, que los envía al servidor, que sirve el panel de control. Dos servicios opcionales completan el sistema: un servicio de puntuación (evaluaciones) y un servicio de asistente de IA (el chat integrado en el panel).
  • SDK de Python: añades unas pocas llamadas agenteye.event.* a tu agente; los eventos se almacenan en búfer localmente.
  • agenteye-collector: un demonio ligero en cada máquina de agente que agrupa los eventos y los envía al servidor.
  • Servidor: ingesta tus eventos, mantiene el estado operativo en tus propias bases de datos y sirve la REST API que usan el panel, la CLI y tus propias integraciones.
  • Panel de control: donde exploras todo.
  • Servicios opcionales: un servicio de puntuación (evaluaciones) y un servicio de asistente de IA (el chat integrado en el panel).
Para el vocabulario utilizado en toda la documentación (evento, sesión, evaluación, auditoría, hallazgo, incidente), consulta Conceptos.

Cómo obtener Failproof AI Observability

Failproof AI Observability es un producto empresarial de Failproof AI, y funciona junto con Failproof AI Enforcement — el producto de políticas y barreras de seguridad — bajo la marca Failproof AI. Se ejecuta completamente en tu propio entorno. Si aún no tienes acceso a los paquetes, solicita una demo y te ayudamos a ponerte en marcha: escribe a nikita@befailproof.ai.

Próximos pasos

  • Conceptos: el vocabulario de Failproof AI Observability en un solo lugar.
  • Observabilidad: sigue lo que hacen tus agentes, ejecución a ejecución.
  • Seguridad: cómo Failproof AI Observability mantiene tus datos aislados y bajo tu control.