Skip to main content
Failproof AI Observability è una piattaforma self-hosted per osservare, valutare e migliorare i tuoi agenti AI in produzione. Registra tutto ciò che i tuoi agenti fanno (ogni chiamata a strumenti, richiesta al modello, hook ed errore), assegna un punteggio alla qualità di ogni esecuzione e individua i malfunzionamenti che non sapevi di dovere cercare, il tutto in una dashboard che gestisci dentro la tua stessa infrastruttura. Se distribuisci agenti AI e sei stanco di indovinare perché un’esecuzione è andata male, questa è la pagina giusta per iniziare. Spiega cosa ti offre Failproof AI Observability e come i diversi componenti si incastrano insieme, prima che tu installi qualsiasi cosa.
Failproof AI Observability è un prodotto enterprise di Failproof AI. Vuoi vederlo in azione? Richiedi una demo: invia un’email a nikita@befailproof.ai.
Una sessione di Failproof AI Observability rappresentata come un grafo di esecuzione in stile git accanto alla sua timeline di eventi, con una suddivisione per esecuzione di strumenti, modelli e hook nella colonna di destra Ogni esecuzione dell’agente è rappresentata come un grafo di esecuzione in stile git (a sinistra) accanto alla sua timeline di eventi. Ogni sub-agente parallelo ha il suo spazio dedicato; la colonna di destra mostra i dettagli degli strumenti, modelli, hook e token consumati per l’esecuzione.

Vedi in azione

Due brevi video mostrano le due cose che i team cercano per prime: tracciare un’esecuzione e trovare i malfunzionamenti automaticamente.
Tracciamento dell’agente: segui un’esecuzione passo dopo passo, dal goal agli strumenti alla risposta finale.
Failproof Audit: lascia che Failproof AI Observability analizzi i tuoi log tra le sessioni e ti dica cosa correggere.

Perché i team lo usano

  • Vedi cosa ha fatto realmente il tuo agente. Ogni esecuzione diventa un grafo di esecuzione leggibile in stile git: quali strumenti sono stati eseguiti in parallelo, quali sub-agenti si sono diramati, dove si è bloccato e cosa ha consumato.
  • Rileva i cali di qualità automaticamente. Collega un piccolo servizio di scoring e Failproof AI Observability assegna un punteggio a ogni esecuzione completata, quindi un calo di utilità o un picco di allucinazioni emergono da soli.
  • Trova i malfunzionamenti per cui non hai scritto una regola. I controlli ricorrenti analizzano i tuoi log tra le sessioni per cluster di errori, outlier di latenza, punteggi bassi ed esecuzioni bloccate, quindi ti forniscono risultati classificati e supportati da evidenze.
  • Ricevi notifiche quando conta. Le regole di soglia si attivano su tasso di errore, latenza, costo o punteggi di valutazione e aprono incident che puoi riconoscere, assegnare e risolvere.
  • Fai domande in linguaggio naturale. Un assistente AI incorporato nella dashboard risponde a “come sta andando la qualità in prod questa settimana?” sui tuoi dati. Qualsiasi modifica che effettua è sottoposta a approvazione.
  • Mantieni i tuoi dati. Failproof AI Observability è self-hosted: eventi, prompt e analitiche rimangono nell’infrastruttura che controlli.

Cosa ottieni

Failproof AI Observability è organizzata attorno a tre concetti (osserva, analizza e amministra), rispecchiati nella barra laterale sinistra della dashboard. Osserva (la verità grezza di ciò che è accaduto):
  • Flusso di eventi: il trail live, passo dopo passo, di ogni esecuzione (chiamate a strumenti, chiamate a modelli, hook, errori).
  • Sessioni: quegli eventi raggruppati in una riga per esecuzione, ognuna pronta per essere valutata, con un grafo di esecuzione in stile git.
  • Metriche di performance: heat-map di latenza per superficie e vitals p50/p95/p99 per modelli, strumenti e hook, così uno spike della coda si distingue dalla mediana.
  • Tracciamento degli errori: una superficie di triage per tutto ciò che è andato male, a un clic da un alert che si attiva.
La pagina Strumenti della sezione osserva: una heat-map di latenza, una banda percentile e una barra di distribuzione dei tool su 24 bin temporali Ogni superficie di osservazione accoppia una sparkline e i vitals p50/p95/p99 con una heat-map di latenza e una banda percentile. Mostrato qui: Strumenti. Analizza (trasforma l’attività in risposte):
  • Query e dashboard: SQL salvate sui tuoi eventi e valutazioni, rappresentate in grafici su dashboard condivise e con scope dell’organizzazione.
  • Valutazioni: punteggi di qualità prodotti dal tuo servizio di valutazione, con ragionamento per ogni punteggio.
  • Controlli: investigazioni ricorrenti che evidenziano modelli di fallimento tra le sessioni.
  • Avvisi e incident: regole di soglia che ti avvertono, più un flusso di lavoro incident per triarli.
Interfacce (accedi ai tuoi dati nel modo che preferisci):
  • CLI: gestisci l’intera implementazione dal terminale o da uno script, e lascia che un agente di codifica lo faccia per te in linguaggio naturale.
  • Assistente AI: fai domande sui tuoi agenti in linguaggio naturale, direttamente dentro la dashboard.
  • API REST: tutto ciò che la dashboard e la CLI fanno è supportato da un’API REST che puoi chiamare direttamente con una chiave API con scope — inserisci eventi, query sessioni e valutazioni, e gestisci dashboard, avvisi, controlli, utenti e chiavi, così puoi integrare Failproof AI Observability nella tua tooling.
Amministra (gestiscilo per il tuo team):
  • Chiavi API: token con scope per il collector, la dashboard e l’assistente.
  • Utenti: accesso senza password basato su email con una lista di autorizzati.
  • Impostazioni: configurazione per organizzazione, inclusi override della finestra di contesto del modello.

Come si incastrano i pezzi

I dati fluiscono in una direzione, dal codice del tuo agente alla dashboard: il tuo agente (tramite l’SDK Python) emette eventi a agenteye-collector, che li invia al server, che serve la dashboard. Due servizi opzionali completano il quadro — un servizio di scoring (valutazioni) e un servizio assistente AI (la chat incorporata nella dashboard).
  • Python SDK: aggiungi alcune chiamate agenteye.event.* al tuo agente; gli eventi vengono memorizzati localmente nel buffer.
  • agenteye-collector: un daemon leggero su ogni macchina agente che raggruppa gli eventi e li invia al server.
  • Server: acquisisce i tuoi eventi, mantiene lo stato operativo nei tuoi database e serve l’API REST che la dashboard, la CLI e i tuoi integrazioni usano tutti.
  • Dashboard: dove esplori tutto.
  • Servizi opzionali: un servizio di scoring (valutazioni) e un servizio assistente AI (la chat incorporata nella dashboard).
Per il vocabolario usato in tutta la documentazione (evento, sessione, valutazione, controllo, risultato, incident), vedi Concetti.

Ottenere Failproof AI Observability

Failproof AI Observability è un prodotto enterprise di Failproof AI e funziona insieme a Failproof AI Enforcement — il prodotto di policy e guardrail — sotto il brand Failproof AI. Viene eseguito interamente nel tuo ambiente. Se non hai ancora accesso ai pacchetti, richiedi una demo e ti aiuteremo a iniziare: invia un’email a nikita@befailproof.ai.

Passaggi successivi

  • Concetti: il vocabolario di Failproof AI Observability tutto in un posto.
  • Osservabilità: segui ciò che fanno i tuoi agenti, esecuzione dopo esecuzione.
  • Sicurezza: come Failproof AI Observability mantiene i tuoi dati isolati e sotto il tuo controllo.