
Smetti di campionare le esecuzioni manualmente
Prima facevi controlli spot su una manciata di esecuzioni e speravi che il resto andasse bene. Adesso ogni sessione completata viene valutata nel momento in cui finisce, secondo le dimensioni che contano per te: utilità, efficienza dello strumento, fattualità, sicurezza, quello che è il tuo standard di qualità. Tu definisci le chiavi di score; Failproof AI Observability memorizza, registra le tendenze e visualizza tutto quello che il tuo evaluator rimanda indietro. Nessuna esecuzione sfugge senza essere valutata, e smetti di scoprire una regressione da un ticket di supporto. Gli score compaiono sulla griglia di sessioni su/<org-slug>/sessions (sidebar → observe → sessions), un cluster di badge per riga. Vuoi solo le esecuzioni che non hanno raggiunto l’obiettivo? Filtra la griglia per range di score, ad esempio utilità sotto 0.5, e accedi esattamente alle esecuzioni che vale la pena leggere. La visualizzazione degli score richiede il permesso evaluations:read.
Scopri perché un’esecuzione ha ottenuto un basso score
Un numero ti dice che un’esecuzione era debole; la pagina della sessione ti dice perché. Apri qualsiasi esecuzione e la barra laterale destra inizia con il riassunto principale, poi mostra una barra per ogni dimensione con il ragionamento del tuo evaluator sotto ciascuna, così passi da “questo ha ottenuto 0.4 sulla fattualità” all’affermazione esatta sbagliata in pochi secondi.
evaluations:trigger) rivaluta la sessione in posizione e aggiunge il risultato fresco alla sua timeline, così gli score precedenti rimangono visibili come storico. Lo troverai su /<org-slug>/sessions/<session-id>.
Osserva la tendenza di qualità su tutta la flotta
Un’esecuzione con basso score è rumore; una coorte intera che scivola è un segnale. Le dashboard salvate trasformano i tuoi score in una tendenza che puoi osservare a colpo d’occhio: utilità media questa settimana rispetto alla scorsa, per agent, per ambiente.
/<org-slug>/dashboards (sidebar → analyze → dashboards), sono condivise su tutta l’organizzazione e ogni scheda raggruppa le sessioni corrispondenti: quante ce ne sono, la media di ogni score presentato e una sparkline di tendenza. “Apri nelle sessioni” ti porta direttamente alle esecuzioni pre-filtrate dietro qualsiasi numero. La visualizzazione richiede dashboards:read più evaluations:read.
Connetti un evaluator una volta
Lo scoring è opt-in e rimane completamente disattivato finché non punti Failproof AI Observability a uno scorer. Avvii un piccolo servizio HTTP (Observability fornisce un riferimento funzionante che puoi copiare), imposti due valori sul tuo server e da allora ogni esecuzione viene valutata per te. La guida completa, il contratto di scoring e l’SDK si trovano nella guida approfondita. Non sei sicuro di quali dimensioni vale la pena valutare in primo luogo? L’agent skill evaluator fa in modo che il tuo agent di codifica lo scopra sulle tue stesse sessioni, poi costruisci e distribuisci il servizio.Correlati
- Evaluation suite: connetti il tuo evaluator, il contratto di scoring e l’SDK.
- Evaluator agent skill: lascia che un agent di codifica scelga le tue dimensioni di score e costruisca l’evaluator.
- Sessions: la griglia run-by-run dove compaiono gli score.
- Dashboards: salva e condividi le tendenze di qualità nella tua organizzazione.
- Audits: l’altra funzione di qualità automatica di Observability, per investigazioni tra sessioni.

