Skip to main content
Le valutazioni online applicano giudizi coerenti alle sessioni dell’agente. Utilizzale per segnali che devono essere misurati continuamente piuttosto che indagati solo durante un audit.

Verifica la qualità della valutazione

  1. Vai a Observe → Evaluations.
  2. Aggiungi una serie e scegli l’agente, l’ambiente, il punteggio di valutazione, la statistica e la curva.
  3. Aggiungi serie per confrontare ambienti, agenti o chiavi di punteggio.
  4. Seleziona un risultato per aprire le sessioni corrispondenti o condividere la vista filtrata. Usa Observe → Metrics per latenza, token, costi e altri valori di grandezza. Una dashboard di qualità che mostra i punteggi di valutazione medi e i trend nel tempo.
Apri una sessione dal drill-down per ispezionare il ragionamento per ogni punteggio:Una vista di dettaglio della sessione che mostra i punteggi di valutazione e il ragionamento accanto alla traccia completa.
Un valutatore riceve l’identità della sessione, l’ambiente, i timestamp e gli eventi ordinati. Può restituire chiavi di punteggio numeriche con ragionamento opzionale e un riepilogo. I valutatori a lunga esecuzione possono restituire un lavoro in sospeso e essere interrogati successivamente.

Buoni target di valutazione

  • Completamento dell’attività o correttezza
  • Fondatezza e rischio di allucinazione
  • Selezione dello strumento ed efficienza dello strumento
  • Conformità a politiche o processi
  • Budget di costi e latenza
  • Escalation umana richiesta

Dal punteggio alla risposta

Mostra i punteggi nelle dashboard per tracciare i trend. Crea avvisi per soglie o condizioni composte. Quando un punteggio diminuisce in una popolazione, esegui un audit per indagare il motivo; quando la causa è un’azione ripetibile, distribuisci una politica.

Crea un valutatore

Implementa una valutazione sincrona o asincrona con l’SDK del valutatore Python.