Skip to main content
Le valutazioni online applicano giudizi coerenti alle sessioni degli agenti. Usale per segnali che devono essere misurati continuamente piuttosto che indagati solo durante un audit.

Rivedere la qualità della valutazione

  1. Vai a Observe → Evaluations.
  2. Aggiungi una serie e scegli l’agente, l’ambiente, il punteggio di valutazione, la statistica e la curva.
  3. Aggiungi serie per confrontare ambienti, agenti o chiavi di punteggio.
  4. Seleziona un risultato per aprire le sessioni corrispondenti o condividere la vista filtrata. Usa Observe → Metrics per latenza, token, costi e altri valori di grandezza. Un dashboard di qualità che mostra i punteggi di valutazione medi e i trend nel tempo.
Apri una sessione dal drill-down per ispezionare il suo ragionamento per punteggio:Una vista dettagli sessione che mostra i punteggi di valutazione e il ragionamento accanto alla traccia completa.
Un valutatore riceve l’identità della sessione, l’ambiente, i timestamp e gli eventi ordinati. Può restituire chiavi di punteggio numeriche con ragionamento facoltativo e un riepilogo. I valutatori a lunga esecuzione possono restituire un job in sospeso e essere sottoposti a polling in seguito.

Buoni obiettivi di valutazione

  • Completamento o correttezza del compito
  • Fondatezza e rischio di allucinazione
  • Selezione degli strumenti ed efficienza degli strumenti
  • Conformità alle politiche o ai processi
  • Budget di costi e latenza
  • Escalation umana richiesta

Dal punteggio alla risposta

Mostra i punteggi nei dashboard per tracciare i trend. Crea avvisi per soglie o condizioni composte. Quando un punteggio diminuisce all’interno di una popolazione, esegui un audit per indagare il motivo; quando la causa è un’azione ripetibile, distribuisci una politica.

Costruisci un valutatore

Implementa una valutazione sincrona o asincrona con l’SDK valutatore Python.