> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Valutazioni online

> Valuta sessioni live e completate per qualità, conformità, costi e latenza.

Le valutazioni online applicano giudizi coerenti alle sessioni dell'agente. Utilizzale per segnali che devono essere misurati continuamente piuttosto che indagati solo durante un audit.

## Verifica la qualità della valutazione

<Tabs>
  <Tab title="Dashboard">
    1. Vai a **Observe → Evaluations**.
    2. Aggiungi una serie e scegli l'agente, l'ambiente, il punteggio di valutazione, la statistica e la curva.
    3. Aggiungi serie per confrontare ambienti, agenti o chiavi di punteggio.
    4. Seleziona un risultato per aprire le sessioni corrispondenti o condividere la vista filtrata. Usa **Observe → Metrics** per latenza, token, costi e altri valori di grandezza.

           <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/dashboard-quality.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=74c925ae831046fc869a3a3d6e81fc25" alt="Una dashboard di qualità che mostra i punteggi di valutazione medi e i trend nel tempo." width="2880" height="1800" data-path="images/dashboard/dashboard-quality.png" />

    Apri una sessione dal drill-down per ispezionare il ragionamento per ogni punteggio:

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/session-detail.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=7b5f022dd5c485565a8cd92b2e936235" alt="Una vista di dettaglio della sessione che mostra i punteggi di valutazione e il ragionamento accanto alla traccia completa." width="3200" height="2000" data-path="images/dashboard/session-detail.png" />
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp evals --agent-id checkout-agent --aggregate
    fp evals --aggregate --env production --status error
    fp evals --score helpfulness:0.8.. --since 7d
    ```

    Aggiungi l'opzione globale `--json` prima di `evals` per l'automazione, ad esempio `fp --json evals --aggregate --env production`.
  </Tab>
</Tabs>

Un valutatore riceve l'identità della sessione, l'ambiente, i timestamp e gli eventi ordinati. Può restituire chiavi di punteggio numeriche con ragionamento opzionale e un riepilogo. I valutatori a lunga esecuzione possono restituire un lavoro in sospeso e essere interrogati successivamente.

## Buoni target di valutazione

* Completamento dell'attività o correttezza
* Fondatezza e rischio di allucinazione
* Selezione dello strumento ed efficienza dello strumento
* Conformità a politiche o processi
* Budget di costi e latenza
* Escalation umana richiesta

## Dal punteggio alla risposta

Mostra i punteggi nelle dashboard per tracciare i trend. Crea avvisi per soglie o condizioni composte. Quando un punteggio diminuisce in una popolazione, esegui un audit per indagare il motivo; quando la causa è un'azione ripetibile, distribuisci una politica.

<Card title="Crea un valutatore" icon="code-2" href="/it/reference/evaluator-sdk">
  Implementa una valutazione sincrona o asincrona con l'SDK del valutatore Python.
</Card>
