> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Valuta gli agenti

> Assegna un punteggio a ogni sessione conclusa dell'agente con valutazioni che definisci: controlli Python ospitati o giudici LLM nel tuo worker.

Una valutazione assegna un punteggio a una sessione dell'agente conclusa. Quando una sessione termina, ogni valutazione abilitata che le si applica viene eseguita e registra i risultati trovati, con un ragionamento che puoi leggere accanto alla traccia:

* un **punteggio** da 0 a 1, opzionalmente contrassegnato come superato o non superato
* una **metrica**, come un conteggio, una durata o un costo, con la relativa unità
* un'**asserzione**, che è stata superata o non superata

## Due tipi di valutatore

|            | Python ospitato                                        | Il tuo worker                                                                               |
| ---------- | ------------------------------------------------------ | ------------------------------------------------------------------------------------------- |
| Scritto    | Nel dashboard, sotto **Analyze → eval authoring**      | In Python, con l'[Evaluator SDK](/it/reference/evaluator-sdk)                               |
| Esecuzione | Sul valutatore gestito di Failproof AI, in una sandbox | Sulla tua infrastruttura                                                                    |
| Ideale per | Controlli deterministici basati su codice              | Giudici LLM, chiamate ai modelli, pacchetti, segreti, accesso di rete, elaborazione pesante |

Python ospitato è deliberatamente limitato: un'espressione, nessuna importazione, nessuna rete. Qualsiasi cosa che richieda un modello — un giudice LLM che valuta se una risposta era rilevante, ad esempio — viene eseguita nel tuo worker. Nessuno dei due tipi ha bisogno di una connessione in entrata: i worker richiedono le sessioni terminate e inviano i risultati tramite HTTPS in uscita.

## Ogni organizzazione valuta i propri agenti

Le valutazioni appartengono all'organizzazione che le definisce. Ogni organizzazione su un'istanza scrive le proprie — i propri controlli, condizioni, soglie ed etichette — le varia e le distribuisce senza influenzare altre, e vede solo i propri risultati. Filtra questi risultati per agente, ambiente, valutazione e ora, oppure chiedi informazioni all'assistente.

## Dalla prima bozza ai punteggi live

<Steps>
  <Step title="Scrivila">
    Descrivi cosa misurare e lascia che l'assistente la rediga, oppure scrivila tu stesso. Vedi [Scrivi una valutazione](/it/evaluations/write).
  </Step>

  <Step title="Testala">
    Eseguila su sessioni reali prima che sia live; nulla viene memorizzato. Vedi [Testa una valutazione](/it/evaluations/test).
  </Step>

  <Step title="Distribuisci e versiona">
    Distribuisci una versione immutabile, pubblica nuove versioni mentre evolve, e torna a una versione precedente. Vedi [Distribuisci e versiona](/it/evaluations/deploy).
  </Step>

  <Step title="Leggi i risultati">
    Traccia i punteggi nel tempo, confronta agenti e ambienti, e chiedi all'assistente. Vedi [Leggi i risultati della valutazione](/it/sessions/evaluations).
  </Step>
</Steps>

La valutazione procede in avanti: una versione distribuita ora assegna un punteggio alle sessioni che terminano da ora in poi. Per assegnare un punteggio alle sessioni che hai già, [completale retroattivamente](/it/evaluations/deploy#valuta-le-sessioni-già-presenti).
