- un punteggio da 0 a 1, opzionalmente contrassegnato come superato o non superato
- una metrica, come un conteggio, una durata o un costo, con la relativa unità
- un’asserzione, che è stata superata o non superata
Due tipi di valutatore
Python ospitato è deliberatamente limitato: un’espressione, nessuna importazione, nessuna rete. Qualsiasi cosa che richieda un modello — un giudice LLM che valuta se una risposta era rilevante, ad esempio — viene eseguita nel tuo worker. Nessuno dei due tipi ha bisogno di una connessione in entrata: i worker richiedono le sessioni terminate e inviano i risultati tramite HTTPS in uscita.
Ogni organizzazione valuta i propri agenti
Le valutazioni appartengono all’organizzazione che le definisce. Ogni organizzazione su un’istanza scrive le proprie — i propri controlli, condizioni, soglie ed etichette — le varia e le distribuisce senza influenzare altre, e vede solo i propri risultati. Filtra questi risultati per agente, ambiente, valutazione e ora, oppure chiedi informazioni all’assistente.Dalla prima bozza ai punteggi live
1
Scrivila
Descrivi cosa misurare e lascia che l’assistente la rediga, oppure scrivila tu stesso. Vedi Scrivi una valutazione.
2
Testala
Eseguila su sessioni reali prima che sia live; nulla viene memorizzato. Vedi Testa una valutazione.
3
Distribuisci e versiona
Distribuisci una versione immutabile, pubblica nuove versioni mentre evolve, e torna a una versione precedente. Vedi Distribuisci e versiona.
4
Leggi i risultati
Traccia i punteggi nel tempo, confronta agenti e ambienti, e chiedi all’assistente. Vedi Leggi i risultati della valutazione.

