Skip to main content
Le valutazioni ospitate sono piccoli Python deterministici, scritti nel dashboard ed eseguiti sulla flotta di valutatori di Failproof AI. La logica più complessa — un giudice LLM, un pacchetto, un segreto, una chiamata di rete — viene eseguita nel tuo worker.

Redila da una descrizione

  1. Vai a Analyze → eval authoring e seleziona new eval.
  2. Descrivi cosa misurare in inglese semplice, oppure scegli da start from an example…, e seleziona draft.
  3. Rivedi i campi e il codice che compila, quindi testalo e distribuiscilo.
La pagina di authoring eval con una valutazione redatta: la descrizione, le note dell'assistente sulla bozza, e i campi name, key, version, result, timeout, labels e condition. La bozza è radicata negli eventi della tua organizzazione: la pagina legge quali chiavi di payload le tue sessioni hanno trasportato negli ultimi sette giorni, quindi il codice legge chiavi che esistono piuttosto che indovinare. Prima di consegnare la bozza, l’assistente la testa su fino a cinque delle tue sessioni recenti, ripara tutto ciò che può provare sia rotto — per un massimo di tre cicli — e controlla una volta che il codice misuri quello che hai chiesto. Mantieni la descrizione specifica: i prompt ampi sono più lenti e possono andare in timeout. Rivedi il codice comunque; la distribuzione non è mai bloccata.

Imposta i campi

Usa la condition per limitare una valutazione agli agenti e agli ambienti per cui è destinata:
La key, la version, il tipo di result, la condition e il codice sono immutabili una volta distribuiti: per modificarne uno qualsiasi, pubblica una nuova versione. Il name, i labels e se è abilitato rimangono modificabili.

Scrivi il codice tu stesso

Il codice evaluator è un’unica espressione Python che restituisce EvalResult(...), con session in ambito. Questo calcola la quota di risultati di strumenti tornati ok:
Un risultato inizia con la propria key della valutazione, nel suo tipo dichiarato: score= per una valutazione score, oppure una voce metrics o assertions denominata dalla key per una valutazione metric o assertion. Altre metriche e assertion la accompagnano, fino a 25 risultati in un’esecuzione. Nient’altro è raggiungibile: nessun import, e nessun attributo oltre i dati della sessione e i metodi plain string e dictionary come get, lower, e split, che devono essere chiamati piuttosto che referenziati. Le chiavi di payload sono qualunque cosa i tuoi agenti inviino — status sopra è solo un esempio — quindi leggile da una sessione reale. format ordina il codice e fix chiede all’assistente di ripararlo. Il codice può essere fino a 128 KiB, e la condition fino a 16 KiB. L'editor del codice evaluator, con format e fix, che mostra le assertion di una valutazione redatta.

Scrivi nel tuo worker

Quando una valutazione ha bisogno di un modello, un pacchetto, un segreto, o la rete, scrivila con l’Evaluator SDK ed eseguila sulla tua infrastruttura. Usa gli stessi tipi di risultato, e i suoi risultati appaiono accanto a quelli ospitati, etichettati customer: