Redila da una descrizione
- Vai a Analyze → eval authoring e seleziona new eval.
- Descrivi cosa misurare in inglese semplice, oppure scegli da start from an example…, e seleziona draft.
- Rivedi i campi e il codice che compila, quindi testalo e distribuiscilo.

Imposta i campi
Usa la condition per limitare una valutazione agli agenti e agli ambienti per cui è destinata:
Scrivi il codice tu stesso
Il codice evaluator è un’unica espressione Python che restituisceEvalResult(...), con session in ambito. Questo calcola la quota di risultati di strumenti tornati ok:
score= per una valutazione score, oppure una voce metrics o assertions denominata dalla key per una valutazione metric o assertion. Altre metriche e assertion la accompagnano, fino a 25 risultati in un’esecuzione.
Nient’altro è raggiungibile: nessun import, e nessun attributo oltre i dati della sessione e i metodi plain string e dictionary come
get, lower, e split, che devono essere chiamati piuttosto che referenziati. Le chiavi di payload sono qualunque cosa i tuoi agenti inviino — status sopra è solo un esempio — quindi leggile da una sessione reale. format ordina il codice e fix chiede all’assistente di ripararlo. Il codice può essere fino a 128 KiB, e la condition fino a 16 KiB.


