Skip to main content
L’Evaluator SDK esegue valutazioni sulla tua infrastruttura. Il tuo worker registra le sue valutazioni con Failproof AI, rivendica le sessioni al loro completamento, le valuta e invia i risultati, tutto tramite HTTPS in uscita: niente si connette ad esso. Usalo per ciò che Python ospitato non può fare — giudici LLM, chiamate di modello, pacchetti, segreti e accesso di rete. I suoi risultati appaiono accanto a quelli ospitati nella pagina valutazioni, etichettati customer. È fornito in failproofai-sdk, sotto failproofai_sdk.evaluator; importare l’SDK di tracciamento non lo carica.

Scrivi valutazioni

  • @app.eval(key, version=...) registra una valutazione. La chiave è ciò su cui viene tracciato il suo risultato; cambia la versione ogni volta che la logica cambia, e ogni risultato mantiene la versione che l’ha prodotto. Un worker contiene fino a 100 valutazioni.
  • result_kind è "score" a meno che tu non dica diversamente. Per una valutazione "metric" o "assertion", assegna a una voce metrics o assertions il nome della chiave: quella voce è il suo risultato.
  • when decide se una sessione si applica. Restituisci ConditionResult(False, "<reason>") per saltarne una, e il motivo viene registrato.
  • Una valutazione può essere una funzione semplice o async, e timeout_seconds la delimita.
  • Le chiavi di payload — tool_name, response e content sopra — sono ciò che i tuoi agenti inviano, quindi leggile da una sessione reale.

Esegui il worker

Metti una chiave con l’autorizzazione evaluations:run, creata sotto Administration → Keys, in FAILPROOFAI_EVALUATOR_TOKEN — impostala dal tuo archivio segreti piuttosto che digiarla in un comando — e avvia il worker:
Senza il blocco __main__, python -m failproofai_sdk.evaluator evaluator:app fa lo stesso.
FAILPROOFAI_EVALUATOR_ALLOW_INSECURE_HTTP invia tutto in testo non crittografato. Il worker trasporta FAILPROOFAI_EVALUATOR_TOKEN come intestazione Authorization: Bearer su ogni richiesta, e i trascritti che recupera sono le sessioni stesse — quindi chiunque si trovi sul percorso legge entrambi, e la chiave che legge esegue valutazioni fino a quando non la ruoti. Usalo solo su una rete di sviluppo isolata. Ovunque altro l’URL deve essere HTTPS; loopback non ha bisogno di flag.

Tipi di risultato

Un EvalResult contiene almeno un punteggio, una metrica o un’asserzione, e al massimo 25, ciascuno sotto una chiave univoca.

La sessione

Ogni evento contiene id, ts, event_type e payload.

L’evaluator legacy

Il precedente Evaluator SDK — un servizio HTTP che Failproof AI chiamava a EVALUATOR_ENDPOINT, rispondendo a /evaluate e sottoposto a polling tramite JobPending — è ritirato. Costruisci nuovi evaluator su questo worker; gli operatori di un’istanza self-hosted che eseguono un servizio legacy possono mantenerlo durante la transizione.