Evaluator einrichten
1
Evaluator SDK installieren
Installieren Sie das SDK und den Server zum Ausführen.
2
Bewertungskriterien festlegen
Erstellen Sie
evaluator.py. Dieses Beispiel prüft, ob eine Sitzung fehlgeschlagene Tool-Aufrufe enthält.3
Lokal ausführen und testen
Setzen Sie ein gemeinsames Token, starten Sie den Evaluator und prüfen Sie, ob der Health-Endpunkt antwortet.In einem anderen Terminal:
Evaluator mit Failproof AI verbinden
- Deployen Sie den Evaluator unter einer HTTPS-URL, die von Failproof AI Cloud erreichbar ist.
- Konfigurieren Sie
EVALUATOR_ENDPOINTmit dieser URL und setzen SieEVALUATOR_TOKENauf dasselbe Token, das der Evaluator verwendet. Für die verwaltete Cloud wenden Sie sich an support@befailproof.ai, um die Verbindung einzurichten. - Führen Sie eine Evaluierung durch und prüfen Sie, ob die Bewertungen in Failproof AI erscheinen.
- Dashboard
- CLI
Öffnen Sie eine abgeschlossene Sitzung unter Observe → Sessions und wählen Sie Run evaluation, falls sie nicht automatisch evaluiert wurde. Überprüfen Sie Status, Bewertungen, Begründungen und Zusammenfassung im Evaluation-Panel der Sitzung.Verwenden Sie Observe → Evaluations, um Bewertungen über Agenten oder Umgebungen hinweg zu vergleichen. Nutzen Sie Observe → Metrics für Latenz-, Kosten-, Token- und andere numerische Messungen.Beginnen Sie mit einer einzelnen Sitzung, um sicherzustellen, dass der Evaluator die erwarteten Score-Keys und sinnvolle Begründungen für diesen konkreten Durchlauf zurückgegeben hat.
Sobald die Einzelergebnisse korrekt aussehen, können Sie im Evaluierungs-Dashboard diese Bewertungen über die Zeit und über Agenten oder Umgebungen hinweg vergleichen.
Ein gesundes Diagramm sollte stabile Score-Namen verwenden – das Umbenennen eines Keys erstellt eine separate Datenreihe.


EVALUATOR_ENDPOINT am Serverprozess gesetzt ist. Starten Sie den Server nach Änderungen an Evaluator-Umgebungsvariablen neu.
Der Service stellt GET /health, GET /config, POST /evaluate und optional GET /evaluate/{job_id} bereit. Geben Sie JobPending für asynchrone Arbeit zurück und registrieren Sie @app.job_lookup, damit Failproof AI den Status abfragen kann.
Wenn ein Token konfiguriert ist, erfordern alle Routen außer Health dasselbe Bearer-Token, das Failproof AI als EVALUATOR_TOKEN sendet.
SDK-Typen
Dekoratoren und Routen
Das SDK begrenzt Evaluierungsanfrage-Bodies auf 25 MiB. Unbekannte Anforderungsfelder werden ignoriert, sodass Services kompatibel bleiben, wenn der Event-Vertrag erweitert wird.
Asynchrone Arbeit zurückgeben
Verwenden SieJobPending, wenn die Evaluierung nicht innerhalb einer einzigen Anfrage abgeschlossen werden kann. Die Job-ID ist für Failproof AI opak und muss von Ihrem Service auflösbar bleiben, bis das Ergebnis abgerufen oder der Server-Timeout erreicht wurde.
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, dann EVALUATOR_POLLING_INTERVAL_SECS des Servers. Werte werden auf einen Bereich zwischen 1 Sekunde und 1 Stunde begrenzt. Die standardmäßige Wanduhr-Polling-Obergrenze des Servers beträgt eine Stunde.
Anfrage- und Antwortfelder
Server-Operator-Einstellungen
Die automatische Evaluierung gilt für das gesamte Deployment und bleibt deaktiviert, wennEVALUATOR_ENDPOINT nicht gesetzt ist.
Der Server kann auch einschränken, welche Organisationen den deployment-globalen Evaluator nutzen. Behandeln Sie Änderungen an Endpunkt, Token, Wiederholungslogik und Organisations-Beschränkungen als Operator-Konfiguration und starten Sie den Server danach neu oder führen Sie ein Rolling Restart durch.
Sicherheit und Betrieb
- Stellen Sie den Evaluator hinter HTTPS, wenn der Datenverkehr eine vertrauenswürdige Netzwerkgrenze überquert.
- Konfigurieren Sie ein nicht leeres Bearer-Token und halten Sie es auf beiden Services identisch.
- Protokollieren Sie weder das Token noch vollständige sensible Prompts aus Anfrage-Nutzdaten.
- Gestalten Sie synchrone Handler idempotent; Wiederholungen können eine Anfrage wiederholen.
- Persistieren Sie asynchronen Job-Status in der Produktion außerhalb des Prozessspeichers.
- Verwenden Sie stabile Score-Keys. Das Umbenennen eines Keys erstellt eine neue Diagrammreihe, anstatt die alte zu ändern.
eval received, eval responded, job lookup, config returned, auth rejected und Handler-Ausnahmen. Es konfiguriert keine Logging-Handler; verwenden Sie die Logging-Konfiguration der Host-Anwendung.
