Evaluator einrichten
1
Evaluator SDK installieren
Installiere das SDK und den Server, der es ausführt.
2
Bewertungskriterien definieren
Erstelle
evaluator.py. Dieses Beispiel prüft, ob eine Sitzung fehlgeschlagene Tool-Aufrufe enthält.3
Lokal ausführen und testen
Setze ein gemeinsames Token, starte den Evaluator und bestätige, dass der Health-Endpunkt antwortet.In einem anderen Terminal:
Evaluator mit Failproof AI verbinden
- Stelle den Evaluator unter einer HTTPS-URL bereit, die von Failproof AI Cloud erreichbar ist.
- Konfiguriere
EVALUATOR_ENDPOINTmit dieser URL und setzeEVALUATOR_TOKENauf dasselbe Token, das der Evaluator verwendet. Für verwaltete Cloud-Instanzen wende dich an support@befailproof.ai, um die Verbindung einzurichten. - Führe eine Bewertung durch und bestätige, dass die Scores in Failproof AI erscheinen.
- Dashboard
- CLI
Öffne eine abgeschlossene Sitzung unter Observe → Sessions und wähle Run evaluation, falls sie nicht automatisch bewertet wurde. Überprüfe Status, Scores, Begründungen und Zusammenfassung im Evaluation-Panel der Sitzung.Verwende Observe → Evaluations, um Scores über Agenten oder Umgebungen hinweg zu vergleichen. Nutze Observe → Metrics für Latenz, Kosten, Token und andere numerische Messungen.Beginne mit einer einzelnen Sitzung, um zu bestätigen, dass der Evaluator die erwarteten Score-Schlüssel und nützliche Begründungen für diesen spezifischen Durchlauf zurückgegeben hat.
Sobald die Einzelergebnisse korrekt aussehen, verwende das Evaluierungs-Dashboard, um diese Scores über Zeit und über Agenten oder Umgebungen hinweg zu vergleichen.
Ein gesundes Diagramm sollte stabile Score-Namen verwenden; das Ändern eines Schlüssels erstellt eine separate Reihe.


EVALUATOR_ENDPOINT im Serverprozess gesetzt ist. Starte den Server nach dem Ändern von Evaluator-Umgebungsvariablen neu.
Der Dienst stellt GET /health, GET /config, POST /evaluate und optional GET /evaluate/{job_id} bereit. Gib JobPending für asynchrone Aufgaben zurück und registriere @app.job_lookup, damit Failproof AI abfragen kann.
Wenn ein Token konfiguriert ist, erfordern alle Routen außer health dasselbe Bearer-Token, das Failproof AI als EVALUATOR_TOKEN sendet.
SDK-Typen
Dekoratoren und Routen
Das SDK begrenzt den Anfragekörper für Bewertungsanfragen auf 25 MiB. Unbekannte Anforderungsfelder werden ignoriert, sodass Dienste kompatibel bleiben, wenn der Event-Vertrag erweitert wird.
Asynchrone Arbeit zurückgeben
VerwendeJobPending, wenn die Bewertung nicht innerhalb einer Anfrage abgeschlossen werden kann. Die Job-ID ist für Failproof AI undurchsichtig und muss von deinem Dienst auflösbar bleiben, bis das Ergebnis abgerufen oder der Server-Timeout abgelaufen ist.
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, dann EVALUATOR_POLLING_INTERVAL_SECS des Servers. Werte werden zwischen 1 Sekunde und 1 Stunde begrenzt. Die standardmäßige Wanduhr-Abfrageobergrenze des Servers beträgt eine Stunde.
Anfrage- und Antwortfelder
Einstellungen für Server-Betreiber
Die automatische Bewertung gilt für die gesamte Bereitstellung und bleibt deaktiviert, wennEVALUATOR_ENDPOINT nicht gesetzt ist.
Der Server kann auch einschränken, welche Organisationen den deployment-globalen Evaluator verwenden. Behandle Änderungen an Endpunkt, Token, Wiederholungsversuchen und Organisations-Gates als Betreiberkonfiguration und starte den Server nach Änderungen neu oder führe ein Rolling-Restart durch.
Sicherheit und Betrieb
- Stelle den Evaluator hinter HTTPS, wenn der Datenverkehr eine vertrauenswürdige Netzwerkgrenze überschreitet.
- Konfiguriere ein nicht-leeres Bearer-Token und halte es auf beiden Diensten identisch.
- Protokolliere nicht das Token oder vollständige sensible Prompts aus Anfrage-Nutzlasten.
- Gestalte synchrone Handler idempotent; Wiederholungsversuche können eine Anfrage wiederholen.
- Speichere den Status asynchroner Jobs in der Produktion außerhalb des Prozessspeichers.
- Verwende stabile Score-Schlüssel. Das Umbenennen eines Schlüssels erstellt eine neue Diagrammreihe, anstatt die alte zu ändern.
eval received, eval responded, job lookup, config returned, auth rejected und Handler-Ausnahmen. Es konfiguriert keine Logging-Handler; verwende die Logging-Konfiguration der Host-Anwendung.
