Skip to main content
Ein Evaluator empfängt eine abgeschlossene Agent-Sitzung und gibt die gewünschten Qualitätssignale zurück: numerische Bewertungen, eine Erklärung für jede Bewertung und eine optionale Zusammenfassung. Failproof AI speichert diese Ergebnisse neben dem Trace und stellt sie agenten- und umgebungsübergreifend in Diagrammen dar.

Evaluator einrichten

1

Evaluator SDK installieren

Installiere das SDK und den Server, der es ausführt.
2

Bewertungskriterien definieren

Erstelle evaluator.py. Dieses Beispiel prüft, ob eine Sitzung fehlgeschlagene Tool-Aufrufe enthält.
3

Lokal ausführen und testen

Setze ein gemeinsames Token, starte den Evaluator und bestätige, dass der Health-Endpunkt antwortet.
In einem anderen Terminal:

Evaluator mit Failproof AI verbinden

  1. Stelle den Evaluator unter einer HTTPS-URL bereit, die von Failproof AI Cloud erreichbar ist.
  2. Konfiguriere EVALUATOR_ENDPOINT mit dieser URL und setze EVALUATOR_TOKEN auf dasselbe Token, das der Evaluator verwendet. Für verwaltete Cloud-Instanzen wende dich an support@befailproof.ai, um die Verbindung einzurichten.
  3. Führe eine Bewertung durch und bestätige, dass die Scores in Failproof AI erscheinen.
Öffne eine abgeschlossene Sitzung unter Observe → Sessions und wähle Run evaluation, falls sie nicht automatisch bewertet wurde. Überprüfe Status, Scores, Begründungen und Zusammenfassung im Evaluation-Panel der Sitzung.Verwende Observe → Evaluations, um Scores über Agenten oder Umgebungen hinweg zu vergleichen. Nutze Observe → Metrics für Latenz, Kosten, Token und andere numerische Messungen.Beginne mit einer einzelnen Sitzung, um zu bestätigen, dass der Evaluator die erwarteten Score-Schlüssel und nützliche Begründungen für diesen spezifischen Durchlauf zurückgegeben hat.Eine Sitzungsdetailansicht, die Bewertungsscores und Begründungen neben dem Trace zeigt.Sobald die Einzelergebnisse korrekt aussehen, verwende das Evaluierungs-Dashboard, um diese Scores über Zeit und über Agenten oder Umgebungen hinweg zu vergleichen.Ein Qualitäts-Dashboard mit Evaluator-Scores über die Zeit.Ein gesundes Diagramm sollte stabile Score-Namen verwenden; das Ändern eines Schlüssels erstellt eine separate Reihe.
Bei einer selbst gehosteten Cloud-Instanz ist die automatische Bewertung deaktiviert, bis EVALUATOR_ENDPOINT im Serverprozess gesetzt ist. Starte den Server nach dem Ändern von Evaluator-Umgebungsvariablen neu. Der Dienst stellt GET /health, GET /config, POST /evaluate und optional GET /evaluate/{job_id} bereit. Gib JobPending für asynchrone Aufgaben zurück und registriere @app.job_lookup, damit Failproof AI abfragen kann. Wenn ein Token konfiguriert ist, erfordern alle Routen außer health dasselbe Bearer-Token, das Failproof AI als EVALUATOR_TOKEN sendet.

SDK-Typen

Dekoratoren und Routen

Das SDK begrenzt den Anfragekörper für Bewertungsanfragen auf 25 MiB. Unbekannte Anforderungsfelder werden ignoriert, sodass Dienste kompatibel bleiben, wenn der Event-Vertrag erweitert wird.

Asynchrone Arbeit zurückgeben

Verwende JobPending, wenn die Bewertung nicht innerhalb einer Anfrage abgeschlossen werden kann. Die Job-ID ist für Failproof AI undurchsichtig und muss von deinem Dienst auflösbar bleiben, bis das Ergebnis abgerufen oder der Server-Timeout abgelaufen ist.
Die Abfragereihenfolge wird in dieser Reihenfolge ausgewählt: JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, dann EVALUATOR_POLLING_INTERVAL_SECS des Servers. Werte werden zwischen 1 Sekunde und 1 Stunde begrenzt. Die standardmäßige Wanduhr-Abfrageobergrenze des Servers beträgt eine Stunde.

Anfrage- und Antwortfelder

Einstellungen für Server-Betreiber

Die automatische Bewertung gilt für die gesamte Bereitstellung und bleibt deaktiviert, wenn EVALUATOR_ENDPOINT nicht gesetzt ist. Der Server kann auch einschränken, welche Organisationen den deployment-globalen Evaluator verwenden. Behandle Änderungen an Endpunkt, Token, Wiederholungsversuchen und Organisations-Gates als Betreiberkonfiguration und starte den Server nach Änderungen neu oder führe ein Rolling-Restart durch.

Sicherheit und Betrieb

  • Stelle den Evaluator hinter HTTPS, wenn der Datenverkehr eine vertrauenswürdige Netzwerkgrenze überschreitet.
  • Konfiguriere ein nicht-leeres Bearer-Token und halte es auf beiden Diensten identisch.
  • Protokolliere nicht das Token oder vollständige sensible Prompts aus Anfrage-Nutzlasten.
  • Gestalte synchrone Handler idempotent; Wiederholungsversuche können eine Anfrage wiederholen.
  • Speichere den Status asynchroner Jobs in der Produktion außerhalb des Prozessspeichers.
  • Verwende stabile Score-Schlüssel. Das Umbenennen eines Schlüssels erstellt eine neue Diagrammreihe, anstatt die alte zu ändern.
Das SDK gibt strukturierte Lifecycle-Logs aus, wie eval received, eval responded, job lookup, config returned, auth rejected und Handler-Ausnahmen. Es konfiguriert keine Logging-Handler; verwende die Logging-Konfiguration der Host-Anwendung.