Skip to main content
Ein Evaluator empfängt eine abgeschlossene Agentensitzung und gibt die gewünschten Qualitätssignale zurück: numerische Bewertungen, eine Erklärung für jede Bewertung und eine optionale Zusammenfassung. Failproof AI speichert diese Ergebnisse neben dem Trace und visualisiert sie über Agenten und Umgebungen hinweg.

Evaluator einrichten

1

Evaluator SDK installieren

Installieren Sie das SDK und den Server zum Ausführen.
2

Bewertungskriterien festlegen

Erstellen Sie evaluator.py. Dieses Beispiel prüft, ob eine Sitzung fehlgeschlagene Tool-Aufrufe enthält.
3

Lokal ausführen und testen

Setzen Sie ein gemeinsames Token, starten Sie den Evaluator und prüfen Sie, ob der Health-Endpunkt antwortet.
In einem anderen Terminal:

Evaluator mit Failproof AI verbinden

  1. Deployen Sie den Evaluator unter einer HTTPS-URL, die von Failproof AI Cloud erreichbar ist.
  2. Konfigurieren Sie EVALUATOR_ENDPOINT mit dieser URL und setzen Sie EVALUATOR_TOKEN auf dasselbe Token, das der Evaluator verwendet. Für die verwaltete Cloud wenden Sie sich an support@befailproof.ai, um die Verbindung einzurichten.
  3. Führen Sie eine Evaluierung durch und prüfen Sie, ob die Bewertungen in Failproof AI erscheinen.
Öffnen Sie eine abgeschlossene Sitzung unter Observe → Sessions und wählen Sie Run evaluation, falls sie nicht automatisch evaluiert wurde. Überprüfen Sie Status, Bewertungen, Begründungen und Zusammenfassung im Evaluation-Panel der Sitzung.Verwenden Sie Observe → Evaluations, um Bewertungen über Agenten oder Umgebungen hinweg zu vergleichen. Nutzen Sie Observe → Metrics für Latenz-, Kosten-, Token- und andere numerische Messungen.Beginnen Sie mit einer einzelnen Sitzung, um sicherzustellen, dass der Evaluator die erwarteten Score-Keys und sinnvolle Begründungen für diesen konkreten Durchlauf zurückgegeben hat.Eine Sitzungsdetailansicht mit Evaluierungsbewertungen und Begründungen neben dem Trace.Sobald die Einzelergebnisse korrekt aussehen, können Sie im Evaluierungs-Dashboard diese Bewertungen über die Zeit und über Agenten oder Umgebungen hinweg vergleichen.Ein Qualitäts-Dashboard mit zeitlichem Verlauf der Evaluator-Bewertungen.Ein gesundes Diagramm sollte stabile Score-Namen verwenden – das Umbenennen eines Keys erstellt eine separate Datenreihe.
Bei einer selbst gehosteten Cloud-Instanz ist die automatische Evaluierung deaktiviert, bis EVALUATOR_ENDPOINT am Serverprozess gesetzt ist. Starten Sie den Server nach Änderungen an Evaluator-Umgebungsvariablen neu. Der Service stellt GET /health, GET /config, POST /evaluate und optional GET /evaluate/{job_id} bereit. Geben Sie JobPending für asynchrone Arbeit zurück und registrieren Sie @app.job_lookup, damit Failproof AI den Status abfragen kann. Wenn ein Token konfiguriert ist, erfordern alle Routen außer Health dasselbe Bearer-Token, das Failproof AI als EVALUATOR_TOKEN sendet.

SDK-Typen

Dekoratoren und Routen

Das SDK begrenzt Evaluierungsanfrage-Bodies auf 25 MiB. Unbekannte Anforderungsfelder werden ignoriert, sodass Services kompatibel bleiben, wenn der Event-Vertrag erweitert wird.

Asynchrone Arbeit zurückgeben

Verwenden Sie JobPending, wenn die Evaluierung nicht innerhalb einer einzigen Anfrage abgeschlossen werden kann. Die Job-ID ist für Failproof AI opak und muss von Ihrem Service auflösbar bleiben, bis das Ergebnis abgerufen oder der Server-Timeout erreicht wurde.
Das Polling-Intervall wird in dieser Reihenfolge bestimmt: JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, dann EVALUATOR_POLLING_INTERVAL_SECS des Servers. Werte werden auf einen Bereich zwischen 1 Sekunde und 1 Stunde begrenzt. Die standardmäßige Wanduhr-Polling-Obergrenze des Servers beträgt eine Stunde.

Anfrage- und Antwortfelder

Server-Operator-Einstellungen

Die automatische Evaluierung gilt für das gesamte Deployment und bleibt deaktiviert, wenn EVALUATOR_ENDPOINT nicht gesetzt ist. Der Server kann auch einschränken, welche Organisationen den deployment-globalen Evaluator nutzen. Behandeln Sie Änderungen an Endpunkt, Token, Wiederholungslogik und Organisations-Beschränkungen als Operator-Konfiguration und starten Sie den Server danach neu oder führen Sie ein Rolling Restart durch.

Sicherheit und Betrieb

  • Stellen Sie den Evaluator hinter HTTPS, wenn der Datenverkehr eine vertrauenswürdige Netzwerkgrenze überquert.
  • Konfigurieren Sie ein nicht leeres Bearer-Token und halten Sie es auf beiden Services identisch.
  • Protokollieren Sie weder das Token noch vollständige sensible Prompts aus Anfrage-Nutzdaten.
  • Gestalten Sie synchrone Handler idempotent; Wiederholungen können eine Anfrage wiederholen.
  • Persistieren Sie asynchronen Job-Status in der Produktion außerhalb des Prozessspeichers.
  • Verwenden Sie stabile Score-Keys. Das Umbenennen eines Keys erstellt eine neue Diagrammreihe, anstatt die alte zu ändern.
Das SDK gibt strukturierte Lifecycle-Logs aus, z. B. eval received, eval responded, job lookup, config returned, auth rejected und Handler-Ausnahmen. Es konfiguriert keine Logging-Handler; verwenden Sie die Logging-Konfiguration der Host-Anwendung.