Skip to main content
Online-Auswertungen wenden konsistente Beurteilungen auf Agent-Sessions an. Verwende sie für Signale, die kontinuierlich gemessen werden sollten – anstatt erst bei einem Audit untersucht zu werden.

Auswertungsqualität prüfen

  1. Gehe zu Observe → Evaluations.
  2. Füge eine Reihe hinzu und wähle den Agent, die Umgebung, den Auswertungswert, die Statistik und die Kurve.
  3. Füge weitere Reihen hinzu, um Umgebungen, Agents oder Score-Schlüssel zu vergleichen.
  4. Wähle ein Ergebnis aus, um passende Sessions zu öffnen oder die gefilterte Ansicht zu teilen. Nutze Observe → Metrics für Latenz, Tokens, Kosten und andere Mengenwerte. Ein Qualitäts-Dashboard mit durchschnittlichen Auswertungswerten und zeitlichen Trends.
Öffne eine Session über die Drill-down-Ansicht, um die auswertungsspezifische Begründung zu prüfen:Eine Session-Detailansicht mit Auswertungswerten und Begründungen neben dem vollständigen Trace.
Ein Evaluator erhält die Session-Identität, Umgebung, Zeitstempel und geordnete Ereignisse. Er kann numerische Score-Schlüssel mit optionaler Begründung und einer Zusammenfassung zurückgeben. Lang laufende Evaluatoren können einen ausstehenden Job zurückgeben und später abgefragt werden.

Geeignete Auswertungsziele

  • Aufgabenerfüllung oder Korrektheit
  • Faktentreue und Halluzinationsrisiko
  • Tool-Auswahl und Tool-Effizienz
  • Richtlinien- oder Prozess-Compliance
  • Kosten- und Latenzbudgets
  • Erforderliche Eskalation an Menschen

Von der Bewertung zur Reaktion

Zeige Werte in Dashboards an, um Trends zu verfolgen. Erstelle Alerts für Schwellenwerte oder zusammengesetzte Bedingungen. Wenn ein Score über eine Population hinweg sinkt, führe ein Audit durch, um die Ursache zu untersuchen; wenn die Ursache eine wiederholbare Aktion ist, setze eine Policy ein.

Einen Evaluator erstellen

Implementiere synchrone oder asynchrone Auswertungen mit dem Python Evaluator SDK.