Skip to main content
Online-Evaluierungen wenden konsistente Beurteilungen auf Agentensitzungen an. Verwenden Sie sie für Signale, die kontinuierlich gemessen werden sollten, anstatt nur bei einem Audit untersucht zu werden.

Evaluierungsqualität überprüfen

  1. Gehen Sie zu Observe → Evaluations.
  2. Fügen Sie eine Datenreihe hinzu und wählen Sie den Agenten, die Umgebung, den Evaluierungswert, die Statistik und die Kurve.
  3. Fügen Sie Datenreihen hinzu, um Umgebungen, Agenten oder Score-Schlüssel zu vergleichen.
  4. Wählen Sie ein Ergebnis aus, um passende Sitzungen zu öffnen oder die gefilterte Ansicht zu teilen. Verwenden Sie Observe → Metrics für Latenz, Tokens, Kosten und andere Größenwerte. Ein Qualitäts-Dashboard mit durchschnittlichen Evaluierungswerten und Trends über die Zeit.
Öffnen Sie eine Sitzung aus der Detailansicht, um ihre sitzungsbezogene Begründung zu untersuchen:Eine Sitzungsdetailansicht mit Evaluierungswerten und Begründungen neben dem vollständigen Trace.
Ein Evaluator erhält die Sitzungsidentität, Umgebung, Zeitstempel und geordnete Ereignisse. Er kann numerische Score-Schlüssel mit optionaler Begründung und einer Zusammenfassung zurückgeben. Langläufige Evaluatoren können einen ausstehenden Job zurückgeben und später abgefragt werden.

Geeignete Evaluierungsziele

  • Aufgabenerfüllung oder Korrektheit
  • Faktentreue und Halluzinationsrisiko
  • Tool-Auswahl und Tool-Effizienz
  • Richtlinien- oder Prozess-Compliance
  • Kosten- und Latenzbudgets
  • Erforderliche Eskalation an Menschen

Vom Score zur Reaktion

Zeigen Sie Scores in Dashboards an, um Trends zu verfolgen. Erstellen Sie Warnmeldungen für Schwellenwerte oder zusammengesetzte Bedingungen. Wenn ein Score über eine Population hinweg abnimmt, führen Sie ein Audit durch, um die Ursache zu untersuchen; wenn die Ursache eine wiederholbare Aktion ist, stellen Sie eine Richtlinie bereit.

Einen Evaluator erstellen

Implementieren Sie synchrone oder asynchrone Evaluierungen mit dem Python-Evaluator-SDK.