Skip to main content
Eine Evaluierung bewertet eine abgeschlossene Agenten-Sitzung. Wenn eine Sitzung endet, wird jede aktivierte Evaluierung, die auf sie zutrifft, ausgeführt und zeichnet die Ergebnisse auf – mit einer Begründung, die du direkt neben dem Trace lesen kannst:
  • ein Score von 0 bis 1, optional als bestanden oder nicht bestanden markiert
  • eine Metrik, z. B. eine Anzahl, eine Dauer oder Kosten, mit ihrer Einheit
  • eine Assertion, die bestanden hat oder nicht

Zwei Arten von Evaluatoren

Gehostetes Python ist bewusst schlank gehalten: ein Ausdruck, keine Imports, kein Netzwerk. Alles, was ein Modell erfordert – etwa ein LLM-Richter, der bewertet, ob eine Antwort relevant war – läuft stattdessen in deinem eigenen Worker. Keine der beiden Varianten benötigt eine eingehende Verbindung: Worker holen abgeschlossene Sitzungen ab und übermitteln Ergebnisse über ausgehendes HTTPS.

Jede Organisation evaluiert ihre eigenen Agenten

Evaluierungen gehören der Organisation, die sie definiert. Jede Organisation auf einer Instanz schreibt ihre eigenen – eigene Prüfungen, Bedingungen, Schwellenwerte und Labels – versioniert und deployt sie, ohne andere Organisationen zu beeinflussen, und sieht nur ihre eigenen Ergebnisse. Diese Ergebnisse lassen sich nach Agent, Umgebung, Evaluierung und Zeitraum filtern oder per Assistent abfragen.

Vom ersten Entwurf zu Live-Scores

1

Schreibe sie

Beschreibe, was gemessen werden soll, und lass den Assistenten einen Entwurf erstellen – oder schreibe sie selbst. Siehe Eine Evaluierung schreiben.
2

Teste sie

Führe sie gegen echte Sitzungen aus, bevor sie live geht; nichts wird gespeichert. Siehe Eine Evaluierung testen.
3

Deploye und versioniere sie

Deploye eine unveränderliche Version, veröffentliche neue Versionen bei Weiterentwicklung und kehre bei Bedarf zu einer früheren zurück. Siehe Deployen und versionieren.
4

Lies die Ergebnisse

Visualisiere Scores über die Zeit, vergleiche Agenten und Umgebungen, und stelle Fragen an den Assistenten. Siehe Evaluierungsergebnisse lesen.
Evaluierungen wirken vorwärts: Eine jetzt deployete Version bewertet die Sitzungen, die ab sofort abgeschlossen werden. Um bereits vorhandene Sitzungen zu bewerten, fülle sie nach.