- ein Score von 0 bis 1, optional als bestanden oder nicht bestanden markiert
- eine Metrik, z. B. eine Anzahl, eine Dauer oder Kosten, mit ihrer Einheit
- eine Assertion, die bestanden hat oder nicht
Zwei Arten von Evaluatoren
Gehostetes Python ist bewusst schlank gehalten: ein Ausdruck, keine Imports, kein Netzwerk. Alles, was ein Modell erfordert – etwa ein LLM-Richter, der bewertet, ob eine Antwort relevant war – läuft stattdessen in deinem eigenen Worker. Keine der beiden Varianten benötigt eine eingehende Verbindung: Worker holen abgeschlossene Sitzungen ab und übermitteln Ergebnisse über ausgehendes HTTPS.
Jede Organisation evaluiert ihre eigenen Agenten
Evaluierungen gehören der Organisation, die sie definiert. Jede Organisation auf einer Instanz schreibt ihre eigenen – eigene Prüfungen, Bedingungen, Schwellenwerte und Labels – versioniert und deployt sie, ohne andere Organisationen zu beeinflussen, und sieht nur ihre eigenen Ergebnisse. Diese Ergebnisse lassen sich nach Agent, Umgebung, Evaluierung und Zeitraum filtern oder per Assistent abfragen.Vom ersten Entwurf zu Live-Scores
1
Schreibe sie
Beschreibe, was gemessen werden soll, und lass den Assistenten einen Entwurf erstellen – oder schreibe sie selbst. Siehe Eine Evaluierung schreiben.
2
Teste sie
Führe sie gegen echte Sitzungen aus, bevor sie live geht; nichts wird gespeichert. Siehe Eine Evaluierung testen.
3
Deploye und versioniere sie
Deploye eine unveränderliche Version, veröffentliche neue Versionen bei Weiterentwicklung und kehre bei Bedarf zu einer früheren zurück. Siehe Deployen und versionieren.
4
Lies die Ergebnisse
Visualisiere Scores über die Zeit, vergleiche Agenten und Umgebungen, und stelle Fragen an den Assistenten. Siehe Evaluierungsergebnisse lesen.

