Aus einer Beschreibung entwerfen
- Gehe zu Analyze → eval authoring und wähle new eval.
- Beschreibe auf Englisch, was gemessen werden soll, oder wähle unter start from an example… ein Beispiel aus, und klicke auf draft.
- Überprüfe die Felder und den generierten Code, teste die Evaluierung und stelle sie bereit.

Die Felder befüllen
Verwende die Bedingung, um eine Evaluierung auf die dafür vorgesehenen Agents und Umgebungen einzuschränken:
Den Code selbst schreiben
Der evaluator code ist ein einzelner Python-Ausdruck, derEvalResult(...) zurückgibt, wobei session im Scope verfügbar ist. Dieses Beispiel bewertet den Anteil der Tool-Ergebnisse, die mit ok zurückgekehrt sind:
score= für eine Score-Evaluierung, oder ein metrics- bzw. assertions-Eintrag mit dem Namen des Keys für eine Metrik- oder Assertion-Evaluierung. Weitere Metriken und Assertions können mitsenden — bis zu 25 Ergebnisse pro Lauf.
Nichts anderes ist erreichbar: keine Imports und keine Attribute über die Session-Daten sowie einfache String- und Dictionary-Methoden wie
get, lower und split hinaus, die aufgerufen werden müssen anstatt nur referenziert zu werden. Payload-Schlüssel sind das, was deine Agents senden — status oben ist nur ein Beispiel — lies sie daher von einer echten Session ab. format formatiert den Code, fix beauftragt den Assistenten, ihn zu reparieren. Der Code kann bis zu 128 KiB groß sein, die Bedingung bis zu 16 KiB.


