विवरण से मसौदा तैयार करें
- Analyze → eval authoring पर जाएं और new eval चुनें।
- सादी English में मापने के लिए क्या है यह बताएं, या start from an example… से चुनें, और draft को चुनें।
- Fields और code की समीक्षा करें, फिर इसे test करें और deploy करें।

Fields सेट करें
एक मूल्यांकन को उन agents और environments तक सीमित करने के लिए condition का उपयोग करें जिसके लिए यह meant है:
कोड स्वयं लिखें
evaluator code एक Python expression है जोEvalResult(...) return करता है, जिसमें session in scope है। यह tool results के share को score करता है जो ok आए:
score=, या एक metric या assertion evaluation के लिए key के नाम से एक metrics या assertions entry। अन्य metrics और assertions इसके साथ ride करते हैं, एक run में 25 परिणाम तक।
कुछ भी और reachable नहीं है: कोई imports नहीं, और session data और plain string और dictionary methods जैसे
get, lower, और split से परे कोई attributes नहीं, जिन्हें reference किए जाने के बजाय called होना चाहिए। Payload keys वह हैं जो आपके agents भेजते हैं — status ऊपर केवल एक example है — इसलिए उन्हें एक real session से पढ़ें। format code को tidy करता है और fix सहायक को इसे repair करने के लिए कहता है। Code 128 KiB तक हो सकता है, और condition 16 KiB तक हो सकता है।


