- 0 से 1 तक एक स्कोर, वैकल्पिक रूप से पास या विफल चिह्नित
- एक मेट्रिक, जैसे गिनती, अवधि, या लागत, इसकी इकाई के साथ
- एक assertion, जो पास हुआ या नहीं
दो प्रकार के मूल्यांकनकर्ता
होस्ट किया गया Python जानबूझकर छोटा है: एक अभिव्यक्ति, कोई आयात नहीं, कोई नेटवर्क नहीं। कुछ भी जो एक मॉडल की आवश्यकता है — एक LLM judge जो स्कोर करता है कि क्या कोई उत्तर प्रासंगिक था, कहें — इसके बजाय आपके अपने वर्कर में चलता है। दोनों प्रकार को कोई इनबाउंड कनेक्शन की आवश्यकता नहीं है: वर्कर पूरे सत्रों को दावा करते हैं और आउटबाउंड HTTPS पर परिणाम जमा करते हैं।
प्रत्येक संगठन अपने एजेंट्स का मूल्यांकन करता है
मूल्यांकन उस संगठन के हैं जो उन्हें परिभाषित करता है। किसी उदाहरण पर प्रत्येक संगठन अपने स्वयं के लिखता है — इसकी अपनी जांच, शर्तें, सीमाएं, और लेबल — संस्करण और किसी अन्य को प्रभावित किए बिना उन्हें तैनात करता है, और केवल अपने परिणाम देखता है। उन परिणामों को एजेंट, पर्यावरण, मूल्यांकन, और समय के आधार पर फ़िल्टर करें, या सहायक से उनके बारे में पूछें।पहले ड्राफ्ट से लाइव स्कोर तक
1
इसे लिखें
वर्णन करें कि क्या मापना है और सहायक को इसे ड्राफ्ट करने दें, या इसे स्वयं लिखें। एक मूल्यांकन लिखें देखें।
2
इसका परीक्षण करें
इससे पहले कि यह लाइव हो, इसे वास्तविक सत्रों के विरुद्ध चलाएं; कुछ भी संग्रहीत नहीं है। एक मूल्यांकन का परीक्षण करें देखें।
3
इसे तैनात और संस्करण करें
एक अपरिवर्तनीय संस्करण तैनात करें, जैसे-जैसे यह विकसित होता है नए संस्करण प्रकाशित करें, और एक पहले वाले पर वापस रोल करें। तैनात और संस्करण करें देखें।
4
परिणाम पढ़ें
समय के साथ स्कोर चार्ट करें, एजेंट्स और पर्यावरण की तुलना करें, और सहायक से पूछें। मूल्यांकन परिणाम पढ़ें देखें।

