Skip to main content
एक मूल्यांकन एक पूरे एजेंट सत्र को स्कोर करता है। जब कोई सत्र समाप्त होता है, तो हर सक्षम मूल्यांकन जो उस पर लागू होता है, चलता है और यह दर्ज करता है कि उसे क्या मिला, जिसके साथ तर्क आप ट्रेस के बगल में पढ़ सकते हैं:
  • 0 से 1 तक एक स्कोर, वैकल्पिक रूप से पास या विफल चिह्नित
  • एक मेट्रिक, जैसे गिनती, अवधि, या लागत, इसकी इकाई के साथ
  • एक assertion, जो पास हुआ या नहीं

दो प्रकार के मूल्यांकनकर्ता

होस्ट किया गया Python जानबूझकर छोटा है: एक अभिव्यक्ति, कोई आयात नहीं, कोई नेटवर्क नहीं। कुछ भी जो एक मॉडल की आवश्यकता है — एक LLM judge जो स्कोर करता है कि क्या कोई उत्तर प्रासंगिक था, कहें — इसके बजाय आपके अपने वर्कर में चलता है। दोनों प्रकार को कोई इनबाउंड कनेक्शन की आवश्यकता नहीं है: वर्कर पूरे सत्रों को दावा करते हैं और आउटबाउंड HTTPS पर परिणाम जमा करते हैं।

प्रत्येक संगठन अपने एजेंट्स का मूल्यांकन करता है

मूल्यांकन उस संगठन के हैं जो उन्हें परिभाषित करता है। किसी उदाहरण पर प्रत्येक संगठन अपने स्वयं के लिखता है — इसकी अपनी जांच, शर्तें, सीमाएं, और लेबल — संस्करण और किसी अन्य को प्रभावित किए बिना उन्हें तैनात करता है, और केवल अपने परिणाम देखता है। उन परिणामों को एजेंट, पर्यावरण, मूल्यांकन, और समय के आधार पर फ़िल्टर करें, या सहायक से उनके बारे में पूछें।

पहले ड्राफ्ट से लाइव स्कोर तक

1

इसे लिखें

वर्णन करें कि क्या मापना है और सहायक को इसे ड्राफ्ट करने दें, या इसे स्वयं लिखें। एक मूल्यांकन लिखें देखें।
2

इसका परीक्षण करें

इससे पहले कि यह लाइव हो, इसे वास्तविक सत्रों के विरुद्ध चलाएं; कुछ भी संग्रहीत नहीं है। एक मूल्यांकन का परीक्षण करें देखें।
3

इसे तैनात और संस्करण करें

एक अपरिवर्तनीय संस्करण तैनात करें, जैसे-जैसे यह विकसित होता है नए संस्करण प्रकाशित करें, और एक पहले वाले पर वापस रोल करें। तैनात और संस्करण करें देखें।
4

परिणाम पढ़ें

समय के साथ स्कोर चार्ट करें, एजेंट्स और पर्यावरण की तुलना करें, और सहायक से पूछें। मूल्यांकन परिणाम पढ़ें देखें।
मूल्यांकन आगे की ओर चलता है: अभी तैनात किया गया एक संस्करण उन सत्रों को स्कोर करता है जो अब से समाप्त होते हैं। जो सत्र आपके पास पहले से हैं उन्हें स्कोर करने के लिए, उन्हें backfill करें