> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# एजेंट्स का मूल्यांकन करें

> हर पूरे सत्र को अपनी परिभाषित मूल्यांकन के साथ स्कोर करें: होस्ट किए गए Python चेक, या अपने वर्कर में LLM judges।

एक मूल्यांकन एक पूरे एजेंट सत्र को स्कोर करता है। जब कोई सत्र समाप्त होता है, तो हर सक्षम मूल्यांकन जो उस पर लागू होता है, चलता है और यह दर्ज करता है कि उसे क्या मिला, जिसके साथ तर्क आप ट्रेस के बगल में पढ़ सकते हैं:

* 0 से 1 तक एक **स्कोर**, वैकल्पिक रूप से पास या विफल चिह्नित
* एक **मेट्रिक**, जैसे गिनती, अवधि, या लागत, इसकी इकाई के साथ
* एक **assertion**, जो पास हुआ या नहीं

## दो प्रकार के मूल्यांकनकर्ता

|           | होस्ट किया गया Python                                        | आपका अपना वर्कर                                                       |
| --------- | ------------------------------------------------------------ | --------------------------------------------------------------------- |
| लिखा गया  | डैशबोर्ड में, **Analyze → eval authoring** के तहत            | Python में, [Evaluator SDK](/hi/reference/evaluator-sdk) के साथ       |
| चलता है   | Failproof AI के प्रबंधित मूल्यांकनकर्ता पर, एक सैंडबॉक्स में | आपके बुनियादी ढांचे पर                                                |
| सर्वोत्तम | नियतात्मक, कोड-आधारित जांच                                   | LLM judges, मॉडल कॉल, पैकेज, secrets, नेटवर्क एक्सेस, भारी प्रोसेसिंग |

होस्ट किया गया Python जानबूझकर छोटा है: एक अभिव्यक्ति, कोई आयात नहीं, कोई नेटवर्क नहीं। कुछ भी जो एक मॉडल की आवश्यकता है — एक LLM judge जो स्कोर करता है कि क्या कोई उत्तर प्रासंगिक था, कहें — इसके बजाय आपके अपने वर्कर में चलता है। दोनों प्रकार को कोई इनबाउंड कनेक्शन की आवश्यकता नहीं है: वर्कर पूरे सत्रों को दावा करते हैं और आउटबाउंड HTTPS पर परिणाम जमा करते हैं।

## प्रत्येक संगठन अपने एजेंट्स का मूल्यांकन करता है

मूल्यांकन उस संगठन के हैं जो उन्हें परिभाषित करता है। किसी उदाहरण पर प्रत्येक संगठन अपने स्वयं के लिखता है — इसकी अपनी जांच, शर्तें, सीमाएं, और लेबल — संस्करण और किसी अन्य को प्रभावित किए बिना उन्हें तैनात करता है, और केवल अपने परिणाम देखता है। उन परिणामों को एजेंट, पर्यावरण, मूल्यांकन, और समय के आधार पर फ़िल्टर करें, या सहायक से उनके बारे में पूछें।

## पहले ड्राफ्ट से लाइव स्कोर तक

<Steps>
  <Step title="इसे लिखें">
    वर्णन करें कि क्या मापना है और सहायक को इसे ड्राफ्ट करने दें, या इसे स्वयं लिखें। [एक मूल्यांकन लिखें](/hi/evaluations/write) देखें।
  </Step>

  <Step title="इसका परीक्षण करें">
    इससे पहले कि यह लाइव हो, इसे वास्तविक सत्रों के विरुद्ध चलाएं; कुछ भी संग्रहीत नहीं है। [एक मूल्यांकन का परीक्षण करें](/hi/evaluations/test) देखें।
  </Step>

  <Step title="इसे तैनात और संस्करण करें">
    एक अपरिवर्तनीय संस्करण तैनात करें, जैसे-जैसे यह विकसित होता है नए संस्करण प्रकाशित करें, और एक पहले वाले पर वापस रोल करें। [तैनात और संस्करण करें](/hi/evaluations/deploy) देखें।
  </Step>

  <Step title="परिणाम पढ़ें">
    समय के साथ स्कोर चार्ट करें, एजेंट्स और पर्यावरण की तुलना करें, और सहायक से पूछें। [मूल्यांकन परिणाम पढ़ें](/hi/sessions/evaluations) देखें।
  </Step>
</Steps>

मूल्यांकन आगे की ओर चलता है: अभी तैनात किया गया एक संस्करण उन सत्रों को स्कोर करता है जो अब से समाप्त होते हैं। जो सत्र आपके पास पहले से हैं उन्हें स्कोर करने के लिए, [उन्हें backfill करें](/hi/evaluations/deploy#आपके-पास-पहले-से-मौजूद-सत्रों-को-स्कोर-करें)।
