एक मूल्यांकनकर्ता सेट अप करें
1
Evaluator SDK इंस्टॉल करें
SDK और इसे चलाने के लिए उपयोग किए जाने वाले सर्वर को इंस्टॉल करें।
2
स्कोर करने के लिए क्या परिभाषित करें
evaluator.py बनाएँ। यह उदाहरण जाँचता है कि क्या एक सेशन में कोई विफल टूल कॉल है।3
इसे स्थानीय रूप से चलाएँ और परीक्षण करें
एक साझा टोकन सेट करें, मूल्यांकनकर्ता शुरू करें, और पुष्टि करें कि इसका health endpoint प्रतिक्रिया देता है।एक अन्य टर्मिनल में:
मूल्यांकनकर्ता को Failproof AI से कनेक्ट करें
- मूल्यांकनकर्ता को एक HTTPS URL पर तैनात करें जो Failproof AI Cloud द्वारा पहुँचा जा सकता है।
EVALUATOR_ENDPOINTको उस URL के साथ कॉन्फ़िगर करें औरEVALUATOR_TOKENको मूल्यांकनकर्ता द्वारा उपयोग किए जाने वाले टोकन पर सेट करें। प्रबंधित Cloud के लिए, कनेक्शन कॉन्फ़िगर करने के लिए support@befailproof.ai से संपर्क करें।- एक मूल्यांकन चलाएँ और पुष्टि करें कि इसके स्कोर Failproof AI में दिखाई देते हैं।
- Dashboard
- CLI
Observe → Sessions के तहत एक पूर्ण सेशन खोलें और यदि यह स्वचालित रूप से मूल्यांकन नहीं किया गया था तो Run evaluation चुनें। सेशन के Evaluation पैनल में स्थिति, स्कोर, तर्क और सारांश की समीक्षा करें।एजेंट या वातावरण के पार स्कोर की तुलना करने के लिए Observe → Evaluations का उपयोग करें। विलंबता, लागत, टोकन और अन्य संख्यात्मक माप के लिए Observe → Metrics का उपयोग करें।पुष्टि करने के लिए एक सेशन के साथ शुरुआत करें कि मूल्यांकनकर्ता ने उस विशिष्ट रन के लिए अपेक्षित स्कोर कुंजी और उपयोगी तर्क लौटाए हैं।
एक बार जब व्यक्तिगत परिणाम सही दिखें, समय के साथ और एजेंट या वातावरण के पार उन स्कोर की तुलना करने के लिए मूल्यांकन डैशबोर्ड का उपयोग करें।
एक स्वस्थ चार्ट को स्थिर स्कोर नाम का उपयोग करना चाहिए; एक कुंजी को पुनः नाम देना एक अलग श्रृंखला बनाता है।


EVALUATOR_ENDPOINT सर्वर प्रक्रिया पर सेट नहीं किया जाता तब तक स्वचालित मूल्यांकन अक्षम है। मूल्यांकनकर्ता पर्यावरण चर बदलने के बाद सर्वर को पुनः शुरू करें।
सेवा GET /health, GET /config, POST /evaluate, और वैकल्पिक रूप से GET /evaluate/{job_id} को उजागर करती है। असमकालीन कार्य के लिए JobPending लौटाएँ और @app.job_lookup को पंजीकृत करें ताकि Failproof AI इसे पोल कर सके।
जब एक टोकन कॉन्फ़िगर किया गया हो, तो health को छोड़कर सभी रूट को समान bearer token की आवश्यकता है जो Failproof AI EVALUATOR_TOKEN के रूप में भेजता है।
SDK प्रकार
Decorators और routes
SDK मूल्यांकन request bodies को 25 MiB पर सीमित करता है। अज्ञात request फ़ील्ड को अनदेखा किया जाता है ताकि सेवाएँ event contract के विकास के साथ संगत रहें।
असमकालीन कार्य लौटाएँ
JobPending का उपयोग करें जब मूल्यांकन एक request के भीतर समाप्त नहीं हो सकता है। job ID Failproof AI के लिए अपारदर्शी है और परिणाम एकत्र किए जाने या सर्वर timeout समाप्त होने तक आपकी सेवा द्वारा resolvable रहना चाहिए।
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, फिर सर्वर का EVALUATOR_POLLING_INTERVAL_SECS। मान 1 सेकंड और 1 घंटे के बीच fixed हैं। सर्वर की डिफ़ॉल्ट wall-clock polling cap एक घंटा है।
Request और response फ़ील्ड
Server operator सेटिंग्स
स्वचालित मूल्यांकन deployment-wide है और जबEVALUATOR_ENDPOINT अनुपस्थित होता है तो अक्षम रहता है।
सर्वर यह भी restrict कर सकता है कि कौन सी organizations deployment-global मूल्यांकनकर्ता का उपयोग करती हैं। endpoint, token, retry, और organization-gate परिवर्तनों को operator configuration के रूप में मानें और उन्हें बदलने के बाद सर्वर को restart या roll करें।
सुरक्षा और संचालन
- जब traffic एक trusted network boundary को पार करता है तो मूल्यांकनकर्ता को HTTPS के पीछे रखें।
- एक non-empty bearer token कॉन्फ़िगर करें और इसे दोनों सेवाओं पर identical रखें।
- टोकन या request payloads से पूर्ण sensitive prompts को log न करें।
- समकालीन handlers को idempotent बनाएँ; retries एक request को दोहरा सकते हैं।
- Production में process memory के बाहर असमकालीन job state को persist करें।
- स्थिर स्कोर कुंजी लौटाएँ। एक कुंजी को पुनः नाम देना एक नई chart series बनाता है पुरानी को बदलने के बजाय।
eval received, eval responded, job lookup, config returned, auth rejected, और handler exceptions। यह logging handlers कॉन्फ़िगर नहीं करता; host application की logging configuration का उपयोग करें।
