> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Evaluations

title: "ऑनलाइन मूल्यांकन"
description: "गुणवत्ता, अनुपालन, लागत और विलंबता के लिए लाइव और पूर्ण सत्रों को स्कोर करें।"
icon: "gauge"
-------------

ऑनलाइन मूल्यांकन एजेंट सत्रों के लिए सुसंगत निर्णय लागू करते हैं। उन संकेतों के लिए उनका उपयोग करें जिन्हें केवल ऑडिट के दौरान जांच करने के बजाय लगातार मापा जाना चाहिए।

## मूल्यांकन गुणवत्ता की समीक्षा करें

<Tabs>
  <Tab title="Dashboard">
    1. **Observe → Evaluations** पर जाएं।
    2. एक श्रृंखला जोड़ें और एजेंट, वातावरण, मूल्यांकन स्कोर, सांख्यिकी और वक्र चुनें।
    3. वातावरण, एजेंट या स्कोर कुंजियों की तुलना करने के लिए श्रृंखला जोड़ें।
    4. मिलते-जुलते सत्रों को खोलने या फ़िल्टर किए गए दृश्य को साझा करने के लिए एक परिणाम चुनें। विलंबता, टोकन, लागत और अन्य परिमाण मानों के लिए **Observe → Metrics** का उपयोग करें।

           <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/dashboard-quality.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=74c925ae831046fc869a3a3d6e81fc25" alt="एक गुणवत्ता डैशबोर्ड जो औसत मूल्यांकन स्कोर और समय के साथ प्रवृत्तियों को दर्शाता है।" width="2880" height="1800" data-path="images/dashboard/dashboard-quality.png" />

    ड्रिल-डाउन से एक सत्र खोलें ताकि इसके प्रति-स्कोर तर्क का निरीक्षण किया जा सके:

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/session-detail.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=7b5f022dd5c485565a8cd92b2e936235" alt="एक सत्र विस्तार दृश्य जो मूल्यांकन स्कोर और तर्क को पूर्ण ट्रेस के बगल में दर्शाता है।" width="3200" height="2000" data-path="images/dashboard/session-detail.png" />
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp evals --agent-id checkout-agent --aggregate
    fp evals --aggregate --env production --status error
    fp evals --score helpfulness:0.8.. --since 7d
    ```

    ऑटोमेशन के लिए `evals` से पहले वैश्विक `--json` जोड़ें, उदाहरण के लिए `fp --json evals --aggregate --env production`।
  </Tab>
</Tabs>

एक मूल्यांकनकर्ता सत्र की पहचान, वातावरण, समय मुहर और आदेशित घटनाओं को प्राप्त करता है। यह वैकल्पिक तर्क और एक सारांश के साथ संख्यात्मक स्कोर कुंजियां लौटा सकता है। दीर्घकालीन मूल्यांकनकर्ता एक लंबित कार्य लौटा सकते हैं और बाद में पोल किए जा सकते हैं।

## अच्छे मूल्यांकन लक्ष्य

* कार्य पूर्णता या सटीकता
* आधार संबंधितता और भ्रम का जोखिम
* उपकरण चयन और उपकरण दक्षता
* नीति या प्रक्रिया अनुपालन
* लागत और विलंबता बजट
* आवश्यक मानव एस्केलेशन

## स्कोर से प्रतिक्रिया तक

प्रवृत्तियों को ट्रैक करने के लिए डैशबोर्ड में स्कोर दिखाएं। थ्रेसहोल्ड या यौगिक शर्तों के लिए सतर्कताएं बनाएं। जब कोई स्कोर किसी जनसंख्या में गिरता है, तो यह जांचने के लिए एक ऑडिट चलाएं कि ऐसा क्यों हुआ; जब कारण एक दोहराए जाने वाला कार्य है, तो एक नीति तैनात करें।

<Card title="एक मूल्यांकनकर्ता बनाएं" icon="code-2" href="/hi/reference/evaluator-sdk">
  Python मूल्यांकनकर्ता SDK के साथ सिंक्रोनस या अतुल्यकालिक मूल्यांकन लागू करें।
</Card>
