> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Evaluations

title: "التقييمات المباشرة"
description: "قيّم الجلسات المباشرة والمكتملة من حيث الجودة والامتثال والتكلفة والكمون."
icon: "gauge"
-------------

تطبق التقييمات المباشرة أحكاماً متسقة على جلسات الوكيل. استخدمها للإشارات التي يجب قياسها بشكل مستمر بدلاً من التحقيق فيها فقط أثناء التدقيق.

## مراجعة جودة التقييم

<Tabs>
  <Tab title="لوحة المعلومات">
    1. انتقل إلى **Observe → Evaluations**.
    2. أضف سلسلة واختر الوكيل والبيئة ودرجة التقييم والإحصائية والمنحنى.
    3. أضف سلاسل لمقارنة البيئات أو الوكلاء أو مفاتيح الدرجات.
    4. اختر نتيجة لفتح الجلسات المطابقة أو شارك العرض المصفى. استخدم **Observe → Metrics** للحصول على قيم الكمون والرموز والتكلفة والقيم الأخرى.

           <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/dashboard-quality.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=74c925ae831046fc869a3a3d6e81fc25" alt="لوحة معلومات الجودة تعرض متوسط درجات التقييم والاتجاهات بمرور الوقت." width="2880" height="1800" data-path="images/dashboard/dashboard-quality.png" />

    افتح جلسة من التفصيل للتحقق من تفكيرها لكل درجة:

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/session-detail.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=7b5f022dd5c485565a8cd92b2e936235" alt="عرض تفاصيل الجلسة يعرض درجات التقييم والتفكير بجانب التتبع الكامل." width="3200" height="2000" data-path="images/dashboard/session-detail.png" />
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp evals --agent-id checkout-agent --aggregate
    fp evals --aggregate --env production --status error
    fp evals --score helpfulness:0.8.. --since 7d
    ```

    أضف `--json` العام قبل `evals` للأتمتة، على سبيل المثال `fp --json evals --aggregate --env production`.
  </Tab>
</Tabs>

يتلقى المقيِّم هوية الجلسة والبيئة والطوابع الزمنية والأحداث المرتبة. يمكنه إرجاع مفاتيح درجات رقمية مع تفكير اختياري وملخص. يمكن للمقيِّمين طويلي المدى أن يعيدوا وظيفة قيد الانتظار ويتم استقصاؤهم لاحقاً.

## أهداف التقييم الجيدة

* إكمال المهام أو صحتها
* التأسيس على الواقع ومخاطر الهلوسة
* اختيار الأداة وكفاءة الأداة
* الامتثال للسياسة أو العملية
* ميزانيات التكلفة والكمون
* تصعيد بشري مطلوب

## من الدرجة إلى الاستجابة

اعرض الدرجات في لوحات المعلومات لتتبع الاتجاهات. أنشئ تنبيهات للحدود أو الشروط المركبة. عندما تنخفض الدرجة عبر السكان، قم بإجراء تدقيق للتحقيق في السبب؛ عندما يكون السبب إجراءً قابلاً للتكرار، انشر سياسة.

<Card title="بناء مقيِّم" icon="code-2" href="/ar/reference/evaluator-sdk">
  قم بتنفيذ التقييم المتزامن أو غير المتزامن باستخدام SDK مقيِّم Python.
</Card>
