> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# تقييم الوكلاء

> قيّم كل جلسة منتهية باستخدام التقييمات التي تحددها: فحوصات Python مستضافة، أو حكام LLM في العامل الخاص بك.

يسجل التقييم جلسة وكيل منتهية. عند انتهاء جلسة، يتم تشغيل كل تقييم مفعّل ينطبق عليها وتسجيل ما وجدته، مع التفاصيل التي يمكنك قراءتها بجانب التتبع:

* **درجة** من 0 إلى 1، مع إمكانية تحديدها كناجحة أو فاشلة
* **مقياس**، مثل عدد، أو مدة، أو تكلفة، مع وحدتها
* **تأكيد**، إما أنه نجح أو لم ينجح

## نوعان من المقيّمين

|           | Python مستضاف                                    | العامل الخاص بك                                                                  |
| --------- | ------------------------------------------------ | -------------------------------------------------------------------------------- |
| مكتوب     | في لوحة التحكم، تحت **Analyze → eval authoring** | في Python، باستخدام [Evaluator SDK](/ar/reference/evaluator-sdk)                 |
| يعمل      | على مقيّم Failproof AI المُدار، في بيئة معزولة   | على البنية التحتية الخاصة بك                                                     |
| الأفضل لـ | الفحوصات الحتمية المستندة إلى الكود              | حكام LLM، استدعاءات النماذج، الحزم، الأسرار، الوصول إلى الشبكة، المعالجة الثقيلة |

Python المستضاف متعمد الصغر: تعبير واحد، بدون استيرادات، بدون شبكة. أي شيء يتطلب نموذج — مثل حكم LLM يسجل ما إذا كانت الإجابة ذات صلة — يعمل في العامل الخاص بك بدلاً من ذلك. لا يحتاج أي من النوعين إلى اتصال واردة: يطالب العمال بالجلسات المنتهية ويقدمون النتائج عبر HTTPS الصادرة.

## كل منظمة تقيّم وكلاءها الخاصة

التقييمات تنتمي إلى المنظمة التي تحددها. تكتب كل منظمة في النسخة الخاصة بها — فحوصاتها الخاصة، وشروطها، وحدودها، وتسمياتها — وتصدر نسخًا وتنشرها دون التأثير على أي نسخة أخرى، وترى النتائج الخاصة بها فقط. صفّ تلك النتائج حسب الوكيل والبيئة والتقييم والوقت، أو اسأل المساعد عنها.

## من المسودة الأولى إلى الدرجات المباشرة

<Steps>
  <Step title="اكتبها">
    اشرح ما يجب قياسه واترك للمساعد صياغة مسودة، أو اكتبها بنفسك. انظر [كتابة التقييم](/ar/evaluations/write).
  </Step>

  <Step title="اختبرها">
    قم بتشغيلها على جلسات حقيقية قبل إطلاقها مباشرة؛ لا يتم حفظ أي شيء. انظر [اختبار التقييم](/ar/evaluations/test).
  </Step>

  <Step title="نشرها ورقم نسختها">
    انشر نسخة ثابتة، ونشر نسخًا جديدة مع تطورها، والعودة إلى نسخة سابقة. انظر [النشر والإصدار](/ar/evaluations/deploy).
  </Step>

  <Step title="اقرأ النتائج">
    مثّل الدرجات بيانيًا على مدار الوقت، وقارن بين الوكلاء والبيئات، واسأل المساعد. انظر [قراءة نتائج التقييم](/ar/sessions/evaluations).
  </Step>
</Steps>

التقييم يعمل للأمام: نسخة تم نشرها الآن تسجل الجلسات التي تنتهي من الآن فصاعدًا. لتسجيل الجلسات التي لديك بالفعل، [املأ الفجوات](/ar/evaluations/deploy#تسجيل-الجلسات-التي-لديك-بالفعل).
