Skip to main content
التقييمات المستضافة عبارة عن أكواد Python صغيرة وحتمية، مكتوبة في لوحة التحكم وتعمل على أسطول تقييم Failproof AI. المنطق الأثقل — حكم LLM، أو حزمة، أو سر، أو استدعاء شبكة — يعمل في عاملك الخاص بدلاً من ذلك.

صغه من وصف

  1. اذهب إلى Analyze → eval authoring واختر new eval.
  2. صف ما تريد قياسه بالإنجليزية العادية، أو اختر من start from an example…، ثم اختر draft.
  3. راجع الحقول والكود الذي يملأها، ثم اختبره وانشره.
صفحة تأليف التقييم مع تقييم مسودة: الوصف، وملاحظات المساعد حول المسودة، واسم وأساس ونسخة ونتيجة وانقطاع وتسميات وشروط الحقول. المسودة مبنية على الأحداث الخاصة بمؤسستك: تقرأ الصفحة مفاتيح الحمولة التي حملتها جلساتك على مدار السبعة أيام الماضية، لذا يقرأ الكود المفاتيح الموجودة بدلاً من التخمين. قبل تسليم المسودة، يختبرها المساعد مقابل ما يصل إلى خمس من جلساتك الأخيرة، ويصلح كل ما يمكنه إثبات أنه معطوب — لمدة تصل إلى ثلاث جولات — وفحص مرة واحدة أن الكود يقيس ما طلبته. احتفظ بالوصف محددًا: الطلبات العامة أبطأ ويمكن أن تنقطع. راجع الكود على أي حال؛ النشر لا يتم حظره أبدًا.

تعيين الحقول

استخدم الشرط لتحديد نطاق التقييم للعوامل والبيئات المخصصة له:
المفتاح والإصدار ونوع النتيجة والشرط والكود ثابتة بمجرد النشر: لتغيير أي منها، انشر إصدارًا جديدًا. الاسم والتسميات وما إذا كانت مفعلة تبقى قابلة للتعديل.

اكتب الكود بنفسك

كود المقيّم هو تعبير Python واحد يُرجع EvalResult(...)، مع وجود session في النطاق. هذا الواحد يسجل حصة نتائج الأداة التي عادت بشكل صحيح:
تبدأ النتيجة بمفتاح التقييم الخاص به، في نوعه المعلن: score= لتقييم النقاط، أو إدخال metrics أو assertions باسم المفتاح لتقييم متري أو مؤكدة. تأتي المقاييس والمؤكدات الأخرى معها، حتى 25 نتيجة في التشغيل. لا شيء آخر قابل للوصول: لا استيراد، ولا سمات تتجاوز بيانات الجلسة وطرق السلسلة والقاموس البسيطة مثل get وlower وsplit، والتي يجب استدعاؤها بدلاً من الإشارة إليها. مفاتيح الحمولة هي كل ما يرسله وكلاء عملك — status أعلاه مثال فقط — لذا اقرأها من جلسة حقيقية. format يرتب الكود وfix يطلب من المساعد إصلاحه. يمكن أن يكون الكود حتى 128 KiB، والشرط حتى 16 KiB. محرر كود المقيّم، مع format و fix، يعرض التأكيدات لتقييم مسودة.

اكتبه في عاملك الخاص

عندما يحتاج التقييم إلى نموذج أو حزمة أو سر أو شبكة، اكتبه باستخدام Evaluator SDK وشغّله على البنية التحتية الخاصة بك. يستخدم نفس أنواع النتائج، وتظهر نتائجه بجانب النتائج المستضافة، موسومة customer: