title: “مهارة وكيل Failproof AI Observability Evaluator” description: “انتقل من “أعتقد أن وكيلنا سيء أحياناً” إلى خدمة تقييم مُنتشرة، مع قيام وكيل البرمجة بكل من القرار والبناء.”
انتقل من “أعتقد أن وكيلنا سيء أحياناً” إلى خدمة تقييم مُنتشرة، مع قيام وكيل البرمجة بكل من القرار والبناء. مهارة Failproof AI Observability evaluator (agenteye-evaluator) هي مهارة وكيل: مجلد صغير من التعليمات يحمّله وكيل برمجة مثل Claude Code أو Codex عند الحاجة. تعلّم الوكيل كيفية تحديد أي أبعاد جودة تستحق التتبع لـ وكيلك، ثم كتابة واختبار ونشر خدمة المُقيّم التي تقيّمها.
إنها ليست محدد درجات مستضاف، ولا سجل تحمّل عليه، ولا نظام إضافات. يبقى المُقيّم خدمة HTTP خاصة بك على البنية الأساسية الخاصة بك، بالضبط كما هو موضح في دليل مجموعة التقييم. تعلّم المهارة وكيلك فقط ليبنيها بشكل جيد، لذلك كل ما تفعله يمكنك أن تفعله بنفسك بكتابة الكود ذاته.
الجزء الصعب هو تحديد ما يجب تقييمه
سطح SDK صغير — ديكوريتور ونموذجان — والوكيل يمكنه كتابة ذلك من العقد وحده. هذا ليس حيث يفشل المُقيّمون. يفشلون لأنهم يقيّمون الشيء الخطأ، والمُقيّم الذي يقيّم الشيء الخطأ أسوأ من لا شيء: فهو ينتج لوحة معلومات يتعلم الجميع تجاهلها. لذلك معظم المهارة هي الجزء قبل وجود أي كود. يحتوي على الوكيل الذي يقابلك (“اصف تشغيلاً سار بشكل جيد؛ الآن واحداً سار بشكل سيء”) ثم يسحب جلساتك الفعلية من خلالagenteye CLI ويقرأها من البداية إلى النهاية. هذان النصفان عادة ما يختلفان، والفجوة هي النقطة: ما تنوي قياسه مقابل ما يمكن لنصوصك فعلاً دعمه. يبقى البعد فقط إذا كان قابلاً للحساب من الأحداث وتمييزياً — إذا حقق 0.9 على جلستك الجيدة والسيئة معاً، فهو لا يعلم شيئاً ويتم حذفه.
ما يعود عليك هو اقتراح 2-4 أبعاد مع التفكير المرفق، لتصديق عليها قبل كتابة سطر واحد.
كيفية ارتباطها بأجزاء التقييم الأخرى
أربعة مستندات تغطي التقييم، وتسلمها لبعضها البعض بالترتيب:مقابل مهارة CLI: البناء مقابل القراءة
المهارتان متعمداً غير متداخلتان، والتثبيت كليهما هو الإعداد الطبيعي — يختار الوكيل بينهما بناءً على ما تطلبه:agenteye-evaluator(هذا المستند) يبني الشيء الذي ينتج الدرجات. تنتهي وظيفته عندما تهبط الدرجات للمرة الأولى.agenteye-cliيقرأ درجات موجودة بالفعل (agenteye evals). “هل انخفضت الجودة هذا الأسبوع؟” هو سؤاله، وليس سؤال هذه المهارة.
المتطلبات الأساسية
agenteyeCLI مثبت وقيد التسجيل (pipx install agenteye، ثمagenteye login). تعتمد المهارة عليها مرتين: لسحب الجلسات الفعلية التي تصممها، والتأكيد من أن درجاتك هبطت في النهاية. يحتاج تسجيلك إلىevents:read, بالإضافة إلىevaluations:readللتحقق النهائي. كما هو الحال مع مهارة CLI، لا يمكنها إكمال تسجيل دخول الرمز أحادي الاستخدام عبر البريد الإلكتروني نيابة عنك.- مكان للمُقيّم ليعيش فيه. يتم بناؤه في صورة ويعمل كخدمة طويلة الأجل، لذا فهو يحتاج إلى ريبو حقيقي، وليس ملف مؤقت. غالباً ما تعيش المُقيّمون في ريبو خاصة بهم، منفصلة عن الوكيل الذي يتم تقييمه — تبحث المهارة عن ريبو موجود وتطلب قبل إنشاء ريبو جديد.
- عجلة SDK
agenteye-evaluator— اقرأ القسم التالي قبل أن يبدأ وكيلك بكتابة أوامرpip.
أين تحصل عليها
تُنشر المهارة في مجموعة المهارات العامة في Failproof AI: github.com/FailproofAI/skills →skills/agenteye-evaluator/
المستودع عام والمهارة لا تحتاج إلى بيانات اعتماد خاصة بها — فهي فقط تشغيل agenteye CLI مع جلسة أنت قيد التسجيل، وتكتب كوداً في ريبوك الخاص. لاحظ أنها تُشحن كمجلد خاص بها وهي ليست داخل حزمة pipx install agenteye، لذا لا تبحث عنها هناك.
تثبيت المهارة
أسرع طريق هي CLIskills، الذي يحضر المجلد وينزله حيث يبحث وكيلك:
SKILL.md (بالإضافة إلى مراجع اختيارية)، لذا نسخه يعمل أيضاً:
- Claude Code: ضع مجلد
agenteye-evaluator/في~/.claude/skills/(كل مشروع) أو<your-repo>/.claude/skills/(هذا الريبو فقط). Claude Code يكتشفه تلقائياً — تحقق مع قائمة/skills، أو اطلب فقط تقييمات. - Codex (OpenAI): يقرأ Codex نفس
SKILL.md. يعيّنagents/openai.yamlالمرفقallow_implicit_invocation: true، لذا يختار Codex تلقائياً المهارة عندما تطابق المهمة؛ وإلا استدعِها بشكل صريح كـ$agenteye-evaluator.
SDK ليس على PyPI العام
تحذير: اقرأ هذا قبل السماح لوكيل بتثبيت SDK.المهارة عامة؛ SDK الذي تقوده ليس كذلك.
agenteye-evaluator يُشحن فقط كقطعة إصدار خاصة، وخلافاً لـ agenteye، الاسم غير مطالب به على PyPI العام — لذا pip install agenteye-evaluator بسيط قد يسحب حزمة شخص غريب إلى الخدمة التي تقرأ نصوصك الإنتاجية. هذه مشكلة سلسلة التوريد، وليست خطأ إملائي.
تعرف المهارة هذا وتعمل لأسفل سلم التثبيت بدلاً من ذلك، متوقفة عند أول درجة تنطبق: مصدر أحادي الريبو إذا كنت داخل ريبو AgentEye، وإلا عجلة الإصدار الخاصة من GitHub Releases (تحتاج إلى وصول)، وإذا لم تكن متاحة فإنها توقف وتخبرك بطلب عجلة من جهة Failproof AI الخاصة بك بدلاً من الارتجال.
لذا إذا اقترح وكيلك pip install agenteye-evaluator بسيطة من PyPI العام، هذا يشير إلى أن المهارة لم تحمّل أبداً. توقف هناك وتحقق من تثبيتها.
ما يمكنك طلبه
جولة ذهاب وإياب حقيقية تبدأ بطلب غامض وتنتهي بتصميم موقّع، وليس بكود:JobPending بدلاً من السماح لقاضيك بالإلغاء وإعادة المحاولة خمس مرات بخمسة أضعاف التكلفة.
ثم ينشر، يعيّن متغيري بيئة الخادم، ويؤكد مع agenteye --json evals --session-id <id> أن الدرجات هبطت فعلاً. هبوط الدرجات هو الدليل الوحيد.
ما يجب الانتباه له
- أسماء الأبعاد قريبة من الدائمة. مفاتيح الدرجات سلاسل اختيارية والمنصة تتجه أينما أرسلت، مما يعني لا شيء يصحح لاحقاً خياراً سيئاً. أعد التسمية لاحقاً وينقسم التاريخ: الجلسات القديمة تحتفظ بالمفتاح القديم وينقطع الاتجاه. هذا هو السبب في حصول المهارة على موافقة صريحة قبل كتابة الكود — خذ هذا الحث بجدية.
- الدعائم هي نصوص إنتاجية حقيقية. يعني التصميم مقابل جلسات حقيقية سحبها إلى الديسك، ويمكنها أن تحتوي بيانات العملاء. تطلب المهارة قبل التعهد بهم إلى git؛ إذا كنت غير متأكد، احفظ
fixtures/خارج الريبو وليترك كل مطور سحب الخاص به. - الوكيل يكتب وينشر خدمة تقرأ كل نص. يتصرف كأنك، محدود بأذونات تسجيل دخول CLI الخاصة بك، لكن مراجعة المُقيّم مثل أي كود آخر يلمس بيانات الإنتاج.
الخطوات التالية
- مجموعة التقييم: عقد HTTP، SDK، ومتغيرات بيئة الخادم التي تقوم المهارة بتكوينها.
- التقييمات: حيث تظهر الدرجات مرة تهبط.
- مهارة CLI: المهارة الشقيقة، لقراءة النتائج بدلاً من بناء المُقيّم.
- CLI: مرجع الأوامر خلف بيانات الجلسة التي تصممها المهارة.

