failproofai-sdk، تحت failproofai_sdk.evaluator؛ استيراد SDK التتبع لا يحمّله.
اكتب التقييمات
@app.eval(key, version=...)يسجّل تقييماً. المفتاح هو ما تتخطط نتائجه تحته؛ غيّر الإصدار كلما تغيرت المنطق، وكل نتيجة تحتفظ بالإصدار الذي أنتجها. عامل واحد يحمل ما يصل إلى 100 تقييم.result_kindهو"score"ما لم تقل خلاف ذلك. للتقييم"metric"أو"assertion"، سمّ إدخالmetricsأوassertionsواحد باسم المفتاح: هذا الإدخال هو نتيجته.whenيقرر ما إذا كانت جلسة قابلة للتطبيق. أرجعConditionResult(False, "<reason>")لتخطي واحدة، والسبب يتم تسجيله.- يمكن أن يكون التقييم دالة عادية أو
async، وtimeout_secondsيحدده. - مفاتيح الحمل الجديد —
tool_nameوresponseوcontentأعلاه — هي ما ترسله وكلاؤك، لذا اقرأها من جلسة حقيقية.
شغّل العامل
ضع مفتاحاً بإذنevaluations:run، تم إنشاؤه تحت Administration → Keys، في FAILPROOFAI_EVALUATOR_TOKEN — اضبطه من متجر الأسرار بدلاً من كتابته في أمر — وابدأ العامل:
__main__، python -m failproofai_sdk.evaluator evaluator:app يفعل الشيء نفسه.
أنواع النتائج
يحمل
EvalResult على الأقل درجة واحدة أو متري أو تأكيد، وبحد أقصى 25، كل واحد تحت مفتاح فريد.
الجلسة
يحمل كل حدث
id و ts و event_type و payload.
مقيّم الإرث
يتم إيقاف Evaluator SDK السابق — خدمة HTTP استدعاها Failproof AI علىEVALUATOR_ENDPOINT، والإجابة على /evaluate والتحقيق من خلال JobPending —. قم ببناء مقيّمين جدد على هذا العامل؛ يمكن لمشغلي مثيل ذاتي الاستضافة الذي يقوم بتشغيل خدمة قديمة أن يحتفظوا بها خلال الانتقال.
