failproofai-sdk, תחת failproofai_sdk.evaluator; ייבוא ה-tracing SDK אינו טוען אותו.
כתיבת הערכות
@app.eval(key, version=...)רושם הערכה. המפתח הוא מה שתוצאותיו מתרשמות תחתיו; שנה את הגרסה בכל פעם שהלוגיקה משתנה, וכל תוצאה שומרת את הגרסה שיצרה אותה. תהליך אחד מחזיק עד 100 הערכות.result_kindהוא"score"אלא אם ציינת אחרת. להערכת"metric"או"assertion", תן לרשומה אחתmetricsאוassertionsאחרי המפתח: הרשומה הזו היא התוצאה שלה.whenמחליט האם סשן חל. החזרConditionResult(False, "<reason>")כדי לדלג על אחד, והסיבה נרשמת.- הערכה יכולה להיות פונקציה רגילה או
async, ו-timeout_secondsמקשרת אותה. - מפתחות עומס —
tool_name,responseו-contentלמעלה — הם מה שהאג’נטים שלך שולחים, אז קרא אותם מסשן אמיתי.
הפעלת התהליך
שים מפתח עם הרשאתevaluations:run, שנוצר תחת Administration → Keys, ב-FAILPROOFAI_EVALUATOR_TOKEN — הגדר אותו מחנות הסודות שלך ולא הקלד אותו לפקודה — והתחל את התהליך:
__main__, python -m failproofai_sdk.evaluator evaluator:app עושה את אותו הדבר.
סוגי תוצאה
EvalResult נושא לפחות ניקוד, מדד או טענה אחת, ולכל היותר 25, כל אחד תחת מפתח ייחודי.
הסשן
כל אירוע נושא
id, ts, event_type ו-payload.
מעריך המורשת
ה-Evaluator SDK המוקדם — שירות HTTP שFailproof AI קרא ל-EVALUATOR_ENDPOINT, מענה ל-/evaluate ובדק דרך JobPending — הוא פרוש. בנה מעריכים חדשים בתהליך זה; מפעילים של מופע מתארח עצמי המריץ שירות מורשה יכול להשמור עליו דרך המעבר.
