Skip to main content
Evaluator מקבל סשן agent שהושלם ומחזיר את אותות האיכות שחשובים לך: ניקוד מספרי, הסבר לכל ניקוד, וסיכום אופציונלי. Failproof AI שומר את התוצאות הללו לצד ה-trace וממציא אותן על פני agents וסביבות שונות.

הגדר evaluator

1

התקן את ה-SDK של ה-evaluator

התקן את ה-SDK ואת השרת המשמש להריצה שלו.
2

הגדר מה לדרג

צור evaluator.py. הדוגמה הזו בודקת האם סשן מכיל קריאות tool כושלות.
3

הרץ ובדוק מקומית

הגדר token משותף, התחל את ה-evaluator, וודא שendpoint ה-health שלו מגיב.
בטרמינל אחר:

חבר את ה-evaluator ל-Failproof AI

  1. פרוס את ה-evaluator ב-URL של HTTPS שנגיש עבור Failproof AI Cloud.
  2. הגדר את EVALUATOR_ENDPOINT עם ה-URL הזה וקבע את EVALUATOR_TOKEN לאותו token שמשמש את ה-evaluator. עבור Cloud מנוהל, צור קשר עם support@befailproof.ai כדי להגדיר את החיבור.
  3. הרץ הערכה וודא שהניקודים שלה מופיעים ב-Failproof AI.
פתח סשן שהושלם תחת Observe → Sessions ובחר Run evaluation אם הוא לא הוערך באופן אוטומטי. בדוק את ה-status, הניקודים, הנימוק והסיכום בלוח Evaluation של הסשן.השתמש ב-Observe → Evaluations כדי להשוות ניקודים על פני agents או סביבות שונות. השתמש ב-Observe → Metrics למדידות של latency, cost, token ואחרות מספריות.התחל עם סשן אחד כדי לודא שה-evaluator החזיר את מפתחות הניקוד הצפויים ונימוק שימושי עבור ריצה ספציפית זו.תצוגת פרטי סשן המציגה ניקודי הערכה ונימוק לצד ה-trace שלה.כאשר התוצאות הבודדות נראות נכונות, השתמש בדשבורד ההערכה כדי להשוות ניקודים אלה לאורך זמן ועל פני agents או סביבות שונות.דשבורד איכות שמציין ניקודי evaluator לאורך זמן.דיאגרמה בריאה צריכה להשתמש בשמות ניקוד יציבים; שינוי של מפתח יוצר סדרה נפרדת.
עבור instance Cloud בהוראה עצמית, הערכה אוטומטית מושבתת עד שקבעו EVALUATOR_ENDPOINT בתהליך השרת. הפעל מחדש את השרת לאחר שינוי משתני סביבה של evaluator. השירות חושף GET /health, GET /config, POST /evaluate, ואפשרות GET /evaluate/{job_id}. החזר JobPending עבור עבודה אסינכרונית והרשם @app.job_lookup כדי Failproof AI יוכל לבדוק אותה. כאשר token מוגדר, כל הנתיבים חוץ מ-health דורשים את אותו bearer token ש-Failproof AI שולח כ-EVALUATOR_TOKEN.

סוגי SDK

Decorators ונתיבים

ה-SDK מגביל גופי בקשות הערכה ל-25 MiB. שדות בקשה לא ידועים מתעלמים כך ששירותים נשארים תואמים כחוזה האירוע גדל.

החזר עבודה אסינכרונית

השתמש ב-JobPending כאשר הערכה לא יכולה להסתיים בתוך בקשה אחת. מזהה הJob אטום ל-Failproof AI וחייב להישאר ניתן לפתרון על ידי שירותך עד שהתוצאה נאספת או תוקף ה-timeout של השרת תפוג.
קדנציה של polling נבחרת בסדר זה: JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, ואז EVALUATOR_POLLING_INTERVAL_SECS של השרת. ערכים מחוברים בין שנייה אחת ושעה אחת. תקרת polling של wall-clock ברירת המחדל של השרת היא שעה אחת.

שדות בקשה ותגובה

הגדרות של מפעיל שרת

הערכה אוטומטית היא כל deployment וגם נשארת מושבתת כאשר EVALUATOR_ENDPOINT חסר. השרת יכול גם להגביל אילו ארגונים משתמשים ב-evaluator הגלובלי של deployment. התייחס לשינויים של endpoint, token, retry ו-organization-gate כהגדרת מפעיל והפעל מחדש או גלגול את השרת לאחר שינוי שלהם.

אבטחה ותפעול

  • הצב את ה-evaluator מאחורי HTTPS כאשר תעבור עוברת גבול של רשת מהימנה.
  • הגדר bearer token לא ריק ושמור על זהותו בשני השירותים.
  • אל תיומן את ה-token או prompts רגישים מלאים מגופי בקשות.
  • הגדר핸handlers סינכרוניים כ-idempotent; retries עלולים לחזור על בקשה.
  • המשך מצב עבודה אסינכרוני מחוץ לזיכרון תהליך בייצור.
  • החזר מפתחות ניקוד יציבים. שינוי שם של מפתח יוצר סדרה תרשים חדשה במקום שינוי של הישן.
ה-SDK פולט רישומי life-cycle מובנים כגון eval received, eval responded, job lookup, config returned, auth rejected, ויוצאים מ-handler. הוא לא מגדיר handlers של logging; השתמש בהגדרת הlogging של יישום ה-host.