Skip to main content
מעריך מקבל פעילות סוכן שהושלמה ומחזיר את אותות האיכות שחשובים לך: ניקוד מספרי, הסבר לכל ניקוד וסיכום אופציונלי. Failproof AI שומר את התוצאות הללו ליד ה-trace וממפה אותן על פני סוכנים וסביבות.

הגדר מעריך

1

התקן את Evaluator SDK

התקן את ה-SDK ואת השרת המשמש להפעלתו.
2

הגדר מה לדרג

צור evaluator.py. דוגמה זו בודקת אם פעילות מכילה קריאות כלים שנכשלו.
3

הפעל ובדוק באופן מקומי

הגדר טוקן משותף, הפעל את המעריך וודא שנקודת הקצה /health שלו מגיבה.
בטרמינל אחר:

חבר את המעריך ל-Failproof AI

  1. פרוס את המעריך ב-URL של HTTPS שניתן להגיע אליו מ-Failproof AI Cloud.
  2. הגדר את EVALUATOR_ENDPOINT עם ה-URL הזה והגדר את EVALUATOR_TOKEN לאותו טוקן שבו משתמש המעריך. עבור Cloud מנוהל, צור קשר עם support@befailproof.ai כדי להגדיר את החיבור.
  3. הפעל הערכה וודא שהניקוד שלה מופיע ב-Failproof AI.
פתח פעילות שהושלמה תחת Observe → Sessions ובחר Run evaluation אם היא לא הוערכה באופן אוטומטי. עיין בסטטוס, ניקוד, נימוקים וסיכום בפאנל Evaluation של הפעילות.השתמש ב-Observe → Evaluations כדי להשוות ניקוד על פני סוכנים או סביבות. השתמש ב-Observe → Metrics עבור עיכוב, עלות, טוקנים ומדידות מספריות אחרות.התחל עם פעילות אחת כדי לאשר שהמעריך החזיר את מקשי הניקוד הצפויים ונימוקים שימושיים לריצה ספציפית זו.תצוגה פרטית של פעילות המציגה ניקוד הערכה ונימוקים ליד ה-trace שלה.לאחר שתוצאות בודדות נראות נכונות, השתמש בלוח המחוונים של הערכה כדי להשוות ניקוד זה לאורך זמן ועל פני סוכנים או סביבות.לוח מחוונים איכות הממפה ניקוד מעריך לאורך זמן.תרשים בריא צריך להשתמש בשמות ניקוד יציבים; שינוי של מפתח יוצר סדרה נפרדת.
עבור instance Cloud המופעל בעצמך, הערכה אוטומטית מבוטלת עד ש-EVALUATOR_ENDPOINT מוגדר בתהליך השרת. הפעל מחדש את השרת לאחר שינוי משתני סביבה של המעריך. השירות חושף GET /health, GET /config, POST /evaluate ובאופן אופציונלי GET /evaluate/{job_id}. החזר JobPending לעבודה אסינכרונית וירשום @app.job_lookup כך ש-Failproof AI יוכל לסקור אותה. כאשר טוקן מוגדר, כל המסלולים מלבד health דורשים אותו bearer token שה-Failproof AI שולח כ-EVALUATOR_TOKEN.

סוגי SDK

דקורטורים ומסלולים

ה-SDK מגביל גופי בקשת הערכה ל-25 MiB. שדות בקשה לא ידועים מתעלמים כך ששירותים נשארים תואמים כאשר חוזה האירוע גדל.

החזרת עבודה אסינכרונית

השתמש ב-JobPending כאשר הערכה לא יכולה להסתיים בתוך בקשה אחת. מזהה המשימה אטום ל-Failproof AI וחייב להישאר ניתן להשגה על ידי השירות שלך עד שהתוצאה נאספת או פקיעת הזמן של השרת עוברת.
קדנציית סקירה נבחרת בסדר זה: JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, ואז EVALUATOR_POLLING_INTERVAL_SECS של השרת. ערכים מחובטים בין 1 שנייה ל-1 שעה. כובע הסקירה של קיר השעון של השרת הוא שעה אחת.

שדות בקשה והתגובה

הגדרות מפעיל שרת

הערכה אוטומטית היא בקנה מידה של פריסה ונשארת מבוטלת כאשר EVALUATOR_ENDPOINT חסר. השרת יכול גם להגביל אילו ארגונים משתמשים בהערכה הגלובלית של פריסה. התייחס לנקודת קצה, טוקן, ניסיון וארגון-שער כהגדרות מפעיל והפעל או גלוך את השרת לאחר שינויים.

אבטחה ותפעול

  • הצב את המעריך מאחורי HTTPS כאשר התעבורה חוצה גבול רשת מהימן.
  • הגדר bearer token לא ריק והשמור עליו זהה בשני השירותים.
  • אל תתעד את הטוקן או הודעות רגישות מלאות מגופי בקשה.
  • הפוך למנהלים סינכרוניים אידיומפוטנטי; ניסיונות חוזרים עשויים לחזור על בקשה.
  • הנח מצב עבודה אסינכרוני מחוץ לזיכרון התהליך בייצור.
  • החזר מקשי ניקוד יציבים. שינוי של מפתח יוצר סדרת תרשימים חדשה במקום לשנות את הישנה.
ה-SDK פולט יומנים מובנים של מחזור חיים כגון eval received, eval responded, job lookup, config returned, auth rejected ו-handler exceptions. הוא לא מגדיר מטפלי logging; השתמש בהגדרת logging של יישום המארח.