Skip to main content
גלה ברגע שמשהו חוצה את הגבול שלך, בערוץ שהצוות שלך כבר צופה בו, במקום לשמוע על זה מלקוח. הגדר כלל פעם אחת ו-Failproof AI Observability בודק אותו לפי לוח זמנים, ואז שולח לך התראה בדוא”ל, Slack, webhook, או ישירות בלוח הבקרה. עמוד ההתראות: רשת של כרטיסי כללי התראה, כל אחד מציג את ההגדרה שלו, חלון ההערכה, ערוצים, ותג חומרה של מידע, אזהרה או קריטי כל כלל התראה בהצצה: מה הוא מוקד, בכמה תדירות, לאן זה שולח התראות, ועד כמה זה דחוף.

קבל ידיעה על בעיות לפני המשתמשים שלך

הפסק להחדש את לוח הבקרה בתקווה לתפוס רגרסיה. השתמש בהתראה בכל פעם שיש אות שתרצה לשמוע עליה גם כשאף אחד לא מביט, והנח אותה במקום שבו אתה כבר נמצא:
  • דוא”ל, למי שצריך לדעת.
  • Slack, הודעה עשירה עם כפתור שקופץ ישר לתקרית.
  • Webhook, JSON POST ל-PagerDuty, Opsgenie, או לנקודת הקצה שלך, עם חתימה אופציונלית כדי שהמקבל יוכל לסמוך עליה.
  • בלוח הבקרה, שקט בעיצוב, כשאתה מכוונן כלל ולא רוצה עדיין להתריע לאיש.
צרף כל שילוב לכלל יחיד, וחומרתו (מידע, אזהרה או קריטי) נשארת עם זה כדי שהחשוב נראה חשוב.

בנה את הכלל בטופס, לא ב-JSON

אתה מתאר מה “שבור” אומר בטופס, ו-Failproof AI Observability כותב את הכלל הבסיסי בשבילך. מפרט ה-JSON הוא רק מה שהטופס הזה מייצר בעמקי המערכת, כך שאתה יכול לקרוא אותו כדי להבין כלל אבל בדרך כלל לא תקליד אותו. טופס ההתראה החדשה: שם ותיאור, כפתור הפעלה, ובוררי הגדרה המציעים סף מטרי, SQL מותאם אישית, ציון הערכה, eval מורכב, ותנאים לכל אירוע בחר הגדרה והטופס מחליף לשדות הנכונים; שמור כותב את הכלל. הנתיב הטוב הוא מהיר: תן לו שם, בחר הגדרה (מה לצפות בו), קבע סף וחלון (כמה רע, על פני כמה זמן), צרף לפחות ערוץ אחד, ואז שמור ולחץ על בדיקה כדי לשלוח התראה סינתטית ולאשר שכל יעד חוברה. בעמקי המערכת זה יוצר spec קטן כמו:
אתה לא מוגבל לסוג אות אחד. בחר בהגדרה שמתאימה לאופן שבו אתה חושב על הכשל: כבר בעיניים על כשל בעמוד ה-Errors? כל שורה שם יש לה כפתור + alert שפותח את אותו טופס עם מילוי מראש כדי לתפוס את הכשל המדויק הזה שוב, כך שהתקרית שזה עתה טיפלת בה הופכת לאחד שישדר לך בפעם הבאה. איפה למצוא אותו: התראות נמצאות ב-/<org-slug>/alerts. יצירה, עריכה, מחיקה, ובדיקת כללים דורשים alerts:write; alerts:read מספיק להסתכלות. בוררי הנמענה מפרטים את חברי הארגון שלך בשם, כך שתוכל להתריע לאדם מבלי להשאיר את הטופס.

התריע אותי רק כשזה אמיתי

מדידה רעה אחת לא צריכה להעיר אותך. מסנן הרעש M של N שולט בכמה מהבדיקות האחרונות החייבות להיכשל לפני שההתראה בעצם משדרת אותך. קבע אותו ל-3 מ-5 והכלל משדר רק לאחר שהוא חרג שלוש מחמש הבדיקות האחרונות שלו, כך שאות רועד מפסיק לבכות לזئב; השאר את ברירת המחדל 1 מ-1 כדי להשדר על החרגה הראשונה. אתה גם בוחר כמה לעתים קרובות הכלל פועל, מערכות הגדרות של 1m, 5m, 15m, ו-1h, תואמות לאופן שהאות באמת זז.

מה קורה כשהתראה משדרת

הפרה פותחת תקרית ומשדרת את הערוצים שלך פעם אחת. משם הצוות שלך מכיר בה, מקצה בעלים, דן בה, ופותר אותה, הכל מול רקורד נקי ומיוחסו. לזרימת העבודה של טריאז ‘הזו יש בית משלו: ראה Incidents.

קשור

  • Incidents: עקוב אחר התראה משדרת מפתח לממומנע לנפתר.
  • Error tracking: קבץ כשלי agent והעלה אחד להתראה בלחיצה.
  • Dashboards: צפה בלוחות המשותפים שהספים שאתה משדר עליהם מגיעים מהם.
  • CLI and agents: צור התראות וack תקריות מהטרמינל שלך, או script אותן ל-CI.