
קבל ידיעה על בעיות לפני המשתמשים שלך
הפסק להחדש את לוח הבקרה בתקווה לתפוס רגרסיה. השתמש בהתראה בכל פעם שיש אות שתרצה לשמוע עליה גם כשאף אחד לא מביט, והנח אותה במקום שבו אתה כבר נמצא:- דוא”ל, למי שצריך לדעת.
- Slack, הודעה עשירה עם כפתור שקופץ ישר לתקרית.
- Webhook, JSON POST ל-PagerDuty, Opsgenie, או לנקודת הקצה שלך, עם חתימה אופציונלית כדי שהמקבל יוכל לסמוך עליה.
- בלוח הבקרה, שקט בעיצוב, כשאתה מכוונן כלל ולא רוצה עדיין להתריע לאיש.
בנה את הכלל בטופס, לא ב-JSON
אתה מתאר מה “שבור” אומר בטופס, ו-Failproof AI Observability כותב את הכלל הבסיסי בשבילך. מפרט ה-JSON הוא רק מה שהטופס הזה מייצר בעמקי המערכת, כך שאתה יכול לקרוא אותו כדי להבין כלל אבל בדרך כלל לא תקליד אותו.
כבר בעיניים על כשל בעמוד ה-Errors? כל שורה שם יש לה כפתור + alert שפותח את אותו טופס עם מילוי מראש כדי לתפוס את הכשל המדויק הזה שוב, כך שהתקרית שזה עתה טיפלת בה הופכת לאחד שישדר לך בפעם הבאה.
איפה למצוא אותו: התראות נמצאות ב-
/<org-slug>/alerts. יצירה, עריכה, מחיקה, ובדיקת כללים דורשים alerts:write; alerts:read מספיק להסתכלות. בוררי הנמענה מפרטים את חברי הארגון שלך בשם, כך שתוכל להתריע לאדם מבלי להשאיר את הטופס.
התריע אותי רק כשזה אמיתי
מדידה רעה אחת לא צריכה להעיר אותך. מסנן הרעש M של N שולט בכמה מהבדיקות האחרונות החייבות להיכשל לפני שההתראה בעצם משדרת אותך. קבע אותו ל-3 מ-5 והכלל משדר רק לאחר שהוא חרג שלוש מחמש הבדיקות האחרונות שלו, כך שאות רועד מפסיק לבכות לזئב; השאר את ברירת המחדל 1 מ-1 כדי להשדר על החרגה הראשונה. אתה גם בוחר כמה לעתים קרובות הכלל פועל, מערכות הגדרות של 1m, 5m, 15m, ו-1h, תואמות לאופן שהאות באמת זז.מה קורה כשהתראה משדרת
הפרה פותחת תקרית ומשדרת את הערוצים שלך פעם אחת. משם הצוות שלך מכיר בה, מקצה בעלים, דן בה, ופותר אותה, הכל מול רקורד נקי ומיוחסו. לזרימת העבודה של טריאז ‘הזו יש בית משלו: ראה Incidents.קשור
- Incidents: עקוב אחר התראה משדרת מפתח לממומנע לנפתר.
- Error tracking: קבץ כשלי agent והעלה אחד להתראה בלחיצה.
- Dashboards: צפה בלוחות המשותפים שהספים שאתה משדר עליהם מגיעים מהם.
- CLI and agents: צור התראות וack תקריות מהטרמינל שלך, או script אותן ל-CI.

