
Узнайте о проблемах прежде, чем о них узнают пользователи
Прекратите обновлять панель управления в надежде поймать регрессию. Установите оповещение для любого сигнала, о котором вы хотели бы узнать даже когда никто не смотрит, и доставьте его туда, где уже находится ваша команда:- По электронной почте тем, кому нужно знать.
- В Slack с расширенным сообщением и кнопкой, которая прямо переводит на инцидент.
- По webhook в виде JSON POST для PagerDuty, Opsgenie или собственной конечной точки с опциональной сигнатурой, чтобы получатель мог доверять источнику.
- В панели управления — по умолчанию без уведомлений для тех случаев, когда вы настраиваете правило и еще не хотите никого беспокоить.
Создавайте правило в форме, а не в JSON
Вы описываете, что означает «сбой», в форме, а Failproof AI Observability создает базовое правило за вас. JSON спецификация — это просто то, что создает эта форма под капотом, поэтому вы можете его прочитать, чтобы понять правило, но редко вводите его вручную.
Уже смотрите на сбой на странице Ошибок? Каждая строка там имеет кнопку + оповещение, которая открывает эту же форму предварительно заполненную, чтобы поймать эту точную ошибку снова, так что инцидент, который вы только что разобрали, станет тем, который вас предупредит в следующий раз.
Где это найти: Оповещения находятся по адресу
/<org-slug>/alerts. Создание, редактирование, удаление и тестирование правил требует alerts:write; alerts:read достаточно для просмотра. Выбор получателя показывает членов вашей организации по имени, поэтому вы можете отправить уведомление человеку, не выходя из формы.
Уведомляй меня только когда это действительно важно
Одно плохое измерение не должно вас будить. Фильтр шума M из N контролирует, сколько из последних нескольких проверок должны не пройти, прежде чем оповещение действительно вас уведомит. Установите его на 3 из 5, и правило срабатывает только после того, как оно нарушено в трех из последних пяти проверок, так что дрожащий сигнал прекращает ложные тревоги; оставьте значение по умолчанию 1 из 1, чтобы срабатывать при первом нарушении. Вы также выбираете, как часто запускается правило, из предустановок 1m, 5m, 15m и 1h, подобранных в соответствии с тем, насколько быстро движется сигнал.Что происходит, когда срабатывает оповещение
Нарушение открывает инцидент и уведомляет ваши каналы один раз. После этого ваша команда подтверждает его, назначает владельца, обсуждает и разрешает, все с чистой атрибутированной записью. Этот рабочий процесс сортировки имеет свой собственный дом: см. Инциденты.Связанное
- Инциденты: отслеживайте срабатывающее оповещение от открытия до подтверждения до разрешения.
- Отслеживание ошибок: группируйте ошибки агентов и повысьте одну до оповещения в один клик.
- Панели управления: смотрите общие доски, из которых берутся пороги, для которых вы устанавливаете оповещения.
- CLI и агенты: создавайте оповещения и подтверждайте инциденты из терминала, или встраивайте их в CI.

