
Saiba dos problemas antes dos seus usuários
Pare de ficar atualizando um dashboard na esperança de capturar uma regressão. Use um alerta sempre que houver um sinal que você precisaria saber mesmo quando ninguém está olhando, e receba-o onde você já está:- E-mail, para quem precisa saber.
- Slack, uma mensagem rica com um botão que vai direto ao incidente.
- Webhook, um POST JSON para PagerDuty, Opsgenie ou seu próprio endpoint, com uma assinatura opcional para que o receptor possa confiar nele.
- No dashboard, discreto por design, para quando você está ajustando uma regra e ainda não quer notificar ninguém.
Monte a regra em um formulário, não em JSON
Você descreve o que “quebrado” significa em um formulário, e a Observabilidade do Failproof AI escreve a regra subjacente para você. A especificação JSON é apenas o que esse formulário produz nos bastidores, então você pode lê-la para entender uma regra, mas raramente precisa digitá-la.
Já está olhando para uma falha na página de Erros? Cada linha lá tem um botão + alerta que abre esse mesmo formulário preenchido para capturar exatamente aquela falha novamente, de modo que o incidente que você acabou de triar se torna o próximo a te notificar.
Onde encontrar: Os alertas ficam em
/<org-slug>/alerts. Criar, editar, excluir e testar regras requer alerts:write; alerts:read é suficiente para visualizar. O seletor de destinatários lista os membros da sua organização por nome, para que você possa notificar uma pessoa sem sair do formulário.
Notifique-me apenas quando for real
Uma medição ruim não deveria te acordar. O filtro de ruído M de N controla quantas das últimas verificações precisam falhar antes que o alerta realmente te notifique. Defina como 3 de 5 e a regra só dispara após ter ultrapassado o limite em três das últimas cinco verificações, evitando que um sinal instável gere alarmes falsos; deixe no padrão 1 de 1 para disparar na primeira violação. Você também escolhe com que frequência a regra é executada, a partir de predefinições de 1m, 5m, 15m e 1h, adequadas à velocidade com que o sinal realmente se move.O que acontece quando um alerta dispara
Uma violação abre um incidente e notifica seus canais uma vez. A partir daí, sua equipe confirma o recebimento, atribui um responsável, discute o problema e o resolve, tudo contra um registro limpo e atribuído. Esse fluxo de triagem tem seu próprio espaço: veja Incidentes.Relacionados
- Incidentes: acompanhe um alerta disparado do estado aberto ao confirmado e ao resolvido.
- Rastreamento de erros: agrupe falhas de agentes e promova uma delas a um alerta com um clique.
- Dashboards: monitore os painéis compartilhados de onde vêm os limites que você alerta.
- CLI e agentes: crie alertas e confirme incidentes pelo terminal, ou automatize-os no CI.

