> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 告警

> 检测问题复发并将事件路由至正确的响应人员。

告警监控可测量的条件，并在触发时创建事件。当某个故障需要及时响应时，无论策略是否能拦截，都应使用告警。

## 创建并测试告警

<Tabs>
  <Tab title="控制台">
    1. 前往 **Analyze → Alerts**，点击 **new alert**。也可以从某个典型错误的铃铛图标直接创建。
    2. 填写名称、严重级别、触发类型、条件、评估间隔、触发次数、时间窗口和通知渠道。
    3. 保存告警后，打开其详情页并运行 **test**。
    4. 前往 **Analyze → Issues**，对告警创建的事件执行确认、分配、讨论、订阅和解决操作。

    表单的第一部分用于标识告警及应触发它的信号。

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/alert-new-trigger.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=c54a28d895efc633ceb818d134d27bb5" alt="新建告警表单的第一部分，包含名称、描述、启用状态和触发类型。" width="1968" height="1510" data-path="images/dashboard/alert-new-trigger.png" />

    第二部分控制条件需持续多长时间、评估频率以及通知发送的目标。

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/alert-new-routing.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=a0789e823feaf0598395973da257c6c1" alt="新建告警表单的第二部分，包含触发逻辑、计划、严重级别、投递渠道和创建操作。" width="1904" height="1442" data-path="images/dashboard/alert-new-routing.png" />

    保存后，在告警列表中确认规则已启用，并核对其触发条件、时间窗口、严重级别和渠道是否符合预期。

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/alerts.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=b75f8c55c3f276cf3601c1b09d312560" alt="告警页面，展示告警规则及其触发条件、评估窗口、渠道和严重级别。" width="3200" height="2000" data-path="images/dashboard/alerts.png" />

    在将告警用于生产响应之前，请先对其进行测试。
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp alerts create high-errors \
      --trigger-kind metric_threshold \
      --severity warning \
      --trigger-spec '{"metric":"error_count","op":">","value":50,"window_secs":900}'

    fp alerts show high-errors
    fp alerts test high-errors
    fp alerts update high-errors --severity critical --yes
    ```

    使用 `fp alerts list` 查看规则，使用 `fp alerts delete <name>` 删除规则。

    完整的告警命令集请参阅 [`fp alerts` 参考文档](/zh/reference/cloud-cli#alerts)。
  </Tab>
</Tabs>

告警条件可基于错误、评估分数、评估组合或自定义 SQL。添加接收人、测试规则，并打开生成的事件进行确认、分配、评论、订阅和解决。

## 良好的告警设计原则

* 在名称中体现条件和受影响的工作流。
* 明确限定环境范围。
* 设置合理的时间窗口和阈值，避免对单次无害事件做出反应。
* 附上能引导响应人员定位会话的链接或查询。
* 在启用规则之前先指定负责人。

<Tip>
  在解决审计发现的问题后，针对策略覆盖范围之外可能再次发生的相同故障添加告警。
</Tip>
