Skip to main content
在一个地方查看 Agent 产生的所有失败,并按问题分组,让密集的错误爆发也只显示为一个问题。你可以一键从”某处出现红色”直接跳转到出错的具体运行,无需在实时日志流中上下翻找。 错误页面:顶部是失败次数随时间变化的直方图,下方是分组的红色错误行,每行右侧有一键"+ alert"按钮 错误页面:顶部是失败次数随时间变化的直方图,重复出现的失败会折叠为每个事件一行。

所有失败,自动为你收集

当 Agent 出错时,你不应该去滚动实时事件流,希望在红色行消失之前赶上它们。错误页面替你完成收集工作。它将仪表板中所有标红的内容汇聚到一个统一的分类界面,让你第一眼看到的是哪里出了问题,而不是去哪里找问题。 它捕获的不仅仅是显而易见的错误。除了明确的 error 事件,Failproof AI Observability 还会浮现那些悄无声息的失败:任何携带失败信息的 tool_resulthook_completedagent_end 都会出现在这里。某个工具返回了错误,或者某个 hook 异常退出,不会再因为没有抛出明显异常而悄悄溜走。 页面顶部有一个直方图,展示错误随时间的分布情况。一眼就能判断这是持续不断的背景噪音,还是几分钟前突然出现的峰值,让你立刻知道是否需要放下手头的事情。 与所有观测界面一样,错误页面的范围限定在你的组织内,并支持按日期范围、环境、Agent 和会话进行筛选。这意味着你可以从全量列表出发,快速缩小到你真正关心的某个 Agent 或某个环境。

一个事件,而非数百条相同的行

一个损坏的依赖项每分钟可能触发同一个错误数百次。如果原样呈现,那就是一堵近乎相同的日志墙,把真正需要关注的内容全部淹没。 Failproof AI Observability 会将同一会话内相同错误类型的重复失败折叠为一行。一次爆发读起来只是一个事件。你数的是问题,而不是日志行,真正重要的信号始终置顶,不会被自身的数量所淹没。

从”某处出现红色”直达出错事件

点击任意一行,即可直接进入该运行对应的会话,并定位到出错的具体事件。无需复制会话 ID,无需滚动寻找出问题的那一刻:你会直接落在那里,完整的执行图一览即得,让你看清 Agent 在出错前的每一步操作。 如果你拥有 alerts:write 权限,每一行还会显示一个 + alert 按钮。点击后,Observability 会打开一条新的告警规则,并预先填好匹配该失败的条件。你刚刚处理过的这个事件,会成为下次再次发生时通知你的那条规则,而不是让你再次被意外打到。 如何找到它:****错误页面位于仪表板观测区域,路径为 /<org-slug>/errors

相关内容

  • 告警:将任何失败转化为通知规则。
  • 事件:追踪一条已触发告警从开启到解决的全过程。
  • 会话:打开任意错误背后的完整运行记录。
  • 审计:让 Observability 自动为你发现运行中的失败模式。