
所有失败,自动为你收集
当 Agent 出错时,你不应该去滚动实时事件流,希望在红色行消失之前赶上它们。错误页面替你完成收集工作。它将仪表板中所有标红的内容汇聚到一个统一的分类界面,让你第一眼看到的是哪里出了问题,而不是去哪里找问题。 它捕获的不仅仅是显而易见的错误。除了明确的error 事件,Failproof AI Observability 还会浮现那些悄无声息的失败:任何携带失败信息的 tool_result、hook_completed 或 agent_end 都会出现在这里。某个工具返回了错误,或者某个 hook 异常退出,不会再因为没有抛出明显异常而悄悄溜走。
页面顶部有一个直方图,展示错误随时间的分布情况。一眼就能判断这是持续不断的背景噪音,还是几分钟前突然出现的峰值,让你立刻知道是否需要放下手头的事情。
与所有观测界面一样,错误页面的范围限定在你的组织内,并支持按日期范围、环境、Agent 和会话进行筛选。这意味着你可以从全量列表出发,快速缩小到你真正关心的某个 Agent 或某个环境。
一个事件,而非数百条相同的行
一个损坏的依赖项每分钟可能触发同一个错误数百次。如果原样呈现,那就是一堵近乎相同的日志墙,把真正需要关注的内容全部淹没。 Failproof AI Observability 会将同一会话内相同错误类型的重复失败折叠为一行。一次爆发读起来只是一个事件。你数的是问题,而不是日志行,真正重要的信号始终置顶,不会被自身的数量所淹没。从”某处出现红色”直达出错事件
点击任意一行,即可直接进入该运行对应的会话,并定位到出错的具体事件。无需复制会话 ID,无需滚动寻找出问题的那一刻:你会直接落在那里,完整的执行图一览即得,让你看清 Agent 在出错前的每一步操作。 如果你拥有alerts:write 权限,每一行还会显示一个 + alert 按钮。点击后,Observability 会打开一条新的告警规则,并预先填好匹配该失败的条件。你刚刚处理过的这个事件,会成为下次再次发生时通知你的那条规则,而不是让你再次被意外打到。
如何找到它:****错误页面位于仪表板观测区域,路径为 /<org-slug>/errors。

