
告别手动抽样检查
过去你只能抽查少数几次运行,然后祈祷其余的没有问题。现在,每一次已完成的会话在结束的那一刻就会按你关心的维度自动评分:帮助性、工具效率、真实性、安全性,以及任何你设定的质量标准。你来定义评分键;Failproof AI Observability 负责存储、追踪并展示评估器返回的所有内容。没有任何运行会漏掉评分,你也不必再从支持工单里得知回归问题。 评分会随着会话展示在/<org-slug>/sessions 的 Sessions 网格上(侧边栏 → observe → sessions),每行一组徽章簇。只想查看表现不达标的运行?按分数范围筛选,比如帮助性低于 0.5,精准定位值得深入阅读的运行。查看评分需要 evaluations:read 权限。
了解运行低分的原因
数字告诉你某次运行表现不佳;会话页面则告诉你原因。打开任意一次运行,右侧面板首先显示总体摘要,随后按维度展示评分条,每条下方附有评估器自身的推理说明——让你在几秒内从”真实性评分 0.4”定位到具体出错的那个论断。
evaluations:trigger 权限)可以就地对会话重新评分,并将最新结果追加到其时间线中,此前的评分作为历史记录仍然可见。你可以在 /<org-slug>/sessions/<session-id> 找到该按钮。
监控整个队列的质量趋势
单次运行低分是噪声;整个批次下滑才是信号。已保存的仪表板将你的评分转化为可一目了然的趋势:本周与上周的平均帮助性对比,按 Agent、按环境分别呈现。
/<org-slug>/dashboards(侧边栏 → analyze → dashboards),在整个组织内共享。每张卡片汇总对应的会话数据:运行数量、每个关注评分的平均值,以及趋势迷你折线图。点击”在 Sessions 中打开”可直接跳转到任意数字背后已预筛选的运行列表。查看需要 dashboards:read 和 evaluations:read 权限。
一次接入评估器
评分功能为可选项,在你将 Failproof AI Observability 指向一个评分服务之前,始终保持关闭状态。你只需搭建一个小型 HTTP 服务(Observability 提供了一个可直接复制的参考实现),在服务器上设置两个值,此后每次运行都会自动获得评分。完整操作指南、评分契约和 SDK 详见深度指南。 不确定该从哪些维度开始评分?评估器 Agent 技能可以让你的编码 Agent 结合你自己的会话数据找出答案,然后构建并部署该服务。相关内容
- 评估套件:接入评估器、评分契约与 SDK。
- 评估器 Agent 技能:让编码 Agent 选定评分维度并构建评估器。
- Sessions:展示评分的逐次运行网格。
- 仪表板:在组织内保存并共享质量趋势。
- 审计:Observability 的另一项自动质量功能,用于跨会话调查。

