Skip to main content
质量问题主动找上门,而不是等到用户投诉时你才得知。只需接入一次你自己的评分服务,Failproof AI Observability 就会自动对每一次完成的运行打分——帮助性下降或幻觉激增等问题会在用户察觉之前自动浮现。 Sessions 网格中的分数列:每次运行都带有评估状态标记,以及颜色编码的帮助性、真实性和工具效率徽章 Sessions 网格中的每次运行都携带其评分;红色、琥珀色和绿色徽章让问题运行一眼可见,无需打开任何一条记录。

告别手动抽样检查

过去你只能抽查少数几次运行,然后祈祷其余的没有问题。现在,每一次已完成的会话在结束的那一刻就会按你关心的维度自动评分:帮助性、工具效率、真实性、安全性,以及任何你设定的质量标准。你来定义评分键;Failproof AI Observability 负责存储、追踪并展示评估器返回的所有内容。没有任何运行会漏掉评分,你也不必再从支持工单里得知回归问题。 评分会随着会话展示在 /<org-slug>/sessions 的 Sessions 网格上(侧边栏 → observesessions),每行一组徽章簇。只想查看表现不达标的运行?按分数范围筛选,比如帮助性低于 0.5,精准定位值得深入阅读的运行。查看评分需要 evaluations:read 权限。

了解运行低分的原因

数字告诉你某次运行表现不佳;会话页面则告诉你原因。打开任意一次运行,右侧面板首先显示总体摘要,随后按维度展示评分条,每条下方附有评估器自身的推理说明——让你在几秒内从”真实性评分 0.4”定位到具体出错的那个论断。 会话的右侧面板:顶部是评估摘要,下方是各维度评分条及各条推理说明,旁边是完整的事件时间线 会话详情视图:摘要、各维度评分条,以及每项评分背后的推理说明,与运行事件时间线并排显示。 部署了更精准的评估器,或者遇到运行在评分前崩溃的情况?重新评估按钮(需要 evaluations:trigger 权限)可以就地对会话重新评分,并将最新结果追加到其时间线中,此前的评分作为历史记录仍然可见。你可以在 /<org-slug>/sessions/<session-id> 找到该按钮。

监控整个队列的质量趋势

单次运行低分是噪声;整个批次下滑才是信号。已保存的仪表板将你的评分转化为可一目了然的趋势:本周与上周的平均帮助性对比,按 Agent、按环境分别呈现。 质量仪表板:各评估维度的平均分柱状图,以及时间趋势折线 已保存的质量仪表板展示你关注的评分键趋势,让缓慢的下滑在演变为事故之前早早显现。 仪表板位于 /<org-slug>/dashboards(侧边栏 → analyzedashboards),在整个组织内共享。每张卡片汇总对应的会话数据:运行数量、每个关注评分的平均值,以及趋势迷你折线图。点击”在 Sessions 中打开”可直接跳转到任意数字背后已预筛选的运行列表。查看需要 dashboards:readevaluations:read 权限。

一次接入评估器

评分功能为可选项,在你将 Failproof AI Observability 指向一个评分服务之前,始终保持关闭状态。你只需搭建一个小型 HTTP 服务(Observability 提供了一个可直接复制的参考实现),在服务器上设置两个值,此后每次运行都会自动获得评分。完整操作指南、评分契约和 SDK 详见深度指南。 不确定该从哪些维度开始评分?评估器 Agent 技能可以让你的编码 Agent 结合你自己的会话数据找出答案,然后构建并部署该服务。

相关内容

  • 评估套件:接入评估器、评分契约与 SDK。
  • 评估器 Agent 技能:让编码 Agent 选定评分维度并构建评估器。
  • Sessions:展示评分的逐次运行网格。
  • 仪表板:在组织内保存并共享质量趋势。
  • 审计:Observability 的另一项自动质量功能,用于跨会话调查。