Skip to main content
评估器接收已完成的 Agent 会话,并返回您关注的质量信号:数值分数、每项分数的说明以及可选的摘要。Failproof AI 将这些结果与追踪记录一同存储,并在各 Agent 和环境之间进行图表化展示。

设置评估器

1

安装评估器 SDK

安装 SDK 及用于运行它的服务器。
2

定义评分内容

创建 evaluator.py。此示例检查会话中是否包含任何失败的工具调用。
3

在本地运行并测试

设置共享令牌,启动评估器,并确认其健康检查端点能正常响应。
在另一个终端中:

将评估器连接到 Failproof AI

  1. 将评估器部署在 Failproof AI Cloud 可访问的 HTTPS URL 上。
  2. 使用该 URL 配置 EVALUATOR_ENDPOINT,并将 EVALUATOR_TOKEN 设置为与评估器相同的令牌。对于托管 Cloud,请联系 support@befailproof.ai 配置连接。
  3. 运行评估并确认分数出现在 Failproof AI 中。
Observe → Sessions 下打开已完成的会话,如果未自动进行评估,请选择 Run evaluation。在会话的 Evaluation 面板中查看状态、分数、推理过程和摘要。使用 Observe → Evaluations 跨 Agent 或环境比较分数。使用 Observe → Metrics 查看延迟、费用、令牌及其他数值指标。从单个会话开始,确认评估器为该特定运行返回了预期的分数键和有用的推理内容。显示评估分数和推理过程(位于追踪记录旁边)的会话详情视图。当单个结果看起来正确后,使用评估仪表盘随时间推移以及跨 Agent 或环境比较这些分数。按时间绘制评估器分数的质量仪表盘。健康的图表应使用稳定的分数名称;更改键名会创建独立的数据系列。
对于自托管 Cloud 实例,在服务器进程上设置 EVALUATOR_ENDPOINT 之前,自动评估功能处于禁用状态。更改评估器环境变量后,请重启服务器。 该服务暴露 GET /healthGET /configPOST /evaluate,以及可选的 GET /evaluate/{job_id}。对于异步工作,返回 JobPending 并注册 @app.job_lookup,以便 Failproof AI 能够轮询它。 配置令牌后,除健康检查以外的所有路由均需要 Failproof AI 以 EVALUATOR_TOKEN 发送的同一 Bearer 令牌。

SDK 类型

装饰器与路由

SDK 将评估请求体大小上限设为 25 MiB。未知请求字段将被忽略,因此随着事件契约的扩展,服务仍能保持兼容性。

返回异步工作

当评估无法在单次请求内完成时,请使用 JobPending。Job ID 对 Failproof AI 而言是不透明的,在结果被收集或服务器超时到期之前,您的服务必须始终能够解析该 ID。
轮询频率按以下顺序确定:JobPending.next_poll_secsEvaluatorConfig.default_poll_interval_secs,然后是服务器的 EVALUATOR_POLLING_INTERVAL_SECS。取值范围限制在 1 秒到 1 小时之间。服务器默认的挂钟轮询上限为 1 小时。

请求与响应字段

服务器运维设置

自动评估为全部署范围生效,当 EVALUATOR_ENDPOINT 未设置时保持禁用状态。 服务器还可以限制哪些组织使用部署级全局评估器。请将端点、令牌、重试及组织访问控制的变更视为运维配置,更改后需重启或滚动更新服务器。

安全与运维

  • 当流量跨越受信网络边界时,请将评估器部署在 HTTPS 之后。
  • 配置非空 Bearer 令牌,并确保两个服务使用相同的令牌。
  • 不要在日志中记录令牌或请求载荷中的完整敏感提示词。
  • 使同步处理器具有幂等性;重试可能会重复发送请求。
  • 在生产环境中,将异步 Job 状态持久化到进程内存之外。
  • 保持分数键的稳定性。重命名键会创建新的图表系列,而不是修改旧的系列。
SDK 会发出结构化的生命周期日志,例如 eval receivedeval respondedjob lookupconfig returnedauth rejected 以及处理器异常信息。SDK 不配置日志处理器;请使用宿主应用的日志配置。