Skip to main content
评估会对已完成的 Agent 会话进行评分。当会话结束时,所有适用于该会话且已启用的评估都会运行,并将结果记录下来,您可以在追踪记录旁边读取相应的推理过程:
  • 分数:0 到 1 之间,可选标记为通过或未通过
  • 指标:如计数、时长或成本,附带其单位
  • 断言:通过或未通过

两种评估器

托管 Python 有意保持精简:仅支持单个表达式,无法导入模块,无法访问网络。任何需要调用模型的场景——例如用 LLM 评判器判断答案是否相关——都应改为在您自己的 Worker 中运行。两种方式都不需要入站连接:Worker 主动拉取已完成的会话,并通过出站 HTTPS 提交结果。

每个组织独立评估自己的 Agent

评估归定义它的组织所有。实例上的每个组织独立编写自己的评估——包括检查逻辑、条件、阈值和标签——可以独立进行版本管理和部署,不会影响其他组织,也只能查看自己的结果。您可以按 Agent、环境、评估和时间筛选结果,也可以直接向助手提问。

从初稿到上线评分

1

编写评估

描述要衡量的内容,让助手帮您起草,或者自行编写。参见编写评估
2

测试评估

在正式上线前对真实会话进行测试,测试结果不会被存储。参见测试评估
3

部署与版本管理

部署不可变版本,随着评估的演进发布新版本,并可回滚到之前的版本。参见部署与版本管理
4

查看结果

查看分数随时间的变化趋势,比较不同 Agent 和环境的表现,并向助手提问。参见查看评估结果
评估按时间顺序向前执行:现在部署的版本将对从此刻起完成的会话进行评分。如需对已有的历史会话评分,请进行回填