- 分数:0 到 1 之间,可选标记为通过或未通过
- 指标:如计数、时长或成本,附带其单位
- 断言:通过或未通过
两种评估器
托管 Python 有意保持精简:仅支持单个表达式,无法导入模块,无法访问网络。任何需要调用模型的场景——例如用 LLM 评判器判断答案是否相关——都应改为在您自己的 Worker 中运行。两种方式都不需要入站连接:Worker 主动拉取已完成的会话,并通过出站 HTTPS 提交结果。
每个组织独立评估自己的 Agent
评估归定义它的组织所有。实例上的每个组织独立编写自己的评估——包括检查逻辑、条件、阈值和标签——可以独立进行版本管理和部署,不会影响其他组织,也只能查看自己的结果。您可以按 Agent、环境、评估和时间筛选结果,也可以直接向助手提问。从初稿到上线评分
1
编写评估
描述要衡量的内容,让助手帮您起草,或者自行编写。参见编写评估。
2
测试评估
在正式上线前对真实会话进行测试,测试结果不会被存储。参见测试评估。
3
部署与版本管理
部署不可变版本,随着评估的演进发布新版本,并可回滚到之前的版本。参见部署与版本管理。
4
查看结果
查看分数随时间的变化趋势,比较不同 Agent 和环境的表现,并向助手提问。参见查看评估结果。

