从描述起草
- 前往 Analyze → eval authoring,选择 new eval。
- 用自然语言描述要衡量的内容,或从 start from an example… 中选择,然后点击 draft。
- 检查各字段和生成的代码,然后测试并部署。

设置字段
使用 condition 将评估限定到目标 agent 和环境:
自己编写代码
evaluator code 是一个返回EvalResult(...) 的 Python 表达式,作用域内包含 session。以下示例对状态为 ok 的工具调用结果占比进行评分:
score=,metric 或 assertion 类评估则在 metrics 或 assertions 中使用以该键命名的条目。其他指标和断言可附带其中,每次运行最多 25 个结果。
除此之外均不可访问:不允许 import,也不能访问超出会话数据以及
get、lower、split 等普通字符串和字典方法的属性(这些方法必须被调用,而非仅引用)。Payload 键取决于您的 agent 发送的内容——上面的 status 仅为示例——因此请从真实会话中读取。format 可整理代码格式,fix 可让助手修复代码。代码最大 128 KiB,条件最大 16 KiB。


