> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 评估 Agent

> 使用您自定义的评估为每个已完成的会话打分：托管的 Python 检查，或在您自己的 Worker 中运行的 LLM 评判器。

评估会对已完成的 Agent 会话进行评分。当会话结束时，所有适用于该会话且已启用的评估都会运行，并将结果记录下来，您可以在追踪记录旁边读取相应的推理过程：

* **分数**：0 到 1 之间，可选标记为通过或未通过
* **指标**：如计数、时长或成本，附带其单位
* **断言**：通过或未通过

## 两种评估器

|      | 托管 Python                              | 您自己的 Worker                                                 |
| ---- | -------------------------------------- | ----------------------------------------------------------- |
| 编写方式 | 在仪表板的 **Analyze → eval authoring** 中编写 | 用 Python 编写，配合 [Evaluator SDK](/zh/reference/evaluator-sdk) |
| 运行位置 | 在 Failproof AI 托管的评估器沙箱中运行             | 在您自己的基础设施上运行                                                |
| 适用场景 | 确定性的、基于代码的检查                           | LLM 评判器、模型调用、依赖包、密钥、网络访问、大量处理                               |

托管 Python 有意保持精简：仅支持单个表达式，无法导入模块，无法访问网络。任何需要调用模型的场景——例如用 LLM 评判器判断答案是否相关——都应改为在您自己的 Worker 中运行。两种方式都不需要入站连接：Worker 主动拉取已完成的会话，并通过出站 HTTPS 提交结果。

## 每个组织独立评估自己的 Agent

评估归定义它的组织所有。实例上的每个组织独立编写自己的评估——包括检查逻辑、条件、阈值和标签——可以独立进行版本管理和部署，不会影响其他组织，也只能查看自己的结果。您可以按 Agent、环境、评估和时间筛选结果，也可以直接向助手提问。

## 从初稿到上线评分

<Steps>
  <Step title="编写评估">
    描述要衡量的内容，让助手帮您起草，或者自行编写。参见[编写评估](/zh/evaluations/write)。
  </Step>

  <Step title="测试评估">
    在正式上线前对真实会话进行测试，测试结果不会被存储。参见[测试评估](/zh/evaluations/test)。
  </Step>

  <Step title="部署与版本管理">
    部署不可变版本，随着评估的演进发布新版本，并可回滚到之前的版本。参见[部署与版本管理](/zh/evaluations/deploy)。
  </Step>

  <Step title="查看结果">
    查看分数随时间的变化趋势，比较不同 Agent 和环境的表现，并向助手提问。参见[查看评估结果](/zh/sessions/evaluations)。
  </Step>
</Steps>

评估按时间顺序向前执行：现在部署的版本将对从此刻起完成的会话进行评分。如需对已有的历史会话评分，请[进行回填](/zh/evaluations/deploy#对已有会话进行评分)。
