> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 部署和版本管理评估

> 部署不可变版本、查看当前线上内容、发布新版本、回滚，以及对已有会话进行评分。

## 部署

在编写页面底部选择 **deploy `<key>@<version>`**。版本一旦发布即不可变更：此后，所有已完成且符合其条件的会话都将由该版本进行评分。

## 查看当前线上内容

**Analyze → eval authoring** 列出了您组织已托管的定义，即托管评估器为其运行的评估项目。每一行显示：

* 名称、键、版本和结果类型
* 源校验和，无需打开代码即可区分已部署的各个版本
* 是否为**条件性**评估，或对**所有已完成会话**运行——条件用于将评估的范围限定到特定的 Agent 或环境
* 超时时间、标签，以及最后修改时间

<img src="https://mintcdn.com/exosphere/k_s8fY_jSxA_m1d_/images/dashboard/eval-definitions.png?fit=max&auto=format&n=k_s8fY_jSxA_m1d_&q=85&s=face82bf6a7149415fca849037aac8b8" alt="托管定义列表：每个评估的名称、键、版本、结果类型、校验和、超时时间及范围，以及新建版本和启用或禁用操作。" width="1764" height="728" data-path="images/dashboard/eval-definitions.png" />

可搜索列表，或按状态筛选。您自己的 worker 注册的评估不会显示在此处；其结果在[评估页面](/zh/sessions/evaluations)上带有 **customer** 标签，而托管评估则带有 **managed** 标签。

一个组织最多可同时启用 100 个不同的托管评估。

## 发布新版本

在某一行上选择 **new version**。编写页面将打开并显示该版本的代码；对其进行修改、测试，然后部署。键和结果类型会保留，且不可更改。

发布新版本会禁用其前一版本，并将其保留在列表中。结果会保留产生它们的版本信息，因此图表可以清晰显示新逻辑是何时生效的。

## 回滚

对当前版本选择 **disable**，对您想恢复的版本选择 **enable**。不会删除任何内容，所有结果保持不变。

## 停止评估

选择 **disable**。在没有启用版本的情况下，该评估将停止对新会话运行。若要停止您自己的 worker 运行的评估，请停止注册它：将其从 worker 中移除，或停止该 worker。

## 对已有会话进行评分

评估是向前运行的：现在部署的版本不会对其部署前已结束的会话进行评分。若要对历史数据评分，请在 eval 编写页面上打开 **score sessions you already have**，选择最多 90 天的时间窗口，以及可选的单个评估，并在运行前先进行计数。计数结果即为实际运行的数量，其中每个会话与评估的配对均为一次计费评估。

此功能仅填补空缺。已有某次评估结果的会话将保留原结果；对同一时间窗口重复运行不会产生新的评分。

若要对某个会话重新评分——例如修复问题之后，或针对未正常结束的会话——请在其页面上选择 **re-evaluate**。新结果将添加到该会话的历史记录中，早期结果予以保留。

## 权限

| 权限                    | 允许您                                                           |
| --------------------- | ------------------------------------------------------------- |
| `evaluations:read`    | 查看结果，并打开 eval 编写页面                                            |
| `evaluations:trigger` | 查看、部署、版本管理、启用和禁用托管定义；测试它们；对历史数据评分；重新评估某个会话                    |
| `events:read`         | 在 `evaluations:trigger` 的基础上，针对真实会话进行测试，并以您的 payload 键为草稿提供依据 |
| `evaluations:run`     | 运行您自己的评估器 worker                                              |
