> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 测试评估

> 在部署前对真实会话运行评估。不存储任何数据。

在编写页面上，**测试此评估**会在不部署的情况下，将代码在评估器集群上对您的真实会话运行。不存储任何数据：此处的失败仅为预览，部署始终是被允许的。

<Steps>
  <Step title="检查编译是否通过">
    选择 **check**，在不对任何会话运行的情况下，根据沙箱规则编译代码和条件。
  </Step>

  <Step title="选择会话">
    按代理、环境、时间或会话 ID 筛选匹配的会话，最多勾选 10 个。既应包含评估预期应失败的会话，也应包含预期应通过的会话。
  </Step>

  <Step title="运行">
    选择 **run against N sessions**，逐行查看结果。
  </Step>
</Steps>

| 行状态         | 含义                                                          |
| ----------- | ----------------------------------------------------------- |
| **ok**      | 已运行。该行列出了返回的每个分数、指标和断言，以及耗时。                                |
| **skipped** | 条件返回了 `False`，因此评估未运行。这是跳过，而非失败。                            |
| Failed      | 发生了异常、超时，或使用了沙箱拒绝的内容。该行会说明具体原因，**Fix it** 会在可以协助时将错误交由助手处理。 |

<img src="https://mintcdn.com/exosphere/k_s8fY_jSxA_m1d_/images/dashboard/eval-test.png?fit=max&auto=format&n=k_s8fY_jSxA_m1d_&q=85&s=b7e36ddb791b5c612c485f2f86e0f36f" alt="测试此评估面板：按代理选取了三个会话，两个状态为 ok，一个因条件返回 False 而被跳过。" width="1324" height="887" data-path="images/dashboard/eval-test.png" />

一旦您编辑了代码，结果就不再是最新的，它会变暗而非被重用。
