Skip to main content
在线评估对 Agent 会话应用一致的判断标准。适用于需要持续监测而非仅在审计时才进行调查的信号。

查看评估质量

  1. 前往 Observe → Evaluations
  2. 添加一个系列,选择 Agent、环境、评估分数、统计指标和曲线。
  3. 添加多个系列以比较不同环境、Agent 或分数键。
  4. 选择一条结果以打开匹配的会话,或分享已过滤的视图。使用 Observe → Metrics 查看延迟、Token 数、成本及其他数值指标。 质量仪表盘,展示平均评估分数和随时间变化的趋势。
从下钻视图中打开会话,查看各项分数的推理过程:会话详情视图,在完整追踪记录旁显示评估分数和推理内容。
评估器接收会话标识、环境、时间戳和有序事件。它可以返回带有可选推理说明和摘要的数值分数键。长时间运行的评估器可以返回一个待处理的任务,并在稍后进行轮询。

良好的评估目标

  • 任务完成度或正确性
  • 事实依据与幻觉风险
  • 工具选择与工具使用效率
  • 策略或流程合规性
  • 成本与延迟预算
  • 必要的人工升级处理

从分数到响应

在仪表盘中展示分数以追踪趋势。为阈值或复合条件创建告警。当某项分数在整体层面出现下滑时,运行审计以调查原因;当原因是某个可重复的操作时,部署相应的策略。

构建评估器

使用 Python 评估器 SDK 实现同步或异步评估。