Skip to main content
在线评估对 Agent 会话应用一致的判断标准。适用于需要持续监测而非仅在审计时才进行检查的指标。

审查评估质量

  1. 前往 Observe → Evaluations
  2. 添加系列,选择 Agent、环境、评估分数、统计量和曲线。
  3. 添加多个系列以比较不同环境、Agent 或分数键。
  4. 选择某条结果以打开匹配的会话或共享筛选视图。延迟、Token 数、成本及其他量值请使用 Observe → Metrics 展示平均评估分数及其随时间变化趋势的质量仪表盘。
从下钻视图中打开会话,可查看各分项的评估推理过程:在完整追踪旁边展示评估分数和推理内容的会话详情视图。
评估器接收会话标识、环境、时间戳和有序事件,可返回带有可选推理说明和摘要的数值分数键。长时间运行的评估器可返回一个待处理任务,并在稍后进行轮询。

适合评估的目标

  • 任务完成度或正确性
  • 事实依据与幻觉风险
  • 工具选择与使用效率
  • 政策或流程合规性
  • 成本与延迟预算
  • 是否需要人工介入升级

从评分到响应

在仪表盘中展示分数以跟踪趋势。为阈值或复合条件创建告警。当某项分数在整体水平上持续下降时,运行审计调查原因;若原因是某个可重复的操作,则部署相应策略。

构建评估器

使用 Python 评估器 SDK 实现同步或异步评估。