Skip to main content
オンライン評価は、エージェントセッションに一貫した判断を適用します。監査時にのみ調査するのではなく、継続的に計測すべき指標に活用してください。

評価品質のレビュー

  1. Observe → Evaluations に移動します。
  2. シリーズを追加し、エージェント・環境・評価スコア・統計値・カーブを選択します。
  3. シリーズを追加して、環境・エージェント・スコアキーを比較します。
  4. 結果を選択して対応するセッションを開くか、フィルタリングされたビューを共有します。レイテンシ・トークン数・コスト・その他の数値には Observe → Metrics を使用してください。 平均評価スコアと時系列トレンドを表示した品質ダッシュボード。
ドリルダウンからセッションを開くと、スコアごとの推論内容を確認できます。完全なトレースとともに評価スコアと推論を表示したセッション詳細ビュー。
エバリュエーターは、セッション識別子・環境・タイムスタンプ・順序付きイベントを受け取ります。オプションの推論内容とサマリーを含む数値スコアキーを返すことができます。長時間実行されるエバリュエーターは保留中のジョブを返し、後でポーリングすることも可能です。

評価に適したターゲット

  • タスクの完了度または正確性
  • 根拠の有無とハルシネーションのリスク
  • ツール選択とツールの効率性
  • ポリシーまたはプロセスへの準拠
  • コストおよびレイテンシの予算
  • 必要な人間へのエスカレーション

スコアから対応へ

スコアをダッシュボードに表示してトレンドを追跡します。閾値や複合条件に対してアラートを作成します。スコアが集団全体で低下した場合は監査を実施して原因を調査し、原因が再現可能なアクションである場合はポリシーを展開します。

エバリュエーターの構築

Python エバリュエーター SDK を使用して、同期または非同期の評価を実装します。