Skip to main content
オンライン評価は、エージェントセッションに一貫した判断を適用します。監査時のみ調査するのではなく、継続的に測定すべきシグナルに活用してください。

評価品質のレビュー

  1. Observe → Evaluations に移動します。
  2. シリーズを追加し、エージェント、環境、評価スコア、統計、カーブを選択します。
  3. 環境、エージェント、スコアキーを比較するためにシリーズを追加します。
  4. 結果を選択して、一致するセッションを開くか、フィルタリングされたビューを共有します。レイテンシ、トークン、コスト、その他の数値については Observe → Metrics を使用してください。 平均評価スコアと時系列トレンドを表示する品質ダッシュボード。
ドリルダウンからセッションを開くと、スコアごとの推論内容を確認できます:評価スコアと推論内容が完全なトレースと並んで表示されるセッション詳細ビュー。
エバリュエーターはセッションのID、環境、タイムスタンプ、および順序付きイベントを受け取ります。オプションの推論内容とサマリーを含む数値スコアキーを返すことができます。長時間実行されるエバリュエーターは保留中のジョブを返し、後でポーリングすることができます。

評価に適したターゲット

  • タスクの完了度または正確性
  • 根拠の明確さおよびハルシネーションリスク
  • ツール選択とツール効率
  • ポリシーまたはプロセスのコンプライアンス
  • コストおよびレイテンシの予算
  • 必要な人間へのエスカレーション

スコアからレスポンスへ

スコアをダッシュボードに表示してトレンドを追跡します。しきい値や複合条件に対してアラートを作成します。集団全体でスコアが低下した場合は、原因を調査するために監査を実施します。原因が繰り返し発生するアクションであれば、ポリシーをデプロイします。

エバリュエーターを構築する

Python エバリュエーター SDK を使用して、同期または非同期の評価を実装します。