評価品質のレビュー
- ダッシュボード
- CLI
- Observe → Evaluations に移動します。
- シリーズを追加し、エージェント・環境・評価スコア・統計値・カーブを選択します。
- シリーズを追加して、環境・エージェント・スコアキーを比較します。
-
結果を選択して対応するセッションを開くか、フィルタリングされたビューを共有します。レイテンシ・トークン数・コスト・その他の数値には Observe → Metrics を使用してください。


評価に適したターゲット
- タスクの完了度または正確性
- 根拠の有無とハルシネーションのリスク
- ツール選択とツールの効率性
- ポリシーまたはプロセスへの準拠
- コストおよびレイテンシの予算
- 必要な人間へのエスカレーション
スコアから対応へ
スコアをダッシュボードに表示してトレンドを追跡します。閾値や複合条件に対してアラートを作成します。スコアが集団全体で低下した場合は監査を実施して原因を調査し、原因が再現可能なアクションである場合はポリシーを展開します。エバリュエーターの構築
Python エバリュエーター SDK を使用して、同期または非同期の評価を実装します。

