評価品質のレビュー
- ダッシュボード
- CLI
- Observe → Evaluations に移動します。
- シリーズを追加し、エージェント、環境、評価スコア、統計、カーブを選択します。
- 環境、エージェント、スコアキーを比較するためにシリーズを追加します。
-
結果を選択して、一致するセッションを開くか、フィルタリングされたビューを共有します。レイテンシ、トークン、コスト、その他の数値については Observe → Metrics を使用してください。


評価に適したターゲット
- タスクの完了度または正確性
- 根拠の明確さおよびハルシネーションリスク
- ツール選択とツール効率
- ポリシーまたはプロセスのコンプライアンス
- コストおよびレイテンシの予算
- 必要な人間へのエスカレーション
スコアからレスポンスへ
スコアをダッシュボードに表示してトレンドを追跡します。しきい値や複合条件に対してアラートを作成します。集団全体でスコアが低下した場合は、原因を調査するために監査を実施します。原因が繰り返し発生するアクションであれば、ポリシーをデプロイします。エバリュエーターを構築する
Python エバリュエーター SDK を使用して、同期または非同期の評価を実装します。

