説明から下書きを作成する
- Analyze → eval authoring に移動し、new eval を選択します。
- 測定内容を平易な英語で説明するか、start from an example… から選択して、draft を選択します。
- フィールドと自動入力されたコードを確認し、テストしてデプロイします。

フィールドを設定する
conditionを使用して、評価を対象とするエージェントおよび環境にスコープを絞り込みます:
コードを自分で記述する
evaluator code はEvalResult(...) を返す1つのPython式で、スコープ内に session があります。以下の例は、ステータスがokで返ってきたツール結果の割合を採点します:
score=、metric評価またはassertion評価にはキーと同じ名前の metrics または assertions エントリを使用します。その他のmetricsとassertionsはこれに付随し、1回の実行で最大25件の結果を含められます。
それ以外にはアクセスできません。importは使用できず、セッションデータとプレーンな文字列・辞書メソッド(
get、lower、split など、参照ではなく呼び出しが必要)以外の属性も使用できません。ペイロードキーはエージェントが送信する内容によって異なります(上記の status はあくまで例です)。実際のセッションから確認してください。format はコードを整形し、fix はアシスタントに修正を依頼します。コードは最大128 KiB、conditionは最大16 KiBです。


