설명으로 초안 작성하기
- Analyze → eval authoring으로 이동하여 new eval을 선택합니다.
- 측정할 내용을 일반 영어로 설명하거나 **start from an example…**에서 선택한 후 draft를 선택합니다.
- 필드와 자동으로 채워진 코드를 검토한 다음 테스트하고 배포합니다.

필드 설정하기
condition을 사용하면 평가 대상 에이전트와 환경으로 범위를 제한할 수 있습니다:
직접 코드 작성하기
evaluator code는EvalResult(...)를 반환하는 단일 Python 표현식이며, 스코프 내에 session이 제공됩니다. 아래 예제는 성공적으로 반환된 도구 결과의 비율을 점수로 계산합니다:
score=를, 메트릭 또는 어서션 평가는 해당 키 이름의 metrics 또는 assertions 항목을 사용합니다. 그 외 메트릭과 어서션은 함께 포함될 수 있으며, 한 번 실행에 최대 25개의 결과를 담을 수 있습니다.
이외에는 접근할 수 없습니다. import도 불가하며, 세션 데이터와
get, lower, split 같은 기본 문자열 및 딕셔너리 메서드 외의 속성은 사용할 수 없습니다. 이 메서드들은 참조가 아닌 호출 방식으로 사용해야 합니다. 페이로드 키는 에이전트가 전송하는 내용에 따라 달라집니다. 위의 status는 예시일 뿐이므로, 실제 세션에서 키를 직접 확인하세요. format은 코드를 정리하고, fix는 어시스턴트에게 수정을 요청합니다. 코드는 최대 128 KiB, 조건은 최대 16 KiB까지 작성할 수 있습니다.


