Составить оценку из описания
- Перейдите в Analyze → eval authoring и выберите new eval.
- Опишите, что нужно измерить, на простом английском языке или выберите start from an example…, затем нажмите draft.
- Проверьте поля и сгенерированный код, потом протестируйте его и разверните.

Установить поля
Используйте условие, чтобы ограничить оценку агентами и средами, для которых она предназначена:
Написать код самостоятельно
Код оценки — это одно выражение на Python, которое возвращаетEvalResult(...) с доступным session. Вот пример, который оценивает долю результатов инструмента, которые пришли в порядке:
score= для оценки-балла или запись metrics или assertions с именем ключа для метрики или утверждения. Другие метрики и утверждения идут с ним, до 25 результатов в запуске.
Больше ничего недоступно: нет импортов и нет атрибутов кроме данных сессии и простых методов строк и словарей, таких как
get, lower и split, которые должны вызываться, а не просто ссылаться. Ключи полезной нагрузки — это всё, что отправляют ваши агенты — status выше только пример — поэтому берите их из реальной сессии. format приводит код в порядок, а fix просит помощника его исправить. Код может быть до 128 КиБ, условие — до 16 КиБ.


