- оценка от 0 до 1, опционально отмеченная как пройденная или не пройденная
- метрика, например количество, продолжительность или стоимость, с её единицей измерения
- утверждение, которое прошло или не прошло
Два вида оценщиков
Hosted Python намеренно минимален: одно выражение, без импортов, без сети. Всё, что требует модель — например, LLM-судья, оценивающий релевантность ответа — выполняется в вашей инфраструктуре. Ни один вид не требует входящего подключения: рабочие процессы получают завершённые сессии и отправляют результаты по исходящему HTTPS.
Каждая организация оценивает свои агентов
Оценки принадлежат организации, которая их определила. Каждая организация в инстансе пишет свои — свои проверки, условия, пороги и ярлыки — версионирует и развёртывает их без влияния на другие, и видит только свои результаты. Фильтруйте результаты по агенту, окружению, оценке и времени, или обсудите их с помощником.От первого варианта к живым оценкам
1
Напишите её
Опишите, что нужно измерить, и дайте помощнику его набросать, или напишите сами. См. Написание оценки.
2
Протестируйте её
Запустите её на реальных сессиях перед запуском в продакшене; ничего не сохраняется. См. Тестирование оценки.
3
Разверните и версионируйте её
Разверните неизменяемую версию, публикуйте новые по мере развития и откатывайтесь к более ранней версии. См. Развёртывание и версионирование.
4
Читайте результаты
Постройте графики оценок во времени, сравните агентов и окружения, и обсудите их с помощником. См. Чтение результатов оценки.

