Skip to main content
Оценка — это результат работы завершённой сессии агента. Когда сессия заканчивается, каждая активная применимая оценка запускается и записывает найденные результаты с обоснованием, которое вы можете увидеть рядом с трассой:
  • оценка от 0 до 1, опционально отмеченная как пройденная или не пройденная
  • метрика, например количество, продолжительность или стоимость, с её единицей измерения
  • утверждение, которое прошло или не прошло

Два вида оценщиков

Hosted Python намеренно минимален: одно выражение, без импортов, без сети. Всё, что требует модель — например, LLM-судья, оценивающий релевантность ответа — выполняется в вашей инфраструктуре. Ни один вид не требует входящего подключения: рабочие процессы получают завершённые сессии и отправляют результаты по исходящему HTTPS.

Каждая организация оценивает свои агентов

Оценки принадлежат организации, которая их определила. Каждая организация в инстансе пишет свои — свои проверки, условия, пороги и ярлыки — версионирует и развёртывает их без влияния на другие, и видит только свои результаты. Фильтруйте результаты по агенту, окружению, оценке и времени, или обсудите их с помощником.

От первого варианта к живым оценкам

1

Напишите её

Опишите, что нужно измерить, и дайте помощнику его набросать, или напишите сами. См. Написание оценки.
2

Протестируйте её

Запустите её на реальных сессиях перед запуском в продакшене; ничего не сохраняется. См. Тестирование оценки.
3

Разверните и версионируйте её

Разверните неизменяемую версию, публикуйте новые по мере развития и откатывайтесь к более ранней версии. См. Развёртывание и версионирование.
4

Читайте результаты

Постройте графики оценок во времени, сравните агентов и окружения, и обсудите их с помощником. См. Чтение результатов оценки.
Оценки выполняются вперёд: версия, развёрнутая сейчас, оценивает сессии, которые завершаются с этого момента. Чтобы оценить уже имеющиеся сессии, заполните их задним числом.