> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Оценка агентов

> Оценивайте каждую завершённую сессию с помощью проверок на Python или LLM-судей в вашей инфраструктуре.

Оценка — это результат работы завершённой сессии агента. Когда сессия заканчивается, каждая активная применимая оценка запускается и записывает найденные результаты с обоснованием, которое вы можете увидеть рядом с трассой:

* **оценка** от 0 до 1, опционально отмеченная как пройденная или не пройденная
* **метрика**, например количество, продолжительность или стоимость, с её единицей измерения
* **утверждение**, которое прошло или не прошло

## Два вида оценщиков

|                 | Hosted Python                                                 | Ваша собственная инфраструктура                                                   |
| --------------- | ------------------------------------------------------------- | --------------------------------------------------------------------------------- |
| Разработка      | На панели инструментов в разделе **Analyze → eval authoring** | На Python с использованием [Evaluator SDK](/ru/reference/evaluator-sdk)           |
| Выполнение      | На управляемом оценщике Failproof AI в изолированной среде    | На вашей инфраструктуре                                                           |
| Лучше всего для | Детерминированные проверки на основе кода                     | LLM-судьи, вызовы моделей, пакеты, секреты, сетевой доступ, интенсивная обработка |

Hosted Python намеренно минимален: одно выражение, без импортов, без сети. Всё, что требует модель — например, LLM-судья, оценивающий релевантность ответа — выполняется в вашей инфраструктуре. Ни один вид не требует входящего подключения: рабочие процессы получают завершённые сессии и отправляют результаты по исходящему HTTPS.

## Каждая организация оценивает свои агентов

Оценки принадлежат организации, которая их определила. Каждая организация в инстансе пишет свои — свои проверки, условия, пороги и ярлыки — версионирует и развёртывает их без влияния на другие, и видит только свои результаты. Фильтруйте результаты по агенту, окружению, оценке и времени, или обсудите их с помощником.

## От первого варианта к живым оценкам

<Steps>
  <Step title="Напишите её">
    Опишите, что нужно измерить, и дайте помощнику его набросать, или напишите сами. См. [Написание оценки](/ru/evaluations/write).
  </Step>

  <Step title="Протестируйте её">
    Запустите её на реальных сессиях перед запуском в продакшене; ничего не сохраняется. См. [Тестирование оценки](/ru/evaluations/test).
  </Step>

  <Step title="Разверните и версионируйте её">
    Разверните неизменяемую версию, публикуйте новые по мере развития и откатывайтесь к более ранней версии. См. [Развёртывание и версионирование](/ru/evaluations/deploy).
  </Step>

  <Step title="Читайте результаты">
    Постройте графики оценок во времени, сравните агентов и окружения, и обсудите их с помощником. См. [Чтение результатов оценки](/ru/sessions/evaluations).
  </Step>
</Steps>

Оценки выполняются вперёд: версия, развёрнутая сейчас, оценивает сессии, которые завершаются с этого момента. Чтобы оценить уже имеющиеся сессии, [заполните их задним числом](/ru/evaluations/deploy#оценить-уже-имеющиеся-сессии).
