> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Онлайн-оценки

> Оценивайте активные и завершённые сессии по качеству, соответствию требованиям, стоимости и задержкам.

Онлайн-оценки применяют последовательные критерии оценки к сессиям агентов. Используйте их для показателей, которые должны измеряться постоянно, а не только исследоваться во время аудита.

## Просмотр качества оценок

<Tabs>
  <Tab title="Dashboard">
    1. Перейдите в **Observe → Evaluations**.
    2. Добавьте серию и выберите агента, окружение, оценку, статистику и кривую.
    3. Добавьте несколько серий для сравнения окружений, агентов или ключей оценок.
    4. Выберите результат, чтобы открыть соответствующие сессии или поделиться отфильтрованным представлением. Используйте **Observe → Metrics** для значений задержек, токенов, стоимости и других параметров.

           <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/dashboard-quality.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=74c925ae831046fc869a3a3d6e81fc25" alt="Панель качества, показывающая средние оценки и тренды с течением времени." width="2880" height="1800" data-path="images/dashboard/dashboard-quality.png" />

    Откройте сессию из детализации, чтобы проверить рассуждение для каждой оценки:

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/session-detail.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=7b5f022dd5c485565a8cd92b2e936235" alt="Представление деталей сессии с оценками и рассуждениями рядом с полной трассировкой." width="3200" height="2000" data-path="images/dashboard/session-detail.png" />
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp evals --agent-id checkout-agent --aggregate
    fp evals --aggregate --env production --status error
    fp evals --score helpfulness:0.8.. --since 7d
    ```

    Добавьте глобальный флаг `--json` перед `evals` для автоматизации, например `fp --json evals --aggregate --env production`.
  </Tab>
</Tabs>

Оценивающий модуль получает идентификатор сессии, окружение, временные метки и упорядоченные события. Он может возвращать числовые ключи оценок с опциональным рассуждением и резюме. Долгоживущие оценивающие модули могут возвращать отложенную задачу и опрашиваться позже.

## Хорошие цели для оценивания

* Завершение задачи или корректность
* Обоснованность и риск галлюцинаций
* Выбор инструмента и эффективность использования инструментов
* Соответствие политике или процессу
* Бюджеты стоимости и задержек
* Требуемая эскалация на человека

## От оценки к действию

Показывайте оценки на панелях для отслеживания трендов. Создавайте оповещения для пороговых значений или сложных условий. Когда оценка снижается в популяции, проведите аудит для расследования причины; когда причиной является повторяемое действие, разверните политику.

<Card title="Создание оценивающего модуля" icon="code-2" href="/ru/reference/evaluator-sdk">
  Реализуйте синхронную или асинхронную оценку с помощью Python evaluator SDK.
</Card>
