Skip to main content
Онлайн-оценки применяют последовательные критерии оценки к сессиям агентов. Используйте их для показателей, которые должны измеряться постоянно, а не только исследоваться во время аудита.

Просмотр качества оценок

  1. Перейдите в Observe → Evaluations.
  2. Добавьте серию и выберите агента, окружение, оценку, статистику и кривую.
  3. Добавьте несколько серий для сравнения окружений, агентов или ключей оценок.
  4. Выберите результат, чтобы открыть соответствующие сессии или поделиться отфильтрованным представлением. Используйте Observe → Metrics для значений задержек, токенов, стоимости и других параметров. Панель качества, показывающая средние оценки и тренды с течением времени.
Откройте сессию из детализации, чтобы проверить рассуждение для каждой оценки:Представление деталей сессии с оценками и рассуждениями рядом с полной трассировкой.
Оценивающий модуль получает идентификатор сессии, окружение, временные метки и упорядоченные события. Он может возвращать числовые ключи оценок с опциональным рассуждением и резюме. Долгоживущие оценивающие модули могут возвращать отложенную задачу и опрашиваться позже.

Хорошие цели для оценивания

  • Завершение задачи или корректность
  • Обоснованность и риск галлюцинаций
  • Выбор инструмента и эффективность использования инструментов
  • Соответствие политике или процессу
  • Бюджеты стоимости и задержек
  • Требуемая эскалация на человека

От оценки к действию

Показывайте оценки на панелях для отслеживания трендов. Создавайте оповещения для пороговых значений или сложных условий. Когда оценка снижается в популяции, проведите аудит для расследования причины; когда причиной является повторяемое действие, разверните политику.

Создание оценивающего модуля

Реализуйте синхронную или асинхронную оценку с помощью Python evaluator SDK.