Skip to main content
Онлайн-оценки применяют согласованные критерии к сессиям агентов. Используйте их для метрик, которые должны измеряться постоянно, а не только исследоваться во время аудита.

Проверка качества оценок

  1. Перейдите в Observe → Evaluations.
  2. Добавьте серию и выберите агента, окружение, метрику оценки, статистику и кривую.
  3. Добавьте серии для сравнения окружений, агентов или ключей оценки.
  4. Выберите результат, чтобы открыть соответствующие сессии или поделиться отфильтрованным представлением. Используйте Observe → Metrics для значений задержки, токенов, стоимости и других величин. Панель качества, показывающая средние оценки и тренды во времени.
Откройте сессию из детализации, чтобы проверить рассуждение для каждой оценки:Представление деталей сессии с оценками и рассуждениями рядом с полной трассировкой.
Оценивающая функция получает идентификатор сессии, окружение, временные метки и упорядоченные события. Она может возвращать числовые ключи оценок с необязательным рассуждением и резюме. Долгоживущие оценивающие функции могут возвращать ожидающую задачу и быть опрошены позже.

Хорошие цели для оценивания

  • Завершенность задачи или корректность
  • Обоснованность и риск галлюцинаций
  • Выбор инструментов и эффективность их использования
  • Соответствие политикам или процессам
  • Бюджеты по стоимости и задержке
  • Необходимость эскалации к человеку

От оценки к действию

Отображайте оценки на панелях для отслеживания трендов. Создавайте оповещения для пороговых или комбинированных условий. Когда оценка снижается в группе сессий, запустите аудит для исследования причины; когда причина — повторяющееся действие, разверните политику.

Создайте оценивающую функцию

Реализуйте синхронную или асинхронную оценку с помощью SDK оценивающей функции на Python.