Настройка evaluator
1
Установите Evaluator SDK
Установите SDK и сервер для его запуска.
2
Определите, что оценивать
Создайте
evaluator.py. В этом примере проверяется наличие неудачных вызовов инструментов в сессии.3
Запустите и протестируйте локально
Установите общий токен, запустите evaluator и убедитесь, что endpoint проверки здоровья отвечает.В другом терминале:
Подключение evaluator к Failproof AI
- Разверните evaluator на HTTPS URL, доступном для Failproof AI Cloud.
- Настройте
EVALUATOR_ENDPOINTс этим URL и установитеEVALUATOR_TOKENна тот же токен, который использует evaluator. Для управляемого Cloud обратитесь в support@befailproof.ai для настройки подключения. - Запустите оценку и убедитесь, что её результаты появились в Failproof AI.
- Dashboard
- CLI
Откройте завершённую сессию в разделе Observe → Sessions и выберите Run evaluation, если оценка не была выполнена автоматически. Посмотрите статус, оценки, объяснения и резюме в панели Evaluation сессии.Используйте Observe → Evaluations для сравнения оценок между агентами или окружениями. Используйте Observe → Metrics для метрик задержки, стоимости, количества токенов и других числовых измерений.Начните с одной сессии, чтобы убедиться, что evaluator вернул ожидаемые ключи оценок и полезные объяснения для этого конкретного запуска.
После того как отдельные результаты выглядят корректно, используйте панель оценок для сравнения этих оценок во времени и между агентами или окружениями.
Здоровый график должен использовать стабильные названия оценок; изменение ключа создаёт отдельный ряд.


EVALUATOR_ENDPOINT на процессе сервера. Перезапустите сервер после изменения переменных окружения evaluator.
Сервис предоставляет GET /health, GET /config, POST /evaluate и опционально GET /evaluate/{job_id}. Возвращайте JobPending для асинхронной работы и регистрируйте @app.job_lookup, чтобы Failproof AI мог её опрашивать.
Когда токен настроен, все маршруты, кроме health, требуют тот же bearer токен, который Failproof AI отправляет как EVALUATOR_TOKEN.
Типы SDK
Декораторы и маршруты
SDK ограничивает тела запросов оценки до 25 МиБ. Неизвестные поля запроса игнорируются, поэтому сервисы остаются совместимы по мере развития контракта событий.
Возврат асинхронной работы
ИспользуйтеJobPending, когда оценка не может завершиться в одном запросе. ID задачи непрозрачен для Failproof AI и должен оставаться разрешимым вашим сервисом до сбора результата или истечения таймаута сервера.
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, затем EVALUATOR_POLLING_INTERVAL_SECS сервера. Значения зажимаются между 1 секундой и 1 часом. Стандартная верхняя граница настенного времени опроса сервера — один час.
Поля запроса и ответа
Настройки оператора сервера
Автоматическая оценка работает на уровне развертывания и остаётся отключённой при отсутствииEVALUATOR_ENDPOINT.
Сервер также может ограничить, какие организации используют глобальный evaluator развертывания. Рассматривайте изменения endpoint, токена, повтора и организационных врат как конфигурацию оператора и перезапустите или переделайте сервер после их изменения.
Безопасность и операции
- Разместите evaluator за HTTPS, когда трафик пересекает границу доверенной сети.
- Настройте непустой bearer токен и держите его идентичным на обоих сервисах.
- Не логируйте токен или полные конфиденциальные подсказки из полезных нагрузок запросов.
- Сделайте синхронные обработчики идемпотентными; повторные попытки могут повторить запрос.
- Сохраняйте состояние асинхронных задач вне памяти процесса в production.
- Возвращайте стабильные ключи оценок. Переименование ключа создаёт новый ряд диаграммы вместо изменения старого.
eval received, eval responded, job lookup, config returned, auth rejected и исключения обработчиков. Он не настраивает обработчики логирования; используйте конфигурацию логирования хост-приложения.
