title: “Навык Failproof AI Observability Evaluator Agent” description: “От «я думаю, что наш агент иногда работает плохо» к развёрнутому сервису оценки, где кодирующий агент сам принимает решения и строит решение.”
От «я думаю, что наш агент иногда работает плохо» к развёрнутому сервису оценки, где кодирующий агент сам принимает решения и строит решение. Навык Failproof AI Observability evaluator (agenteye-evaluator) — это Agent Skill: небольшая папка с инструкциями, которые кодирующий агент, такой как Claude Code или Codex, загружает по требованию. Она учит агента определять, какие показатели качества стоит отслеживать для вашего агента, а затем писать, тестировать и развёртывать сервис оценки, который их оценивает.
Это не размещённый скорер, реестр для загрузки или система плагинов. Ваша оценка остаётся вашей собственной HTTP-службой на вашей инфраструктуре, точно так, как описано в руководстве Evaluation suite. Навык только учит вашего агента строить её правильно, поэтому всё, что она делает, вы могли бы сделать сами, написав тот же код.
Сложная часть — решить, что оценивать
Поверхность SDK небольшая — декоратор и две модели — и агент может написать это просто по контракту. В этом не проблема оценок. Они не работают, потому что оценивают неправильное, и оценка, которая оценивает неправильное, хуже, чем никакая: она создаёт панель управления, которую все учатся игнорировать. Поэтому большая часть навыка — это часть до того, как существует код. Агент берёт у вас интервью («опишите сеанс, который прошёл хорошо; теперь один, который прошёл плохо»), затем загружает ваши реальные сеансы черезagenteye CLI и читает их от начала до конца. Эти две части обычно не совпадают, и разрыв — это именно то, что нужно: что вы намерены измерять против того, что ваши расшифровки могут реально поддерживать. Измерение выживает только если оно вычислимо из событий и дискриминирующее — если оно выставляет 0,9 как для вашего хорошего, так и для вашего плохого сеанса, оно ничему не учит и исключается.
То, что возвращается — предложение 2-4 измерений с приложенным обоснованием, которое вы подписываете перед тем, как будет написана строка кода.
Как это относится к другим частям оценки
Четыре документа охватывают оценку и передают информацию друг другу по очереди:vs. CLI skill: построение vs чтение
Два навыка намеренно неперекрывающиеся, и установка обоих — это обычная конфигурация — агент выбирает между ними в зависимости от того, что вы просите:agenteye-evaluator(этот документ) строит то, что производит оценки. Его работа заканчивается, когда оценки появляются в первый раз.agenteye-cliчитает оценки, которые уже существуют (agenteye evals). «Качество упало на этой неделе?» — это его вопрос, не этого навыка.
Предварительные требования
agenteyeCLI установлен и подключён (pipx install agenteye, затемagenteye login). Навык использует его дважды: для загрузки реальных сеансов, на которых он проектирует, и для подтверждения того, что ваши оценки появились в конце. Ваш логин нуждается вevents:read, плюсevaluations:readдля этой окончательной проверки. Как и в случае с CLI skill, он не может завершить отправленный по почте вход с одноразовым кодом за вас.- Место для жизни оценки. Она строится в образ и работает как долгоживущий сервис, поэтому ей нужно настоящее хранилище, а не временный файл. Оценки часто живут в собственном хранилище, отдельно от оцениваемого агента — навык ищет существующее и спрашивает перед построением нового.
- Колесо
agenteye-evaluatorSDK — прочитайте следующий раздел перед тем, как ваш агент начнёт вводить командыpip.
Где это получить
Навык опубликован в публичной коллекции навыков Failproof AI: github.com/FailproofAI/skills →skills/agenteye-evaluator/
Хранилище публичное и навыку не нужно никаких собственных учётных данных — он только управляет agenteye CLI с сеансом, на который вы подключились, и пишет код в ваше хранилище. Обратите внимание, что он поставляется как собственная папка и не находится внутри пакета pipx install agenteye, поэтому не ищите его там.
Установка навыка
Самый быстрый способ — это CLIskills, которая загружает папку и помещает её туда, где ваш агент ищет:
SKILL.md (плюс опциональные ссылки), поэтому копирование тоже работает:
- Claude Code: поместите папку
agenteye-evaluator/в~/.claude/skills/(каждый проект) или<your-repo>/.claude/skills/(только это хранилище). Claude Code автоматически её обнаруживает — проверьте с помощью списка/skillsили просто попросите оценки. - Codex (OpenAI): Codex читает тот же
SKILL.md. Включённыйagents/openai.yamlустанавливаетallow_implicit_invocation: true, поэтому Codex автоматически выбирает навык при совпадении задачи; иначе вызовите его явно как$agenteye-evaluator.
SDK не на публичном PyPI
Предупреждение: прочитайте это перед тем, как позволить агенту установить SDK.Навык публичный; SDK, который он управляет — нет.
agenteye-evaluator поставляется только как приватный артефакт выпуска, и в отличие от agenteye, имя не заявлено на публичном PyPI — поэтому голый pip install agenteye-evaluator может загрузить пакет незнакомца в сервис, который читает ваши производственные расшифровки. Это проблема цепочки поставок, а не опечатка.
Навык знает это и работает по лестнице установки, останавливаясь на первой применимой ступени: исходный код монорепозитория, если вы внутри репозитория AgentEye, иначе приватное колесо выпуска из GitHub Releases (нужен доступ), и если ни одно не достижимо, он останавливается и говорит вам попросить колесо у вашего контакта Failproof AI вместо импровизации.
Поэтому если ваш агент предлагает голый pip install agenteye-evaluator с публичного PyPI, это признак того, что навык никогда не загружался. Остановитесь там и проверьте, что он установлен.
Что вы можете просить
Настоящий полный цикл начинается с нечёткого запроса и заканчивается подписанным дизайном, а не кодом:JobPending вместо того, чтобы позволить вашему судье быть отменённым и переправленным пять раз в пять раз дороже.
Затем он развёртывает, устанавливает две переменные окружения сервера и подтверждает с помощью agenteye --json evals --session-id <id>, что оценки действительно появились. Появление оценок — единственное доказательство.
На что обратить внимание
- Названия измерений почти постоянны. Ключи оценок — произвольные строки, и платформа тренирует всё, что вы отправляете, что означает, что ничто ниже не исправляет плохой выбор. Переименование позже и история разбивается: старые сеансы хранят старый ключ и тренд разбивается. Вот почему навык получает явное одобрение перед написанием кода — отнеситесь к этому приглашению серьёзно.
- Фиксации — настоящие производственные расшифровки. Проектирование против реальных сеансов означает их загрузку на диск, и они могут содержать данные клиентов. Навык спрашивает перед фиксацией в git; если сомневаетесь, держите
fixtures/вне хранилища и попросите каждого разработчика загрузить свои собственные. - Агент пишет и развёртывает сервис, который читает каждую расшифровку. Он действует от вашего имени, ограниченный разрешениями логина вашего CLI, но просмотрите оценку как любой другой код, который касается производственных данных.
Следующие шаги
- Evaluation suite: HTTP контракт, SDK и переменные окружения сервера, которые навык конфигурирует.
- Evaluations: где оценки показываются, когда они появляются.
- CLI skill: родственный навык для чтения результатов вместо построения скорера.
- CLI: справочник команд за данными сеансов, против которых навык проектирует.

