agenteye-evaluator) es una Agent Skill: una pequeña carpeta de instrucciones que un agente de programación como Claude Code o Codex carga bajo demanda. Le enseña al agente a determinar qué dimensiones de calidad vale la pena rastrear para tu agente y luego escribir, probar y desplegar el servicio evaluador que las puntúa.
No es un puntuador alojado, un registro al que subir archivos ni un sistema de plugins. Tu evaluador permanece como tu propio servicio HTTP en tu propia infraestructura, exactamente como se describe en la guía de la Suite de evaluación. La habilidad solo enseña a tu agente a construirlo bien, de modo que todo lo que hace, podrías hacerlo tú mismo escribiendo el mismo código.
La parte difícil es decidir qué puntuar
La superficie del SDK es pequeña — un decorador y dos modelos — y un agente puede escribirla a partir del contrato por sí solo. Ahí no es donde fallan los evaluadores. Fallan porque puntúan la cosa equivocada, y un evaluador que puntúa la cosa equivocada es peor que ninguno: produce un dashboard que todos aprenden a ignorar. Por eso la mayor parte de la habilidad es la etapa previa a que exista cualquier código. Hace que el agente te entreviste («describe una ejecución que salió bien; ahora una que salió mal»), luego recorre tus sesiones reales a través de la CLIagenteye y las lee de principio a fin. Esas dos mitades suelen no coincidir, y la brecha es precisamente el punto: lo que pretendes medir frente a lo que tus transcripciones pueden respaldar realmente. Una dimensión solo sobrevive si es computable a partir de los eventos y discriminante — si puntúa 0,9 tanto en tu ejecución buena como en la mala, no enseña nada y se elimina.
Lo que se devuelve es una propuesta de 2 a 4 dimensiones con el razonamiento adjunto, para que la apruebes antes de que se escriba una sola línea.
Su relación con las demás piezas de evaluación
Cuatro documentos cubren la puntuación, y se encadenan entre sí en orden:vs. la habilidad CLI: construir versus leer
Las dos habilidades están deliberadamente diseñadas para no solaparse, e instalar ambas es la configuración normal — el agente elige entre ellas según lo que le pidas:agenteye-evaluator(este doc) construye la cosa que produce puntuaciones. Su trabajo termina cuando las puntuaciones aparecen por primera vez.agenteye-clilee las puntuaciones que ya existen (agenteye evals). «¿Bajó la calidad esta semana?» es su pregunta, no la de esta habilidad.
Requisitos previos
- La CLI
agenteyeinstalada e iniciada sesión (pipx install agenteye, luegoagenteye login). La habilidad la utiliza en dos momentos: para obtener las sesiones reales con las que diseña, y para confirmar que tus puntuaciones llegaron al final. Tu sesión necesitaevents:read, másevaluations:readpara esa verificación final. Al igual que con la habilidad CLI, no puede completar el inicio de sesión con código de un solo uso enviado por correo electrónico en tu lugar. - Un lugar donde alojar el evaluador. Se construye como una imagen y se ejecuta como un servicio de larga duración, por lo que necesita un repositorio real, no un archivo temporal. Los evaluadores suelen vivir en su propio repositorio, separado del agente que se está puntuando — la habilidad busca uno existente y pregunta antes de crear un andamiaje nuevo.
- El wheel del SDK
agenteye-evaluator— lee la siguiente sección antes de dejar que tu agente empiece a escribir comandospip.
Dónde conseguirla
La habilidad está publicada en la colección pública de habilidades de Failproof AI: github.com/FailproofAI/skills →skills/agenteye-evaluator/
El repositorio es público y la habilidad no necesita credenciales propias — solo maneja la CLI agenteye con la sesión tuya en la que iniciaste sesión, y escribe código en tu repositorio. Ten en cuenta que se distribuye como su propia carpeta y no está dentro del paquete pipx install agenteye, así que no la busques ahí.
Instalación de la habilidad
La forma más rápida es la CLIskills, que descarga la carpeta y la coloca donde tu agente la busca:
SKILL.md (más referencias opcionales), así que copiarla también funciona:
- Claude Code: coloca la carpeta
agenteye-evaluator/en~/.claude/skills/(todos los proyectos) o en<tu-repo>/.claude/skills/(solo ese repositorio). Claude Code la descubre automáticamente — verifica con la lista/skills, o simplemente pide evaluaciones. - Codex (OpenAI): Codex lee el mismo
SKILL.md. El archivo incluidoagents/openai.yamlestableceallow_implicit_invocation: true, por lo que Codex selecciona la habilidad automáticamente cuando una tarea coincide; de lo contrario, invócala explícitamente como$agenteye-evaluator.
El SDK no está en PyPI público
Advertencia: Lee esto antes de dejar que un agente instale el SDK.La habilidad es pública; el SDK que maneja no lo es.
agenteye-evaluator se distribuye únicamente como un artefacto de lanzamiento privado, y a diferencia de agenteye, el nombre está sin reclamar en PyPI público — así que un pip install agenteye-evaluator sin más podría descargar el paquete de un desconocido en el servicio que lee tus transcripciones de producción. Eso es un problema de cadena de suministro, no un error tipográfico.
La habilidad lo sabe y recorre una escalera de instalación en su lugar, deteniéndose en el primer peldaño que aplica: el código fuente del monorepo si estás dentro del repositorio de AgentEye, de lo contrario el wheel de lanzamiento privado desde GitHub Releases (requiere acceso), y si ninguno es accesible se detiene y te dice que pidas el wheel a tu contacto de Failproof AI en lugar de improvisar.
Por tanto, si tu agente propone un pip install agenteye-evaluator simple desde PyPI público, esa es la señal de que la habilidad nunca se cargó. Detente ahí y comprueba que está instalada.
Qué puedes pedirle
Un ciclo completo real empieza con una petición vaga y termina con un diseño aprobado, no con código:JobPending en lugar de dejar que tu juez sea cancelado y reintentado cinco veces a cinco veces el coste.
Luego lo despliega, configura las dos variables de entorno del servidor y confirma con agenteye --json evals --session-id <id> que las puntuaciones realmente llegaron. Que lleguen las puntuaciones es la única prueba.
Qué tener en cuenta
- Los nombres de las dimensiones son casi permanentes. Las claves de puntuación son cadenas arbitrarias y la plataforma traza tendencias de lo que envíes, lo que significa que nada en el downstream corrige una mala elección. Renombrar después divide el historial: las sesiones antiguas conservan la clave antigua y la tendencia se rompe. Por eso la habilidad obtiene una aprobación explícita antes de escribir código — tómate ese aviso en serio.
- Los fixtures son transcripciones reales de producción. Diseñar contra sesiones reales implica descargarlas al disco, y pueden contener datos de clientes. La habilidad pregunta antes de agregarlos a git; en caso de duda, mantén
fixtures/fuera del repositorio y pide a cada desarrollador que descargue las suyas propias. - El agente escribe y despliega un servicio que lee cada transcripción. Actúa como tú, acotado por los permisos de tu sesión de CLI, pero revisa el evaluador como cualquier otro código que toque datos de producción.
Próximos pasos
- Suite de evaluación: el contrato HTTP, el SDK y las variables de entorno del servidor que configura la habilidad.
- Evaluaciones: dónde aparecen las puntuaciones una vez que llegan.
- Habilidad CLI: la habilidad hermana, para leer resultados en lugar de construir el puntuador.
- CLI: la referencia de comandos detrás de los datos de sesión con los que la habilidad diseña.

