agenteye-evaluator) est une Agent Skill : un petit dossier d’instructions qu’un agent de codage tel que Claude Code ou Codex charge à la demande. Elle apprend à l’agent à déterminer quelles dimensions de qualité méritent d’être suivies pour votre agent, puis à écrire, tester et déployer le service évaluateur qui les note.
Il ne s’agit pas d’un scoring hébergé, d’un registre vers lequel vous téléversez du contenu, ni d’un système de plugins. Votre évaluateur reste votre propre service HTTP sur votre propre infrastructure, exactement comme décrit dans le guide Evaluation suite. La compétence apprend simplement à votre agent à le construire correctement — tout ce qu’elle fait, vous pourriez le faire vous-même en écrivant le même code.
La partie difficile, c’est de décider quoi noter
La surface du SDK est réduite — un décorateur et deux modèles — et un agent peut l’écrire à partir du seul contrat. Ce n’est pas là que les évaluateurs échouent. Ils échouent parce qu’ils mesurent la mauvaise chose, et un évaluateur qui mesure la mauvaise chose est pire qu’aucun : il produit un tableau de bord que tout le monde apprend à ignorer. L’essentiel de la compétence concerne donc ce qui précède tout code. Elle fait interviewer l’agent (« décrivez une exécution qui s’est bien passée ; maintenant une qui s’est mal passée »), puis lui fait parcourir vos vraies sessions via la CLIagenteye et les lire de bout en bout. Ces deux sources divergent généralement, et l’écart est justement le point central : ce que vous avez l’intention de mesurer par rapport à ce que vos transcriptions peuvent réellement étayer. Une dimension ne survit que si elle est calculable à partir des événements et discriminante — si elle donne 0,9 à la fois sur votre bonne exécution et sur la mauvaise, elle n’enseigne rien et est supprimée.
Ce qui en ressort est une proposition de 2 à 4 dimensions avec le raisonnement associé, que vous devez valider avant qu’une seule ligne ne soit écrite.
Relation avec les autres composants d’évaluation
Quatre pages couvrent le scoring, et se relaient dans l’ordre :Par rapport à la CLI skill : construire versus lire
Les deux compétences sont délibérément sans chevauchement, et les installer toutes les deux est la configuration habituelle — l’agent choisit entre elles en fonction de ce que vous demandez :agenteye-evaluator(ce doc) construit ce qui produit les scores. Sa mission se termine quand les scores arrivent pour la première fois.agenteye-clilit les scores déjà existants (agenteye evals). « La qualité a-t-elle baissé cette semaine ? » est sa question, pas celle de cette compétence.
Prérequis
- La CLI
agenteyeinstallée et connectée (pipx install agenteye, puisagenteye login). La compétence s’appuie dessus à deux reprises : pour récupérer les vraies sessions sur lesquelles elle se base lors de la conception, et pour confirmer que vos scores sont bien arrivés à la fin. Votre connexion nécessiteevents:read, plusevaluations:readpour cette vérification finale. Comme avec la CLI skill, elle ne peut pas compléter la connexion par code à usage unique envoyé par e-mail à votre place. - Un endroit où héberger l’évaluateur. Il est construit dans une image et exécuté en tant que service de longue durée, il a donc besoin d’un vrai dépôt, pas d’un fichier temporaire. Les évaluateurs vivent souvent dans leur propre dépôt, séparé de l’agent évalué — la compétence cherche un dépôt existant et demande avant d’en créer un nouveau.
- La roue SDK
agenteye-evaluator— lisez la section suivante avant que votre agent commence à taper des commandespip.
Où l’obtenir
La compétence est publiée dans la collection publique de compétences de Failproof AI : github.com/FailproofAI/skills →skills/agenteye-evaluator/
Le dépôt est public et la compétence n’a pas besoin de ses propres identifiants — elle pilote uniquement la CLI agenteye avec la session sur laquelle vous êtes connecté, et écrit du code dans votre dépôt. Notez qu’elle est livrée dans son propre dossier et n’est pas incluse dans le package pipx install agenteye, donc ne la cherchez pas là.
Installer la compétence
Le chemin le plus rapide passe par la CLIskills, qui récupère le dossier et le place là où votre agent le cherche :
SKILL.md (plus des références optionnelles), donc la copier fonctionne aussi :
- Claude Code : placez le dossier
agenteye-evaluator/dans~/.claude/skills/(tous les projets) ou<votre-dépôt>/.claude/skills/(ce dépôt uniquement). Claude Code le découvre automatiquement — vérifiez avec la liste/skills, ou demandez simplement des évals. - Codex (OpenAI) : Codex lit le même
SKILL.md. Le fichieragents/openai.yamlfourni définitallow_implicit_invocation: true, donc Codex sélectionne automatiquement la compétence quand une tâche correspond ; sinon invoquez-la explicitement avec$agenteye-evaluator.
Le SDK n’est pas sur PyPI public
Avertissement : Lisez ceci avant de laisser un agent installer le SDK.La compétence est publique ; le SDK qu’elle pilote ne l’est pas.
agenteye-evaluator est livré uniquement comme artefact de version privée, et contrairement à agenteye, le nom est non revendiqué sur PyPI public — donc un simple pip install agenteye-evaluator pourrait installer le package d’un inconnu dans le service qui lit vos transcriptions de production. C’est un problème de chaîne d’approvisionnement, pas une faute de frappe.
La compétence le sait et parcourt à la place une liste d’installation par priorité, s’arrêtant à la première qui s’applique : la source du monodépôt si vous êtes dans le dépôt AgentEye, sinon la roue de version privée depuis GitHub Releases (nécessite un accès), et si aucune n’est accessible, elle s’arrête et vous indique de demander la roue à votre contact Failproof AI plutôt que d’improviser.
Donc si votre agent propose un simple pip install agenteye-evaluator depuis PyPI public, c’est le signe que la compétence n’a jamais été chargée. Arrêtez-vous et vérifiez qu’elle est bien installée.
Ce que vous pouvez lui demander
Un vrai aller-retour commence par une demande vague et se termine par une conception validée, pas par du code :JobPending plutôt que de laisser votre juge être annulé et réessayé cinq fois au quintuple du coût.
Ensuite il déploie, définit les deux variables d’environnement serveur, et confirme avec agenteye --json evals --session-id <id> que les scores sont bien arrivés. L’arrivée des scores est la seule preuve.
Ce à quoi faire attention
- Les noms de dimensions sont quasi permanents. Les clés de score sont des chaînes arbitraires et la plateforme suit les tendances de tout ce que vous envoyez, ce qui signifie que rien en aval ne corrige un mauvais choix. Renommer plus tard divise l’historique : les anciennes sessions conservent l’ancienne clé et la tendance se brise. C’est pourquoi la compétence obtient une validation explicite avant d’écrire du code — prenez cette invite au sérieux.
- Les fixtures sont de vraies transcriptions de production. Concevoir à partir de vraies sessions signifie les télécharger sur le disque, et elles peuvent contenir des données clients. La compétence demande avant de les committer dans git ; en cas de doute, gardez
fixtures/hors du dépôt et faites récupérer les siennes à chaque développeur. - L’agent écrit et déploie un service qui lit chaque transcription. Il agit en votre nom, limité par les permissions de votre connexion CLI, mais examinez l’évaluateur comme n’importe quel autre code qui touche des données de production.
Prochaines étapes
- Evaluation suite : le contrat HTTP, le SDK et les variables d’environnement serveur que la compétence configure.
- Evaluations : là où les scores s’affichent une fois qu’ils arrivent.
- CLI skill : la compétence jumelle, pour lire les résultats plutôt que construire le scorer.
- CLI : la référence des commandes derrière les données de session sur lesquelles la compétence se base.

