agenteye-evaluator), bir Ajan Becerisidir: bir kodlama ajan (Claude Code veya Codex gibi) tarafından isteğe bağlı olarak yüklenen, bir klasör içinde barındırılan talimatlar. Ajanı, sizin ajan için izlenmeye değer olan kalite boyutlarını belirlemek, ardından değerlendirici hizmetini yazıp, test edip ve dağıtmak öğretir.
Bu sistem değildir: barındırılan bir puanlayıcı, yüklendiğiniz bir kayıt defteri veya bir eklenti sistemi. Değerlendiricileriniz, Değerlendirme paketi kılavuzunda açıklandığı gibi, kendi altyapınızda çalışan kendi HTTP hizmetiniz olarak kalır. Beceri, ajanınızı bunu iyi inşa etmeyi öğretir; bu nedenle yaptığı her şey, aynı kodu yazarak siz de yapabilirsiniz.
Zor kısım neyi puanlamak gerektiğine karar vermek
SDK yüzeyi küçüktür — bir dekoratör ve iki model — ve bir ajan bunu kontratı tek başına yazabilir. Sorun burada değildir. Sorun, yanlış şeyi puanlamalarıdır; yanlış şeyi puanlayan bir değerlendirici hiç olmamasından daha kötüdür: herkesin görmezden gelmeyi öğrendiği bir pano üretir. Bu nedenle becerinin çoğu, kod yazmadan önceki kısımdır. Ajanı sizi görüşmeye (“iyi giden bir işlemi anlatın; şimdi kötü gideni”), ardındanagenteye CLI aracılığıyla gerçek seanslarınızı çekerek end-to-end okumaya alır. Bu iki yarı genellikle anlaşamaz ve arası fark önemlidir: ölçmeyi niyet ettiğiniz şey ile transkriplerinizin gerçekten destekleyebileceği şey arasındaki boşluk. Bir boyut ancak olaylardan hesaplanabilir ve ayırıcı ise hayatta kalır — eğer hem iyi çalışmanızda hem de kötü çalışmanızda 0.9 puan alırsa, hiçbir şey öğretmez ve kesilir.
Geri dönen şey, 2-4 boyutun bir teklifi ve ona ilişkin akıl yürütmedir; bir satır yazılmadan önce sizin onay vermeniz için.
Diğer değerlendirme bileşenleriyle ilişkisi
Dört belge puanlamayı kapsar ve sırayla birbirini devreye sokar:CLI becerisi ile karşılaştırma: oluştur versus oku
İki beceri kasıtlı olarak örtüşmez ve her ikisini yüklemek normal kurulumudur — ajan ne sorduğunuza bağlı olarak aralarında seçim yapar:agenteye-evaluator(bu belge) puanları üreten şeyi oluşturur. İşi puanlar ilk kez inmesi sırasında biter.agenteye-clizaten var olan puanları okur (agenteye evals). “Bu hafta kalite düştü mü?” onun sorusudur, bu becerinin değil.
Ön Koşullar
agenteyeCLI yüklü ve oturum açmış (pipx install agenteye, ardındanagenteye login). Beceri bunu iki kez kullanır: tasarladığı gerçek seansları çekmek için ve seansların sonunda puanlarınızın geldiğini doğrulamak için. Oturumunuzunevents:readgereksinimi vardır, ayrıca bu son kontrol içinevaluations:read. CLI becerisi ile birlikte, e-posta ile gönderilen tek kullanımlık kod girişini tamamlayamaz.- Değerlendiricinin yaşayacağı bir yer. Bir imaja yerleştirilir ve uzun süreli bir hizmet olarak çalıştırılır; bu nedenle gerçek bir repo’ya ihtiyaç vardır, geçici bir dosyaya değil. Değerlendiriciler sık sık kendi repo’sunda yaşar, puanlanan ajanından ayrı — beceri var olanı arar ve yeni bir tane oluşturmadan önce sorar.
agenteye-evaluatorSDK tekerleği — ajanınızpipkomutlarını yazmaya başlamadan sonraki bölümü okuyun.
Nereden alınır
Beceri, Failproof AI’ın herkese açık beceri koleksiyonunda yayınlanır: github.com/FailproofAI/skills →skills/agenteye-evaluator/
Depo herkese açıktır ve becerinin kendi kimlik bilgisine ihtiyacı yoktur — yalnızca agenteye CLI’yi oturum açtığınız seansla çalıştırır ve kodunuzu kendi repo’nuzda yazar. Kendi klasörü olarak gönderilir ve pipx install agenteye paketi içinde değildir; bu nedenle onu orada aramayın.
Becerisini Kurma
En hızlı yolskills CLI’dir; bu klasörü getirir ve ajanınızın baktığı yere bırakır:
SKILL.md içeren bir klasördür (artı isteğe bağlı referanslar); bu nedenle kopyalama işe yarar:
- Claude Code:
agenteye-evaluator/klasörünü~/.claude/skills/(her proje) veya<your-repo>/.claude/skills/(yalnızca bu repo) içine koyun. Claude Code bunu otomatik olarak bulur —/skillslistesi ile doğrulayın veya sadece evaluasyonlar isteyin. - Codex (OpenAI): Codex aynı
SKILL.mddosyasını okur. Paketlenmişagents/openai.yaml,allow_implicit_invocation: trueayarlar; bu nedenle bir görev eşleştiğinde Codex beceriyi otomatik seçer; aksi takdirde açıkça$agenteye-evaluatorolarak çağırın.
SDK genel PyPI’de değildir
Uyarı: Bir ajanın SDK yüklemesine izin vermeden önce bunu okuyun.Beceri herkese açıktır; onu çalıştırdığı SDK değildir.
agenteye-evaluator yalnızca özel bir sürüm yapı olarak gönderilir ve agenteye gibi farklı olarak, ad genel PyPI’de açıklanmadıdır — bu nedenle basit pip install agenteye-evaluator komutu, üretim transkriplerinizi okuyan hizmete başka bir kişinin paketini çekebilir. Bu bir yazım hatası değil, bir tedarik zinciri sorunudur.
Beceri bunu bilir ve yerine bir yükleme merdiveninde aşağı doğru çalışır; ilk geçerli basamağında durur: AgentEye repo’sunun içindeyseniz monorepo kaynağı; aksi takdirde GitHub Releases’ten özel sürüm tekerleği (erişim gerekir); ikisi de erişilemezse durur ve Failproof AI iletişim kişinizden tekerleği istemenizi söyler uydurmak yerine.
Eğer ajanınız genel PyPI’den basit pip install agenteye-evaluator önerirse, bu becerinin hiç yüklenmediğini gösterir. Orada durun ve yüklendiğini kontrol edin.
Ona ne sorabilirsiniz
Gerçek bir tur sonu, belirsiz bir sorudan imza faydalı bir tasarımla biter, kodla değil:JobPending ile eşzamansız gider, hakim iptal edilmiş ve beş kez yeniden denenmiş olmasına izin vermez.
Daha sonra dağıtır, iki sunucu ortam değişkenini ayarlar, ve agenteye --json evals --session-id <id> ile doğrular ki puanlar gerçekten indi. Puanlar inmek tek kanıttır.
Nelere dikkat edin
- Boyut adları neredeyse kalıcıdır. Puan anahtarları keyfi dizeler ve platform gönderdiğiniz şeyi eğilimlendirir; bu nedenle aşağı akış hiçbir şey kötü seçimi düzeltmez. Daha sonra yeniden adlandırın ve geçmiş bölünür: eski seanslar eski anahtarı tutar ve eğilim kırılır. Bu, becerinin kod yazmadan önce açık onay aldığı nedeni — bu istem ciddiye alın.
- Sabitler gerçek üretim transkriplerileridir. Gerçek seanslar aracılığıyla tasarlamak onları diske çekmek anlamına gelir ve müşteri verisi içerebilirler. Beceri git’e teslim etmeden önce sorar; şüphede,
fixtures/repo dışında tutun ve her geliştirici kendi tarafını çeksin. - Ajan her transkripti okuyan bir hizmet yazar ve dağıtır. Sizin olarak davranır, CLI oturumunuzun izinleriyle sınırlı; fakat üretim verisine dokunulan diğer kodlar gibi değerlendiriciye bakın.
Sonraki adımlar
- Değerlendirme paketi: HTTP kontratı, SDK ve becerinin yapılandırdığı sunucu ortam değişkenleri.
- Değerlendirmeler: puanlar indikten sonra nerede gösterildiği.
- CLI becerisi: puan oluşturmak yerine sonuçları okuyan kardeş beceri.
- CLI: becerinin tasarladığı seanslar verilerinin arkasındaki komut referansı.

