- 0 ile 1 arasında bir puan, isteğe bağlı olarak geçti veya başarısız olarak işaretlenmiş
- bir metrik, örneğin bir sayı, bir süre veya bir maliyet, birimiyle birlikte
- bir assertion, geçti veya geçmedi
İki tür değerlendirici
Barındırılan Python kasıtlı olarak küçüktür: bir ifade, içe aktarım yok, ağ yok. Bir modele ihtiyaç duyan herhangi bir şey — bir LLM yargıcının bir cevabın uygun olup olmadığını puanlandırması, örneğin — bunun yerine kendi worker’ınızda çalışır. Her iki tür de gelen bir bağlantıya ihtiyaç duymaz: worker’lar tamamlanan oturumları talep eder ve sonuçları giden HTTPS üzerinden gönderir.
Her organizasyon kendi ajanlarını değerlendirir
Değerlendirmeler onları tanımlayan organizasyona aittir. Bir instance’taki her organizasyon kendi değerlendirmesini yazar — kendi kontrolleri, koşulları, eşikleri ve etiketleri — sürümleri oluşturur ve diğerini etkilemeden dağıtır ve yalnızca kendi sonuçlarını görür. Bu sonuçları ajan, ortam, değerlendirme ve zamana göre filtreleyebilir veya asistana onlar hakkında sorabilirsiniz.İlk taslaktan canlı puanlara
1
Yazın
Neyi ölçeceğinizi açıklayın ve asistanın bunu hazırlamasını sağlayın veya kendiniz yazın. Bkz. Bir değerlendirme yazın.
2
Test edin
Canlı gitmeden önce bunu gerçek oturumlar karşısında çalıştırın; hiçbir şey depolanmaz. Bkz. Bir değerlendirmeyi test edin.
3
Dağıtın ve sürüm verin
Değişmez bir sürüm dağıtın, evrim geçirdiğinde yeni olanlar yayınlayın ve önceki birine geri dönün. Bkz. Dağıtım ve sürüm oluşturma.
4
Sonuçları okuyun
Puanları zaman içinde grafiklendirin, ajanları ve ortamları karşılaştırın ve asistana sorun. Bkz. Değerlendirme sonuçlarını okuyun.

