Skip to main content
Barındırılan değerlendirmeler, panoda yazılan ve Failproof AI’nin değerlendirici filosunda çalıştırılan küçük, belirleyici Python kodlarıdır. Daha ağır mantık — bir LLM hakim, bir paket, bir gizli anahtar, bir ağ çağrısı — bunun yerine kendi worker’ınızda çalışır.

Bir açıklamadan taslak oluşturun

  1. Analyze → eval authoring öğesine gidin ve new eval öğesini seçin.
  2. Ölçülecek şeyi düz İngilizce’de açıklayın veya start from an example… öğesinden seçim yapın ve draft öğesini seçin.
  3. Alanları ve doldurduğu kodu gözden geçirin, ardından test edin ve dağıtın.
Taslak bir değerlendirme içeren eval authoring sayfası: açıklama, taslaağa ilişkin asistanın notları ve ad, anahtar, sürüm, sonuç, zaman aşımı, etiketler ve koşul alanları. Taslak, kuruluşunuzun kendi etkinliklerine dayanır: sayfa, oturumlarınızın son yedi gün içinde hangi yük anahtarlarını taşıdığını okur, böylece kod tahmin etmek yerine var olan anahtarları okur. Taslağı teslim etmeden önce, asistan onu son oturumlarınızdan beşe kadarına karşı test eder, kanıtlayabileceği herhangi bir şeyi onarır — üç tura kadar — ve kodu istediğiniz şeyi ölçüp ölçmediğini bir kez daha kontrol eder. Açıklamayı spesifik tutun: geniş istekler daha yavaş olabilir ve zaman aşımına uğrayabilir. Her halükarda kodu gözden geçirin; dağıtım asla engellenmez.

Alanları ayarlayın

Bir değerlendirmeyi bunu amaçlayan aracılara ve ortamlara kapsamı belirlemek için koşulu kullanın:
Anahtar, sürüm, sonuç türü, koşul ve kod dağıtıldıktan sonra değişmezdir: bunlardan herhangi birini değiştirmek için yeni bir sürüm yayınlayın. Ad, etiketler ve etkinleştirilip etkinleştirilmediği düzenlenebilir kalır.

Kodu kendiniz yazın

Evaluator kodu, EvalResult(...) döndüren tek bir Python ifadesidir ve session kapsamındadır. Bu, araç sonuçlarının iyi olma oranını puanlar:
Bir sonuç değerlendirmenin kendi anahtarı ile başlar, deklaresi edilen türünde: bir skor değerlendirmesi için score= veya bir metrik veya assertion değerlendirmesi için anahtarla adlandırılan metrics veya assertions girişi. Diğer metrikler ve iddialar bununla birlikte gider, bir çalışmada 25’e kadar sonuç. Başka hiçbir şeye ulaşılamaz: içe aktarma yok ve oturum verileri ve get, lower ve split gibi düz dize ve sözlük yöntemleri dışında hiçbir öznitelik yoktur ve bunlar başvurulan değil, çağrılan şeylerse. Yük anahtarları aracılarınızın gönderdiği şeydir — yukarıdaki status yalnızca bir örnektir — bunları gerçek bir oturumdan okuyun. format kodu temizler ve fix asistandan bunu onarmalarını ister. Kod 128 KiB’e kadar olabilir ve koşul 16 KiB’e kadar olabilir. Evaluator kod editörü, biçim ve onarım ile birlikte, taslak bir değerlendirmenin iddialarını gösterir.

Bunu kendi worker’ınızda yazın

Bir değerlendirme bir modele, bir pakete, bir gizli anahtara veya ağa ihtiyaç duyduğunda, onu Evaluator SDK ile yazın ve kendi altyapınızda çalıştırın. Aynı sonuç türlerini kullanır ve sonuçları barındırılan olanların yanında görünür, customer olarak etiketlenir: