Skip to main content
Evaluator SDK, değerlendirmeleri kendi altyapınızda çalıştırır. Çalışanınız, değerlendirmelerini Failproof AI’ya kaydeder, oturumlar bittiğinde talep eder, bunları puanlar ve sonuçları gönderir — tümü giden HTTPS üzerinden: hiçbir şey ona bağlanmaz. Barındırılan Python’un yapamadığı şeyler için kullanın — LLM yargıçlar, model çağrıları, paketler, sırlar ve ağ erişimi. Sonuçları, değerlendirmeler sayfasında barındırılan olanların yanında görünür, customer etiketi ile etiketlenir. failproofai-sdk içinde, failproofai_sdk.evaluator altında gemi olarak gönderilir; izleme SDK’sını içe aktarmak onu yüklemez.

Değerlendirmeler yazın

  • @app.eval(key, version=...) bir değerlendirmeyi kaydeder. Anahtar, sonuçlarının altında göründüğü şeydir; mantık değişirse sürümü değiştirin ve her sonuç onu üreten sürümü tutar. Bir çalışan 100 adede kadar değerlendirmeyi tutabilir.
  • result_kind aksi belirtilmediği sürece "score" dir. Bir "metric" veya "assertion" değerlendirmesi için, bir metrics veya assertions girişini anahtardan sonra adlandırın: bu giriş sonucu olur.
  • when bir oturumun uygulanıp uygulanmadığını belirler. Birini atlamak için ConditionResult(False, "<reason>") döndürün ve neden kaydedilir.
  • Bir değerlendirme düz bir işlev veya async olabilir ve timeout_seconds onu sınırlar.
  • Yük anahtarları — yukarıdaki tool_name, response ve content — aracılarınızın gönderdikleri şeydir, bu nedenle bunları gerçek bir oturumdan okuyun.

Çalışanı çalıştırın

Administration → Keys altında oluşturulan evaluations:run izinli bir anahtarı FAILPROOFAI_EVALUATOR_TOKEN içine koyun — bunu bir komuta yazıp yazıp yapmak yerine gizli deponuzdan ayarlayın — ve çalışanı başlatın:
__main__ bloğu olmadan, python -m failproofai_sdk.evaluator evaluator:app aynısını yapar.
FAILPROOFAI_EVALUATOR_ALLOW_INSECURE_HTTP her şeyi açık metin olarak gönderir. Çalışan, FAILPROOFAI_EVALUATOR_TOKEN değerini her istekte Authorization: Bearer başlığı olarak taşır ve getirdiği yazılı tutanaklar oturumların kendisidir — bu nedenle yoldaki herkes ikisini de okur ve okuduğu token, siz döndürmediğiniz sürece değerlendirmeleri çalıştırır. Bunu yalnızca yalıtılmış bir geliştirme ağında kullanın. Başka her yerde URL HTTPS olmalıdır; loopback hiçbir bayrak gerektirmez.

Sonuç türleri

Bir EvalResult en az bir puan, metrik veya iddaa tutar ve en fazla 25 tutar, her biri benzersiz bir anahtar altında.

Oturum

Her olay id, ts, event_type ve payload taşır.

Eski değerlendirici

Daha önceki Evaluator SDK — Failproof AI’ın /evaluate adresinde EVALUATOR_ENDPOINT’de çağırdığı ve JobPending aracılığıyla yoklanan bir HTTP hizmeti — emekli olmuştur. Bu çalışan üzerinde yeni değerlendiriciler oluşturun; eski bir hizmet çalıştıran kendi kendini barındıran örneğin operatörleri bunu geçiş sırasında tutabilir.