failproofai-sdk içinde, failproofai_sdk.evaluator altında gemi olarak gönderilir; izleme SDK’sını içe aktarmak onu yüklemez.
Değerlendirmeler yazın
@app.eval(key, version=...)bir değerlendirmeyi kaydeder. Anahtar, sonuçlarının altında göründüğü şeydir; mantık değişirse sürümü değiştirin ve her sonuç onu üreten sürümü tutar. Bir çalışan 100 adede kadar değerlendirmeyi tutabilir.result_kindaksi belirtilmediği sürece"score"dir. Bir"metric"veya"assertion"değerlendirmesi için, birmetricsveyaassertionsgirişini anahtardan sonra adlandırın: bu giriş sonucu olur.whenbir oturumun uygulanıp uygulanmadığını belirler. Birini atlamak içinConditionResult(False, "<reason>")döndürün ve neden kaydedilir.- Bir değerlendirme düz bir işlev veya
asyncolabilir vetimeout_secondsonu sınırlar. - Yük anahtarları — yukarıdaki
tool_name,responsevecontent— aracılarınızın gönderdikleri şeydir, bu nedenle bunları gerçek bir oturumdan okuyun.
Çalışanı çalıştırın
Administration → Keys altında oluşturulanevaluations:run izinli bir anahtarı FAILPROOFAI_EVALUATOR_TOKEN içine koyun — bunu bir komuta yazıp yazıp yapmak yerine gizli deponuzdan ayarlayın — ve çalışanı başlatın:
__main__ bloğu olmadan, python -m failproofai_sdk.evaluator evaluator:app aynısını yapar.
Sonuç türleri
Bir
EvalResult en az bir puan, metrik veya iddaa tutar ve en fazla 25 tutar, her biri benzersiz bir anahtar altında.
Oturum
Her olay
id, ts, event_type ve payload taşır.
Eski değerlendirici
Daha önceki Evaluator SDK — Failproof AI’ın/evaluate adresinde EVALUATOR_ENDPOINT’de çağırdığı ve JobPending aracılığıyla yoklanan bir HTTP hizmeti — emekli olmuştur. Bu çalışan üzerinde yeni değerlendiriciler oluşturun; eski bir hizmet çalıştıran kendi kendini barındıran örneğin operatörleri bunu geçiş sırasında tutabilir.
