Skip to main content
Çevrimiçi değerlendirmeler, ajan oturumlarına tutarlı kararlar uygular. Yalnızca denetim sırasında araştırılması yerine sürekli olarak ölçülmesi gereken sinyaller için bunları kullanın.

Değerlendirme kalitesini gözden geçirin

  1. Observe → Evaluations sayfasına gidin.
  2. Bir seri ekleyin ve ajan, ortam, değerlendirme puanı, istatistik ve eğriyi seçin.
  3. Ortamları, ajanları veya puan anahtarlarını karşılaştırmak için seri ekleyin.
  4. Eşleşen oturumları açmak veya filtrelenmiş görünümü paylaşmak için bir sonucu seçin. Gecikme, token, maliyet ve diğer büyüklük değerleri için Observe → Metrics kullanın. Ortalama değerlendirme puanlarını ve zaman içindeki eğilimleri gösteren bir kalite panosu.
Her puan için akıl yürütmeyi incelemek için drill-down’dan bir oturum açın:Değerlendirme puanlarını ve akıl yürütmeyi tam iz yanında gösteren bir oturum ayrıntı görünümü.
Bir değerlendirici, oturum kimliğini, ortamı, zaman damgalarını ve sıralanmış olayları alır. İsteğe bağlı akıl yürütme ve bir özet ile sayısal puan anahtarlarını döndürebilir. Uzun süre çalışan değerlendiriciler, beklemede bir iş döndürebilir ve daha sonra sorgulanabilir.

İyi değerlendirme hedefleri

  • Görev tamamlanması veya doğruluğu
  • Gerçeklilik ve halüsinasyon riski
  • Araç seçimi ve araç verimliliği
  • İlke veya süreç uyumu
  • Maliyet ve gecikme bütçeleri
  • Gerekli insan eskalasyonu

Puandan yanıta

Eğilimleri izlemek için puanları panolarda gösterin. Eşikler veya bileşik koşullar için uyarılar oluşturun. Bir puanın bir popülasyon genelinde düşmesi durumunda, nedenini araştırmak için bir denetim çalıştırın; neden tekrarlanabilir bir eylem ise, bir ilke yayınlayın.

Bir değerlendirici oluşturun

Python değerlendirici SDK’sı ile senkron veya asenkron değerlendirme uygulayın.