> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Ajanları değerlendir

> Tanımladığınız değerlendirmelerle her tamamlanan oturumu puanlandırın: barındırılan Python kontrolleri veya kendi worker'ınızdaki LLM yargıçlar.

Bir değerlendirme, tamamlanan bir ajan oturumunu puanlandırır. Bir oturum bittiğinde, ona uygulanan her etkinleştirilmiş değerlendirme çalışır ve bulduklarını kaydeder; izi yanında okuyabileceğiniz açıklamalarıyla birlikte:

* 0 ile 1 arasında bir **puan**, isteğe bağlı olarak geçti veya başarısız olarak işaretlenmiş
* bir **metrik**, örneğin bir sayı, bir süre veya bir maliyet, birimiyle birlikte
* bir **assertion**, geçti veya geçmedi

## İki tür değerlendirici

|                     | Barındırılan Python                                            | Kendi worker'ınız                                                          |
| ------------------- | -------------------------------------------------------------- | -------------------------------------------------------------------------- |
| Yazıldığı yer       | Panoda, **Analiz → eval authoring** altında                    | Python'da, [Evaluator SDK](/tr/reference/evaluator-sdk) ile                |
| Çalıştırıldığı yer  | Failproof AI'ın yönetilen değerlendiriicisinde, bir sandbox'ta | Kendi altyapınızda                                                         |
| En iyi kullanıldığı | Deterministik, kod tabanlı kontroller                          | LLM yargıçlar, model çağrıları, paketler, sırlar, ağ erişimi, yoğun işleme |

Barındırılan Python kasıtlı olarak küçüktür: bir ifade, içe aktarım yok, ağ yok. Bir modele ihtiyaç duyan herhangi bir şey — bir LLM yargıcının bir cevabın uygun olup olmadığını puanlandırması, örneğin — bunun yerine kendi worker'ınızda çalışır. Her iki tür de gelen bir bağlantıya ihtiyaç duymaz: worker'lar tamamlanan oturumları talep eder ve sonuçları giden HTTPS üzerinden gönderir.

## Her organizasyon kendi ajanlarını değerlendirir

Değerlendirmeler onları tanımlayan organizasyona aittir. Bir instance'taki her organizasyon kendi değerlendirmesini yazar — kendi kontrolleri, koşulları, eşikleri ve etiketleri — sürümleri oluşturur ve diğerini etkilemeden dağıtır ve yalnızca kendi sonuçlarını görür. Bu sonuçları ajan, ortam, değerlendirme ve zamana göre filtreleyebilir veya asistana onlar hakkında sorabilirsiniz.

## İlk taslaktan canlı puanlara

<Steps>
  <Step title="Yazın">
    Neyi ölçeceğinizi açıklayın ve asistanın bunu hazırlamasını sağlayın veya kendiniz yazın. Bkz. [Bir değerlendirme yazın](/tr/evaluations/write).
  </Step>

  <Step title="Test edin">
    Canlı gitmeden önce bunu gerçek oturumlar karşısında çalıştırın; hiçbir şey depolanmaz. Bkz. [Bir değerlendirmeyi test edin](/tr/evaluations/test).
  </Step>

  <Step title="Dağıtın ve sürüm verin">
    Değişmez bir sürüm dağıtın, evrim geçirdiğinde yeni olanlar yayınlayın ve önceki birine geri dönün. Bkz. [Dağıtım ve sürüm oluşturma](/tr/evaluations/deploy).
  </Step>

  <Step title="Sonuçları okuyun">
    Puanları zaman içinde grafiklendirin, ajanları ve ortamları karşılaştırın ve asistana sorun. Bkz. [Değerlendirme sonuçlarını okuyun](/tr/sessions/evaluations).
  </Step>
</Steps>

Değerlendirme ileriye doğru çalışır: şimdi dağıtılan bir sürüm, şimdi itibaren biten oturumları puanlandırır. Zaten sahip olduğunuz oturumları puanlandırmak için, [onları geri doldurun](/tr/evaluations/deploy#zaten-sahip-olduğunuz-oturumları-puanlayın).
