> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Online-Auswertungen

> Bewerte aktive und abgeschlossene Sessions hinsichtlich Qualität, Compliance, Kosten und Latenz.

Online-Auswertungen wenden konsistente Beurteilungen auf Agent-Sessions an. Verwende sie für Signale, die kontinuierlich gemessen werden sollten – anstatt erst bei einem Audit untersucht zu werden.

## Auswertungsqualität prüfen

<Tabs>
  <Tab title="Dashboard">
    1. Gehe zu **Observe → Evaluations**.
    2. Füge eine Reihe hinzu und wähle den Agent, die Umgebung, den Auswertungswert, die Statistik und die Kurve.
    3. Füge weitere Reihen hinzu, um Umgebungen, Agents oder Score-Schlüssel zu vergleichen.
    4. Wähle ein Ergebnis aus, um passende Sessions zu öffnen oder die gefilterte Ansicht zu teilen. Nutze **Observe → Metrics** für Latenz, Tokens, Kosten und andere Mengenwerte.

           <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/dashboard-quality.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=74c925ae831046fc869a3a3d6e81fc25" alt="Ein Qualitäts-Dashboard mit durchschnittlichen Auswertungswerten und zeitlichen Trends." width="2880" height="1800" data-path="images/dashboard/dashboard-quality.png" />

    Öffne eine Session über die Drill-down-Ansicht, um die auswertungsspezifische Begründung zu prüfen:

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/session-detail.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=7b5f022dd5c485565a8cd92b2e936235" alt="Eine Session-Detailansicht mit Auswertungswerten und Begründungen neben dem vollständigen Trace." width="3200" height="2000" data-path="images/dashboard/session-detail.png" />
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp evals --agent-id checkout-agent --aggregate
    fp evals --aggregate --env production --status error
    fp evals --score helpfulness:0.8.. --since 7d
    ```

    Füge das globale Flag `--json` vor `evals` für die Automatisierung hinzu, z. B. `fp --json evals --aggregate --env production`.
  </Tab>
</Tabs>

Ein Evaluator erhält die Session-Identität, Umgebung, Zeitstempel und geordnete Ereignisse. Er kann numerische Score-Schlüssel mit optionaler Begründung und einer Zusammenfassung zurückgeben. Lang laufende Evaluatoren können einen ausstehenden Job zurückgeben und später abgefragt werden.

## Geeignete Auswertungsziele

* Aufgabenerfüllung oder Korrektheit
* Faktentreue und Halluzinationsrisiko
* Tool-Auswahl und Tool-Effizienz
* Richtlinien- oder Prozess-Compliance
* Kosten- und Latenzbudgets
* Erforderliche Eskalation an Menschen

## Von der Bewertung zur Reaktion

Zeige Werte in Dashboards an, um Trends zu verfolgen. Erstelle Alerts für Schwellenwerte oder zusammengesetzte Bedingungen. Wenn ein Score über eine Population hinweg sinkt, führe ein Audit durch, um die Ursache zu untersuchen; wenn die Ursache eine wiederholbare Aktion ist, setze eine Policy ein.

<Card title="Einen Evaluator erstellen" icon="code-2" href="/de/reference/evaluator-sdk">
  Implementiere synchrone oder asynchrone Auswertungen mit dem Python Evaluator SDK.
</Card>
