> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Évaluations en ligne

> Évaluez les sessions en cours et terminées selon la qualité, la conformité, le coût et la latence.

Les évaluations en ligne appliquent des jugements cohérents aux sessions d'agents. Utilisez-les pour les signaux qui doivent être mesurés en continu plutôt qu'examinés uniquement lors d'un audit.

## Examiner la qualité des évaluations

<Tabs>
  <Tab title="Tableau de bord">
    1. Accédez à **Observe → Evaluations**.
    2. Ajoutez une série et choisissez l'agent, l'environnement, le score d'évaluation, la statistique et la courbe.
    3. Ajoutez des séries pour comparer des environnements, des agents ou des clés de score.
    4. Sélectionnez un résultat pour ouvrir les sessions correspondantes ou partager la vue filtrée. Utilisez **Observe → Metrics** pour la latence, les tokens, le coût et autres valeurs quantitatives.

           <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/dashboard-quality.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=74c925ae831046fc869a3a3d6e81fc25" alt="Un tableau de bord qualité affichant les scores d'évaluation moyens et les tendances dans le temps." width="2880" height="1800" data-path="images/dashboard/dashboard-quality.png" />

    Ouvrez une session depuis le détail pour inspecter le raisonnement par score :

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/session-detail.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=7b5f022dd5c485565a8cd92b2e936235" alt="Une vue détaillée d'une session montrant les scores d'évaluation et le raisonnement associé, à côté de la trace complète." width="3200" height="2000" data-path="images/dashboard/session-detail.png" />
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp evals --agent-id checkout-agent --aggregate
    fp evals --aggregate --env production --status error
    fp evals --score helpfulness:0.8.. --since 7d
    ```

    Ajoutez le flag global `--json` avant `evals` pour l'automatisation, par exemple `fp --json evals --aggregate --env production`.
  </Tab>
</Tabs>

Un évaluateur reçoit l'identité de la session, l'environnement, les horodatages et les événements ordonnés. Il peut retourner des clés de score numériques avec un raisonnement optionnel et un résumé. Les évaluateurs à longue durée d'exécution peuvent retourner un job en attente et être interrogés ultérieurement.

## Bonnes cibles d'évaluation

* Accomplissement des tâches ou exactitude
* Fondement et risque d'hallucination
* Sélection et efficacité des outils
* Conformité aux politiques ou aux processus
* Budgets de coût et de latence
* Escalade humaine requise

## Du score à la réponse

Affichez les scores dans des tableaux de bord pour suivre les tendances. Créez des alertes pour des seuils ou des conditions combinées. Lorsqu'un score baisse sur une population, lancez un audit pour en comprendre la cause ; lorsque la cause est une action reproductible, déployez une politique.

<Card title="Créer un évaluateur" icon="code-2" href="/fr/reference/evaluator-sdk">
  Implémentez une évaluation synchrone ou asynchrone avec le SDK Python pour évaluateurs.
</Card>
