Skip to main content
Les évaluations en ligne appliquent des jugements cohérents aux sessions d’agents. Utilisez-les pour les signaux qui doivent être mesurés en continu plutôt qu’examinés uniquement lors d’un audit.

Examiner la qualité des évaluations

  1. Accédez à Observe → Evaluations.
  2. Ajoutez une série et choisissez l’agent, l’environnement, le score d’évaluation, la statistique et la courbe.
  3. Ajoutez des séries pour comparer des environnements, des agents ou des clés de score.
  4. Sélectionnez un résultat pour ouvrir les sessions correspondantes ou partager la vue filtrée. Utilisez Observe → Metrics pour la latence, les tokens, le coût et autres valeurs quantitatives. Un tableau de bord qualité affichant les scores d'évaluation moyens et les tendances dans le temps.
Ouvrez une session depuis le détail pour inspecter le raisonnement par score :Une vue détaillée d'une session montrant les scores d'évaluation et le raisonnement associé, à côté de la trace complète.
Un évaluateur reçoit l’identité de la session, l’environnement, les horodatages et les événements ordonnés. Il peut retourner des clés de score numériques avec un raisonnement optionnel et un résumé. Les évaluateurs à longue durée d’exécution peuvent retourner un job en attente et être interrogés ultérieurement.

Bonnes cibles d’évaluation

  • Accomplissement des tâches ou exactitude
  • Fondement et risque d’hallucination
  • Sélection et efficacité des outils
  • Conformité aux politiques ou aux processus
  • Budgets de coût et de latence
  • Escalade humaine requise

Du score à la réponse

Affichez les scores dans des tableaux de bord pour suivre les tendances. Créez des alertes pour des seuils ou des conditions combinées. Lorsqu’un score baisse sur une population, lancez un audit pour en comprendre la cause ; lorsque la cause est une action reproductible, déployez une politique.

Créer un évaluateur

Implémentez une évaluation synchrone ou asynchrone avec le SDK Python pour évaluateurs.