Skip to main content
Les résultats de chaque évaluation, qu’elle soit hébergée ou issue de votre propre worker, arrivent aux mêmes endroits.

Comparer les scores dans le temps

Accédez à Observe → evaluations.
  • Recent runs liste chaque évaluation dès qu’elle arrive : qu’elle provienne d’un évaluateur hébergé (managed) ou du vôtre (customer), l’agent et la session, l’évaluation et sa version, son statut, ainsi que son score ou ses métriques.
  • Score over time trace ce que vous demandez. Sélectionnez add series et choisissez un agent, un environnement, une évaluation et une statistique : avg, min, max, p50, p75, p90, p95, p99, stddev ou mode. Chaque série correspond à une ligne ; attribuez-lui sa propre curve pour l’afficher sur un graphique séparé. La page evaluations : des exécutions récentes étiquetées customer, un graphique Score over time avec des lignes de référence à 0,5 et 0,8, et une série calculant la moyenne de finished_clean sur tous les agents et environnements.
Une plage temporelle et une taille de bin s’appliquent à toutes les séries. Un bin fin permet de détecter un incident ; un bin grossier révèle une tendance, mais peut masquer les pics que vous recherchez. Un bucket sans aucun score correspond à un vide dans la courbe, jamais à un zéro, et des lignes de référence sont placées à 0,5 et 0,8.Chaque élément de la vue est encodé dans l’URL : share la copie, et quiconque l’ouvre voit exactement la comparaison que vous avez construite.
Tracez avg et p90 pour la même évaluation afin de vérifier si une bonne moyenne cache une queue problématique, ou comparez la même évaluation pour deux agents, ou pour la production et le staging, sur un même axe. Les coûts, latences et nombres de tokens, qui ont des unités, sont représentés sous Observe → metrics, avec un graphique par unité.

Comprendre pourquoi une session a obtenu un score faible

Ouvrez une session depuis Observe → sessions ; la grille affiche les scores de chaque session et permet de filtrer par plage de score. Le panneau latéral droit de la session présente d’abord le résumé de l’évaluation, puis une barre par score avec le raisonnement de l’évaluateur en dessous. Une vue détaillée de session affichant les scores d'évaluation et leur justification à côté de la trace complète.

Interroger l’assistant

Posez vos questions sur les données d’évaluation en langage naturel : « parle-moi de quelques évaluations récentes », ou demandez quels agents voient leurs scores baisser. L’assistant lit et analyse les résultats, puis répond avec des tableaux sur lesquels vous pouvez rebondir ; une question pertinente peut devenir une requête ou un dashboard. La page evaluations à côté de l'assistant, qui répond à « parle-moi de quelques évaluations récentes » avec un résumé des totaux, statuts et scores.

Surveiller et agir

  • Dashboards, sous Analyze → dashboards, suivent l’évolution des scores que vous mettez en avant, par agent et environnement, pour toute l’organisation. Un dashboard qualité affichant les scores d'évaluation moyens et leur évolution dans le temps.
  • Alerts vous notifient lorsqu’un score franchit un seuil. Consultez alerts.
  • Lorsqu’un score baisse sur de nombreuses sessions, lancez un audit pour en comprendre la cause ; si la cause est une action reproductible, rédigez une policy.