
Arrêtez de contrôler manuellement les exécutions
Vous vérifiez encore quelques exécutions au hasard en espérant que le reste est correct. Désormais, chaque session terminée est scorée au moment où elle se termine, selon les dimensions qui vous importent : utilité, efficacité des outils, factualité, sécurité, quel que soit votre seuil de qualité. Vous définissez les clés de score ; Failproof AI Observability stocke, suit les tendances et affiche tout ce que votre évaluateur renvoie. Aucune exécution ne passe sans être scorée, et vous n’apprendrez plus une régression via un ticket de support. Les scores apparaissent dans la grille des sessions à/<org-slug>/sessions (barre latérale → observe → sessions), avec un groupe de badges par ligne. Vous voulez uniquement les exécutions en dessous du seuil ? Filtrez la grille par plage de scores — par exemple, une utilité inférieure à 0,5 — pour afficher exactement les exécutions qui méritent d’être lues. La consultation des scores nécessite la permission evaluations:read.
Comprendre pourquoi une exécution a obtenu un score faible
Un chiffre vous indique qu’une exécution était faible ; la page de session vous explique pourquoi. Ouvrez n’importe quelle exécution et le panneau de droite commence par le résumé principal, puis affiche une barre par dimension avec le raisonnement de votre évaluateur sous chacune — ainsi, vous passez de « cette exécution a obtenu 0,4 en factualité » à l’affirmation exacte qui était incorrecte en quelques secondes.
evaluations:trigger) rescote la session sur place et ajoute le nouveau résultat à sa chronologie, de sorte que les scores antérieurs restent visibles comme historique. Vous le trouverez à /<org-slug>/sessions/<session-id>.
Suivre l’évolution de la qualité sur l’ensemble du parc
Une exécution avec un score faible est du bruit ; toute une cohorte qui glisse est un signal. Les tableaux de bord sauvegardés transforment vos scores en une tendance que vous pouvez surveiller d’un coup d’œil : utilité moyenne cette semaine par rapport à la semaine dernière, par agent, par environnement.
/<org-slug>/dashboards (barre latérale → analyze → dashboards), sont partagés dans toute votre organisation, et chaque carte regroupe les sessions correspondantes : leur nombre, la moyenne de chaque score mis en avant et un graphique sparkline de tendance. « Open in sessions » vous amène directement aux exécutions pré-filtrées derrière n’importe quel chiffre. La consultation nécessite dashboards:read ainsi que evaluations:read.
Connecter un évaluateur une seule fois
Le scoring est optionnel et reste complètement désactivé jusqu’à ce que vous pointiez Failproof AI Observability vers un scorer. Vous déployez un petit service HTTP (Observability fournit une référence fonctionnelle que vous pouvez copier), définissez deux valeurs sur votre serveur, et chaque exécution à partir de ce moment est scorée pour vous. Le guide complet, le contrat de scoring et le SDK se trouvent dans le guide approfondi. Vous ne savez pas quelles dimensions valent la peine d’être scorées ? La compétence d’agent évaluateur fait travailler votre agent de code pour les déterminer à partir de vos propres sessions, puis construire et déployer le service.Liens connexes
- Suite d’évaluation : connecter votre évaluateur, le contrat de scoring et le SDK.
- Compétence d’agent évaluateur : laissez un agent de code choisir vos dimensions de score et construire l’évaluateur.
- Sessions : la grille exécution par exécution où les scores apparaissent.
- Tableaux de bord : sauvegardez et partagez les tendances de qualité dans votre organisation.
- Audits : l’autre fonctionnalité de qualité automatique d’Observability, pour les investigations inter-sessions.

