Skip to main content
Visualisez en un seul endroit toutes les défaillances de vos agents, regroupées pour qu’une rafale d’erreurs apparaisse comme un problème unique. Vous disposez d’un accès en un clic entre « quelque chose est rouge » et l’exécution exacte qui a échoué, sans avoir à parcourir un flux en direct pour la retrouver. La page Erreurs : un histogramme des défaillances au fil du temps au-dessus de lignes d'erreurs rouges groupées, chacune avec un bouton « + alert » en un clic La page Erreurs : un histogramme des défaillances au fil du temps, avec les erreurs répétées regroupées en une seule ligne par incident.

Toutes les défaillances, déjà collectées pour vous

Quand un agent tombe en panne, vous ne devriez pas avoir à parcourir un flux d’événements en direct en espérant repérer les lignes rouges avant qu’elles disparaissent. La page Errors se charge de la collecte à votre place. Elle rassemble tout ce que le tableau de bord afficherait en rouge dans une interface de triage unique, de sorte que la première chose que vous voyez est ce qui échoue, et non l’endroit où chercher. Et elle détecte bien plus que les erreurs évidentes. En plus des événements error explicites, Failproof AI Observability remonte également les défaillances silencieuses : tout tool_result, hook_completed ou agent_end dont le contenu indique un échec apparaît ici. Un outil ayant retourné une erreur, ou un hook s’étant terminé de manière anormale, ne passe plus inaperçu simplement parce qu’aucune exception bruyante n’a été levée. En haut de la page, un histogramme trace l’évolution des erreurs dans le temps. Un simple coup d’œil vous indique s’il s’agit d’un filet constant en arrière-plan ou d’un pic apparu il y a quelques minutes, vous permettant de décider immédiatement si vous devez tout laisser tomber. Comme toutes les surfaces d’observation, la page Errors est limitée à votre organisation et se filtre par plage de dates, environnement, agent et session. Vous pouvez ainsi partir d’une liste couvrant l’ensemble de votre parc et la réduire à l’agent ou à l’environnement qui vous intéresse réellement.

Un seul incident, pas cent lignes identiques

Une dépendance défaillante peut déclencher la même erreur des centaines de fois par minute. Sans regroupement, cela donne un mur de lignes quasi identiques qui noie l’information dont vous avez vraiment besoin. Failproof AI Observability regroupe les défaillances répétées partageant la même session et le même type d’erreur en une seule ligne. Une rafale apparaît comme un seul incident. Vous comptez des problèmes, pas des lignes de log, et le signal qui compte reste en évidence au lieu d’être noyé par son propre volume.

De « quelque chose est rouge » à l’événement exact

Cliquez sur n’importe quelle ligne pour accéder directement à la session de cette exécution, positionné sur l’événement exact qui a échoué. Pas besoin de copier des identifiants de session ni de faire défiler pour trouver le moment de la rupture : vous arrivez directement dessus, avec le graphe d’exécution complet à portée de regard pour voir ce que l’agent faisait dans les instants précédant la défaillance. Si vous disposez de alerts:write, chaque ligne comporte également un bouton + alert. Cliquez dessus et Observability ouvre une nouvelle règle d’alerte déjà configurée pour détecter ce même type de défaillance. L’incident que vous venez de traiter deviendra celui qui vous alerte la prochaine fois, au lieu de vous surprendre une deuxième fois. Où le trouver : la page Errors se trouve dans la section observe du tableau de bord, à l’adresse /<org-slug>/errors.

Ressources associées

  • Alerts : transformez n’importe quelle défaillance en règle d’alerte.
  • Incidents : suivez une alerte déclenchée de son ouverture à sa résolution.
  • Sessions : ouvrez l’exécution complète derrière n’importe quelle erreur.
  • Audits : laissez Observability identifier les schémas de défaillance dans vos exécutions.