Skip to main content
Les évaluations hébergées sont de petits scripts Python déterministes, écrits dans le tableau de bord et exécutés sur la flotte d’évaluateurs de Failproof AI. La logique plus lourde — un juge LLM, un package, un secret, un appel réseau — s’exécute plutôt dans votre propre worker.

Générer une ébauche à partir d’une description

  1. Accédez à Analyze → eval authoring et sélectionnez new eval.
  2. Décrivez ce que vous souhaitez mesurer en langage courant, ou choisissez start from an example…, puis sélectionnez draft.
  3. Examinez les champs et le code généré, puis testez-le et déployez-le.
La page d'authoring d'évaluation avec une ébauche générée : la description, les notes de l'assistant sur l'ébauche, ainsi que les champs name, key, version, result, timeout, labels et condition. L’ébauche s’appuie sur les événements propres à votre organisation : la page lit les clés de payload que vos sessions ont transportées au cours des sept derniers jours, de sorte que le code utilise des clés qui existent réellement plutôt que des suppositions. Avant de vous remettre l’ébauche, l’assistant la teste sur jusqu’à cinq de vos sessions récentes, corrige tout ce qu’il peut prouver être cassé — jusqu’à trois itérations — et vérifie une fois que le code mesure bien ce que vous avez demandé. Soyez précis dans votre description : les prompts trop larges sont plus lents et peuvent expirer. Examinez le code dans tous les cas ; le déploiement n’est jamais bloqué.

Configurer les champs

Utilisez la condition pour cibler une évaluation sur les agents et environnements auxquels elle est destinée :
La clé, la version, le type de résultat, la condition et le code sont immuables une fois déployés : pour en modifier l’un d’eux, publiez une nouvelle version. Le nom, les labels et l’état d’activation restent modifiables.

Écrire le code vous-même

Le evaluator code est une expression Python unique qui retourne EvalResult(...), avec session dans la portée. Celle-ci calcule la proportion de résultats d’outils retournés avec le statut ok :
Un résultat commence par la clé propre à l’évaluation, dans son type déclaré : score= pour une évaluation de score, ou une entrée metrics ou assertions portant le nom de la clé pour une évaluation de métrique ou d’assertion. D’autres métriques et assertions peuvent l’accompagner, jusqu’à 25 résultats par exécution. Rien d’autre n’est accessible : pas d’imports, et aucun attribut au-delà des données de session et des méthodes de chaînes et de dictionnaires courantes comme get, lower et split, qui doivent être appelées et non simplement référencées. Les clés de payload correspondent à ce que vos agents envoient — status ci-dessus n’est qu’un exemple — lisez-les donc depuis une vraie session. format met en forme le code et fix demande à l’assistant de le corriger. Le code peut faire jusqu’à 128 Kio, et la condition jusqu’à 16 Kio. L'éditeur de code de l'évaluateur, avec les boutons format et fix, affichant les assertions d'une évaluation générée.

L’exécuter dans votre propre worker

Lorsqu’une évaluation nécessite un modèle, un package, un secret ou le réseau, écrivez-la avec l’Evaluator SDK et exécutez-la sur votre propre infrastructure. Elle utilise les mêmes types de résultats, et ses résultats apparaissent à côté des évaluations hébergées, avec le tag customer :