- un score de 0 à 1, éventuellement marqué comme réussi ou échoué
- une métrique, telle qu’un comptage, une durée ou un coût, avec son unité
- une assertion, qui a réussi ou non
Deux types d’évaluateur
Le Python hébergé est volontairement minimaliste : une seule expression, sans imports, sans réseau. Tout ce qui nécessite un modèle — un juge LLM évaluant la pertinence d’une réponse, par exemple — s’exécute dans votre propre worker à la place. Aucun des deux types ne nécessite de connexion entrante : les workers récupèrent les sessions terminées et soumettent les résultats via HTTPS sortant.
Chaque organisation évalue ses propres agents
Les évaluations appartiennent à l’organisation qui les définit. Chaque organisation sur une instance rédige les siennes — ses propres vérifications, conditions, seuils et libellés — les versionne et les déploie sans affecter les autres, et ne consulte que ses propres résultats. Filtrez ces résultats par agent, environnement, évaluation et période, ou interrogez l’assistant à leur sujet.Du premier brouillon aux scores en production
1
Rédigez-la
Décrivez ce que vous souhaitez mesurer et laissez l’assistant en rédiger une ébauche, ou écrivez-la vous-même. Voir Rédiger une évaluation.
2
Testez-la
Exécutez-la sur de vraies sessions avant sa mise en production ; rien n’est enregistré. Voir Tester une évaluation.
3
Déployez-la et versionnez-la
Déployez une version immuable, publiez de nouvelles versions à mesure qu’elle évolue, et revenez à une version antérieure si nécessaire. Voir Déployer et versionner.
4
Consultez les résultats
Visualisez les scores dans le temps, comparez les agents et les environnements, et interrogez l’assistant. Voir Consulter les résultats des évaluations.

