Générer une ébauche à partir d’une description
- Accédez à Analyze → eval authoring et sélectionnez new eval.
- Décrivez ce que vous souhaitez mesurer en langage courant, ou choisissez start from an example…, puis sélectionnez draft.
- Examinez les champs et le code généré, puis testez-le et déployez-le.

Configurer les champs
Utilisez la condition pour cibler une évaluation sur les agents et environnements auxquels elle est destinée :
Écrire le code vous-même
Le evaluator code est une expression Python unique qui retourneEvalResult(...), avec session dans la portée. Celle-ci calcule la proportion de résultats d’outils retournés avec le statut ok :
score= pour une évaluation de score, ou une entrée metrics ou assertions portant le nom de la clé pour une évaluation de métrique ou d’assertion. D’autres métriques et assertions peuvent l’accompagner, jusqu’à 25 résultats par exécution.
Rien d’autre n’est accessible : pas d’imports, et aucun attribut au-delà des données de session et des méthodes de chaînes et de dictionnaires courantes comme
get, lower et split, qui doivent être appelées et non simplement référencées. Les clés de payload correspondent à ce que vos agents envoient — status ci-dessus n’est qu’un exemple — lisez-les donc depuis une vraie session. format met en forme le code et fix demande à l’assistant de le corriger. Le code peut faire jusqu’à 128 Kio, et la condition jusqu’à 16 Kio.


