Configurer un évaluateur
1
Installer le SDK de l'évaluateur
Installez le SDK et le serveur nécessaire pour l’exécuter.
2
Définir ce qui doit être évalué
Créez
evaluator.py. Cet exemple vérifie si une session contient des appels d’outils ayant échoué.3
Exécuter et tester localement
Définissez un token partagé, démarrez l’évaluateur et vérifiez que son endpoint de santé répond.Dans un autre terminal :
Connecter l’évaluateur à Failproof AI
- Déployez l’évaluateur à une URL HTTPS accessible par Failproof AI Cloud.
- Configurez
EVALUATOR_ENDPOINTavec cette URL et définissezEVALUATOR_TOKENavec le même token que celui utilisé par l’évaluateur. Pour le Cloud géré, contactez support@befailproof.ai afin de configurer la connexion. - Lancez une évaluation et confirmez que les scores apparaissent dans Failproof AI.
- Tableau de bord
- CLI
Ouvrez une session terminée sous Observe → Sessions et sélectionnez Run evaluation si elle n’a pas été évaluée automatiquement. Consultez le statut, les scores, le raisonnement et le résumé dans le panneau Evaluation de la session.Utilisez Observe → Evaluations pour comparer les scores entre agents ou environnements. Utilisez Observe → Metrics pour la latence, les coûts, les tokens et d’autres mesures numériques.Commencez par une seule session pour confirmer que l’évaluateur a renvoyé les clés de scores attendues et un raisonnement pertinent pour cette exécution spécifique.
Une fois que les résultats individuels semblent corrects, utilisez le tableau de bord d’évaluation pour comparer ces scores dans le temps et entre agents ou environnements.
Un graphique sain doit utiliser des noms de scores stables ; le changement d’une clé crée une série distincte.


EVALUATOR_ENDPOINT soit défini sur le processus serveur. Redémarrez le serveur après avoir modifié les variables d’environnement de l’évaluateur.
Le service expose GET /health, GET /config, POST /evaluate et optionnellement GET /evaluate/{job_id}. Renvoyez JobPending pour les traitements asynchrones et enregistrez @app.job_lookup afin que Failproof AI puisse interroger périodiquement le service.
Lorsqu’un token est configuré, toutes les routes sauf celle de santé nécessitent le même bearer token que Failproof AI envoie en tant que EVALUATOR_TOKEN.
Types du SDK
Décorateurs et routes
Le SDK limite la taille des corps de requêtes d’évaluation à 25 Mio. Les champs de requête inconnus sont ignorés afin que les services restent compatibles au fur et à mesure que le contrat d’événements évolue.
Retourner un travail asynchrone
UtilisezJobPending lorsque l’évaluation ne peut pas se terminer dans une seule requête. L’identifiant de tâche est opaque pour Failproof AI et doit rester résolvable par votre service jusqu’à ce que le résultat soit collecté ou que le délai d’expiration du serveur soit atteint.
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs, puis EVALUATOR_POLLING_INTERVAL_SECS du serveur. Les valeurs sont limitées entre 1 seconde et 1 heure. Le plafond d’interrogation horloge murale par défaut du serveur est d’une heure.
Champs de requête et de réponse
Paramètres de l’opérateur serveur
L’évaluation automatique s’applique à l’ensemble du déploiement et reste désactivée lorsqueEVALUATOR_ENDPOINT est absent.
Le serveur peut également restreindre les organisations qui utilisent l’évaluateur global du déploiement. Traitez les modifications de l’endpoint, du token, des tentatives et du filtrage par organisation comme une configuration opérateur, et redémarrez ou rechargez le serveur après les avoir appliquées.
Sécurité et exploitation
- Placez l’évaluateur derrière HTTPS lorsque le trafic traverse une frontière réseau non approuvée.
- Configurez un bearer token non vide et maintenez-le identique sur les deux services.
- Ne journalisez pas le token ni les prompts sensibles complets des charges utiles de requêtes.
- Rendez les handlers synchrones idempotents ; les tentatives peuvent répéter une requête.
- Persistez l’état des tâches asynchrones en dehors de la mémoire du processus en production.
- Utilisez des clés de scores stables. Renommer une clé crée une nouvelle série de graphique plutôt que de modifier l’ancienne.
eval received, eval responded, job lookup, config returned, auth rejected et les exceptions des handlers. Il ne configure pas les handlers de journalisation ; utilisez la configuration de journalisation de l’application hôte.
