Configurar um avaliador
1
Instalar o SDK do avaliador
Instale o SDK e o servidor utilizado para executá-lo.
2
Definir o que será avaliado
Crie o arquivo
evaluator.py. Este exemplo verifica se uma sessão contém chamadas de ferramentas com falha.3
Executar e testar localmente
Defina um token compartilhado, inicie o avaliador e confirme que o endpoint de saúde responde.Em outro terminal:
Conectar o avaliador ao Failproof AI
- Faça o deploy do avaliador em uma URL HTTPS acessível pelo Failproof AI Cloud.
- Configure
EVALUATOR_ENDPOINTcom essa URL e definaEVALUATOR_TOKENcom o mesmo token utilizado pelo avaliador. Para o Cloud gerenciado, entre em contato com support@befailproof.ai para configurar a conexão. - Execute uma avaliação e confirme que as pontuações aparecem no Failproof AI.
- Dashboard
- CLI
Abra uma sessão concluída em Observe → Sessions e selecione Run evaluation caso ela não tenha sido avaliada automaticamente. Revise o status, as pontuações, o raciocínio e o resumo no painel Evaluation da sessão.Use Observe → Evaluations para comparar pontuações entre agentes ou ambientes. Use Observe → Metrics para latência, custo, tokens e outras medições numéricas.Comece com uma única sessão para confirmar que o avaliador retornou as chaves de pontuação esperadas e um raciocínio útil para aquela execução específica.
Quando os resultados individuais estiverem corretos, use o dashboard de avaliações para comparar essas pontuações ao longo do tempo e entre agentes ou ambientes.
Um gráfico saudável deve usar nomes de pontuação estáveis; alterar uma chave cria uma série separada.


EVALUATOR_ENDPOINT seja definido no processo do servidor. Reinicie o servidor após alterar as variáveis de ambiente do avaliador.
O serviço expõe GET /health, GET /config, POST /evaluate e opcionalmente GET /evaluate/{job_id}. Retorne JobPending para trabalhos assíncronos e registre @app.job_lookup para que o Failproof AI possa fazer polling.
Quando um token está configurado, todas as rotas, exceto health, exigem o mesmo bearer token que o Failproof AI envia como EVALUATOR_TOKEN.
Tipos do SDK
Decoradores e rotas
O SDK limita o corpo das requisições de avaliação a 25 MiB. Campos desconhecidos nas requisições são ignorados, mantendo os serviços compatíveis à medida que o contrato de eventos evolui.
Retornar trabalho assíncrono
UseJobPending quando a avaliação não puder ser concluída dentro de uma única requisição. O ID do job é opaco para o Failproof AI e deve permanecer resolvível pelo seu serviço até que o resultado seja coletado ou o timeout do servidor expire.
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs e, em seguida, EVALUATOR_POLLING_INTERVAL_SECS do servidor. Os valores são limitados entre 1 segundo e 1 hora. O limite padrão de polling em tempo real do servidor é de uma hora.
Campos de requisição e resposta
Configurações para operadores do servidor
A avaliação automática é aplicada a todo o deployment e permanece desativada quandoEVALUATOR_ENDPOINT não está definido.
O servidor também pode restringir quais organizações utilizam o avaliador global do deployment. Trate alterações de endpoint, token, retry e controle de organização como configuração de operador e reinicie ou faça rollout do servidor após modificá-las.
Segurança e operações
- Coloque o avaliador atrás de HTTPS quando o tráfego cruzar um limite de rede confiável.
- Configure um bearer token não vazio e mantenha-o idêntico em ambos os serviços.
- Não registre o token nem prompts sensíveis completos dos payloads de requisição.
- Torne os handlers síncronos idempotentes; tentativas de retry podem repetir uma requisição.
- Persista o estado de jobs assíncronos fora da memória do processo em produção.
- Retorne chaves de pontuação estáveis. Renomear uma chave cria uma nova série no gráfico em vez de alterar a existente.
eval received, eval responded, job lookup, config returned, auth rejected e exceções de handlers. Ele não configura handlers de logging; utilize a configuração de logging da aplicação host.
