Configurar um avaliador
1
Instalar o SDK do avaliador
Instale o SDK e o servidor necessário para executá-lo.
2
Definir o que será avaliado
Crie o arquivo
evaluator.py. Este exemplo verifica se uma sessão contém chamadas de ferramentas com falha.3
Executar e testar localmente
Defina um token compartilhado, inicie o avaliador e confirme que o endpoint de saúde responde.Em outro terminal:
Conectar o avaliador ao Failproof AI
- Faça o deploy do avaliador em uma URL HTTPS acessível pelo Failproof AI Cloud.
- Configure
EVALUATOR_ENDPOINTcom essa URL e definaEVALUATOR_TOKENcom o mesmo token usado pelo avaliador. Para o Cloud gerenciado, entre em contato com support@befailproof.ai para configurar a conexão. - Execute uma avaliação e confirme que as pontuações aparecem no Failproof AI.
- Dashboard
- CLI
Abra uma sessão concluída em Observe → Sessions e selecione Run evaluation se ela não foi avaliada automaticamente. Revise o status, as pontuações, o raciocínio e o resumo no painel Evaluation da sessão.Use Observe → Evaluations para comparar pontuações entre agentes ou ambientes. Use Observe → Metrics para medições de latência, custo, tokens e outros valores numéricos.Comece com uma sessão para confirmar que o avaliador retornou as chaves de pontuação esperadas e um raciocínio útil para aquela execução específica.
Quando os resultados individuais parecerem corretos, use o dashboard de avaliação para comparar essas pontuações ao longo do tempo e entre agentes ou ambientes.
Um gráfico saudável deve usar nomes de pontuação estáveis; alterar uma chave cria uma série separada.


EVALUATOR_ENDPOINT seja definido no processo do servidor. Reinicie o servidor após alterar variáveis de ambiente do avaliador.
O serviço expõe GET /health, GET /config, POST /evaluate e, opcionalmente, GET /evaluate/{job_id}. Retorne JobPending para trabalho assíncrono e registre @app.job_lookup para que o Failproof AI possa fazer polling.
Quando um token está configurado, todas as rotas, exceto health, exigem o mesmo bearer token que o Failproof AI envia como EVALUATOR_TOKEN.
Tipos do SDK
Decoradores e rotas
O SDK limita o corpo das requisições de avaliação em 25 MiB. Campos desconhecidos nas requisições são ignorados, mantendo a compatibilidade dos serviços conforme o contrato de eventos evolui.
Retornar trabalho assíncrono
UseJobPending quando a avaliação não puder ser concluída dentro de uma única requisição. O ID do job é opaco para o Failproof AI e deve permanecer resolvível pelo seu serviço até que o resultado seja coletado ou o timeout do servidor expire.
JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs e, em seguida, EVALUATOR_POLLING_INTERVAL_SECS do servidor. Os valores são limitados entre 1 segundo e 1 hora. O limite padrão de polling em tempo real do servidor é de uma hora.
Campos de requisição e resposta
Configurações do operador do servidor
A avaliação automática é global para o deployment e permanece desabilitada quandoEVALUATOR_ENDPOINT não está definido.
O servidor também pode restringir quais organizações utilizam o avaliador global do deployment. Trate as alterações de endpoint, token, retry e controle de acesso por organização como configuração de operador e reinicie ou atualize o servidor após modificá-las.
Segurança e operações
- Coloque o avaliador atrás de HTTPS quando o tráfego cruzar um limite de rede não confiável.
- Configure um bearer token não vazio e mantenha-o idêntico em ambos os serviços.
- Não registre em log o token nem prompts sensíveis completos dos payloads das requisições.
- Torne os handlers síncronos idempotentes; novas tentativas podem repetir uma requisição.
- Persista o estado de jobs assíncronos fora da memória do processo em produção.
- Retorne chaves de pontuação estáveis. Renomear uma chave cria uma nova série no gráfico em vez de alterar a existente.
eval received, eval responded, job lookup, config returned, auth rejected e exceções de handlers. Ele não configura handlers de logging; utilize a configuração de logging da aplicação hospedeira.
