Skip to main content
Um avaliador recebe uma sessão de agente concluída e retorna os indicadores de qualidade que você precisa: pontuações numéricas, uma explicação para cada pontuação e um resumo opcional. O Failproof AI armazena esses resultados junto ao trace e os exibe em gráficos por agentes e ambientes.

Configurar um avaliador

1

Instalar o SDK do avaliador

Instale o SDK e o servidor utilizado para executá-lo.
2

Definir o que será avaliado

Crie o arquivo evaluator.py. Este exemplo verifica se uma sessão contém chamadas de ferramentas com falha.
3

Executar e testar localmente

Defina um token compartilhado, inicie o avaliador e confirme que o endpoint de saúde responde.
Em outro terminal:

Conectar o avaliador ao Failproof AI

  1. Faça o deploy do avaliador em uma URL HTTPS acessível pelo Failproof AI Cloud.
  2. Configure EVALUATOR_ENDPOINT com essa URL e defina EVALUATOR_TOKEN com o mesmo token utilizado pelo avaliador. Para o Cloud gerenciado, entre em contato com support@befailproof.ai para configurar a conexão.
  3. Execute uma avaliação e confirme que as pontuações aparecem no Failproof AI.
Abra uma sessão concluída em Observe → Sessions e selecione Run evaluation caso ela não tenha sido avaliada automaticamente. Revise o status, as pontuações, o raciocínio e o resumo no painel Evaluation da sessão.Use Observe → Evaluations para comparar pontuações entre agentes ou ambientes. Use Observe → Metrics para latência, custo, tokens e outras medições numéricas.Comece com uma única sessão para confirmar que o avaliador retornou as chaves de pontuação esperadas e um raciocínio útil para aquela execução específica.Uma visualização detalhada de sessão exibindo pontuações de avaliação e raciocínio ao lado do seu trace.Quando os resultados individuais estiverem corretos, use o dashboard de avaliações para comparar essas pontuações ao longo do tempo e entre agentes ou ambientes.Um dashboard de qualidade com gráfico de pontuações do avaliador ao longo do tempo.Um gráfico saudável deve usar nomes de pontuação estáveis; alterar uma chave cria uma série separada.
Em uma instância Cloud auto-hospedada, a avaliação automática fica desativada até que EVALUATOR_ENDPOINT seja definido no processo do servidor. Reinicie o servidor após alterar as variáveis de ambiente do avaliador. O serviço expõe GET /health, GET /config, POST /evaluate e opcionalmente GET /evaluate/{job_id}. Retorne JobPending para trabalhos assíncronos e registre @app.job_lookup para que o Failproof AI possa fazer polling. Quando um token está configurado, todas as rotas, exceto health, exigem o mesmo bearer token que o Failproof AI envia como EVALUATOR_TOKEN.

Tipos do SDK

Decoradores e rotas

O SDK limita o corpo das requisições de avaliação a 25 MiB. Campos desconhecidos nas requisições são ignorados, mantendo os serviços compatíveis à medida que o contrato de eventos evolui.

Retornar trabalho assíncrono

Use JobPending quando a avaliação não puder ser concluída dentro de uma única requisição. O ID do job é opaco para o Failproof AI e deve permanecer resolvível pelo seu serviço até que o resultado seja coletado ou o timeout do servidor expire.
A cadência de polling é selecionada nesta ordem: JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs e, em seguida, EVALUATOR_POLLING_INTERVAL_SECS do servidor. Os valores são limitados entre 1 segundo e 1 hora. O limite padrão de polling em tempo real do servidor é de uma hora.

Campos de requisição e resposta

Configurações para operadores do servidor

A avaliação automática é aplicada a todo o deployment e permanece desativada quando EVALUATOR_ENDPOINT não está definido. O servidor também pode restringir quais organizações utilizam o avaliador global do deployment. Trate alterações de endpoint, token, retry e controle de organização como configuração de operador e reinicie ou faça rollout do servidor após modificá-las.

Segurança e operações

  • Coloque o avaliador atrás de HTTPS quando o tráfego cruzar um limite de rede confiável.
  • Configure um bearer token não vazio e mantenha-o idêntico em ambos os serviços.
  • Não registre o token nem prompts sensíveis completos dos payloads de requisição.
  • Torne os handlers síncronos idempotentes; tentativas de retry podem repetir uma requisição.
  • Persista o estado de jobs assíncronos fora da memória do processo em produção.
  • Retorne chaves de pontuação estáveis. Renomear uma chave cria uma nova série no gráfico em vez de alterar a existente.
O SDK emite logs de ciclo de vida estruturados como eval received, eval responded, job lookup, config returned, auth rejected e exceções de handlers. Ele não configura handlers de logging; utilize a configuração de logging da aplicação host.