Skip to main content
Um avaliador recebe uma sessão de agente concluída e retorna os sinais de qualidade que importam para você: pontuações numéricas, uma explicação para cada pontuação e um resumo opcional. O Failproof AI armazena esses resultados ao lado do trace e os exibe em gráficos por agentes e ambientes.

Configurar um avaliador

1

Instalar o SDK do avaliador

Instale o SDK e o servidor necessário para executá-lo.
2

Definir o que será avaliado

Crie o arquivo evaluator.py. Este exemplo verifica se uma sessão contém chamadas de ferramentas com falha.
3

Executar e testar localmente

Defina um token compartilhado, inicie o avaliador e confirme que o endpoint de saúde responde.
Em outro terminal:

Conectar o avaliador ao Failproof AI

  1. Faça o deploy do avaliador em uma URL HTTPS acessível pelo Failproof AI Cloud.
  2. Configure EVALUATOR_ENDPOINT com essa URL e defina EVALUATOR_TOKEN com o mesmo token usado pelo avaliador. Para o Cloud gerenciado, entre em contato com support@befailproof.ai para configurar a conexão.
  3. Execute uma avaliação e confirme que as pontuações aparecem no Failproof AI.
Abra uma sessão concluída em Observe → Sessions e selecione Run evaluation se ela não foi avaliada automaticamente. Revise o status, as pontuações, o raciocínio e o resumo no painel Evaluation da sessão.Use Observe → Evaluations para comparar pontuações entre agentes ou ambientes. Use Observe → Metrics para medições de latência, custo, tokens e outros valores numéricos.Comece com uma sessão para confirmar que o avaliador retornou as chaves de pontuação esperadas e um raciocínio útil para aquela execução específica.Uma visualização de detalhe de sessão mostrando pontuações de avaliação e raciocínio ao lado do trace.Quando os resultados individuais parecerem corretos, use o dashboard de avaliação para comparar essas pontuações ao longo do tempo e entre agentes ou ambientes.Um dashboard de qualidade com gráficos de pontuações do avaliador ao longo do tempo.Um gráfico saudável deve usar nomes de pontuação estáveis; alterar uma chave cria uma série separada.
Para uma instância Cloud auto-hospedada, a avaliação automática fica desabilitada até que EVALUATOR_ENDPOINT seja definido no processo do servidor. Reinicie o servidor após alterar variáveis de ambiente do avaliador. O serviço expõe GET /health, GET /config, POST /evaluate e, opcionalmente, GET /evaluate/{job_id}. Retorne JobPending para trabalho assíncrono e registre @app.job_lookup para que o Failproof AI possa fazer polling. Quando um token está configurado, todas as rotas, exceto health, exigem o mesmo bearer token que o Failproof AI envia como EVALUATOR_TOKEN.

Tipos do SDK

Decoradores e rotas

O SDK limita o corpo das requisições de avaliação em 25 MiB. Campos desconhecidos nas requisições são ignorados, mantendo a compatibilidade dos serviços conforme o contrato de eventos evolui.

Retornar trabalho assíncrono

Use JobPending quando a avaliação não puder ser concluída dentro de uma única requisição. O ID do job é opaco para o Failproof AI e deve permanecer resolvível pelo seu serviço até que o resultado seja coletado ou o timeout do servidor expire.
A cadência de polling é selecionada nesta ordem: JobPending.next_poll_secs, EvaluatorConfig.default_poll_interval_secs e, em seguida, EVALUATOR_POLLING_INTERVAL_SECS do servidor. Os valores são limitados entre 1 segundo e 1 hora. O limite padrão de polling em tempo real do servidor é de uma hora.

Campos de requisição e resposta

Configurações do operador do servidor

A avaliação automática é global para o deployment e permanece desabilitada quando EVALUATOR_ENDPOINT não está definido. O servidor também pode restringir quais organizações utilizam o avaliador global do deployment. Trate as alterações de endpoint, token, retry e controle de acesso por organização como configuração de operador e reinicie ou atualize o servidor após modificá-las.

Segurança e operações

  • Coloque o avaliador atrás de HTTPS quando o tráfego cruzar um limite de rede não confiável.
  • Configure um bearer token não vazio e mantenha-o idêntico em ambos os serviços.
  • Não registre em log o token nem prompts sensíveis completos dos payloads das requisições.
  • Torne os handlers síncronos idempotentes; novas tentativas podem repetir uma requisição.
  • Persista o estado de jobs assíncronos fora da memória do processo em produção.
  • Retorne chaves de pontuação estáveis. Renomear uma chave cria uma nova série no gráfico em vez de alterar a existente.
O SDK emite logs de ciclo de vida estruturados como eval received, eval responded, job lookup, config returned, auth rejected e exceções de handlers. Ele não configura handlers de logging; utilize a configuração de logging da aplicação hospedeira.