Skip to main content
As avaliações online aplicam julgamentos consistentes às sessões do agente. Use-as para sinais que devem ser medidos continuamente, em vez de investigados apenas durante uma auditoria.

Revisar a qualidade das avaliações

  1. Acesse Observe → Evaluations.
  2. Adicione uma série e escolha o agente, o ambiente, a pontuação da avaliação, a estatística e a curva.
  3. Adicione séries para comparar ambientes, agentes ou chaves de pontuação.
  4. Selecione um resultado para abrir as sessões correspondentes ou compartilhar a visualização filtrada. Use Observe → Metrics para latência, tokens, custo e outros valores de magnitude. Um dashboard de qualidade exibindo pontuações médias de avaliação e tendências ao longo do tempo.
Abra uma sessão no drill-down para inspecionar o raciocínio por pontuação:Uma visualização detalhada de sessão exibindo pontuações de avaliação e raciocínio ao lado do trace completo.
Um avaliador recebe a identidade da sessão, o ambiente, os timestamps e os eventos ordenados. Ele pode retornar chaves de pontuação numéricas com raciocínio opcional e um resumo. Avaliadores de longa duração podem retornar um job pendente e ser consultados posteriormente.

Bons alvos de avaliação

  • Conclusão de tarefas ou precisão
  • Fundamentação e risco de alucinação
  • Seleção e eficiência de ferramentas
  • Conformidade com políticas ou processos
  • Orçamentos de custo e latência
  • Escalada humana obrigatória

Da pontuação à resposta

Exiba pontuações em dashboards para acompanhar tendências. Crie alertas para limites ou condições compostas. Quando uma pontuação declina em uma população, execute uma auditoria para investigar o motivo; quando a causa for uma ação repetível, implante uma política.

Construir um avaliador

Implemente avaliações síncronas ou assíncronas com o SDK Python para avaliadores.