> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Avaliações online

> Avalie sessões ao vivo e concluídas quanto a qualidade, conformidade, custo e latência.

As avaliações online aplicam julgamentos consistentes às sessões do agente. Use-as para sinais que devem ser medidos continuamente, em vez de investigados apenas durante uma auditoria.

## Revisar a qualidade das avaliações

<Tabs>
  <Tab title="Dashboard">
    1. Acesse **Observe → Evaluations**.
    2. Adicione uma série e escolha o agente, o ambiente, a pontuação da avaliação, a estatística e a curva.
    3. Adicione séries para comparar ambientes, agentes ou chaves de pontuação.
    4. Selecione um resultado para abrir as sessões correspondentes ou compartilhar a visualização filtrada. Use **Observe → Metrics** para latência, tokens, custo e outros valores de magnitude.

           <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/dashboard-quality.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=74c925ae831046fc869a3a3d6e81fc25" alt="Um dashboard de qualidade exibindo pontuações médias de avaliação e tendências ao longo do tempo." width="2880" height="1800" data-path="images/dashboard/dashboard-quality.png" />

    Abra uma sessão no drill-down para inspecionar o raciocínio por pontuação:

    <img src="https://mintcdn.com/exosphere/WgPwQzedeDNwJBTy/images/dashboard/session-detail.png?fit=max&auto=format&n=WgPwQzedeDNwJBTy&q=85&s=7b5f022dd5c485565a8cd92b2e936235" alt="Uma visualização detalhada de sessão exibindo pontuações de avaliação e raciocínio ao lado do trace completo." width="3200" height="2000" data-path="images/dashboard/session-detail.png" />
  </Tab>

  <Tab title="CLI">
    ```bash theme={null}
    fp evals --agent-id checkout-agent --aggregate
    fp evals --aggregate --env production --status error
    fp evals --score helpfulness:0.8.. --since 7d
    ```

    Adicione `--json` globalmente antes de `evals` para automação, por exemplo `fp --json evals --aggregate --env production`.
  </Tab>
</Tabs>

Um avaliador recebe a identidade da sessão, o ambiente, os timestamps e os eventos ordenados. Ele pode retornar chaves de pontuação numéricas com raciocínio opcional e um resumo. Avaliadores de longa duração podem retornar um job pendente e ser consultados posteriormente.

## Bons alvos de avaliação

* Conclusão de tarefas ou precisão
* Fundamentação e risco de alucinação
* Seleção e eficiência de ferramentas
* Conformidade com políticas ou processos
* Orçamentos de custo e latência
* Escalada humana obrigatória

## Da pontuação à resposta

Exiba pontuações em dashboards para acompanhar tendências. Crie alertas para limites ou condições compostas. Quando uma pontuação declina em uma população, execute uma auditoria para investigar o motivo; quando a causa for uma ação repetível, implante uma política.

<Card title="Construir um avaliador" icon="code-2" href="/pt-br/reference/evaluator-sdk">
  Implemente avaliações síncronas ou assíncronas com o SDK Python para avaliadores.
</Card>
