
Pare de amostrar execuções manualmente
Antes, você verificava algumas execuções aleatoriamente e torcia para que o restante estivesse bem. Agora, toda sessão concluída é pontuada no momento em que termina, nas dimensões que importam para você: utilidade, eficiência de ferramentas, factualidade, segurança — qualquer que seja o seu critério de qualidade. Você define as chaves de pontuação; a Observabilidade do Failproof AI armazena, analisa tendências e exibe tudo que o seu avaliador retornar. Nenhuma execução fica sem pontuação, e você para de descobrir regressões por meio de tickets de suporte. As pontuações aparecem na grade de sessões em/<org-slug>/sessions (barra lateral → observe → sessions), com um cluster de badges por linha. Quer ver apenas as execuções que ficaram abaixo do esperado? Filtre a grade por intervalo de pontuação — por exemplo, utilidade abaixo de 0,5 — e acesse exatamente as execuções que valem a pena examinar. Para visualizar pontuações, é necessária a permissão evaluations:read.
Entenda por que uma execução teve pontuação baixa
Um número te diz que uma execução foi fraca; a página da sessão te diz o porquê. Abra qualquer execução e o painel lateral começa com o resumo geral, depois exibe uma barra por dimensão com o próprio raciocínio do avaliador abaixo de cada uma — assim você vai de “essa execução tirou 0,4 em factualidade” até a afirmação exata que deu errado, em segundos.
evaluations:trigger) reponua a sessão no lugar e adiciona o novo resultado à sua linha do tempo, preservando as pontuações anteriores como histórico. Você o encontrará em /<org-slug>/sessions/<session-id>.
Acompanhe a tendência de qualidade em toda a frota
Uma execução com pontuação baixa é ruído; uma coorte inteira caindo é um sinal. Dashboards salvos transformam suas pontuações em uma tendência que você pode acompanhar de relance: média de utilidade desta semana versus a semana passada, por agente, por ambiente.
/<org-slug>/dashboards (barra lateral → analyze → dashboards), são compartilhados com toda a sua organização, e cada card consolida as sessões correspondentes: quantas houve, a média de cada pontuação destacada e um sparkline de tendência. “Open in sessions” leva você diretamente às execuções pré-filtradas por trás de qualquer número. Para visualizar, são necessárias as permissões dashboards:read e evaluations:read.
Conecte um avaliador uma única vez
A pontuação é opt-in e fica completamente desativada até que você aponte a Observabilidade do Failproof AI para um avaliador. Você sobe um pequeno serviço HTTP (a Observabilidade inclui uma referência funcional que você pode copiar), define dois valores no seu servidor, e a partir daí toda execução é pontuada automaticamente. O guia completo, o contrato de pontuação e o SDK estão no guia detalhado. Não tem certeza de quais dimensões valem a pena pontuar? A habilidade de agente avaliador faz com que seu agente de código descubra isso com base nas suas próprias sessões, depois cria e implanta o serviço.Relacionados
- Suite de avaliação: conecte seu avaliador, o contrato de pontuação e o SDK.
- Habilidade de agente avaliador: deixe um agente de código escolher suas dimensões de pontuação e construir o avaliador.
- Sessões: a grade execução por execução onde as pontuações aparecem.
- Dashboards: salve e compartilhe tendências de qualidade em toda a sua organização.
- Auditorias: outro recurso automático de qualidade da Observabilidade, para investigações entre sessões.

