- uma pontuação de 0 a 1, opcionalmente marcada como aprovada ou reprovada
- uma métrica, como uma contagem, uma duração ou um custo, com sua unidade
- uma asserção, que passou ou não
Dois tipos de avaliador
O Python Hospedado é deliberadamente limitado: uma expressão, sem imports, sem rede. Qualquer coisa que precise de um modelo — um juiz LLM avaliando se uma resposta foi relevante, por exemplo — executa no seu próprio worker. Nenhum dos dois tipos precisa de uma conexão de entrada: os workers buscam sessões finalizadas e enviam resultados via HTTPS de saída.
Cada organização avalia seus próprios agentes
As avaliações pertencem à organização que as define. Cada organização em uma instância escreve as suas próprias — com suas próprias verificações, condições, limites e rótulos — versionando e implantando-as sem afetar nenhuma outra, e visualizando apenas seus próprios resultados. Filtre esses resultados por agente, ambiente, avaliação e período, ou pergunte ao assistente sobre eles.Do primeiro rascunho às pontuações ao vivo
1
Escreva
Descreva o que medir e deixe o assistente criar um rascunho, ou escreva você mesmo. Veja Escrever uma avaliação.
2
Teste
Execute contra sessões reais antes de entrar em produção; nada é armazenado. Veja Testar uma avaliação.
3
Implante e versione
Implante uma versão imutável, publique novas versões conforme ela evolui e reverta para uma anterior quando necessário. Veja Implantar e versionar.
4
Leia os resultados
Visualize pontuações ao longo do tempo, compare agentes e ambientes e consulte o assistente. Veja Ler resultados de avaliações.

