Criar a partir de uma descrição
- Acesse Analyze → eval authoring e selecione new eval.
- Descreva o que medir em linguagem natural, ou escolha em start from an example…, e selecione draft.
- Revise os campos e o código gerado, depois teste e publique.

Configurar os campos
Use a condição para restringir uma avaliação aos agentes e ambientes para os quais ela foi criada:
Escrever o código você mesmo
O evaluator code é uma única expressão Python que retornaEvalResult(...), com session disponível no escopo. Este exemplo calcula a proporção de resultados de ferramentas que retornaram ok:
score= para uma avaliação de pontuação, ou uma entrada em metrics ou assertions com o nome da chave para uma avaliação de métrica ou asserção. Outras métricas e asserções podem acompanhá-la, com até 25 resultados por execução.
Nada mais está acessível: sem imports, e sem atributos além dos dados de sessão e métodos simples de string e dicionário como
get, lower e split, que devem ser chamados e não apenas referenciados. As chaves de payload são o que seus agentes enviam — status acima é apenas um exemplo — portanto, leia-as de uma sessão real. format organiza o código e fix pede ao assistente que o corrija. O código pode ter até 128 KiB, e a condição até 16 KiB.


