- 점수: 0에서 1 사이의 값으로, 선택적으로 통과 또는 실패로 표시
- 메트릭: 횟수, 소요 시간, 비용 등의 수치와 단위
- 어서션: 통과 여부
두 가지 평가자 유형
호스팅된 Python은 의도적으로 제한적입니다: 표현식 하나, 임포트 없음, 네트워크 없음. 모델이 필요한 작업 — 예를 들어 답변의 관련성을 판단하는 LLM 심사위원 — 은 자체 워커에서 실행합니다. 두 유형 모두 인바운드 연결이 필요하지 않습니다: 워커가 완료된 세션을 가져와 아웃바운드 HTTPS로 결과를 제출합니다.
각 조직은 자신의 에이전트를 직접 평가합니다
평가는 이를 정의한 조직에 속합니다. 인스턴스 내의 각 조직은 자체적인 평가를 작성하며 — 체크 항목, 조건, 임계값, 레이블 모두 직접 설정하고 — 다른 조직에 영향을 주지 않고 버전을 관리하고 배포하며, 자신의 결과만 확인할 수 있습니다. 에이전트, 환경, 평가 항목, 시간별로 결과를 필터링하거나 어시스턴트에게 질문할 수 있습니다.초안 작성부터 실제 채점까지
1
작성하기
측정할 내용을 설명하고 어시스턴트가 초안을 작성하도록 하거나, 직접 작성합니다. 평가 작성하기를 참고하세요.
2
테스트하기
실제 세션에 대해 실행하여 배포 전에 검증합니다. 결과는 저장되지 않습니다. 평가 테스트하기를 참고하세요.
3
배포 및 버전 관리
변경 불가능한 버전을 배포하고, 발전에 따라 새 버전을 게시하며, 이전 버전으로 롤백할 수 있습니다. 배포 및 버전 관리를 참고하세요.
4
결과 확인하기
시간별 점수 추이를 차트로 확인하고, 에이전트와 환경을 비교하며, 어시스턴트에게 질문합니다. 평가 결과 확인하기를 참고하세요.

