Skip to main content
평가는 완료된 에이전트 세션을 채점합니다. 세션이 종료되면 해당 세션에 적용되는 모든 활성화된 평가가 실행되고, 트레이스 옆에서 확인할 수 있는 근거와 함께 결과를 기록합니다:
  • 점수: 0에서 1 사이의 값으로, 선택적으로 통과 또는 실패로 표시
  • 메트릭: 횟수, 소요 시간, 비용 등의 수치와 단위
  • 어서션: 통과 여부

두 가지 평가자 유형

호스팅된 Python은 의도적으로 제한적입니다: 표현식 하나, 임포트 없음, 네트워크 없음. 모델이 필요한 작업 — 예를 들어 답변의 관련성을 판단하는 LLM 심사위원 — 은 자체 워커에서 실행합니다. 두 유형 모두 인바운드 연결이 필요하지 않습니다: 워커가 완료된 세션을 가져와 아웃바운드 HTTPS로 결과를 제출합니다.

각 조직은 자신의 에이전트를 직접 평가합니다

평가는 이를 정의한 조직에 속합니다. 인스턴스 내의 각 조직은 자체적인 평가를 작성하며 — 체크 항목, 조건, 임계값, 레이블 모두 직접 설정하고 — 다른 조직에 영향을 주지 않고 버전을 관리하고 배포하며, 자신의 결과만 확인할 수 있습니다. 에이전트, 환경, 평가 항목, 시간별로 결과를 필터링하거나 어시스턴트에게 질문할 수 있습니다.

초안 작성부터 실제 채점까지

1

작성하기

측정할 내용을 설명하고 어시스턴트가 초안을 작성하도록 하거나, 직접 작성합니다. 평가 작성하기를 참고하세요.
2

테스트하기

실제 세션에 대해 실행하여 배포 전에 검증합니다. 결과는 저장되지 않습니다. 평가 테스트하기를 참고하세요.
3

배포 및 버전 관리

변경 불가능한 버전을 배포하고, 발전에 따라 새 버전을 게시하며, 이전 버전으로 롤백할 수 있습니다. 배포 및 버전 관리를 참고하세요.
4

결과 확인하기

시간별 점수 추이를 차트로 확인하고, 에이전트와 환경을 비교하며, 어시스턴트에게 질문합니다. 평가 결과 확인하기를 참고하세요.
평가는 순방향으로 실행됩니다: 지금 배포된 버전은 지금부터 완료되는 세션을 채점합니다. 이미 보유한 세션을 채점하려면 백필을 사용하세요.