> ## Documentation Index
> Fetch the complete documentation index at: https://docs.befailproof.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 에이전트 평가

> 완료된 모든 세션을 직접 정의한 평가로 채점합니다: 호스팅된 Python 체크 또는 자체 워커의 LLM 심사위원을 사용할 수 있습니다.

평가는 완료된 에이전트 세션을 채점합니다. 세션이 종료되면 해당 세션에 적용되는 모든 활성화된 평가가 실행되고, 트레이스 옆에서 확인할 수 있는 근거와 함께 결과를 기록합니다:

* **점수**: 0에서 1 사이의 값으로, 선택적으로 통과 또는 실패로 표시
* **메트릭**: 횟수, 소요 시간, 비용 등의 수치와 단위
* **어서션**: 통과 여부

## 두 가지 평가자 유형

|        | 호스팅된 Python                        | 자체 워커                                                        |
| ------ | ---------------------------------- | ------------------------------------------------------------ |
| 작성 위치  | 대시보드의 **Analyze → eval authoring** | Python으로 작성, [Evaluator SDK](/ko/reference/evaluator-sdk) 사용 |
| 실행 환경  | Failproof AI의 관리형 평가자 (샌드박스 내부)    | 직접 운영하는 인프라                                                  |
| 적합한 경우 | 결정론적 코드 기반 체크                      | LLM 심사위원, 모델 호출, 패키지, 시크릿, 네트워크 접근, 고부하 처리                   |

호스팅된 Python은 의도적으로 제한적입니다: 표현식 하나, 임포트 없음, 네트워크 없음. 모델이 필요한 작업 — 예를 들어 답변의 관련성을 판단하는 LLM 심사위원 — 은 자체 워커에서 실행합니다. 두 유형 모두 인바운드 연결이 필요하지 않습니다: 워커가 완료된 세션을 가져와 아웃바운드 HTTPS로 결과를 제출합니다.

## 각 조직은 자신의 에이전트를 직접 평가합니다

평가는 이를 정의한 조직에 속합니다. 인스턴스 내의 각 조직은 자체적인 평가를 작성하며 — 체크 항목, 조건, 임계값, 레이블 모두 직접 설정하고 — 다른 조직에 영향을 주지 않고 버전을 관리하고 배포하며, 자신의 결과만 확인할 수 있습니다. 에이전트, 환경, 평가 항목, 시간별로 결과를 필터링하거나 어시스턴트에게 질문할 수 있습니다.

## 초안 작성부터 실제 채점까지

<Steps>
  <Step title="작성하기">
    측정할 내용을 설명하고 어시스턴트가 초안을 작성하도록 하거나, 직접 작성합니다. [평가 작성하기](/ko/evaluations/write)를 참고하세요.
  </Step>

  <Step title="테스트하기">
    실제 세션에 대해 실행하여 배포 전에 검증합니다. 결과는 저장되지 않습니다. [평가 테스트하기](/ko/evaluations/test)를 참고하세요.
  </Step>

  <Step title="배포 및 버전 관리">
    변경 불가능한 버전을 배포하고, 발전에 따라 새 버전을 게시하며, 이전 버전으로 롤백할 수 있습니다. [배포 및 버전 관리](/ko/evaluations/deploy)를 참고하세요.
  </Step>

  <Step title="결과 확인하기">
    시간별 점수 추이를 차트로 확인하고, 에이전트와 환경을 비교하며, 어시스턴트에게 질문합니다. [평가 결과 확인하기](/ko/sessions/evaluations)를 참고하세요.
  </Step>
</Steps>

평가는 순방향으로 실행됩니다: 지금 배포된 버전은 지금부터 완료되는 세션을 채점합니다. 이미 보유한 세션을 채점하려면 [백필](/ko/evaluations/deploy#기존-세션-채점)을 사용하세요.
