평가 품질 검토
- 대시보드
- CLI
- Observe → Evaluations으로 이동합니다.
- 시리즈를 추가하고 에이전트, 환경, 평가 점수, 통계 및 곡선을 선택합니다.
- 시리즈를 추가하여 환경, 에이전트 또는 점수 키를 비교합니다.
-
결과를 선택하여 일치하는 세션을 열거나 필터링된 뷰를 공유합니다. 레이턴시, 토큰, 비용 및 기타 수치 값은 Observe → Metrics를 사용하세요.


좋은 평가 대상
- 태스크 완료 또는 정확성
- 근거 충실도 및 환각 위험
- 도구 선택 및 도구 효율성
- 정책 또는 프로세스 컴플라이언스
- 비용 및 레이턴시 예산
- 필수 인간 에스컬레이션
점수에서 대응으로
대시보드에 점수를 표시하여 트렌드를 추적하세요. 임계값 또는 복합 조건에 대한 알림을 생성하세요. 특정 집단에서 점수가 하락하면 감사를 실행하여 원인을 조사하고, 원인이 반복 가능한 행동인 경우 정책을 배포하세요.평가자 빌드
Python 평가자 SDK를 사용하여 동기 또는 비동기 평가를 구현합니다.

