Skip to main content
온라인 평가는 에이전트 세션에 일관된 판단을 적용합니다. 감사 시에만 조사하는 것이 아니라 지속적으로 측정해야 하는 신호에 활용하세요.

평가 품질 검토

  1. Observe → Evaluations으로 이동합니다.
  2. 시리즈를 추가하고 에이전트, 환경, 평가 점수, 통계 및 곡선을 선택합니다.
  3. 시리즈를 추가하여 환경, 에이전트 또는 점수 키를 비교합니다.
  4. 결과를 선택하여 일치하는 세션을 열거나 필터링된 뷰를 공유합니다. 레이턴시, 토큰, 비용 및 기타 수치 값은 Observe → Metrics를 사용하세요. 평균 평가 점수와 시간에 따른 트렌드를 보여주는 품질 대시보드.
드릴다운에서 세션을 열어 점수별 추론 내용을 확인하세요:전체 트레이스 옆에 평가 점수와 추론을 표시하는 세션 상세 뷰.
평가자는 세션 식별 정보, 환경, 타임스탬프, 순서가 있는 이벤트를 수신합니다. 선택적 추론 및 요약과 함께 숫자 점수 키를 반환할 수 있습니다. 장시간 실행되는 평가자는 보류 중인 작업을 반환하고 나중에 폴링할 수 있습니다.

좋은 평가 대상

  • 태스크 완료 또는 정확성
  • 근거 충실도 및 환각 위험
  • 도구 선택 및 도구 효율성
  • 정책 또는 프로세스 컴플라이언스
  • 비용 및 레이턴시 예산
  • 필수 인간 에스컬레이션

점수에서 대응으로

대시보드에 점수를 표시하여 트렌드를 추적하세요. 임계값 또는 복합 조건에 대한 알림을 생성하세요. 특정 집단에서 점수가 하락하면 감사를 실행하여 원인을 조사하고, 원인이 반복 가능한 행동인 경우 정책을 배포하세요.

평가자 빌드

Python 평가자 SDK를 사용하여 동기 또는 비동기 평가를 구현합니다.