Skip to main content
호스팅된 평가든 자체 워커를 통한 평가든, 모든 평가 결과는 동일한 위치에 저장됩니다.

시간 경과에 따른 점수 비교

Observe → evaluations으로 이동합니다.
  • Recent runs에는 각 평가 결과가 수신된 순서대로 나열됩니다. 호스팅된(managed) 평가자에서 온 것인지 직접 운영하는(customer) 평가자에서 온 것인지 여부, 에이전트와 세션, 평가 항목과 버전, 상태, 점수 또는 지표가 표시됩니다.
  • Score over time은 원하는 내용을 차트로 그립니다. add series를 선택하고 에이전트, 환경, 평가 항목, 통계(avg, min, max, p50, p75, p90, p95, p99, stddev, mode 중 하나)를 지정합니다. 각 시리즈는 하나의 선으로 표시되며, 별도 차트에 그리려면 curve를 지정하세요. 평가 페이지: customer 태그가 붙은 최근 실행 목록, 0.5와 0.8에 기준선이 있는 시간 경과 점수 차트, 모든 에이전트와 환경에 걸쳐 finished_clean을 평균 내는 하나의 시리즈.
하나의 시간 범위와 하나의 구간 크기가 모든 시리즈에 적용됩니다. 세밀한 구간은 특정 인시던트를 찾아내고, 넓은 구간은 전체 추세를 보여주되 찾고 있는 급등 현상을 숨길 수 있습니다. 점수가 없는 구간은 선의 공백으로 표시되며 0으로 처리되지 않고, 기준선은 0.5와 0.8에 표시됩니다.뷰의 모든 설정은 URL에 저장됩니다. share를 누르면 링크가 복사되고, 링크를 열면 구성한 비교 화면이 그대로 표시됩니다.
동일한 평가에 대해 avg와 p90을 함께 플롯하면 좋은 평균값이 나쁜 꼬리 분포를 숨기고 있는지 확인할 수 있습니다. 두 에이전트 또는 프로덕션과 스테이징 환경에 대해 동일한 평가를 플롯하면 하나의 축에서 바로 비교할 수 있습니다. 단위가 있는 비용, 지연 시간, 토큰 수는 Observe → metrics에서 단위별로 별도 차트에 표시됩니다.

세션 점수가 낮은 이유 파악하기

Observe → sessions에서 세션을 열면, 그리드에 각 세션의 점수가 표시되며 점수 범위로 필터링할 수 있습니다. 세션 오른쪽 패널에는 평가 요약이 먼저 표시되고, 그 아래에 각 점수를 나타내는 막대와 평가자의 추론 근거가 이어집니다. 완전한 트레이스 옆에 평가 점수와 근거가 표시된 세션 상세 뷰.

어시스턴트에게 질문하기

평가 데이터에 대해 평문으로 질문할 수 있습니다. 예를 들어 “최근 평가 결과 몇 가지를 알려줘”라거나 어떤 에이전트의 점수가 떨어지고 있는지 물어볼 수 있습니다. 어시스턴트는 결과를 읽고 분석하여 표 형태로 답변을 제공하며, 후속 질문도 가능합니다. 유용한 질문은 쿼리나 대시보드로 저장할 수 있습니다. 어시스턴트가 "최근 평가 결과 몇 가지를 알려줘"라는 질문에 총계, 상태, 점수 요약으로 답변하는 모습이 평가 페이지 옆에 표시된 화면.

모니터링 및 대응

  • Dashboards(Analyze → dashboards)에서는 조직 전체 기준으로 에이전트와 환경별 주요 점수 추세를 확인할 수 있습니다. 평균 평가 점수와 시간 경과에 따른 추세를 보여주는 품질 대시보드.
  • Alerts는 점수가 임계값을 넘으면 알림을 보냅니다. 알림을 참고하세요.
  • 여러 세션에 걸쳐 점수가 하락할 경우 감사 실행으로 원인을 파악하고, 원인이 반복적인 행동에 있다면 정책을 작성하세요.