Skip to main content
품질 문제가 이제 사용자 불만으로 들려오기 전에 먼저 찾아옵니다. 자체 채점 서비스를 한 번만 연결해두면 Failproof AI Observability가 완료된 모든 실행을 자동으로 평가합니다. 그러면 유용성 저하나 환각 급증이 고객이 느끼기 전에 자동으로 드러납니다. 점수 열이 있는 세션 그리드: 각 실행에 평가 상태 표시와 색상으로 구분된 유용성, 사실성, 도구 효율성 배지가 표시됩니다 세션 그리드의 모든 실행에 점수가 표시됩니다. 빨간색, 주황색, 초록색 배지 덕분에 단 하나의 트랜스크립트도 열어보지 않고도 문제가 있는 실행을 바로 파악할 수 있습니다.

수동 샘플링 중단

예전에는 일부 실행만 직접 확인하고 나머지는 괜찮을 거라 기대했습니다. 이제는 완료된 모든 세션이 종료되는 즉시 원하는 기준에 따라 채점됩니다. 유용성, 도구 효율성, 사실성, 안전성 등 품질 기준을 직접 정의하면 됩니다. 점수 항목은 직접 정의하고, Failproof AI Observability는 평가기가 반환하는 모든 값을 저장·추적·표시합니다. 채점되지 않고 넘어가는 실행은 없으며, 지원 티켓을 통해 회귀를 뒤늦게 알게 되는 일도 없습니다. 점수는 /<org-slug>/sessions(사이드바 → observesessions)의 세션 그리드에 표시되며, 행마다 배지 묶음이 붙습니다. 기준 미달 실행만 보고 싶다면? 유용성 0.5 미만처럼 점수 범위로 그리드를 필터링해서 검토할 가치가 있는 실행만 정확히 불러오세요. 점수 조회에는 evaluations:read 권한이 필요합니다.

낮은 점수의 원인 파악

숫자는 실행이 부족했다는 사실을 알려주고, 세션 페이지는 그 이유를 알려줍니다. 실행을 열면 오른쪽 패널 상단에 요약이 표시되고, 각 평가 항목별 막대 그래프와 평가기의 근거가 함께 보입니다. “사실성이 0.4점이었다”는 정보에서 어떤 주장이 잘못됐는지 몇 초 만에 확인할 수 있습니다. 세션 오른쪽 패널: 상단의 평가 요약, 항목별 점수 막대와 각 점수의 근거, 그 옆의 전체 이벤트 타임라인 세션 상세 뷰: 요약, 항목별 점수 막대, 각 점수의 근거가 실행의 이벤트 타임라인 바로 옆에 표시됩니다. 더 정밀한 평가기를 배포했거나, 채점 전에 중단된 실행을 확인하고 싶다면? 재평가 버튼(evaluations:trigger 권한 필요)을 사용하면 세션을 즉시 재채점하고 새 결과를 타임라인에 추가합니다. 이전 점수는 기록으로 계속 확인할 수 있습니다. **/<org-slug>/sessions/<session-id>**에서 확인하세요.

전체 플릿의 품질 추이 모니터링

실행 하나의 낮은 점수는 노이즈일 수 있지만, 전체 코호트가 하락하면 그건 신호입니다. 저장된 대시보드는 점수를 한눈에 볼 수 있는 추이로 변환해줍니다. 이번 주와 지난 주의 평균 유용성을 에이전트별, 환경별로 비교할 수 있습니다. 품질 대시보드: 평가 항목별 평균 점수 막대와 시간에 따른 추이 저장된 품질 대시보드는 주요 점수 항목의 추이를 보여주므로, 문제가 발생하기 훨씬 전에 서서히 나빠지는 경향을 명확히 파악할 수 있습니다. 대시보드는 /<org-slug>/dashboards(사이드바 → analyzedashboards)에 있으며, 조직 전체에 공유됩니다. 각 카드는 해당 세션을 집계해 보여줍니다. 세션 수, 각 주요 점수의 평균, 추이 스파크라인이 포함됩니다. “세션에서 열기”를 클릭하면 해당 수치 뒤의 사전 필터링된 실행으로 바로 이동합니다. 조회에는 dashboards:readevaluations:read 권한이 필요합니다.

평가기 한 번만 연결하기

채점은 선택 사항이며, Failproof AI Observability에 채점기를 지정하기 전까지는 완전히 비활성화 상태입니다. 작은 HTTP 서비스를 하나 구성하고(Observability가 복사해서 사용할 수 있는 참조 구현을 제공합니다), 서버에 두 가지 값을 설정하면 이후 모든 실행이 자동으로 채점됩니다. 전체 설정 가이드, 채점 계약, SDK는 심화 가이드에서 확인할 수 있습니다. 어떤 항목을 채점할지 모르겠다면? 평가기 에이전트 스킬을 활용하면 코딩 에이전트가 직접 세션을 분석해 점수 항목을 결정하고 서비스를 구축·배포합니다.

관련 문서

  • 평가 스위트: 평가기 연결, 채점 계약, SDK.
  • 평가기 에이전트 스킬: 코딩 에이전트가 점수 항목을 선정하고 평가기를 구축하도록 합니다.
  • 세션: 점수가 표시되는 실행별 그리드.
  • 대시보드: 조직 전체의 품질 추이를 저장하고 공유합니다.
  • 감사: 크로스 세션 조사를 위한 Observability의 또 다른 자동 품질 기능.