
수동 샘플링 중단
예전에는 일부 실행만 직접 확인하고 나머지는 괜찮을 거라 기대했습니다. 이제는 완료된 모든 세션이 종료되는 즉시 원하는 기준에 따라 채점됩니다. 유용성, 도구 효율성, 사실성, 안전성 등 품질 기준을 직접 정의하면 됩니다. 점수 항목은 직접 정의하고, Failproof AI Observability는 평가기가 반환하는 모든 값을 저장·추적·표시합니다. 채점되지 않고 넘어가는 실행은 없으며, 지원 티켓을 통해 회귀를 뒤늦게 알게 되는 일도 없습니다. 점수는/<org-slug>/sessions(사이드바 → observe → sessions)의 세션 그리드에 표시되며, 행마다 배지 묶음이 붙습니다. 기준 미달 실행만 보고 싶다면? 유용성 0.5 미만처럼 점수 범위로 그리드를 필터링해서 검토할 가치가 있는 실행만 정확히 불러오세요. 점수 조회에는 evaluations:read 권한이 필요합니다.
낮은 점수의 원인 파악
숫자는 실행이 부족했다는 사실을 알려주고, 세션 페이지는 그 이유를 알려줍니다. 실행을 열면 오른쪽 패널 상단에 요약이 표시되고, 각 평가 항목별 막대 그래프와 평가기의 근거가 함께 보입니다. “사실성이 0.4점이었다”는 정보에서 어떤 주장이 잘못됐는지 몇 초 만에 확인할 수 있습니다.
evaluations:trigger 권한 필요)을 사용하면 세션을 즉시 재채점하고 새 결과를 타임라인에 추가합니다. 이전 점수는 기록으로 계속 확인할 수 있습니다. **/<org-slug>/sessions/<session-id>**에서 확인하세요.
전체 플릿의 품질 추이 모니터링
실행 하나의 낮은 점수는 노이즈일 수 있지만, 전체 코호트가 하락하면 그건 신호입니다. 저장된 대시보드는 점수를 한눈에 볼 수 있는 추이로 변환해줍니다. 이번 주와 지난 주의 평균 유용성을 에이전트별, 환경별로 비교할 수 있습니다.
/<org-slug>/dashboards(사이드바 → analyze → dashboards)에 있으며, 조직 전체에 공유됩니다. 각 카드는 해당 세션을 집계해 보여줍니다. 세션 수, 각 주요 점수의 평균, 추이 스파크라인이 포함됩니다. “세션에서 열기”를 클릭하면 해당 수치 뒤의 사전 필터링된 실행으로 바로 이동합니다. 조회에는 dashboards:read와 evaluations:read 권한이 필요합니다.
평가기 한 번만 연결하기
채점은 선택 사항이며, Failproof AI Observability에 채점기를 지정하기 전까지는 완전히 비활성화 상태입니다. 작은 HTTP 서비스를 하나 구성하고(Observability가 복사해서 사용할 수 있는 참조 구현을 제공합니다), 서버에 두 가지 값을 설정하면 이후 모든 실행이 자동으로 채점됩니다. 전체 설정 가이드, 채점 계약, SDK는 심화 가이드에서 확인할 수 있습니다. 어떤 항목을 채점할지 모르겠다면? 평가기 에이전트 스킬을 활용하면 코딩 에이전트가 직접 세션을 분석해 점수 항목을 결정하고 서비스를 구축·배포합니다.관련 문서
- 평가 스위트: 평가기 연결, 채점 계약, SDK.
- 평가기 에이전트 스킬: 코딩 에이전트가 점수 항목을 선정하고 평가기를 구축하도록 합니다.
- 세션: 점수가 표시되는 실행별 그리드.
- 대시보드: 조직 전체의 품질 추이를 저장하고 공유합니다.
- 감사: 크로스 세션 조사를 위한 Observability의 또 다른 자동 품질 기능.

