Skip to main content
Failproof AI Observability는 프로덕션 환경에서 AI 에이전트를 관측, 평가, 개선하기 위한 자체 호스팅 플랫폼입니다. 에이전트의 모든 동작(모든 도구 호출, 모델 요청, 훅, 오류)을 기록하고, 각 실행의 품질을 점수화하며, 미처 발견하지 못했던 장애를 찾아내 여러분의 인프라 내에서 직접 운영하는 대시보드에 표시합니다. AI 에이전트를 운영 중이고 실행이 왜 잘못됐는지 계속 추측하는 데 지쳤다면, 여기서 시작하세요. 이 문서는 설치 전에 Failproof AI Observability가 제공하는 것과 각 구성 요소가 어떻게 연결되는지 설명합니다.
Failproof AI Observability는 Failproof AI의 엔터프라이즈 제품입니다. 실제 동작을 보고 싶으신가요? 데모를 요청하세요: nikita@befailproof.ai로 이메일 보내주세요.
git 스타일의 실행 그래프와 이벤트 타임라인이 나란히 표시된 Failproof AI Observability 세션, 오른쪽 패널에는 도구·모델·훅의 실행별 분석 정보 표시 모든 에이전트 실행은 git 스타일의 실행 그래프(왼쪽)와 이벤트 타임라인이 나란히 표시됩니다. 병렬 서브 에이전트는 각각 별도의 레인을 가지며, 오른쪽 패널에서 해당 실행의 도구, 모델, 훅, 토큰 사용량을 상세히 확인할 수 있습니다.

실제 동작 보기

두 편의 짧은 영상에서 팀들이 가장 먼저 찾는 두 가지 기능을 보여줍니다: 실행 추적과 자동 장애 탐지.
에이전트 추적: 목표에서 도구 사용, 최종 응답까지 단일 실행을 단계별로 따라가기.
Failproof 감사: Failproof AI Observability가 세션 전반의 로그를 분석해 수정이 필요한 사항을 알려줍니다.

팀이 이 도구를 사용하는 이유

  • 에이전트가 실제로 무엇을 했는지 확인하세요. 모든 실행이 읽기 쉬운 git 스타일의 실행 그래프로 변환됩니다: 어떤 도구가 병렬로 실행됐는지, 어떤 서브 에이전트가 분기했는지, 어디서 멈췄는지, 무엇을 사용했는지 한눈에 볼 수 있습니다.
  • 품질 저하를 자동으로 감지하세요. 소규모 점수화 서비스를 연결하면 Failproof AI Observability가 완료된 모든 실행을 점수화하여, 유용성 하락이나 환각 급증을 자동으로 감지합니다.
  • 미리 규칙을 작성하지 않아도 장애를 찾아냅니다. 반복 감사가 세션 전반의 로그에서 오류 클러스터, 지연 이상값, 낮은 점수, 중단된 실행을 발굴하고, 증거가 뒷받침된 우선순위 결과를 제시합니다.
  • 중요한 순간에 알림을 받으세요. 오류율, 지연 시간, 비용, 또는 평가 점수에 대한 임계값 규칙이 발동되면 인시던트가 생성되어 확인, 담당자 지정, 해결까지 처리할 수 있습니다.
  • 일반 언어로 질문하세요. 대시보드 내 AI 어시스턴트가 여러분의 데이터를 기반으로 “이번 주 프로덕션에서 품질 트렌드는 어떤가요?” 같은 질문에 답합니다. 어시스턴트가 변경하는 모든 사항은 승인이 필요합니다.
  • 데이터를 직접 관리하세요. Failproof AI Observability는 자체 호스팅 방식으로, 이벤트, 프롬프트, 분석 데이터가 여러분이 제어하는 인프라 안에 머뭅니다.

제공 기능

Failproof AI Observability는 세 가지 개념(관측, 분석, 관리)을 중심으로 구성되며, 이는 대시보드 왼쪽 사이드바에 그대로 반영됩니다. 관측 (실제로 무슨 일이 있었는지의 원본 데이터):
  • 이벤트 스트림: 모든 실행의 단계별 실시간 기록 (도구 호출, 모델 호출, 훅, 오류).
  • 세션: 실행별로 집계된 이벤트로, 각 실행은 점수화 준비가 된 한 행으로 표시되며 git 스타일의 실행 그래프를 포함합니다.
  • 성능 메트릭: 표면별 지연 시간 히트맵과 모델, 도구, 훅에 대한 p50/p95/p99 지표로, 꼬리 구간의 급증을 중앙값과 비교해 식별합니다.
  • 오류 추적: 발생한 모든 문제를 한 곳에서 트리아지하고, 발동된 알림에서 한 번의 클릭으로 접근할 수 있습니다.
도구 관측 페이지: 24개의 시간 구간에 걸친 지연 시간 히트맵, 백분위수 밴드, 도구 분포 바 각 관측 화면은 스파크라인과 p50/p95/p99 지표를 지연 시간 히트맵 및 백분위수 밴드와 함께 표시합니다. 여기서는 도구(Tools) 화면을 보여줍니다. 분석 (활동을 인사이트로 전환):
  • 쿼리대시보드: 이벤트와 평가 데이터에 대해 저장된 SQL을 실행하고, 조직 범위의 공유 대시보드로 시각화합니다.
  • 평가: 자체 평가 서비스가 생성하는 품질 점수와 점수별 근거.
  • 감사: 세션 전반에서 장애 패턴을 발굴하는 반복 조사.
  • 알림인시던트: 알림을 발송하는 임계값 규칙과, 이를 트리아지할 수 있는 인시던트 워크플로우.
인터페이스 (원하는 방식으로 데이터에 접근):
  • CLI: 터미널이나 스크립트에서 전체 배포를 제어하고, 코딩 에이전트가 일반 언어로 대신 처리하도록 할 수 있습니다.
  • AI 어시스턴트: 대시보드 내에서 일반 언어로 에이전트에 대해 질문하세요.
  • REST API: 대시보드와 CLI의 모든 기능은 범위가 지정된 API 키로 직접 호출할 수 있는 REST API로 지원됩니다 — 이벤트 수집, 세션 및 평가 쿼리, 대시보드·알림·감사·사용자·키 관리까지 가능하여, Failproof AI Observability를 자체 도구와 연동할 수 있습니다.
관리 (팀을 위한 운영):
  • API 키: 수집기, 대시보드, 어시스턴트용 범위 지정 토큰.
  • 사용자: 허용 목록 기반의 이메일 패스워드리스 로그인.
  • 설정: 모델 컨텍스트 윈도우 재정의를 포함한 조직별 구성.

구성 요소의 연결 방식

데이터는 에이전트 코드에서 대시보드까지 단방향으로 흐릅니다: 에이전트(Python SDK를 통해)가 이벤트를 agenteye-collector로 전송하고, collector가 서버로 전달하며, 서버가 대시보드를 제공합니다. 두 개의 선택적 서비스로 구성이 완성됩니다 — 점수화 서비스(평가)와 AI 어시스턴트 서비스(대시보드 내 채팅).
  • Python SDK: 에이전트에 몇 가지 agenteye.event.* 호출을 추가하면, 이벤트가 로컬에서 버퍼링됩니다.
  • agenteye-collector: 각 에이전트 머신에서 실행되는 경량 데몬으로, 이벤트를 일괄 처리하여 서버로 전송합니다.
  • 서버: 이벤트를 수집하고, 자체 데이터베이스에서 운영 상태를 유지하며, 대시보드·CLI·자체 통합에서 모두 사용하는 REST API를 제공합니다.
  • 대시보드: 모든 것을 탐색하는 공간.
  • 선택적 서비스: 점수화 서비스(평가)와 AI 어시스턴트 서비스(대시보드 내 채팅).
문서 전반에서 사용하는 용어(이벤트, 세션, 평가, 감사, 결과, 인시던트)에 대해서는 개념을 참고하세요.

Failproof AI Observability 도입하기

Failproof AI Observability는 Failproof AI의 엔터프라이즈 제품으로, Failproof AI 브랜드 아래 정책 및 가드레일 제품인 Failproof AI Enforcement와 함께 동작합니다. 완전히 여러분의 환경에서 실행됩니다. 아직 패키지에 대한 접근 권한이 없다면, 데모를 요청해 주세요: nikita@befailproof.ai로 이메일을 보내주시면 시작을 도와드리겠습니다.

다음 단계

  • 개념: Failproof AI Observability 용어를 한 곳에서 정리한 문서.
  • Observability: 에이전트의 동작을 실행별로 추적하기.
  • 보안: Failproof AI Observability가 데이터를 격리하고 여러분의 통제 하에 유지하는 방법.