Skip to main content

title: “Failproof AI: Quan sát Agents để phát hiện lỗi” description: “Failproof AI Observability là một nền tảng tự lưu trữ để quan sát, đánh giá và cải thiện các AI agents của bạn trong production.”

Failproof AI Observability là một nền tảng tự lưu trữ để quan sát, đánh giá và cải thiện các AI agents của bạn trong production. Nó ghi lại mọi thứ mà agents của bạn thực hiện (mọi lệnh gọi công cụ, yêu cầu mô hình, hook và lỗi), chấm điểm chất lượng của mỗi lần chạy, và phát hiện những lỗi bạn không biết cần tìm kiếm, tất cả trong một bảng điều khiển chạy bên trong cơ sở hạ tầng của riêng bạn. Nếu bạn triển khai AI agents và mệt mỏi với việc đoán tại sao một lần chạy không thành công, đây là trang để bắt đầu. Nó giải thích những gì Failproof AI Observability mang lại cho bạn và cách các phần ghép lại với nhau, trước khi bạn cài đặt bất cứ thứ gì.
Failproof AI Observability là một sản phẩm doanh nghiệp từ Failproof AI. Muốn xem nó hoạt động? Yêu cầu một bản demo: gửi email tới nikita@befailproof.ai.
Một phiên Failproof AI Observability được vẽ dưới dạng đồ thị thực thi kiểu git bên cạnh dòng thời gian sự kiện của nó, với phân tích từng lần chạy của các công cụ, mô hình và hook ở cột phải Mỗi lần chạy agent được vẽ dưới dạng đồ thị thực thi kiểu git (bên trái) bên cạnh dòng thời gian sự kiện của nó. Các sub-agents song song mỗi cái có làn riêng; cột phải hiển thị chi tiết công cụ, mô hình, hook và chi phí token cho lần chạy.

Xem nó hoạt động

Hai video ngắn cho thấy hai thứ mà các nhóm thường cần trước tiên: theo dõi một lần chạy và tìm kiếm lỗi tự động.
Theo dõi agent: theo dõi một lần chạy từng bước, từ mục tiêu đến công cụ đến câu trả lời cuối cùng.
Failproof Audit: để Failproof AI Observability khai thác nhật ký của bạn qua các phiên và cho bạn biết cần sửa chữa gì.

Tại sao các nhóm sử dụng nó

  • Xem agent của bạn thực sự đã làm gì. Mỗi lần chạy trở thành một đồ thị thực thi dễ đọc, kiểu git: công cụ nào chạy song song, sub-agents nào phân nhánh, nơi nó bị trì trệ, và nó đã chi tiêu bao nhiêu.
  • Phát hiện sự suy giảm chất lượng tự động. Kết nối một dịch vụ chấm điểm nhỏ và Failproof AI Observability chấm điểm mỗi lần chạy hoàn tất, để sự giảm sút về hữu ích hoặc tăng đột biến về ảo giác tự hiển thị.
  • Tìm kiếm lỗi bạn chưa viết quy tắc cho. Kiểm toán định kỳ khai thác nhật ký của bạn qua các phiên để tìm các cụm lỗi, ngoại lệ về độ trễ, điểm thấp và các lần chạy bị mắc kẹt, sau đó trao cho bạn các phát hiện được xếp hạng, hỗ trợ bằng bằng chứng.
  • Nhận thông báo khi nó quan trọng. Các quy tắc ngưỡng kích hoạt trên tỷ lệ lỗi, độ trễ, chi phí hoặc điểm đánh giá và mở các sự cố bạn có thể xác nhận, gán và giải quyết.
  • Đặt câu hỏi bằng tiếng Anh thuần túy. Một trợ lý AI trong bảng điều khiển trả lời những câu hỏi như “chất lượng trong prod tuần này có xu hướng như thế nào?” trên dữ liệu của bạn. Bất kỳ thay đổi nào mà nó thực hiện đều được phê duyệt.
  • Giữ dữ liệu của bạn. Failproof AI Observability tự lưu trữ: sự kiện, prompt và phân tích ở lại trong cơ sở hạ tầng bạn kiểm soát.

Những gì bạn nhận được

Failproof AI Observability được tổ chức xung quanh ba ý tưởng (observe, analyzeadmin), phản ánh trong thanh bên trái của bảng điều khiển. Observe (sự thật thô của những gì đã xảy ra):
  • Luồng sự kiện: dòng sự kiện trực tiếp, từng bước của mỗi lần chạy (lệnh gọi công cụ, lệnh gọi mô hình, hook, lỗi).
  • Phiên: những sự kiện đó được tổng hợp thành một hàng trên mỗi lần chạy, mỗi cái sẵn sàng được chấm điểm, với một đồ thị thực thi kiểu git.
  • Chỉ số hiệu suất: bản đồ nhiệt độ trễ trên mỗi bề mặt và chỉ số p50/p95/p99 cho mô hình, công cụ và hook, để một tăng đột biến ở phần đuôi nổi bật so với mức trung bình.
  • Theo dõi lỗi: một bề mặt phân loại cho mọi thứ không ổn, chỉ cách một cú nhấp chuột từ một cảnh báo kích hoạt.
Trang Tools observe: một bản đồ nhiệt độ trễ, một dải phần trăm và một thanh phân phối công cụ trên 24 thùng thời gian Mỗi bề mặt observe kết hợp một sparkline và chỉ số p50/p95/p99 với một bản đồ nhiệt độ trễ và một dải phần trăm. Hiển thị ở đây: Công cụ. Analyze (chuyển hoạt động thành câu trả lời):
  • Truy vấnbảng điều khiển: SQL đã lưu trên sự kiện và đánh giá của bạn, biểu đồ thành các bảng điều khiển được chia sẻ, phạm vi tổ chức.
  • Đánh giá: điểm chất lượng do dịch vụ đánh giá của riêng bạn tạo ra, với lý do cho mỗi điểm.
  • Kiểm toán: các cuộc điều tra định kỳ phát hiện các mô hình lỗi qua các phiên.
  • Cảnh báosự cố: các quy tắc ngưỡng thông báo cho bạn, cộng với quy trình xử lý sự cố để phân loại chúng.
Giao diện (truy cập dữ liệu của bạn cách bạn muốn):
  • CLI: điều khiển toàn bộ triển khai của bạn từ terminal hoặc script, và để một agent lập mã làm điều đó cho bạn bằng tiếng Anh thuần túy.
  • Trợ lý AI: đặt câu hỏi về các agent của bạn bằng tiếng Anh thuần túy, ngay bên trong bảng điều khiển.
  • REST API: mọi thứ mà bảng điều khiển và CLI làm được hỗ trợ bởi một REST API bạn có thể gọi trực tiếp với một khóa API được phân phối — nhập sự kiện, truy vấn phiên và đánh giá, và quản lý bảng điều khiển, cảnh báo, kiểm toán, người dùng và khóa, để bạn có thể tích hợp Failproof AI Observability vào công cụ của riêng bạn.
Admin (chạy nó cho nhóm của bạn):
  • Khóa API: token được phân phối cho bộ sưu tập, bảng điều khiển và trợ lý.
  • Người dùng: đăng nhập không mật khẩu, dựa trên email với danh sách cho phép.
  • Cài đặt: cấu hình trên mỗi tổ chức, bao gồm ghi đè cửa sổ ngữ cảnh mô hình.

Cách các phần ghép lại

Dữ liệu chảy theo một hướng, từ mã agent của bạn tới bảng điều khiển: agent của bạn (thông qua Python SDK) phát hành sự kiện cho agenteye-collector, nó gửi tới server, server phục vụ bảng điều khiển. Hai dịch vụ tùy chọn hoàn thiện nó — một dịch vụ chấm điểm (đánh giá) và một dịch vụ trợ lý AI (chat trong bảng điều khiển).
  • Python SDK: bạn thêm một vài lệnh gọi agenteye.event.* vào agent của bạn; sự kiện được đệm cục bộ.
  • agenteye-collector: một daemon nhẹ trên mỗi máy agent mà tập hợp các sự kiện và gửi chúng tới server.
  • Server: nhập sự kiện của bạn, giữ trạng thái hoạt động trong cơ sở dữ liệu của riêng bạn, và phục vụ REST API mà bảng điều khiển, CLI và các tích hợp của riêng bạn đều sử dụng.
  • Bảng điều khiển: nơi bạn khám phá mọi thứ.
  • Dịch vụ tùy chọn: một dịch vụ chấm điểm (đánh giá) và một dịch vụ trợ lý AI (chat trong bảng điều khiển).
Đối với từ vựng được sử dụng trong toàn bộ tài liệu (event, session, evaluation, audit, finding, incident), xem Khái niệm.

Nhận Failproof AI Observability

Failproof AI Observability là một sản phẩm doanh nghiệp từ Failproof AI, và nó hoạt động cùng với Failproof AI Enforcement — sản phẩm chính sách và guardrail — dưới thương hiệu Failproof AI. Nó chạy hoàn toàn trong môi trường của riêng bạn. Nếu bạn chưa có quyền truy cập vào các gói, hãy yêu cầu một bản demo và chúng tôi sẽ thiết lập cho bạn: gửi email tới nikita@befailproof.ai.

Bước tiếp theo

  • Khái niệm: từ vựng Failproof AI Observability trong một nơi.
  • Quan sát: theo dõi những gì các agent của bạn làm, lần chạy sau lần chạy.
  • Bảo mật: cách Failproof AI Observability giữ dữ liệu của bạn được cô lập và dưới sự kiểm soát của bạn.