failproofai-sdk, dưới failproofai_sdk.evaluator; nhập SDK tracing không tải nó.
Viết các evaluations
@app.eval(key, version=...)đăng ký một evaluation. Key là thứ mà các kết quả của nó được biểu diễn; thay đổi phiên bản bất cứ khi nào logic thay đổi, và mỗi kết quả giữ phiên bản đã tạo ra nó. Một worker chứa tối đa 100 evaluations.result_kindlà"score"trừ khi bạn nói cách khác. Đối với một evaluation"metric"hoặc"assertion", đặt tên một mụcmetricshoặcassertionstheo key: mục đó là kết quả của nó.whenquyết định xem một phiên có áp dụng hay không. Trả vềConditionResult(False, "<reason>")để bỏ qua một phiên, và lý do được ghi lại.- Một evaluation có thể là một hàm thông thường hoặc
async, vàtimeout_secondsgiới hạn nó. - Các khóa payload —
tool_name,response, vàcontentở trên — là bất cứ thứ gì agents của bạn gửi, vì vậy hãy đọc chúng từ một phiên thực.
Chạy worker
Đặt một khóa với quyềnevaluations:run, được tạo dưới Administration → Keys, trong FAILPROOFAI_EVALUATOR_TOKEN — đặt nó từ secret store của bạn thay vì gõ nó vào một lệnh — và khởi động worker:
__main__, python -m failproofai_sdk.evaluator evaluator:app làm điều tương tự.
Các loại kết quả
Một
EvalResult mang ít nhất một score, metric, hoặc assertion, và tối đa 25, mỗi cái dưới một khóa duy nhất.
Phiên
Mỗi sự kiện mang
id, ts, event_type, và payload.
Evaluator cũ
Evaluator SDK trước đó — một dịch vụ HTTP mà Failproof AI gọi tạiEVALUATOR_ENDPOINT, trả lời /evaluate và được thăm dò qua JobPending — đã bị loại bỏ. Xây dựng các evaluator mới trên worker này; các nhà khai thác một instance tự lưu trữ chạy một dịch vụ cũ có thể giữ nó qua quá trình chuyển đổi.
