Skip to main content
Diese Seite definiert das Vokabular, das Failproof AI Observability verwendet. Wenn ein Begriff in einem anderen Leitfaden unbekannt ist, finden Sie ihn hier erklärt. Sie müssen ihn nicht von Anfang bis Ende lesen: Überfliegen Sie ihn oder springen Sie zurück, wenn Sie ein Wort genauer klären möchten.

Das Datenmodell

Ereignis (Event) Die kleinste Dateneinheit. Ein Ereignis zeichnet einen einzelnen Schritt auf, den Ihr Agent ausgeführt hat: ein tool_use, ein model_request, ein hook_completed, ein error und so weiter. Ihr Agent sendet Ereignisse über das Python SDK; sie erscheinen live auf der Events-Seite. Sitzung (Session) Ein einzelner Agentenlauf, identifiziert durch eine session_id. Eine Sitzung umfasst alle Ereignisse, die diese ID teilen, zusammengefasst in einer einzelnen Zeile auf der Sessions-Seite und als Ausführungsgraph auf der Detailseite dargestellt. Eine Sitzung beginnt in der Regel mit agent_start und endet mit agent_end. Agent Ein benannter Akteur innerhalb eines Laufs, identifiziert durch eine agent_id. Ein Lauf kann mehrere Agenten umfassen: zum Beispiel ein Planer, der einen Zusammenfassungs-Subagenten erzeugt. Subagenten tragen eine parent_id, die es Failproof AI Observability ermöglicht, sie in eigenen Spuren im Ausführungsgraph darzustellen. Umgebung (Environment) Eine Bezeichnung für den Ort, an dem der Lauf stattgefunden hat: production, staging, dev. Sie legen sie einmalig bei der Konfiguration des SDK fest. Fast jede Dashboard-Seite kann nach Umgebung gefiltert werden. Kontextfenster-Auslastung Der prozentuale Anteil des Kontextfensters eines Modells, den eine Antwort verbraucht hat. Failproof AI Observability stempelt diesen Wert auf model_response-Ereignisse für bekannte Modelle, sodass das Wachstum von Prompts und bevorstehende Kompaktierungen direkt im Ereignisstrom sichtbar sind.

Qualität

Evaluierung (Evaluation) Eine Qualitätsbewertung für eine abgeschlossene Sitzung, die von einem von Ihnen betriebenen Bewertungsdienst erzeugt wird. Evaluierungen sind optional: Bis Sie einen Evaluator anschließen, werden Sitzungen zwar aufgezeichnet, aber nicht bewertet. Jede Evaluierung kann mehrere benannte Bewertungen enthalten (zum Beispiel helpfulness, factuality, tool_efficiency), jeweils mit einer kurzen Begründungsnotiz. Siehe Evaluation suite. Score-Schlüssel (Score key) Der Name einer Dimension, über die ein Evaluator berichtet, beispielsweise helpfulness. Warnregeln und Audits können einen bestimmten Score-Schlüssel im Zeitverlauf überwachen. Evaluator Ihr Bewertungsdienst. Failproof AI Observability sendet das Transkript eines abgeschlossenen Laufs per POST daran und speichert die zurückgegebenen Bewertungen. Es wird kein Standard-Evaluator mitgeliefert; die Bewertungslogik liegt bei Ihnen.

Fehler finden und beheben

Hook Eine Absicherung oder ein Nebeneffekt, den Ihr Agenten-Framework um einen Schritt herum ausführt: eine Inhaltssicherheitsprüfung, PII-Schwärzung, eine Budget-Überwachung. Hooks senden hook_triggered- und hook_completed-Ereignisse mit einem outcome (allow, deny, modify) und haben eine eigene Beobachtungsseite. Warnregel (Alert rule) Eine Regel, die auslöst, wenn eine Metrik einen von Ihnen festgelegten Schwellenwert überschreitet: Fehlerrate, p95-Latenz, Token-Kosten oder ein Evaluator-Score. Wenn eine Regel auslöst, öffnet sie einen Vorfall und benachrichtigt Ihre ausgewählten Kanäle (E-Mail, Slack, Webhook, im Dashboard). Siehe Alerts. Vorfall (Incident) Ein offenes Problem, das erstellt wird, wenn eine Warnregel auslöst. Vorfälle haben einen Lebenszyklus (bestätigen, zuweisen, lösen) und eine Aktivitätszeitachse, die jede Aktion aufzeichnet. Sie können auch manuell einen erstellen. Audit Eine wiederkehrende Untersuchung (stündlich bis wöchentlich), die Ihre Logs sitzungsübergreifend nach Fehlermustern durchsucht, für die Sie noch keine Regel geschrieben haben: Fehlercluster, niedrige Bewertungen, Latenz-Ausreißer, Tool-Call-Schleifen und Läufe, die nie abgeschlossen wurden. Während eine Warnregel eine bereits bekannte Metrik überwacht, zeigt Ihnen ein Audit, worauf Sie als Nächstes schauen sollten. Siehe Audits. Befund (Finding) Ein priorisiertes, evidenzgestütztes Ergebnis eines Audit-Laufs. Ein Befund benennt ein Muster, verlinkt auf die genauen Sitzungen dahinter und hat einen Triage-Lebenszyklus (bestätigen, lösen, stummschalten, verwerfen). Failproof AI Observability dedupliziert Befunde laufübergreifend, sodass ein bekanntes Muster aktualisiert wird, anstatt sich anzuhäufen. Der KI-Assistent Der Dashboard-interne Chat, der Fragen zu Ihren Agenten in einfachem Englisch über Ihre eigenen Daten beantwortet. Er ist standardmäßig schreibgeschützt; alles, was er erstellt (eine gespeicherte Abfrage, ein Dashboard), erfordert eine Genehmigung, und er kann niemals löschen. Siehe AI assistant.

Betrieb

Organisation (Tenant) Ein isolierter Arbeitsbereich. Eine Failproof AI Observability-Instanz kann viele Organisationen hosten, jede mit eigenen Benutzern, Schlüsseln und Daten. Jede Dashboard-URL ist unter Ihrem Org-Slug (/<org-slug>/…) eingeschränkt. Collector agenteye-collector, der schlanke Daemon, der auf jedem Agenten-Rechner läuft, die vom SDK auf die Festplatte geschriebenen Ereignisse bündelt und an den Server sendet. API-Schlüssel (API key) Ein eingeschränktes Token, das einen Client gegenüber dem Server authentifiziert. Schlüssel tragen granulare Berechtigungen (zum Beispiel events:add für den Collector, schreibgeschützte Bereiche für einen Dashboard-Schlüssel). Siehe API keys. Server Der Ingest- und API-Dienst. Er nimmt Ereignisse entgegen, speichert den Betriebsstatus in Ihren Datenbanken und stellt das Dashboard und die CLI bereit. Dashboard Die Web-Oberfläche. Jede Seite ist einer Organisation zugeordnet und liest über die API des Servers.

Nächste Schritte

  • Overview: wie diese Bausteine zusammenpassen.
  • Observability: die Beobachtungsoberflächen (Events, Sessions, Models, Tools, Hooks, Errors).