
KI-Agenten überwachen: Ein HTTP-200 sagt nichts über die erledigte Aufgabe

Ein HTTP-200 zeigt allein keinen fachlichen Erfolg eines KI-Agenten. Der Status bedeutet nach RFC 9110 lediglich eine erfolgreiche HTTP-Anfrage; ob der Agent die richtige Aufgabe verstanden, zulässige Werkzeuge verwendet und ein brauchbares Ergebnis geliefert hat, muss das Produktionsmonitoring gesondert erfassen.
Die Mindestkonfiguration verbindet deshalb jeden Lauf über eine Trace-ID mit Agenten-, Prompt- und Modellversion, Modell- und Tool-Schritten, Latenz, Tokens, Kosten, Richtlinienentscheidungen, Nutzerfeedback und einem fachlichen Erfolgslabel. Harte Grenzen für Laufzeit, Schritte, Wiederholungen und Kosten müssen den Agenten stoppen oder an einen Menschen übergeben können.
Die Aufgabe ist die Betriebseinheit
Erzeugen Sie beim Eingang einer Aufgabe eine Trace-ID und übernehmen Sie sie in jeden Modell-, Retrieval-, Tool- und Übergabeschritt. Ein Root-Trace umfasst den gesamten Lauf; untergeordnete Spans bilden die einzelnen Aktionen ab. Auch die Microsoft-Lektion zu Traces und Spans beschreibt einen Trace als vollständige Agentenaufgabe und Spans als einzelne Schritte wie Modellaufrufe oder Datenabrufe.
Der Root-Span sollte Start und Ende, Dienst, Umgebung, Workflow- beziehungsweise Agentenversion, Prompt-Version und den Abschlusszustand enthalten. Sinnvolle Zustände sind nicht nur „erfolgreich“ und „fehlgeschlagen“, sondern auch abgebrochen, Zeitlimit erreicht, Kostenlimit erreicht, Richtlinie verletzt oder an einen Menschen übergeben. Der technische Status und das fachliche Urteil bleiben getrennte Felder.
Für einen Modellaufruf benötigen Teams mindestens Anbieter, angeforderte und tatsächlich verwendete Modellversion, Ein- und Ausgabetokens, Latenz, Fehler, Wiederholungen und Abbruchgrund. Werden Kosten berechnet, gehört die verwendete Preistabelle oder ihr Gültigkeitszeitpunkt dazu, damit ein historischer Lauf später nachvollziehbar bleibt.
Tool-Aufrufe als Aktionen protokollieren
Jeder Tool-Aufruf braucht einen eigenen Span mit Tool-Name und -Version, Call-ID, Zielsystem, Start und Ende, Ergebnisstatus, Wiederholungszahl sowie dem Verweis auf den auslösenden Agentenschritt. Erfassen Sie außerdem, ob die Aktion nur gelesen oder externen Zustand verändert hat. Für Nachrichten, Käufe, Änderungen und Löschungen sollten andere Freigaben und Abbruchregeln gelten als für eine Suche.
Beobachtung ersetzt keine Zugriffskontrolle. Wenn ein Agent Werkzeuge mit weitreichenden Berechtigungen nutzt, muss eine mehrschichtige Absicherung der Tool-Nutzung unzulässige Aktionen bereits vor der Ausführung begrenzen; der Trace dokumentiert anschließend Entscheidung und Ergebnis.
Verfügbarkeit und Aufgabenerfolg getrennt bewerten
Technische Telemetrie beantwortet, wie ein Lauf ausgeführt wurde. Ein fachliches Erfolgslabel beantwortet, ob sein Zweck erfüllt ist. Beide Ebenen müssen über dieselbe Trace-ID verbunden sein.
- Ausführung: End-to-End-Latenz, Span-Latenzen, Fehler, Wiederholungen, Tool-Aufrufe, Tokens und Kosten pro Lauf.
- Ergebnis: ein anwendungsbezogenes Label wie vollständig erfüllt, teilweise erfüllt, falsch oder nicht bewertbar.
- Sicherheit: blockierte Aktionen, Richtlinienverstöße, unerlaubte Ziele und Übergaben an menschliche Prüfer.
- Feedback: direkte Bewertungen sowie passend definierte Signale wie Korrektur, sofortige Wiederholung oder Abbruch.
Definieren Sie das Erfolgslabel für jeden Workflow vor der Alarmierung. Bei einem Rechercheagenten können Quellenabdeckung und Widerspruchsfreiheit relevant sein, bei einem Supportagenten die tatsächliche Lösung des Anliegens. Automatische Evaluatoren eignen sich zum Vorsortieren großer Mengen, sollten aber durch deterministische Prüfungen, nachgelagerte Geschäftssignale und gezielte menschliche Stichproben ergänzt werden.
Aggregierte Warnungen sollten nach Workflow sowie Agenten-, Prompt- und Modellversion segmentiert werden. Beobachten Sie Erfolgsquote, Latenzverteilung, Kosten pro erfolgreicher Aufgabe, Tool-Fehlerrate, Richtlinienverstöße und negatives Feedback. Andernfalls kann eine Regression einer neuen Version in einem globalen Mittelwert verschwinden.
Inhalte nur kontrolliert speichern
Prompts, Antworten, Retrieval-Abfragen sowie Tool-Argumente und -Ergebnisse können personenbezogene oder andere vertrauliche Angaben enthalten. Die OpenTelemetry-Referenz für GenAI-Attribute kennzeichnet Ein- und Ausgaben, Retrieval-Abfragen sowie Tool-Inhalte ausdrücklich als potenziell sensibel. Vollständiges Inhaltslogging darf deshalb keine unbeachtete Standardeinstellung sein.
Legen Sie für jedes Inhaltsfeld fest, ob es verworfen, maskiert, gehasht, gekürzt oder nur in einer freigegebenen Stichprobe gespeichert wird. Dokumentieren Sie Zweck, Aufbewahrungsfrist, Speicherort, Verschlüsselung und Zugriffsrollen. Metadaten können im regulären Telemetriesystem liegen, während notwendige Rohinhalte in einen getrennten Speicher mit engerem Zugriff und eigener Löschfrist gehören.
Abbruchregeln müssen während des Laufs greifen
Ein Alarm nach einer endlosen Schleife schützt weder Budget noch Zielsystem. Der Orchestrator muss maximale Gesamtdauer, Schrittzahl, Tool-Aufrufe, Token- oder Kostenbudget und identische Wiederholungen zur Laufzeit durchsetzen. Weitere Stoppsignale sind nicht erlaubte Tools oder Ziele, wiederholt ungültige Argumente und nicht behebbare Richtlinienverstöße.
Jede Grenze braucht eine eindeutige Reaktion: stoppen, eine kontrollierte Ersatzantwort liefern oder an einen Menschen übergeben. Speichern Sie Auslöser und Reaktion im Abschlusszustand des Traces. So lässt sich unterscheiden, ob der Agent kontrolliert begrenzt wurde oder unbemerkt gescheitert ist.
Mindestkonfiguration für den Produktionsstart
- Definieren Sie pro Workflow Aufgabe, erlaubte Aktionen, fachliches Erfolgslabel und harte Abbruchbedingungen.
- Instrumentieren Sie einen Root-Trace und Spans für Modell-, Retrieval-, Tool- und Übergabeschritte.
- Erfassen Sie Versionen, Latenz, Tokens, Kosten, Fehler, Richtlinienentscheidungen und Abschlusszustand in konsistenter Form.
- Verknüpfen Sie Qualitätsbewertungen und Nutzerfeedback über die Trace-ID mit dem ursprünglichen Lauf.
- Filtern Sie sensible Inhaltsfelder und setzen Sie Zugriffsschutz sowie Löschfristen vor einer breiten Speicherung um.
- Testen Sie Schleifen, Tool-Ausfälle, Budgetüberschreitungen und Richtlinienverletzungen und prüfen Sie, ob der Agent tatsächlich stoppt oder eskaliert.
Damit wird die erledigte Aufgabe statt des erreichbaren Endpunkts zur entscheidenden Betriebseinheit. Erst die Verbindung aus Ausführungsspur, fachlichem Ausgang, Sicherheit, Kosten und wirksamen Abbruchgrenzen zeigt, ob ein KI-Agent in Produktion kontrolliert arbeitet.
Lesen Sie auch:
Ähnliche Artikel


KI-Agenten absichern – jeder Werkzeugaufruf braucht eine eigene Grenze

LangGraph zu AgentCore migrieren – der Wrapper ist erst der Anfang

KI-Agenten sicher ausführen: Die Sandbox allein reicht nicht

Anthropic baut einen Not-Aus für Claude – nach vier realen Zwischenfällen

Gemini 3.8 Flash kostet wie sein Vorgänger – kann aber mehr Tokens verbrauchen
Newsletter abonnieren
Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.