OpenAI stoppt Reasoning-Extraktion – Erfolg der Angreifer bleibt offen

|Autor: QUASA-Redaktion|4 Min. Lesezeit
OpenAI stoppt Reasoning-Extraktion – Erfolg der Angreifer bleibt offen

OpenAI hat laut seinem Sicherheitsbericht vom 30. September 2026 eine Kampagne zur Extraktion geschützten Modell-Reasonings gestoppt: Am 24. und 25. Juli registrierte das Unternehmen 16.000 Anfragen mit einem einschlägigen Muster von mehr als 4.000 Nutzern. Einen Kern der Aktivität ordnet OpenAI Personen mit Verbindung zu Moonshot AI zu, dem Entwickler von Kimi.

Die Einordnung von Tom’s Hardware hebt die Grenze dieser Zahl hervor: Sie zählt Extraktionsversuche, keine nachgewiesenen erfolgreichen Abflüsse. Weder eine Erfolgsquote noch die konkret angegriffenen Modelle oder die Zahl eindeutig Moonshot AI zugeordneter Konten wurden veröffentlicht. Damit ist die gestoppte Aktivität dokumentiert, ihr möglicher Ertrag aber offen.

Ein Replay über zwei Unterhaltungen

Der beobachtete Angriff setzte an Modellinteraktionen an. Geschütztes Reasoning ist die interne Aufzeichnung der Schritte, mit denen ein Modell eine Aufgabe bearbeitet; diese Schritte sollen nicht als gewöhnlicher Antworttext erscheinen. Werden sie dennoch sichtbar, können sie Informationen preisgeben, die in der endgültigen Antwort fehlen. Ihre systematische Nutzung zum Trainieren, Nachbilden oder Verbessern eines anderen Modells entspricht dem Muster adversarieller Modelldestillation.

Bei einer der beschriebenen Methoden übernahmen die Beteiligten verschlüsseltes Reasoning aus einer Unterhaltung in eine andere. Dort forderten sie ein Modell auf, den verborgenen Inhalt zu entschlüsseln und als Text wiederzugeben. Voraussetzung für diesen Replay-Pfad war, dass jemand das verschlüsselte Artefakt bereits besaß. Die Verschlüsselung selbst wurde dabei nicht gebrochen; ebenso wenig wurden eine Datenbank kompromittiert oder gespeicherte Nutzerchats direkt ausgelesen.

Der kritische Übergang liegt in der erneuten Verarbeitung des Artefakts. Ein verschlüsselter Inhalt kann vor direkter Lektüre geschützt sein und trotzdem zum Gegenstand einer Anfrage werden, die eine lesbare Wiedergabe verlangt. Eine zweite Grenze entsteht bei der Ausgabe: Liefert ein Modell seine Antwort fortlaufend aus, muss ein möglicher Reasoning-Text erkannt und angehalten werden, bevor er den Anfragenden erreicht. Beide Übergänge erklären, weshalb Kontosperren allein diese Art von Versuch nicht abdecken.

Großer Prompt-Cluster, engere Zuschreibung

Die beiden Spitzen im Juli waren Teil einer längeren Beobachtung. Die Aktivität begann zunächst mit geringem Volumen; bei der anschließenden Untersuchung tauchten verwandte Prompt-Muster in einem Cluster von mehr als 15.000 Nutzern auf. Diese Aktivität galt bis zum 28. Juli als vollständig unterbunden. Die größere Clusterzahl beschreibt verwandte Muster und darf deshalb weder mit der Zahl erfolgreicher Extraktionen noch mit der Größe des Moonshot AI zugeordneten Kerns gleichgesetzt werden.

Auch die Zuschreibung hat eine klare Grenze: Sie betrifft Personen mit Verbindung zu Moonshot AI, nicht pauschal alle Nutzer im untersuchten Cluster. Ob sämtliche beobachteten Betreiber zu einem einzigen Akteur gehörten, bleibt unklar. Ein Nutzerkonto ist zudem keine verlässliche Zähleinheit für Personen: Mehrere Konten können von denselben Beteiligten stammen, während eine einzelne Anfrage nichts über den Inhalt der ausgelieferten Antwort verrät. Für die Bewertung des Vorfalls müssen daher Anfragen, Nutzerkennungen, Betreiber und tatsächlich sichtbare Inhalte auseinandergehalten werden.

Die Abwehr greift an vier Stellen

Bei den Zugängen sperrte oder beschränkte OpenAI betrügerische Konten, verschärfte die Kontrollen für Registrierung und Infrastruktur und weitete die Beobachtung verbundener Netzwerke aus. Das richtet sich gegen die Verteilung gleichartiger Anfragen auf viele Zugänge. Die Maßnahme betrifft den Umfang einer Kampagne: Selbst wenn einzelne Anfragen unauffällig wirken, kann ihre Verbindung über Konten und Prompt-Muster erkennbar werden.

Bei portablen Reasoning-Artefakten schloss das Unternehmen einen Pfad, über den bereits vorhandenes verschlüsseltes Reasoning eines anderen Nutzers erneut eingereicht und sein Inhalt zurückgewonnen werden konnte. Zugleich verstärkte es den Schutz über Nutzer, Arbeitsbereiche, Organisationen und Modellfamilien hinweg. Diese Grenzen sind für denselben Replay-Versuch entscheidend: Das Artefakt wechselt den Kontext, während der geschützte Inhalt auch im neuen Kontext verborgen bleiben muss.

Für gestreamte Antworten kamen Prüfungen hinzu, die Ausgaben mit möglichem Reasoning-Inhalt erkennen und vor der Auslieferung anhalten sollen. Bei verwandter Aktivität über Dienste Dritter arbeitete OpenAI mit deren Betreibern daran, beteiligte Konten zu identifizieren und zu stören. Damit reichen die Kontrollen von der Erstellung eines Zugangs über die Verarbeitung eines erneut eingereichten Artefakts bis zur ausgelieferten Antwort und zu Bereitstellungen außerhalb des eigenen Dienstes.

Partner-Deployments als nächste Grenze

Die Verteilung der Schutzmaßnahmen auf fremd betriebene Bereitstellungen ist noch laufende Arbeit. Dasselbe gilt für Abwehrmechanismen gegen Angriffe über Tool-Ausgaben, die mehr als gewöhnlichen sichtbaren Text auswerten müssen. Erkenntnisse zu der Kampagne wurden über das Frontier Model Forum und staatliche Kanäle zum Informationsaustausch weitergegeben, damit andere Entwickler nach vergleichbaren Mustern suchen können.

Für API- und Plattformteams liegt die unmittelbare Folge in der Reichweite des beschriebenen Angriffspfads: Eine laufende Unterhaltung kann ein geschütztes Artefakt aus einem anderen Kontext als Eingabe erhalten, und eine Antwort kann schon während des Streamings Inhalte preisgeben. Ob die angekündigten Schutzschichten in Partner-Deployments denselben Stand erreichen, hängt von der weiteren Umsetzung bei diesen Betreibern ab.

Lesen Sie auch:

Teilen:

Newsletter abonnieren

Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.

0