
OpenAI stoppt Extraktion geschützten KI-Reasonings durch Moonshot AI
OpenAI hat eine koordinierte Kampagne unterbrochen, die versuchte, geschütztes Reasoning aus seinen KI-Modellen zu extrahieren, und schreibt die Aktivität mit Peking verbundenen Personen zu …
OpenAI hat eine systematische Kampagne abgeschaltet, die darauf abzielte, geschütztes Reasoning aus seinen künstlichen Intelligenzmodellen auf unerlaubte Weise zu extrahieren – eine als adversariale Destillation bekannte Technik. Das Unternehmen brachte einen Kern der Aktivität, die von Anfang Juli bis Ende Juli 2026 andauerte, mit Personen in Verbindung, die mit Moonshot AI, einem chinesischen KI-Unternehmen mit Sitz in Peking, assoziiert sind.
Die Kampagne begann am 1. Juli 2026 mit wenig umfangreichen Sondierungsanfragen. Sie schwoll am 24. und 25. Juli dramatisch an, als OpenAI rund 16.000 versuchte Anfragen mit einem bestimmten Extraktionsmuster registrierte, die sich auf mehr als 4.000 Nutzerkonten verteilten. Eine breitere Überprüfung deckte später ähnliche Prompt-Musteraktivitäten bei über 15.000 Nutzern auf. OpenAI unterbrach die Operation am 28. Juli 2026 vollständig.
Adversariale Destillation ist die systematische und nicht autorisierte Nutzung der Ausgaben eines Modells, um ein anderes Modell zu trainieren, zu replizieren oder zu verbessern. In diesem Fall haben die Akteure keine Verschlüsselung gebrochen, Datenbanken kompromittiert oder direkten Zugriff auf gespeicherte Unterhaltungen erlangt. Stattdessen manipulierten sie die Interaktionen mit dem Modell so, dass geschütztes Reasoning – das interne schrittweise Denken, das ein Modell vor der endgültigen Antwort durchführt – in für den Anfrager sichtbaren Formen reproduziert werden konnte, und zwar in großem Maßstab und unter Verstoß gegen die Nutzungsbedingungen von OpenAI.
Um das Risiko zu verstehen: Geschütztes Reasoning bietet einen Einblick darin, wie ein Modell eine Aufgabe angeht. Seine Extraktion kann sensible Daten preisgeben und Wettbewerbern helfen, die Fähigkeiten eines Modells zu kopieren, ohne dieselben Ressourcen in Sicherheitsvorkehrungen zu investieren. OpenAI wies darauf hin, dass extrahiertes Reasoning verwendet werden könnte, um ein anderes Modell zu trainieren, wobei die ursprüngliche Leistung erhalten bleibt, aber die Sicherheitsfilter für den Nutzer abgelegt werden – was sowohl Sicherheits- als auch nationale Sicherheitsbedenken aufwirft, insbesondere wenn Modelle Fähigkeiten in dual-use-Bereichen erwerben.
Nach dem Vorfall führte OpenAI zusätzliche Gegenmaßnahmen ein. Es wurde ein „Pfad“ geschlossen, der es jemandem, der die verschlüsselte Reasoningspur eines anderen Nutzers besaß, ermöglichte, diese erneut abzuspielen und ihren Klartextinhalt wiederherzustellen. Das Unternehmen fügte auch Prüfungen hinzu, um jede gestreamte Ausgabe, die Reasoning offenbaren könnte, zu erkennen und zurückzuhalten, bevor sie den Nutzer erreicht. Darüber hinaus sperrte OpenAI die betrügerischen Konten, die an der Kampagne beteiligt waren.
Diese Episode beleuchtet ein tieferliegendes Architekturproblem. In einer im August 2026 veröffentlichten Studie entdeckten Forscher von MATS Research, dem ELLIS Institute Tübingen und Synk eine Schwachstelle, die KI-Modelle mehrerer Anbieter betrifft, darunter Claude, Gemini und GPT. Sie fanden heraus, dass verschlüsselte Reasoningspuren über verschiedene Sitzungen, Nutzer und Modelle innerhalb des Ökosystems eines Anbieters hinweg vollständig kompatibel und austauschbar sind. Ein Angreifer könnte eine verschlüsselte Reasoningspur eines starken, gut geschützten Modells in ein schwächeres, weniger abgesichertes Modell desselben Anbieters einschleusen und das schwächere Modell zwingen, das Reasoning wörtlich im Klartext auszugeben – ohne das stärkere Modell jemals direkt zu jailbreaken. Diese Technik ermöglicht auch die großflächige Extraktion privater Daten, unsichtbare Prompt-Injections, bei denen schädliche Nutzlasten vollständig in verschlüsselten Blöcken verborgen sind, und die versehentliche Offenlegung gefährlicher Informationen aus dem Reasoning-Prozess, selbst wenn die endgültige sichtbare Ausgabe des Modells eine schädliche Anfrage ablehnt.
Dies ist nicht das erste Mal, dass Moonshot AI mit Destillationsvorwürfen konfrontiert ist. Im letzten Monat behauptete das konkurrierende KI-Unternehmen Anthropic, Moonshot AI habe Kundenanfragen von seiner eigenen Kimi-Plattform heimlich an Anthropics Claude-Modell weitergeleitet und dann Claudes Antworten den Nutzern angezeigt. Anthropic behauptete weiter, dass Moonshot AI einen Teil dieser Austausche zurückgehalten habe, um sein eigenes Chain-of-Thought-Modell zu trainieren. Diese Aktivität wird unter der Kennung GTG-16002 verfolgt.
Für Unternehmen und Website-Betreiber, die KI-gesteuerte Funktionen in ihre Online-Präsenz integrieren – wie Chatbots, Content-Generatoren oder Kundenservice-Automatisierung – ist dieser Vorfall eine Mahnung, dass externe KI-Dienste nur so sicher sind wie ihre am stärksten beanspruchten Schutzvorkehrungen. AEU-I, unsere sicherheitsorientierte IT- und Infrastrukturberatung, hilft Organisationen, die mit Drittanbietertools verbundenen Risiken zu bewerten, Datenverarbeitungsrichtlinien zu implementieren und auf abnormale Zugriffsmuster zu achten, die auf eine unbefugte Extraktion proprietärer Informationen hindeuten könnten.
So schützen Sie sich
- Lesen Sie die Datenschutzrichtlinien und Datennutzungseinstellungen jedes KI-Tools, das Ihre Website verwendet, z. B. eines Chatbots oder Inhaltsgenerators, und schalten Sie die Datenweitergabe für das Modelltraining ab, falls diese Option besteht.
- Vermeiden Sie das Einfügen sensibler Geschäftsdaten, Kundendetails oder proprietären Codes in öffentliche KI-Prompt-Schnittstellen.
- Wechseln Sie API-Schlüssel für KI-Dienste regelmäßig und widerrufen Sie alle, die Sie nicht mehr nutzen, um unbefugten Zugriff zu verhindern.
- Überwachen Sie das Nutzungs-Dashboard Ihrer verbundenen KI-Konten auf unerwartete Anfragespitzen, da diese auf einen Missbrauch Ihres Kontos hindeuten können.
- Halten Sie die Plugins und Themes Ihrer Website auf dem neuesten Stand, sodass Angreifer keinen schädlichen Code einschleusen können, der die Interaktionen zwischen Ihren Besuchern und eingebetteten KI-Funktionen abfängt.
Begriffe Erklärt
- distillation Eine Technik, bei der Wissen von einem großen, komplexen KI-Modell auf ein kleineres oder anderes Modell übertragen wird, oft indem es mit den Ausgaben des größeren Modells trainiert wird.
- adversarial distillation Die nicht autorisierte Nutzung der Ausgaben eines Modells, um ein anderes Modell zu replizieren oder zu verbessern, typischerweise unter Umgehung von Sicherheitsfiltern und Nutzungsbedingungen.
- encrypted reasoning Der interne, schrittweise Denkprozess, den ein KI-Modell durchläuft, bevor es eine endgültige Antwort gibt, der oft verborgen und geschützt wird, um die internen Abläufe des Modells zu schützen.
- prompt injection Ein Angriff, bei dem jemand eine bösartige Anweisung in der Eingabe eines Modells versteckt, um es zu unbeabsichtigtem Verhalten zu verleiten oder versteckte Daten preiszugeben.
- chain-of-thought (CoT) Eine Methode, bei der die KI Zwischenschritte des Denkens artikuliert, um ihre endgültige Antwort zu verbessern und ihr Denken transparenter zu machen.