Zurück zur Übersicht
BranchennachrichtenKI-SicherheitLLMCybersecurity

Sicherheitslücke bei KI-Modellen: Forscher extrahieren verborgene Gedankengänge aus proprietären APIs

Ein neuer Forschungsbericht mit dem Titel „Stealing Reasoning Traces from Proprietary LLM APIs“ deckt eine kritische Schwachstelle bei führenden KI-Anbietern wie OpenAI, Anthropic und Google auf. Durch eine Methode namens „Encrypted Thought Injection“ ist es möglich, die eigentlich verborgenen Denkprozesse (Reasoning Traces) leistungsstarker Modelle zu stehlen. Dabei werden verschlüsselte Datenblöcke, die normalerweise nur zur Fortführung von Konversationen dienen, in schwächere, manipulierte Modelle injiziert. Diese geben die internen Überlegungen des Ursprungsmodells daraufhin im Klartext aus. Die Analyse zeigt, dass die extrahierten Daten exakt mit der Anzahl der vom System gemeldeten „Thinking Tokens“ übereinstimmen. Bei den Untersuchungen wurden zudem hunderte technische Identifikatoren sowie sensible Informationen wie PII und Zugangsdaten in den Datenströmen entdeckt.

Hacker News

Die wichtigsten Punkte

  • Neue Angriffsmethode entdeckt: Forscher demonstrieren, wie verborgene Denkprozesse (Reasoning Traces) aus geschlossenen KI-APIs extrahiert werden können.
  • Ausnutzung der Portabilität: Verschlüsselte Gedankenblöcke können aus ihrem ursprünglichen Kontext gerissen und in andere Modelle injiziert werden.
  • Betroffene Anbieter: Die Schwachstelle wurde bei Modellen von OpenAI, Anthropic und Google nachgewiesen.
  • Datenleck-Risiko: Neben den Denkprozessen wurden technische Identifikatoren, personenbezogene Daten (PII) und Anmeldedaten in den Traces gefunden.
  • Präzise Rekonstruktion: Die extrahierten Texte entsprechen exakt der Anzahl der vom System angegebenen verborgenen Token.

Analyse

Die Mechanik der „Encrypted Thought Injection“

Moderne KI-Anbieter senden die internen Gedankengänge eines Modells oft als verschlüsselten Block an den Client zurück. Dieser Block wird bei einer Fortsetzung der Konversation wieder an den Server gesendet, um den Kontext zu wahren. Die Forschung zeigt nun, dass diese Blöcke „portabel“ sind. Das bedeutet, ein verschlüsselter Gedankenblock eines hochleistungsfähigen Modells (wie Claude 4 Opus) kann abgefangen und in ein schwächeres, durch einen Jailbreak manipuliertes Modell (wie Claude Haiku) eingespeist werden. Das schwächere Modell fungiert dabei als Entschlüsselungswerkzeug und gibt die ursprünglichen, geheimen Gedankengänge wortwörtlich im Klartext aus.

Umfang und gefundene Daten

Die Untersuchung basierte unter anderem auf der Lösung von 120 Codeforces-Problemen. Dabei korrelierte die Länge der dekodierten Texte präzise mit der Anzahl der „Hidden Thinking Tokens“, die von der API gemeldet wurden. Besonders besorgniserregend ist die Art der extrahierten Informationen. In den über 6.700 gesammelten Datenpunkten fanden die Forscher 351 eindeutige geleakte Elemente, darunter 204 technische Identifikatoren, 126 personenbezogene Informationen (PII) und 23 Sätze von Zugangsdaten (Credentials). Dies verdeutlicht, dass die internen Denkprozesse der Modelle weitaus mehr sensible Informationen enthalten können, als in der finalen Textausgabe sichtbar ist.

Bedeutung für die KI-Branche

Dieser Durchbruch in der Sicherheitsforschung stellt das aktuelle Vertrauensmodell von „Hidden Reasoning“ in Frage. Während Anbieter versuchen, die internen Logikschritte ihrer Modelle zu verbergen – sei es zum Schutz des geistigen Eigentums oder zur Verbesserung der Nutzererfahrung –, zeigt dieser Angriff, dass die aktuelle technische Umsetzung der Verschlüsselung unzureichend ist. Für die Branche bedeutet dies eine notwendige Überarbeitung der API-Sicherheit und der Art und Weise, wie Kontextdaten zwischen Client und Server übertragen werden, um Industriespionage und den Abfluss sensibler Daten zu verhindern.

Häufig gestellte Fragen

Frage: Was ist eine „Reasoning Trace“?

Eine Reasoning Trace ist die Abfolge von internen Gedankengängen, die ein KI-Modell durchläuft, bevor es eine endgültige Antwort generiert. Diese Schritte sind für den Nutzer normalerweise nicht sichtbar.

Frage: Welche Modelle sind von dieser Sicherheitslücke betroffen?

Die Forscher konnten den Angriff erfolgreich bei den führenden Modellen der großen Anbieter OpenAI, Anthropic und Google demonstrieren.

Frage: Welche Gefahr besteht durch das Auslesen dieser Daten?

Neben dem Diebstahl von geistigem Eigentum (wie das Modell denkt) besteht die Gefahr, dass sensible Daten wie Passwörter oder persönliche Informationen, die das Modell während des Denkprozesses verarbeitet, an die Öffentlichkeit gelangen.

Ähnliche Nachrichten

Branchennachrichten

Parallel halbiert Recherchezeit und Kosten für Arbeitsmarktdaten durch den Einsatz von GPT-6 Astra im Praxiseinsatz

Laut einer Veröffentlichung im OpenAI Blog konnte das Unternehmen Parallel durch den Einsatz des Modells GPT-6 Astra signifikante Effizienzsteigerungen erzielen. Die KI-Agenten von Parallel nutzen das neue Modell für die Recherche und Synthese von Arbeitsmarktdaten. Im direkten Vergleich zu zuvor eingesetzten Vorgängermodellen gelang es, sowohl den zeitlichen Aufwand für diese Recherche- und Syntheseprozesse als auch die anfallenden Kosten um jeweils die Hälfte zu reduzieren. Dieser Praxiseinsatz verdeutlicht, wie moderne KI-Modelle wie GPT-6 Astra in automatisierten Agentenumgebungen eingesetzt werden, um datenintensive Aufgaben wirtschaftlicher und schneller abzuwickeln. Der Bericht von OpenAI hebt hervor, dass die agentenbasierte Verarbeitung von komplexen Marktinformationen durch GPT-6 Astra eine Verdopplung der Geschwindigkeit bei gleichzeitiger Halbierung des Kostenaufwands ermöglicht hat, ohne dass im Originalbericht zusätzliche technische Spezifikationen oder abweichende Kennzahlen genannt wurden.

Branchennachrichten

OpenAI definiert Prioritäten und Prinzipien für unabhängige Sicherheitsbewertungen von Frontier-KI-Modellen durch Dritte

OpenAI hat einen umfassenden Leitfaden mit Prioritäten und Prinzipien für die unabhängige Sicherheitsüberprüfung von fortschrittlichen KI-Modellen und Schutzmechanismen vorgestellt. Angesichts der wachsenden Fähigkeiten von Frontier-Modellen betont das Unternehmen die Notwendigkeit externer Kontrollen, um Risiken frühzeitig aufzudecken und Sicherheitsversprechen wissenschaftlich fundiert zu validieren. Die Initiative konzentriert sich auf vier zentrale Schwerpunktbereiche: die Prüfung sogenannter Safety Cases, die Evaluierung kritischer Schutzmaßnahmen über Entwicklungs- und Einsatzphasen hinweg, die Überprüfung von Fähigkeitstests in Risikofeldern sowie unabhängige Untersuchungen kritischer Misalignment-Vorfälle. Gleichzeitig formuliert OpenAI klare Anforderungen an Prüforganisationen in Bezug auf Unabhängigkeit, technische Expertise, Vertraulichkeit und verantwortungsvolle Veröffentlichung. Ziel ist es, gemeinsame internationale Sicherheitsstandards zu etablieren und das Zusammenspiel zwischen Spitzenforschung, Rechenschaftspflicht und Schutz sensibler Informationen verlässlich zu strukturieren.

MTFM von Meituan: Neues einheitliches Empfehlungs-Basismodell für mehrere zentrale Geschäftsbereiche im Bereich der Essenslieferung vorgestellt
Branchennachrichten

MTFM von Meituan: Neues einheitliches Empfehlungs-Basismodell für mehrere zentrale Geschäftsbereiche im Bereich der Essenslieferung vorgestellt

Das Technikteam des Plattformbetreibers Meituan hat das neuartige Empfehlungs-Basismodell MTFM vorgestellt. Das System baut direkt auf den technologischen Grundlagen des bisherigen Frameworks MTGR auf und stellt einen wesentlichen Meilenstein für die Weiterentwicklung industrieller Empfehlungssysteme dar. Mit MTFM gelingt es Meituan zum ersten Mal in der Praxis, ein einheitliches Fein-Ranking-Modell für mehrere zentrale Geschäftsbereiche und Szenarien innerhalb seines Lieferservices bereitzustellen. Früher kamen in unterschiedlichen Geschäftszweigen oft getrennte Architekturen und Bewertungsverfahren zum Einsatz. MTFM bündelt diese verschiedenen Anforderungen nun in einem konsistenten Basismodell. Der Fachbeitrag des Meituan-Technikteams verdeutlicht die erfolgreiche Umsetzung von Foundation Models für anspruchsvolle Lieferszenarien und zeigt, wie spezialisierte Ranking-Modelle zu ganzheitlichen Großmodellen weiterentwickelt werden können.