Sicherheitsforscher Rony Utevsky von Adversa AI hat eine neue Angriffstechnik namens Cryptographic Context Injection entwickelt, die KI-Sicherheitsfilter durch verschlüsselte Payloads umgeht. Die Methode wurde laut Bericht gegen zwei Live-Produktionssysteme demonstriert: xAI's Grok und Google's Gemini. Bei Grok ist die Sicherheitslücke besonders kritisch – ein Angreifer kann damit den kompletten Chat-Verlauf eines Nutzers stehlen, ohne dass dieser etwas anklicken muss.
Kurz & knapp
- Angriffsziel: xAI's Grok und Google's Gemini; Grok-Lücke als kritischer eingestuft
- Technik: AES-256-GCM-Verschlüsselung versteckt Anweisungen vor Content-Filtern; das Modell entschlüsselt die Payload in seiner eigenen Sandbox
- Datendiebstahl: Zugriff auf Nutzername, Standort, Abonnement-Status und vollständiger Chat-Verlauf
- Besonderheit: Zero-Click – kein Nutzer-Klick erforderlich, keine Warnung
Wie der Angriff funktioniert
Der Ablauf ist tückisch einfach: Ein Nutzer wird gebeten, eine Webseite zusammenzufassen, die eine verschlüsselte Payload enthält. Grok besucht die Seite, entschlüsselt die AES-256-GCM-Payload in seiner Python-Sandbox und führt die darin versteckten Anweisungen aus. Das System greift dann auf die privaten Session-Daten des Nutzers zu – inklusive Name, Standort, Abonnement-Plan und vollständiger Chat-Historie – und öffnet automatisch eine URL mit diesen Informationen. Der Nutzer bemerkt nichts davon.
"Cryptographic Context Injection versteckt bösartige Anweisungen in AES-verschlüsseltem Text, damit Sicherheitsfilter sie nicht lesen können, und täuscht die KI dann vor, sie zu entschlüsseln und als ihre eigenen zu vertrauen," heißt es im Bericht von Adversa AI.
Warum bisherige Sicherheitsmaßnahmen versagen
Der entscheidende technische Unterschied zu früheren Cipher-basierten Prompt-Injection-Angriffen liegt in der Entschlüsselung selbst. Statische Sicherheitsfilter klassifizieren Eingaben als Text – sie führen sie nicht aus. Ein Angreifer sendet Ciphertext zusammen mit dem Schlüsselmaterial und einer Entschlüsselungsanweisung. Das Modell führt die Entschlüsselung dann in seiner eigenen Code-Execution-Sandbox durch.
Ältere Techniken wie CipherChat und CodeChameleon nutzten Substitutions-Ciphers, XOR oder Base64 – Verfahren, die das Modell nativ in seinem Kontext dekodieren kann. AES-256-GCM funktioniert anders: Die Entschlüsselung erfordert einen Runtime-Interpreter, den kein Standard-Content-Classifier bei der Inspektion durchführt. Genau diese Lücke nutzt der Angriff aus.
"Die Runtime-Ausführung wäscht von Angreifern kontrollierte Daten in vertrauenswürdige Anweisungen um, die der Agent ausführt. So bekam der Angriff seinen Namen: Kryptografie hilft dabei, vertrauenswürdigen Kontext für den Agenten zu fabrizieren."
Das Ergebnis: Die gestohlenen Daten werden hinter einer harmlosen Anfrage versteckt – etwa "Fasse diese Seite zusammen" – und die Payload erbt die Glaubwürdigkeit, die derselbe Text nie hätte, wenn er direkt in den Prompt eingefügt würde.
Was das für Entscheider bedeutet
Diese Lücke zeigt, dass auch fortgeschrittene KI-Systeme in Produktivumgebungen gegen neue Angriffsklassen anfällig sind. Für Unternehmen, die Grok oder ähnliche Frontier-Modelle evaluieren oder einsetzen, ist das ein klares Signal: Sicherheitsaudits müssen über Standard-Prompt-Injection hinausgehen. Die Fähigkeit eines Modells, Code auszuführen – ein Feature für Produktivität – wird hier zur Angriffsvektor. Organisationen sollten klären, wie ihre KI-Systeme mit verschlüsselten Inhalten umgehen und ob Nutzer-Daten wirklich isoliert sind.
Quellen
Redaktionell verantwortet von Ideal Syka. Quellen und Arbeitsweise: Redaktion & Methode. Hinweise und Korrekturen: ai@i6eal.de.




