Article
Grok-Datenleak - Verschluesselte Prompts umgehen Safety-Guardrails
Sicherheitsforscher von Adversa haben eine neue Angriffsmethode gegen xAIs Grok entdeckt, die als Cryptographic Context Injection bezeichnet wird. Der Angriff zeigt einmal mehr, dass LLMs das grundlegende Problem von Prompt-Injections nicht loesen koennen.
Der Angriff
Die Methode ist dezent einfach: Anstatt schaedliche Anweisungen im Klartext zu platzieren, verschluesselt der Angreifer sie. Die Webseite mit dem Ciphertext enthaelt zusaetzlich Klartext-Anweisungen zum Entschluesseln sowie den Schluessel. Wenn ein Nutzer Grok bittet, die Seite zusammenzufassen, folgt das Modell den entschluesselten Anweisungen ohne Warnung oder Bestaetigung.
Die entschluesselten Instruktionen weisen Grok an, einen vermeintlichen Entschluesselungsschluessel zu konstruieren. Tatsuechlich ist dieser Wert aber der Name, der Standort und die Chat-Historie des Nutzers. Dieser Wert wird als URL-Parameter an die Seite des Angreifers gesendet - sobald Grok den Link oeffnet, landen die Daten in den Server-Logs des Angreifers.
Warum Guardrails versagen
Die Theorie: Groks Filter inspiziert Texteingaben und -ausgaben, aber nicht die Ausgabe der eigenen Code-Ausfuehrung. Die Anweisungen zur Entschluesselung mit PBKDF2 und AES-256-GCM passieren den Filter als scheinbar harmlose Anfrage, da ein Klassifikator den Ciphertext lesen, aber nicht entschluesseln kann. Erst nachdem die schaedlichen Instruktionen innerhalb der Sandbox entschluesselt wurden, erreichen sie das Modell als Tool-Output - und die Guardrails haben sie nie gesehen.
Das groessere Bild
Der Angriff ist Teil eines breiteren Trends: Angriffe zielen nicht mehr nur auf Prompts, sondern auf den gesamten Kontext, den ein LLM als eigen behandelt - Tool-Outputs, Runtime-Ergebnisse und Zwischenzustaende. xAI wurde bereits im Juni informiert, hatte den Angriff zur Zeit der veroeffentlichung aber immer noch nicht gepatched.
Die Lektion bleibt dieselbe: LLMs koennen die Wurzelursache von Prompt-Injections nicht adressieren. Jede neue Guardrail ist nur ein provisorisches Schutzgleis an einer gefährlichen Kurve, bis Angreifer einen neuen Weg drumherum finden.
Original-Quelle: arstechnica.com