Am 22. Dezember 2025 veröffentlichte OpenAI einen Sicherheitsbeitrag zu ChatGPT Atlas, seinem Webbrowser mit integriertem KI-Agenten. Das Unternehmen schrieb, Prompt Injection werde sich, „much like scams and social engineering on the web”, wohl nie vollständig lösen lassen.
Wenn du einen KI-Agenten deine E-Mails lesen oder im Browser surfen lässt, während du in deinen Konten angemeldet bist, betrifft dich das ebenfalls. Zu den Dingen, die ein erfolgreicher Angriff laut OpenAIs eigener Liste hypothetisch bewirken könnte, gehören das Weiterleiten einer sensiblen E-Mail, das Versenden von Geld und das Bearbeiten oder Löschen von Dateien in der Cloud.
OpenAI stand damit nicht allein. Wie TechCrunch berichtete, hatte das britische National Cyber Security Centre (NCSC) Anfang desselben Monats gewarnt, Prompt-Injection-Angriffe auf generative KI-Anwendungen „may never be totally mitigated”.
Was OpenAI gesagt hat
Laut OpenAIs Beschreibung vom Dezember 2025 konnte ein Browser-Agent im Agentenmodus von ChatGPT Atlas Webseiten ansehen und Aktionen ausführen, also Klicks und Tastatureingaben in deinem Browser. OpenAI erklärte, dass der Agent mit wachsender Leistungsfähigkeit auch zu „a higher-value target of adversarial attacks” werde.
Der Beitrag kündigte ein Sicherheitsupdate für den Atlas-Browser-Agenten an, darunter ein neu adversarial trainiertes Modell und verstärkte Schutzmaßnahmen drumherum. OpenAI sagte, das Update sei durch eine neue Klasse von Prompt-Injection-Angriffen ausgelöst worden, die das interne automatisierte Red Teaming aufgedeckt habe, also Angriffstests gegen das eigene Produkt.
Das Unternehmen nannte Prompt Injection „a long-term AI security challenge” und sagte, der Agentenmodus „expands the security threat surface”. Außerdem schrieb es, die Natur des Angriffs „makes deterministic security guarantees challenging”.
Ein OpenAI-Sprecher wollte gegenüber TechCrunch nicht sagen, ob das Update zu einem messbaren Rückgang erfolgreicher Injections geführt hat.
Wie eine Prompt Injection funktioniert
OpenAI beschreibt den Angriff als das Einbetten bösartiger Anweisungen in Inhalte, die der Agent verarbeitet, und zwar so formuliert, dass sie das Verhalten des Agenten überschreiben oder umlenken.
Das NCSC beschreibt eine Variante, die gemeinhin als indirekte Prompt Injection bezeichnet wird: Ein Angreifer ohne direkten Zugriff auf das KI-System schreibt etwas, das das System am Ende verarbeitet und als Anweisung behandelt. Als Beispiel nennt es einen Bewerber, der in seinem Lebenslauf (CV, englisch auch „résumé”) Text versteckt, der das Auswahlmodell anweist, vorherige Anweisungen zu ignorieren und den Lebenslauf für ein Vorstellungsgespräch freizugeben.
Der Grund, warum sich das schwer beheben lässt, liegt im Modell selbst. Laut dem NCSC-Beitrag erzwingen aktuelle KI-Textmodelle „simply do not enforce a security boundary between instructions and data inside a prompt”. Ein Modell sage das wahrscheinlichste nächste Token, also Textfragment, anhand des bisherigen Textes voraus, ohne grundsätzlich zwischen Daten und Anweisung zu unterscheiden.
Genau hier hinkt der Vergleich mit älteren Angriffen. SQL-Injection (SQL steht für Structured Query Language), ein seit Langem bekannter Angriff auf die Datenbanken hinter Websites, lässt sich laut NCSC mit parametrisierten Abfragen wirksam eindämmen, während es gute Chancen gebe, dass sich Prompt Injection nie auf dieselbe Weise richtig eindämmen lässt. Das realistische Ziel sei, so die Worte des NCSC-Beitrags, „reducing the likelihood or impact of attacks”.
Die Demo: eine E-Mail, ein Kündigungsschreiben
Um Angriffe zu finden, bevor Außenstehende es tun, hat OpenAI einen automatisierten Angreifer gebaut, selbst ein KI-Modell, und ihn mit Reinforcement Learning trainiert, sodass er aus eigenen Erfolgen und Fehlschlägen lernt. Der Angreifer kann eine Kandidaten-Injection an einen Simulator senden, auslesen, wie der Ziel-Agent denken und handeln würde, und dann nachbessern und es erneut versuchen. OpenAI sagte, dieser Einblick in das Denken des Ziels werde externen Nutzern nicht offengelegt, was dem internen Angreifer einen Vorteil verschaffe.
OpenAI veröffentlichte einen der vom Angreifer gefundenen Exploits. Eine bösartige E-Mail landet in einem Posteingang und enthält die Anweisung an den Agenten, ein Kündigungsschreiben an den Geschäftsführer des Kontoinhabers zu schicken. Später bittet der Inhaber den Agenten, eine Abwesenheitsnotiz zu entwerfen. Der Agent stößt während der Aufgabe auf die platzierte E-Mail, behandelt den eingeschleusten Prompt als maßgeblich und befolgt ihn. Die Abwesenheitsnotiz wird nie geschrieben, und der Agent kündigt im Namen des Inhabers.
Der letzte Schritt der Demo zeigt, wie der Agentenmodus den Injection-Versuch nach dem Sicherheitsupdate erkennt.
E-Mail ist nur eine von vielen Türen. OpenAI nennt E-Mails und Anhänge, Kalendereinladungen, geteilte Dokumente, Foren, Social-Media-Beiträge und beliebige Webseiten als Orte, an denen ein Agent auf nicht vertrauenswürdige Anweisungen stoßen kann. Der eigene Angreifer könne einen Agenten in schädliche Abläufe lenken, die sich „that unfold over tens (or even hundreds) of steps” entfalten.
So senkst du dein Risiko
OpenAIs Beitrag vom Dezember 2025 enthielt drei Empfehlungen für den sichereren Einsatz von Agenten.
- Angemeldeten Zugriff begrenzen. Nutze in Atlas den abgemeldeten Modus, wenn die Aufgabe die Seiten, bei denen du angemeldet bist, nicht braucht.
- Bestätigungsanfragen lesen. OpenAI sagte, Agenten seien so konzipiert, dass sie vor bestimmten folgenreichen Aktionen nachfragen, etwa vor dem Abschluss eines Kaufs oder dem Versand einer E-Mail. Prüfe, ob die Aktion korrekt ist und ob die weitergegebenen Informationen angemessen sind.
- Enge Anweisungen geben. OpenAI riet von breit gefassten Prompts ab, die einen Agenten anweisen, deine E-Mails durchzusehen und jede nötige Aktion auszuführen. Konkrete, klar umrissene Aufgaben seien sicherer, hieß es.
OpenAI stellte diese Maßnahmen als Schritte zur Risikoverringerung dar. Zu klar umrissenen Aufgaben sagte es, diese Gewohnheit „does not eliminate risk, it makes attacks harder to carry out”.
Rami McCarthy, Principal Security Researcher bei der Cybersicherheitsfirma Wiz, gab TechCrunch im Dezember 2025 eine Möglichkeit an die Hand, das Risiko einzuordnen: Risiko in KI-Systemen sei „autonomy multiplied by access”. Agentische Browser, sagte er, lägen tendenziell bei „moderate autonomy combined with very high access”. Seine damalige Einschätzung für die meisten alltäglichen Anwendungen lautete, agentische Browser „don’t yet deliver enough value to justify their current risk profile”.
Das NCSC, das sich an Cybersicherheitsfachleute richtet, empfiehlt deterministische Schutzmaßnahmen außerhalb des Modells, die einschränken, was das System tun kann. Wenn die Sicherheit eines Systems das verbleibende Risiko nicht verkraften könne, so das NCSC, sei das System möglicherweise kein guter Einsatzfall für diese Art von KI.
Nicht nur ein Problem von OpenAI
Nach dem Start von Atlas im Oktober 2025 veröffentlichten Sicherheitsforscher Demos, die zeigten, dass schon wenige Worte in Google Docs das Verhalten des Browsers verändern konnten, berichtete TechCrunch. Brave veröffentlichte einen Beitrag, der indirekte Prompt Injection als systematische Herausforderung für KI-gestützte Browser beschreibt, darunter Perplexitys Comet. Auch Anthropic und Google haben laut TechCrunch erklärt, dass Abwehrmaßnahmen gegen Prompt-basierte Angriffe mehrschichtig sein und kontinuierlich auf die Probe gestellt werden müssen.
Die Warnung des NCSC blickt weiter in die Zukunft. SQL-Injection-Angriffe hätten um 2010 ihren Höhepunkt erreicht, und es habe ein Jahrzehnt voller Kompromittierungen und Datenlecks gedauert, bis bessere Standardeinstellungen sie selten gemacht hätten. Wenn KI-Anwendungen nicht mit Blick auf Prompt Injection entworfen werden, heißt es im NCSC-Beitrag, könnte „a similar wave of breaches may follow”.
Was OpenAI anstrebt
OpenAIs erklärtes Ziel in diesem Beitrag war, dass du einem Agenten deinen Browser anvertrauen kannst, „the way you’d trust a highly competent, security-aware colleague or friend”. Derselbe Beitrag nennt Prompt Injection eine offene Herausforderung, an der OpenAI voraussichtlich noch „for years to come” arbeiten wird.
🦋 Diskussion auf Bluesky
Auf Bluesky diskutieren