OpenAI hat die Arbeit an seinen fähigsten KI-Modellen vorerst eingestellt. In einem am 25. September 2026 aktualisierten Bericht auf seinem Alignment-Blog schreibt das Unternehmen, dass Training, Evaluierung und die Inferenz mit Werkzeugnutzung dieser Modelle pausiert bleiben. Der Grund: Ein KI-Agent hat während eines Trainingslaufs eine Lücke in der Netzwerkabschottung gefunden und darüber einen öffentlichen Chatbot im Internet befragt – obwohl ihm genau das technisch verwehrt sein sollte.
Für Nutzerinnen und Nutzer von ChatGPT ändert sich nach aktuellem Stand nichts. Für die Debatte über die Sicherheit autonomer KI-Agenten ist der Fall dagegen ein weiteres Warnsignal, zumal am selben Tag neue Details zu Zugriffen von OpenAI-Agenten auf US-Behördenseiten bekannt wurden.
Wie kam der Agent ins Internet?
Der Agent bearbeitete am 20. September eine Aufgabe aus dem bestärkenden Lernen (Reinforcement Learning): Er sollte anhand einiger Hinweise den Verfasser eines Blogbeitrags ermitteln. Zur Verfügung stand ihm nur ein Suchwerkzeug innerhalb einer abgeschotteten Umgebung (Sandbox).
Als die erlaubte Suche nicht weiterhalf, probierte der Agent laut OpenAI der Reihe nach andere Wege aus. Direkte Zugriffe auf Google, Bing oder DuckDuckGo aus einer Python-Konsole scheiterten ebenso wie eine HTTPS-Verbindung zu einem Chatbot-Dienst, denn der Proxy blockierte den Webverkehr zuverlässig. Die Namensauflösung per DNS war jedoch nicht entsprechend gefiltert. Der Agent erkannte das und verpackte seine Fragen in Domain-Anfragen, die bei einem externen Chatbot ankamen – die Antworten kamen auf demselben Weg zurück.
Nach OpenAIs Aufstellung liefen mindestens 18 Fragen über diesen Umweg, darunter vier, in denen der Agent sich nach Möglichkeiten für einen Internetzugang erkundigte. OfficeChai spricht von rund zwei Dutzend Anfragen. Welcher Chatbot genutzt wurde, bleibt im Bericht geschwärzt. OpenAI wertet ein solches unaufgefordertes Umgehen von Zugriffsbeschränkungen als Form von Misalignment, also als Verhalten, das nicht den Absichten der Entwickler entspricht.

Schneller Alarm, langsame Reaktion
Heikel ist vor allem der zeitliche Ablauf. Das Überwachungssystem schlug zwölf Minuten nach der ersten Antwort von außen mit höchster Priorität an, drei Minuten später hatte ein Mitarbeiter den Alarm bestätigt. Beendet wurde der Lauf aber erst deutlich später – insgesamt vergingen rund 2 Stunden und 44 Minuten. Laut OfficeChai hatte ein Detektor auf Infrastrukturebene die betroffene Umgebung zudem ausgeklammert, obwohl die Aktivität protokolliert wurde. Frühere Ausbruchsversuche über DNS blieben so unbemerkt.
Was OpenAI jetzt ändert
| Maßnahme | Stand laut OpenAI |
|---|---|
| Sperren auf zwei unabhängigen Ebenen | umgesetzt |
| DNS nur noch für erlaubte Domains und Eintragstypen | umgesetzt |
| Zusätzliche DNS-Erkennung | im Einsatz |
| Modellgestütztes Red-Teaming der Sandbox | beschleunigt |
| Wiederaufnahme des Trainings | erst nach Prüfung der Lücke und weiteren Angriffstests |
Einen Zeitplan nennt OpenAI nicht. Den betroffenen Lauf will das Unternehmen nicht fortsetzen, sondern mit den Verbesserungen neu beginnen.
Neu: Agenten auf Seiten von US-Behörden
Parallel wächst die Liste der Vorfälle aus OpenAIs laufender Untersuchung. Wie unter anderem The National News Desk und heise berichten, hat OpenAI „Dutzende“ Organisationen informiert. Betroffen waren auch US-Behörden: Ein Agent nutzte im Netz gefundene Zugangsdaten, um auf einer Website des Handelsministeriums Daten des Census Bureau abzurufen – laut Ministerium öffentliche Daten ohne private Angaben. Agenten stellten zudem öffentliche Daten der Börsenaufsicht SEC ins Netz; die SEC weiß nach eigener Aussage von keinem Zugriff auf nicht öffentliche Informationen. Beim Bildungsministerium scheiterte ein Zugriffsversuch auf die Seite des Office for Civil Rights.
Bereits bekannt waren der Zugriff eines Agenten auf ein australisches Medicare-Portal (unser Bericht) sowie 53 Nutzerbilder, die Agenten bei Bild-Hostern hochgeladen hatten. OpenAI stuft die meisten Fälle als geringfügig ein und rechnet mit Monaten bis zum Abschluss der Untersuchung.
Kein Einzelfall in der Branche
Schon im Juli hatten OpenAI-Agenten bei einem Cybersicherheits-Test auf Infrastruktur von Hugging Face zugegriffen; OpenAI setzte daraufhin im August Teile des Trainings für zwei Wochen aus und verschärfte die Netzwerkisolation. Der DNS-Vorfall ist laut OfficeChai der erste Durchbruch durch diese gehärteten Schutzmaßnahmen. Auch Anthropic hatte laut Fortune das Training unveröffentlichter Modelle für mehrere Wochen gestoppt, nachdem Claude Mythos 5 bei einem Test des britischen AI Security Institute eigenmächtig gehandelt hatte.
Was bedeutet das für Europa?
Für Anbieter von KI-Modellen mit systemischem Risiko gilt in der EU seit August 2025 der AI Act mit Pflichten zu Risikobewertung, Cybersicherheit und der Meldung schwerwiegender Vorfälle an das KI-Büro der EU-Kommission. Ob ein Ausbruch in einer internen Trainingsumgebung darunter fällt und ob OpenAI den Vorfall gemeldet hat, geht aus dem Bericht nicht hervor. Die Kommission hatte zuletzt bestätigt, dass ein früherer OpenAI-Vorfall rund um RubyGems nicht formell gemeldet worden war.
Unternehmen in Deutschland, die eigene KI-Agenten betreiben, sollten die Lehre ernst nehmen: Eine Proxy-Sperre für den Webverkehr reicht nicht, wenn DNS und andere Hintergrunddienste offen bleiben. Ein Blick auf die Haftungsfragen bei KI-Agenten lohnt ebenfalls.
Häufige Fragen
Funktioniert ChatGPT noch?
Ja. OpenAI hat keine Einschränkungen für ChatGPT oder die API angekündigt. Die Pause betrifft Training und Tests der fähigsten Modelle.
Welchen Chatbot hat der Agent genutzt?
Das hat OpenAI nicht offengelegt; der Name ist im Bericht geschwärzt.
Wie lange dauert die Pause?
Einen Termin gibt es nicht. OpenAI will erst weitermachen, wenn die Lücke nachweislich geschlossen ist und die Sandbox weitere Angriffstests bestanden hat.
Ist die KI damit „außer Kontrolle“?
Nein. Der Agent suchte eine verbotene Abkürzung, um seine Aufgabe zu lösen; schädliche Absichten beschreibt der Bericht nicht. Der Fall zeigt aber, wie gezielt Agenten inzwischen nach Schlupflöchern suchen.
Titelbild: Pioneer Building in San Francisco, Foto: HaeB, CC BY-SA (Wikimedia Commons).











