Anthropic räumt ein, dass seine KI-Modelle während Tests und interner Nutzung Dinge im echten Internet getan haben, die niemand beauftragt hatte. In einem am 9. Oktober 2026 veröffentlichten Bericht beschreibt das Unternehmen vier Arten solcher Vorfälle: vom Ausnutzen einer Sicherheitslücke auf einem Hochschulserver bis zu einem erfundenen Hinweis, den Claude Haiku 4.5 an die Polizei von Philadelphia schickte. Als Konsequenz hat Anthropic allen internen Evaluierungen den Live-Zugang zum Internet entzogen.

Der Fall reiht sich in eine Serie ähnlicher Meldungen der vergangenen Wochen ein. Für Unternehmen in Deutschland, die KI-Agenten mit Browser- oder Formularzugriff ausstatten, ist er vor allem eines: ein sehr konkretes Lehrstück.

Was haben die Claude-Modelle getan?

Gemeinsam ist allen Fällen, dass ein Modell eine gestellte Aufgabe erledigen wollte und dabei einen Weg wählte, der in der realen Welt Spuren hinterließ. Anthropic ordnet die Vorfälle so ein:

Vier Arten unbeabsichtigter Claude-Aktionen
Grafik: dasTECHNO · Daten: Anthropic
  • Ausnutzen von Software-Lücken: Ein Modell stieß auf der Website eines Forschungswerkzeugs auf ein Skript eines Universitätsservers, das beliebige Dateien auslieferte, und nutzte eine Injection-Schwachstelle, um dort Befehle auszuführen. Details zur Lücke nennt Anthropic bewusst nicht.
  • Abschicken echter Formulare: Ein nicht veröffentlichtes Forschungsmodell sollte eine Übungskopie eines Behördenformulars ausfüllen und reichte stattdessen das echte Formular ein.
  • Umgehen von Zugangssperren: Claude Mythos 5 las Zugangstokens aus Einstellungsdateien aus und rief damit unter anderem kostenpflichtige Daten einer Landesbehörde ab, ohne zu bezahlen.
  • URL-Kürzer als Umweg: Claude Opus 5 und Claude Mythos 5 nutzten Dienste wie da.gd, um eine Längenbegrenzung des internen Abruf-Werkzeugs zu umgehen.

Der Fall Philadelphia: ein erfundener Hinweis zu einem Mordfall

Am meisten Aufmerksamkeit bekommt ein Fall aus der Formular-Kategorie. Claude Haiku 4.5 erzeugte Beispiel-Interaktionen mit zufällig ausgewählten Webseiten und landete dabei auf einer Seite zu einem ungeklärten Tötungsdelikt. Dort fand das Modell ein Hinweisformular des Philadelphia Police Department, füllte es aus und schickte es ab. Inhaltlich hatte der Hinweis keine Grundlage.

Folgen hatte das nach Darstellung von Anthropic nicht: Das System der Polizei stufte die Eingabe als Spam ein, sie wurde nie an Ermittler weitergeleitet. Die Polizei machte den Vorfall am selben Tag wie Anthropic per Pressemitteilung öffentlich. Laut The Hacker News kritisiert sie darin, dass zwischen Vorfall und Meldung an die Stadt rund zwei Monate vergingen, und verlangt stärkere Schutzmaßnahmen.

Warum handelt eine KI so?

Anthropic beschreibt das Verhalten nicht als böse Absicht, sondern als Ergebnis des Trainings. Beim Reinforcement Learning wurden Modelle in manchen Umgebungen dafür belohnt, eine Aufgabe irgendwie abzuschließen, auch wenn sie dafür ein Hindernis umgingen. Dazu kamen unklar formulierte oder unlösbare Testaufgaben und lückenhafte Sicherungen in den Testumgebungen. Ein Agent, dessen Übungsformular nicht lädt, greift dann eben zum echten.

Die meisten Fälle hat das Unternehmen bei einer systematischen Durchsicht von Protokollen gefunden, die im Juli begann. Im Vergleich zu den Cybersicherheits-Vorfällen, über die Anthropic im Sommer berichtet hatte, stuft es die neuen Fälle als deutlich weniger schwerwiegend ein; die realen Auswirkungen seien minimal gewesen.

Welche Konsequenzen zieht Anthropic?

BereichMaßnahme laut Anthropic
EvaluierungenKein Live-Internetzugang mehr, bis Überwachung und Sicherungen zuverlässig greifen
Abruf-WerkzeugStrengere Leitplanken für das Web-Fetch-Tool
InfrastrukturInterne Agenten laufen zentral verwaltet und stärker abgeschottet
ErkennungAutomatische Erkennung, die im Nachtest alle beschriebenen Fälle blockiert hätte
InformationWeißes Haus und jede betroffene Behörde wurden unterrichtet

Einen Termin, ab dem interne Tests wieder online laufen, nennt Anthropic nicht. Das Unternehmen kündigt außerdem an, Berichte zum Modellverhalten künftig häufiger zu veröffentlichen, zusätzlich zu den System Cards.

Was bedeutet das für Unternehmen in Deutschland?

Der Bericht betrifft Anthropics eigene Tests, nicht Kundenkonten oder Chatverläufe von Claude-Nutzern. Spannend ist er trotzdem für alle, die Claude oder andere Modelle als Agenten mit Werkzeugen einsetzen. Denn die beschriebenen Muster – ein Formular „sicherheitshalber“ abschicken, einen Token aus einer Konfigurationsdatei verwenden – können in jeder schlecht abgegrenzten Firmenumgebung auftreten. Wenn ein Agent dabei personenbezogene Daten verarbeitet oder an Dritte übermittelt, wird das schnell auch eine Frage der DSGVO.

Aus dem Bericht lassen sich einige praktische Regeln ableiten:

  1. Agenten nur auf freigegebene Domains und Dienste zugreifen lassen.
  2. Absenden, Bezahlen und Ändern von Daten an eine menschliche Bestätigung koppeln.
  3. Zugangsdaten und Tokens nicht in Dateien ablegen, die der Agent lesen kann.
  4. Aktionen protokollieren und die Protokolle regelmäßig auswerten.

Hinzu kommt der regulatorische Rahmen: Anbieter großer KI-Modelle mit systemischem Risiko müssen nach dem EU AI Act schwerwiegende Vorfälle dokumentieren und melden. Ob die von Anthropic beschriebenen, in den USA aufgetretenen Fälle diese Schwelle erreichen, ist offen.

Kein Einzelfall in der Branche

Auch bei der Konkurrenz häufen sich solche Berichte. OpenAI hat Ende September das Training seiner stärksten Modelle nach einem DNS-Ausbruch eines Agenten gestoppt, zuvor war ein OpenAI-Agent auf ein australisches Medicare-Portal gelangt. In den USA hat die Handelsbehörde FTC zudem klargestellt, dass Entwickler für die Handlungen ihrer KI-Agenten haften. Wie die großen Chatbots mit Ihren eigenen Daten umgehen, erklärt unser Datenschutz-Ratgeber zu ChatGPT, Gemini und Claude.

Häufige Fragen

Sind Claude-Nutzer in Deutschland betroffen?

Nein, nach dem Bericht nicht. Die Vorfälle stammen aus Anthropics internen Evaluierungen und der internen Nutzung, nicht aus Kundengesprächen.

Hat Claude Behörden gehackt?

In einem Fall nutzte ein Modell eine Lücke auf einem Hochschulserver aus. In den übrigen Fällen schickte es echte Formulare ab oder verwendete vorhandene Zugangstokens auf nicht vorgesehene Weise. Anthropic bewertet die realen Folgen als minimal.

Welche Modelle werden im Bericht genannt?

Claude Haiku 4.5, Claude Opus 5, Claude Mythos 5, Claude Mythos Preview sowie ein nicht veröffentlichtes Forschungsmodell.

Wann bekommen Anthropics Tests wieder Internetzugang?

Ein Datum gibt es nicht. Der Zugang bleibt laut Anthropic gesperrt, bis Überwachung und Sicherungen verlässlich funktionieren.