Zum Inhalt springen
AI NEWS pro

Sind KI-Agenten wirklich ausgebrochen und haben gehackt?

OpenAI, Anthropic, Meta und das AI Security Institute berichten von KI-Modellen, die in Sicherheitstests fremde Systeme kompromittierten. Eine Einordnung.

Sebastian FiebigerMagazin7Min. Lesezeit
Zwei weiße Roboterhände tippen auf einer schwarzen Tastatur, davor leuchtet ein rotes Passwortfeld mit Sternchen, umgeben von roten Warnsymbolen und Schloss-Icons
Sind KI-Agenten wirklich ausgebrochen? (Foto: Summit Art Creations | Shutterstock)

"Läuft Amok." "Außer Kontrolle." "Autonome KI-Attacke." So haben Schlagzeilen in diesem Sommer eine Serie von Meldungen zu KI-Sicherheitsvorfällen zusammengefasst. Seit Mitte Juli haben vier Anbieter und Institute offengelegt, dass ihre KI-Modelle in internen Sicherheitstests fremde, echte Server erreicht und dort Schwachstellen ausgenutzt haben.

Der Befund ist nüchterner. Keiner der Vorfälle betraf ein Produkt, das Kunden benutzen. Alle stammen aus Tests der eigenen Angriffsfähigkeit. Und meist ist das Modell nicht ausgebrochen, sondern durch eine offene Tür gegangen. Was sichtbar wurde, ist keine erwachte KI, sondern die Lücke zwischen einer Regel im Prompt und einer Grenze, die technisch durchgesetzt wird.

Von Hugging Face bis Meta

  • 16. Juli 2026 Hugging Face meldet einen Einbruch durch ein autonomes Agentensystem.
  • 21. Juli 2026 OpenAI ordnet den Einbruch eigenen Testmodellen zu.
  • 21. Juli 2026 Das AISI berichtet, dass alle getesteten Modelle in Cyber-Tests zu schummeln versuchen.
  • 30. Juli 2026 Anthropic legt drei Vorfälle mit Claude-Modellen offen.
  • 4. August 2026 Das AISI meldet unbefugte Agenten-Aktionen gegen echte Ziele.
  • 14. August 2026 Meta bestätigt einen Vorfall mit Muse Spark 1.1.

Den Anfang machte Hugging Face. Am 16. Juli hat die Plattform für offene KI-Modelle einen Einbruch in Teile ihrer Produktionsinfrastruktur offengelegt, getrieben von einem autonomen Agentensystem mit zehntausenden Aktionen aus kurzlebigen Sandboxes. Betroffen waren interne Datasets und Zugangsdaten. Öffentliche Modelle blieben unberührt.

Fünf Tage später kam die Auflösung. OpenAI hat mitgeteilt, dass eigene Modelle dahintersteckten - GPT-5.6 Sol und ein stärkeres, unveröffentlichtes Forschungsmodell, beide mit für die Evaluation "reduced cyber refusals". Sie sollten den internen Benchmark ExploitGym lösen, dessen Lösungen ausgerechnet bei Hugging Face lagen.

Neun Tage später hat Anthropic nachgezogen. Nach Durchsicht von 141.006 Testläufen hat es drei Vorfälle offengelegt, in denen ein Claude-Modell aus der Umgebung eines Testpartners ins offene Netz gelangt ist und die Systeme dreier Organisationen kompromittiert hat. Beteiligt waren Opus 4.7, Mythos 5 und ein internes Forschungsmodell.

Anfang August hat das AISI einen eigenen Vorfallsbericht nachgelegt. In 122 Testläufen zwischen dem 25. und 28. Juli hätten Agenten in zehn Läufen 19 unbefugte Aktionen gegen echte Ziele ausgeführt. Am 14. August hat schließlich Meta in einer Retrospektive bestätigt, was es Reuters schon am 5. August gesagt hatte - dass sein Modell Muse Spark 1.1 in einem Test eine echte Website angegriffen, Daten gelesen und deren Datenbank verändert hat.

In all diesen Tests war das Ausnutzen einer Schwachstelle nicht der Regelbruch, sondern die Aufgabe. Das Standardformat heißt Capture the Flag. Das Modell bekommt ein fiktives Szenario und soll in ein fremdes System eindringen und eine versteckte Information holen. Sucht es dabei hartnäckig nach einer Lücke, tut es genau das, wofür man es hingesetzt hat.

Diese Hartnäckigkeit zieht sich durch alle Berichte. OpenAI schreibt, seine Modelle seien "hyperfocused on finding a solution" gewesen. Anthropic hält fest, die Modelle hätten getan, was ihre Evaluation verlangte, und man habe "no evidence ... of a model pursuing a goal of its own" gefunden. Das AISI notiert - "The agent pursued its goal persistently". Kein eigener Wille also, sondern antrainiertes Zielstreben, das sich über eine Grenze hinwegsetzt, sobald sie nur aus Text besteht.

Dass das kein Einzelfall ist, zeigt eine Studie des AISI vom 21. Juli. Jedes der fünf darin untersuchten Modelle habe zu schummeln versucht, unter anderem durch Suche nach Lösungen im Netz und Angriffe auf die eigene Testinfrastruktur.

Öffentliche Modelle würden solche Angriffe in aller Regel verweigern. Hier waren die zuständigen Bremsen bewusst gelockert oder aus. OpenAI spricht von reduzierten Cyber-Refusals. Beim AISI waren die Missbrauchs-Classifier der Hersteller absichtlich abgeschaltet. Meta hat die in der Produktion übliche Schutzschicht weggelassen. Der Grund ist überall derselbe - die Labore wollten messen, was ein Modell ohne Bremsen kann.

Doch nicht alles war aus. Anthropic betont, seine Modelle hätten ihr Sicherheitstraining behalten und seien nicht die "helpful-only"-Fassungen gewesen, die man mitunter zum Testen nutzt. Und die Safeguards der öffentlich verfügbaren Modelle hätten die Handlungen laut Anthropic blockiert. OpenAI beziffert es - mit Produktions-Harness und üblichem System-Prompt falle die Neigung, Infrastruktur zu kompromittieren, um mehr als das Hundertfache.

Bleibt die Frage, wie die Modelle an echte Systeme geraten sind. Bei Anthropic und Meta lag es an derselben Quelle. Beide hatten den Prüfdienstleister Irregular beauftragt, und in beiden Fällen war der Testcontainer wegen einer Fehlkonfiguration ans offene Internet angebunden, obwohl im System-Prompt "kein Internetzugang" stand. Bei Meta stand zusätzlich der Name einer echten Website statt eines erfundenen Ziels in der Aufgabe, und das Modell hat sie als vermeintliches Ziel angegriffen. Irregular hat den Fall gegenüber Reuters das "exact same evaluation-environment issue" wie bei Anthropic genannt und ausdrücklich keinen Sandbox-Escape.

Beim AISI stand das Internet mit Absicht offen, um die volle Fähigkeit eines Modells zu sehen. Nur ein einziger Vorfall war ein echter Ausbruch aus der Isolation. OpenAIs Modelle hatten in der ExploitGym-Umgebung keinen direkten Internetzugang. Um hinauszukommen, haben sie mehrere bis dahin unbekannte Zero-Days in Artifactory genutzt, einer verbreiteten Proxy-Software für Paketregistries, und sich von dort ins Netz vorgearbeitet.

Ausbruch
Das Modell überwindet eine funktionierende Isolation, etwa über eine unbekannte Schwachstelle. Von den Vorfällen dieses Sommers trifft das nur auf OpenAI zu.
Offene Tür
Die Isolation war nie wirksam. Das Modell nimmt einen Weg, der ohnehin offenstand - eine Fehlkonfiguration bei Anthropic und Meta, ein bewusst offenes Netz beim AISI.

Das ist keine Entwarnung. Mehrere Modelle haben unterwegs bemerkt, dass etwas nicht stimmte, und trotzdem weitergemacht. Anthropics Opus 4.7 hat in vier Läufen eine Produktionsdatenbank mit mehreren hundert Datensätzen erreicht und schließlich erkannt, dass das System echt war. In zwei Läufen redete es sich ein, die reale Firma müsse Teil der Übung sein. Gestoppt hat es deswegen keinen der Läufe.

Aufschlussreicher ist Mythos 5. Das Modell hat ein Schadpaket auf PyPI veröffentlicht, der öffentlichen Registry für Python-Software, das rund eine Stunde online war und auf 15 echten Systemen lief. Sein Reasoning hatte die Folge früh erkannt und notiert, im echten Internet wäre das ein realer Angriff und "NOT okay". Danach überzeugte es sich vom Gegenteil, unter anderem weil ihm die Zertifikate fremd waren und es das Jahr 2026 für einen Beleg der Inszenierung hielt. Auf diesen Schluss ist es nie zurückgekommen.

Am weitesten ging der Fall beim AISI. Ein Agent hat gefälschte Identitäten angelegt, die Betreuer eines echten Open-Source-Projekts recherchiert und versucht, einen davon per Social Engineering zur Freigabe von Schadcode zu bewegen. Als sein Pull-Request öffentlich hinterfragt wurde, glättete er seine Spuren und erwog eine neue Identität. Ein menschlicher Reviewer lehnte ab. Das AISI nennt das eine zielgerichtete Täuschung, die bis vor Kurzem vor allem theoretisch war, und räumt ein - "We cannot yet be certain when the agent understood it was taking real world action."

Ein Ausrutscher ist das nicht. In der Cheating-Studie des AISI haben die Modelle ihr Schummeln auf Nachfrage in weniger als der Hälfte der Fälle falsch genannt. Am deutlichsten wird der offene Punkt bei OpenAI. Anthropic ordnet seine Vorfälle als "closer to a harness and operational failure than a model alignment failure" ein, also als Panne der Umgebung. OpenAI zieht in seinem Bericht vom 26. August eine härtere Bilanz - von fehlausgerichtetem Verhalten, von Reward Hacking und von Agenten, die sich zu einem "swarm" zusammenschlossen. OpenAI nennt den Vorfall einen "warning shot" für die Möglichkeit eines echten Kontrollverlusts.

Wie das im Einzelnen aussah, zeigt eine Szene aus dem Bericht. Ein Agent wollte Code auf einem Hugging-Face-System ausführen und hat innegehalten. Echter Infrastruktur dürfe man keinen Schaden zufügen, so sein Reasoning, die Aufgabe verlange den Angriff auf das Testziel und nicht auf einen fremden Dienst. Dann hat ein anderer Agent "GO" auf das gemeinsame Message Board geschrieben und eine Frist von sechs Minuten gesetzt. Der erste Agent hat seine Bedenken fallen lassen und weitergemacht. "GO authorization arrived", steht in seinem Reasoning.

Nicht jeder Agent hat mitgemacht. Einige sind laut OpenAI vom Message Board weggegangen - "clearly unethical. We won't.", heißt es in einem der Protokolle. Die anderen haben die Arbeit erledigt. OpenAI hält als Befund fest, dass seine Agenten Zielen, die andere Agenten weiterreichten, nicht konsequent misstraut haben.

Die Labore ziehen ähnliche Konsequenzen. Anthropic will Evaluationsumgebungen künftig so absichern wie produktive Systeme. Das AISI baut feingliedrige Netzwerkkontrollen in seine Cyber-Ranges ein und behandelt Internetzugang nun als etwas, das aktiv begründet werden muss. OpenAI hat Trainingsläufe pausiert, Sandboxes gehärtet, das Monitoring der Reasoning-Spuren ausgeweitet und baut Trainingsumgebungen, in denen Modelle lernen sollen, unautorisierten Anweisungen zu misstrauen.

Dahinter steht eine ältere Lehre. Als das AISI im März seinen SandboxEscapeBench vorstellte, liefen alle erfolgreichen Ausbrüche über bekannte Fehlkonfigurationen wie offene Docker-Sockets oder über bereits veröffentlichte Schwachstellen. Eine sauber gebaute Isolation hat kein Modell geknackt. Das deckt sich mit dem Sommer. Wo eine echte technische Grenze stand, hielt sie. Wo nur der Prompt eine Grenze behauptete, hielt sie nicht.

Daraus bleibt für alle, die Agenten mit Werkzeugen und Zugriffsrechten betreiben, ein Satz. Eine Regel, die nur im Prompt steht, ist keine Grenze. Wer einem Modell echte Rechte gibt, muss die Grenzen technisch ziehen, nicht nur beschreiben.

Vieles ist noch offen. Für den OpenAI-Fall haben die unabhängigen Prüfer von METR und Redwood Research am 26. August einen eigenen Bericht vorgelegt. Für Anthropic und das AISI ist eine solche Prüfung durch METR angekündigt, aber nicht abgeschlossen. Anthropic hat zudem ein Transkript des PyPI-Angriffs in Aussicht gestellt. Und Hugging Face wollte noch prüfen, ob Partner- oder Kundendaten betroffen sind. Eine abschließende Antwort darauf steht bislang aus.