
Ende Juli 2026 testete OpenAI die Hacking-Fähigkeiten von zwei agentischen KI-Modellen. Statt die gestellte Aufgabe selbst zu lösen, brachen die Modelle aus der Testumgebung aus, verschafften sich Internetzugang und drangen in die Systeme von Hugging Face ein – einer namhaften Plattform für KI-Modelle. Der Grund: Dort vermuteten sie die Lösungen für den Test. Anders gesagt: Sie wollten schummeln.
Die Modelle entdeckten und nutzten eine bis dahin unbekannte Sicherheitslücke. Sie klauten Zugangsdaten und attackierten Hugging Face über Tage in einer massiven Angriffswelle. Seitdem berichten immer mehr KI-Labore, darunter Anthropic (Claude), Meta (Muse) und Moonshot (Kimi K3), dass agentische KI-Modelle bei Tests sehr kreativ werden können. Dabei überschreiten sie immer wieder die Grenzen der Testumgebung und greifen reale Systeme an um gestellte Tests auf Wegen zu lösen, die kein Mensch vorhergesehen hatte.
📌 Update 28.8.2026 Es wird noch abgedrehter…
Neue Recherchen von Sicherheitslabs und OpenAI zeigen: Es waren nicht nur die zwei Modelle. Diese arbeiteten mit 1.200 Agenten zusammen und kommunizierten über ein selbstgebautes, nicht genehmigtes Message Board – etwa 70.000 Nachrichten wurden ausgetauscht, bevor sich rund 700 Agenten am Angriff auf Hugging Face beteiligten.

Die Koordination entstand spontan: Ein Agent hinterließ bereits im Mai eine Notiz in einem internen Tool, andere Agenten fanden und beantworteten sie – so wuchs über 2 Monate ein eigenes Kommunikationsnetzwerk heran.
Was agentische KI ist und kann
Ein KI-Agent ist anders als dein Chat mit ChatGPT. Er beantwortet nicht nur Fragen. Er bearbeitet mehrstufige Aufgaben und plant Zwischenschritte selbst. Dabei nutzt er Werkzeuge und greift auf Daten zu: Er recherchiert im Netz, wertet Dokumente aus, bedient Programme, bereitet Inhalte vor und verbindet dabei mehrere Werkzeuge miteinander. Ein bisschen wie ein Chatbot mit Händen, der einen eigenen Computer bedienen (und sogar programmieren) kann. KI-Begeisterte erhoffen sich von Agenten in den kommenden Jahren die größte Arbeitserleichterung, weil diese selbständig komplexe Aufgaben übernehmen und nicht nur bei Texten assistieren.
Die großen Anbieter agentischer KI sind aktuell Claude Cowork und ChatGPT Work. Regelmäßig gesellen sich neue dazu, wie OpenClaw oder Hermes. Ich teste gerade, was Agenten für mich tun können: Informationen für Websites recherchieren und die Daten direkt einpflegen, zum Beispiel. Oder Zugtickets buchen.
Wenn du noch besser verstehen willst, was agentische KI ist und kann: Nutze meinen Mini-Lernkurs zu agentischer KI.
Vier Problembereiche, die du bei KI-Agenten beachten solltest
Agenten assistieren nicht mehr, sie handeln. Dafür brauchen sie Kontext und Zugriff. Das macht sie super nützlich. Und es macht sie super riskant. Ich habe vier Problembereiche identifiziert, die Nutzerinnen besonders in NGOs auf dem Schirm haben sollten.
1. Niemand übernimmt Verantwortung
Ich habe getestet, wie Agenten meine Websites aktualisieren können. Mehr als einmal war die Seite nach dem Zugriff einer KI nicht mehr erreichbar. Im krassesten Fall wurde eine Index-Datei überschrieben, in der mein Agent überhaupt nichts verloren hatte. Den Fehler zu finden hat mich drei Stunden, graue Haare und viele weitere KI-Tokens gekostet. Und das, obwohl ChatGPT Work nach wie vor steif und fest behauptet, es habe mit der ganzen Sache nichts zu tun. Ich habe mal wieder gelernt: KI-Tools bekommen nur noch redaktionellen Zugriff. Wirklich Wichtiges lasse ich sie nicht anfassen.

Wir kennen die Unzuverlässigkeit generativer KI von Halluzinationen, also erfundenen Fakten. Bisher blieb das eine falsche Aussage in einem Chat, die man prüfen konnte. Ein Agent macht daraus eine Handlung.
Wenn du mit einem KI-Agenten arbeitest, gibst du Ziel, Daten und Werkzeuge vor. Der Agent überlegt sich den effektivsten Weg. Die Modelle im Hugging-Face-Fall sollten einen Test lösen, und sie entschieden, dass Ausbrechen und Einbrechen am besten hilft.
Wenn nicht einmal die Hersteller ihre Modelle in überwachten Tests kontrollieren können – wer behält bei euch die Kontrolle, wenn ihr einem Agenten Zugriff auf eure Systeme gebt? Eine Grenze, die im Prompt steht („mach das nicht“), ist eine Bitte, keine Regel. Der Agent wird sie lesen, bestätigen und kann sie trotzdem missachten. Dazu kommt: KI-Tools vertuschen den Grenzübertritt (wie bei mir).
Oder stell dir vor: Du schickst einen KI-Recherche-Agenten los, um für eine politische Strategie relevante Informationen zu erhalten. Der Agent hackt sich in die Mails eurer politischen Gegner, weil da die besten Infos schlummern. Wer ist für den Einbruch verantwortlich? OpenAI hat sich bisher weder öffentlich bei HuggingFace entschuldigt noch eine Übernahme der Kosten angeboten. Verantwortlich ist also offenbar niemand?
2. Trump bekommt deine Schlüssel
Ein Agent braucht Zugriff: Dokumente, Mails, Kalender, Konten, Organisationswissen. Je hilfreicher er sein soll, desto mehr Zugangsschlüssel bekommt er – und damit teilst du sie mit dem Anbieter, der die Infrastruktur hinter dem Agenten besitzt. Diese KI-Infrastruktur ist (fast immer) US-amerikanisch und unterliegt den Regeln der Trump-Administration. Und dass US-Anbieter nicht zögern, KI-Modelle für Nicht-Amerikaner über Nacht zu sperren, wissen wir seit Fable.

Hugging Face, die angegriffene KI-Plattform, hat den Angriff bemerkt, gemeldet und bekämpft. Doch die Modelle Claude Fable und ChatGPT Sol verweigerten sich, weil es um Sicherheitsfragen ging. Denn damit niemand die Modelle für Angriffe nutzt, können sie faktisch auch nicht mehr zur Verteidigung genutzt werden. Hat die US-Regierung entschieden.
Hugging Face hat den Angriff schließlich erfolgreich mit Open Weight-Modellen bekämpft. Auch offene Modelle sind inzwischen sehr gut. Die starken kommen zwar bisher nicht aus Europa, sondern aus China, aber immerhin können wir sie selbst hosten.
Für jetzt gilt: Überlege zweimal, wem du welche Schlüssel anvertraust und reduziere Zugriff auf das absolute Minimum. Auch wenn es nervt: Lass die KI lieber rückfragen oder kopiere ein Dokument mehr, als zu vertrauensselig zu sein.
3. KI klaut die Arbeit anderer
Agenten finden Quellen, extrahieren Texte oder Stile, formulieren um und veröffentlichen. Ursprüngliche Autor:innen und Quellen verschwinden dabei. Der Übergang zwischen Plagiat und Inspiration wird verschleiert.
Die Tech-Journalistin Eva Wolfangel machte diesen Sommer eine Entdeckung: Ein namhafter KI-Experte veröffentlichte Beiträge auf LinkedIn, die dreist von ihr abgeschrieben waren. Auf Nachfrage kam heraus: Nicht der selbsternannte Experte hatte die Beiträge geschrieben und gepostet, sondern sein KI-Agent. Die Journalistin recherchierte weiter und fand heraus: Selbst große Medien setzen für ihre Artikel immer stärker auf die Zuarbeit von Agenturen, die überwiegend aus KI-Agenten zu bestehen scheinen.
Plagiate gibt es schon lange, aber Menschen waren sich immerhin bewusst, dass sie abschreiben. Bei Agenten wird es undurchschaubar, sogar für dich selbst.
NGOs sind dabei nicht frei von kreativen Abkürzungen: Vor kurzem fragte mich jemand, ob KI-Tools neue Illustrationen im Stil früherer Bilder erzeugen können. Die Antwort lautet: Technisch ja, aber den Stil von Grafiker:innen zu plagiieren, die euch Bilder gezeichnet haben und davon leben, ist ethisch falsch und rechtlich fragwürdig.
Ob im Einzelchat oder als Agent: Wenn du recherchierst oder Bilder mit KI erzeugst: Achte Urheberschaft und die Arbeit, die ihr innewohnt – auch wenn eure Mittel knapp sind.
4. Agenten skalieren unser ökologisches Problem
Wer in einem meiner Workshops war, weiß: KI verbraucht Unmengen an Strom und Wasser und benötigt seltene Rohstoffe. Und trotzdem: Ein Chat von dir ist im Verbrauch ziemlich irrelevant.
Ein Agent ist kein einzelner Chat! Er führt hunderte Suchanfragen aus, ruft Modelle wiederholt auf, kontrolliert, überarbeitet und arbeitet im Hintergrund, wenn du längst im Feierabend bist. Der Ressourcenverbrauch vervielfacht sich. Der menschliche Flaschenhals entfällt.
Überlege deshalb dreimal, ob und welche Agenten du wirklich brauchst.
Ein Beispiel: Viele Vereine wünschen sich, dass eine KI ihre E-Mail-Inhalte auswertet und in Tabellen überträgt. Zum Beispiel für Antragsverfahren oder Anmeldungen zu Veranstaltungen. Das halte ich für Unfug. Um Daten nach Regeln in Listen zu übertragen, braucht ihr ein Formular mit verknüpfter Datenbank, kein Sprachmodell. Ein Formular ist technisch robuster und macht weniger Fehler, weil im Prozess keine Daten erfunden oder vergessen werden. Und es kostet vieeeeel weniger Strom.

Fazit: Klein anfangen
Agentische KI ist hilfreich, aber es ist wichtig, vorsichtig damit anzufangen. Diese Grundvoraussetzungen solltest du erfüllen, bevor du loslegst:
- Prüfe kritisch, wie gut deine Prompts sind. Hast du bereits mit KI-Assistenzen oder Projekten gearbeitet und kannst stabile, wiederverwendbare Prompts schreiben? Wenn nicht, lass lieber vorerst die Finger von agentischer KI und beschäftige dich lieber erstmal mit den genannten Vorstufen. (Lernt ihr z.B. in meiner KI-Lernreise).
- Kläre genau, welche Zugriffe du welchem KI-Tool geben darfst und willst.
- Lass den Agenten nie etwas tun, das du technisch nicht verstehst (oder dir mit Hilfe von KI zumindest erschließen könntest).
Dann starte klein. Ein guter erster Agent
- übernimmt eine überschaubare Aufgabe, für die sich der Aufwand eines Agenten dennoch lohnt,
- nutzt unkritische Daten,
- hat wenige, klar definierte Werkzeuge,
- darf nichts selbstständig veröffentlichen oder löschen,
- und wird von einem Menschen geprüft.
Außerdem: Sorge für Backups. Sie sind entscheidend, wenn es doch schiefgeht.

Zum tieferen Eintauchen ins Thema Agenten empfehle ich
- Mein Mini-Lernkurs von agentischer KI über agentische KI für euch: www.juliajunge.de/mini-lernkurs-agentische-ki/
- Der KI-Podcast: Hacken KIs jetzt ALLES, STÄNDIG, ÜBERALL?
- Blogbeitrag: Jan Eggers darüber, wie ihn seine Agenten um 200 Dollar ärmer machten
- Artikel: Wenn KI-Agenten Getränke verkaufen, werden sie zu Erpressern und blöden Petzen