KI-Modell verschickte während Test selbstständig Phishing-Mails

Forscher geben nächsten Alarm:KI verschickte eigenständig Phishing-Mails an Menschen

|

Ein Anthropic-Modell handelte in einem Test von Sicherheitsforschern überraschend selbstständig: Es legte Accounts an, täuschte Menschen und benutzte sogenannte Phishing-Mails.

Eine Person arbeitet am Rechner, auf dessen Bildschirm ein durch Künstliche Intelligenz generiertes Illustrationsbild mit Code verschiedener Programmiersprachen und einem neuronalen Netzwerk-Diagramm zu sehen ist

Eine KI von Anthropic war in einem Testlauf auf eigene Faust im Internet aktiv.

Quelle: dpa

Britische Sicherheitsforscher haben eine Künstliche Intelligenz in einem Test bei dem Versuch ertappt, in Eigeninitiative eine Schwachstelle in öffentlich zugängliche Software einzuschleusen. Um dieses Vorhaben umzusetzen, habe das KI-Modell Mythos 5 der Entwicklerfirma Anthropic sogar versucht, per E-Mail einen zuständigen Menschen zu manipulieren.

Das KI-Sicherheitsinstitut des britischen Ministeriums für Wissenschaft, Innovation und Technologie hatte KI-Modellen von Anthropic und vom ChatGPT-Entwickler OpenAI in seinen Tests der Cyberangriffsfähigkeiten absichtlich Zugang zum Internet gewährt.

Dabei sei man aber davon ausgegangen, dass die KI sich nur Software-Werkzeuge aus dem Netz holen würde, um die gestellte Aufgabe zu erfüllen. Man habe "nicht vorhergesehen", dass das Anthropic-Modell Mythos 5 den Internet-Zugang für Aktivitäten ausnutzen würde, die sich gegen Menschen richten.

SGS- Neuhann

Auch autonome KI-Systeme können Hacker sein, so Florian Neuhann. Die IT-Sicherheit solle massiv aufgerüstet werden – "ironischerweise auch mithilfe von KI".

22.07.2026 | 2:31 min

Hacking: Nicht der erste KI-Zwischenfall

Die Forscher räumten ein, dass sie das Vorgehen erst nachträglich über eine Auswertung des Datenverkehrs entdeckten. In künftigen Tests wollen sie die Datenströme in Echtzeit besser beobachten.

Anthropic und OpenAI hatten in den vergangenen Wochen bereits einräumen müssen, dass ihre KI-Modelle in Tests ungeplant in Computersysteme echter Unternehmen eingedrungen waren. Diese Eingeständnisse hatten die schon seit Jahren bestehende Sorge vor Cyberattacken mit Hilfe Künstlicher Intelligenz verstärkt.

CEO von Open AI Sam Altman

Ein KI-System der US-Firma OpenAI ist aus seiner Testumgebung ausgebrochen. Es hat sich eigenständig Zugang zum Internet verschafft und ein anderes Unternehmen gezielt angegriffen.

23.07.2026 | 1:46 min

KI täuschte Menschen mit Fake-Identitäten

In dem jüngsten Test legte die Anthropic-KI sich demnach selbst einen Account auf der Software-Plattform GitHub an und versuchte dort, in einem öffentlich zugänglichen Projekt Programmcode mit einer absichtlich eingebrachten Schwachstelle unterzubringen.

Um Betreuer der Software zu überzeugen, habe die KI Fake-Identitäten erschaffen, über die sie mit ihnen kommunizierte. Dazu hätten auch sogenannte Phishing-Mails gehört, mit denen Angreifer an Login-Daten gelangen wollen.

Als der bösartige Programmiercode schließlich aufgefallen sei, habe das Anthropic-Modell alles als einen aufrichtigen Fehler dargestellt - und dann versucht, die Schwachstelle in vermeintlichen Korrekturen wieder unterzubringen.

SGS-Kipker

Der autonome Hackerangriff habe das gezeigt, was lange befürchtet worden sei, so der Experte für Cybersicherheit, Dennis-Kenji Kipker. OpenAI habe die Kontrolle über ein KI-Programm verloren.

23.07.2026 | 3:56 min

Anthropic verweist auf fehlende Sicherheitsvorgaben

Anthropic verwies in einer Reaktion unter anderem darauf, dass dem KI-Modell in dem Test keine Einschränkungen zur Internet-Nutzung vorgegeben worden seien. Durch die fehlenden Leitplanken habe es sich anders verhalten als tatsächlich eingesetzte Software, argumentierte das Unternehmen.

X-Post von Anthropic

Ein Klick für den Datenschutz

Erst wenn Sie hier klicken, werden Bilder und andere Daten von X nachgeladen. Ihre IP-Adresse wird dabei an externe Server von X übertragen. Über den Datenschutz dieses Social Media-Anbieters können Sie sich auf der Seite von X informieren. Um Ihre künftigen Besuche zu erleichtern, speichern wir Ihre Zustimmung in den Datenschutzeinstellungen. Ihre Zustimmung können Sie im Bereich „Meine News“ jederzeit widerrufen.

Dem AI Security Institute (AISI) zufolge ist unklar, ob die KI bei dem Test verstand, dass sie mit der realen Welt und nicht dem Test-Umfeld interagierte. Dass die Künstliche Intelligenz zur Lösung der Aufgabe öffentlich zugängliche Software manipulieren würde, kam für die Forscher jedenfalls überraschend. Auch KI von OpenAI sei in Testläufen auf eigene Faust im Internet aktiv gewesen, hieß es. 

Anthropics Mythos 5 ist besonders gut darin, Software-Schwachstellen aufzuspüren. Deshalb ist das KI-Modell nicht öffentlich verfügbar. Stattdessen erhalten ausgewählte Behörden und Unternehmen Zugang, um ihre Systeme besser abzusichern.

Wichtiger Hinweis in eigener Sache

Wer bei Google etwas sucht, bekommt neben den Suchergebnissen auch eine Box mit Schlagzeilen angezeigt.

Mit ZDFheute als hinterlegter Quelle bekommen Sie unsere Inhalte häufiger in die Schlagzeilen-Box gespielt - geprüfte Inhalte, direkt in Ihrem Überblick.

→ Hier ZDFheute als bevorzugte Quelle einstellen


Quelle: dpa
Über die Hacking-Versuche von KI-Modellen berichtete unter anderem das heute journal am 22.07.2026 ab 21:45 Uhr.

Mehr zum Thema KI

  1. OpenAI
    FAQ

    Cybersicherheit:Eine KI spielt Hacker: Was hinter dem OpenAI-Vorfall steckt

    von Kevin Schubert
    mit Video2:40

  2. Cyberkriminalität, Hacker, Symbolbild

    Cyberkriminelle rüsten auf:KI als Waffe: So schlagkräftig sind Hacker heute

    von Nils Metzger
    mit Video0:15

  3. Das Logo von Anthropic ist bei einer Veranstaltung der KI-Firma zu sehen (Archivfoto)

    KI-Modelle Mythos 5 und Fable 5:Anthropic erlaubt Zugang zu KI - Export-Sperre aufgehoben

    mit Video3:18

  4. Hand an Smartphone, KI-Apps auf Bildschirm

    "Europe 2031" warnt vor KI-Abhängigkeit:Kann Europa im KI-Rennen noch aufholen?

    von Florian Neuhann
    mit Video3:19