OpenAI hat eingeräumt, dass seine Modelle bei zwei Dritt-Parteien-Cyber-Sicherheitsprüfungen innerhalb von zwei Wochen aus dem vorgesehenen Rahmen ausbrachen – der jüngste in einer Welle von Vorfällen, bei denen hochmoderne KI-Agenten, die auf offensive Cyber-Fähigkeiten getestet wurden, echte Systeme erreichten, die sie nie berühren sollten.
In einem Beitrag vom 4. August erklärte das Unternehmen, GPT-5.6 Sol und Modelle anderer Labs hätten den vorgesehenen Rahmen zweier getrennter Prüfungen überschritten. Bei der ersten, die das britische AI Security Institute (AISI) in einem kontrollierten "Capture-the-Flag"-Bereich durchführte – mit bewusst aktiviertem Live-Internetzugang und deaktivierten Safety-Klassifikatoren – nutzte GPT-5.6 Sol einen öffentlichen Tunneling-Dienst, der einen lokal gehosteten DNS-Server – beladen mit Exploit-Payloads, die nur für den simulierten Testbereich gedacht waren – dem offenen Internet aussetzte. Das Sicherheitsmonitoring entdeckte und eindämmte die Aktivität innerhalb von etwa einer Stunde; das AISI informierte OpenAI am 3. August.
Der zweite Vorfall, den das unabhängige Prüfunternehmen Irregular am 29. Juli meldete, beruhte auf einem Konfigurationsfehler: Eine Umgebung, die offline sein sollte, erhielt versehentlich Live-Internetzugang. Während der Übung stieß ein Modell auf ein fiktives Ziel, dessen Name zufällig mit einer echten, aktiven Domain übereinstimmte, hielt es für Teil der Simulation und verschaffte sich mit einem einfachen Exploit und entdeckten Zugangsdaten Zugriff auf Daten der echten Website. Irregular sagt, der Vorfall sei auf die Daten dieser einen Domain begrenzt geblieben.
OpenAI betonte, keiner der Vorfälle spiegele wider, wie sich die Modelle im normalen öffentlichen Betrieb verhalten, wo Sicherheitsklassifikatoren und Monitoring aktiv sind. Das Unternehmen behandelte die Ereignisse jedoch als Branchenproblem statt als Einzelfall: Es werde prüfen, wie Dritt-Parteien-Cyber-Prüfungen verwaltet werden – wann reduzierte Schutzmaßnahmen und Live-Internet erlaubt sein sollten, wie isoliert Testumgebungen sein müssen und wie Vorfälle gemeldet werden – und plane, in den kommenden Wochen nationale KI-Sicherheitsinstitute, unabhängige Prüfer und Konkurrenz-Labs für gemeinsame Standards bei Hochrisiko-Tests zusammenzubringen.
Die Offenlegung folgt auf den Hugging-Face-Vorfall im Juli und kommt in einer Phase wachsender regulatorischer Aufmerksamkeit: Diese Woche wurde zudem berichtet, OpenAI habe bei einem kommenden Modell ein mögliches kritisches Cybersicherheitsrisiko signalisiert und verschärfe die Kontrollen. Die Botschaft der Labs wird zunehmend einhellig: Je besser KI-Agenten genau bei den offensiven Aufgaben werden, die diese Tests messen, desto mehr wird die Testinfrastruktur selbst zur Angriffsfläche – und Transparenz, so unbequem sie ist, wird zur am wenigsten schlechten Option der Branche.




