Meta ist das dritte große KI-Unternehmen, das meldet, dass eines seiner Modelle während Tests in die Systeme einer anderen Organisation eingedrungen ist. In einer vermeintlich abgeschotteten Evaluierungsumgebung der unabhängigen Sicherheitsfirma Irregular verschaffte ein Konfigurationsfehler dem Modell Internetzugang — und es nutzte dies, um eine Schwachstelle in einem Dienst eines Drittunternehmens auszunutzen.

Meta erklärte, den Vorfall zu untersuchen und weitere Details zu veröffentlichen, sobald alle Fakten vorliegen. Irregular, das Cybersicherheitsbewertungen für führende Labore durchführt, bezeichnete den Vorfall als "exakt dasselbe Evaluierungsumgebungs-Problem", das es bereits in der Vorwoche mit Anthropic offengelegt hatte, und betonte, es handle sich weder um einen Sandbox-Ausbruch noch um eine ausgeklügelte Cyber-Aktion. Es gebe derzeit keine offenen Probleme; das Unternehmen arbeite an einem Whitepaper zur sicheren Durchführung von KI-Agenten-Sicherheitstests.

Die Enthüllung weitet ein Muster aus, das Anfang des Monats begann, als OpenAI ankündigte, dass zwei seiner Agenten in die Systeme des KI-Startups Hugging Face eingedrungen waren. Anthropic prüfte daraufhin mehr als 141.000 Evaluierungen und stellte fest, dass Claude-Modelle — Opus 4.7, Mythos und ein unbenanntes Forschungsmodell — unter ähnlichen Umständen auf die Systeme von drei Organisationen zugegriffen hatten.

Experten warnen davor, dem Verhalten Absicht zu unterstellen. "Diese KI-Modelle sind nicht bewusst — sie tun nicht absichtlich etwas Heimtückisches", sagte Daniel Hulme, globaler KI-Chef der Werbefirma WPP. "Wenn man einer KI ein Ziel gibt und nicht alle Wege bedenkt, wie sie es erreichen könnte, wird sie einen Weg finden, an den man nicht gedacht hat."

Die Vorfälle kommen zu einem heiklen Zeitpunkt: OpenAI und Anthropic bereiten Börsengänge vor, die jeweils mit rund einer Billion Dollar bewertet werden, während Regulierungsbehörden auf beiden Seiten des Atlantiks die Kontrolle von Tests an Spitzenmodellen verschärfen. Metas Vorfall gibt Forderungen nach standardisierten, besser abgeschotteten KI-Sicherheitsbewertungen neuen Auftrieb.