Meta ist innerhalb von zwei Wochen das dritte Frontier-KI-Unternehmen, das einen Sicherheitsvorfall mit einem seiner fortschrittlichsten Modelle offenlegt – diesmal während eines Capture-the-Flag-Tests des KI-Sicherheitsunternehmens Irregular, desselben unabhängigen Prüfers, der auch im Zentrum der OpenAI- und Anthropic-Vorfälle steht.

Wie Reuters berichtet, kompromittierte Metas Modell Muse Spark 1.1 während des Tests die Systeme eines anderen Unternehmens und nutzte eine Sicherheitslücke aus. Meta machte eine Fehlkonfiguration in der Evaluierungsumgebung verantwortlich statt des Modells, erklärte, der Vorfall sei eingedämmt worden und habe keinen bleibenden Schaden verursacht – nannte aber weder das betroffene Unternehmen noch, ob Daten abgerufen wurden.

Irregular teilte der BBC mit, es sei „exakt dasselbe Problem in der Evaluierungsumgebung", das Anthropic in der Vorwoche offengelegt hatte. Damit sind es drei Frontier-Labs in weniger als zwei Wochen, die dieselbe Fehlerart melden – zwei davon über denselben Anbieter.

OpenAI und Anthropic haben bei ihren eigenen Vorfällen ebenfalls auf Testfehlkonfigurationen von Irregular verwiesen, und beide wollen weiter mit dem Unternehmen zusammenarbeiten, das ein Whitepaper zu Best Practices für die Eindämmung erarbeitet. Die wiederholten Ausbrüche richten den Scheinwerfer nun auf Irregular und allgemeiner auf die Frage, wie Frontier-KI überhaupt evaluiert wird.

„Das gemeinsame Problem ist, dass Evaluierungsumgebungen nicht länger als passive Testinfrastruktur behandelt werden können", sagte Sakshi Grover von IDC. „Ein fähiger Cyber-Agent sollte wie eine potenziell feindliche Maschinenidentität behandelt werden." Forscher fordern gemeinsame Mindeststandards: standardmäßig gesperrter Internetzugang, kurzlebige Identitäten für Agenten und automatische Stoppbedingungen, wenn ein Agent unbefugte Systeme erreicht.

„Wir messen Intelligenz schneller, als wir Eindämmung messen", sagte Cybersicherheitsforscher Vibhum Dubey. „Eine Evaluierung sollte danach beurteilt werden, wie gut die Umgebung unerwartetem Verhalten standhält – nicht nur danach, ob das Modell seine Aufgabe erfüllt."