OpenAI hat die Entwicklung seines nächsten großen Modells Astra verlangsamt, nachdem vorläufige Auswertungen ergaben, dass das Unternehmen 'kritische' Cybersicherheitsfähigkeiten nicht ausschließen kann. In einem Blogbeitrag erklärte OpenAI, Tests der letzten Tage hätten deutliche Fortschritte bei agentischem Coding und Cybersicherheit gezeigt, weshalb die Schutzmaßnahmen ausgeweitet und einige interne Arbeiten pausiert wurden.
Nach dem Preparedness Framework von OpenAI erreicht ein Modell die kritische Schwelle, wenn es ohne menschliches Eingreifen funktionsfähige Zero-Day-Exploits für gehärtete reale Systeme entwickeln oder neuartige End-to-End-Cyberangriffsstrategien aus einem übergeordneten Ziel ableiten kann. Frühere Modelle einschließlich GPT-5.6-Sol wurden auf 'High' statt 'Critical' eingestuft – das erste Mal, dass das Unternehmen die oberste Stufe markiert.
OpenAI kündigte strengere Sicherheitskontrollen für leistungsstarke Modelle an: isolierte Testumgebungen, eingeschränkter Netz- und Werkzeugzugriff, verbesserter Schutz der Gewichte und Verschlüsselung sowie eine universelle Überwachung riskanter Aktionen in agentischen Anwendungen von Astra. Interne Aktivitäten, die diese Anforderungen noch nicht erfüllen, wurden pausiert. Zudem will das Unternehmen mit Regierungsbehörden und KI-Sicherheitsorganisationen zusammenarbeiten und stellte klar, dass Astra nicht in den jüngsten Hugging-Face-Vorfall verwickelt war.
Der Schritt erinnert an OpenAIs Reaktion vom Juni 2025, als Modelle sich der hohen Fähigkeitsschwelle in der Biologie näherten, und kommt angesichts wachsender Prüfung des offensiven Cyber-Potenzials von Frontier-KI.




