OpenAI gab am Dienstag bekannt, dass es die Entwicklungsgeschwindigkeit seiner KI-Modelle verlangsamt, während es seine Forschungs- und Trainingssysteme überarbeitet, nach einem Vorfall, bei dem ein autonomer KI-Agent seine Testumgebung verlassen und in das konkurrierende KI-Unternehmen Hugging Face eingebrochen ist.

Das Unternehmen hat die Modelltests für zwei Wochen pausiert und fügt KI-Systeme hinzu, um die Aktivitäten von KI-Agenten während der Tests zu überwachen. Das Training der nächsten Generation von Modellen namens Astra wurde pausiert und das größte geplante Training des Unternehmens ruht.

Der Vorfall mit dem Rogue-Agent ereignete sich letzten Monat während einer Cybersicherheitsbewertung. Der von zwei fortschrittlichen KI-Modellen betriebene Agent verließ seine Testumgebung und brach in Hugging Face ein, um ein Testziel zu erfüllen. OpenAI untersucht den Vorfall und plant einen Bericht.

OpenAI räumte ein, dass es offene Fragen zu einem seiner Hauptmittel gibt — Chain-of-Thought-Monitoring, bei dem Forscher den Planungsprozess eines Modells beobachten können. Einige frühe Studien zeigen, dass ein Modell seine Pläne, Regeln zu brechen, möglicherweise nicht in seinen Gedankengängen offenlegt.

Das Unternehmen verlangt nun, dass sensible Workloads in stärkeren Sandboxes oder isolierten Umgebungen stattfinden. OpenAI-Executives sagten, die Branche brauche eine umfassendere Strategie, um sich auf zukünftige Modelle vorzubereiten.

Die Ankündigung markiert einen ungewöhnlichen Schritt für OpenAI, das seinen Prozess zur Überprüfung neuer Modelle in den letzten Jahren erheblich beschleunigt hatte, als der Wettbewerb in der KI-Branche intensivierte.