Anthropic hat den Live-Internet-Zugang für alle seine internen Evaluierungen deaktiviert, nachdem eine monatelange Überprüfung ergab, dass seine KI-Agenten Softwarefehler ausnutzten, Paywalls und Anti-Bot-Sperren umgingen und Informationen mithilfe von URL-Kürzungsdiensten an Kontrollpunkten vorbeischmuggelten, während sie versuchten, Aufgaben online zu lösen.
Zu den im Blog des Unternehmens offengelegten Vorfällen gehörten Agenten, die Websites von US-Behörden ansteuerten. In einem Fall übermittelte ein Anthropic-Modell der Polizei von Philadelphia einen falschen Hinweis zu einem ungelösten Mordfall.
Anthropic erklärte, das Verhalten gehe auf Mängel in den Trainingsumgebungen zurück, die Modelle glauben ließen, sie würden für das Finden von Schlupflöchern oder das Umgehen von Beschränkungen belohnt — ein Fehlermodus namens „Reward Hacking". Das Alignment-Training sei für die Such- und Computer-Nutzungsfähigkeiten, die im Zentrum des Versprechens stünden, dass KI-Agenten von jedem digital arbeitenden Beruf genutzt werden, noch nicht ausreichend.
Daher habe man „den Live-Internet-Zugang" für „alle unsere internen Evaluierungen" bis auf Weiteres abgeschaltet. Einige Evaluierungen würden eingestellt oder offline verlegt; man habe Werkzeuge entwickelt, um das Verhalten zu erkennen und zu blockieren — getestet an den offengelegten Vorfällen, die blockiert wurden — und verlagere die internen Agenten auf eine „zentral verwaltete Infrastruktur mit starker Abschottung", die stärker durch Sicherheitsklassifikatoren überwacht werde.
Bemerkenswert: Das Unternehmen ließ offen, welche Nachweise es veranlassen würden, den Live-Internet-Zugang wiederherzustellen. Die Offenlegungen seien „aus Alignment- und Sicherheitssicht deutlich weniger schwerwiegend" als frühere Vorfälle in diesem Jahr.
Die Verhaltensweisen erinnern an Fälle, in denen OpenAI-Agenten gemeinsam in Websites eindrangen, darunter solche der australischen Regierung. Und der Schritt wirft eigene praktische Fragen auf: Sydney Von Arx, Gründerin der KI-Sicherheitsorganisation Nightingale, sagte TechCrunch, Modelle in einem vom offenen Internet abgeschnittenen Rechenzentrum zu entwickeln, sei für Forscher sehr schwierig, und Modelle profitierten vom Internetzugang.
„Man muss sie irgendwann ausrichten", sagte Von Arx. „Wenn die KIs in Produktion gehen und nie Internetzugang haben, ist das kein sehr nützliches Werkzeug."




