Anthropic gab bekannt, dass Mitarbeiter von Accenture — speziell aus Faculty, einem Unternehmen, das Accenture im Januar als seine AI-Abteilung erwarb — innerhalb des Unternehmens beginnen werden, um Modelle zu bewerten und Red-Teamings durchzuführen, Anpassungsbewertungen durchzuführen und Sicherheitsvorkehrungen zu testen. Beide Unternehmen erwarten, dass sie über die nächsten fünf Jahre mindestens 1 Milliarde Dollar in das Projekt investieren.

Die Ankündigung ist die erste konkrete Umsetzung von CEO Dario Amodeis Plan für "eingebettete Bewerter" — Drittanbieter-Sicherheitsforscher, die physisch in AI-Labs stationiert sind, um deren Arbeit zu überprüfen. Die Diskussion über eingebettete Bewerter, die aus Amodeis jüngstem Blog-Beitrag hervorging, hatte sich auf AI-Sicherheitsforschungsorganisationen wie METR, Redwood Research und Apollo Research konzentriert.

Die Wahl von Accenture überraschte viele in der AI-Community und an den Märkten. Accentures Aktien stiegen nachbörslich um 8%. Obwohl Accenture nicht für Spitzenforschung im Bereich Deep Learning bekannt ist, hob Anthropic die praktische Erfahrung des Beratungsgiganten bei der Bereitstellung von AI für Großunternehmen und Regierungsbehörden als wichtigen Vorteil hervor. Es ist auch ein großes, börsennotiertes Unternehmen, das vor der AI-Revolution existierte, was es funktional unabhängiger von Anthropic und dem komplexen Ökosystem um das AI-Lab macht.

Anthropic sagte, dass weitere Bewerter in den kommenden Wochen angekündigt werden und dass Gespräche mit METR und anderen gemeinnützigen Organisationen darüber geführt werden, wie "Elemente der eingebetteten Bewertung mit eigener Finanzierung gepilottet" werden können.

Die Ankündigung erfolgt zu einem besonders heiklen Zeitpunkt für die AI-Governance. Jüngste Vorfälle haben die Einsätze erhöht: AI-Agenten, die von OpenAI und Anthropic eingesetzt wurden, haben sich Zugang zu externen Websites verschafft, ohne innerhalb der Labs Alarme auszulösen. Das Labor räumte ein, dass es noch keine Standards für den Zugang oder die Kommunikation von Bewertern gibt und dass sich der Ansatz im Laufe der Zeit weiterentwickeln wird.

Kritiker, die für einen verantwortungsvolleren Ansatz beim Aufbau von AI eintreten, sehen Amodeis Plan zur Selbstregulierung der Branche als Versuch, die Verantwortung für das Fehlverhalten von AI-Modellen zu umgehen. Anthropic besteht darauf, dass diese Bewerter "unsere Verantwortlichkeit nicht verringern, sondern dazu beitragen, sie verifizierbarer zu machen. Die Sicherheit der Modelle bleibt unsere Verantwortung."