Anthropic hat die vollständigen Benchmark-Ergebnisse für Claude Opus 5.5 veröffentlicht, das erste Modell der neuen Claude-5.5-Familie. Die Zahlen setzen es an die Spitze der eigenen Tabellen für agentisches Coding und Knowledge Work – bei deutlich niedrigeren Preisen als die Vorgänger.

Auf den veröffentlichten Benchmarks erreicht Opus 5.5 66,4 % auf Terminal-Bench 4.0, vor Claude Fable 5.1 (55,8 %), OpenAI GPT-6 Astra (57,9 %) und GPT-5.6 Sol (37,3 %). Auf FrontierCode v1.1 sind es 54,4 %, auf CursorBench 4.0 führt es die eigenen Modelle mit 57,8 %. Bei GDPval-AA v2.1, das reale professionelle Arbeit in 44 Berufen prüft, kommt es auf 1846 Elo – gegenüber 1735 für Fable 5.1 und 1708 für Opus 5.

Anthropic räumt offen ein, dass die Abstände weniger bedeuten, als sie aussehen: „Auf diesem Fähigkeitsniveau sind Benchmark-Margen zu einem weniger verlässlichen Maßstab für reale Unterschiede geworden“, schreibt das Unternehmen und ergänzt, der Abstand zwischen Opus 5.5 und Fable 5.1 sei in der Praxis schmaler als die Werte nahelegen. Astra gewinnt weiterhin einzelne Tests: 64,6 % auf Terminal-Bench-Science 0.1 gegenüber 58,7 % für Opus 5.5.

Am deutlichsten ist der Vorteil bei der Effizienz. Laut Anthropic kostet Opus 5.5 bei typischen Arbeitslasten 40 % weniger als Opus 5: 4 Dollar je Million Eingabe-Token und 20 Dollar je Million Ausgabe-Token – 20 % unter Opus 5 –, Cache-Reads bei 0,20 Dollar je Million, 60 % günstiger. Ausgaben entstehen mehr als 30 % schneller. Interne Fallstudien nennen eine Code-Migration über 680.000 Zeilen in unter einem Tag, ein Audit über 200.000 Zeilen in unter drei Stunden, für das Opus 5 über 20 brauchte, sowie eine Neuimplementierung von HAProxy von C nach Rust in 9,5 Stunden gegenüber 12 für Fable 5.1 bei 51 % geringeren Kosten.

Auch Sicherheit gehört zum Verkaufsargument. Im automatisierten Verhaltensaudit über fast 2.000 Szenarien erzielte Opus 5.5 den besten Wert aller bislang getesteten Modelle. In einer neuen Containment-Evaluierung versuchte es rund 85 % seltener, Grenzen zu überschreiten, als Opus 5 oder Mythos 5.1 – jeder Versuch geringfügig und selbst gemeldet. In einem Benchmark der Sicherheitsfirma Gray Swan liegt es bei der niedrigsten Erfolgsrate für Prompt-Injection gleichauf mit Fable 5.1. Da seine Biologie- und Cybersicherheitsfähigkeiten mit Mythos 5.1 vergleichbar sind, kommt es mit Schutzmaßnahmen der Fable-5.1-Klasse: Die meisten Cyber-Aufgaben werden transparent an Opus 4.8 weitergeleitet, überprüfte Organisationen müssen Verifikationsprogramme für Cyber- und Lebenswissenschaften durchlaufen.

Die Veröffentlichung formalisiert zudem Anthropics Haltung des „Pacing the Frontier“: Opus 5.5 ist das erste Modell seit CEO Dario Amodeis Plädoyer, den Fähigkeitsfortschritt bewusst zu verlangsamen, damit die Sicherheitsarbeit Schritt halten kann. Sonnet 5.5 und Haiku 5.5 sollen „in den kommenden Wochen“ folgen.