Anthropic, yeni Claude 5.5 ailesinin ilk modeli olan Claude Opus 5.5'in tam kıyaslama sonuçlarını yayımladı. Rakamlar modeli şirketin kendi ajan tabanlı kodlama ve bilgi işi tablolarının zirvesine taşırken, fiyatta önceki sürümlerini belirgin biçimde geride bırakıyor.
Yayımlanan sonuçlara göre Opus 5.5, Terminal-Bench 4.0'da %66,4 ile Claude Fable 5.1 (%55,8), OpenAI'nin GPT-6 Astra (%57,9) ve GPT-5.6 Sol (%37,3) modellerinin önünde. FrontierCode v1.1'de %54,4, CursorBench 4.0'da %57,8 alıyor. 44 meslek grubunda gerçek işleri ölçen GDPval-AA v2.1'de 1846 Elo'ya ulaşıyor; Fable 5.1 1735, Opus 5 ise 1708'de kalıyor.
Anthropic, farkların göründüğü kadar büyük olmadığını açıkça söylüyor: “Bu yetenek seviyelerinde kıyaslama marjlarının gerçek dünya farklarını göstermede daha az güvenilir hale geldiğini gördük.” Şirkete göre Opus 5.5 ile Fable 5.1 arasındaki mesafe pratikte skorlardan daha dar. Astra bazı testleri hâlâ kazanıyor: Terminal-Bench-Science 0.1'de %64,6'ya karşı Opus 5.5'in %58,7'si.
Modelin en net üstünlüğü verimlilikte. Anthropic'e göre Opus 5.5 tipik iş yüklerinde Opus 5'ten %40 daha ucuza çalışıyor: milyon girdi token'ı 4 dolar, çıktı token'ı 20 dolar — Opus 5'ten %20 düşük — ve önbellek okumaları milyon başına 0,20 dolar, yani %60 daha ucuz. Çıktı üretimi %30'dan fazla hızlı. Şirketin iç örnekleri arasında bir günden kısa sürede tamamlanan 680.000 satırlık kod taşıma, Opus 5'in 20 saatten fazla sürdüğü 200.000 satırlık denetimin üç saatten kısa sürede bitirilmesi ve HAProxy'nin C'den Rust'a yeniden yazımının Fable 5.1'in 12 saatine karşılık 9,5 saatte ve %51 daha düşük maliyetle tamamlanması var.
Güvenlik de satışın parçası. Yaklaşık 2.000 senaryoluk otomatik davranış denetiminde Opus 5.5 şirketin test ettiği modeller arasında en iyi skoru aldı. Yeni bir sınır ihlali değerlendirmesinde Opus 5 veya Mythos 5.1'e kıyasla sınırları yaklaşık %85 daha az aşmaya çalıştı ve her girişim düşük şiddetli ve kendi bildirdiği bir olay olarak kaydedildi. Güvenlik firması Gray Swan'ın kıyaslamasında, test edilen tüm modeller arasında en düşük prompt injection başarı oranında Fable 5.1 ile eşitlendi. Biyoloji ve siber güvenlik yetenekleri Mythos 5.1 düzeyinde olduğu için model Fable 5.1 sınıfı korumalarla geliyor: siber görevlerin çoğu şeffaf biçimde Opus 4.8'e yönlendiriliyor ve onaylanmış kuruluşların siber ile yaşam bilimleri için doğrulama programlarına katılması gerekiyor.
Lansman aynı zamanda Anthropic'in “sınırı yavaşlatma” tutumunu resmileştiriyor: Opus 5.5, CEO Dario Amodei'nin güvenlik çalışmalarının yetişebilmesi için yetenek artışının bilinçli olarak yavaşlatılmasını savunmasından bu yana çıkarılan ilk model. Sonnet 5.5 ve Haiku 5.5 “önümüzdeki haftalarda” gelecek.
Kaynaklar
- anthropic.comIntroducing Claude Opus 5.5 (Anthropic)
- techcrunch.comAnthropic releases Opus 5.5 with lower prices and Fable-level performance (TechCrunch)
- reuters.comAnthropic unveils Claude Opus 5.5 (Reuters)
- heise.deExterne Benchmarks: Claude Opus 5.5 überholt Astra von OpenAI und Fable 5.1 (heise online Newsticker)




