Özet
Claude Opus 5.5 Salı günü tanıtıldı. Modelde giriş tokenı milyon başına 4 dolar, çıkış tokenı milyon başına 20 dolar fiyatlandı. Varsayılan ayarlarda Opus 5’e göre yüzde 40 daha ucuz. Anthropic, modelin çoğu görevde Fable 5.1 ile eşdeğer performans gösterdiğini söylüyor.
Anthropic’in kendi verilerine göre Opus 5.5, kodlama ve bilgi işi testlerinde Fable 5.1 ve Opus 5’in önünde yer alıyor. Ancak GPT-6 Astra, AutomationBench ve Terminal-Bench-Science 0.1’de onu geride bırakıyor.
Bu, CEO Dario Amodei’nin sektörden yapay zeka yetenek artışını yavaşlatma çağrısı yapmasının ardından Anthropic’in piyasaya sürdüğü ilk model. Model, Fable 5.1 ile aynı siber güvenlik ve biyoloji güvenlik önlemlerini taşıyor.
Anthropic Salı günü Claude Opus 5.5’i duyurdu. Bu model, şirketin Claude 5.5 ailesindeki ilk ürün. Anthropic, yeni modelin en pahalı amiral gemisi olan Claude Fable 5.1 ile çoğu görevde aynı seviyede performans gösterdiğini belirtiyor.
Modelin farkı fiyatında. Opus 5.5, yerini aldığı Opus 5’e göre çalıştırma maliyeti yüzde 20 daha düşük ve şirketin en güncel teklifi olan Fable 5.1’e göre yüzde 60 daha ucuz.
Model oldukça yetenekli görünüyor. Hem sürüm olarak 5.5’e karşı Fable’ın 5.1’i hem de aile olarak Opus, halka açık en büyük model. Onu Sonnet takip ediyor, Haiku ise en küçük olanı.
Anthropic, Fable ile Opus arasındaki farkın kıyas skorlarının gösterdiğinden daha dar olduğunu kabul ediyor. Ancak modelin plan kapsamında herkese açık olması ve token başına daha ucuz olması, çoğu Claude kullanıcısı için açık tercih haline getiriyor.
Opus 5 Temmuz’da piyasaya çıktığında çoğu kıyasta Fable 5’i fiyat ve skor olarak geride bırakmıştı. Fable 5.1 ise eylül başında geldi ve durumu tersine çevirerek Anthropic’in yayımladığı her kıyasta Opus 5’i geçti.
Opus 5.5 farkı yeniden kapatıyor, bu kez ham skorlar yerine fiyat üzerinden. Geliştirici platformu Lovable, temmuzda Opus 5’i kendi kodlama testlerinden geçirmişti. Anthropic tarafından paylaşılan açıklamada şirket, önceki modelin “daha istikrarlı, çalıştırma başına çok daha az varyansla” çalıştığını söyledi. Bu, Anthropic’in şimdi yeniden yaptığı aynı verimlilik vurgusu.
Opus 5.5 aynı zamanda CEO Dario Amodei’nin sektörden yavaşlamasını istediği bir yazı yayımlamasının ardından Anthropic’in çıkardığı ilk model. Amodei, yapay zeka yetenek artışının güvenlik testlerini aşmaya başladığını savunuyor. Amodei bu ay başında “Yapay zeka modellerinin yeteneklerini geliştirme hızını yavaşlatmalıyız” diye yazdı.
Anthropic bu ilerlemeyi büyük ölçüde ajan tabanlı kodlama üzerinden ölçüyor. Ajan tabanlı kodlama, tek bir isteme yanıt vermek yerine çok adımlı eylemleri kendi başına gerçekleştiren bir yapay zeka ajanı tarafından yürütülen iş anlamına geliyor.
Komut satırı arayüzünde karmaşık profesyonel görevleri bitirip tamamlanan görev yüzdesi olarak puanlayan Terminal-Bench 4.0’da Opus 5.5 yüzde 66,4 ile Fable 5.1’in yüzde 55,8’i ve GPT-6 Astra’nın yüzde 57,9’unu geçti. Gerçek bir mühendislik hattında ajan kod değişikliklerinin birleştirilip birleştirilmeyeceğini aynı geçme oranı puanlamasıyla kontrol eden FrontierCode’da Opus 5.5 yüzde 54,4 aldı, Fable 5.1 ise yüzde 50,3’te kaldı.

44 meslek genelinde gerçek dünya profesyonel işini Elo üzerinden değerlendiren GDPval-AA v2.1’de Opus 5.5 1846 puan aldı. Fable 5.1 1735, Opus 5 ise 1708 puanda kaldı. Elo, satrançta kullanılan ve göreceli beceriyi düz bir yüzde yerine ölçen sıralama sistemi.
Opus 5.5 her yerde lider değil. Zapier tarafından oluşturulan ve bir ajanın insan yardımı olmadan tam bir iş akışını baştan sona taşıyıp taşıyamadığını puanlayan AutomationBench’te GPT-6 Astra’nın yüzde 41,4’ü Opus 5.5’in yüzde 40,0’ını geçiyor.
Komut satırı ortamında yürütülen ajan tabanlı bilimsel araştırmayı aynı geçme oranı yöntemiyle test eden Terminal-Bench-Science 0.1’de Astra’nın yüzde 64,6’sı Opus 5.5’in yüzde 58,7’sini daha geniş bir farkla geçiyor.
En büyük satış noktası maliyet. Milyon başına fiyatlanan, modelin okuyup yazdığı metin parçaları olan giriş tokenları Opus 5.5’te 4 dolar, Opus 5’te 5 dolardı. Çıkış tokenları 25 dolardan 20 dolara indi. Uzun ajan kodlama oturumlarında maliyeti artıran, modelin daha önce işlediği bağlamı yeniden işlemek yerine yeniden kullanmak anlamına gelen önbellek okumaları milyon token başına 0,20 dolara indi ve yüzde 60 düştü.

Opus 5.5, bu iki yetenek açısından Anthropic’in Mythos sınıfı modelleriyle eşleştiği için Fable 5.1 ile aynı güvenlik önlemleriyle piyasaya çıkıyor. Mythos sınıfı, şirketin en kısıtlı katmanı ve denetlenmiş siber güvenlik ve biyoloji araştırmacılarına ayrılmış durumda.
Çoğu siber güvenlik görevi otomatik olarak daha eski Opus 4.8’e yönlendiriliyor. Bu durum daha önce birçok geliştirici ve kullanıcının şikayet ettiği bir konu.
Opus 5.5 şu anda Anthropic’in platformlarında kullanıma açık. Amazon Web Services, Google Cloud ve Microsoft Azure dahil. Anthropic’e göre önümüzdeki haftalarda Sonnet 5.5 ve Haiku 5.5 de gelecek ve aynı fiyat indirimleri serinin geri kalanına da yansıyacak.