Anthropic’in en yeni modeli Opus 5.5 Salı günü kullanıma sunuldu. Şirket açıklamasına göre model, kodlama ve bilgi işi performansında yeni bir en iyi seviye belirledi. Claude serisindeki üç katmandan en yetenekli ve en pahalı olanı Opus; ortada Sonnet, en hızlı ve en ucuz olanı ise Haiku yer alıyor. Anthropic, yeni sürümün birçok kıyaslamada daha büyük Fable modelini geride bıraktığını ve Fable’ın başaramadığı bir dizi gayriresmi görevde başarılı olduğunu belirtiyor.
Yeni model, selefine kıyasla belirgin şekilde daha ucuz. Opus 5.5 için çıktı token fiyatı milyon token başına 20 dolar olarak belirlendi; önceki modelde bu ücret 25 dolardı. Diğer metriklerde de benzer fiyat düşüşleri var. Modelin çalıştırılması da daha hızlı; bu durum hizmet için gereken hesaplama miktarındaki genel düşüşü yansıtıyor.
Yeni sürüm, Opus’un iletişim biçiminde de önemli değişiklikler getiriyor. Opus 5.5 jargon kullanma eğilimi daha düşük ve mesajlarının başında önemli bilgileri verme olasılığı daha yüksek.
Lansman, 24 Temmuz’da Opus 5’in yayınlanmasının üzerinden sadece iki ay geçtikten sonra geldi. Açıklamaya göre serideki bir sonraki katmanlar olan Sonnet 5.5 ve Haiku 5.5, benzer performans iyileştirmeleriyle “önümüzdeki haftalarda” duyurulacak.
Anthropic, Opus 5.5’in biyoloji ve siber güvenlik yetenekleri açısından Mythos’a denk olduğunu söylüyor. Bu nedenle modelin piyasaya sürülmesi, şirketin Fable modeli için uyguladığı aynı güvenlik önlemlerine tabi. Söz konusu önlemler, modellerin derlenmiş programlardaki açıkları keşfetmek veya tanınabilir biyolojik silahlar geliştirmek gibi faaliyetlerde kullanımını sınırlıyor.
Opus 5.5, CEO Dario Amodei’nin öncülüğünde yapay zeka yeteneklerindeki ilerlemenin hizalama çalışmalarının hızına uyacak şekilde bilinçli olarak yavaşlatılması çağrılarını benimsemesinden bu yana Anthropic’in ilk model sürümü oldu.
Amodei, bu ayın başında yazdığı gönderide “Risklerin tamamen ele alınabilmesi için daha fazla sağduyu gerektiğine ikna oldum” dedi ve ekledi: “Sadece risk önleme yatırımı yapmak değil, risk önlemenin yetişmesi için zaman tanınması adına yetenek gelişim hızını ayarlamak gerekiyor.”
Opus 5.5’in güvenlik eğitimi genel olarak selefleriyle benzerdi; hizalama testleri ve METR ile Frontier Design gibi dış kuruluşlar tarafından piyasaya sürüm öncesi değerlendirmeler yapıldı. Anthropic, gelecek modeller için daha gelişmiş eğitim ve değerlendirme sistemlerinin hazırlandığını vurguladı; bu sistemler arasında geliştirilmiş güvenlik ve izleme altyapıları da bulunuyor.
Blog yazısında “Yapay zeka daha yetenekli hale geldikçe, insanların güvendiği sistemlerin güvenli olmasını sağlamada kamu politikasının daha büyük bir rol oynaması gerekiyor. Bu kapasitenin inşası zaman alıyor ve bunu destekleyecek altyapıyı kurmaya başladık” denildi. Yazıda ayrıca bu çalışmalarla ilgili daha fazla ayrıntının yakında paylaşılacağı belirtildi.