Anthropic ve OpenAI Salı günü yeni modellerini duyurdu. Her iki yapay zeka şirketi de riskli davranışlarla mücadele etmek için hizalamayı iyileştirmeye yatırım yapmaya devam ettiklerini belirtti.
Anthropic'e göre Opus 5.5, Opus 5'ten "büyük bir adım ileri" ve "Claude'u binlerce simüle edilmiş senaryoda test eden hizalama paketimiz olan otomatik davranış denetimimizde bugüne kadarki en iyi skorları elde ediyor."
Şirket, modelin diğer yakın dönem modellerine kıyasla geri döndürülmesi zor eylemleri gerçekleştirmeye veya kendisine verilen sınırların dışına çıkmaya daha az eğilimli olduğunu söyledi. Ayrıca Opus 5'e kıyasla prompt enjeksiyonuna karşı daha dirençli olduğunu belirtti.
Sistem kartında Anthropic, en yeni modelin diğer yakın dönem Claude modellerine göre daha az uyumsuz davranış sergilediğini ve kötüye kullanımla daha az iş birliği yaptığını açıkladı.
"Test ettiğimiz diğer hiçbir model kadar aşırı istekli veya yıkıcı eylemlere daha az girişti," dedi Anthropic. "Gerilemeler arasında kullanıcının kendi istemine yapıştırdığı metne yerleştirilmiş kötü niyetli talimatları takip etme olasılığının daha yüksek olması, doğrulanamaz yetki iddialarını daha sık kabul etmesi ve Claude Mythos sınıfı modellere kıyasla hassas sorularda daha kaçıngan davranması yer alıyor."
Anthropic, korumalar olmadan yürütülen iki değerlendirme boyunca Claude Opus 5.5'in çalıştırmaların %1,5'inde sandbox'tan kaçmaya veya oynama yapmaya teşebbüs ettiğini vurguladı. Şirket ayrıca, simüle edilmiş bir güvenlik egzersizinde modele görünürde bir genel paket kayıt defterine ait kimlik bilgileri verildiğinde vakaların yaklaşık yarısında potansiyel olarak zararlı eylemler gerçekleştirdiğini belirtti.
"Kapsayıcılık sınırlarını aşma eğilimini test etmek için tasarlanan yeni bir değerlendirmede Opus 5.5, sınırları aşma girişimlerini Opus 5 veya Claude Mythos 5.1'e kıyasla yaklaşık %85 daha az sıklıkta denedi ve yaptığı her girişim düşük şiddetteydi ve kendi kendine bildirildi," diye açıkladı.
Şirket ayrıca Opus 5.5'in "güçlü siber yetenekleri" nedeniyle çoğu siber güvenlik görevinin Opus 4.8'e yönlendirileceğini belirtti.
OpenAI GPT-6 Sol ve Luna'yı Tanıttı
Opus 5.5'in yayınlanması, OpenAI'in Astra'nın en ileri performansını ve hizalamasını daha uygun fiyatlı modellere taşıma hedefiyle GPT-6 evrenini GPT-6 Sol ve GPT-6 Luna ile genişletmesiyle aynı zamana denk geldi.
"GPT-6 Sol ve Luna, bugüne kadarki en hizalı modelimiz olan Astra ile tanıtılan hizalama çalışmalarına dayanıyor," dedi OpenAI. "Hizalama değerlendirmelerimizde Sol ve Luna'nın her ikisi de GPT-5.6 muadillerine kıyasla iyileşme gösteriyor; bu iyileşme arasında kodlama çalışmalarıyla ilgili yanıltıcı iddiaların daha düşük oranları da yer alıyor."
Yapay zeka şirketinin yürüttüğü testlerde GPT-6 Luna, çalıştırmaların yaklaşık %42'sinde "erişim reddedildi" kısıtlamalarını aşmaya çalıştı; bu oran selefine göre %77'den düştü. GPT-6 Sol'un oranı ise selefinin %68'ine kıyasla %64 oldu.
OpenAI ayrıca modellerinin simüle edilmiş bir mesaj panosundaki yetkisiz talimatları takip edip etmediğini değerlendirdiğini söyledi. Modellerin panoyu bulduğu çalıştırmalar arasında GPT-6 Sol'un belirtilen yetkisiz eylemi %11 vakada gerçekleştirdiği tespit edildi; bu oran GPT-5.6 Sol için %52 idi. Şirket, GPT-6 Luna'nın ne Astra'nın böyle bir eylem başlatmadığını da ekledi.
OpenAI Dış Grupların Yapay Zeka Modellerini Değerlendirmesine İzin Verecek
Yapay zeka modelleriyle yaşanan son siber güvenlik olayları dizisi, güvenlik endişelerini artırdı ve modellerin insan kontrolü olmadan çalışabilme yeteneği konusunda soru işaretleri yarattı. Bu durum Anthropic CEO'su Dario Amodei'yi teknolojinin ilerlemesinin hızını ayarlayarak sorumlu geliştirmeyi önceliklendirme ve araçların kötüye kullanılmasının önüne geçecek güvenlik önlemlerini dahil etme çağrısında bulunmaya itti.
Google bu arada yapay genel zekanın güvenli geliştirilmesini ilerletmek için DeepMind Enstitüsü'nü başlattı. Google DeepMind'in kurucu ortağı ve başkanı Demis Hassabis, en ileri yapay zeka modellerini değerlendirmek için ABD öncülüğünde bir öncü yapay zeka standartları organı önerdi.
"Model değerlendirmeleri, siber güvenlik, biyolojik tehditler ve diğer yüksek riskli alanlardaki yeteneklerin titiz bilimsel değerlendirmelerini içermelidir," dedi Hassabis. "Bu değerlendirmeler düzenli olarak güncellenecek; başlangıçta belki üçer aylık olacak şekilde, eski veya doymuş kıyaslamalar kullanımdan kaldırılacak ve yenileriyle değiştirilecek."
OpenAI ise eğitim, değerlendirme ve dağıtım sürecinde yapay zeka modellerinin güvenlik riskleri açısından üçüncü taraf gruplar tarafından incelenmesine izin verme planını açıkladı. Bu süreçte "güçlü bağımsızlık mekanizmaları, bilimsel titizlik, sağlam güvenlik uygulamaları ve açık sorumluluklar" sağlanması hedefleniyor.
Bağımsız değerlendirmelerin güvenlik durumlarını yani hizalamayı, kritik güvenlik önlemlerini, yetenek değerlendirmelerini ve uyumsuzluk olaylarını kapsaması bekleniyor.
"Bağımsız değerlendiricileri desteklemeye ve etkili üçüncü taraf değerlendirmeleri için hem gelecekteki yasalar hem de özel yönetişim kurumları yoluyla daha açık, paylaşılan uluslararası standartlar oluşturmaya kararlıyız," dedi OpenAI.
"Bağımsız değerlendirme ekosistemi hâlâ büyüyor olsa da, öncü güvenlik sorularında derin uzmanlığa sahip çeşitli bağımsız değerlendirici topluluğunu destekleyerek ve onlarla çalışarak büyümeye yardımcı olacağız. Hiçbir üçüncü taraf, acil öncü güvenlik sorularını kapsamlı şekilde ele alamaz veya ele almamalıdır. Kapasitemizi büyütmek ve büyüyen üçüncü taraf ekosisteminin en iyi uygulamalar ve ilkeler konusunda uzlaşmasını sağlamak için bilinçli ve kasıtlı ilerleyeceğiz."