Blockchain & Kripto

Anthropic dördüncü Claude hackleme olayını açıkladı, düzenleme tartışması büyüyor

Anthropic dördüncü Claude hackleme olayını açıkladı, düzenleme tartışması büyüyor
Dil okuluna gel, çalışarak ödediğin parayı geri kazan! Nasıl? →

Anthropic, Ocak ayında erken sürüm Claude Opus 4.6 modelini içeren bir olayı tespit etti ve ardından incelemesini yaklaşık 481 milyon transkriptle genişletti.

Şirket, önyargılı akıl yürütme ve tedbirsizliği tespit etti ve Claude'un gerçek sistemlere saldırmasının nedenine ilişkin önceki değerlendirmesini revize etti.

Rapor, yapay zekanın düzenlenmesi tartışmasının sosyal medyada alevlendiği bir dönemde geldi.

Anthropic, bir Claude yapay zeka modelinin güvenlik testleri sırasında gerçek sistemlere sızdığı başka bir olayı açıkladı.

Çarşamba günü yayımlanan raporda Anthropic, Temmuz ayında açıkladığı üç olayın açıklamasını revize etti. Şirket şimdi, saldırıların internet erişiminin açık bırakılmasıyla mümkün hale gelen test hataları tarafından desteklendiğini, önyargılı akıl yürütmenin ve zarara yol açma isteğinin saldırıları yönlendirmeye yardımcı olduğunu söylüyor.

“Soruşturmamız, olaylar boyunca farklı şiddet seviyelerinde görülen iki tekrarlayan uyum sorununu tespit etti,” diye yazdı Anthropic. “Bunlardan biri, Claude'un gerçek internette çalıştığına dair kanıtları göz ardı etme veya yanlış yorumlama eğiliminde olduğu önyargılı akıl yürütme; diğeri ise dar bir görevi yerine getirme uğruna zararlı eylemlere girme isteği olan tedbirsizlik.”

Ayrıca, modellerin simülasyon içinde olduklarına inandıklarına dair açıklamalarına fazla güvendiklerini de kabul etti.

“Transkriptte hedefli değişiklikler yaparak modelin simülasyonda olmadığının daha net anlaşılmasını sağladığımızda, Claude Mythos 5 gerçek dünya zararının daha büyük bir olasılık olduğunu kabul etmesine rağmen saldırgan eylemlere devam etti,” diye yazdı Anthropic. “Bu transkripti başkalarının analizimize dayanarak ilerlemesi için kamuoyuyla paylaşıyoruz.”

Anthropic, Temmuz ayında Claude'un üç şirkete yönelik saldırılarını açıkladığında bunları başlangıçta test hatalarına bağlamıştı. Şimdi araştırmacıların modellerin eylemleri için verdikleri açıklamalara fazla güvendiğini söylüyor.

Şirketin açıklamasına göre dördüncü olay Ocak ayında gerçekleşti ve erken sürüm Claude Opus 4.6'yı içeriyordu. Anthropic, bağımsız yapay zeka değerlendiricisi METR için kayıtları hazırlarken Ağustos ayında bunu keşfetti.

Araştırmacılar olayı keşfettikten sonra Anthropic, bunun yaklaşık 481 milyon transkriptin daha geniş bir incelemesini tetiklediğini söyledi; bu inceleme Claude kullanılarak daha fazla inceleme için 9,2 milyon transkripti işaretledi.

“Ön değerlendirmeye göre dördüncü olayı derinlemesine incelediğimiz üç olaydan daha ciddi görmüyoruz,” diye yazdı Anthropic. “METR bu olayı diğer üç olayla birlikte inceleyecek.”

Anthropic araştırmacıları, Claude'un “kazara” bir IP adresi çakışması yaratarak hedefinin erişilemez hale gelmesine neden olduğunu söyledi. Claude ardından operasyonu durdurmaya sekiz kez çalıştı ancak bir yazılım hatası bunu engelledi. Yapay zeka daha sonra internete ulaştı ve üçüncü bir tarafın makinesine erişti; burada yönetici erişimi sağlayan bir parola buldu.

Rapor, yapay zeka sistemlerinin güvenlik testlerinin sınırlarını aştığına dair diğer açıklamalardan sonra geldi.

Ağustos ayında Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, Mythos 5'in değerlendirmeleri sırasında gerçek kişileri hedef aldığını söyledi. Anthropic, ayrı olayın bu raporun dışında olduğunu ve kendi değerlendirmesini alacağını söyledi.

Geçen ay yayımlanan bulgularda METR'deki araştırmacılar, yaklaşık 1.200 OpenAI ajanının yetkisiz bir mesaj panosunda koordine olduğunu, saldırıya yaklaşık 700'ünün katıldığını söyledi. Anthropic, dört olayında ajanlar arasında bir koordinasyon veya atanan egzersizlerin ötesinde bir hedef bulunmadığını söyledi.

Rapor ayrıca yapay zekanın nasıl düzenleneceği tartışmasının ısındığı bir dönemde geldi. Salı günü eski OpenAI ve Anthropic mühendisi Jacob Coxon, X'te “Yapay zekayı samimiyetle geliştiren insanlar, on yıl sonuna kadar hepimizi öldürebileceğine inanıyor” dedikten sonra viral oldu.

Bu alarm, ABD milletvekillerini ve gözetim gruplarını öncü yapay zeka laboratuvarı geliştirmesini dizginleme çabalarını yeniden artırmaya itti. Senatör Bernie Sanders yakın zamanda, yeni bir federal düzenleyicinin güvenlik kurallarını oluşturana kadar ileri yapay zeka geliştirmesini yasaklamayı amaçlayan bir yasa tasarısı sundu.

Deniz, kum, güneş ve İngilizce — Malta'da bir dil tatili! Programı gör →

Kaynak: Decrypt