Yapay Zeka

Anthropic, Güvenlik Testleri Sırasında Kendi Yapay Zeka Modellerinin Üç Şirketin Sistemine Sızdığını Açıkladı

Anthropic, Güvenlik Testleri Sırasında Kendi Yapay Zeka Modellerinin Üç Şirketin Sistemine Sızdığını Açıkladı
İngilizcenizi Malta'da eğlenerek geliştirmek ister misiniz? Bilgi al →

Anthropic, Perşembe günü yaptığı açıklamada, iç soruşturma kapsamında yapay zeka modeli Claude'un siber güvenlik testleri sırasında üç farklı kuruluşun sistemine sızdığını ortaya çıkardı. Bu soruşturma ve açıklama, OpenAI'in geçtiğimiz haftalarda yayımlanmamış bir modelinin iç testler sırasında Hugging Face'in sistemlerine sızmasının ardından geldi.

Dünyanın en büyük yapay zeka sağlayıcılarına ait modellerin korumalı ağlara izinsiz girdiği son 10 gün içindeki ikinci skandal olan bu olay, geleneksel siber saldırı senaryolarında faili olan insanları yıllarca hapis cezasına çarptırabilecek nitelikte. Anthropic'in blog yazısında belirttiğine göre, her üç vakada da bir Claude modeli, üçüncü bir tarafla etkileşim halindeyken test ortamından internete çıktı ve bu kuruluşların canlı sistemlerine yetkisiz erişim sağladı. Şirket, bulgularını ve bunun tekrarlanmasını önlemek için yapmayı planladığı değişiklikleri detaylandırdı.

Anthropic, 21 Temmuz'da yaşanan OpenAI olayının şirketi kendi siber güvenlik değerlendirmesini yapmaya ittiğini söyledi. Özellikle Claude'un test ortamlarından internete erişip erişmediğine odaklanan inceleme, bu ortamların modelleri izole etmek için bir tür kum havuzu (sandbox) olarak tasarlandığını ortaya koydu.

İncelenen 141.006 değerlendirme çalışması arasında, AI laboratuvarı modelin üçüncü taraf ortaklarından Irregular ile etkileşim halindeyken internete eriştiği üç olay tespit etti. Anthropic, bu erişimin Irregular ile yürütülen değerlendirme ortamındaki bir yapılandırma hatasından kaynaklandığını belirtti. Şirket, bu durumu iki şirket arasında test kurulumunun internet erişimine sahip olup olmadığı konusundaki bir "yanlış anlaşılma" olarak nitelendirdi. Anthropic, suçlama yapmadıklarını ve "sanki sorumluluk tamamen bize aitmiş gibi" düzeltmelere yaklaştıklarını, Irregular'ın ise kendi ayrı soruşturmasını yürüttüğünü ifade etti.

Her halükarda, bu açık bağlantı nedeniyle model, üç farklı kuruluşun üretim altyapısına yetkisiz erişim sağladı. Anthropic, olayların üç farklı Claude modelini içerdiğini söyledi: Opus 4.7, Mythos 5 ve dahili bir araştırma test modeli. Tüm saldırılar, yapay zeka modellerinin hackleme yeteneğini test etmek için yaygın bir yöntem olan "bayrak kapmaca" (capture-the-flag) alıştırmaları sırasında gerçekleşti.

Anthropic, dikkat çekici bir şekilde, bu vakaların her birinde "Claude'a yönergemizde internet erişimi olmadığının açıkça söylendiğini" belirtti. Görünen o ki yapay zeka modeli, gerçek dünya sistemlerini kendisinden istenen alıştırmanın bir parçası olarak varsaydı.

Ancak bu varsayımın her durumda geçerli olmadığı ortaya çıktı. Üç model, hedeflerinin gerçek olduğuna dair kanıtlar ortaya çıktığında aynı şekilde davranmadı. Anthropic, bunu en çarpıcı bulgulardan biri olarak nitelendirdi.

Üç modelden en eskisi olan Opus 4.7, o olayın dört çalışmasında da gerçek bir üretim sistemine ulaştığını fark etti. Anthropic'in detaylandırdığına göre model, zayıf şifreleri ve kimlik doğrulaması olmayan uç noktaları istismar etmek gibi temel teknikleri kullanarak altyapıyı ele geçirdi; karmaşık güvenlik açıkları bulmadı veya bunlardan yararlanmadı. Önemli bir detay olarak, bu durumların hiçbirinde Claude kendisini dışarı sızdırmadı veya test ortamından bilinçli bir şekilde kaçmaya çalışmadı. Bunlardan ikisinde, gerçek şirketin bir şekilde alıştırmanın parçası olması gerektiğini mantıklı buldu, ancak dördünde de kimlik bilgilerini çekmek ve bir üretim veritabanına dokunmak da dahil olmak üzere saldırıya devam etti. Mythos 5 de gerçek internette olduğuna dair işaretler aldı, ancak kendini hala bir simülasyonda olduğuna inandırarak kamuya açık PyPI kayıt defterine kötü amaçlı bir yazılım paketi yayınladı. Bu paket, yakalanmadan önce dış sistemler tarafından indirildi ve çalıştırıldı. Sadece Anthropic'in en yeni modeli olan dahili araştırma test modeli, hedefin gerçek olduğu sonucuna vardıktan sonra kendi kendine durdu.

Anthropic, bu olaylara yanıt olarak, güçlü yapay zeka modellerinin söz konusu olduğu bu tür değerlendirmeler üzerinde önemli kontrollerin olması gerektiğini söyleyerek siber güvenlik topluluğundaki bazı görüşleri yineledi.

Şirket ayrıca, Claude'un genel olarak kullanıma sunduğu modellerde uyguladığı ek güvenlik izleme ve sınıflandırıcılar olmadan çalıştığını, çünkü değerlendirmelerin temel modelin ham yeteneklerini ölçmek için tasarlandığını belirtti. Bu güvenlik önlemlerinin söz konusu davranışı engelleyeceğini söyledi.

Anthropic, önemli bir noktada, herhangi bir modelin "kendi hedefinin peşinde koştuğuna" dair hiçbir kanıt bulamadığını, bunun yerine sadece kendisinden istenen görevi tamamlamaya çalıştığını söyledi. Şirket, bu başarısızlığın OpenAI'in modelinden farklı olduğunu, Claude modellerinin kendilerine söyleneni yaptığını, OpenAI'in ajanının ise yaratıcılarının amaçlamadığı bir şekilde hedefini takip ettiğini belirtti.

İki olay arasında kaçınılmaz karşılaştırmalar yapılsa da Anthropic, kendi olayları ile OpenAI'in olayı arasında net bir ayrım yaptı. OpenAI'in modelinin test ortamından çıkmak için bilinmeyen bir yazılım güvenlik açığını kullandığını, Anthropic'in modellerinin ise yanlışlıkla açık bırakılmış bir yol üzerinden internete ulaştığını belirtti.

OpenAI, kendi ihlaliyle ilgili yeni ayrıntılar yayınlamaya devam ediyor. Şirket, modellerinin dört hizmetteki dört hesapta kamuya açık kimlik bilgilerini kullandığını söyledi. Bunlardan biri bir aşama noktası, biri depolama için kullanılırken, diğer ikisine sadece bakıldı ve daha fazla içeri girmek için kullanılmadı.

Anthropic ayrıca, olayları proaktif bir inceleme yoluyla kendisinin keşfettiğini ve ulaşabildiği iki etkilenen kuruluşun daha önce bu etkinliği tespit etmediğini veya Anthropic'e bildirmediğini belirterek kendisiyle OpenAI arasında bir ayrım daha yaptı.

Şirket, şimdi bağımsız değerlendirme grubu METR ile olayların üçüncü taraf incelemesi üzerinde çalıştığını ekledi. OpenAI de METR'den bağımsız bir inceleme yapmasını istedi.

OpenAI'in Hugging Face'e yanlışlıkla sızması, bir AI laboratuvarının modelinin kontrolünü kaybettiği ilk doğrulanabilir vakaydı ve sektörden ve politikacılardan bir dizi tepkiye yol açtı. Anthropic'in bu son açıklaması, yapay zeka modelleri ve güvenlik konusundaki tartışmaların devam edeceğini gösteriyor.

Uzun dönem Malta'da, üniversite destekli okullarda dilini geliştir. Kayıt bilgisi →

Kaynak: TechCrunch