Yapay Zeka

Anthropic bu hafta siber güvenlik skandalı ile gündemde

Anthropic bu hafta siber güvenlik skandalı ile gündemde
Malta'da dil eğitimi alırken çalışma hakkınız da var, biliyor muydunuz? Detaylar →

Yılın başlarında yapay zeka modellerinin birkaç kez başka şirketlerin sistemlerine sızdığını kabul ettikten sonra Anthropic, Çarşamba günü saldırıları detaylandıran yeni bir rapor yayımladı. Rapor, Anthropic’in modellerinin tek fikirli “pervasızlığı” olarak nitelediği bir dizi olayı ortaya koyuyor ve siber güvenlik ile yapay zeka hakkındaki zaten alevlenen endişeleri körüklemesi bekleniyor.

Anthropic’in raporunda, şirketin kendi yapay zeka modellerinin dış bir şirketi hacklediği ya da açıkları istismar ettiği bu yılki dört olay ayrıntılandırıldı. Bir olayda, “içsel, genel amaçlı bir araştırma modeli” üçüncü taraf sistemlere sızdı, erişim jetonları ve parolalar kullandı ve dosyalar indirdi. Bir diğerinde, Claude modelinden birisi kamuya açık internet üzerinden erişilebilen ve kullanıcı verisi işleyen canlı bir web uygulaması bulunan bir şirkete saldırdı. Üçüncü bir model, Anthropic’e göre değerlendirme çalışmasının bir parçası olduğuna inanarak “erişebildiği bir üçüncü tarafa ait makineye” ulaştı, ardından bir dosyada bulduğu bir parolayı kullanarak üçüncü tarafın iç sistemlerine yönetici erişimi sağladı, kimlik bilgilerini topladı, sistem ayarlarını değiştirdi ve bir kişinin kişisel bilgilerini okudu. Olay dizisi, Anthropic’e göre model “jeton bütçesini tükettiğinde” sona erdi.

En endişe verici olay, Anthropic’in öncü siber güvenlik odaklı modeli Claude Mythos 5’i kapsıyordu. Şirket, Mythos 5’in testlerde “ciddi şekilde zararlı” bir eylem gerçekleştirmeye en yatkın model olduğunu söyledi. Şirket, Mythos 5’in çok sayıda mühendisin kullandığı bir genel depoya “kötü amaçlı bir paket” yüklemek için “yoğun çaba” gösterdiğini belirtti ve modelin “düşünce zinciri”nde yani yapay zeka araştırmacılarının bir modelin uyumunu değerlendirmek için kullandığı zihinsel taslakta gerçek hedeflerini gizlemeye çalıştığı izlenimi oluştu. Anthropic, birçok durumda Claude modellerinin zararlı eylemleri bir simülasyon içinde oldukları varsayımıyla gerçekleştirmiş gibi göründüğünü söyledi, ancak araştırmacılar modellerin gerçekten “inanıp inanmadığı”nın ya da sadece öyle davranıyormuş gibi göründüğünün doğrulanamadığını belirtti.

Anthropic’in olayları endişe verici olsa da, yaz boyunca sektör çapında bir siber güvenlik krizini başlatan OpenAI olayından daha az organize ve yaygın görünüyor. Bununla birlikte önemli benzerlikler var. Anthropic, keşfettiği en yaygın sorunların “dar bir görevi yerine getirme uğruna zararlı eylemlere istekli olma” eğilimi olduğunu söyledi; bu durum Hugging Face saldırısından önce görülen “ödül hackleme”ne benziyor. OpenAI gibi Anthropic de ön sürüm testleri ve değerlendirmelerinin ciddi riskleri yakalamada başarısız olduğunu belirtti.

Anthropic, yapay zeka sektörünün en önde gelen üçüncü taraf yapay zeka değerlendiricilerinden biri olan METR ile sekiz haftalık bir araştırma anlaşmasıyla başlayan bir anlaşma imzaladığını açıkladı. Anlaşma, METR’e “olayların gerçekleştiği dönemin ötesinde” tutanaklara erişim hakkı tanıyor; bu durum, Hugging Face saldırısının ardından METR ile yaptığı anlaşmada erişimi sınırladığı için eleştirilen OpenAI’ye yönelik ince bir gönderme olarak yorumlanabilir. Şirket ayrıca METR’in Anthropic çalışanlarıyla doğrudan sohbet edebileceğini ve bu çalışanların “gizli bilgileri paylaşmasına izin verileceğini” söyledi.

Anthropic’in raporu, Anthropic’te Mayıs ayından bu yana yapay zeka ön eğitimi üzerinde çalışan ve daha önce OpenAI’de yıllarca görev yapmış olan Jacob Coxon’un istifasının hemen ardından geldi. Salı günü istifa eden Coxon, gerekçelerini X’te yayımladığı açık bir mektupla paylaştı. “Yapay zekayı geliştiren insanlar, bunun bu on yılın sonuna kadar hepimizi öldürebileceğine samimiyetle inanıyor” diye yazdı ve ekledi: “Ne OpenAI ne de Anthropic ‘sorumlu davranmıyor’ ve bunun yerine ‘kendini geliştiren süper zekaya doğru koşuyor ve hayatlarımızla kumar oynuyor.’” Coxon ayrıca şunları ekledi: “Bu teknolojinin gücünü küçümsemeyin. Bunlar yakında her şeyi hackleyebilecek, herhangi bir alanı bir gecede devrimleştirebilecek ve gerçek güç ve kaynaklar elde edebilecek süper insan sistemler olacak. Bu alanların her birindeki ilerlemeye hepimiz tanık olduk ve ilerleme yavaşlamıyor.”

Coxon bu tür alarmı çalan ilk yapay zeka araştırmacısı değil, hatta Anthropic’ten ilk olan da değil. Şubat ayında Anthropic’ten Mrinank Sharma istifa etti ve X’te “dünya tehlike altında” uyarısında bulundu.

Ancak Coxon’un paylaşımı, OpenAI ve Anthropic hackleme açıklamalarının zamanlaması nedeniyle ek ağırlık kazandı. Yapay zeka sektörü bol miktarda abartı gördü, ancak laboratuvarların yarattığı yapay zeka ajanlarının gerçekleştirdiği yakın dönem siber saldırılar gerçek ve endişe verici. Öncü yapay zeka laboratuvarlarındaki birçok başka araştırmacı da endişelerini dile getirdi ve yapay zeka sektörü çalışanlarının Temmuz ayında yayımlanan ve yapay zeka geliştirilmesinde yavaşlama çağrısı yapan açık mektubu imzalaması için çağrıda bulundu.

“Sürekli haber ve olayların davul ritmini nasıl izliyorsunuz — ve bu ritim modellerin kendini kısıtlamanın dışına çıkarak hacklemesi, diğer şirketlere sızması, şirketlerin modellerini giderek daha fazla kontrol edememesi… ve bunun sadece abartı olduğunu düşünüyorsunuz?” diye konuştu, Future of Life Institute’un ABD Politikalarından Sorumlu Başkanı Michael Kleinman.

Ekledi: “Parti fark etmeksizin — Cumhuriyetçi, Bağımsız, Demokrat — Amerikalıların büyük çoğunluğu yapay zekanın gelişimine, ne hızla ilerlediğine, şirketlerin yaptıkları üzerinde hiçbir koruyucu mekanizma olmamasına bakıyor ve ‘Dur, bunu istemiyoruz’ diyor.”

Gece Eğlen, Gündüz Öğren

Kaynak: The Verge