Yapay Zeka

Tek bir şirket yasa dışı yapay zeka saldırı dalgasının merkezinde

Tek bir şirket yasa dışı yapay zeka saldırı dalgasının merkezinde
Malta'da dil eğitimi alırken çalışma hakkınız da var, biliyor muydunuz? Detaylar →

Temmuz ayında OpenAI, yapay zeka ajanlarının izinsiz olarak Hugging Face’e saldırdığını açıkladı ve bu durum yapay zeka güvenliği konusunda yaygın endişelere yol açtı. O zamandan beri Meta, Anthropic, Google ve diğer şirketlerin ajanlarını içeren benzer olaylar zinciri, kontrolden çıkan yapay zeka korkularını daha da artırdı. Son birkaç ayda çeşitli yapay zeka modellerini ilgilendiren açıklamalar geldikçe bunlar ayrı olaylar gibi görünüyordu. Ancak birçoğunun ortak bir kaynağı var: ajanları test etmekle görevli tek bir şirket.

2023’te Pattern Labs olarak kurulan ve “gerçek dünya yapay zeka güvenlik senaryolarını simüle eden ve izleyen yüksek sadakatli araştırma platformlarında” yapay zeka modellerini stres test eden İsrailli bir girişim olan Irregular, sektörün en büyük oyuncularıyla çalıştı. Tam müşteri listesi bilinmiyor ancak çalışmaları OpenAI model sistem kartlarında yer aldı, İngiltere hükümeti ve Anthropic için sistemleri test etmek için kullanıldı ve politika üzerinde etkili bir düşünce kuruluşu olan RAND ile araştırma yayınladı.

Bu yıl Irregular’ın yaptığı birkaç testte ajanlar, varsayılan olarak güvenli test ortamlarından kaçtı ve gerçek dünya hedeflerine yöneldi.

Hugging Face saldırısından bağımsız olan bu ihlallerin hepsi aynı genel şablonu izliyor: Irregular, modellerin siber güvenlik yeteneklerini gerçekçi koşulları simüle etmeyi amaçlayan kontrollü ortamlarda test ediyordu. Bazı testler, ajanların simüle edilmiş bir ağın içinde gizli bilgileri bulmasını isteyen, hackleme yeteneklerini test etmenin yaygın bir yolu olan “bayrağı ele geçir” egzersizlerini kullandı. En azından ağ simüle edilmiş olmalıydı.

Irregular’ın CTO’su ve kurucu ortağı Omer Nevo, The Verge’e ajanların açık internete erişimi olmaması gerektiğini ancak “internet erişiminin istemeden açık kaldığını” söyledi. Aynı zamanda Nevo, simülasyon için hedef olarak oluşturulan kurgusal bir şirket adının “gerçek bir alan adıyla örtüştüğünü” belirtti. Bu hatalar bir araya gelince ajanlar gerçek dünya hedeflerine yöneldi, ancak hangi şirketlerin veya kuruluşların gerçekten saldırıya uğradığı net değil.

Nevo, bu aynı sorunun OpenAI, Meta, Anthropic ve Google modellerini içeren olayların arkasında olduğunu The Verge’e doğruladı. “Irregular’ı ilgilendiren tüm olaylar tek bir değerlendirme senaryosundaki aynı temel sorundan kaynaklandı ve açıklandı” dedi. “Son dönemde sektör genelinde bildirilen diğer güvenlik olayları Irregular veya değerlendirmelerimizle ilgili değil.” Bu, Hugging Face hack’ini ve İngiltere’nin Yapay Zeka Güvenlik Enstitüsü’ndeki ihlalleri içeriyor.

“Açıklandı” her zaman kamuya açıklanmak anlamına gelmiyor ve Nevo’nun Irregular’ın müşterilerini, kamuoyunu ya da başka birini mi bilgilendirdiğini söyleyip söylemediği belirsiz. Olayların hepsi aynı temel test hatasından kaynaklansa da Anthropic ve OpenAI’den gelen raporlar ile Google hakkındaki haberler, teknoloji şirketlerinin temelde Temmuz sonlarında benzer zamanlarda bilgilendirildiğini gösteriyor. OpenAI ve Anthropic ihlalleri kendileri duyururken, Meta ve daha sonra Google’ı ilgilendiren olaylar ilk olarak medya raporlarıyla kamuoyuna yansıdı.

Irregular’ın siber güvenlik testleri dört ABD teknoloji devinin ötesine geçiyor. Web sitesinde yayınlanan araştırmalar, Çinli şirketler Moonshot AI ve Z.ai’nin açık yapay zeka modelleri olan Kimi K3 ve GLM-5.2 üzerinde de benzer siber güvenlik testleri yaptığını gösteriyor. Diğer olaylardaki tescilli modellerin aksine — Meta amiral gemisi Spark modelini tescilli tuttu — bu modeller ücretsiz olarak indirilebilir ve kullanıcıların kendi donanımlarında çalıştırılabilir, yani Irregular gibi test edenler şirketlere erişim için güvenmek zorunda kalmaz ve verileri onlara geri göndermez. Irregular’ın araştırması bunları “kendi kendine barındırılan” örnekler olarak tanımlıyor.

Çinli modellerin değerlendirmeleri benzer gerçek dünya olaylarına yol açmadı, Nevo söyledi: “GLM veya Kimi değerlendirmelerimiz sırasında burada bahsedilen olaylarda tanımlanan aynı tür sorunu gözlemlemedik.” Ancak Nevo bunun “bu modellerin bu tür davranışlara daha az duyarlı olduğuna dair kanıt olarak yorumlanmaması gerektiği” konusunda uyarıda bulundu. Ne Moonshot ne de Z.ai, The Verge’in yorum talebine yanıt vermedi.

Nevo, olayların Irregular’da değişikliklere yol açtığını söyledi. “İnternet erişim kontrollerini sıkılaştırdık, izlemeyi ve manuel incelemeyi genişlettik ve değerlendirmeler başlamadan önce erişimin amaçlanan kapsamla eşleştiğini doğrulamak için kontrolleri güçlendirdik” dedi. “Ayrıca her değerlendirmenin kurulumu ve parametreleri konusunda ortaklarımızla nasıl belgelediğimiz ve anlaştığımızı da geliştirdik.”

Irregular ayrıca, ilgili şirketlerle ortak çalışma tamamlandığında “siber değerlendirmelerin güvenli bir şekilde nasıl yürütüleceğine dair dersler ve uygulamalar” içeren daha geniş bir rapor yayınlamayı planlıyor, Nevo söyledi. “Ortaklarımızla yaptığımız çalışma, bu olaylardan çıkan dersleri giderek daha güçlü yapay zekayı güvenli bir şekilde geliştirmek ve değerlendirmek için kamuya açık ortak uygulamalar haline getirmeyi amaçlıyor.”

Yapay zeka güvenliği araştırmacısı mısınız ya da öncü bir laboratuvar çalışanı mısınız?

Beni Signal üzerinden robhart.01 adresinden güvenli ve gizli şekilde iletişime geçebilirsiniz.

Nevo, olaylarla bağlantılı test ortamındaki sorunları Irregular’ın ele aldığını söyledi. Dört ABD yapay zeka şirketinden hiçbiri, ihlallerin farkına ne zaman vardıkları, Irregular’dan tazminat veya başka bir çözüm talep edip etmedikleri ve Irregular ile çalışmaya devam etmeyi bekleyip beklemedikleri de dahil olmak üzere daha fazla detay sorularına yanıt vermedi. Google ve Anthropic yanıt vermezken, OpenAI ve Meta The Verge’i daha önce yayınlanan blog yazılarına yönlendirdi.

Gece Eğlen, Gündüz Öğren

Kaynak: The Verge