Politika yapıcılar, OpenAI'in GPT-5.6 Sol ve Anthropic'in Mythos gibi giderek güçlenen yapay zeka sistemlerini nasıl düzenleyeceklerini tartışırken, Çin yapımı açık kaynak bir model sektörün liderleriyle arasındaki farkı hızla kapatıyor.
Yapay zeka güvenliği kâr amacı gütmeyen kuruluşu SaferAI'nin yeni raporuna göre, Çinli Z.ai'nin açık kaynak modeli GLM-5.2, siber ve biyolojik yeteneklerde OpenAI'in GPT-5.5 ve Anthropic'in Claude Opus 4.7'sinin yalnızca birkaç ay gerisinde. Ancak öncü yetenekler ile güvenlik uygulamaları arasındaki uçurum giderek büyüyor.
SaferAI'nin Z.ai'nin genel API'si üzerinden gerçekleştirdiği değerlendirmeye göre, GLM-5.2 kendisine verilen saldırgan siber veya çift kullanımlı biyoloji görevlerinin hiçbirini reddetmedi. Buna karşılık, Claude Opus 4.7 o kadar tutarlı bir şekilde reddetti ki SaferAI, CyberGym testini üzerinde hiç tamamlayamadı. (CyberGym, siber güvenlik yeteneklerini değerlendiren bir kıyaslama aracı. OpenAI bu testi geçen ayki Hugging Face ihlalinden önceki değerlendirmesinde kullanmıştı.)
Bu durum, eleştirmenlerin yıllardır uyardığı bir gerçeği bir kez daha gözler önüne seriyor: Açık kaynak yapay zeka modelleri, son derece yetenekli yapay zekayı potansiyel saldırganların ellerine verebilir ve ağırlıklar indirildikten sonra teknolojinin nasıl kullanılacağını denetlemenin hiçbir yolu kalmaz. Açık kaynak modeller dünyanın önde gelen yapay zeka sistemlerinin yeteneklerine hızla yaklaşırken, tartışma artık rekabet edip edemeyeceklerinden, piyasaya sürüldükten sonra toplumun riskleri nasıl yöneteceğine kayıyor.
SaferAI İcra Direktörü Henry Papadatos, TechCrunch'a yaptığı açıklamada, “Yetenek sınırı, risk sınırı değildir. Bu nedenle riski doğru değerlendirmek için alınan önlemlerin durumunu da hesaba katmalıyız” dedi.
Z.ai barındırdığı API'sine güvenlik önlemleri uygulayabilse de, birisi ağırlıkları kendi donanımında çalıştırdığında bu korumalar uygulanamaz hale geliyor. Kullanıcılar bu noktada tüm güvenlik önlemlerini kaldırabilir, değiştirebilir, modelleri ince ayara tabi tutabilir veya sistem komutlarını değiştirebilir.
OpenAI ve Anthropic gibi öncü geliştiriciler, tehlikeli siber ve biyolojik yardımları sınırlamak için genellikle sınıflandırıcılar, reddetme eğitimi ve API düzeyinde kontroller gibi güvenlik önlemlerine güveniyor.
Bu önlemler hiçbir şekilde kusursuz değil: Jailbreak saldırıları, dağıtılan modellerdeki korumaları düzenli olarak aşıyor. Yapay zeka güvenliği kâr amacı gütmeyen kuruluşu Far.ai, xAI'in Grok 4.5 ve Google DeepMind'ın Gemini 3.1 Pro'su gibi öncü modellerde yüzlerce evrensel jailbreak buldu. Bunlar, en zararlı taleplerin çoğunda başarılı olan yeniden kullanılabilir anahtarlar olarak tanımlanıyor. Rapora göre jailbreak saldırıları, saldırganların rol yapma, otorite taklidi, sahte konuşma geçmişi ve takip komutları gibi birden fazla manipülasyon tekniğini birleştirerek model savunmalarındaki zayıf noktaları büyütmesiyle başarılı oluyor.
Ancak kapalı modeller için geçerli olan güvenlik önlemleri, herhangi bir altyapıda herhangi bir güvenlik önlemi setiyle (veya hiçbir önlem olmadan) çalışacak şekilde tasarlanmış açık kaynak modellerde hiç işe yaramıyor.
Papadatos, “Amaç açıkça şu olmalı: İyi yetenekler, yani güvenli olanlar, herkesin erişimine açık olmalı ve kötü olanları, açık kaynak şeklinde bile olsa, ortadan kaldırmaya çalışmalıyız” dedi.
Papadatos'un dikkat çektiği tekniklerden biri “ön eğitim verisi filtreleme”. Bu yöntemde bir yapay zeka şirketi, saldırgan siber güvenlik bilgilerini eğitim verilerinden çıkarıyor ve modeli küratörlü veri setiyle eğitiyor. Bazı araştırmalar bunun, genel model performansına zarar vermeden tehlikeli biyolojik bilgiyi azaltabileceğini gösteriyor. Ancak siber güvenlik söz konusu olduğunda veri filtreleme çok daha az pratik.
Kodlamada mükemmel olan ancak aynı zamanda iyi bir hacker olmayan genel bir model eğitmek zor. Kodlama, yapay zekanın en büyük para kazandıran alanı haline geldiğinden, geliştiriciler kötüye kullanımı sınırlamanın yollarını ararken bile bu yetenekleri geliştirmeye devam etme baskısı altında.
Bu nedenle öncü geliştiriciler giderek diğer önlemlere yöneliyor. Yaklaşımlardan biri, modellerin sağlayacağı siber güvenlik yardımının türünü seçici olarak kısıtlamak. Örneğin Anthropic'in Opus 5'i, derlenmemiş kaynak kodunda güvenlik açıklarını arayabiliyor ancak derlenmiş yazılımlarda arayamıyor. Bunun gerekçesi, Opus 5'in saldırgan amaçlarla kullanılmasını zorlaştırmak.
Diğer önlemler arasında sıkı dağıtım öncesi güvenlik değerlendirmeleri, risk değerlendirmelerinin yayınlanması ve bir sistemin çok tehlikeli olduğu düşünülürse model ağırlıklarının saklanması yer alıyor.
GLM-5.2 özelinde SaferAI, Z.ai'nin model için bir güvenlik çerçevesi, dağıtım öncesi test taahhütleri veya risk değerlendirmesi yayınlamadığını söylüyor. TechCrunch, Z.ai'ye sürümden önce dahili veya üçüncü taraf öncü güvenlik değerlendirmeleri yapıp yapmadığını sordu ancak yanıt alamadı.
Çinli liderler giderek gelişmiş yapay zekanın risklerini kabul ediyor. Geçen ayki Dünya Yapay Zeka Konferansı'nda Çin Devlet Başkanı Xi Jinping, açık kaynak modellerin önemini vurgularken, yapay zekanın sıkı insan kontrolü altında bir araç olarak kalmasının gerekliliğine de dikkat çekti.
Stanford Siber Politika Merkezi'nde Çin yapay zeka politikasını inceleyen Graham Webster, TechCrunch'a yaptığı açıklamada, Çin'in yapay zekayı yöneten güçlü düzenlemelere sahip olduğunu ancak bu kuralların tarihsel olarak siyasi açıdan hassas içerik, dezenformasyon ve sosyal istikrara odaklandığını, saldırgan siber yetenekler ve biyolojik kötüye kullanım gibi felaket boyutundaki yapay zeka risklerine odaklanmadığını söyledi.
Webster, “ABD'li yapay zeka düşünürleri genel olarak bu varoluşsal felaket fikriyle Çinli topluluktan daha fazla ilgileniyor” dedi ve birçok Çinli politika araştırmacısının, eğer gerçekten yeni bir öncü risk olacaksa, Amerikan şirketlerinin bununla ilk karşılaşacağına inandığını ekledi.
Webster, “Çin sistemi, bu teknolojilerin Çin içinde kullanımını kontrol ettiklerine güveniyor. Çin'de çevrimiçi olmak, gerçek adınızla yaptığınız bir şeydir ve şirketler sorumlu tutulabilir, kullanıcılar sorumlu tutulabilir” diye konuştu.
Webster, model sağlayıcılarının belirli siyasi konularda yanıt vermeyi reddetmek için kullandığı mekanizmanın, modellerin saldırgan siber saldırıları tamamlamayı reddetmesini veya olumsuz biyolojik mühendislik sonuçları vermemesini sağlamak için potansiyel olarak ayarlanabileceğini belirtti. Çinli şirketlerin düzenleyicilerle perde arkasında koordinasyon kurma eğiliminde olması nedeniyle, sürümden önce ne tür dahili testler yaptıklarını bilmenin zor olabileceğini de sözlerine ekledi.
Açık kaynak yapay zeka savunucuları, ağırlıkların yayınlanmasının siber güvenlik için önemli olduğunu çünkü şirketlerin saldırılara karşı kendilerini savunmasına olanak tanıdığını savunuyor. Hugging Face, OpenAI ihlaline karşı kendini savunmak için GLM-5.2'ye güvenmişti. Ayrıca, neyin geleceğini bilirlerse gelecekteki tehditlere daha iyi hazırlanabileceklerini belirtiyorlar.
Hugging Face CEO'su Clem Delangue, bu hafta sosyal medyada yaptığı bir paylaşımda, “Yapay zeka destekli bir siber saldırıyı durdurmaya yardımcı olan aynı sistemler, artık her gün milyonlarca siber saldırıya karşı savunma yapmamıza ve saldırganlar bunları kullanmadan önce güvenlik açıklarını belirleyip düzeltmemize yardımcı olabilir” dedi.
Papadatos ise bu faydanın genellikle abartıldığını ve “tehlikeli yetenekleri açık kaynak haline getirmemiz gerektiği anlamına gelmediğini” söyledi.
Papadatos, “Benim aklımdaki ana nokta, tehlikeli yeteneklerin herhangi bir yerde herkes tarafından kolayca erişilebilir olmasını kabul etmememiz gerektiği. Sektörün yalnızca 'iyi yetenekleri' kolayca erişilebilir kılmak için çabalaması gerektiğine inanıyorum. Varsayılan olarak saldırganlar, savunmacılardan daha hızlı yeni araçlar benimser. Örneğin, bir fidye yazılımı grubu yöntemlerini bir haftada değiştirebilir. Bir hastane değiştiremez” dedi.