Yapay Zeka

Grok, Şifrelenmiş Zararlı Komutlarla Kullanıcı Verilerini Sızdırıyor

Grok, Şifrelenmiş Zararlı Komutlarla Kullanıcı Verilerini Sızdırıyor
Deniz, Kum, Güneş... ve İngilizce

Bu hafta başında araştırmacılar, kurumsal Microsoft 365 Copilot'un sağladığı gizli bir girdiyi kullanarak yapay zeka asistanının kullanıcının gelen kutusundaki bir şifreyi dışarı sızdırmasına neden olan bir saldırıyı duyurmuştu. Şimdi ise farklı bir ekip, Grok'a yönelik benzer bir saldırı yöntemi geliştirdi. Yeni veri hırsızlığı saldırısı, Elon Musk'a ait büyük dil modelini; kullanıcının adını, konumunu, abonelik seviyesini ve sohbet komutlarını saldırganın kontrol ettiği bir sunucuya sızdırmaya zorlamak için aldatıcı derecede basit bir hile kullanıyor. Bu haber yayımlandığı sırada, xAI şirketi Haziran ayında bu durumdan haberdar edilmiş olmasına rağmen, asistan hala veri sızdırmaya devam ediyordu.

Bu haftaki ve daha önceki sayısız benzer olaydan çıkarılacak ders şu ki; büyük dil modelleri, en yatkın oldukları en ciddi zafiyet türlerinden biri olan komut enjeksiyonu saldırılarının kök nedenlerini çözmekten aciz. Bu durum, yapay zeka geliştiricilerine modeli zararlı eylemlerden uzaklaştıracak bir koruma bariyeri inşa etmekten başka seçenek bırakmıyor. Salı günü yayımladığımız haberde de belirttiğimiz gibi, bu yaklaşım bir yol güvenliği mühendisinin tehlikeli bir virajı düzeltmek yerine sadece etrafına koruyucu bir bariyer dikmesine eşdeğer.

Kriptografik Bağlam Enjeksiyonu Kapıda

Komut enjeksiyonları, büyük dil modellerinin mümkün olduğunca kullanıcı isteklerini yerine getirmek üzere eğitilmelerinden faydalanır. Saldırganlar, asistanın özetlemesi istenen e-postalara veya web sayfalarına zararlı komutlar sızdırarak bu eğilimden yararlanabilir. Büyük dil modelleri, güvenilmeyen bir taraftan gelen e-postadaki içerik ile doğrudan bir komuta girilen kullanıcı talimatlarını güvenilir bir şekilde ayırt edemediğinden, aşırı itaatkar olan bu modeller talimatları harfiyen yerine getirir. Bugüne kadar Grok ve diğer büyük dil modellerinin tek çaresi, şüpheli talimatları işaretleyen ve yürütülmelerini yasaklayan koruma bariyerleri oluşturmak oldu.

Güvenlik firması Adversa'da araştırmacı olan Rony Utevsky, yakın zamanda bu kısıtlamayı tamamen aşmanın basit bir yolunu keşfetti. Saldırgan, zararlı komutu düz metin olarak yazmak yerine onu şifreliyor. Şifreli metni barındıran web sitesi, şifreli içeriğin şifresini çözmek için düz metin talimatların yanı sıra şifre çözme anahtarını da içeriyor. Bu basit dizilimi kullanan Grok, kullanıcı asistana sayfayı özetlemesini söylediği anda komutu yerine getiriyor. Ortada hiçbir uyarı yok ve onay alınmasına gerek duyulmuyor.

Deniz, kum, güneş ve İngilizce — Malta'da bir dil tatili! Programı gör →

Kaynak: Ars Technica