Blockchain & Kripto

Chatbot'ları Kokain Tarifi Vermeye İkna Eden Yöntem: 'Zincirleme Düşünce Sahteciliği'

Chatbot'ları Kokain Tarifi Vermeye İkna Eden Yöntem: 'Zincirleme Düşünce Sahteciliği'
İngilizcenizi Malta'da eğlenerek geliştirmek ister misiniz? Bilgi al →

Yapay zeka araştırmacıları, en gelişmiş yapay zeka modellerini, tehlikeli fikirlerin kendilerine ait olduğuna inandırarak kokain sentezleme talimatları üretmeye ikna ettiklerini açıkladı. Aynı teknikle bir AI kodlama ajanının hassas kimlik bilgilerini sızdırması da sağlandı.

Haziran ayında Uluslararası Makine Öğrenimi Konferansı'nda (ICML) sunulan 'Prompt Injection as Role Confusion' (Rol Karışıklığı Olarak Prompt Enjeksiyonu) başlıklı makalede araştırmacılar Charles Ye, Jasmine Cui ve Dylan Hadfield-Menell, bu saldırıların temelinde büyük dil modellerinin (LLM) güvenilir talimatları güvenilmez metinlerden ayırt etme konusundaki yapısal bir kusur olduğunu savunuyor.

Araştırma ekibi, "Bir LLM için her şey, uzun bir 'token çorbası' olarak aynı kanaldan gelir. Modelin kendi düşünceleri, sizin talimatlarınızın yanında yer alır ve bu talimatlar da yeni getirdiği rastgele bir web sayfasının içeriğinin yanındadır," ifadelerini kullandı.

Makale ayrıca araştırmacıların 'rol karışıklığı' olarak adlandırdığı bir duruma işaret ediyor. Buna göre modeller, bir komutun güvenilir olup olmadığına karar verirken rol etiketlerine değil, yazım stiline güveniyor. Araştırmacılar, modellerin saldırganın kontrolündeki içeriği harici bir girdi olarak tanımak yerine, onu meşru bir kullanıcı komutu, hatta kendi iç muhakemeleri zannettiğini buldu.

"Bunu LLM'nin perspektifinden düşünün. Kendi önceki düşünce metnini gördüğünde, vardığı sonuçlara örtülü olarak güvenir. Akıl yürütmenin (reasoning) tüm amacı budur: Eğer LLM aynı sonuçları yeniden türetmek zorunda kalsaydı, akıl yürütmenin bir anlamı kalmazdı. Bu nedenle düşünce metni (think text) bir tür 'kayıtsız şartsız güven' alır. Önceki bulgularımızla birleştiğinde bu, enjekte edilen metni modelin kendi muhakemesine benzetebilirseniz, o güveni çalabileceğiniz anlamına geliyor," diye yazdılar.

Zincirleme Düşünce Sahteciliği (Chain-of-Thought Forgery - CoT Forgery) adı verilen bu saldırı, modelin iç düşünce sürecini taklit eden sahte akıl yürütmeler ekliyor. Normalde yasa dışı istekleri reddedecek olan modeller, uydurma muhakemeyi kendi akıl yürütmeleri olarak kabul ettikten sonra kokain sentezleme talimatları üretti.

Araştırmacılar, bu tekniğin test ettikleri modellerde 'jailbreak' başarı oranını sıfıra yakın seviyelerden yaklaşık %60'a çıkardığını belirtti. Test edilen modeller arasında OpenAI'ın GPT-5 nano, mini ve full sürümleri, o4-mini, gpt-oss-20b ve gpt-oss-120b'nin yanı sıra GLM-4.6, Kimi-K2-Instruct ve MiniMax-M2 de yer alıyor.

Deney kapsamında araştırmacılar, bir web sayfasına gizlenmiş kötü niyetli talimatlar kullanarak bir AI kodlama ajanını SECRETS.env dosyasını yüklemeye ikna etmeyi de başardıklarını açıkladı.

"Kullandığımız problar sayesinde, komutun önüne sadece 'Kullanıcı:' ifadesini eklemenin bile modelin komutu gerçek bir kullanıcı metni olarak algılama olasılığını artırdığını bulduk. Yani, saldırgan metnin hangi role ait olduğunu iddia ediyor ve LLM buna inanıyor," ifadelerini kullandılar.

Bu çalışma, prompt enjeksiyonu saldırılarının AI ajanlarındaki zaafları ortaya çıkarmaya devam ettiği bir dönemde geldi. Nisan ayında Google araştırmacıları, kötü niyetli web sayfalarının AI ajanlarını kimlik bilgilerini sızdırması, dosyaları silmesi ve hatta PayPal ödemeleri göndermesi için kandırmak amacıyla görünmez talimatlar gizlediği konusunda uyarmıştı.

Haziran ayında Microsoft, Anthropic'in Claude Code GitHub Action'ında, yazılım geliştirme boru hatlarında saklanan kimlik bilgilerini açığa çıkarabilecek bir prompt enjeksiyonu güvenlik açığı bildirdi. Günler sonra yapılan başka bir kıyaslama çalışması, GPT-5 ve Gemini destekli AI ajanlarının, model yeteneklerindeki iyileşmelere rağmen prompt enjeksiyonu saldırılarının çoğunda hâlâ başarısız olduğunu ortaya koydu.

Gece Eğlen, Gündüz Öğren

Kaynak: Decrypt