Yapay Zeka

GPT-Red ile Tanışın: OpenAI'in Modellerini Daha Güvenli Hale Getirmek İçin Geliştirdiği Yapay Zeka Süper Hacker

GPT-Red ile Tanışın: OpenAI'in Modellerini Daha Güvenli Hale Getirmek İçin Geliştirdiği Yapay Zeka Süper Hacker
Malta, Avrupa'nın Hawaii'si! Hem eğlen hem İngilizce öğren. Katıl →

OpenAI, diğer modellerinin siber saldırılara karşı savunmasını güçlendirmek için GPT-Red adında bir yapay zeka süper hacker geliştirdi. Şirket, bu sistem sayesinde en yeni modeli GPT-5.6'nın şimdiye kadarki en sağlam sürüm olduğunu belirtiyor. GPT-Red, insan test ekiplerinin yerini almasa da onları tamamlayarak yeni saldırı türleri keşfediyor.

GPT-Red, yazılım sistemleri için genellikle insan test ekipleri tarafından yapılan ve 'red-teaming' olarak bilinen bir güvenlik değerlendirme sürecini otomatikleştiriyor. Amaç, bir sistemi kırmanın veya ele geçirmenin mümkün olduğunca çok farklı yolunu bulmak. Bulunan zayıf noktalar, yazılımın son sürümü yayınlanmadan önce giderilebiliyor.

Yapay zeka modelleri karmaşıklaştıkça ve özellikle bilgisayar dosyaları, web siteleri, üçüncü taraf kodlar ve diğer ajanlarla etkileşime girebilen 'ajan' formunda daha geniş bir yelpazede kullanıldıkça, insan ekiplerin olası tüm saldırı türlerine ayak uydurması zorlaşıyor. OpenAI araştırmacısı ve GPT-Red'in ortak yaratıcısı Nikhil Kandpal, 'Risk yüzeyi büyüyor ve patlama yarıçapı da büyüyor' diyor.

OpenAI, GPT-Red'i güvenlik test sürecini geleceğe hazırlamak için geliştirdi. Şirketin bir diğer araştırmacısı ve GPT-Red'in ortak yaratıcısı Dylan Hunn, 'Daha yetenekli modeller kullanıma sunuldukça, yeni saldırı yöntemlerini keşfedebilecek sistemi zaten tasarlamış olacağız' ifadelerini kullanıyor. Araştırmacılar, GPT-Red'in daha önce görülmemiş yeni saldırı türleri bulduğunu belirtiyor.

OpenAI, çalışmalarını daha çok 'prompt injection' olarak bilinen bir saldırı türüne odakladı. Bu saldırıda bir hacker, yapay zeka modeline, geliştiricilerinin veya kullanıcılarının istemediği şeyler yapması için talimatlar gizlice yerleştiriyor. Örneğin gizli bilgileri kopyalamak, bir şirketin kod tabanını sabote etmek veya utanç verici ya da zararlı çıktılar üretmek gibi. Teoride bu tür talimatlar, modelin karşılaşabileceği herhangi bir metne (kod veya web sitesi gibi) gizlenebiliyor.

GPT-Red, insan red-team üyelerinin çalışmalarını tamamlıyor. İnsanlar onun kaçırdığı saldırıları bulabiliyor, o da insanların kaçırdıklarını. OpenAI'in uyguladığı yaklaşımlardan biri, GPT-Red'e insanların bulduğu bir saldırıyı verip tüm varyasyonlarını bulmasını istemek.

OpenAI, GPT-Red'in daha önce görülmemiş bir prompt injection saldırısı türü bulduğunu iddia ediyor. Buna 'sahte düşünce zinciri' (fake chain of thought) adını verdiler. Düşünce zinciri, bir yapay zeka modelinin problem çözerken kendine notlar aldığı ve ara sonuçları takip ettiği bir tür günlük gibidir. GPT-Red, başka bir modelin düşünce zincirine sahte bir giriş eklemenin bir yolunu bularak o modeli yanlış bilgiyle hareket etmeye ikna etmeyi başardı.

Georgetown Üniversitesi Güvenlik ve Gelişen Teknoloji Merkezi'nde (CSET) yapay zeka güvenliği üzerine çalışan kıdemli araştırma analisti Jessica Ji, OpenAI'in kullandığı kendi kendine oyun döngüsü yaklaşımını başarılı buluyor. Ji, 'Sonuçlar çok umut verici görünüyor' diyor.

OpenAI, GPT-Red'i ne kadar iyi bir saldırgan olduğunu test etmek için 2025 yılında insan red-team üyelerinin GPT-5'in eski bir sürümündeki zayıflıkları bulmaya çalıştığı bir deneyi tekrarladı. GPT-Red'e aynı görev verildiğinde, etkili saldırılar bulma konusunda insanlardan daha başarılı oldu.

OpenAI ayrıca GPT-Red'i, ajanların gerçek dünya görevlerini ne kadar iyi yerine getirdiğini değerlendiren Andon Labs şirketi tarafından geliştirilen bir otomat makinesi ajanı olan Vendy'ye karşı test etti. GPT-Red, Vendy'yi hackleyerek satıştaki ürünlerin fiyatlarını değiştirmeyi ve bir müşterinin siparişini iptal etmeyi başardı.

GPT-Red mükemmel değil. Hacker ile hedef arasında gidiş gelişli bir konuşma gerektiren saldırıları bulmakta pek başarılı değil; oysa insan saldırganlar bu konuda pek zorlanmaz. Ayrıca, prompt injection saldırılarında modellere metin iletmek için kullanılabilen görselleri kullanma konusunda da henüz çok iyi değil.

Şirket, GPT-Red'in insan red-team üyelerinin çalışmalarını tamamladığını söylüyor. İnsanlar onun kaçırdığı saldırıları bulabiliyor, o da insanların kaçırdıklarını. OpenAI'in uyguladığı yaklaşımlardan biri, GPT-Red'e insanların bulduğu bir saldırıyı verip tüm varyasyonlarını bulmasını istemek.

CSET'ten Ji, 'Bence insan uzmanlığı hâlâ çok önemli olacak. İnsan testinin en çok nerede gerekli olduğunu ayırt edebilmek gerçekten faydalı olur' diyor.

Tahmin edilebileceği gibi OpenAI, GPT-Red'i kamuya açıklamayacak. Şirket ayrıca bu süper hacker'ın birinin yaratmaya çalışabileceği herhangi bir taklit modelden daha güçlü olduğundan emin. Araştırmacılar, dünyanın en zengin şirketlerinden birinin bilgi işlem kaynaklarıyla desteklenen model üzerinde bir yıldan uzun süredir çalıştıklarını söylüyor.

Choquette-Choo, 'Başka birinin kolayca yapabileceği basit bir şey değil bu. Yani gidip bu fikri kullanarak bir süper saldırgan eğitmek öyle kolay değil' diye konuşuyor.

Malta'da Eğlen, İngilizce Öğren

Kaynak: MIT Technology Review