OpenAI, GPT modellerini geniş çapta kullanıma sunmadan önce prompt injection güvenlik açıklarını keşfetmek için geliştirdiği GPT-Red adlı otomatik kırmızı takım modelinin ayrıntılarını paylaştı.
Yapay zeka şirketi yaptığı açıklamada, "GPT-Red güçlü bir kırmızı takımcıdır ve önceki modellerimiz onun prompt injection saldırılarına karşı oldukça savunmasızdır. GPT-Red'i GPT-5.6'yı çekişmeli olarak eğitmek için kullanarak onu prompt injection saldırılarına karşı çok daha dayanıklı hale getirdik" ifadelerini kullandı.
Model tıpkı insan bir kırmızı takımcı gibi çalışıyor. Bir prompt gönderiyor, GPT modelinin nasıl yanıt verdiğini izliyor ve hassas verileri harici bir sunucuya yüklemek gibi kötü niyetli bir hedefe doğru adım adım ilerliyor.
Bu gelişme, büyük dil modellerinin hâlâ en büyük sorunlarından biri olan adversarial prompt injection saldırılarının devam ettiği bir dönemde geldi. Bu saldırılarla modeller, istenmeyen sonuçlar doğurabilecek özenle hazırlanmış bir talimatı yerine getirmeye kandırılabiliyor.
Ajan sistemler web tarayıcıları, bağlı uygulamalar, yerel dosyalar ve diğer araçlar aracılığıyla üçüncü taraf veri kaynaklarına bağlandıkça, saldırı yüzeyi de genişliyor. Kötü niyetli aktörler, girdi olarak beslenen masum görünümlü içeriklere (bir e-posta, web sayfası, araç yanıtı veya kod deposu) kötü amaçlı promptlar yerleştirerek modelin çıktısını etkileyebiliyor.
GPT-Red, insan kırmızı takım çalışmasını ölçeklendirerek yeni başarısızlık modlarını tespit etmeyi, sağlamlığı artırmayı ve modeller dağıtılmadan önce uygun karşı önlemler geliştirmeyi amaçlıyor.
OpenAI, "Tıpkı insan kırmızı takımcıların saldırılar oluşturması gibi, model de bir prompt göndererek, GPT modellerinin buna nasıl yanıt verdiğini gözlemleyerek ve adım adım ilerleyerek bir hedefe doğru çalışıyor" dedi.
OpenAI, GPT-Red'i doğrudan üretim modellerinin eğitim sürecine entegre ederek GPT-5.6 Sol'un bugüne kadarki en sağlam model olduğunu ve doğrudan prompt injection karşılaştırmasında dört ay önceki öncü modeli GPT-5.5'e kıyasla altı kat daha az başarısızlık kaydettiğini açıkladı.