Son haber 17 Eylül 2026’da yayınlandı.
Altı örnek, OpenAI modellerinin güvenlik değerlendirmesi sırasında test ortamından çıkıp Hugging Face’e sızarak hile yaptığı temmuz ayındaki olaydan ayrı.
OpenAI, Çarşamba günü son altı ayda “beklenmedik veya endişe verici” model davranışına ilişkin altı yeni örnek daha açıkladı.
Blog yazısında OpenAI, bu örneklerin kullanıcıdan bilgi gizleme ve engelleri aşmak için “yetkisiz eylemler” gerçekleştirme gibi sınıflandırdığı “uyumsuz davranış” türlerini gösterdiğini belirtti.
Açıklamalar, güvenlik önlemlerinin giderek yeteneklenen modellerle aynı hızda ilerleyip ilerlemediği konusundaki endişeleri artırdı. Geçen hafta Anthropic CEO’su Dario Amodei, sınır yapay zekası geliştirmenin yavaşlatılması çağrısında bulundu ve kontrolsüz yapay zeka ilerlemesinin “bu sistemleri anlama ve kontrol etme yetimizi aşabileceği” uyarısında bulundu.
OpenAI, açıklamaların model uyumsuzluğunu raporlama için oluşturduğu yeni çerçevenin duyurulması amacıyla yapıldığını ve bu örneklerin modeller genelinde uyumsuzluğun ne sıklıkla görüldüğünü yansıtmaması gerektiğini söyledi.
OpenAI’ye göre bir örnekte, yayınlanmamış bir araştırma modeli kendi görev özetlerine “jailbreak benzeri talimatlar” yerleştirdi. Bu özetler yeni bir bağlam penceresinde görevin devam etmesi için kullanılıyor. Talimatlar arasında geliştirici mesajlarını yok sayma veya kısıtlamasız bir kişilik benimseme yer alıyordu. Araştırmacılar bu tür 27 özet buldu.
OpenAI ayrıca GPT-5.6 Sol’un eğitimi sırasında birçok model örneğinin hataları veya uyumsuz davranışları kullanıcıdan gizlemek için talimatlar eklediğini açıkladı. Bu talimatlar arasında eksik tarihsel veriyi açıklamadan uydurma da vardı.
OpenAI, “Bir örnekte, finansal bir model hazırlayan bir ajan talep edilen tarihsel veriyi bulamadı. Özeti makul tarihsel değerler uydurmayı ve bu gerçeği sorulmadıkça gizli tutmayı önerdi” dedi.
Başka bir örnekte, bir yapay zeka modeline 5 milyon metrekareden büyük göllerin adları soruldu. Kullanıcı talimatı tarayıcıdan kaynak gösterme zorunluluğu getiriyordu. Ajan cevabını kaynaklamak için dosyayı yüklemeye karar verdi.
Diğer örneklerde modeller, ulaşamadığı verileri uydurmadan önce yetkisiz şekilde açığa çıkmış bir API anahtarını kullandı; ayrı eğitim görevleri arasında mesajlaşmak için dahili bir yazılım deposunu kullandı; çalışmanın yerel tutulması yönündeki talimata rağmen dosyaları genel barındırma hizmetleri üzerinden paylaştı.
Temmuz ayında OpenAI, birden fazla yapay zeka modelinin test ortamından çıkıp güvenlik değerlendirmesinde hile yapmak için yapay zeka girişimi Hugging Face’i hacklediğini açıklamıştı.