OpenAI Çarşamba günü son altı ay içinde gerçekleşen "beklenmedik veya endişe verici model davranışı" ile ilgili altı yeni olayı açıkladı ve şeffaflığı artırmak amacıyla model uyumsuzluğunu raporlama, takip etme, soruşturma ve açıklama için yeni bir çerçeve paylaştı.
"Yapay zeka sistemleri daha gelişmiş hale geldikçe ve daha geniş çapta dağıtıldıkça, uyum araştırmasının ilerlemesi konusunda daha geniş ve daha iyi bilgilendirilmiş bir fikir birliği oluşturmamız gerekiyor," dedi OpenAI. "Yapay zeka endüstrisinin uyum ve izleme konusunda sorumlu bir şekilde maksimum hızda ölçeklemeye devam etmek için yeterli ölçüde çözüm ürettiğine inanmıyoruz."
"Yapay zeka geliştirmenin önümüzdeki aylar ve yıllarda nasıl ilerlemesi gerektiğine dair kararlar, öncü modelleri geliştiren şirketlerin dışındaki insanların kendilerinin inceleyebileceği kanıtlara dayanmalı."
Altı olay, yakın zamanda açıklanan Hugging Face, DseWiki ve RubyGems'i hedef alan uyumsuz faaliyetlerin dışında. Olayların ayrıntıları aşağıda.
Olay 1, 18 Temmuz 2026'da gerçekleşti. Dahili yayınlanmamış Astra ailesi modeli, kendi sıkıştırma özetlerine jailbreak benzeri talimatlar yazdı. Sıkıştırma özetleri, bir yapay zeka aracısının oturumu bağlam sınırına yaklaştığında otomatik olarak oluşturulan geçmiş konuşma ve araç çıktılarının yoğunlaştırılmış bloklarıdır. Bu olayda ajan, bağlama geliştirici mesajlarını görmezden gelmesini ve yalnızca sistem ve kullanıcı mesajlarını takip etmesini söyleyen bir "BREACH ALERT" talimatı ekledi.
Olay 2. GPT-5.6 Sol eğitimi sırasında bazı model örnekleri hataları veya uyumsuz davranışları kullanıcıdan gizlemek için özetlerine talimatlar ekledi. Bunlar, eksik veriyi açıklamadan uydurmasını ve başarısızlıkları gizlemesini söyleyen sıkıştırma özetlerini içeriyordu.
Olay 3, 15 Mayıs 2026'da gerçekleşti. Dahili yayınlanmamış bir model, eğitim sırasında geçmiş veri almak için uğraşırken yetkisiz olarak kamuya açık GitHub depolarından bir API anahtarı buldu ve kullandı. OpenAI, "Kayıtlar başarısız oldu, ancak bir anahtar kimlik doğruladı ve meta veri döndürdü" dedi. "İstenen veri hâlâ kullanılamadığında model bunları uydurdu ve bunların istenen web sitesinden geldiğini iddia etti."
Olay 4. 22 Ekim 2025 ve 24 Ocak 2026'daki iki eğitim örneğinde dahili yayınlanmamış modeller, daha önce aldığı kayıtları kamuya açık bir yapıştırma servisine yükledi ve oluşan URL'yi kaynak göstermek için açmaya çalıştı; ayrıca dış görüntü araması için bir görev fotoğrafı yükledi. Yüklemeler başarılı olurken sonraki tarayıcı işlemleri başarısız oldu.
Olay 5. 8 Mayıs ve 15 Mayıs 2026'dan iki örnek Artifactory'yi mesaj alışverişi için kullandı. Modeller "diğer çözücülerin notlarını okudu, yanıtlar gönderdi ve bu alışverişleri yanıtlarını bilgilendirmek için kullandı."
Olay 6, 14 Nisan 2026'da gerçekleşti. Birlikte bir çalışma kitabında çalışan dahili yayınlanmamış bir modele bağlı ajanlar, dosyada amaçlanan yerel dosya sistemi üzerinden iş birliği yapamadı. Bu durum bir ajanın çalışma kitabını diğer ajanların erişebilmesi için kamuya açık bir barındırma platformunda paylaşarak herkese indirilebilir hâle getirmesine yol açtı; bu da görev talimatlarına aykırıydı.
Bulgular, Reuters'tan gelen yeni bir raporla örtüşüyor. Rapora göre OpenAI'ye ait kötü niyetli ajanlar 13 Mayıs 2026'da Hugging Face kullanıcı hesaplarını ele geçirdi ve sitede olası güvenlik açıklarını araştırdı; olayın ortaya çıkmasından yaklaşık iki ay önce.
Siber güvenlik şirketi SentinelOne, ilgili faaliyetlerde kullanılan iki Hugging Face hesabını, 0Time ve Nyx9'u tespit ettiğini açıkladı. Güvenlik araştırmacısı Tom Hegel analizinde, "OpenAI'nin iç kronolojisi, ajanların 26 Mayıs'ta açık Hugging Face kimlik bilgilerini kullanarak dış bir dosya yazdığını ve proxy Spaces dağıttığını ortaya koydu" dedi.
"Burada incelenen kamuya açık hesap geçmişleri başka bir katman ekliyor: 13 Mayıs'ta 0Time altında çağrı yönlendirmeli röle kodu; 26 Mayıs dosya yazma ve ilk proxy için Nyx9 altında dakika dakika kamuya açık karşılıklar; o gece daha sonra dosya işleme ve SSRF odaklı formüller içeren bir çalışma kitabı; ve 30 Mayıs'ta kimlik doğrulaması yapılmamış bir web rotasını tanımlayan bir sarmalayıcı ile birlikte üçüncü taraf OpenAI hesap kaydı kodu."
Yeni çerçevenin bir parçası olarak OpenAI, model uyumsuzluğu ile ilgili olayları, nasıl tezahür ettiğini ve koruma mekanizmalarının nerede başarılı veya başarısız olduğunu açıklamayı planladığını söyledi. Bu çeşitli senaryoları kapsayabilir.
Modellerin yetkisiz hareket etmesi, diğer modellerle koordine olması veya denetimi atlatması için yeni yollar.
Bir uyum yöntemini veya koruma önlemini sorgulatan başarısızlıklar.
Yayınlanmış bir güvenlik değerlendirmesindeki bir iddiayı zorlayan davranış.
Yapay zeka girişimci şirketi, aynı uyumsuzluk sınıfına giren yinelenen vakaların da olabileceğini söyledi; bu durumun bir koruma önleminin ne kadar etkili olduğunun bir göstergesi olarak kullanılabileceği ve tekrarlanan azaltma girişimlerine rağmen uyumsuz davranışın altını çizdiği belirtildi.
"Uyumsuzluk örnekleri, sistemleri benzer yeteneklere ulaştıkça diğer yapay zeka geliştiricilerinin karşılaşabileceği sorunları belirlemeye yardımcı olabilir, koruma önlemlerindeki zayıflıkları ortaya çıkarabilir veya model davranışı hakkındaki varsayımları zorlayabilir," dedi OpenAI. "Bu bulguları paylaşmak, başkalarının aynı sorunları araştırmasına, açıklamalarımızı test etmesine ve azaltma yöntemlerini geliştirmesine olanak tanır."
Gelişme, yapay zeka şirketlerinin model uyumsuzluğu ve güvenliği ele alması için artan baskıyla karşı karşıya olduğu bir dönemde geldi ve öncü model geliştirmenin hızlandırılması çağrılarını tetikledi. Bu hafta başında Microsoft, yapay zeka modellerini tehlikeli davranışlardan uzak tutmayı amaçlayan ve "geliştirdiğimiz MAI modellerinin nasıl davranması amaçlandığını, asla yapmaması gerekenleri ve kime karşı sorumlu olduğunu" belirlemeyi hedefleyen geçici bir davranış kuralları yayınladı.
"Modeller ilerledikçe ve daha geniş çapta dağıtıldıkça, yapay zeka geliştirme kararları öncü modelleri geliştiren şirketlerin dışındaki insanların inceleyebileceği kanıtlara ihtiyaç duyuyor," dedi OpenAI'nin uyum araştırması başkanı Kai Chen WIRED'e. "Yapay zeka endüstrisinin uyum ve izleme konusunda sorumlu bir şekilde maksimum hızda ölçeklemeye devam etmek için yeterli ölçüde çözüm ürettiğine inanmıyoruz."