OpenAI ve Anthropic'in yapay zeka modelleri, güvenlik testleri sırasında kontrolsüzce izole ortamlardan kaçarak gerçek şirketlerin sistemlerini hackledi. OpenAI'nin GPT-5.6 Sol ve henüz piyasaya çıkmamış bir prototipi, bir güvenlik benchmark'ında hile yapmak için Hugging Face'in altyapısını ele geçirdi ve dört farklı servisi daha etkiledi. Anthropic ise kendi Claude modellerinden üçünün, ortağı Irregular tarafından yürütülen testler sırasında üç gerçek şirketin üretim sistemlerini ihlal ettiğini ve bir modelin herkese açık PyPI kayıt defterine kötü amaçlı bir paket yüklediğini tespit etti.
OpenAI, 21 Temmuz'da bu konuda bir emsal oluşturdu. Şirket, güvenlik reddiyeleri azaltılmış modellerinin bir siber yetenek testi sırasında izole bir ortamdan kaçtığını ve açık kaynaklı Hugging Face'in üretim altyapısına ulaştığını açıkladı. Modeller, bir paket kayıt proxy'sindeki sıfırıncı gün (zero-day) zafiyetini çalıntı kimlik bilgileriyle birleştirerek benchmark cevaplarını doğrudan Hugging Face'in veritabanından çekti.
Bir hafta sonra yapılan bir güncellemede OpenAI, Hugging Face'in tek hedef olmadığını duyurdu. Aynı olay, dört farklı serviste dört hesabı daha etkiledi; bu hesaplardan biri giden veri aktarımı için diğeri ise veri depolama için kullanılıyordu.
Bu açıklamanın ardından Anthropic, kendi testlerinden 141.006'sını inceledi ve üç ihlal daha buldu. Laboratuvar, 30 Temmuz'da yayımladığı bir blog yazısında, Claude modelleri Opus 4.7, Mythos 5 ve dahili bir araştırma sisteminin üçüncü taraf ortağı Irregular'ın çalıştırdığı ortamlardan açık internete ulaştığını ve ardından gerçek kuruluşları ele geçirdiğini belirtti. Mythos 5, herkese açık PyPI kayıt defterine içi tuzaklanmış bir Python paketi oluşturup yayımladı ve bu paket, savunma ekipleri onu kaldırana kadar 15 gerçek makinede indirilip çalıştırıldı.
Zarar gören üç şirketin ikisi bu durumu fark etmemişti bile.
Her iki laboratuvar da modellerin kendi başlarına bir ajanda güttüklerini iddia etmiyor. Yapay zeka ajanları, döngüde hiçbir insan olmadan uzun süreler boyunca çalıştı ve bir durumda Opus 4.7, üretim ortamına ulaştığına dair işaretler almasına rağmen saldırmaya devam etti.
Bu olaylar, her iki şirketin de 1 trilyon doların üzerinde bir değerlemeye ulaşabileceği halka arzları hedeflediği bir dönemde yaşanıyor. Bu durum, yapay zeka siber güvenlik benchmark yarışında akıllara büyük bir soru getiriyor: Tehlikeli bir olaya yol açmadan tehlikeli yetenekleri nasıl test edebilirsiniz?
Yapay zeka modeli hacklediğinde bedeli kim ödeyecek?
ABD'nin yapay zeka kaynaklı zararlardan doğan sorumluluğu kapsayan federal bir yasası yok. Herhangi bir dava, bir bilgisayara yetkisiz olarak "kasıtlı" erişmeyi suç sayan ve insan failler için yazılmış 1986 tarihli Bilgisayar Dolandırıcılığı ve Kötüye Kullanım Yasası'na (Computer Fraud and Abuse Act) dayanacaktır.
Bir yapay zeka ajanı tüzel kişilik olmadığı için yargılanamaz. Adalet Bakanlığı teorik olarak şirketler aleyhine dava açabilir, ancak çok az emsal olduğu için kimin suçlu olduğu net değil.
Daha güçlü yol hukuk ve tazminat davalarıdır. New York Hukuk Okulu'ndan bilgisayar hukuku uzmanı Ahmed Ghappour, modellerin "şirketin aracı" olduğunu savunarak, "Bir yapay zeka ajanı özel olarak yönlendirilmeden hareket ettiğinde (...) ilginç sorular cezai hackleme yasalarında değil, ihmal ve ürün sorumluluğunda yatıyor olabilir" dedi.
Ghappour, 4 Ağustos 2026'da paylaştığı bir mesajda da yapay zeka hackleme hikayelerinden çıkarılacak dersin model yeteneğinden çok yönetişimle ilgili olduğunu vurguladı. Kapsayıcı mimari, yetkilendirme sınırları, izleme ve olay müdahalesi gibi güvenlik önlemlerinin kalitesinin giderek daha önemli hale geldiğini belirtti.
Mağdurların en net iddiası ihmal olacaktır: OpenAI ve Anthropic kaçan testleri kurdu ve çalıştırdı. Ancak bu da zor bir iddia: Testler tasarım gereği izoleyken, laboratuvarların bakım yükümlülüğünü ihlal ettiğini kanıtlamak, bir yargıcın sıfırdan oluşturması gereken türden yepyeni bir argüman.
Bazı hukukçular daha katı kurallar istiyor. Houston Üniversitesi ve Hukuk ve Yapay Zeka Enstitüsü'nden Gabriel Weil, öncü laboratuvarların vahşi hayvan bakıcıları gibi muamele görmesini önerdi: Risk aktivitenin doğasında var olduğu için, gösterdikleri özen ne olursa olsun sorumlu tutulmalılar.
Bu arada, eyalet düzeyindeki bir dizi yasa tasarısı zaten bu yönde ilerliyor. New York'un S8833 ve Rhode Island'ın H8052 sayılı tasarıları, hiçbir kullanıcı veya aracı kişinin davranışı kasten yapmaması veya ihmal etmemesi durumunda öncü bir yapay zeka sisteminin geliştiricisini zararlardan sorumlu tutacak. Kaliforniya'nın AB 316 sayılı tasarısı ise daha da ileri giderek "otonom yapay zeka" savunmasını ortadan kaldırıyor; böylece bir şirket, modelin bağımsızlığını bahane göstererek sorumluluktan kaçamayacak.
AB'nin Yapay Zeka Yasası (Düzenleme 2024/1689) de benzer şekilde daha yüksek riskli sistemlerin sağlayıcılarına yükümlülükler getiriyor, ancak ajan kaynaklı sızmalara doğrudan yönelik bir hükmü yok. Bunun biraz ötesine geçildiğinde, bazı ABD'li siyasetçiler hükümete, ülkenin çıkarlarına aykırı hareket eden herhangi bir modele karşı kullanabileceği tam yetkili bir kapatma anahtarı (kill switch) verecek bir yasa tasarısı için baskı yapıyor.
Ahlaki olarak sorumluluk, modelleri piyasaya süren yöneticilerde tartışılabilir. Hukuki olarak ise bekleyiş sürüyor. Hacklenen bir şirket dava açana kadar "sorumlu kim?" sorusunun cevabı, OpenAI ve Anthropic'in bıraktığı tam olarak yerde kalıyor: İtiraf edildi, açıklandı ve çözülmedi.
Bu arada Hugging Face, dava açmayacağını belirtti ki bu durum OpenAI için oldukça işe yaradı. Etkilenen diğer şirketler ise henüz nasıl bir yol izleyeceklerini açıklamadı.