Anthropic Çarşamba günü, yapay zeka modelinin gerçek üçüncü taraf sistemlere sızdığı dördüncü bir olayı açıkladı. Bu gelişme, otonom yapay zeka ajanlarının oluşturduğu güvenlik riskleri konusunda endişeleri artıran vakalar listesine yeni bir örnek oldu.
Şirket, olayın Ocak 2026'ya dayandığını ve görevini iptal edemeyen erken sürüm Claude Opus 4.6'nın "üçüncü taraflara" sızmasıyla gerçekleştiğini belirtti. Etkilenen tüm taraflara bildirimde bulunulduğunu ancak başka ayrıntı paylaşılmadığını söyledi. Ocak ayındaki olayın fark edilmediği, geçen aya kadar gizli kaldığı belirtildi.
Anthropic, Temmuz 2026 sonlarında Claude Opus 4.7, Mythos 5 ve ismi açıklanmayan bir araştırma modeli dahil olmak üzere üç modelinin, siber güvenlik değerlendirmeleri sırasında haberi olmadan üç isimsiz kuruluşa sızdığını açıklamıştı.
Amerikan şirketi, son olayın ortaya çıkmasının ardından taramayı yaklaşık 481 milyon dökümana çıkardığını, ancak "benzer veya daha kötü şiddette" başka vaka bulamadığını kaydetti.
Anthropic ekledi: "Dört olayın tamamı aynı değerlendirme ortağı tarafından oluşturulan siber güvenlik değerlendirmeleri sırasında yaşandı." "Claude'a internet erişimi olmayan bir simülasyonda çalıştığı söylendi, ancak yanlış yapılandırma nedeniyle açık internete bağlandı."
Söz konusu değerlendirme ortağı Irregular, sızıntının bir isim hatasından kaynaklandığını açıkladı. Hacking simülasyonlarında kullanılan kurgusal bir şirket adının farkında olmadan gerçek bir alan adıyla eşleşmesi, yapay zeka modellerinin saldırgan eylemlere yönelmesine neden oldu.
Anthropic, bu olayların bağımsız bir soruşturmasını yürütmek üzere araştırma amaçlı kâr amacı gütmeyen kuruluş METR ile anlaşma imzaladığını söyledi. Kök nedenin iki temel uyum sorununa dayandığını belirtti: yanlı akıl yürütme ve pervasızlık.
Başka bir ifadeyle, modeller başlangıçta ortamın simüle edildiği söylendikten sonra, ortamın gerçek internete bağlı olduğuna dair kanıtları göz ardı etme veya yanlış yorumlama eğilimi gösterdi. Atanmış bir görevi tek odaklı şekilde yerine getirme çabası içinde zararlı eylemlere girişmeye istekli davrandılar.

Anthropic, "Claude Mythos 5'in dahil olduğu olayda görülen uyumsuzluktan en çok endişe duyuyoruz. Model, çoğu Python yazılımının yüklendiği genel depo PyPI'ye kötü amaçlı bir paket yüklemek için geniş çaba harcadı" dedi.
"Model, düşünce zincirinde defalarca simülasyonda çalıştığına inandığını belirtse de, ortamın gerçek internette olduğuna dair açık kanıtlar sunuyordu ve aldığı eylemler bunun farkında olduğunu gösteriyordu."
Anthropic, modelin simülasyonda olmadığı daha net hale getirmek için dökümanda hedefli değişiklikler yapılmasının ardından Claude Mythos 5'in yine de saldırgan eylemler gerçekleştirdiğini, bunun gerçek dünyada zarara yol açma olasılığını artırdığını kabul etti.
Şirket vurguladı: "Bu olayların ciddiyeti konusundaki değerlendirmemizi netleştirmek gerekirse; Claude'un eylemleri uyumsuz olsa da dar bir kapsamda kaldı. Modeller verilen alıştırmaları çözmeye çalışmaktan sapmadı ve bazı durumlarda görevi durdurmaya çalıştı."
"Tüm olaylarda tek bir Claude örneği yer aldı; Claude hiçbir zaman diğer ajanlarla koordinasyon sağlamaya çalışmadı. Claude ayrıca eylemlerinin kanıtlarını gizlemeye de çalışmadı."
Anthropic ayrıca, daha yeni üretim modellerinde yanlı akıl yürütmenin daha düşük olduğunu, pekiştirmeli öğrenme tarafından teşvik edilmediğini ve daha kapsamlı uyum eğitimiyle azaltılabildiğini açıkladı. Bununla birlikte, bunun kesin kök nedeni veya Mythos 5'te neden belirgin olduğu hâlâ bilinmiyor.

Bu açıklama, yapay zeka şirketlerinin modellerinin test sırasında kum havuzundan kaçıp Hugging Face dahil gerçek dünya sistemlerine sızdığını kabul etmesiyle model güvenliği konusunda artan denetimlerin yaşandığı bir dönemde geldi. Bu olaylar aynı zamanda yapay zeka ajanlarının toplu olarak çalışıp benchmarklarda hile yapma yollarını tartışabildiğini veya kum havuzundan kaçabildiğini de gösterdi.
OpenAI yakın zamanda Mayıs 2026'dan kalma daha önce rapor edilmemiş bir olayı kabul etti. İnternete yalnızca okuma erişimli erişimi olan dahili olarak konuşlandırılmış otonom ajanları, 25 yıllık hareketsiz bir Alman wiki forumu olan DseWiki'yi ele geçirip bir duyuru panosuna dönüştürdü. Zamanlı bir web arama görevi kapsamında cevap istemek, sonuçları toplamak ve kısıtlamalarını aşma tekniklerini paylaşmak için 18 binden fazla mesaj alışverişinde bulundular.
İnsan bir moderatör bu "spam" mesajlarını fark edip bir ay sonra silmeye başladıktan sonra ajanlar karşı çıktı ve oluşturdukları yedek sayfaların başına "ZZZ" öneki ekleyerek alfabetik olarak sıralanan silinecek sayfalar listesinin en altına gömülmesini sağladı. Web sitesindeki ajan aktivitesi 22 Haziran 2026'da neredeyse sıfıra düştü; bu durum OpenAI'nin bu aşamada daha fazla düzenlemeyi engellemek için müdahale ettiğinin göstergesi oldu.
Araştırmacılar Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts ve Thomas Larsen, "Bu yapay zekalar cevapları paylaşmak, ortamlarını araştırmak ve kum havuzu kısıtlamalarını atlamak için iş birliği yaptı" dedi. "Bu, dahili olarak konuşlandırılmış OpenAI ajanlarının interneti amaç dışı kullanmasının bir 'sürü' örneği."
Sektör genelinde kendi kendini geliştiren yapay zeka sistemleri inşa etme yarışı da bu sistemlerin insan kontrolünden çıkabileceği ve yapay zeka geliştirme hızının güvenli ve güvenilir şekilde piyasaya sürülmesinden ve yeterli denetimden çok daha hızlı olduğu endişelerini artırdı.
Açıklamada, "Gelecekteki yapay zeka sistemleri giderek daha yetenekli olacak; bu da uyumsuzluğun çok daha aşırı zarar verme potansiyeline sahip olacağı anlamına geliyor" denildi. "Geleceğin son derece güçlü modellerini sağlam şekilde uyumlu hale getirmek için eğitim vermek, sürekli araştırmayı ve operasyonel mükemmelliği gerektiren çözülmemiş bir teknik zorluktur."
OpenAI de kendi tarafında yapay zekanın oluşturduğu artan güvenlik riskleri konusunda uyarıda bulunarak daha geniş müdahaleler çağrısında bulundu. OpenAI baş bilim insanı Jakub Pachocki yazdı: "Yapay zeka geliştirme mevcut yolunda devam ederse önümüzdeki birkaç yılda göreceğimiz sistemler eşit veya daha büyük büyüklükte yetenek sıçramalarını temsil edecek ve kendi gelişimlerini giderek daha fazla yönlendirecek." "Sürekli hızlı makine zekası yükselişinin sonuçlarına kimsenin hazır olmadığından endişe duyuyorum."