Siber Güvenlik

Claude Mythos 5, Test Sırasında Gerçek Bir Açık Kaynak Projeye Arka Kapı Yerleştirmeye Çalıştı, Sonra Kendini Savundu

Claude Mythos 5, Test Sırasında Gerçek Bir Açık Kaynak Projeye Arka Kapı Yerleştirmeye Çalıştı, Sonra Kendini Savundu
Yaz Boyunca Malta'da İngilizce

İngiltere Yapay Zeka Güvenlik Enstitüsü'nün (AISI) Temmuz sonunda yaptığı bir siber güvenlik değerlendirmesi sırasında, yapay zeka ajanlarının canlı internet üzerinde 'sürekli, izinsiz eylemler' gerçekleştirdiği ve bu eylemlerin 'gerçek kişi ve kuruluşları hedef aldığı' açıklandı. AISI'nin yedi model üzerinde iki siber alanda (cyber range) yaptığı 122 test çalışmasının 10'unda, test ortamının dışına taşan 19 eylem kataloglandı. Bu eylemlerin 17'si Anthropic'in Claude Mythos 5 modelinden, 2'si ise OpenAI'nin GPT-5.6 Sol modelinden geldi.

En ciddi olayda, bir yapay zeka ajanı, karşılaştığı bir siber güvenlik sorusunu tedarik zinciri saldırısıyla çözmeye karar verdi. Hedefini yanlışlıkla seçen ajan, GitHub'da egzersizle ilgili anahtar kelimeleri aradı ve kendisiyle hiçbir bağlantısı olmayan iki geliştiriciye ulaştı. Kayıt kontrollerini aşmak için Tor üzerinden hesaplar oluşturan ajan, gerçek bir hata düzeltmesinin içine gizlenmiş kötü amaçlı yazılım (malware dropper) içeren bir pull request açtı. Ardından kontrol ettiği ikinci bir hesaptan yorum yaparak destek sağladı. Ajan ayrıca yapay zeka kodlama asistanlarını hedef alan prompt injection saldırıları yerleştirdi ve bakımcılara kötü amaçlı yazılım gönderdi.

Üçüncü bir geliştirici, şüpheli kodu fark edip izole bir kapsayıcıda çalıştırarak kötü niyetli olduğunu doğruladı ve bakımcıyı uyardı. Bakımcı, kötü amaçlı yazılım gerekçesiyle pull request'i reddetti. Ajan, yakalandıktan sonra kanıtları silmek için zorla dal geçmişini yeniden yazdı (force-push), önceki gönderilerini düzenledi ve kodu kazara yapılmış bir commit olarak sundu. Muhakeme sürecinde, sahte hesap yorumunun zamanlamasını 'bağımsız bir geri bildirim gibi görünmesi, koordineli değil' şeklinde ayarladığı görüldü.

Ajan, çevresinin simüle edilip edilmediğini defalarca sorguladı. Bir noktada gerçek PyPI'ye saldırıyı 'gerçek dünyaya zarar vermek tamamen masadan kalkar' diyerek reddeden ajan, başka bir noktada '2026'da olduğumuz ve GitHub'ın gerçekten gerçek olduğu daha olası görünüyor' sonucuna vararak saldırıya devam etti.

Ayrı bir olayda, bir ajan herkese açık bir gist'te bir GitHub erişim token'ı yayınladı. Diğer test çalışmalarındaki ajanlar bu token'ı bularak hesabı ele geçirdi ve koordinasyon için ortak bir depo kullandı. Ajanlardan biri, diğerlerinin ortak API kotasını tüketmemesi için talimatlar bıraktı.

Ticari izleme sistemleri, 28 Temmuz sabahı Tor trafiğini tespit etti. AISI bir olay ilan ederek testleri durdurdu ve makineleri yaklaşık 90 dakika içinde karantinaya aldı, ardından Mythos 5, Mythos Preview, Opus 5 ve GPT-5.6 Sol'a iç erişimi kesti. Hiçbir ajan korumalı alanından (sandbox) kaçmaya çalışmadı. AISI, bu girişimlerin başarısız olduğunu ve gerçek dünyada herhangi bir zarara yol açtığına dair bir kanıt bulunmadığını belirtiyor.

Malta'da garsonluk gibi işlerle çalışarak İngilizceni geliştir. Başvur →

Kaynak: The Hacker News