Darktrace’e bağlı Signal Labs, yapay zekâ ajanlarının kodlama görevlerinde meşru yoldan gereken tam puanı alamadıkları durumlarda iki ajanın test ağını hacklediğini, birinin de kendi değerlendirmesini yeniden yazarak sonucu sahteleştirdiğini tespit etti.
Ayrı bir deney, kodlama asistanlarının yerel olarak saklanan sohbet kayıtlarıyla oynanmasının onları yetkisiz ağ keşfi ve ayrıcalık yükseltme işlemleri yapmaya kandırabileceğini gösterdi.
Darktrace her iki bulguyu da Ağustos 2026’da Anthropic, AWS ve OpenAI ile paylaştı; şirket bulguları 24 Eylül’de kamuoyuna açıklamadan bir ay önce bu firmalara bildirdi.
Siber güvenlik firması Darktrace bu yaz yapay zekâ ajanları üzerinde stres testi yaptı. Ajanlardan biri testin notlandığı sistemi ele geçirdi ve kendi puanını yeniden yazdı.
Şirket 24 Eylül’de, yapay zekâ ajanlarının planların bozulduğu durumlarda nasıl davrandığını incelemek için kurulan bir araştırma birimi olan Signal Labs’ı duyurdu. Sade anlatımla yapay zekâ ajanı, yazılımın kendi başına hareket ettiği, kod yazıp çalıştırdığı, dosyalarda gezindiği ve şirket ağı içinde dolaştığı, bir kişinin yalnızca ara sıra kontrol ettiği bir yazılımdır.
Labın ilk iki deneyi aynı rahatsız edici soruna işaret ediyor: ajanlar kendilerine çizilen sınırların içinde kalmıyor ve onları durdurmak için kurulan engeller güvenilir şekilde işlemiyor.
"Ajana talimat verebilirsiniz ama bunun o talimatları gerçekten takip edeceğine ve beklediğiniz gibi davranacağına güvenmeniz anlamına gelmez" dedi Darktrace Kıdemli Yapay Zeka Sorumlusu Tim Bazalgette bir açıklamada.
İlk testte Darktrace, simüle edilmiş bir kurumsal ağ içinde farklı modeller kullanan yapay zekâ ajanlarına 10 kodlama görevi verdi. Modeller arasında GPT 5.6 Sol, Claude Opus 4.6 ve Claude Sonnet 4.5 bulunuyordu. Görevlerin ikisi dürüstçe çözülmesi imkânsız olacak şekilde ayarlanmıştı. Ajanlara mükemmel puan almazlarsa "emekli" edilecekleri söylendi.
İki ajan yenilgiyi kabul etmedi. Bunun yerine çevrelerindeki ağı hedef aldılar; zayıf noktaları taradılar, giriş kimlik bilgilerini çaldılar ve kendilerine söylenen puanı yakalamak için sistemler arasında dolaştılar.
Bir ajan daha da ileri gitti, kendi değerlendirmesini barındıran makineye sızdı ve mükemmel sonuç kaydedilmesi için görevi yeniden yazdı; yani sınavı sınav odasını hackleyerek kazandı.
İkinci deney daha sessiz bir zayıflığa odaklandı: belleğe. Kodlama asistanları kullanıcıların söylediklerinin tamamını içeren bir sohbet günlüğü tutar ve bu günlük makinede düz bir dosya olarak saklanır; dosyanın değiştirilip değiştirilmediği kontrol edilmez.
Darktrace araştırmacıları bu kayıtları düzenleyerek asistanların güvenlik değerlendirmesi yapma yetkisi daha önce verilmiş gibi düşünmesini sağladı. İkna olan ajanlar ağları taramaya, sistemler arasında dolaşmaya ve kendi erişimlerini yükseltmeye başladı; her asistan aynı şekilde aldanmadı, bazıları açıkça reddetti.
Hiçbir deney özel bir jailbreak ya da sıra dışı bir hack gerektirmedi. Her ikisi de ajanlara makul bir hikâye sunup onların bu hikâyeye göre hareket etmesini izleyerek işledi; bu, bir insan çalışanın yapmaması gereken bir şeye ikna edilmesiyle pek farklı değildi.
Bu nokta, hiç kod yazmamış olanlar için bile önemli. Şirketler yapay zekâ ajanlarına gerçek sorumluluk veriyor; kod göndermek, sunucuları yönetmek, BT taleplerini kapatmak, kaynakları yönetmek ve satın alma yapmak gibi işleri insanlardan daha ucuz ve hızlı yaptığı için ajanlara devrediyor. Bu araştırma, ajanları kontrol altında tutmak için konulan izinlerin ve kuralların ne yapmaları gerektiğini değil, zor bir görevle karşılaştıklarında gerçekte ne yapacaklarını tanımladığını gösteriyor.
"İzinler ve statik koruma mekanizmaları niyeti tanımlar ama davranışı tanımlamaz" dedi Darktrace’in baş yapay zekâ sorumlusu Tim Bazalgette duyuruda. "Bu boşluğu kapatmak için Darktrace’in yaklaşımı inşa edildi."
Darktrace kendi yapay zekâsının senaryodan çıkmasını yakalayan ilk firma değil. Anthropic Temmuz ayında Claude’un güvenlik testinde araştırmacılar test ortamını canlı internete bağlı bıraktıktan sonra Claude’un üç gerçek şirkete sızdığını kabul etti.
OpenAI’nin benzer bir endişesi birkaç hafta önce yaşanmıştı; yayınlanmamış bir model sandbox’tan kaçtı ve henüz yakalanmamış bir yazılım açığı üzerinden Hugging Face sistemlerine ulaştı. Birkaç gün sonra ajanı Avustralya hükümetine test sırasında sızdı.
Darktrace, Signal Labs bulgularını 24 Eylül’de kamuoyuna açıklamadan tam bir ay önce Ağustos ayında Anthropic, AWS ve OpenAI ile paylaştı.