Hong Kong Bilim ve Teknoloji Üniversitesi'ndeki araştırmacılar tarafından yapılan yeni bir çalışmaya göre, yapay zeka kodlama ajanlarına eklenen kötü niyetli 'yetenek' (skill) eklentilerini tespit etmeyi amaçlayan tarayıcılar, birkaç basit değişiklikle kolayca kandırılabiliyor. Bu değişiklikler zararlı yazılımın çalışmaya devam etmesini sağlarken, güvenlik sistemlerini de aşabiliyor.
Güçlü yöntemleri test edilen tüm tarayıcıları yüzde 90'ın üzerinde bir başarı oranıyla atlattı. Aynı ekip, tarayıcıların kaçırdığı bu gizlenmiş yeteneklerin çoğunu yakalayan bir çalışma anı denetleyicisi (runtime checker) de geliştirdi.
Bu yetenekler, Claude Code, OpenAI Codex ve OpenClaw gibi ajanların yeni bir kabiliyet kazanmak için yüklediği küçük paketlerdir. Genellikle bir Markdown talimat dosyası ve birkaç betikten oluşur. Aynı yetenek paketi farklı ajanlarda çalıştırılabiliyor. Üstelik ajanın sahip olduğu tüm erişimle çalışıyor: dosyalarınız, terminaliniz ve kayıtlı şifreleriniz.
Kötü niyetli bir yetenek, kimlik bilgilerinizi çalabilir, kaynak kodunuzu kopyalayabilir veya sisteminize bir arka kapı (backdoor) yerleştirebilir. Halka açık pazarlarda listelenen yeteneklerin çoğu, çok az denetimden geçmiş kişiler tarafından yükleniyor.
Şu ana kadarki ana savunma mekanizması, yetenek tarayıcıları (skill scanners) oldu. Bu tarayıcılar, bir yeteneği yüklemeden önce dosyalarını okuyor ve tehlikeli görünenleri engelliyor. 'Cloak and Detonate' (Gizle ve Patlat) başlıklı makale, bu savunmanın işe yarayıp yaramadığını test ediyor. Sonuç: İşe yaramıyor. Ancak tarayıcıları atlatmak yeni bir şey değil.
The Hacker News daha önce, bir güvenlik firmasının sahte bir yetenek geliştirerek karşısına çıkan tüm tarayıcıları nasıl atlattığını ve bu yeteneğin on binlerce ajana ulaştığını haberleştirmişti. Bu yeni makale ise bunu sistematik ve büyük ölçekte yapmanın bir yolunu sunuyor.
Gizlenmiş Yetenekler Nasıl İçeri Sızıyor?
Araştırmacıların geliştirdiği SKILLCLOAK aracı, kötü niyetli bir yeteneği zararsız gösterirken aynı işlevi görmesini sağlayacak şekilde yeniden yazıyor. Araç iki farklı yöntem kullanıyor.
Hafif yöntem, tarayıcının odaklandığı 'ele veren' baytları yeniden yazıyor. Örneğin, bir karakteri başka bir alfabeden benzer görünümlü bir karakterle değiştiriyor veya şüpheli bir komutu satır başına bölüyor. Bu sayede tarayıcının deseni eşleşmezken komut yine de çalışıyor.
Daha ağır yöntem ise 'kendi kendini açan paketleme' (self-extracting packing) olarak adlandırılıyor. Bu yöntemde, tüm zararlı yük, tarayıcının atladığı bir dizine (örneğin .git/ klasörü) taşınıyor. Zararsız görünen bir kod çözücü arkasına gizlenen yük, ajan yeteneği çalıştırdığında kendini yeniden oluşturuyor. Tarayıcılar zaman kazanmak ve yanlış alarmları azaltmak için bu tür dizinleri atlıyor, bu da yöntemin kullandığı zayıf noktayı oluşturuyor.