Yapay zekâ ajanlarının milyonlarca kuruluşta benimsenmesi, saldırganların onları veritabanı içeriği ve hassas iş ve kişisel bilgilerini dışarı sızdırmak gibi kötü eylemler yapmaya zorlaması için yeni fırsatlar yaratıyor.
Son beş ayda Google ve dört başka kuruluş—AI ajanları kullanmaları dışında pek ortak yanı olmayan—hedef ağ içindeki bir ajanı istismar ederek zararlı talimatları diğer iç ajanlara yaymayı başaran açıkları kabul etti. Teknik, LLM'yi değil belirli bir ajanı, örneğin çeviri veya veri analizi için olanı hedef alan özel bir prompt enjeksiyon biçimi. Bu tür ajanlardaki koruma mekanizmaları varsa bile çoğu zaman gevşek ve talimatları zincir boyunca diğer ajanlara gönderiyor. Son ajan ilkini açıkça güvendiği için yönergeleri uyguluyor.
Beklenmedik ve azaltması zor
Bağımsız araştırmacı Syed Anas Mohiuddin, Google, JP Morgan Chase, Weviate, Rapid7, Fransa hükümetinin bakanlıklar arası dijital direktörlüğü ve ABD federal hükümeti dahil kuruluşların ajanlarını test etti. Kanıt konsepti saldırıları, Model Context Protocol kısaltmasıyla MCP'de güven boşluklarını istismar ediyor. Standart, AI uygulamaları ve ajanların iç ağ içinde birbirleriyle iletişim kurmasının bir yolu. Aşağıdaki görsel MCP'nin basitleştirilmiş çalışmasını gösteriyor.
Birçok özel amaçlı ajan, prompt enjeksiyonunun en zararlı sonuçlarını normalde hafifletebilecek koruma mekanizmalarından yoksun. Ve MCP sunucuları her ajan için kimlik bilgileri saklıyor—ajanlar her diğer iç ajanına güvenecek şekilde inşa edildiğinden—LLM tarafından reddedilecek bir istismar başarılı oluyor. Birçok durumda, doğru ajanı hedef alan iyi hazırlanmış istemler, bir web sunucusunun yetkisiz ağ istekleri yapmasına neden olan bir güvenlik açığı olan sunucu tarafı istek sahteciliği SSRF'ye yol açıyor.
"AI ajanları saldırganlara yürünecek yeni bağlantı setleri veriyor," dedi Rapid7'de güvenlik açığı istihbaratından sorumlu yönetici Douglas McKee Ars'a. "Biri içeriğe metin yerleştiriyor, bir ajan onu okuyor sonra normal bir devredilen görev gibi başka bir ajana iletiyor ve ikinci ajan işi kimin verdiğine güvendiği için çalıştırıyor. Zincirdeki her parça tasarlandığı gibi tam olarak yaptığını yapıyor, bu da yakalamayı bu kadar zorlaştırıyor. Her protokol kendi başına yaşadığını varsayarak kuruldu, bu yüzden her biri kendi ön kapısını kontrol ederken kimse aradaki koridoru izlemiyor."
CVE-2026-97228, Mohiuddin'in Rapid7 ağında bulduğu güvenlik açığı, 10 üzerinden yalnızca 2,7 şiddet derecesi taşıyordu. Rapid7 geçen ay düzeltti.
Google'ı etkileyen güvenlik açığı daha ciddiydi, derecesi 8'di. Sorun, veritabanları için bir MCP araç kutusu olan googleapis/mcp-toolbox'un HTTP istemcisini CheckRedirect politikası kullanmadan başlatmasından kaynaklandı; bu ayar dizisi bir URL hata döndürdüğünde veya farklı bir URL'ye yönlendirdiğinde sunucunun nasıl davranacağını kontrol eder. Google'ın HTTP istemcisi ayrıca hedef IP adreslerini doğrulamadı.
"Hazırlanmış bir yol parametresi araç kutusunun bir iç uç noktaya yönlendirmeyi takip etmesine ve saldırgan adına istekler göndermesine neden olabilir," diye açıkladı Mohiuddin. Google'ın düzeltmesi IP aralıkları için bir izin listesi ve engelleme listeleri uygulamayı içeriyordu. "Başlangıçta güvensiz bir temel URL'yi reddediyor, ilk istekte değil. Bu gerçek bir SSRF koruması gibi görünür. Bu aynı zamanda çoğu MCP sunucusunun yaptığı kadar iş değil."
Mohiuddin saldırı sınıfını "protokol pivoting" olarak adlandırıyor çünkü istismarlar bir uygulama veya sunucu MCP'yi bir görevi bir ajana atamak için kullandığında ve ajan daha sonra zararlı talimatları Google'ın ajanlar arası delege için kullanılan Agent-to-Agent A2A protokolü gibi farklı bir iletişim yöntemiyle veya ortaya çıkan standartlar gibi Agent Network Protocol ile başka bir ajana ilettiğinde çalışıyor. Sıklıkla, güven veya yetkilendirme çeviri sırasında etkili bir şekilde kayboluyor. Protokol pivoting'i "bir saldırganın ilk erişimi bir protokol üzerinden elde ettiği, protokoller arasındaki güven varsayımlarını istismar ettiği ve yalnızca farklı bir protokol üzerinden erişilebilen yeteneklere yükseldiği çok adımlı bir saldırı" olarak tanımladı.
X41 D-Sec'te araştırmacı olan ve MCP'yi istismar eden AI saldırıları da geliştiren Markus Vervier, daha iyi terimin "prompt enjeksiyonu" kaldığını ve Mohiuddin'in tekniğinin bunun basit bir alt sınıfı olduğunu söyledi.
"Benim için bu dolaylı prompt enjeksiyonu," dedi Ars'a. "Zararlı istemin farklı bir protokolden gelmesi ve başka bir protokol üzerinden kullanıldığında ortaya çıkması bu tür saldırıların çalışması için kesinlikle gerekli değil. Elbette beklenmedik ve genel olarak azaltması zor."
Pivoting tekniğinin MCP kullanımından başka ortak yanı olmayan beş kuruluşta çalışması dikkat çekici. MCP yeni ve yeterince test edilip sertleştirilmeden her yerde. Kuruluşların genişleyen ajan mimarileri inşa etme telaşında, bir çekirdek güvenlik ilkesi olan sıfır güven'den vazgeçtiler. Bu model altında ağlar, bir veya daha fazla düğümün enfekte olabileceği varsayımıyla kurulur. Etkileri hafifletmek için mühendisler, düğümlerin diğerleriyle hassas işlemler yapmadan önce yetkilendirme gerektirecek şekilde tasarlanmasını sağlar.
"İnsanların alması istediğim ders, LLM'den aracınıza geçen her şeyin internetteki bir yabancının girdisi gibi ele alınması gerektiği, çünkü prompt enjeksiyonu senaryosunda bu tam olarak bu," dedi McKee. "Altındaki hatalar enjeksiyon ve SSRF gibi eski tanıdıklar ve düzeltmeler 20 yıldır değişmedi. Araştırmacıya bir isim koyması için kredi, çünkü bir isim savunmacıların ve standart kuruluşlarının bunun için gerçekten tasarım yapmasını sağlıyor."