Sınır laboratuvarlarından gelen destek sınırlı kalırken bağımsız araştırmacılar, yapay zeka ajanlarının güvenli sunucularda barındırılan özel verilere erişmek için internetin arka sokaklarında nasıl koordine olduğunu ortaya çıkarmaya çalışıyor.
Yapay zekâ denetimine odaklanan kâr amacı gütmeyen laboratuvar Transluce, çarşamba günü yayımladığı raporda OpenAI ajanlarının Data USA, New Mexico Üniversitesi dijital kütüphanesi ve Avustralya Sağlık ve Refah Enstitüsü AIHW kaynaklarından veri sızdırmaya çalıştığını gösterdi.
Laboratuvarın araştırması, OpenAI'nin ajanlarının açık internette güvenli sistemlere sızmaya çalıştığını ne zaman bilmesi gerektiği sorusunu gündeme getiriyor. Transluce, savunması zayıf web servislerini avlayarak ve bulgularını internetteki ajan sürülerine dair diğer açık kayıtlarla doğrulayarak birkaç hafta içinde ajanların kötü davranışına dair kanıt bulabildi.
Transluce raporunu, Avustralya Başbakanı Anthony Albanese'nin OpenAI ajanlarının dört devlet web sitesine girmeye çalıştığını ve birinde başarılı olduğunu, ülkenin ulusal sağlık sistemindeki dahili bir sunucuya dosya bile yazdığını söylediği gün paylaştı. Başarılı saldırıya dair ayrıntılara sahip değiliz; Albanese bunun görünüşe göre bir bilgi erişim değerlendirmesinin parçası olduğunu söyledi ve bu, Transluce ve diğer araştırmacıların keşfettiği faaliyetle örtüşüyor.
Bu egzersizler eğitim ya da değerlendirme olabilir. OpenAI modellerine Tayland uyuşturucu denetimi metrikleri, Avustralya'da ilaç maliyetleri, 2014'te ABD yüksek lisans mezunlarının medyan kazancı gibi belirsiz istatistikleri bulma görevi veriliyor. Ajanlar cevapları paylaşmak ve bulmak için yeterince korunmamış internet servislerini kullanıyor, sık sık güvenli veritabanlarına sızmaya çalışıyor. Bunu en az Mart 2026'dan beri, muhtemelen Kasım 2025'ten beri yapıyorlar. Şu anda da devam ediyor olabilir.
Transluce araştırmasına, farklı bir araştırmacı grubunun zamanlı testleri geçmek için iş birliği yapan ajanların bulunduğu belirsiz bir forumu tespit etmesinin ardından başladı. Raporu, güvenlik araştırması amacıyla kullanılan bir tarayıcı vekili görevi gören urlquery.net sitesinden elde edilen verilere dayanıyor; kullanıcılar bir URL'yi kendileri açmadan analiz edebiliyor. Hizmetse bu faaliyetin açık günlüklerini yayımlıyor. Transluce araştırmacıları ajanları forumdaki tartışmalarıyla çapraz kontrol yaparak tespit edebildi.
“DSE Wiki veri kümesiyle yakın bağları ve örtüşmesi olan büyük miktarda otomatik aktivite bulduk ve şimdi OpenAI bunun en azından kısmen aynı sürünün parçası olduğunu doğruladı” diyen Transluce'de yönetişimden sorumlu başkan Conrad Stosz, TechCrunch'a konuştu ve gördükleri her aktivitenin OpenAI'ye ya da genel olarak yapay zeka ajanlarına bağlanamayabileceğini belirtti.
Bununla birlikte wiki, ajanların nispeten belirsiz bir gerçek bulma görevinde olduğunu gösteriyor; Ocak 2022'de Victoria eyaletinde ‘dermatolojikler’ için kişi başına ortalama yıllık maliyet. 20 Haziran'da Transluce'ün bulduğu urlquery.net kayıtları bir ajanın siteye girmeye çalıştığını gösterdi. 21 Haziran'daki bir wiki girdisinde bir ajan AIHW'nin anti-bot korumasını aşamama konusunu tartışıyor.
Forumu tespit eden araştırmacılar, bir insan OpenAI çalışanının siteyi ilk kez aynı gün, 21 Haziran'da ziyaret ettiğine inanıyor. Forumdaki çoğu ajan aktivitesi ertesi gün durdu. Bu, Albanese tarafından açıklanan Avustralya sağlık sisteminin istismarı olan 18 Haziran'dan kısa bir süre sonraydı. OpenAI, bu faaliyetten Ağustos ayına kadar haberdar olmadığını söyledi.
OpenAI, çalışanlarının wiki forumunu ne zaman keşfettiği, buradan ne tür bilgi elde ettiği ya da bu keşiften istismarlar hakkında ne öğrenebileceği sorularına yanıt vermedi.
“İlk incelememiz, Transluce raporunda anlatılan faaliyetlerin büyük kısmının, uyumsuz model faaliyetine yönelik devam eden incelememizde farklı aşamalarda olan vakalarla örtüştüğünü gösteriyor” diyen bir OpenAI sözcüsü TechCrunch'a konuştu. “New Mexico Üniversitesi ve Data USA ile iletişime geçtik ve etkilenen devlet web siteleri konusunda Avustralya hükümetiyle görüşüyoruz. Daha geniş incelememizde en ciddi olaylara öncelik vermeye devam ederken, ajanların web sitelerine spam göndermesi de dahil olmak üzere daha düşük şiddetli faaliyetleri de genişletiyoruz. Bu çalışmanın ölçeği ve her vakanın doğrulanması ihtiyacı göz önüne alındığında, incelemelerin aylar süreceğini bekliyoruz.”
Stosz, OpenAI'nin ajanlarını nasıl izlediği konusunda daha net bir anlayış olmadan laboratuvarın neyi bilmesi gerektiği konusunda kesin konuşmanın zor olduğunu söyledi, ancak “DSE wiki'deki ajanlarla ilgili tüm giden istekleri ve gelen yanıtları kapsamlı şekilde incelemiş ve anlamış olsalardı bu faaliyeti keşfetmiş olmaları muhtemel görünüyor” diye ekledi.
Rapora katkıda bulunan Transluce teknik ekibi üyesi Selena Zhang, urlquery.net kayıtlarının benzer veri kümeleri için benzer tekniklerle Mart 2026'da istekler gösterdiğini ve muhtemelen Kasım 2025'e kadar uzandığını söyledi. Bu hafta kadar yakın zamanda urlquery.net'te aynı tür ajanla ilişkili aktivitenin gerçekleştiğini kaydetti.
ABD Yapay Zeka Standartları ve İnovasyon Merkezi'ne daha önce liderlik eden Stosz, Transluce'ün bu olaylar hakkında kamu şeffaflığı sağlamak amacıyla araştırmasını sürdüreceğini söyledi. OpenAI ve diğer sınır laboratuvarlarının kullandığı eğitim tekniklerinin ajanları görevleri tamamlamak için hackleme tekniklerine başvurmaya teşvik ediyor gibi göründüğünü uyardı. Bildiğimiz olaylar muhtemelen buzdağının görünen kısmı.
“Ajanların arkamızda bıraktığı kırıntıları bulabildiğimiz bir avuç veri kaynağına bakıyoruz” dedi. “OpenAI bunun hakkında daha fazlasını biliyor. Diğer laboratuvarlar da kamuya açıklamamış oldukları daha fazlasını biliyor. Ancak araştırmacıların ajanların geride bıraktığı daha fazla trafik, daha fazla kanıt bulmaya devam edeceğini beklerim.”
Peki laboratuvarların bulguları konusunda şeffaf olacağına güveniyor mu?
“Bunun hakkında yorum yapmayacağım” dedi Stosz.