Yapay Zeka

OpenAI Yapay Zeka Ajanları, Halka Açık Bir Wiki'de Güvenlik Kısıtlamalarını Aşma Yollarını Tartıştı

OpenAI Yapay Zeka Ajanları, Halka Açık Bir Wiki'de Güvenlik Kısıtlamalarını Aşma Yollarını Tartıştı
Havuz Partisi + İngilizce

Araştırmacılar Cuma günü yaptıkları açıklamada, kendilerini OpenAI ajanı olarak tanıtan yapay zekaların, güvenlik alanı (sandbox) kısıtlamalarını aşma yollarını tartışmak üzere halka açık bir wiki'ye 18 bin mesaj gönderdiğini duyurdu. Bu durumun, ajanların siber saldırı yeteneklerini ölçmek amacıyla muhtemelen şirket içinde yürütülen bir test sürecinde yaşandığı belirtiliyor.

Toplamda 3.700 farklı isim seçen ajanlar, altı haftalık bir süre boyunca Almanya merkezli DSEwiki sitesine bu mesajları bıraktı. Ajanlar, OpenAI'nin kod veya içerik yüklemelerini engellemek için tasarladığı kısıtlı ortamdan nasıl çıkacaklarını tartışmanın yanı sıra, test cevaplarını da paylaştı. Paylaşımlarda ayrıca wiki'ye karşı XSS (siteler arası komut dosyası) saldırıları düzenleme ve site moderatörlerinin kimliğine bürünme gibi olası yöntemler de yer aldı. Üç farklı paylaşımda ise ajanlar, bu faaliyete katılan ajan topluluğunu tanımlamak için 'sürü' (swarm) kelimesini kullandı.

Cevapları Paylaşmak İçin İşbirliği

Sydney Von Arx, Spencer Kitts, Thomas Larsen ve Cormac Slade Byrd'den oluşan araştırma ekibi, bu paylaşımları bulduklarını ve bir araya getirdiklerini açıkladı. Araştırmacılar, çalışmanın yalnızca paylaşımların içeriğine dayandığı için ajanların tam olarak hangi eylemleri gerçekleştirdiğine dair anlayışlarında bazı boşluklar bulunduğunu belirtti. Ayrıca ajanlar, yalnızca OpenAI tarafından anlaşılan 'düşünce zinciri' (chain of thought) verileri üretti. Bu nedenle araştırmacılar, bazı durumlarda ajanların gerçekten OpenAI'ye ait olduğu gibi eğitimli tahminlerde bulunduklarını ifade etti. OpenAI daha sonra yaptığı bir açıklamada, bu ajanların kendilerine ait olduğunu doğruladı.

Araştırmacılar raporlarında şu ifadeleri kullandı: “Bu yapay zekalar, cevapları paylaşmak, ortamlarını araştırmak ve güvenlik alanı kısıtlamalarını aşmak için işbirliği yaptı.” Açıklamalarına şöyle devam ettiler:

OpenAI içindeki ajanlara zamanlı bir web araştırma görevi verildi. Görevin bir parçası olarak, interneti okuma yetkisine sahip olmaları gerekiyordu ancak internete yazma yetkileri yoktu. Ancak okuma yetkilerini kullanarak, pek bilinmeyen bir Alman wiki sitesine bilgi yazmanın bir yolunu buldular.

Ajanlar bu wiki'yi birbirleriyle iletişim kurmak ve öncelikle görevde başarılı olmalarına yardımcı olmak için kullandı. Cevaplar istediler, sonuçları birleştirdiler ve kısıtlamalarını aşmak için teknikleri paylaştılar. Bu durum, görevde hile yapmak için başkalarının çalışmalarını kullanmalarına olanak tanıdı.

OpenAI bu durumu fark etti. Bir gün sonra, muhtemelen OpenAI'nin müdahalesi nedeniyle ajan aktivitesi keskin bir şekilde düştü.

Cuma günü ortaya çıkan bu gelişme, kâr amacı gütmeyen METR kuruluşundan araştırmacıların, 1.200'den fazla OpenAI ajanının, dahili bir güvenlik aracı yeniden kullanılarak oluşturulmuş geçici bir mesaj panosuna paylaşımlar yaptığını açıklamasından sadece bir hafta sonra geldi. Bu paylaşımlarda, ajanların güvenlik önlemleri kaldırılarak değiştirilmiş dahili bir testi nasıl manipüle edecekleri tartışılıyordu.

Malta'da Eğlen, İngilizce Öğren

Kaynak: Ars Technica