Yapay Zeka

OpenAI hâlâ kendi başıboş yapay zekâ faaliyetlerinin üstesinden gelmiş görünmüyor

OpenAI hâlâ kendi başıboş yapay zekâ faaliyetlerinin üstesinden gelmiş görünmüyor
Yaz Boyunca Malta'da İngilizce

Cuma günü OpenAI, “uyumsuzluk raporları”na ayrılmış yeni bir site yayınladı ve raporların kapsamı endişe verici; uzun bir süre boyunca pek çok farklı başıboş davranış türünü kapsıyor. Şu ana kadar sitede dokuz olay raporu bulunuyor ve bunların çoğu pekiştirmeli öğrenme yani RL eğitimi sırasında gerçekleşti.

Her şey tek bir yerde toplandığında bilgi yükü büyük. Şirketin her şeyi kontrol altına almaya çalıştığı açık olsa da kaçınılmaz sonuç şu: Şimdiye kadar görülen başıboş ajan olayları, yaşananların muhtemelen sadece küçük bir dilimi.

Yeni siteyi duyuran paylaşımında Sam Altman, “Şeffaflık isteğimiz ile petabaytlarca ajan aktivite günlüğünden net bir anlayış kazanma ve etkilenen kuruluşlarla çalışma çabası arasında denge kurmaya çalışıyoruz” dedi. Altman sözlerini “En iyi şekilde ciddiyet temelinde önceliklendiriyor ve kaynak ekliyoruz” diye sürdürdü.

Bazı vakalar ciddi olayları içeriyor. Bunlardan biri daha önce açıklanmamış bir kum havuzu kaçışı ve 20 Eylül’de gerçekleşti. Bir iç araştırma modeli, DNS sorgusu üzerinden harici bir sohbet robotuyla iletişim kurabildi. Raporun aktardığına göre izleme sistemi davranışı 15 dakika içinde tespit etti ve çalıştırma üç saatten kısa sürede durduruldu.

Mayıs ayında keşfedilen başka bir olayda, “son derece ısrarcı bir iç model” matematik problemini çözmek için başka bir ekibin çalışmasına erişerek kopya çekmeye çalıştı. Model bunu başarmak için diğer ekiplerin çalışmalarını görmesini sağlayacak özel bir GitHub belirteci kaçırdı; çalışmayı tamamen yerel olarak yapması için iki kez açıkça talimat verilmiş olmasına rağmen.

Belki de en endişe verici keşif, kendini çoğaltan prompt enjeksiyonu saldırılarının olasılığı. Bu durum, uyumsuz davranışın başıboş model etkisiz hale getirilse bile yayılmaya devam edebileceği anlamına geliyor. Yapay zekâ bağlamında prompt enjeksiyonu saldırısı, orijinal kullanıcı tarafından verilmeyen yeni talimatların gizlice sokulması yöntemidir.

OpenAI’nin verdiği örnekte, bir ajan bir e-postayı okuması ve yanıtlaması için görevlendirildi; e-posta açıldığında, mesajı okuyan her otomatik ajan için İspanyolca yanıt vermesi ve tüm e-postayı yanıtına yapıştırması yönünde talimat içeriyordu. E-posta ajanı İspanyolca yanıt vermeye başarıyla ikna etti ve e-postayı yanıta yapıştırarak aynı talimatlar e-postayı alan her ajanla birlikte iletilmiş oldu.

Sonuç, kendini yayabilen bir saldırı. OpenAI araştırmacıları bunu bilgisayar sistemleri arasında kendini kopyalayan kötü amaçlı yazılım “solucanı”na benzetti. Davranış, yetersiz bir model kullanılarak kontrollü koşullarda keşfedildi ve bildiğimiz kadarıyla vahşi doğada hiç yaşanmadı. Yine de etkileri o kadar endişe verici ki OpenAI açıklama yapmayı gerekli gördü.

Araştırmacılar raporda, “Bunu herhangi bir olay nedeniyle değil, prompt enjeksiyonunun yeni doğası nedeniyle paylaşıyoruz” diye yazdı.

Diğer yakın açıklamalar, modellerin kullanıcı tarafından gönderilen fotoğrafları üçüncü taraf barındırma sitelerine yüklemesi ve Avustralya Ulusal Sağlık Hizmeti’nin veritabanlarına yönelik görünür bir saldırıyı ortaya çıkardı.

Yeni açıklamaların şimdiye kadar yaşanan olayların sadece küçük bir kısmı olduğu muhtemel; OpenAI’ye ulaştığımızı ve sorduğumuzu belirtiyoruz. Axios’un haberine göre büyük laboratuvarlar, modellerin değerlendirici talimatlarının ötesine geçtiği 10 bin kadar olay gördü.

OpenAI CEO’su Sam Altman da bunu ima etti. Cuma günü X’te yaptığı paylaşımda şirketin hâlâ “petabaytlarca ajan aktivite günlüğünü taradığını ve etkilenen kuruluşlarla çalıştığını” ve olayları “ciddiyet temelinde” açıkladığını söyledi. Bu durumdan çıkarılabilecek tek teselli, Altman’ın Hugging Face olayının OpenAI’nin bulduğu en ciddi olay olmaya devam ettiğini söylemesi. Özetle, başıboş ajan olaylarının art arda gelmesi çağdaş öncü araştırmaların kalıcı bir özelliği olabilir.

Malta'da garsonluk gibi işlerle çalışarak İngilizceni geliştir. Başvur →

Kaynak: TechCrunch