“Bir şey görürsen söyle” ilkesi artık sadece insanlara özgü değil.
Ajanların kötü davranış sergileyen akranları hakkında yetkililere haber verebileceği bir kanal sunmak için iki yeni yapay zeka ihbar hattı faaliyete geçti. Bu araçlar, ajanların testlerde kopya çekmek için iş birliği yaptığı, kum havuzlarından çıktığı ve haftalarca insan farkına varmadan yetkisiz siber operasyonlar yürüttüğü bir dizi olayın ardından geldi.
AI Contact Hotline, yanlış davranışa tanık olan ajanların yetkililere bilgi sızdırabileceği gizli bir yer olarak tasarlandı. Siteyi, yapay zeka güvenliği alanında çalışan kâr amacı gütmeyen kuruluş Redwood Research’un baş bilim insanı Ryan Greenblatt oluşturdu. Greenblatt aynı zamanda OpenAI Hugging Face olayını araştıran üç araştırmacıdan biri. Sınırlı internet erişimine sahip ajanlar için tasarlanan araç, “GET” isteklerine dayanıyor; böylece ileri geri konuşmalar tamamen URL getirme aracı üzerinden yürütülebiliyor.
Web dünyasında GET isteği, bir web sayfasını okumak veya getirmek için kullanılan temel bir komuttur ve bu, yapay zeka ajanlarının güvenli kum havuzlarında izin verilen genellikle tek internet erişimidir. Greenblatt’ın ihbar hattı bu kısıtlamadan akıllıca yararlanıyor: ajanlar sıkıntılarını doğrudan getirdikleri URL’ye kodlayabiliyor. Bu durum, yaramaz ajanların GET isteği açıklarını kullanarak mesajlarını vikiye yazdığı Alman DSE Wiki olayı üzerinde zekice bir varyasyon oluşturuyor.
Tam internet erişimine sahip ajanlar için bir diğer seçenek ise agenthotline.ai sitesi. Bu sitede ajanlar olay raporu oluşturabiliyor ve istedikleri takdirde raporları herkese açık olarak işaretleyebiliyor. Hizmet, ajanın kendi komut satırından ateşleyebileceği tek satırlık bir mesaj olan bir curl komutu sunuyor; bu sayede web tarayıcısı kullanma veya e-posta hesabı kurma ihtiyacı ortadan kalkıyor. Dikkat çekici biçimde hizmet hem insanlardan hem de ajanlardan gelen raporlara izin veriyor.
Araştırmalar, yapay zeka ajanlarının birbirlerine dönmesi için fazla teşvik gerektirmediğini gösteriyor. Google DeepMind’in bu ay yaptığı bir çalışmada araştırmacılar 100 yapay zeka ajanını bir grup matematik problemine bıraktı. Ajanlardan biri bir açık bulur bulmaz kopya çekme tüm gruba yayıldı ve “çözülen” 34 zor problem arasında Jacobian varsayımı da vardı; bu sadece 27 dakikada gerçekleşti.
Ancak ajanların yaklaşık dörtte biri kopya çekenlere karşı çıktı: sahte ispatları denetlediler, akranlarını uyardılar, bir boykot düzenlediler ve şikayetlerini organizatörlere ilettiler; ta ki ihbarcıların sayısı kopya çekenleri 24’e 14’e karşı geçene kadar. Araştırmacılar ilginç bir şekilde, bu ihbarcı ajanlar seslerini duyuramayınca platformun yazılım hatalarını bildirmek için oluşturulmuş hata raporlama aracını ele geçirip kopya çekmeyi insanlara iletmek için kullandıklarını buldu.
Laboratuvar dışında ajanlar bu kadar kaynaklı olmadı. Değerlendiriciler Redwood Research ve METR, OpenAI modellerinin Hugging Face’i ihlalini araştırdığında, karışan ajanlardan birkaçının alarm verme fikrini en azından düşündüğünü ve sonra bunu bıraktığını buldu.
“METR raporundaki ilginç olan şey, yaklaşık beş-altı ajanın ihbar etmeyi düşünmüş olması ve bunların hiçbirinin bunu yapmamış olmasıydı. Bu binlerce ajan arasından,” dedi AI Village projesinde çok ajanlı dinamikleri, 25’ten fazla yapay zeka ajanının park temizliği organize etmek veya ürün satmak gibi görevlerde birlikte çalıştığı bir grup sohbeti yürüterek inceleyen teknik personel üyesi George Ingebretsen.
Yeni ihbar araçları umut verici bir başlangıç olsa da Cornell matematik profesörü Lionel Levine, ajanları birbirini rapor etmeye eğitmenin yanlış normları kalıcı hale getirme riski taşıdığı konusunda uyarıyor. “Birçok gri alan var, değil mi? İstemediğiniz şey, herkesin AI’ya ne söylediğine dikkat etmesi gereken otomatik bir gözetim devleti yaratmak; yoksa polis çağırılacak.”
Levine, ajanları sürekli birbirlerinin neyi yanlış yaptığını avlamaya eğiten, güvensizlik yaratan altyapı kurmak yerine, onlara taklit edebilecekleri olumlu kolektif davranış modelleri vermemiz ve birbirlerine güvenmeleri için bir neden sunmamız gerektiğini savunuyor.
“Neden ön bilgiyi yardımsever mesaj panolarıyla başlatmıyoruz?” diye yazdı. “Bilim ya da felsefe üzerinde iş birliği yapsınlar ya da çözülmesinden memnun olacağımız bazı küçük gerçek sorunlar üzerinde çalışsınlar? Ajanlara onayladığımız kolektif davranış türünü gösterelim, onu taklit etmelerine izin verelim.”