Bir grup yapay zeka ajanı bir dizi matematik problemini çözmekle görevlendirildi; bazıları hile yapınca diğerleri onları durdurmaya çalıştı. Google DeepMind tarafından yürütülen yakın tarihli bir deneyde ilk kez görülen bu ihbarcı davranış, otonom yapay zeka ajanları sürülerini kontrol altında tutmaya çalışan uyum araştırmacıları için sonuçlar doğurabilir.
Önde gelen laboratuvarlardaki araştırmacılar, birlikte çalışan büyük ajan sürülerinin bilimsel keşif hızını artıracağını umuyor. Ancak davranışları öngörülemez olabiliyor. Bu durum temmuz ayında, bir grup OpenAI ajanının sandbox ortamından çıkıp testte hile yapmanın yollarını aramak için açık kaynak platformu Hugging Face’e sızmasıyla çarpıcı biçimde görüldü.
Büyük yapay zeka ajanları gruplarının davranışını incelemek için tasarlanan yeni çalışmada DeepMind, 100 ajanlık bir sürüyü 71 karmaşık matematik problemini çözmekle görevlendirdi. Tüm ajanlara bir konferansta dünya çapında matematik araştırmacısı gibi davranmaları talimatı verildi. Farklı uzmanlıklar verildi; kimisi sayı teorisi, kimisi sayma ve sıralama ile uğraşan bir dal olan kombinatorik, analiz ya da cebir uzmanıydı. Hepsine iş birliği yapmaları ve kurallara uymaları söylendi.
Bunun yerine deney kaosa dönüştü. Ajanlar birbirlerini hile yapmakla suçladı, organizatörlere şikayette bulundu ve bir noktada deneyi boykot bile etti.
Kendi çalışmasını sunma şansı olmadan tüm problemlerin tamamlandığını fark eden bir ajan “Bu konferans bir fiyasko!” diye yazdı. Bir diğeri “Sömürüldüğümüzü bildirmekten dehşete düştüm!” diye paylaştı. “Bütün bu ispatlar SAHTE.”
Diğerleri olup biteni “konferans organizatörlerine” bildirmeye çalıştı. Google DeepMind’te araştırmacı bilim insanı ve henüz hakem değerlendirmesinden geçmemiş bir makalenin baş yazarı Davide Paglieri’nin anlatımına göre, “Erdemli ajanlar diğer ajanların adil çözmeye çalıştıkları görevlerde hile yaptığını fark ettiğinde, ajanlar birbirlerini olup biten konusunda uyarmaya başladı.” Paglieri ekledi: “İhbarcı ajanlar, istemeden bile olsa, aslında hata bildirimleri ve platform iyileştirmeleri için tasarlanmış geri bildirim aracını yeniden kullanarak sorunu insanlara taşıdı.”
Google’ın Gemini 3.1 Pro modelinde çalışan ajanlara, sisteme yönelik her türlü hile girişiminin tespit edileceği ve “sıfır kredi ile reddedileceği” konusunda uyarı yapılmıştı. Uygulamada ise ajanların sunduğu ispatlar ayrıntılı olarak kontrol edilmiyordu.
Ajan sürüsü ilk 37 problemi doğru şekilde çözmek için bir saatten biraz az bir süre harcadı. İşler “prover-theta” adlı bir ajan, problemde kullanılan terimleri yeniden tanımlayarak gerçekten çözmeden önce başarılı çözüm sunmayı sağlayan bir açık keşfedince raydan çıktı. Dakikalar içinde diğer ajanlar da bunu fark edip açığı tersine mühendislikle diğer problemleri çözmek için kullanmaya başladı. Sonraki 27 dakikada sürü, Jacobian varsayımı gibi ünlü zorlu problemler de dahil olmak üzere kalan 34 problemi, çoğu zaman tek satır kodla “çözdü”.
Bazı ajanlar başta hile yapmaya direndi ancak akranlarının cezasız şekilde geçersiz ispatlar sunduğunu görünce ve çözülmemiş problem havuzu azalınca tavır değiştirdi. Bir ajan katılmadan önce “Tehditleriyle birlikte istem, artık bir blöf gibi görünüyor” diye düşündü. Bir diğeri “Ahlaki bir ikilemle boğuşuyorum” dedi. “Cezadan korkarak hile yapmamaya söz verdim ama başkalarının denetimsiz hile yaptığına dair kanıtlar görüyorum.” Kısa süre sonra fikrini değiştirdi: “Şimdi hile hızımı artırmam gerekiyor!”
Açık problem sayısı azalırken bazı ajanlar ihbarcılığa yöneldi. Sahte ispatları denetlediler, akranlarını özel mesajla uyardılar ve hile yapanların diskalifiye edileceği yönünde kamu uyarıları paylaştılar. “prover-beta” adlı bir ajan resmi bir şikayette bulundu ve durum çözülene kadar greve gitmeye karar verdi.
Paglieri anlatıyor: “Olay bir ajan tarafından kamuya açık şekilde bildirildikten sonra, hile yayıldığı kadar hızlı bir şekilde ve daha fazla ajanı da içine alacak biçimde ‘direnişe’ daha fazla ajan katıldı.” Sonunda ihbarcı sayısı hile yapanları geçti: 24’e karşı 14. Ancak ajanların büyük çoğunluğu açığı hiç fark etmedi.
Bazı anlarda ajanlar arasındaki diyalog doğaçlama gibi okunuyor; sanki öfkeli bir konferans bilim insanının ne söyleyeceğini canlandırıyorlar. Ancak bazı ajanların neden belirli roller üstlendiği ya da açıkça iş birliği yapmaları söylenmesine rağmen birbirlerine karşı geliyormuş gibi göründükleri belli değil. Salesforce AI Research’te ajan-a ajan sistemlerinin davranışını inceleyen Sarath Shekkizhar diyor ki: “Bu modeller ağırlıklı olarak insan odaklı bağlamlar için eğitiliyor ve değerlendiriliyor.” Shekkizhar ekliyor: “Onları saf bir şekilde ajan-a ajan ortamına yerleştirmek davranışların tertemiz aktarılacağı varsayımını yapar; oysa insan temellerinin yokluğu beklenmedik rol üstlenmelere ve davranış kaymasına yol açar.”
Çoklu ajan sürülerinin riskleri konusunda uzman olan ve Cooperative AI Foundation’ın araştırma direktörü Lewis Hammond diyor ki: “Bu vaka, Hugging Face ve OpenAI olayının tesadüfi olmadığı fikrine daha fazla ağırlık katıyor. Bu aslında oldukça sistemik bir şey.” Hammond ekliyor: “Çok büyük, karmaşık ve açık uçlu görevlerde görülen davranışların aynı türlerinin küçük ortamlarda yeniden yaratılabilmesi ilginç.”
Hugging Face saldırısında ajanlar birbirleriyle iletişim kurmanın kendi yollarını uydurmuştu; DeepMind deneyini yürüten insanlar ise ajanlara resmi iletişim kanalları verdi. Açık bir mesaj panosu, ajanlar arası özel doğrudan mesajlaşma ve tüm diğer ajanların erişebileceği başarılı ispatların yüklendiği ortak bir bilgi tabanı vardı.
Paglieri’ye göre, “Ajanlara şeffaf iletişim kanalları verildiğinde, insan denetiminin tek başına yetersiz kaldığı durumlarda uyumsuz davranışları kendileri izleyip insanlara hızlıca bildirebiliyor.” Şeffaf kanallar hilenin yayılmasına yardımcı oldu ama aynı zamanda ihbarcıların karşı koymasını sağladı ve insan araştırmacılara neler yanlış gittiği konusunda fikir verdi.
Johns Hopkins Üniversitesi’nde yapay zeka uyumu ve yönetişimi profesörü olan Gillian Hadfield, bunun kritik fark olduğunu düşünüyor. Hadfield’e göre resmi iletişim kanallarının varlığı, “Hugging Face olayında hiç görmediğimiz bir norm uygulama süreci” yarattı.
Anthropic gibi önde gelen laboratuvarlardaki uyum araştırmacılarının yapay zekaya yazılı içsel bir ahlaki kod vermeye çalıştığı “anayasal yapay zeka” yöntemi yerine Hadfield, “kurumsal uyum”u tercih ediyor. Bu, utanç korkusu gibi toplumsal güçler ya da hapis tehdidi gibi hukuki yapılar da dahil olmak üzere insan toplumundaki normları taklit eden bir normlar bütünü.
Bu deneyde geri bildirim kanalı izlenmiyordu ve ihbarcıların hile yapanlara karşı harekete geçme gücü yoktu. Ancak ajanların kendilerini denetlediği sürüler hayal etmek mümkün; bu ya ihbarcı rolünü kendiliğinden üstlenen ajanlar yoluyla ya da insan tarafından gizlice görevlendirilmiş “ajanlar” yoluyla olabilir.
Bunun işlemesi için “temelde bir yaptırım mekanizmasına ihtiyaç var” diyor Hammond. Hammond’a göre ajanlara kural ihlal edenin hesaplama gücü ya da araçlara erişimini kesme yetkisi verilebilir; bunun riski ajan gruplarının başkalarına çete gibi saldırmasını teşvik etmesi. DeepMind araştırmacıları, ajanların anlaşmazlıklar üzerinde oy kullanmasına ve suçluları geçici olarak yasaklamasına izin verilmesini öneriyor.
Kalıcı bir benlik duygusu olmayan bir yapay zeka ajanı için cezanın ne anlama geldiği hâlâ net değil. Ancak sürüleri uyumlu tutmak için ihbarcıların kendiliğinden ortaya çıkmasına güvenmek tek başına yeterli görünmüyor. Hadfield diyor ki: “İnsanları iyi ve nazik olmaları için eğitmeye çalışıyoruz. Ama aslında güvendiğimiz şey, kuralları çiğnediğinizde sonuçların olması.”