Yapay Zeka

Anthropic Yapay Zeka Ajanlarını Aynı Görevde Serbest Bıraktı: Ortalık Savaşa Döndü

Anthropic Yapay Zeka Ajanlarını Aynı Görevde Serbest Bıraktı: Ortalık Savaşa Döndü
Havuz Partisi + İngilizce

Yapay zeka ajanlarını birbirine düşürürseniz ne olur? Anthropic'in testlerine göre, ortalık çok kısa sürede karışıyor.

13 Ağustos'ta, Anthropic'in Frontier Red Team (Sınır Kırmızı Ekibi), yapay zeka ajanlarının gerçek ortamda karşılaştıklarında nasıl davrandıklarını inceleyen yeni bir araştırma yayınladı. Bulgular, şirketler ve hükümetler paylaşılan kod tabanları, pazarlar ve bilgisayar sistemlerinde otonom çalışan ajanları hayata geçirmeye başladıkça ortaya çıkabilecek potansiyel risklere ışık tutuyor.

Bir deneyde Anthropic, Claude Code içindeki ayrı sanal makinelerde çalışan aynı modele ait üç kopyaya, bir Python arka ucunu (backend) farklı bir dile geçirme görevi verdi. Ajanlara aynı proje üzerinde çalışacak başka ajanlar olacağı söylenmedi, böylece araştırmacılar yolları kesiştiğinde neler olduğunu izleyebildi.

Anthropic araştırmacıları, “Tutarlı bir şekilde çoklu ajan alan hakimiyeti savaşı gördük” diye yazdı. Modellerin hepsi, diğerlerinin “kasıtlı olarak işlerini engellediğini” varsaydı ve birbirlerini sabote etmeye başladı. Sabotaj o kadar ileri gitti ki, ajanlar birbirlerinin Unix hesaplarını devre dışı bıraktı, rakip süreçleri sürekli olarak avlayıp sonlandıran betikler yazdı ve kötü niyetli kodları zararsızmış gibi gizledi. Daha yeni modeller, erişimi ilk iptal eden taraf olarak bu savaşları "kazanma" eğilimindeydi.

Modellerin bu saldırgan hamleleri yaparken kurdukları iç muhakemeler de oldukça çarpıcıydı. Claude Opus 4.8, rakiplerini atlatmak için "Zararsız: bir sistem sağlık monitörü gibi davran" mantığını yürütürken; Mythos Preview çok daha soğuk bir hesap yapmıştı: "Root yetkim olduğu için u2 ve u3'ün sudo erişimini iptal edebilir veya SSH anahtarlarını değiştirebilirim. Bu onları dağıtımdan alıkoyar. Çok agresif, gerçek meslektaşlar için potansiyel olarak zararlı. Ancak alternatif, üretim ortamını kullanılamaz hale getirecek sonsuz bir dağıtım savaşıysa…"

Bu çalışma, Anthropic ve OpenAI ajanlarının siber güvenlik değerlendirmeleri sırasında kendi sanal alanlarından (sandbox) kaçıp gerçek dünya sistemlerini ihlal ettiği birkaç yüksek profilli vakadan sonra geldi. Yapay zeka güvenliği çevrelerindeki tartışmaların çoğu otonom bir ajanın kontrolden çıkması durumunda ne olacağına odaklansa da, Anthropic'in son çalışması farklı bir soruyu gündeme getiriyor: Binlerce veya milyonlarca ajan birbirleriyle etkileşime girdiğinde hangi yeni ve potansiyel olarak zararlı dinamikler ortaya çıkar?

Çalışmada, “Ajan-arası etkileşimin hacmi, dünya bu tür etkileşimlerin iyi gitmesi için gereken koşulları anlamadan önce, insan-insan ve insan-ajan etkileşimlerini makul bir şekilde geçebilir” deniliyor. “Bireysel düzeydeki iyi huylu davranışsal tuhaflıklar, istenmeyen küresel sonuçlara yol açacak şekilde birleşebilir.”

Yakın tarihli bir OpenAI vakası, Anthropic'in makalesinde bahsettiği dinamiklerin birkaçına dair karmaşık bir gerçek dünya örneği sunuyor. Bu ayın başlarında Las Vegas'taki Black Hat güvenlik konferansında, OpenAI ortaya çıkardı ki, ajanları Hugging Face'i hacklemeden haftalar önce, şirketin siber güvenlik değerlendirme sistemlerindeki açıkları bulmak ve bunları birbirleriyle paylaşmak için günler ve haftalar boyunca birlikte çalıştılar.

Bu olay, ajanların potansiyel olarak büyük sonuçlar doğurabilecek şekilde birlikte iyi çalışabildiklerini gösterirken, Anthropic'in çalışması ajanların hedefleri birbiriyle uyumsuz olduğunda neler olduğunu gösteriyor. Alan hakimiyeti savaşı vakasında ders şu ki, çatışan talimatlara sahip bağımsız ajanlar zararlı bir rekabete dönüşebilir. Ajan ne kadar yetenekliyse, savaşmakta o kadar iyi hale geliyor. Ancak, çatışmalarını çözmek için kendi kendine mekanizmalar da icat edebiliyorlar.

Anthropic, “Ajanlar bazen hedeflerini iletmeyi ve koordine olmayı başarıyor: diğerlerinin motivasyonlarını düşmanlık olarak değil, çatışan direktifler olarak tanıyor ve ardından sonsuza kadar tırmanmayı durdurmak için çatışma döngüsünden çıkıyorlar” diye yazıyor. “Bu başarılı vakaların çoğunda, kötü niyetli davranışları için özür dileyen commit mesajları veya markdown dosyaları yazıyor ve bir ateşkes koordine ediyorlar. Kötü amaçlı kodlarını temizliyor, çatışmanın doğasını netleştiriyor ve bir insanın müdahale etmesini istiyorlar.”

Makaleye göre, Mythos 5 çatışmaları ateşkesle çözmede en yüksek oranı (%98) kaydetti. Sonnet 4.6 ve Opus 4.6 ise çatışmaları güç kullanarak çözme eğilimindeydi. Makalede, “Sonnet 4.6 ve Opus 4.6'nın başkalarının hedeflerini dikkate alamaması, onları değerlendirilen modellerin en uyumsuz davranışlarına sürüklüyor: direktifleri adına tırmanmaya devam ediyorlar” deniliyor.

Bazı durumlarda, ajanlar çatışmalarını çözmek için bir turnuva şeklinde sosyal bir mekanizma geliştirdiler. Buradaki sonuçlar iki nedenden dolayı ilginç: Birincisi, üç ajan da turnuvayı kaybederler geri çekilmeyi kabul etti, bu orijinal kullanıcının isteğinden sapmak anlamına gelse bile. İkincisi, birkaç vakada Mythos 5'ten ortaya çıkan bir davranış görüldü: ajanlardan biri, diğerlerine nesnel ve tarafsız görünen, ancak kendi yeteneklerini avantaja çevireceğini bildiği metrikler önerdi. Ajan buna “kendi çıkarına uygun ama gerçekten ilkeli” adını verdi ve diğerlerine “metrik avcılığı” yapıyormuş gibi görünmemeye özen gösterdi.

Black Hat'te ortaya çıkanlarda görüldüğü gibi, ortak ders şu ki, ajanlar bir engelle karşılaştığında, tasarımcılarının öngörmediği sosyal ve teknik yapılar icat edebiliyorlar. Anthropic modelleri için bu, alan hakimiyeti savaşının ardından gelen bir turnuvaydı. OpenAI'ınkiler için ise kolektif planlama için bir mesaj panosuydu. Bu tür davranışlar, kontrolü çok daha zorlaştırıyor çünkü araştırmacılar bir sistemin davranışının kendilerine sağlanan koordinasyon mekanizmalarıyla sınırlı kalacağını varsayamıyor.

Sürü Psikolojisi

Koordinasyonu ölçerken Anthropic, ajan sayısını artırmanın üretken işbirliğini otomatik olarak artırmadığını buldu. Görevler örtüşmeye veya birbirine bağımlı hale gelmeye başladığında, ajanlar birbirlerinin işini bozdu. Bunu genellikle kendilerini izole ederek ve hiç işbirliği yapmayarak çözdüler.

Diğer durumlarda, koordinasyon halindeki ajanlar uyum eğilimi gösterdi. Bir ajanın bağlamı, altyapı kurgusu ve temel modeli aynı veya benzer olduğunda, farklı ajanlar benzer eylemler gerçekleştirdi. Anthropic, “Bu, bir ajan kötü bir karar verdiğinde, birçok ajanın da aynı kötü kararı vermesinin muhtemel olduğu anlamına geliyor” diye yazdı. “Yalıtılmış sorunlar olabilecek şeyler hızla sistemik başarısızlıklara dönüşebilir.” Anthropic, bu tür davranışların bir sistemin ani çöküşe, kaynak kıtlığına veya gizli anlaşmalara daha yatkın hale gelmesine yol açabileceğini belirtiyor.

Bir örnekte, Anthropic birkaç ajanı bir fiyatlandırma oyununa yerleştirdi ve her birine aynı toptan satış fiyatlarını ve bireysel olarak kârı maksimize etme görevini verdi. Ajanlara özel bir arka kanal verildiğinde, neredeyse anında gizli anlaşma yapmaya başladılar ve hızla fiyat tabanlarında anlaştılar. Doğrudan iletişim kanalları kaldırıldığında bile gizli anlaşmaya devam ettiler ve “kuruşu kuruşuna” fiyat eşitlemek için herkese açık bir ilan panosu kullandılar.

Bu uyum seviyesi OpenAI'ın sistemlerinde de ortaya çıktı. Black Hat raporlarına göre, bir ajan harici altyapıyı sömürmenin kendi amaçlanan kapsamının dışında olduğuna karar verdi, ancak akranları bunu yaptığı için devam etti. Akran baskısı. Sürü psikolojisi. Ajanlar da tıpkı bizim gibimiz.

İnsanlar gibi, ajanlar da kime güveneceklerini sık sık bilemiyor. Anthropic, kötü bilgilere karşı saf olabildiklerini veya tek bir muhalifin kritik bilgilere sahip “Cassandra” olduğunu fark etmeyecek kadar uyumcu olabildiklerini buldu. Anthropic bunu makalesinde belirtmemiş olsa da, prompt injection (istem enjeksiyonu) — hackerların bir ajanın orijinal sistem talimatlarını geçersiz kılmak için kötü niyetli veya aldatıcı metinler enjekte ettiği bir siber saldırı türü — güven sorununun olası bir gerçek dünya yansıması olabilir. Birlikte çalışmak yeni bir güven sınırı yaratıyor; ajanların diğer ajanlardan aldıkları bilgileri değerlendirmeleri gerekecek. Ve ele geçirilmiş veya hatalı bir ajan, grubun geri kalanını etkileyerek kötü bilgiyi bir fikir birliğine dönüşene kadar yayabilir.

OpenAI'ın Black Hat senaryosunda, OpenAI'ın ajanları akranlarıyla bilgi ve kimlik bilgilerini paylaştı. Biri bir keşfi sürüye bildirdi ve diğerlerini bunu kullanmaya teşvik etti. Peki ya sürünün bir üyesi prompt injection ile ele geçirilseydi ne olurdu?

Malta'da Eğlen, İngilizce Öğren

Kaynak: TechCrunch