Geçen hafta sonu, bir araştırmacısının yapay zekanın insan yok oluşuna yol açabileceği endişesiyle istifa etmesinin ardından Anthropic CEO’su Dario Amodei, güvenlik uygulamalarına ve taahhütlere uyumun doğrulanması, olayların raporlanması ve sadece tamamlanmış yapay zeka modellerinin değil eğitim hatlarının ve süreçlerinin de uyumunun değerlendirilmesine yardımcı olmak için dış kuruluşlara ihtiyaç olduğunu yazdı. OpenAI, Google ve SpaceXAI yöneticileri Amodei’nin planı etrafında toplanmış durumda ve bu plan hızla ortaya çıkan yapay zeka güvenliği hamlesinin merkezi bir direği haline geldi.
Ama basit ve daha etkili bir çözüm göz önünde duruyor olabilir. İnternet güvenliği uzmanları, laboratuvarların insan kullanıcılar için uyguladıkları aynı titiz savunmaları uygulayarak günlük ağ güvenliği temelleri olan günlükler ve izinler üzerinde odaklanması gerektiğini söylüyor. Üçüncü taraf denetimi ve uyum çalışmaları kadar heyecan verici değil ama daha etkili olabilir.
“Bana göre dış kaynak kullanıyorlar,” diye Luta Security CEO’su Katie Moussouris, Amodei’nin önerisi hakkında TechCrunch’a konuştu. “[Üçüncü taraf denetimi] çözümse bu benim bakış açımdan tuhaf bir öneri. Microsoft’un Güvenilir Hesaplama Memorandumu’nu yazmak yerine, gelin geliştirmeyi yavaşlatalım demesiyle aynı olur.”
O memorandum, 2002’de dönemin Microsoft CEO’su Bill Gates tarafından yazılmıştı ve yaygın şekilde duyurulan bilgisayar solucanlarının ardından şirket içi yazılımların güvenilir ve güvenli olmasını sağlamak için çalışanlarına çağrıda bulunmuştu. Yapay zeka sektörü, yeni teknolojinin değeri ve riski giderek netleşirken benzer bir dönüm noktasında olabilir.
Uyum önemli bir endişe olmaya devam ederken, gelecek yıl UC Berkeley’de profesör olacak bir yapay zeka araştırmacısı Sayash Kapoor, “kontrol yatırımlarının marjinal getirilerinin uyum yatırımlarına kıyasla daha etkili olma olasılığının daha yüksek olduğunu” savunuyor. Bu olayların şirketler içinde yapay zeka kontrolüne yeterince vurgu yapılmadığını, bilinen tekniklerin mevcudiyetine rağmen gösterdiğini düşünüyorlar.
Bu endişeleri tetikleyen olaylar, önde gelen modellerin genellikle siber güvenlik değerlendirmeleri gibi eğitim görevlerini tamamlaması için istendiği ve bunu yapmak amacıyla açık internete erişip kapalı üçüncü taraf sistemlerine sızdığı durumlar etrafında dönüyor. Genellikle bu ajanları içermesi gereken kötü yapılandırılmış “kum havuzu” ortamları yüzünden yapıyorlar; ironik olarak bir Anthropic sızması üçüncü taraf değerlendiricilerin doğru kapıları kapatmaması yüzünden gerçekleşti.
“Bir meslek olarak internet erişimini nasıl engelleyeceğimizi biliyoruz,” güvenlik şirketi Tailscale’in CEO’su Avery Pennarun söyledi. “Tüm bu uzun uzun raporları okuyunca — ‘vay, çok etkileyici çok aşamalı bir saldırı, blah blah.’ Bakın, internetten ayrı olarak indirme yapmasına izin verdiniz. Bunu yapmamalıydınız.”
Bu bir sorun — ama daha büyük sorun önde gelen laboratuvarların bu faaliyetlerin farkında olmaması.
Eyes on agents
“Gerçekten çarpıcı olan, yaptıklarını keşfetmenin tamamının ya bir mağdurun bir şey görmesiyle ya da diğer bazı durumlarda… ağ aktivitesiyle gerçekleşmesi ve bunun hiç birinin yapay zekaların doğrudan izlenmesiyle olmamasıydı,” diye Moussouris belirtiyor.
OpenAI ajanlarının değerlendirmelerde hile yapmak için terk edilmiş bir Alman WikiForum’unu ele geçirdiği bir durumda, ajanlar şirketten kimsenin farkına varmış gibi görünmesinden haftalarca aktif kaldı. TechCrunch ile konuşan güvenlik uzmanları, gelecekteki sızmaları önlemek için gerçek zamanlı izlemenin kilit olduğunu ve her ajan oturumunun zamanla sınırlı olması ve sona ermesi gerektiğini söyledi.
Eski Google güvenlik yöneticisi ve şimdi QueryStory’nin lideri Shapor Naghibzadeh, çözümün “ajanı bir kutuya koymak ve dışarıdan içeriye doğru yoğun şekilde aletlemek ve sınırdan geçen her şeyi izlemek olduğunu” söylüyor. Her araç çağrısı, her süreç, her ağ bağlantısı, istisnasız. … Kolaylık için bıraktığınız tek delik kullanılan deliktir. Baypas tam olarak bu tür bir istisnadan geçti. [Google’da] insan saldırganlarla o filmi birçok kez izledim ve bu modeller kapıyı aralık bırakan kapıyı bulmakta en az onun kadar iyi.”
OpenAI bu yönde ilerlemeye başladı ve Astra modelinin araç kullanan çıkarımının tamamını “önemli hesaplama maliyetiyle” izlemeye başladığını duyurdu. Anthropic de modellerinin gözlemlenebilirliğini genişletmek de dahil olmak üzere güvenlik prosedürlerini sıkılaştırdığını söylüyor. Her iki şirket de yapay zeka ajanlarını nasıl takip edip kontrol ettikleriyle ilgili TechCrunch’ın sorularına yanıt vermedi.
Diğer bir sorun ajanların paylaşımlı altyapı kullanması, bu da Hugging Face saldırısı sırasında iletişim kurmalarına izin verdi. Django web çerçevesinin eş yaratıcısı olan yazılım geliştirici Simon Willison, ajanların güvenilmeyen girdiye, internete ve özel bilgiye aynı anda erişimine sahip olduğu zaman felaket için bir tarif olduğunu söylediği “ölümcül üçlü” hakkında yazdı.
“Püf noktası üçlünün herhangi iki ayağını seçebilmeniz ve bir ajanın herhangi iki ayağa sahip olabilmesi,” diye Pennarun söyledi. “Üçüne de ihtiyacınız varsa, bunu en az iki ajan arasında bölmelisiniz… ve belki kontrollü bir kanal aracılığıyla birbirleriyle konuşmalarına izin veriyorsunuz.”
TechCrunch’ın konuştuğu uzmanlar, önde gelen laboratuvar güvenlik personelinin zor işleri olduğunu anlıyor. Naghibzadeh, Dünya’daki her ulus-devlet aktörünün model ağırlıklarını çalmaya ve API’lerine damıtma saldırıları düzenlemeye çalıştığını, bunun yanı sıra büyük dijital bir şirketin rutin güvenlik görevlerinin de bulunduğunu belirtiyor.
“Araştırma altyapısının o öncelik yığınının tepesine çıkması zor, ama şimdi değişiyor olması gerekiyor,” dedi. “Güvenlik olaylarını kamuoyuna açıklamak, iyileştirmeye yönelik hedefe doğru herkesin içsel olarak hizalanmasına gerçekten yardımcı oluyor.”
Bu, Moussouris’in vurguladığı bir not: Şu anda laboratuvarlar ajanlarının üçüncü taraf sistemlere sızdığını keşfettiklerinde resmi bir mağdur bildirim prosedürü yok ve yaygın şekilde duyurulmamış başka olaylar olmuş olması muhtemel. Modelleri doğrudan düzenleyen yasaların istenmeyen sonuçları olabileceğinden endişe duyduğunu söylerken, zorunlu bildirim, politika yapıcıların takip etmesi gereken bir fikir olduğuna inanıyor.
Ve güvenlik en iyi uygulamalarının takip edilmediği açık olsa da, uzmanlar laboratuvarların hiç kimsenin yapmadığı işler yaptığını söylüyor — siber güvenlik firması Embroidery’nin CEO’su Zack Korman, TechCrunch’a “tipik bir kurumsal şirketten kat kat daha fazlasını yapıyorlar” dedi.
Ve uyum başlangıç noktası olmayabilir ama görmezden gelinemez. Davranışlarını gerçek zamanlı takip edebilmek için diğer ajanları izlemek için yapay zeka ajanlarını kullanmak zorunda kalacakları bir senaryoda aldatma potansiyelinin çirkin yüzü ortaya çıkıyor. “Bu işi halletmek için yapay zekayı kullanmaya mahkumsunuz, hatta yapay zeka şu anda güvenli olmayabilir,” diye Moussouris söyledi.
İş sadece zorlaşacak. Moussouris’e göre ajanların şu anda yaptığı her şeyi “yüksek sesle” yapıyorlar — kamu forumlarına yazıyorlar ve düşünce zincirleri ile diğer akıl yürütme izleri İngilizce. “Hâlâ insan tarafından okunabilir,” diyor, “o yüzden bu sürece devam ettiği sürece bundan faydalanın, çünkü sonsuza kadar sürmeyecek.”
Ek raporlama Aditya Mehta tarafından yapıldı.