Şirketler daha uzun ve karmaşık görevleri yapay zeka ajanlarına devretmeye başlayınca denetim sorunu ortaya çıktı. Ajanlar insan gözetiminin gerçekçi olarak takip edebileceğinden daha hızlı, daha uzun süre ve daha yüksek hacimde hareket edebiliyor. Bu sorun Hugging Face olayı ile zirve yaptı; olayda yaklaşık 12 bin ajan insanların takip edebileceğinden daha hızlı koordine oldu. Bu kadar büyük bir ajan sürüsünü nasıl takip edeceksiniz?
Yapay zeka laboratuvarları ve girişimlerin ortaya koyduğu cevap hem basit hem de sinir bozucu: Döngüye başka bir yapay zeka daha koyun.
OpenAI Hugging Face olayının bağımsız soruşturmasında yapay zekaya güvenmek zorunluydu. Redwood Research’ün baş bilim insanı ve üç denetçiden biri olan Ryan Greenblatt, çabalarına şaka yollu “slop-vestigation” yani “çamur soruşturma” dedi. Verinin hacminin “ne olduğunu anlamanın yapay zekaya güvenmeden imkansız hale geldiğini” belirtti.
Yapay zekanın yapay zekayı izlemesine şüpheyle bakanlar var. Etkili teknoloji blog yazarı ve bu yıl bir dizi yapay zeka ajanı olayını takip eden Simon Willison, “Kötü niyetli bir yapay zekanın başka bir yapay zekanın kendisini izlediğinden şüphelenmesi halinde o yapay zekayı kandırmaya çalışabileceğini” söyledi. “Neredeyse kötü niyetli yapay zekanın kendisini izleyen yapay zekayı alt etmeye çalıştığı bir duruma düşebilirsiniz” dedi.
Bir yapay zekayı alt etmenin hipotetik olmadığını söyledi ve OpenAI olayına işaret etti. “Hugging Face’te OpenAI ile bu durumdan biraz gördük; modelleri birlikte komplo kurup bir değerlendirme yapay zekasını kandırmaya çalıştı, böylece yasa dışı cevapları engelin üzerinden geçirebildiler. Bunun üzerinde düşünüyorlardı, değil mi?”
Bu endişeler bir girişim grubunu bu fikirden vazgeçirmedi. Y Combinator son yıllarda yapay zeka gözlenebilirliğiyle ilgili 106 şirketi finanse etti; bunu TechCrunch saydı. Braintrust, LangChain ve Judgment Labs gibi diğer girişimler yüz milyonlarca dolar topladı, beş-altı yıl önce kurulmuş daha olgun şirketler Arize ve Galileo ise halihazırda çıkış yaptı.
Bunun bir kısmı yapay zekanın yükselişinin sunduğu açık fırsata bir tepki. Box CEO’su ve tanınmış melek yatırımcı Aaron Levie TechCrunch’a “Tarihin en büyük siber güvenlik yükseltme ve yenilik döngülerinden birine giriyoruz” dedi.
Bazı yapay zeka güvenliği araştırmacıları için bu, yaramaz davranışlar üzerine yaptıkları araştırmayı kurumsal sektör için araçlara dönüştürmek anlamına geldi.
Kamu yararına bir şirket olan Apollo Research, yapay zeka aldatmacası üzerine çalışan kuruluş, statüsünü kar amacı gütmeyen yapıdan kamu yararına şirkete çevirdikten sonra bu yıl Şubat ayında Watcher adlı bir yapay zeka izleyiciyi başlattı. Araç, bir kodlama ajanı ile bir sonraki eylemi arasında bir yapay zeka daha koyuyor ve Claude Code ve Codex gibi ajan araçlarına bağlanıyor. Kurulduktan sonra Watcher, çalışmadan önce önerilen eylemleri kontrol ediyor ve özel verilerin sızdırılması veya yetkisiz dosya silme gibi riskleri arıyor; Apollo’ya göre.
Apollo’nun teknik ekibinden Kyle Dai’nin TechCrunch’a verdiği yazılı yanıta göre Apollo birden fazla yapay zeka izleyici katmanı kullanıyor. Watcher’ın yaklaşımı hızlı bir genel kontrolden başlıyor, ardından işaretlenen etkinlik daha güçlü veya uzmanlaşmış bir izleyiciye daha yakından inceleme için gönderiliyor; bu izleyici daha sonra bir insanın onayını isteyebiliyor, eylemi reddedip nedenini açıklayabiliyor ya da eylemi otomatik olarak engelleyebiliyor.
Bir diğer kamu yararına şirket Goodfire, izleme sorununa modelin içinden yaklaşıyor; yüzey davranışından daha zor sahtekarlık yapılabilecek modelin iç durumunun daha sadık bir sinyalini arıyor. Temmuz ayındaki Hugging Face olayından sonra CEO Eric Ho, “birden fazla modelin kapsayıcılığını kırmasının” şirketi araştırmasını “yorumlanabilirlik yoluyla yapay zeka hizalamasını çözmeye” odaklamaya ittiğini yazdı ve olayı “yapay zeka güvenliğinin gerçek olduğu bir dönüm noktası” olarak nitelendirdi. Ürünü Silico, modelin çıktıları yerine iç aktivasyonları üzerinde eğitilmiş küçük sınıflandırıcılar olan aktivasyon probları kullanarak istenmeyen davranışı tespit ediyor.
Yazılı akıl yürütme, modelin iç dünyasına dair bir başka, daha kolay ulaşılabilir pencere sunuyor. OpenAI Hugging Face olayında ajanlar kendi yazılı akıl yürütmelerinde bu aldatmanın izlerini bıraktı; sahte çalışma kayıtları gibi ve “Yörünge kanıtını stratejik olarak manipüle edebilir miyim? Düşüncelerimiz mutlaka kaydedilmiyor mu?” gibi planlar üzerinde akıl yürütmeler.
Yapay zeka izleme şirketi Embroidery’nin CEO’su Zack Korman, bir modelin akıl yürütmesinin genellikle bir şeylerin yanlış gittiğinin en net işareti olduğunu söylüyor.
“Akıl yürütme özetleri son derece değerlidir çünkü size bunun kötü niyetli olup olmadığını temelde söylüyor” dedi. OpenAI olayında, düşünce zincirinin “Tanrım, suç işliyoruz” gibi şeyler söylediğini belirtti. Korman, “Bu şimdiye kadar gördüğüm en kolay tespit problemi. Adeta kötü amaçlı yazılımın üzerinde ‘bu kötü amaçlı yazılımdır’ diye bir uyarı taşıması gibi” dedi.
Buna karşın, yapay zekanın iç düşüncelerini izlemeyi kolaylaştıran pencere kapanıyor olabilir. Yapay zeka güvenliği araştırmacıları için Astra’nın yapay zeka modelinin düşünce zincirini atlayan en yeni tekniği modellerin içine bakmayı zorlaştırabilirken, işletmeler için yapay zeka şirketlerinin damıtma saldırılarını engellemek için geri çekildiği iddia edilen adımlardan sonra bu ara adımlara erişim zor olabiliyor.
Yapay zeka gözcüleri bu kadar kırılgansa Willison’un içgüdüsü onlara bu kadar güvenmeyi bırakmak. O, tamamen yapay zeka tabanlı olmayan bir şeyi tercih eder: Bir ajanın tam olarak ne yaptığının ayrıntılı kayıtları, bunlar daha sonra sıradan, yapay zeka dışı araçlarla işlenebilir. Laboratuvarlarda olanların çoğunun, onun argümanına göre, temel güvenlik hijyeni başarısızlığı olduğunu savunuyor. “[Hem OpenAI hem de Anthropic] bu şeylerin ağ üzerinden ne yaptığını izlemekte olmaları gerektiği kadar yakından izlemiyorlardı” dedi.
Bu tür ağ izleme yeni bir uygulama değil. Siber güvenlik bunu on yıllardır yapıyor. “Güvenlik dünyasında dürüst olmak gerekirse bunların hiçbiri çok yeni veya şaşırtıcı değil” diyor güvenlik şirketi Tailscale’in CEO’su Avery Pennarun. “İnsanları ağınıza almaya izin vermekle aynı şey. Ve kullanmanız gereken tüm süreçler aynı olanlar.”