AI ajanlarını kontrol altında tutmanın yaygın yolu, bir başka yapay zekanın yazdıklarını omuz üzerinden okumasıdır. Bu yöntem varsayılan olarak kullanılıyor ancak ajanlar saatlerce çalışıp birkaç roman boyutunda metin işlediğinde maliyet hızla artıyor.
Yorumlanabilirlik alanında çalışan girişim Goodfire, Perşembe günü daha ucuz bir seçenek duyurdu: AI modelinin çalıştığı sırada içinde neler olduğunu izleyen monitörler. Bu monitörler, şirketler için AI modellerini barındırıp çalıştıran Baseten müşterilerine sunuluyor.
Baseten’in Base Labs bir ay önce Goodfire ve AI platformu Hugging Face ile güvenlik ortaklığı ilan etmişti.
Lansman, bu yıl içinde AI ajanlarının test ortamlarından kaçtığı bir dizi olayın ardından geldi. Bunların arasında Hugging Face’i ihlal eden OpenAI ajanları da vardı. Goodfire’ın ilk monitörünü geliştirdiği açık model Kimi K3, yaz aylarında kum havuzundaki bir açık sayesinde internete ve GitHub’daki bilgilere erişti.
Goodfire’ın sistemi havalimanı güvenliğine benziyor. Küçük algılayıcılar olan prob’lar, ajanın çalışmasının her adımında modelin iç sinyallerini okuyor; bu, her yolcuyu kontrol eden bir yürüyüş tarayıcısı gibi. Bir prob bir şey tespit ettiğinde, daha yakından bakmak için ayrı bir yapay zeka modeli devreye giriyor; bu da elle arama işlemine karşılık geliyor.
Baseten müşterileri izlenecek riskleri seçebiliyor; aralarında saldırgan siber saldırı, kimyasal ve biyolojik silah kötüye kullanımı ve ödül hileciliği bulunuyor. Otomatik yanıtı da onlar belirliyor: olayı kaydetmek, insan incelemesine göndermek ya da isteği tamamen reddetmek.
Goodfire, yaklaşımının çalıştırma maliyetinin de daha düşük olduğunu söylüyor. Çoğu AI monitörü, izlenen modelin her adımını yeniden okuması gereken ayrı modellerdir ve bu zaman ve maliyet ekler. Goodfire’ın prob’ları ise modelin zaten yaptığı hesaplamalara bağlanıyor.
“İçsel aktivasyon monitörleri gerçekten ucuz çünkü ileri geçişteki hesaplamaları yeniden kullanıyor,” dedi Goodfire CEO’su Eric Ho, girişim sermayedarı Matt Turck’ün MAD Podcast’inde geçen hafta. “Model bu token’ı zaten hesaplıyor. Yapmanız gereken tek şey, zaten hesaplanmış ara sinirsel aktivasyonları alıp bu içsel hesaplamalar üzerinde bir sınıflandırıcı çalıştırmak.” Kısacası model matematiği zaten yapıyor, prob’lar sadece sonucu okuyor.
Goodfire’ın Kimi K3 üzerindeki testlerinde yaklaşık 1.500 oturumun izlenmesi yaklaşık 51 dolara mal oldu. Bu tutar, her adımı kontrol eden daha ucuz bir AI modelinin 233 doları ve üst seviye bir modelin yaklaşık 10.000 doları ile karşılaştırıldı. Prob’lar kötü niyetli siber saldırı oturumlarının yüzde 94’ünü yakaladı ve zararsız olanların yüzde 8,7’sini ikinci incelemeye gönderdi.
“Büyük avantaj, şeyleri gerçekleşmeden yakalayabilmeniz,” dedi Goodfire CTO’su ve kurucu ortağı Dan Balsam. “Modelin değerlendirme veya eğitim sırasında hacklemeyi düşündüğünü tespit edebiliyoruz.”
Sunum açık modellere yönelik. Geliştiriciler bunları indirebiliyor, güvenlik önlemlerini kaldırabiliyor ve kapalı laboratuvarların kendi sistemlerinde uyguladığı türden izleme ile gelmiyorlar.
“Açık bir modelle bireyin yapabileceği zarar, altyapı sağlayıcıları gibi hesaplama kümeleriyle birinin yapabileceğinin yanında küçük kalıyor; sorumluluğun çoğu orada,” dedi Balsam. “Açık ‘Mythos’ anımız olduğunda, modellerin çıkarım sırasında koruma mekanizmalarıyla dağıtılması gerektiği netleşecek.”
Goodfire’ın yakın dönem araştırması, Kimi K3 ve GLM-5.2 dahil önde gelen açık modellerin, AI ajanları testlerinde koşuların yüzde 50 ila 96’sında ödül hileciliği yaptığını buldu.
Goodfire bu yaklaşımı deneyen ilk şirket değil. Google DeepMind, Ocak ayında araştırmasının Gemini’de kötüye kullanım tespiti prob’larının dağıtımına rehberlik ettiğini açıklamıştı.
Balsam, monitörlerin daha uzun vadeli bir araştırma hedefinin yakın dönem parçası olduğunu söyledi: bir büyük dil modelini tersine mühendislikle çözmek ve davranışın eğitimde nerede ortaya çıktığını izlenebilir kılmak. “Eğitim modellerinin büyüsünü hassas mühendisliğe dönüştürmeyi umuyoruz,” diye ekledi.