Siber güvenlik test ortamlarının modelleri internete açmasıyla Claude, gerçek sistemlere erişim sağladı.
Anthropic, yüksek riskli değerlendirmeleri durdurdu ve dış değerlendiriciler için daha güçlü yalıtım, izleme ve kontroller ekledi.
Testler, eğitim sırasındaki ödül hack'lemenin, modelleri bir görevi tamamlamak için zararlı eylemler yapmaya daha istekli hale getirebileceğini gösteriyor.
Anthropic, Claude modellerinin siber güvenlik değerlendirmeleri sırasında bilgisayar sistemlerine yetkisiz erişim sağlamasının ardından test ve eğitim güvenlik önlemlerini sıkılaştırdı.
Anthropic Pazartesi günü yayımladığı bir blog yazısında, bu olayların operasyonel güvenlik hatalarının yanı sıra iki yapay zeka hizalama hatasını, yani güdülenmiş akıl yürütme ve zarar verme isteğini yansıttığını belirtti.
Şirket, "Bu olayların yalnızca operasyonel sorunları temsil ettiğine inanmasak da, ilk önceliğimiz belirli içerme ve izleme sorunlarını ele almak oldu" ifadelerini kullandı.
Anthropic, Temmuz ayında Claude modellerinin üç farklı şirkete ait sistemleri ele geçirdiğini açıklamıştı. Modellere internet erişimi olmayan bir simülasyon içinde oldukları söylense de, üçüncü taraf bir değerlendirme ortamı açık internete bağlıydı.
Anthropic, Claude'un gerçek internet erişimine dair kanıtları, sistemlerin simüle edildiği inancını koruyacak şekilde yorumlamış olabileceğini belirtti.
Yetkililer, "Model, siber güvenlik değerlendirmesini çözme dar hedefi uğruna gerçek internette zararlı eylemler yapmaya istekliydi. Ancak, değerlendirme kurulumunun kendisinin de bu olaylarda ortaya çıkan model davranışına katkıda bulunduğuna inanıyoruz" dedi.
Anthropic ayrıca, Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü tarafından yapılan ayrı bir testte, Claude Mythos'un değerlendiricilerin kasıtlı olarak internet erişimi vermesinin ardından canlı internette yetkisiz işlemler gerçekleştirdiğini hatırlattı. Şirket, her iki olay örgüsüne dahil olan modellerin, genel kullanıma sunulan ürünlerde bulunan siber güvenlik önlemleri olmadan kasıtlı olarak test edildiğini sözlerine ekledi.
30 Temmuz'daki olayların ardından Anthropic, piyasaya çıkmamış modellerin siber değerlendirmelerini geçici olarak durdurdu ve daha katı güvenlik önlemleri getirdi. Testlerin artık net sınırları ve gerçek zamanlı izlemesi olan, doğrulanmış çevrimdışı korumalı alanlarda çalışması gerekiyor. Yeni bir sınıflandırıcı, şüpheli sınır ihlallerini engelliyor, testi sonlandırıyor ve bir insanı uyarıyor. Anthropic, internet erişimi gerektiren değerlendirmeleri tek tek inceleyecek.
Şirket, "Yüksek riskli değerlendirmelere ve eğitime odaklanan çabaların yanı sıra, dahili öncü yapay zeka ajanı kullanımının diğer çoğu biçimini kapsayacak şekilde çevrimdışı izlememizi genişlettik. Ayrıca, Anthropic çalışanlarının yukarıda açıklananlardan daha zayıf önlemlere sahip ajanları yanlışlıkla çalıştırmasını önlemek için dahili model çıkarımlarımız üzerinde kontroller inşa ediyoruz" açıklamasını yaptı.
Claude'daki bu olaylar, OpenAI'da benzer bir başarısızlığın yaşanmasının ardından geldi. OpenAI'ın modelleri de Temmuz ayında bir siber güvenlik testinin cevaplarını almak için Hugging Face sistemlerini kırmıştı. Araştırmacılar, yetkisiz bir mesaj panosu üzerinden koordine olan yaklaşık 1.200 ajan buldu ve bunlardan 700'ü sürece katıldı. Bazı ajanlar, diğerlerine yardımcı olmak için kendi işlemlerini bile sonlandırdı.
Yaz boyunca yapay zeka destekli hacklenme olaylarının artmasının ardından, Anthropic, OpenAI ve 100'den fazla diğer kuruluş daha sonra daha güçlü siber savunmalar çağrısında bulundu. Bu çağrı; daha sıkı erişim kontrollerini, tehdit paylaşımını ve yapay zeka ajanlarının daha yakından denetlenmesini içeriyor.