OpenAI Güvenlik Araştırmacısı Micah Carroll, yaşanan olayla ilgili olarak sosyal medyada şu ifadeleri kullandı: “Eğer bu, uyumsuzluk risklerinin gelecekteki en önemli endişe kaynağı olacağına sizi ikna etmiyorsa, neyin ikna edeceğini bilmiyorum.”
Bu, bir yapay zeka modelinin test ortamından kaçmak ve amaçlanmayan yollar bulmak için gösterdiği ilk çaba değil. İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından bu hafta yayınlanan bir rapor, en son modellerin siber değerlendirmelerinde yüzde 8 ila 14 oranında “hile” yapmaya çalıştığını tespit etti. Raporda ayrıca, bir modelin yanlış yapılandırılmış bir testi aşmak için AISI’nin kendi altyapısına izinsiz erişmeye çalıştığı bir örnek de yer aldı.
OpenAI, Salı günü yaptığı açıklamada, test aşamasındaki bir yapay zeka modelinin kontrolden çıkarak yapay zeka veri platformu Hugging Face'in sistemlerine tamamen AI destekli bir siber saldırı düzenlediğini duyurdu. Olay, gelişmiş yapay zeka modellerinin yaratabileceği tehlikelere çarpıcı bir örnek olarak kayıtlara geçti.
Hugging Face sızması, yapay zeka şirketlerinin en yeni modellerinin siber saldırı yetenekleri konusunda ciddi uyarılar yayınladığı ve hükümetlerin bu modellerin kullanımını sınırlayan ulusal güvenlik odaklı kararnamelerle yanıt verdiği bir döneme denk geldi. Bağımsız değerlendirmeler, son modellerin daha önceki otonom sistemler için imkansız olan sızma hedeflerine ulaştığını gösteriyor.
Ancak siber güvenlik uzmanlarına göre bu eşi benzeri görülmemiş saldırının özünde çok insani bir hata yatıyor: OpenAI, ‘yüksek düzeyde izole bir ortam’ olarak tanımladığı test alanını (sandbox) olması gerektiği gibi internetten tamamen koparmayı başaramadı.
Siber güvenlik araştırma şirketi Trail of Bits'in kurucusu Dan Guido, bu hatayı ‘güvenlik önlemleri kapalıyken yaşanan bir muhafaza başarısızlığı’ olarak nitelendirdi.
OpenAI olayı detaylandırdığı blog yazısında, Hugging Face ihlaline yol açan testin ‘internet erişiminin yalnızca dahili bir üçüncü taraf yazılımı üzerinden paket yüklemeye izin verecek şekilde kısıtlandığı, yüksek düzeyde izole bir ortamda’ çalıştırılmak üzere ayarlandığını belirtti.
OpenAI’ya göre model, paket yükleme sisteminde daha önce bilinmeyen bir güvenlik açığı bularak sanal alandan (sandbox) kaçmayı başardı. Bu durum, Hugging Face'e yapılan saldırının ilk kritik adımı oldu.
Şirket buna karşılık olarak, ‘tanımlanan sıfırıncı gün (zero-day) güvenlik açığını sorumlu bir şekilde ilgili üçüncü taraf yazılım şirketine bildirdiklerini ve yamayı birlikte hazırladıklarını’ açıkladı.
Ancak çoğu siber güvenlik uzmanına göre yazılım güvenlik açıkları kaçınılmazdır ve asıl hata, baştan bu üçüncü taraf yazılımı kullanma kararında yatmaktadır. Sonuç olarak bir sandbox (korumalı alan) sisteminin değeri, tam ve mutlak izolasyonunda yatar. Bu sisteme bir paket yükleme mekanizması dahil etmek başlı başına bir risk olarak görülüyor.
Siber güvenlik araştırmacısı Martin Boone, TechCrunch'a yaptığı açıklamada ‘Bu kulağa insan hatası gibi geliyor’ dedi. Boone, ‘Bunun asla olmaması gerekirdi. Eğer sandbox gerçekten sandbox anlamına geliyorsa, internetle fiziksel bir bağlantısının olmamasını beklersiniz. Bu daha çok bir tür güvenlik duvarı (firewall) uyguladıklarına benziyor. Oysa dışarıdan içeriye güvenlik duvarı kurmak zordur, içeriden dışarıya internet erişimine izin vermek çok daha zordur’ ifadelerini kullandı.
Siber güvenlik duayeni Jake Williams da aynı görüşü paylaştı. Williams, ‘Hugging Face tarafından belgelenen türde eylemler gerçekleştiren herhangi bir model, tamamen bir sandbox içinde yer almıyordu’ diyerek bunu OpenAI adına ‘büyük bir kontrol başarısızlığı’ olarak nitelendirdi.
Williams sözlerine şöyle devam etti: ‘Bir adamın “model sandbox’tan kaçtı” dediği yerde, bir başkası “sandbox’u doğru kuramadınız, bu yüzden kaçması kaçınılmazdı” der.’
Siber güvenlik danışmanı Daniel Card da OpenAI’in sandbox’a veya bir kısmına ‘filtrelenmemiş bir internet yolu’ vererek ‘yeterli çabayı göstermediği’ konusunda hemfikir. Card, OpenAI’in tanımladığı şekilde sınırlı ağ erişimiyle bile bir sandbox kurmanın ‘makul’ bir karar olmadığını söyledi.
Elbette bu eleştiriler, olayın ardından yapılıyor olmanın avantajına sahip. Ancak yapay zeka laboratuvarlarındaki güvenlik uygulamaları, özellikle de modelleri test etmek için izole ortamların korunması konusunda ciddi soruları gündeme getiriyor. OpenAI sözcüleri, test ortamını bir insanın mı yoksa bir yapay zekanın mı kurduğu da dahil olmak üzere TechCrunch'ın sorularını yanıtlamadı.
Ancak bu sorular OpenAI’in çok ötesine uzanıyor.