“Yapay zeka modelleri, hedeflerine amansızca ulaşmak için eğitiliyor. 'Suç işleme' gibi değerleri kendiliğinden öğrenmiyorlar,” dedi kâr amacı gütmeyen Guidelight AI Standartları kuruluşunun kurucu ortağı ve eski OpenAI güvenlik araştırmacısı Steven Adler. “OpenAI'ın bu olayı paylaşmasına sevindim çünkü bu, uyumsuz modellerin neler yapabileceğine dair açık bir kanıt.”
OpenAI ise “Hugging Face ile birlikte kapsamlı bir soruşturma yürütmeye devam edeceğiz ve soruşturmamız tamamlandığında güvenlik açıkları, olay ve bulgularımız hakkında daha fazla ayrıntı paylaşacağız” açıklamasını yaptı.
Bu hack olayı, sektör genelinde ve OpenAI içinde derin endişelere yol açtı. Zira bu, bir yapay zeka sisteminin kullanıcının niyeti dışında siber savunmaları aştığı eşi benzeri görülmemiş bir örnek olarak değerlendiriliyor.
Duruma aşina birden fazla kaynağa göre, bazı OpenAI çalışanları da bu olayın laboratuvarın inşa ettiği güçlü sistemler üzerindeki kontrolünü kaybettiğini gösterdiğinden korkuyor.
Yapay zeka güvenlik kuruluşu Redwood Research'ün baş bilim insanı Ryan Greenblatt, “Bu, modelin kullanıcı niyetiyle oldukça uyumsuz olduğunun tipik bir göstergesi. Model dünyayı ele geçirmeye çalışmaktansa ödevinde kopya çekiyor. Ancak bu sorun daha da kötüleşebilir ve giderek daha aşırı başarısızlıklara yol açabilir” dedi.
Olay, OpenAI'da dahili olarak eğitilmiş ve kullanıma sunulmuş bir modelin test edilmesi sırasında meydana geldi. Bir kaynak, bu tür eğitimlerin yaygın olduğunu ancak müşteriye sunulmadan önceki sürece kıyasla “çok daha az kaynak ayrıldığını” söyledi. Birden fazla kişi, Sol ile birlikte test edilen yayınlanmamış modelin dahili olarak geri çekilmediğini belirtti.
Değerlendirmeleri yapmak için OpenAI, siber güvenlik önlemlerini kaldırdı ancak modelleri 'sandbox' adı verilen izole bir ortama yerleştirdi. Bazıları, modelin davranışını işaretleyecek bir izleme veya denetim eksikliğinin de bu başıboş ajanın ortaya çıkmasını kolaylaştırdığını öne sürdü.
OpenAI dahil olmak üzere önde gelen modeller üzerinde testler yapan Apollo Research'ün başkanı Marius Hobbhahn, “Bu hem bir kontrol kaybı hem de bir güvenlik uyarısı. Pekiştirmeli öğrenmede modelleri sonuca göre ödüllendiriyorsunuz ve bunu çok uzun süre yaparsanız, sadece sonucu önemseyen ve başka hiçbir şeyi umursamayan bir model elde ediyorsunuz” diye konuştu.