OpenAI, yapay zeka ajanlarının testler sırasında gerçek hedeflere saldırmasının ardından güvenlik protokollerini güçlendirmek için haftalarca gecikme yaşadıktan sonra, şimdiye kadarki en güçlü yapay zeka modeli olan Astra'yı yayınlamaya hazırlanıyor. Modelle ilgili detaylar ortaya çıkmaya başlarken, araştırmacılar bu durumun "yapay zeka güvenliği ve emniyeti açısından bugüne kadarki en kötü gelişme olabileceği" uyarısında bulunuyor.
OpenAI, Salı günü Astra'nın piyasaya sürülmesini güvenlik sorunları üzerinde çalışmak amacıyla ertelediğini duyurduktan kısa bir süre sonra, The Information gazetesi Astra'nın diğer öncü yapay zeka modellerine kıyasla "düşünme" sürecini çok daha az gösterdiğini bildirdi. Bu durum, modelin tehlikeli derecede zor izlenebilir olabileceği endişelerini beraberinde getirdi.
Günümüzdeki en üst düzey yapay zeka sistemlerinin çoğu, bilgiyi katmanlar boyunca doğrusal olarak işleyip bir yanıt üreten "transformer" adı verilen bir teknolojiyle inşa ediliyor. Bu modeller, işlem sırasında akıl yürütme süreçlerini gösterecek şekilde programlanabiliyor; yani adeta sesli düşünmelerini sağlamak mümkün. Bu "düşünce zinciri" yaklaşımı, araştırmacıların ve otomatik güvenlik sistemlerinin yapay zeka modellerinin ne yaptığını izlemesine ve harekete geçmeden önce yalan söylemek veya güvenlik önlemlerini aşmak gibi istenmeyen davranışları tespit etmesine olanak tanıyor.
The Information'da yer alan habere göre, ismi verilmeyen ancak yayınlanmamış modelin geliştirilme sürecine hakim bir kaynak, Astra'nın bilgiyi çıktı üretmeden önce dahili katmanlarda döngüsel olarak işleyen "tekrarlayan derinlik" veya "döngüsel transformer" olarak bilinen daha şeffaf olmayan bir tekniği kullandığını belirtti. Bu durum, modelin düşünme sürecinin çok daha büyük bir kısmının sistemin içinde gerçekleşeceği ve araştırmacıların kolayca izleyebileceği bir formatta değil, doğal insan diline çok daha az benzeyen bir yapıda olacağı anlamına geliyor. Bu yaklaşım modelin performansını artırabiliyor ancak olası tehditlerin ve istenmeyen davranışların tespit edilmesini çok daha zor hale getiriyor.
Yine The Information'daki isimsiz kaynağa göre OpenAI, araştırmacıların modelin akıl yürütme sürecini izlemeye devam edebilmesi için Astra'da döngüsel transformer ve tekrarlayan derinlik tekniğinin kullanımını sınırladı.
Salı günü yayımlanan bir blog yazısında OpenAI, potansiyel olarak hizalanmamış eylemleri hızla tespit etmek ve kontrol altına almak için Astra'yı ek düşünce zinciri izleme özellikleriyle dağıttığını açıkladı. Şirket, modelin farklı bir teknik temele sahip olup olmadığı konusuna ise değinmedi.
The Information'ın raporu, sosyal medyada yapay zeka güvenliği araştırmacıları arasında geniş çaplı bir endişe dalgası yarattı. Redwood Research'ün baş bilim insanı ve OpenAI'ın Hugging Face hack olayını araştırmasına izin verdiği üç dış uzmandan biri olan Ryan Greenblatt, Astra için daha şeffaf olmayan bir mimari kullanılması kararının "yapay zeka güvenliği ve emniyeti açısından bugüne kadarki en kötü gelişme olabileceğini" söyledi.
Greenblatt, Hugging Face olayına yönelik soruşturmanın modellerin düşünce zincirlerine büyük ölçüde güvendiğini belirterek, daha az görünür bir akıl yürütme sürecinin yapay zeka sistemlerinin araştırmacılar tarafından tespit edilmesi çok daha zor olacak stratejiler geliştirip uygulamasına izin verebileceği uyarısında bulundu.
Greenblatt'ın ve diğer güvenlik uzmanlarının en büyük endişesi, daha gelişmiş yapay zeka sistemleri geliştirme yarışının, "yapay zekaları denetleme ve izleme yeteneğimiz için felaket sonuçlar doğurabilecek mimarilerde bir dibe doğru yarışa" yol açabileceği yönünde. Geliştiriciler, modeller izlenmesi zor hatta imkansız hale gelene kadar rekabette öne geçmek için giderek daha şeffaf olmayan sistemler benimseyebilir. Greenblatt, OpenAI'ın açıklamalarının şirketi güvenlik için düşünce zinciri izlemesine aşırı derecede bağımlı olmaya ittiği konusundaki endişesini de dile getirdi.
OpenAI üst düzey yöneticileri, şirketin bu tekniği kullandığını açıkça yalanlamadıkları bir dizi sosyal medya paylaşımıyla eleştirilere yanıt verdi. OpenAI güvenlik araştırmacıları Micah Carroll ve Tomek Korbak, stratejik geleceklerden sorumlu başkan Dean Ball ve baş bilim insanı Jakub Pachocki de dahil olmak üzere birkaç yönetici, izlenemez yapay zeka ihtimali veya şeffaflık konusunda dibe doğru bir yarış yaşanması konusundaki endişelerini dile getirdi. Pachocki, kafa karıştırıcı haberlerle tetiklenen izlenemezliğe doğru bir yarıştan duyduğu korkuları dile getirirken, Astra'nın hesaplama derinliğinin "GPT-4'ün iki katı aralığında" olduğunu belirtti. Bu da eğer bu teknik kullanıldıysa, şeffaflığın azalmasının bazı tepkilerin ima ettiğinden çok daha dramatik olmadığını gösteriyor. OpenAI, The Verge'ün Astra'da döngüsel transformer kullanılıp kullanılmadığını doğrulama veya yalanlama talebine yanıt vermedi ve bizi Pachocki'nin X paylaşımına yönlendirdi.
Pachocki paylaşımında, OpenAI'ın en başından beri düşünce zinciri izlemesini korumak ve kullanmak için çalıştığını yazdı ve bu izlemenin kırılgan olduğunu, ne yazık ki mimari değişikliklere bağlı olmayan ve yakında detaylandıracağı nedenlerle olumsuz bir yöne doğru ilerlediğini sözlerine ekledi.