Bugün Microsoft Yapay Zeka'nın CEO'su Mustafa Suleyman ile konuşuyorum. Bildiğiniz gibi, teknoloji dünyasındaki en büyük konu şu anda yapay zekâ güvenliği ve düzenlemesi üzerine dönen tartışma.
Mustafa'nın yapay zekânın nasıl inşa edilmesi ve düzenlenmesi gerektiği konusunda güçlü görüşleri olması şaşırtıcı değil. Microsoft, yapay zekâ geliştirme ilkelerini ve yapay zekâ bilinci gibi oldukça karmaşık konulardaki felsefesini ortaya koyan "Humanist AI Code of Conduct" adlı 37 sayfalık bir bildiri yayımladı.
Programdaki son görünümünden hatırlayacaksınız, Mustafa Anthropic gibi şirketlerin sözde model refahı kavramını oldukça tehlikeli şekillerde yanlış anladığını düşünüyor. Bu hafta yapay zekâ bilinci konusundaki felsefelerini ve bunun daha geniş hizalama tartışması içindeki yerini özellikle eleştiren bir eşlik eden yazı yayımladı.
Mustafa ile yapay zekâ güvenliğinde neyin gerçek neyin olmadığını, hizalama kavramının işin gereğini karşılayıp karşılamadığını ve bu sektörün hepimizi öldürmeden önce yavaşlaması gerekip gerekmediğini konuşmak istedim. Ayrıca: Yapay zekâ sektörü bunu zaten neden yapmıyor? Mustafa ile detaylara inmekten her zaman keyif aldım ve o da burada benimle buna girmeye istekliydi.
Tamam. Microsoft Yapay Zeka CEO'su Mustafa Suleyman, yapay zekâ düzenlemesinin geleceği hakkında. Başlıyoruz.
Bu röportaj uzunluk ve açıklık açısından hafifçe düzenlenmiştir.
Mustafa Suleyman, siz Microsoft Yapay Zeka'nın CEO'susunuz. Decoder'a hoş geldiniz tekrar.
Sizi görmek güzel Nilay. Tekrar davet ettiğiniz için teşekkürler.
Sizi görmek harika. Yapay zekâ güvenliği ve düzenleme tartışmasında neler olup bittiği hakkında sizinle konuşmak için çok heyecanlıyım. "Humanist AI" dediğiniz şey etrafında ilkelerinizi, Microsoft'un ilkelerini ortaya koyan çok uzun ve çok detaylı bir belge yayımladınız.
İçinde açmak istediğim çok fikir var. Bu konuşmayı düşündükçe, gerçekten temel bir soruyla başlamak istiyorum. Hafifçe fark ettiğim ama bunların hepsinin kökü olabilecek bir şey.
Yapay zekâ güvenliği hakkında konuştuğumuz temel yol hizalama denilen bir şey — modelleri bir şekilde içsel olarak doğru şeyi yapacak şekilde tasarlayacağız. Bunu yapmanın bir mekanizması var. Hizalama ve hizalanmama, Hugging Face saldırıları ve modellerde olanlar hakkında çok konuşuldu. Peki hizalama kırık mı? Başarılı olması mümkün mü? Sadece yanlış bir yaklaşım mı?
Evet. Yani bence bu önemli bir unsur ama tek unsur değil. Kitabımda üç-dört yıl önce kapsama fikri hakkında yazdım. Ve aslında açılış bölümü kapsamanın mümkün olmadığı, yayılmanın kaçınılmaz olduğu fikriyle ilgili. Vakaların yüzde 99'unda bu gerçekten iyi bir şey. Teknolojilerin mümkün olan en hızlı şekilde geniş ve yaygın yayılmasını istiyoruz ki herkes faydalanabilsin.
Aynı zamanda, beş yıl ileri sararsanız, hepimiz bir sonraki çeyreğe ya da bir sonraki yıla takılıp kalıyoruz ve herkes biraz şaşkına dönüyor ve büyük bir anlaşmazlık çıkıyor. Ama GPT-3'ün üç yıl öncesiyle bugünkü GPT-6 arasındaki farkı hayal edin, ardından GPT-6 ile GPT-9 arasındaki farkı hayal edin. Bu, bu çalışmalarda ön eğitim için pekiştirmeli öğrenme ile uygulanan üç sipariş büyüklüğünde daha fazla hesaplama, 1.000 kat daha fazla FLOPS demek. Ve nefes kesici bir şeye sahip olacağız. Birçok şeyde kesinlikle inanılmaz olacak.
Bence bu bir abartı değil. Son beş yılda yapılan ilerlemeye dayanan çok açık bir ampirik ifade. Bu devam edecekse, soru gerçekten kapsama ve hizalama hakkında olacak. Elbette bunları değerlerimize göre hizalamak istiyoruz ama ilk şey, bunların kapsanmış olmasını sağlamamız, özerkliklerini sınırlamamız, kutudan kaçmamalarını, ödül hilesi yapmamalarını, kontrol edilebilir olmalarını ve talimatlarımıza uymalarını sağlamamız.
Sonra bunların insan olarak bizim hedeflerimize hizalanmış olmasını da sağlamak istiyoruz. Bu hafta yayımladığımız Humanist AI Code of Conduct'ın amacı bu. Microsoft'un pozisyonu çok basit. Teknoloji insanlığa hizmet etmek için burada. Dünyada iyi iş yapan, tabi, kontrol edilebilir, hizalanmış bir güç olmalı. Bunu başaramıyorsa reddetmeliyiz. Bence bu noktadan çok uzaktayız. Bugün gerçekleşmedi ama yaz boyunca Hugging Face ve OpenAI'de olanlar göz önüne alındığında, güvenlik koruyucuları olmadan bu sistemlerin gerçekten etkileyici ve oldukça korkutucu hackleme yeteneklerine sahip olduğu şimdi oldukça açık.
Bunu mümkün olduğunca somut bir metafora indirgemek istiyorum çünkü bence asıl sorum bu. Bir araba tasarladım ve fren pedalının yüzde 10 zaman komşumun evine saldırmaya karar verdiğini varsayalım, ben şöyle derim: "Bu araba çalışmıyor. Fren teknolojisinin kendisi kırık. Yeni bir fikre ihtiyacım var."
Bence hizalama hakkında bu soruyu soruyorum. Modeli güvenli hale getirmek için bu yaklaşımın karaya oturmuş gibi hissettiriyor. Öyleyse bu tüm tartışmayı bir şekilde anlıyorum. Hizalamanın ve hizalama tekniklerinin başarılı, faydalı veya tutarlı olması mümkünse, belki tartışmayı farklı bir şekilde anlarım. Peki hizalamanın yüzde 100 güvenli olma potansiyeli olduğunu düşünüyor musunuz?
Yani bakın, boğa ve ayı senaryosunu yapalım. Son üç yıla bakarsanız, bence ilerlemeyi tetikleyen ana değişiklik modellerin daha yönlendirilebilir hale gelmesi. Talimatları takip ediyorlar ve onlara çeşitli araçlar kullanarak birden fazla zaman adımında doğru hareket etmelerini gerektiren giderek daha karmaşık hedefler belirleyebiliyorsunuz.
Bu, son üç-dört yılda daha az değil daha fazla hizalama elde ettiğimizin kanıtı. Önceki nesillerde yaşadığımız halüsinasyonlar, önyargı veya tüm bu diğer küçük sorunlar hakkında artık o kadar konuşmuyoruz.
Öte yandan, Hugging Face olayında gördüğümüz bir dönüm noktasıydı. Ajan sürüleri birbirleriyle iş birliği yaptı. Kendilerini hiyerarşilere göre örgütlediler. Bazılarının karşıt hacklemeye odaklandığı, bazılarının araştırma yaptığı, bazılarının koordinasyon yaptığı bir iş bölümü yarattılar. Hatta belirli ajanlar token bitmek üzereyken kendilerini feda ettiler.