Yapay Zeka

Kandırılmayın—büyük dil modelleri akıl yürütmez

Kandırılmayın—büyük dil modelleri akıl yürütmez
Malta'da dil eğitimi alırken çalışma hakkınız da var, biliyor muydunuz? Detaylar →

2016 Mart'ında Seul'de bir öğleden sonra, birlikte inşa ettiğim bir programın Go tahtasının beşinci satırına bir taş koyduğunu izledim; bu, insan rakibine bir hediye gibi görünüyordu. Beş maçlık serinin ikinci maçındaki 37. hamle o kadar absürd görünüyordu ki bazı yorumcular bunun bir programlama hatası olduğunu düşündü.

Öyle değildi. AlphaGo oyunu kazandı ve nihayetinde tüm zamanların en büyük profesyonel Go oyuncularından biri olan Lee Sedol'u 4-1 mağlup etti. Lee daha sonra şöyle dedi: "AlphaGo'nun olasılık hesaplamasına dayandığını ve sadece bir makine olduğunu düşünüyordum. Ama bu hamleyi görünce fikrimi değiştirdim. Elbette AlphaGo yaratıcı."

Deep Blue 1997'de o dönemin dünya satranç şampiyonu Garry Kasparov'u yendiğinde, bunu oyuncu başına altı ila sekiz hamle öncesini inceleyerek ve saniyede 200 milyon satranç pozisyonunu değerlendirerek başardı; kuralları insanlar elle kodlamıştı. Go çok daha karmaşık bir oyun. Bir taşın değeri, uzak grupların ve bölgenin onlarca hamle boyunca nasıl geliştiğine bağlı. Olası sonuçların yalnızca bir kesirini bile hesaplamak bir süper bilgisayara milyarlarca yıl alırdı. Kazanmak için AlphaGo'nun bir bakışta kim önde olduğunu sezmesi ve hiç insan tarafından düşünülmemiş hamleler bile icat etmesi gerekiyordu.

İşte bu yüzden AlphaGo'nun Lee'ye karşı maçındaki 37. hamlesi saf makine içgörüsünün bir parıltısı olarak anlatılır. Ama bu bir yanlış anlamadır. Bu yaratıcı seçim aslında AlphaGo'nun akıl yürütme gücünün ürünüydü ve bu güçler günümüzün yapay zekasında yok. Gelecekteki yapay zeka sistemlerinin bilim ve tıp gibi alanlarda güvenilir sonuçlar ve gerçekten yeni içgörüler üretmesini istiyorsak, onlara bu tür gerçek akıl yürütme yetenekleri kazandırmamız gerekiyor.

AlphaGo iki sistemden oluşuyor. İlki, politika ağı, güçlü bir insanın oynayacağını tahmin etmeyi öğrendi. Bu "sezgisel" kısım 37. hamleyi olağanüstü görmüyordu; bir uzman insanın oynama olasılığı yaklaşık onda binde olan bir hamleydi. AlphaGo'nun onu seçmesini sağlayan şey programın arama mekanizmasıydı; bu mekanizma anlık olasıktan öteye bakıyor ve önerilen hamlelerin gelecekteki sonuçlarını tartıyordu. Binlerce dalı olan açık bir oyun ağacı inşa ediyor ve her biri farklı bir olası geleceği temsil eden her dalı arıyordu.

Davranış bilimlerinde yaygın bir teori, Daniel Kahneman tarafından popülerleştirilen, insan düşüncesinin iki modu arasında ayrım yapar: Sistem 1 hızlı, içgüdüsel, zahmetsiz; sistem 2 yavaş, adım adım ve derinlemesine. AlphaGo bu ayrımın çarpıcı bir makine benzerini sundu. Ağları sezgileri sağlıyordu—bu hamle umut verici görünüyor, bu pozisyon kazanılmış görünüyor—ve arama bu sezgileri takip edecek hamle ve karşılıklarla test ederek derinlemesine düşünmeyi sağlıyordu. İnsan bilişinde olduğu gibi, iki yarı da tek başına çalışmıyor. Sezgi tek başına 37. hamleyi seçmeyecek, körü körüne arama da çok sayıda olası hamleyi eleyemeyecekti.

Bu, günümüzün yapay zeka modellerinin çalışma şeklinden çarpıcı biçimde farklı. Bir büyük dil modeli, defalarca bir sonraki token'ı seçer. Bu, sistem 1'in eylemde olması demektir—hızlı, ilişkilendirici ve insanların yazdığı hemen her konuda şaşırtıcı derecede iyi bir örüntü tamamlama.

ChatGPT'nin çıkışından kısa süre sonra alan, dil akıcılığının gerçek kullanışlılığın yetersiz kaldığını fark etti. Görünürdeki çözüm, modellerin derinlemesine düşünmesini sağlamaktı: Artık hemen cevap vermek yerine, bir sorunu parçalara ayıran, kısmi sonuçları ileriye taşıyan ve sonraki akıl yürütmeyi etkileyen ara adımlar üretebiliyorlar; bu sürece zincirleme düşünme deniyor.

Kazançlar gerçek oldu, özellikle matematik ve kodlamada. Ama AlphaGo'nun aramasının aksine bu, gerçekten ayrı bir akıl yürütme mekanizması getirmez: Ara akıl yürütme yine aynı bir sonraki token tahmin süreci tarafından üretilir, model cevap vermeye karar vermeden önce daha uzun süre yinelemeye tabi tutulur.

Chatbotların yaptığı şeyin bir bilim insanının tanıyacağı anlamda akıl yürütme olarak nitelendirilmesini engelleyen üç eksiklik var. Birincisi, bu modeller tipik olarak açık, kalıcı ve incelenebilir bir epistemik durum sürdürmez. Modelin hangi hipotezleri değerlendirdiğini, çeşitli açıklamalar hakkındaki güvenini, tarttığı kanıtları ve elinde tuttuğu çözülmemiş soruları ortaya koyan açık bir defter yoktur; tüm bunlar yeni bilgi geldikçe sistematik olarak revize edilmelidir.

İkincisi, sistemin ne bildiği ile bu bilgiyi nasıl işlediği arasında temiz bir ayrım yapmazlar. Bilgi ve akıl yürütme, sinir ağının ağırlıklarında iç içe geçmiştir; bağımsız, açıkça temsil edilmiş bir inanç kümesi yoktur. Üçüncüsü, chatbotların ürettiği düşünce zincirleri derinlemesine düşünmeye benzese de araştırmalar botların bunları çoğu zaman sonradan uydurduğunu gösteriyor; bir yolla cevap buluyor ama başka birini rapor ediyor.

Bu bir sorundur çünkü hepsinin umursadığı yüksek riskli uygulamalarda, tıp, mühendislik ve bilimsel araştırmada olduğu gibi, bir sistemin ne sonuç çıkardığı kadar nasıl vardığı da önemlidir. Hatalar olduğunda—örneğin tıbbi teşhis ve tedavide—neyin yanlış gittiğini tespit edebilmemiz gerekir: Sistemin akıl yürütmesi mi hatalıydı, geçersiz kanıta mı dayandı, yoksa yanlış varsayımlar mı yaptı?

Bu yüzden yakın zamanda Google DeepMind'deki görevimden ayrıldım. AlphaGo'nun mimarisinden ilham alan yeni bir makine akıl yürütme yaklaşımına ihtiyacımız olduğuna inanıyorum. AlphaGo, bir pozisyon hakkında ne bildiğinin kaydını tutar: oyun ağacı. Bu veri yapısı, AlphaGo'nun değerlendirdiği tüm varyasyonları, olası gelecekleri içerir ve her hamle ile pozisyon sinir ağları tarafından yapılan yargılarla etiketlenir. Akıl yürütme ilerledikçe AlphaGo oyun ağacını günceller ve sonunda içindeki bilgileri sentezleyerek hangi hamleyi yapacağına karar verir.

Benzer şekilde, genel akıl yürütme için bir sistem, sistemin neyi kesin olarak bildiğini, neyi şüphe ettiğini, neyi eleyebileceğini ve hangi soruların açık kaldığını temsil eden bir epistemik durum sürdürmelidir. Akıl yürütme daha sonra bilgiyi ilerletmek ve belirsizliği azaltmak için epistemik durumu değiştiren bir dizi hamle olarak anlaşılabilir: sonuçlar çıkarmak, sorunları parçalara ayırmak ve—en önemlisi—hangi sorunun sorulacağına, hangi hesaplamanın yapılacağına ya da hangi deneyin yürütüleceğine karar vermek.

Elbette açık dünya akıl yürütmesi Go veya satranç gibi bir masa oyununu oynamaktan daha zordur. Gerçek dünyada mevcut durum yalnızca kısmen bilinir, mevcut eylem kümesi büyük ve değişkendir ve eylemlerin sonuçları stokastik ya da bilinmez.

Ama büyük dil modelleri ve diğer sinir modellerindeki son gelişmeler artık bu tür genel akıl yürütme sorunlarını üstlenme kapasitesini bize veriyor. Örneğin büyük dil modelleri, bilinenler ve mevcut kaynaklar temelinde bir soruna yaklaşmanın yollarını önerebilir. API'ler veya kod aracılığıyla araçlarla etkileşime geçebilir ve bir iddianın mevcut kanıtlar tarafından desteklenip desteklenmediğini değerlendirmelerine yardımcı olabilir.

En önemlisi, sistemi dürüst tutmak için sistemin bağımsız bir parçası her hamleyi gerçekten belirsizliği ne kadar çözdüğüne göre değerlendirmeli ve inançlar yalnızca değişim kanıtla desteklendiğinde güncellenmelidir. Bu kurallar uygulandığında model sertifikalı bilgi biriktirebilir ve geçmiş akıl yürütme deneyimlerinden öğrenerek akıl yürütme politikasını iyileştirebilir. Böyle bir sistemi, sorgulanmaya dayanabilecek bilgi üretmeyi amaçlayan steroidli bilimsel yöntem olarak düşünebilirsiniz.

Güvenilir makine zekasına sistem 1'i büyütmekle ulaşılmayacağına inanmıyorum. Ölçek sezgiyi keskinleştirir ama sezgiyi daha derinlemesine düşünür hale getirmez. 37. hamle önemliydi çünkü bir makine bir pozisyonu elinde tuttu, olası gelecekleri tarttı ve yapay içgüdülerinin muhtemelen reddedeceği hamleyi seçti.

Toplum, ilaç keşfi, malzemeler, iklim, teşhis gibi alanlarda bu tür yaratıcı hamlelere ihtiyaç duyuyor—tahta bir Go tahtasına benzemeyen ve kimseye kuralları vermeyen alanlar. Bu içgörüleri ancak akıl yürüten sistemlerden alacağız; sonuçları ikna edici bir hikâyenin sonradan anlatılmasından değil, denetlenebilir bir kanıt, çıkarım ve inanç revizyonu dizisinden doğan sistemlerden.

Thore Graepel, University College London'da makine öğrenimi başkanıdır. DeepMind'de AlphaGo ekibinin temel üyesiydi ve yapay zekanın insan gelişimine fayda sağlamasını sağlamak için çalışıyor.

Gün Batımı, Kokteyl, İngilizce

Kaynak: MIT Technology Review