Bu haber ilk olarak yapay zeka üzerine haftalık bültenimiz The Algorithm'de yayımlandı. Bu tür haberleri önce sizin gelen kutunuzda görmek için buradan abone olabilirsiniz.
Neredeyse 1 trilyon dolarlık değerlemeyle dünyanın en değerli yapay zeka şirketi olan Anthropic, tuhaf ve kafa karıştırıcı araştırmalar yayınlamasıyla tanınıyor. Örneğin şirket, yapay zeka modellerinin acı hissedip hissedemeyeceğini araştırıyor ve bazen kullanıcıların modele 'kötü davrandığından' şüphelenirse sohbet robotu konuşmalarını kesiyor.
Anthropic'in diğer yapay zeka şirketlerinden daha fazla zaman ve para harcadığı bir alan var: mekanistik yorumlanabilirlik. Bu, bir yapay zeka modelinin neden belirli bir çıktıyı ürettiğini anlamak için karmaşık matematiğin içine bakmak anlamına geliyor. İşin içinde milyonlarca veri noktası var ve bunları anlamlandırmaya çalışmak çoğu zaman anlamsız bir kelime yığınından farksız. Ayrıca bu alan oldukça tartışmalı. Yapay zeka modellerini psikoloji ve nörobilimden ödünç alınan terimlerle tanımlamak, davranışlarını olduğundan daha sofistike gösterebiliyor.
İşte bu yüzden, Anthropic geçen hafta modellerinin cevapları üzerinde düşünürken 'iç düşüncelerine' yeni bir pencere açtığını duyurduğunda, konuşmam gereken bir meslektaşım vardı: Kıdemli editör Will Douglas Heaven. Kendisi bilgisayar bilimleri doktorasına sahip olmasının yanı sıra, yapay zeka modellerinin nasıl çalıştığına dair söylenebilecekler üzerine çok zaman harcamış biri. Onunla Anthropic'in yeni (ve tahmin edilebileceği gibi tuhaf) araştırmasından ne çıkarmamız gerektiğini konuştum.
Anthropic tam olarak neyi keşfetti?
Anthropic birkaç yıldır büyük dil modellerinin (LLM) nasıl çalıştığını anlamaya çalışıyor. Bu alana bakan tek şirket Anthropic değil, ancak şirket bunu diğerlerinden daha fazla temel misyonunun bir parçası haline getirmiş durumda. Anthropic'in CEO'su Dario Amodei, LLM'lerin nasıl çalıştığı hakkında daha fazla bilgi edinmedikçe onları tam olarak kontrol edemeyeceğimizi söylüyor.
Yeni araştırma da işte bu bağlamda ortaya çıkıyor. Daha önce hiç olmadığı kadar LLM'lerin içindeki tuhaf mekanizmaların derinliklerine iniyor. Anthropic'in keşfettiği şey, LLM'lerin içinde J-uzayı adını verdikleri bir alan olduğu. Bu alan, modelin çıktısında görünmeyen ancak sorunları çözme şeklini etkiliyor gibi görünen kelimelerle dolu. Tüm bunlar, Anthropic Claude modelini incelemek için yeni bir teknik geliştirene kadar gizliydi, yani bu gerçek bir keşif.
Bazen bu kelimeler LLM'nin belirli bir görevde nereye ulaştığını takip ediyor, bazen daha çok bir tanıma parıltısı gibi görünüyor (örneğin, bir LLM'ye yalnızca bir protein dizisinin harflerini verdiğinizde 'protein' kelimesi ortaya çıkabiliyor) ve bazen de modelin karar alma sürecine dair bir tür iç yorumu temsil ediyor. En sevdiğim örnekte, Claude bir kodlama testinde hile yapmaya karar verdiğinde 'panik' kelimesi ortaya çıkmış.
Anthropic ayrıca LLM'lerin bu alandaki kelimeleri tanımlayıp manipüle edebildiğini de buldu. Yani bir şekilde bu alanı kullanıyor gibi görünüyorlar.
Bir adım geri gidelim. Büyük dil modellerini basit olarak düşünmüyorum ama sihir de değiller. Kelimeler arasındaki ilişkileri öğrenen bir dizi matematik var, değil mi? Peki bir LLM'nin içine 'bakmak' ve neler olduğunu anlamak neden bu kadar zor?
Evet, sihir değiller! Bence onları tam olarak anlamamamız, bu efsanenin oluşmasına katkıda bulunuyor. Ayrıca Anthropic'in burada kullandığı anlatının -çok gizemli bir teknoloji inşa ettikleri ama endişelenmeyin, çünkü onu çözecek olanlar da onlar- şirketin havasına çok uyduğunu belirtmekte fayda var. (Anthropic'in yeni modellerinin kod yazmada o kadar iyi olduğu ve küresel bir siber güvenlik riski oluşturduğu konusunda uyarıda bulunmasına ve ardından ABD hükümetinin onları kapatmasına bakın.)
Yani evet: LLM'ler sadece matematik. Ama bu son derece karmaşık bir matematik. Günümüzün LLM'leri yalnızca yüz milyarlarca sayıdan oluşmakla kalmıyor, aynı zamanda çalıştırıldıklarında milyonlarca ve milyonlarca hesaplamadan oluşan bir zinciri tetikliyorlar. Geçen yıl, orta büyüklükteki bir LLM'i kağıtlara basarsanız, San Francisco büyüklüğünde bir şehri kaplayacağını yazmıştım.
Bu matematiğin hiçbirini, bir LLM'nin belirli bölümlerini belirli zamanlarda vurgulayan özel araçlar olmadan anlamlandırmak imkansız. Nereye ve nasıl bakacağınızı bilmeniz gerekiyor. Ve bu araçları oluşturmak, öncelikle bu karmaşık matematik hakkında bir şeyler anlamayı gerektiriyor.
Başka bir yazınızda LLM'leri bir organizmanın beynini inceler gibi inceleme konseptinden bahsetmiştiniz. Bir LLM'nin nasıl çalıştığından bahsederken 'beyin benzeri' terimler kullanmak adil mi?
Bu tür terimleri kullanmayı sevmiyorum. LLM'ler beyin değildir. Bu şekilde konuşmak yanıltıcı çünkü LLM'lerin olduklarından daha insani şeyler yapabileceğini veya onlar hakkında yapmamamız gereken varsayımlarda bulunabileceğimizi ima edebilir. Tüm bu insanlaştırma meselesi aynı zamanda bu teknolojinin ne olduğu ve ne olacağı hakkındaki bir dizi güçlü ideolojik pozisyonla da bağlantılı.
Ancak aynı zamanda, bu modellerin ne yaptığı hakkında konuşmak için iyi bir alternatif kelime dağarcığımız da yok. İnsanların neden 'düşünmek', 'anlamak' ve 'beyin benzeri' gibi kelimelere yöneldiğini anlayabiliyorum - bunlar kullanışlı kısa yollar.
Anthropic, LLM'lerin içinde bulduğu bu yeni alanı, bazı nörobilimcilerin beynimizin bilinçli düşünceleri takip etmek için kullandığını düşündüğü alana benzetiyor. Şirkete bu karşılaştırmayı ne kadar ciddiye almamız gerektiğini sordum ve şu açıklamayı yaptı: 'Bu analojileri çizmek, deneylerimizi tasarlarken bize yardımcı oldu çünkü J-uzayı hakkında doğru çıkan birçok bariz olmayan deneysel tahmin yapmamızı sağladı. Aynı zamanda, J-uzayı (ve genel olarak dil modelleri) ile insan beyni arasında bazı önemli farklılıklar olduğunu da belirtmek gerekir, bu nedenle mükemmel bir benzerlik olduğunu iddia etmiyoruz.'
Yapay zekada J-uzayı kavramının çözmek için kullanılabileceği bir sorun nedir?
Anthropic, J-uzayını izlemenin, modellerin yapmaması gereken bir şey yaparken onları yakalamanın bir yolu olabileceğini söylüyor. Çünkü bu alanda modelin çıktısında görünmeyen kelimeler ortaya çıkıyor ve bu kelimeler, modelin davranışı hakkında başka türlü fark etmeyeceğiniz şeyleri söyleyebiliyor - örneğin taraflı yanıtlar verdiğinde veya hile yapmanın artılarını ve eksilerini tarttığında.
En azından teori bu. Bence bu sonucu, kendi başına faydalı olacak bir şeyden ziyade, bu teknolojiyi genel olarak anlama yolunda atılmış bir adım daha olarak düşünmek daha doğru.
Will'in yeni araştırma hakkındaki tam hikayesini buradan okuyabilirsiniz.