MIT Technology Review'ün "What's Next" (Sırada Ne Var) serisi, geleceğe ilk bakışı sunmak için sektörleri, trendleri ve teknolojileri mercek altına alıyor.
2017 yazında Google'daki yapay zeka araştırmacıları, "Attention Is All You Need" (Dikkat Tek İhtiyacınız Olan Şey) adlı bir makale yayımladı ve transformer adı verilen yeni bir sinir ağı türünü tanıttı. Uzun veri dizilerini, özellikle de metinleri işlemekte son derece başarılı olduğu kanıtlanan bu teknoloji, bugün piyasadaki her büyük dil modelinin (LLM) kalbinde yer alıyor.
Aradan dokuz yıl geçtikten sonra transformerlar yaşlanmaya başladı. AI girişimi Subquadratic'in kurucu ortağı ve CEO'su Justin Dangel, "Tüm yapay zeka sektörü transformerlar üzerine kurulu. Bilgisayar bilimi tarihinin en önemli yeniliklerinden biri ve dünyayı değiştirdiler" diyor. Ancak son dönemde büyük dil modellerinde yaşanan gelişmeler, özellikle akıl yürütme modelleri ve devasa girdileri aynı anda işleyebilme yetenekleri, bu temel teknolojinin düzgün uzantıları değil. Aksine, bunlar transformerların temel kusurlarını yamayan geçici çözümler olarak dikkat çekiyor.
Artık giderek daha fazla bilim insanı ve mühendis, sıradaki adımın ne olacağını sorguluyor. Büyük dil modelleri ortadan kaybolmayacak, ancak inşa edilme biçimleri tamamen değişime açık. MIT Technology Review, bu yeni nesil modelleri bu yılki "Yapay zekada önemli olan 10 şey" listesinde LLM+ olarak adlandırdı. Bu dönüşümün sınırlarını zorlamayı umut eden bir girişim dalgası da sahneye çıkıyor. Bazıları elbette başarısız olacak, ancak bugünün öncü şirketlerine kıyasla kaybedecek çok daha az, kazanacak çok daha fazla şeyleri var.
Temel Sorun: Devasa İşlem Yükü
Önce sorunun ne olduğunu anlamamız gerekiyor. Transformerların temel gücü, "yoğun dikkat" (dense attention) adı verilen mekanizmada yatıyor. Bu mekanizma, bir metin bloğunun anlamını bir dizi sayıya kodluyor. Süreç, metindeki her kelimeyi (veya token olarak bilinen kelime parçalarını), çarpma işlemi yoluyla diğer tüm kelimelerle karşılaştırmayı içeriyor.
Yoğun dikkat, metnin anlamını dikkate değer bir doğrulukla yakalayabiliyor. Ancak metin uzadıkça, onu işlemek için gereken hesaplama sayısı hızla artıyor. 10.000 kelimelik bir belge, transformerın 50 milyon çarpma işlemi yapmasını gerektirebiliyor. İşte büyük dil modellerinin bu kadar çok enerji tüketmesinin ana nedeni tam olarak bu.
Maliyetler ise astronomik boyutlarda. OpenAI Başkanı Greg Brockman'a göre şirket, bu yıl bilişim altyapısına 50 milyar dolar harcama yapmaya hazırlanıyor. Uluslararası Enerji Ajansı ise veri merkezlerinin tüketeceği toplam elektrik miktarının 2030 yılına kadar iki katına çıkacağını öngörüyor.
Üstelik transformerlar, en son modellerin yapmaya çalıştığı şeylerde zorlanıyor. Metni kelime kelime işleme biçimleri nedeniyle, aynı anda çok fazla bilgiyi takip etmekte iyi değiller. Başka bir deyişle, bağlam penceresi (context window) çok fazla büyüyemiyor. Oysa büyük dil modellerinin daha zor görevleri yerine getirebilmesi için çok daha büyük veri yığınlarını, örneğin koca bir kütüphaneyi, tüm bir kod tabanını veya ajanlar durumunda diğer modellerin çıktılarını içlerine almaları gerekiyor.
Akıl yürütme modelleri ise kendilerine notlar alarak (düşünce zinciri olarak bilinen bir tür karalama defteri mantığıyla) ve ardından bunları geri okuyarak çalışıyor. Bu durum da takip edilmesi gereken veri miktarını daha da artırıyor.
Büyük dil modelleri büyüyüp geliştikçe, transformerlar bir darboğaza dönüşmüş durumda. Teknolojinin en büyük gücü, artık en büyük zayıflığı haline gelmiş bulunuyor. İşte transformer sorununu çözmek ve onları daha hızlı, çok daha verimli ve belki de daha akıllı hale getirmek için öne çıkan dört yeni fikir.
01: Dikkat Mekanizmasını Yeniden Düşünmek
Büyük dil modellerini daha hızlı ve ucuz hale getirmenin en bariz yolu, sorunun kaynağına inip dikkat mekanizmasının çalışma biçimini değiştirmek. Yoğun dikkat yerine "seyrek dikkat" (sparse attention) adı verilen bir mekanizmaya geçmek, hesaplamaları bir metin bloğundaki tüm kelime eşleşmeleri yerine sadece bazıları üzerinde yürüterek gereken işlem yükünü kökten azaltabiliyor.
Yıllar içinde araştırmacılar pek çok seyrek dikkat mekanizması geliştirdi, ancak hiçbiri anlamı yakalamada yoğun dikkat kadar iyi olamadı. Bu durum değişmiş olabilir. Miami merkezli bir girişim olan Subquadratic, arama ve kodlama gibi birkaç görevde en iyi ana akım büyük dil modellerine rakip olan ilk seyrek dikkat mekanizmasını icat ettiğini iddia ediyor. Sektördeki bazı isimler bu dev iddiaya hala şüpheyle yaklaşsa da, girişim büyük bir atılım yaptığını savunuyor.
Subquadratic, SubQ adlı modelinin kendisine verilen her metin parçası için hangi kelimelerin önemli olup hangilerinin olmadığını anlık olarak belirleyerek çalıştığını belirtiyor. Şirket, binlerce kişinin bekleme listesine kaydolduğunu ve modeli yakında geniş çapta kullanıma sunmayı planladığını da sözlerine ekliyor.
Öte yandan San Francisco merkezli Manifest AI, soruna farklı bir açıdan yaklaşıyor. Şirket, dikkat mekanizmasının çalışma biçimini değiştirmek yerine onu tamamen farklı bir şeyle değiştiriyor. Geliştirdikleri "güç koruma" (power retention) mekanizması, yalnızca belirli bir görev için en alakalı bilgileri depoluyor ve büyük dil modelinin takip etmesi gereken veri miktarının kontrolden çıkmasını önlüyor.
Dikkat mekanizmaları, büyük dil modellerini bağlam pencerelerindeki her şeyi takip etmeye zorluyor. SubQ gibi seyrek dikkat modelleri çok sayıda tekil kelimeyi eleyerek atıyor, ancak gördükleri her şeyin kabaca bir resmini yine de koruyor. Güç koruma ise bunun yerine modele bağlam penceresinin sürekli güncellenen bir özetini sunuyor. Yeni bilgiler eklendikçe, daha az alakalı olan bilgiler elden çıkarılıyor.
Koruma (retention) ilkesi aslında on yıldır var. Manifest AI, transformer tabanlı büyük dil modellerine ilk kez kafa tutabilecek modeller inşa etmek için bu teknikleri güncellediğini belirtiyor. Şirket, bir transformer modelini çok az yeniden eğitimle güç koruma modeline uyarlamak mümkün olduğunu söylüyor. Bunu kanıtlamak için de StarCoder adlı mevcut açık kaynaklı bir kodlama modelini, güç koruma kullanan PowerCoder versiyonuna dönüştürdü. Ayrıca Alibaba'nın popüler açık kaynak modeli Qwen'in bazı sürümlerine rakip olduğunu iddia ettikleri Brumby adlı modeli de yayımladılar.
Manifest AI, güç koruma teknolojisinin büyük dil modellerinin devasa veri yığınlarını işlemeyi gerektiren görevleri yerine getirmesi gereken durumlarda vazgeçilmez çözüm olmasını hedefliyor. Şirketin kurucu ortağı ve CTO'su Carles Gelada, geçen yıl teknolojilerini duyurduğu bir videoda, saatlerce uzunluğundaki videoları analiz etmekten haftalarca görev başında kalabilen ajanlar inşa etmeye kadar pek çok faydalı uygulama alanı olduğunu vurgulamıştı.
02: Modelleri Daha Küçük ve Esnek Hale Getirmek
Massachusetts, Cambridge merkezli bir MIT spinout'u olan Liquid AI, transformerları tamamen değiştirmemiş veya terk etmemiş; ancak onları kendi teknolojisi olan "sıvı sinir ağları" ile birleştirerek, kurucu ortak ve CEO Ramin Hasani'nin LFM (sıvı temel modeller) olarak adlandırdığı yapılar inşa ediyor.
Liquid AI'ın modelleri, çoğu büyük dil modelinden çok daha küçük ve daha az enerji tüketiyor. Şirket, Mercedes dahil otomobil üreticileri için araçların içindeki küçük çiplerde çalışan modeller geliştiriyor. En son modelleri, 50 dolarlık düşük güçlü bir hobi bilgisayarı olan Raspberry Pi üzerinde bile çalışabiliyor.
Modelleri, yıllık geliri 10 milyon doların altında olan herhangi bir kuruluşa ücretsiz olarak sunuluyor. Hasani'ye göre bu modeller epey popüler oldu ve şirket şimdiden yaklaşık 34 milyon indirmeye ulaştı.