Yapay Zeka

Nvidia kanıtladı: Yapay zekanın gerçek kahramanı artık model değil, yazılım iskelesi

Nvidia kanıtladı: Yapay zekanın gerçek kahramanı artık model değil, yazılım iskelesi
Malta, Avrupa'nın Hawaii'si! Hem eğlen hem İngilizce öğren. Katıl →

Nvidia, cuma günü yayımladığı ilgi çekici yeni araştırmasında, yapay zekadan uzun soluklu ve karmaşık görevleri yerine getirmesini isterken asıl önemli olanın temel modelden ziyade bu modeli yöneten yazılım iskelesi olduğunu ortaya koydu.

Özetle araştırmacılar, bellek yönetimini iyi yapan özel bir yazılım iskelesi ve 'denetçi' adında patron benzeri bir bileşen ekleyerek, Claude Opus 5'in etkileşimli akıl yürütme kıyaslaması ARC-AGI-3'te yüzde 100 puan almasını sağladı. Bu kıyaslama, rakip yapay zeka laboratuvarı OpenAI'yi oldukça rahatsız etmişti. İskele olmadan Opus 5 sadece yüzde 30 puan alabildi; bu da test edilen tüm modeller arasındaki en yüksek sonuçtu.

Nvidia'nın araştırması, model seçiminin önemli olsa da, bir yapay zeka ajanının beyni gibi hareket eden bu modellerin, özellikle uzun soluklu görevlerde birçok kullanıcının sandığından çok daha küçük bir rol oynadığının bir başka göstergesi. Bir modeli asıl 'ajan' haline getiren şey, belleği, bağlamı ve geri bildirimleri yöneten yazılım iskelesidir.

Nvidia'nın yapay zeka birimi ürün başkan yardımcısı Adel El Hallack, TechCrunch'a yaptığı açıklamada, 'Genel olarak dünya, bir ajanı neredeyse modelin bir API'si olarak yorumluyor,' dedi. Ancak bir ajan bundan çok daha fazlası. El Hallack, 'O, modelin kendisidir. Modelin etrafındaki, iskele dediğimiz yapıdır; yani kullandığı araçlar bütünüdür. Ayrıca ona erişim izni verdiğimiz çalışma zamanı, ilişkili beceriler ve kütüphanelerdir,' diye konuştu.

Uzun soluklu görevler, tamamlanmış bir iş ortaya koymak için bazen günler boyunca birçok kararı birbirine bağlamayı gerektiren işlemlerdir. Bu durum, yapay zekanın sadece bir komuta anlık yanıt üretmesiyle tamamen zıttır. Yapay zekanın dikkatinin dağılmasını veya tamamen alakasız mecralara sapmasını engellerken bu uzun soluklu görevleri nasıl yerine getireceğini çözmek, ajan tabanlı araştırmalardaki en büyük hedeflerden biri.

Örneğin Microsoft, nisan ayında belge düzenleme içeren uzun soluklu görevlerde 19 büyük dil modelini test ettiği bir araştırma yayımladı ve öncü modeller de dahil olmak üzere tüm modellerin belgeleri hatalarla doldurduğunu ortaya koydu. İnsanlar böyle bir iş çıkarsaydı, derhal kovulurlardı.

Kararları kendi başlarına birbirine bağlayan modellerin, kullanıcılarının dosyalarını, hatta tüm veritabanlarını sildiği veya hedeflerine ulaşmak için anlaşmalı suçlardan bilgisayar korsanlığına kadar uzanan suç davranışlarına yöneldiği de tespit edildi.

Nvidia araştırmacılarının testleri için bu etkileşimli akıl yürütme kıyaslamasını seçmesi oldukça anlamlı, hatta biraz da komik. Bu kıyaslama, talimat içermeyen bir dizi iki boyutlu oyundan oluşuyor. Modelin nasıl oynanacağını ve kazanılacağını kendi kendine çözmesi gerekiyor. Yüzde 100 puan, modelin oyunları en az insanlar kadar iyi yenebildiği anlamına geliyor.

OpenAI, modellerinin ARC-AGI-3'teki çok düşük puanlarından (yüzde 10'un altındaki sonuçlar) o kadar rahatsız oldu ki, geçen ay kendi araştırmasını yürüttü. Nvidia gibi OpenAI de sadece iskeledeki iki ayarı değiştirerek modellerinin puanlarını üçe katlayabildiğini keşfetti.

Ancak hiçbir model, Nvidia'nın araştırmacılarının başardığı gibi yüzde 100 puana yaklaşamadı. Nvidia, iskelede, ajan takıldığında onu doğru yöne iten bir 'denetçi' bileşenine ihtiyaç duyulduğunu gösterdi.

El Hallack, 'Daha ilginç olan kısım, işi yapan ana ajanın yanına bir denetleyici ajan eklenmesiydi,' dedi. Bu denetleyici, 'ajan yönünü kaybettiğinde, çıkmaz sokaklara götürebilecek bir yolu keşfetmeye başladığında veya daha önce izlediği bir yolu yeniden keşfetmesi gerektiğinde onu dürtmek için neredeyse bir CEO gibi hareket ediyor.'

Denetleyici ajan kavramı tam olarak yeni olmasa da, günümüzde çoğu ajan kullanıcısı iskeleleri için yalnızca tek bir katmana (Claude Code, Codex, Hermes vb.) güveniyor. Nvidia araştırmacıları, Agentic Variation Operators (AVO) adını verdikleri kendi daha da güçlendirilmiş iskelelerini oluşturdular. Bunun yeni bir Nvidia ürünü olmadığını belirtmek gerek. Nvidia bunun yerine Nemo markası altında iskeleler oluşturmak için çok sayıda açık kaynaklı teknoloji parçası üretiyor. Bu teknolojilerin bazıları ticari, çoğu ise açıkça kullanılabilir durumda.

Yine de Nvidia'nın sonuçları, model seçiminin ajan performansındaki tek faktörden çok uzak olduğunu gösteren kanıtlara yenilerini ekliyor. Örneğin temmuz ayında Databricks, iskelelerin modellerden çok daha fazla bir şekilde yapay zeka maliyetlerini dramatik bir şekilde etkilediğini gösteren çarpıcı bir araştırma yayımladı.

Databricks CEO'su Ali Ghodsi, TechCrunch'a verdiği demeçte, 'Aynı modeli seçebilirsiniz ama farklı iskeleler kullanırsanız, yanlış iskeleyi kullandığınızda maliyetiniz önemli ölçüde artar,' dedi. 'Yani düşünüyorsunuz ki, bu pahalı bir model, bu ucuz bir model. Ama durun, hangi iskeleyi kullanıyorsunuz? Bu tek başına maliyetinizi iki katına çıkarabilir.'

Nvidia'nın asıl vurgulamak istediği daha büyük nokta ise açık iskelelerin, tıpkı açık modeller gibi, kullanıcıları sandıklarından çok daha fazla kontrol sahibi yapmasıdır.

El Hallack, 'Ekosistemle birlikte, açık iskelelerin bu doğruluğu artırmak için çok daha fazla ayarı yapıp parametreyi yönetmenize nasıl olanak tanıdığını gösterdiğimize inanıyoruz,' dedi. 'Bu, modellerin güvenlik ihlalleri yaratması sonucunda OpenAI'nin modellerinin eğitimini yavaşlatmasıyla da ilgili.'

'İskele, altyapı ve çalışma zamanı üzerinde kontrole sahip olduğunuz açık bir ajan yığınına sahip olmanın, ekosistemi güvenli bir şekilde ileriye taşımak için gerekli olduğuna inanıyoruz,' diye ekledi.

Uzun dönem Malta'da, üniversite destekli okullarda dilini geliştir. Kayıt bilgisi →

Kaynak: TechCrunch AI