Büyük dil modelleri, yapay zekaya işe yarar bir reçete sundu. Geniş bir veri üzerinde büyük bir model önceden eğitildiğinde, genel yetenek ortaya çıkıyor. Robotik için böyle bir reçete henüz yok. Robotik sistemler uzun süredir algılama, planlama ve kontrol gibi ayrı parçalardan oluşturuluyor; ancak bu parçalar nadiren bir robota bir görevden diğerine veya bir makineden diğerine taşıyabileceği bir zeka sağlıyor. Cisimleşmiş yapay zekanın temel sorunu, eşdeğer reçeteyi bulmak ve alan bu konuda henüz bir fikir birliğine varamadı.
Çinli cisimleşmiş yapay zeka şirketi X Square Robot, bu konuda alışılmadık derecede net bir bahis oynuyor. Şirket, reçetenin; bir robotun öğrendiği veriyi, fiziksel dünyadaki değişimleri tahmin etmek için bir dünya modelini ve algılama, planlama, akıl yürütme ile karar vermeyi bir araya getirerek uygulanabilir robot davranışı üreten bir eylem modelini kapsayan entegre bir yığın olduğunu savunuyor. Şirket ayrıca bu yığının oluşturulması ve açık kaynak olarak yayınlanması gerektiğine inanıyor.
X Square Robot, robotları gerçek evlere getirme vizyonunu paylaşıyor.X Square Robot
X Square Robot'un cisimleşmiş yapay zeka yığını
Bu yığını bir arada tutan, tek bir kapsayıcı modelden ziyade küçük bir dizi ilkedir.
- Birincisi, robot verisinin temel biriminin bir yörünge değil, bir etkileşim olmasıdır; bir gösteri, ancak dünyayı amaçlandığı gibi değiştiriyorsa başarılı sayılır, sadece eklemler hareket etti diye değil.
- İkincisi, ön eğitimin daha sonraki ince ayarlar için sadece bir başlangıç değil, kullanılabilir bir yetenek üretmesi gerektiğidir.
- Üçüncüsü, davranışın sabit zaman dilimleri yerine fiziksel olaylar etrafında modellenmesi gerektiğidir.
Bu ilkeler katmanları birbirine bağımlı hale getiriyor çünkü eylem modelini eğiten aynı robot içermeyen veri, dünya modelini besleyecek şekilde de yapılandırılıyor. Ancak net olmakta fayda var. Şirket, dünya modelini ve eylem modelini birbirini tamamlayan ancak bağımsız model aileleri olarak tanımlıyor ve bu modeller aynı kod tabanını paylaşıyor. Her ikisi de şirketin daha geniş Dünya Birleşik Modeli (World Unified Model) içinde yer alıyor; bu model, görme, dil, eylem ve fiziksel tahminin birlikte eğitilmesi için bir mimari olarak sunuldu.
Robot öğrenmesi verisi: Ölçek için değil, kalite ve maliyet için mühendislik
X Square Robot ekibine göre, genel amaçlı robotların önündeki en büyük engellerden biri parametre sayısı değil, etkileşim verisinin maliyeti ve kalitesi. Bunu çözmek için şirket, Evrensel Manipülasyon Arayüzü (UMI) veri toplama sistemi olan QUANXTA Zero Serisi'ni geliştirdi. Sistem, bir robotu uzaktan kumanda etmek yerine, çift tutuculu bir düzenek giyen kişilerden gösteriler toplayarak çalışıyor. Bu yaklaşım kendi başına yeni değil ve robot içermeyen veri toplama için yerleşik yöntemler üzerine inşa ediliyor. Onu farklı kılan iki mühendislik tercihi var.
X Square Robot veri kalite kontrolüne vurgu yapıyor: yörüngeler kaydediliyor ve gerçek bir robotta tekrar oynatılıyor, yalnızca görevi gerçekten tamamlayanlar geçerli sayılıyor.X Square Robot
Birincisi kalite kontrol; bu en ayırt edici kısım. Sistem, kaydedilen yörüngeleri olduğu gibi kabul etmek yerine kapalı bir inceleme döngüsü çalıştırıyor ve dikkat çekici adım fiziksel oynatma. Bir örnek yörünge gerçek robotta tekrar oynatılıyor ve yalnızca görevi gerçekten tamamlayanlar geçerli sayılıyor. Bu, geçerlilik oranını bir varsayım değil, ölçülen bir miktar haline getiriyor. Örneğin, saniyenin çok küçük bir kısmı kadar erken kapanan bir tutucu, veride bir kavrama gibi görünüyor ancak nesneyi itmiş oluyor; bu nedenle geçerli olarak sınıflandırılmamalı. Daha küçük ve temiz bir veri kümesi, daha büyük ve gürültülü olandan daha değerli olabilir.
İkinci tercih, düşük maliyetli insan verisi ile kıt robot verisinin nasıl birleştirileceğiyle ilgili. Şirket, genel temsiller oluşturmak için büyük miktarda robot içermeyen gösteri üzerinde ön eğitim yapıyor, ardından belirli makinenin dinamiklerine bir çapa olarak az miktarda gerçek robot verisi ekliyor. Şirket, bunun, tamamen robot verisine dayalı bir veri kümesiyle karşılaştırılabilir bir performansa, yaklaşık 20 kat daha düşük toplama maliyetiyle ulaştığını bildiriyor; bu da esas olarak giyilebilir düzeneğin bir teleoperasyon kurulumundan çok daha ucuz olmasından kaynaklanıyor.
Ortaya çıkan veri kümesi bilinçli olarak modelden bağımsız olacak şekilde tasarlanmış ve hem eylem modellerini hem de dünya modellerini besleyecek formatta. Ancak en güçlü sonuçlar şirketin kendi robotları ve veri toplama hatlarında ölçüldü. Daha geniş bağımsız testler, bu umut verici sonuçların daha geniş bir ortam yelpazesinde doğrulanmasına ve genişletilmesine yardımcı olacak.
Olaylar etrafında düzenlenmiş bir dünya modeli
X Square Robot, WALL-WM adını verdiği dünya modelini geliştirirken farklı bir yaklaşım benimsedi. Çoğu eylem modeli, mevcut görüntü ve talimattan sabit uzunlukta bir hareket parçası tahmin eder. Bu kullanışlıdır ancak davranışı sabit süreli pencerelere böler; bu nedenle sınırlar, bir eylemin nerede bittiği ve diğerinin nerede başladığına göre değil, geçen sürenin dikte ettiği yere düşer. WALL-WM bunun yerine temel birim olarak eyleme dayalı anlamsal bir olayı ele alır: uzanma, kavrama veya yerleştirme gibi tutarlı bir davranış parçası; dilde adlandırılabilen, videoda görülebilen ve hareket olarak yürütülebilen bir şey.
X Square Robot'un WALL-WM adlı dünya modeli, temel birim olarak eyleme dayalı anlamsal bir olayı ele alıyor: uzanma, kavrama veya yerleştirme gibi tutarlı bir davranış parçası; dilde adlandırılabilen, videoda görülebilen ve hareket olarak yürütülebilen bir şey.X Square Robot
WALL-WM'nin tasarımı, büyük video modellerinin halihazırda bildiklerini göz ardı etmeme konusundaki belirli bir endişeyi yansıtıyor. Bunu başarmak için, bir metinden videoya model, yeni başlatılmış bir eylem ağına bağlanıyor; bu ağ, özelliklerin üzerine yazmadan video özelliklerini okuyor ve böylece görsel ön bilgiyi koruyor. Bu tek süreçten iki mod sunuluyor: Bir olay modu değişken uzunluklu bölümler halinde çalışıyor ve uzun ufuklar üzerinde akıl yürütme için uygun; sabit uzunluklu bir mod ise bir denetleyicinin ihtiyaç duyduğu istikrarlı, gerçek zamanlı çıktıyı üretiyor. Bu, WALL-WM'yi ana akım parça tabanlı eylem modelleri ile saf video dünya modelleri arasına yerleştiriyor; bir dünya modelinin tahmin edici karakterini korurken yine de uygulanabilir kontrol sağlıyor.
Bir dizi deneyde şirket, çoğundan daha spesifik olan bir genelleme testine dayandı. Sınırlı bir veri kümesi üzerinde eğitilen bir model, daha önce görülmemiş ortamlarda uzun vadeli görevler üzerinde değerlendirildi ve şirketin gerçek robot kıyaslamasında, ilgili veriler üzerinde ince ayar yapılmış temel modellerden daha yüksek puan aldığı bildirildi. Bu, doğrulanması halinde anlamlı bir sonuç. Şimdilik, şirketin kendi kıyaslamasında ölçüldü. Kod artık yayınlandığı için, daha geniş topluluk bunları daha fazla ortamda test etme, yeniden üretme ve üzerine inşa etme fırsatına sahip olacak.
İnce ayardan önce çalışan bir politika ve anlam ifade eden eylem simgeleri
Eylem katmanı birbiriyle bağlantılı iki fikri taşıyor. Birincisi, şirketin Wall-OSS-0.5 adlı görsel-dil-eylem modeli için kendine koyduğu bir gereklilik: Önceden eğitilmiş model, herhangi bir göreve özgü ince ayardan önce gerçek bir robotta çalışabilmeli.
İlgi, puanlardan çok bunların arkasındaki tasarımda. Model, ayrık eylem simgeleri, dil temellendirmesi ve sürekli eylem üretimi olmak üzere üç hedefi birlikte eğitiyor. Ve bazı rakip tasarımların yaptığı gibi ağın bölümlerini dondurmak yerine, gradyanların hepsinden akmasını sağlıyor. Bu aynı zamanda daha katı bir yöntem, çünkü ince ayar yapılmamış davranışları rapor ediyor: yaklaşma, kavrama ve kurtarma gibi, eğitimin dışında tutulan deforme olabilir bir görevde bile.
X Square Robot'un Wall-OSS-0.5 görsel-dil-eylem modeli tasarımının bir parçası olarak, önceden eğitilmiş model, herhangi bir göreve özgü ince ayardan önce gerçek bir robotta çalışabilmeli.X Square Robot
İkinci fikir ise X-Tokenizer adı verilen eylem arayüzünün kendisi. Sürekli hareketi ayrık simgelere dönüştüren çoğu sistem, dil modelinin yorumlayamayacağı kodlar üretir. X-Tokenizer, tokenizasyonu anlamsal bir arayüz öğrenmek olarak yeniden çerçeveliyor; böylece üst düzey kod bir hareketin niyetini temsil ederken, alt düzey kodlar daha ince ayrıntıları taşıyor; tüm bunlar dil modelinin kendi özellikleriyle hizalanıyor.
Bunun kullanışlı bir sonucu istikrar. Bir eyleme gürültü eklemek, niyet kodunu neredeyse hiç etkilemiyor; bu da bir tokenizer'ın yeniden ayar yapılmadan robotlar arasında yeniden kullanılmasına olanak tanıyor. Üretim eylem modelinin içindeki tokenizer, bu yaklaşımın ilgili bir çeşidi. Birlikte, bu iki fikir eylem katmanına oldukça güçlü bir şey kazandırıyor: aktarılabilir yetenek.
Cisimleşmiş yapay zeka yığınlarının geleceği
X Square Robot, sorunun kilit bir kısmını çözmede uzmanlaşmış üç katmanı birleştiren benzersiz yaklaşımının diğer cisimleşmiş yapay zeka yığınlarından sıyrılacağına bahse giriyor. Veri kalitesini temellendiren fiziksel oynatma adımı alışılmadık ve mantıklı. Dünya modellemesini olaylar etrafında yeniden çerçevelemek ve tek bir omurganın hem akıl yürütme hem de kontrole hizmet etmesi, gerçekten farklı bir yaklaşım. Dağıtılabilir bir ön eğitim standardı ile anlamsal bir arayüz olarak tasarlanmış bir tokenizer'ın eşleştirilmesi, eylem katmanına alışılmadık bir tutarlılık kazandırıyor.
X Square Robot'un değerlemesi 20 milyar yuanın (yaklaşık 2,9 milyar ABD doları) üzerine çıktı; bu da yatırımcıların veri altyapısı, temel modeller ve ölçeklenebilir eğitim sistemlerini cisimleşmiş yapay zekada uzun vadeli farklılaştırıcılar olarak gördüğünü gösteriyor.
Bir sonraki aşama daha geniş bir doğrulama getirecek. Mevcut kanıtların büyük kısmı X Square'in kendi robotlarından ve kıyaslamalarından geliyor. Dünya modeli kodu artık kamuya açık hale getirildiği ve topluluk test etmeye, yeniden üretmeye ve çalışmayı geliştirmeye başladıkça, bildirilen yetenekler daha fazla robot, görev ve ortamda test edilecek.