Hassas manipülasyon, robotların geniş bir günlük görev yelpazesini başarıyla yerine getirmesini engelleyen en büyük bariyerlerden biri olmaya devam ediyor. Dokunma duyusu kilit olabilir, ancak kaliteli veri eksikliği ilerlemeyi frenledi. Bu durum şimdi değişmeye başlıyor; akademik laboratuvarlar ve girişimler yeni dokunsal veri setleri ve bunları kullanma teknikleri geliştirmek için yarışıyor.
Son birkaç yılda vizyon-dil-eylem modelleri, robotların daha önce hiç karşılaşmadığı nesneler ve ortamlar içeren karmaşık görevleri yerine getirme yeteneğini önemli ölçüde artırdı. Büyük miktarda görüntü, video ve metin üzerinde ön eğitim alan ve ardından daha az sayıda teleoperasyonlu robot gösterimiyle ince ayarlanan bu modeller, yalnızca bir video akışı ve doğal dil talimatlarıyla çamaşır katlama, oturma odalarını düzenleme ve hatta mutfak aletlerini kullanma gibi giderek artan sayıda günlük işi yönlendirebiliyor.
Ama robotlar, deformable malzemeleri kullanma veya küçük nesneleri manipüle etme gibi ince el kontrolü gerektiren görevlerde hâlâ zorlanıyor; bir USB kablosunu takmak veya bir anahtarı kilitte çevirmek gibi. Bunun bir nedeni de VLA’ların bu durumlarda insanların güvendiği birincil bilgi kaynaklarından biri olan dokunsal geri bildirimi görmezden gelmesi.
İnsanlar Gibi Manipüle Etmek
“En hassas manipülasyonların çoğu insanlar gözleri kapalı yapabilir,” diyor California Üniversitesi Berkeley’de bilgisayar bilimi profesörü Trevor Darrell. “Kuvveti, kaymayı ve hassas kavramayı anlamak, geleneksel görüntü sensörleriyle iyi yapılabilecek bir şey değil.”
Ancak dokunsal sensörlerin etkili kullanımı zor. Dokunsal sensör verilerinin özellikleri, VLA’ların normalde eğitildiği görüntü verilerinden çok farklı ve dokunsal veri setleri birçok görüntü ve dil veri setinin internet ölçeğinin çok gerisinde. Bunu aşmak için Darrell’ın ekibi önce bir modeli mevcut veri setleri üzerinde ön eğitime tabi tutmanın bir yolunu buldu, ardından modeli 200’den fazla farklı ev eşyasını kullanarak silme, kavramayı, bükme veya dökme gibi yaygın eylemlerin gösterimlerini içeren, özel olarak toplanmış yüksek kaliteli dokunsal veriden 100 saatlik bir veri üzerinde eğitim verilen uzman bir alt modelle dokunma duyusu kazandırdı.
Explore an interactive visualizer of a small portion of the T-Rex dataset. T-Rex
Dokunsal veriyi kullanıma sokmak kolay olmadı. Amaç, bir robotun nesneleri manipüle ederken gerçek zamanlı olarak kavramasını dokunsal sinyal kullanarak düzeltmesini sağlamaktı. Bu, çoğu vizyon-dil modelinin çalıştığından daha hızlı tepki süreleri gerektiriyor. Darrell’a göre bu uyumsuzluk önemli bir zorluk oluşturuyor, bu yüzden ekip yüksek seviye eylemleri ve düşük seviye dokunsal kontrolü, dokunsal geri bildirimin faydalı olabilmesi için yeterince hızlı olacak şekilde ele alan “uzmanlar” olarak bilinen ayrı alt modeller kullandı.
Eylem uzmanı hareket planları üretiyor, dört kat daha hızlı çalışan dokunsal uzman ise robotun ilerledikçe hissettiği şeye göre hareket planını gerçek zamanlı olarak ayarlıyor. Model daha sonra ampul takma, diş fırçasına diş macunu sıkma veya yumurtayı tepsiler arasında aktarma gibi nispeten karmaşık manipülasyon görevlerinin yaklaşık 100 teleoperasyonlu gösterimi üzerinde ince ayarlandı ve 12 görevde ortalama yüzde 65 başarı oranına ulaştı; bu oran en iyi VLA modelinin neredeyse iki katı.
Veri Çeşitliliği
Darrell’ın kabul ettiği bir sınırlama, verilerinin tek bir robot donanım örneğinden gelmesi. Robot eller tamamen eklemli beş parmaklı tasarımlardan basit pens tipi tutuculara kadar değişiyor ve dokunsal sensörler dirençteki değişimleri ölçmekten yumuşak bir jel yastığın deformasyonunun görüntülerini kaydetmeye kadar temel olarak farklı fiziklere dayanabiliyor. Bu durum çoğu dokunsal yapay zeka araştırmasını sensöre özgü kılıyor, diyor Tsinghua Üniversitesi’nde yüksek lisans öğrencisi Chengbo Yuan ve bu durum verilerin paylaşılmasını ve öğrenilenlerin gruplar arasında aktarılmasını zorlaştırıyor.
Yuan yakın zamanda bu sorunu ele almak için halka açık veri setlerinden 21 sensör türünü ve çeşitli robot gövdelerini kapsayan 3.000 saatten fazla dokunsal robot verisini bir araya getirdi. Yuan, Open X-Embodiment iş birliği gibi birçok robotun verisini bir araya toplayıp eğitimde kullanılmayan donanıma genelleyen modellere yol açan çabalarından ilham aldıklarını söylüyor. Yuan’ın ekibi daha sonra her sensörün çıktısını ortak bir formata dönüştürerek ve bunu bir insan elinin şablonundaki etiketli konumlara eşleyerek bu çeşitli veriler üzerinde eğitim alabilen donanımdan bağımsız bir model tasarladı. Bu model, daha önce hiç karşılaşmadığı donanımda bile bir taban modelinden çok daha başarılı oldu. Yuan bunu, bu kadar çeşitli kurulumlar üzerinde eğitim alarak “bir tür ortak dokunsal bilgi” edindiğine bağlıyor.
Ölçek Peşinde
Umut verici sonuçlara rağmen Yuan daha fazla dokunsal veriye ihtiyaç olduğunu düşünüyor ve grubu şimdi dokunsal veri toplama ve işleme konusunda standartlaştırılmış bir yaklaşım kullanarak daha büyük bir teleoperasyonlu gösterim setini derlemek için 80 kurumluk bir iş birliğine öncülük ediyor. Bu arada Şanghay’daki Fudan Üniversitesi ve yan kuruluşu NeoteAI, önceki çabaların bir büyüklük mertebesi üzerinde bir dokunsal veri seti üretti.
Çeşitli robot kollarına takılan tescilli bir sensör ve insanlar tarafından işletilen elde taşınan bir tutucu kullanılarak, senkronize görsel ve dokunsal veriyle 30.000 saatten fazla gösterim toplandı.
Araştırmacılar bu veriyi, dokunmaya sadece tepki vermekle kalmayıp robotun eylemleri yönlendirmesine ve değerlendirmesine yardımcı olmak için ne hissetmesi gerektiğini proaktif olarak tahmin eden bir model eğitmek için kullandı ve bu durum performansı önemli ölçüde artırdı. Fudan Üniversitesi’nde doktora sonrası araştırmacı ve NeoteAI’nin CTO’su Shunlin Lu, büyük ölçekli ve çeşitli dokunsal veriye erişimin önemli performans kazanımlarına yol açtığının açık kanıtı olduğunu söylüyor.
Başka bir ölçeklendirme yaklaşımı, zaten toplanmış olan büyük miktardaki görsel robotik verisinden faydalanmak olabilir. Los Angeles’taki Güney Kaliforniya Üniversitesi’ndeki araştırmacılar yakın zamanda elde taşınan bir tutucuyla günlük manipülasyonun 2.700’den fazla gösterimi üzerinde eğitilerek görsel veriden dokunsal bilgiyi çıkarabilen bir model yayınladı. Tutucu hem dokunsal veriyi hem de cihaz üzerindeki kameradan görüntüleri kaydediyor. Model, tutucunun nesnelerle temas ettiği görüntüleri o anda dokunsal sensörlerin hissettiği basınç miktarı ile ilişkilendirmeyi öğrendi ve bu, dokunsal sensörü olmayan robotlara bile araştırmacıların temas yoğun manipülasyon görevleri için özellikle yararlı olduğunu gösterdiği kaba bir dokunma duyusu sağladı. Ancak daha geniş hedefleri, üreteci kullanarak mevcut görüş veri setlerine dokunsal veri eklemek.
Hassas görevlerde atılım için ne kadar dokunsal veriye ihtiyaç duyulacağı hâlâ belirsiz. Şimdiye kadar dokunsal eğitimin ana katkısı, nesneleri alma ve yerleştirme gibi zaten erişilebilir olan görevlerde robotları daha verimli öğrenenler haline getirmek oldu, diyor Yuan ve temas olmadan gerçekten imkânsız olan sorunları ele almak için yeni algoritmalara ihtiyaç duyulabileceğini düşünüyor.
Çin Bilimler Akademisi’nden Long Cheng de ham verinin panzehir olmadığını düşünüyor. “Veri iyidir,” diyor. “Ama onları doğru kullanma şekli başka bir mesele.” Sorun, görüşün sürekli, yüksek bant genişliğinde bir piksel akışı sağlarken dokunsal sinyallerin seyrek ve aralıklı olması ve modellerin onları görmezden gelmeyi öğrenmesi olduğunu belirtiyor. Bu ayın ilerleyen günlerinde IROS 2026’da sunulacak çözümü, bir robotun yalnızca görüşten ne hissedeceğini tahmin eden ve bunu gerçek dokunsal girişle karşılaştıran bir model. İkisi arasındaki büyük boşluk, sensörün robotun aksi halde kaçıracağı bir şeyi algıladığını gösteriyor, bu yüzden bu sürpriz sinyaller güçlendirilirken öngörülebilir olanlar bastırılıyor. Beş temas yoğun görevde yaklaşım ortalama yüzde 62,8 başarı elde etti; dokunuş olmadan aynı modelde bu oran yüzde 28,2.
Lu, veri ölçeklendirmenin dil ve görüşte görülenlere benzer faydalar sağlayabileceğine daha güveniyor. Çeşitli, gerçek dünya ortamlarında laboratuvarda değil toplanmış yaklaşık 100.000 saatin yeni yeteneklerin kilidini açabileceğini tahmin ediyor. Her halükarda alan şimdi daha büyük dokunsal veri setlerinin ve bunları kullanmanın daha akıllı yollarının en zorlu görevlerden bazılarında robotlara önemli bir destek verebileceğine dair erken işaretlere sahip. “Bence dokunsal zeka fiziksel yapay zekâ için bir sonraki adım,” diyor Lu.