Son dönemde düzenlenen büyük teknoloji etkinliklerinde insansı robotlar her yerdeydi. Yürüyen, yön bulan ve nesneleri yıllar önce hayal bile edilemeyecek bir ustalıkla kullanan bu makineler gerçekten etkileyici. Ancak Treble'da bu robotlarla iletişim kurmaya çalıştığımda, tüm bu ilerlemeye rağmen hep aynı hayal kırıklığını yaşıyorum.
Treble olarak uzun yıllardır gelişmiş ses ve konuşma teknolojilerinin geliştirilmesine odaklanıyoruz. Dünya lideri ürünler için güçlü ses yapay zekaları geliştirmeye çoktan alıştık. Dolayısıyla bakış açım doğal olarak bu deneyimlerden şekilleniyor. Yine de robotikte iletişim ve işitsel algının ne kadar gelişmemiş olduğunu görmek beni gerçekten şaşırtıyor.
Bizler bizim gibi hareket edebilen ve hatta birçok durumda bizden daha iyi görebilen muazzam makineler inşa ediyoruz. Ancak bu makineler henüz bizimle doğal bir şekilde etkileşime giremiyor. Bence bu durum, teknolojinin gerçekten benimsenip benimsenmeyeceğini belirleyecek temel zorluk.
İnsan-makine etkileşimi; güvenliği, verimliliği ve kullanım kolaylığını doğrudan etkilediği için robotların insanlar tarafından yaygın olarak kabul görmesinin önündeki en büyük engel haline gelecek.
Gerçek dünya gürültülü, karmaşık ve kaotik
İnsansı robotlar ve daha geniş anlamda mobil fiziksel yapay zeka sistemleri, sesli iletişim kurmayı öğrenene kadar insanlar tarafından kabul görmeyecek. Üstelik bunu sadece kontrollü ve sessiz ortamlarda değil, gerçek hayatın akıp gittiği yerlerde yapmaları gerekecek.
Bu ortamlar; kalabalık fuar alanları, endüstriyel tesisler, şehir sokakları ve gürültü, ses kaynaklarının hareketi, yankılanma ile öngörülemezlik dolu evler. İnsanlar tam olarak bu ortamlarda yaşıyor ve mevcut bedensel yapay zeka ses sistemleri tam da bu ortamlarda çöküyor.
Aynı zamanda sesin neden birincil odak noktası olmadığını da anlamak oldukça kolay. Robotikteki mevcut rekabet ortamı, görünür ve ölçülebilir ilerlemeleri ödüllendiriyor.
Hareket kabiliyeti, ilerlemenin net bir göstergesi. Görüntü tabanlı algının arkasında bol miktarda veri, iyi kurulmuş modeller ve ölçeklenebilir eğitim hatları bulunan olgun ve güçlü bir ekosistem var.
Veri toplamadan simülasyona kadar tüm altyapı bu modaliteleri destekleyecek şekilde gelişti. Veri bol, kıyaslamalar net ve iyileştirmeleri göstermek oldukça kolay.
Özellikle simülasyon, ilerlemenin temel taşlarından biri haline geldi. NVIDIA Isaac Sim gibi platformlar, daha önce imkansız olan hızlı yinelemelere ve büyük ölçekli eğitimlere olanak tanıdı. Bu sistemler güçlü, iyi tasarlanmış ve sektörün genel ekonomisiyle uyumlu.
Ancak aynı zamanda önemli bir şeyi de gözler önüne seriyorlar: Akıllı makineleri eğitmek için kullandığımız ortamlar ağırlıklı olarak görsel. Ancak çoğunlukla sessizler.
Bu bir tesadüf değil. Hesaplama sınırlamaları, mühendislik kapasitesi ve önceliklendirilmesi gereken somut hedefler gibi gerçek kısıtlamalar altında verilen mantıklı kararların bir yansıması. Aynı zamanda, algılama ve etkileşimin tüm bir boyutunun sistematik olarak gelişmemiş bırakıldığı anlamına da geliyor.
Treble evrimsel boşluğu inceliyor
Bu duruma insan evrimi penceresinden bakınca aradaki boşluk çok daha net görülüyor. Aslen biyolog olarak eğitim aldım. Bazı beklenmedik dönüşlerin ardından kendimi ses teknolojileri geliştirirken buldum, ancak bu sistemleri hala fizyolojik ve evrimsel bir perspektiften değerlendiriyorum.
İnsanlar, duyusal bilgileri işlemek için binlerce yıl boyunca önemli miktarda enerji harcayacak şekilde evrildi. Görme, bu enerjinin büyük bir kısmını oluşturarak beynin duyusal iş yükünün en büyük payını alıyor. İşitmeye gelince, daha az enerji tüketiyor. Ancak bağlama göre değişmekle birlikte, yine de beyin enerjisinin yaklaşık yüzde 15 ila 20'sini tüketen en önemli ikinci duyusal paya sahip.
Bu nedenle, erken dönem robotik sistemlerinde görmenin baskın modalite haline gelmesi tamamen mantıklı. Ancak işitmenin en çok enerji tüketen ikinci duyu olması bize çok önemli bir şey söylüyor. Sesin, gerçek dünyada ve özellikle insan ortamında işlev görmek için ne kadar kritik olduğunu gösteriyor.
Evrimin acımasız hesaplamalarında enerji asla boşa harcanmaz. O yüzde 15 ila 20'lik enerji payı bir tesadüf değil, doğal seçilimin türümüzü Dünya gezegeninde hayatta kalmak, gelişmek ve refaha ermek için optimize etmesinin doğrudan bir sonucu. Bu, robotikçiler için göz ardı edilemeyecek bir ipucu olmalı. Eğer biyolojik bir zekanın fiziksel dünyada gezinmek ve hayatta kalmak için bu kadar fazla işitsel bant genişliğine ihtiyacı varsa, silikon tabanlı zeka da onsuz başarılı olamaz.
Sadece bir sistemin ne kadar enerji tükettiğine odaklanmak, daha önemli olan soruyu gözden kaçırmak anlamına gelir: Sistem aslında ne için kullanılıyor? İşitme, görmeden tamamen farklı bir rol oynuyor. Niyetleri yorumlamamızda, görüş alanımızın ötesinde farkındalık sürdürmemizde ve en önemlisi iletişim kurmamızda merkezi bir rolü var.
Ses sayesinde bir şeyin yaklaşıp yaklaşmadığını veya uzaklaşıp uzaklaşmadığını, bir sesin sakin mi yoksa düşmanca mı olduğunu ve bir ortamın güvenli mi yoksa öngörülemez mi olduğunu çıkarıyoruz. Görüşü kritik şekillerde tamamlayan, her zaman açık bir algı katmanı olarak işlev görüyor.
Daha da ötesi, insan iletişiminin temelini oluşturuyor. Konuşma sadece bir kelime dizisi değil. Zamanlama, ritim, mikro tonlama ve duygusal sinyalleşmenin karmaşık bir alışverişi. Doğası gereği dinamik ve olağanüstü derecede sağlam.
İnsanlar gürültülü, yankılı ve kaotik ortamlarda bile etkili bir şekilde iletişim kurabiliyor ve seslerden, mevcut sistemlerin hala eşleşmekte zorlandığı bir dayanıklılık düzeyinde anlam çıkarabiliyor. Robotlar için bu yetenek şart.
Ses için daha yüksek bir standart mı var?
İnsanlar paylaşılan biyoloji ve derinden yerleşmiş sosyal kalıplardan faydalanır. Birbirimizin iletişim kusurlarını telafi ederiz çünkü içinde bulunduğumuz sistemi sezgisel olarak anlarız. Robotların bu avantajı yok. Bu nedenle, özellikle benimsemenin ilk aşamalarında farklı bir standarda tabi tutuluyorlar.
Hafifçe kusurlu hareket eden bir robot hala işlevsel algılanabilir. Ancak kötü iletişim kuran bir robot; örneğin yanlış duyan, senkronize olmadan yanıt veren veya gerçek dünyadaki akustik koşullarda çalışamayan bir robot, hızla sinir bozucu hatta rahatsız edici hale gelir.
Mesele sadece teknik performans değil. Mesele güvenin zedelenmesi. Sesin benimseme bağlamında orantısız derecede önemli olmasının nedeni bu. Robotları yalnızca yeteneklerine göre değil, onlarla etkileşime girmenin nasıl hissettirdiğine göre değerlendiriyoruz. Etkileşimin temeli ise derinlemesine işitseldir.
Bunun henüz çözülmemiş olmasının nedeni farkındalık eksikliği değil, altyapı eksikliği. Yüksek kaliteli ses verilerini elde etmek zor, ölçeklendirmek daha da zor. Görsel verilerin aksine, kritik bağlamı kaybetmeden büyük ölçekte kazınıp etiketlenemezler.
Uzamsal ilişkiler, çevresel akustik ve cihaza özgü özellikler, sesin nasıl algılandığında önemli bir rol oynuyor. Bu bilgileri gerçek dünya ortamlarında yakalamak ve açıklamak karmaşık ve pahalı.
Simülasyon bir yol sunuyor ancak kendi zorluklarını da beraberinde getiriyor. Ses dalga fiziği tarafından yönetilir, bu da onu geometri, malzemeler ve çevresel koşullara karşı son derece hassas hale getirir. Bir sahnede yapılan küçük değişiklikler, algıda büyük farklılıklara yol açabilir. Bu durum, doğru simülasyonu hesaplama açısından zorlu ve yaklaşık olarak tahmin etmesi güç hale getirir.
Sonuç olarak, mevcut sistemlerin çoğu basitleştirilmiş veya fiziksel olmayan modellere güveniyor, bu da genelleme yeteneklerini sınırlıyor. Sentetik eğitim verilerinin geliştirilmesinde sesin diğer modalitelerin gerisinde kalmasının temel nedenlerinden biri bu.
Treble paradigmayı değiştirmek için çalışıyor
Ancak bu durum değişmeye başlıyor. Treble, ses sistemlerini eğitmek için temel olarak sesin fiziksel olarak doğru simülasyonuna doğru büyüyen bir değişimin parçası. Yaklaşıklıklara veya sınırlı kayıtlı veri setlerine güvenmek yerine, artık gerçek dünya koşullarını yansıtan büyük ölçekli, yüksek kaliteli akustik veriler üretmek mümkün hale geliyor. Bu; çevresel akustiği, cihaza özgü davranışı ve uzamsal algıyı içeriyor.
Treble'da bu, temel odak noktamız oldu. Son derece düşük simülasyondan gerçeğe geçiş boşluğuna sahip, fiziksel olarak doğru akustik veriler üretmek için özel olarak bir platform inşa ettik. Platform halihazırda ses sistemleri geliştirmek ve eğitmek için dünyadaki önde gelen teknoloji şirketlerinin birkaçı tarafından kullanılıyor. Bir darboğaz olan şey, yapay zeka altyapısının ölçeklenebilir bir bileşeni haline geliyor.