Yapay zeka dünyası, sohbet robotlarından görü işlemeye doğru hızla evriliyoe. Artık yapay zeka; robotların ve sürücüsüz araçların içinde yaşıyor. Bu sistemlerin eğitiminde devasa veri setleri ve dijital simülasyonlarla büyük adımlar atılmış olsa da kritik bir boşluk hâlâ kapanmadı: Bir robotun 'gördüğü' şeyle gerçek fiziksel dünyadaki durum arasındaki köprü henüz tam olarak kurulamıyor.
Yüksek düzeyli akıl yürütme, sistemin çevresinin fiziksel durumunu tam olarak kavrayamaması durumunda işe yaramıyor.
Fiziksel Yapay Zeka 1.0'dan 2.0'a Evrim
Sektör şu an 'Fiziksel Yapay Zeka 1.0' aşamasında. Bu dönem ölçekle tanımlanıyor: Makinelere ilk adımlarını atmadan önce dünyanın nasıl işlediğini öğretmek için muazzam miktarda video ve metin verisi ile NVIDIA'nın Cosmos platformu gibi aşırı gerçekçi simülasyonlar kullanılıyor.
Ancak Fiziksel Yapay Zeka 1.0'ın bir 'görme öncelikli' yanlılığı var. Bu yaklaşım, bir robota yeterli kamera ve yeterli işlem gücü sağlanırsa geleceği doğru tahmin edebileceğini varsayıyor. Oysa her sürücünün bildiği gibi kameralar parlama nedeniyle kör olabiliyor, nesneler gölgelere gizlenebiliyor ve sensörler gürültülü, çelişkili veriler üretebiliyor.
'Fiziksel Yapay Zeka 2.0' ise sisteme yeni ve zorunlu bir katman ekliyor: fiziksel durum kurtarma.
Bu ayrım önemli; çünkü fiziksel yapay zekadaki rekabet artık sadece modelle sınırlı değil. Dijital yapay zekada model çoğunlukla ürünün kendisi oluyor.
Bedenleştirilmiş sistemlerde ise model; algılama, simülasyon, politika eğitimi, orkestrasyon, güvenlik sistemleri, uç dağıtım ve canlı operasyonlardan gelen geri bildirimlerle birlikte çalışmak zorunda. Mevcut durumu yanlış okuyan bir robot, hatalı bir durum tahmininden aklını kullanarak çıkamıyor.
Yeni Eylem Mimarisi
Gerçek dünyada güvenli şekilde çalışabilmek için bir sistemin döngüsel olarak birlikte işleyen dört farklı yeteneğe ihtiyacı var:
1. Dünya modelleri: Geçmiş deneyim ve simülasyonlara dayalı olarak ne olabileceğine dair öğrenilmiş bilgiyi sağlıyor.
2. Fiziksel durum kurtarma: 'Kayıp halka' bu. Gürültülü ve eksik sensör verilerini alarak dünyanın gerçek fiziksel durumunu yeniden inşa ediyor. Bir yayayanın nerede olduğunu tahmin etmekle, karmaşık bir sahnede tam yörüngesini bilmek arasındaki fark tam da bu.
3. Akıl yürütme sistemleri: Durum kurtarıldıktan sonra yapay zeka seçenekleri karşılaştırıp riskleri tartıyor ve en iyi niyete karar veriyor: 'Geçmeli miyim, yoksa beklemeli miyim?'
4. Eylem: Sistemin sıkı güvenlik sınırları içinde hareketi gerçekleştirdiği son adım.
Akıl yürütme, yalnızca üzerinde çalıştığı durum tahmini kadar iyi olabiliyor. Gözlem eksik ya da bozuksa, mükemmel bir akıl yürütme modeli bile özgüvenle yanılabiliyor.
Bu ayrım kritik. Akıl yürütme sistemleri kontrolü etkiliyor, ama doğrudan harekete geçirmiyor. Sağlam sistemlerde akıl yürütme; niyet, kısıtlamalar, açıklamalar veya aday eylemleri öneriyor; planlama, kontrol ve güvenlik mantığı ise bu çıktıları sınırlı harekete dönüştürüyor.
Fiziksel yapay zeka salt açıklayıcı ya da öngörücü değil. Kararlar harekete dönüştüğünde ve bu hareket dünyayı değiştirip bir sonraki gözlem kümesini yarattığında gerçek anlamda fiziksel oluyor.
Neden Daha Fazla Veri Tek Başına Yeterli Değil?
Yaygın bir karşı argüman şu: Yeterince büyük 'uçtan uca' modeller inşa edersek, yapay zeka zamanla gürültülü sensörleri kendi başına halletmeyi öğrenir.
Oysa özel bir kurtarma katmanı çok daha verimli. Fiziksel durum kurtarmayı ayrı bir modül olarak ele alarak geliştiriciler radar veya dokunma gibi özel algılama yöntemlerinden yararlanabilir ve üst düzey 'beyin' düşünmeye başlamadan önce gözlemlenebilirliği artırabilir. Bu yaklaşım, her yeni robotun fiziğin temel yasalarını sıfırdan 'yeniden öğrenmesini' de engelliyor.
Buradaki temel ayrım, zor vakalar ile kötü gözlemlenmiş vakalar arasında. Performans testleri, geliştiricilere bir sistemin uzun kuyruklu senaryolarda, örneğin görüş engellemeleri veya alışılmadık yol kullanıcısı davranışlarında zorlandığını gösterebilir.
Ama zor bir vakayı tespit etmek, sensörlerin yakalayamadığı bilgiyi kurtarmakla aynı şey değil. Bir kamera daha fazla kare üretebilir ve model bunları daha uzun süre analiz edebilir; ama altta yatan gözlem yapısal olarak bozuksa aşağı akış akıl yürütmesi yine de yanlış bir resim üzerinde çalışıyor olacak.
Bu durumlarda cevap yalnızca daha fazla veri değil. Gizli durumu görünür kılmak için fizik tabanlı kısıtlamalar ve daha zengin algılama kullanan güçlü bir kurtarma katmanı şart.
Gerçek Dünya Örnekleri: Robotlar ve Araçlar
Dünya modelleri — Çamaşır katlayan insansı robot: Farklı kumaşların nasıl katlanması gerektiğini tahmin eder. Şehir içi otonom araç: Yağmurlu havada trafiğin nasıl aktığını tahmin eder.
Durum kurtarma — Robot: Kırışıklıklara, gölgelere, kısmi görünüme ve belirsiz temasa rağmen giysinin şeklini tanımlar. Araç: Park halindeki bir kamyonun arkasına gizlenen bisikletçiyi karmaşık bir sahnede izler.
Akıl yürütme — Robot: Katlamaya, yeniden tutmaya, bir kenara bırakmaya ya da yardım istemeye karar verir. Araç: Geçmeye, durmaya, yavaşlamaya ya da rotayı yeniden planlamaya karar verir.
Eylem — Robot: Kolu nazikçe katlar. Araç: Pürüzsüz ve güvenli bir direksiyon manevrasını gerçekleştirir.
Gözlem, Fiziksel Yapay Zekanın Temeli
Yapay zekanın bir sonraki sınırı, modelleri akıl yürütmede daha 'akıllı' yapmaktan ibaret değil; onları gözlemlemede daha 'iyi' kılmak da gerekiyor. Yapay zeka yarışının galibi, dijital tahmin ile fiziksel gerçeklik arasındaki uçurumu en doğru şekilde kapatabilen sistem olacak.
Görü ve dil bir başlangıç noktası. Ama fiziksel yapay zekanın gerçek dünyaya tam anlamıyla adım atabilmesi için içinde hareket etmeye çalıştığı gerçek dünya üzerinde çok daha güvenilir bir kavrayışa ihtiyacı var.
Çünkü gerçek dünyada göremedikleriniz, gördüklerinizden çok daha önemli.