Yapay zeka ajanları tüketiciler için alışveriş yapıyor ve şirketlerde arka ofis işlerini yürütüyor. Alibaba.com, ajanların işi bitirip bitirmediğini görmek için 13 yapay zeka modeline 107 gerçek satıcı görevi verdi.
En iyi model Claude Opus 5, görevlerin %61,7’sini tamamladı. Ajanlar, teslim edilmiş maliyetlerin hesaplanması, iade anlaşmazlıkları ve çok aşamalı kargo rotaları gibi bilgileri birden çok adımda tutmalarını gerektiren işlerde zorlandı.
PYMNTS Intelligence’ın bulgusuna göre ABD’de yaklaşık 132 milyon yetişkin yapay zekanın yardımıyla perakende ürünü satın aldı ve bu satın alımların %59’unu Amazon gerçekleştirdi.
Ajansal yapay zekanın potansiyeli ve açık sorunları iyi biliniyor. Ajansal ticaretin vaadi, ajanın işi yapması varsayımına dayanıyor. Bu yüzden Alibaba ajanları gerçek görevlerde çalıştırdı ve onlara not verdi.
Alibaba.com, yapay zekanın gerçek çevrimiçi iş görevlerini ne kadar iyi halledebileceğini ölçmek için GitHub’da açık test aracı CommerceAgentBench’i yayınladı. Araç, CommerceAgentBench GitHub sayfasında yayınlanan sonuçlara göre 13 yapay zeka model ailesini 107 gerçek ticaret görevi üzerinde test etti ve her birini geçme ya da kalma olarak değerlendirdi. Ajans iyi yazılmış bir yanıt için kredi almadı. Sadece iş doğru şekilde yapıldığında geçti. Bir ürün listesi doğru niteliklerle yayına girmeliydi. Bir sevkiyat var olan bir rota üzerinden rezerve edilmeliydi.
GitHub sayfasına göre en yüksek puanı %61,7 ile Claude Opus 5 aldı.
Alibaba.com Başkanı Kuo Zhang, 9 Eylül tarihli Fortune yorumunda en yüksek puanın “kullanışlı olacak kadar yüksek, uyarı olacak kadar düşük” olduğunu yazdı.
Test, tedarik, lojistik, ürün listeleme, yerine getirme ve satış sonrası hizmeti kapsadı. 9 Eylül tarihli Alibaba basın bültenine göre ajanların yüzlerce yapılandırılmamış e-postayı incelemesi, ödeme dolandırıcılığını tespit etmesi, teslim edilmiş maliyetleri hesaplaması ve taşıyıcılar arasında kargo rotaları rezerve etmesi gerekiyordu. Test, 10 milyon aktif küçük işletme kullanıcısından, 1,6 milyon konuşmadan ve 200 bin yürütme izinden alınan görevlere dayanıyordu. Rakamlar şirketin kendi verileri. Görevler yedi kategoriye ve dört özerklik seviyesine ayrıldı.
Ajanlar, ürün yayınlama formları ve kargo rezervasyon araçları da dahil olmak üzere ticaret yazılımının yerel kopyaları içinde çalıştı. GitHub sayfasına göre bir görev, her doğrulayıcı kontrolü geçtiğinde yalnızca geçti.
Uzun iş akışları ajanları zorluyor
Başarısızlıklar kümelendi. Zhang yorumunda ajanların 300 mesajlık bir tedarikçi e-posta dizisinde gizli bir ödeme anormalliğini kaçırdığını yazdı. Teslim edilmiş maliyet birden fazla değişken aynı anda hareket ettiğinde bozuldu. Satış sonrası anlaşmazlıklar belgeler birbirleriyle çeliştiğinde başarısız oldu. Çok aşamalı kargo rotaları her zaman zor oldu.
Bu işlerin her biri ajanın bilgileri birden çok adımda tutmasını gerektirdi. En iyi model Claude Opus 5, GitHub sayfasının gösterdiğine göre görev başına ortalama 63 araç çağrısı yaptı ve yaklaşık 10 dakika harcadı.
Beyaz yakalı işler benzer sonuç verdi. Eğitim verisi şirketi Mercor’un APEX-Agents adlı kıyaslaması, TechCrunch’ın Ocak ayında bildirdiğine göre en iyi modellerin görevlerin dörtte birinden azını doğru yaptığını buldu. Görevler danışmanlık, yatırım bankacılığı ve hukuk alanından geldi. Rapora göre Mercor CEO’su Brendan Foody, en büyük zorluğun bilginin birden fazla alan arasında takip edilmesinin olduğunu söyledi.
Altyapı puanı değiştiriyor
Bir model tek başına çalışmaz. Araç ve bellek sağlayan bir altyapı içinde çalışır. GitHub sayfasında üç altyapıda 13 model ailesi listelendi ve en iyi modeller her birinde farklı puan aldı. Claude Opus 5, Alibaba’nın Accio altyapısında görevlerin %61,7’sini geçti, Pi’de %60,7, OpenClaw’da %56,1. Gemini 3 Flash son sırada yer aldı ve üçünde de %29 geçti.
Alibaba’nın 9 Eylül tarihli basın bülteninde “Hiçbir tek model her alanda lider olmadı, bu da görev bazlı yönlendirmenin durumunu güçlendiriyor, farklı görevlerin tek bir genel amaçlı model yerine farklı yapay zeka modelleri tarafından ele alınmasının daha iyi olacağı fikri” denildi.
Tüketiciler ve satıcılar kendi sınırlarını belirliyor
Talep tüketici tarafında zaten geliyor. PYMNTS Intelligence’ın “2026 Alışveriş Sezonu Ajansal Olacak mı?” raporu Eylül ayında ABD’de yaklaşık 132 milyon yetişkinin yapay zekanın yardımıyla perakende ürünü satın aldığını buldu. Amazon bu yapay zeka destekli satın alımların %59’unu yakaladı.
Satıcılar ajanların dokunabileceği alanları seçiyor. PYMNTS Intelligence’ın Temmuz ayında yayınlanan “Global Dijital Alışveriş Endeksi: Ajansal Ticaret Derinlemesine İnceleme” raporu, satıcıların %46’sının ajanlara en az teslim etmek istediği işlevin fiyatlandırma olduğunu belirttiğini buldu. Dolandırıcılık, anlaşmazlıklar ve sorumluluk %42 ile izledi.
Alibaba.com, GitHub sayfasında talep üzerine dış modelleri çalıştıracağını, ön sürüm yapıları da dahil olmak üzere belirtti. Geliştiricilerin yeni test ortamları sunmalarını istiyor; bu ortamlar daha sonraki bir sürümde puanlanan sete giriyor.