Fintech & Ödeme

Yapay Zeka Ajanları 4 Gerçek İş Görevinden 3'ünde Başarısız

Yapay Zeka Ajanları 4 Gerçek İş Görevinden 3'ünde Başarısız
Malta'da Hem Öğren Hem Çalış

UC Berkeley Sorumlu, Merkeziyetsiz Zeka Merkezi tarafından hazırlanan yeni bir kıyaslama testine göre, yapay zeka ajanları gerçek dünyadaki iş görevlerinin yalnızca dörtte birini tamamlayabiliyor. Araştırma, önde gelen yapay zeka sistemlerini çalışan profesyonellerin gerçek iş ödevleriyle karşı karşıya getirdi. Bulgular, yapay zeka ajanlarının bir ila iki yıl içinde çoğu bilgi işinde insan işçilerin yerini alacağı yönündeki iddialı tahmini sorguluyor. Kıyaslamanın başyazarlarından Yiyou Sun, 'Her yerde yapay zeka ajanlarının 2026 ile 2027 arasında neredeyse tüm işlerde insanları geçeceğine dair tahminler var. Bu iddiayı doğrulamak için bu sınavı oluşturduk' dedi.

Araştırmacılar, 55 sektörden 250'den fazla profesyonelden 1.490 gerçek iş ödevi topladı. Bunlar, normalde bir kişinin saatler ila haftalar arasında tamamlayabileceği türden projelerdi: hukuki bir belge hazırlamak, finansal model oluşturmak veya bir imalat parçası tasarlamak gibi. Her yapay zeka sistemi, doğru, eksiksiz ve bitmiş bir ürün teslim edip etmediğine göre notlandırıldı; iyi niyetli bir denemeye kısmi puan verilmedi. Eksik teslimat veya yanlış yapılan bir şey başarısızlık sayıldı.

En iyi performans gösteren sistem, OpenAI'in GPT-5.5 modeli üzerinde çalışan Codex aracı, tüm ödevlerin %26,2'sini doğru tamamladı. Bu da kabaca dörtte bire denk geliyor. En zor ödevlerde, yani yapay zekanın uzun bir çalışma süresi boyunca birçok adımı takip etmesini ve her parçayı doğru yapmasını gerektiren görevlerde, test edilen tüm sistemlerin ortalama başarı oranı yalnızca %2,6 oldu. Codex bile en zor kategoride yalnızca %8,6 başarı elde edebildi. Anthropic'in Opus 4.7 modeli üzerinde çalışan Claude Code aracı ise bu zor ödevlerin hiçbirini tamamlayamadı. Testin bir versiyonunda soruna büyük miktarda bilgi işlem kaynağı ayrıldı: 630 dolar değerinde bilgi işlem gücü ve 763 milyon 'token' kullanıldı, ancak başarı oranı yine sadece %2,9 oldu. Araştırmacılara göre buradan çıkan sonuç, daha fazla para ve bilgi işlem gücü harcamanın bir yapay zeka ajanını bu tür işlerde güvenilir bir şekilde daha iyi hale getirmediği.

%26,2'lik genel başarı oranından en zor kategorideki %2,6'lık ortalamaya düşüş, günümüz yapay zeka ajanlarının nerede işe yaradığını ve nerede yaramadığını net bir şekilde gösteriyor. Testin daha kolay kategorisinde, mevcut yapay zeka sistemlerinin kısmen başa çıkabildiği 59 ödevde, en iyi performans gösterenler kabaca %30 başarı elde etti. Codex, GPT-5.5 ile bu kolay sette %42,4'e ulaştı. Bir yapay zeka ajanı tek bir finans sorusuna doğru cevap verebilirken, bu cevabı tüm çok adımlı süreç boyunca taşıması istendiğinde tamamen başarısız olabiliyor: doğru verileri toplamak, kendi çalışmasını kontrol etmek ve birinin gerçekten kullanabileceği nihai bir rapor üretmek gibi. Uzun bir adım dizisi boyunca yolda kalmak, kendi hatalarını yakalayıp düzeltmek ve kullanıma hazır bir şey teslim etmek, günümüz yapay zeka sistemlerinin çoğunun güvenilir bir şekilde yapamadığı bir şey olmaya devam ediyor.

%26,2'lik genel rakam, işletmelere yapay zeka ajanlarının bugün nerede kullanılabileceğine dair faydalı bir sinyal veriyor: açık uçlu, çok adımlı projelerde değil, daha dar ve iyi tanımlanmış görevlerde. Şirketler, işleri yapay zekanın güvenilir bir şekilde hallettiği görevler etrafında yeniden yapılandırabilir ve çalışanların, yapay zekanın henüz emanet edilemeyeceği, muhakeme ve hesap verebilirlik gerektiren işlere odaklanmasını sağlayabilir. Bu durum, kurumsal finansta halihazırda yaşananlarla örtüşüyor. PYMNTS Intelligence araştırmasına göre, büyük şirketlerdeki CFO'ların %80'inden fazlası borç hesapları için yapay zeka kullanıyor veya kullanmayı ciddi şekilde değerlendiriyor. Yapay zeka ajanlarının benimsenmesi ise çok daha sınırlı: ABD'deki finans şeflerinin yaklaşık %7'si yapay zeka ajanlarını canlı, günlük finans operasyonlarında kullanmaya başlamış durumda. Bir diğer PYMNTS Intelligence çalışmasına göre, %5'i ise tam kullanıma geçmeden önce teknolojiyi test ediyor. Bu erken dağıtımlar, net kuralları olan yapılandırılmış, tekrarlanabilir görevlerde yoğunlaşıyor.

Uzun dönem Malta'da, üniversite destekli okullarda dilini geliştir. Kayıt bilgisi →

Kaynak: PYMNTS