Araştırmacılar, önümüzdeki AI ajentlerinin bağımsız olarak AI araştırması yapabileceğini test etti. Sistemler, mühendislik görevlerini tamamladı, ancak bir üst düzey AI konferansında kabul edilebilir nitelikte kağıtlar üretmede başarısız oldu.
Araştırmada, Princeton Üniversitesi, UK AI Güvenlik Enstitüsü, Stanford Üniversitesi, Toronto Üniversitesi ve birkaç akademik ve araştırma kuruluşundan araştırmacılar, önümüzdeki AI ajentlerinin bağımsız olarak orijinal AI araştırması yapabileceğini değerlendirdi.
Araştırmacılar, AI ajentlerine, iki yayınlanmamış NeurIPS 2026 kağıdından merkezi araştırma sorularını verdi. Sistemler, altı gün, binlerce dolarlık API kredileri, GPU kaynakları, internet erişimi ve bir sanal makineyle konferans kaliteli bir kağıt üretmek için görevlendirildi. Sonuçta ortaya çıkan kağıtlar, orijinal araştırma yazarları tarafından incelendi ve her iki kağıt da reddedildi.
AI ajentleri, literatür taraması, yazılım hatalarını düzeltme, deneyler yürütme, GPU kaynaklarını yönetme ve insan müdahalesi olmadan tam akademik kağıtlar üretme gibi birçok mühendislik görevini tamamladı. Ancak incelemeciler, sistemlerin orijinal bilimsel katkılar üretmede başarısız olduğunu kếtülediler.
Araştırmacılar, bu değerlendirmenin, açık uçlu araştırma sorunlarını test ettiği için önceki benchmark'lardan daha iyi ölçtüğü bilimsel akıl yürütmeyi ölçtüğünü belirttiler.
Araştırmacılar, çalışmanın sadece iki araştırma projesini incelediğini ve sınırlamaları olduğunu kabul ettiler. Sonuçlar, önümüzdeki AI ajentlerinin, araştırmadaki birçok mühendislik görevini otomatikleştirebileceğini ancak orijinal bilimsel çalışma üretmede hala mücadele ettiğini gösterdi.