Yapay Zeka

Yapay Zeka Ajanlarına Güven Azalıyor: Değerlendirme Testleri Gerçeği Yansıtmıyor

Yapay Zeka Ajanlarına Güven Azalıyor: Değerlendirme Testleri Gerçeği Yansıtmıyor
Deniz, Kum, Güneş... ve İngilizce

157 kuruluş üzerinde yapılan bir araştırma, yapay zeka ajanlarına verilen özerkliğin artmasına rağmen bu özerkliği denetlemesi gereken değerlendirme sistemlerine olan güvenin azaldığını ortaya koydu. Kuruluşların yarısı, iç değerlendirmeleri geçen ancak müşteri karşısında başarısız olan bir ajanı kullanıma sundu. Sadece yirmide biri otomatik değerlendirmeye tam olarak güveniyor. En sık dile getirilen zayıflık ise değerlendirmelerin gerçek dünya sonuçlarıyla uyumlu olmaması. Buna rağmen kuruluşların üçte ikisi, düşük riskli ajanlar için insan denetimi olmadan, yalnızca otomatik değerlendirmeye dayanarak değişiklik yapılmasına izin veriyor veya bu yönde çalışmalar yürütüyor. Sonuçta ortaya çıkan şey bir 'değerlendirme boşluğu': kuruluşların ajanlarına verdiği özerklik ile bu başarısızlıkları yakalaması gereken testlere duydukları güven arasındaki mesafe.

VentureBeat Pulse Research'ün bu dalgası, teknik liderlerin ajan performansını nasıl ölçtüğünü inceliyor: hangi güvenilirlik ve değerlendirme platformlarını kullanıyorlar, bunları nasıl seçip güveniyorlar, üretimde neyin bozulduğu ve ajanların insan müdahalesi olmadan ne kadar ileri gitmesine izin vermeye istekli oldukları.

Araştırmanın temel bulgusu bir değerlendirme boşluğu: kuruluşların ajanlarına verdiği özerklik ile bu özerkliği yönetmesi gereken değerlendirmelere duydukları güven arasındaki fark. Kuruluşların yarısı (%50) son bir yıl içinde iç değerlendirmeleri geçen ancak müşteri karşısında başarısız olan bir ajan veya büyük dil modeli özelliği dağıttı. Dörtte biri ise bunu birden fazla kez yaşadı. Testlere duyulan güven zayıf: sadece %5'i otomatik değerlendirmeye tam olarak güvendiğini söylüyor. En sık dile getirilen sınırlama ise değerlendirmelerin gerçek dünya sonuçlarıyla zayıf uyumu (%29). Kuruluşlar, geçer not alan bir değerlendirmenin çalışan bir ajan anlamına gelmediğini keşfediyor.

Bu boşluğu önemli kılan şey ise gidişat yönü. Kuruluşların üçte ikisi (%66) ya düşük riskli ajanlar için tamamen otomatik, insan müdahalesiz dağıtıma izin veriyor (%34) ya da on iki ay içinde buna izin verecek şekilde altyapılarını aktif olarak hazırlıyor (%33). Aynı zamanda bu güveni kazanması gereken değerlendirme yapısı parçalanmış ve olgunlaşmamış durumda: en yaygın birincil araçlar, model sağlayıcılarının yerel değerlendirmeleri ve hiçbir özel aracın olmaması (her biri %17). Kuruluşların sadece dörtte biri canlı üretim trafiğinde gerçek zamanlı kalite kontrolleri yapıyor. Özerklik, güvenceden daha hızlı geliyor.

Metodoloji

VentureBeat bu anketi, devam eden Pulse Research serisinin bir parçası olarak gerçekleştirdi. 'Ajan Güvenilirliği ve Değerlendirmeleri' başlıklı bu anket, teknik liderlerin ajan performansını ve güvenilirliğini nasıl değerlendirdiğine odaklandı. Yanıtlar, 100 veya daha fazla çalışanı olan kuruluşlardan (n=157) alındı ve Haziran 2026'da tek bir anketten toplandı. Bu tek dalga olduğu için rapor kesitsel olarak okunmalı ve aylık eğilimler çıkarılmamalıdır. Birden fazla seçeneğin işaretlenebildiği sorularda oranlar %100'ü geçebilir.

Katılımcı profili açısından örneklem, kıdemli ve satın alma kararlarında etkili kişilerden oluşuyor: %38'i yapay zeka satın almalarında nihai karar verici, %34'ü ise öneride bulunan veya etkileyen kişiler. Ürün ve program yöneticileri (%15), danışmanlar (%10), mühendislik/BT direktörleri (%8) ve CIO/CTO/CISO'lar (%8) öne çıkan unvanlar arasında. Büyük bir 'Diğer' kategori (%37) de bulunuyor. Kuruluş büyüklüğü açısından orta ölçekli şirketler ağırlıkta: 100-499 (%37) ve 500-2.499 (%27) çalışan sayısı başı çekerken, 2.500-9.999 (%20), 10.000-49.999 (%10) ve 50.000+ (%6) üzerinde yer alıyor. Teknoloji/Yazılım %23 ile en büyük sektör, onu Perakende/Tüketici (%15), Sağlık/Yaşam Bilimleri (%12) ve Üretim (%10) takip ediyor.

157 katılımcılı örneklem, yön gösterici olarak okunabilecek büyüklükte ancak kesin bir ölçüm olarak değerlendirilmemelidir. Kendi kendine seçilmiş bir örneklemdir ve olasılık örneği değildir. Orta ölçekli şirketlere kaydığı için en iyi, ajan değerlendirme uygulamalarını aktif olarak kuran kuruluşların görüşü olarak okunmalıdır.

Not: Bu anket, önceki 'Büyük Dil Modeli Gözlemlenebilirliği ve Değerlendirmeleri' anketinden Haziran dalgası için yeniden oluşturulmuştur. Sorular ve örneklem farklı olduğu için Nisan-Mayıs verileriyle karşılaştırma yapılmamıştır.

Bulgu 1: Testi Geçen Ajan, Çalışan Ajan Değildir

Yarısı, testleri geçen ancak müşteri karşısında başarısız olan ajan dağıttı

Katılımcılara son 12 ayda iç değerlendirmeleri geçen ancak müşteri karşısında başarısızlığa yol açan bir ajan veya büyük dil modeli özelliği dağıtıp dağıtmadıkları soruldu. Değerlendirme yapan kuruluşların yarısı bunu yaşadığını belirtti.

%26 — Evet, bir kez
%24 — Evet, birden fazla kez — değerlendirme ile gerçeklik arasında tekrarlayan bir boşluk
%36 — Böyle bir üretim başarısızlığı tespit edilmedi
%8 — Dağıtım öncesi değerlendirme yapmıyor; %6'sı ise takip etmiyor veya bilmiyor

Bu, raporun tanımlayıcı rakamı. Kuruluşların yarısı (%50), iç değerlendirmeleri geçen ancak müşteri karşısında başarısız olan bir yapay zeka özelliği dağıttı — hatalı bir çıktı, bozuk bir iş akışı veya bir kalite olayı. Dörtte biri bunu birden fazla kez yaşadı. Sadece %36'sı böyle bir başarısızlık bildirmedi. Geri kalanlar ya dağıtım öncesi değerlendirme yapmıyor (%8) ya da temel nedeni yeterince yakından takip etmiyor (%6). Başarısızlık net ve maliyetli: değerlendirme ajanın hazır olduğunu söyledi ama değildi. Bundan sonraki her şey — kuruluşların değerlendirmelerine nasıl güvendiği, neyi izlediği ve ne kadar özerklik verdiği — bu deneyim tarafından şekilleniyor.

Bulgu 2: Neredeyse Hiç Kimse Otomatik Değerlendirmeye Tam Olarak Güvenmiyor

En büyük şikayet: Değerlendirmeler gerçek dünya sonuçlarıyla uyuşmuyor

Katılımcılara, otomatik ajan değerlendirmelerine olan güveni en çok hangi sınırlamanın azalttığı soruldu. Sadece çok az kuruluşun hiçbir şikayeti yoktu.

%29 — Gerçek dünya sonuçlarıyla zayıf uyum — önde gelen sınırlama
%21 — Değerlendirme yanlılığı veya tutarsızlığı
%18 — Açıklanabilirlik eksikliği
%17 — Veri sızıntısı veya gizlilik endişeleri
%11 — Araç olgunlaşmamışlığı; sadece %5'i otomatik değerlendirmeye tam olarak güvendiğini söylüyor

Otomatik değerlendirmeye güven az ve spesifik. Kuruluşların sadece %5'i mevcut haliyle otomatik değerlendirmeye tam olarak güvendiğini söylüyor — yani %95'i onları geri tutan bir sınırlama belirtiyor. En yaygın olanı %29 ile Bulgu 1'i en doğrudan açıklayan madde: değerlendirmeler gerçek dünya sonuçlarıyla zayıf uyumlu, daha sonra başarısız olacak ajanları geçiriyor. Yanlılık veya tutarsızlık (%21) ve açıklanabilirlik eksikliği (%18) takip ediyor — kuruluşlar bir değerlendirmenin neden belirli bir karara vardığını her zaman söyleyemiyor. %17'si ise değerlendirme sürecinin kendisinde veri sızıntısı veya gizlilik endişeleri belirtiyor. Ajanları onaylaması gereken testler henüz onları onaylayacak kadar güvenilmiyor — bu da Bulgu 3'teki özerklik eğilimini bu kadar çarpıcı kılan şey.

Bulgu 3: Özerklik Tavanı Yine de Yükseliyor

Üçte ikisi insansız dağıtıma izin veriyor veya buna hazırlanıyor

Katılımcılara, bir otonom ajanın, insan onayı olmadan, yalnızca otomatik değerlendirme sonuçlarına dayanarak bir kod veya sistem değişikliğini üretime göndermesine izin verip vermeyecekleri soruldu. Eğilim, güven boşluğunun içinden geçiyor.

%34 — Evet, belirli düşük riskli ajanlar veya değişiklikler için zaten izin veriliyor
%33 — Hayır, ancak 12 ay içinde buna izin verecek şekilde altyapı aktif olarak hazırlanıyor
%22 — Hayır ve öngörülebilir gelecekte tam otomatik dağıtıma izin vermeyi beklemiyor
%8 — Uygulanamaz, otonom ajan dağıtmıyorlar; %3'ü bilmiyor

İşte raporun kalbindeki paradoks. Neredeyse hiç kimse otomatik değerlendirmeye tam olarak güvenmese de (Bulgu 2), kuruluşların üçte ikisi (%66) ya düşük riskli ajanlar için insan müdahalesiz dağıtıma zaten izin veriyor (%34) ya da bir yıl içinde buna izin verecek şekilde altyapılarını aktif olarak hazırlıyor (%33). Sadece %22'si bunu öngörülebilir gelecekte tamamen reddediyor. Yön net: kuruluşlar, değerlendirmelerin gerçeklikle güvenilir bir şekilde eşleşmediğini söyledikleri anda, insan kontrolünü kaldırarak değerlendirmelerin üretimi otonom olarak yönetmesine izin vermeye doğru ilerliyor. Özerklik tavanı, altındaki güvenceden daha hızlı yükseliyor — bu da Bulgu 1'deki yanlış güven başarısızlıklarının azalmak yerine büyüyeceği mekanizma.

Gün Batımı, Kokteyl, İngilizce

Kaynak: VentureBeat AI