Yapay Zeka

Yapay Zekanın Gerçek Kullanım Amacı Hâlâ Bir Muamma: Şirketler Sadece İstedikleri Verileri Paylaşıyor

Yapay Zekanın Gerçek Kullanım Amacı Hâlâ Bir Muamma: Şirketler Sadece İstedikleri Verileri Paylaşıyor
Deniz, Kum, Güneş... ve İngilizce

Anthropic ve OpenAI gibi yapay zeka şirketleri, insanların Claude ve ChatGPT gibi ürünleri nasıl kullandığına dair düzenli olarak raporlar yayımlıyor. Ancak yapay zeka araştırmacılarına göre bu şirketler sadece bize göstermek istedikleri verileri açıklıyor.

Stanford Güvenilir Yapay Zeka Araştırma (STAIR) Laboratuvarı'nda bilgisayar bilimleri doktorası adayı olan Anka Reuel, “Bu verileri doğrulayacak bağımsız bir kaynak yok” diyor.

Reuel, bu boşluğu doldurmayı amaçlayan AI Observatory (Yapay Zeka Gözlemevi) adlı yeni bir araştırma projesinin ortak lideri. Proje, kullanıcıların onayıyla yedi mevcut veri seti aracılığıyla toplanan Claude ve Gemini gibi popüler modellerle yapılan gerçek yapay zeka konuşmalarını bir araya getiren ve analiz eden kamuya açık bir platform. Reuel, Gözlemevi'nin amacının, araştırmacıların ve politika yapıcıların üretken yapay zekanın nasıl kullanıldığını değerlendirmesi için bağımsız bilgi kaynakları sağlamak olduğunu belirtiyor. Paydaşların, yapay zekanın faydaları ve riskleri hakkında çok sınırlı verilere dayanarak son derece önemli kararlar aldığını vurguluyor.

AI Observatory, yapay zeka kullanımının modeller arasında önemli ölçüde farklılık gösterdiğini ve zaman içinde değiştiğini ortaya koydu. Araştırma, büyük yapay zeka şirketlerinin raporlarında yakalananlardan çok daha fazla hassas davranış olduğunu gösteriyor. Şirketlerin raporları ise kişisel kullanımdan ziyade iş odaklı kullanıma daha fazla ağırlık veriyor.

Anthropic Ekonomik Endeksi, yapay zeka kullanım verilerinin en bilinen ve en çok atıf yapılan kaynaklarından biri olsa da bazı kör noktaları bulunuyor. Adından da anlaşılacağı gibi, bu endeks Claude yapay zekasının iş ve verimlilikle ilgili kullanımlarına odaklanıyor ve bu kullanımlarla ilgisi olmayan konuşmaları filtreliyor.

AI Observatory ekibi, Anthropic’in yöntemlerini kendi veri setlerine uyguladığında, konuşmaların neredeyse yarısının, yani yüzde 48'inin filtrelenmiş olacağını fark etti. Filtrelenen iş dışı konuşmalar; sağlık ve ilişkiler (Anthropic’in analizindeki yüzde 31,2'ye karşı yüzde 44,2), yetişkinlere yönelik veya yasa dışı konular (yüzde 2,1'e karşı yüzde 7,9), taciz ve nefret söylemi (yüzde 5,66'ya karşı yüzde 27,5) ve cinsel içerik (yüzde 2,4'e karşı yüzde 16,7) gibi konuları içeriyordu. (Benzer şekilde OpenAI’nin 2025 yılında yayımladığı ChatGPT kullanım raporunda da tüketici kullanımının sadece yüzde 30'unun işle ilgili olduğu ortaya çıkmıştı.)

Anthropic, insanların Claude'u destek veya arkadaşlık için ve hatta çocuk cinsel istismarı materyali (CSAM) üretmek için nasıl kullandıklarına dair ayrı blog yazıları yayımladı. Ancak Teksas Üniversitesi Austin Kampüsü Bilgi Okulu'nda yardımcı doçent olarak görev yapan ve insanların yapay zeka sistemleriyle nasıl etkileşime girdiğini araştıran David Widder, “AI Observatory'nin kuş bakışı analizi, ayrı raporlara bölünmek yerine araştırmacıların farklı kullanımları daha tutarlı bir şekilde anlamasına yardımcı oluyor” diyor. Widder, bu araştırmaya dahil değil.

AI Observatory'nin incelediği veri setleri, 2023 ile 2025 yılları arasında gerçekleşen konuşmaları içeriyor. Hem insanların yapay zekayı nasıl kullandığında hem de çeşitli yapay zeka platformlarının nasıl yanıt verdiğinde farklılıklar tespit edildi.

AI Observatory’nin çalışmasına dahil edilen en büyük ve en ayrıntılı veri setlerinden biri olan WildChat'teki konuşmalar, zaman içinde daha uzun ve daha ayrıntılı hale geldi. Bu durum, istem (prompt) belirteçleri, yanıt belirteçleri ve konuşma turlarındaki artışlarla ortaya kondu.

Zaman içinde küçük sohbetlerin de önemli ölçüde arttığı görüldü. Bu durum, yapay zeka arkadaşlığının arttığını gösterirken, yapay zeka asistanlarının kendini ifşa etmesi (yani bir sohbet botu olduklarını belirtmeleri) azaldı.

Ayrıca araştırmacıların hassas kullanım olarak etiketlediği değiş tokuşlar; cinsel taciz ve nefret söylemi dahil potansiyel olarak zararlı veya kısıtlı içerik barındıranlar; düşüş gösterdi. Bu durum, platformların genel olarak daha etkili güvenlik önlemleri dağıttığını işaret ediyor olabilir.

AI Observatory ayrıca yapay zeka kullanımının modele göre önemli ölçüde farklılaştığını buldu. Kullanıcılar, araca bağlı olarak konular, etkileşim stilleri, konuşma yapıları ve hassas kullanım durumlarının hem olasılığı hem de türü açısından çeşitlilik gösterdi.

Örneğin araştırmacılar, insanların Grok ve Gemini'yi daha sık bilgi edinme amacıyla kullandığını tespit etti. Grok özellikle haberler ve siyasetle ilgili bilgiler için popülerdi, ancak aynı zamanda yanlış bilginin yoğunlaştığı yer olarak öne çıktı. (Bu durum, yanlış bilginin Grok'ta ne kadar kolay yayıldığını gösteren diğer araştırmalarla da tutarlık gösteriyor. xAI, yorum talebine yanıt vermedi.)

Öte yandan insanlar kodlama için daha çok Anthropic'e, sosyal ve rol yapma kullanımları için Gemini'ye ve ödev yardımı için ChatGPT'ye yönelme eğilimindeydi.

Aynı modelin farklı sürümleri arasında bile farklar vardı. Araştırmacılar, insanların ChatGPT'yi GPT-3.5 sürümüyle kullanırken daha kısa, GPT-4o sürümüyle kullanırken ise daha uzun ve tekrarlı konuşmalar yaptığını ortaya koydu. GPT-4o sürümünün duygusal bağımlılığa yol açmasıyla tanındığı göz önüne alındığında, bu durum gayet mantıklı bir sonuç.

Ancak şirket raporları, kendi modelleri arasındaki veya içindeki bu ince ayrıntıları yansıtmıyor. Araştırmayı Reuel ile birlikte yürüten MIT Medya Laboratuvarı'ndan yeni mezun bir doktor olan Shayne Longpre, “Hiçbir tekil şirket raporu tüm hikayeyi anlatmıyor” diyor.

AI Observatory'yi oluşturmak için Reuel ve MIT, Stanford, Data Provenance Initiative ve diğer kurumlardan araştırmacılar; önceki araştırmalar tarafından toplanan yedi gerçek dünya veri setinden 85.633 konuşma turunu (yani kullanıcı istemi ve ilgili yapay zeka yanıtını) içeren 24.521 konuşmayı bir araya getirdi. Bu konuşmalar, 2023 ile 2025 yılları arasında ChatGPT, Gemini, Claude ve Grok dahil 52 farklı modelle etkileşime giren 5.000 kullanıcıdan geliyordu.

Ancak bu konuşmalar, büyük laboratuvarların kendilerinin erişebildiği verilerin yanında devede kulak kalıyor. Örneğin en son Anthropic Ekonomik Yapay Zeka Endeksi, 1 milyon Claude konuşmasının analizine dayanırken; OpenAI’nin insanların ChatGPT'yi nasıl kullandığına dair raporu 1,5 milyon konuşmayı analiz etti.

Bir Anthropic temsilcisi, yayımladıkları araştırmaların kendi araştırma ekiplerinin belirli sorularını ve ilgi alanlarını yansıttığını ve harici bağımsız araştırmaları desteklemenin önemini belirtti. OpenAI ise yorum taleplerine yanıt vermedi.

Ayrıca AI Observatory'nin veri setinin gönüllü olarak sağlanan kaynaklardan derlenmesi, hassas kullanımları temsil etmede yetersiz kalabileceği anlamına geliyor; çünkü insanlar bu tür kullanımları paylaşmaya daha az eğilimli olabilir. Bu nedenle araştırmacılar, bulgularının tüm yapay zeka kullanımını yansıtmadığı konusunda uyarıda bulunuyor.

Yine de Gözlemevi'nin çalışması, araştırma topluluğu için erişimi genişletiyor. Bağımsız araştırmacılar olan Reuel ve Widder, yapay zeka şirketlerinin genellikle sohbet verilerini analiz için paylaşmadığını, bu nedenle raporlarının şirketlerini en iyi ışıkta gösteren bulgulara odaklanma eğiliminde olduğunu söylüyor. Widder, “Örneğin, Anthropic'in genel amaçlı yapay zeka sisteminin çoğunlukla iyi mi yoksa kötü mü kullanıldığını sormak istediğimizde, bu bilgi tescilli olduğu için bu soruyu cevaplamanın bir yolu yok” diye açıklıyor.

AI Observatory'nin verileri araştırmacıların analizine açık olacak ve ekip zaman içinde veri setlerini genişletmeyi umuyor. Reuel, ideal olarak yapay zeka şirketlerinin verilerini bağımsız araştırmacılarla paylaşmasını; elbette kullanıcı gizliliğini koruyacak şekilde yapmasını istiyor. Ancak mevcut durumda, yapay zeka kullanım verilerine dayanarak karar veren herkesin, “tamamen belirsizlik içinde hareket etme ve şirket anlatılarının ötesinde gerçekte neler olup bittiğini bilmeden bu gerçekten önemli kararları alma” riskiyle karşı karşıya olduğunu sözlerine ekliyor.

Deniz, kum, güneş ve İngilizce — Malta'da bir dil tatili! Programı gör →

Kaynak: MIT Technology Review