Yapay Zeka

Microsoft yöneticisi yapay zeka taramasını “insanlık tarihinin en büyük emek hırsızlığı” olarak nitelendirdi, yeni sansürsüz belgeler ortaya çıkardı

Microsoft yöneticisi yapay zeka taramasını “insanlık tarihinin en büyük emek hırsızlığı” olarak nitelendirdi, yeni sansürsüz belgeler ortaya çıkardı
Malta, Avrupa'nın Hawaii'si! Hem eğlen hem İngilizce öğren. Katıl →

OpenAI ve Microsoft’a karşı The New York Times’ın üç yıl önce açtığı telif davasında ortaya çıkan yeni sansürsüz bilgiler, yapay zeka taramasının hırsızlığa eşdeğer olduğu yönünde bir itirafı ve yapay zeka ürünlerinin yayınlar için ciddi tehdit oluşturduğunu ortaya koyuyor.

Davaya göre, Microsoft’un üst düzey bir yöneticisi şirketlerin yapay zeka eğitim uygulamalarını özel olarak “hırsızlık” olarak tanımladı ve OpenAI’nin kendi liderliği yapay zeka modellerinin kendilerini eğiten yayıncı ve gazeteciler için “varoluşsal tehdit” oluşturduğunu söyledi.

Açığa çıkan belgeler ayrıca şirketlerin bu içerikleri nasıl elde edip kullandığını da detaylandırıyor. Paywall’ları fark edilmeden aşarak, kitlesel tarama yoluyla eğitim veri setleri oluşturarak ve eğitim verilerinden telif bildirimlerini bilinçli olarak kaldırarak hareket ettikleri iddia ediliyor.

Belirtmek gerekir ki yeni bilgilerin büyük bölümü The Times’ın kendi dilekçesinden geliyor, temel ekler hâlâ gizli. Aşağıdaki alıntılar orijinal bağlamları olmadan sunuluyor.

Sansürsüz dilekçe, The New York Times’ın firmaların üretken yapay zeka modellerini kendi içerikleriyle eğiterek telif hakkını ihlal ettiğini ileri sürdüğü üç yıllık davada son tırmanışın habercisi.

Yapay zeka firmalarının telifli materyali yapay zeka eğitimi için yasal olarak kullanıp kullanamayacağı sorusunun net bir cevabı yok, ancak hâkimler eğitim faaliyetinin “adil kullanım” kapsamında olduğu yönündeki yapay zeka şirketlerinin argümanlarına genel olarak olumlu yaklaşıyor. Bu hukuki kural, parodi, haber raporlama veya eleştiri gibi belirli durumlarda telifli eserin izin olmadan kullanılmasına izin veriyor. Bu ayın başlarında Trump yönetimi, OpenAI’nin büyük dil modellerini eğitmek için telifli materyali lisanssız kullanmasının savunulması yönünde bir dilekçe sundu.

Yeni itiraflardan bazıları ise OpenAI’nin adil kullanım savunmasıyla çelişiyor; özellikle kullanımın orijinal eserin pazarı için ikame oluşturmaması veya zarar vermemesi gerektiği kuralıyla.

Örneğin Microsoft’un kendi verileri, Copilot “yanıt motoru”nun The New York Times alanına gelen tıklama oranlarını geleneksel Bing aramasına kıyasla en fazla %93 oranında düşürdüğünü gösteriyor. Microsoft’un Uygulamalı Bilim Direktörü Brent Hecht tarafından Ocak 2024’te yazılan iç bir Microsoft sunumu, düşüşü modellerin ve tüm web’in performansına zarar verecek bir “kıyamet döngüsü” olarak tanımlıyor.

“Temel tedarikçilerinin ekonomik temellerini tehdit eden bir son ürünün olması son derece alışılmadık bir durumdur, ancak LLM işimiz için ‘içerik tedarik zinciri’ ile ilgili olarak tam olarak böyle bir durum yarattık” ifadesi, dilekçede aktarılan Microsoft belgesinde yer alıyor.

Microsoft CEO’su Satya Nadella da bu yıl verdiği ifadede “Paywall arkasında olan her şeyin kullanılmak istenen herkes tarafından lisanslanması gerekir… gerekçelendirme veya eğitim için” dedi ve eğer “OpenAI’nin paywall arkasındaki bilgileri tarayıp eğitimde kullandığının farkında olsaydım” Microsoft’un OpenAI’yi modellerini yeniden eğitmeye zorlama hakkını kullanacağını açıkça belirtti.

Diğer itiraflar adil kullanım testinin farklı ayaklarına da aykırı. OpenAI’nin ChatGPT Başkanı Nick Turley, iç iletişimde yayıncıların sohbet robotu gibi ürünlerden “varoluşsal tehdit” altında olduğunu, bu ürünlerin “büyük ölçüde ikame edici” olduğunu ve geliştikçe daha da ikame edici hale geleceğini yazdı.

OpenAI Başkanı Greg Brockman modelleri “haber konusunda mükemmel” olarak tanımladı. Nadella bu yıl yemin altında sohbet robotlarıyla konuşmanın “bilgiyi doğrudan web sitesinde yapay zeka platformunda vermesi nedeniyle altta yatan kaynağa gitme ihtiyacını ortadan kaldırarak… ikame ettiğini” kabul etti.

Bu tür ifadeler teknolojinin orijinal eseri dönüştürmekten ziyade doğrudan onunla rekabet edebileceğini gösteriyor.

Bir Microsoft belgesi, üretken yapay zekanın “temel modelin eğitildiği veriyi üreten insanların istihdamını önemli ölçüde bozma” yönünde “gerçek bir risk” taşıdığını belirtiyor.

Kopyalamanın ölçeği çarpıcı. Belgeler, OpenAI’nin orta eğitim veri setlerinin yalnızca NYT, Daily News ve Center for Investigative Reporting tarafından yayımlanan eserlerin 91.692’den fazla kopyasını içerdiğini ilk kez ortaya koyuyor. Common Crawl kaynaklı bir veri seti yalnızca nytimes.com’dan 2 milyondan fazla belge içeriyordu.

Ocak 2023 tarihli iç bir notta Hecht, duruma “eşi benzeri görülmemiş boyutlarda şaşırtıcı bir hırsızlık” ve “insanlık tarihinin en büyük emek hırsızlığı” dedi.

Dilekçe, OpenAI ve Microsoft’un davacıların içeriğini nasıl elde ettiğine dair yeni ayrıntılar sunuyor; bu kapsamda içeriğin Bing Endeksi’nden taranması da yer alıyor.

“OpenAI, GPT-3 eğitim veri setinin tamamını Microsoft’a teslim etti ve Microsoft bunu OpenAI modellerini kendi ticari ürünlerinde nasıl uygulayacağını değerlendirmek için kullandı” ifadesi dilekçede yer alıyor. “Microsoft da Project Taxi ve Project Mango adı verilen girişimler aracılığıyla OpenAI’ye eğitim verisi sağladı.”

Şirketlerin Project Mango verilerini haber yayıncılarından en az 160.903 benzersiz eserin kopyalarını içeren bir eğitim veri seti halinde birleştirdiği iddia ediliyor.

Tarama işleminden en iyi şekilde yararlanmak için OpenAI çalışanlarının fark edilmeden paywall’ları atlatma planı geliştirdiği iddia ediliyor. Dilekçelere göre OpenAI araştırmacısı Nick Ryder, Brockman’a “nytimes paywall’ını aşmak için bir hile” olduğunu söylediğinde Brockman “aa güzel” diye yanıtladı.

OpenAI çalışanlarının WebText ve WebText2 gibi eğitim veri setlerini de orantısız şekilde taranmış haber içeriğine dayalı olarak inşa ettikleri iddia ediliyor. Ayrıca ücretsiz, açık bir web tarama veri deposu olan Common Crawl’dan milyonlarca makale çektikleri de iddia ediliyor. Araştırmacıların model çıktısında kullanıcılara “telif bildirimleri” çıkmasını istememeleri nedeniyle eğitim verisine ulaşmadan önce telif bildirimlerinin kasıtlı olarak çıkarıldığını anlatan bulgular da yer alıyor.

OpenAI ve Microsoft yorum taleplerine yanıt vermedi.

Deniz, kum, güneş ve İngilizce — Malta'da bir dil tatili! Programı gör →

Kaynak: TechCrunch