OpenAI bu hafta dünyanın en zor matematik problemlerinden bazılarına ait yüzlerce iddia edilen çözüm yayınladığında, öncü laboratuvar son kez bir modelinin alanındaki uzun süredir devam eden bir problemi çözmesiyle gelen tartışmayı önlemek için seçkin matematikçilerden oluşan bir danışma grubuna danıştığını söyledi.
Ama OpenAI, özellikle matematikçilerin bir matematiksel sonucun insan tarafından anlaşılmasına vurgu yaptığı noktalarda bu standartların altında kaldı. Bu durum, OpenAI modellerinin çözdüğü iddia edilen bir milyon dolarlık problemin doğal dil ve biçimsel olarak ifade edilmiş çözümü arasındaki boşlukları vurgulayan yeni bir makalenin ardından özellikle endişe verici.
Princeton Üniversitesi İleri Araştırmalar Enstitüsü tarafından barındırılan Matematik ve Yapay Zekâ Danışma Grubu (AGMAI), dünyanın dört bir yanındaki kurumlarda çalışan dokuz önde gelen araştırmacıdan oluşuyor.
Kuruluş, eylül sonu itibarıyla matematik problemlerini çözen öncü laboratuvarlar için yönergeler yayınladı. Son kanıt setine ilişkin açıklamada AGMAI, "önerilerimizin ne ölçüde başarıyla uygulandığını nihayetinde matematiksel topluluğun değerlendirmesi gerekiyor" dedi.
Ancak kuruluşun ilk talebi "gelişmiş matematiksel problemleri tescilli modeller üzerinde test etmeyi durdurmak"tı. OpenAI'nin duyurusu, tescilli modellerini matematik alanındaki açık araştırma problemleri üzerinden değerlendirdiğini açıkça belirtiyor.
Danışma grubu, TechCrunch'ın OpenAI'nin son kanıt yayınlamasına ilişkin daha kapsamlı bir değerlendirme talebine yanıt vermedi. Laboratuvar, sonuçları mümkün olan en kısa sürede yayınlama ve modellerin sonuçlara nasıl ulaştığına dair bilgi sunma gibi bazı ilkelerine açıkça uydu. Ama hepsinde değil: 719 makaleden sadece 10'unda modelin düşünce zinciri paylaşıldı.
İnsanların anlamadığı makaleler için matematikçiler, kanıtların biçimselleştirilmesini önerdi; ancak OpenAI'nin yayınladığı kanıtların %42'si bu sürece tabi tutulmamıştı.
Sonuçta OpenAI'nin kanıtlarını yayınlarken "insan anlayışının takip edeceğinden sorumluluk alıp almadığı" AGMAI ilkelerine uygun olarak hâlâ net değil. AGMAI, OpenAI'nin laboratuvarın çözümlerini gerçek anlamda anlamlı kılacak insan matematikçilerin çalışmalarını finanse etmeye yardımcı olmasını önerdi.
"Problemler, ilk hedefleri 'çözüldükten' sonra daha geniş alanla ilgilenmeyen ve sonucu sorulara yanıt verecek, konuşma yapacak veya alanın geri kalanıyla etkileşime girecek kadar AI çıktısını anlamayan özerk AI istemcileri tarafından çözülüyor," önde gelen matematikçi Terence Tao, yayın sonrası sosyal medyada OpenAI'nin yaklaşımını eleştirdi.
Bu sorun, bu hafta Cambridge Üniversitesi ve Londra'daki King's College'daki matematikçilerin öncü laboratuvarların bu zorluklara yaklaşımını sorgulayan bir makale yayınlamasıyla örneklendi.
AI modelleri matematiksel problemleri çözdüğünde önce "doğal dil" açıklaması oluşturuyor, ardından sonucu teoride kanıtın doğruluğunu kod olarak derleyerek onaylayan bir programlama dili olan Lean'de ifade etmeye çalışıyor.
Ancak modellerin doğal dil kanıtlarını koda çevirme biçiminde sorunlar olabilir; bu makale, OpenAI'nin akışkanların karmaşık davranışını tanımlayan Navier-Stokes denklemlerinden türetilen bir probleme sunduğu çözümün arkasındaki doğal dil kanıtı ile Lean kodu arasında en az iki tutarsızlık belgeliyor.
Bu tutarsızlıklar her iki çözümü de kesin olarak çürütmüyor, ama modellerin kendi çözümlerini insan müdahalesi olmadan biçimselleştirmesine güvenip güvenemeyeceğimiz konusunda soru işaretleri yaratıyor. Bu da AGMAI'nin OpenAI'den "doğal dil ve biçimsel materyalleri ilişkilendiren makine tarafından okunabilir meta verileri" dahil etmesini istemesinin bir nedeni. Öncü laboratuvar bunu bu yayınlarda yapmadı.
"Yanlış çeviri olgusu — bu makalede vurgulandığı üzere — OpenAI'nin NL kanıtı ve
diğer otomatik biçimlendirilmiş Lean kanıtları, diğer kanıtların tabi tutulduğu aynı hakem süreci ve incelemeden geçmeden prima facie güvenilmemelidir," "kayıp çeviri" makalesinin yazarları sonuçlandırdı.
Matematikçiler, yeni sonuçlar insanlar tarafından keşfedildiğinde sorumluluğun üstlenildiğini ve makaleler, konuşmalar ve seminerler yoluyla daha geniş toplulukla etkileşime girildiğini vurguluyor. Bu süreç çözümlerin anlaşılmasını artırıyor, diğer problemleri çözmek için kullanılabilecek stratejiler buluyor ve yeni bilginin pratik alanlarda uygulanmasına olanak tanıyor.
Bir modelin zor bir problemi çözmesi için istemlenmesi ve bir çözüm çıkarması durumunda, "yayın anında insan anlayışı yok, iş o noktada başlıyor," Harvard Üniversitesi matematik profesörü Melanie Wood, TechCrunch'a söyledi.