Blockchain & Kripto

OpenAI, yayınlanmamış modelin tek istemle yüzlerce matematik problemini çözdüğünü açıkladı; matematikçiler kanıt istiyor

OpenAI, yayınlanmamış modelin tek istemle yüzlerce matematik problemini çözdüğünü açıkladı; matematikçiler kanıt istiyor

OpenAI, yayınlanmamış iç modelden gelen 722 matematik makalesini GitHub’da 372 sonuç ailesi altında yayımladı.

722 makalenin yalnızca 162’sinde Lean ile biçimlendirilmiş ana sonuç bulunuyor ve OpenAI, biçimlendirilmemiş sonuçların bazılarının sorunlu olabileceği uyarısında bulundu.

MIT’li matematikçi Andrew Sutherland, tek istem ve tek ajan iddiasının model yayınlanana kadar doğrulanmadığını söyledi. Institute for Advanced Study’deki danışma grubunun açıklama önerdiği istemler de paylaşılmadı.

OpenAI Salı günü GitHub’da henüz yayınlamadığı iç bir model tarafından üretilen 722 matematik makalesini yayımladı. Bir OpenAI sözcüsü neredeyse tamamının tek bir istemle tek bir yapay zekâ ajanına verildiğini, bazılarının birden fazla deneme almış olabileceğini belirtti.

Bu iddialı bir sav ve matematik alanında potansiyel olarak önemli bir ilerleme. Ancak herkes heyecanlı değil, abartıyı da satın almıyor.

“Modeli yayınlayıp sonuçların tekrarlanmasına izin vermedikçe, tek ajanla tek seferde problem çözme iddialarını doğrulanmamış olarak ele almalısınız” diyen MIT’li matematikçi Andrew Sutherland, Scientific American’a konuştu. “Makbuzları istemeliyiz” dedi.

Makaleler 372 ‘aile’ halinde gruplandı ve bir aile ana teoremi eşlik eden argümanlar, sonuçlar ya da alternatif ispatlarla birleştirebiliyor. Bu yüzden 722 sayısı çözülen problem sayısı değil, el yazması sayısı. OpenAI’ye göre modele yaklaşık 4 bin problem soruldu ve yayımlanmaya değer görülen çıktılar saklandı.

OpenAI’ye göre ortalama bir sonuç ChatGPT Pro düşünme hesaplama kapasitesinin yaklaşık üç saatine denk geldi. Geçen ayki Navier-Stokes iddiası çok farklıydı; 10 bin koordine ajan 88 saat çalışmıştı.

OpenAI 10 sonuç için özetlenmiş akıl yürütme özetleri yayımladı. Depodaki biçimlendirme kataloğuna göre 722 makalenin yalnızca 162’si bilgisayar tarafından kontrol edilen ana sonuçla geliyor. Bu, her mantık adımını mekanik olarak kontrol eden Lean yazılımına çevrilen koleksiyonun yaklaşık yüzde 22’si.

OpenAI kendisi de tüm makalelerin Lean biçimlendirmesine sahip olmadığını ve “biçimlendirilmemiş sonuçların bazılarının sorunlu olabileceği”ni söylüyor. Başka bir deyişle yayımlananların büyük bölümü yanlış olabilir.

Geçen bir Lean kontrolü yalnızca ispatın Lean’de yazıldığı şekilde ifadeden çıktığını doğrular. İfadenin orijinal probleme uyduğunu, sonucun yeni ya da önemli olduğunu göstermez; bu kısmı matematikçilerin değerlendirmesi gerekiyor.

Ve işte araştırmacılar kaşlarını kaldırıyor.

“Düzlemin kromatik sayısının >= 6 olduğunu gösteren OpenAI ispatını okumaya çalışıyordum. Ama bu tamamen inanılmaz uzaylı matematik?”

“Bir şekilde model herhangi bir K-renklendirme <=> ‘zayıf ölçülebilir’ K-renklendirme buldu, bu hiç havadan geldi.”

— Dmitry Rybin (@DmitryRybin1) 7 Ekim 2026

“openai/math deposunda Issues kapalı ve hiç pull request kabul edilmedi. Bu hayal kırıklığı yaratıcı. 722 makale yayımlayıp Lean biçimlendirmesi istiyorsan insanların gönderebileceği bir yerin olması gerekir.”

“Lean 4’te OpenAI’nin Saxl’ın Sanısı ispatını biçimlendiriyorum…”

— Keith Adler (@keithadler) 7 Ekim 2026

“Artık yapay zekânın, onu istemlendiren insanı argümanları anlayamayan, doğrulayamayan ya da sorumluluğunu üstlenemeyecek şekilde matematiksel argümanlar üretebildiği bir durum söz konusu” diyen Princeton, New Jersey’deki Institute for Advanced Study bir açıklamada bulundu. “Matematiğin insan tarafından anlaşılmasının son derece önemli olduğuna inanıyoruz. Bu yeni çağda, sorumlu bilimsel çıktıların bir parçası olarak matematiğin insan tarafından anlaşılmasını nasıl sağlayabiliriz?”

Diğerleri ise Profesör Abhishek Saha gibi oldukça heyecanlı. “Matematik için çok büyük bir gün” diye yazdı, ancak çoğu problemin “mevcut bir program içindeki olağanüstü ilerlemeler” ve “şaşırtıcı atılımlar” kategorilerine girdiğini belirtti.

Bu, setteki çoğu problemin ilginç olduğu ancak milenyum problemleri gibi imkânsız ya da oyun değiştirici olmadığı anlamına geliyor. 722 makaleden tam olarak birine ayrılmış yer Quasi-Riemann Hipotezi.

“Bugün OpenAI tarafından yayımlanan 372 sonuç, 722 makale üzerinden bazı ek düşünceler.”

“Matematikçilerin ispatlayıp yayımladığı teoremleri çığır açıcı olma derecesine göre sınıflandırmak istersem, onları (çok kabaca) dört kategoriye ayırırım:”

“A) Çığır açıcı olmayan… https://t.co/BA10SxBlx7”

— Abhishek Saha (@ObhishekSaha) 7 Ekim 2026

Yayımlama, Institute for Advanced Study’deki danışma grubunun 29 Eylül’de önerdiğinin de altında kaldı: model adı, istemler, özetlenmiş düşünce zinciri, her sonuç için geçen süre ve hesaplama maliyeti. OpenAI ortalama hesaplama rakamları ve 10 akıl yürütme özeti yayımladı ancak istem paylaşmadı ve modeli sorumlu şekilde yayımlamak için çalıştığını söyledi.

Toronto Üniversitesi’nden matematikçi Daniel Litt, şirketten bu matematik sorularının cevaplarını gizli tutmasını isteme gerekçesi olmadığını savunarak farklı bir görüş ortaya koydu.

Anthropic geçen ay Lean ile kontrol edilmiş Fermat’ın Son Teoremi ispatıyla farklı bir yol izledi ve 13 milyon satırı GitHub’da herkese açık paylaştı. Bu ispat 1995’te Andrew Wiles’ın yayımladığı bir teoremi biçimlendirdi, yeni sonuç iddiasında bulunmadı.

OpenAI, Lean biçimlendirmelerini elde ettikçe ekleyeceğini söylüyor; şimdilik 722 makalenin 162’sinde böyle bir biçimlendirme var.

Kaynak: Decrypt

Paylaş:

Yapay zekâ asistanları için: bu haberin Markdown (.md) sürümü