Blockchain & Kripto

DeepSeek'in yeni modeli tasarımda GPT-6 Astra'yı neredeyse yakalıyor—maliyetin yüzde 1,4'ü kadar

DeepSeek'in yeni modeli tasarımda GPT-6 Astra'yı neredeyse yakalıyor—maliyetin yüzde 1,4'ü kadar
Malta'da Hem Öğren Hem Çalış

OpenDesign Arena, gerçek dünya tasarım görevlerinde DeepSeek V4.1 Flash'a 100 üzerinden 81,2 puan verdi; bu puan GPT-6 Astra'nın 82,7 puanının yüzde 98'ine denk geliyor. Bitmiş her tasarım için Astra $1,61 isterken DeepSeek $0,023 istiyor.

Test edilen 13 model arasında Claude Fable 5.1, Grok 4.6 ve Qwen 3.8-Max da bulunuyor. DeepSeek'in modelinden daha düşük puan alan ve çalıştırılması daha pahalı olan model sayısı 11. Daha yüksek puan alan tek model GPT-6 Astra.

DeepSeek'in V4.1 Flash için teknik makalesi, modelin bir istemi okumak için 552 milyar parametresinden yalnızca 8 milyarını etkinleştirdiğini gösteriyor. Bu tasarım tercihi düşük fiyatın nedeni.

Benchmark sitesi OpenDesign Arena'nın arkasındaki şirket OpenDesign, bu hafta 13 yapay zekâ modelini aynı tasarım görevleri grubundan geçirdi. En yüksek puanı OpenAI'nin GPT-6 Astra'sı aldı. Ancak DeepSeek'in en yeni modeli V4.1 Flash, zirve puanın yüzde 98'ine ulaştı ve zirve fiyatın yaklaşık yüzde 1,4'ünü talep etti.

OpenDesign Arena, modelleri günlük tasarım işlerinde değerlendiriyor—web uygulamaları, panolar, mobil ekranlar ve açılış sayfaları oluşturma—100 puan üzerinden. Bu puanların 30'u çıktının briefe uyup uymadığını kontrol ediyor; kalan 70 puan düzen, hiyerarşi, renk ve stil uyumu gibi tasarım kalitesine göre veriliyor.

Bu sistem, çoğu yapay zekâ lider tablosunun sorduğundan daha dar bir soruyu yanıtlamak için kuruldu: Yarın gerçekten kullanacak bir web tasarımcısı hangi modeli seçmeli.

Bu ölçekte GPT-6 Astra ortalama 82,7 puan aldı, bitmiş her tasarım için 11,1 dakika harcadı ve $1,61 maliyet çıkardı. DeepSeek V4.1 Flash 81,2 puan aldı, işi 5,3 dakikada bitirdi ve $0,023'a mal oldu. Claude Fable 5.1 80,3 puanla geldi, 12,8 dakika sürdü ve $3,66 tuttu.

OpenDesign'ın test ettiği diğer her model—Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash ve Gemini 3.8 Flash da dahil—DeepSeek V4.1 Flash'tan daha düşük puan aldı ve çalıştırılması daha pahalıya geldi. Test edilen 13 modelin 11'i bu durumda. DeepSeek'i açık ara geçen tek model GPT-6 Astra oldu ve fark sadece bir buçuk puan.

DeepSeek'in V4.1 Flash için teknik raporu tasarrufun nereden geldiğini açıklıyor. Model toplamda 552 milyar parametre taşıyor—bir modelin eğitim sırasında öğrendiğini saklamak için ayarladığı iç ayarlar—ancak gelen bir istemi okumak için yalnızca 8 milyarını, yanıtı yazmak için ise 16 milyarını harekete geçiriyor. DeepSeek buna Causal Encoder-Decoder tasarımı diyor ve bu, modelin hızlı tamamlama sürelerinin de arkasındaki yöntem.

Bu, DeepSeek'in ucuz yoldan yetenek açığını kapatma adına yaptığı ilk girişim değil. Haftalar önce şirketin V4 Pro modeli, ayrı bir kıyaslamada Claude Fable 5'in yüzde 5'i içine girerken Fable'ın tarifesinin bir kısmını talep etti. DeepSeek ayrıca tam agentic yığınına sahip olmak için sadece altyapıdaki modeli sağlamak yerine kendi Code Harness'ını inşa etmek üzere mühendisleri Pekin'de işe alıyor.

OpenDesign'ın test düzeni bu sayıların neyi kanıtlayabileceğini sınırlıyor. Bir modelin çıktısı yalnızca ilk etapta çalışan bir web sayfası olarak render edilirse puanlanıyor; boş, bozuk veya kesik her şey sıfır alıyor ve yeniden test edilmiyor. Bu da kıyaslamanın genel akıl yürütme veya kodlama becerisi yerine güvenilir, günlük tasarım çıktısını ölçtüğü anlamına geliyor.

OpenAI'nin 3 Eylül'de yayınladığı GPT-6 Astra, bir devre kartı düzenlemekten vergi beyannamesi taslaklamaya, 3D sahne oluşturmaya kadar her şeyi yapma ününe sahip. Erken test edenler, modelin yazar olarak kendisini değiştirdiği modelden daha zayıf olduğunu belirtti. OpenDesign tablosundaki fiyatı ve temposu aynı genelci tasarıma uyuyor: DeepSeek'in daha ucuz girişinden daha yavaş ve daha pahalı, ancak alanda hâlâ en yüksek puan alan model.

DeepSeek V4.1 Flash'ın teslim oranı—OpenDesign'ın revizyonsuz teslim etmeye hazır bulduğu çıktıların payı—yüzde 57,7 oldu. GPT-6 Astra'nın teslim oranı yüzde 60, Claude Fable 5.1'in ki yüzde 56,7.

Üniversite Destekli Dil Okulu

Kaynak: Decrypt