Blockchain & Kripto

Bonsai 27B: Cebinize Sığan İlk 27 Milyar Parametreli Yapay Zeka Modeli

Bonsai 27B: Cebinize Sığan İlk 27 Milyar Parametreli Yapay Zeka Modeli
Malta, Avrupa'nın Hawaii'si! Hem eğlen hem İngilizce öğren. Katıl →

Yapay zeka modelleri çok fazla bellek tüketiyor. Endüstri standartlarına göre orta ölçekli sayılan 27 milyar parametreli bir model, yarı hassasiyette çalışmak için yaklaşık 54 GB belleğe ihtiyaç duyuyor. Çoğu dizüstü bilgisayar bunu kaldıramaz; hatta bazı masaüstü sistemler bile yetersiz kalıyor.

Ancak bu hafta başında PrismML, yalnızca 3.9 GB boyutunda bir model yayınladı. Bu, bir iPhone'a sığacak kadar küçük.

Parametreler, bir modelin işleyebileceği ayar ve ince ayar sayısını ifade ediyor. Parametre sayısı arttıkça model daha yoğun ve daha yetenekli hale geliyor.

Bonsai 27B, tüketici sınıfı bir akıllı telefonun bellek sınırını aşan ilk 27B sınıfı model oldu. iPhone 17 Pro Max'te saniyede 11 token hızında çalışıyor. (Token'lar, yapay zeka modellerinin işleyip üretebildiği temel bilgi birimleridir.) Ternary varyantı ise 5.9 GB boyutunda ve M5 Pro dizüstü bilgisayarda saniyede yaklaşık 26 token hızına ulaşıyor. Her iki model de Apache 2.0 lisansıyla ücretsiz olarak sunuluyor.

Sıkıştırma yöntemi, Caltech fikri mülkiyeti üzerine inşa edilmiş. Her bir model ağırlığını 16 bit kayan nokta hassasiyetinden tek bir işarete indirgiyor: ikili (binary) yapıda +1 veya -1, üçlü (ternary) yapıda ise üç değerden biri. Her 128 ağırlıktan oluşan grup, 16 bitlik bir ölçekleme faktörünü paylaşıyor. Böylece ikili varyant, ağırlık başına 1.125 bit ile tam hassasiyetli orijinalinden 14 kat daha küçük hale geliyor. Ternary model ise biraz daha fazla ifade gücü için sıfır durumunu ekliyor ve ağırlık başına 1.71 bit seviyesine ulaşıyor.

Daha basit bir ifadeyle, bir ternary yapay zeka modeli her bir iç değer için yalnızca üç ayar kullanıyor: negatif, sıfır veya pozitif. Oysa standart bir yapay zeka yaklaşık 65.000 farklı ayar arasından seçim yapabiliyor.

PrismML tüm bunları çıktı kalitesinden çok fazla ödün vermeden başardı.

Bu modeli geleneksel "düşük bit" modellerden ayıran şey, hiçbir bileşenin yüksek hassasiyetli bir kaçış yolu bulamaması: gömme (embedding) katmanları, dikkat (attention) mekanizmaları ve dil modelinin tamamı uçtan uca sıkıştırılıyor. Çoğu niceleme (quantization) yöntemi, hassas katmanları tam hassasiyette tutar; bu da kaliteyi korumak için boyutu artırır. Bonsai ise bu oyunu oynamıyor.

Bu, ailenin ikinci büyük sürümü. Mart ayında PrismML, Bonsai 8B'yi piyasaya sürmüştü. Bu 1.15 GB'lık model, 1 bit mimarisinin 8 milyar parametrede mantıksal akıl yürütmeyi kaybetmeden çalışabileceğini kanıtlamıştı. Şimdi 27 milyara sıçrama, işin boyutunu değiştiriyor. Bu ölçekte sürekli zincirleme düşünme, güvenilir araç kullanımı ve çok adımlı etmen (agent) davranışları tutarlı bir şekilde ortaya çıkıyor; küçük modellerin hâlâ zorlandığı şeyler bunlar.

Kıyaslamalar (Benchmarks)

NVIDIA H100 GPU'larda düşünme modunda değerlendirilen 15 kıyaslama testinde — bilgi, matematik, kodlama ve araç kullanımı alanlarında — Ternary Bonsai 27B ortalama 80.49 puan aldı. Bu, tam hassasiyetli modelin %94.6'sına denk geliyor. 1 bit varyant ise 76.11 puanda kaldı.

Genel olarak, kıyaslamalarda bu modeller, boyutlarına kıyasla sundukları potansiyel açısından Gemma 4 veya Qwen 3.6'dan çok daha iyi performans gösteriyor.

Modeller, sunduklarına ve gerektirdikleri kaynakların azlığına bakıldığında oldukça başarılı. Bu sayede küçük donanımlar (akıllı telefonlar ve düşük seviyeli bilgisayarlar) yetenek açısından bambaşka bir seviyeye taşınıyor. Amerikan Matematik Yarışması'nı temel alan AIME25 ve AIME26 testlerinde Ternary Bonsai 27B %93.7 puan alırken, çok daha büyük olan Qwen 3.6B %95.3 puan aldı. Bonsai, kodlama testinde 86 puana karşılık Qwen 3.6 88 puan aldı; genel bilgide ise Bonsai %77, Qwen 3.6 %83 puan aldı.

Gün Batımı, Kokteyl, İngilizce

Kaynak: Decrypt