Henüz radarınızda değilse yapay zeka laboratuvarı PrismML olması gerekiyor. Bunun nedeni topladığı para değil; şirket henüz büyük bir yatırım almadı, sadece 22,25 milyon dolarlık bir tohum yatırım turu tamamladı. Önemli olan teknik ekibi ve geliştirdiği sektör değiştirebilecek teknolojisi.
PrismML, yetenekli, yüksek performanslı ve akıl yürütme yapabilen büyük dil modellerinin aslında büyük olmak zorunda olmadığına bahse giriyor.
Şirket, akıl yürütme modellerini bilgisayarlara ve akıllı telefonlara sığacak kadar küçük hale getiriyor. Hatta Apple ile görüşme halinde olduğu konuşuluyor, ancak CEO Babak Hassibi bu iddiaya ilişkin TechCrunch’a yorum yapmayı reddetti.
Perşembe günü PrismML, model ailesinin en yeni üyesi Bonsai 2 27B’yi duyurdu. Model, Alibaba’nın yaygın kullanılan açık kaynaklı modeli Qwen3.8 27B’yi 5,9 GB’a sıkıştırıyor. Bu boyut bir bilgisayara ve muhtemelen üst seviye bir akıllı telefona rahatça sığıyor. Bellek kullanımı orijinaline kıyasla 9 ila 10 kat azaldı.
PrismML, bir grup Caltech araştırmacısı tarafından kuruldu ve liderliğini sıkıştırma teknolojileri uzmanı Caltech profesörü Hassibi yapıyor. Şirketin danışmanları arasında Databricks’in kurucusu ve Berkeley’in ünlü Sky Computing Lab’in direktörü Ion Stoica da bulunuyor. Söz konusu laboratuvar Letta’dan SGLang’e kadar pek çok teknoloji ve girişime ev sahipliği yaptı.
PrismML’e Khosla Ventures, Cerberus Capital ve Caltech yatırım yapıyor.
LLM sıkıştırma teknolojisi üzerinde çalışan tek şirket PrismML değil. İspanya’nın Donostia Uluslararası Fizik Merkezi’nden tanınmış bir profesör tarafından kurulan Multiverse Computing de bu alanda faaliyet gösteriyor. Multiverse Computing’in çok ciddi miktarda para topladığı biliniyor.
Hassibi, PrismML’in sıkıştırma teknolojisinin benzersiz olmasının nedenini modellerin orijinallere kıyasla neredeyse hiç performans kaybetmemesi olarak açıklıyor. Bonsai 2, Qwen’in toplam benchmark skorlarının yüzde 98’ine ulaşıyor. Bu oran, Mart ayında yayınlanan ve yüzde 95’lik eşleşme sağlayan ilk Bonsai modeline göre artış anlamına geliyor. İlk modelin 11 milyondan fazla kez indirildiği belirtiliyor; şirketin daha küçük modelleri ise ek olarak 2,6 milyon kez indirildi.
Bu durum, PrismML’in sıkıştırma sonuçlarının her sürümde iyileştiğini gösteriyor. Benchmark performansında yüzde 100 eşitliğe ulaşılıp ulaşılamayacağı ise henüz belirsiz. Hassibi’ye göre sıkıştırma her zaman bir miktar etki yaratacaktır.
Yine de mükemmel benchmark eşitliği akademik bir mesele olarak kalıyor. Sıkıştırılmamış halleriyle bile büyük dil modelleri kusursuz değil ve benchmark’lar gerçek görevleri tam olarak yansıtamıyor. Bu nedenle yüzde 2’lik bir düşüşün pratik kullanımda anlamlı bir fark yaratması beklenmiyor. Ayrıca modelin çalıştığı çevre yazılımının, yani donanımın doğruluğu üzerinde büyük etkisi bulunuyor.
PrismML bu başarıyı modelin yapı taşları olan “ağırlıkları” küçülterek elde ettiğini söylüyor. Ağırlıklar esasen modelin eğitim sırasında öğrendiği ve sakladığı bilgilerdir. Normalde her ağırlık 16 bit gerektirir. PrismML’in “terner” adı verilen yaklaşımı bunu +1, −1 veya 0 olmak üzere üç değere indiriyor. Her ağırlık için saklanacak değer çok daha küçük olunca model dramatik şekilde daha az yer kaplıyor.
Şirketin bir sonraki hedefi bu sıkıştırma tekniğini daha büyük modellere uygulamaktan geçiyor. Hassibi TechCrunch’a, “Önümüzdeki birkaç ay içinde yayınlamayı umduğumuz bir sonraki modeller birkaç yüz milyar parametre aralığında olacak ve zekayı korumanın orada daha kolay olacağını düşünüyorum” dedi.
Model boyutu büyüdükçe, diye ekledi, “Sıkıştırırken zekayı kaybetmeden daha fazla alan oluyor. Genel bir eğilim olarak söyleyebilirim ki daha büyük modellerde yüzde 100’e ulaşmak daha kolay.”
Stoica, bu teknolojinin gelişmiş modellerin kullanıcı cihazlarında çalışmasını mümkün kıldığı için heyecanlı olduğunu belirtiyor. “Akıllı telefonunuzun ucunda zeka olacak ve bu ücretsiz olacak çünkü zaten satın aldığınız cihazda çalışacak. Ayrıca özel olacak, çünkü veriyi buluta göndermeyeceksiniz.”