Yapay zeka çıkarım (inference) hızı için verilen yarış tüm hızıyla sürüyor. Piyasalar, mayıs ayında halka arzı gerçekleşen Cerebras ve onun özel tasarım çiplerini coşkuyla karşıladı. Ancak Fransız girişim Kog, tüm iddiasını mevcut standart GPU'lardan çok daha fazla performans sıkıştırıp çıkarabileceği üzerine kuruyor.
Girişim, mayıs ayında Hacker News ana sayfasına çıkarak dikkatleri üzerine çekti. Yayınladıkları teknik önizleme ile şirketlerin halihazırda sahip olduğu standart veri merkezi GPU'larında son derece hızlı, tek isteklik kod çözmenin mümkün olduğunu kanıtlamayı hedeflediler. Demolarında AMD MI300X ve NVIDIA H200 GPU'larını kullandılar.
Bu hızın dizüstü bilgisayarlardaki GPU'lara yansımaması bazılarını hayal kırıklığına uğratsa da, potansiyeli görenler de azımsanmayacak kadar çoktu. Çıkarım hızı ve maliyetleri artık kritik bir darboğaz haline gelmişken, Kog'un mevcut donanımları yazılımsal optimizasyonla yeni yeteneklere kavuşturma vaadi sadece meraklıları değil, ciddi müşterileri de peşinden sürükledi. Şirketin CEO'su Gaël Delalleau, TechCrunch'a yaptığı açıklamada, 200 somut iş talebi aldıklarını belirtti.
Erken geri bildirimlere dayanarak, tek kurucu olan Delalleau, ilk kullanım senaryosunun yazılım mühendisliği olmasını bekliyor. Claude Code'un deneyimli kullanıcıları, sonuçları almak için bazen saatlerce beklemek zorunda kaldıklarını çok iyi biliyor. Anthropic de hızın para ettiğini gayet iyi anlıyor ve Claude'un Hızlı Modu (Fast Mode) için çoklu fiyatlandırma uyguluyor.
Kog, genellikle profesyonel işler için yapay zeka iş akışlarına güvenen ve bu gecikmelerden bıkan müşterileri hedef alıyor. Ancak girişimin, kullanıcıların tek bir komutla oyun ve uygulama oluşturmasına olanak tanıyan tasarım ortakları da var. Delalleau'ya göre, Kog Çıkarım Motoru (KIE) sayesinde daha hızlı sonuç almak, bu ortaklar için doğrudan daha fazla gelir anlamına geliyor.
Şirket, bu pazarın henüz tam olgunlaşmadığının farkında. Talebi gözlemlerken, potansiyel müşterilerin küçük modelleri ince ayar (fine-tune) yapmaya hazır olmadığını fark ettiler. Delalleau bu durumu şöyle açıklıyor: İşte bu yüzden lansmandan bu yana, gördüğümüz talebi karşılamak için tamamen daha büyük modellerin geliştirilmesini hızlandırmaya odaklandık.
Bu durum, Kog'un 30 kat daha hızlı LLM çıkarımı vaadini yerine getirmesi için önünde dev bir engel olduğu anlamına geliyor. Demoları etkileyici bir şekilde istek başına saniyede 3.000 jeton (TPS) gösterdi; ancak bu, yalnızca yaklaşık 2 milyar parametreye sahip, özel olarak tasarlanmış ve artık açık kaynaklı hale gelen Laneformer 2B modeliyle yapıldı.
Şüphecilerin aksine Delalleau, aynı yaklaşımın çıkarım çipleri için zorluk yaratabilecek büyük dil modellerinde (LLM) de aynı şekilde işleyeceğinden emin. GPU'ların parlak bir geleceği olduğunu savunan Kog CEO'su, bu çiplerin kod çözme için uygun olmadığı fikrinin artık bir yanılgıya dönüştüğünü belirtiyor. Ona göre yeni nesil GPU'lar, kilidinin açılmasını bekleyen giderek artan bir bellek bant genişliğine sahip.
Kog, yazılımsal optimizasyonun GPU'ların kutu üzerinde yazandan fazlasını yapabileceğine inanan tek şirket değil. Yine Fransa merkezli olan ZML, Nvidia'nın CUDA'sını atlayarak rakip çiplerde hızlı çıkarımı destekleyen donanımdan bağımsız bir yazılım piyasaya sürdü. Ancak Delalleau, Kog'un daha çok Stanford Üniversitesi laboratuvarı Hazy Research'e benzediğini ve GPU hızlandırmaya çok daha derinlemesine odaklandıklarını vurguluyor.
Delalleau'nun kendisi bir araştırmacı değil ve ilk girişimi olan TechCrunch50 2009 mezunu Stribe'in yeni şirketiyle hiçbir ilgisi yok. Tek bağlantı, eski ortaklığı şimdi girişim sermayedarı olan Kamel Zeroual ve onun firması Varsity VC'nin Kog'un tohum turunu ortaklaşa yönetmesi. Ancak girişimin bu derinlemesine odaklanması, Delalleau'nun benzersiz geçmişinden kaynaklanıyor.
Fransa'nın École Polytechnique üniversitesinde katı hal fiziği okuduktan sonra ofansif siber güvenlik, yani diğer adıyla beyaz şapkalı hackleme alanında çalıştı. Delalleau'ya göre bu deneyim, şu anda ekibinden de benimsemesini istediği zihniyeti şekillendirdi. Bilim tarafında, fiziğin yasalarını ve GPU'ların yasalarını anlamak ve bunlardan en üst düzeyde faydalanmak gibi bir zihniyet var.
Hackleme tarafına gelince, DEF CON CTF turnuvasında dört kez finale kalmış olması, ona işleri çok düşük bir seviyede, montaj diline ve ikili koda kadar tersine mühendislik yapmayı öğretmiş. Bu sayede sistemlerin nasıl çalıştığını anlamayı ve mutlaka tasarlandığı amaç için olmayan bir hedefe ulaşmak için onları kullanmayı başarmış.
Bu yaklaşımın dezavantajı ise çok fazla el emeği ve zaman gerektirmesi. Her yeni GPU için, gerçekten detaylara inmek ve o donanım üzerinde GPU mühendisliği araştırmaları yürütmek için haftalarca, hatta aylarca zaman ayırdıklarını belirten Delalleau, 11 kişilik bir ekiple çalıştıklarının altını çiziyor. Bu durum, en azından yakın gelecekte Kog'un çalışabileceği çip sayısını sınırlıyor.
Daha uzun vadede Kog, metodolojisini daha fazla çip ve modeli destekleyecek ajan tabanlı iş akışlarına entegre etmeyi umuyor. Avrupa bu iki alanda kendi yeteneklerini inşa etmeye çalışırken, bu durum girişim için egemenlik rüzgarları yaratabilir. Şirket şimdiden Scaleway tarafından destekleniyor ve Fransa'nın Bpifrance ile French Tech 2030 programının yatırımlarını almış durumda.
Şimdilik ise Kog, yaklaşımının LLM'lerde işe yaradığını dünyaya kanıtlamak zorunda. Bu aynı zamanda daha fazla finansman sağlaması için de kritik olacak. Delalleau konuyu şöyle özetliyor: Eylül ayında olacağını düşündüğüm, ilk büyük modelimizi 10 kat hızla hayata geçirdiğimizde, müşteri ilgisini göstermeye başlayabileceğiz ve oradan da Seri A turumuza geçebileceğiz.