Yapay Zeka

Uzmanlara Göre Kimi K3'ün Başarısı Fable'ı Kopyalamaktan Kaynaklanmıyor

Uzmanlara Göre Kimi K3'ün Başarısı Fable'ı Kopyalamaktan Kaynaklanmıyor
Yaz Boyunca Malta'da İngilizce

Beyaz Saray Bilim Danışmanı Michael Kratsios, mevcut en büyük açık ağırlıklı dil modeli olan Kimi K3'ün arkasındaki Çinli şirket Moonshot'ın, modelini Anthropic'in Fable LLM'ini kopyalayarak ve Çin'e ihracı onaylanmamış çipleri kullanarak oluşturduğunu söyledi.

Kratsios, "ABD'ye ait özel teknolojiyi çalmayı ve Amerikan araştırmalarını baltalamayı hedefleyen büyük ölçekli, gizli endüstriyel distilasyon kabul edilemez" diye yazdı. Bu açıklama, Çin yapımı açık ağırlıklı modellerin yasaklanmasına yönelik tartışmaların yapay zeka sektörünü karıştırdığı bir dönemde geldi. Moonshot, eğitim süreciyle ilgili sorulara yanıt vermezken, Kratsios iddialarının kaynakları hakkında daha fazla detay paylaşmadı.

Kratsios'un tweet'i, Hazine Bakanı Scott Bessent'in "ABD'ye ait büyük dil modellerimizin izlerini birçok Çin modelinde buluyoruz ve bu kabul edilemez" sözlerini yansıttı. Bu izlerin neler olduğu net değil ve Hazine Bakanlığı bir soruşturmaya yanıt vermedi.

Ancak uzmanlar, Kimi K3'ün sergilediği ileri düzey yeteneklerden distilasyon sürecinin sorumlu olduğu konusunda şüpheli. Distilasyon, bir LLM'yi sorgulayarak iç işleyişini belirleme ve yeteneklerini kopyalama işlemi olarak tanımlanıyor.

Laude Enstitüsü araştırmacısı ve Snorkel AI'nın kurucu ortağı Braden Hancock, TechCrunch'a yaptığı açıklamada, "Fable'ın hemen ardından bu kadar güçlü bir modeli sadece distilasyonla elde edebileceğinizi sanmıyorum. Açıkçası yeterli zaman bile yok. Fable sadece 1 Temmuz'dan beri halka açık. Bu kadar veriyi damıtıp, bir modeli eğitip iki haftada yayınlayamazsınız" dedi.

Allen Institute for AI'da yapay zeka araştırmacısı Nathan Lambert, dün yayınlanan bir podcast'te, "Zamanla, Çin modelleri sınıra yaklaştıkça ve eğitim rejimi pekiştirmeli öğrenmeye kaydıkça distilasyonun etkisinin azaldığını düşünüyorum. Eğer durum böyle olsaydı, herkes verilerini distilasyon için kullanarak bir GLM'ye veya K3'e kolayca yetişebilirdi. Ancak sadece denetimli ince ayarla bunu görmedik veya görmeyeceğiz" dedi.

Distilasyon yapmak için bir laboratuvarın, eğitim sonrası süreçte kullanılabilecek veriler üretmek amacıyla hedef modeli sistematik olarak sorgulaması gerekiyor. Bazen bu, modelin sorunları nasıl çözdüğünü anlamak için düşünce zincirini ifade etmesini istemeyi içeriyor. Diğer durumlarda, modelden gelen yönlendirmeler ve yanıtlar, denetimli ince ayar adı verilen bir süreçte yeni bir modeli eğitmek için kullanılıyor.

Lambert'e göre, bir modelin görünüşte üçüncü bir tarafça oluşturulduğunu iddia etmesine yol açan şey bu ince ayar süreci. Lambert, ince ayarın "modelin tavırlarını edindiği" yer olduğunu söylüyor.

Ancak Lambert, modeller daha karmaşık hale geldikçe SFT'nin faydalarının azaldığını belirtiyor. Fable benzeri yetenekleri damıtmak için muhtemelen pekiştirmeli öğrenme teknikleri gerekecektir. Çoğu durumda bu, daha büyük modelin bir temsilcisinin daha küçük modelin yanıtlarını derecelendirmesi ve dereceye göre ayarlama yapması anlamına geliyor.

Daha gelişmiş teknikler aynı zamanda daha önemli bir altyapı gerektiriyor. Büyük pekiştirmeli öğrenme çalışmaları on milyonlarca temsilci gerektirebiliyor. Bir sınır laboratuvarının API'sini bunun için kullanmak "son derece pahalı olur ve muhtemelen bir zaman darboğazı yaratır çünkü bu modeller oldukça yavaş ve açıkçası size bir performans artışı bile sağlamayabilir."

Önceki sınır modellerinin Kimi'ye katkıda bulunmuş olması muhtemel görünüyor. Anthropic, bu yılın başlarında Moonshot, DeepSeek ve MiniMax'ı modellerini sistematik olarak damıtmakla suçlamıştı. Anthropic, IP adresleri ve diğer meta veriler aracılığıyla belirlediği bu şirketlerdeki kullanıcılar ile modelleri arasında milyonlarca alışveriş keşfettiğini söyledi. Bu sorgulamaların "normal kullanım modellerinden farklı olduğu ve meşru kullanımdan ziyade kasıtlı yetenek çıkarmayı yansıttığı" belirtildi. Anthropic, Fable distilasyonuyla ilgili TechCrunch'ın sorularına yanıt vermedi.

Ancak distilasyon, yalnızca Çin'de değil, yapay zeka şirketleri arasında yaygın olarak görülüyor. Elon Musk, bu yılın başlarında şirketi SpaceXAI'nin Grok'u geliştirmek için OpenAI modellerini damıttığına ve bu uygulamanın sektörde yaygın olduğuna dair ifade vermişti. Örneğin, distilasyon ile sentetik veri setleri geliştirme arasındaki çizgi oldukça bulanık olabiliyor.

Hancock, "Genel olarak Amerikalılar bu Çinli ekiplerin teknik uzmanlığını küçümsüyor. Moonshot'ın kurucularından biri CMU'da doktora öğrencisiydi. Bunlar meşru araştırmacılar ve mühendisler ve sağlam işler çıkarıyorlar. ... Amerikan modelleri durursa, Çin'in ilerlemesi yavaşlar ama yine de devam eder. Onlar sadece birilerinin eteğine tutunmuyor" dedi.

Distilasyonu Kratsios'un yorumunun ikinci kısmından ayırmak da zor: Moonshot'ın gelişmiş Nvidia çipleri, Grace Blackwell 300'ler elde ettiği ve ayrıca Tayland'da GB300 donanımlı sunuculara eriştiği iddiası. Bu çiplerin Çin'e ihracı yasak, ancak Georgetown Güvenlik ve Gelişen Teknoloji Merkezi'nden araştırmacı Sam Bresnick'e göre bir karaborsa mevcut. Mayıs ayında ABD'li sunucu üreticisi Supermicro'nun kurucusu, gelişmiş çipleri Çin'e kaçırmaktan suçlanmıştı.

Bresnick, "Dünyadaki veri merkezleri için müşterini tanı yasalarının destekçisiyim. Bir şirketin son teknoloji donanımınızda büyük eğitim çalışmaları yapmasına izin veriyorsanız, o şirketin kim olduğu ve ne yaptığına dair bir raporlama mekanizması olmalı" dedi.

Başkan Joe Biden'ın Ticaret Bakanlığı, 2024 yılında veri merkezleri için federal müşterini tanı kuralları önermişti, ancak Donald Trump döneminde daha fazla ilerleme kaydedilmiş görünmüyor. Bununla birlikte, gelişmiş çipleri yurt dışına gönderen ihracatçıların, bunların yalnızca onaylanmış amaçlar için kullanıldığından emin olmaları gerekiyor.

Uzun dönem Malta'da, üniversite destekli okullarda dilini geliştir. Kayıt bilgisi →

Kaynak: TechCrunch