Blockchain & Kripto

Black Forest Labs FLUX 3'ü Tanıttı: Artık Sadece Fotoğraf Değil, Video da Üretiyor

Black Forest Labs FLUX 3'ü Tanıttı: Artık Sadece Fotoğraf Değil, Video da Üretiyor
Deniz, Kum, Güneş... ve İngilizce

Black Forest Labs, Perşembe günü FLUX 3'ü piyasaya sürdü ve şirketin amiral gemisi modeli ilk kez sadece statik görseller yerine video üretiyor. FLUX görüntü üreteçleri serisiyle tanınan Alman yapay zeka laboratuvarı, yeni sistemi tek bir ortak sistem içinde aynı anda görseller, videolar ve ses üzerine eğitti.

Bu, çok modluluk (multimodality) olarak bilinen bir yaklaşım: bir modelin birden fazla bilgi türünü ayrı araçlar yerine birlikte öğrenmesi.

Videolar, haberin başlık özelliği. FLUX 3, 20 saniyeye kadar klipler üretiyor ve sesi, görüntüyle senkronize olarak oluşturuyor; diyaloglar, ses efektleri ve ortam sesleri dahil. İlk değerlendirmelerde, insan değerlendiriciler FLUX 3'ün çıktısını Runway Gen-4.5'e karşı %77, Luma Ray 3.2'ye karşı %93 oranında tercih etti. Model, Gemini Omni ve Seedance'ı da %52 oranında geride bırakarak hafif bir üstünlük sağladı.

Elbette bu bir tercih testi, sabit bir puanlama cetveli değil: değerlendiriciler iki klibi izleyip hangisinin daha inandırıcı göründüğünü seçiyor ve BFL, FLUX 3'ün kaç kez kazandığını sayıyor.

Bunun dışında model, geçmişine sadık kalarak statik görsellerde de oldukça başarılı görünüyor. BFL birkaç görsel paylaştı ve FLUX 3'ün fotogerçekçiliğin ötesinde çok çeşitli stiller üretebildiği anlaşılıyor.

BFL, bunu sadece bir içerik aracı olarak görmüyor. Kurucu ortak ve CEO Robin Rombach, "Yalnızca görselleri öğrenen bir model, yalnızca görseller üretebilir," dedi. Şirketin iddiasına göre, video tahmin etmeyi öğrenmek, aynı zamanda altında yatan fiziği de öğrenmek anlamına geliyor: ağırlık, temas, zamanlama. Bu da bir makinenin fiziksel dünyada hareket etmesi için tam olarak ihtiyaç duyduğu şey.

Bu iddianın bir adı var: FLUX-mimic. Zürih merkezli mimic robotics ile birlikte geliştirilen bu model, FLUX 3'ün video tahmin motorunu alıyor ve buna hafif bir "kod çözücü" ekliyor. Bu küçük eklenti bileşeni, modelin nesnelerin nasıl hareket ettiğine dair içsel algısını gerçek robot hareketlerine dönüştürüyor. Otomobil üreticisi Audi, bu teknolojiyi esnek kapı contaları takma gibi geleneksel otomasyonun zorlandığı görevlerde test ediyor.

mimic'in kurucu ortağı Stephan-Daniel Gravert, "Audi, FLUX-mimic'i geliştirdiğimiz türden bir üretim ortağını temsil ediyor," dedi. Audi'den Christoph Schneider ise robotların artık eski makinelerin başaramadığı "karmaşık yumuşak cisim manipülasyon işlerini" çözdüğünü söyledi. BFL, tüm sistemin yaklaşık 101 milisaniyede tepki verdiğini, bunun da insan görsel reflekslerine yakın olduğunu belirtiyor.

FLUX'un yükselişi bir boşlukta gerçekleşmedi. Ağustos 2024'te, Stability AI'da orijinal Stable Diffusion modellerini oluşturmaya yardımcı olan deneyimli araştırmacılar tarafından kurulan Black Forest Labs, MidJourney'i geride bırakan ve Stability'nin kendi hayal kırıklığı yaratan Stable Diffusion 3'ünü gölgede bırakan Flux modellerini piyasaya sürdü.

Açık kaynaklı Flux Dev ve Schnell modelleri, AI sanatçılarının Stability'nin yeniden yapımı olan Stable Diffusion 3.5'in bir gün geri almasını beklediği "en iyi açık kaynak görüntü üreteci" unvanını kaptı.

Bu hiç gerçekleşmedi. FLUX 1.1 Pro, o yılın Ekim ayında Artificial Analysis görüntü arenasında zirveye çıktı. Ancak bu sürüm açık kaynak değildi.

Üniversite Destekli Dil Okulu

Kaynak: Decrypt