Yapay Zeka

Fish Audio, Yaratıcılar ve İşletmeler İçin Yapay Zeka Ses Modelleri Geliştirmek Üzere 50 Milyon Dolar Tohum Yatırımı Aldı

Fish Audio, Yaratıcılar ve İşletmeler İçin Yapay Zeka Ses Modelleri Geliştirmek Üzere 50 Milyon Dolar Tohum Yatırımı Aldı
Yaz Boyunca Malta'da İngilizce

Yapay zeka tarafından oluşturulan ses modellerine olan talep oldukça büyük. Yaratıcı kullanım alanları, yapay zeka ses modellerinin daha ifade gücü yüksek olmasını gerektirirken; müşteri hizmetleri ve satış operasyonlarını otomatikleştirmek isteyen işletmeler ise daha yönlendirilebilir modellere ihtiyaç duyuyor.

Palo Alto merkezli Fish Audio, 15.000'den fazla doğal dil kontrolüne sahip kütüphanesiyle tüm bu kullanım alanlarına hitap etmeyi hedefliyor. Geçen yıl piyasaya sürülen girişim, bugün 8 milyondan fazla kullanıcısının modellerinin açık kaynak veya barındırılan sürümlerini kullanmasıyla yıllık tekrarlayan gelirini 21 milyon dolara ulaştırdı.

Bu ivmeyi sürdürmek için girişim, Salı günü Coreline Ventures ve Capital Today liderliğinde 50 milyon dolarlık bir tohum yatırımı aldığını duyurdu. Yatırıma 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners ve HF0 da katıldı.

Fish Audio, eski NVIDIA araştırmacısı Shijia Liao tarafından küçük bir proje olarak başlatıldı. Liao, piyasadaki ifade gücü düşük sentetik seslerden rahatsız olarak, tek bir GPU üzerinde bir ses üretme modeli eğitti ve bunu açık kaynak olarak yayınladı. GitHub'daki Fish Speech deposu şu anda 31.000'den fazla yıldıza sahip ve bağımsız geliştiriciler, video oyun tasarımcıları ve yaratıcılar tarafından kullanılıyor.

Şirket son bir yılda beş model piyasaya sürdü: dört ses üretme modeli ve bir konuşmadan metne modeli. Ses üretme modellerinden üçünü açık kaynak olarak yayınlarken, en yeni S2.1 Pro modeli yalnızca ücretli API üzerinden kullanılabiliyor.

Fish Audio, yaratıcılar ve ekipler için uygun, belirli sayıda dakikalık üretim ve ses klonlama özellikleri sunan aylık ücretli planlar sunuyor. Şirket ayrıca API'lerinin ve platformunun kurumsal sürümünü de sunuyor ve HeyGen, Sanas ve Plaud gibi kuruluşların bunu zaten kullandığını belirtiyor.

Cao, "Her işletmenin farklı kullanım alanları ve farklı tercihleri var. Örneğin, seslerimizi yapay zeka avatarlarında kullanan HeyGen gibi şirketler seslerde gerçekçilik isterken; bir oyun stüdyosu karakterleri için etkileyici sesler; LiveKit gibi ses aracı şirketleri ise aramalar için yeterince doğal ve düşük gecikmeli sesler istiyor" dedi.

Girişimin ses kütüphanesini oluşturma yöntemlerinden biri, kullanıcılardan seslerini model eğitimi için göndermelerini istemek ve sesleri kullanılırsa onlara tazminat ödemekti. Ancak bu durum birkaç ay önce bazı sorunlara yol açtı; bazı yaratıcılar, seslerinin izinsiz olarak Fish Audio'ya yüklendiğini iddia etti. Girişimin bu tür endişeleri gidermek için bir DMCA içerik kaldırma süreci vardı ancak kaldırma işlemleri uzun zaman alıyordu.

Fish Audio'nun CEO'su ve kurucu ortağı Rissa Cao, TechCrunch'a şirketin artık kaldırma sürecini otomatikleştirdiğini söyledi. Cao, yaratıcıların yüklenen bir sesin kendilerine ait olduğunu kanıtlamak için kolayca kısa bir ses örneği veya sözleşme gönderebileceğini ve seslerinin 3 dakikadan kısa sürede platformdan kaldırılacağını belirtti.

Ancak bu, bir sanatçının sesinin haberi olmadan yüklenmesini engellemiyor. Sanatçı durumu fark edene ve kaldırma talebinde bulunana kadar sesi platformda kullanılmaya devam ediyor.

Coreline Ventures ortağı Oskue Honda, topluluk odaklı bir modelin ancak yaratıcılar platforma güvendiğinde işe yarayacağını söyledi.

Honda, "Toplum merkezli bir yaklaşım ancak yaratıcılar platforma güvendiğinde kalıcı bir avantaj haline gelebilir. Bu, rıza, şeffaflık ve atıfın ürüne sonradan eklenen değil, baştan dahil edilmesi gerektiği anlamına geliyor. Sektörün doğrulanmış ses sahipliği, net lisanslama koşulları, kolay raporlama ve kaldırma süreçleri ve sonunda sesleri lisanslandığında veya ticari olarak kullanıldığında yaratıcıların finansal olarak fayda sağladığı gelir paylaşımı modellerine doğru ilerlemesi gerektiğine inanıyorum" dedi.

Cao, girişimin yalnızca açık kaynak bir proje olarak ürün sunarken ve yaratıcılar için planlar yaparken verimli çalıştığını ve paraya ihtiyacı olmadığını söyledi. Ancak daha gelişmiş modeller geliştirmek ve yatırımcı ilgisi artarken işletmelere de hitap etmek istedikleri için sermaye arayışına girdiklerini belirtti.

Geleceğe bakıldığında, Fish Audio bu yıl bir ses anlama modeli yayınlamayı planlıyor. Ayrıca bir konuşmadan konuşmaya modeli üzerinde çalışıyor.

Ses üretim pazarı oldukça kalabalık. ElevenLabs, WellSaid, Cartesia, Speechify, Async (eski adıyla Podcastle) ve Krisp gibi şirketler yaratıcıların ve işletmelerin bütçeleri için rekabet ediyor.

359 Capital ortağı Rico Mallozzi'ye göre, geliştiriciler için ince ayarlı kontroller ve maliyet etkin model eğitimi, Fish Audio'nun büyük yapay zeka laboratuvarlarıyla daha iyi rekabet etmesine yardımcı olacak.

Mallozzi, TechCrunch'a yaptığı telefon görüşmesinde, "Bence sahip oldukları ekiple, diğer iyi finanse edilen yapay zeka laboratuvarları veya şirketlerine kıyasla son teknoloji modeller geliştirebilmeleri inanılmaz. Bu, yapay ses ile insan sesi arasındaki farkı kapatma konusundaki teknik becerilerini gösteriyor" dedi.

Üniversite Destekli Dil Okulu

Kaynak: TechCrunch