Üzlet

Fish Audio 50 millió dollárt kapott hangalapú AI-modellek bővítésére

A Palo Alto-i Fish Audio, amelyet a korábbi NVIDIA-kutató Shijia Liao indított és Rissa Cao vezeti, 50 millió dollár seed befektetést szerzett Coreline Ventures és Capital Today vezetésével.

Fish Audio 50 millió dollárt kapott hangalapú AI-modellek bővítésére

Palo Altóban működő Fish Audio bejelentette, hogy 50 millió dollár tőkét vont be egy seed fordulóban, amelyet a Coreline Ventures és a Capital Today vezetett. A finanszírozásban részt vettek még a 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners és HF0.

A vállalat azt mondja, hogy az elmúlt évben indított, nyílt forráskódú és hosztolt modelljeit több mint 8 millió ember használja, és jelenleg éves ismétlődő bevételük (ARR) 21 millió dollár. A Fish Audio könyvtára több mint 15 000 természetes nyelvi vezérlőt tartalmaz, amelyeket a startup kreatív és vállalati felhasználásokra egyaránt szán: a kreatív szereplők kifejezőbb hangokat igényelnek, míg a vállalatok automatizált ügyfélszolgálati és értékesítési megoldásokhoz jobban irányítható (steerable) hangokra van szükségük.

Származás és termékek

A cég alapötlete Shijia Liao, egy korábbi NVIDIA-kutató kezdeményezéséből nőtt ki: Liao elégedetlen volt a piacon elérhető, nem kifejező szintetikus hangokkal, és egyetlen GPU-n tanított hanggeneráló modellt, amelyet nyílt forráskódúvá tett. A Fish Speech GitHub-tárháza ma több mint 31 000 csillagot kapott, és indie fejlesztők, videojáték-tervezők és kreatívok használják.

Az elmúlt évben a cég öt modellt mutatott be: négy hanggeneráló modellt és egy beszéd-szöveg (speech-to-text) modellt. Ezek közül három hanggeneráló modellt nyílt forráskódúvá tettek, míg a legújabb, S2.1 Pro modell kizárólag a fizetős API-n keresztül érhető el.

A Fish Audio előfizetéses havi csomagokat kínál, amelyek meghatározott számú generációs percet és hangklónozási funkciókat tartalmaznak, továbbá vállalati szintű API- és platformváltozatot is. A cég szerint olyan szervezetek, mint a HeyGen, Sanas és Plaud már használják szolgáltatásaikat.

Közösség, jogi kérdések és eltávolítási folyamat

A startup hangkönyvtárát részben úgy bővítette, hogy kérte a felhasználókat, küldjenek saját hangmintákat a modellek tanításához, és pénzügyi kompenzációt ígért, ha egy hangot felhasználnak. Ez azonban néhány hónappal ezelőtt vitákat váltott ki: több alkotó azt állította, hogy a hangjukat az engedélyük nélkül töltötték fel a Fish Audio platformjára.

A cégnek volt DMCA tartalmi eltávolítási folyamata az ilyen panaszok kezelésére, de a gyakorlatban az eltávolítások hosszú ideig tartottak. Fish Audio vezérigazgatója és társalapítója, Rissa Cao a TechCrunchnak azt mondta, hogy a vállalat most automatizálta az eltávolítási eljárást: az alkotók rövid hangmintát vagy szerződést nyújthatnak be igazolásként, és ha bizonyítják, hogy egy feltöltött hang hozzájuk tartozik, a hang kevesebb mint három perc alatt eltávolítható a platformról.

Ez a rendszer azonban nem akadályozza meg azt, hogy valaki az érintett művész tudta nélkül töltsön fel egy hangot; az hang az eltávolítási kérelem beadásáig a platformon marad és használatban lehet.

Coreline Ventures partnere, Oskue Honda szerint a közösség által vezérelt modell csak akkor működik hosszú távon, ha az alkotók megbíznak a platformban. Honda kiemelte: a beleegyezés, átláthatóság és attribúció a termék részévé kell, hogy váljon, nem pedig utólagos megoldássá. Szerinte az iparnak előre kell lépnie a hitelesített hangtulajdon, egyértelmű licencfeltételek, egyszerű jelentési és eltávolítási folyamatok, valamint végül jövedelemosztási modellek irányába, hogy az alkotók pénzügyi előnyt is kapjanak, ha hangjukat licencelik vagy kereskedelmi célra használják.

További tervek és verseny

Cao elmondása szerint a startup eredetileg önfenntartóan, nyílt forráskódú projektként működött, és nem volt szüksége befektetésre, de a fejlettebb modellek fejlesztéséhez, valamint a vállalati ügyfelek kiszolgálásához tőkére volt szükség, ezért döntöttek a tőkebevonás mellett.

A Fish Audio tervei között szerepel egy audio-understanding (hangértő) modell kiadása még az idén, és egy beszéd–beszéd (speech-to-speech) modell fejlesztése.

A beszédgeneráló piacon erős verseny van: szereplők között említették az ElevenLabs, WellSaid, Cartesia, Speechify, Async (korábban Podcastle) és Krisp vállalatokat. A 359 Capital partnere, Rico Mallozzi szerint a finomhangolt vezérlők a fejlesztők számára és a költséghatékony modelltréning előnyei segíthetnek a Fish Audio-nak abban, hogy jobban versenyezzen a nagyobb, jól finanszírozott AI-laborokkal. Mallozzi a TechCrunchnak azt mondta, hogy amit a csapat felépített — államilag korszerű modelleket azonosítva — lenyűgöző, és jól mutatja a technikai rátermettségüket az „mesterséges hangzás” és az „emberihez hasonló” hangok közötti különbség lezárásában.