ByteDance a Seedance 2.0 nevű multimodális videógenerátort beépítette a népszerű videószerkesztő alkalmazásba, CapCutba. A modellt korábban, idén Kínában mutatták be; a mostani terjesztéssel ugyanis fizetős CapCut-felhasználók százmilliói számára vált elérhetővé Délkelet-Ázsiában, Latin-Amerikában, Afrikában, a Közel-Keleten, Európa egyes részein, Japánban és az Egyesült Államokban.
Bemenetek, kimenetek és technikai korlátok
Seedance 2.0 többféle bemenetet fogad el: szöveget, képeket, hangot és videót (legfeljebb 3 videoklip, 9 kép és 3 hangklip). A modell 4–15 másodperces, szinkronizált videó+hang kimeneteket állít elő, a rövidebb él oldalán 480 vagy 720 pixeles felbontásokban, hat képaránnyal: 21:9, 16:9, 4:3, 1:1, 3:4 és 9:16.
Funkciók közé tartozik több nyelvű, ajakszinkronos párbeszéd, környezeti hangok és zene, többkamera-szerkesztés egyetlen klipeken belül vágásokkal, valamint promptokkal kontrollálható kamera és világítás. Kimeneteket láthatatlan vízjellel jelölik, és a CapCut blokkolja az olyan feltöltött képeket, amelyek valós arcokat vagy szerzői joggal védett karaktereket tartalmaznak.
ByteDance maga is felhívja a figyelmet a modell korlátaira: részletstabilitás, túlzott „hiperrealizmus”, hangtorzulás, több szereplő következetessége, szövegmegjelenítés pontossága és „összetett” szerkesztési effektusok terén lehetnek problémák.
Működési elv röviden
A Seedance 2.0 kiterjeszti a ByteDance korábbi munkáját: a párhuzamos audio–videó generálásról egy egységes rendszerben végzett közös generálásra lépett. A cég bejelentése az architektúrát „sparse” (ritkított) jellegűként írja le. A modell négy fő feladatra használható: referenciaalapú generálás (tárgy, mozgás, hatás vagy stílus átvitele új anyagra), szerkesztés (meghatározott régiók, karakterek, akciók vagy hang módosítása meglévő videón), kiterjesztés (a meglévő videó előtti vagy utáni részek létrehozása) és kombinált módok (például egy meglévő videó szereplőjének kicserélése referenciaképről).
A modell egyszerre állítja elő a képi és a hanganyagot (sztereó párbeszéd, effektek és háttérhangok), és egyetlen futásban képes egymást követő snitteket és vágásokat generálni, ami segít a szereplők és a jelenetek következetességének megőrzésében.
Teljesítmény és rangsorok
A Seedance 2.0 két, emberi preferenciákon alapuló, vak head-to-head összevetéseken alapuló független rangsorban az első és a második helyeken végzett. Az Alibaba HappyHorse-1.0 a legközelebbi kihívó mindkét ranglistán.
- Az arena.ai rangsorán a Seedance 2.0 text-to-video teljesítményben 1 460 Elo-t, image-to-video teljesítményben 1 454 Elo-t ért el, mindkettőben szűken megelőzve a HappyHorse-1.0-t (1 444 Elo mindkettőn). A ranglista azonban előzetesként címkézi a Seedance 2.0 és a HappyHorse-1.0 eredményeit.
- Az Artificial Analysis rangsorában a HappyHorse-1.0 háromból három kategóriát vezet (image-to-video hang nélkül, text-to-video hanggal és hang nélkül), míg a Seedance 2.0 második helyen áll; viszont a szinkronizált audióval készített image-to-video kategóriában a Seedance 2.0 vezet 1 182 Elo-val a HappyHorse-1.0 1 168 Elo-ja és a Sky Work AI SkyReels V4 1 091 Elo-ja előtt.
Elérhetőség és ár
Seedance 2.0 több csatornán keresztül érhető el: a CapCut (Kínában Jianying) fizetős rétegén keresztül, a Dreamina webfelületen, API-n keresztül a ByteDance szolgáltatásain, köztük a BytePlus és Volcengine platformokon, valamint harmadik féltől származó szolgáltatókon keresztül, például a Higgsfield.ai-nél. Harmadik felek árazása szerint az alapfeldolgozás 720 pixeles kimenet és hang esetén 0,30 USD/másodperc, a SeeDance 2.0 Fast gyorsabb feldolgozása pedig 0,24 USD/másodperc.
Nem hoztak nyilvánosságra részleteket a modell architektúrájáról, paraméterszámáról, a tanító adatkészletről és a tanítási módszerekről.
Biztonsági és jogi kérdések
A Seedance 2.0 kínai bevezetését követően egy generált klip, amely Tom Cruise és Brad Pitt hasonmásaival készült, hat nagy hollywoodi stúdiót késztetett arra, hogy követeljék: ByteDance hagyjon fel a modellek szerzői joggal védett anyagokon való további képzésével, és blokkolja a felhasználók ilyen tartalmak létrehozását. A vitát a felek még nem rendezték el. ByteDance óvintézkedéseket vezetett be a CapCuton belül, de nem világos, hogy ezek a korlátozások kiterjednek-e a harmadik féltől származó API-kon keresztül generált kimenetekre.
A piaci háttér és jelentőség
Az elmúlt hónapokban gyorsan átrendeződött a videógenerálás piaca: amerikai fejlesztők visszavonultak a fogyasztói piacról, miközben kínai fejlesztők felgyorsult tempóban mutattak be új modelleket. Márciusban az OpenAI bejelentette, hogy megszünteti a Sora alkalmazást és API-t; a jelentések szerint a Sora napi aktív felhasználóinak száma a bevezetés körüli nagyjából egymillióról 500 ezer alá csökkent, miközben a szolgáltatás üzemeltetése naponta hozzávetőlegesen 1 millió dollárba került.
Áprilisban az Alibaba HappyHorse-1.0 először jelent meg a független videórangsorokon, majd röviddel ezután az Alibaba bemutatta a HappyOyster nevű rendszert 3D környezetek generálására. Ugyanezen a napon a Tencent nyilvánosságra hozta a Hunyuan 3D frissített, nyílt forrású változatát.
Fontos szerepe van annak, hogy a ByteDance egyszerre rendelkezik egy nagy elérésű szerkesztőalkalmazással és egy erős videógeneráló modellel. A CapCut — jelentések szerint — 736 millió havi aktív mobilfelhasználóval rendelkezik, ezzel a fogyasztói AI-termékek között csak a ChatGPT mögött a második legnagyobb. A Seedance 2.0 integrálása a CapCutba jól demonstrálja, mit tud elérni egy vállalat, ha egyszerre birtokolja a generálás és a szerkesztés eszközeit.
Mi a tanulság?
OpenAI Sora-programtól való visszalépése rávilágít, hogy a jelenlegi számítási költségek mellett az AI-vel generált videó drága fogyasztói termék marad. ByteDance lépése ugyanakkor azt is mutatja, hogy azok a vállalatok, amelyek egyszerre kínálnak generálási és szerkesztési megoldást, versenyelőnyhöz juthatnak a piacon.


