Modellbevezetés

Mesterséges intelligenciával generált szöveg

LTX-2.5: nyílt súlyú videó- és world-model gyorsítva ComfyUI-integrációval

A főszereplő a LTX, a Lightricks-ből kivált világmodelleket fejlesztő cég, amely bemutatta az LTX-2.5 modellt és naponkénti integrációt kötött a ComfyUI-vel.

LTX-2.5: nyílt súlyú videó- és world-model gyorsítva ComfyUI-integrációval

LTX, a Lightricks-ből kivált nyílt world-modell vállalat, bemutatta legújabb, LTX-2.5 jelzésű nyílt súlyú videó- és "world" modelljét, amely napon egyből natívan elérhető a node-alapú ComfyUI munkafolyamat eszközben a két cég stratégiai, launch-napi együttműködése révén.

A modell mostantól elérhető nyílt súlyokként a Hugging Face-en, beépítve ComfyUI-be, valamint a LTX API-n keresztül azok számára, akik menedzselt generálást szeretnének. A használat ingyenes azon szervezetek számára, amelyek éves ismétlődő bevétele (ARR) kevesebb mint 10 millió dollár; nagyobb cégekkel licencmegállapodást kötnek. A cég közlése szerint LTX-modelljeit eddig összesen 33 millió letöltés érte, ezzel az LTX család a legszélesebb körben használt "open world" modellvonalnak számít a piacon.

Mire fókuszál az LTX-2.5

A cég bejelentése szerint az LTX-2.5 gyakorlatilag az egész generációs csővezeték számos elemét újratervezte, ahelyett, hogy új képességeket toldott volna egy régi magra. A legfontosabb újdonságok:

  • Új, diffúziós videódekóder, amely csökkenti a gyors mozgásnál jelentkező vizuális hibákat és jobb részletvisszaadást kínál (például szöveg és arcok), miközben megtartja az LTX magas tömörítési arányát.
  • Natív multishot generálás: a teljes sorozatot egyetlen kimenetként rendereli, így a karakterek, a jelenet és a hang következetes marad vágások között, ahelyett hogy külön generált snitteket illesztenének össze.
  • Egyedi Gemma 4 nyelvi alap és dedikált prompt-enhancer a komplex, többalanyos utasítások pontosabb kezelése érdekében.
  • Egy előre betanított checkpoint, amelyet fizikai AI és robotika felhasználásokra hangoltak, hogy csapatok ezen a bázison finomhangolhassanak olyan domén-specifikus adatra, amely nem hasonlít a filmes felvételekre.
  • Jelentősen javított distillált modell, amely közel teljes modellminőséget ad alacsonyabb költségen és gyorsabb inferenciával; az NVIDIA-val végzett optimalizáció révén lokálisan futtatható NVIDIA RTX GPU-kon csökkentett memóriaigénnyel.

A vállalat szerint az LTX-2.5 nagyjából nyolcad annyi költséget és hétszer rövidebb renderidőt kínál a hasonló modellekhez képest, és a kimenet skálázható különböző hardverekre adatközponti GPU-któl egészen Mac gépekig.

Teljesítmény és minőség: mit állít az LTX

A legfeltűnőbb szám a sebesség: az LTX közlése szerint az LTX-2.5 egy 10 másodperces, 720p kép-bemenetű videóklipeket 6,8 másodperc alatt generál — gyorsabban, mint a valós idő. Ennek a mérésnek van egy megjegyzése: a számot saját, két darab NVIDIA GB200 csúcskártyán mérték, egy olyan konfiguráción, amelytől a legtöbb csapat távol van. Ugyanezt a feladatot LTX menedzselt API-ján keresztül 23,7 másodperc alatt renderelték, viszont 1080p felbontáson (az API-n nincs 720p szint).

A cég saját end-to-end összehasonlítása szerint a konkurens API-k azonos feladaton különböző ideig futottak: Google Gemini Omni Flash 52 s, xAI Grok 1.5 63 s, Google Veo 3.1 70 s (8 másodperces klipeknél), MiniMax H3 180 s, ByteDance Seedance 2.5 317 s és Kuaishou Kling 3.0 Pro 398 s. Ezeket az értékeket a LTX jelentette vagy megrendelte, nem független harmadik fél által lettek hitelesítve.

Minőségben LTX vak, összehasonlító emberi preferencia-teszteket idéz: az evaluátorok ugyanazt a promptot használva, de nem tudva, melyik modell készítette az adott videót, választottak. Az LTX-2.5 67%-os győzelmi arányt ért el a tesztben, szorosan megelőzve a Seedance 2.5-öt (65%); további eredmények: Gemini Omni Flash 55%, MiniMax H3 50%, Seedance 2.0 44%, Wan 2.6 42%, és FLUX 3 28%. A cég ezeket az adatokat előzetesnek nevezi és azt javasolja, hogy a vevők saját munkaterhelésükön teszteljenek.

Telepítés, licencelés és üzleti modell

LTX hangsúlyozza a telepítési rugalmasságot: az LTX-2.5 bármilyen GPU-n fut, amelyen legalább 16 GB VRAM rendelkezésre áll, telepíthető on-premises, az edge-en vagy API-n keresztül, nem jár kötelező márkajellel a kimeneten, és ügyfél-specifikus adatra finomhangolható. A cég a nyílt súlyokat és a finomhangolási lehetőséget az API-kizáró és a regionális korlátozásokkal rendelkező versenytársakkal állítja szembe.

A vállalat vezérigazgatója, Zeev Farbman szerint az LTX nyitottsága stratégiai döntés: a zárt modellek és csak API-n történő hozzáférés nem működik sok üzleti eset számára. Farbman szerint a video- és world-modellek használati területei sokkal szélesebbek, ezért a fejlesztőknek a súlyokhoz való hozzáférésre van szükségük, hogy testre szabott folyamokat építsenek.

LTX nyitott súlyokkal dolgozik, ugyanakkor licencpolitikai korlátokat vezet be üzleti méret alapján: az ingyenes használat az ARR < 10 millió dollár alatti szervezeteknek szól; nagyobb szervezetek licencdíjat tárgyalnak.

Miért ComfyUI? A belépőkapu vállalati használathoz

A ComfyUI-vel való azonnali integráció logikus lépés: Farbman elmondása szerint sok LTX-ügyfél a ComfyUI-ben fedezi fel és prototipizálja a munkafolyamatokat. ComfyUI, amely 2023 januárjában indult egy nyílt forráskódú projektként, ma az egyik leggyorsabban növekvő open-source eszköz a generatív média területén; a mögötte álló Comfy Org 17 millió dollárt gyűjtött a fejlesztés folytatására. Yoland Yan, a ComfyUI társalapítója és vezérigazgatója szerint a platform a nyílt ökoszisztéma kapcsolódási rétegét adja: helyi inferenciára, zárt modellekhez való hozzáférésre és különböző node-ok összekapcsolására ad lehetőséget.

Yan és Farbman szerint ez a "flywheel" hajtja a nyílt modellek kereskedelmi terjedését: ComfyUI-n keresztül a felhasználók kipróbálják és optimalizálják a modelleket; ha üzleti értéket hoznak, vállalati licencekhez, szolgáltatásokhoz és visszacsatoláshoz vezetnek.

Vállalati és valós idejű alkalmazások

Mindkét vezető hangsúlyozta, hogy a videó- és world-modellek alkalmazási köre messze túlmutat a hagyományos filmes generáláson. Például hardvergyártók használják őket zajcsökkentésre szenzorváltókból érkező nyers képeken; produkciós stúdiók VFX, vízszimuláció vagy nappalból éjszaka átalakítás feladataira; animációs stúdiók interpolációs munkafolyamatok automatizálására.

A fejlesztők számára az LTX-2.5 különösen a real-time és alacsony késleltetésű alkalmazások felé nyit: a bejelentésben szerepel két launch partner, az Asteria (AI filmstúdió) és a Reactor (fejlesztői platform), amely LTX-2.5-öt futtat alacsony késleltetésű inferencia-infrastruktúrán interaktív avatarokhoz, live world-ökhöz és robotikai valós idejű feladatokhoz.

Yan példaként említette a Flipbook nevű vírusos interaktív élményt, ahol egy kattintásra generált, élőben streamelt világ működik LTX-modellekre építve — szerinte az ilyen kísérletek nem léteznének nyílt súlyok és LTX teljesítménye nélkül.

Filmkészítők és alkotók

A valós idejű world-modellek a virtuális produkció részévé válnak: lehetővé teszik, hogy a forgatás és az utómunka közötti távolság lerövidüljön, a rendezők és producerek gyorsabb visszajelzést kapjanak a kész képről. Ugyanakkor a modellek és eszközök specializáltsága miatt a cégvezetők óvatosságra intenek: az összehasonlító eredményeket nem szabad szó szerint értelmezni, mivel a modellek különböző erősségeket szolgálnak (például animáció vs. fotorealizmus vs. 3D vs. robotika).

A ComfyUI híresen meredek tanulási görbéje miatt Yan azt mondta, hogy a platform kínál "könnyebb lejtőket" az amatőröknek és indie alkotóknak, de megőrzi a haladó, szakmai felhasználók számára szükséges mélyebb, komplexebb funkciókat.

Elérhetőség

Az LTX-2.5 ma elérhető a Hugging Face-en nyílt súlyokként, natívan ComfyUI-ben és a LTX API-n keresztül. A cég hangsúlyozza, hogy a mérései és preferencia-tesztei előzetes jellegűek, ezért potenciális vevőknek ajánlja a saját munkafolyamatukon történő tesztelést.