Modellbevezetés

Mesterséges intelligenciával generált szöveg

A ByteDance 10 billió paraméteres AI-modellt fejleszt a globális élmezőny felzárkózásáért

A ByteDance fejlesztőcsapata, a Seed, amelyet a Google DeepMind korábbi kutatója Vu Jong-huj vezet, jelenleg egy akár 10 billió paraméteres mesterségesintelligencia-modell előtanításán dolgozik.

A ByteDance 10 billió paraméteres AI-modellt fejleszt a globális élmezőny felzárkózásáért

A Financial Times jelentése szerint a TikTok anyavállalata, a ByteDance jelenleg egy akár 10 billió paraméteres (10 trillion parameters) mesterségesintelligencia-modell előtanításán dolgozik. A vállalat fejlesztése méretében megközelítheti az Anthropic élvonalbeli Mythos rendszerét, és körülbelül háromszor nagyobb lehet a korábban Kína legnagyobb modelljének tartott Moonshot Kimi K3-nál.

Fejlesztési állapot és paraméterszámok

A projekt még a korai, előtanítási (pretraining) fázisban van, amely iparági szokás szerint általában három–hat hónapot vesz igénybe. A modell végleges paraméterszáma a későbbi fázisokban dől el. Az Anthropic hivatalosan nem közli modelljei paraméterszámát; ipari becslések alapján azonban a Mythos 5 nagyjából 8 billió, míg a Fable 5 körülbelül 5 billió paraméterrel rendelkezik.

Fontos megjegyezni, hogy a paraméterszám önmagában a modell kapacitásának egyik mérője, de a tényleges teljesítményt nagyban befolyásolja az adatok minősége és a tanítási módszerek is.

A kínai versenyhelyzet

A ByteDance ambíciói illeszkednek a kínai AI-laborok szélesebb törekvéseihez: az elmúlt hetekben a Moonshot és az Alibaba modelljei is erős benchmark-eredményeket értek el, és bizonyos feladatokban csak az Anthropic Fable 5 mögött maradtak. Iparági források szerint több kínai labor is hasonló, Fable 5 méretű modellek betanításán dolgozik, de a ByteDance tervei a legambiciózusabbnak számítanak.

A Seed csapat és a technikai háttér

A ByteDance fejlesztéseit a Seed nevű csapat végzi, amelyet Vu Jong-huj, a Google DeepMind korábbi kutatója vezet. A mintegy kétezer fős csapat Kínában és külföldön dolgozó kutatókból, infrastruktúra-mérnökökből, adatcímkézőkből és fordítókból áll.

A vállalat az elmúlt három évben a kínai technológiai szereplők közül az egyik legagresszívabb befektető volt az AI terén: bővítette adatközpont-hálózatát, fejlesztette a Volcano Engine nevű felhőszolgáltatást, és tervezi saját AI-chipek fejlesztését.

Módszertani irány és vezetői elvárások

A Seed csapat több mint egy éve nem alkalmaz tudásdesztillációt (knowledge distillation), vagyis nem tanulnak más laborok meglévő modelljeinek kimeneteiből. A desztilláció során egy kisebb modellt egy nagyobb „tanármodell” kimenetének másolására tanítanak be; a ByteDance ehelyett a független fejlesztésre helyezi a hangsúlyt.

A cég alapítója, Zhang Yiming (Csang Ji-ming) meggyőződése szerint csak így lehet versenytársakat felülmúló modellt létrehozni. Egy belső értekezleten — amelyről a Financial Times szerint két héttel ezelőtt beszélt — Zhang arra kérte csapatát, hogy a rövid távú lemaradások miatti aggodalom helyett hosszú távon világelső modellképességeket célozzanak meg.

Miért számít ez?

Ha a ByteDance modellje valóban eléri a 10 billió paraméter körüli nagyságrendet, az jelentős lépés lenne a kínai AI-fejlesztésben és a globális versenyben egyaránt. Ugyanakkor a végső teljesítményt nem csupán a modellméret határozza meg: döntő lesz az adatminőség, a tréningeljárások és az alkalmazott technikák kombinációja.

Ennek a cikknek az előkészítésében AI-asszisztens működött közre, a végleges tartalmat újságírónk szerkesztette és ellenőrizte.