A Financial Times jelentése szerint a TikTok anyavállalata, a ByteDance jelenleg egy akár 10 billió paraméteres (10 trillion parameters) mesterségesintelligencia-modell előtanításán dolgozik. A vállalat fejlesztése méretében megközelítheti az Anthropic élvonalbeli Mythos rendszerét, és körülbelül háromszor nagyobb lehet a korábban Kína legnagyobb modelljének tartott Moonshot Kimi K3-nál.
Fejlesztési állapot és paraméterszámok
A projekt még a korai, előtanítási (pretraining) fázisban van, amely iparági szokás szerint általában három–hat hónapot vesz igénybe. A modell végleges paraméterszáma a későbbi fázisokban dől el. Az Anthropic hivatalosan nem közli modelljei paraméterszámát; ipari becslések alapján azonban a Mythos 5 nagyjából 8 billió, míg a Fable 5 körülbelül 5 billió paraméterrel rendelkezik.
Fontos megjegyezni, hogy a paraméterszám önmagában a modell kapacitásának egyik mérője, de a tényleges teljesítményt nagyban befolyásolja az adatok minősége és a tanítási módszerek is.
A kínai versenyhelyzet
A ByteDance ambíciói illeszkednek a kínai AI-laborok szélesebb törekvéseihez: az elmúlt hetekben a Moonshot és az Alibaba modelljei is erős benchmark-eredményeket értek el, és bizonyos feladatokban csak az Anthropic Fable 5 mögött maradtak. Iparági források szerint több kínai labor is hasonló, Fable 5 méretű modellek betanításán dolgozik, de a ByteDance tervei a legambiciózusabbnak számítanak.
A Seed csapat és a technikai háttér
A ByteDance fejlesztéseit a Seed nevű csapat végzi, amelyet Vu Jong-huj, a Google DeepMind korábbi kutatója vezet. A mintegy kétezer fős csapat Kínában és külföldön dolgozó kutatókból, infrastruktúra-mérnökökből, adatcímkézőkből és fordítókból áll.
A vállalat az elmúlt három évben a kínai technológiai szereplők közül az egyik legagresszívabb befektető volt az AI terén: bővítette adatközpont-hálózatát, fejlesztette a Volcano Engine nevű felhőszolgáltatást, és tervezi saját AI-chipek fejlesztését.
Módszertani irány és vezetői elvárások
A Seed csapat több mint egy éve nem alkalmaz tudásdesztillációt (knowledge distillation), vagyis nem tanulnak más laborok meglévő modelljeinek kimeneteiből. A desztilláció során egy kisebb modellt egy nagyobb „tanármodell” kimenetének másolására tanítanak be; a ByteDance ehelyett a független fejlesztésre helyezi a hangsúlyt.
A cég alapítója, Zhang Yiming (Csang Ji-ming) meggyőződése szerint csak így lehet versenytársakat felülmúló modellt létrehozni. Egy belső értekezleten — amelyről a Financial Times szerint két héttel ezelőtt beszélt — Zhang arra kérte csapatát, hogy a rövid távú lemaradások miatti aggodalom helyett hosszú távon világelső modellképességeket célozzanak meg.
Miért számít ez?
Ha a ByteDance modellje valóban eléri a 10 billió paraméter körüli nagyságrendet, az jelentős lépés lenne a kínai AI-fejlesztésben és a globális versenyben egyaránt. Ugyanakkor a végső teljesítményt nem csupán a modellméret határozza meg: döntő lesz az adatminőség, a tréningeljárások és az alkalmazott technikák kombinációja.
Ennek a cikknek az előkészítésében AI-asszisztens működött közre, a végleges tartalmat újságírónk szerkesztette és ellenőrizte.



