Modellbevezetés

Tencent bemutatja a Hy3 nagy nyelvi modellt Mixture-of-Experts architektúrával

A Tencent Hy Team bemutatta a Hy3 nevű nagy nyelvi modellt, amely Apache 2.0 licenc alatt érhető el.

Tencent bemutatja a Hy3 nagy nyelvi modellt Mixture-of-Experts architektúrával

A Tencent Hy Team bejelentette a Hy3 nevű nagy nyelvi modellt, amely Mixture-of-Experts (MoE) architektúrán alapul. A modell teljes paraméterszáma 295 milliárd, ebből 21 milliárd az aktívan használt paraméterek száma, továbbá 3,8 milliárd paraméter található a MTP rétegben.

Fejlesztés és finomhangolás

A Hy3 első, „Preview” változatát a hónap végén, áprilisban tették elérhetővé. A bemutató után a fejlesztők több mint 50 termékcsapat visszajelzéseit gyűjtötték össze, majd a modellt poszt-tréning fázisban magasabb minőségű adatokkal skálázták fel. A Tencent szerint ezek az iterációk hozzájárultak a modell általános teljesítményjavulásához és gyakorlati hasznosságának növeléséhez.

Teljesítmény és alkalmazások

A vállalat állítása szerint a Hy3 jobb teljesítményt nyújt a hasonló méretű modelleknél, és versenyképes a vezető nyílt forráskódú modellekkel, amelyek 2–5-ször több paraméterrel rendelkeznek. Emellett a Hy3 jelentős előrelépést mutatott a különböző termékekben és produktivitást segítő feladatokban mért hasznosság tekintetében.

Méretek, formátumok és elérhetőség

A modell teljes méretben Hugging Face-en 598 GB helyet foglal, míg az FP8 kvantált változata körülbelül 300 GB. A kontextushossz — az egyszerre feldolgozható tokenek száma — 256 000 token (256K).

A Hy3 ingyenesen kipróbálható az OpenRouter felületén, az elérhetőség július 21-ig tart.

Demonstrációs példa

A bejelentés említ egy egyszerű kreatív próbát is: a modellhez intézett kérésre egy „SVG-t generálni egy bicikliző pelikánról” sikeres eredményt adott, ami szemlélteti a generatív képességek egy aspektusát.

Miért számít ez?

A Hy3 bemutatása az MoE-modellek növekvő népszerűségét tükrözi a nagy modellek skálázásában: az MoE lehetővé teszi nagy, de költséghatékony paraméterkészletek használatát úgy, hogy csak egy részhalmaz aktív egy adott feladat során. A 256K kontextushossz különösen előnyös hosszú dokumentumok, kód vagy többfordulós párbeszédek feldolgozásához.

A Tencent Hy Team közleménye szerint a Hy3 célja, hogy jobb teljesítményt és nagyobb gyakorlati értéket biztosítson különböző termékek és fejlesztési forgatókönyvek számára.