A kínai Tencent ma bemutatta a Hy4 nevű, csak szöveges bemenetet fogadó nagy nyelvi modell (LLM) előzetes változatát. A vállalat által megadott paraméterek szerint a modell összesen 770 milliárd paramétert tartalmaz, ebből 49 milliárd az „aktív” paraméterek száma. A Hy4 kontextusablakának mérete 1 000 000 tokenre („1M token”) nőtt.
Miben különbözik a Hy3-tól
A Hy4 mérete jelentős növekedés a Tencent júliusi Hy3 modelljéhez képest: a Hy3 295 milliárd paraméterrel és 21 milliárd aktív paraméterrel rendelkezett, valamint 256 000 tokenes kontextusablakkal. A Hy4 tehát mind a teljes, mind az aktív paraméterek, illetve a kontextuskapacitás tekintetében nagy ugrást jelent.
Chat-sablon és a „reasoning_effort” beállítások
A fejlesztők vagy a közösség által a Hugging Face-re feltöltött chat_template.jinja fájl részletei alapján a modell chat-sablonja két „reasoning_effort” (érvelési/hozzáállás) szintet támogat: „high” (magas), amely alapértelmezettként szerepel, és „no_think” (érvelés letiltva). A sablonban validációs logika is található: ha a paraméter nincs megadva, beállítja „high”-ra; ha más értéket kap, hibát dob.
Közösségi próbák és viselkedés
Egy felhasználói próbán, amelyben a „Generate an SVG of a pelican riding a bicycle” (Generálj SVG-t egy bicikliző pelikánról) kérést futtattak az alapértelmezett "high" érvelési móddal OpenRouteren keresztül, a Hy4 részletes „reasoning trace” (érvelési nyomvonal) jellegű belső gondolatokat generált. A nyomvonalban például olyan megfontolások szerepeltek, hogy érdemes-e bukósisakot vagy szemüveget adni a pelikánnak, illetve hogy ez eltakarhatja-e a hosszú csőrét.
Miért számít ez
A nagyobb paraméterszám és az 1 milliós kontextus jelentősen megnöveli a modell potenciális képességeit hosszabb szövegek, kontextusok és komplex feladatok kezelésében. A chat_sablonból látható kétféle érvelési mód és a publikus tesztek során megjelenő részletes gondolatmenet pedig arra utalnak, hogy a Hy4 viselkedése konfiguralható, és képes önreflektív, többlépcsős érvelésre – legalábbis a „high” módban.
Összefoglalás
A Tencent Hy4 előzetes bemutatása technikai előrelépést jelent a cég LLM-fejlesztésében: 770 milliárd paraméterrel, 49 milliárd aktív paraméterrel és 1 000 000 tokenes kontextussal a modell jelentősen nagyobb, mint a júliusi Hy3. A nyilvánosan elérhető chat-sablon és a közösségi próbákból származó példák alapján a Hy4 két érvelési módot kínál, és képes részletes, többlépcsős belső érvelést megjeleníteni.



