Alibaba bemutatta a Qwen3.7-Max nevű nagy nyelvi modelljét, amelyet elsősorban hosszabb futásidejű, „agentic” feladatokra, kódolásra és tudományos felfedezésekre pozicionál. A vállalat szerint a Qwen3.7-Max a preferált modelljük szövegalapú munkákhoz; a modell súlyai azonban zártak, akárcsak a cég csúcskategóriás Qwen-modellei óta késő 2025-ben.
Mit tud és hogyan lehet használni
- Bemenet: szöveg, maximum 1 millió tokenig.
- Kimenet: szöveg, maximum 64 000 tokenig.
- Sebesség: 208,3 token/másodperc (Artificial Analysis mérése, adott beállítással).
- Funkciók: érvelés, eszközhasználat (tool use), prompt caching (promptok gyorsítótárazása), natív kompatibilitás az OpenAI és Anthropic API specifikációival, valamint a modell képes megtartani az előző körökre írt érvelési szöveget.
A Qwen3.7-hez kapcsolódóan egy multimodális variáns, a Qwen3.7-Plus-Preview is egyidejűleg megjelent.
Teljesítmény és benchmarkok
A Qwen3.7-Max az Artificial Analysis Intelligence Index nevű összetett rangsorban a felső mezőnyhöz tartozik: a reasoning (érvelés) részmutatóban 56,6 pontot ért el, ami a tesztbeállításoktól függően ötödik vagy hetedik helyre sorolja. Egyes rivális modellekhez viszonyítva (például Gemini 3.1 Pro Preview 57,2 és Google Gemini 3.5 Flash 55,3) a Qwen3.7-Max a mezőny közelében található.
Az Artificial Analysis más metrikáin is megmérték a modellt:
- AA-Omniscience (tudás/helyesség alapú mérőszám): a Qwen3.7-Max egy, a cikkben nem részletezett érvelési szintre állítva a hatodik helyen végzett (pontszám: 14). Ebben a mérésben a helytelen válaszokat büntetik, a tartózkodások (abstentions) nem számítanak — a Qwen3.7-Max esetében a 23%-os „hallucinációs arány” volt a legalacsonyabb a vizsgált frontier modellek között, de ezt részben azzal érte el, hogy a kérések több mint felére nem adott választ.
- Sebesség: az Artificial Analysis mérése szerint 208 token/másodpercet ért el (érvelési szint nincs specifikálva), amivel harmadik helyre került, holtversenyben a Gemini 3.5 Flash-sel; gyorsabbak voltak a GPT-OSS 120B (313 t/s) és a GPT-OSS 20B (238 t/s).
Az értékelések futtatása körülbelül 97 millió output tokent használt fel, ami jóval meghaladja az elemzők átlagos 35 milliós tokenfelhasználását.
Hogyan tanították és mi nem ismert
Alibaba magas szinten írt a Qwen3.7-Max megerősítéses tanulási (reinforcement-learning) megközelítéséről. A cég szerint az agent-training tipikusan összekapcsolt összetevőit három részre bontották: a végrehajtandó feladatra, egy agentic harness-re (azaz az eszközöket hívó keretrendszerre) és egy verifier-re, amely eldönti a sikerességet. A modellt sokféle feladathoz, harness-hoz és verifier‑hez képest tréningezték, hogy elkerüljék az egyetlen beállításhoz kötődő „trükkök” megtanulását.
Ugyanakkor fontos, hogy a Qwen3.7-Max paraméterszáma, belső architektúrája, a használt tanítóadatok és a részletes tréningmódszerek nem lettek nyilvánosságra hozva.
Egyedi belső teszt és üzemidő‑optimalizálás
Az Alibaba egy belső tesztet is bemutatott a modell agentic képességeiről, amely még nem független benchmarkokkal van validálva. Eszerint a modell 35 óra alatt 1 158 eszközhívást (tool call) végzett és 432 kernel-értékelést (tesztfuttatást) hajtott végre olyan hardveren, amelyet a modell a tréning során nem ismert. Az így generált kód körülbelül tízszeres gyorsulást mutatott egy referenciaimplementációhoz képest.
Az Artificial Analysis még nem tesztelte a Qwen3.7-Maxot a hosszú futású, agentic feladatok saját benchmarkján.
Hozzáférés és árképzés
- Ingyenesen elérhető a Qwen Chat felületén (fiók szükséges).
- API-hozzáférés az Alibaba Cloud Model Studio-n keresztül: 2,50/0,25/7,50 USD per millió input / cached / output token.
A vállalati stratégia mögött
A Qwen3.7-Max bemutatása folytatja Alibaba korábbi irányváltását az open‑súlyú modellektől a zártabb megoldások felé. A Qwen3.6-Max-Preview és a Qwen3.6-Plus szintén zárt súlyúak, míg a kevésbé nagy teljesítményű Qwen3.6-27B és Qwen3.6-35B-A3B súlyai továbbra is nyilvánosan hozzáférhetők. Emellett az Alibaba elkezdett díjat felszámítani a Qwen Code parancssori fejlesztőeszköz használatáért. Ezek a változások a Qwen-csapat vezetésében történt átalakulásokkal együtt azt jelzik, hogy a cég a legjobb modelljeit bevételszerzésre kívánja fordítani ahelyett, hogy kizárólag a széles körű hozzáférést maximalizálná.
Miért számít ez
Az Artificial Analysis Intelligence Index alapján a Qwen3.7-Max jelenleg a legokosabb kínai nagy nyelvi modellnek tűnik, és a sebesség tekintetében is az élmezőnybe tartozik. Ugyanakkor a zárt súlyok és a hiányzó részletes technikai információk korlátozzák a független vizsgálatokat és a kutatói közösség számára történő reprodukálhatóságot.
Összegzés
A Qwen3.7-Max egy jelentős előrelépésnek tűnik Alibaba termékportfóliójában: gyorsabb kimeneteket, fejlett agentic képességeket és alacsonyabb hallucinációs rátát ígér, miközben a cég a fejlettebb rétegek zárt súlyainak üzleti hasznosítását folytatja. Ugyanakkor a részletes technikai adatok hiánya és a független benchmarkok korlátozott elérhetősége miatt az objektív értékelés még részben függ a későbbi, külső vizsgálatoktól.



