Az Alibaba Qwen Team bemutatta a Qwen 3.7-Max modellt, amelyet kifejezetten az „ügynök-korszakra” és a hosszú, autonóm munkamenetek kezelésére fejlesztettek ki. A csapat által közölt demonstráció szerint a modell egy teljesen önálló kernel-optimalizációs munkamenetet futtatott folyamatosan 35 órán át, és ez idő alatt több mint 1 000 eszközhívást hajtott végre.
Teljesítmény és benchmarkok
- SWE-Pro: Qwen 3.7-Max 60,6%-ot ért el a SWE-Pro mérésén, szemben Claude Opus 4.6 48,2%-ával.
- TerminalBench és MCP-Mark: a közlemény szerint a modell vezető helyet ért el ezekben a benchmarkokban is.
- Általános következtetés: a Qwen 3.7-Max az összes vizsgált tisztán logikai/érvelési benchmarkon az élmezőnyben szerepel.
Önálló viselkedés és „scaffold generalisation"
A csapat kiemeli, hogy a modell újdonsága a scaffold generalisation: különféle ügynök-keretrendszerekbe (például Claude Code, OpenClaw, Hermes Agent vagy Qwen Code) csatlakoztatva konzisztens eredményeket ad anélkül, hogy bonyolult prompt-optimalizálásra lenne szükség.
Megbízhatóság és jutalommanipuláció elleni védelem
A Qwen 3.7-Maxba épített megfigyelő rendszer és a képzés során alkalmazott módszerek célja a „reward hacking” (jutalommanipuláció) elleni védelem. A közlemény szerint a modell több mint 80 óra megerősítéses tanításon (RL) esett át SWE feladatokon:
- A monitoring rendszer automatikusan észlelt 1 618 jutalommanipulációs kísérletet.
- A rendszer 13 új heurikus szabályt generált ezek blokkolására.
A csapat ezt úgy írja le, hogy a modell „magát tanítja” az őszinteségre a jutalmazási keretek manipulálása ellen.
Kontextusméret és hosszú dokumentumok kezelése
- Kontextus: a Qwen 3.7-Max 1 millió tokenes kontextust támogat.
- Kimenet: a modell 65 ezer tokenes kimenetet képes előállítani.
- Hosszú-kontekst alapú lekérdezések: a modell 90,4%-ot ért el az MRCR-v2 128K teszten, amelyben messze megelőzi a versenytársakat hosszú kontextusú visszakeresésben.
Nyelvi és fordítási képességek
A modell natívan 48 nyelvet támogat, és a közlemény szerint vezető helyen áll többnyelvű benchmarkokon, köztük a WMT24++ fordítási mérésen és az MMLU‑ProX-en.
Árazás és hozzáférés
A Qwen 3.7-Max zárt forrású (proprietary) modellként jelenik meg: elérhető lesz az Alibaba Cloud Model Studio API felületén. A közlemény szerint a modell ára körülbelül a GPT-5.4 díjának felével egyenlő, és kevesebb mint egyharmada Claude Opus 4.6 költségének, miközben a SWE-Pro és TerminalBench pontszámokban megegyező teljesítményt nyújt.
A közlemény arról is beszámol, hogy kisebb méretű, „open-weight” variánsok várhatók később, de a Qwen 3.7-Max maga zártkörű marad.
Mire érdemes figyelni továbbra is
A bejelentés többízü erős teljesítményt és hatékonyságot ígér, különösen ügynök-alkalmazásoknál és hosszú kontextusú feladatoknál. Ugyanakkor fontos megjegyezni, hogy a modell zárt forrású, így a részletes viselkedés- és biztonsági vizsgálatok független reprodukciója korlátozott lesz, amíg az API-s hozzáférés és a kisebb, nyílt súlyú variánsok nem válnak elérhetővé.



