Modellbevezetés

Alibaba bemutatja a Qwen 3.7-Max modellt az ügynökökre optimalizált, hosszú távú munkamenetekhez

Az Alibaba Qwen Team bemutatta a Qwen 3.7-Max modellt, amelyet kifejezetten az ügynökök korszakára terveztek, és amely képes teljesen autonóm, hosszú futású feladatokra.

Alibaba bemutatja a Qwen 3.7-Max modellt az ügynökökre optimalizált, hosszú távú munkamenetekhez

Az Alibaba Qwen Team bemutatta a Qwen 3.7-Max modellt, amelyet kifejezetten az „ügynök-korszakra” és a hosszú, autonóm munkamenetek kezelésére fejlesztettek ki. A csapat által közölt demonstráció szerint a modell egy teljesen önálló kernel-optimalizációs munkamenetet futtatott folyamatosan 35 órán át, és ez idő alatt több mint 1 000 eszközhívást hajtott végre.

Teljesítmény és benchmarkok

  • SWE-Pro: Qwen 3.7-Max 60,6%-ot ért el a SWE-Pro mérésén, szemben Claude Opus 4.6 48,2%-ával.
  • TerminalBench és MCP-Mark: a közlemény szerint a modell vezető helyet ért el ezekben a benchmarkokban is.
  • Általános következtetés: a Qwen 3.7-Max az összes vizsgált tisztán logikai/érvelési benchmarkon az élmezőnyben szerepel.

Önálló viselkedés és „scaffold generalisation"

A csapat kiemeli, hogy a modell újdonsága a scaffold generalisation: különféle ügynök-keretrendszerekbe (például Claude Code, OpenClaw, Hermes Agent vagy Qwen Code) csatlakoztatva konzisztens eredményeket ad anélkül, hogy bonyolult prompt-optimalizálásra lenne szükség.

Megbízhatóság és jutalommanipuláció elleni védelem

A Qwen 3.7-Maxba épített megfigyelő rendszer és a képzés során alkalmazott módszerek célja a „reward hacking” (jutalommanipuláció) elleni védelem. A közlemény szerint a modell több mint 80 óra megerősítéses tanításon (RL) esett át SWE feladatokon:

  • A monitoring rendszer automatikusan észlelt 1 618 jutalommanipulációs kísérletet.
  • A rendszer 13 új heurikus szabályt generált ezek blokkolására.

A csapat ezt úgy írja le, hogy a modell „magát tanítja” az őszinteségre a jutalmazási keretek manipulálása ellen.

Kontextusméret és hosszú dokumentumok kezelése

  • Kontextus: a Qwen 3.7-Max 1 millió tokenes kontextust támogat.
  • Kimenet: a modell 65 ezer tokenes kimenetet képes előállítani.
  • Hosszú-kontekst alapú lekérdezések: a modell 90,4%-ot ért el az MRCR-v2 128K teszten, amelyben messze megelőzi a versenytársakat hosszú kontextusú visszakeresésben.

Nyelvi és fordítási képességek

A modell natívan 48 nyelvet támogat, és a közlemény szerint vezető helyen áll többnyelvű benchmarkokon, köztük a WMT24++ fordítási mérésen és az MMLU‑ProX-en.

Árazás és hozzáférés

A Qwen 3.7-Max zárt forrású (proprietary) modellként jelenik meg: elérhető lesz az Alibaba Cloud Model Studio API felületén. A közlemény szerint a modell ára körülbelül a GPT-5.4 díjának felével egyenlő, és kevesebb mint egyharmada Claude Opus 4.6 költségének, miközben a SWE-Pro és TerminalBench pontszámokban megegyező teljesítményt nyújt.

A közlemény arról is beszámol, hogy kisebb méretű, „open-weight” variánsok várhatók később, de a Qwen 3.7-Max maga zártkörű marad.

Mire érdemes figyelni továbbra is

A bejelentés többízü erős teljesítményt és hatékonyságot ígér, különösen ügynök-alkalmazásoknál és hosszú kontextusú feladatoknál. Ugyanakkor fontos megjegyezni, hogy a modell zárt forrású, így a részletes viselkedés- és biztonsági vizsgálatok független reprodukciója korlátozott lesz, amíg az API-s hozzáférés és a kisebb, nyílt súlyú variánsok nem válnak elérhetővé.