Modellbevezetés

Mesterséges intelligenciával generált szöveg

Qwen 3.8 27B: erős, helyben futtatható multimodális modell, de túl sokat „gondolkodik” alapbeállítással

A főszereplő az Alibaba Qwen kutatócsoport által kiadott Qwen 3.8 27B nagy nyilvános súlyú, látásképes nyelvi modell.

Qwen 3.8 27B: erős, helyben futtatható multimodális modell, de túl sokat „gondolkodik” alapbeállítással

Az Alibaba Qwen kutatócsapata pénteken adta ki a Qwen 3.8 27B modellt: egy Apache 2 licencű, 27 milliárd paraméteres, látásképes nagy nyelvi modell (LLM). A modell diszkre letöltve körülbelül 17 GB-ot foglal, és a fejlesztők szerint javulást mutat a korábbi Qwen 3.6 27B és a zárt súlyú Qwen 3.7-Plus modellekhez képest.

Hol és hogyan futtatták

A modellt a szerző két gépen tesztelte: egy 128 GB memóriás M5 Max MacBook Pro-n és egy NVIDIA DGX Spark rendszeren. Mindkét környezetben LM Studio-t és a 17 GB-os Q4_K_M kvantált GGUF buildet használták; a Sparkon emellett kipróbálták közvetlenül a llama-server-rel is.

Alapértelmezett „xhigh” reasoning setting: túl sok gondolkodás

A Qwen 3.8 dokumentációja szerint a modell alapértelmezett reasoning_effort beállítása "xhigh" (komplex feladatok részletes elemzéséhez), emellett létezik "medium" (pontosság és sebesség egyensúlya) és "low" (a sebességre és költségre optimalizált) opció. A teszt alapján ez a "xhigh" alapbeállítás különösen rosszul viselkedik fogyasztói hardveren: a modell nagyon sok reasoning tokennel dolgozik, sokszor feleslegesen hosszú belső okfejtést generálva.

A szerző eredetileg az LM Studio 8,192 tokendes kontextuslimitjével futtatta a modellt, és azt tapasztalta, hogy a Qwen a limit teljes kihasználásával "gondolkodik" még egyszerű feladatokon is. A probléma megszűnt, amikor a modellt a maximális 262,144 tokenes kontextushosszig töltötte be.

Példa: pelikan biciklin (SVG)

Egy bemutatófeladatban a szerző egy pelikan biciklin ábrázolására kérte a modellt SVG-ként; az első próbálkozásnál, megnövelt kontextussal a generálás 21 percet vett igénybe. A modell 22,276 reasoning tokent használt és 3,223 tokent adott vissza kimenetként. A szerző szerint ez a legjobb lokálisan futó modell által készített pelikan-SVG, amit eddig látott (részletek: helyes váz, mindkét oldalon lábak, tiszta táska, szárnyak a kormányon, háttér elemek stb.) — de a 21 perc várakozás nem éri meg a befektetést.

Ugyanezt a promptot reasoning kikapcsolt állapotban is lefuttatta: ez a futás 3,715 tokent adott és 137 másodpercet (nagyjából két percet) vett igénybe, azaz sokkal gyorsabb volt.

A szerző a nagyobb Qwen 3.8 2.4T-A95B változattal is kipróbálta ugyanazt (ezt a változatot a cikk szerint a héten adták ki), ahol animált SVG-t kapott gyorsabban.

Egyszerű példa: egy kör rajzolása

Egy nagyon egyszerű promptnál ("draw an svg of a circle") a Qwen xhigh beállításon részletes, kreatív és hosszú belső okfejtést indított, majd több perc elteltével egy látványos, animált kör-SVG-t állított elő — ami ugyan szép volt, de nem az, amit a felhasználó kért. A szerző javaslata: alapból hagyjuk figyelmen kívül az xhigh-ot, és kezdjünk "low" vagy teljesen kikapcsolt reasoninggel.

Vision: bounding boxok és annotálás

A Qwen 3.8 jól teljesített a látásalapú feladatokban is. Képannotálási tesztként pelikanokra kért vissza 0–1000 skálán mért bounding boxokat egy fotóról; a modell két találatot adott vissza a következő koordinátákkal:

  • [195, 290, 370, 780]
  • [445, 320, 675, 850]

A koordináták egybevágtak a képen megjelölt dobozokkal, és a szerző ezt vizualizálta is.

A modell képes volt egy teljes HTML eszközt is generálni, amely egy képet betölt és a 0–1000 skálán megadott bbox-koordinátákat a tényleges képmérethez méretezi; a generált eszköz ugyan túl van tervezve (a szerző elfelejtette lehúzni a reasoning szintet), de működőképes interfészt adott egyetlen promptból. A modell még egy beépített mintaképet is létrehozott demonstrációs célra (például egyszerűsített pelikan-sziluettek), bár a szerző ezt nem kérte külön.

Amikor a reasoning ki volt kapcsolva, a modell szinte működő megoldást adott, de a dobozok helyzete elcsúszott — ebből a szerző arra következtet, hogy a reasoning hasznos lehet a pontosabb egykörös megoldásokhoz.

Képes ügynököket (coding agents) működtetni

A lokalisan futó modellekkel kapcsolatban fontos kérdés, hogy elég teljesítményük van-e kódköröket és eszközhívásokat tartalmazó ügynökök futtatásához. A szerző Pi ügynökét választotta, mivel rövidebb system promptja miatt kisebb modellekkel jól működik. Pi-t úgy konfigurálta, hogy Qwen 3.8 27B-t használjon LM Studio-n futtatva a Sparkon (a Sparkot tailscale serve-en keresztül érte el). A konfigurációban a modellhez reasoning=true volt beállítva.

Egy "how does auth work?" kérdésre a modell több eszközhívást és reasoning-lépést követően hasznos választ adott. Később a szerző a modellre bízta, hogy írjon Python kódot egy Pi JSONL transcript Markdownná konvertálásához: a modell létrehozta és tesztelte a pi_jsonl_to_md.py fájlt, amely pontosan azt tette, amit kértek.

Teljesítmény és sebesség

A Qwen 3.8 27B sok szempontból ígéretes: hosszú kontextus, eszközhívások támogatása, erős látás- és kódgenerációs képességek, mindez egy 17 GB-os fájlban. Ugyanakkor a teljesítmény jelentős korlát: a szerző LM Studio alatt 15–30 token/másodperc sebességet mért, ami lassúbb, mint a hosztolt API-k. A cikk említi az "Artificial Analysis" méréseit is, amelyek szerint OpenAI 5.6 Sol 74 token/s, 5.6 Luna pedig 184 token/s teljesítményt ért el.

A közösség viszont gyorsan dolgozik a sebesség javításán. Egy ígéretes optimalizáció maga a modell által támogatott Multi-Token Prediction (MTP), amely olcsóbb előrejelző mechanizmust használ több token előrejelezésére, majd a fő modell gyorsan ellenőrzi a javaslatokat. A szerző Georgi Gerganov (llama.cpp készítője) tweetje alapján kipróbált egy MTP-szolgáltatást a Sparkon: a llama serve parancsban --spec-type draft-mtp használatával a futtatás körülbelül 72%-kal jobb teljesítményt adott, mint az LM Studio alap GGUF buildje egy összehasonlító benchmarkon.

Összegzés és következtetések

A Qwen 3.8 27B demonstrálja, hogy nyílt súlyú, általános célú modell hosszú kontextussal, látás- és eszköztámogatással, valamint érdemi kódgenerálási képességgel egy 17 GB-os csomagban megvalósítható. Ez fontos előrelépés a lokális modellek számára: ma már nem kell félmilliós adatközponti hardver egy kompetens modell futtatásához.

A fő korlát jelenleg a sebesség: a modell hajlamos túlgondolkodni az "xhigh" alapbeállításon, ami nagyon lelassítja az interakciót; a gyakorlati tanács az, hogy kezdetben használjunk alacsonyabb reasoning szinteket, és alkalmazzunk közösségi optimalizációkat (például MTP), hogy gyorsabbá tegyük a rendszert.

A Qwen 3.8 27B egy kis méretű, de rendkívül képességes modell, amely tovább erősíti az otthoni és kisvállalati környezetben futtatható LLM-ek használhatóságát, ha a teljesítményproblémákat és az alapbeállításokat megfelelően kezelik.

Megjegyzés a forrásokról

A cikk a szerző saját tesztjein és futtatási naplóin alapul, amelyekben LM Studio, llama-server, Pi, NVIDIA DGX Spark és M5 Max MacBook Pro környezetek szerepelnek. A Qwen 3.8 2.4T-A95B említése a nagyobb, múlt heti kiadásra utal.