Moonshot AI frissítette Kimi családját: a Kimi K2.6 egy 1 trilliárd paraméteres vision-language modell, amelyet hosszú, autonóm kódolási munkamenetekre és nagyobb léptékű multi-agent koordinációra terveztek. A vállalat szerint a modell teljesítménye vetekszik olyan nyílt-weights versenytársakkal, mint a Qwen3.6 Max Preview és a frissen megjelent DeepSeek V4, bár a vezető zárt modellek mögött marad.
Mire képes a Kimi K2.6
- Architektúra: mixture-of-experts megközelítés, összesen 1 trilliárd paraméter; egy tokenre aktívan jutó kapacitás 32 milliárd paraméter. A látásfeldolgozást a MoonViT kódoló (400 millió paraméter) végzi. A Kimi K2.6 az előző Kimi K2 és Kimi K2.5 architektúrájára épít, többek között a multi-headed latent attention megoldást használva.
- Bemenet/kimenet: képes fogadni szöveget, képeket és videót (akár 256 000 tokenig), és szöveget generálni akár 98 000 token hosszúságban.
- Quantizáció: natív INT4 kvantizációval tanították.
- Jellemzők: eszközhasználat, webkeresés, "preserve thinking" üzemmód (amely megőrzi a korábbi gondolatmeneti tokeneket többfordulós interakciók során), illetve agent swarm mód, amelyben egy koordinátor feladatokat bont szubtaskokra és akár 300 párhuzamos alügynököt képes létrehozni.
- Agent swarm részletek: az egyes alügynökök 4 000 lépést hajthatnak végre (ez emelkedés az előző Kimi K2.5-höz képest, ahol 100 alügynök és 1 500 lépés volt a limit). A koordinátor újraosztja a munkát, ha egy alügynök elakad vagy hibázik. A „claw groups” kutatói előnézet lehetővé teszi, hogy külső fejlesztők ügynökei és emberi közreműködők is csatlakozzanak az agent swarmhoz, futtathatók tetszőleges eszközön vagy modellen.
Teljesítmény és benchmarkok
- A Moonshot szerint a Kimi K2.6 az open-weights modellek között erősen szerepel több intelligencia- és agent-képesítési benchmarkon, és jó helyezéseket ért el emberi preferenciákon alapuló szubjektív tesztekben. Ugyanakkor egyes, nagyléptékű problémákat és komplex kódolási feladatokat értékelő mércéken a vezető zárt modellek (például GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro Preview) megelőzik.
- Artificial Analysis Intelligence Index: a Kimi K2.6 a reasoning beállításon 54 pontot ért el, amivel vezet az open-weights mezőnyben, de elmarad GPT-5.5 xhigh reasoning (60) és Claude Opus 4.7 max reasoning, valamint Gemini 3.1 Pro Preview reasoning értékektől. Legközelebbi nyílt versenytársaként a Qwen3.6 Preview és a DeepSeek-V4-Pro szerepelnek, mindketten 52 ponttal.
- Erősségek: Kimi K2.6 kimagasló volt olyan tesztekben, mint GPQA Diamond (graduális szintű tudományos kérdések), HLE (szakértői szintű multidiszciplináris logikai feladatok), és SciCode (tudományos kutatáshoz generált kód). Ugyanakkor öt index benchmarkon a frissen megjelent DeepSeek-V4-Pro megelőzte, és két teszten a Xiaomi MiMo-2.5-Pro és más nyílt modellek jobbnak bizonyultak.
- Kódolási feladat vizsgálata: Moonshot egy valódi, nagyléptékű kódolási portolási feladatban tesztelte a modellt: a Qwen3.5-0.8B inferencia kódjának Zig nyelvre történő átültetését és Mac-re optimalizálását. Több mint 4 000 eszközhívás és 14 egymást követő javítás során, több mint 12 óra alatt a throughputot körülbelül 15-ről 193 token/másodpercre növelte, és a folyamat végén mintegy 20 százalékkal gyorsabb eredményt ért el, mint ugyanazon a hardveren futó LM Studio helyi inferencia alkalmazás.
- Hallucinációs ráta: az Artificial Analysis által mért hallucinációs arány egy általános tudásra irányuló kérdés-válasz benchmarkon 39,26 százalék volt. Ez jelentős javulás a Kimi K2.5-höz képest (64,6 százalék), és nagyjából összevethető az Anthropic Claude Opus 4.7 értékével (36,18 százalék).
- Code Arena WebDev (Arena.ai) rangsor: a Kimi K2.6 1 529 Elo ponttal a 67 modell közül 2026. április 26-i állás szerint a hatodik helyen végzett; előtte Anthropic Claude Opus 4.7 (1 565 Elo), Claude Opus 4.6 (1 548 Elo) és Z.ai nyílt modellje, a GLM-5.1 (1 534 Elo) álltak.
Hozzáférés, licenc és ár
- A Kimi K2.6 súlyai elérhetők letöltésre a Hugging Face-en egy módosított MIT licenc alatt; ez a licenc kereskedelmi felhasználást engedélyez, feltéve, hogy a termék több mint 100 millió havi aktív felhasználóval vagy több mint havi 20 millió dollár bevétellel rendelkezik — ebben az esetben attribúció szükséges.
- A publiok szerint ingyenes chat felület érhető el a kimi.com címen, valamint Kimi mobilalkalmazás, és API-hozzáférés a Moonshot árlistája szerint: 0,95/0,16/4,00 USD per millió input/cached/output token.
Amit Moonshot nem részletezett
A vállalat nem tett közzé részleteket a Kimi K2.6 pontos tanítási adatkészletéről és a tanítási módszerek konkrét változtatásairól a korábbi K2.5-höz képest.
Kontextus és jelentőség
A 2025 végén kibontakozó versenyben a hosszú távú autonóm végrehajtás (hogy egy ügynök órákon, vagy akár napokon át önállóan dolgozzon egy feladaton) új versenyfronttá vált. Anthropic, OpenAI és Alibaba is erre a képességre fókuszált legutóbbi kiadásaiban. A Kimi család (a Kimi K2-t 2025 júliusában adták ki) korai nyílt-weights szereplőként lépett be az agentikus eszközhasználat mezőjére, és a családot azóta több alkalommal frissítették, egyre nagyobb hangsúlyt helyezve a hosszú távú végrehajtásra.
Moonshot Kimi K2.6-tal folyamatosan növeli azt az időtartamot, amely alatt a modell önállóan képes hasznos munkát végezni: rövid gondolatmeneti nyomvonalaktól a többórás kódolási munkameneteken át most már többnapos projektekig. Minden ilyen bővülés csökkenti azt a gyakoriságot, amellyel emberi ellenőrzésre van szükség az ügynökök pályán tartásához.
Rövid megjegyzés
Moonshot megjegyzése szerint a tartós autonómia és a csökkent hallucinációs arány kapcsolódnak egymáshoz: ha egy ügynök hibázik, képes ellenőrizni a munkáját, megtalálni és kijavítani a hibát — ez a modell tervezési iránya is.


