Modellbevezetés

Moonshot AI bemutatja a Kimi K2.6 modellt: egytrilliós, hosszú távú autonóm kódolásra képes nyílt modell

Moonshot AI új Kimi K2.6 modellje egytrillió paraméteres látás‑nyelv modell, amelyet a hosszú, autonóm kódolási ciklusok kezelése és több száz ügynök egyidejű koordinálása céljából fejlesztettek.

Moonshot AI frissítette Kimi családját: a Kimi K2.6 egy 1 trilliárd paraméteres vision-language modell, amelyet hosszú, autonóm kódolási munkamenetekre és nagyobb léptékű multi-agent koordinációra terveztek. A vállalat szerint a modell teljesítménye vetekszik olyan nyílt-weights versenytársakkal, mint a Qwen3.6 Max Preview és a frissen megjelent DeepSeek V4, bár a vezető zárt modellek mögött marad.

Mire képes a Kimi K2.6

  • Architektúra: mixture-of-experts megközelítés, összesen 1 trilliárd paraméter; egy tokenre aktívan jutó kapacitás 32 milliárd paraméter. A látásfeldolgozást a MoonViT kódoló (400 millió paraméter) végzi. A Kimi K2.6 az előző Kimi K2 és Kimi K2.5 architektúrájára épít, többek között a multi-headed latent attention megoldást használva.
  • Bemenet/kimenet: képes fogadni szöveget, képeket és videót (akár 256 000 tokenig), és szöveget generálni akár 98 000 token hosszúságban.
  • Quantizáció: natív INT4 kvantizációval tanították.
  • Jellemzők: eszközhasználat, webkeresés, "preserve thinking" üzemmód (amely megőrzi a korábbi gondolatmeneti tokeneket többfordulós interakciók során), illetve agent swarm mód, amelyben egy koordinátor feladatokat bont szubtaskokra és akár 300 párhuzamos alügynököt képes létrehozni.
  • Agent swarm részletek: az egyes alügynökök 4 000 lépést hajthatnak végre (ez emelkedés az előző Kimi K2.5-höz képest, ahol 100 alügynök és 1 500 lépés volt a limit). A koordinátor újraosztja a munkát, ha egy alügynök elakad vagy hibázik. A „claw groups” kutatói előnézet lehetővé teszi, hogy külső fejlesztők ügynökei és emberi közreműködők is csatlakozzanak az agent swarmhoz, futtathatók tetszőleges eszközön vagy modellen.

Teljesítmény és benchmarkok

  • A Moonshot szerint a Kimi K2.6 az open-weights modellek között erősen szerepel több intelligencia- és agent-képesítési benchmarkon, és jó helyezéseket ért el emberi preferenciákon alapuló szubjektív tesztekben. Ugyanakkor egyes, nagyléptékű problémákat és komplex kódolási feladatokat értékelő mércéken a vezető zárt modellek (például GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro Preview) megelőzik.
  • Artificial Analysis Intelligence Index: a Kimi K2.6 a reasoning beállításon 54 pontot ért el, amivel vezet az open-weights mezőnyben, de elmarad GPT-5.5 xhigh reasoning (60) és Claude Opus 4.7 max reasoning, valamint Gemini 3.1 Pro Preview reasoning értékektől. Legközelebbi nyílt versenytársaként a Qwen3.6 Preview és a DeepSeek-V4-Pro szerepelnek, mindketten 52 ponttal.
  • Erősségek: Kimi K2.6 kimagasló volt olyan tesztekben, mint GPQA Diamond (graduális szintű tudományos kérdések), HLE (szakértői szintű multidiszciplináris logikai feladatok), és SciCode (tudományos kutatáshoz generált kód). Ugyanakkor öt index benchmarkon a frissen megjelent DeepSeek-V4-Pro megelőzte, és két teszten a Xiaomi MiMo-2.5-Pro és más nyílt modellek jobbnak bizonyultak.
  • Kódolási feladat vizsgálata: Moonshot egy valódi, nagyléptékű kódolási portolási feladatban tesztelte a modellt: a Qwen3.5-0.8B inferencia kódjának Zig nyelvre történő átültetését és Mac-re optimalizálását. Több mint 4 000 eszközhívás és 14 egymást követő javítás során, több mint 12 óra alatt a throughputot körülbelül 15-ről 193 token/másodpercre növelte, és a folyamat végén mintegy 20 százalékkal gyorsabb eredményt ért el, mint ugyanazon a hardveren futó LM Studio helyi inferencia alkalmazás.
  • Hallucinációs ráta: az Artificial Analysis által mért hallucinációs arány egy általános tudásra irányuló kérdés-válasz benchmarkon 39,26 százalék volt. Ez jelentős javulás a Kimi K2.5-höz képest (64,6 százalék), és nagyjából összevethető az Anthropic Claude Opus 4.7 értékével (36,18 százalék).
  • Code Arena WebDev (Arena.ai) rangsor: a Kimi K2.6 1 529 Elo ponttal a 67 modell közül 2026. április 26-i állás szerint a hatodik helyen végzett; előtte Anthropic Claude Opus 4.7 (1 565 Elo), Claude Opus 4.6 (1 548 Elo) és Z.ai nyílt modellje, a GLM-5.1 (1 534 Elo) álltak.

Hozzáférés, licenc és ár

  • A Kimi K2.6 súlyai elérhetők letöltésre a Hugging Face-en egy módosított MIT licenc alatt; ez a licenc kereskedelmi felhasználást engedélyez, feltéve, hogy a termék több mint 100 millió havi aktív felhasználóval vagy több mint havi 20 millió dollár bevétellel rendelkezik — ebben az esetben attribúció szükséges.
  • A publiok szerint ingyenes chat felület érhető el a kimi.com címen, valamint Kimi mobilalkalmazás, és API-hozzáférés a Moonshot árlistája szerint: 0,95/0,16/4,00 USD per millió input/cached/output token.

Amit Moonshot nem részletezett

A vállalat nem tett közzé részleteket a Kimi K2.6 pontos tanítási adatkészletéről és a tanítási módszerek konkrét változtatásairól a korábbi K2.5-höz képest.

Kontextus és jelentőség

A 2025 végén kibontakozó versenyben a hosszú távú autonóm végrehajtás (hogy egy ügynök órákon, vagy akár napokon át önállóan dolgozzon egy feladaton) új versenyfronttá vált. Anthropic, OpenAI és Alibaba is erre a képességre fókuszált legutóbbi kiadásaiban. A Kimi család (a Kimi K2-t 2025 júliusában adták ki) korai nyílt-weights szereplőként lépett be az agentikus eszközhasználat mezőjére, és a családot azóta több alkalommal frissítették, egyre nagyobb hangsúlyt helyezve a hosszú távú végrehajtásra.

Moonshot Kimi K2.6-tal folyamatosan növeli azt az időtartamot, amely alatt a modell önállóan képes hasznos munkát végezni: rövid gondolatmeneti nyomvonalaktól a többórás kódolási munkameneteken át most már többnapos projektekig. Minden ilyen bővülés csökkenti azt a gyakoriságot, amellyel emberi ellenőrzésre van szükség az ügynökök pályán tartásához.

Rövid megjegyzés

Moonshot megjegyzése szerint a tartós autonómia és a csökkent hallucinációs arány kapcsolódnak egymáshoz: ha egy ügynök hibázik, képes ellenőrizni a munkáját, megtalálni és kijavítani a hibát — ez a modell tervezési iránya is.