Modellbevezetés

Moonshot AI bemutatja a 2,8 trilliós Kimi K3 modellt — nyílt súlyok jövő júliusra ígérve

A főszereplő a kínai Moonshot AI, amely bejelentette legújabb nyelvi modelljét, a Kimi K3-at, 2,8 billió (trillió) paraméterrel.

Moonshot AI bemutatja a 2,8 trilliós Kimi K3 modellt — nyílt súlyok jövő júliusra ígérve

A kínai Moonshot AI ma bejelentette a Kimi K3-at, amelyet a cég "eddigi legképzettebb modelljeként, 2,8 trillió paraméterrel" jellemzett. A modellt jelenleg a Moonshot weboldalán és API-ján keresztül lehet elérni; a labor azonban ígéretet tett arra, hogy a nyílt súlyokat 2026. július 27-ig elérhetővé teszi.

Pozicionálás és benchmarkok

Moonshot Kimi K3-at az első "nyílt 3T-osztályú modellnek" nevezi (a 2,8 trilliót a kommunikáció szerint nagyjából 3 trillióra kerekítve). Ezzel átveszi a vezetést a DeepSeek 1,6T v4 Pro modelljétől.

A Moonshot és az Artificial Analysis által közzétett önbevalláson alapuló mérési eredmények szerint Kimi K3 általában felülmúlja az Anthropic Claude Opus 4.8 max változatát és az OpenAI GPT-5.5 high szintjét, ugyanakkor elmarad Claude Fable 5 és GPT-5.6 Sol teljesítményétől.

Az Artificial Analysis kiemelt megállapításai között szerepel:

  • „A privát, hosszú távú tudásmunkára irányuló értékelésünkön Kimi K3 összesített Elo-pontszáma 1547, ami +732 pont Kimi K2.6-hoz képest, és csak Claude Fable 5 előzi meg.”
  • „Feladatköltség (task cost): $0.94, ami hasonló a GPT-5.6 Sol ($1.04) költségéhez, körülbelül a fele az Opus 4.8-nak ($1.80), viszont magasabb, mint a nyílt súlyú vetélytársaké.”
  • „A Kimi K3 kimeneti tokenfelhasználása az Artificial Analysis Intelligence Indexen jelentősen csökkent, 21%-kal kevesebb output tokent használva, mint a K2.6.”

Emellett Kimi K3 jelenleg az Arena.ai Frontend Code arénájában is az élen áll, és itt még Claude Fable 5-öt is megelőzi.

Ár és árszint

A modell használata input tokenenként $3/millió és output tokenenként $15/millió díjazással történik. Ez az árszint összevethető Anthropic Claude Sonnet-sorozatával, és a legdrágább kínai labor által kiadott modellnek számít eddig. Ez jelentős emelkedés a Moonshot korábbi modelljeihez képest — például a Kimi K2.6 árbeállítása $0.95/$4 volt. A Kimi K3 paraméterszáma (2,8 trillió) több mint kétszerese a korábbi 1T körüli modelleknek.

Gyakorlati kipróbálás: a "pelikan a biciklin" teszt

A bejelentés kapcsán a szerző kipróbálta a modellt egy gyakran használt, szórakoztató összehasonlító eljárással: egy „Generate an SVG of a pelican riding a bicycle” prompttal. OpenRouteron keresztül, a llm-openrouter pluginnal futtatva a kérést, az elkészült SVG előállítása 95 input tokent és 16,658 output tokent igényelt (ebből 13,241 a reasoning token), ami összesen körülbelül $0.25 költséget jelentett.

Mivel K3 képes képi inputot fogadni, a generált SVG-re visszaküldve a modell alt-szöveget is előállított, amelyért körülbelül $0.006-t számított fel. Az alt-szöveg részletesen leírta a rajzolt jelenetet: egy piros sálas fehér pelikánt, amint piros biciklin teker egy szürke úton, kék égbolttal, napfénnyel és zöld füvű előtérrel.

A szerző megjegyzi, hogy a pelikanos prompt eredetileg viccnek indult, és bár 21 hónapig viszonylag jól korrelált a modellek általános képességeivel, ez a kapcsolat mára gyengült. Emellett a pelican-teszt nem fedi le a jelenleg legfontosabb képességet: az ügynöki (agentic) eszközhasználatot és a hosszú beszélgetések során megbízható eszközműveleteket.

Megfigyelések a Kimi K3 használata alapján

A pelican-példán keresztül a szerző több jellemzőt kiemel:

  • A K3-nak jelenleg csak egy reasoning effort szintje van, "max", és ez látszik: a modell nagyon sok reasoning tokent fogyasztott, ami költséges használathoz vezetett a próbánál.
  • A prompt tokenek számlálása érdekes eltéréseket mutat: a szerző mérései szerint a Kimi K3-nál egy rövid „hi” prompt is 86 tokent számolt, ami arra utalhat, hogy van egy rejtett, körülbelül 85 token hosszú rendszerüzenet, amelyet a modell nem volt hajlandó felfedni.
  • A látásalapú (vision) képességek jól működnek: az automatikus alt-szöveg jó minőségű volt.

A szerző továbbá hangsúlyozza, hogy a pelican-teszt elsősorban arra jó, hogy ténylegesen kipróbálja a modellt, becslést adjon a költségekről és arról, hogyan kezeli az SVG-t és a térbeli leírást. A Kimi K3 pelican-kimenete jelentős javulás a korábbi Kimi 2.5-höz képest.

Összegzés

Moonshot AI Kimi K3 modellje 2,8 trillió paraméterével és a tervezett 2026. július 27-i nyílt súlykiadással a nyílt modellek közelgő, nagy kapacitású újdonsága lehet. A független és gyári mérések szerint a K3 erős teljesítményt nyújt több nagy nyelvi modellhez viszonyítva, ugyanakkor nem minden területen veri a legjobb zárt modelleket. Az árazás miatt a K3 jelenleg a kínai laboroktól származó legdrágább kiadásnak számít, és a reasoning-token-használat, valamint az effort-szintek kialakítása továbbra is befolyásolják a használati költségeket és gyakorlati értéket.