Modellbevezetés

Thinking Machines bemutatta az Inklinget: 1 billió paraméteres multimodális model 1 millió tokenes kontextussal

A Thinking Machines bemutatta az Inkling nevű nagy multimodális nyelvi modellt, amely a Hugging Face-en érhető el.

Thinking Machines bemutatta az Inklinget: 1 billió paraméteres multimodális model 1 millió tokenes kontextussal

Thinking Machines kiadta az Inkling nevű nyílt multimodális modellt, amelyet a csapat a Hugging Face-re töltött fel. Az Inkling nagy (közel 1 billió paraméteres) modell, amely nativ módon fogad szöveget, képeket és hangot, és támogatja az akár 1 000 000 token hosszú kontextust. A modell fő célja a multimodális érvelés és a domain‑specifikus finomhangolás lehetővé tétele.

Főbb műszaki jellemzők

  • Méret és kontextus: a projekt leírása szerint az Inkling ~1T paraméter körül tartozik; a modell belső felépítése decoder-only Mixture‑of‑Experts (MoE) architektúra, amelyről a dokumentáció 975 milliárd összparamétert és körülbelül 41 milliárd aktív paramétert említ (azaz szparse MoE‑ként csak egy részhalmaz aktív egy adott előrejelzésnél). A kontextusablak maximuma 1 000 000 token.
  • Tréningadatok: a modell képzésében 45 billió tokennyi szöveg, kép, hang és videó szerepelt.
  • Számítási és kvantálási opciók: a kiadás tartalmaz teljes BF16 checkpointot és egy jól kalibrált NVFP4 kvantált változatot. A bf16 checkpoint körülbelül 2 TB VRAM‑ot igényel, míg az NVFP4 változat hozzávetőleg 600 GB VRAM‑ot igényel.
  • Nativ beviteli modalitások: szöveg, kép és audio (a videó feldolgozásához az image inputoknál plusz temporális dimenzió is elérhető).

Architektúra részletek

  • Decoder‑only: a modell kauzális autoregresszív generálást használ.
  • Multimodális tálak: az image patchifier egyszerű hierarchikus MLP, amely rétegenként egyre több pixelt egyesít, végül egy patch‑enkénti embeddinget ad. Az audio bemeneteket diszkretizált mel‑spektrumra konvertálják (100 ms‑os szeletek), majd mel‑bin osztályba sorolják és azok beágyazását használják.
  • Relatív figyelem: Inkling nem RoPE‑t használ, hanem relatív attention mechanizmust, ahol az attention réteg egy negyedik vetítést (R) is tanul, amelyet távolsági információkkal módosítanak.
  • Hibrid attention: a dekóder rétegek felváltva használnak globe‑t (teljes kontextusra néző) és sliding‑window attentiont egy 5:1 arányban (öt sliding, egy global), a legfelső réteg globális attentiont alkalmaz.
  • Short convolution (SConv): rövid 1D konvolúció a lokális információk kezelésére; a SConv a jelen token és az előző W−1 hidden state-et olvassa, így tehermentesíti a attention és MoE modulokat a lokális reprezentációktól.
  • MoE részletek: 256 ekszpertet tartalmaz a modell, a router top‑k kiválasztást végez 6 ekspertre, plusz 2 mindig aktív shared experttel.
  • Multi Token Prediction (MTP): opcionális, post‑training rétegek, amelyek egyszerre több token előrejelzésére szolgálnak; ez spekulatív dekódoláshoz (drafters) használható, gyorsabb generálást biztosítva kis VRAM többletköltséggel.

Integrációk és inference‑támogatás

  • Day‑0 támogatás: a modellhez a kiadás napján elérhető a Transformers integráció (például any‑to‑any pipeline), valamint támogatás van SGLang, vLLM, SGLang és llama.cpp környezetekben.
  • Transformers: a „thinkingmachines/Inkling” (BF16) és a kvantált „thinkingmachines/Inkling‑NVFP4” modellek használhatók; a kiadás napján a Transformers 5.14.0 verzió is megjelent.
  • SGLang: sglang.launch_server parancs példát adnak a modell 8 GPU‑ra történő shardingjára és OpenAI‑kompatibilis API szolgáltatására.
  • vLLM: vllm serve parancs letölti a tömegeket, tensor‑paralelizálja és OpenAI‑kompatibilis szervert indít.
  • Remote inference: Hugging Face Inference Providers és a router‑alapú OpenAI kliens támogatott; a kiadás keretében a Thinking Machines két óra ingyenes inferencia‑költséget is biztosít a release időablakra. Megjegyzés: az audio támogatás az Inference Providersnél még munkában van.
  • Lokális kvantálások: llama.cpp és Unsloth GGUF kvantokkal is futtatható; Unsloth‑hoz készült 1‑bit kvantálás csökkenti a VRAM igényt drasztikusan (például 95% megtakarítást említenek) és az 1‑bit GGUF változatok visszatartják a top‑1% pontosság ~74.2%‑át miközben 86%‑kal kisebbek.

Példák és felhasználási esetek

  • Multimodális kérdés‑válasz és transzkripció: a kiadott példák bemutatják, hogyan lehet képeket és hangot promptként átadni a pipeline‑nak, valamint a reasoning_effort (none … max) paraméterrel vezérelni az érvelési költséget.
  • Agentic és post‑training: Thinking Machines tinker nevű menedzselt eszközzel támogatja a post‑traininget (finomhangolás, distilláció, RL). Az OpenEnv és a Tinker példáként szolgálnak agentic RL‑beállításokra, ahol az ECHO algoritmust említik (környezeti tokenek predikciója policy‑tanulás mellett).
  • Pi agent: demó egy egyszerű kódoló agent munkafolyamathoz, amely különböző végpontokkal (llama.cpp vagy Inference Providers) működik.
  • Lokális és klaszteres telepítés: SLURM szkriptek és útmutatók elérhetők a klaszteres elosztáshoz; a fontos paraméterek a tensor‑parallel‑méret és a max‑model‑len beállítása.

Értékelés és vibe‑evek

A csapat több multimodális és audio „vibe” értékelést készített: szakértői vizsgakérdések, egyetemi felvételi és különböző audio benchmarkok (például BigBenchAudio és GlobeAudio). Néhány szemléltető eredmény a kiadott anyagból:

  • Vizsgafeladatok tokenfelhasználás példák: egyes feladatoknál a befejező tokenek száma különböző reasoning_effort beállításoknál 1 117–6 000 tokenig terjedt, a modell a legtöbb feladaton jól szerepelt (idézett példák: Open‑ended Drug Interactions, Physics Question, Bar Exam stb.).
  • Audio benchmarkok (GlobeAudio, BigBenchAudio): a megadott példákban a modell általánosságban jól teljesített, egyes formális fallacy példákon alacsony erőfeszítésnél voltak hibák, míg közepes‑magas erőfeszítésnél sikeresek voltak. Completion token‑számok például orosz kérdésnél 130–179 token között, kínai példánál 111–289 token között mozogtak.

Szabványos benchmarkok

A kiadás mellé egy átfogó benchmark‑tábla is tartozik, amelyet a dokumentáció közöl számos más modellel (GLM‑5.2, Qwen3.7‑Max, Claude Opus 4.8, GPT‑5.5, Gemini 3.1 Pro stb.) összehasonlítva. Több feladaton Inkling kiemelkedő vagy versenyképes eredményeket mutatott, például AIME 2026‑on 99.2‑es eredményt közöltek. A részletes táblázat a kiadott anyagban elérhető.

Összegzés

Az Inkling a Thinking Machines ambiciózus kísérlete a nagy, nyílt multimodális modellek piacán: közel 1 billió paraméteres MoE architektúra, 1 millió tokenes kontextusablakkal és natív kép/hang/szöveg befogadással. A modell nap‑egy támogatást kapott a Transformers‑ben és több inferencia motorral kompatibilis, ugyanakkor a teljes pontosságú checkpointok futtatása jelentős VRAM‑igénnyel jár, ezért a kvantált és 1‑bit megoldások helyi vagy költséghatékonyabb futtatást tesznek lehetővé. Thinking Machines javasolja a modellt finomhangolásra és post‑trainingre, valamint agentic és dokumentum‑/audio‑feldolgozó alkalmazások építésére.