Modellbevezetés

Thinking Machines bemutatja az Inkling Smallt: közel az előd teljesítményéhez negyednyi méretben

A Thinking Machines bemutatta az Inkling Small nevű nyílt forráskódú multimodális AI modellt, amelyet Mira Murati vezetése alatt fejlesztettek.

Thinking Machines bemutatja az Inkling Smallt: közel az előd teljesítményéhez negyednyi méretben

Közvetlenül azután, hogy Thinking Machines két héttel korábban nyilvánosságra hozta első nyílt forráskódú nyelvi modelljét, Inklinget, a cég most bejelentette Inkling‑Smallt. A modell multimodális képességekkel rendelkezik (szöveg, kép, hang bemeneteket fogad, szöveget ad vissza), és az Apache 2.0 permisszív licenc alatt érhető el.

Műszaki jellemzők és licenc

  • Teljes paraméterszám: 276 milliárd.
  • Aktív paraméterek tokenenként: 12 milliárd (összehasonlítva az Inkling 41 milliárdjával).
  • Kontextusablak: akár 1 millió token.
  • Licenc: Apache 2.0.

A modell sparse Mixture‑of‑Experts (MoE) architektúrát használ: a 42 rétegű dekóder minden tokent hat, a 256 specializált szakértő közül irányít, illetve két megosztott szakértő aktív minden tokennél. Ez magyarázza, hogy a teljes tanult kapacitás nagy ugyan, de tokenenként csak a paraméterek kis hányadát aktiválja.

Teljesítmény: közel az eredetihez, bizonyos területeken jobb

Az Artificial Analysis Intelligence Indexen Inkling‑Small 40 pontot ért el, míg az Inkling 41‑et. Ez különösen figyelemre méltó, mert az Inkling 975 milliárd teljes paraméterrel és 41 milliárd aktív paraméterrel rendelkezik.

Néhány konkrét benchmarkon Inkling‑Small felülmúlja a nagyobb modellt:

  • SWE‑bench Verified: 80.2% (Inkling: 77.6%).
  • Terminal Bench 2.1: 64.7% (Inkling: 63.8%).
  • Előnyösebb eredmények jelentek meg továbbá a SciCode, Humanity’s Last Exam, GPQA Diamond és CritPt teszteken.

Ugyanakkor nem minden területen jobb: az Inkling előnyben marad faktuális tudásban és bizonyos ügynöki (agentic) feladatokban. Például τ³‑Banking: Inkling‑Small 15.5% vs Inkling 23.7%, továbbá az Inkling‑Small AA Omniscience pontszáma negatív, ami gyengébb faktuális lefedettséget jelez, bár a jelentett hallucinációs arány kissé alacsonyabb.

Ez a kompromisszum fontos vállalati felhasználásoknál: kódolási asszisztensek, eszközhasználati rendszerek, retrieval‑augmented generation, dokumentumelemzés és multimodális munkafolyamatok esetén vonzó lehet, míg magas tétű faktuális feladatoknál kiegészítő lekérések, ellenőrzés és emberi felülvizsgálat szükséges.

Működés és skálázás: hogyan aktiválódik 12 milliárd paraméter

Az MoE architektúra miatt a modell megtartja a 276 milliárd paraméter teljes tárházát, de minden token feldolgozásakor csak a szakértők kis részét hívja meg, így jön ki a 12 milliárd aktív paraméter szerinti hatékonyság. A dekóder közös reprezentációban dolgozza fel a szöveget, képet és hangot, tehát a multimodalitás natív módon integrált.

A Thinking Machines emellett támogatja a változtatható „reasoning effort” üzemmódot, amellyel a fejlesztők a tesztidő alatti számítási erőforrást a feladat nehézsége szerint növelhetik vagy csökkenthetik, ezzel egyensúlyozva minőséget, késleltetést és költséget.

Telepítés és erőforrásigény: „Small” relatív fogalom

Bár a modell neve „Small”, nem fut hétköznapi laptopon vagy fejlesztői munkaállomáson. A standard BF16 checkpoint esetén a Thinking Machines legalább 600 GB összesített GPU‑memóriát ad meg követelményként; támogatott konfigurációk példaként: 4× NVIDIA B300 vagy 8× NVIDIA H200.

A kvantált NVFP4 checkpoint körülbelül 180 GB VRAM‑ot igényel; ez W4A4 módban egy NVIDIA B300‑on vagy W4A16 módban két H200 GPU‑n is futtatható. Ezért a gyakorlati célpontok vállalati GPU szerverek, felhői klaszterek és specializált inference szolgáltatók.

A memóriaigény azonban jelentősen kisebb, mint az Inklingé, ami csökkentheti a hosztingköltségeket és kibővítheti azokat a szervezeteket, amelyek képesek önállóan hosztolni a modellt.

Elérhetőség, fine‑tuning és árszabás

Thinking Machines közzétette a teljes model weights‑et a Hugging Face-en és támogatja a finomhangolást a Tinker model training API‑n keresztül. A vállalat bevezetéskor korlátozott ideig 50% kedvezményt hirdet:

  • 64K kontextusú standard Inkling‑Small API árak: $0.58 /M előtöltött (prefill) token, $1.44 /M generált (sampled) token, $1.73 /M train token. A cache‑elt prefill kérések ára $0.116 /M token.
  • 256K kontextusú változat magasabb díjszabással érhető el.

A cég támogat több deployment útvonalat is: SGLang, vLLM, TokenSpeed, Unsloth és Hugging Face eszközök.

Fejlesztési pipeline és ismételhetőség

Thinking Machines gyorsan alakította át az Inkling‑megjelenést ismételhető fejlesztési folyamattá. Horace He, a cég kutatója X‑en úgy fogalmazott, hogy míg Inkling kiadása „egy falura volt szükség”, az Inkling‑Small kiadása sokkal rutinabb volt: a meglévő pipeline‑t kisebb modellel futtatták le, és további kisebb javulások is hatottak a végeredményre.

A cég szerint Inkling‑Small előnyei részben javított pre‑training adatmixeletnek, módosított tanulási receptnek és on‑policy distillationnek köszönhetők, ahol az Inkling szolgált tanárként; ezt követte két hét ügynöki kódolási megerősítéses tanulás.

Mit jelent ez az üzleti gyakorlat számára?

Inkling‑Small kompromisszumot kínál: közel azonos összintelligencia mérőszám, jobb eredmények bizonyos kódolási és következtetési területeken, csökkentett token‑árak, kisebb hardverlábnyom és vállalati szinten nagyobb jogi mozgástér az Apache 2.0 licenc miatt. Nem alkalmas fogyasztói lokális futtatásra, de vállalati infrastruktúrán és felhői környezetben vonzó önhosztolási alternatívát jelenthet azoknak a szervezeteknek, amelyek kontrollt akarnak az adatok és a modell viselkedése fölött.

A szélesebb iparági jelzés az, hogy Thinking Machines nem egy egyszeri kiadást tervezett: a cég már tömöríti modelcsaládját, finomítja a képzési folyamatot, és felé halad egy olyan ütemezés felé, amely lehetővé teszi, hogy nyílt súlyú multimodális rendszerek rendszeresen, ismételhető módon jöjjenek létre és kerüljenek terjesztésre.