Modellbevezetés

Thinking Machines Lab bemutatja a valós idejű, párhuzamos multimodális interakcióra alkalmas TML-Interaction-Small modellt

A főszereplő a Thinking Machines Lab startup és annak TML-Interaction-Small nevű multimodális rendszere, amely egyszerre dolgoz fel hangot, videót és szöveget, majd párhuzamosan ad visszajelzést.

Thinking Machines Lab bemutatja a valós idejű, párhuzamos multimodális interakcióra alkalmas TML-Interaction-Small modellt

A Thinking Machines Lab bemutatta a TML-Interaction-Small nevű multimodális modellt, amely célja, hogy valós idejű, párhuzamos beszélgetési interakciókat biztosítson: egyszerre hallgatja, nézi és válaszol a felhasználóra, ahelyett hogy hagyná a hagyományos, váltott „beszédfordulókat”. A cég szerint a modellt a nagyközönség számára később ebben az évben teszik elérhetővé, először zárt kutatói előzetesben.

Mire képes és hogyan épül fel

  • Bemenet/kimenet: a rendszer egyszerre fogad hang-, kép- és szöveges bemenetet, és párhuzamosan ad vissza hang- és szövegkimenetet.
  • Architektúra: a modell egy mixture-of-experts (MoE) transzformer, összesen 276 milliárd paraméterrel, melyből 12 milliárd aktív egy token feldolgozásakor. Emellett rendelkezik egy külön háttér‑reasoning (érvelő) modellel, amelynek pontos architektúráját a cég nem fedte fel.
  • Két komponens: a TML-Interaction-Small egy gyors, interakcióra optimalizált modellből és egy aszinkron háttérmodelből áll. Az interakciós modell „mikro‑fordulókat” alkalmaz: 200 milliszekundumos töredékek (micro-turns) feldolgozását és kimenet generálását váltogatja, így párhuzamosan kezeli a hangot, a videót és a szöveget, és megszünteti azt a határvonalat, amely a bemenet végét és a kimenet generálását jellemzi.

Bemenetek és belső reprezentációk

Az interakciós modell a következőket használja:

  • diszkretizált hangtokenek,
  • 40×40 pixeles képfoltok beágyazásai, amelyeket hierarchikus multilayer perceptron állít elő,
  • szövegbeágyazások.

A kimeneteket egy flow‑matching dekóder generálja hangként és szövegként. A Thinking Machines Lab ezt az eljárást „encoder‑free early fusion” névvel illeti, mivel nem használ nagy, előre betanított enkódereket (például OpenAI Whisperhez vagy kép‑transformerekhez hasonlóakat), hanem a transzformert, a perceptront és a dekódert együtt, a nulláról tanította meg.

A háttérmodelt érdemi érvelésre, webes böngészésre és eszközhívásokra használják; ez aszinkron módon fut, ugyanazt a kontextust osztja meg az interakciós modellel, és amikor szükséges, az eredményeit beépíti a beszélgetésbe anélkül, hogy folyamatosan megszakítaná a felhasználóval zajló interakciót.

Teljesítmény a benchmarkokon

A Thinking Machines Lab saját mérései szerint a TML-Interaction-Small vezet más, hangközpontú modellek között az interaktivitást mérő benchmarkokon, ugyanakkor elmarad a GPT‑Realtime‑2 legerősebb érvelési módjától az intelligenciát vizsgáló teszteken.

Konkrét eredmények:

  • FD‑bench V1 (hanglatencia beszélgetési fordulókban): TML‑Interaction‑Small 0,40 másodperces válaszidőt ért el, szemben a Gemini‑3.1‑flash‑live‑preview minimális érvelésre állítva mért 0,57 mp‑jével és a GPT‑Realtime‑2 minimális érvelésre állítva mért 1,18 mp‑jével.
  • FD‑bench V1.5 (megszakítások, közbevetések és előtér/háttér‑beszéd kezelése): TML‑Interaction‑Small átlagos minősége 77,8 lett, jóval magasabb, mint a GPT‑Realtime‑2 xhigh érvelésen mért 47,8 és a Gemini‑3.1‑flash‑live‑preview high érvelésen mért 45,5.
  • Audio MultiChallenge (többfordulós audio párbeszéd, érvelés és utasítások követése): TML‑Interaction‑Small 43,4 százalékos APR‑t (average pass rate) ért el; ez elmarad a GPT‑Realtime‑2 xhigh érvelésének 48,5%-ától, de megelőzi a Gemini‑3.1‑flash‑live‑preview high érvelésének 36,1%-át.
  • BigBench Audio (audio érvelés): TML‑Interaction‑Small 96,5%-os pontosságot ért el a háttérmodell aktiválásával; ez csak alig marad el a GPT‑Realtime‑2 high érvelésétől és a Gemini‑3.1‑flash‑live‑preview high érvelésétől, amelyek 96,6%-on álltak.

Elérhetőség és nyitott kérdések

A Thinking Machines Lab zárt kutatói előzetest tervez néhány hónapon belül, a szélesebb körű kiadást pedig későbbre, 2026 folyamán jelölte meg. A cég nem közölte a képzési adatokat és módszereket, a tudásvágást (knowledge cutoff), a kontextusablak méretét, az árképzést, illetve a háttérmodel pontos architektúráját.

Kontextus és versenytársak

A TML‑Interaction‑Small nagyjából 15 hónappal Mira Murati által a Thinking Machines Lab megalapítása után jelenik meg, és várhatóan a vállalat első publikus modellje lesz. Októberben a startup már kiadott egy finomhangolási API‑t, amelynek neve Tinker.

Idén több más cég is bemutatott valós idejű, halló‑beszélő‑látó modelleket, amelyek kezelik a megszakításokat: OpenBMB februárban nyílt forráskódúvá tette a 9 milliárd paraméteres MiniCPM‑o 4.5‑öt; márciusban Google indította el a Gemini 3.1 Flash Live‑ot és az Alibaba a Qwen3.5 Omni‑t; májusban pedig az OpenAI bemutatta a GPT‑Realtime‑2‑t.

A TML‑Interaction‑Small a nyilvánosan közölt méretek között az egyik legnagyobb, amelyet kifejezetten interaktivitásra tanítottak (276 milliárd paraméter a nyilvánosan ismert 9 milliárdhoz képest, ami a MiniCPM‑o 4.5 kapacitása).

Miért fontos ez

A multimodális, valós idejű reagálás lehetővé teszi olyan alkalmazásokat, amelyeket a forduló alapú rendszerek nehezen szolgálnak ki — például valós idejű edzői visszajelzés sportolóknak vagy műtéti megfigyelés. A TML‑Interaction‑Small különösen érdekes azért is, mert az interakciós és háttérmodel közös tanítása és a mikro‑fordulós feldolgozás más megközelítést képvisel a real‑time rendszerek sorában.

Megjegyzés a megközelítésekről

A Thinking Machines Lab megoldása eltér olyan orchestrációs stratégiáktól, mint amilyet a Vocal Bridge alkalmaz: míg Vocal Bridge egy valós idejű hangmodellt párosít különálló érvelő modellekkel API‑hívásokon keresztül, a TML‑Interaction‑Small esetében a foreground és background komponensek közösen tanult viselkedést mutatnak. Az orchestration előnye a rugalmasság, de hátránya a hívási API‑k által determinált késleltetés és a rendszer alapvető forduló‑alapúsága.