A Thinking Machines Lab bemutatta a TML-Interaction-Small nevű multimodális modellt, amely célja, hogy valós idejű, párhuzamos beszélgetési interakciókat biztosítson: egyszerre hallgatja, nézi és válaszol a felhasználóra, ahelyett hogy hagyná a hagyományos, váltott „beszédfordulókat”. A cég szerint a modellt a nagyközönség számára később ebben az évben teszik elérhetővé, először zárt kutatói előzetesben.
Mire képes és hogyan épül fel
- Bemenet/kimenet: a rendszer egyszerre fogad hang-, kép- és szöveges bemenetet, és párhuzamosan ad vissza hang- és szövegkimenetet.
- Architektúra: a modell egy mixture-of-experts (MoE) transzformer, összesen 276 milliárd paraméterrel, melyből 12 milliárd aktív egy token feldolgozásakor. Emellett rendelkezik egy külön háttér‑reasoning (érvelő) modellel, amelynek pontos architektúráját a cég nem fedte fel.
- Két komponens: a TML-Interaction-Small egy gyors, interakcióra optimalizált modellből és egy aszinkron háttérmodelből áll. Az interakciós modell „mikro‑fordulókat” alkalmaz: 200 milliszekundumos töredékek (micro-turns) feldolgozását és kimenet generálását váltogatja, így párhuzamosan kezeli a hangot, a videót és a szöveget, és megszünteti azt a határvonalat, amely a bemenet végét és a kimenet generálását jellemzi.
Bemenetek és belső reprezentációk
Az interakciós modell a következőket használja:
- diszkretizált hangtokenek,
- 40×40 pixeles képfoltok beágyazásai, amelyeket hierarchikus multilayer perceptron állít elő,
- szövegbeágyazások.
A kimeneteket egy flow‑matching dekóder generálja hangként és szövegként. A Thinking Machines Lab ezt az eljárást „encoder‑free early fusion” névvel illeti, mivel nem használ nagy, előre betanított enkódereket (például OpenAI Whisperhez vagy kép‑transformerekhez hasonlóakat), hanem a transzformert, a perceptront és a dekódert együtt, a nulláról tanította meg.
A háttérmodelt érdemi érvelésre, webes böngészésre és eszközhívásokra használják; ez aszinkron módon fut, ugyanazt a kontextust osztja meg az interakciós modellel, és amikor szükséges, az eredményeit beépíti a beszélgetésbe anélkül, hogy folyamatosan megszakítaná a felhasználóval zajló interakciót.
Teljesítmény a benchmarkokon
A Thinking Machines Lab saját mérései szerint a TML-Interaction-Small vezet más, hangközpontú modellek között az interaktivitást mérő benchmarkokon, ugyanakkor elmarad a GPT‑Realtime‑2 legerősebb érvelési módjától az intelligenciát vizsgáló teszteken.
Konkrét eredmények:
- FD‑bench V1 (hanglatencia beszélgetési fordulókban): TML‑Interaction‑Small 0,40 másodperces válaszidőt ért el, szemben a Gemini‑3.1‑flash‑live‑preview minimális érvelésre állítva mért 0,57 mp‑jével és a GPT‑Realtime‑2 minimális érvelésre állítva mért 1,18 mp‑jével.
- FD‑bench V1.5 (megszakítások, közbevetések és előtér/háttér‑beszéd kezelése): TML‑Interaction‑Small átlagos minősége 77,8 lett, jóval magasabb, mint a GPT‑Realtime‑2 xhigh érvelésen mért 47,8 és a Gemini‑3.1‑flash‑live‑preview high érvelésen mért 45,5.
- Audio MultiChallenge (többfordulós audio párbeszéd, érvelés és utasítások követése): TML‑Interaction‑Small 43,4 százalékos APR‑t (average pass rate) ért el; ez elmarad a GPT‑Realtime‑2 xhigh érvelésének 48,5%-ától, de megelőzi a Gemini‑3.1‑flash‑live‑preview high érvelésének 36,1%-át.
- BigBench Audio (audio érvelés): TML‑Interaction‑Small 96,5%-os pontosságot ért el a háttérmodell aktiválásával; ez csak alig marad el a GPT‑Realtime‑2 high érvelésétől és a Gemini‑3.1‑flash‑live‑preview high érvelésétől, amelyek 96,6%-on álltak.
Elérhetőség és nyitott kérdések
A Thinking Machines Lab zárt kutatói előzetest tervez néhány hónapon belül, a szélesebb körű kiadást pedig későbbre, 2026 folyamán jelölte meg. A cég nem közölte a képzési adatokat és módszereket, a tudásvágást (knowledge cutoff), a kontextusablak méretét, az árképzést, illetve a háttérmodel pontos architektúráját.
Kontextus és versenytársak
A TML‑Interaction‑Small nagyjából 15 hónappal Mira Murati által a Thinking Machines Lab megalapítása után jelenik meg, és várhatóan a vállalat első publikus modellje lesz. Októberben a startup már kiadott egy finomhangolási API‑t, amelynek neve Tinker.
Idén több más cég is bemutatott valós idejű, halló‑beszélő‑látó modelleket, amelyek kezelik a megszakításokat: OpenBMB februárban nyílt forráskódúvá tette a 9 milliárd paraméteres MiniCPM‑o 4.5‑öt; márciusban Google indította el a Gemini 3.1 Flash Live‑ot és az Alibaba a Qwen3.5 Omni‑t; májusban pedig az OpenAI bemutatta a GPT‑Realtime‑2‑t.
A TML‑Interaction‑Small a nyilvánosan közölt méretek között az egyik legnagyobb, amelyet kifejezetten interaktivitásra tanítottak (276 milliárd paraméter a nyilvánosan ismert 9 milliárdhoz képest, ami a MiniCPM‑o 4.5 kapacitása).
Miért fontos ez
A multimodális, valós idejű reagálás lehetővé teszi olyan alkalmazásokat, amelyeket a forduló alapú rendszerek nehezen szolgálnak ki — például valós idejű edzői visszajelzés sportolóknak vagy műtéti megfigyelés. A TML‑Interaction‑Small különösen érdekes azért is, mert az interakciós és háttérmodel közös tanítása és a mikro‑fordulós feldolgozás más megközelítést képvisel a real‑time rendszerek sorában.
Megjegyzés a megközelítésekről
A Thinking Machines Lab megoldása eltér olyan orchestrációs stratégiáktól, mint amilyet a Vocal Bridge alkalmaz: míg Vocal Bridge egy valós idejű hangmodellt párosít különálló érvelő modellekkel API‑hívásokon keresztül, a TML‑Interaction‑Small esetében a foreground és background komponensek közösen tanult viselkedést mutatnak. Az orchestration előnye a rugalmasság, de hátránya a hívási API‑k által determinált késleltetés és a rendszer alapvető forduló‑alapúsága.



