Kutatók bemutatták a Brain2Qwerty v2-t, a korábbi rendszerük továbbfejlesztett változatát, amely agyhullámokból igyekszik szöveget generálni. A projektben részt vettek kutatók a Meta-tól, a French National Centre for Scientific Research-től (CNRS), a Hospital Foundation Adolphe de Rothschild-tól, a Basque Center on Cognition, Brain and Language-től, a Paris Cité University-től és az Inria-tól (French Institute for Research in Computer Science and Automation).
Módszer röviden
A Brain2Qwerty v2 három fő lépésben dolgozza fel a MEG (magnetoencephalography) méréseket:
- Egy enkóder feldarabolja az agyi aktivitást karakterekre: ezt egy konvolúciós neurális hálózat (CNN) és egy CNN/transformer hibrid, a conformer végzi, amely karakter-embeddingeket állít elő és karakterosztályozást végez.
- Egy úgynevezett "aligner" átalakítja a karakter-embeddingeket szó-szintű embeddingekké: a karakterekből előre jelzett szóhatárok alapján csoportosítva átlagolja az embeddingeket, és arra tanul, hogy a helyes szó embeddingjét közelebb hozza a Qwen3 nyelvi modell embeddingjéhez, míg a többi szóét eltávolítsa.
- Egy finomhangolt nagy nyelvi modell (Qwen3-4B) javítja a karakterekből képzett szöveget: a szerzők minden alanyra külön LoRA adapterrel finomhangolták a Qwen3-4B modellt, majd ezek adaptereit átlagolták.
A rendszert kilenc alany MEG-felvételeiből tanították, akik angol mondatokat gépeltek. Az adathalmaz összesen körülbelül 90 óra felvételt és mintegy 22 ezer példát tartalmazott. A MEG nem-invazív módszer, mágneses agyi aktivitást rögzít.
Eredmények és mérőszámok
- A Brain2Qwerty v2 39 százalékos word error rate-t (WER) ért el a publikus jelentés szerint, míg a korábbi verzió (v1) 43 százalékos WER-rel szerepelt.
- Az enkóder karakterhibaaránya (character error rate, CER) javult az adatmennyiség növelésével: nagyjából 20 óra tanulóadatnál a CER ~50% volt, míg 90 óra esetén körülbelül 25%-ra csökkent. A szerzők nem láttak teljesítmény-platót a rendelkezésre álló adatmennyiség kimerülése előtt.
- Alanyonkénti összehasonlításban a szerzők módszere jobbnak bizonyult, mint az egyéni alanyokra külön-külön történő tanítás: a kilenc alany mediánjára vetítve az egyéni képzés 66,5%-os WER-t eredményezett, míg a többalanyos, kombinált tanítás 47,8%-os WER-t.
Előzmények és nyílt forrás
Az eredeti Brain2Qwerty-vizsgálat összehasonlította a MEG és az EEG (elektroencefalográfia) jelzéseket, és azt találta, hogy a MEG pontosabb szövegjóslást tett lehetővé. A v2 verzió kizárólag MEG-adatokra épít, módosította a neurális architektúrát és több tanítóadatot használt. A kutatók mindkét verzió képzési kódját nyíltan közzétették, és a v1 adatait is elérhetővé tették.
Miért fontos
A kutatás azt mutatja, hogy több adatra és több alany közös tanítására építve a MEG-alapú agyhullám-szövegfelismerés teljesítménye javulhat — hasonló tanulási görbéhez, mint amit a nagy nyelvi modelleknél láttunk, amikor több adat állt rendelkezésre. Ez különösen releváns lehet azok számára, akik kommunikációs segédeszközökre szorulnak.
Bár invazív beavatkozásokkal (például agyba ültetett elektródákkal) elérték a kommunikációban az egyjegyű százalékos hibaarányokat, a jelenlegi MEG-alapú módszerek hibaszintje még jóval magasabb. Minden egy százalék javulás azonban előrelépést jelent afelé, hogy egyes pácienseknek elkerülhetővé váljon a műtét.
Összefoglalás
A Brain2Qwerty v2 mérhető előrelépést kínál a nem-invazív, MEG-alapú agyi szövegfelismerésben: kisebb hibaarány, skálázhatóság több alanyra és egyértelmű javulás az adatmennyiség növelésével. Ugyanakkor a rendszer még messze van az invazív módszerek pontosságától, és további adatra és fejlesztésre lesz szükség, hogy klinikai vagy mindennapi segédeszközzé váljon.



