Microsoft AI csütörtökön bemutatta a MAI-Transcribe-2 nevű beszédfelismerő modellt, amelyről a cég azt állítja, hogy gyorsabb, pontosabb és olcsóbb, mint a jelenleg elérhető hasonló szolgáltatások az OpenAI-tól, a Google-tól vagy az ElevenLabs-től. A bevezetési ár mindössze 0,10 dollár (10 cent) per órányi hanganyag feldolgozásáért.
Ár és költséghatás
Az ár jelentős csökkenést tükröz a sorozat korábbi modelleihez képest: amikor a Microsoft ötf hónappal ezelőtt kiadta az első modellt ebben a sorozatban, az óránként 0,36 dollárba került. Az új, 0,10 dolláros induló ár nagyjából 72%-os csökkentést jelent. Például egy évi 100 000 órás call‑center hanganyag feldolgozása esetén a költség 36 000 dollárról mintegy 10 000 dollárra csökken — olyan volumen, amely már egy nagy bank vagy távközlési cég számára is reális.
Mit tud a MAI-Transcribe-2, és miért számít ez a vállalatoknak
A modell most 60 nyelvet támogat, szemben a júniusi MAI-Transcribe-1.5 43 nyelvével és az áprilisi eredeti kiadás 25 nyelvével. A modellt a Microsoft Foundry piactéren és a MAI Playground tesztkörnyezetben érhetik el a fejlesztők. A cég hangsúlyozza, hogy kifejezetten valós üzleti felvételek zajos, alacsony minőségű és átfedő beszédet tartalmazó körülményeire tervezték, nem stúdióminőségű felvételekre.
A nyelvi lefedettségnél talán fontosabb, hogy mely funkciókat tartalmazza az alaptermék:
- Beszélő‑diarizáció (speaker diarization): megkülönbözteti, ki mikor beszél több résztvevős felvételeken.
- Szó‑szintű időbélyegek: minden szóhoz pontos időjelölés kapcsolódik a kereséshez és videóhoz igazításhoz.
- Kulcsszó‑biasolás: a fejlesztők betáplálhatnak szakterminológiát (például gyógyszerneveket, termékkódokat, munkavállalói neveket), hogy a modell ne rontsa el a speciális kifejezéseket.
- Automatikus nyelvfelismerés: nem kell előre megadni a nyelvet.
Két további, kiemelt funkció:
- Konfigurálható kimeneti stílus: „verbatim” mód, amely megőrzi a töltelékszavakat, töredezett mondatokat a megfelelőségi és jogi célokra, illetve „clean” mód, amely eltávolítja a kitöltő elemeket olvasható felirathoz és jegyzetekhez.
- Code switching kezelése: a modell kezeli azt, ha a beszélgetés nyelvet vált mondaton belül (például Hinglish vagy Spanglish), ami fontos piacok — India és az Egyesült Államok spanyolajkú közössége — ügyfélszolgálati hívásai számára.
Ezeket a funkciókat a szakértői beszédszolgáltatók korábban külön prémiumként kínálták; a Microsoft most alapból adja a bevezetési árért.
Teljesítmény- és benchmark‑igénylések — mit mérnek és mit nem
A Microsoft három teljesítményigénylést tett. Mindenik más mérőeszközre támaszkodik, és a technikai döntéshozóknak érdemes figyelembe venniük, mit takarnak ezek a mutatók:
-
FLEURS: A Microsoft szerint a MAI-Transcribe-2 az első helyen áll a FLEURS benchmarkon 60 nyelv átlagában, 5,2%-os Word Error Rate (WER) mellett. A FLEURS egy 2022-ben publikált, olvasott beszédre épülő benchmark, amely körülbelül 2 000 mondatot tartalmaz nyelvenként. A 5,2% azt jelenti nagyjából, hogy húsz szóból egy hibás, de mivel a mostani átlag 60 nyelvet fog össze (júniusban 43-at), az átlag feljebb jöhet alacsonyabb erőforrású nyelvek bevonása miatt; ezért a vásárlóknak érdemes kéréssel élniük a nyelvenkénti bontásra.
-
Artificial Analysis leaderboard: A modell a második helyen áll az Artificial Analysis WER listáján, és a cég szerint definiálja az accuracy‑latency Pareto‑határt — azaz nincs olyan rivális, amely jobb pontosságot érne el anélkül, hogy lassabb lenne, vagy gyorsabb lenne anélkül, hogy pontatlanabb lenne. Az Artificial Analysis valódi API‑kon keresztül méri a modellt különféle forrásokkal (szimulált ügynöki beszélgetések, parlamenti felszólalások, vállalati negyedéves beszámolók), erősen súlyozva az angol üzleti beszédet.
-
Sebesség: Az Artificial Analysis mérései szerint a MAI-Transcribe-2 tízszer gyorsabb, mint OpenAI GPT-Transcribe, hétszer gyorsabb, mint ElevenLabs Scribe v2, és ötször gyorsabb, mint Google Gemini 3.5 Transcribe. Gyorsabb inferencia alacsonyabb GPU‑óraszámot jelent nagy batch feldolgozásnál, ami hozzájárul a laposabb árképzéshez.
Fontos megjegyezni, hogy a FLEURS olvasott beszéden alapul, nem beszélgetésen; a WER nem méri a diarizáció minőségét; és a benchmarkok nyers átlageredményei elfedhetik a nyelvenkénti eltéréseket.
Gyors kiadási ütem — három modell öt hónap alatt
A tempó önmagában is releváns: április 2-án jelent meg a MAI-Transcribe-1 (25 nyelv, 0,36 USD/óra), június 2-án a MAI-Transcribe-1.5 (43 nyelv, kulcsszó‑biasolás, harmadik hely Artificial Analysis‑on), majd most a MAI-Transcribe-2 (60 nyelv, diarizáció, időbélyegek, code switching, második hely és 0,10 USD/óra). Három kiadás öt hónap alatt, minden iteráció hozzáadott nyelvi támogatást és új funkciókat — ez azt jelzi, hogy a csapat stabil architektúrát talált és gyorsan tud skálázni.
Mustafa Suleyman, a Microsoft AI vezetője a The Verge‑nek áprilisban azt mondta, hogy az első modell mögött egy "kicsi, fókuszált, 10 fős" csapat állt, amelyet a bürokráciától függetleníthettek; egy nagyobb környezet pedig a beszállítók és az adatgyűjtés kezelését végzi.
Miért épít saját modelleket a Microsoft az OpenAI‑befektetés ellenére?
Microsoft több mint 13 milliárd dollárt fektetett az OpenAI‑ba, és az OpenAI modelljei jelenleg is sok Microsoft termék mögött futnak. Ennek ellenére a függetlenség fontos indok lett: az elmúlt év során a vállalat többször módosította a szerződését OpenAI‑val, egyre nagyobb szabadságot nyerve saját modellek fejlesztésére és telepítésére. 2024 márciusában Mustafa Suleyman érkezése és a későbbi szerződésmódosítások fokozatosan lazították az OpenAI‑hoz fűződő köteléket.
A másik ok a költségcsökkentés: minden prompt, amelyet OpenAI modellekhez irányítanak, költséget jelent; saját modellek futtatása saját GPU‑kon alacsonyabb költséggel jár. A Microsoft már elkezdte részben MAI‑modellekre áttolni a Word és Excel felhasználói lekérdezéseinek egy részét, ami a Bloomberg szerint része az iparági AI‑költségcsökkentéseknek.
Transzkripció természetes első célpont: a Teams és a Nuance révén a Microsoft hatalmas mennyiségű beszédadatot birtokol, amelyeket belsőleg MAI‑Transcribe‑tal lehet továbbfeldolgozni — így minden áthelyezett óra azt jelenti, hogy a Microsoft nem fizet más szállítónak.
Versenyképi kép: kikkel mérkőzik a Microsoft?
A Microsoft név szerint négy közvetlen riválist említ: OpenAI GPT-Transcribe, Google Gemini 3.5 Transcribe, OpenAI Whisper V3‑Large és ElevenLabs Scribe v2. Ugyanakkor nem említette a hosszabb ideje vállalati transzkripciót kínáló Deepgramet, AssemblyAI‑t, Speechmatics‑t vagy Rev‑et. A Microsoft frontvonalbeli laborokkal (frontier labs) szembeni pozícionálása egyszerre marketing és valóság: ha egy dedikált modell ötször–tízszer gyorsabb, miközben mérsékelt pontosságot tart, az megkülönböztető előny lehet.
A specializált szolgáltatók (például egészségügyi vagy jogi domain‑szókincsre és integrációra fókuszáló cégek) azonban érzékenyen érezhetik az árnyomást, mivel a Microsoft alapárba csomagolta a legtöbb korábban prémiumként kínált funkciót. Az Alibaba továbbra is egy olyan szereplő, akit a Microsoft nem állít egyértelműen maga mögé pontosságban: az Alibaba modelljei sok független listán vezetnek 2026 folyamán.
Mely kérdéseket tegyék fel a technikai döntéshozók?
A bejelentés több gyakorlati kérdést nyitva hagy, amelyeket egy váltást fontolgató vállalatnak tisztáznia kell:
- Időtartam: a 0,10 USD/óra bevezetési ajánlat; nincs megadva lejárati idő vagy standard tarifa — ezt írásban érdemes rögzíteni a költségmodellen dolgozóknak.
- Streaming: a közlemény a kötegelt (batch) feldolgozás és hosszú formátumú hanganyag átvételét emeli ki, de nem beszél valós idejű transzkripcióról, amelyet hangügynökök és élő feliratok igényelnek.
- Nyelvenkénti pontosság: az átlagos 5,2% WER elrejtheti a nyelvenkénti különbségeket; speciális nyelvek esetén tesztelés szükséges.
- Diarizáció minősége: a WER nem méri a beszélő‑hozzárendelés hibaarányát; ez külön mérést igényelhet.
- Adatkezelés: vállalati transzkripció gyakran érinti az orvosi, jogi és pénzügyi adatokat; a közlemény nem részletezi az adatok lakhelyét, megőrzését vagy hogy a Foundry‑hoz beküldött hanganyagok visszakerülnek‑e tréningadatként.
Ezek a kérdések nem szokatlanok egy termékindításnál, de fontosak a valódi termelési bevezetésnél.
Mit árul el ez a stratégia a Microsoft szélesebb AI‑ambícióiról?
A beszédfelismerésnél tágabb mintázat látható: a Microsoft MAI egysége immár modelleket dob piacra képfeldolgozásra, beszédre, transzkripcióra, kódra, érvelésre és kiberbiztonságra. A Build rendezvényen júniusban hét új MAI modellt jelentettek be, és a megközelítés jellemző elemei ismétlődnek: jól körülhatárolt modalitás célzása, inferencia költségének agresszív optimalizálása, frontier labok alatti árazás, értékesítés Foundryn keresztül és a modellek beépítése saját termékekbe.
A cél nem egyetlen univerzális modell megépítése, amely mindenben legyőzi a GPT‑t vagy a Gemini‑t, hanem egy portfólió kialakítása specializált modellekből, amelyek együttesen lehetővé teszik, hogy a Microsoft az ügyfélmunka nagy részét saját megoldásaival lássa el, és a többletkapacitást versenyképes áron értékesítse.
Elérhetőség
A MAI-Transcribe-2 mostantól elérhető a Microsoft Foundry piactéren és a MAI Playground tesztkörnyezetben. A cég bevezetési áron kínálja az óránkénti 0,10 USD‑s díjat, de a tartós ár és a bevezetési időtartam nem került megnevezésre.



