Microsoft AI szerdán két, saját fejlesztésű modellt tett public preview státuszba: a MAI-Image-2.5-Pro-t, amely a cég szerint eddigi legnagyobb pontosságú képgenerátora, illetve a MAI-Voice-2-Flash-t, egy nagyforgalmú vállalati beszédmodellt. A bejelentést a Microsoft AI Superintelligence csapata tette közzé.
A lépés nagyjából egy évvel azt követi, hogy a cég vállalta: célzott, belső fejlesztésű modelleket épít. A blogbejegyzés szokatlanul részletes listát adott arról is, hogy hol futnak ezek a modellek: többek között a Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot és Azure szolgáltatásokban. A Microsoft üzenete az üzleti vásárlók felé — és implicit módon az OpenAI felé — az, hogy a házon belüli modellek már nem kutatási projektek, hanem éles infrastruktúra, mely milliók számára szolgál.
„Minden fejlesztés egy lépés ugyanazon cél felé: Microsoft-termékek, Microsoft-modellekkel” — írta a cég a bejelentésben.
A két modell a költség‑sebesség‑minőség görbe ellentétes végén helyezkedik el
A két új kiadás szándékosan a minőség‑sebesség‑költség görbe ellentétes pólusainak felel meg. A MAI-Image-2.5-Pro a prémium kategóriát célozza: kiemelt vizuális anyagok, részletes szerkesztés és pontos képen belüli szövegmegjelenítés — utóbbi évek óta nehézség az ilyen modellek számára. A Microsoft árazása: 5 USD per millió text input token, 8 USD per millió image input token és 106 USD per millió image output token. A MAI-Image-2.5 alapmodell nemrég a No. 2 helyen debütált az Arena közösségi képességi rangsorában képszerkesztés kategóriában.
A kreatív ipar részben észlelte a változást: Rob Reilly, a WPP globális chief creative officer-e a Microsoft bejelentéséhez mellékelt nyilatkozatban a Pro modellt „erős előrelépésnek” nevezte a generatív média eszközök terén, és azt írta, hogy a Microsoft „határozottan a generatív AI vezetői közé lépett”.
Ezzel szemben a MAI-Voice-2-Flash a költséghatékonyságra és sebességre optimalizált. Először a Microsoft Build konferencián mutatták be; a Flash kétszer gyorsabb, mint a MAI-Voice-2 és 32%-kal olcsóbb, ára 15 USD per millió karakter. Olyan nagy volumenű hangfeladatokra tervezték, mint call centerek, hangügynökök és valós idejű beszédalkalmazások, ahol a késleltetés és a hívásonkénti költség fontosabb, mint a legapróbb kifejezőkészség‑javulás.
A két modell egy családépítési stratégiát tükröz: a kreatív stúdió és az ügyfélszolgálati művelet eltérő igényeket támaszt.
Microsoft saját üzemeltetési adatai szerint a házon belüli modellek jelentősen csökkentik a GPU‑költségeket
A modellek bevezetésénél talán még fontosabbak a Microsoft által publikált üzemeltetési mérőszámok, amelyek a vállalat állítása szerint rendszerszerű érvet adnak a külső, frontier modellek kiváltására.
- A Bing Image Creator most teljes egészében MAI-Image-2.5-re váltott.
- PowerPointban a Microsoft szerint a MAI-Image-2.5 akár 84%-kal csökkenti a GPU-költségeket a GPT-Image-2-höz képest (OpenAI képi modellje).
- OneDrive-ban, ahol MAI-Image-2.5 az alapértelmezett kulcsfontosságú képszerkesztési forgatókönyvekhez, a cég 26%-os mentési rátanövekedést, nagyjából 25%-kal alacsonyabb P95 késleltetést és 2,5-szeres hatékonyságnövekedést jelentett közepes terhelésű üzemeltetés mellett.
Hangoldalon a MAI-Voice-2-Flash már a Dynamics 365 Contact Centerben működik — ezt a platformot olyan ügyfelek használják, mint a T-Mobile és az EasyJet —, ahol a Microsoft szerint a GPU-költségek akár 89%-kal csökkentek. A modell integrálva van továbbá az Azure Voice Live-ba fejlesztők számára, akik beszéd‑beszéd ügynököket építenek.
A legfontosabb telepítések közé tartozik az egészségügyi terület: a Microsoft Dragon Copilot, amelyet 170 000 egészségügyi szolgáltató használ és az elmúlt negyedévben 28 millió betegeseményt dolgozott fel, most a MAI-Transcribe-1.5-öt futtatja többnyelvű munkafolyamatokhoz 58 nyelven. A cég belső értékeléseire hivatkozva 50%-os relatív csökkenést jelentett a transzkripciós és nyelvazonosítási hibaarányban a legtöbb nyelvnél.
A „hill‑climbing” módszer: kis modellek optimalizálása termelési környezetre
Ugyanezen a napon a Microsoft egy kísérőposztban ismertette a mögöttes módszertant, amelyet „hill‑climbing machine”-ként neveznek: ez egy integrált körforgás adatból, modellekből és a termékharnessből, amely a deployt körülveszi.
Példa: a MAI-Code-1-Flash, a GitHub Copilotban júniusban bevezetett könnyű kódolási modell körülbelül 10%-kal magasabb kódelfogadási rátát ért el a GPT-5.4 Minihez és a Claude Haiku 4.5-höz képest VS Code-ban, miközben 10%-kal kevesebb medián tokent használ. A fejlesztői megtartás is javult: a felhasználók 6%-kal valószínűbben tértek vissza több nap alatt, mint GPT-5.4 Mini esetén, és 11%-kal valószínűbben, mint Claude Haiku 4.5 használata mellett.
A Microsoft ezt követően a MAI-Code-1-Flash ellenőrzőpontot belső Excel megerősítéses tanulási környezetben továbbképzte, így a modell elsajátította a táblázatkezelési munkafolyamatok eszközeit. A termelési felhasználói visszajelzések szerint az eredmény a leggyakoribb Excel‑feladatokban a GPT-5.6‑tal vetekszik, miközben elég kicsi ahhoz, hogy régebbi Nvidia H100 és akár A100 GPU-kon fusson, nem csak a legújabb gyorsítókön.
Ez a hardver‑részlet stratégiai jelentőségű: minden nagy AI‑vállalat harcol a csúcskategóriás chipek elosztásáért, és egy modell, amely két generációval korábbi szilíciumn futtatásával frontier‑szinthez közelítő minőséget nyújt, alapjaiban változtatja meg a telepítési gazdaságosságot. Emellett felszabadítja az újabb hardvert — köztük a Microsoft működő GB200 klaszterét — elsősorban tréningre.
Satya Nadella megfogalmazása és a partnerkapcsolatok szerepe
Satya Nadella vezérigazgató egy hosszabb X-posztban, „Frontier Diffusion & Control” címmel stratégiai nyilatkozatként értelmezhető gondolatokat fogalmazott meg. Nadella arról írt, hogy a telített frontier képességeket most skálázhatóan és alacsonyabb költségen lehet elérni olyan modellekkel, amelyek a nagyhasználatú termékekre optimalizáltak, miközben a frontier modelleket továbbra is használják frontier‑igényekre.
Hozzátette, hogy a Microsoft „kezdi forgalmazni a forgalmat az első féltől származó felületeinken a MAI felé, amikor modelljeink megfelelnek vagy felülmúlják a frontier alternatívákat.” Nadella kiemelte továbbá, hogy az OpenAI és az Anthropic frontier modelljei „részei az orkestrációs rendszernek a MAI mellett”, ugyanakkor hangsúlyozta a modellfüggetlenség elvét: a cég értékeléseinek folyamatosan „hill climbolniuk” kell még akkor is, ha egy adott modellt eltávolítanak.
A bejelentés kontextusában emlékeztető, hogy Reuters áprilisi jelentése szerint a Microsoft OpenAI‑hoz fűződő kizárólagos licencmegállapodása nem kizárólagossá módosult, és hogy a Microsoft tavaly óta Anthropic modelleket is bevont egyes termékekbe. A mostani lépés így a Microsoftot mint orkestrátort mutatja: partnerei frontier modelljei cserélhető komponensekké válnak, miközben a Microsoft saját modelljei egyre több rutinszerű forgalmat veszik át.
Reakciók: fejlesztők öröme és kritikus hangok
Az online reakciók tükrözték a stratégia vonzerejét és a kételyeket is. Egyes fejlesztők üdvözölték a kisebb, feladatspecifikus modellek használatát, mondván nem kell a „mindentudó” modellt használni apró műveletekhez. Mások kevésbé bíztak a Microsoft felhasználói visszajelzésekre adott reagálásában; kritikák szerint a vállalat gyakran nem figyel eléggé a felhasználói igényekre.
A kételyek részben jogosak: a Microsoft által közölt elfogadási ráták, mentési ráták és GPU‑megtakarítások belső értékelések eredményei, nem független benchmarkok, és a cég válogatja meg, mely összehasonlításokat publikálja. Ugyanakkor a stratégia logikája nem egyetlen számra támaszkodik: Nadella megfogalmazása szerint a szoftvernél „valódi marginális költség” jelent meg, és amikor AI‑funkciók milliárdos felhasználói termékeken futnak minden leütésnél, a radikális GPU‑költségcsökkentés üzleti túlélési kérdés.
Microsoft eladja a módszertant is: Foundry és Frontier Tuning
A stratégia záró eleme, hogy a Microsoft nemcsak a modelleket, hanem a saját módszertanát is értékesíti. Nadella a hill‑climbing megközelítést „sablonnak” nevezte más AI‑natív, SaaS vagy vállalati cégek számára; a Microsoft a Foundry és a Frontier Tuning eszközein keresztül csomagolja a toolchain-t, lehetővé téve, hogy vállalatok saját, zárt értékelési és megerősítéses tanulási környezeteikre hangolják a modelleket.
A cég hangsúlyozza, hogy modelleiket „tiszta, nyomon követhető, vállalati szintű adatokon” tréningezik, harmadik fél modellektől történő desztilláció nélkül — egy fontos értékesítési érv az adathiányosságok és származtatás körüli növekvő szabályozói és ügyfélérdeklődés közepette. A Microsoft azt közölte, hogy a hill‑climbing megközelítést kiterjesztik a Copilot Chatre, az Outlookra és a PowerPointra, és mindkét új modell publikus preview-ban elérhető a Microsoft Foundry és az MAI Playground felületein. A cég hangsúlyozta: „ez még nem a végpont — még csak most kezdjük.”
Hét évvel ezelőtt a Microsoft több mint 13 milliárd USD‑t tett fel az OpenAI jövőjére. A szerdai bejelentés azt sugallja, hogy a vállalat tanult egy olcsóbb leckét: a jövő lehet, hogy a frontier építőié, de a profit azokat illeti, akik a frontierből hétköznapit képesek csinálni.



