Modellbevezetés

Apple AFM 3 Core Advanced: nagy nyelvi modell helyi futtatásra optimalizálva

A hír főszereplője az Apple és a Google együttműködésében készült Apple Foundation Models harmadik generációjának egyik tagja, az AFM 3 Core Advanced.

Apple AFM 3 Core Advanced: nagy nyelvi modell helyi futtatásra optimalizálva

Apple bejelentette az AFM 3 Core Advanced modellt, az Apple Foundation Models (AFM) harmadik generációjának egyik tagját, amelyet az Apple és a Google közötti együttműködés eredményeként fejlesztettek. A modellt kifejezetten arra tervezték, hogy bizonyos Apple eszközökön — Apple silicon processzoron — képes legyen szöveg és beszéd előállítására, miközben jelentősen kisebb aktív munkamemóriát igényel, mint a hagyományos mixture-of-experts (MoE) modellek.

Mire képes és hol fut

  • Input/output: szöveg, képek és beszéd bemenet; szöveg és beszéd kimenet.
  • Architektúra: módosított mixture-of-experts típusú transformer; a teljes modell 20 milliárd paramétert tartalmaz, ebből egy időben 1–4 milliárd paraméter aktív.
  • Nyelvi és multimodális képességek: szöveg- és beszédfeldolgozás, szöveg- és beszédgenerálás, képfeldolgozás, eszközhasználat (tool use), készségek (skills) és következtetés, 25 nyelven.
  • Elérhetőség: az AFM 3 Core Advanced az Apple operációs rendszerfrissítéseivel jelenik meg 2026 őszén, Mac számítógépekre és az iPhone 17 Pro/Max/Air készülékekre.

Miben különbözik a hagyományos MoE-ktől

A modell egyik újdonsága az Instruction-Following Pruning névre keresztelt megközelítés, amely alternatívát kínál a tipikus MoE routing rétegeivel szemben. A hagyományos MoE-modellek routing rétegekkel választják ki, hogy az egyes kimeneti tokenekhez melyik "szakértők" (experts) aktiválódjanak, és ez gyakran tokenenként váltakozást eredményez. Az AFM 3 Core Advanced esetében ehelyett egy külön transformer dönt arról, hogy melyik szakértőket aktiválják bizonyos kimeneti tokenekhez, és mivel a modell gyakran ugyanazokat a szakértőket használja több tokenhez, kevesebb váltás történik, ami gyorsabb inferenciát és alacsonyabb memóriahasználatot eredményezhet.

Ez a megközelítés lehetővé teszi, hogy a modell gyakorlati módon tárolható legyen a flash-tárban, mivel nem szükséges minden szakértőt egyszerre aktív memóriába tölteni — így nagyobb modell futtatható helyben az eszközön.

Képzés és transzparencia

Apple azt közölte, hogy az AFM 3 modelleket a nyilvánosan elérhető forrásokból, licencelt adatokból, vizsgálatokból gyűjtött adatokból és generált adatokból álló keveréken képezték; a bemutatott tájékoztatás szerint a felhasználói adatok vagy a felhasználói interakciók nem kerültek bele a képzésbe. A tanulási folyamat előképzésből (pretraining), felügyelt finomhangolásból (supervised fine-tuning) és megerősítő tanulásból (reinforcement learning) állt.

Apple nem közölt részleteket az input/output méretkorlátokról, sem a benchmark-eredményekről vagy a konkrét képzési adatkészletekről és módszerekről; a cég azt állítja, hogy a benchmark-eredményeket később a év során közzéteszi. Az AFM 3 család tagjai — köztük az AFM 3 Core (szintén helyben futó), az AFM 3 Cloud, AFM 3 Cloud Image és AFM 3 Cloud Pro (szerveroldali modellek) — Apple által egyedileg épített modellek, amelyeket állításuk szerint Google Gemini modellekből distilláltak.

Teljesítmény és mérések

Apple még nem tett közzé független benchmark-eredményeket az AFM 3 modellekre vonatkozóan. A cég azonban közölte, hogy az AFM 3 modellek saját, zárt mérései szerint jobban teljesítenek az előző generációhoz képest a humán preferenciák alapján mért mutatókban. Részletes, külső összehasonlító eredmények egyelőre hiányoznak.

A háttérben: Google partnerség és fejlesztői választék

Januárban az Apple többéves megállapodást kötött a Google-lal, amelynek keretében a Google Gemini modelleit használhatja alapként AI modelljeihez. Amar Subramanya, az Apple alelnöke és AI területi vezetője a AFM 3 bejelentésekor azt mondta, hogy a modellek "distillation-based" jellegűek, nem pedig a Gemini teljes körű átvételén alapulnak. Egyidejűleg az Apple bejelentette a Foundation Models Framework tervét, amely lehetővé teszi más vállalatok modelljeinek integrálását: a fejlesztők az Apple hardverén vagy AFM 3 modellek, vagy az Apple LanguageModel protokollját megvalósító alternatívák, például az Anthropic Claude vagy a Google Gemini családjai közül választhatnak.

Miért fontos ez

A memória- és sávszélesség-korlátok miatt a többmilliárd-paraméteres modellek letöltése és helyi futtatása sok alkalmazás számára gyakorlatilag nem kivitelezhető. Az AFM 3 Core Advanced architektúrája azonban olyan megoldás felé mutat, amely lehetővé teszi nagyobb modellek tárolását flash-ben és hatékony futtatását Apple eszközökön. Ez vonzóvá teszi az iOS-fejlesztők számára a helyi, optimalizált modellek használatát, különösen az Apple és a Google kombinált szakértelmére építve.

Összegzés

Az AFM 3 Core Advanced egy olyan, Apple siliconra optimalizált, MoE-ihlette megközelítést alkalmazó modell, amely 20 milliárd paraméterből áll, de egyszerre csak 1–4 milliárd paramétert aktivál. A modell 2026 őszén érkezik az Apple rendszerszoftver-frissítéseivel Macre és az iPhone 17 Pro/Max/Air készülékekre. Apple részletes benchmark- és adatképzési információkat később tervezi közzétenni.