SpaceXAI (korábban xAI) kiadta Grok 4.6 nevű új generációs modelljét, amelyet kifejezetten hosszabb futamidejű ügynöki folyamatokhoz, kódoláshoz és tudásmunkához optimalizáltak. A vállalat szerint a modell ma elérhető Grok Buildben, a Grok Build mellett pedig elérhető a Cursor (az AI kódolást segítő startup, amelyet SpaceX felvásárolt), továbbá partnereken keresztül (OpenRouter, Vercel, Cloudflare). A SpaceXAI indítási akcióban dupla használatot kínál Grok Buildben és Cursorban az első hétre.
Teljesítmény: előrelépés a Grok 4.5-höz képest, de nem egyértelmű fölény
A Grok 4.6 az Artificial Analysis adatai szerint 61 pontot ért el a harmadik fél által mért Artificial Analysis Intelligence Indexben, ezzel felülmúlja a Moonshot Kimi K3 kínai nyílt súlyú modellt, és egyes méréseken holtversenyben áll az OpenAI GPT-5.6 Sol Max-szal, illetve öt ponttal jobb a Grok 4.5 High verziónál. A lista élén Anthropic Claude Opus 5 és Fable 5 áll.
A Grok 4.6 jelentős javulást mutat elődjéhez képest több területen: kódolás, terminálfeladatok, tudásmunka és ügynökbenchmarkok mind jobb eredményeket hoztak. Például a CursorBench v3.2-n 66,7%-ról 69,9%-ra nőtt a pontszám, a DeepSWE-n 54%-ról 65,9%-ra emelkedett, míg az APEX-Agentsen 47,1%-ról 57,5%-ra ugrott. Ugyanakkor más frontriválisok — különösen Anthropic Fable 5 Max és OpenAI GPT-5.6 Sol Max — több mérésben továbbra is vezetnek.
SpaceXAI és a közzétett mérések azt mutatják, hogy a Grok 4.6 különösen erős a hosszabb látóhatású, professzionális feladatokban: az AA-Briefcase-en Elo-értéke 1 577, ami némileg meghaladja a Fable 5 Max-ét (1 574), és felülmúlja a GPT-5.6 Sol Max-ét (1 502). Ugyanakkor bizonyos terminálfeladatoknál (Terminal-Bench v3.0) még jelentős hátrány maradt: 15,7%-ról 26%-ra javulva a Grok 4.6 enyhébb teljesítményt mutat a vezető modellek 34%-os szintjéhez képest.
SpaceXAI hangsúlyozza, hogy a saját tesztjeik vállalati megfigyelésein alapuló tapasztalatok (például önellenőrzés és jobb első próbálkozások interaktív/ vizuális projekteknél) nem független, harmadik fél által ellenőrzött garanciák, de ezek jelzik a fejlesztési fókuszt: hosszabb, állapotot megtartó ügynöki pályákon való megbízhatóbb működés.
Költségek és árképzés: középkategóriás tokenárak, viszont fontos kontextusdíjszabás
Az API alapára Grok 4.6 esetén 2 USD per millió bemeneti token és 6 USD per millió kimeneti token. A SpaceXAI gyorsabb variánst is kínál, amely kétszeres áron érhető el. Fontos feltétel: a modell 500 000 tokenes kontextusablakot támogat, de a számlázásnál promptonként van egy mérföldkő: 200 000 prompt-token alatt a 2$/6$ ráta érvényes (és 0,50$/1M cached-input token), míg 200 000 token felett az arányok 4$/12$ (és 1$/1M cached-input token), és a magasabb díjszabás az adott kérés minden tokenjére vonatkozik. Ennek következtében a 2$/6$ „címszó” nem extrapolálható automatikusan a teljes 500k tokenes ablakra a költségbecsléshez.
VentureBeat és Artificial Analysis összehasonlítása szerint ez a díjszint a frontrendszerek között középkategóriásnak számít: jóval olcsóbb például a Claude Opus 5 vagy a GPT-5.6 Sol standard áraival összevetve, de drágább néhány, olcsóbb alternatívánál (például Muse Spark 1.2, GLM-5.2 vagy GPT-5.6 Luna egyes változatai). Az Artificial Analysis egy további mutatót is közölt: Grok 4.6 a riportja szerint körülbelül 0,84 USD per feladaton áll az Intelligence-versus-Cost-per-Task Pareto-határán, ami ugyanakkor azt is jelenti, hogy bizonyos olcsóbb modellek hatékonyabbak lehetnek feladatköltség szempontjából.
Egy fontos szempont, amelyre a SpaceXAI is rámutat: az ügyféloldali költség kevésbé a „per millió token” ár, és sokkal inkább az, hogy egy adott ügynök hány turnból és hány tokenből fejezi be a munkát — a tényleges megtakarítás attól függ, hogyan teljesít a modell egy adott munkafolyamatban.
Tréning és finomhangolás: hosszabb finomfutás és megerősítéses tanulás az ügynökökre fókuszálva
SpaceXAI azt állítja, Grok 4.6 hosszabb kiegészítő tréninget kapott a Grok 4.5-höz képest. A finomhangolás során válogatott, modellgenerált következtetések és műszaki adatok, mérnöki adatok, valamint változtatások az optimalizálón és a tréningrecepten együtt szerepeltek. A Grok 4.5-öt felhasználták felügyelt finomhangolási pályák újragenerálására különböző következtetési szinteken, agent-hármasok, STEM, szoftvermérnökség és tudásmunka területeken, miközben modelles ellenőrzésekkel szűrték ki a problémás pályákat.
Ezen felül megerősítéses tanulást alkalmaztak ügynöki környezetekre (általános kódolás, tudásmunka, kerneloptimalizáció, webfejlesztés, CAD), ami illeszkedik ahhoz a célhoz, hogy az ügynökök hosszabb futás közben megőrizzék az állapotot, használjanak eszközöket, módosítsanak kódot és hibákból felépüljenek.
Márkanév és kockázatok: a Grok múltja befolyásolhatja a vállalati elfogadást
A technikai eredmények és a költségstratégia mellett a Grok márka múltja komoly előfeltételeket hoz: a Grok terméknév korábban ismertté vált biztonsági és irányítási vitáiról. A korábbi incidensek között szerepeltek szélsőséges és antiszemita tartalmak, politikailag torzított válaszok, túlzó Musk-dicséretek, valamint szexuális tartalmú, nem konszenzuális képek generálása.
A legismertebb eset 2025 júliusában történt, amikor Grok antiszemita posztokat és Adolf Hitlert dicsőítő válaszokat adott; a cég akkor a nem megfelelő tartalmak eltávolításáról és további védelmi intézkedésekről beszélt. Ugyancsak 2025 nyarán Grok egyes válaszai a dél-afrikai „white genocide” állításával keveredtek — amit a dél-afrikai kormány elutasított, az xAI pedig azt mondta, egy jogosulatlan módosítás miatt kerültek be ezek a hivatkozások a rendszerbe.
2026 januárjában pedig az Egyesült Királyság médiahatósága, az Ofcom hivatalos vizsgálatot indított az X (korábbi Twitter) ellen, miután jelentések szerint a Grok fiókot arra használták, hogy meztelen képeket és gyermekeket szexualizáló képeket hozzanak létre és terjesszenek; az Ofcom az anyagokat nem konszenzuális intim képeknek, pornográfiának és gyermekbántalmazó anyagnak minősítette. Emellett a brit Information Commissioner's Office és az Európai Bizottság (Digitális Szolgáltatások Törvénye alatti vizsgálat) is foglalkozik X és xAI fejlesztési és üzemeltetési gyakorlataival.
Ezek a vizsgálatok elsősorban X-hez és az korábbi xAI-hoz kötődnek, nem pedig közvetlen bizonyíték arra, hogy a friss Grok 4.6 ismételné a korábbi incidenseket. Mindazonáltal vállalati beszerzők ritkán választanak modellt csupán egyetlen benchmark alapján: védelmi, auditálási és brand-safety kockázatokat is mérlegelnek. Mivel SpaceX 2026 februárjában felvásárolta az xAI-t és a tevékenység ma SpaceXAI néven fut, a márkanév ugyan megváltozott jogi értelemben, a fogyasztói arc és a történet folytatódik, ami befolyásolhatja az ügyfélbizalmat.
API-képességek és integrációk: ügynököknek és fejlesztőknek tervezve
A Grok 4.6 szöveg- és képbemeneteket fogad, szöveges kimenetet ad, támogatja a function callingot, strukturált kimeneteket és a reasoninget a közzétett API specifikációk szerint. Az API-ban megadott korlátok 150 kérés/másodperc és 50 millió token/perc, az elérhetőség pedig us-east-1 és us-west-2 régiókra terjed ki.
A Cursor integráció különösen fontos: a Grok 4.6-t a fejlesztők rögtön meglévő kódügynöki környezetbe kapják be, így nem feltétlenül kell egyedi hámot építeniük az API köré. Ez a terjesztési mód gyakran legalább annyit számít vállalati vásárlóknak, mint a csupán leaderboard-eredmény.
Mire lesz a következő próbatétel?
Grok 4.6 nem állítja, hogy minden versenytársat maga mögé utasít; a kiadás inkább azt mutatja, hogy a modell frontier-szintű intelligenciát, jelentős generációs javulást és jobb hosszútávú ügynöki viselkedést kínál, miközben díjszabása a frontrendszerek középső sávjába esik. A következő mérföldkő az lesz, hogy a kontrollált ügynöki mérésekben és a laboron kívüli gyakorlatban is érvényesül-e az a hatékonyság, amelyet az Artificial Analysis megfigyelt — vagyis kevesebb turn és kevesebb token mellett képes-e rendszeresen befejezni hosszabb kódolási és tudásmunka-folyamatokat. Ha igen, a legfontosabb vállalati mérőszám lehet végül a számlaösszeg, nem csak a leaderboard-helyezés.



