Ilya Sutskever kilépett az OpenAI-tól és megalapította az SSI-t; novemberben azt mondta Dwarkesh Patelnek, hogy a szektor rossz irányba fordult: a skálázás vége felé tart, az adatok végesek, és a pre-tréning forrásai kifogynak. Ezen állításokhoz idén a DeepSeek adott kézzelfogható bizonyítékot: egy töredéknyi paraméterrel bíró, „karcsú” modelljükkel jobb teljesítményt értek el azon a feladaton, amelyen a munkás ügynökök (work agents) ténylegesen működnek.
Mit mutat a DeepSeek bejelentése
- A DeepSeek által említett modellek és mérőszámok:
- V4.1 Flash: 552 milliárd paraméter, és per token aktivációként csak 8–16 milliárd paramétert élesít.
- V4-Pro: 1,6 billió paraméter, és per token 49 milliárd paramétert élesít.
- A cég saját kódolási tesztjein a karcsúbb modell jobb eredményt ért el: 74,2 pont a nagyobb modell 62,7 pontja ellen.
- DeepSeek szerint szeptember 14-től minden V4-Pro kérést átirányítanak a karcsú modellre.
Miért fontos ez
Sutskever állítása — amelyet novemberben fogalmazott meg — nem azt mondta, hogy a modelleknek feltétlenül kisebbekké kell válniuk, hanem azt, hogy a skálázás megtérülése megváltozott. A DeepSeek eredményei azt sugallják, hogy a gyakorlati használatban fontosabbá válik, mennyi paraméter aktiválódik egy token feldolgozásakor (runtime hatékonyság), és nem pusztán a teljes paraméterszám.
A technikai részletek: a V4-Pro magasabb teljes paraméterszáma ellenére többet élesít tokenenként, míg a V4.1 Flash alacsonyabb élesítéssel is hatékony. A DeepSeek kódolási benchmarkja szerint ez a hatékonyság a felhasználói feladatokon tetten érhető előnyt eredményezett.
Következmények és értelmezés
- Az elmúlt öt évben a verseny előnyét sokszor a nagyfürtök (cluster size) és a teljes paraméterszám jelentette. A DeepSeek állítása szerint mostanra a versengés egy része a hatékonyabb aktivációról és a futásidejű erőforrás-használatról szólt.
- Ha a gyakorlatban a kisebb aktív paraméterszám mellett elérhető jobb teljesítmény általánosítható, az iparági prioritások eltolódhatnak: hardver- és szoftveroptimalizáció, sparsity-szerű megoldások és finomabban irányzott tréning lehet előtérben.
Záró megjegyzés
A DeepSeek publikálta eredményei nem törlik el a nagyméretű modellek mögötti kutatási értéket, de alátámasztják Ilya Sutskever azon meglátását, hogy a skálázásból származó megtérülés változik. A szeptember 14-i átirányítás és a benchmarkpontok konkrét példák arra, hogyan térhetnek el a gyakorlati eredmények a puszta paraméterszám alapján várttól.



