Modellbevezetés

Mesterséges intelligenciával generált szöveg

DeepSeek lean modellje alátámasztja Ilya Sutskever skálázásról szóló meglátását

A főszereplők Ilya Sutskever és a DeepSeek nevű cég; Sutskever novemberben távozott az OpenAI-tól, hogy megalapítsa az SSI-t, és akkor azt állította, hogy az iparág rossz irányba halad: a skálázás túlnyomó előnyei fogytán vannak, mert az adat véges és a pre-tréning hozamai csökkennek.

DeepSeek lean modellje alátámasztja Ilya Sutskever skálázásról szóló meglátását

Ilya Sutskever kilépett az OpenAI-tól és megalapította az SSI-t; novemberben azt mondta Dwarkesh Patelnek, hogy a szektor rossz irányba fordult: a skálázás vége felé tart, az adatok végesek, és a pre-tréning forrásai kifogynak. Ezen állításokhoz idén a DeepSeek adott kézzelfogható bizonyítékot: egy töredéknyi paraméterrel bíró, „karcsú” modelljükkel jobb teljesítményt értek el azon a feladaton, amelyen a munkás ügynökök (work agents) ténylegesen működnek.

Mit mutat a DeepSeek bejelentése

  • A DeepSeek által említett modellek és mérőszámok:
    • V4.1 Flash: 552 milliárd paraméter, és per token aktivációként csak 8–16 milliárd paramétert élesít.
    • V4-Pro: 1,6 billió paraméter, és per token 49 milliárd paramétert élesít.
  • A cég saját kódolási tesztjein a karcsúbb modell jobb eredményt ért el: 74,2 pont a nagyobb modell 62,7 pontja ellen.
  • DeepSeek szerint szeptember 14-től minden V4-Pro kérést átirányítanak a karcsú modellre.

Miért fontos ez

Sutskever állítása — amelyet novemberben fogalmazott meg — nem azt mondta, hogy a modelleknek feltétlenül kisebbekké kell válniuk, hanem azt, hogy a skálázás megtérülése megváltozott. A DeepSeek eredményei azt sugallják, hogy a gyakorlati használatban fontosabbá válik, mennyi paraméter aktiválódik egy token feldolgozásakor (runtime hatékonyság), és nem pusztán a teljes paraméterszám.

A technikai részletek: a V4-Pro magasabb teljes paraméterszáma ellenére többet élesít tokenenként, míg a V4.1 Flash alacsonyabb élesítéssel is hatékony. A DeepSeek kódolási benchmarkja szerint ez a hatékonyság a felhasználói feladatokon tetten érhető előnyt eredményezett.

Következmények és értelmezés

  • Az elmúlt öt évben a verseny előnyét sokszor a nagyfürtök (cluster size) és a teljes paraméterszám jelentette. A DeepSeek állítása szerint mostanra a versengés egy része a hatékonyabb aktivációról és a futásidejű erőforrás-használatról szólt.
  • Ha a gyakorlatban a kisebb aktív paraméterszám mellett elérhető jobb teljesítmény általánosítható, az iparági prioritások eltolódhatnak: hardver- és szoftveroptimalizáció, sparsity-szerű megoldások és finomabban irányzott tréning lehet előtérben.

Záró megjegyzés

A DeepSeek publikálta eredményei nem törlik el a nagyméretű modellek mögötti kutatási értéket, de alátámasztják Ilya Sutskever azon meglátását, hogy a skálázásból származó megtérülés változik. A szeptember 14-i átirányítás és a benchmarkpontok konkrét példák arra, hogyan térhetnek el a gyakorlati eredmények a puszta paraméterszám alapján várttól.