Kutatás

Mesterséges intelligenciával generált szöveg

Augusztusi AI-trendek: kisméretű nyílt modellek és vízjelezés előretörése

A Radar Trends to Watch szeptemberi összefoglalója több szereplőt említ, köztük Anthropic, OpenAI, Z.ai, NVIDIA, Meta és IBM, és a kisméretű, helyben futtatható nyílt modellek előretörését jelzi.

Augusztusi AI-trendek: kisméretű nyílt modellek és vízjelezés előretörése

Augusztusban a nagy, látványos bejelentések helyett sok kisebb, de gyakorlati jelentőségű fejlesztés dominált: a kisméretű, nyílt súlyú (open-weight) modellek tovább közelednek a legjobb frontvonalbeli modellek teljesítményéhez, miközben az alkalmazási és üzemeltetési eszközök sora bővült. Egy másik fontos előrelépés Anthropic bejelentése: szöveges kimenetükbe ágyazott vízjelezés, amely megkönnyítheti az emberi és gépi szöveg részeinek elkülönítését.

Miért számít ez?

A nagy modellek mérete és teljesítménye lassan eltávolodik attól az egyértelmű előnnyel járó státusztól, amely korábban jellemezte őket. Több, laptopon vagy egyetlen gyorsítón futtatható modell ígér közelítően frontvonalbeli képességeket, így a drága per-token hozzáférés egyre kevésbé tűnik feltétlenül megéri. Emellett az infrastruktúra-, üzemeltetési és biztonsági fejlesztések azt mutatják: a modell-teljesítmény mellett a futtatás módja lesz egyre fontosabb.

Új és frissített modellek (kiválasztva)

  • Ox Alpha: rövid idő alatt az OpenRouter leggyakrabban használt modelljévé vált; később Z.ai megerősítette, hogy ez a GLM-5.3-Flash, egy 320 milliárd paraméteres, nyílt súlyú modell, amely állításuk szerint Opus 4.8-hoz hasonló teljesítményt nyújt, és kizárólag kínai chipeken fut.
  • IBM Granite 4.2: kis, nyílt súlyú érvelési modell, kifejezetten többlépéses feladatokra hangolva; 3B, 8B és 30B változatban érhető el.
  • Ornith-1.5: a fejlesztők szerint lényeges előrelépés történt az önfejlesztés irányába; a modell támogat egy önfejlesztési hurkot, ahol új feladatokat javasol, megoldásokat generál, és megerősítéses tanulással alkalmazza az eredményeket önmagán.
  • DeepSeek-V4-Flash-Vision: a DeepSeek V4 kiterjesztése vizuális képességekkel; képek és szöveg keverése, képleírás, képből kinyerhető szöveg és egyéb multimodális funkciók.
  • Qwen3.8-27B: 27 milliárd paraméteres, nyílt súlyú modell, amely állítás szerint Opus 4.6 max-hoz hasonló teljesítményt nyújt, és könnyen futtatható egy jól felszerelt laptopon.
  • Z.ai GLM-5.3: Z.ai kiadta a GLM-5.3-at, amely – a cég szerint – a GLM-5.2-höz képest további utótréninget kapott, jobb kódgenerálásban és hosszú feladatok kezelésében.
  • NVIDIA Nemotron 3.5 Lightning: 30B paraméteres, open-weight mixture-of-experts modell, amelyből 3B az aktív paraméterek száma; optimalizált hosszú futású ágensekhez.
  • Cactus Compute Needle 2: egy 45B paraméteres modell, kifejezetten „tool calling, device use és structured extraction” feladatokra, nagyon kis memóriaigénnyel — 28 MB RAM szükséges, így sok laptopon és kis eszközökön is futhat.
  • Meta Muse Glimmer: Meta nyílt forrásúvá tette a 30B-s Muse Glimmert, agentikus alkalmazásokhoz tervezve, fogyasztói hardveren futtatható; továbbá kiadták a Muse Code-ot (kódgenerálásra tervezett modell, agent hurkkal és helyi eseménynaplóval) és Muse Spark 1.2-t (általános célú modell, közel-frontvonal teljesítménnyel).

Vízjelezés és szövegazonosítás

Anthropic mostantól vízjelezést ágyaz a modelljei által generált vagy szerkesztett szövegbe. A vízjel állítólag a szóválasztáson alapul: az algoritmus megváltoztatja a véletlenség forrását a szóválasztásnál. Egyelőre nincs széles körben ismert, megbízható detektáló eszköz, bár már megjelentek olyan megoldást ígérő eszközök, amelyek a vízjelek eltávolítását ígérik; ezek hatékonysága egyelőre nem egyértelmű.

Benchmarkok, fejlesztői eszközök és agentek

  • SWE-Bench ProMax: új benchmark, amely nagy léptékű refaktorálási képességeket tesztel, többnyelvű, valódi kódon alapuló hét nyelven.
  • DeepSeek Harness: a DeepSeek agent-harness-e nyílt forrásúvá vált; erőssége, hogy gyakorlatilag minden plugin, így nagyon rugalmas, és több modellel együtt használható, továbbá képes munkát delegálni Claude Code-nak és Codex-nek.
  • TrueForge: nyílt forrású agent harness, bármilyen modellel használható, tartalmaz eszközöket agentek hibakeresésére és kormányzására éles környezetben.
  • Zed Delta: „többjátékos környezet” kódoláshoz agentekkel és a létrehozott kód áttekintéséhez; a beszélgetést a kód körül elsődlegesnek tekinti, és azt is rögzíti.
  • Anthropic: Claude Code-hoz kereszt-szessionális üzenetküldést adott hozzá, hogy az ügynökök kommunikálhassanak egymással a programozó közvetítése nélkül.
  • Agent Plugins: egy szabvány agentek bővítésére, támogatottsággal OpenAI, Microsoft, Cursor és AWS részéről (Google és Anthropic jelenleg nem támogatják).
  • Codex Micro: OpenAI új hardvereszköze, egy kisméretű terminál a távoli AI munkafolyamatokhoz; 13 gombbal, encoderrel, érintésérzékelővel és joystickkal rendelkezik, távoli Codex munkafolyamatok vezérlésére.
  • Model Context Protocol (MCP): frissítése stateless módot tett lehetővé, ami egy jelentős akadályt old meg az elfogadás felé.

Infrastruktúra, üzemeltetés és tokenomika

A „tokenomika” mint külön szakma egyre fontosabb: a költségek, biztonság és hatékonyság összehangolása meghatározó lesz. Néhány példa:

  • Taalas chip: egy olyan chip, amelybe a Llama 3.1 8B súlyait integrálták; a chip kizárólag az adott modellhez használható, rendkívül gyors, ugyanakkor kérdéses, mennyire érdemes egyetlen-modellos chipeket gyártani a gyorsan változó modellpiacon.
  • Docker Sandboxes: eldobható, izolált konténerek agentek biztonságos futtatására.
  • Kubernetes Device Resource Allocation (DRA): megkönnyíti heterogén GPU klaszterek feladatütemezését.
  • Cloudflare: publikált leírást arról, hogyan futtatja skálán a Kimi és GLM modelleket.
  • WARP: egy inference engine, amelynek célja, hogy Kimi K3-at laptopon futtassa; K3 tipikusan hatalmas paraméterszámú modell, de WARP képes futtatni 64 GB-os MacBook Pro-n néhány TB lemez mellett, lassan (~0.5 token/másodperc).

Biztonság

A biztonság és az AI fejlesztés együtt jár. Több jelenség is kiemelendő:

  • Nyílt levél: Anthropic, OpenAI, Google és más cégek aláírtak egy nyílt levelet, amelyben sürgetik, hogy a kormányok és szervezetek közösen tegyenek lépéseket a kiberbiztonsági védelem erősítésére.
  • Chrome: a böngésző elfogadta a device-bound service credential (DBSC) megoldást, amely megakadályozza a session cookie-k eltulajdonítását, a kulcsot biztonságos tárolóban tartva.
  • Posztkvantum kriptográfia: megjelent egy Python könyvtár, amely támogatja az ML-KEM és ML-DSA NIST-szabvány algoritmusokat.
  • Incidensek és eszközök: Simon Willison publikált idővonalat OpenAI véletlenül elindított támadásáról a HuggingFace ellen (OpenAI Black Hat posztmortem alapján). A ChainDrop kártevő több mint 1 300 npm csomagot kompromittált; ezek a csomagok látszólag hiteles forrással rendelkeznek.
  • OpenAI Codex Security: OpenAI nyílt forrásúvá tette a Codex Security CLI-t és API-t, amelyek ChatGPT-t használnak kód sebezhetőségek elemzésére; mindkettő „korlátozott béta” státuszban van.
  • Google Beyond Zero: Google egy Beyond Zero nevű új biztonsági modellt mutatott be, amely a döntéseket már nem csak felhasználók vagy alkalmazások alapján hozza, hanem konkrét műveletek és erőforrások alapján, statikus és dinamikus szabályok kombinációjával.

Emberek, használat és termelékenység

Az AI használatáról és termelékenységéről még kevés az általános, megbízható adat. Az AI Observatory adatokat gyűjt a felhasználási mintákról, de a szolgáltatók gyakran csak a számukra kedvező metrikákat publikálják. Javaslatként megfogalmazódik, hogy a termelékenységet inkább a kód minősége és a review-on való túlélés alapján mérjük, ne pusztán a megírt sorok száma alapján.

Web és fogyasztói szolgáltatások

  • ChatGPT for Teens: OpenAI egy 13–17 éveseknek szánt módot indított, amely tanulásra és vizsgafelkészülésre fókuszál, erősebb tartalomszűrőkkel.
  • TIME: az oldal AI alapú scrappereknek minimális Markdown változatot szolgáltat, eltérő tartalmat adva a User-Agent alapján; némely user agent hozzáférését korlátozzák.
  • Böngésző-theremin és vizuális kísérletek: megjelentek kreatív demonstrációk, például egy böngészőben futó theremin és Andrej Karpathy Claude Opus-szal készített rövid animációja A Gyűrűk Urának első bekezdésére.

Biológia és neurális kísérletek

  • Emberi neuronok: a National University of Singapore Life Sciences Institute létrehozott egy szerverrákot, amelynek számítási kapacitását 16 millió laboratóriumban tenyésztett emberi neuron adja; a life support kihívás, de az energiafelhasználás alacsonyabb, mint a GPU-alapú megoldásoknál.
  • Claude és fehérje-tervezés: Claude sikeresen végigfuttatott egy teljes fehérje-tervezési munkafolyamatot; az új terveket szintetizálták és laborban tesztelték.
  • Légye-szimuláció: egy asztali alkalmazás egy légy connectomájából származó több mint 23 000 neuront szimulál, valósághű viselkedést mutatva (macOS-en).

Záró gondolatok

Augusztus inkább a finomításról és az alkalmazhatóságról szólt: a kisméretű, nyílt modellek erősödnek, a vízjelezés új lehetőséget ad a generált tartalom azonosítására, és az üzemeltetési, biztonsági megoldások egyre fontosabbá válnak. A hónap üzenete az, hogy a nagy modellméretek önmagukban már nem befektetés- vagy alkalmazás-képes garanciák; a futtatás módja, a költségek és a kormányzás egyre meghatározóbbak.