Az ausztrál startup Springboards egy új nyelvi modellt, Flintet mutatott be, amelynek célja a nagy nyelvi modellek (LLM-ek) hajlamosító egysíkúságának csökkentése. A cég alapítói azt tapasztalták, hogy a mainstream LLM-ek gyakran hasonló, kiszámítható válaszokat adnak nyitott végű kérdésekre, ami gond lehet például ötletelésnél vagy marketingkoncepciók kialakításánál.
A játék: miért tűnik minden válasz ugyanolyannak?
Egy egyszerű kísérletet írt le Pip Bingemann, a Springboards társalapítója és vezérigazgatója: ha megkérünk egy chatbotot — például Claude-ot, ChatGPT-t vagy Geminit —, hogy „adj egy véletlenszerű számot 1 és 10 között”, sokszor 7-et kapunk; ha újra rákérdezünk „Még egyet”, gyakran 3 vagy 4, aztán 8 vagy 9 következik. Flint viszont képes olyan válaszokra, mint 3.7916 egy újraindított munkamenetben, míg más modellek ismétlődő számokat adtak.
Ez a jelenség nem csak számokra korlátozódik. Például autótípusra adott válaszoknál a mainstream modellek gyakran Toyotát vagy Hondát ajánlanak, míg Flint olyan eltérő javaslatokat hozott, mint a Ford F-150. Ugyanígy, egy New Balance kampány szlogenjére Claude és ChatGPT egyaránt „Run your way”-t adtak, míg Flint "Built to last, run to win" válasszal tért el.
Kutatási háttér: az "Artificial Hivemind"
2024 novemberében egy kutatócsoport publikált egy tanulmányt „Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)” címmel, amely rávilágított arra, hogy több LLM nagyon hasonló válaszokra konvergál nyitott végű promptoknál. A kutatók 25 különböző modellt kértek meg 50-szer, hogy írjanak egy metaforát az időről; a 1 250 válasz nagy része valamilyen „Az idő egy folyó” vagy „Az idő egy szövő” típusú megfogalmazás volt. A csapat a NeurIPS konferencián elnyerte a best paper díjat.
A kutatók feltételezése szerint a konvergenciát részben az okozza, hogy a legtöbb LLM hasonló módszerekkel és hasonló adathalmazokon tanult, hasonló feladatokra. OpenAI kommentárja szerint a megbízható, koherens válaszra való tréning hajlamos lehet a magas valószínűségű, ismerős kimenetekhez való visszatérésre; a kutatásban vizsgált modellek azóta frissítve lehettek.
Flint hogyan működik: célzott variancia a teljes randomizálás helyett
A Springboards nem saját, alapmodellt tanított — Flintet a kínai Alibaba Qwen 3 nevű open-source modelljére építették rá. A csapat azt mondja, hogy a teljes modell újratanítása jelenleg nem reális költség és erőforrás szempontjából.
A legtöbb LLM-ben létezik egy "temperature" paraméter, amely növelésével általában nagyobb véletlenszerűséget kapunk. Springboards azonban arra jutott, hogy a paraméterek tetszőleges állítása tompa eszköz: ha minden egyes tokennél megnöveljük a véletlenséget, a modell könnyen koherenciazavarba kerülhet. Ehelyett Flintet úgy finomították, hogy felismerje azokat a pontokat a kimenetben, ahol érdemes több varianciát bevezetni — például egy földrajzi célpont megnevezésekor — és csak ott „dobjon be” egy kevésbé valószínű, szokatlanabb kifejezést.
A cél az, hogy meghívás legyen a szélesebb gondolkodásra: Flint „odavet egy furcsaságot”, ami inspiráló lehet kreatív szakemberek számára, de nem forgatja fel a teljes mondatszerkezetet.
Felhasználás és korlátok: reklám és marketing fókusz
Springboards terméke egy olyan eszköz, amelyhez több LLM is kapcsolódik — köztük ChatGPT és Claude — és amelyben a felhasználó szabadon húzgálhatja a különböző modellek által generált szövegrészeket, összerakva belőlük új ötleteket. Flintet elsősorban hirdetőknek és marketingeseknek ajánlják, akiknek ügyfelei a startup ügyfeleik.
Gyakorlati tesztekben, például egy MBA esettanulmányon (hogyan újítsuk meg a pénzügyi szolgáltatást a mai fiatalok számára), a mainstream modellek hasonló, klisés irányokat javasoltak (például pénzügyi tudatosság tanítása szórakoztató módon), míg Flint radikálisabb javaslatot tett: a vagyonfelhalmozás koncepciójának újramárkázását javasolta.
Springboards alapítói és korai használói hangsúlyozzák, hogy Flint még prototípus jellegű: nem működik mindig tökéletesen, és néha összeomlik, ha túl messzire tolják. Ugyanakkor a korai visszajelzések szerint hasznos lehet a „nehéz” kreatív ugrásokhoz: Zoe Scaman (Bodacious, 77X) szerint Flint „teljesen más irányokba tudja dobni” az ötletelést.
Figyelmeztetések és munkahelyi gyakorlatok
A marketingügynökségek egy része Flintet kiegészítő eszközként használja ChatGPT-vel, Claude-dal és Geminivel együtt. Maximilian Weigl, az Uncommon társalapítója és stratégiai igazgatója arra figyelmeztet, hogy bár az átlagos válaszok kilenc esetből tíz alkalommal elégségesek, nem érdemes AI-kimenetet vakon elfogadni. Szerinte a csapatoknak nem szabad csak kimásolt AI-szöveget beilleszteniük: „Gondolkodniuk, beszélniük kell másokkal és használni a saját hangjukat.”
Pip Bingemann szerint a cél egyszerű: választási lehetőséget adni a felhasználóknak, hogy eldöntsék, mikor akarnak megszokott, megbízható választ és mikor szeretnének szélesebb, inspirálóbb spektrumot. „A sokszínűség remek, ha ötleteket akarsz szikráztatni” — mondja — „menjünk el ezen az úton ahelyett, hogy a gépek alakítanának ki egy szürke, unalmas világot.”



