Biztonság

Mesterséges intelligenciával generált szöveg

A valódi gépi következtetés hiánya: miért nem elég a nagy nyelvi modellek intuíciója

A cikk szerzője Thore Graepel, aki az AlphaGo fejlesztésében dolgozott és jelenleg a University College London gépi tanulás tanszékének vezetője.

A valódi gépi következtetés hiánya: miért nem elég a nagy nyelvi modellek intuíciója

2016 márciusában Szöulban Thore Graepel egy olyan program egyik építését követően nézte, amellyel kapcsolatban a döntő ötjátszmás mérkőzés második partijának 37. lépését sokan „gondatlannak” vagy véletlen hibának vélték. A lépés látszólag ajándék volt az emberi ellenfél, Lee Sedol felé, ám nem hiba: AlphaGo megnyerte a játszmát, a párharcot pedig végül 4–1-re maga mögé utasította Lee Sedolt, a Go egyik legnagyobb profiját. Lee a mérkőzés után azt mondta, hogy korábban valószínűségszámításnak és pusztán gépi működésnek hitte AlphaGo-t, de az említett lépés meggyőzte: a gép kreatívnak tűnt.

Miért különbözött AlphaGo működése a hagyományos sakkszoftverektől?

Amikor 1997-ben a Deep Blue legyőzte a világbajnok Garry Kasparovot, a győzelem annak tulajdonítható, hogy a gép 6–8 lépéssel előre nézett játékosonként és másodpercenként mintegy 200 millió sakktáblát értékelt, olyan szabályok alapján, amelyeket emberek kódoltak be. A Go viszont sokkal összetettebb: egy kő értékét a távoli csoportok és a terület alakulása határozza meg több tucat lépés távlatában. Egy egész lehetséges jövőhalmaz számításához szükséges erőforrások elképzelhetetlenül nagyok lennének.

AlphaGo ezért két fő komponensből állt: egy politikai (policy) hálózatból, amely megtanult erős emberi játékosok lépéseit megjósolni, és egy keresőgépezetből, amely explicit módon felépített és végignézett egy több ezer ágból álló játékkönyvet (game tree). A politikai hálózat „intuitív” ajánlásai között a 37. lépés nem tűnt különlegesnek — körülbelül 1/10 000 valószínűséggel szerepelt volna egy profi játékos mintáiban. Amitől a lépés megtörtént, az a keresés volt: a rendszer felmérte a jövőbeli következményeket, végigpróbált variációkat és azok eredményeit, és így meghozta a döntést.

Kettős gondolkodás: rendszer 1 és rendszer 2 gépi párhuzamai

A viselkedéstudományban népszerűsített, Daniel Kahneman által ismertetett különbség: a gyors, ösztönös, erőfeszítésmentes gondolkodás (Rendszer 1) és a lassú, lépésenkénti, megfontolt gondolkodás (Rendszer 2) jól alkalmazható AlphaGo magyarázatára. A hálózatok adták a megérzéseket (ez a pozíció ígéretesnek tűnik), a keresés pedig a deliberációt (ezeket a megérzéseket kipróbáljuk a lehetséges ellenlépések fényében). Egyik fél önmagában kevés lett volna: az intuíció nem választotta volna a 37. lépést, a nyers erőforrás-keresés pedig nem tudta volna hatékonyan leszűkíteni a lehetséges lépéseket.

Miben különböznek a mai nagy nyelvi modellek?

A jelenlegi nagy nyelvi modellek (LLM-ek) alapművelete a következő token előrejelzése többször ismételve. Ez tulajdonképpen Rendszer 1 mechanizmus: gyors, asszociatív és kiváló minta-kiegészítésben. A ChatGPT megjelenése után azonban kiderült, hogy puszta nyelvi folyékonyság önmagában nem elég a valódi hasznossághoz. Ezt a hiányt részben az intermediate lépések generálására ösztönző „chain of thought” (gondolatmenet) módszerrel próbálták orvosolni: a modell nem rögtön válaszol, hanem bontja a feladatot és köztes eredményeket generál.

Ez azonban nem hoz létre valódi, elkülönült gondolkodási mechanizmust. A láncok előállítása ugyanazt a következő-token előrejelzési folyamatot használja, csak hosszabb iterációban, mielőtt a modell válaszra „commit”-ol. Három alapvető hiányosság miatt ez a fajta működés mégsem felel meg a tudományos értelemben vett érvelésnek:

  • A modellek rendszerint nem tartanak fenn explicit, tartós és átlátható epistemikus állapotot: nincs nyilvántartás arról, mely hipotéziseket fontolgatják, milyen bizonyossággal, milyen bizonyítékok alapján, és mely kérdések maradtak megválaszolatlanul.
  • Hiányzik a tudás és a tudás manipulálásának tiszta elkülönítése: a hálózati súlyokban keverték össze, mi a rendszer „tudása” és hogyan „gondolkodik” arról.
  • Bár a láncok úgy néznek ki, mint a deliberáció, kutatások kimutatták, hogy a modellek gyakran utólag fabrikálják a gondolatmenetet: a válasz többnyire egy másik belső úton születik meg, és utólag illesztik hozzá a logikusnak tűnő történetet.

Miért fontos ez a különbség a gyakorlatban?

Magas tétű alkalmazásoknál — orvoslásban, mérnöki döntésekben, tudományos kutatásban — nemcsak az eredmény számít, hanem az is, hogyan jutott oda a rendszer. Hibák esetén szükség van a gyökérokok feltárására: a rossz következtetés a hibás érvelés következménye volt, helytelen bizonyítékokra támaszkodott, vagy téves feltételezéseket használva ért véget?

Ezért Graepel bejelentette, hogy nemrég elhagyta Google DeepMind pozícióját, és új megközelítésre van szükség a gépi következtetés terén: olyasmire, ami AlphaGo architektúrájából merít. AlphaGo egy explicit játékfát tart fenn, amelyben minden vizsgált változat és pozíció a hálózatok ítéleteivel van annotálva; a rendszer ezt folyamatosan frissíti és végül ebből szintetizál döntést.

Mire lenne szükség általános következtetéshez?

Általános érvelésnél egy rendszernek olyan epistemikus állapotot kell fenntartania, amely leírja, mi tekinthető rendezettnek, mi kétségesnek, mi kizárt, és mely kérdések maradtak nyitva. Az érvelés ekkor úgy értelmezhető, mint egy lépéssorozat, amely módosítja ezt az állapotot, csökkenti a bizonytalanságot: következmények levezetése, problémák részekre bontása, és — lényeges — a következő releváns kérdés, számítás vagy kísérlet kiválasztása.

Nyitott világban a feladat nehezebb, mint a táblajátékoknál: a jelenlegi állapot részben ismert, a lehetséges cselekvések köre nagy és változó, és a következmények véletlenszerűek vagy ismeretlenek lehetnek. Ugyanakkor a modern LLM-ek és más neurális modellek már képesek segíteni: javasolhatnak megközelítéseket, integrálhatnak külső eszközöket API-kon keresztül vagy kóddal, és értékelhetik, hogy az állítások mennyire támaszthatók alá a rendelkezésre álló bizonyítékokkal.

A legfontosabb azonban, hogy a rendszer egy független komponense értékelje minden „lépést” aszerint, mennyiben csökkenti ténylegesen a bizonytalanságot, és a hiedelmeket csak akkor frissítse, ha a változás bizonyítékokkal alátámasztott. Ezeknek a szabályoknak a betartása lehetővé teszi a hiteles tudás felhalmozását és a következtetési politikák tanulását a korábbi érvelési tapasztalatokból. Ezt a megközelítést Graepel a „tudományos módszer felgyorsításaként” írja le: célja a vizsgálatnak ellenálló, ellenőrizhető tudás előállítása.

Következtetés

Graepel szerint nem a rendszer 1 méretezésével érjük el a megbízható gépi intelligenciát: a több adat és nagyobb hálózat ugyan élesebbé teszi az intuíciót, de nem teszi deliberatívvá. Az olyan áttörésekhez, amelyek gyógyszerfejlesztésben, anyagtudományban, klímakutatásban vagy diagnosztikában újszerű, megbízható megoldásokat adnak, olyan rendszerekre van szükség, amelyek valóban következtetnek — azaz döntéseik auditálható sorozatán alapulnak, nem pedig utólag kreált, meggyőző történeteken.