Kutatás

Mesterséges intelligenciával generált szöveg

Jennifer Neville: Mit tanítanak a hibák az AI-rendszerekről

A beszélgetés főszereplője Jennifer Neville, a Microsoft Research partner kutatásvezetője és a Purdue egyetemen is működő professzor, aki az AI rendszerek valós használatát és értékelését vizsgálja.

Jennifer Neville: Mit tanítanak a hibák az AI-rendszerekről

Jennifer Neville a Microsoft partner kutatásmenedzsere, aki a gyakorlati felhasználásra szánt mesterséges intelligencia viselkedését és értékelését vizsgálja. Pályája több fordulatot tartalmazott — matematika, fizika, kognitív tudomány, majd informatikai tanulmányok és kutatás —, és ma egyszerre dolgozik a Microsoft Researchnél és tölti be a Samuel D. Conte szék professzori pozícióját a Purdue Egyetemen. Nevillének több mint 130 publikációja van és több mint 10 000 hivatkozása; díjai között szerepel a National Science Foundation CAREER Award, az IEEE „10 to Watch” in AI listája és legjobb cikk díjak a International Conference on Data Mining és az International Conference on Learning Representations konferenciákról.

Mire fókuszál a kutatócsoport?

Neville vezetésével az AI Interaction and Learning csapat célja, hogy a mai AI-rendszerek határait a valós munkakörnyezetekben vizsgálja és tolja előre. A kutatás központi eleme az értékelés: a csapat szerint a hagyományos, gyakran egyszeri fordulóra (single-turn) optimalizált benchmarkok nem tükrözik a tényleges felhasználói munkafolyamatokat. Ehelyett a hangsúly olyan környezeteken van, ahol multiturn interakciók, együttműködő feladatok és hosszú-horizontú munkafolyamatok fordulnak elő, mert ezekben a beállításokban gyakran jelennek meg a rendszerek gyengeségei.

A kutatócsoport értékeléssel kezd: reprodukálják és strukturálják a felhasználói környezeteket, hogy feltárják a teljesítménybeli réseket. Ezek után fejlettebb algoritmusok, modellek és becslési módszerek kifejlesztésére törekszenek, amelyek a valós használatban jelentkező problémákat célozzák.

Meglepő hibák a multiturn és hosszú munkafolyamatokban

Neville munkái közül több konkrét vizsgálat a multiturn párbeszédekre és az ügynökalapú, dokumentumokkal végzett hosszú-horizontú feladatokra fókuszál. Egy 2025-ös publikációjukban ("LLMs Get Lost In Multi-Turn Conversation") azt mutatták ki, hogy ha egy korábban single-turnként definiált, teljesen specifikált feladatot szimulált felhasználói kiegészítésekkel több fordulóra bontanak, a modellek teljesítménye jelentősen romlik. Ez fontos megállapítás, mert a modelleket sokszor single-turn benchmarkokra optimalizálják, és a magas eredmények nem feltétlenül tükrözik a valós, iteratív felhasználói viselkedést.

Hasonlóan, a csapat kutatásai azt is feltárták, hogy agent-szerű rendszerek és hosszú szerkesztési munkafolyamatok során a hibák felhalmozódása vezethet a dokumentumok szemiotikai tartalmának eltűnéséhez vagy a rendszer további összezavarodásához. Egy 2026 áprilisában közölt publikációjuk címe: "LLMs Corrupt Your Documents When You Delegate", amely az ilyen jellegű problémákat tárgyalja, és további blogbejegyzések (május 2026) részletezik a hosszú-horizontú megbízhatósággal kapcsolatos megjegyzéseiket.

Hogyan szerzik az intuíciót a felhasználói viselkedésről — és mi a helyzet az adatvédelemmel?

Neville szerint az ipari kutatóintézetek egyik előnye, hogy nagy léptékű termékadatokból lehet mintázatokat kinyerni arról, hogyan használják a valós felhasználók a rendszereket, és milyen típusú hibákkal találkoznak. Ugyanakkor hangsúlyozza: a csapat nem nézi "kézbe" a személyes interakciókat; a mintázatelemzés privát, korlátozott környezetben és adatvédelmi megfontolásokkal történik. A cél a magas szintű, anonimizált és privát megfigyelések alapján irányt adni a kutatásnak, nem pedig egyéni felhasználói naplók közvetlen megtekintése.

A kutató azt is kiemeli, hogy a felhasználói visszajelzések nagyobb részletessége (nem csak egy egyszerű "like/dislike", hanem konkrét leírás arról, mi ment rosszul) nagyon hasznos lehet a modellek fejlesztésében.

Gyakorlati javaslatok a jelenlegi rendszerek használatához

Neville következetes gyakorlati tanácsokat ad: a jelenlegi AI-rendszerek hasznosak, de nem teljesen megbízhatók minden feladatra. A fontosabb javaslatok:

  • Ellenőrizze a modellek válaszait; ne delegáljon teljes automatizmust ellenőrzés nélkül.
  • Ha egy multiturn párbeszéd összezavarja a modellt, érdemes a csevegést törölni és a feladatot egy jól megfogalmazott, egyfordulós instrukcióként újra beadni.
  • Adjon részletes visszajelzést, ha valami rosszul ment; a pontos leírások segítik a jövőbeli javításokat.

Neville hangsúlyozza, hogy a felhasználók „fokozatosan tanulnak” együtt az új felületekkel, ahogy annak idején megtanulták hatékonyan használni a keresőket.

A jövő: architektúrák és hosszú távú interakciók

Neville szerint két fő irány lehet meghatározó: egyrészt a transformer-alapú architektúrák korlátainak kezelése a körítés (wrapper) és agent-megközelítések révén; másrészt alternatív modell- és architektúra-fejlesztések, amelyek jobban szolgálják a hosszabb távú, állapotkövetést igénylő feladatokat. A kutató bízik abban, hogy gyors előrelépés várható a következő években a kutatók számának és a számítási erőforrások skálájának növekedése miatt.

Mit jelentene a siker?

Neville mércéje szerint sikeresnek tekintené a kutatását, ha a munkahelyi környezetekben emberek és AI-rendszerek képesek lennének együtt, csapatként működni és innoválni. Kutatói pályafutása során a komplex rendszerek kezelésére és a többember–több-AI együttműködésre fókuszáló kérdések állnak középpontban.

Rövid személyes reflexiók

A beszélgetés során Neville megosztott két tanulságot is: egy korai tanács, amely arra ösztönözte, hogy merjen kérdezni mások jelenlétében, és egy gyakorlati tapasztalatot: „nézd meg az adatot” — többször tanulta meg a nehéz úton, hogy amikor a modellek váratlanul viselkednek, gyakran maga az adathalmaz vagy annak eltérése a probléma forrása.

A közvetlen tanács a felhasználóknak: használják a rendszereket felügyelettel, adjanak részletes visszajelzést, és fogadják el, hogy a kutatás még zajlik, miközben a felhasználói használat segít a fejlődésben.

Kapcsolódó publikációk (említve a beszélgetésben)

  • "LLMs Get Lost In Multi-Turn Conversation" — Publication | May 2025
  • "LLMs Corrupt Your Documents When You Delegate" — Publication | April 2026
  • "Further Notes on Our Recent Research on AI Delegation and Long-Horizon Reliability" — Microsoft Research blog | May 2026