Iparág

Amazon: az AI-ügynökök megbízhatósága, nem képessége akadályozza a vállalati bevezetést

A főszereplő Bryan Silverthorn, az Amazon AGI Autonomy igazgatója, aki a korábbi Adept AI felvásárlás révén került az Amazonhoz és multimodális ügynökök tréningjét vezeti az AGI laborban.

Amazon: az AI-ügynökök megbízhatósága, nem képessége akadályozza a vállalati bevezetést

A VB Transform 2026 konferencián tartott beszédében Bryan Silverthorn, az Amazon AGI Autonomy igazgatója azt hangsúlyozta, hogy az üzleti célú AI-ügynökök elterjedését nem a modellek képességei, hanem azok megbízhatósága akadályozza. A Cisco adataira hivatkozva elmondta: az vállalatok 85%-a próbál ki AI-ügynököket, de csak 5%-uk juttatta el ezeket éles, gyártásba állított rendszerekbe.

A megbízhatóság négy dimenziója

Silverthorn ismertetésében a megbízhatóságot négy külön álló dimenzióra bontotta: konzisztencia, robosztusság, prediktabilitás és biztonság — keretet, amelyet kutatásokhoz kapcsolódóan a Princetonnak tulajdonított. Szerinte ez a felbontás segít szétválasztani azokat a tényezőket, amelyek gyakran összekeverednek a belső értékelésekben.

Miért buknak el az ügynökök az éles használatban?

A keret jelentősége abból fakad, hogy számos ügynök kiválóan teljesít a belső teszteken, de a valós környezetben csődöt mond. Silverthorn példaként egy olyan ügyfelet említett, amely szoftveres minőségbiztosításra telepített ügynököt sorozatszámok képernyőről történő kinyerésére: a rendszer két hónapig hibátlanul működött, majd időnként téves számokat olvasott. A hiba oka az volt, hogy a látásért felelős encoder másként viselkedett aszerint, hogy a sorozatszám a képernyő mely részén jelent meg; egy, az emberi szem számára észrevehetetlen szoftverváltozás indította el a hibajelenséget.

Silverthorn szerint a tanulság a mérésről szól, nem csupán a modellekről: természetesen a modelleket is fejleszteni kell, de ennél fontosabb, hogy a csapatok azonosítsák a variabilitás dimenzióit, és a mérési módszereket az alkalmazás kockázati szintjéhez igazítsák. A VentureBeat saját kutatása, amelyet a szekció előtt mutattak be, alátámasztja ezt: a megkérdezett vállalatok fele olyan ügynököt juttatott ki, amely belső értékeléseken átment, de a valós ügyfeleknél megbukott. Emellett a válaszadók túlnyomó többsége az uptime-ot követi, miközben az pontosságot gyakran figyelmen kívül hagyja — vagyis megmérik a pulzust, de nem győződnek meg a diagnózisról.

Egy másik megállapítás szerint a legtöbb vállalat alapértelmezésben a modellgyártók saját értékeléseire támaszkodik, és ennél kevesebbet tesztel: a szerző szavai szerint ez a megközelítés gyakran egyérmefeldobás a szállítóra való vak bizalom és a semmilyen ellenőrzés között.

Amazon „intern” megközelítése: kulturális és operatív javaslatok

Silverthorn legismertebb ajánlása kevésbé technikai, inkább kulturális jellegű. Az Amazon AGI laborján belül a kutatók szó szerint „internnek” (gyakornoknak) nevezik az ügynököket — így hangzik: „megkérem a gyakornokom, hogy beszéljen a te gyakornokoddal”. A hasonlat komoly működési filozófiát takar: az ügynökök hatékonyak, de időnként tévednek, tehát menedzselésük menedzsmentkészséget igényel, nem pusztán szoftvermérnöki megközelítést.

Konkrétan Silverthorn azt javasolja: kérdezzük meg előre, mi mehet rosszul; építsünk be tartalékokat és visszavonási lehetőségeket; és tudatosan döntsük el, milyen kockázatokat vagyunk hajlandók elfogadni. Példaként említették, hogy az Amazon labor elfogadja azt a kompromisszumot, hogy az ügynökök néha rossz kísérletet futtatnak, cserébe gyorsabb kutatási haladás érhető el — egy ügynök például 24/7 futtatott kísérleteket a saját magas szintű kutatási tervén.

Mit tegyenek a vállalati vezetők a skálázás előtt?

Silverthorn nyíltan beszélt a technológia jelenlegi korlátairól. A „önjavuló AI” kifejezést még mindig problémásnak nevezte: az Amazon folyamatosan használ AI-t modelljei javítására, de a teljesen autonóm önjavulás még távoli. A labor továbbra is foglalkozik a számítógép-használattal (computer use) mint képességgel; említette, hogy egy kereskedelmi fuvarozási ügyfél már böngészőautomatizálást használ több rendszert összekapcsolva garanciális igények feldolgozására. Ugyanakkor hangsúlyozta, hogy a jövőbeli ügynökök nem fognak kizárólag a számítógép-használatra támaszkodni: MCP-kel, API-kkal és más eszközökkel együttműködve hajtanak végre komplex, end-to-end munkafolyamatokat.

Az LLM-eket „bíróként” használó technikák ígéretesek, de Silverthorn szerint csak egy a több lehetséges stratégiából arra, hogy az ügynökök képességét összhangba hozzuk a megengedett kockázattal.

Végső üzenete a vállalatoknak: hagyják abba annak kérdezgetését, hogy tud-e az ügynök egyszer egy lenyűgöző feladatot végrehajtani, és kezdjenek el azon dolgozni, hogy meg tudja-e azt csinálni hibátlanul ezerszer egymás után. Aki kijut a 85%-os „pilot purgatóriumból”, az nem feltétlenül a legokosabb agentet birtokolja majd, hanem azt, aki a legjobban menedzseli és biztosítja a megengedett kockázatokat.

Kulcspontok

  • 85%: a Cisco szerint ennyi vállalat pilótáz AI-ügynököket; 5%: ennyi juttatta őket gyártásba.
  • A megbízhatóság négy dimenziója: konzisztencia, robosztusság, prediktabilitás, biztonság (Princeton-kapcsolat).
  • A VentureBeat kutatása szerint a cégek felénél előfordult, hogy belső teszten átment ügynök a valós ügyfeleknél megbukott.
  • Javaslatok: mérjünk változékonysági dimenziókat, alkalmazzunk visszavonási és biztonsági mechanizmusokat, és prioritásként kezeljük a menedzsmentet a skálázásnál.