A VB Transform 2026 rendezvényen Bryan Silverthorn, az Amazon AGI Autonomy részlegének igazgatója azt állította, hogy az üzleti célú AI-ügynökök elterjedését nem elsősorban a modellek képességei, hanem a megbízhatóság hiánya fékezi. A Cisco adataira hivatkozva elmondta: a vállalatok 85%-a pilótaprojekteket futtat ügynökökkel, de mindössze 5% jutott el a termelési bevezetésig.
Négy dimenziós megbízhatósági keret
Silverthorn szerint a megbízhatóságot négy különálló dimenzióra kell bontani: következetesség (consistency), robusztusság (robustness), kiszámíthatóság (predictability) és biztonság (safety). Ezt a keretet egyetemi, princetoni kutatásra vezeti vissza, és azzal érvel, hogy ezek a tényezők sokszor összekuszálva jelennek meg a tesztekben.
„Kibontja azokat a különböző tényezőket, amelyeket majdnem minden értékelésben összekeverek” — mondta Silverthorn.
Miért buknak meg a tökéletesen teljesítő belső tesztek a valódi ügyfeleknél
A négy dimenzió gyakorlati jelentőségét az mutatja, hogy ügynökök rendszeresen átmennek belső értékeléseken, majd valós környezetben összeomlanak. Silverthorn példaként említett egy ügyfelet, amely szoftveres minőségbiztosításhoz telepített ügynököt sorozatszámok képernyőről való kinyerésére: az ügynök két hónapig problémamentesen működött, aztán időszakosan hibás számokat olvasott be. A vizsgálat szerint az ok az volt, hogy a látásérzékelő (vision encoder) másképp viselkedett attól függően, hogy a sorozatszám a képernyő mely pontján jelent meg, és egy ember számára észrevehetetlen szoftverváltozás váltotta ki a meghibásodást.
A tanulság Silverthorn szerint a mérésen van, nem csak a modelleken: a csapatoknak azonosítaniuk kell a variabilitás dimenzióit, és a mérési szigorúságot az alkalmazás kockázatához kell igazítaniuk.
A piackutatás megerősíti a problémát
A VentureBeat saját, konferencia előtt bemutatott kutatása alátámasztotta a megfigyelést: a megkérdezett cégek fele olyan ügynököt adott át, amely belső értékeléseken megfelelt, de a valódi ügyfelek számára nem. A vállalatok jellemzően az üzemidőt (uptime) figyelik, de sokszor figyelmen kívül hagyják a pontosságot (accuracy) — vagyis ellenőrzik a rendszert működés közben, de nem vizsgálják a kimenetek helyességét. Emellett a legtöbb vállalat a modellszolgáltatók saját értékeléseire támaszkodik, és kevés további védővonalat épít.
Az "intern" kultúra az Amazon AGI-laborban
Silverthorn egyik legemlékezetesebb javaslata kulturális jellegű volt: az Amazon AGI-laborban szó szerint „internnek” (gyakornoknak) hívják az ügynököket — „a gyakornokom beszél a gyakornokoddal”. A hasonlat mögött operatív filozófia áll: az ügynökök nagy erejűek, de időnként tájékozatlanok, képesek kimagaslóra és súlyos hibákra egyaránt.
Szerinte az ügynökök kezelése inkább menedzsment- mint szoftvermérnöki készséget igényel: feltenni a kérdést, hogy mi mehet rosszul, beépíteni tartalékokat és visszavonási lehetőségeket, illetve tudatosan meghatározni az elfogadható kockázatot. „Megkérdezheted a gyakornokot: »Hé, mi az, amit elronthatnál itt? Hogyan mérsékelheted a negatív következményeket?«” — fogalmazott. A labor elfogadta ezt a kompromisszumot: hajlandóak néha rossz kísérleteket megengedni a kutatási tempó érdekében; említettek egy ügynököt, amely éjjel-nappal futó kísérleteket végzett saját, magas szintű kutatási tervén.
Mit tegyenek a vállalati vezetők a skálázás előtt
Silverthorn nyílt volt a technológia korlátairól: a „self-improving” (önmagát javító) AI kifejezést „terhelt kifejezésnek” nevezte. Az Amazon folyamatosan használ AI-t modellek javítására, de a teljesen autonóm, önfejlesztő rendszerek még távol vannak. A labor továbbra is hangsúlyt fektet a számítógép-használatra (computer use); egy beszállítói példa szerint egy kereskedelmi fuvarozó ügyfél már böngészőautomatizálást alkalmaz, hogy összefűzze a széttagolt rendszerekben lévő jótállási igényeket. Ugyanakkor Silverthorn hangsúlyozta, hogy a jövő ügynökei nem fognak kizárólag számítógép-használatra támaszkodni: együtt fognak működni MCP-vel, API-kkal és más eszközökkel az end-to-end munkafolyamatok lezárásához.
Az LLM-eket bíróként használó technikák (LLM-as-judge) ígéretesek, de csak az egyik stratégia a képesség és az elfogadható kockázat összehangolására.
Végső tanácsa a pilótaállapotból való kilépéshez az elvárás megváltoztatása volt: ne azt kérdezd, hogy az ügynök képes-e egyszer lenyűgöző dolgot végrehajtani, hanem azt, képes-e azt helyesen megcsinálni ezerszer egymás után. A vállalatok, amelyek áttörik az 85%-os pilótaszintet, szerinte nem a legintelligensebb ügynököket fogják használni, hanem a legjobb menedzsereket.
Összegzés
A VB Transform 2026-on elhangzottak szerint az üzleti ügynökök termelési bevezetésének fő akadálya a megbízhatóság többdimenziós hiánya és a nem megfelelő mérési, tesztelési gyakorlat. A megoldás technikai fejlesztések mellett kulturális és menedzsment-váltást is követel: határozd meg a hibalehetőségeket, mérd azokat a megfelelő módon, és állíts fel felelősséget és visszavonási mechanizmusokat, hogy az ügynökök ismétlődően helyes döntéseket hozzanak.



