Iparág

Mesterséges intelligenciával generált szöveg

Vállalati bizalom nő az automatizált ügynökértékelésben, de a valós hibaarány változatlan maradt

A VentureBeat Pulse Research júliusi felmérése 108, legalább 100 fős szervezet válaszai alapján vizsgálta az automatizált ügynökértékelések megbízhatóságát.

Vállalati bizalom nő az automatizált ügynökértékelésben, de a valós hibaarány változatlan maradt

A VentureBeat Pulse Research júliusi, ugyanolyan kérdőívvel végzett felmérésének második hullámában 108, legalább 100 főt foglalkoztató vállalat válaszai azt mutatták: a szervezetek bizalma az automatizált ügynökértékelés iránt jelentősen nőtt, miközben az olyan esetek aránya, amikor egy rendszer az értékelésen átment, majd ügyfélkiszolgálásnál meghibásodott, nem változott.

Főbb számok és időhorizont

  • Felmérés: VentureBeat Pulse Research, "agentic reliability and evals tracker", július 2026. hullám.
  • Mintanagyság: 108 válaszadó szervezet (100 vagy több alkalmazott).
  • Összehasonlítás: június 2026 hullám (n=157), azonos kérdőív alapján.

Mi mozdult el — a bizalom

A júniusi 5%-ról júliusra 13%-ra nőtt azoknak a szervezeteknek az aránya, amelyek teljes mértékben megbíznak az automatizált értékelésben. Ugyanakkor az az aggály, hogy az értékelések rosszul illeszkednek a valós kimenetekhez, 29%-ról 19%-ra csökkent — így már nem ez a leggyakoribb kifogás.

Ezek a változások statisztikailag jól kimutathatók a június–július összehasonlításban, és irányt jeleznek: a bizalmi mutatók javultak.

Mi nem változott — a hibaarány

A vizsgált mutató szerint változatlan maradt az, hogy a vállalatok belső értékeléseken átment ügynököt élesben bevetve ügyfélkiszolgálási hibát okoztak. A válaszadók 49%-a mondta, hogy az elmúlt 12 hónapban olyan ügynököt vagy LLM-funkciót telepítettek, amely átment a belső értékeléseken, majd ügyfélnél hibát okozott (júniusban 50% volt). A válaszadók 24%-a tapasztalt ilyet többször — ez is változatlan.

Ez a stabilitás az elemzés támasza: amíg a hibaarány nem csökken, a megnövekedett bizalom nem tükröz jobb helyzetet a valós működésben.

A bizalom honnan jön? — a „burned” és a „non-burned” szétválasztás

A kereszt-táblázatokból az derül ki, hogy az új bizalom elsősorban azoknál a vállalatoknál jelentkezik, amelyek még nem szenvedtek el olyan, értékelés miatti túlzott bizalomból fakadó hibát. A 53 vállalatból, amelyeknél előfordult, hogy az értékelésen átment ügynök később ügyfélnél hibázott, csak 4% bízik teljesen az automatizált értékelésben. Ezzel szemben a 41, ilyen esetet nem tapasztaló szervezet 24%-a ad teljes bizalmat.

A júliusi bizalomjavulás tehát nagy részben a tapasztalatlanságból fakad: az újonnan megkérdezett, kevésbé „megégetett” szervezetek emelik a bizalmi átlagot.

Autonómia: a hibát átélt szervezetek sem lassítanak

A válaszadók 67%-a vagy már engedélyezi a „zero-human” (emberi ellenőrzés nélküli) telepítést alacsony kockázatú ügynököknél (37%), vagy azon dolgozik, hogy egy éven belül ezt lehetővé tegye (30%) — ez megegyezik a júniusi 67%-kal. A teljes elutasítás aránya 22%-ról 18%-ra csökkent.

Érdekes módon azok a szervezetek, amelyek már szenvedtek el olyan hibát, nagyobb valószínűséggel haladnak az autonómia irányába: a „burned” csoport 85%-a van azon az úton, míg a nemütött csoportban ez 61%. A magyarázat valószínűleg az, hogy azok a vállalatok, amelyek elég sokszor telepítenek ahhoz, hogy egyszer- vagy többször ügyfélhibát okozzanak, nagyobb volumenben és kifinomultabb pipeline-okkal rendelkeznek, így a hibát működési költségként kezelik, nem visszafogó tényezőként.

Ez a dinamika magyarázza, hogy bár a relatív hibaarány stabil marad, az abszolút incidensek száma nőhet, ha a legaktívabb szereplők ember nélküli telepítést skáláznak.

A piac konszolidálódni kezd — specialisták nőnek, a „semmi” csökken

A dedikált értékelőeszközök használata növekszik: a „nincs dedikált eszköz” aránya 17%-ról 12%-ra csökkent. A specialisták részesedése nőtt: Braintrust primér használata közel megduplázódott 8%-ról 15%-ra, DeepEval pedig 17%-on áll. A modellszolgáltatók saját eszközei nagyjából stabilak (OpenAI 18%, Anthropic 12%).

Ha nem csak a primér, hanem az „együtthasznált” használatot nézzük, OpenAI natív evals 31%-on, DeepEval 27%-on, Braintrust 22%-on, Anthropic natív evals 20%-on, saját fejlesztés 14%-on, Weave és Langfuse 11%-on állnak. Még mindig 19% jelezte, hogy sehol sem használ dedikált eszközt.

Ez az első jele annak a sorozatnak, hogy kialakul egy külön értékelési réteg a vállalati stackekben.

Termelésfigyelés: sok helyen a működést figyelik, nem a helyességet

A gyártási monitorozás fókusza változatlan: a szervezetek 50%-a csak azt figyeli, hogy az ügynök működik-e (válasz érkezik-e, lefutott-e a kérés, van-e hibajelzés), míg 26% futtat automatizált ellenőrzéseket arra, hogy a kimenet helyes-e. Az inline minőségellenőrzés és a tranzakció-trace naplózás egyaránt 26%-on állnak.

Különösen aggasztó, hogy a zero-human telepítést engedélyező vállalatok közül mindössze 28% futtat inline minőségellenőrzést a termelési forgalmon. Vagyis sok helyen eltávolították az embert a telepítés kapujából, de nem helyettesítették működés közbeni kimenet-ellenőrzéssel.

Beszerzési kritériumok: az integrációs könnyűség legfontosabb

A kiválasztási szempontok között az „integrálhatóság, könnyű beépíthetőség” ugrott a vezető tényezővé 27%-ról 39%-ra, megelőzve a költséget (23%). Az értékelés pontosságát 28% jelölte elsődleges szempontként. Ez azt jelzi, hogy a vállalatok már nem elsősorban áron vásárolnak, hanem azon mérlegelnek, hogy egy új eszköz mennyire illeszkedik meglévő pipeline-jaikba.

Ami nem változott: a sikermutatóként legfontosabbnak tartott jellemző továbbra is az értékelések konzisztenciája 38%-kal (júniusban 36%). A jelenlegi eszközökkel való elégedettség középértéke 3,9 volt egy ötfokozatú skálán (júniusban 3,8).

Befektetési prioritások: emberi felülvizsgálók növelése

A válaszadók 31%-a az emberi felülvizsgálati munkafolyamatokra tervez a legtöbbet költeni a következő évben, 30% pedig a produkciós megfigyelésre. Az automatizált értékelési csővezetékekre fordított növekmény 19% körül van.

A „burned” szervezetek különösen hajlandóak emberi felülvizsgálatra költeni: közöttük 38% jelölte ezt a leggyorsabban növekvő tételként, míg a nem „burned” vállalatok 24%-a választotta ugyanígy, ők inkább az observability eszközöket preferálják. Ez a stratégia: automatizálják a telepítési döntést, és embereket finanszíroznak arra, hogy elkapják, amit az automatizáció elnéz.

Váltási hajlandóság csökken

A júliusi mintában 56% jelezte, hogy 12 hónapon belül új, kiegészítő vagy cserélendő értékelési platformot tervez bevezetni (júniusban 64% volt). Azok aránya, akik rövid távon terveznek lépni, 31%-ról 24%-ra csökkent, míg a nem tervezők aránya 36%-ról 44%-ra nőtt. A változás összhangban van azzal, hogy az eszközvásárlás átmegy a kiválasztáson az implementáción.

A válogatási listák élén OpenAI natív evals (20%) és Braintrust (18%) szerepelnek a 60 szervezet, amely váltást fontolgat, míg Weights & Biases Weave 12%-on és DeepEval 10%-on állnak.

Összefoglaló — bizalom nőtt, helyesség nem

A júliusi hullám egyértelmű irányt mutat: a bizalmi mutatók javultak, a vállalatok szélesebb körben eszközölnek dedikált értékelési platformokat, és a vásárlásoknál az integrálhatóság került előtérbe. Ugyanakkor a valós hibaarány — az a százalék, amikor az értékelésen átment ügynök ügyfélnél hibázik — változatlanul magas, nagyjából 49%.

A keresztmetszeti adatok szerint a bizalom növekedése elsősorban azoknál a cégeknél jelentkezik, amelyek még nem tapasztaltak ilyen hibát. A hibát elszenvedett szervezetek nem visszakoznak az autonómia elől; épp ellenkezőleg, nagyobb arányban lépnek a zero-human telepítés irányába, miközben erőteljesen finanszírozzák az emberi felülvizsgálatot. A termelésfigyelés viszont sok helyen még mindig nem a kimenetek helyességét méri, így a bizalom növekedése és a tényleges kockázatkezelés között rés tátong.

Módszertan és korlátok

A felmérés önszelektív mintán alapul, 108 kvalifikált válaszadó szervezet adataira támaszkodik (100+ alkalmazott). A júliusi instrumentum megegyezett júniusival, ezért a hónapról hónapra összehasonlítások értelmezhetők. A mintaméret irányadó jellegű következtetésekhez elegendő, de nem ad precíz populációs becslést; az iparági összetétel júniushoz képest eltolt: a Technology/Software aránya csökkent (23% → 14%), Retail/Consumer nőtt (15% → 19%). Ezek a kompozíciós változások befolyásolhatják a bizalom-mutatókat.


(Report: VentureBeat Pulse Research — július 2026 hullám, összehasonlítva a június 2026 hullámmal.)