A VentureBeat Pulse Research júniusi, 2026-os hullámában végzett felmérés 157, legalább 100 fős szervezet technikai vezetőit kérdezte arról, hogyan mérik és engedélyezik az AI-ügynökök (agentek) teljesítményét és megbízhatóságát. A központi következtetés egy „értékelési rés”: a vállalatok nagyobb függetlenséget adnak az ügynököknek, miközben kevesebb bizalommal kezelik azokat a automatizált értékeléseket, amelyeknek ezt a függetlenséget kellene szabályozniuk.
Mi történt és miért számít
- A válaszadók fele (50%) az elmúlt 12 hónapban telepített olyan ügynököt vagy LLM-funkciót, amely átment a belső értékeléseken, de végül ügyféloldali hibát okozott (helytelen válasz, megszakadt folyamat vagy minőségi incidens). A megkérdezettek egynegyede többször is találkozott ilyennel.
- Csak 36% nyilatkozott úgy, hogy nem találkozott ilyen esettel; 8% nem végez előtelepítési értékelést, 6% pedig nem követi elég szorosan az okot.
Ez a jelenség azt mutatja: egy átment értékelés nem feltétlenül garantál működő, ügyfélkörnyezetben helytálló ügynököt.
A bizalom hiánya az automatizált értékelésekben
- Mindössze 5% mondta, hogy teljes mértékben megbízik a jelenlegi automatizált értékelésekben. A megkérdezettek 95%-a jelölt meg legalább egy korlátot.
- A leggyakoribb kifogás (29%) az, hogy az értékelések rosszul illeszkednek a valós világ eredményeihez — ez közvetlenül magyarázza a fent idézett deploy-onkénti hibákat.
- További aggodalmak: torzítás vagy következetlenség (21%), magyarázhatóság hiánya (18%) és adat-szivárgás/privát adatok kezelése az értékelési folyamatban (17%).
Az autonómia növekedése a bizalom ellenére
- A szervezetek kétharmada (66%) vagy már megengedi, vagy azon dolgozik, hogy lehetővé tegye a teljesen automatizált, emberi validáció nélküli (zero-human-in-the-loop) telepítést alacsony kockázatú ügynökök esetén: 34% már engedélyezi, 33% pedig az elkövetkező 12 hónapban tervezi ezt a képességet.
- Csak 22% zárja ki ezt a lehetőséget a közeljövőben.
- A nagyobb vállalatok (2,500+ alkalmazott) enyhén előrébb járnak ezen az úton: 70% felé tartanak a zero-human gyakorlat felé szemben a kisebbek 64%-ával; nagyobb arányban jelentettek értékelésen átment, majd ügyfélhibát okozó ügynököt (54% vs. 48%).
Ez a párhuzam – növekvő autonómia és alacsony bizalom – az „értékelési rés” lényegét adja: az autonómia gyorsabban nő, mint ahogy az értékelési biztosíték fejlődik.
Az értékelési eszközök piacának állapota
- Az értékelési réteg korai, széttagolt és részben szolgáltató-vezérelt. A leggyakoribb elsődleges eszközök a szolgáltatók natív értékelő eszközei: OpenAI natív evals és trace-ek (17%) és Anthropic Claude Console evals (13%).
- Meglehetősen gyakori válasz volt továbbá, hogy nincs dedikált értékelő eszköz: 17%.
- Speciális értékelő szereplők megoszlása: DeepEval (12%), Braintrust (8%), valamint LangSmith, Weave, Promptfoo, Langfuse, Arize említése alacsony egy számjegyű vagy alacsony kétszámjegyű arányokkal. 11% saját megoldást épített.
A piac konszolidálatlan: nincs még egyértelmű, iparági szabvánnyá váló független platform.
Gyártásmonitorozás: működés vs. helyesség
- A gyakorlatban a szervezetek többsége a rendszer működését figyeli (uptime, válaszidő, hibák, költség), nem pedig az output helyességét.
- 51% kizárólag a rendszer működését monitorozza, 23% monitorozza az válaszok helyességét, a többiek ad-hoc felülvizsgálatokra vagy ismeretlen állapotra támaszkodnak.
Ez azt jelenti, hogy körülbelül háromnegyedük nem futtat automatizált, valós idejű minőségi ellenőrzést a kimenetek helyességére — a magabiztosan téves válaszok gyakran láthatatlanok maradnak.
Eszközválasztás és sikermutatók
- Az értékelő eszköz választását leginkább az ár (28%) és az integráció egyszerűsége (27%) befolyásolja, megelőzve az értékelési pontosságot (24%).
- A siker mércéjeként a konszisztencia, azaz ugyanazon viselkedésre ugyanaz a verdikt (36%) a legfontosabb, megelőzve a kísérletezés sebességét (19%) és a hibák csökkenését (18%).
- Az elégedettség a jelenlegi eszközökkel mérsékelt: átlagosan 3,8 egy ötfokozatú skálán.
Befektetési irányok: több megfigyelés és emberi felülvizsgálat
- A következő egy évben a legnagyobb növekvő költés a produkciós observability-re irányul, második helyen pedig a humán felülvizsgálati munkafolyamatok állnak (26%).
- Mindehhez képest csak 16% növeli az automatizált értékelési csővezeték költését. A vállalatok egyszerre készülnek az autonómiára és növelik a felügyeleti kapacitást — emberi döntéshozókat tartva a kritikus esetekre.
Eszközváltás a következő 12 hónapban
- A megkérdezettek 64%-a tervez új, kiegészítő vagy cserélő értékelési platformot bevezetni 12 hónapon belül; 31% a következő negyedévben.
- A legnagyobb érdeklődést Confident AI DeepEval (20%), OpenAI natív evals (13%) és Braintrust (9%) kapta — a nyitott forrású, vagy feltörekvő specializált szereplők vonzóbbnak tűnnek, mint a jelenlegi elterjedtségük.
Összegzés: az értékelési rés nem magától zárul be
A 157 európai és északamerikai válaszadó (legalább 100 alkalmazottas szervezetek, adatfelvétel: 2026. június) irányadó képet ad: a vállalatok több autonómiát adnak az AI-ügynököknek, mint amennyire bíznak az értékelő tesztekben. Félük már találkozott olyan esettel, amikor az értékelés átment, de a telepítés ügyfélhibát eredményezett; mindössze 5% bízik teljesen az automatizált értékelésekben; és a legtöbben a működést figyelik gyártásban a helyesség helyett.
A piac korai, szolgáltató- és házon belüli megoldásokkal vegyes; a többség tervez váltást vagy bővítést az elkövetkező évben. Ugyanakkor a cégek növelik a megfigyelést és a humán felülvizsgálatba fektetett költést is, ami azt jelzi, hogy érzik az értékelési rést, miközben egyébként az automatizált telepítések irányába építkeznek. A kulcskérdés a következő hullámokban: utoléri-e az értékelési biztosíték az autonómiát, vagy a példaértékűen téves, „átment” agentek hibái átkerülnek a teljesen automatizált telepítésekbe.
Módszertan és korlátok
- A felmérés a VentureBeat Pulse Research sorozat része, 157 válaszadóval, egyetlen, 2026. júniusi hullámból; a válaszadók szervezetei legalább 100 fősek.
- A mintavétel önkéntes, nem valószínűségi minta, közepes vállalati méret felé torzít; az adat iránymutató jellegű, nem pontos populációs mérés.
- A válaszadók között 38% végső döntéshozó az AI-beszerzéseknél, további 34% ajánló vagy befolyásoló; címek: termék- és programmenedzserek, tanácsadók, mérnökség/IT igazgatók, CIOk/CTOk/CISOk és mások. Iparágak: Technology/Software (23%), Retail/Consumer (15%), Healthcare/Life Sciences (12%), Manufacturing (10%) és mások.



