Biztonság

Vállalati AI-ügynökök értékelési rés: több autonómia, kevesebb bizalom a tesztekben

A VentureBeat Pulse Research júniusi felmérése 157 vállalati válaszadó alapján arra világít rá, hogy a szervezetek egyre nagyobb autonómiát adnak AI-ügynököknek, miközben kevésbé bíznak a működést felügyelő automatizált értékelésekben.

Vállalati AI-ügynökök értékelési rés: több autonómia, kevesebb bizalom a tesztekben

A VentureBeat Pulse Research júniusi, 2026-os hullámában végzett felmérés 157, legalább 100 fős szervezet technikai vezetőit kérdezte arról, hogyan mérik és engedélyezik az AI-ügynökök (agentek) teljesítményét és megbízhatóságát. A központi következtetés egy „értékelési rés”: a vállalatok nagyobb függetlenséget adnak az ügynököknek, miközben kevesebb bizalommal kezelik azokat a automatizált értékeléseket, amelyeknek ezt a függetlenséget kellene szabályozniuk.

Mi történt és miért számít

  • A válaszadók fele (50%) az elmúlt 12 hónapban telepített olyan ügynököt vagy LLM-funkciót, amely átment a belső értékeléseken, de végül ügyféloldali hibát okozott (helytelen válasz, megszakadt folyamat vagy minőségi incidens). A megkérdezettek egynegyede többször is találkozott ilyennel.
  • Csak 36% nyilatkozott úgy, hogy nem találkozott ilyen esettel; 8% nem végez előtelepítési értékelést, 6% pedig nem követi elég szorosan az okot.

Ez a jelenség azt mutatja: egy átment értékelés nem feltétlenül garantál működő, ügyfélkörnyezetben helytálló ügynököt.

A bizalom hiánya az automatizált értékelésekben

  • Mindössze 5% mondta, hogy teljes mértékben megbízik a jelenlegi automatizált értékelésekben. A megkérdezettek 95%-a jelölt meg legalább egy korlátot.
  • A leggyakoribb kifogás (29%) az, hogy az értékelések rosszul illeszkednek a valós világ eredményeihez — ez közvetlenül magyarázza a fent idézett deploy-onkénti hibákat.
  • További aggodalmak: torzítás vagy következetlenség (21%), magyarázhatóság hiánya (18%) és adat-szivárgás/privát adatok kezelése az értékelési folyamatban (17%).

Az autonómia növekedése a bizalom ellenére

  • A szervezetek kétharmada (66%) vagy már megengedi, vagy azon dolgozik, hogy lehetővé tegye a teljesen automatizált, emberi validáció nélküli (zero-human-in-the-loop) telepítést alacsony kockázatú ügynökök esetén: 34% már engedélyezi, 33% pedig az elkövetkező 12 hónapban tervezi ezt a képességet.
  • Csak 22% zárja ki ezt a lehetőséget a közeljövőben.
  • A nagyobb vállalatok (2,500+ alkalmazott) enyhén előrébb járnak ezen az úton: 70% felé tartanak a zero-human gyakorlat felé szemben a kisebbek 64%-ával; nagyobb arányban jelentettek értékelésen átment, majd ügyfélhibát okozó ügynököt (54% vs. 48%).

Ez a párhuzam – növekvő autonómia és alacsony bizalom – az „értékelési rés” lényegét adja: az autonómia gyorsabban nő, mint ahogy az értékelési biztosíték fejlődik.

Az értékelési eszközök piacának állapota

  • Az értékelési réteg korai, széttagolt és részben szolgáltató-vezérelt. A leggyakoribb elsődleges eszközök a szolgáltatók natív értékelő eszközei: OpenAI natív evals és trace-ek (17%) és Anthropic Claude Console evals (13%).
  • Meglehetősen gyakori válasz volt továbbá, hogy nincs dedikált értékelő eszköz: 17%.
  • Speciális értékelő szereplők megoszlása: DeepEval (12%), Braintrust (8%), valamint LangSmith, Weave, Promptfoo, Langfuse, Arize említése alacsony egy számjegyű vagy alacsony kétszámjegyű arányokkal. 11% saját megoldást épített.

A piac konszolidálatlan: nincs még egyértelmű, iparági szabvánnyá váló független platform.

Gyártásmonitorozás: működés vs. helyesség

  • A gyakorlatban a szervezetek többsége a rendszer működését figyeli (uptime, válaszidő, hibák, költség), nem pedig az output helyességét.
  • 51% kizárólag a rendszer működését monitorozza, 23% monitorozza az válaszok helyességét, a többiek ad-hoc felülvizsgálatokra vagy ismeretlen állapotra támaszkodnak.

Ez azt jelenti, hogy körülbelül háromnegyedük nem futtat automatizált, valós idejű minőségi ellenőrzést a kimenetek helyességére — a magabiztosan téves válaszok gyakran láthatatlanok maradnak.

Eszközválasztás és sikermutatók

  • Az értékelő eszköz választását leginkább az ár (28%) és az integráció egyszerűsége (27%) befolyásolja, megelőzve az értékelési pontosságot (24%).
  • A siker mércéjeként a konszisztencia, azaz ugyanazon viselkedésre ugyanaz a verdikt (36%) a legfontosabb, megelőzve a kísérletezés sebességét (19%) és a hibák csökkenését (18%).
  • Az elégedettség a jelenlegi eszközökkel mérsékelt: átlagosan 3,8 egy ötfokozatú skálán.

Befektetési irányok: több megfigyelés és emberi felülvizsgálat

  • A következő egy évben a legnagyobb növekvő költés a produkciós observability-re irányul, második helyen pedig a humán felülvizsgálati munkafolyamatok állnak (26%).
  • Mindehhez képest csak 16% növeli az automatizált értékelési csővezeték költését. A vállalatok egyszerre készülnek az autonómiára és növelik a felügyeleti kapacitást — emberi döntéshozókat tartva a kritikus esetekre.

Eszközváltás a következő 12 hónapban

  • A megkérdezettek 64%-a tervez új, kiegészítő vagy cserélő értékelési platformot bevezetni 12 hónapon belül; 31% a következő negyedévben.
  • A legnagyobb érdeklődést Confident AI DeepEval (20%), OpenAI natív evals (13%) és Braintrust (9%) kapta — a nyitott forrású, vagy feltörekvő specializált szereplők vonzóbbnak tűnnek, mint a jelenlegi elterjedtségük.

Összegzés: az értékelési rés nem magától zárul be

A 157 európai és északamerikai válaszadó (legalább 100 alkalmazottas szervezetek, adatfelvétel: 2026. június) irányadó képet ad: a vállalatok több autonómiát adnak az AI-ügynököknek, mint amennyire bíznak az értékelő tesztekben. Félük már találkozott olyan esettel, amikor az értékelés átment, de a telepítés ügyfélhibát eredményezett; mindössze 5% bízik teljesen az automatizált értékelésekben; és a legtöbben a működést figyelik gyártásban a helyesség helyett.

A piac korai, szolgáltató- és házon belüli megoldásokkal vegyes; a többség tervez váltást vagy bővítést az elkövetkező évben. Ugyanakkor a cégek növelik a megfigyelést és a humán felülvizsgálatba fektetett költést is, ami azt jelzi, hogy érzik az értékelési rést, miközben egyébként az automatizált telepítések irányába építkeznek. A kulcskérdés a következő hullámokban: utoléri-e az értékelési biztosíték az autonómiát, vagy a példaértékűen téves, „átment” agentek hibái átkerülnek a teljesen automatizált telepítésekbe.

Módszertan és korlátok

  • A felmérés a VentureBeat Pulse Research sorozat része, 157 válaszadóval, egyetlen, 2026. júniusi hullámból; a válaszadók szervezetei legalább 100 fősek.
  • A mintavétel önkéntes, nem valószínűségi minta, közepes vállalati méret felé torzít; az adat iránymutató jellegű, nem pontos populációs mérés.
  • A válaszadók között 38% végső döntéshozó az AI-beszerzéseknél, további 34% ajánló vagy befolyásoló; címek: termék- és programmenedzserek, tanácsadók, mérnökség/IT igazgatók, CIOk/CTOk/CISOk és mások. Iparágak: Technology/Software (23%), Retail/Consumer (15%), Healthcare/Life Sciences (12%), Manufacturing (10%) és mások.