Az Egyesült Nemzetek Szervezete csütörtökön bejelentette, hogy együttműködik a Google-lel egy új, AI-barát statisztikai platform kiépítésén, amely megkönnyíti a globális adatokhoz való hozzáférést és azok gépi használatát. Az új rendszer az UN System Data Commons nevet kapta, és a Google nyílt forráskódú Data Commons platformjára épül.
Mire vált a rendszer és mi változik?
Az UN System Data Commons lehetővé teszi, hogy a felhasználók természetes nyelvű lekérdezésekkel keressenek statisztikákat különböző ENSZ-ügynökségektől. Az új felület leváltja a korábbi UNData portált, ahol a felhasználók főként hagyományos adatbázis-kereső és böngésző felületen találták meg az adatokat. A platform támogatja a Model Context Protocolt (MCP) is, egy olyan szabványt, amely lehetővé teszi, hogy AI rendszerek közvetlenül csatlakozzanak külső adatforrásokhoz.
Miért fontos ez most?
A felhasználók egyre gyakrabban fordulnak AI-eszközökhöz adatokért és válaszokért, ugyanakkor több vizsgálat rámutatott, hogy a nagy nyelvi modellek gyakran nem képesek megbízható, hivatkozott számadatokat szolgáltatni. João Pedro Azevedo, az UNICEF főstatisztikusa egy virtuális sajtóértekezleten ismertette, hogy egy UNICEF-benchmark hat nagy LLM több mint 133 000 válaszának vizsgálata során az átlagos pontosság mindössze 21,2% volt. A tesztben szereplő modellek között voltak OpenAI GPT-4o és GPT-4o-mini, Anthropic Claude Sonnet 4.5 és Haiku 4.5, valamint Google Gemini 2.5 Flash és Gemini 2.0 Flash.
Azevedo elmondása szerint a válaszok körülbelül háromötöde egyáltalán nem tartalmazott használható számot, gyakran azért, mert a modellek óvatoskodva válaszoltak. Továbbá, amikor ugyanazokat a kérdéseket két nappal később megismételték ugyanazokkal a modellekkel, azon válaszok esetében, amelyek mindkét alkalommal adtak számot, csak körülbelül fele tért el attól, hogy a szám ugyanaz legyen mindkét futtatásnál.
Ez a munka jelenleg UNICEF munkadokumentumként készült elő, folyamatban van folyóirati benyújtásra, és még nem esett át lektoráláson; az UNICEF azt ígéri, hogy a cikkhez metodológiát, kódot és adatokat is közzéteszik.
Növekvő forgalom AI-asszisztensektől
Az UNICEF statisztikái szerint idén jelentősen nőtt a generatív AI-asszisztensekről érkező forgalom az adatoldalukra: a honlap több mint hatmillió látogatást kap havonta, és az ügynökség egyik leglátogatottabb oldala. Azevedo a TechCrunchnak azt mondta, hogy 2024. január 1. és szeptember 14. között 67%-kal nőtt a ChatGPT-válaszokban található linkekből érkező forgalom éves összevetésben. Ezek az átirányítások az idei összes munkamenet 6,4%-át tették ki, és az UNICEF becslése szerint az AI-asszisztensek ma nagyjából minden tizedik látogatást adják.
A platform terjedelme és finanszírozása
A ENSZ közlése szerint 26 ENSZ-entity köteleződött el a Data Commons mellett, és indításkor majdnem 20 entitás adatai voltak elérhetők. A cél az, hogy 2027-ig az ENSZ rendszerének statisztikai adatkészleteinek 80%-át felvigyék a platformra.
A Google.org 2 millió dolláros kapacitásépítési támogatást és technikai segítséget nyújtott a platform mag-infrastruktúrájának kialakításához. Prem Ramaswamy, a Google Data Commons csapatának vezetője a TechCrunchnak elmondta, hogy a rendszer egy ENSZ által irányított példányon (UN-governed instance) fut, és a terv az, hogy a platformot végül az ENSZ maga tartsa fenn, működtesse és skálázza.
Shantanu Mukherjee, az ENSZ Statisztikai Osztályának ügyvezető igazgatója azt hangsúlyozta: „nagyságrenddel fejlettebbek vagyunk most méretben, hatókörben és rugalmasságban, és először kapcsolunk össze annyi ügynökséget az ENSZ-rendszerben. És ezt a pillanatot arra használjuk, hogy adatainkat AI-ready állapotba hozzuk.”
Nyomon követhetőség és demonstrációk
A Data Commons infrastruktúra lehetővé teszi, hogy minden statisztika eredetét is rögzítsék, így egy AI-rendszer által visszaadott adat visszakövethető legyen az eredeti ENSZ-forráshoz. Azevedo szerint ez különösen fontos, amint egyre többen támaszkodnak AI-eszközökre információkeresés és értelmezés során.
A Google bemutatott egy olyan példát is, amelyben egy MCP-hez kapcsolt AI-rendszer több indikátort egyesítve képes volt dashboardokat, diagramokat és szöveges elemzéseket létrehozni anélkül, hogy a felhasználónak manuálisan kellett volna összeválogatnia az alattuk lévő adatkészleteket. Egy demonstráció során a Google megkérte az AI-t, hogy találja meg az Egyesült Államok President’s Emergency Plan for AIDS Relief (PEPFAR) hatását Afrikában; az AI megtalálta az erre vonatkozó ENSZ-statisztikákat (például HIV-fertőzések, AIDS miatti halálozás és várható élettartam), és infografikát készített belőlük.
Emberi ellenőrzés továbbra is szükséges
A platform célja, hogy az AI-ok közvetlenül hozzáférhessenek hagyományosan hiteles ENSZ-adatokhoz, ám ez nem jelenti automatikusan, hogy az AI által levont következtetések is hibátlanok vagy véglegesek. Prem Ramaswamy figyelmeztetett: „mivel a modellek félreérthetik a nüanszokat, egy embernek mindig ellenőriznie kell a kimeneteket, mielőtt idéznék vagy közzétennék azokat.”
Összességében az UN System Data Commons egy lépés az ENSZ részéről afelé, hogy statisztikái jobban integrálhatók legyenek a modern AI-ökoszisztémába, miközben a program célja a források követhetőségének és a rendszer fenntarthatóságának biztosítása az ENSZ irányítása alatt.



