A Linux Foundation égisze alatt működő LF AI & Data Foundation egy munkacsoportot hozott létre, amely a DocLang nevű, AI-barát dokumentumformátum fejlesztését irányítja. A kezdeményezés célja egy nyílt, szabványosított formátum létrehozása, amely megkönnyíti a vállalatok számára, hogy dokumentumaikat hatékonyan betáplálják mesterségesintelligencia-rendszerekbe.
A DocLang-csoport alapítói között szerepel az IBM, az NVIDIA, a Red Hat, az ABBYY, a HumanSignal és a Forgis. A munkacsoport szerint a jelenleg elterjedt dokumentumformátumok — például a PDF, a Markdown, a HTML vagy a LaTeX — elsősorban megjelenítésre készültek, ezért nem optimálisak az AI-rendszerek számára történő feldolgozásra. Amikor az AI-modellek ezeket tokenekké alakítják, gyakran vesznek el szemantikai, szerkezeti vagy geometriai információk.
Mi a DocLang lényege?
A DocLang specifikációját úgy alakították ki, hogy kifejezetten a nagy nyelvi modellek (LLM-ek) tokenizálóihoz legyen optimalizálva. A megoldás egy korlátozott XML-szókészletre épülő jelölőrendszert használ, amely egy az egyben megfelelteti a DocLang elemeit az LLM-tokeneknek. A formátum veszteségmentes representációt ígér: megőrzi a dokumentum szerkezetére, elrendezésére, jelentésére és irányítási információira vonatkozó adatokat, és támogatja a táblázatokat, képleteket, diagramokat és egyéb multimodális elemeket.
A DocLang az IBM által 2024 végén bemutatott, Docling nevű nyílt forráskódú eszközkészletre épít. A Docling különböző fájlformátumokat képes strukturált, AI-kompatibilis adatformává alakítani; a DocLang erre az alapra építve egy szabványt kínál a strukturált kimenetek rendszerek közötti cseréjére.
Indoklás: miért van szükség új formátumra?
A munkacsoport szerint a Markdown funkcionalitása túl korlátozott, a HTML túl bőbeszédű, míg a LaTeX számos kétértelműséget enged meg — mindez megnehezíti az LLM-ek hatékony és költségtakarékos használatát. Az új formátum célja, hogy csökkentse a tokenek számát és így a feldolgozási költségeket, valamint javítsa a modellek pontosságát azáltal, hogy kevesebb erőforrást kell az elrendezés megfejtésére fordítani.
Az ABBYY AI-stratégiáért felelős alelnöke, Maxime Vermeir szerint: „A DocLang célja az egyik legalapvetőbb vállalati AI-probléma megoldása: a dokumentumokat embereknek tervezték, nem gépeknek.” Vermeir arra hívta fel a figyelmet, hogy a szabványos, minimális és AI-natív reprezentáció kiszámíthatóbb alapot biztosít a modern mesterségesintelligencia-rendszerek számára.
Tokenköltségek és gyakorlati eredmények
A DocLang potenciális költségcsökkentő hatását bemutató adatok közül az AI Cost Check kontextusát idézik: egy PDF OCR-feldolgozása általában körülbelül 1200 bemeneti és 150 kimeneti token felhasználását igényli. Vállalati léptékben ez jelentős költséget eredményezhet, különösen hosszú vagy összetett dokumentumok és drágább modellváltozatok esetén.
Jon Knisley, az ABBYY AI Value and Enablement vezetője hangsúlyozta: „A PDF-et megjelenítésre tervezték, nem megértésre. Valahányszor egy PDF bekerül egy AI-folyamatba, a dokumentum szerkezete, jelentése és elrendezése részben elveszik.” Knisley szerint ennek következménye, hogy fejlesztőcsapatok sok egyedi, törékeny megoldást építenek az egyes integrációs pontokra, ami növeli a költségeket és a karbantartási igényt.
Az ABBYY által létrehozott DocLang Interactive Benchmark bemutat néhány mérést: az IBM 2025-ös éves jelentésének PDF-változata 8421 bemeneti és 512 kimeneti tokent generált, míg ugyanennek a dokumentumnak a DocLang-változata 5310 bemeneti és 498 kimeneti tokent igényelt. Emellett a DocLang alacsonyabb késleltetést produkált (2,7 másodperc a PDF 4,2 másodpercével szemben), és jobb minőségű kimenetet adott: a PDF feldolgozása során az AI kihagyott egy alfejezetet és hibásan kezelte egy táblázat összevonását.
Knisley hozzátette, hogy a pontos megtakarítás az alkalmazási területtől és a dokumentum összetettségétől függ, de a kezdeti mérések szerint a költségcsökkenés a vizsgált modelltől függően négyszerestől akár harmincszoros mértékű lehet.
Nyitott, közösségi fejlesztés és várakozások
A DocLang szabvány nyílt és szabadon felhasználható lesz, és a munkacsoport további technológiai szolgáltatókat és vállalatokat vár a csatlakozásra. A résztvevők szerint az első visszajelzések biztatóak, de a kezdeti szakaszban egyelőre nem szeretnék túlbecsülni az elfogadottság jelenlegi mértékét. A cél egy olyan interoperábilis, AI-natív dokumentumformátum kialakítása, amely csökkentheti a tokenfelhasználást, javíthatja a pontosságot és megkönnyítheti a megfelelőségi, metaadat-kezelési igények teljesítését.
A DocLang kezdeményezés azt tükrözi, hogy a vállalati ügyfelek egyre inkább keresik azokat a megoldásokat, amelyek csökkentik az AI-feldolgozás költségeit és növelik a megbízhatóságot, különösen nagy volumenű dokumentumfeldolgozás esetén.



