Eszközök

DataFlow-Harness: strukturált, vizuális adattovábbítási pipeline-ok LLM-vezérelt építéséhez

A DataFlow-Harness egy nyílt forráskódú keretrendszer, amelyet a Peking University, a Zhongguancun Academy és a Shanghai Institute for Advanced Algorithms Research kutatói mutattak be az AI által generált adattovábbítási folyamatok strukturált, vizuális létrehozására.

DataFlow-Harness: strukturált, vizuális adattovábbítási pipeline-ok LLM-vezérelt építéséhez

Peking University, Zhongguancun Academy és Shanghai Institute for Advanced Algorithms Research kutatói bemutatták a DataFlow-Harness nevű nyílt forráskódú keretrendszert, amely arra irányul, hogy a nagyméretű nyelvi modellek (LLM-ek) ne egyszerű, eldobható kódszkriptet generáljanak, hanem lépésről lépésre építsenek fel strukturált, vizuálisan szerkeszthető adatfeldolgozó pipeline-okat. A cél, hogy az AI által létrehozott munkafolyamatok tartós, auditálható és vállalati rendszerekbe illeszthető artefaktumokká váljanak.

Miért van szükség rá: az "NL2Pipeline gap"

A kutatók rámutatnak az úgynevezett "NL2Pipeline gap" problémára: a felhasználók természetes nyelven fogalmazzák meg az adatfeldolgozási igényeket, míg a gyártási környezet strukturált, platform-specifikus és tartós pipeline-okat követel meg. Bár a modern kódoló ügynökök gyorsan képesek használható Python-szkripteket előállítani, ezek gyakran széttagolt, nehezen auditálható és a valós platformfüggőségekkel nem egyeztetett megoldások maradnak. Ennek következménye a fenntarthatatlan technikai adósság és a bizonytalan integráció.

A DataFlow-Harness felépítése

A DataFlow-Harness a workflow-szintézist négy összetevő köré szervezi:

  • Data Pipeline Backend: a rendszer autoritatív forrása, amely a pipeline-t irányított aciklikus gráfként (DAG) tárolja — adatforrásokkal, konfigurált előre gyártott feldolgozó modulokkal ("operatorok") és végrehajtási függőségekkel. Az ügynökök itt "typed mutations" műveleteket hajtanak végre (például operator hozzáadása vagy élek összekapcsolása) a szabadkód-generálás helyett.

  • DataFlow-Skills: markdown fájlok, amelyek doménspecifikus tudást injektálnak a modell kontextusába. Ezek a skills kompatibilitási szabályokat, sémainferrálási és összeszerelési elveket adnak, hogy a modell helyesen párosítsa az adatformátumokat és kezelje a komplex struktúrákat.

  • MCP Tools Layer: eszközréteg, amelyen keresztül az AI hozzáfér az operator-regiszterhez és a jelenlegi pipeline-állapothoz; ezen keresztül strukturált javaslatokat nyújt a rendszernek, amely validálja azokat.

  • DataFlow-WebUI: a felhasználói réteg, amely két interfészt kínál: egy beszélgetés-alapú, természetes nyelvű leírást és egy vizuális DAG-szerkesztőt. A fejlesztők itt felülvizsgálhatják és módosíthatják az AI által javasolt változtatásokat.

A megoldás statikus ellenőrzéseket végez a platform metaadataival szemben, például regisztrált datasetek, operatorok és modell-hivatkozások ellenőrzése, mezőfolyás és paraméterhasználat vizsgálata, valamint strukturális érvényesség.

Kísérleti eredmények: mérőszámok és összehasonlítások

A kutatók egy 12 feladatból álló benchmarkon tesztelték a rendszert hat ipari adatfeldolgozási forgatókönyvben (például kérdés-válasz generálás, review governance, séma-normalizálás). Claude Opus 4.7 szolgált kísérleti háttérmodellként.

A DataFlow-Harness a következőkkel szemben lett összehasonlítva:

  • Vanilla CC: korlátlan, szabadkód-generáló Claude Code
  • Context-Aware CC: ügynök, amely a DataFlow kódbázisát használja a kontextusban
  • MCP-only: ügynök, amely csak az MCP eszközökhöz fér hozzá és platform-native DAG-okat generál, de nincs DataFlow-Skills

Fő eredmények:

  • End-to-end pass rate: 93.3% a DataFlow-Harness számára. Ez 10.0 százalékponttal jobb az MCP-only-hoz képest, felülmúlja a Vanilla CC-t (91.7%), és 0.9 százalékponttal marad le a Context-Aware CC-től (94.2%).
  • Költség: API-költség feladatonként $0.261, ami 72.5%-os csökkenés a Vanilla CC-hez és 42.8%-os csökkenés a Context-Aware CC-hez viszonyítva.
  • Válaszidő: workflow generálásban 49.9%-kal gyorsabb, mint a Vanilla CC és 17.6%-kal gyorsabb, mint a Context-Aware CC.

A DataFlow-Harness különösen hatékonynak bizonyult összetett, implicit doménismeretet igénylő feladatoknál. Egy tankönyvből VQA (visual question answering) kivonatolási demonstrációban 97.2% precíziót és 87.3% lefedettséget ért el, jelentősen felülmúlva a baseline megközelítéseket. Hasonlóképpen, szintetikus instrukció-adat generálásnál többfázisú pipeline-t állított össze, amely generálta, kritikálta, újraírtatta és LLM-alapú bíróval pontozta a párokat, majd kiszűrte a gyenge minőségű kimeneteket.

Egy matematikai adattisztítás és szintézis feladaton az így előállított adatokkal képzett modell jobb átlagos pontosságot ért el az AIME24 és AIME25 benchmarkokon, mint a Vanilla Claude Code által generált adatokkal képzett modell.

Műszaki beilleszthetőség és korlátok

A DataFlow-Harness Apache 2.0 licenc alatt elérhető, ám a jelenlegi implementáció natív a DataFlow platformra; nem egy kész „plug-and-play” megoldás Airflow, Prefect vagy Spark környezetekhez. Egy szervezetnek adaptert kell építenie, ha ezeket a rendszereket szeretné végrehajtási háttérként használni, illetve gondoskodnia kell az operator-regiszter, sémák és Skills fenntartásáról.

A kutatók hangsúlyozzák, hogy a rendszer mérnöki kontrollrétegnek tekintendő: megakadályozza az ésszerűtlen összeköttetéseket strukturális ellenőrzésekkel, de nem helyettesíti a megfelelőségi politikát, a validált detekciós modelleket, a hozzáférés-szabályozást, az auditálást vagy az emberi jóváhagyást.

Következtetés

A DataFlow-Harness célja nem a teljesen autonóm adatépítés emberi felügyelet nélkül, hanem a munkamegosztás javítása: az ügynökök ismétlődő konstrukciós feladatokat végeznek explicit határok között, míg a mérnökök felelősek maradnak a szemantikáért, a politikákért és a döntési felelősségért. A projekt forráskódja és dokumentációja elérhető a nyílt forrású GitHub-tárházban.