A Workflow1111 egy Gradio gr.Workflow alkalmazás, amely a legtöbb AUTOMATIC1111 (stable-diffusion-webui) funkciót egyetlen munkafolyamat-vásznon valósítja meg. A projekt 11 média-pipelinet tartalmaz és összesen 73 node-ból áll. A vászonra egyaránt kerültek legkorszerűbb text-to-image, hi-resolution fix, image-to-image, prompt-matrix rácsok, VLM alapú interrogate, detektálásból inpaint maszk, ControlNet-szerű annotátorok, háttéreltávolítás, PNG-be mentett metaadatok olvasása és kép->videó pipeline-ok.
A futtatáshoz a felhasználó bejelentkezhet a Hugging Face fiókjával vagy megadhat egy hozzáférési tokent; a modellhívások ekkor a felhasználó saját kvótáját használják. A Workflow1111 megnyitható és duplikálható a Space-en, hogy bárki átszerkessze vagy testre szabja a saját use case-ére.
A vászon felépítése és az operátorok
A pipeline-ok mind ugyanazokból a négy operátor-kategóriából épülnek fel, amelyeket a Gradio gr.Workflow dokumentáció is definiál: fn (Python függvény), model (InferenceClient-en keresztül hívott modell), space (más Gradio Space meghívása), és dataset (Hub dataset sor). Minden node egy operátort csomagol, és az operátor bemenetei/kimenetei a portokként jelennek meg, amelyeket élek kötnek össze.
A 11 pipeline ismertetése
-
Text-to-image: a központi pipeline, az AUTOMATIC1111 txt2img fül vezérlőivel (negative prompt, steps, CFG, seed, width, height) és egy model_id mezővel. A prompt először egy fn prompt-builderen megy át (stílus preset hozzáadása, tisztítás), majd egy model node hívja a checkpointot Inference Providers-en keresztül. Egy post-process fn node a generálási paramétereket a PNG metaadatába írja, ezt olvassa vissza a PNG Info pipeline.
-
Hi-resolution fix: AUTOMATIC1111-hez hasonlóan itt is a txt2img eredmény nagyobb és élesebb lesz; a Workflow1111-ben ez két node-dal valósul meg: egy FLUX.1-Kontext model node kap egy refine utasítást (pl. „enhance fine detail and micro-texture, keep the composition identical”) és élesebb, nagyobb képet ad vissza.
-
Image-to-image: ugyanaz a Kontext node dupla felhasználással dolgozik: feltöltesz egy képet, leírod a szerkesztést, és a node visszaadja a módosított képet.
-
LLM által írt prompt: egy alap promptot (például "A lighthouse in a storm") küld egy Qwen3-4B model node-nak; egy kisebb fn node a választ címkék listájává alakítja, legfeljebb 40 tagig. A kimenet bármely diffusion model node-hoz csatlakoztatható képkészítéshez.
-
Képből prompt (Interrogate): Qwen2.5-VL (VLM) nézi át a fotót és olyan promptot generál, amely leírhatta volna a képet; egy ViT osztályozó ugyanarra a képre címkéket ad (például restaurant 51.9%, tobacco shop 15.6%, toyshop 9.1%). A gr.Workflow párhuzamosan futtatja a két modellt, így mindkettő választ nagyjából egyidejűleg adja.
-
Detection to inpaint mask: DETR detektál tárgyakat egy utcai fotón (például három ember, egy kutya, egy bicikli, egy autó), majd kettéágazik a folyamat: egyik ág a detektált dobozokat rajzolja a képre, a másik átalakítja őket inpaint maszkká. A rajzolás és maszk-készítés helyben, Pillow és NumPy segítségével történik; csak a detektálás zajlik távoli híváson keresztül.
-
Prompt matrix: egy alap prompt (pl. "a lone oak tree") négy suffixszel kombinálódik (pl. at sunrise, in a thunderstorm, under the Milky Way, in autumn fog) egy fn node-ban; minden variáns saját text-to-image node-ot kap, majd egy végső node összeilleszti a négy képet.
-
Upscale és background removal: kétsávos megközelítés: az egyik upscaler helyi Lanczos újramintavételezés fn node-dal (gyors, nincs hálózati hívás), a másik AuraSR ×4 space node, amely egy Hub Space-t hív meg. A háttéreltávolítás BRIA RMBG-2.0 space node-dal történik, tehát a modell teljesen a saját Space-ében fut.
-
Annotators: Canny, line art, sketch, luma-depth és posterize preprocesszorok fn node-okként szerepelnek, NumPy-vel implementálva, modellek nélkül. Egy előre betöltött példa-fotón mindegyik annotátor CPU-n körülbelül fél másodperc alatt fut le.
-
PNG Info: a text-to-image post-process node a PNG parameters szöveges chunkjába írja a generálási paramétereket (prompt, negative prompt, steps, CFG, seed, képméret, modell), ezt olvassa vissza a PNG Info pipeline.
-
Image-to-video: ugyanaz a képnoda, amelyből a PNG Info olvas, a Wan 2.2 I2V A14B node-ba is belemegy, amely animálja a képet; a bemutató példában egy alsó fox felébred és mozogni kezd.
Milyen részek futnak helyben és mik távoli modellek
A vásznon összesen 36 operátor node található: ezek közül 32 fn node, és 22 fn node teljesen helyben, hálózati hívás nélkül fut. Ez azt jelenti, hogy a vászon körülbelül kétharmada továbbra is működik, ha a felhasználó elveszíti a hálózati kapcsolatot. Mivel a fn node-ok sima Python függvények, közvetlenül is tesztelhetők szerver, vászon vagy GPU nélkül.
Futtatás saját GPU-n
Alapértelmezésben a modellhívások távoli hardveren futnak Inference Providers vagy Spaces segítségével, de egy fn node teljes értékű Python, ezért lehetőség van lokálisan betölteni checkpointokat és a saját GPU-t használni. Példaként a FastVideo/fastvideo-fasth3-preview Space futtat FastH3 modellt, amely a MiniMax-H3 négylépéses distillációja, és ZeroGPU-t használ a videó generálásához. A gr.Workflow bind mechanizmusa képes olyan függvényt meghívni, amely a hívás idejére GPU-t kap, majd visszaadja azt.
Minden kimenet API
Minden kimenet node automatikusan REST végponttá válik. Workflow1111 kilenc ilyen végpontot exponál: /image, /edited_image, /generated_prompt, /recovered_prompt, /detected_objects, /x_y_grid, /upscaled_local, /annotator_map és /png_info. A gradio_client használatával ezekről a végpontokról közvetlenül is kérhetők eredmények, miközben a hívó a saját Hugging Face tokenjét küldi.
Ezen túl a kimenetek MCP eszközökként is megjeleníthetők: ha a Space mcp_server=True opcióval indul, minden output node egy AI-asszisztens által hívható toolként jelenik meg. Az agentek (Claude Code, Cursor vagy bármely MCP kliens) így képesek képgenerálást, detektálást vagy prompt-olvasást beépíteni magasabb szintű feladatokba anélkül, hogy külön glue kódot kellene írni.
Hol helyezkedik el ez a ComfyUI-hoz képest
Mind AUTOMATIC1111, mind ComfyUI ismertették a szükséges funkciókat, de a közvetlen összehasonlítás gyakran ComfyUI-hoz köti a gr.Workflow-öt, mivel mindkettő node-alapú grafikus felület. A gr.Workflow előnyei: node-ok futtathatók távoli hardveren (Inference Providers), hívhatnak bármilyen Space-et a Hub-on, és kimeneteik automatikusan tipizált REST végponttá válnak; látogatók OAuth használatával saját identitás alatt futtathatják a workflow-kat; különböző modelleket és modalitásokat (diffúziós modellek, LLM-ek, VLM-ek, detektorok, videómodellek) lehet egy vásznon keverni; és ha egyedi megoldás kell, egyszerű Python függvényt írni.
Hogyan kezdj hozzá
A Workflow1111 73 node-dal fut, de az induláshoz csak egy egyszerű gr.Workflow példa kell: bind= átalakítja a Python függvényeket node-okká, edges= köti össze őket, és .launch() megnyitja a vásznat a böngészőben. Ha kész a workflow, a gradio deploy feltölti Space-re. A gr.Workflow útmutató tartalmazza a JSON sémát és az operátor típusok részleteit.
Ha valaki gyorsan szeretne kipróbálni valamit, megnyithatja Workflow1111 Space-et, rányomhat a Duplicate-re és elkezdheti törölni, cserélni vagy átvezetni az egyik tizenegy pipeline bármelyikét. A szerzők kérik, hogy megosztott munkákat posztoljanak X-en és taggeljék @gradio-t, hogy a csapat terjeszthesse a munkákat.



