A PipeNetwork által közzétett MiniMax-H3-MLX Python csomag azonosítja és áthidalja a MiniMax-H3 futtatását MLX környezetben, lehetővé téve Apple Silicon gépeken való használatát. A MiniMax-H3-t a MiniMax írta le „általános célú, omni‑modal generatív rendszerként”, amely szöveget, képet, hangot és videót fogad bemenetként, és ezekből legfeljebb 15 másodperces videóklipet képes generálni hanggal együtt.
A kipróbálás részletei
A szerző saját M5 Max chipet tartalmazó MacBook Pro gépén futtatta a csomagot. A következő lépésekkel dolgozott:
- A szükséges modellek letöltése a Hugging Face hubról:
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \
--include 'FL2VA/*' --exclude 'FL2VA/transformer/*'
uvx --from huggingface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit
- A modell indítása MLX-el:
uv run --with mlx-vlm \
--with-requirements requirements.txt python scripts/generate.py \
"a rainbow colored skunk leaps over a mossy log in a supermarket" \
-o skunk.mp4 \
-c ~/.cache/huggingface/hub/models--MiniMaxAI--MiniMax-H3/snapshots/fa9c8ab1eaa21c8ae25e7e40b83b2e6002f340af/FL2VA \
-t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-MLX-8bit/snapshots/3ac52081470b0488921c3ec3ba84a39097bf2361
Az elkészült próbavideó egy „szivárványszínű szkunksz” jelenetet mutatott be, amely átlép egy mohás fatörzsen egy élelmiszerboltban.
Méretek és időigény
A futtatás során körülbelül 115 GB modellefájl töltődött le. A videó generálása (max. 15 másodperces kimenet) a szerző szerint valamivel kevesebb, mint 45 percet vett igénybe az említett gépen.
Minőség és megjegyzések
A vizuális eredmény lenyűgöző volt a szerző szerint, viszont a generált hang „furcsa, beszédszerű zajnak” tűnt — ez azért volt, mert nem adott külön instrukciót vagy útmutatást az audio részre. A MiniMax-H3-hoz készült prompting guide részletes ajánlásokat tartalmaz az ilyen hangproblémák elkerülésére; a szerző elismeri, hogy ezt a kísérlet előtt nem olvasta el.
Miért számít ez
A MiniMax-H3 MLX‑re portja lehetőséget ad arra, hogy Apple Silicon gépeken, helyben futtatható multimodális generatív modelleket próbáljanak ki kutatók és fejlesztők. Ugyanakkor a nagy modellméret (~115 GB) és a hosszabb generálási idő rávilágít a helyi futtatás erőforrásigényére és a multimodális kimenet finomhangolásának szükségességére (például audio‑prompting).
Címkék
ai, generative-ai, mlx, text-to-video, minimax



