Eszközök

MiniMax-H3 MLX port futtatása Apple Siliconon — 15 másodperces multimodális videók 115 GB modellel

A PipeNetwork által közzétett minimax-h3-mlx GitHub-repozitórium egy Python-csomag, amely az MiniMaxAI által kiadott MiniMax-H3 multimodális generatív modellt MLX-re portolja, hogy Apple Silicon gépeken fusson.

MiniMax-H3 MLX port futtatása Apple Siliconon — 15 másodperces multimodális videók 115 GB modellel

A PipeNetwork által közzétett MiniMax-H3-MLX Python csomag azonosítja és áthidalja a MiniMax-H3 futtatását MLX környezetben, lehetővé téve Apple Silicon gépeken való használatát. A MiniMax-H3-t a MiniMax írta le „általános célú, omni‑modal generatív rendszerként”, amely szöveget, képet, hangot és videót fogad bemenetként, és ezekből legfeljebb 15 másodperces videóklipet képes generálni hanggal együtt.

A kipróbálás részletei

A szerző saját M5 Max chipet tartalmazó MacBook Pro gépén futtatta a csomagot. A következő lépésekkel dolgozott:

  1. A szükséges modellek letöltése a Hugging Face hubról:
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \
  --include 'FL2VA/*' --exclude 'FL2VA/transformer/*'
uvx --from huggingface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit
  1. A modell indítása MLX-el:
uv run --with mlx-vlm \
  --with-requirements requirements.txt python scripts/generate.py \
  "a rainbow colored skunk leaps over a mossy log in a supermarket" \
  -o skunk.mp4 \
  -c ~/.cache/huggingface/hub/models--MiniMaxAI--MiniMax-H3/snapshots/fa9c8ab1eaa21c8ae25e7e40b83b2e6002f340af/FL2VA \
  -t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-MLX-8bit/snapshots/3ac52081470b0488921c3ec3ba84a39097bf2361

Az elkészült próbavideó egy „szivárványszínű szkunksz” jelenetet mutatott be, amely átlép egy mohás fatörzsen egy élelmiszerboltban.

Méretek és időigény

A futtatás során körülbelül 115 GB modellefájl töltődött le. A videó generálása (max. 15 másodperces kimenet) a szerző szerint valamivel kevesebb, mint 45 percet vett igénybe az említett gépen.

Minőség és megjegyzések

A vizuális eredmény lenyűgöző volt a szerző szerint, viszont a generált hang „furcsa, beszédszerű zajnak” tűnt — ez azért volt, mert nem adott külön instrukciót vagy útmutatást az audio részre. A MiniMax-H3-hoz készült prompting guide részletes ajánlásokat tartalmaz az ilyen hangproblémák elkerülésére; a szerző elismeri, hogy ezt a kísérlet előtt nem olvasta el.

Miért számít ez

A MiniMax-H3 MLX‑re portja lehetőséget ad arra, hogy Apple Silicon gépeken, helyben futtatható multimodális generatív modelleket próbáljanak ki kutatók és fejlesztők. Ugyanakkor a nagy modellméret (~115 GB) és a hosszabb generálási idő rávilágít a helyi futtatás erőforrásigényére és a multimodális kimenet finomhangolásának szükségességére (például audio‑prompting).

Címkék

ai, generative-ai, mlx, text-to-video, minimax