MiniMax H3 を ComfyUI でローカル実行する方法:必要ファイル・VRAM・GGUF(2026年版)

2026年10月1日

MiniMax H3 は ComfyUI で標準サポートされています。 MiniMax がモデルの重みを公開した2026年8月3日に対応しました。ComfyUI を 0.30.0 以降 に更新し、テンプレートライブラリから MiniMax H3 のワークフローを開いて、表示されるモデルをダウンロードするだけです。標準の pruned INT8 モデルは約21GB。Comfy によると、VRAM の動的オフロードにより RTX 3060 クラスの GPU でも動作します。コミュニティ製の GGUF なら約9GBまで小さくできます。

ダウンロードの前に、まずライセンスを確認してください。

最初にライセンスを確認

MiniMax H3 は MiniMax H3 Community License Agreement で公開されています。ローカル利用で押さえておきたい点は3つです。

  • 対象地域。 ライセンスが認められるのは、EU、英国、韓国、米国を除く地域です。日本は対象地域に含まれます。除外地域での利用はこのライセンスでは認められていません。
  • 大企業の場合。 売上が2,000万米ドルを超える商用製品・サービスで使うには、MiniMax から別途書面での許可が必要です。
  • 生成物の商用利用。 Comfy のドキュメントによると、ローカルで生成した動画を商用利用するには MiniMax の商用ライセンスが必要で、Comfy から購入できます。Comfy Cloud での生成には商用利用権が含まれます。

詳細は必ずライセンス本文で確認してください。環境構築が面倒な場合は、ブラウザだけで使える H3 Max 動画生成AI もあります。GPU は不要です。

必要なもの

  • ComfyUI 0.30.0 以降(テキストから動画、画像から動画、参照から動画)。追加機能はさらに新しいバージョンが必要です:マルチフレーム参照は 0.34.0、Fun ControlNet Union とスパースアテンションは 0.35.0、FastH3 は 0.36.0。
  • ストレージ。 拡散モデル、テキストエンコーダー、VAE 2つ(映像用・音声用)が必要です。公式ファイルで最小構成なら約35GB、標準構成なら約52GBです。
  • メインメモリ。 VRAM に収まらない分はメインメモリに置かれます。Comfy の最適化後のメモリ使用量は約42.5GB(フル精度では123.6GB)です。

ダウンロードするモデルファイル

公式の ComfyUI 用ファイルは Comfy-Org/MiniMax-H3 にまとまっています。テキストから動画・画像から動画(最初のフレーム、最後のフレーム、その両方)には FL2VA、参照から動画には Ref2VA を使います。

種類ファイル名サイズ配置フォルダ
拡散モデル(標準)minimax_h3_fl2va_pruned_int8_convrot.safetensors21.0GBmodels/diffusion_models/
拡散モデル(軽量)minimax_h3_fl2va_pruned_w6a8.safetensors16.0GBmodels/diffusion_models/
拡散モデル(高VRAM向け)minimax_h3_fl2va_pruned_bf16.safetensors40.2GBmodels/diffusion_models/
テキストエンコーダーqwen3vl_32b_minimax_h3_int8_convrot.safetensors27.1GBmodels/text_encoders/
テキストエンコーダー(軽量)qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7GBmodels/text_encoders/
映像 VAEminimax_h3_video_vae_int8_convrot.safetensors2.8GBmodels/vae/
音声 VAEminimax_h3_audio_vae_fp32.safetensors0.6GBmodels/vae/

参照から動画を使う場合は、拡散モデルを対応する minimax_h3_ref2va_… に置き換えます。Comfy は pruned 版 を推奨しています。モジュレーション部分の重みをルックアップテーブルに置き換えたもので、出力を変えずにメモリを大きく減らせます。

ワークフローの手順

  1. ComfyUI を 0.30.0 以降に更新します(Comfy Cloud でも可)。
  2. テンプレートライブラリ → Video を開き、MiniMax H3 のテンプレートを選びます:video_minimax_h3_t2v(テキストから動画)、video_minimax_h3_i2v(画像から動画)、video_minimax_h3_r2v(参照から動画)。
  3. ポップアップからモデルをダウンロードするか、上の表のファイルを各フォルダに置きます。
  4. 解像度を設定します。テンプレートは高速なプレビューサイズになっています。16:9 で本来の画質を出すには、Resolution Selector を 0.98 メガピクセル(倍数32)にします。1344×768、つまり H3 本来の短辺768pxになります。1.0 メガピクセルは 1376×768 になり、モデルの上限を超えるので避けてください。
  5. サンプリングは標準のままで大丈夫です。テンプレートは res_multistep サンプラー、simple スケジューラー、20ステップです。
  6. プロンプトを書いて実行します。動画は4〜15秒、24fps、32kHz ステレオ音声付きです。プロンプトの書き方は H3 Max プロンプト集 が参考になります。

ローカルで出力できるのは最大768pです。MiniMax のホスト版で使われている2Kアップスケール(H3-Regenerate-2K)とプロンプト補正(H3-Context-IR)は公開されていません。

ステップ数と画質

  • シンプルなショットは12〜16ステップでも十分です。
  • 細かいディテールは50ステップ前後まで良くなり続けます。
  • 音声は映像が変わらなくなった後も改善するので、音を重視するならステップを減らしすぎないでください。
  • 参照がずれる場合は25ステップに上げてみてください。ステップが少ないと参照が効きにくくなります。

高速化のコツ

  • Lightning LoRA。 テンプレートの Enable Lightning LoRA(または turbo_mode)をオンにすると、テキスト・画像から動画は8ステップ、参照から動画は4ステップで生成できます。LoRA ファイルは同じ Comfy-Org リポジトリの loras/ にあります。
  • Sage Attention。 環境に合った SageAttention の wheel と KJNodes をインストールし、UNETLoader と BasicGuider の間に Patch Sage Attention KJ を入れて sage_attention を auto にします。Comfy によると、画質をほぼ保ったまま約2倍速くなります。
  • FastH3。 4ステップ用に蒸留されたバージョンで、ComfyUI 0.36.0 から使えます。

VRAM が少ない場合:コミュニティ製 GGUF

H3 の GGUF は MiniMax や Comfy の公式ではなく、コミュニティによるものです。ComfyUI-GGUF の UnetLoaderGGUF ノードで読み込みます。

リポジトリファイル補足
joeygambino/MiniMax-H3-GGUFQ5_1 25.9GB、Q4_0 19.9GBQ5_1 は24〜32GBカード向け、Q4_0 は16GBカード向け(収まらない分はストリーミング)。pruned 版は MiniMax-H3-curve-GGUF で約40%小さい
Abiray/MiniMax-H3-Pruned-GGUF8.9〜21.6GBQ3_K_M〜Q8_0 と表記された pruned 版。16GB なら Q4_K_M が推奨

注意点が2つあります。

  • 「Unexpected architecture type in GGUF file: 'minimax_h3'」 と表示されてもファイルは壊れていません。ComfyUI-GGUF がまだこのアーキテクチャを登録していないだけです。ComfyUI-H3-Multishot v1.5.2 以降を入れると、起動時に自動で登録されます。
  • K-quant の表記。 joeygambino の作者は、H3 の元の重みでは隠れ層の幅(2688)が256で割り切れないため、本来の K-quant は作れないと説明しています。他のリポジトリの「K」表記は、出力を見比べたうえで判断してください。

ストリーミングはモデルを小さくするのではなく、重みをメインメモリと VRAM の間で移動させるだけです。小さい GPU では、量子化を下げると画質が、ストリーミングに頼ると速度が犠牲になります。

トラブルシューティング

症状対処
メモリ不足pruned の INT8 または W6A8 の拡散モデルと NVFP4 のテキストエンコーダー、または GGUF を使う
GGUF のアーキテクチャエラーComfyUI-H3-Multishot v1.5.2 以降を入れる(上記参照)
INT8 + Sage Attention で動画の終盤が崩れる・文字が化けるbf16 版に切り替え、Model Attention Backend ノードを comfy kitchen attention に設定
画質が甘い解像度がテンプレートのプレビューサイズのままになっていないか確認(0.98MP=1344×768)

ローカルの MiniMax H3 とオンラインの H3 Max

H3 Max は ComfyUI では動かせません。 H3 Max は H3 を追加学習したホスト専用のモデルで、ダウンロードできる重みは基本モデルの H3 です。違いは H3 Max と H3 の違い、基本モデルの概要は MiniMax H3 をご覧ください。

ComfyUI で MiniMax H3h3maxvideo.net で H3 Max
必要な機材GPU、大容量のメモリとストレージ不要(ブラウザで動作)
準備ComfyUI 0.30.0 以降、約35〜52GBのファイルGoogle アカウントでログイン
解像度ローカルでは最大768p480P・768P・1080P
入力テキスト、最初/最後のフレーム、複数参照テキスト、最初のフレーム+任意の最後のフレーム
ライセンスコミュニティライセンス(地域制限あり)当サイトの利用規約
費用機材と電気代2.99ドルからのクレジット(料金)

まずは H3 の実力を試したいなら、無料クレジットで H3 Max 動画生成AI を使ってみてください。下書きを安く作るなら H3 Max Turbo がおすすめです。

よくある質問

MiniMax H3 は ComfyUI で無料で使えますか? 重みはコミュニティライセンスの対象地域内で無料でダウンロードできます。Comfy によると、ローカルで生成した動画の商用利用には商用ライセンスが必要です。

必要な GPU の目安は? Comfy によると、十分なメインメモリがあれば VRAM の動的オフロードにより RTX 3060 クラスでも動作します。GPU が大きいほど速くなります。

GGUF ファイルはどこに置けばいいですか? ComfyUI/models/unet/ に置き、ComfyUI-GGUF の UnetLoaderGGUF ノードで読み込みます。公式の safetensors ファイルは models/diffusion_models/ に置きます。

FL2VA と Ref2VA はどちらを使えばいいですか? テキストから動画と、最初/最後のフレームを使う画像から動画は FL2VA。参照画像・動画・音声から生成するなら Ref2VA です。

H3 Max や H3 Max Turbo をローカルで動かせますか? いいえ。どちらもホスト専用のモデルです。重みが公開されているのは基本モデルの MiniMax H3 だけです。

参考資料

最終更新日:2026年10月1日。h3maxvideo.net は独立したサイトであり、MiniMax、Comfy、fal.ai とは提携関係にありません。

H3Max Video

H3Max Video

MiniMax H3 を ComfyUI でローカル実行する方法:必要ファイル・VRAM・GGUF(2026年版) | H3Max Video