
Minimax H3
MiniMax H3は、オープンウェイトの真にマルチモーダルなAIビデオジェネレーターで、テキスト、画像、ビデオ、オーディオをネイティブステレオサウンド、強力なキャラクター連続性、命令ベースの編集を備えた4〜15秒のクリップ(最大2K/1440p)にブレンドします。
https://minimaxh3.ai/?utm_source=aipure

製品情報
更新日:2026年08月07日
Minimax H3とは
H3は、シーン全体を別々の段階から組み立てるのではなく、1つのジョブとして扱う新しいクラスのビデオモデルに属します。プロンプト、いくつかの静止画、クリップ、音声サンプルなど、さまざまな素材をH3に与えると、H3はそれらの参照における人物、ジェスチャー、サウンド、ムード、フレーミング、視覚的処理が互いにどのように関連しているかを、何かを生成する前に解明します。返されるのは、4秒から15秒の2Kショットで、オーディオはすでにレンダリングの一部として含まれています。
Minimax H3の主な機能
MiniMax H3は、オープンウェイトの汎用マルチモーダル動画生成モデルです。テキスト、画像、動画クリップ、オーディオトラックといった統合されたコンテキストを理解し、ネイティブな同期ステレオオーディオ付きの短い動画(約4~15秒)を生成できます。テキストから動画、画像から動画、最初/最後のフレーム制御、参照ベースの生成、指示ベースの動画編集など、複数のワークフローをサポートしているため、クリエイターはキャラクターの連続性、カメラの動き、スタイル、サウンドデザインをクリップ全体で維持しながら、平易な言葉でショットを生成または修正できます。出力はホスト型システム経由で最大2K、ローカルベースのデプロイでは短辺約768pに達します。
統合されたマルチモーダルコンテキスト(テキスト + 画像 + 動画 + オーディオ): 1つのリクエストで最大9枚の画像、3つの動画クリップ、3つのオーディオトラック(合計12ファイル)という混合入力を受け入れ、それらをまとめて推論し、キャラクター、動き、カメラワーク、音声、スタイルを1つのまとまった結果にブレンドします。
ネイティブステレオオーディオ生成&音声/オーディオ参照: 組み込みの同期ステレオサウンド(アンビエンス、SFX、音楽、対話)付きの動画を出力し、提供されたオーディオ参照を使用してボーカル/音声のトーンとタイミングをガイドし、効果音をオンスクリーンアクションに合わせることができます。
参照駆動制御(アイデンティティ、モーション、スタイル): 参照画像を使用して顔/キャラクターの一貫性を保ち、参照動画を使用して振り付けやカメラの動きを転送し、参照オーディオを使用して音声/音楽をガイドします。これにより、自然言語で記述された「オムニ参照」スタイルのワークフローが可能になります。
指示ベースの動画編集(会話型反復): 平易な言語の指示(オブジェクト/被写体の交換、衣装の変更、背景の置き換え、再照明、対話の書き換え)を介して既存のクリップを編集し、未変更の領域を安定させて、ショットごとの反復を高速化します。
複数の生成モード&アスペクト比: テキストから動画、画像から動画、最初と最後のフレームの補間、動画から動画/編集を一般的なフォーマット(例:16:9、9:16、1:1、21:9)でサポートし、映画のような出力とソーシャルな出力の両方に適合します。
オープンウェイトエコシステム + ホスト型APIオプション: オープンウェイトとツールサポート(例:diffusersパイプライン、ComfyUIワークフロー、vLLM/SGLangサービングレシピ)を備えたコミュニティライセンスの下でリリースされており、2K再生などのハイエンドパイプライン向けにホスト型API経由でもアクセス可能です。
Minimax H3のユースケース
マーケティング&ブランド広告: 製品ショットとブリーフを、読みやすいオンスクリーンテキスト/ロゴ、制御されたカメラワーク、組み込みのサウンドデザインを備えた短い広告クリエイティブに変換し、指示を通じて詳細(照明、背景、コピー、VO)を編集することで迅速に反復します。
Eコマース製品紹介: 物理的な撮影なしで、静止した製品写真を、パッケージの詳細、キャプション、同期されたアンビエンス/音楽を含む洗練されたリスティング動画にアニメーション化します。
ゲーム開発&コンテンツ(CG、トレーラー、UIデモ): デザインをモデルに保つために参照を使用し、一貫性が重要な(HUD/メニューの読みやすさ、キャラクターモデルの安定性)ゲームのようなシーケンス、キャラクターPV、アニメーションUIウォークスルーを生成します。
様式化されたアニメーション&ミュージックビデオコンテンツ: 独特のルック(アニメ、クレイメーション、ピクセルアート、3Dファンタジー)でクリップを制作し、スタイルとモーションの参照を活用して、アクションビートを音楽/SFXに同期させ、まとまりのある視覚的リズムを実現します。
映画のプリビジュアライゼーション&短い物語シーン: ストーリーボード、ピッチ資料、迅速なコンセプト探索に役立つ、ディレクター風のカメラ指示(ドリー、ラックフォーカス、カット/タイトルカード)とネイティブオーディオを備えた4~15秒の映画のようなビートを作成します。
ソーシャルショートフォームコンテンツ制作: テキストプロンプトとオプションの参照から、TikTok/Reels/Shorts向けの縦型(9:16)サウンドオンクリップを迅速に生成し、最初から再レンダリングするのではなく、会話型編集で洗練させます。
メリット
強力なマルチモーダルな柔軟性:テキスト、画像、動画、オーディオを個別のツールではなく、1つのコンテキストで組み合わせます。
ネイティブな同期ステレオオーディオ(対話/SFX/アンビエンスを含む)により、個別のサウンドデザインパスの必要性が軽減されます。
指示ベースの編集により、キャラクターのアイデンティティやシーンのレイアウトなどの安定した要素を維持しながら、迅速な反復が可能になります。
オープンウェイトの利用可能性と幅広いエコシステムサポート(パイプライン/ワークフロー/サービングスタック)により、カスタマイズとローカルでの実験が可能になります。
デメリット
完全な2Kワークフローはホスト型ステージに依存する場合があります。ローカルのオープンウェイトリリースはより制限される可能性があり(例:短辺約768pの基本出力)、ハードウェア負荷が高い場合があります。
コミュニティライセンスには使用制限が含まれます(例:合法的な使用に関する義務、他のAIモデルを改善するための出力/モデルの使用制限)。
短いクリップの持続時間(約4~15秒)に焦点を当てているため、より長い物語には複数の生成を結合し、連続性を外部で管理する必要があります。
Minimax H3の使い方
1) MiniMax H3の実行方法を選択します(アプリ、ホスト型API、またはローカルのオープンウェイト): 1つのワークフローを選択します。(a) Web/アプリ体験(最速の開始):MiniMax H3アプリ/サイトを使用して、チャット内で生成および編集します。(b) ホスト型API(サーバーレス):非同期ジョブを送信し、完了時にMP4をダウンロードします。(c) ローカルのオープンウェイト(ComfyUIまたはvLLM):H3-Baseをローカルで実行して768pクラスの出力を得ます。ホスト型Context-IRおよび2Kアップスケーリングモジュールは別々のホスト型ステージであることに注意してください。
2) 生成モードを決定します(テキストからビデオ、最初/最後のフレームを含む画像からビデオ、または参照からビデオ): MiniMax H3は、2つのタスク固有のチェックポイントとしてリリースされています。FL2VA(テキストからビデオ + 最初/最後のフレームの条件付け)とRef2VA(参照ベースの生成)です。プロンプトのみの場合はテキストからビデオ、最初および/または最後のフレーム制御の場合は画像からビデオ、複数の画像/ビデオ/オーディオ参照(合計最大12ファイル:画像最大9枚、ビデオ3本、オーディオ3本)を組み合わせる場合は参照からビデオを選択します。
3) 「ディレクター風」のプロンプトを作成します(被写体 + アクション + カメラ + 光 + 音): 静止画だけでなく、クリップ全体で何が起こるかを記述します。カメラの言語(例:トラッキングショット、ラックフォーカス、手持ち)、照明/時間(ゴールデンアワー、ネオンナイト)を含め、オーディオを独自のトラックとして明示的に指示します(アンビエンス、SFX、音楽、ダイアログ)。H3はネイティブステレオオーディオを出力するため、意図しないオーディオを避けるためにサウンドを意図的に指定します。
4) 参照を使用する場合は、各参照に明示的なジョブを割り当てます: 画像/ビデオ/オーディオを提供する際は、それぞれが何を制御するかを明記します(キャラクターのアイデンティティ、背景、振り付け、スタイル、BGM、声のトーン)。例:「キャラクターの顔と衣装には@Image 1を使用し、2番目のキャラクターには@Image 2を使用し、環境には@Image 3を使用し、カメラの動きとアクションのリズムには@Video 1を使用し、BGMには@Audio 1を使用し、同期されたヒット/ジャンプ/武器のSFXを追加します。」
5) 期間とアスペクト比を選択します: サポートされている範囲内でクリップの長さを設定します(プラットフォームによって一般的に5〜15秒)。21:9、16:9、4:3、1:1、3:4、9:16などのアスペクト比を選択します(または一部のインターフェースではH3にフレーミングを自動選択させます)。
6) アプリ経由で生成します(クイックスタートパス): MiniMax H3アプリ/サイトで、(1) MiniMax H3を選択し、ビデオに切り替えます。(2) プロンプトを貼り付け、オプションで参照(画像/ビデオ/オーディオ)をアップロードします。(3) アスペクト比と期間を選択します。(4) 生成をクリックして、ネイティブステレオオーディオ付きのビデオを受け取ります。(5) 結果をダウンロードします。
7) ホスト型API経由で生成します(非同期ジョブ送信): APIキーを作成します(例:EvoLink)。非同期生成リクエストをPOSTし、タスクIDを受け取り、ステータスをポーリングし、完了時に結果のMP4をダウンロードします。モードに適したモデルIDを使用します(例:「minimax-h3-text-to-video」)。モード固有のフィールドを混在させないでください(例:テキストルートはimage_startを受け入れず、参照ルートはimage_start/image_endを受け入れません)。
8) APIリクエストの例(テキストからビデオ): { "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" } のようなJSONを送信します。その後、完了するまでタスクIDでポーリングし、MP4をダウンロードします。
9) ローカルComfyUIセットアップ:ノードをインストールし、モデルファイルを配置します: ComfyUIとMiniMax H3カスタムノード(例:ComfyUI-MiniMaxH3)をインストールします。必要なウェイトをダウンロードして配置します。拡散モデル(例:minimax_h3_fl2va_pruned_int8_convrot.safetensors)、テキストエンコーダー(例:qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors)、および両方のVAE:minimax_h3_video_vae_fp16.safetensors(ビデオ)+ minimax_h3_audio_vae_fp32.safetensors(オーディオ)。オーディオが出力に書き込まれるように、VAEDecodeAudioがSaveVideoに接続されていることをワークフローで確認してください。
10) ローカルComfyUI:正しい解像度を選択します(小さすぎないようにする): H3の最小解像度は384pです。256pは失敗します。公式の解像度プリセット/テンプレートを使用してください。H3のネイティブキャンバスは768pxの短い辺(768×1344、32の倍数に制限)です。フル品質のローカル出力の場合、16:9で約1.0メガピクセル(約1344×768)に引き上げてください。
11) ローカルComfyUI:モードに適したノードを実行します: FL2VA(テキスト + オプションの最初/最後のフレーム)の場合、MiniMaxH3ImageToVideoノードを使用し、画像をfirst_frameおよび/またはlast_frameに接続します。Ref2VA(複数参照)の場合、MiniMaxH3ReferenceToVideoノードを使用し、プロンプトで記述された明示的な役割を持つ順序付けられた画像/ビデオ/オーディオ参照を提供します。
12) ローカルvLLM(ROCm)サービングオプション(上級): ROCmでvLLM Omniを使用してデプロイする場合、公式のvllm/vllm-omni-rocm:minimax-h3イメージを使用し、リクエストタイプに応じて/path/to/MiniMax-H3/FL2VAまたは/path/to/MiniMax-H3/Ref2VAのいずれかをサービスします。FL2VAとRef2VAの処理を切り替えるには、サービスパスを交換して再起動します。
13) 命令ベースの編集を使用して反復します(1つ変更し、残りは安定させる): 生成後、平易な言語の編集指示(衣装の交換、背景の置き換え、再照明、ダイアログの書き換えなど)を与えて調整します。H3は、要求された変更を適用しながら、手つかずの部分を安定させるように設計されています。信頼性の高い反復のために、一度に1つの変数を変更し、動作するベースラインを維持してください。
14) 一般的な問題のトラブルシューティング(オーディオ、解像度、「壊れた」プロンプト): オーディオがおかしい場合は、明示的なサウンドディレクション(アンビエンス、音楽スタイル、SFXのタイミング、ダイアログの意図)を追加してください。出力が失敗したり、ローカルで破損しているように見える場合は、解像度が384p以上であり、ビデオとオーディオの両方のVAEがVAEDecodeAudioに接続されてSaveVideoに配線されていることを確認してください。ホストされているHailuo/Appでプロンプトが機能するがローカルでは機能しない場合、ホストされているパイプラインにはContext-IR前処理が含まれている可能性があることを覚えておいてください。ローカルでは、より明示的な構造と参照役割の割り当てが必要になる場合があります。
15) 結果を適切にエクスポートして使用します: MP4(ネイティブステレオオーディオ付き)をダウンロードします。オープンウェイトを使用する場合は、MiniMax H3コミュニティライセンス契約および使用制限に従ってください。ホスト型APIはグローバルに利用可能である場合がありますが、オープンウェイトの条件は地域的であり、蒸留禁止などの制限が含まれる場合があります。
Minimax H3のよくある質問
MiniMax H3は、オープンウェイトの汎用マルチモーダル動画生成モデルで、テキスト、画像、動画、音声を単一のコンテキストでまとめて読み込み、一貫性のある視聴覚動画クリップを生成できます。











