MiniMax H3 是一個開放權重、真正多模態的 AI 影片生成器,它將文字、圖像、影片和音訊融合到 4-15 秒的片段中(最高 2K/1440p),具有原生立體聲、強大的角色連續性和基於指令的編輯。
https://minimaxh3.ai/?utm_source=aipure
Minimax H3

產品資訊

更新時間:2026年08月07日

什麼是 Minimax H3

H3 屬於一種新型的影片模型,它將整個場景視為一個任務,而不是從不同的階段組裝。您將各種素材——提示、一些靜態圖片、一個片段、一個語音樣本——交給它,它會在生成任何內容之前,分析這些參考資料中人物、手勢、聲音、情緒、構圖和視覺處理之間的關係。返回的結果是一個介於四到十五秒的 2K 鏡頭,其音訊已作為渲染的一部分。

Minimax H3 的主要功能

MiniMax H3 是一個開放權重、通用多模態影片生成模型,能夠理解文字、圖像、影片片段和音軌的統一語境,以生成帶有原生同步立體音訊的短片(約 4-15 秒)。它支援多種工作流程——文字轉影片、圖像轉影片、首/尾幀控制、基於參考的生成以及基於指令的影片編輯——因此創作者可以用簡單的語言生成或修改鏡頭,同時在整個片段中保持角色連續性、攝影機運動、風格和聲音設計,輸出透過託管系統可達 2K,本地基礎部署可達約 768p 短邊。
統一多模態語境(文字 + 圖像 + 影片 + 音訊): 在單一請求中接受混合輸入——最多 9 張圖像、3 個影片片段和 3 條音軌(總共 12 個檔案)——並對它們進行綜合推理,將角色、動作、攝影機語言、聲音和風格融合為一個連貫的結果。
原生立體音訊生成與語音/音訊參考: 輸出帶有內建同步立體聲(氛圍、音效、音樂和對話)的影片,並可使用提供的音訊參考資料來引導人聲/語音語調和時間,使音效與螢幕動作對齊。
參考驅動控制(身份、動作、風格): 使用參考圖像保持臉部/角色一致,參考影片傳輸編舞或攝影機運動,以及參考音訊引導語音/音樂——實現自然語言描述的「全方位參考」風格工作流程。
基於指令的影片編輯(對話式迭代): 透過簡單的語言指令編輯現有片段(交換物體/主體、更換服裝、替換背景、重新打光、重寫對話),同時保持未觸及區域的穩定性,以實現更快的逐鏡頭迭代。
多種生成模式與長寬比: 支援文字轉影片、圖像轉影片、首尾幀插值以及影片轉影片/編輯,適用於常見格式(例如 16:9、9:16、1:1、21:9),同時適用於電影和社群輸出。
開放權重生態系統 + 託管 API 選項: 在社群許可證下發布,具有開放權重和工具支援(例如,擴散器管道、ComfyUI 工作流程、vLLM/SGLang 服務配方),同時也可透過託管 API 訪問,用於 2K 再生等高端管道。

Minimax H3 的使用案例

行銷與品牌廣告: 將產品照片和簡報轉化為帶有可讀螢幕文字/標誌、受控攝影機語言和內建聲音設計的短廣告創意——然後透過指令編輯細節(燈光、背景、文案、旁白)快速迭代。
電子商務產品展示: 無需實體拍攝,即可將靜態產品照片製作成精美的商品影片,包括包裝細節、字幕和同步的氛圍/音樂。
遊戲開發與內容(CG、預告片、UI 演示): 生成遊戲般的序列、角色 PV 和動畫 UI 演練,其中一致性至關重要(HUD/選單可讀性、角色模型穩定性),使用參考資料保持設計符合模型。
風格化動畫與音樂影片內容: 製作具有獨特外觀(動畫、黏土動畫、像素藝術、3D 奇幻)的片段,並將動作節拍與音樂/音效同步,利用風格和動作參考資料實現連貫的視覺節奏。
電影預覽與短篇敘事場景: 創建 4-15 秒的電影節拍,帶有導演風格的攝影機指令(推軌、焦點轉換、剪輯/標題卡)和原生音訊,適用於故事板、提案材料和快速概念探索。
社群短影音內容製作: 從文字提示和可選參考資料快速生成適用於 TikTok/Reels/Shorts 的垂直(9:16)有聲影片,然後透過對話式編輯進行精修,而不是從頭重新渲染。

優點

強大的多模態靈活性:將文字、圖像、影片和音訊結合在一個語境中,而不是使用單獨的工具。
原生同步立體音訊(包括對話/音效/氛圍)減少了單獨聲音設計的需要。
基於指令的編輯能夠快速迭代,同時保留角色身份和場景佈局等穩定元素。
開放權重可用性以及廣泛的生態系統支援(管道/工作流程/服務堆棧)實現了客製化和本地實驗。

缺點

完整的 2K 工作流程可能依賴於託管階段;本地開放權重版本可能更受限制(例如,約 768p 短邊基礎輸出),並且可能需要大量硬體資源。
社群許可證包含使用限制(例如,關於合法使用的義務以及限制使用輸出/模型來改進其他 AI 模型)。
短片時長限制(約 4-15 秒)意味著較長的敘事需要拼接多個生成片段並在外部管理連續性。

如何使用 Minimax H3

1) 選擇您將如何運行 MiniMax H3(應用程式、託管 API 或本地開放權重): 選擇一個工作流程:(a) 網頁/應用程式體驗(最快啟動):使用 MiniMax H3 應用程式/網站進行生成和聊天編輯。(b) 託管 API(無伺服器):提交非同步任務並在完成後下載 MP4。(c) 本地開放權重(ComfyUI 或 vLLM):在本地運行 H3-Base 以獲得 768p 級別的輸出;請注意,託管的 Context-IR 和 2K 升級模組是獨立的託管階段。
2) 決定您的生成模式(文字轉影片、圖像轉影片帶首/尾幀,或參考轉影片): MiniMax H3 以兩個特定任務的檢查點發布:FL2VA(文字轉影片 + 首/尾幀條件)和 Ref2VA(基於參考的生成)。選擇:文字轉影片用於僅提示;圖像轉影片用於首幀和/或尾幀控制;參考轉影片用於組合多個圖像/影片/音訊參考(總共最多 12 個文件:最多 9 個圖像、3 個影片、3 個音訊)。
3) 編寫一個「導演風格」的提示(主題 + 動作 + 攝影機 + 光線 + 聲音): 描述片段中發生的事情,而不僅僅是靜態圖像。包括攝影機語言(例如,跟蹤鏡頭、焦點拉動、手持)、光線/時間(黃金時段、霓虹夜),並明確將音訊作為其自己的軌道(環境音、音效、音樂、對話)。H3 輸出原生立體聲音訊,因此請有意地指定聲音以避免不必要的音訊。
4) 如果使用參考,為每個參考分配明確的任務: 提供圖像/影片/音訊時,說明每個控制什麼(角色身份、背景、編舞、風格、背景音樂、語音語調)。範例模式:「使用 @Image 1 用於角色面部和服裝;@Image 2 用於第二個角色;@Image 3 用於環境;@Video 1 用於攝影機運動和動作節奏;@Audio 1 用於背景音樂;添加同步的打擊/跳躍/武器音效。」
5) 選擇持續時間和長寬比: 在支援的範圍內設定片段長度(通常根據平台為 5-15 秒)。選擇長寬比,例如 21:9、16:9、4:3、1:1、3:4 或 9:16(或讓 H3 在某些介面中自動選擇構圖)。
6) 透過應用程式生成(快速啟動路徑): 在 MiniMax H3 應用程式/網站中:(1) 選擇 MiniMax H3,切換到影片。(2) 貼上您的提示並可選上傳參考(圖像/影片/音訊)。(3) 選擇長寬比和持續時間。(4) 點擊生成以接收帶有原生立體聲音訊的影片。(5) 下載結果。
7) 透過託管 API 生成(非同步任務提交): 創建 API 金鑰(例如,EvoLink)。POST 非同步生成請求,接收任務 ID,輪詢狀態,然後在完成時下載生成的 MP4。為您的模式使用正確的模型 ID(例如,「minimax-h3-text-to-video」)。不要混合模式特定字段(例如,文字路由不接受 image_start;參考路由不接受 image_start/image_end)。
8) API 請求範例(文字轉影片): 發送類似以下的 JSON:{ "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" }。然後通過任務 ID 輪詢直到完成並下載 MP4。
9) 本地 ComfyUI 設定:安裝節點並放置模型文件: 安裝 ComfyUI 和 MiniMax H3 自定義節點(例如,ComfyUI-MiniMaxH3)。下載並放置所需的權重:擴散模型(例如,minimax_h3_fl2va_pruned_int8_convrot.safetensors)、文本編碼器(例如,qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors),以及兩個 VAE:minimax_h3_video_vae_fp16.safetensors(影片)+ minimax_h3_audio_vae_fp32.safetensors(音訊)。確保您的工作流程包含連接到 SaveVideo 的 VAEDecodeAudio,以便音訊寫入輸出。
10) 本地 ComfyUI:選擇正確的分辨率(避免太小): H3 的最小分辨率為 384p;256p 會失敗。使用官方分辨率預設/模板。H3 的原生畫布短邊為 768px(上限為 768×1344,32 的倍數)。對於全品質本地輸出,將百萬像素提高到約 1.0(16:9 時約 1344×768)。
11) 本地 ComfyUI:為您的模式運行正確的節點: 對於 FL2VA(文本 + 可選的首/尾幀),使用 MiniMaxH3ImageToVideo 節點並將圖像連接到 first_frame 和/或 last_frame。對於 Ref2VA(多參考),使用 MiniMaxH3ReferenceToVideo 節點並提供帶有提示中描述的明確角色的有序圖像/影片/音訊參考。
12) 本地 vLLM (ROCm) 服務選項(進階): 如果使用 ROCm 上的 vLLM Omni 部署,請使用官方 vllm/vllm-omni-rocm:minimax-h3 圖像,並根據請求類型服務 /path/to/MiniMax-H3/FL2VA 或 /path/to/MiniMax-H3/Ref2VA。切換服務路徑並重新啟動以在 FL2VA 和 Ref2VA 處理之間切換。
13) 使用基於指令的編輯進行迭代(改變一件事,保持其餘穩定): 生成後,通過給出簡單語言的編輯指令(更換服裝、替換背景、重新打光、重寫對話等)進行精煉。H3 旨在保持未觸及的部分穩定,同時應用請求的更改。為了可靠的迭代,一次只改變一個變量並保持一個可行的基準。
14) 解決常見問題(音訊、分辨率和「損壞」的提示): 如果音訊聽起來不對,請添加明確的聲音方向(環境音、音樂風格、音效時間、對話意圖)。如果輸出失敗或在本地看起來損壞,請確保分辨率 ≥384p,並且影片+音訊 VAE 都已加載並將 VAEDecodeAudio 連接到 SaveVideo。如果提示在託管的 Hailuo/應用程式中有效但在本地無效,請記住託管管道可能包含 Context-IR 預處理;在本地您可能需要更明確的結構和參考角色分配。
15) 適當導出和使用結果: 下載 MP4(帶有原生立體聲音訊)。如果使用開放權重,請遵守 MiniMax H3 社區許可協議和任何使用限制;託管 API 可能在全球範圍內可用,而開放權重條款可能具有地域性並包含諸如禁止蒸餾等限制。

Minimax H3 常見問題

MiniMax H3 是一個開放權重、通用多模態影片生成模型,它可以在單一語境中同時讀取文字、圖像、影片和音訊,並生成連貫的視聽影片片段。

与 Minimax H3 类似的最新 AI 工具

Loud Fame
Loud Fame
Loud Fame是一個AI驅動的視頻轉換工具,允許用戶將普通視頻轉換為動畫風格的動畫,並創建AI生成的明星對話視頻。
BizBoom.ai
BizBoom.ai
BizBoom.ai 是一個由 AI 驅動的平台,可以從產品鏈接和圖像自動生成專業產品視頻,成本降低 95%。
EzVideos
EzVideos
EzVideos 是一個全方位的視頻創作工具,通過自動化編輯功能和內置資源,幫助用戶為 Instagram、TikTok 和 YouTube 等社交媒體平台生成病毒式視頻。
Illuminix
Illuminix
Illuminix 是一個由 AI 驅動的平台,通過自主超級專家和專門工具為業務流程自動化、數據管理和視頻內容創作賦能。