
Minimax H3
MiniMax H3 是一款开放权重、真正的多模态AI视频生成器,可将文本、图像、视频和音频融合到4-15秒的片段中(最高2K/1440p),具有原生立体声、强大的角色连续性和基于指令的编辑功能。
https://minimaxh3.ai/?utm_source=aipure

产品信息
更新于:2026年08月07日
什么是 Minimax H3
H3 属于一类较新的视频模型,它将整个场景视为一个任务,而不是从单独的阶段组装。你向它提供各种素材——一个提示、一些静态图片、一个片段、一个语音样本——它会先分析这些参考资料中人物、手势、声音、情绪、构图和视觉处理之间的关系,然后再进行生成。返回的结果是一个时长在4到15秒之间、2K分辨率的镜头,其音频已作为渲染的一部分。
Minimax H3 的主要功能
MiniMax H3 是一个开放权重的通用多模态视频生成模型,能够理解文本、图像、视频片段和音轨的统一上下文,以生成带有原生同步立体声音频的短视频(约 4-15 秒)。它支持多种工作流程——文本到视频、图像到视频、首/尾帧控制、基于参考的生成和基于指令的视频编辑——因此创作者可以用简单的语言生成或修改镜头,同时在整个片段中保持角色连续性、摄像机运动、风格和声音设计,通过托管系统输出可达 2K,本地基础部署可达约 768p 短边。
统一多模态上下文(文本 + 图像 + 视频 + 音频): 在单个请求中接受混合输入——最多 9 张图像、3 个视频片段和 3 条音轨(总共 12 个文件)——并对它们进行推理,将角色、动作、摄像机语言、声音和风格融合到一个连贯的结果中。
原生立体声音频生成与语音/音频参考: 输出带有内置同步立体声(环境音、SFX、音乐和对话)的视频,并可使用提供的音频参考来指导人声/语音语调和时间,使音效与屏幕动作对齐。
参考驱动控制(身份、动作、风格): 使用参考图像保持面部/角色一致,参考视频传输编舞或摄像机运动,参考音频指导语音/音乐——实现自然语言描述的“全能参考”风格工作流程。
基于指令的视频编辑(对话式迭代): 通过简单的语言指令(交换物体/主体、更换服装、替换背景、重新打光、重写对话)编辑现有片段,同时保持未触及区域的稳定,以实现更快的逐镜头迭代。
多种生成模式与宽高比: 支持文本到视频、图像到视频、首尾帧插值以及视频到视频/编辑,涵盖常见格式(例如 16:9、9:16、1:1、21:9),适用于电影和社交输出。
开放权重生态系统 + 托管 API 选项: 在社区许可下发布,具有开放权重和工具支持(例如,diffusers 管道、ComfyUI 工作流、vLLM/SGLang 服务配方),同时也可通过托管 API 访问,用于更高端的管道,如 2K 重生成。
Minimax H3 的使用场景
营销与品牌广告: 将产品照片和简介转化为短广告创意,具有可读的屏幕文字/标志、受控的摄像机语言和内置的声音设计——然后通过指令编辑细节(灯光、背景、文案、画外音)快速迭代。
电子商务产品展示: 无需实物拍摄,即可将静态产品照片制作成精美的商品列表视频,包括包装细节、字幕和同步的氛围/音乐。
游戏开发与内容(CG、预告片、UI 演示): 生成游戏般的序列、角色 PV 和动画 UI 演练,其中一致性至关重要(HUD/菜单可读性、角色模型稳定性),使用参考来保持设计符合模型。
风格化动画与音乐视频内容: 制作具有独特外观(动漫、粘土动画、像素艺术、3D 奇幻)的片段,并将动作节拍与音乐/SFX 同步,利用风格和动作参考实现连贯的视觉节奏。
电影预可视化与短叙事场景: 创建 4-15 秒的电影节拍,带有导演风格的摄像机指令(推轨、焦点变换、剪辑/标题卡)和原生音频,适用于故事板、宣传材料和快速概念探索。
社交短视频内容制作: 通过文本提示和可选参考,快速生成适用于 TikTok/Reels/Shorts 的竖屏(9:16)有声片段,然后通过对话式编辑进行优化,而不是从头开始重新渲染。
优点
强大的多模态灵活性:在一个上下文中结合文本、图像、视频和音频,而不是使用单独的工具。
原生同步立体声音频(包括对话/SFX/环境音)减少了对单独声音设计过程的需求。
基于指令的编辑能够快速迭代,同时保持角色身份和场景布局等稳定元素。
开放权重可用性以及广泛的生态系统支持(管道/工作流/服务堆栈)实现了定制和本地实验。
缺点
完整的 2K 工作流程可能依赖于托管阶段;本地开放权重版本可能更受限制(例如,约 768p 短边基础输出),并且可能对硬件要求较高。
社区许可包含使用限制(例如,关于合法使用的义务以及使用输出/模型改进其他 AI 模型的限制)。
短片段时长限制(大约 4-15 秒)意味着更长的叙事需要拼接多个生成内容并在外部管理连续性。
如何使用 Minimax H3
1) 选择运行 MiniMax H3 的方式(应用程序、托管API或本地开放权重): 选择一个工作流程:(a) 网页/应用程序体验(最快启动):使用 MiniMax H3 应用程序/网站在聊天中生成和编辑。(b) 托管API(无服务器):提交异步任务并在完成后下载MP4。(c) 本地开放权重(ComfyUI或vLLM):在本地运行 H3-Base 以获得768p级别的输出;请注意,托管的 Context-IR 和 2K 升级模块是单独的托管阶段。
2) 决定您的生成模式(文本到视频、带首/尾帧的图像到视频或参考到视频): MiniMax H3 发布了两个针对特定任务的检查点:FL2VA(文本到视频 + 首/尾帧条件)和 Ref2VA(基于参考的生成)。选择:文本到视频用于仅提示;图像到视频用于首帧和/或尾帧控制;参考到视频用于组合多个图像/视频/音频参考(总共最多12个文件:最多9张图片、3个视频、3个音频)。
3) 编写“导演风格”的提示(主题 + 动作 + 镜头 + 灯光 + 声音): 描述片段中发生的事情,而不仅仅是静态图像。包括镜头语言(例如,跟踪镜头、焦点拉伸、手持)、灯光/时间(黄金时段、霓虹夜),并明确将音频作为独立轨道进行指导(环境音、音效、音乐、对话)。H3 输出原生立体声,因此请有意地指定声音以避免不必要的音频。
4) 如果使用参考,请为每个参考分配明确的任务: 在提供图像/视频/音频时,说明每个参考控制什么(角色身份、背景、编舞、风格、背景音乐、语音语调)。示例模式:“使用 @Image 1 用于角色面部和服装;@Image 2 用于第二个角色;@Image 3 用于环境;@Video 1 用于镜头运动和动作节奏;@Audio 1 用于背景音乐;添加同步的打击/跳跃/武器音效。”
5) 选择时长和宽高比: 在支持的范围内设置剪辑长度(通常根据平台为5-15秒)。选择一个宽高比,例如21:9、16:9、4:3、1:1、3:4或9:16(或者在某些界面中让H3自动选择构图)。
6) 通过应用程序生成(快速启动路径): 在 MiniMax H3 应用程序/网站中:(1) 选择 MiniMax H3,切换到视频。(2) 粘贴您的提示并选择性上传参考资料(图像/视频/音频)。(3) 选择宽高比和时长。(4) 点击生成以接收带有原生立体声的视频。(5) 下载结果。
7) 通过托管API生成(异步任务提交): 创建API密钥(例如,EvoLink)。POST一个异步生成请求,接收任务ID,轮询状态,然后在完成后下载生成的MP4。为您的模式使用正确的模型ID(例如,“minimax-h3-text-to-video”)。不要混合模式特定的字段(例如,文本路由不接受 image_start;参考路由不接受 image_start/image_end)。
8) API请求示例(文本到视频): 发送JSON,例如:{ "model": "minimax-h3-text-to-video", "prompt": "一个孤独的旅行者在黄金时段沿着风吹的悬崖行走,电影般的跟踪镜头", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" }。然后通过任务ID轮询直到完成并下载MP4。
9) 本地 ComfyUI 设置:安装节点并放置模型文件: 安装 ComfyUI 和 MiniMax H3 自定义节点(例如,ComfyUI-MiniMaxH3)。下载并放置所需的权重:扩散模型(例如,minimax_h3_fl2va_pruned_int8_convrot.safetensors)、文本编码器(例如,qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors),以及两个VAE:minimax_h3_video_vae_fp16.safetensors(视频)+ minimax_h3_audio_vae_fp32.safetensors(音频)。确保您的工作流程包含连接到 SaveVideo 的 VAEDecodeAudio,以便将音频写入输出。
10) 本地 ComfyUI:选择正确的分辨率(避免过小): H3 的最小分辨率为384p;256p 会失败。使用官方分辨率预设/模板。H3 的原生画布短边为768px(上限为768×1344,32的倍数)。为了获得全质量的本地输出,将像素提高到16:9时约1.0兆像素(大约1344×768)。
11) 本地 ComfyUI:为您的模式运行正确的节点: 对于 FL2VA(文本 + 可选的首/尾帧),使用 MiniMaxH3ImageToVideo 节点并将图像连接到 first_frame 和/或 last_frame。对于 Ref2VA(多参考),使用 MiniMaxH3ReferenceToVideo 节点并提供有序的图像/视频/音频参考,并在提示中描述明确的角色。
12) 本地 vLLM (ROCm) 服务选项(高级): 如果使用 ROCm 上的 vLLM Omni 进行部署,请使用官方的 vllm/vllm-omni-rocm:minimax-h3 镜像,并根据请求类型提供 /path/to/MiniMax-H3/FL2VA 或 /path/to/MiniMax-H3/Ref2VA。切换服务路径并重新启动以在 FL2VA 和 Ref2VA 处理之间切换。
13) 使用基于指令的编辑进行迭代(改变一件事,保持其余稳定): 生成后,通过给出简单的编辑指令(更换服装、替换背景、重新打光、重写对话等)进行细化。H3 旨在保持未触及的部分稳定,同时应用请求的更改。为了可靠的迭代,一次只改变一个变量并保持一个可用的基线。
14) 故障排除常见问题(音频、分辨率和“损坏”的提示): 如果音频听起来不对,请添加明确的声音方向(环境音、音乐风格、音效时间、对话意图)。如果本地输出失败或损坏,请确保分辨率 ≥384p,并且视频+音频 VAE 都已加载,VAEDecodeAudio 已连接到 SaveVideo。如果提示在托管的 Hailuo/App 中有效但在本地无效,请记住托管管道可能包含 Context-IR 预处理;在本地,您可能需要更明确的结构和参考角色分配。
15) 导出并适当使用结果: 下载MP4(带有原生立体声)。如果使用开放权重,请遵守 MiniMax H3 社区许可协议和任何使用限制;托管API可能在全球范围内可用,而开放权重条款可能具有地域性并包含诸如禁止蒸馏等限制。
Minimax H3 常见问题
MiniMax H3 是一个开放权重、通用多模态视频生成模型,它可以在一个上下文中同时读取文本、图像、视频和音频,并生成连贯的视听视频片段。











