MiniMax H3 正式开源:2K 分辨率、15 秒带声视频的全模态生成系统
MiniMax H3 正式开源:2K 分辨率、15 秒带声视频的全模态生成系统
来源:MiniMax 官方新闻(2026-08-03)
新闻概要
8 月 3 日,MiniMax 正式开源新一代通用视频模型 MiniMax H3 —— 一个通用型全模态生成系统:统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带原生立体声音频的视频。
得益于以任务泛化为导向的系统设计,H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力,能出色地遵循复杂的多模态指令。
核心信息
- FL2VA:支持 T2VA 和 FL2VA 任务 - Ref2VA:支持基于参考图像、视频和音频的 Ref2VA 任务
- 能力:文生视频(T2VA)、首帧/首尾帧图生视频(FL2VA)、参考图像/视频/音频生视频(Ref2VA),最长 15 秒、2K 分辨率、原生立体声音频
- 开源范围:H3-Base 已开源(Hugging Face + 魔搭社区),支持 SGLang、vLLM、diffusers、ComfyUI 等推理框架/工作流部署
- Checkpoint:
- Full 2K Workflow:官方提供完整 2K 复现工作流,将本地部署的 H3-Base 与 H3-Context-IR、H3-Regenerate-2K API 组合,可复现 MiniMax API 直接生成的 2K 结果(部分复杂模块暂未开源,通过 API 复现)
对开发者的意义
- 多模态生成一站到位:一个系统同时理解并生成文本/图像/视频/音频,大幅简化多模态应用的架构。
- 本地可部署:H3-Base 开放权重 + 主流推理框架支持,可在本地/私有化环境跑视频生成。
- 与生态联动:同期 MiniMax MCP Server 上线(8 月 10 日),支持 Claude Desktop、Cursor、Windsurf、OpenAI Agents 等 MCP 客户端一键调用视频/图像/语音生成能力。
如何使用
- 开源地址:Hugging Face
MiniMaxAI/MiniMax-H3;魔搭社区MiniMax/MiniMax-H3 - 在线 API:MiniMax 开放平台(国内 https://platform.minimaxi.com / 海外 https://www.minimax.io)
参考链接
- MiniMax 官方新闻:https://www.minimaxi.com/news/minimax-h3-open-source
- MiniMax MCP Server:https://www.minimaxi.com/news/minimax-mcp