
8 月 3 日,MiniMax 正式开源新一代通用型全模态生成系统 MiniMax H3。这是 MiniMax 继三代 M 系列文本模型之后,推出的首款开源多模态生成模型,一次性把”全模态理解 + 高清视频生成 + 开源生态 + 国产算力适配”打包推向开发者——H3 既能统一理解文本、图像、视频、音频构成的混合上下文,又能直接生成最高 2K 分辨率、最长 15 秒、带原生立体声音频的音画内容,并在预训练阶段就具备广泛的多模态指令遵循能力。
三模块架构,Hugging Face 可直接下载
完整的 H3 系统由 H3-Context-IR、H3-Base、H3-Regenerate-2K 三个模块组成。开发者现已可在 Hugging Face 直接拉取 MiniMax-H3 权重;其中 H3-Base 支持通过 SGLang、vLLM、diffusers、ComfyUI 等主流推理框架与工作流部署,意味着从数据中心到本地工作站都能快速跑起来。 输入侧,H3 支持文本、图片、音频、视频多种模态混合输入;输出侧,2K 分辨率直出、最长 15 秒的原生音画同步——这把高质量视频内容的创作和使用门槛进一步拉低。
十六家芯片与生态方同日 Day0 适配
H3 开源当天,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 等国内外头部芯片厂商,连同 Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub、fal 等开发社区与云推理平台,以及 vLLM-Omni、SGLang 等推理框架,集体完成适配支持。 国产算力侧的动作尤其快:
- 沐曦曦云 C 系列 GPU 依托自研 MXMACA 软件栈率先 Day0 适配,面向大模型海量参数与长上下文推理场景;
- 海光信息基于海光 DCU 完成极速适配,落地全流程部署与性能核验;
- 摩尔线程基于 MTT S5000 智算卡和 MUSA 软件栈,仅用 3 小时便打通从 SGLang-MUSA 推理框架到 MATE、muDNN 高性能算子库的完整链路;
- 壁仞科技基于 SGLang 框架,在壁砺系列旗舰 GPU 上完成 Day0 适配与调优。
这种”模型开源即国产硬件全适配”的节奏,过去通常要数周甚至数月——H3 把它压缩到了同一天。
榜单与成本:全球第一的视频编辑能力,价格打到三分之一
在 Artificial Analysis 视频模型榜单中,H3 的视频编辑能力排名全球第一。模型在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等维度表现突出,可应用于广告、品牌、电商、产品设计、UI/UX、游戏等商用场景。
更关键的是定价:2K 分辨率视频生成 0.8 元/秒,约为业内同类旗舰视频模型的三分之一。MiniMax 的降本路径来自三方面:
- 高压缩 Tokenizer 降低视频生成所需 Token 数量,直接从表示层压低成本;
- 针对视频长度、分辨率、多模态负载差异大的特点,做异构训练与负载均衡;
- 系统级优化 GPU 利用效率,在效果与训练/推理成本之间找平衡。
方法论文:把文本模型的成功经验”平移”到多模态
H3 的训练思路借鉴了文本模型已被验证的几条路径——复杂问题拆解、Reasoning、Scaling Context、Muon 优化器,并将其应用到多模态理解、数据构建与模型训练中;围绕不同任务的理解和指令遵循,MiniMax 对数据体系做了多轮迭代,以提升模型面对开放输入和复杂指令时的泛化能力。
这种”文本范式 → 多模态迁移”的做法,让 H3 不只是又一个视频生成模型,而是试图在效果、成本、开放性、生态协同四个维度同时推进。
产业意义:多模态模型竞争进入综合维度
💡 MiniMax 相关负责人表示:”通过 MiniMax H3,我们希望为更多企业和开发者、创作者降低内容创作的门槛。
企业可以在本地灵活部署,结合自身数据和业务进行优化,更好地满足安全合规要求;芯片厂商和开发者也能共同参与适配和优化,降低使用成本,扩大应用范围。
“H3 的开源,把多模态模型的竞争从单纯的”效果跑分”推向效果 × 成本 × 开放性 × 生态协同的综合维度。
对企业而言,可本地部署+自有数据定制,意味着安全合规与业务贴合度;对国产芯片厂商而言,Day0 适配能力正在成为标配竞争力——沐曦、海光、摩尔线程、壁仞等公司在 H3 之前,也已先后完成对腾讯混元 Hy3、美团 LongCat-2.0、智谱 GLM-5.2、MiniMax M3 等旗舰模型的快速适配。
模型企业与国产 AI 芯片的软硬件协同生态,由此再下一城。
MiniMax 的多模态路线,也借此进入”模型能力、训练效率、开源生态、行业应用”协同推进的新阶段。
