MiniMax 发布全模态模型 H3 将开源权重
MiniMax 于 7 月 31 日发布全模态生成模型 H3,统一理解与生成文本、图像、视频和声音,支持最高 15 秒 2K 原生双声道视频,同分辨率价格不到主流模型三分之一。模型权重将在数日内开源,旨在加速国产芯...
发生了什么
MiniMax 在 7 月 31 日正式推出通用全模态生成模型 H3。该模型是继 Hailuo 01 和 02 之后的第三代模型,在预训练阶段即融合多模态数据与多样任务,追求感知与生成的统一与泛化。H3 支持文本、图像、视频和声音的多模态上下文联合理解与生成,并可输出原生双声道音视频,最高提供 15 秒 2K 分辨率的视频内容。
公司强调 H3 在指令遵循、文字呈现及视频动作迁移方面表现突出,面向广告、电商、游戏等商业场景。默认分辨率下,每秒生成价格不到主流竞品的三分之一,试图大幅降低企业调用成本。
核心能力
H3 的核心突破在于跨模态统一建模。它不再将文本、图像、视频和音频分解为独立流水线,而是在同一表征空间内完成多模态理解与生成。这意味着模型能够更自然地执行“根据文本描述生成包含特定文字和声音的短视频”这类复合任务。
原生双声道音频输出为音视频同步生成带来新的产品可能,例如直接生成带立体声旁白或环境音效的广告素材。同时,对文字呈现的优化使模型生成的画面中的文本更准确清晰,这对需要品牌标识或产品说明的商业视频尤为关键。
对开发者意味着什么
MiniMax 计划在未来几天开放 H3 的模型权重,这将为开发者社区提供可直接微调的基础模型。基于开源权重,团队可以针对自身业务数据训练垂直版本,例如电商产品展示视频生成或游戏过场动画自动化,从而在保证质量的同时降低调用成本。
低价格策略和权重的开放有望加速国产芯片的适配测试。由于模型在预训练阶段集成了多任务和跨模态学习,实际部署时可能需要对推理硬件进行针对性调优,以保证视频生成的延迟与成本可控。此外,视频生成 API 若随之推出,其调用稳定性将直接影响规模化集成的可行性。
当前边界
目前 MiniMax 尚未披露开源权重的具体许可证类型,也不清楚是否会通过官方 API 以及 API 的速率、区域等限制。模型的最大视频时长是否仅限 15 秒、是否支持调节帧率、输入输出的文件大小限制等均未说明。
此外,有关训练数据的构成、规模与版权合规性尚未公开,模型参数规模与最低推理硬件要求也未提供。“主流模型三分之一”的价格基准所对比的具体模型名单也未列出,实际成本对比仍需进一步验证。

