MiniMax 发布全模态模型 H3 将开源权重
MiniMax 于 7 月 31 日发布全模态生成模型 H3,统一理解与生成文本、图像、视频和声音,支持最高 15 秒 2K 原生双声道视频,同分辨率价格不到主流模型三分之一。模型权重将在数日内开源,旨在加速国产芯...
TechFoco
共 2 篇文章,按时间倒序展示。
MiniMax 于 7 月 31 日发布全模态生成模型 H3,统一理解与生成文本、图像、视频和声音,支持最高 15 秒 2K 原生双声道视频,同分辨率价格不到主流模型三分之一。模型权重将在数日内开源,旨在加速国产芯...
本文介绍了 MM_StoryAgent,一个用于生成沉浸式故事书视频的多智能体框架。该框架支持基于设定进行高质量故事创作,并整合图像、语音、音效和音乐等多模态内容生成,同时允许用户通过自定义工作流提升生成质量。
