8月3日,MiniMax宣布开源新一代通用视频模型MiniMaxH3。MiniMaxH3是一个全模态生成系统,能够理解并生成文本、图像、视频和音频构成的多模态内容,输出最高2K分辨率、最长15秒的视频,并带有立体声音频。
MiniMaxH3支持多种输入与输出规格,包括不同宽高比和分辨率,帧率为24FPS,支持11种稳定对话语言,并提供不同程度的其他语言支持。模型版本包括H3-Base-FL2VA和H3-Base-Ref2VA,支持不同模式的图像、视频和音频输入。系统由H3-Context-IR、H3-Base和H3-Regenerate-2K三个模块组成,分别负责理解和提炼多模态指令、生成音频视频以及高分辨率输出。
MiniMaxH3基于MiniMaxH3CommunityLicense发布,开源地址为网页链接。
