8 月 3 日,人工智能企业 MiniMax 宣布开源新一代通用视频模型 MiniMax H3。该模型面向多模态生成,可融合文本、图像、视频和音频上下文,支持输出 4 至 15 秒视频,规格包括 24 FPS、32 kHz 立体声及多种宽高比;常规模式短边为 768 像素,并可通过 H3-Regenerate-2K 输出 2K 分辨率。H3 支持 11 种主流语言,提供首尾帧模式和全模态参考模式,最多可混合输入 9 张图像、3 段视频和 3 段音频。模型已按 MiniMax H3 Community License 发布,可在 Hugging Face 获取。