AI公司MiniMax发布通用全模态生成模型MiniMax H3,支持文本、图像、视频、音频的统一理解与生成,可原生输出双声道音视频,最高生成15秒2K分辨率内容。官方称,H3已在指令遵循、品牌信息呈现、V2V动作迁移等场景展现商用稳定性,可用于广告、电商、游戏、UI设计等领域。技术上,H3采用上下文全模态表示、自研H3-VAE及In-context Regeneration,在2K分辨率下每秒生成成本不到主流模型三分之一。MiniMax还计划在符合法规前提下开源H3权重,以推动开源生态和国产芯片适配。