MiniMax发布全模态生成模型H3,计划开源模型权重

人工智能企业MiniMax近日发布全模态生成模型MiniMax H3,并承诺将在数日内开源模型权重。该模型支持文本、图像、视频、声音等多模态上下文组合输入,可生成带原生双声道音频的高清视频。技术上,H3将文生图、文生视频、图到视频及音频处理整合至统一预训练框架,采用H3-Omni Transformer架构,使端到端训练吞吐量提升近30%;其H3-VAE架构通过重写Tokenizer降低高分辨率推理成本。MiniMax称,H3在2K分辨率下每秒价格低于主流同类模型三分之一,并兼容国产芯片。

上一篇:

下一篇:

发表回复

登录后才能评论