字节跳动开源3B多模态模型Lance,统一图文视频理解与生成

字节跳动发布并开源原生统一多模态大模型Lance,参数规模仅3B,在单一模型中实现图文理解、图像与视频生成及跨模态编辑。模型采用统一交错序列与双流MoE架构,并引入MaPE位置编码机制,解决理解与生成任务冲突。Lance基于约1.5T多模态数据预训练,结合SFT与强化学习优化,支持多任务闭环输出。在多项基准测试中,其性能超越部分7B级模型。项目基于Apache 2.0协议开源,已上线Hugging Face,最低约128张A100可完成训练,部署门槛与算力成本显著降低。

上一篇:

下一篇:

发表回复

登录后才能评论