Black Forest Labs上线FLUX3多模态基础模型,支持20秒音视频生成

Black Forest Labs宣布以Early Access方式推出FLUX3多模态基础模型。该模型采用统一架构联合学习图像、视频和音频,基于Self-Flow自监督流匹配框架扩展,可用于多模态生成与理解任务。FLUX3支持单次生成最长20秒视频并同步输出原生音频,覆盖文生视频、图生视频、视频续写、关键帧转视频、多语言对话等场景。官方称,在10秒720p带声音视频人工评测中,FLUX3相较Grok Imagine Video胜率为69%,相较Seedance 2.0和Gemini Omni Flash胜率均为52%。

上一篇:

下一篇:

发表回复

登录后才能评论