黑森林实验室发布Flux3多模态基础模型,支持原生音频生成

德国AI初创公司黑森林实验室发布多模态基础模型Flux3。该模型基于Self-Flow架构,配备图像、视频、音频及动作编解码器,支持文本、图像、视频转视频、关键帧转场和多语言对话,可一次性生成最长20秒音视频同步片段。早期测试显示,Flux3在720p、10秒片段任务中对比Luma Ray3.2和Runway Gen-4.5取得较高胜率。公司还与Mimic Robotics开发机器人视频动作模型Flux-mimic,并已在奥迪工厂测试。Flux3 Video已上线,Flux3 Image及开源权重Flux3 Dev将陆续发布。

上一篇:

下一篇:

发表回复

登录后才能评论