字节跳动近日推出音频创作模型 Seed Audio 1.0,并已上线火山方舟体验中心开放测试。该模型在统一框架下联合建模人声、音效和环境声,可端到端生成面向叙事的完整声音作品。官方称,其支持 100 毫秒级时间线控制、零样本生成、长音频延展和多情绪音色演绎,覆盖中文、英语、日语等 20 余种语言。评测显示,Seed Audio 1.0 在九大常见创作场景中的音频可用率超过 90%,多语言生成自然度 MOS 评分普遍达到 4 分以上。
字节跳动近日推出音频创作模型 Seed Audio 1.0,并已上线火山方舟体验中心开放测试。该模型在统一框架下联合建模人声、音效和环境声,可端到端生成面向叙事的完整声音作品。官方称,其支持 100 毫秒级时间线控制、零样本生成、长音频延展和多情绪音色演绎,覆盖中文、英语、日语等 20 余种语言。评测显示,Seed Audio 1.0 在九大常见创作场景中的音频可用率超过 90%,多语言生成自然度 MOS 评分普遍达到 4 分以上。