千问发布语音合成大模型 Qwen-Audio-3.0-TTS,支持自然语言控制

千问于 7 月 20 日发布语音合成大模型 Qwen-Audio-3.0-TTS,主打 Free-style 自然语言指令控制。用户可通过日常语言描述语气、节奏、风格等需求,模型据此生成语音,减少传统参数配置。该模型提供 Flash 与 Plus 两个版本:Flash 面向实时交互,首包延迟降至 300 毫秒级,适用于实时问答、语音助手等场景;Plus 面向高质量生成,侧重音质与表现力,适用于有声书、配音和内容创作。

上一篇:

下一篇:

发表回复

登录后才能评论