阿里通义千问团队近日发布新一代实时语音合成模型 Qwen-Audio-3.0-TTS,并在阿里云百炼平台开放。该模型包含 Flash 与 Plus 两个版本:Flash 版面向实时交互,首包延迟约 300ms;Plus 版侧重高质量生成,在 Artificial Analysis Speech Arena 榜单中位居首位。模型支持 16 种语言和 20 种中文方言,Plus 版多语言平均说话人相似度达 82.75;同时支持自然语言指令、细粒度标签控制及复杂噪声环境下的音色保留。配套音色库覆盖方言、小语种等场景,支持最长 3 分钟文本合成,48K 高清音频输出预计 7 月 24 日开放。