小米发布 MiMo-V2.5 全链路语音模型系列,TTS 支持一句话生成新音色、ASR 开源多方言识别

小米正式推出 MiMo-V2.5 全链路语音模型系列,涵盖三款语音合成(TTS)模型及一款开源语音识别(ASR)模型,面向智能体(Agent)语音输入与输出场景。TTS 系列支持自然语言控制语速、情绪与语气,其中 MiMo-V2.5-TTS-VoiceDesign 可通过一句话生成新音色,MiMo-V2.5-TTS-VoiceClone 仅需短样本即可高保真复刻人声,并支持音频标签与分层剧本机制,实现复杂语音表演。MiMo-V2.5-ASR 模型已开源,支持粤语、吴语、闽南语、四川话等方言及中英混说,具备强噪环境下的高鲁棒性和原生标点输出。三款TTS模型已在小米 MiMo 开放平台限时免费开放,ASR 模型权重与代码完全开源,加速智能语音生态应用落地。

上一篇:

下一篇:

发表回复

登录后才能评论