Fish Audio 发布 S2.1Pro 实时对话语音模型

Fish Audio 在成立周年之际推出生产级语音大模型 S2.1Pro,面向实时对话语音场景,已通过 Fish Audio API 上线,并提供用于开发和测试的免费版本。该模型首帧音频播放延迟约 90 毫秒,覆盖 83 种语言,采用统一语音识别架构;支持在文本中嵌入自由格式括号标签,实现耳语、紧张笑声等细粒度语音控制。S2.1Pro 还原生支持多说话人对话生成,并可通过 10 至 30 秒参考样本完成语音克隆,无需额外微调即可复刻目标语调与风格。

上一篇:

下一篇:

发表回复

登录后才能评论