OpenAI在API中推出全双工语音模型GPT-Live-1

OpenAI近日在API中推出全双工语音模型GPT-Live-1。该模型采用单一模型同时处理输入和输出音频,减少传统“语音转文字—模型推理—文字转语音”级联架构带来的延迟,并支持即时打断。复杂推理和工具调用可交由后端文本模型完成。早期测试中,语言学习平台Speak称其将思考停顿期间的中断减少近80%。开发者可通过系统提示词调整语气、节奏和对话风格,模型支持背景噪声及静默上下文,适用于客服、餐饮预订等场景。目前该模型已全面开放API,前端语音层价格为每分钟0.05美元,Yelp、Intercom等合作伙伴已参与应用。

上一篇:

下一篇:

发表回复

登录后才能评论