OpenAI宣布将GPT-Live-1引入API,开发者可构建支持实时语音交互的应用和业务流程。该模型支持全双工对话,可同时听取和输出语音,并处理打断、停顿及背景噪声,适用于餐厅预订、客户服务等电话场景。GPT-Live-1将语音理解与输出整合在同一模型中,以降低交互延迟,并支持连接Codex、企业系统及获批工具,必要时转交人工。早期评估显示,Speak平台误打断次数减少近80%;其前端语音层价格为每分钟0.05美元,另提供12种新增声音。
OpenAI宣布将GPT-Live-1引入API,开发者可构建支持实时语音交互的应用和业务流程。该模型支持全双工对话,可同时听取和输出语音,并处理打断、停顿及背景噪声,适用于餐厅预订、客户服务等电话场景。GPT-Live-1将语音理解与输出整合在同一模型中,以降低交互延迟,并支持连接Codex、企业系统及获批工具,必要时转交人工。早期评估显示,Speak平台误打断次数减少近80%;其前端语音层价格为每分钟0.05美元,另提供12种新增声音。