OpenAI近日宣布将GPT-Live-1正式接入API,支持全双工实时语音交互、语音打断处理、停顿识别和背景噪声处理。模型整合语音理解与语音输出,可通过提示词调整语气、语速及对话风格,并支持原生转写、关键词偏置、轮次检测和工具调用。开发者可将其连接Codex及OpenAI Presence,构建可查询企业系统、执行授权操作并转接人工的电话智能体,应用于餐厅预订和客户服务等场景。早期评估显示,Speak接入后误打断次数减少近80%;GPT-Live-1在Full Duplex Bench测试中较GPT-Realtime-2.1高30个百分点。其前端语音层定价为每分钟0.05美元,后端模型及工具费用另计。