OpenAI 推出三款实时语音模型,覆盖对话、翻译与转录场景

OpenAI 宣布发布三款新型实时语音模型——GPT‑Realtime‑2、GPT‑Realtime‑Translate 和 GPT‑Realtime‑Whisper,全面提升语音交互能力。GPT‑Realtime‑2 具备 GPT‑5 级推理能力,可实现连续的语音对话,并支持工具调用与上下文理解;GPT‑Realtime‑Translate 支持超过 70 种输入语言和 13 种输出语言,提供接近同声传译的实时翻译体验;GPT‑Realtime‑Whisper 则专注于低延迟语音转录,可即时生成字幕和会议记录。三款模型已纳入 OpenAI 的 Realtime API 体系,GPT‑Realtime‑2 定价为每 100 万音频输入 Token 32 美元、输出 Token 64 美元,Translate 和 Whisper 分别按分钟计费,费用为 0.034 美元和 0.017 美元。开发者可通过 Playground 测试或直接接入应用。此举进一步扩展 OpenAI 在实时多模态语音交互领域的产品布局。

上一篇:

下一篇:

发表回复

登录后才能评论