Google近日发布语音转文字模型Gemini 3.5 Transcribe,面向开发者、企业和个人用户开放,重点提升嘈杂环境、专业术语及自然口语场景下的识别效果。官方数据显示,该模型流式语音识别平均词错误率为4.0%,非流式场景为2.6%,支持85种语言、最多三名说话者的带时间戳识别,并可适配自定义词汇。模型还具备自动纠错、删除口语填充词和文本格式化功能,可用于语音智能体、实时字幕及通话分析等应用。目前,开发者可通过Google AI Studio和Google Antigravity中的Gemini API公开预览,普通用户可在Android版Gboard及macOS版Gemini应用中使用,Google计划后续将其接入Chrome。