7月31日,阿里通义千问发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,并在阿里云百炼平台开放调用。该模型主打长音频上下文记忆和行业词识别,支持会议中人名、技术概念跨片段保持一致,内置多行业词库,医疗专业词召回率达95.36%,IT编程场景达91.87%。模型还支持分级热词定制、语音润色及30余种语言识别。同期推出的Qwen-Audio-3.0-ASR-Streaming面向实时场景,理论出字延迟300毫秒。
7月31日,阿里通义千问发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,并在阿里云百炼平台开放调用。该模型主打长音频上下文记忆和行业词识别,支持会议中人名、技术概念跨片段保持一致,内置多行业词库,医疗专业词召回率达95.36%,IT编程场景达91.87%。模型还支持分级热词定制、语音润色及30余种语言识别。同期推出的Qwen-Audio-3.0-ASR-Streaming面向实时场景,理论出字延迟300毫秒。