通义千问大模型近日升级核心音频能力,正式推出实时语音识别模型 Fun-ASR-Realtime。该模型将首字识别延迟控制在百毫秒级,面向语音交互提供“即说即反馈”体验;识别准确度接近行业领先离线识别模型。模型支持30种语言识别,并强化中文方言处理能力,可识别16种方言,适用于语音助手、会议速记等实时交互场景,面向开发者和企业用户提供智能语音应用底层能力。
通义千问大模型近日升级核心音频能力,正式推出实时语音识别模型 Fun-ASR-Realtime。该模型将首字识别延迟控制在百毫秒级,面向语音交互提供“即说即反馈”体验;识别准确度接近行业领先离线识别模型。模型支持30种语言识别,并强化中文方言处理能力,可识别16种方言,适用于语音助手、会议速记等实时交互场景,面向开发者和企业用户提供智能语音应用底层能力。