小米近日开源工业级目标说话人语音识别大模型 CocktailASR-1。该模型基于参考声纹识别目标说话人,用户输入参考音频和目标音频后,可在多人混合、混响及噪声环境中仅转录指定人员语音,并过滤其他声音。模型采用 D2V2 音频编码器、Adapter 和大模型解码器的端到端架构,权重统一集成。测试显示,其在 LibriMix2mix、LibriSpeechMix2mix 上的 WER 分别为4.11%和2.90%,在 LibriMix3mix 上为12.29%,并支持负样本拒识和思维链推理。相关代码已按 Apache 2.0 协议在 GitHub 开源。