英伟达发布开源音频-文本大模型 Audex

英伟达研究团队发布开源统一音频-文本大语言模型 Nemotron-Labs-Audex-30B-A3B(Audex)。该模型基于纯文本 MoE 架构,采用单一 Transformer 解码器统一处理文本与量化音频 token,并兼容现有 LLM 基础设施。训练数据包括 1574 亿音频 token 和 3205 亿文本 token,结合多阶段监督训练、纯文本 Cascade RL 与多域在策略知识蒸馏。据介绍,Audex 在音频理解、语音识别、翻译和音频生成等任务中表现突出,同时保留原 LLM 的推理、对齐、知识和长文本能力,可供开发者评估与部署。

上一篇:

下一篇:

发表回复

登录后才能评论