英伟达开源 Nemotron-Labs-TwoTower,文本生成吞吐提升 2.42 倍

英伟达 7 月 2 日发布并开源 Nemotron-Labs-TwoTower 离散扩散语言模型权重,面向大模型逐 Token 串行生成效率瓶颈。该模型基于 Nemotron 骨干网络改造,总参数量 60B,由两座 30B 网络组成,每塔激活 3B 参数,并通过上下文塔与去噪塔协同、交叉注意力传递信息,实现并行文本生成。基准测试显示,其综合能力保留原版 98.7%,生成吞吐提升 2.42 倍,代码和数学任务略有下降。完整双塔推理需双张 H100 或 A100 80GB GPU,单卡仅支持自回归模式。

上一篇:

下一篇:

发表回复

登录后才能评论