清华联合腾讯混元夺MLSys2026 MoE推理挑战冠军,NPU性能提升4.1倍

清华大学存储实验室与腾讯混元AI Infra团队在MLSys2026 MoE模型推理优化挑战赛中获得冠军。针对万亿参数MoE模型在NPU上的推理瓶颈,团队提出全链路优化方案,包括E-Shard专家切分、PSUM三维读出、GEMV并发路径及标量引擎优化,并重构注意力模块数据布局。同时开发基于Agent的算子优化器“Knight”,实现自动化优化闭环。最终将端到端推理时间由14.91秒降至3.56秒,提升4.1倍,单步解码延迟降至5.45毫秒。

上一篇:

下一篇:

发表回复

登录后才能评论