清华大学存储实验室与腾讯混元AI Infra团队在MLSys2026 MoE模型推理优化挑战赛中获得冠军。针对万亿参数MoE模型在NPU上的推理瓶颈,团队提出全链路优化方案,包括E-Shard专家切分、PSUM三维读出、GEMV并发路径及标量引擎优化,并重构注意力模块数据布局。同时开发基于Agent的算子优化器“Knight”,实现自动化优化闭环。最终将端到端推理时间由14.91秒降至3.56秒,提升4.1倍,单步解码延迟降至5.45毫秒。
清华大学存储实验室与腾讯混元AI Infra团队在MLSys2026 MoE模型推理优化挑战赛中获得冠军。针对万亿参数MoE模型在NPU上的推理瓶颈,团队提出全链路优化方案,包括E-Shard专家切分、PSUM三维读出、GEMV并发路径及标量引擎优化,并重构注意力模块数据布局。同时开发基于Agent的算子优化器“Knight”,实现自动化优化闭环。最终将端到端推理时间由14.91秒降至3.56秒,提升4.1倍,单步解码延迟降至5.45毫秒。