寒武纪宣布已基于 vLLM 推理框架完成对深度求索最新开源大模型 DeepSeek-V4 全系列的 Day0 适配,包含 285B 参数版本 Flash 和 1.6T 参数版本 Pro,使模型在发布当日即可在寒武纪硬件平台稳定运行。相关改装及加速优化代码已同步开源至 GitHub。针对 DeepSeek-V4 的稀疏注意力与压缩结构,寒武纪通过自研向量融合算子库 Torch-MLU-Ops 加速核心模块,并以 BangC 高性能编程语言编写稀疏 Attention 和 GroupGemm 优化内核,支持五维混合并行、低精度量化及分离部署。在硬件层面,充分利用 MLU 的访存与排序加速特性,减少通信损耗并提升推理效率。此次敏捷适配显示寒武纪硬件在超大规模复杂模型运行上的稳定性,为国产算力平台在大模型生态中的协同发展提供技术支撑。