智谱发布ZCube网络架构并落地GLM-5.1,推理吞吐提升15%、网络成本降33%

智谱联合清华大学与驭驯网络在ACM SIGCOMM 2025提出ZCube网络架构,并于2026年5月在GLM-5.1 coding生产环境落地。该方案在GPU与软件栈不变情况下,实现交换机与光模块资本支出降低33%,GPU推理吞吐提升15%,首Token时延P99下降40.6%。ZCube通过扁平化二部图互联与双端口混合接入,替代传统Clos与ROFT架构,缓解KV Cache跨节点传输不均与网络拥塞问题,支持数万至数十万GPU规模扩展。目前千卡集群已稳定运行两周以上。

上一篇:

下一篇:

发表回复

登录后才能评论