智谱联合清华大学与驭驯网络在ACM SIGCOMM 2025提出ZCube网络架构,并于2026年5月在GLM-5.1 coding生产环境落地。该方案在GPU与软件栈不变情况下,实现交换机与光模块资本支出降低33%,GPU推理吞吐提升15%,首Token时延P99下降40.6%。ZCube通过扁平化二部图互联与双端口混合接入,替代传统Clos与ROFT架构,缓解KV Cache跨节点传输不均与网络拥塞问题,支持数万至数十万GPU规模扩展。目前千卡集群已稳定运行两周以上。
智谱联合清华大学与驭驯网络在ACM SIGCOMM 2025提出ZCube网络架构,并于2026年5月在GLM-5.1 coding生产环境落地。该方案在GPU与软件栈不变情况下,实现交换机与光模块资本支出降低33%,GPU推理吞吐提升15%,首Token时延P99下降40.6%。ZCube通过扁平化二部图互联与双端口混合接入,替代传统Clos与ROFT架构,缓解KV Cache跨节点传输不均与网络拥塞问题,支持数万至数十万GPU规模扩展。目前千卡集群已稳定运行两周以上。