DeepMind 推出解耦式 DiLoCo 架构:显著提升分布式训练效率与容错能力

谷歌 DeepMind 发布新型分布式训练架构“解耦式 DiLoCo”,旨在提升大规模人工智能模型的训练效率与硬件容错性能。该系统通过将训练任务分解为多个独立的异步“学习单元”,各单元可在本地完成多次梯度计算,再将压缩梯度传递给外部优化器,实现去中心化的异步更新机制。实验结果显示,DiLoCo 在高故障率条件下的资源利用率可达 88%,远高于标准并行训练的 27%。此外,该架构将跨数据中心带宽需求从 198 Gbps 大幅降至 0.84 Gbps,支持在全球多数据中心环境下的高效协同。系统还具备自愈特性,可在部分单元失效时持续训练,并在恢复后自动重整,兼容多代 TPU 等异构硬件,提升资源利用率并延长设备寿命。

上一篇:

下一篇:

发表回复

登录后才能评论