Moonshot AI 与清华大学发布跨数据中心推理架构 PrfaaS

Moonshot AI 联合清华大学研究团队推出大型语言模型新架构“预填充即服务”(PrfaaS),以解决传统模型在数据中心资源受限下的推理瓶颈。该架构将计算密集的预填充阶段迁移至专用高性能集群,并通过通用以太网将生成的键值缓存(KVCache)传输至本地解码集群,实现跨数据中心的高效协同。测试显示,PrfaaS 在服务吞吐量方面较传统架构提升约 54%,并具备更低延迟与更高资源利用率。系统还通过分离计算、网络和存储子系统及双时间尺度调度机制,优化长请求传输与流量适配,为未来多数据中心的 AI 推理提供了新的技术路径。

上一篇:

下一篇:

发表回复

登录后才能评论