Moonshot AI与清华大学推出PrfaaS架构 提升大模型推理效率54%

Moonshot AI(月之暗面)与清华大学联合研发并发布新型架构“预填充即服务”(PrfaaS),旨在解决大语言模型(LLM)在数据中心部署中的算力与带宽瓶颈。该架构通过将预填充(Prefill)与解码(Decode)阶段解耦处理,将计算密集的预填充任务分配至高算力集群,再通过以太网将生成的键值缓存(KVCache)传输至本地解码集群,实现跨地域的高效协同。PrfaaS采用双时间尺度调度与精确路由机制,可动态调配资源以应对流量波动。实测结果显示,该架构使服务吞吐量提升54%,显著降低响应延迟并优化资源利用率。此次合作为大模型推理服务的工程化与跨地域算力网络建设提供了新的技术路径。

上一篇:

下一篇:

发表回复

登录后才能评论