英伟达提出KV缓存迁移方案:跨模型复用上下文,推理最高快25倍

英伟达研究团队公布一项KV缓存迁移方法,可将一个模型生成的缓存转换后供另一模型直接使用,目标模型无需重新执行预填充阶段。研究显示,转换过程相比重新处理完整上下文可提速2.7倍至25倍,具体幅度取决于模型与上下文复杂度。

上一篇:

下一篇:

发表回复

登录后才能评论