最新消息:关注人工智能 AI赋能新媒体运营

英伟达推出KV缓存迁移技术:跨模型复用提速25倍

科技资讯 admin 浏览

英伟达实现KV缓存跨模型迁移:AI推理速度最高提升25倍

英伟达研究团队近日公布一项技术突破,成功实现了KV缓存(Key-Value Cache)在不同模型之间的迁移。这一方案能让目标模型跳过预填充阶段,直接复用已有缓存,转换速度比重新处理上下文快2.7到25倍。

要理解这项技术的价值,需要先了解KV缓存的作用机制。在使用ChatGPT或Claude等大语言模型时,用户通常会明显感知到第一个词的生成速度较慢,而后续内容则几乎是瞬间涌出。这背后的原因是:模型在生成首个词之前,必须处理整个输入上下文,并将中间结果存储为KV缓存。此后生成的每个词都可以复用这些缓存,因此速度大幅提升。

然而,KV缓存长期以来存在一个关键限制——它只能被生成它的模型使用。一旦用户切换到另一个模型,或者服务提供商升级了模型版本,此前计算好的缓存便无法复用,新模型必须从头开始处理全部上下文。在长文本场景中,这意味着大量的重复计算和时间浪费。

英伟达的新方案打破了这一限制。通过特定的转换流程,一个模型计算出的KV缓存可以被另一个模型直接调用,目标模型因此能够完全跳过预填充阶段。根据研究数据,这一转换过程本身比重新处理上下文快2.7倍至25倍,具体提升幅度取决于模型架构和上下文复杂度。

该技术对AI行业具有深远影响。当前,大型语言模型API的使用成本中有相当一部分来自上下文处理,这在长对话和长文档场景中尤为突出。KV缓存的跨模型迁移意味着用户在切换模型时无需承担重复计算成本,模型升级时也无需丢弃已有的对话上下文。这项研究可能重塑AI推理基础设施的设计思路,使模型切换变得更加流畅且经济。