[LG]《Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse》T Heo, R Shafipour, R Zhao, M Golub… [NVIDIA] (2026)
在大模型集群部署中,不同规模模型间的动态切换(如从小模型路由到大模型)会导致 KV 缓存失效。过去必须重新执行昂贵的 Prefill 计算,本质原因是不同参数量的模型在隐藏空间中的表征互不兼容,造成了巨大的计算冗余与推理延迟。
本文的核心洞见是:同族模型间的 KV 缓存存在极强的线性结构相关性。由此,通过剥离旋转位置编码以解耦语义与位置信息,并利用闭式岭回归建立跨层线性映射,实现了无需梯度训练即可将源模型缓存精准转化为目标模型格式的关键操作。
这项工作为长文本推理中的模型无缝接力提供了实用方案,将 Prefill 延迟降低了 2.7 至 25 倍。它为跨模型缓存复用打开了新门,但尚未跨过的门槛是处理 KV 头数或维度不匹配的异构架构转换难题。
arxiv.org/abs/2608.03893 机器学习 人工智能 论文 AI创造营








