本文是由墨尔本大学计算与信息系统学院的Jiantong Jiang、Peiyu Yang(通讯作者)、Feng Liu以及华中科技大学计算机科学与技术学院的Rui Zhang联合完成的综述论文,发表于2026年计算语言学协会年会( Findings of the Association for Computational Linguistics: ACL 2026)。该论文系统性地回顾了面向大语言模型服务的系统感知型KV基础设施(System-aware KV Infrastructure for Serving LLMs,简称SKIS)领域的最新进展,并提出了一个以系统行为为中心的三维分类框架。
随着GPT、LLaMA等大语言模型(Large Language Models, LLMs)在各类应用中展现出卓越能力,高效部署和推理服务成为制约其广泛落地的关键瓶颈。基于Transformer架构的LLMs采用自回归方式逐令牌生成文本,为避免重复计算注意力的高昂开销,服务系统通常采用键值缓存(Key-Value Cache, KV Cache)机制,将已生成令牌的中间KV张量存储起来供后续步骤复用。然而,随着提示词和输出长度的增长,KV缓存可膨胀至数百万令牌,形成严峻的内存瓶颈。
尽管已有若干综述涉及高效LLM推理和服务,但它们多为一般性讨论,将KV缓存仅作为次要组件;少数KV专用综述则按生命周期阶段或优化层次组织内容。本综述独辟蹊径,聚焦于SKIS范畴——即在推理服务期间运行、以KV缓存为核心优化目标、不重新训练基础模型权重或修改Transformer架构的系统感知型方法。作者主张从系统行为视角出发,将KV缓存优化理解为涵盖时间(执行与调度)、空间(放置与迁移)和结构(表示与保留)三个维度的行为空间,这一新颖的行为导向分类法为理解这一快速演进领域提供了稳定的分析框架。
本综述的核心贡献在于构建了以系统行为为中心的三维分类法,将现有研究工作组织为三大类行为维度,并进一步细分了具体的技术方向。
这一维度关注KV缓存的时间行为,即如何在运行时高效调度和执行缓存操作,共包含三个子方向:
KV中心调度(KV-centric Scheduling, KVS) 方法显式地将KV特性融入运行时调度决策。在请求层面,部分方法采用KV使用感知调度来平衡资源负载和减少竞争,如TetriInfer利用预测的KV使用量来优先处理请求以缓解预填充与解码阶段的干扰;另一类属于复用感知调度,优先处理高复用潜力的请求以最大化KV缓存命中率,Mooncake和Preble等工作即为代表。在更细粒度的令牌层面,Quest、SparQAttention等方法根据注意力贡献度来选择性决定哪些KV条目参与计算,RefreshKV则通过周期性刷新机制在全量上下文注意力和子集注意力之间交替。在内核层面,FlashInfer根据查询长度和KV长度在CUDA线程块之间调度注意力工作量。
流水线与重叠(Pipelining and Overlapping, Ovlp) 方法通过重叠计算、I/O和通信操作来隐藏与KV相关的延迟。如表2所示,FastDecode、CachedAttention、AsyncKV、KVPR等方法在不同模式(计算-计算、计算-I/O、I/O-通信)下实现了不同程度的操作重叠,粒度从令牌级、子批次级到层级别不等。例如,CachedAttention在层级上重叠GPU计算与KV的加载/存储操作,AsyncKV则异步预取KV块从HBM(高带宽存储器)到L2缓存,以减少后续步骤的缓存未命中。这类方法是减少空闲时间、提升系统效率的关键技术路径。
硬件感知执行(Hardware-aware Execution, HAE) 方法将KV相关操作适配到异构硬件上,包括两个主要方向。其一是分离式推理(Disaggregated Inference),将推理计算解耦到不同的硬件资源上。Infinite-LLM在算子层面将注意力分布到多个实例上;Splitwise、DistServe等系统采用预填充-解码分离策略,将计算密集的预填充和内存密集的解码分配到不同GPU集群;Mooncake进一步将分离式推理与KV中心调度器和分布式缓存池相结合。其二是计算卸载(Compute Offloading),将部分计算迁移到辅助设备以缓解GPU瓶颈。FastDecode和Neo将注意力和KV缓存同时卸载到CPU,遵循“近缓存计算”原则以提升数据局部性;AttAcc和PAPI分别探索了计算存储驱动器和存内计算设备作为卸载目标的可行性。
这一维度聚焦于KV缓存如何在内存层级和计算设备之间进行空间放置和迁移,包含两个子方向:
内存层级KV编排(Memory Hierarchy KV Orchestration, MHO) 方法将KV缓存分布到不同的内存层级上。跨设备内存层级方面,大多数工作采用重要性感知策略,仅在GPU高带宽存储器上保留关键KV条目,将完整缓存卸载到CPU DRAM或SSD等较慢但更大的存储层级中。ArkVale、OmniKV、ClusterKV、PQCache等系统在CPU端保留轻量级的代理信号来估算重要性以指导后续预取,实现了回召式压缩。FlexGen通过成本模型将KV缓存智能分配到GPU、CPU和磁盘之间以最大化吞吐量;最新的工作进一步将这一层级扩展到基于计算快速链路(Compute Express Link, CXL)的共享或分离式内存池,实现低延迟的KV访问。在运行时,许多系统基于队列状态、内存压力、计算与I/O成本以及未来复用信号等系统级信息做出在线的KV卸载或重载决策。GPU内部内存层级方面,AsyncKV和Preserve等工作将KV条目在片上L1/L2缓存与片外HBM之间进行异步预取和迁移,以提升缓存命中率。
计算设备KV编排(Compute Device KV Orchestration, CDO) 方法在不同计算能力的设备之间放置和迁移KV缓存,通常与预填充-解码分离架构耦合。DistServe提出了针对高亲和力和低亲和力GPU集群的预填充和解码放置方案,并采用解码GPU按需从预填充GPU拉取KV的机制;Tract利用CXL共享内存作为分离式预填充和解码工作节点间KV传输的底层支撑。在跨网络场景下,CacheGen通过将KV张量编码为比特流并根据运行时带宽自适应流式传输来减少网络延迟。
这一维度关注KV缓存的结构性系统行为,包含KV缓存压缩和保留管理两大方向:
KV缓存压缩(KV Cache Compression, KVCC) 是直接减少内存占用的核心研究方向。量化(Quantization)方法将浮点张量压缩为低精度格式。早期工作实现了8位和4位KV量化;后续方案广泛采用混合精度策略,对关键条目保留较高精度。一个重要发现是键和值呈现不同的异常值模式和量化敏感度(即非对称KV量化),因此常见做法是键按通道量化、值按令牌量化。在极低比特宽度下,异常值处理成为关键挑战,KIVi、GEAR、KVQuant等方法设计了专门的异常值隔离和稀疏矩阵存储技术。向量量化方向的CQ实现了1位KV压缩,VQ-LLM和CommVQ通过融合向量量化内核和旋转位置编码可交换码本进一步降低开销。低秩近似(Low-rank Approximation)将KV相关张量约束到低维子空间,目标涵盖已缓存KV张量、KV投影权重和QKV注意力子空间三个层面。XKV对缓存的KV应用层组奇异值分解,PALU则通过搜索优化的秩分配分解投影权重。结构压缩(Structural Compression)通过修改缓存组织来减少内存,包括基于注意力或相似性信号的结构单元剪枝(如丢弃部分注意力头或通道)和融合(如令牌或层的合并)。
KV缓存保留管理(KV Cache Retention Management, KVRM) 包含灵活的分配复用和策略性驱逐。结构感知方面,PagedAttention通过固定大小的页面和逻辑到物理映射来减少碎片并支持内存复用,已成为广泛采用的虚拟化分配方案;RadixAttention则利用基数树结构索引实现高效的提示共享。驱逐(Eviction)方法在有限的预算下丢弃不关键的令牌KV状态以压缩缓存。如表6所示,现有方法在驱逐时机(静态vs动态)、驱逐策略(通常保留近期窗口和注意力汇令牌、基于注意力衍生分数等轻量级信号选择额外令牌)和预算分配(从统一预算向层级、头级乃至自适应分配演进)等维度上展现了丰富的设计多样性。
基于上述分类,作者从行为-目标矩阵和行为间协同设计亲和力网络两个互补视角进行了深入分析,提炼出多项关键观察并据此提出未来挑战:
在行为-目标关系上,结构类方法研究密度最高且主导了内存节省,而时间行为对延迟和吞吐量有最直接的影响;空间方法主要针对互连I/O优化,常与流水线重叠协同使用;能耗尽管具有潜在收益却普遍被忽视;各类方法均面临质量损失风险。
在协同设计模式上,硬件感知执行与计算设备KV编排构成了最强的协同设计模式,而KV缓存压缩却相对孤立,暗示了错失的协同优化机会。
据此,作者提出了六项面向未来SKIS研究的系统级开放挑战:SLO驱动的尾部延迟控制、能耗感知优化、可信赖且高效的SKIS设计、可泛化的硬件感知执行-计算设备编排模式、压缩与调度的协同优化以及统一基准的建立。
本综述的学术价值在于首次将KV缓存优化框定为时间-空间-结构的三维行为空间,提供了一种独立于模型和内核细节的稳定分析视角,为理解和创新LLM服务基础设施建立了系统化的基础。其应用价值体现在对实际部署的指导意义上:通过揭示行为间协同设计模式和研究空白,为构建高效、可信赖的大语言模型服务系统指明了方向。特别是将可信任性纳入效率优化框架的倡导,反映了从单纯追求性能指标向兼顾质量、鲁棒性和安全性的必要转变,对于推动LLM在关键应用中的落地具有重要意义。