论文研究 ·
KV缓存新淘汰策略:多样性感知分层打分机制
Beyond Mean Attention: Diversity-Aware, Layer-Wise Scoring for KV Cache Eviction
77进行中1 条arXiv cs.CL
AI 解读
AI 生成推荐理由可降低大模型长文本推理的显存占用,加快推理速度。
兼顾相关性与多样性的分层KV缓存驱逐方法,长上下文任务表现优于现有基线
发生了什么
研究团队针对现有KV缓存驱逐方法仅依靠观测窗口内平均注意力打分的局限,提出融合注意力离散度、与已选token冗余度的统一打分公式,无需额外前向传播,同时探索了随网络深度调整系数的分层配置方案。测试基于16个英文LongBench数据集、Mistral-7B模型开展:全局固定多样性系数可提升13个数据集表现,宏指标平均+1.1;段落检索任务的分层配置,相比基线在64缓存预算下提升9.6,128预算下较全局配置提升13.2。
关键信息
- 测试模型
- Mistral-7B
- 测试基准
- 16个英文LongBench数据集
- 全局配置增益
- 64层缓存预算下13/16数据集提升,宏指标平均+1.1
- 检索任务分层配置增益
- 64预算下较基线+9.6,128预算下较全局配置+13.2
- 方法特性
- 打分计算无需额外前向传播
背景
当前主流KV缓存驱逐方法如SnapKV、PyramidKV,仅在小观测窗口内按平均注意力对token排序,未考虑token注意力分布差异、已选token冗余度,也未针对不同网络深度调整打分权重。
为什么重要
该方法在无额外计算开销的前提下提升了KV缓存利用效率,对行业来说可降低长上下文大模型的部署成本;对开发者而言,无需改动推理流程即可在有限缓存预算下获得更优长文本任务表现;对普通用户来说,未来低显存设备也能实现流畅的长文档检索、问答体验。
后续看点
后续可关注该方法在更大规模模型、多语言长上下文任务上的验证效果,以及与主流推理框架的适配落地进展。
由 AI 根据原文生成,可能有疏漏,以原文为准。