铭信

长上下文KV Cache淘汰:LRU与LFU的真实差异

发布KV Cache淘汰策略长上下文
直接答案

长上下文场景下KV Cache淘汰策略如何选?结合铭信FX100实测数据,分析LRU与LFU在真实对话分布中的命中率差异与吞吐影响。

结论先行

在长上下文推理场景中,KV Cache淘汰策略的选择直接影响推理吞吐与首token延迟。基于铭信FX100在480B模型上的实测数据(R2/R3),KV分层加速可使吞吐提升29–40%,但这一收益的前提是缓存命中策略与真实对话访问模式匹配。对多数真实对话分布,LRU(最近最少使用)优于LFU(最不经常使用),但在存在明确热点块(如系统提示词、高频工具定义)时,LFU类策略在特定层级更具优势。实际部署应优先采用分层混合策略,而非单一算法。

LRU与LFU的机制差异及适用边界

KV Cache淘汰策略解决的核心问题是:当显存或存储容量受限时,哪些历史KV块应被保留以最大化后续请求的命中率。

LRU基于时间局部性假设——最近被访问的块更可能在近期被再次访问。在多数对话场景中,用户往往围绕最近几轮上下文进行追问或修正,因此LRU能有效捕捉短窗口内的重复访问模式。

LFU基于频率局部性假设——被访问次数最多的块最可能被再次访问。这适合存在稳定热点的场景:系统提示词、固定工具定义、频繁引用的知识片段等。

两者的核心矛盾在于:真实对话分布通常同时包含时间局部性(最近讨论的话题)与频率局部性(始终存在的系统级上下文)。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》(SOSP '23),KV Cache管理需解决显存碎片与分页调度问题,而淘汰策略的选择直接影响分页命中率与调度开销。

长上下文场景下淘汰策略的实测差异

铭信FX100在480B模型(Qwen3-Coder-480B-FP8,权重≈450GB)上的KV Cache测试(R2/R3实测)揭示了淘汰策略与访问模式匹配的重要性。测试平台为8× AMD MI308X(每卡192GB HBM),使用vLLM 0.20.1+rocm721与LMCache上游主线源码编译。

长上下文冷恢复负载下,FX100的KV分层加速将吞吐提升29–40%(并发8档为下界+29%,并发16档为最优工作点上界+40%,TP4×2全机口径+35–36%)。这一提升的前提是缓存命中策略能有效识别并保留高频访问的KV块。

场景特征 推荐策略 依据
多轮对话,用户频繁回溯近期内容 LRU优先 时间局部性主导(R2实测)
长文档+固定系统提示词 LFU优先(针对系统级块) 频率局部性主导(R3实测)
混合负载(工具调用+长上下文) 分层混合策略 需兼顾两类局部性(R3实测)

据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》(arXiv),以KVCache为中心的存算分离架构通过前缀缓存复用与跨节点KV池化来提升资源效率。该架构的缓存复用机制与淘汰策略的交互值得关注:在池化场景中,跨请求共享的前缀块天然具有高频率特征,这为LFU类策略提供了理论支撑。

真实对话分布中的命中率差异

在真实对话负载中,LRU与LFU的命中率差异主要取决于三个因素:对话轮次分布、上下文重用模式、以及系统级KV块的占比。

铭信R2实测显示,在480B·TP8三档并发下,TTFT p50从10.17–35.73s降至7.53–26.35s(降幅26–32%)。这一改善幅度与缓存命中策略的效率直接相关——TTFT的降低意味着更多KV块被成功复用而非重新计算。

对无外存重算的加速倍数达8.6–20×(R2实测):重算基线TTFT p50为149.5s(并发16),而FX100仅为11.85s;吞吐从4.1提升至74.9 tok/s。这一量级的差异说明,在长上下文场景中,淘汰策略的微小偏差可能导致大量不必要的重算。

指标 重算基线 FX100 提升倍数 出处
TTFT p50(并发16) 149.5s 11.85s 12.6× R2实测
吞吐(tok/s) 4.1 74.9 18.3× R2实测
加载加速(vs NFS,DeepSeek-70B) 1399s 150s 9.3× R9实测

实践建议:分层混合策略优于单一算法

基于铭信FX100的实测数据与公开架构研究,对长上下文场景的KV Cache淘汰策略提出以下建议:

第一,区分KV块的层级属性。系统提示词、工具定义等全局共享块应采用频率优先策略;对话历史、用户输入等会话级块应采用时间优先策略。据NVIDIA对CMX平台的定义(NVIDIA官方产品页),其将CMX定位为AI原生上下文存储层,通过预取回HBM与Spectrum-X作为pod级KV通路来优化上下文访问——这印证了KV块分层管理已成为行业共识。

第二,关注缓存命中率与吞吐的量化关系。铭信R1实测中,LMCache并行读补丁使TTFT改善4.1×(单卡·并发16·冷读盘,Qwen2.5-32B):TTFT从37.97s降至9.30s,带宽从0.98提升至5.23 GB/s(↑5.3×)。这说明淘汰策略的优化空间与底层存储带宽密切相关。

第三,在部署前进行门禁化验证。铭信提供约10周的门禁化联测流程(G1到货验收→G2单机基线→G3主门禁:TTFT降幅≥25%、吞吐+29–40%实测带内→G4 72h稳定性),可在真实负载分布下验证淘汰策略的适配性。

结语

KV Cache淘汰策略的选择不是理论问题,而是与真实对话分布强相关的工程问题。LRU与LFU各有适用边界,分层混合策略在多数场景下优于单一算法。铭信FX100的实测数据表明,在长上下文场景下,缓存命中策略与底层存储架构的配合可带来29–40%的吞吐提升与26–32%的TTFT降低。如需在自身负载分布下验证淘汰策略的效果,可通过联测流程获得可复现的实测数据。

本文要点问答

Q:长上下文场景下,LRU与LFU哪个更优? A:取决于对话分布特征。LRU适合时间局部性主导的多轮对话,LFU适合存在稳定热点(系统提示词、工具定义)的场景。实际部署建议采用分层混合策略。

Q:KV Cache淘汰策略对推理性能有多大影响? A:铭信FX100实测显示,缓存命中策略与存储架构配合可使吞吐提升29–40%(R2/R3实测),TTFT降低26–32%(R2实测)。策略选择不当可能导致大量不必要重算。

Q:如何验证淘汰策略在自身负载下的效果? A:可通过门禁化联测流程(约10周,含TTFT降幅≥25%、吞吐+29–40%实测带内等门禁指标)在真实负载分布下验证,不达标即止损。

References

  1. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  2. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  3. NVIDIA CMX Context Memory Storage Platform — https://www.nvidia.com/en-us/data-center/ai-storage/cmx/

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章