芯元一

大模型本地部署:KV Cache 内存外置与显存驻留边界

发布大模型本地部署KV Cache内存显存
直接答案

本地部署大模型时 KV Cache 放内存还是显存,取决于并发与上下文长度。本文结合实测数据给出选型判据。

大模型本地部署时,KV Cache 外置到内存与留在显存各有明确适用边界,不存在普适最优解。核心判据是并发档位与上下文长度:低并发、短上下文场景显存驻留占优;高并发、长上下文场景内存外置通过分层加速获得可测收益。芯元一 FX100 在 480B 生产形态长上下文冷恢复负载下实测吞吐提升 +29–40%(R2/R3 实测),可作为内存外置路径有效性的参考依据。

KV Cache 为什么成为部署瓶颈

Transformer 解码阶段每个 token 需读取全部历史 KV Cache,访存密度随序列长度线性增长。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》,注意力计算受 HBM 带宽而非算力限制,这一访存瓶颈本质决定了 KV Cache 的存放位置直接影响解码吞吐。

显存容量约束使问题进一步显性化。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache 分页管理解决了显存碎片问题,但并未增加可用容量上限。当上下文长度或并发数逼近显存边界时,系统被迫在换出重算与容量规划之间取舍。

本地部署场景的典型矛盾在于:单卡或多卡显存总量固定,而长上下文与多用户并发同时放大 KV Cache 需求。此时 KV Cache 外置到内存成为结构性解法——内存容量远大于显存,且本地部署场景中内存与 GPU 同机,访问路径可控。

内存外置的收益边界在哪里

内存外置并非无条件优于显存驻留。其收益前提是:KV Cache 访问具备时间局部性,近期使用的前缀会被反复读取。据《SGLang: Efficient Execution of Structured Language Model Programs》,RadixAttention 通过前缀树复用提升共享前缀场景的命中率,这一机制同样适用于分层存储设计。

芯元一在 480B·TP8 长上下文冷恢复负载下的实测数据可作参照。三档并发下 TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%(R2 实测);吞吐提升在并发 8 档为 +29%、并发 16 档为 +40%(R2/R3 实测)。这些数据表明:并发越高、上下文越长,内存外置的收益越显著。

指标 并发 8 并发 16 出处
吞吐提升 +29% +40% R2/R3 实测
TTFT p50 降幅 26–32%(三档并发区间) R2 实测
无外存重算对比加速 8.6–20×(全并发档) R2 实测

与之相对,低并发短上下文场景中,KV Cache 总量小,显存足以容纳全部缓存,内存外置引入的 PCIe 或网络往返反而增加时延。此时显存驻留是更直接的选择——访问路径最短,无跨设备拷贝开销。

冷恢复与重算是关键分水岭

区分两种路径适用性的核心变量是缓存命中率。高命中率场景(多轮对话、共享前缀、批量同前缀请求)中,内存外置的读取成本被命中收益摊薄;低命中率场景(随机长文档、冷启动)中,外置读取的每次未命中都需承担完整访存代价。

据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以 KV Cache 为中心的存算分离架构通过跨节点 KV 池化提升资源利用率,其设计前提是前缀缓存复用带来的高命中率。这一架构逻辑在单机分层场景同样成立:命中率决定外置收益。

芯元一实测中一个值得注意的对照是「无外存重算」基线:重算基线 TTFT p50 149.5s(并发 16)对比 FX100 的 11.85s,吞吐 4.1 对 74.9 tok/s(R2 实测)。这一极端对照说明:当缓存放不下导致回退到重算时,代价远高于任何分层策略。因此选型的第一原则是避免重算,第二原则才是选择外置层级。

选型判据与验证路径

综合以上分析,本地部署 KV Cache 存放位置可按以下顺序决策:

  1. 显存余量核算:估算目标并发与上下文长度下的 KV Cache 总量,若低于显存可用容量的安全阈值(建议预留权重与激活显存后评估),优先显存驻留。
  2. 命中率评估:若负载特征为多轮对话或共享前缀,内存外置的收益空间较大;若为随机短请求,外置收益有限。
  3. 冷恢复场景专项测试:长上下文冷恢复是最坏情况,若此场景达标则常规场景无虞。

芯元一 FX100 在 AMD MI308X×8 平台(ROCm 7.2,vLLM 0.20.1+rocm721)完成上述验证,G3 主门禁以 TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内为通过标准(R2/R3 实测口径)。该测试环境与结论适用于同类 ROCm 平台,CUDA 平台的迁移效果需另行验证。

芯元一提供约 10 周门禁化联测(G1 到货验收至 G4 72h 稳定性),支持在自有负载上验证分层收益,不达标即止损。如需评估特定模型的 KV Cache 分层效果,可在联测中直接测量。

本文要点问答

Q:KV Cache 放内存还是显存,怎么判断? A:先核算目标并发与上下文下的 KV Cache 总量,显存能容纳则优先驻留;容量不足且负载具备前缀复用特征时,内存外置可通过分层加速获得收益。

Q:内存外置的收益有多大? A:芯元一 FX100 在 480B 长上下文冷恢复负载下实测吞吐提升 +29–40%(R2/R3 实测),TTFT p50 降幅 26–32%(R2 实测),收益随并发与上下文长度增大。

Q:内存外置的适用前提是什么? A:缓存命中率是核心前提。高命中率场景(多轮对话、共享前缀)收益显著;低命中率场景外置收益有限,且应避免缓存放不下时回退到重算——重算基线的 TTFT p50 高达 149.5s(R2 实测)。

References

  1. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  3. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  4. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079

数据出处(可查证)

R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由芯元一 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章