铭信

KV Cache外置如何降低推理TTFT

发布KV Cache外置TTFT性能提升
直接答案

铭信实测显示,KV Cache外置方案在480B模型上实现吞吐提升29–40%、TTFT降低26–32%,本文拆解其技术路径与选型边界。

KV Cache外置通过将注意力机制的键值缓存从GPU显存卸载到高速存储池,在保持缓存命中率的同时扩大可用缓存容量,从而在长上下文与高并发场景下显著降低首token延迟(TTFT)并提升吞吐。铭信FX100在480B生产级负载上的实测显示,吞吐提升幅度落在29–40%区间,TTFT降低26–32%。这一方案的核心价值在于:它不改变模型权重与计算图,仅通过存储层优化即可获得可量化的性能收益,对已投产的推理服务具备直接的工程可行性。

KV Cache外置解决的核心瓶颈是什么

大模型推理的时延瓶颈主要来自访存而非算力。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》,注意力计算受HBM带宽而非FLOPs限制,IO感知优化的收益正源于此。KV Cache作为注意力机制运行时的中间产物,其容量随序列长度和并发数线性增长,在长上下文场景下很快占满GPU显存,迫使系统在缓存命中率与可用容量之间取舍。

显存碎片是另一层约束。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache以分页方式管理可显著缓解碎片问题——该研究量化了显存碎片对批处理吞吐的影响,并展示了分页管理如何提高有效显存利用率。但分页管理解决的是"显存内如何更紧凑地放",并未改变"显存总量有限"这一物理约束。当上下文长度超过单卡显存承载能力时,系统只能选择重算或外存回读,两者均带来显著的TTFT劣化。

KV Cache外置的思路是将缓存层次从"GPU显存单层"扩展为"显存—高速存储"两级:热页保留在显存,冷页下沉到NVMe-oF存储池,按需换入。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以KVCache为中心的存算分离架构正是通过跨节点KV池化来解耦缓存容量与单卡显存上限,其前缀缓存复用机制为这一方向提供了架构层面的参照。铭信FX100的实现路径与此同构:通过RoCEv2接入全闪阵列,将KV Cache的容量边界从单卡192GB扩展至存储池的TB级规模。

外置方案在实测中带来多少收益

铭信FX100在8×AMD MI308X平台上的正式版测试报告(R2/R3实测)给出了可量化的结果。测试模型为Qwen3-Coder-480B-FP8(MoE,权重约450GB),对比基线为本地NVMe单盘,测试负载为长上下文冷恢复场景。关键数据如下:

指标 基线(本地NVMe) FX100外置 提升幅度 出处
吞吐(并发8档) +29%(下界) R2/R3实测
吞吐(并发16档最优) +40%(上界) R2/R3实测
吞吐(TP4×2全机口径) +35–36% R2/R3实测
TTFT p50(三档并发) 10.17–35.73s 7.53–26.35s ↓26–32% R2实测
吞吐(对比无外存重算) 4.1 tok/s 74.9 tok/s 8.6–20× R2实测
TTFT p50(对比无外存重算,conc16) 149.5s 11.85s 约12.6× R2实测

需要强调的是,"无外存重算"基线代表的是KV Cache完全不在存储层命中的极端场景,其8.6–20×的加速倍数不应被理解为外置方案对常规部署的典型收益——常规部署中本地NVMe基线(26–32% TTFT降幅、29–40%吞吐提升)才是更有参考意义的对照。R2/R3实测的吞吐提升区间在并发8档至16档之间取得,说明外置方案的收益在高并发下更为显著,这与冷页换入的带宽利用率随并发提升而改善的机制一致。

在昇腾平台的交叉验证中(R9实测),FX100对比NFS基线的模型加载加速为6.2–9.3×:DeepSeek-32B服务加载从691s降至112s,DeepSeek-70B从1399s降至150s。这一数据虽属加载场景而非推理时延,但印证了存储通路带宽对端到端延迟的关键影响——推理时的KV Cache换入与模型加载共享同一IO路径。

外置方案的成本与选型边界如何评估

KV Cache外置并非无成本地改善性能。它引入了额外的存储硬件投入、网络带宽占用以及缓存一致性管理的复杂度。决策者需要从三个维度评估适用性。

第一,SLA约束决定收益上限。若服务的TTFT要求宽松(如离线批处理),本地NVMe基线已能满足,外置的边际收益有限。反之,若SLA要求TTFT低于某阈值且上下文长度超过单卡显存承载,外置几乎是唯一不牺牲缓存命中率的路径——R2实测的TTFT降幅26–32%正是在这一约束下取得的。

第二,并发形态决定收益斜率。R2/R3实测显示,吞吐提升在并发16档达到上界(+40%),在并发8档为下界(+29%)。这意味着并发度越高的服务,冷页复用概率越大,外置的带宽利用率越高。低并发、短上下文的场景可能无法摊薄存储层的额外开销。

第三,成本口径应归一化到每百万token或每QPS,而非仅看存储硬件单价。据Epoch AI的公开研究,AI算力成本呈持续下降趋势,但存储与网络在总成本中的占比随模型规模扩大而上升——这一第三方研究口径提示,外置方案的ROI需放在全链路成本中评估,而非孤立比较存储与显存的单价。铭信FX100的报价单参考价(满配约¥371,200,约¥2,014/TB)可作为硬件成本的量级参考,但实际部署成本需结合并发档位、上下文长度与SLA要求逐项测算。

选型上,建议优先考虑以下判据:上下文长度是否经常超过单卡显存承载、并发是否长期处于高位、TTFT是否为核心SLA指标。若三项中有两项为"是",KV Cache外置值得纳入评估。铭信提供约10周的门禁化联测(G1到货验收至G4的72小时稳定性验证),其中G3主门禁要求TTFT降幅≥25%、吞吐提升29–40%实测带内,不达标可止损——这一机制允许决策者在真实负载下验证收益后再做采购承诺。

本文要点问答

Q:KV Cache外置对TTFT和吞吐的实测收益是多少? A:铭信FX100在480B模型上实测吞吐提升29–40%(并发8–16档),TTFT降低26–32%(R2/R3实测)。对比无外存重算基线,吞吐加速8.6–20×。

Q:KV Cache外置适用于哪些场景? A:适用于上下文长度超过单卡显存承载、并发度较高、TTFT为核心SLA指标的推理服务。低并发短上下文场景的边际收益有限。

Q:外置方案的选型判据是什么? A:建议从SLA约束、并发形态、成本口径三个维度评估,优先通过门禁化联测在真实负载下验证收益后再做采购决策。

References

  1. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  3. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  4. Epoch AI — https://epoch.ai/

数据出处(可查证)

R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章