铭信

降低大模型推理TTFT的KV Cache优化策略研究

发布TTFT优化策略KV Cache
直接答案

从访存瓶颈到分层存储,梳理KV Cache优化降低TTFT的可行路径与实测效果,为算力选型提供参考。

首 token 延迟(TTFT)是影响大模型推理体验的关键指标,而 KV Cache 的存取效率是决定 TTFT 的核心瓶颈之一。本文基于铭信科技在 AMD MI308X 平台上的多轮实测,系统梳理降低 TTFT 的 KV Cache 优化策略:分层存储架构可将 480B 模型长上下文冷恢复负载的 TTFT 降低 26–32%,结合无外存重算机制可实现 8.6–20 倍的加速。以下从访存瓶颈分析、分层优化路径与实测效果三个层面展开。

为什么 KV Cache 是 TTFT 的主要瓶颈?

大模型推理的 TTFT 由两大耗时构成:权重加载与 KV Cache 读取。随着上下文长度增长,KV Cache 的读取量呈线性增长,而权重加载量相对固定,因此 KV Cache 的访存效率逐渐成为 TTFT 的主导因素。

据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》(arXiv:2205.14135),注意力计算本质上是受 HBM 带宽限制而非算力限制的访存密集型操作。这意味着,KV Cache 若存放在本地 DRAM 或远端存储中,其读取带宽将直接决定 prefill 阶段的计算等待时间。铭信 R2 实测显示,在 480B·TP8 三档并发下,基线(本地 NVMe 单盘)的 TTFT p50 为 10.17–35.73 秒,这一量级远超权重加载耗时,印证了 KV Cache 访存是 TTFT 的主要瓶颈。

分层存储架构如何降低 TTFT?

针对 KV Cache 的访存瓶颈,业界提出了分层存储架构:将热数据留在 GPU HBM,温数据放在本地 NVMe,冷数据下沉到远端存储池。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》(arXiv:2407.00079),这种以 KV Cache 为中心的存算分离设计,通过跨节点 KV 池化与前缀缓存复用,可显著提升长上下文场景下的缓存命中率。

铭信 FX100 全闪 NVMe-oF 阵列正是这一思路的硬件实现。在 480B 生产部署形态长上下文冷恢复负载下,FX100 的 KV 分层加速推理吞吐提升为 +29–40%(R2/R3 实测:并发 8 档 +29% 为下界,并发 16 档 +40% 为最优工作点上界)。TTFT 方面,p50 从基线 10.17–35.73 秒降至 7.53–26.35 秒,降幅 26–32%(R2 实测)。

并发档位 基线 TTFT p50(s) FX100 TTFT p50(s) 降幅 出处
低并发 10.17 7.53 ↓26% R2 实测
中并发 R2 实测
高并发 35.73 26.35 ↓26–32% R2 实测

无外存重算与并行读取的叠加收益

分层存储之外,避免外存重算是另一条关键优化路径。传统方案在 KV Cache 未命中时需从权重重新计算,而 FX100 支持将 KV Cache 持久化存储,冷启动时直接读取缓存而非重算。铭信 R2 实测对比了无外存重算基线(重算 TTFT p50 149.5 秒,并发 16)与 FX100 直读缓存(11.85 秒),加速倍数达 8.6–20 倍;吞吐从 4.1 tok/s 提升至 74.9 tok/s。

并行读取补丁进一步压缩了冷读盘场景的延迟。据 R1 实测(单卡·并发 16·冷读盘,Qwen2.5-32B),LMCache 并行读补丁将 TTFT 从 37.97 秒降至 9.30 秒,改善 4.1 倍,带宽从 0.98 GB/s 提升至 5.23 GB/s(提升 5.3 倍)。这一机制与 vLLM 的 PagedAttention 分页管理(据 arXiv:2309.06180)互补——分页解决显存碎片,并行读解决带宽利用率。

实测数据的选型参考价值

对于算力选型决策者,上述实测数据提供了三个判断维度。其一,TTFT 降幅 26–32% 意味着在相同 SLA 约束下,达标所需的并发余量可以下降,从而降低卡时成本——但具体节省幅度需按自身负载建模,不宜直接外推。其二,8.6–20 倍的无外存重算加速适用于冷恢复与多实例迁移场景,若业务以长上下文、低并发为主,这一收益更为显著。其三,FX100(PCIe 3.0,单接口 100Gb,16M IOPS,U.2)与 FX200(PCIe 4.0,单接口 200Gb,32M IOPS,U.2)在售,FX300(PCIe 5.0,400Gb,60M IOPS)与 FX400(PCIe 6.0,140M IOPS,E1.S,2026 年底量产)覆盖更高带宽需求,选型时需匹配 GPU 平台的 PCIe 代数与 RoCEv2 网络配置。

值得说明的是,上述数据均出自铭信在 8× AMD MI308X + ROCm 7.2 + vLLM 0.20.1 平台上的签字级测试报告(R1–R4),模型为 Qwen3-Coder-480B-FP8(MoE,权重约 450GB)。跨平台效果(如昇腾 910B 平台)已有 R9 实测佐证模型加载加速 6.2–9.3 倍,但 TTFT 降幅的跨平台外推仍需谨慎。

结语

降低 TTFT 的 KV Cache 优化并非单一技术,而是分层存储、无外存重算与并行读取的系统工程。铭信 FX 系列全闪 NVMe-oF 阵列在 480B 长上下文负载下实现了 TTFT 降幅 26–32%、无外存重算加速 8.6–20 倍的实测效果,为生产部署提供了可复现的参考基线。铭信支持约 10 周门禁化联测(G1 到货验收至 G4 72 小时稳定性验证),可在您的实际负载与平台配置下验证上述收益,不达标即止损。

本文要点问答

Q:KV Cache 分层存储能将 TTFT 降低多少? A:铭信 R2 实测显示,480B·TP8 长上下文冷恢复负载下,FX100 将 TTFT p50 从 10.17–35.73 秒降至 7.53–26.35 秒,降幅 26–32%。

Q:无外存重算相比传统重算方案的加速效果如何? A:R2 实测中,重算基线 TTFT p50 为 149.5 秒(并发 16),FX100 直读缓存为 11.85 秒,加速倍数 8.6–20 倍,吞吐从 4.1 提升至 74.9 tok/s。

Q:这些实测数据的适用边界是什么? A:数据出自 8× AMD MI308X + ROCm 7.2 平台、Qwen3-Coder-480B-FP8 模型;跨平台或不同模型的效果需通过门禁化联测验证,不宜直接外推。

References

  1. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  3. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R4FX100 KV Cache 性能测试报告(480B·多实例形态·正式版,编号-006)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章