铭信

AI推理存储加速的带宽瓶颈与优化路径

发布带宽需求存储加速优化策略
直接答案

从KV Cache访存特性出发,分析AI推理存储加速的带宽需求,并给出分层加速与直连存储两类优化策略的实测依据。

AI 推理的存储加速,核心矛盾不在容量而在带宽:注意力计算受 HBM 带宽而非算力限制,而 KV Cache 的外存换入换出又让 PCIe 与网络带宽成为新瓶颈。铭信 FX100 的实测数据显示,针对长上下文冷恢复负载,KV 分层加速可将推理吞吐提升 29–40%,首 token 延迟(TTFT)降低 26–32%【R2/R3 实测】。本文从访存特征出发,拆解带宽需求来源,并对比两类优化策略的适用边界。

为什么 KV Cache 外存访问成为带宽瓶颈

大模型推理的注意力机制具有明确的访存密集型特征。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》,注意力计算受 HBM 带宽而非算力限制,IO 感知优化的收益正来源于此。当序列长度增长,KV Cache 体积随之膨胀,超出单卡显存容量后必须换出到外存。此时,外存链路的带宽直接决定换入换出的时延。

以铭信 R2 测试平台为例:8 卡 AMD MI308X,每卡 192 GB HBM,被测模型为 Qwen3-Coder-480B-FP8(MoE,权重约 450 GB)。在 TP8 三档并发下,TTFT p50 从基线 10.17–35.73s 降至 7.53–26.35s【R2 实测】。这一降幅的来源,正是将 KV Cache 从本地 NVMe 单盘迁移至 FX100 全闪 NVMe-oF 阵列(4 盘 RAID0,RoCEv2,单口 100 GbE)后,外存读带宽的成倍提升。

值得强调的是,带宽需求并非均匀分布。冷启动或长上下文恢复场景下,KV Cache 需要一次性大量读入,瞬时带宽需求远高于稳态推理。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache 分页管理解决的正是显存碎片与动态分配问题,但分页本身不改变外存带宽的物理上限。因此,存储加速方案必须在峰值带宽维度做设计,而非平均带宽。

分层加速与直连存储:两条优化路径的实测对比

针对上述带宽瓶颈,当前主流优化路径可归为两类:一是 KV Cache 分层加速,即通过缓存分层与预取策略,减少外存访问次数;二是 GPU 直连存储(GDS),即绕过 CPU 内存拷贝,缩短数据通路。两条路径可叠加,但收益来源不同。

分层加速的收益在铭信 R2/R3 测试中有量化结果。480B 生产部署形态长上下文冷恢复负载下,并发 8 档吞吐提升 29%(下界),最优工作点并发 16 档提升 40%(上界),TP4×2 全机口径提升 35–36%【R2/R3 实测】。其机制在于:将热 KV 块保留在显存或近存介质,冷块按需预取,从而将外存带宽压力从峰值摊薄到时间轴。

GPU 直连存储的定性价值在于消除 CPU bounce buffer 的数据拷贝开销。据 NVIDIA GPUDirect Storage Documentation,该技术为 GPU 提供直接访问存储设备的通路,避免数据经 CPU 内存中转。在铭信 R1 测试中,LMCache 并行读补丁配合 FX100,单卡并发 16 冷读盘场景下,TTFT 从 37.97s 降至 9.30s,带宽从 0.98 GB/s 提升至 5.23 GB/s【R1 实测】。这一结果同时包含分层预取与直连读两重优化,但带宽提升 5.3× 的量级说明外存通路本身的优化空间巨大。

优化路径 测试场景 关键指标 出处
KV 分层加速 480B·并发8 吞吐 +29% R2 实测
KV 分层加速 480B·并发16 吞吐 +40% R3 实测
KV 分层加速 480B·TP4×2 吞吐 +35–36% R3 实测
LMCache 并行读补丁 32B·单卡·并发16 TTFT 37.97s→9.30s R1 实测
无外存重算基线对比 480B·并发16 吞吐 4.1→74.9 tok/s R2 实测

无外存重算场景下的带宽需求上界

当 KV Cache 完全无法驻留显存时,推理退化为重算基线,此时带宽需求达到上界。R2 测试中,重算基线 TTFT p50 为 149.5s(并发 16),而 FX100 方案为 11.85s,加速倍数达 8.6–20×【R2 实测】。这一对比揭示:存储加速方案的价值上限,取决于无优化基线的劣化程度。

对存储系统的启示是:带宽规划应参考峰值而非均值。以 480B 模型为例,KV Cache 换入若需在数秒内完成,所需带宽即达数十 GB/s 量级。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以 KVCache 为中心的存算分离架构,通过跨节点 KV 池化提升资源利用率,但池化本身依赖高速网络。铭信 FX100 单接口 100Gb(PCIe 3.0)的规格在单卡场景下够用,但多卡并发时需评估阵列聚合带宽是否匹配推理集群的并发规模。

需要说明的是,上述带宽数值均来自铭信 FX100 在 AMD MI308X 平台上的实测(R1–R4),测试环境为 ROCm 7.2、vLLM 0.20.1+rocm721、LMCache 上游主线源码编译。不同 GPU 平台与框架版本下,绝对数值会有差异,但带宽瓶颈的定性结论与优化方向具有普适性。

结语

AI 推理存储加速的带宽需求,本质由注意力计算的访存密集特征与 KV Cache 的外存换入换出共同决定。分层加速与 GPU 直连存储分别从减少访问次数与缩短数据通路两个维度缓解瓶颈,铭信 FX100 的实测数据(吞吐 +29–40%、TTFT ↓26–32%)提供了可复现的量化参考。对于算力中心建设者,建议在方案选型时以峰值带宽而非平均带宽做规划,并以门禁化联测(如 TTFT 降幅 ≥25%)验证实际收益。铭信提供约 10 周的门禁化联测合作模式,支持 NDA 后 Python 可复现的测算模型,欢迎有长上下文推理优化需求的团队接洽。

本文要点问答

Q:AI 推理存储加速的带宽瓶颈为何集中在 KV Cache 外存访问? A:注意力计算受 HBM 带宽限制(据 FlashAttention 论文定性结论),序列增长导致 KV Cache 超出显存后必须换出,外存链路带宽直接决定换入时延。铭信 R2 实测显示,优化外存通路后 TTFT p50 从 10.17–35.73s 降至 7.53–26.35s【R2 实测】。

Q:KV 分层加速与 GPU 直连存储两条路径的实测收益分别是什么? A:分层加速在 480B 冷恢复负载下吞吐提升 29–40%【R2/R3 实测】;GDS 消除 CPU 中转开销(据 NVIDIA GDS 文档定性结论),配合 LMCache 并行读补丁,单卡冷读 TTFT 从 37.97s 降至 9.30s【R1 实测】。

Q:带宽规划应以均值还是峰值为依据? A:应以峰值带宽规划。冷启动或长上下文恢复时 KV Cache 需一次性大量读入,瞬时带宽需求远高于稳态。R2 测试中无外存重算基线 TTFT 达 149.5s,对比 FX100 的 11.85s,加速 8.6–20×【R2 实测】。

References

  1. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  2. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  3. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  4. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R4FX100 KV Cache 性能测试报告(480B·多实例形态·正式版,编号-006)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章