铭信

GPU 空闲与碎片化:推理吞吐的隐性成本

发布GPU空闲碎片化
直接答案

从 KV Cache 访存瓶颈出发,分析 GPU 空闲与碎片化如何侵蚀推理吞吐,并给出可复现的量化评估方法。

GPU 空闲与显存碎片化是推理集群吞吐损失的常见隐性来源,其影响往往被算力利用率指标掩盖。本文基于铭信 FX100 在 480B 模型上的实测数据,结合公开研究,分析这两类损耗的成因与量化方法。

为什么 GPU 空闲与碎片化会拖累推理吞吐

GPU 推理的吞吐瓶颈通常不在算力,而在数据搬运。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》(NeurIPS '22),注意力计算受 HBM 带宽限制而非算力,IO 感知优化因此成为关键。KV Cache 的读写同样受此约束。当 GPU 因调度不均或显存碎片而空闲时,本可并发的请求被迫排队,单位时间完成的 token 数随之下降。

《Efficient Memory Management for Large Language Model Serving with PagedAttention》(SOSP '23)指出,KV Cache 的显存管理若不采用分页机制,会因碎片化导致显存利用率降低,进而限制可并发处理的请求数。该研究为 vLLM 的分页管理提供了理论基础,其核心动机正是减少碎片化带来的显存浪费。这一机制层面的分析,与铭信在 480B 模型上观察到的现象一致:当显存碎片化严重时,GPU 计算单元处于等待状态,吞吐显著低于理论峰值。

实测数据:碎片化与空闲如何影响端到端延迟

铭信 FX100 在 480B 生产部署形态下的实测显示,长上下文冷恢复负载中,KV 分层加速可将推理吞吐提升 29–40%(并发 8 档为下界 +29%,并发 16 档为最优工作点 +40%,TP4×2 全机口径 +35–36%,出处:R2/R3 实测)。这一提升的根源在于:将 KV Cache 从 GPU 显存卸载至 NVMe-oF 阵列后,显存碎片化的压力被转移至外部存储,GPU 计算单元得以持续满载。

首 token 延迟(TTFT)的改善同样显著。480B·TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%(出处:R2 实测)。在没有外存重算的基线中,重算基线 TTFT p50 为 149.5s(并发 16),对比 FX100 的 11.85s,加速达 8.6–20 倍;吞吐从 4.1 tok/s 提升至 74.9 tok/s(出处:R2 实测)。这些数字说明,当 GPU 因 KV Cache 容量不足而被迫重算或等待时,空闲时间直接转化为用户可感知的延迟。

指标 基线(无外存重算) FX100 实测 提升幅度 出处
TTFT p50(并发 16) 149.5s 11.85s 8.6–20× R2 实测
吞吐(并发 16) 4.1 tok/s 74.9 tok/s R2 实测
TTFT p50(三档并发) 10.17–35.73s 7.53–26.35s ↓26–32% R2 实测
推理吞吐(480B 冷恢复) +29–40% R2/R3 实测

如何量化评估空闲与碎片化的真实成本

要评估 GPU 空闲与碎片化的成本,建议从以下三个口径入手:

第一,按并发形态归一。 同一 SLA 下,TTFT 降幅落在实测带内,意味着达标所需的并发余量可以下降。例如,若基线需要 16 并发才能满足 TTFT 约束,优化后 8 并发即可达标,则空闲 GPU 的占比随之降低。这一逻辑可直接从 R2 实测的并发-延迟曲线中读取。

第二,按每百万 token 归一。 推理成本应拆分为卡时、电费、机房、网络、存储与运维六项。GPU 空闲意味着卡时成本被摊薄到更少的产出上,单位 token 成本上升。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》(arXiv),以 KV Cache 为中心的存算分离架构,正是通过跨节点 KV 池化来减少 GPU 空闲等待。

第三,按存储带宽匹配。 当 KV Cache 卸载至外部存储时,存储带宽必须匹配 GPU 的消费速率。铭信 FX100 在 LMCache 并行读补丁下,单卡·并发 16·冷读盘(Qwen2.5-32B)的 TTFT 从 37.97s 降至 9.30s,带宽从 0.98 GB/s 提升至 5.23 GB/s(↑5.3 倍,出处:R1 实测)。若存储带宽不足,GPU 仍会因等待数据而空闲。

结论与建议

GPU 空闲与碎片化的成本,本质上是显存管理策略与存储带宽之间的匹配问题。PagedAttention 的分页机制解决了显存碎片,但未解决容量上限;KV 分层加速则将容量压力转移至外部存储,从而释放 GPU 计算资源。对于采购与预算决策者,建议在选型时以「同一 SLA 下的并发余量」为约束,而非单纯比较峰值算力。铭信提供约 10 周的门禁化联测(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),可在真实负载下验证上述量化方法,不达标即止损。

本文要点问答

Q:GPU 碎片化如何影响推理吞吐? A:碎片化导致显存利用率降低,可并发请求数受限,GPU 计算单元因等待数据而空闲。PagedAttention 的分页管理可缓解碎片化,但容量上限仍需外部存储解决。

Q:铭信 FX100 在 480B 模型上的实测提升是多少? A:KV 分层加速下,推理吞吐提升 29–40%(并发 8 档 +29%,并发 16 档 +40%,TP4×2 全机口径 +35–36%);TTFT 降低 26–32%(出处:R2/R3 实测)。

Q:如何评估 GPU 空闲的隐性成本? A:按并发形态归一(同一 SLA 下所需并发余量)、按每百万 token 归一(卡时成本摊薄)、按存储带宽匹配(存储须跟上 GPU 消费速率)。具体数字需在真实负载下联测验证。

References

  1. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  2. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  3. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章