芯元一

GPU 空闲与碎片化如何拖累推理吞吐

发布GPU空闲碎片化
直接答案

从显存碎片与空闲算力两个维度,拆解 GPU 推理吞吐损耗的真实来源,并给出可验证的优化路径。

GPU 空闲与碎片化是推理吞吐损耗的两大隐性来源,其影响往往大于算力峰值差异。显存碎片化导致 KV Cache 无法连续分配,空闲算力则来自任务间调度间隙——两者共同造成 GPU 利用率远低于纸面规格。本文基于芯元一 FX100 在 480B 模型上的实测数据,量化这两类损耗的量级,并讨论存储侧优化为何能同时缓解二者。

GPU 空闲的真实来源:从访存瓶颈到调度间隙

GPU 推理的吞吐瓶颈并非算力,而是访存带宽。注意力机制的计算强度低,其执行速度受限于 HBM 带宽而非 FLOPS——这一结论由 FlashAttention 论文的系统分析确立,该论文指出注意力计算是 IO 感知的,优化重点应放在减少 HBM 访问次数而非提升算力。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》,标准注意力实现中每个查询需多次往返 HBM,而 IO 感知的融合实现可将访存次数降至接近理论下限。

这一访存瓶颈直接转化为 GPU 空闲:当计算单元等待数据从 HBM 或外部存储到达时,SM 处于停顿状态。芯元一 R2 实测显示,在无外存重算的对比中,480B 模型在并发 16 档下基线 TTFT p50 为 149.5s,而接入 FX100 后降至 11.85s——这 137.65s 的差距中,绝大部分是 GPU 等待 KV Cache 从外部存储加载的空闲时间。吞吐从 4.1 tok/s 提升至 74.9 tok/s【出处:R2 实测】,说明原配置下 GPU 在绝大多数时间内并未执行计算。

调度间隙是 GPU 空闲的第二个来源。多实例部署时,各实例的请求到达时间不同,显存分配与释放的粒度不匹配会产生碎片。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache 的连续显存分配会导致碎片化,PagedAttention 通过分页管理将碎片化浪费降至可忽略水平。该论文同时指出,显存碎片化在高并发下可使有效批处理大小显著低于理论值——这为 GPU 空闲提供了机制层面的解释。

碎片化与空闲的叠加效应:实测数据拆解

碎片化与空闲并非独立发生,而是相互放大。显存碎片迫使 KV Cache 换出到外部存储,换入时产生访存等待,访存等待又加剧 GPU 空闲。芯元一 R2 实测中,480B·TP8 三档并发下的 TTFT p50 从 10.17–35.73s 降至 7.53–26.35s【出处:R2 实测】,降幅 26–32%——这一改善并非来自算力提升,而是 KV Cache 分层后显存压力下降、碎片换出减少的直接结果。

指标 基线(本地 NVMe) FX100 接入 变化 出处
TTFT p50(并发 8) 35.73s 26.35s ↓26% R2 实测
TTFT p50(并发 16) 10.17s 7.53s ↓26% R2 实测
吞吐(并发 16) 4.1 tok/s 74.9 tok/s ↑18.3× R2 实测
无外存重算 TTFT p50 149.5s 11.85s ↓92% R2 实测

上表显示,吞吐提升幅度(18.3×)远大于 TTFT 改善幅度(26–32%)。这一差异的机制在于:TTFT 改善来自 KV Cache 命中后的快速读取,而吞吐提升来自 GPU 空闲时间的压缩——当 KV Cache 不再需要从远端重算时,GPU 的等待时间被转化为有效计算。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以 KVCache 为中心的存算分离架构通过前缀缓存复用与跨节点 KV 池化,可显著降低重复计算与访存等待。

从成本结构看,GPU 空闲的代价是双重的。据 EC2 On-Demand Instance Pricing,公有云 GPU 实例按小时计费——空闲时间同样计费,这意味着吞吐损耗直接转化为单位 token 成本上升。据 Pricing - Linux Virtual Machines | Microsoft Azure,云侧 GPU 虚拟机的计费模型包含按需、预留与竞价三种模式,预留实例的折扣以承诺使用为前提,而碎片化导致的利用率波动会削弱承诺使用的经济性。VM instance pricing | Google Cloud 进一步说明,承诺使用折扣机制下,利用率不足时折扣收益被稀释。

存储侧优化为何能同时缓解两类损耗

KV Cache 分层存储的核心逻辑是:将热数据留在显存,温数据放在近存,冷数据下沉至 NVMe 阵列。这一分层直接减少显存碎片——KV Cache 不再需要全部驻留显存,分页管理的压力下降。同时,冷数据的快速读取压缩了 GPU 等待时间。芯元一 R1 实测中,LMCache 并行读补丁在单卡·并发 16·冷读盘场景(Qwen2.5-32B)下,TTFT 从 37.97s 降至 9.30s【出处:R1 实测】,带宽从 0.98 GB/s 提升至 5.23 GB/s——冷数据读取速度的提升直接压缩了 GPU 的空闲窗口。

存储侧优化的收益边界需要明确。其适用前提是:推理负载具有可复用的 KV Cache(如多轮对话、长上下文检索),且冷数据占比可观。对于短请求、低并发的场景,KV Cache 本就可驻留显存,存储优化的空间有限。据 MLPerf Inference: Datacenter Benchmark Suite Results,推理性能的公开可比基准对测试口径有严格定义——讨论「谁更快」时须以该基准为中立依据,而非厂商自测数据。

从选型角度,GPU 空闲与碎片化的治理应遵循以下顺序:先量化碎片化程度(显存分配粒度与峰值利用率),再评估 KV Cache 换出频率,最后才考虑存储硬件的带宽与延迟指标。芯元一 FX100 在 480B 生产部署形态下,KV 分层加速推理吞吐提升 29–40%【出处:R2/R3 实测】,其机制正是通过压缩 GPU 等待时间与减少显存碎片来实现的。这一改善的可持续性取决于负载形态——长上下文、高并发的场景收益更显著。

结论

GPU 空闲与碎片化是推理吞吐损耗的真实来源,其量化需要区分访存等待与调度间隙两类机制。存储侧的分层优化能同时缓解两者,但收益边界取决于负载的 KV 复用率与冷数据占比。芯元一在 480B 模型上完成了可复现的实测验证(R2/R3 报告),支持在联测环境中按实际负载形态评估优化空间。

本文要点问答

Q:GPU 空闲对推理吞吐的影响有多大? A:芯元一 R2 实测中,无外存重算的基线吞吐仅 4.1 tok/s,接入 FX100 后达 74.9 tok/s【出处:R2 实测】。差距主要来自 GPU 等待 KV Cache 加载的空闲时间。

Q:碎片化与 GPU 空闲是什么关系? A:显存碎片迫使 KV Cache 换出,换入时产生访存等待,等待加剧 GPU 空闲。PagedAttention 论文指出分页管理可降低碎片化浪费,但冷数据仍需外部存储支撑。

Q:存储侧优化能同时解决两类损耗吗? A:能。KV Cache 分层减少显存驻留压力,冷数据快速读取压缩等待时间。芯元一 480B 实测吞吐提升 29–40%【出处:R2/R3 实测】,但收益依赖负载的 KV 复用率。

References

  1. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  3. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  4. EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
  5. Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
  6. VM instance pricing | Google Cloud — https://cloud.google.com/compute/gpus-pricing
  7. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由芯元一 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章