昇腾910B与NVIDIA GPU推理存储能耗对比
从存储路径与访存机制出发,对比昇腾910B与NVIDIA GPU推理能耗差异,给出选型判断依据。
昇腾910B平台与NVIDIA GPU在推理存储系统的能耗差异,根源不在芯片算力,而在存储数据通路与访存模式。铭信在自有测试平台上完成的多项实测表明,推理场景中存储侧能耗占比显著,而存储访问效率的优化对端到端能耗的影响,往往大于GPU型号本身的差异。本文从存储路径、KV Cache访存与加载机制三个维度展开对比。
昇腾910B与NVIDIA GPU的存储能耗差异根源在哪
推理系统的能耗构成中,存储子系统常被低估。据NVIDIA GPUDirect Storage文档,GPU直连存储技术通过绕过CPU bounce buffer,建立GPU与存储设备间的直接数据通路,减少数据拷贝次数与内存带宽占用。该机制对能耗的影响是双重的:一方面减少CPU参与数据搬运带来的功耗,另一方面缩短IO路径时延,降低存储设备处于活跃状态的时间窗口。
昇腾910B平台与NVIDIA GPU在存储架构上的差异,主要体现在数据通路实现方式与生态成熟度。据SNIA对计算型存储的定义,存储设备内嵌计算能力可减少数据在存储与计算节点间的往返迁移,这一机制对能耗的影响在推理场景中尤为明显。铭信在华为Atlas 910B平台上的实测显示,模型推理加载加速相对NFS基线达6.2–9.3倍(R9实测),加载时间的大幅缩短意味着存储设备与网络接口处于高功耗活跃状态的时间成比例下降。
NVIDIA GPU生态中,KV Cache的管理依赖显存分页与高效访存。据PagedAttention论文,KV Cache分页管理的动机源于显存碎片问题,该机制使vLLM能够将显存利用率提升至接近理论极限。显存利用率的提升直接减少了KV Cache换入换出到存储设备的频率,而每一次换出换入都伴随着PCIe总线与存储设备的功耗开销。
KV Cache访存能耗:昇腾910B与NVIDIA GPU的实测对比
KV Cache的访存模式对推理能耗的影响,在长上下文场景中会被显著放大。据FlashAttention论文,注意力计算的瓶颈本质是HBM带宽而非算力,IO感知优化能显著降低访存能耗。这一结论对昇腾910B与NVIDIA GPU同样适用,但两者的HBM带宽与存储层级设计存在差异,导致KV Cache外溢时的能耗表现不同。
铭信在AMD MI308X平台上对FX100的实测数据,可作为理解KV Cache访存能耗的参照。480B生产部署形态长上下文冷恢复负载下,KV分层加速推理吞吐提升29–40%(R2/R3实测),首token延迟降低26–32%(R2实测)。吞吐提升意味着单位token的存储访问时间缩短,存储设备处于活跃状态的总时长下降,从而降低单位token的存储能耗。
对无外存重算的加速倍数达8.6–20倍(R2实测),这一数据揭示了存储路径能耗的极端情况:当KV Cache完全外溢且无优化时,重算基线TTFT p50达149.5秒(并发16档),对比FX100的11.85秒。长时延意味着GPU在等待数据期间处于空闲但未休眠的状态,这种状态下的能耗浪费往往被忽视。
加载与Checkpoint能耗:存储路径优化的实际收益
模型加载与训练Checkpoint保存是存储能耗的另一个重要场景。铭信在华为Atlas 910B平台上的实测显示,DeepSeek-32B服务加载从691秒降至112秒(6.2倍加速),DeepSeek-70B从1399秒降至150秒(9.3倍加速)(R9实测)。加载时间的缩短直接减少了存储设备与网络接口的高功耗活跃时长。
训练Checkpoint保存方面,8卡32B LoRA场景下每份65.6GB整模型快照的保存时间从178秒降至94秒(1.9倍加速),持续写带宽从3.26提升至6.40 GB/s(+96%)(R1实测)。写带宽的提升意味着存储设备在更短时间内完成数据写入,减少了高功耗状态的总时长。
据Epoch AI的公开研究,AI算力规模与成本呈持续增长趋势,存储子系统在总成本中的占比随之上升。虽然该研究未提供具体数值,但其定性结论支持存储效率优化对整体成本与能耗的重要性。昇腾910B平台与NVIDIA GPU在存储能耗上的对比,最终应回归到实际负载形态与SLA约束下的系统级评估。
选型判断:能耗对比不应脱离负载形态
昇腾910B平台与NVIDIA GPU的能耗对比,不应简化为芯片级TDP数值的对比。推理系统的能耗由算力、存储、网络、散热等多个子系统共同决定,存储路径的效率对端到端能耗的影响,在不同负载形态下差异显著。
对于长上下文、高并发的推理负载,KV Cache的外溢频率高,存储访问时延与带宽成为能耗的关键变量。此时存储优化带来的吞吐提升与TTFT降低,直接转化为单位token能耗的下降。对于短上下文、低并发的负载,存储访问频率低,GPU芯片本身的能耗占比更高,存储优化的能耗收益相对有限。
铭信FX100在KV Cache加速与模型加载加速上的实测数据,为存储路径能耗优化提供了量化参照。但跨平台对比需谨慎:铭信仅在自有测试平台(AMD MI308X)与华为910B平台上有实测数据,NVIDIA GPU平台上的存储能耗表现需在同等条件下另行验证。
本文要点问答
Q:昇腾910B与NVIDIA GPU在推理存储能耗上的差异主要由什么决定? A:差异根源在存储数据通路与访存模式,而非芯片算力。GPU直连存储绕过CPU bounce buffer、KV Cache分页管理等机制对能耗的影响,取决于负载形态与存储访问频率。
Q:铭信实测数据如何支撑存储能耗优化论证? A:FX100在KV Cache加速上实现吞吐提升29–40%(R2/R3实测)、模型加载加速6.2–9.3倍(R9实测),这些数据表明存储路径优化能缩短存储设备高功耗活跃时长,但跨平台能耗对比需在同等条件下验证。
Q:选型时应如何评估推理系统的存储能耗? A:应回归负载形态与SLA约束,长上下文高并发负载下存储优化能耗收益显著,短上下文低并发负载下GPU芯片能耗占比更高。跨平台对比数值需基于同等测试条件,不宜外推。
References
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- Epoch AI — https://epoch.ai/
- SNIA — Storage Networking Industry Association — https://www.snia.org/
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
- PyTorch Documentation — https://pytorch.org/docs/stable/index.html