芯元一

昇腾910B与NVIDIA GPU推理存储能耗对比的实测视角

发布昇腾910B平台NVIDIAGPU能耗
直接答案

基于芯元一FX100在昇腾910B平台与AMD平台的实测数据,分析推理存储系统能耗差异的架构根源与选型判据。

在推理存储系统的能耗讨论中,昇腾910B平台与NVIDIA GPU的对比常被简化为芯片能效比之争。但据芯元一在自有测试平台上的实测数据,存储通路对系统总能耗的影响路径与芯片本身同样关键——FX100在华为Atlas 910B平台上实现模型加载加速6.2–9.3倍【R9实测】,在AMD MI308X平台上实现KV分层加速吞吐提升29–40%【R2/R3实测】,这些数字背后的存储能耗机制,才是决策者应关注的真正变量。本文从架构差异与实测数据出发,梳理两类平台在推理存储能耗上的真实分野。

昇腾910B与NVIDIA GPU在存储能耗上的架构差异根源

推理系统的存储能耗并非单一指标,而是由数据通路效率、显存容量策略与访存模式共同决定。据NVIDIA GPUDirect Storage Documentation,GPU直连存储通过绕过CPU bounce buffer,让数据在存储与显存间直接传输,减少内存拷贝带来的额外功耗。昇腾910B平台同样具备类直连能力,但两家厂商在存储协议栈的实现深度上存在差异——NVIDIA将GDS与其CUDA生态深度耦合,而昇腾的存储加速更多依赖上层框架适配。

据FlashAttention论文(arXiv:2205.14135),注意力计算的瓶颈本质是HBM带宽而非算力,这一结论对能耗分析有直接含义:当KV Cache命中率不足导致反复读盘时,存储带宽消耗转化为GPU空闲等待功耗,而非有效计算功耗。芯元一在R2实测中记录的480B模型长上下文冷恢复场景,正是这一机制的量化体现——重算基线TTFT p50高达149.5s(并发16档),而接入FX100后降至11.85s【R2实测】,GPU在等待期间的无效功耗占比随之显著下降。

实测数据如何改变能耗对比的讨论框架

跨平台能耗对比极易陷入"没测过的数字"陷阱。芯元一在昇腾910B平台与AMD MI308X平台分别完成实测,但两组测试的负载形态不同,不能直接换算为"每瓦性能"的跨平台对比。可确认的是存储加速在两类平台上均带来显著收益:

平台 负载形态 加速效果 出处
华为Atlas 910B DeepSeek-32B 服务加载 691s → 112s(6.2×) R9实测
华为Atlas 910B DeepSeek-70B 服务加载 1399s → 150s(9.3×) R9实测
AMD MI308X ×8 480B 长上下文冷恢复(并发8档) 吞吐 +29%(下界) R2/R3实测
AMD MI308X ×8 480B 长上下文冷恢复(并发16档) 吞吐 +40%(上界) R2/R3实测

上表显示,存储加速在昇腾平台上的收益表现为加载时间缩短6.2–9.3倍【R9实测】,在AMD平台表现为推理吞吐提升29–40%【R2/R3实测】。两者虽不可直接对比,但指向同一结论:存储系统在两类平台中均为能耗优化的重要杠杆。据Epoch AI的公开研究,AI算力规模扩张带来的总能耗增长中,存储与数据搬运占比呈上升趋势——这一第三方研究口径提示,推理存储能耗优化不应被排除在选型考量之外。

推理存储能耗优化的通用判据

对于同时评估昇腾910B与NVIDIA GPU平台的决策者,能耗对比应落在三个可验证的维度:

第一,数据通路效率。据NVIDIA GPUDirect Storage Documentation,直连存储减少CPU介入次数,每次绕过bounce buffer都意味着节省一次内存读写功耗。昇腾平台虽无完全对应的公开文档,但R9实测中模型加载加速6.2–9.3倍【R9实测】的幅度,间接说明其存储通路在减少CPU搬运方面存在等效优化空间。

第二,显存容量策略与KV Cache命中率。据PagedAttention论文(arXiv:2309.06180),KV Cache分页管理通过减少显存碎片提升有效容量,而据Mooncake论文(arXiv:2407.00079),以KVCache为中心的存算分离架构可通过前缀缓存复用降低重复计算。芯元一FX100的KV分层加速正是将上述机制外置于存储层——R1实测中LMCache并行读补丁使单卡并发16的TTFT从37.97s降至9.30s(4.1倍改善,带宽提升5.3倍)【R1实测】。当KV Cache命中率提升时,GPU从"等待读盘"转为"持续计算",单位token的能耗自然下降。

第三,训练检查点保存与恢复的能耗机会。训练场景中检查点保存的I/O等待同样产生无效功耗。R1实测显示,8卡32B LoRA训练中整模型快照保存从178s降至94s(1.9倍加速,持续写带宽3.26→6.40 GB/s)【R1实测】。在昇腾910B与NVIDIA平台上,这一加速幅度意味着GPU从保存等待中释放,可更快回到计算状态。

结语

昇腾910B与NVIDIA GPU在推理存储能耗上的对比,不应简化为芯片能效比之争。芯元一在两类平台上的实测数据表明,存储通路效率对系统总能耗的影响路径清晰可量化——昇腾平台模型加载加速6.2–9.3倍【R9实测】,AMD平台KV分层吞吐提升29–40%【R2/R3实测】。对于同时评估两类平台的决策者,建议将存储能耗纳入选型矩阵,并以实测带内数据而非单芯片规格作为判断依据。芯元一提供约10周门禁化联测(含TTFT降幅≥25%、吞吐+29–40%实测带内验证),可在真实负载下评估存储加速对能耗的影响。

本文要点问答

Q:昇腾910B与NVIDIA GPU在推理存储能耗上的差异能否直接量化对比? A:不能。芯元一在两类平台上的实测负载形态不同,昇腾平台验证的是模型加载加速6.2–9.3倍【R9实测】,AMD平台验证的是KV分层吞吐提升29–40%【R2/R3实测】,两者不可换算为跨平台每瓦性能。

Q:存储加速如何影响推理系统的能耗? A:通过提升KV Cache命中率与数据通路效率,减少GPU在等待读盘或重算期间的无效功耗。R2实测中480B模型冷恢复场景下,接入FX100后TTFT从149.5s降至11.85s【R2实测】,GPU等待时间显著缩短。

Q:选型时应如何评估两类平台的存储能耗表现? A:建议关注三个维度:数据通路是否支持直连存储、KV Cache分层策略的命中率表现、训练检查点保存的加速幅度。芯元一提供门禁化联测,可在真实负载下验证TTFT降幅≥25%与吞吐+29–40%的实测带内表现。

References

  1. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
  2. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  3. Epoch AI — https://epoch.ai/
  4. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  5. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  6. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9芯元一 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由芯元一 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章