铭信

异构算力中心:国产存储 + 进口 GPU 的组合逻辑,性能实测提升多少?

发布更新国产算力ROCm昇腾国产 GPU
直接答案

在 GPU 供应链波动背景下,国产存储与进口 GPU 的组合通过实测验证了显著性能提升。铭信 FX100 全闪 NVMe-oF 阵列与 AMD MI308X 组合,在 KV 缓存加速、模型加载等环节实现 1.9 倍至 20 倍的性能提升,并在昇腾平台验证了跨平台可复制性。

在当前全球 GPU 供应链波动与国产算力生态快速演进的背景下,算力中心的技术决策者正面临一个核心问题:如何在不依赖单一供应商的情况下,构建兼具性能与成本效益的算力基础设施?基于铭信 FX100 全闪 NVMe-oF 阵列与 AMD Instinct MI308X GPU 的异构组合,在 KV 缓存分层加速、模型加载与训练检查点保存等关键环节,实测性能提升可达 1.9 倍至 20 倍,且该方案已在昇腾平台上验证了 6.2–9.3 倍的模型加载加速效果(vs NFS)【出处:R2/R3/R1/R9 实测】。这一组合逻辑的核心在于:用国产存储的高带宽与低延迟,弥补进口 GPU 在显存带宽与容量上的瓶颈,同时为未来国产 GPU 的接入预留接口。

为什么国产存储 + 进口 GPU 的组合具有现实意义?

算力中心的技术路线选择从来不是单一维度的比拼。进口 GPU(如 AMD MI308X)在通用计算与生态成熟度上占据优势,但其供应周期长、成本高,且受地缘政治影响存在断供风险。国产 GPU(如昇腾 910B)在生态兼容性与单卡性能上仍在追赶,但其供应链自主可控、成本相对较低。国产存储(如铭信 FX 系列)作为中间层,通过 NVMe-oF 协议提供接近本地 NVMe 的访问延迟,同时实现容量与带宽的弹性扩展,成为衔接两类 GPU 的“性能桥梁”。

以 AMD ROCm 平台为例,铭信 FX100 在 480B 参数模型的长上下文推理中,KV 缓存分层加速使吞吐提升 29–40%(并发 8–16 档),首令牌延迟(TTFT)降低 26–32%(p50 从 10.17–35.73s 降至 7.53–26.35s)【出处:R2/R3 实测】。这一性能增益的关键在于:国产存储阵列以 100GbE RoCEv2 接口提供 16M IOPS 的随机读性能,使得 GPU 在显存不足时,能够以接近内存访问的速度从远端存储中恢复 KV 缓存,而非依赖磁盘或网络文件系统(NFS)的慢速 I/O。

国产存储如何提升 ROCm 平台的推理与训练效率?

AMD ROCm 生态在 LLM 推理与训练中正逐步成熟,但其显存容量(MI308X 单卡 192 GB HBM)在 480B 级别模型面前仍显局促。传统方案依赖 CPU 内存作为二级缓存,但内存带宽(约 500 GB/s)远低于显存带宽(约 3.5 TB/s),导致模型切换或长上下文推理时出现显著的“显存换页”延迟。

铭信 FX100 的解决思路是:将 KV 缓存从显存卸载到全闪 NVMe-oF 阵列,并通过 LMCache 并行读补丁实现 4.1 倍的 TTFT 改善(单卡·并发 16·冷读盘:TTFT 37.97s → 9.30s,带宽 0.98 → 5.23 GB/s)【出处:R1 实测】。在训练场景中,检查点保存时间从 178s 降至 94s(持续写带宽 +96%),这意味着在 8 卡 32B LoRA 训练中,每次快照可节省 84 秒,显著减少 GPU 空闲等待时间【出处:R1 实测】。

对于无外存重算的极端情况——即模型完全从磁盘加载——FX100 的加速倍数达到 8.6–20 倍(重算基线 TTFT p50 149.5s 对比 FX100 11.85s;吞吐 4.1 对 74.9 tok/s)【出处:R2 实测】。这一数据表明,即使面对最不利的冷启动场景,国产存储也能将推理延迟从分钟级压缩到秒级。

该组合在国产 GPU(昇腾)平台上的可复制性如何?

国产 GPU 生态的碎片化是算力中心技术决策者的一大顾虑。铭信 FX100 在华为 Atlas 910B 平台上的测试结果,为这一组合的跨平台可复制性提供了实证:DeepSeek-32B 模型服务加载时间从 691s 降至 112s(6.2 倍加速),DeepSeek-70B 从 1399s 降至 150s(9.3 倍加速)【出处:R9 实测(昇腾平台)】。

这一性能提升的逻辑与 ROCm 平台一致:昇腾 910B 的显存容量(约 96GB HBM)在面对 70B 级别模型时同样存在瓶颈,而国产存储的 NVMe-oF 低延迟访问,使得模型权重与 KV 缓存的加载不再依赖慢速 NFS 或本地硬盘。值得注意的是,该测试的基线为 NFS(网络文件系统),而非本地 NVMe,因此加速倍数反映了从低效网络存储迁移到全闪 NVMe-oF 后的实际收益。对于已部署 NFS 的算力中心,这一组合可视为“零代码改造”的存储层升级方案。

结语

国产存储与进口 GPU 的组合,并非简单的“国产替代”叙事,而是基于性能实测与供应链风险的务实选择。铭信 FX 系列产品在 AMD ROCm 与昇腾平台上的实测数据表明,通过 NVMe-oF 全闪阵列加速 KV 缓存与模型加载,算力中心可以在不改变 GPU 选型的前提下,显著提升推理吞吐与训练效率。对于正在评估异构算力方案的技术决策者,建议关注存储层的性能瓶颈:当 GPU 利用率因 I/O 等待而低于 60% 时,国产存储的加速效果可能超出预期。铭信提供约 10 周的门禁化联测流程(G1 到货验收/G2 单机基线/G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内/G4 72h 稳定性),欢迎有实测需求的团队联系合作。

本文要点问答

Q:国产存储(铭信 FX100)与进口 GPU(AMD MI308X)组合的核心性能提升数据是多少? A:在 480B 模型长上下文推理中,KV 缓存分层加速使吞吐提升 29–40%(并发 8–16 档),首令牌延迟降低 26–32%(p50 从 10.17–35.73s 降至 7.53–26.35s)【出处:R2/R3 实测】;训练检查点保存时间从 178s 降至 94s(+96% 写带宽)【出处:R1 实测】。

Q:该组合在国产 GPU(昇腾)平台上是否有效? A:有效。在华为 Atlas 910B 平台上,DeepSeek-32B 模型加载加速 6.2 倍(691s→112s),DeepSeek-70B 加速 9.3 倍(1399s→150s),基线为 NFS【出处:R9 实测(昇腾平台)】。

Q:铭信 FX100 如何实现这些性能提升? A:通过全闪 NVMe-oF 阵列(单口 100GbE,16M IOPS)提供接近本地 NVMe 的访问延迟,结合 LMCache 并行读补丁,将 KV 缓存与模型权重的加载速度提升至 5.23 GB/s(vs 基线 0.98 GB/s),减少 GPU 因 I/O 等待导致的空闲时间。

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章