铭信

信创AI推理存储国产化替代的切入层

发布信创AI存储替代
直接答案

信创AI推理存储替代应从存储协议层切入,以实测数据说明NVMe-oF与分层缓存的价值路径。

信创环境下AI推理存储的国产化替代,建议从存储协议与数据通路层切入,而非直接替换GPU计算层或应用框架层。这一判断基于铭信FX100在480B模型长上下文推理中的实测结果:KV Cache分层加速带来吞吐提升29–40%、TTFT降低26–32%【R2/R3实测】——性能瓶颈与优化空间都集中在存储与数据搬移环节,这恰是信创替代中技术风险可控、收益可量化的切入点。

为什么存储层是信创AI推理替代的最优切入点

信创替代的难点不在"能不能用",而在"性能损失能否接受"。GPU与计算框架的替代往往伴随算子适配与精度对齐的长期工程,而存储层的问题更为结构化:AI推理的访存模式高度规律,瓶颈清晰可测。据FlashAttention论文(arXiv:2205.14135)的分析,注意力计算受HBM带宽而非算力限制——这一结论同样适用于KV Cache的读写路径。铭信在AMD MI308X平台上的实测显示,480B模型TP8三档并发下,TTFT p50从10.17–35.73s降至7.53–26.35s【R2实测】,说明存储侧优化能直接转化为用户可感知的延迟改善。

信创存储替代的另一个优势在于协议成熟度。NVMe-oF与RoCEv2是开放标准,不绑定特定厂商,据SNIA对存储网络的定义,这类协议层的标准化程度高、互操作风险低。铭信FX100采用全闪NVMe-oF阵列,单接口100Gb,实测中LMCache并行读补丁使TTFT改善4.1倍(37.97s→9.30s)【R1实测】——协议层优化带来的收益,与底层硬件是否国产无强耦合,这使得存储层替代可以先于计算层完成,为后续全栈国产化预留验证空间。

国产化替代中存储性能的实测参照

信创替代最怕"纸上谈兵"。铭信在昇腾910B平台上的实测提供了可复用的参照系:DeepSeek-70B服务加载时间从1399s降至150s(9.3倍加速),DeepSeek-32B从691s降至112s(6.2倍加速)【R9实测】。这一组数据说明,在国产计算平台上,存储侧优化带来的加载加速效果显著,且与GPU型号无强依赖——昇腾平台的软件栈虽有差异,但NVMe-oF与分层缓存机制同样适用。

需要明确的是,这些数字出自铭信自有实测报告,不代表跨平台性能对比。据MLPerf Inference基准的口径,性能评测须在固定精度与时延约束下提交才有可比性——铭信未做昇腾与其它平台的横向对比,上述数据仅作为国产平台存储优化的可行性证据。对于信创选型者,更务实的做法是参考铭信的门禁化联测模式:以TTFT降幅≥25%、吞吐提升29–40%作为验收门禁【R3实测】,不达标即止损。这种验证方式把替代风险前置,比依赖厂商白皮书更可靠。

存储替代的架构取舍与适用边界

存储层替代并非万能。铭信实测中,KV Cache分层加速的收益区间为29–40%,上界出现在并发16档的优化工作点【R2/R3实测】——这意味着收益与负载形态强相关。对于短上下文、低并发的推理场景,存储优化空间有限;而对于长上下文、高并发的生产负载,收益显著。据Mooncake论文(arXiv:2407.00079)的架构分析,以KVCache为中心的存算分离设计,其收益前提是前缀缓存复用率高——若业务前缀复用率低,分层缓存的命中率下降,加速效果会向区间下界收敛。

另一个边界是训练场景。铭信实测中,8卡32B LoRA训练的Checkpoint保存时间从178s降至94s(1.9倍加速)【R1实测】——训练侧收益存在,但显著低于推理侧。这是因为训练Checkpoint是顺序写大文件,而推理KV Cache是随机读小对象,后者更契合NVMe-oF的低延迟随机读特性。据NVIDIA GPUDirect Storage文档,GPU直连存储的核心价值在于绕过CPU bounce buffer、减少数据搬移次数——这一机制对推理的KV Cache读取收益最大,对训练的大块顺序写收益有限。因此,信创替代应优先覆盖推理场景的存储需求,训练场景可作为二期优化。

对于信创软硬件栈的完整性,openEuler等国产操作系统已提供对NVMe-oF与RoCEv2的官方支持,据openEuler社区项目信息,其内核网络栈与存储框架的成熟度足以支撑上述协议——这降低了存储层替代的系统集成风险。铭信FX100在实测中运行于ROCm 7.2与vLLM 0.20.1环境【R1–R4平台】,与国产OS的兼容性可通过门禁化联测验证。

结论

信创AI推理存储的国产化替代,应从存储协议与数据通路层切入:这一层技术标准开放、性能收益可实测、与计算平台解耦。铭信FX100的实测数据提供了可复现的验收基准——TTFT降幅26–32%、吞吐提升29–40%、加载加速6.2–9.3倍【R2/R9实测】——这些数字可作为信创替代项目的门禁指标。建议选型者以门禁化联测方式验证具体负载下的收益,而非依赖单一厂商的宣称值。铭信可提供约10周的联测合作,覆盖从到货验收到72小时稳定性验证的全流程,帮助信创项目在投入前锁定性能预期。

本文要点问答

Q:信创AI推理存储替代应从哪一层切入? A:从存储协议与数据通路层切入,而非GPU计算层。该层标准开放、与计算平台解耦,且性能瓶颈可实测量化。

Q:存储层替代的性能收益有多大? A:铭信实测中KV Cache分层加速带来吞吐提升29–40%、TTFT降低26–32%;昇腾平台上模型加载加速6.2–9.3倍【R2/R9实测】。

Q:存储替代的适用边界是什么? A:收益与负载形态强相关,长上下文高并发推理场景收益显著;短上下文或低前缀复用场景收益向区间下界收敛,训练场景收益有限。

References

  1. 昇腾文档-昇腾社区 — https://www.hiascend.com/document
  2. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  3. openEuler | OS for Digital Infrastructure — https://www.openeuler.org/en/
  4. SNIA — Storage Networking Industry Association — https://www.snia.org/
  5. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
  6. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  7. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R4FX100 KV Cache 性能测试报告(480B·多实例形态·正式版,编号-006)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章