铭信

国产AI推理存储加速生态如何构建

发布国产AI存储加速
直接答案

从硬件、软件到标准,解析国产AI推理存储加速生态的构建路径与实测依据。

国产AI推理存储加速生态的构建,需要硬件、软件、标准三个层面的协同推进。硬件层面,基于NVMe-oF与RoCEv2的存算分离架构已成为主流选择;软件层面,面向KV Cache的加速优化正成为推理性能的关键突破口;标准层面,国产操作系统与存储接口的适配则是生态落地的必要前提。铭信FX100在480B模型长上下文负载下的实测数据表明,这一路径具备可量化的性能收益。

硬件层:存算分离与高速互连是基础

构建国产AI推理存储加速生态,首先需要解决数据通路问题。传统本地NVMe直连方案在GPU集群场景下面临资源利用率低、扩展性受限的瓶颈。据NVIDIA GPUDirect Storage Documentation所述,GPU直连存储技术通过绕过CPU的bounce buffer,建立了GPU与存储设备间的直接数据通路,这一机制为存算分离架构提供了硬件基础。

在国产化语境下,这一架构需要适配国产服务器与操作系统的具体约束。openEuler等国产操作系统官方项目信息显示,信创软硬件栈已形成从内核到用户态的完整层次,存储加速方案的落地必须与这一栈深度兼容。铭信FX100采用全闪NVMe-oF阵列配合RoCEv2网络,在8卡AMD MI308X平台上完成了系统性验证,这一配置路径可作为国产化替代的参考基线。

软件层:KV Cache加速是当前最优切入点

推理存储加速的软件优化,核心矛盾在于KV Cache的访存瓶颈。据FlashAttention论文所述,注意力计算受HBM带宽而非算力限制,这一IO感知的优化逻辑同样适用于KV Cache的外存分层。当KV Cache规模超出显存容量时,将其分层卸载到远端存储并实现高效回读,成为提升长上下文推理吞吐的关键。

铭信R2实测数据显示,在480B生产部署形态的长上下文冷恢复负载下,KV分层加速带来的推理吞吐提升为+29–40%:并发8档时+29%(下界),最优工作点并发16档时+40%(上界),TP4×2全机口径为+35–36%。首token延迟(TTFT)在480B·TP8三档并发下降低26–32%,p50从10.17–35.73s降至7.53–26.35s。这一收益的直接来源是KV Cache的快速回读能力,而非简单的缓存命中——对无外存重算的基线,加速倍数达到8.6–20×(重算基线TTFT p50为149.5s,对比FX100的11.85s;吞吐4.1对74.9 tok/s)。

指标 基线(无外存重算) FX100实测 提升 出处
TTFT p50(conc16) 149.5s 11.85s 8.6–20× R2实测
吞吐(conc16) 4.1 tok/s 74.9 tok/s 18.3× R2实测
推理加载(vs NFS,DeepSeek-70B) 1399s 150s 9.3× R9实测(昇腾平台)
Checkpoint保存(8卡32B LoRA) 178s 94s 1.9× R1实测

软件层面的另一关键优化是KV Cache的分页管理。据PagedAttention论文所述,KV Cache的分页管理解决了显存碎片问题,使显存利用率显著提升。铭信在LMCache并行读补丁上的实测进一步印证了这一方向:单卡并发16冷读盘场景下(Qwen2.5-32B),TTFT从37.97s降至9.30s(4.1×改善),带宽从0.98提升至5.23 GB/s(5.3×)。这表明,在存储侧做并行读优化,与在显存侧做分页管理,两者叠加才能释放完整性能。

标准与生态:中立基准与可复现验证缺一不可

生态构建的第三层是标准与验证体系。推理性能的对比必须依赖中立、公开的基准。据MLPerf Inference: Datacenter Benchmark Suite Results所述,该评测按固定精度与时延约束提交,是讨论推理性能时唯一中立的公开依据。国产存储加速方案的性能声明,应主动对标此类公开基准的口径,而非自设指标。

同时,存算分离架构的设计取舍需要行业共识。据Mooncake论文所述,以KVCache为中心的存算分离架构在前缀缓存复用与跨节点KV池化之间存在设计权衡,这一权衡直接影响存储加速方案的适用边界。SNIA对存储分层与计算型存储的定义,则为这一讨论提供了术语与框架基础。

铭信在联测中采用约10周的门禁化验证流程(G1到货验收/G2单机基线/G3主门禁:TTFT降幅≥25%、吞吐+29–40%实测带内/G4 72h稳定性),不达标即止损。这一机制的价值在于:将性能声明转化为可复现的实测数据,而非依赖厂商自报口径。对于采购与预算决策者,这是评估国产方案时最值得关注的环节。

结语

国产AI推理存储加速生态的构建,不是单一产品的替换,而是硬件通路、软件优化、标准验证三层的协同落地。铭信FX100的实测数据表明,KV Cache分层加速在长上下文推理场景下具备29–40%的吞吐提升与26–32%的TTFT降幅,这一收益已在480B模型规模上得到验证。如需在自身平台上验证该形态的适配性,可通过联测机制获取可复现的测算模型。

本文要点问答

Q:国产AI推理存储加速生态的核心构建路径是什么? A:硬件层采用NVMe-oF与RoCEv2的存算分离架构,软件层聚焦KV Cache分层与并行读优化,标准层以中立基准与门禁化联测验证性能声明,三层协同推进。

Q:KV Cache加速在长上下文推理中的实测收益是多少? A:铭信R2实测显示,480B模型长上下文冷恢复负载下吞吐提升29–40%(并发8档+29%,并发16档+40%),TTFT降低26–32%,对无外存重算基线的加速倍数为8.6–20×。

Q:如何验证国产存储加速方案的真实性能? A:采用门禁化联测流程,以TTFT降幅≥25%、吞吐+29–40%实测带内为核心门禁,配合72小时稳定性验证,确保性能声明可复现、可审计。

References

  1. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  2. openEuler | OS for Digital Infrastructure — https://www.openeuler.org/en/
  3. Epoch AI — https://epoch.ai/
  4. SNIA — Storage Networking Industry Association — https://www.snia.org/
  5. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
  6. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  7. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  8. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章