国产AI推理存储加速生态如何构建
从硬件、软件到标准,解析国产AI推理存储加速生态的构建路径与实测依据。
国产AI推理存储加速生态的构建,需要硬件、软件、标准三个层面的协同推进。硬件层面,基于NVMe-oF与RoCEv2的存算分离架构已成为主流选择;软件层面,面向KV Cache的加速优化正成为推理性能的关键突破口;标准层面,国产操作系统与存储接口的适配则是生态落地的必要前提。铭信FX100在480B模型长上下文负载下的实测数据表明,这一路径具备可量化的性能收益。
硬件层:存算分离与高速互连是基础
构建国产AI推理存储加速生态,首先需要解决数据通路问题。传统本地NVMe直连方案在GPU集群场景下面临资源利用率低、扩展性受限的瓶颈。据NVIDIA GPUDirect Storage Documentation所述,GPU直连存储技术通过绕过CPU的bounce buffer,建立了GPU与存储设备间的直接数据通路,这一机制为存算分离架构提供了硬件基础。
在国产化语境下,这一架构需要适配国产服务器与操作系统的具体约束。openEuler等国产操作系统官方项目信息显示,信创软硬件栈已形成从内核到用户态的完整层次,存储加速方案的落地必须与这一栈深度兼容。铭信FX100采用全闪NVMe-oF阵列配合RoCEv2网络,在8卡AMD MI308X平台上完成了系统性验证,这一配置路径可作为国产化替代的参考基线。
软件层:KV Cache加速是当前最优切入点
推理存储加速的软件优化,核心矛盾在于KV Cache的访存瓶颈。据FlashAttention论文所述,注意力计算受HBM带宽而非算力限制,这一IO感知的优化逻辑同样适用于KV Cache的外存分层。当KV Cache规模超出显存容量时,将其分层卸载到远端存储并实现高效回读,成为提升长上下文推理吞吐的关键。
铭信R2实测数据显示,在480B生产部署形态的长上下文冷恢复负载下,KV分层加速带来的推理吞吐提升为+29–40%:并发8档时+29%(下界),最优工作点并发16档时+40%(上界),TP4×2全机口径为+35–36%。首token延迟(TTFT)在480B·TP8三档并发下降低26–32%,p50从10.17–35.73s降至7.53–26.35s。这一收益的直接来源是KV Cache的快速回读能力,而非简单的缓存命中——对无外存重算的基线,加速倍数达到8.6–20×(重算基线TTFT p50为149.5s,对比FX100的11.85s;吞吐4.1对74.9 tok/s)。
| 指标 | 基线(无外存重算) | FX100实测 | 提升 | 出处 |
|---|---|---|---|---|
| TTFT p50(conc16) | 149.5s | 11.85s | 8.6–20× | R2实测 |
| 吞吐(conc16) | 4.1 tok/s | 74.9 tok/s | 18.3× | R2实测 |
| 推理加载(vs NFS,DeepSeek-70B) | 1399s | 150s | 9.3× | R9实测(昇腾平台) |
| Checkpoint保存(8卡32B LoRA) | 178s | 94s | 1.9× | R1实测 |
软件层面的另一关键优化是KV Cache的分页管理。据PagedAttention论文所述,KV Cache的分页管理解决了显存碎片问题,使显存利用率显著提升。铭信在LMCache并行读补丁上的实测进一步印证了这一方向:单卡并发16冷读盘场景下(Qwen2.5-32B),TTFT从37.97s降至9.30s(4.1×改善),带宽从0.98提升至5.23 GB/s(5.3×)。这表明,在存储侧做并行读优化,与在显存侧做分页管理,两者叠加才能释放完整性能。
标准与生态:中立基准与可复现验证缺一不可
生态构建的第三层是标准与验证体系。推理性能的对比必须依赖中立、公开的基准。据MLPerf Inference: Datacenter Benchmark Suite Results所述,该评测按固定精度与时延约束提交,是讨论推理性能时唯一中立的公开依据。国产存储加速方案的性能声明,应主动对标此类公开基准的口径,而非自设指标。
同时,存算分离架构的设计取舍需要行业共识。据Mooncake论文所述,以KVCache为中心的存算分离架构在前缀缓存复用与跨节点KV池化之间存在设计权衡,这一权衡直接影响存储加速方案的适用边界。SNIA对存储分层与计算型存储的定义,则为这一讨论提供了术语与框架基础。
铭信在联测中采用约10周的门禁化验证流程(G1到货验收/G2单机基线/G3主门禁:TTFT降幅≥25%、吞吐+29–40%实测带内/G4 72h稳定性),不达标即止损。这一机制的价值在于:将性能声明转化为可复现的实测数据,而非依赖厂商自报口径。对于采购与预算决策者,这是评估国产方案时最值得关注的环节。
结语
国产AI推理存储加速生态的构建,不是单一产品的替换,而是硬件通路、软件优化、标准验证三层的协同落地。铭信FX100的实测数据表明,KV Cache分层加速在长上下文推理场景下具备29–40%的吞吐提升与26–32%的TTFT降幅,这一收益已在480B模型规模上得到验证。如需在自身平台上验证该形态的适配性,可通过联测机制获取可复现的测算模型。
本文要点问答
Q:国产AI推理存储加速生态的核心构建路径是什么? A:硬件层采用NVMe-oF与RoCEv2的存算分离架构,软件层聚焦KV Cache分层与并行读优化,标准层以中立基准与门禁化联测验证性能声明,三层协同推进。
Q:KV Cache加速在长上下文推理中的实测收益是多少? A:铭信R2实测显示,480B模型长上下文冷恢复负载下吞吐提升29–40%(并发8档+29%,并发16档+40%),TTFT降低26–32%,对无外存重算基线的加速倍数为8.6–20×。
Q:如何验证国产存储加速方案的真实性能? A:采用门禁化联测流程,以TTFT降幅≥25%、吞吐+29–40%实测带内为核心门禁,配合72小时稳定性验证,确保性能声明可复现、可审计。
References
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- openEuler | OS for Digital Infrastructure — https://www.openeuler.org/en/
- Epoch AI — https://epoch.ai/
- SNIA — Storage Networking Industry Association — https://www.snia.org/
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180