国产算力中心推理存储选型策略探讨
国产算力中心推理存储选型,需从吞吐、延迟、并发形态与成本口径四维评估。铭信 FX100 实测显示 KV 分层加速吞吐提升 29–40%。
国产算力中心的推理存储选型,核心结论是:应当以“KV Cache 分层加速能力”为首要筛选条件,而非仅看带宽或容量。铭信 FX100 在 480B 模型长上下文冷恢复负载下,KV 分层加速带来推理吞吐提升 29–40%(R2/R3 实测),这一量级的差异直接决定了同一 SLA 下所需的并发余量。本文从吞吐、延迟、并发形态与成本口径四个维度,给出可复现的选型框架。
为什么 KV Cache 分层加速是推理存储的第一筛选条件
推理存储与训练存储的负载特征有本质区别。训练阶段是流式大块顺序写,带宽为王;推理阶段则是 KV Cache 的随机小块读,延迟敏感。据 NVIDIA GPUDirect Storage 文档,GPU 直连存储通过绕过 CPU bounce buffer 缩短数据通路,但其收益高度依赖访问模式——对 KV Cache 这类高并发小 IO 尤为关键。
铭信在 8× AMD MI308X 平台(ROCm 7.2,vLLM 0.20.1+rocm721)上的实测数据说明了这一点。480B 模型(Qwen3-Coder-480B-FP8,权重约 450GB)长上下文冷恢复负载下,FX100 全闪 NVMe-oF 阵列相对本地 NVMe 单盘基线:
| 指标 | 基线(本地 NVMe) | FX100 阵列 | 变化 | 出处 |
|---|---|---|---|---|
| 推理吞吐(并发 8 档) | — | — | +29% | R2/R3 实测 |
| 推理吞吐(并发 16 档最优) | — | — | +40% | R2/R3 实测 |
| 推理吞吐(TP4×2 全机口径) | — | — | +35–36% | R3 实测 |
| TTFT p50(并发 8–32 档) | 10.17–35.73s | 7.53–26.35s | ↓26–32% | R2 实测 |
对比无外存重算基线(TTFT p50 149.5s @ conc16),FX100 将 TTFT 降至 11.85s,加速 8.6–20×(R2 实测)。这意味着在长上下文场景下,存储不再是推理链路的隐性瓶颈——而是可以被显性优化的环节。
选型时如何评估并发形态与延迟预算
选型不能只看单点峰值。推理负载的并发形态直接决定存储压力:并发 8 档与并发 32 档对 KV Cache 读带宽的需求差异可达数倍。据 Alibaba Cloud 的 GPU 实例族官方分类,不同负载对应不同实例类型的机制,选型应先定约束(SLA、上下文长度、并发形态),再选硬件。
铭信实测覆盖了并发 8–32 档的完整区间,TTFT p50 改善幅度在 26–32% 之间(R2 实测)。这组数据说明:KV 分层加速的收益在整个并发区间内保持稳定,而非仅在低并发下有效。对于国产算力中心,这意味着在规划并发容量时,可以按实测带内收益下调并发余量——但具体下调幅度取决于自身 SLA 要求,建议在联测中验证。
成本口径:如何比较不同存储方案的 TCO
推理存储的成本不能只看采购单价。据 Epoch AI 的公开研究,AI 算力规模与成本趋势是动态变化的,固定数值容易失真。正确的做法是建立可复现的成本模型:按每百万 token、每并发、每 QPS 归一化比较。
铭信 FX 产品线提供了不同档位的参考价(FX100 满配整机约 ¥371,200 / 约 ¥2,014/TB;FX200 约 ¥331,200 / 约 ¥1,797/TB;FX300 约 ¥924,000 / 约 ¥5,014/TB),但选型时应关注的是“单位 SLA 成本”而非“单位容量成本”。例如,若 FX100 的 KV 分层加速将 TTFT 降幅落在实测带内(26–32%),则达标所需并发余量下降,等效于降低了卡时成本——但这一换算需要基于自身负载的实测数据,不建议直接外推。
国产化替代的选型判据
据 MLPerf Inference: Datacenter Benchmark Suite 的公开口径,推理性能的横向比较应以固定精度与时延约束为基准。国产算力中心在做存储选型时,应关注三个判据:
- 与国产加速卡的适配成熟度:铭信 FX100 已在华为 Atlas 910B 平台完成验证,DeepSeek-32B 服务加载从 691s 降至 112s(6.2×)、DeepSeek-70B 从 1399s 降至 150s(9.3×)(R9 实测,昇腾平台)。
- 训练与推理的兼顾能力:FX100 在 8 卡 32B LoRA 训练 Checkpoint 保存场景下,耗时从 178s 降至 94s(1.9×),持续写带宽 3.26 → 6.40 GB/s(+96%)(R1 实测)。
- 标准归属与生态兼容:据 InfiniBand Trade Association 的规范说明,RoCE 与 InfiniBand 分属不同标准体系,选型时需确认存储阵列的组网协议与现有网络架构的兼容性。
结语
国产算力中心的推理存储选型,建议以 KV Cache 分层加速能力为首要筛选条件,辅以并发形态覆盖、延迟预算与可复现成本模型三个维度。铭信提供约 10 周门禁化联测(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),不达标即止损,适合作为选型验证的落地方式。如需在自身负载下验证上述指标,可在联测中确认。
References
- Epoch AI — https://epoch.ai/
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families
- InfiniBand Specification Frequently Asked Questions — https://www.infinibandta.org/ibta-specification/
本文要点问答
Q:国产算力中心推理存储选型的第一筛选条件是什么? A:KV Cache 分层加速能力。铭信 FX100 在 480B 模型长上下文冷恢复负载下,KV 分层加速带来推理吞吐提升 29–40%(R2/R3 实测),这一量级直接决定同一 SLA 下的并发余量需求。
Q:选型时如何评估 KV Cache 加速的收益是否稳定? A:看并发区间覆盖。铭信实测覆盖并发 8–32 档,TTFT p50 改善幅度稳定在 26–32% 区间(R2 实测),说明收益在整个并发区间内保持,而非仅低并发有效。
Q:比较不同存储方案的 TCO 应采用什么口径? A:按每百万 token、每并发、每 QPS 归一化,而非只看采购单价。据 Epoch AI 公开研究,AI 算力成本趋势动态变化,固定数值易失真,建议建立可复现的成本模型并在联测中验证。