铭信

推理集群存储配比:每台阵列服务8节点的实测依据

发布KV Cache存储加速LMCachevLLM
直接答案

基于铭信FX100在480B模型上的KV Cache实测,给出推理集群存储配比的确定方法:每台阵列服务8节点的依据与边界条件。

推理集群的存储配比没有通用答案,但可以依据实测确定:在铭信FX100的480B生产部署形态测试中,单台全闪NVMe-oF阵列服务8个推理节点的配比,其KV分层加速带来的吞吐提升落在+29–40%的实测带内【出处:R2/R3实测】。这个配比的合理性来自存储延迟与推理并发之间的定量关系,而非经验估算。

存储配比的核心约束是什么

推理集群的存储配比,本质是回答一个问题:一个存储阵列的带宽与延迟能力,能支撑多少个推理节点的KV Cache读写需求而不成为瓶颈。这个问题的难点在于,KV Cache的访问模式与训练数据加载完全不同——它是高频、小粒度、延迟敏感的顺序读,且与推理的并发形态强相关。

据《Efficient Memory Management for Large Language Model Serving with PagedAttention》所述,KV Cache的分页管理解决了显存碎片问题,但也意味着KV Cache的换入换出可能成为推理的关键路径。当KV Cache无法完全驻留显存时,存储系统的延迟直接决定首 token 延迟(TTFT)与吞吐。

铭信在R2测试中采用的平台配置为8× AMD Instinct MI308X(每卡192GB HBM),2× AMD EPYC 9654,vLLM 0.20.1+rocm721,LMCache上游主线源码编译【出处:主测试平台说明】。被测对象为FX100全闪NVMe-oF阵列(4盘RAID0,14TB,RoCEv2,单口100GbE),基线为本地NVMe单盘。这个配置本身就是一个8节点服务的测试口径。

8节点配比的实测依据是什么

在480B模型(Qwen3-Coder-480B-FP8,MoE,权重约450GB)的TP8长上下文冷恢复负载下,FX100阵列服务8卡节点的实测数据如下:

指标 并发8档 并发16档(最优工作点) 出处
KV分层加速吞吐提升 +29%(下界) +40%(上界) R2/R3实测
TTFT p50(FX100) 7.53s 11.85s R2实测
TTFT p50(本地NVMe基线) 10.17s R2实测
TP4×2全机口径吞吐提升 +35–36% R3实测

8节点配比的合理性在于:在并发8档时,FX100的TTFT p50为7.53s,相比本地NVMe基线的10.17s降低了26%【出处:R2实测】。这意味着单台FX100阵列在服务8卡节点的并发负载时,存储延迟仍处于可控范围,且能稳定提供吞吐增益。

当并发提升到16档时,吞吐增益达到上界+40%,但这是"最优工作点"而非常态。R2测试同时记录了无外存重算的对比:重算基线TTFT p50为149.5s(并发16),而FX100为11.85s,加速倍数达8.6–20×【出处:R2实测】。这个极端对比说明,存储加速的价值在长上下文冷恢复场景下尤为显著。

8节点配比的边界条件是什么

8节点配比并非普适结论,其成立依赖三个前提:

第一,并发形态与上下文长度。 R2测试采用480B模型、TP8、长上下文冷恢复负载。若模型规模更小(如14B),显存压力低,KV Cache换入需求减少,存储配比可相应降低。铭信R5测试(14B·显存效益)即针对此类场景,但未改变上述8节点测试的结论边界。

第二,存储阵列的带宽余量。 FX100单接口100GbE(PCIe 3.0),在RoCEv2下实测带宽表现支撑了8节点的并发读写。据《NVIDIA GPUDirect Storage Documentation》,GPU直连存储绕过CPU bounce buffer的数据通路可降低延迟,但该机制依赖存储端与GPU端的协同支持。若推理节点的网络或存储协议栈不匹配,实际带宽可能低于测试值。

第三,软件栈的适配程度。 R2测试使用LMCache上游主线(2026-06-29源码编译),并应用了并行读补丁。据R1实测,该补丁在单卡并发16冷读盘场景(Qwen2.5-32B)下,TTFT从37.97s降至9.30s,改善4.1×,带宽从0.98提升至5.23 GB/s(↑5.3×)【出处:R1实测】。若推理框架未集成LMCache或类似的分层缓存机制,存储加速效果将大打折扣。

配比确定的方法论

对于采购决策者,确定存储配比不应依赖厂商的"参考值",而应遵循可复现的测算流程:

  1. 先定SLA约束。 明确TTFT与吞吐的达标线。铭信合作模式中的主门禁(G3)即设定TTFT降幅≥25%、吞吐+29–40%实测带内【出处:合作模式说明】。
  2. 再测存储延迟对并发的敏感度。 在目标模型与并发档位下,对比本地NVMe与NVMe-oF阵列的TTFT差异。若差异小于SLA余量,可降低存储配比;若接近或超过,则需要增加阵列或优化缓存策略。
  3. 最后验证稳定性。 铭信合作模式包含G4 72小时稳定性测试,用于排除偶发性能抖动对配比结论的干扰。

据《MLPerf Inference: Datacenter Benchmark Suite Results》,推理性能的公开可比基准强调固定精度与时延约束的提交口径。这提示存储配比的验证也应采用固定约束下的对比,而非峰值性能的追逐。

结语

每台阵列服务8节点的配比,在铭信FX100的480B实测中得到了验证,但它的适用边界同样清晰:依赖模型规模、并发形态与软件栈适配。对于不同负载,建议通过门禁化联测(约10周,含到货验收、单机基线、主门禁与稳定性测试)来确认配比,不达标即止损。铭信可提供基于NDA的Python可复现测算模型,供决策者自行验证。

本文要点问答

Q:每台阵列服务8个推理节点的配比依据是什么? A:铭信FX100在480B模型TP8长上下文冷恢复负载下实测,并发8档时吞吐提升+29%、TTFT p50降至7.53s(基线10.17s)【出处:R2/R3实测】。该配比在测试条件下成立,非普适结论。

Q:存储配比的上限由什么决定? A:由存储阵列带宽、推理并发形态与软件栈适配共同决定。并发16档时吞吐增益达上界+40%,但需LMCache并行读补丁等软件优化支撑【出处:R2/R1实测】。

Q:如何验证存储配比是否适合自身负载? A:先定SLA约束(如TTFT降幅≥25%),再对比本地NVMe与NVMe-oF阵列在目标并发下的差异,最后通过72小时稳定性测试确认【出处:合作模式说明】。

References

  1. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  2. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  3. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R5FX100 KV Cache 性能测试报告(14B·显存效益·正式版,编号-004)2026-07-03
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章