推理集群存储配比:每台阵列服务8节点的实测依据
基于铭信FX100在480B模型上的KV Cache实测,给出推理集群存储配比的确定方法:每台阵列服务8节点的依据与边界条件。
推理集群的存储配比没有通用答案,但可以依据实测确定:在铭信FX100的480B生产部署形态测试中,单台全闪NVMe-oF阵列服务8个推理节点的配比,其KV分层加速带来的吞吐提升落在+29–40%的实测带内【出处:R2/R3实测】。这个配比的合理性来自存储延迟与推理并发之间的定量关系,而非经验估算。
存储配比的核心约束是什么
推理集群的存储配比,本质是回答一个问题:一个存储阵列的带宽与延迟能力,能支撑多少个推理节点的KV Cache读写需求而不成为瓶颈。这个问题的难点在于,KV Cache的访问模式与训练数据加载完全不同——它是高频、小粒度、延迟敏感的顺序读,且与推理的并发形态强相关。
据《Efficient Memory Management for Large Language Model Serving with PagedAttention》所述,KV Cache的分页管理解决了显存碎片问题,但也意味着KV Cache的换入换出可能成为推理的关键路径。当KV Cache无法完全驻留显存时,存储系统的延迟直接决定首 token 延迟(TTFT)与吞吐。
铭信在R2测试中采用的平台配置为8× AMD Instinct MI308X(每卡192GB HBM),2× AMD EPYC 9654,vLLM 0.20.1+rocm721,LMCache上游主线源码编译【出处:主测试平台说明】。被测对象为FX100全闪NVMe-oF阵列(4盘RAID0,14TB,RoCEv2,单口100GbE),基线为本地NVMe单盘。这个配置本身就是一个8节点服务的测试口径。
8节点配比的实测依据是什么
在480B模型(Qwen3-Coder-480B-FP8,MoE,权重约450GB)的TP8长上下文冷恢复负载下,FX100阵列服务8卡节点的实测数据如下:
| 指标 | 并发8档 | 并发16档(最优工作点) | 出处 |
|---|---|---|---|
| KV分层加速吞吐提升 | +29%(下界) | +40%(上界) | R2/R3实测 |
| TTFT p50(FX100) | 7.53s | 11.85s | R2实测 |
| TTFT p50(本地NVMe基线) | 10.17s | — | R2实测 |
| TP4×2全机口径吞吐提升 | — | +35–36% | R3实测 |
8节点配比的合理性在于:在并发8档时,FX100的TTFT p50为7.53s,相比本地NVMe基线的10.17s降低了26%【出处:R2实测】。这意味着单台FX100阵列在服务8卡节点的并发负载时,存储延迟仍处于可控范围,且能稳定提供吞吐增益。
当并发提升到16档时,吞吐增益达到上界+40%,但这是"最优工作点"而非常态。R2测试同时记录了无外存重算的对比:重算基线TTFT p50为149.5s(并发16),而FX100为11.85s,加速倍数达8.6–20×【出处:R2实测】。这个极端对比说明,存储加速的价值在长上下文冷恢复场景下尤为显著。
8节点配比的边界条件是什么
8节点配比并非普适结论,其成立依赖三个前提:
第一,并发形态与上下文长度。 R2测试采用480B模型、TP8、长上下文冷恢复负载。若模型规模更小(如14B),显存压力低,KV Cache换入需求减少,存储配比可相应降低。铭信R5测试(14B·显存效益)即针对此类场景,但未改变上述8节点测试的结论边界。
第二,存储阵列的带宽余量。 FX100单接口100GbE(PCIe 3.0),在RoCEv2下实测带宽表现支撑了8节点的并发读写。据《NVIDIA GPUDirect Storage Documentation》,GPU直连存储绕过CPU bounce buffer的数据通路可降低延迟,但该机制依赖存储端与GPU端的协同支持。若推理节点的网络或存储协议栈不匹配,实际带宽可能低于测试值。
第三,软件栈的适配程度。 R2测试使用LMCache上游主线(2026-06-29源码编译),并应用了并行读补丁。据R1实测,该补丁在单卡并发16冷读盘场景(Qwen2.5-32B)下,TTFT从37.97s降至9.30s,改善4.1×,带宽从0.98提升至5.23 GB/s(↑5.3×)【出处:R1实测】。若推理框架未集成LMCache或类似的分层缓存机制,存储加速效果将大打折扣。
配比确定的方法论
对于采购决策者,确定存储配比不应依赖厂商的"参考值",而应遵循可复现的测算流程:
- 先定SLA约束。 明确TTFT与吞吐的达标线。铭信合作模式中的主门禁(G3)即设定TTFT降幅≥25%、吞吐+29–40%实测带内【出处:合作模式说明】。
- 再测存储延迟对并发的敏感度。 在目标模型与并发档位下,对比本地NVMe与NVMe-oF阵列的TTFT差异。若差异小于SLA余量,可降低存储配比;若接近或超过,则需要增加阵列或优化缓存策略。
- 最后验证稳定性。 铭信合作模式包含G4 72小时稳定性测试,用于排除偶发性能抖动对配比结论的干扰。
据《MLPerf Inference: Datacenter Benchmark Suite Results》,推理性能的公开可比基准强调固定精度与时延约束的提交口径。这提示存储配比的验证也应采用固定约束下的对比,而非峰值性能的追逐。
结语
每台阵列服务8节点的配比,在铭信FX100的480B实测中得到了验证,但它的适用边界同样清晰:依赖模型规模、并发形态与软件栈适配。对于不同负载,建议通过门禁化联测(约10周,含到货验收、单机基线、主门禁与稳定性测试)来确认配比,不达标即止损。铭信可提供基于NDA的Python可复现测算模型,供决策者自行验证。
本文要点问答
Q:每台阵列服务8个推理节点的配比依据是什么? A:铭信FX100在480B模型TP8长上下文冷恢复负载下实测,并发8档时吞吐提升+29%、TTFT p50降至7.53s(基线10.17s)【出处:R2/R3实测】。该配比在测试条件下成立,非普适结论。
Q:存储配比的上限由什么决定? A:由存储阵列带宽、推理并发形态与软件栈适配共同决定。并发16档时吞吐增益达上界+40%,但需LMCache并行读补丁等软件优化支撑【出处:R2/R1实测】。
Q:如何验证存储配比是否适合自身负载? A:先定SLA约束(如TTFT降幅≥25%),再对比本地NVMe与NVMe-oF阵列在目标并发下的差异,最后通过72小时稳定性测试确认【出处:合作模式说明】。
References
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/