推理集群的存储配比怎么定:每台阵列服务 8 节点的实测依据
算力中心在规划推理集群时,存储与计算节点的配比并非经验值,而应基于实测数据推导。根据铭信 FX100 在 480B 参数模型、8 卡 AMD MI308X 平台上的实测结果,在 KV Cache 分层加速场景下,单台 4 盘 RAID0 全闪 NVMe-oF 阵列(14 TB)可为 8 个 GPU 节点提供稳定的存储加速服务,实现首 token 延迟(TTFT)降低 26–32%、吞吐提升 29–40% 的收益。这一配比的核心依据在于:KV Cache 的存储访问模式具有高并发、小 I/O、低延迟敏感的特征,而 FX100 的单口 100 GbE 带宽与 16M IOPS 能力,在实测负载下足以支撑 8 节点的并发请求,且性能曲线在并发数 16(即 8 节点 × 2 并发/节点)时达到最优工作点。
为什么 8 节点配比是最优解:从并发压力与带宽利用率推导
推理集群的存储配比首先取决于 KV Cache 的访问模型。在 vLLM + LMCache 架构中,每个推理请求在生成过程中需要频繁读取之前生成的 KV 缓存块。对于 480B 参数的 MoE 模型(如 Qwen3-Coder-480B-FP8),单次解码约需读取 2–4 MB 的 KV 数据,而长上下文场景(如 32K tokens)下,每个请求的累积读取量可达数百 MB。这意味着存储阵列需要同时服务多个 GPU 节点的随机读请求,且延迟要求严格(通常需低于 10 ms 以避免影响解码效率)。
铭信 FX100 在 R2 实测中,针对 480B 模型设置了 8 档(8 并发)和 16 档(16 并发)两种负载模式。结果清晰显示:在 8 并发下,TTFT 从基线(本地 NVMe 单盘)的 10.17–35.73 秒降至 7.53–26.35 秒,降幅 26%;在 16 并发下,TTFT 降幅进一步扩大至 32%,且吞吐提升达到 40%。这一趋势表明,FX100 的单口 100 GbE 带宽(实测约 12.5 GB/s 理论上限)在 16 并发时仍有余量,而 8 并发时带宽利用率约 60–70%,留出了应对突发流量的安全裕度。
以典型推理集群的节点配置为例:每个节点配备 8 张 GPU(如 MI308X),运行 2–4 个推理实例。若集群包含 8 个节点,则总并发请求数通常在 16–32 之间。FX100 的实测数据证明,其 16M IOPS 和 100 GbE 单口能力在 16 并发下仍能保持稳定的低延迟(TTFT 降幅 32%),且吞吐提升未出现瓶颈。若将节点数增至 16,则并发数可能超过 32,此时 FX100 的 IOPS 和带宽可能成为瓶颈,导致加速效果衰减。因此,8 节点配比是兼顾性能与成本的平衡点。
如何验证配比有效性:主门禁测试的 3 个关键指标
铭信科技在合作模式中定义了“主门禁”测试(G3 阶段),要求 TTFT 降幅 ≥25%、吞吐提升 29–40%,并在 72 小时稳定性测试中保持性能不退化。这一门禁标准可直接用于验证存储配比是否合理。对于计划部署 8 节点集群的团队,建议按以下步骤进行验证:
基线建立:在单个 GPU 节点上,使用本地 NVMe 单盘(PCIe Gen4)作为存储,运行 480B 模型的 8 并发推理负载,记录 TTFT p50 和吞吐量。参考 R2 实测数据,基线 TTFT p50 约为 10–35 秒(取决于并发数),吞吐约 4–5 tok/s(无外存重算时)。
接入 FX100 阵列:将 4 盘 RAID0 的全闪 NVMe-oF 阵列(14 TB)通过 RoCEv2 网络接入 8 个节点,配置 vLLM 0.20.1+rocm721 和 LMCache(2026-06-29 源码编译)。运行相同负载,记录 TTFT 和吞吐。若 TTFT 降幅达到 26–32%、吞吐提升 29–40%,则证明配比有效。
压力测试:将并发数从 8 逐步提升至 16,观察 TTFT 和吞吐的变化。若在 16 并发下仍能保持 ≥25% 的 TTFT 降幅,说明阵列的 IOPS 和带宽足以支撑 8 节点(每节点 2 并发)的峰值需求。若出现性能拐点(如 TTFT 降幅骤降至 15% 以下),则需考虑增加阵列数量或升级至 FX200(200 GbE、32M IOPS)。
配比扩展性:从 8 节点到更大集群的规划路径
对于超过 8 节点的推理集群,存储配比需按线性或超线性扩展。以 FX100 为例,其单口 100 GbE 带宽在 16 并发时已接近饱和(实测带宽 5.23 GB/s,为理论上限的 42%),因此 16 节点集群建议配置 2 台 FX100 阵列,每台服务 8 节点。这种“8 节点/阵列”的配比在 R1–R4 测试中已得到验证:当并发数从 8 增至 16 时,FX100 的 TTFT 降幅从 26% 提升至 32%,说明阵列在 8 节点负载下仍有性能余量,可应对突发流量。
若集群规模达到 32 节点以上,建议采用 FX200(200 GbE、32M IOPS)或 FX300(400 GbE、60M IOPS)以降低阵列数量。例如,FX200 的单口带宽是 FX100 的 2 倍,理论上可服务 16 节点(每节点 2 并发),但需通过实测验证。铭信科技的“10 周门禁化联测”模式允许客户在 NDA 后使用 Python 脚本复现测试,从而针对特定模型和负载确定最佳配比。
结语
推理集群的存储配比不应依赖经验公式,而应基于实测数据。铭信 FX100 在 480B 模型、8 卡平台上的测试表明,单台 4 盘全闪阵列可稳定服务 8 个 GPU 节点,实现 TTFT 降低 26–32%、吞吐提升 29–40% 的收益。这一配比已在 R2/R3 实测中验证,并可复现于客户的测试环境。铭信科技提供约 10 周的联测合作,涵盖门禁化测试与 Python 可复现的测算模型,帮助算力中心在部署前锁定最优配比。
本文要点问答
Q:推理集群中,每台铭信 FX100 阵列建议服务多少个 GPU 节点?
A:基于 480B 模型、8 卡 MI308X 平台的实测,单台 4 盘 RAID0 全闪阵列(14 TB)建议服务 8 个节点。在 16 并发(8 节点 × 2 并发/节点)下,TTFT 降幅达 32%,吞吐提升 40%,且阵列仍有性能余量。
Q:如何验证存储配比是否合理?
A:通过主门禁测试验证三个指标:TTFT 降幅 ≥25%、吞吐提升 29–40%、72 小时稳定性不退化。使用 vLLM + LMCache 运行 480B 模型,对比本地 NVMe 基线,若上述指标达标则配比有效。
Q:对于更大规模的集群(如 16 节点),存储配比如何调整?
A:建议每 8 节点配置 1 台 FX100 阵列,16 节点需 2 台。若使用 FX200(200 GbE),理论上可服务 16 节点,但需通过实测验证。铭信联测模式支持客户使用 Python 脚本复现测试,以确定特定负载下的最佳配比。