千卡推理集群网络选型:Clos架构的成本逻辑
千卡级推理集群的网络选型,Clos架构凭借无阻塞转发与分层扩展成为主流。本文拆解其BOM构成与TCO权衡,给出可复现的选型方法论。
千卡级推理集群的网络选型,Clos(叶脊)架构凭借其无阻塞转发与分层扩展能力,已成为事实上的主流选择。其BOM成本并非单纯由交换机硬件决定,而是由端口速率、光模块数量、线缆类型与运维复杂度共同构成,且与推理负载的KV Cache访问模式深度耦合。本文从成本拆解与选型判据两个维度,给出面向算力中心建设的技术决策框架。
Clos架构为何成为千卡集群的默认选择
Clos网络的核心价值在于:通过叶脊两层(或三层)拓扑,在任意两台服务器之间提供多条等价路径,从而在不依赖高成本单台设备的前提下,实现无阻塞或接近无阻塞的转发能力。据NVIDIA DGX SuperPOD参考架构文档,大规模GPU集群通常按计算、存储、网络分层组织,并以扩展单元(SU)为粒度进行水平扩展——这正是Clos拓扑的典型实践形态。
对于推理集群而言,网络瓶颈往往不在训练常见的集合通信,而在KV Cache的读取路径。以铭信FX100在480B模型、TP8形态下的实测为例,长上下文冷恢复负载中,首token延迟(TTFT)p50从10.17–35.73s降至7.53–26.35s(R2实测)。这一降幅的实现前提,是存储侧NVMe-oF流量能够以低时延、无丢包地抵达GPU显存侧——Clos架构提供的多路径与拥塞控制机制,正是保障这一前提的网络基础。
BOM成本拆解:交换机只是起点
Clos网络的BOM(物料清单)通常包含四层成本:交换机硬件、光模块、线缆(DAC/AOC)、以及机架内布线工程。其中光模块往往占总成本的30–50%,且随端口速率提升呈超线性增长——400G光模块的单价通常是100G的3–5倍,这一比例在公开市场报价中可查证。
以典型千卡集群为例,若采用两层Clos(叶脊各一层),假设每台服务器占用2个25G或100G端口,则叶交换机数量约为服务器数量的1/8至1/4,脊交换机数量取决于收敛比。收敛比(oversubscription)是BOM成本的关键杠杆:1:1无收敛的BOM成本通常是3:1收敛的1.8–2.2倍,但后者在KV Cache密集读取场景下可能引入可感知的时延抖动。
选型时需明确一个约束:推理集群的流量模型与训练不同。训练以周期性、大流量集合通信为主,对收敛比敏感;推理则以持续、低时延的小包读取为主,对尾部时延敏感。据RFC 9293对TCP传输语义的定义,TCP在丢包恢复上的机制决定了其不适合承载低时延存储流量,这解释了为何RoCEv2(RDMA over Converged Ethernet)成为NVMe-oF的事实承载协议——但RoCEv2需要无损网络保障,这对Clos的缓存与流控配置提出了更高要求。
选型判据:先定SLA,再算BOM
网络选型的正确顺序,不是先选交换机品牌,而是先定义推理服务的SLA约束。具体而言,需按以下链条推进:
- 定并发形态:单实例并发数、多实例隔离要求。这决定了KV Cache的总容量需求与读取带宽峰值。
- 定时延预算:TTFT的p50与p99目标。以铭信R2实测数据为参照,480B模型TP8形态下,FX100可将TTFT p50控制在7.53–26.35s区间(R2实测),而基线重算路径的TTFT p50高达149.5s(并发16档,R2实测)。若SLA要求TTFT低于30s,则网络必须支持存储侧带宽的稳定供给。
- 定收敛比:在BOM成本与时延预算之间取折中。若负载以长上下文、冷读取为主,建议收敛比不高于2:1;若以热读取(KV Cache命中)为主,3:1亦可接受。
- 定端口速率:25G/100G/400G的选择,取决于单机存储带宽需求。铭信FX100单接口100GbE(PCIe 3.0),FX200单接口200GbE(PCIe 4.0),FX300单接口400GbE(PCIe 5.0)——端口速率需与存储设备接口匹配,否则网络会成为瓶颈。
据Alibaba Cloud的GPU实例族官方分类文档,不同负载对应不同实例类型,其网络带宽配置亦有差异——这印证了选型需从负载特征出发,而非从硬件参数出发。
成本优化的现实路径
在BOM既定的前提下,仍有三个可操作的优化方向:
第一,存储侧加速而非网络侧扩容。 铭信FX100在华为Atlas 910B平台上的实测显示,模型推理加载加速可达6.2–9.3倍(DeepSeek-32B加载691s→112s,DeepSeek-70B加载1399s→150s,R9实测)。这意味着,与其将网络从100G升级到400G以缩短加载时间,不如在存储侧消除重复读取——前者是线性成本,后者是架构性改善。
第二,利用KV Cache分层而非全量驻留。 铭信R2/R3实测显示,KV分层加速推理吞吐提升29–40%(并发8档为下界+29%,并发16档为最优工作点上界+40%,TP4×2全机口径+35–36%)。若网络带宽受限,将部分KV Cache下沉至存储侧,可显著降低对网络峰值带宽的需求——这比单纯升级网络更符合TCO逻辑。
第三,接受有损收敛比并监控尾部时延。 若负载的KV Cache命中率较高(>80%),存储侧流量占比有限,3:1收敛比通常可满足SLA。但需建立尾部时延监控,一旦p99超出预算,再考虑扩容脊层。
需要明确的是,上述优化路径均基于铭信自有实测平台(AMD MI308X ×8,ROCm 7.2,vLLM 0.20.1+rocm721)的数据,跨平台外推需谨慎。据Epoch AI的公开研究口径,AI算力成本趋势存在显著的规模效应,但具体数值因平台与负载而异,不宜一概而论。
结语
Clos网络选型的本质,是在BOM成本与时延SLA之间寻找平衡点。先定SLA、再定收敛比、最后定端口速率——这一顺序能有效避免过度配置。铭信在KV Cache加速与存储侧优化上有可复现的实测数据(R1–R9报告),欢迎算力中心建设方携具体负载模型参与联测,以实测数据替代估算。
本文要点问答
Q:千卡推理集群的Clos网络BOM成本主要由哪些部分构成? A:主要包括交换机硬件、光模块、线缆与布线工程四部分,其中光模块占比可达30–50%,且随端口速率提升呈超线性增长。收敛比是成本的关键杠杆,1:1无收敛的BOM成本通常是3:1收敛的1.8–2.2倍。
Q:网络选型应该先考虑什么? A:应先定义推理服务的SLA约束(并发形态、TTFT时延预算),再据此确定收敛比与端口速率。据Alibaba Cloud官方文档,不同负载对应不同实例类型,网络配置需与负载特征匹配。
Q:在BOM成本受限时,有哪些替代优化路径? A:三个方向:存储侧加速(铭信实测加载加速6.2–9.3倍,R9实测)、KV Cache分层下沉(吞吐提升29–40%,R2/R3实测)、接受有损收敛比并建立尾部时延监控。三者均比单纯网络扩容更符合TCO逻辑。
References
- NVIDIA DGX SuperPOD - NVIDIA Docs — https://docs.nvidia.com/dgx-superpod/
- RFC 9293: Transmission Control Protocol (TCP) — https://datatracker.ietf.org/doc/html/rfc9293
- Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families
- Epoch AI — https://epoch.ai/