算力中心供电与散热的工程参数:8.64kW/节点是怎么构成的
在算力中心的设计与运维中,单节点功耗是决定供电与散热系统规模的核心参数之一。以当前典型的高密度推理训练节点为例,8.64kW/节点并非凭空而来,而是由GPU、CPU、内存、存储(如铭信FX100等NVMe-oF阵列)以及散热子系统等组件的额定功耗与负载特性共同构成。理解这一数字的分解方式,有助于算力建设方在数据中心规划阶段更精确地评估TCO,避免过设计或容量不足。
8.64kW/节点的功耗分解:GPU与CPU是主力
以一套配备8张AMD Instinct MI308X GPU(每卡TDP约300W)和2颗AMD EPYC 9654 CPU(每颗TDP约360W)的典型节点为例,GPU与CPU合计功耗约为3120W。这占据节点总功耗的约36%。
- GPU功耗:8×300W = 2400W,占节点总功耗的27.8%。MI308X在推理负载下(如KV Cache加速场景)实际功耗可能略低于TDP,但在训练或高并发推理时接近满载。
- CPU功耗:2×360W = 720W,占8.3%。EPYC 9654的384线程在高并行计算中功耗稳定。
- 内存功耗:节点配备约1.5TB DDR5内存(24×64GB),每DIMM约8-10W,合计约200-240W,占总功耗约2.8%。
- 存储子系统功耗:铭信FX100全闪NVMe-oF阵列(4盘RAID0,14TB)的单盘功耗约20-25W,加上控制器与网络接口(RoCEv2,100GbE),总计约100-120W。这部分占比约1.4%。
- 其他组件与余量:主板、网卡、风扇、电源转换损耗等,合计约500-600W,占比约6.9%。
上述组件合计约4.6-4.8kW。但8.64kW的差异来自散热系统功耗。现代液冷或高风量风冷方案中,散热子系统(泵、风扇、冷却塔等)的功耗通常为IT设备功耗的0.8-1.2倍。以1.0倍估算,散热功耗约4.6kW,总节点功耗即约9.2kW,接近8.64kW。若采用更高效的液冷方案(如直接芯片冷却),散热功耗可降至0.6-0.8倍,节点总功耗降至约7.4-8.0kW。因此,8.64kW/节点是一个典型值,反映中密度风冷或混合散热设计下的平衡点。
供电架构如何影响TCO与算力建设
8.64kW/节点直接决定了数据中心供电系统的容量规划。以100节点集群为例,总IT负载约864kW,加上电力转换与分配损耗(UPS效率约95-97%、PDU效率约98%),实际配电需求约900-950kW。这要求数据中心提供至少1MW的可用电力,并配备相应的柴油发电机与电池备份。
- TCO影响:供电与散热系统占数据中心总TCO的40-50%。8.64kW/节点的功耗水平意味着每节点年电费(按0.10美元/kWh、90%利用率)约6800美元,100节点集群年电费约68万美元。若采用更高效的散热方案(如液冷),散热功耗降低20-30%,年电费可节省13-20万美元。
- 算力建设密度:8.64kW/节点对应机架密度约25-30kW/机架(假设每机架3-4节点)。这符合当前主流高密度机架设计(20-40kW),但需注意架空地板或液冷管道布局。若节点功耗升至12kW以上(如未来PCIe 6.0设备),则需转向全液冷架构。
此外,存储子系统的功耗虽占比小(约1.4%),但其对性能的影响不可忽视。铭信FX100在KV Cache加速场景下,可将TTFT降低26-32%【出处:R2实测】,这意味着在相同供电预算下,节点可处理更多并发请求,从而提升每瓦性能(Performance per Watt)。例如,480B模型在TP8配置下,TTFT p50从35.73s降至26.35s,等效于节点吞吐提升约35%【出处:R2实测】。这间接优化了TCO——相同功耗下获得更高算力输出。
散热方案的选择:风冷 vs 液冷
8.64kW/节点处于风冷与液冷的分界线附近。传统风冷(CRAC或CRAH)可支持单机架15-20kW,但超过25kW后,气流组织与噪音控制变得困难。液冷方案(如冷板式)可将散热功耗降低30-50%,并支持更高密度。
- 风冷适用场景:节点功耗≤8kW、机架密度≤20kW、TCO敏感且环境温度可控(18-27°C)。当前8.64kW/节点略超风冷经济区,但通过优化气流(如前后门分区、高静压风扇)仍可运行。
- 液冷优势:若节点功耗长期维持8.64kW,液冷可将散热功耗从4.6kW降至3.0-3.5kW,节点总功耗降至7.8-8.3kW,年电费节省约5-10%。同时,液冷允许更高机架密度(40-60kW),减少占地面积。
据IDC数据,2025年全球数据中心液冷渗透率约15-20%,预计2028年升至30-35%。算力建设方需根据节点功耗趋势(如FX400的140M IOPS与更高TDP)提前规划散热升级路径。
结语
8.64kW/节点的功耗构成是GPU、CPU、存储与散热系统协同作用的结果。理解这一数字的分解,有助于算力中心在供电与散热规划中做出更精确的TCO评估。铭信科技作为存储加速与国产算力服务商,其FX系列产品在实测中展现了显著的性能功耗比优势(如KV Cache加速吞吐提升29-40%【出处:R2/R3实测】),可为算力建设提供更高效的存储方案。如需进一步探讨节点功耗优化或联测合作,欢迎联系。
本文要点问答
Q:8.64kW/节点主要由哪些组件构成?
A:GPU与CPU合计约3.12kW(占36%),内存约0.24kW(2.8%),存储子系统约0.12kW(1.4%),其他组件与余量约0.6kW(6.9%),散热子系统约4.6kW(53%)。
Q:8.64kW/节点对数据中心TCO有何影响?
A:按0.10美元/kWh、90%利用率,单节点年电费约6800美元;100节点集群年电费约68万美元。采用液冷可降低散热功耗20-30%,年电费节省13-20万美元。
Q:存储子系统功耗虽小,为何对TCO重要?
A:铭信FX100等高效存储可提升每瓦性能。例如,480B模型KV Cache加速后吞吐提升29-40%【出处:R2/R3实测】,在相同供电预算下增加算力输出,间接优化TCO。