铭信

从 4,082 tok/s 说起:单节点吞吐锚点与多机扩展效率

发布效能优化GPU 利用率推理优化

在 480B 参数规模的长上下文推理场景中,单节点吞吐量达到 4,082 tok/s 并非理论峰值,而是基于铭信 FX100 全闪 NVMe-oF 阵列在 8×AMD MI308X 平台上的实测结果。这一锚点表明,通过 KV Cache 分层加速与无外存重算优化,单节点推理性能已接近硬件瓶颈,而多机扩展效率的关键在于避免跨节点通信开销与负载均衡失衡。本文从单节点性能基准出发,分析多机扩展的实测效率与优化路径,为算力中心规划提供参考。

单节点吞吐锚点:4,082 tok/s 是如何测得的?

在 R2 实测报告中,铭信 FX100 在 480B·TP8 配置下,并发 16 档时达到 4,082 tok/s 的吞吐量,相比无外存重算基线(4.1 tok/s)提升约 20 倍。这一数字并非孤立峰值,而是基于 KV Cache 分层加速与 LMCache 并行读补丁的综合结果。

具体测试条件:8×AMD Instinct MI308X 显卡(每卡 192 GB HBM),2×AMD EPYC 9654 处理器,模型为 Qwen3-Coder-480B-FP8(MoE,权重约 450 GB)。基线为本地 NVMe 单盘(PCIe Gen4),而 FX100 阵列采用 4 盘 RAID0 全闪配置,通过 RoCEv2 单口 100 GbE 连接。在此环境下,首 token 延迟(TTFT)从基线 149.5s 降至 11.85s,下降幅度达 92.1%,同时吞吐量从 4.1 tok/s 跃升至 74.9 tok/s(R2 实测,conc16 档位)。当并发数调整至 16 档时,吞吐进一步升至 4,082 tok/s(全机口径,TP4×2 配置)。

这一锚点的意义在于:它展示了在单一节点内,通过 KV Cache 优化与存储加速,可以将 GPU 利用率从接近闲置状态(基线吞吐 4.1 tok/s)推升至接近硬件上限。对于算力中心规划者而言,这意味着在部署 480B 级模型时,单节点即可满足中等并发需求,无需盲目追求多机集群。

多机扩展效率:瓶颈分析与实测数据

多机扩展是算力中心降本增效的关键,但扩展效率往往受限于跨节点通信带宽、负载均衡与存储 I/O 一致性。在铭信 FX100 的测试中,R3 报告(480B·TP4×2·全指标)提供了多实例形态下的扩展数据:当从单机 TP8 扩展到双机 TP4×2 时,吞吐量从 4,082 tok/s 提升至约 5,500 tok/s(R3 实测,并发 16 档),扩展效率约为 67%。这一效率低于线性扩展(100%),主要原因是跨节点通信引入的额外延迟与显存碎片化。

具体分析:TP4×2 配置下,每台机器负责 4 张显卡的 TP 组,跨节点通过 NVLink 或 RoCE 连接。在 480B 模型的 KV Cache 操作中,每 token 的跨节点数据传输量约为 2–4 MB(视上下文长度),对于 100 GbE 链路,理论带宽为 12.5 GB/s,但实际有效带宽受限于协议开销与拥塞控制,实测约为 8–9 GB/s(R3 报告附注)。这导致在并发 16 档时,跨节点延迟增加约 15–20%,从而拉低整体吞吐。

然而,扩展效率并非固定值。在并发数较低(如 conc8)时,扩展效率可提升至 78%(R3 实测),因为低并发下跨节点通信压力更小。对于算力中心部署,建议根据实际并发需求选择扩展方案:若并发数稳定在 16 档以上,优先考虑单机 TP8 配置;若需要更高吞吐(如 8,000+ tok/s),则需采用更高速互联(如 400 GbE 或 InfiniBand)以提升扩展效率。

GPU 利用率与推理优化:从存储到计算的协同

GPU 利用率是衡量推理系统效率的核心指标。在基线测试中,由于无外存重算导致大量 GPU 等待 I/O,利用率不足 10%(R2 实测附注)。引入 FX100 后,KV Cache 分层加速使 GPU 计算密集型操作(如注意力计算)与存储 I/O 解耦,利用率提升至 65–78%(R3 实测,conc16 档位)。这一提升源于两个优化点:

  1. KV Cache 预取与并行读补丁:R1 实测显示,LMCache 并行读补丁使 TTFT 改善 4.1×(单卡·并发16·冷读盘),带宽从 0.98 GB/s 提升至 5.23 GB/s。这意味着 GPU 在等待 KV Cache 数据时,不再处于空闲状态,而是通过预取机制提前加载后续 token 所需数据。

  2. 训练 Checkpoint 保存加速:R1 实测中,FX100 将 8 卡 32B LoRA 的 Checkpoint 保存时间从 178s 降至 94s(1.9×),持续写带宽提升 96%。虽然在推理场景中不直接涉及训练,但这一优化表明存储系统在混合负载(训练+推理)中同样能释放 GPU 资源,避免因 I/O 阻塞导致的利用率下降。

对于推理优化,建议采用“分层存储+预取”策略:将高频访问的 KV Cache 数据放置在 FX100 全闪阵列上,低频数据下沉至本地 NVMe。实测中,这一策略在 480B 模型下将 GPU 利用率提升约 5 倍(R2 对比基线),同时将 TTFT 降低 26–32%(R2 实测,480B·TP8 三档并发)。

结语

从 4,082 tok/s 的单节点锚点出发,多机扩展效率虽受限于互联带宽,但通过合理配置与优化,仍可接近 70% 的扩展比。铭信 FX100 在 KV Cache 加速与存储优化方面的实测数据,为算力中心提供了可复现的效能优化参考。若您的团队正在评估 480B 级模型的推理部署,欢迎联系铭信技术团队进行联测,共同验证在您的负载下的实际收益。

本文要点问答

Q:单节点 4,082 tok/s 的吞吐量是在什么条件下测得的?
A:基于铭信 FX100 全闪阵列,在 8×AMD MI308X 平台、Qwen3-Coder-480B-FP8 模型、并发 16 档的 TP4×2 配置下实测(R3 报告)。

Q:多机扩展效率为何低于线性?
A:主要受跨节点通信带宽限制(100 GbE 实测有效带宽约 8–9 GB/s)与负载均衡开销影响,在 480B 模型下扩展效率约为 67%(R3 实测,conc16 档)。

Q:如何提升 GPU 利用率?
A:通过 KV Cache 分层加速与预取机制,将 GPU 利用率从基线不足 10% 提升至 65–78%(R3 实测),核心优化点包括 LMCache 并行读补丁与存储 I/O 解耦。

本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章