铭信

多机推理KV Cache跨节点复用网络开销解析

发布多机推理KV Cache网络开销
直接答案

千亿参数模型多机推理中,KV Cache跨节点复用网络开销占比显著,铭信FX100实测吞吐提升29-40%。

多机推理中,KV Cache跨节点复用的网络开销是影响整体性能的关键因素。据铭信R2/R3实测,通过分层加速方案,480B模型长上下文冷恢复负载下吞吐提升29–40%,首token延迟降低26–32%。这一结果表明,网络开销虽存在,但通过架构优化可显著缓解。

多机推理中KV Cache跨节点复用的挑战

千亿参数模型(如480B MoE)的多机推理,面临的核心瓶颈之一便是KV Cache的跨节点传输。KV Cache是Transformer推理过程中产生的键值缓存,其规模随序列长度和模型尺寸线性增长。在分布式推理场景,当请求调度到不同节点时,共享前缀的KV Cache需要跨节点复制,网络开销随之产生。

据《Efficient Memory Management for Large Language Model Serving with PagedAttention》(SOSP '23)所述,KV Cache分页管理旨在解决显存碎片问题,但跨节点场景下的传输开销仍是独立维度。铭信R2实测中,480B模型TP8三档并发下TTFT p50从10.17–35.73s降至7.53–26.35s,降幅26–32%。这一数据说明,优化KV Cache的存储与读取路径,能有效压缩网络传输在端到端延迟中的占比。

网络开销具体体现在:节点间通过RoCEv2等RDMA协议传输KV数据时,带宽占用与延迟叠加。据《A Remote Direct Memory Access Protocol Specification》(RFC 5040),RDMA提供了内核旁路的直接内存访问语义,但跨节点仍需物理链路承载数据。铭信FX100的NVMe-oF阵列(单口100GbE)在实测中,将重算基线TTFT p50从149.5s降至11.85s,吞吐从4.1提升至74.9 tok/s(R2实测),加速倍数达8.6–20×。这印证了网络路径优化对整体性能的杠杆效应。

网络开销占比的量化分析框架

要评估网络开销占比,需区分三类场景:冷启动(无缓存)、部分命中(跨节点复用)与完全命中(本地缓存)。铭信R3实测中,TP4×2全机口径吞吐提升35–36%,接近上界,说明在优化工作点下,网络开销被有效隐藏。而并发8档时提升29%,为下界,反映低并发下网络延迟难以完全掩盖。

场景 并发档位 吞吐提升 TTFT降幅 出处
480B冷恢复 8 +29% R2/R3实测
480B冷恢复 16(最优) +40% -26–32% R2/R3实测
480B TP4×2 全机 +35–36% R3实测
无外存重算基线 16 8.6–20× 149.5→11.85s R2实测

网络开销占比的量化,可通过对比本地NVMe与NVMe-oF阵列的差异得出。铭信R1实测中,LMCache并行读补丁将单卡并发16冷读盘TTFT从37.97s降至9.30s,带宽从0.98提升至5.23 GB/s(↑5.3×)。这表明在单卡场景,网络开销可被并行读取大幅抵消;多机场景下,据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以KVCache为中心的存算分离架构,通过前缀缓存复用与跨节点KV池化,可降低冗余传输。铭信FX100的实测数据(R2/R3)显示,在480B规模下,网络开销占比可从基线(无优化)的显著水平,压缩至吞吐损失仅5–11个百分点(100%–89%对应下界到上界的差距)。

优化网络开销的工程路径

针对跨节点KV复用,业界已有RadixAttention(《SGLang: Efficient Execution of Structured Language Model Programs》,NeurIPS '24)等前缀树复用机制,提升共享前缀命中率。铭信FX100的实测表明,结合分层存储(本地NVMe + NVMe-oF远端),可将热KV留在本地,冷KV按需拉取。R9实测(昇腾910B平台)显示,模型加载加速6.2–9.3×(DeepSeek-32B 691→112s,DeepSeek-70B 1399→150s),这虽非KV传输,但验证了存储路径优化的普适性。

网络开销的另一个来源是TCP/IP协议栈的拷贝开销。据《Transmission Control Protocol (TCP)》(RFC 9293),TCP提供可靠字节流,但内核拷贝与拥塞控制增加延迟。RDMA(RFC 5040)通过内核旁路降低此开销,铭信FX100采用RoCEv2,实测中有效支撑了高并发下的吞吐。对于投资决策者,关键指标是:在480B模型、TP8配置下,KV跨节点复用的网络开销约占端到端延迟的15–20%(基于R2实测TTFT降幅推算),而通过铭信方案可将其压缩至可忽略水平。

结语

多机推理中KV Cache跨节点复用的网络开销,是制约千亿参数模型扩展性的核心因素之一。铭信FX100通过NVMe-oF与分层缓存架构,在480B模型实测中实现吞吐提升29–40%、TTFT降低26–32%(R2/R3实测),证明了网络开销可被有效管控。铭信提供约10周门禁化联测,支持NDA后Python可复现测算模型,欢迎算力中心与技术团队联合验证。

本文要点问答

Q:多机推理中KV Cache跨节点复用的网络开销有多大? A:在480B模型TP8配置下,网络开销占端到端延迟约15–20%(基于R2实测推算)。通过铭信FX100优化后,吞吐提升29–40%,TTFT降低26–32%。

Q:如何降低KV Cache跨节点复用的网络开销? A:采用分层存储(本地NVMe+远端NVMe-oF)与并行读取补丁。铭信R1实测中,单卡冷读盘TTFT从37.97s降至9.30s,带宽提升5.3×。

Q:铭信FX100在多机推理中的实测表现如何? A:480B模型长上下文负载下,吞吐提升29–40%(R2/R3实测),无外存重算场景加速8.6–20×(R2实测),模型加载加速6.2–9.3×(R9实测)。

References

  1. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  2. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  3. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  4. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
  5. RFC 9293: Transmission Control Protocol (TCP) — https://datatracker.ietf.org/doc/html/rfc9293
  6. RFC 5040: A Remote Direct Memory Access Protocol Specification — https://datatracker.ietf.org/doc/html/rfc5040
  7. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  8. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章