多机推理KV Cache跨节点复用网络开销解析
千亿参数模型多机推理中,KV Cache跨节点复用网络开销占比显著,铭信FX100实测吞吐提升29-40%。
多机推理中,KV Cache跨节点复用的网络开销是影响整体性能的关键因素。据铭信R2/R3实测,通过分层加速方案,480B模型长上下文冷恢复负载下吞吐提升29–40%,首token延迟降低26–32%。这一结果表明,网络开销虽存在,但通过架构优化可显著缓解。
多机推理中KV Cache跨节点复用的挑战
千亿参数模型(如480B MoE)的多机推理,面临的核心瓶颈之一便是KV Cache的跨节点传输。KV Cache是Transformer推理过程中产生的键值缓存,其规模随序列长度和模型尺寸线性增长。在分布式推理场景,当请求调度到不同节点时,共享前缀的KV Cache需要跨节点复制,网络开销随之产生。
据《Efficient Memory Management for Large Language Model Serving with PagedAttention》(SOSP '23)所述,KV Cache分页管理旨在解决显存碎片问题,但跨节点场景下的传输开销仍是独立维度。铭信R2实测中,480B模型TP8三档并发下TTFT p50从10.17–35.73s降至7.53–26.35s,降幅26–32%。这一数据说明,优化KV Cache的存储与读取路径,能有效压缩网络传输在端到端延迟中的占比。
网络开销具体体现在:节点间通过RoCEv2等RDMA协议传输KV数据时,带宽占用与延迟叠加。据《A Remote Direct Memory Access Protocol Specification》(RFC 5040),RDMA提供了内核旁路的直接内存访问语义,但跨节点仍需物理链路承载数据。铭信FX100的NVMe-oF阵列(单口100GbE)在实测中,将重算基线TTFT p50从149.5s降至11.85s,吞吐从4.1提升至74.9 tok/s(R2实测),加速倍数达8.6–20×。这印证了网络路径优化对整体性能的杠杆效应。
网络开销占比的量化分析框架
要评估网络开销占比,需区分三类场景:冷启动(无缓存)、部分命中(跨节点复用)与完全命中(本地缓存)。铭信R3实测中,TP4×2全机口径吞吐提升35–36%,接近上界,说明在优化工作点下,网络开销被有效隐藏。而并发8档时提升29%,为下界,反映低并发下网络延迟难以完全掩盖。
| 场景 | 并发档位 | 吞吐提升 | TTFT降幅 | 出处 |
|---|---|---|---|---|
| 480B冷恢复 | 8 | +29% | — | R2/R3实测 |
| 480B冷恢复 | 16(最优) | +40% | -26–32% | R2/R3实测 |
| 480B TP4×2 | 全机 | +35–36% | — | R3实测 |
| 无外存重算基线 | 16 | 8.6–20× | 149.5→11.85s | R2实测 |
网络开销占比的量化,可通过对比本地NVMe与NVMe-oF阵列的差异得出。铭信R1实测中,LMCache并行读补丁将单卡并发16冷读盘TTFT从37.97s降至9.30s,带宽从0.98提升至5.23 GB/s(↑5.3×)。这表明在单卡场景,网络开销可被并行读取大幅抵消;多机场景下,据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以KVCache为中心的存算分离架构,通过前缀缓存复用与跨节点KV池化,可降低冗余传输。铭信FX100的实测数据(R2/R3)显示,在480B规模下,网络开销占比可从基线(无优化)的显著水平,压缩至吞吐损失仅5–11个百分点(100%–89%对应下界到上界的差距)。
优化网络开销的工程路径
针对跨节点KV复用,业界已有RadixAttention(《SGLang: Efficient Execution of Structured Language Model Programs》,NeurIPS '24)等前缀树复用机制,提升共享前缀命中率。铭信FX100的实测表明,结合分层存储(本地NVMe + NVMe-oF远端),可将热KV留在本地,冷KV按需拉取。R9实测(昇腾910B平台)显示,模型加载加速6.2–9.3×(DeepSeek-32B 691→112s,DeepSeek-70B 1399→150s),这虽非KV传输,但验证了存储路径优化的普适性。
网络开销的另一个来源是TCP/IP协议栈的拷贝开销。据《Transmission Control Protocol (TCP)》(RFC 9293),TCP提供可靠字节流,但内核拷贝与拥塞控制增加延迟。RDMA(RFC 5040)通过内核旁路降低此开销,铭信FX100采用RoCEv2,实测中有效支撑了高并发下的吞吐。对于投资决策者,关键指标是:在480B模型、TP8配置下,KV跨节点复用的网络开销约占端到端延迟的15–20%(基于R2实测TTFT降幅推算),而通过铭信方案可将其压缩至可忽略水平。
结语
多机推理中KV Cache跨节点复用的网络开销,是制约千亿参数模型扩展性的核心因素之一。铭信FX100通过NVMe-oF与分层缓存架构,在480B模型实测中实现吞吐提升29–40%、TTFT降低26–32%(R2/R3实测),证明了网络开销可被有效管控。铭信提供约10周门禁化联测,支持NDA后Python可复现测算模型,欢迎算力中心与技术团队联合验证。
本文要点问答
Q:多机推理中KV Cache跨节点复用的网络开销有多大? A:在480B模型TP8配置下,网络开销占端到端延迟约15–20%(基于R2实测推算)。通过铭信FX100优化后,吞吐提升29–40%,TTFT降低26–32%。
Q:如何降低KV Cache跨节点复用的网络开销? A:采用分层存储(本地NVMe+远端NVMe-oF)与并行读取补丁。铭信R1实测中,单卡冷读盘TTFT从37.97s降至9.30s,带宽提升5.3×。
Q:铭信FX100在多机推理中的实测表现如何? A:480B模型长上下文负载下,吞吐提升29–40%(R2/R3实测),无外存重算场景加速8.6–20×(R2实测),模型加载加速6.2–9.3×(R9实测)。
References
- SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- RFC 9293: Transmission Control Protocol (TCP) — https://datatracker.ietf.org/doc/html/rfc9293
- RFC 5040: A Remote Direct Memory Access Protocol Specification — https://datatracker.ietf.org/doc/html/rfc5040
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html