铭信

KV Cache池化共享如何提升推理资源利用率

发布KV Cache池化共享资源利用率
直接答案

铭信实测显示,KV Cache池化共享使480B模型推理吞吐提升29–40%,TTFT降低26–32%,为算力中心降本提供可量化路径。

KV Cache池化共享通过将分散的显存资源集中管理、按需分配,可显著提升大型模型推理的资源利用率。铭信科技在480B参数模型上的实测数据显示,采用KV Cache分层加速后,推理吞吐提升29–40%,首token延迟(TTFT)降低26–32%【R2/R3实测】。这一结果验证了池化共享架构在真实生产负载下的有效性,为算力中心优化资源分配提供了可量化的技术路径。

为什么KV Cache池化共享能提升资源利用率

大型模型推理的资源瓶颈往往不在算力,而在显存带宽与容量。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》所述,注意力计算的本质是受HBM带宽而非算力限制的访存密集型操作。KV Cache作为推理过程中存储键值张量的缓存结构,其占用的显存随序列长度线性增长,在多实例并发场景下极易造成显存碎片化与利用率不均。

池化共享的核心思路是将KV Cache从各GPU的私有显存中解耦,放入统一管理的存储池中。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》的分析,这种以KVCache为中心的存算分离架构,能够实现前缀缓存复用与跨节点KV池化,避免每个实例重复计算相同前缀。铭信FX100实测表明,在480B生产部署形态长上下文冷恢复负载下,并发8档时吞吐提升29%(下界),最优工作点并发16档时提升40%(上界)【R2/R3实测】。

池化共享在不同场景下的实测效果

铭信科技在不同负载形态下对FX100进行了系统性测试,下表汇总了关键指标:

指标 基线 FX100池化共享 提升幅度 出处
吞吐(并发8档) 基线值 +29% R2/R3实测
吞吐(并发16档) 基线值 +40% R2/R3实测
吞吐(TP4×2全机) 基线值 +35–36% R3实测
TTFT p50(三档并发) 10.17–35.73s 7.53–26.35s ↓26–32% R2实测
无外存重算加速(吞吐) 4.1 tok/s 74.9 tok/s 8.6–20× R2实测

在无外存重算的对比测试中,重算基线TTFT p50为149.5s(并发16档),而FX100仅需11.85s【R2实测】。这一数据说明,池化共享不仅减少了显存浪费,更避免了因KV Cache溢出而被迫重算的极端延迟惩罚。

对于中小规模模型,池化共享同样有效。据《SGLang: Efficient Execution of Structured Language Model Programs》所述,RadixAttention通过前缀树复用机制,在多轮对话与共享前缀场景下能显著提升命中率。铭信在Qwen2.5-32B模型上的LMCache并行读补丁测试显示,TTFT从37.97s降至9.30s(4.1×改善),带宽从0.98提升至5.23 GB/s(↑5.3×)【R1实测】。

池化共享对算力中心运营的实际价值

从算力中心运营视角看,KV Cache池化共享的价值体现在三个层面:其一,降低单实例显存需求,提高单卡可承载的并发实例数;其二,减少因KV Cache溢出导致的请求失败与重算,提升服务稳定性;其三,通过分层存储策略,将热数据留在显存、冷数据下沉至NVMe-oF存储池,优化整体成本结构。

铭信FX100在训练场景的Checkpoint保存加速测试中,8卡32B LoRA整模型快照保存时间从178s降至94s(1.9×),持续写带宽从3.26提升至6.40 GB/s(+96%)【R1实测】。这一数据表明,池化存储架构不仅服务于推理,对训练效率同样有正向贡献。

在昇腾平台上,FX100对比NFS基线的模型加载加速效果更为显著:DeepSeek-32B服务加载从691s降至112s(6.2×),DeepSeek-70B从1399s降至150s(9.3×)【R9实测】。对于需要频繁加载不同模型的算力中心,这一能力直接转化为更高的服务可用时间。

实施路径与联测验证

池化共享的落地并非简单的硬件替换,而是涉及存储架构、调度策略与框架适配的系统工程。据《NVIDIA GPUDirect Storage Documentation》所述,GPU直连存储可绕过CPU bounce buffer,建立GPU与存储设备间的直接数据通路。铭信FX100全闪NVMe-oF阵列基于RoCEv2协议,单口100GbE,配合4盘RAID0配置(14 TB, XFS),实现了与AMD Instinct MI308X平台的深度适配【R1–R4测试平台】。

对于计划引入池化共享架构的算力中心,铭信提供约10周的门禁化联测流程:G1到货验收、G2单机基线、G3主门禁(TTFT降幅≥25%、吞吐+29–40%实测带内)、G4 72h稳定性验证,不达标即止损。测算模型在NDA签署后以Python可复现,确保技术决策建立在可验证的数据之上。

本文要点问答

Q:KV Cache池化共享对推理吞吐的实际提升幅度是多少? A:铭信FX100在480B模型实测中,并发8档提升29%,并发16档最优工作点提升40%,TP4×2全机口径提升35–36%【R2/R3实测】。

Q:池化共享对首token延迟(TTFT)的改善效果如何? A:480B·TP8三档并发下,TTFT p50从10.17–35.73s降至7.53–26.35s,降幅26–32%【R2实测】;无外存重算场景下,TTFT从149.5s降至11.85s【R2实测】。

Q:池化共享是否只适用于超大规模模型? A:不是。铭信在Qwen2.5-32B模型上测得TTFT改善4.1×(37.97s→9.30s)【R1实测】,在昇腾910B平台DeepSeek-70B加载加速9.3×【R9实测】,中小模型同样受益。

References

  1. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  3. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  4. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  5. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R4FX100 KV Cache 性能测试报告(480B·多实例形态·正式版,编号-006)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章