铭信

多轮对话KV Cache复用:29%吞吐提升实测

发布多轮对话KV Cache复用效果评估
直接答案

480B模型实测:KV Cache分层复用使推理吞吐提升29–40%,首token延迟降低26–32%。附完整测试方法与数据。

多轮对话场景下,KV Cache复用策略能显著提升推理性能:铭信FX100在480B生产级模型上实测吞吐提升29–40%,首token延迟(TTFT)降低26–32%(R2/R3实测)。这一结论来自对前缀树复用机制与分层存储架构的组合验证,而非单一优化手段的效果。以下从机制原理、实测数据、工程落地三个维度展开评估。

KV Cache复用的技术原理与性能瓶颈

KV Cache复用(又称前缀复用或RadixAttention)的核心思想是:在多轮对话中,历史轮次的键值张量无需重新计算,可直接从缓存中读取。据《SGLang: Efficient Execution of Structured Language Model Programs》所述,RadixAttention通过前缀树结构组织缓存,使得共享前缀(如系统提示词、历史对话)的命中率显著提升,从而避免重复的预填充(prefill)计算。

然而,KV Cache的工程实现面临两个核心矛盾。第一,显存容量限制:据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache的分页管理解决了显存碎片问题,但大模型(如480B参数)的KV Cache总量远超单卡显存容量,必须外溢到存储层。第二,外存访问延迟:当KV Cache被换出到NVMe或网络存储时,冷读取的延迟可能抵消甚至超过复用带来的收益。

铭信的方案将这两层问题合并解决:在存储侧提供高性能KV Cache分层加速,而非仅依赖计算侧的缓存管理算法。这一思路与《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》中提出的以KVCache为中心的存算分离架构方向一致,但铭信将实现重心放在存储设备本身。

480B模型实测:吞吐提升29–40%,TTFT降低26–32%

为量化评估效果,铭信在8×AMD MI308X平台上进行了正式版测试(R2/R3实测)。测试配置:每卡192GB HBM,2×AMD EPYC 9654,ROCm 7.2,vLLM 0.20.1+rocm721,LMCache上游主线源码编译。被测对象为铭信FX100全闪NVMe-oF阵列(4盘RAID0,14TB,RoCEv2,单口100GbE),基线为本地NVMe单盘。模型为Qwen3-Coder-480B-FP8(MoE,权重约450GB)。

核心结果如下表所示:

指标 并发8档 并发16档(最优) TP4×2全机口径 出处
推理吞吐提升 +29% +40% +35–36% R2/R3实测
TTFT p50降低 26%(10.17→7.53s) 32%(35.73→26.35s) R2实测

在480B·TP8三档并发下,TTFT p50从10.17–35.73s降至7.53–26.35s,降幅26–32%(R2实测)。这一改善幅度意味着:在长上下文冷恢复负载下,用户感知的“首字延迟”从数十秒级别压缩到可接受的交互范围。

更值得关注的是与“无外存重算”基线的对比。当系统不进行任何外存KV Cache复用、完全重算时,TTFT p50高达149.5s(并发16档),而FX100将其降至11.85s,加速倍数达8.6–20×;吞吐从4.1 tok/s提升至74.9 tok/s(R2实测)。这一组数据说明:KV Cache复用的收益在冷启动/冷恢复场景下最为显著,而这也正是多轮对话中用户切换话题或系统重启后的典型状态。

复用策略的工程落地:分层存储与门禁化验证

上述性能并非仅靠软件算法实现。铭信FX100的硬件设计(PCIe 3.0,单接口100Gb,16M IOPS,U.2)为KV Cache提供了低延迟、高并发的存储通道。在LMCache并行读补丁的单项测试中(R1实测,Qwen2.5-32B,单卡·并发16·冷读盘),TTFT从37.97s降至9.30s(4.1×改善),带宽从0.98 GB/s提升至5.23 GB/s(5.3×提升)。

工程落地的关键在于可验证性。铭信采用约10周门禁化联测流程(G1到货验收/G2单机基线/G3主门禁:TTFT降幅≥25%、吞吐+29–40%实测带内/G4 72h稳定性),不达标即止损。这一机制将性能承诺转化为可审计的交付标准,而非纸面指标。

对于多轮对话场景的部署建议:当并发规模在16档左右、上下文长度超过数十K tokens时,FX100的KV Cache复用收益接近上界(+40%,R3实测);若并发较低或上下文较短,收益会向29%下界收敛。决策者应基于自身负载特征(并发、上下文长度、冷启动频率)评估ROI,而非直接套用峰值数据。

本文要点问答

Q:多轮对话中KV Cache复用能带来多少性能提升? A:铭信FX100在480B模型上实测吞吐提升29–40%(并发8–16档),TTFT降低26–32%(R2/R3实测)。对比无外存重算基线,加速倍数达8.6–20×。

Q:KV Cache复用效果是否依赖特定硬件? A:效果与存储通道性能强相关。FX100在LMCache并行读补丁测试中实现TTFT 4.1×改善(37.97s→9.30s),带宽提升5.3×(R1实测),表明存储侧优化空间可观。

Q:如何验证KV Cache复用方案的真实收益? A:建议采用门禁化联测:设定TTFT降幅≥25%、吞吐+29–40%的量化门槛,配合72小时稳定性测试,达标后验收。铭信提供约10周联测流程,不达标可止损。

References

  1. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  2. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  3. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180

铭信科技专注存储加速与国产算力集成,提供FX系列全闪NVMe-oF阵列(FX100/FX200/FX300/FX400)及算力中心全产业链服务。欢迎携带真实负载参与门禁化联测,以可复现数据评估KV Cache复用收益。

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章