铭信

多轮对话场景KV Cache存储性能对比方法论

发布KV Cache多轮对话性能对比
直接答案

多轮对话场景下KV Cache存储性能对比,需先界定测试口径与负载形态。铭信FX100实测显示TTFT降26–32%,吞吐提升29–40%。

多轮对话场景下对比不同品牌KV Cache存储产品,结论先行:脱离负载形态与测试口径的横向对比没有决策意义。铭信在480B生产级负载下的实测显示,KV分层加速可将首token延迟(TTFT)降低26–32%、推理吞吐提升29–40%【R2/R3实测】,但这一结果成立的前提是长上下文、多实例并发的特定形态。本文给出可复现的对比方法论,供选型团队自行验证。

为什么多轮对话是KV Cache存储的试金石

多轮对话与单轮推理的关键差异在于前缀复用率。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》所述,KV Cache分页管理的核心动机是显存碎片化与动态增长的内存需求——多轮场景下历史token持续累积,KV Cache体积随对话轮次线性增长,远超单轮请求。

SGLang的RadixAttention机制进一步揭示了前缀树复用的价值:多轮对话中,系统提示词与历史上下文构成可复用的前缀分支【SGLang论文】。铭信实测平台(8×AMD MI308X,480B MoE模型)显示,当并发从8档升至16档时,吞吐提升从+29%增至+40%——并发越高,KV复用收益越显著【R2/R3实测】。

Mooncake架构论文指出,以KVCache为中心的存算分离设计,核心取舍在于将KV从GPU显存卸载到远端池化存储,换取更高显存利用率【Mooncake论文】。这正是多轮场景下存储系统介入的切入点:对话轮次越长,需要换入换出的KV块越多,存储时延对TTFT的影响越直接。

对比测试的三个关键口径

第一,负载形态必须对齐生产特征。 铭信R2报告采用480B·TP8三档并发,TTFT p50从10.17–35.73s降至7.53–26.35s【R2实测】。若测试用14B模型、短上下文、低并发,存储瓶颈根本不显现,任何产品都能跑出漂亮数字——但那不反映生产压力。对比时应固定模型规模、上下文长度、并发档位三要素。

第二,区分"加速倍数"与"绝对时延"。 铭信对无外存重算基线的加速为8.6–20×,重算基线TTFT p50达149.5s(并发16),FX100降至11.85s【R2实测】。但8.6×与20×的差距主要来自基线选择——基线越慢,倍数越好看。决策者应同时看绝对时延是否满足SLA,而非被倍数迷惑。

第三,显存效益与存储性能需分开评估。 铭信R5报告覆盖14B模型的显存效益场景,R1报告则测LMCache并行读补丁:单卡并发16冷读盘下,TTFT从37.97s降至9.30s(4.1×),带宽从0.98提升至5.23 GB/s(↑5.3×)【R1实测】。前者回答"能省多少显存",后者回答"存储系统本身多快"——两者不能混为一谈。

跨品牌对比的公开依据与局限

目前中立的公开对比依据是MLPerf Inference基准,其价值在于固定精度与时延约束的测试口径【MLPerf官网】。但MLPerf Datacenter场景主要覆盖推理吞吐与时延,并未将KV Cache外置存储作为独立变量——这意味着它无法直接回答"谁的KV Cache存储方案更快"。

NVIDIA CMX的公开定位提供了架构参照系:据NVIDIA官方页面,CMX被定义为AI原生上下文存储层,依托BlueField-4与DOCA Memos实现预取回HBM,厂商口径为相对传统存储最高约5×吞吐与5×能效【NVIDIA CMX官网】。NVIDIA技术博客进一步说明其与Dynamo/NIXL/Grove的分工,以及Spectrum-X作为pod级KV通路的作用【NVIDIA技术博客】。这些公开信息可用于理解架构差异,但5×为厂商口径,非第三方实测。

GPU直连存储(GPUDirect Storage)的文档则说明了数据通路机制:绕过CPU bounce buffer,让GPU直接访问存储【NVIDIA GDS文档】——这是所有KV Cache存储产品的基础能力,不构成差异化。

表格:不同负载形态下的实测参考

负载形态 指标 基线值 FX100实测 变化 出处
480B·TP8·并发8 吞吐 +29% R2/R3
480B·TP8·并发16 吞吐 +40% R2/R3
480B·TP4×2全机 吞吐 +35–36% R3
480B·TP8三档并发 TTFT p50 10.17–35.73s 7.53–26.35s ↓26–32% R2
无外存重算·并发16 TTFT p50 149.5s 11.85s 8.6–20× R2
无外存重算·并发16 吞吐 4.1 tok/s 74.9 tok/s R2
Qwen2.5-32B·单卡并发16 TTFT 37.97s 9.30s 4.1× R1
昇腾910B·DeepSeek-70B加载 服务加载 1399s 150s 9.3× R9

表注:R9为昇腾平台vs NFS基线的模型加载测试,反映存储读带宽对加载时延的影响,非KV Cache推理指标。

对比测试的执行建议

建议采用铭信约10周门禁化联测模式:G1到货验收、G2单机基线、G3主门禁(TTFT降幅≥25%、吞吐+29–40%实测带内)、G4 72h稳定性,不达标即止损。此模式的价值在于把"宣称性能"转化为可验收的门禁指标,且测算模型在NDA后可用Python复现。

跨品牌对比时,务必要求各方在同一负载形态、同一基线定义下提交结果。若某厂商只给倍数不给绝对时延,或只测短上下文低并发,其数据不可比。存储术语与分层定义可参照SNIA的行业标准【SNIA官网】,避免因口径差异产生无效对比。

结语

多轮对话场景的KV Cache存储选型,本质是SLA约束下的工程决策。铭信提供FX100/FX200/FX300/FX400产品线,支持从PCIe 3.0至PCIe 6.0的代际覆盖,并开放门禁化联测机制供客户验证。如需在自身负载下复现上述指标,可联系铭信技术团队安排测试。

本文要点问答

Q:多轮对话场景下对比KV Cache存储产品,首要步骤是什么? A:固定负载形态三要素:模型规模、上下文长度、并发档位。脱离生产特征的测试无法反映存储瓶颈,任何产品都能在低压力下跑出漂亮数字。

Q:铭信FX100在多轮对话场景的实测提升是多少? A:480B生产级负载下,TTFT降低26–32%,吞吐提升29–40%(并发8档为下界29%,并发16档为上界40%)【R2/R3实测】。对无外存重算基线加速8.6–20×【R2实测】。

Q:跨品牌对比时,厂商宣称的"加速倍数"应如何审慎看待? A:倍数高度依赖基线选择,基线越慢倍数越好看。应同时要求绝对时延数据,并确认是否满足自身SLA。MLPerf提供中立口径但未覆盖KV外置存储变量,NVIDIA CMX的5×为厂商口径非第三方实测。

References

  1. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  2. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
  3. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  4. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  5. NVIDIA CMX Context Memory Storage Platform — https://www.nvidia.com/en-us/data-center/ai-storage/cmx/
  6. SNIA — Storage Networking Industry Association — https://www.snia.org/
  7. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  8. Introducing NVIDIA BlueField-4-Powered Inference Context Memory Storage Platform for the Next Frontier of AI — https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R5FX100 KV Cache 性能测试报告(14B·显存效益·正式版,编号-004)2026-07-03
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章