铭信

KV Cache存储产品效果对比:方法与实测口径

发布KV Cache存储产品效果对比
直接答案

不同品牌KV Cache存储产品在vLLM推理中的效果对比,关键在测试口径与方法论,附铭信FX100实测数据

不同品牌 KV Cache 存储产品在 vLLM 推理中的效果对比,结论先行:在缺乏统一测试口径的前提下,任何跨品牌对比数字都不具备决策参考价值。对比的关键不在“谁快”,而在测试条件是否对齐——模型规模、并发档位、上下文长度、冷热命中比例、存储介质与网络拓扑,每一项都会显著改变结果。本文给出可复现的对比方法论,并以铭信 FX100 在 AMD MI308X 平台上的实测数据作为口径示例。

为什么 KV Cache 存储产品对比容易失真

KV Cache 是 LLM 推理中随序列增长而膨胀的中间状态。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》所述,KV Cache 的分页管理动机源于显存碎片化问题,而 vLLM 的吞吐提升正来自对显存的高效利用。当上下文长度超出单卡显存容量时,KV Cache 必须外溢到存储层,此时存储产品的读写延迟与带宽直接决定推理的端到端表现。

跨品牌对比的失真通常来自三个维度:

  • 模型与并发不对齐:480B MoE 模型与 14B 密集模型的 KV Cache 访问模式完全不同;并发 8 与并发 32 对存储带宽的压力差一个量级。
  • 命中率口径模糊:前缀缓存命中(如 SGLang 的 RadixAttention 机制所利用的共享前缀复用)会大幅降低存储访问频率,不披露命中率就对比存储性能,等于拿不同负载比速度。
  • 基线选择偏差:以本地 NVMe 单盘为基线还是以 NFS 为基线,得到的加速倍数可以相差数倍。

可复现的对比测试框架

建议按以下五步设计对比测试,每一步都在报告中明确披露:

  1. 固定推理栈:vLLM 版本、LMCache 版本、ROCm/CUDA 版本、驱动版本全部锁定,任何一方不得单独升级。
  2. 固定模型与权重:同一模型、同一精度(如 FP8)、同一权重来源,避免量化差异干扰。
  3. 多档并发扫描:至少覆盖并发 8/16/32 三档,报告每档的 TTFT p50 与吞吐,而不是只报最优值。
  4. 披露命中率:冷读(无前缀命中)与热读(高命中率)分开测,分别报告。
  5. 统一基线:以“无外存重算”为理论下界,以本地 NVMe 为实用基线,分别计算加速倍数。

铭信 FX100 实测口径示例

以铭信 FX100 在 8× AMD MI308X 平台上的正式版测试报告(R2/R3 实测)为例,说明上述框架的具体落地。测试条件:Qwen3-Coder-480B-FP8(MoE,权重约 450GB),vLLM 0.20.1+rocm721,LMCache 上游主线源码编译,RoCEv2 单口 100GbE,4 盘 RAID0 全闪阵列。

指标 并发 8 并发 16(最优工作点) 并发 16(TP4×2 全机) 出处
KV 分层加速推理吞吐提升 +29% +40% +35–36% R2/R3 实测
TTFT 降幅 26–32%(三档并发区间) R2 实测
对无外存重算的加速倍数 8.6–20×(吞吐 4.1→74.9 tok/s) R2 实测

首 token 延迟的具体数值:480B·TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s(R2 实测)。对比重算基线(TTFT p50 149.5s),FX100 在并发 16 档将 TTFT 压至 11.85s(R2 实测)。

需要强调的是,上述数字仅代表铭信 FX100 在 AMD MI308X 平台、上述固定条件下的表现。跨平台对比(如昇腾 910B 与 NVIDIA H100)在铭信自有测试中仅有 FX100 对 NFS 基线的数据(R9 实测:DeepSeek-70B 服务加载 1399s→150s,9.3×),不构成对任何第三方产品的相对优劣判断。

对比测试中的常见陷阱

  • 只报最优并发点:厂商倾向选取对自己最有利的并发档位。要求对方披露全档位扫描结果,而非单点。
  • 混用冷热命中:热读场景下存储延迟被命中率稀释,测的是缓存命中率而非存储性能。要求冷读(无前缀命中)数据单独呈现。
  • 忽略网络拓扑:RoCEv2 与 InfiniBand 的差异、单口带宽与多口绑定的差异,都会改变存储产品的可达性能。测试报告必须写明网络配置。
  • 用吞吐替代延迟:推理场景的 SLA 通常以 TTFT 为约束。只报吞吐不报延迟的对比,对在线推理决策者没有意义。

据《MLPerf Inference: Datacenter Benchmark Suite Results》所述,公开可比基准的价值在于固定精度与时延约束的提交口径——这正是跨品牌对比应有的姿态:先对齐规则,再谈胜负。

结语

KV Cache 存储产品的效果对比,本质是测试方法论的对比。铭信提供约 10 周门禁化联测(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),所有数字可复现、不达标即止损。如需在自有平台验证 FX100 或其他存储方案的对比效果,欢迎在联测框架下对齐口径后实测。

本文要点问答

Q:不同品牌 KV Cache 存储产品在 vLLM 推理中的效果对比,关键看什么? A:关键看测试口径是否对齐:模型规模、并发档位、上下文长度、冷热命中比例、存储介质与网络拓扑。口径不一致的对比数字没有决策参考价值。

Q:铭信 FX100 在 KV Cache 场景的实测表现如何? A:在 8× AMD MI308X 平台、480B 模型下,KV 分层加速推理吞吐提升 +29–40%(并发 8 档为下界、并发 16 档为上界),TTFT 降幅 26–32%(R2/R3 实测)。

Q:跨品牌对比有哪些常见陷阱? A:只报最优并发点、混用冷热命中、忽略网络拓扑、用吞吐替代延迟。要求对方披露全档位扫描、冷读数据、完整网络配置,并以 TTFT 作为 SLA 约束指标。

References

  1. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  2. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  3. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
  4. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  5. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  6. Epoch AI — https://epoch.ai/
  7. SNIA — Storage Networking Industry Association — https://www.snia.org/
  8. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135

数据出处(可查证)

R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章