KV Cache存储产品效果对比:方法与实测口径
不同品牌KV Cache存储产品在vLLM推理中的效果对比,关键在测试口径与方法论,附铭信FX100实测数据
不同品牌 KV Cache 存储产品在 vLLM 推理中的效果对比,结论先行:在缺乏统一测试口径的前提下,任何跨品牌对比数字都不具备决策参考价值。对比的关键不在“谁快”,而在测试条件是否对齐——模型规模、并发档位、上下文长度、冷热命中比例、存储介质与网络拓扑,每一项都会显著改变结果。本文给出可复现的对比方法论,并以铭信 FX100 在 AMD MI308X 平台上的实测数据作为口径示例。
为什么 KV Cache 存储产品对比容易失真
KV Cache 是 LLM 推理中随序列增长而膨胀的中间状态。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》所述,KV Cache 的分页管理动机源于显存碎片化问题,而 vLLM 的吞吐提升正来自对显存的高效利用。当上下文长度超出单卡显存容量时,KV Cache 必须外溢到存储层,此时存储产品的读写延迟与带宽直接决定推理的端到端表现。
跨品牌对比的失真通常来自三个维度:
- 模型与并发不对齐:480B MoE 模型与 14B 密集模型的 KV Cache 访问模式完全不同;并发 8 与并发 32 对存储带宽的压力差一个量级。
- 命中率口径模糊:前缀缓存命中(如 SGLang 的 RadixAttention 机制所利用的共享前缀复用)会大幅降低存储访问频率,不披露命中率就对比存储性能,等于拿不同负载比速度。
- 基线选择偏差:以本地 NVMe 单盘为基线还是以 NFS 为基线,得到的加速倍数可以相差数倍。
可复现的对比测试框架
建议按以下五步设计对比测试,每一步都在报告中明确披露:
- 固定推理栈:vLLM 版本、LMCache 版本、ROCm/CUDA 版本、驱动版本全部锁定,任何一方不得单独升级。
- 固定模型与权重:同一模型、同一精度(如 FP8)、同一权重来源,避免量化差异干扰。
- 多档并发扫描:至少覆盖并发 8/16/32 三档,报告每档的 TTFT p50 与吞吐,而不是只报最优值。
- 披露命中率:冷读(无前缀命中)与热读(高命中率)分开测,分别报告。
- 统一基线:以“无外存重算”为理论下界,以本地 NVMe 为实用基线,分别计算加速倍数。
铭信 FX100 实测口径示例
以铭信 FX100 在 8× AMD MI308X 平台上的正式版测试报告(R2/R3 实测)为例,说明上述框架的具体落地。测试条件:Qwen3-Coder-480B-FP8(MoE,权重约 450GB),vLLM 0.20.1+rocm721,LMCache 上游主线源码编译,RoCEv2 单口 100GbE,4 盘 RAID0 全闪阵列。
| 指标 | 并发 8 | 并发 16(最优工作点) | 并发 16(TP4×2 全机) | 出处 |
|---|---|---|---|---|
| KV 分层加速推理吞吐提升 | +29% | +40% | +35–36% | R2/R3 实测 |
| TTFT 降幅 | 26–32%(三档并发区间) | — | — | R2 实测 |
| 对无外存重算的加速倍数 | — | 8.6–20×(吞吐 4.1→74.9 tok/s) | — | R2 实测 |
首 token 延迟的具体数值:480B·TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s(R2 实测)。对比重算基线(TTFT p50 149.5s),FX100 在并发 16 档将 TTFT 压至 11.85s(R2 实测)。
需要强调的是,上述数字仅代表铭信 FX100 在 AMD MI308X 平台、上述固定条件下的表现。跨平台对比(如昇腾 910B 与 NVIDIA H100)在铭信自有测试中仅有 FX100 对 NFS 基线的数据(R9 实测:DeepSeek-70B 服务加载 1399s→150s,9.3×),不构成对任何第三方产品的相对优劣判断。
对比测试中的常见陷阱
- 只报最优并发点:厂商倾向选取对自己最有利的并发档位。要求对方披露全档位扫描结果,而非单点。
- 混用冷热命中:热读场景下存储延迟被命中率稀释,测的是缓存命中率而非存储性能。要求冷读(无前缀命中)数据单独呈现。
- 忽略网络拓扑:RoCEv2 与 InfiniBand 的差异、单口带宽与多口绑定的差异,都会改变存储产品的可达性能。测试报告必须写明网络配置。
- 用吞吐替代延迟:推理场景的 SLA 通常以 TTFT 为约束。只报吞吐不报延迟的对比,对在线推理决策者没有意义。
据《MLPerf Inference: Datacenter Benchmark Suite Results》所述,公开可比基准的价值在于固定精度与时延约束的提交口径——这正是跨品牌对比应有的姿态:先对齐规则,再谈胜负。
结语
KV Cache 存储产品的效果对比,本质是测试方法论的对比。铭信提供约 10 周门禁化联测(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),所有数字可复现、不达标即止损。如需在自有平台验证 FX100 或其他存储方案的对比效果,欢迎在联测框架下对齐口径后实测。
本文要点问答
Q:不同品牌 KV Cache 存储产品在 vLLM 推理中的效果对比,关键看什么? A:关键看测试口径是否对齐:模型规模、并发档位、上下文长度、冷热命中比例、存储介质与网络拓扑。口径不一致的对比数字没有决策参考价值。
Q:铭信 FX100 在 KV Cache 场景的实测表现如何? A:在 8× AMD MI308X 平台、480B 模型下,KV 分层加速推理吞吐提升 +29–40%(并发 8 档为下界、并发 16 档为上界),TTFT 降幅 26–32%(R2/R3 实测)。
Q:跨品牌对比有哪些常见陷阱? A:只报最优并发点、混用冷热命中、忽略网络拓扑、用吞吐替代延迟。要求对方披露全档位扫描、冷读数据、完整网络配置,并以 TTFT 作为 SLA 约束指标。
References
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- Epoch AI — https://epoch.ai/
- SNIA — Storage Networking Industry Association — https://www.snia.org/
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135