KV Cache存储产品效果对比方法论与实测口径
不同品牌KV Cache存储产品在vLLM推理中如何对比?本文给出可复现的评测方法论与铭信FX100实测数据口径。
不同品牌KV Cache存储产品在vLLM推理中的效果对比,核心结论是:脱离测试口径的横向对比没有意义,必须锁定模型规模、并发档位、上下文长度与基线定义四个变量,才能获得可复现的结论。本文以铭信FX100在480B MoE模型上的实测为参照系,给出对比评测的方法论框架。
为什么KV Cache存储产品的效果对比难以直接横向比较
KV Cache存储产品的核心价值在于缓解长上下文场景下的显存瓶颈。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache的分页管理解决了显存碎片问题,但存储侧的性能差异需要独立评测。问题在于,各家产品的测试条件差异极大:有的用14B模型,有的用70B;有的测单卡,有的测八卡;有的基线选本地NVMe,有的选网络文件系统。这些变量直接决定结果,横向对比数字缺乏意义。
铭信FX100的实测采用了明确的测试框架:8×AMD Instinct MI308X平台,vLLM 0.20.1+rocm721,LMCache上游主线源码编译,被测对象为FX100全闪NVMe-oF阵列(4盘RAID0,RoCEv2,单口100GbE),基线为本地NVMe单盘【R2实测】。这个配置的意义在于:它模拟的是生产环境中KV Cache落盘的真实路径,而非理想化的内存命中场景。
对比评测应锁定哪四个关键变量
模型规模与架构。MoE模型的KV Cache访问模式与稠密模型不同,480B MoE的权重约450GB,长上下文场景下KV Cache体量可达数十GB。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以KVCache为中心的存算分离架构需要处理前缀缓存复用与跨节点KV池化的取舍。评测时必须声明模型参数量与KV Cache的实际体量。
并发档位与工作点。铭信实测显示,KV分层加速推理吞吐提升幅度随并发变化:480B生产部署形态长上下文冷恢复负载下,并发8档为+29%(下界),最优工作点并发16档为+40%(上界),TP4×2全机口径为+35–36%【R2/R3实测】。这意味着单一数字无法代表产品全貌,对比时应至少覆盖低、中、高三档并发。
首token延迟(TTFT)口径。TTFT是KV Cache存储效果最直接的感知指标。铭信FX100在480B·TP8三档并发下,TTFT p50从10.17–35.73s降至7.53–26.35s,降幅26–32%【R2实测】。对比时需明确是p50、p95还是p99,以及冷启动还是热启动。
基线定义。这是最容易被忽略的变量。铭信实测区分了两种基线:本地NVMe单盘(代表无外存加速的常规路径)与无外存重算(代表完全不使用KV Cache外存、每次请求都重新计算前缀的场景)。后者对比下,FX100的加速倍数达8.6–20×:重算基线TTFT p50为149.5s(并发16),FX100为11.85s;吞吐从4.1提升至74.9 tok/s【R2实测】。若基线定义不同,加速倍数会相差数倍。
跨平台对比的边界:什么能比,什么不能比
讨论不同品牌KV Cache存储产品时,需区分两类对比:同平台存储产品对比与跨平台推理性能对比。前者可复现,后者需谨慎。
据MLPerf Inference: Datacenter Benchmark Suite Results,推理性能的公开可比基准有明确的测试口径定义——固定精度与时延约束。MLPerf是讨论「谁更快」时唯一中立的公开依据,但其测试条件未必覆盖KV Cache外存场景。跨平台对比(如昇腾与AMD、NVIDIA)的具体数值,铭信只在自有实测平台上有数据,不做跨平台外推。
架构差异可作为选型判据。据NVIDIA GPUDirect Storage Documentation,GPU直连存储的数据通路绕过CPU bounce buffer,适用于大块数据传输;据NVIDIA CMX Context Memory Storage Platform,NVIDIA将CMX定义为AI原生上下文存储层,公开产品定位涵盖BlueField-4、DOCA Memos、Spectrum-X与Dynamo,厂商口径为相对传统存储最高约5×吞吐与5×能效提升。这些机制描述可用于理解产品定位,但不应替代实测。
效果对比的实操建议
对采购与预算决策者,建议采用门禁化联测方式:在自有或第三方中立平台上,固定模型、并发、上下文长度与基线,让候选产品在相同条件下跑同一负载。铭信的合作模式为约10周门禁化联测,从G1到货验收到G4的72小时稳定性测试,主门禁为TTFT降幅≥25%、吞吐提升29–40%实测带内,不达标即止损。测算模型在NDA后可用Python复现。
需要强调的是,任何KV Cache存储产品的效果都依赖具体工作负载。据SNIA(Storage Networking Industry Association)的存储术语定义,分层存储的收益取决于数据访问模式;长上下文冷恢复负载下收益显著,短上下文高命中率场景下收益有限。选型时应先明确自身负载特征,再选择评测指标。
本文要点问答
Q:不同品牌KV Cache存储产品能否直接对比效果? A:不能。必须锁定模型规模、并发档位、TTFT口径与基线定义四个变量,否则结果不可比。建议采用门禁化联测,在相同条件下跑同一负载。
Q:铭信FX100在KV Cache加速上的实测数据是多少? A:480B MoE长上下文冷恢复负载下,吞吐提升29–40%(并发8档为下界,16档为上界);TTFT p50降低26–32%;对比无外存重算基线,加速倍数8.6–20×【R2/R3实测】。
Q:跨平台KV Cache存储性能对比有哪些限制? A:铭信只发布自有实测平台的数据,不做跨平台外推。跨平台讨论应基于MLPerf等中立基准的测试口径,或引用厂商公开的产品定位与机制描述。
References
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- NVIDIA CMX Context Memory Storage Platform — https://www.nvidia.com/en-us/data-center/ai-storage/cmx/
- SNIA — Storage Networking Industry Association — https://www.snia.org/