国产加速卡KV Cache性能实测对比思路
从铭信FX100实测出发,拆解国产与国外加速卡在KV Cache性能对比中的方法论与边界,给出可复现的选型判据。
国产AI推理加速卡与国外产品在KV Cache性能上的差异,无法用单一数字概括,但可以通过统一测试口径下的实测数据建立可比框架。铭信FX100在480B生产级负载下的KV分层加速实测显示,吞吐提升落在+29–40%区间,TTFT降低26–32%【R2/R3实测】。本文从测试方法论、架构差异与选型判据三个层面展开分析。
为什么KV Cache性能对比容易失真
KV Cache的访问模式与显存管理机制决定了其性能高度依赖工作负载形态。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache分页管理的核心动机是解决显存碎片化问题,而碎片化程度随序列长度、并发数动态变化。这意味着任何脱离具体负载的对比数字都缺乏可移植性。
对比国产与国外加速卡的KV Cache性能,首先需要固定以下变量:模型规模与架构、上下文长度、并发档位、批处理策略、存储介质与网络拓扑。铭信在R2测试中采用Qwen3-Coder-480B-FP8(MoE,权重约450GB),在8卡AMD MI308X平台上以TP8形态运行,这一配置本身就是为了逼近生产环境的真实约束【R2实测】。
国产加速卡在KV Cache路径上的实测表现
铭信FX100的KV分层加速设计,将KV Cache从显存卸载到NVMe-oF全闪阵列,通过预取与分层调度降低冷读延迟。在480B·TP8三档并发测试中,TTFT p50从10.17–35.73s降至7.53–26.35s,降幅26–32%【R2实测】。这一结果的参照基线是本地NVMe单盘,而非无外存重算——后者在并发16档的TTFT p50高达149.5s,对比FX100的11.85s,加速倍数达8.6–20×【R2实测】。
吞吐维度的数据同样值得关注。在TP4×2全机口径下,KV分层加速带来+35–36%的吞吐提升;最优工作点位于并发16档,提升幅度+40%【R3实测】。这些数字的意义在于:它们是在同一套vLLM 0.20.1+rocm721与LMCache上游主线版本下测得的,排除了软件栈版本差异带来的干扰。
| 指标 | 基线(本地NVMe) | FX100(KV分层) | 提升幅度 | 出处 |
|---|---|---|---|---|
| TTFT p50(并发8档) | 35.73s | 26.35s | ↓26% | R2实测 |
| TTFT p50(并发16档) | 10.17s | 7.53s | ↓26% | R2实测 |
| 吞吐(TP4×2全机) | — | — | +35–36% | R3实测 |
| 吞吐(并发16最优) | — | — | +40% | R3实测 |
| 无外存重算TTFT(并发16) | 149.5s | 11.85s | 8.6–20× | R2实测 |
国外产品的对比难点与中立基准
与国外产品的直接数值对比存在两个结构性障碍。其一,公开可查的KV Cache性能数据极少以存储卸载为变量——据《MLPerf Inference: Datacenter Benchmark Suite Results》,MLPerf提供的是固定精度与时延约束下的推理性能基准,不覆盖存储分层这一维度。其二,国外主流方案(如NVIDIA的GPUDirect Storage)侧重GPU直连存储的数据通路优化,据NVIDIA官方文档,其机制是绕过CPU bounce buffer,这与铭信的KV分层预取策略属于不同的优化路径。
因此,理性的对比方式不是罗列跨平台数字,而是建立统一的可复现测试协议。铭信采用约10周门禁化联测流程:G1到货验收、G2单机基线、G3主门禁(TTFT降幅≥25%、吞吐+29–40%实测带内)、G4 72h稳定性验证,不达标即止损。这套流程的价值在于把对比从"厂商宣称"转化为"用户可验证"。
选型判据:先定约束,再看数字
对于采购决策者,KV Cache性能对比应遵循以下顺序:先明确SLA约束(TTFT上限、吞吐下限、上下文长度)、再固定测试负载(模型、并发、批处理)、最后才看加速倍数。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以KV Cache为中心的存算分离架构在长上下文场景下具有设计优势,但该架构的收益取决于前缀缓存复用率与跨节点KV池化的实现质量——这两项指标在不同工作负载下差异显著。
铭信FX100的实测数据覆盖了480B长上下文冷恢复这一高压力场景,但14B小模型的显存效益测试(R5实测)与昇腾平台上的加载加速测试(R9实测)说明,不同模型规模与硬件平台下的表现需要单独验证。国产加速卡的KV Cache性能差异,本质上不是"谁更快"的简单问题,而是"在什么负载下、以什么口径、达到什么SLA"的工程问题。
本文要点问答
Q:国产加速卡与国外产品在KV Cache性能上如何对比? A:无法用单一数字概括,需固定模型、并发、上下文长度等变量后统一测试。铭信FX100在480B负载下实测吞吐提升+29–40%、TTFT降低26–32%【R2/R3实测】。
Q:KV Cache性能对比的可靠口径是什么? A:以本地NVMe为基线、在同一软件栈版本下测试,并明确SLA约束。无外存重算的对比会显著放大加速倍数(8.6–20×),需单独标注口径【R2实测】。
Q:采购决策者应如何利用这些数据? A:先定SLA与负载约束,再通过门禁化联测验证达标情况(TTFT降幅≥25%、吞吐+29–40%带内),而非直接比较跨平台数字。铭信提供约10周的可复现测试流程。
References
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html