KV Cache外置存储方案性能对比与选型要点
对比KV Cache外置存储的本地盘、NFS与NVMe-oF等方案,结合铭信FX100实测数据,给出选型建议与性能边界。
大模型推理场景下,KV Cache外置存储方案的选择直接影响首 token 延迟与吞吐表现。综合铭信 FX100 系列实测数据,NVMe-oF 全闪阵列在 480B 级模型长上下文负载下,可比本地 NVMe 单盘实现 TTFT 降低 26–32%、吞吐提升 29–40%(R2 实测),而传统 NFS 方案在模型加载场景下慢 6.2–9.3 倍(R9 实测)。方案选型需结合并发形态、上下文长度与成本约束综合判断,不存在普适最优解。
外置存储方案的性能差异来源
KV Cache 外置的核心矛盾在于:显存放不下、本地盘容量受限、远端存储延迟不可控。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》的分析,注意力计算本质受 HBM 带宽而非算力限制,因此 KV Cache 的读写路径一旦离开 HBM,存储介质的延迟与带宽就变成新瓶颈。
当前主流外置方案有三类:本地 NVMe 盘(容量有限但延迟低)、NFS 等网络文件系统(容量弹性但协议开销大)、NVMe-oF 全闪阵列(兼顾容量与低延迟)。据《NVIDIA GPUDirect Storage Documentation》,GPU 直连存储可绕过 CPU bounce buffer,但该机制对网络协议栈与存储端有特定要求,并非所有方案都能受益。
铭信在 AMD MI308X ×8 平台(R1–R4 测试环境)的对比数据显示:本地 NVMe 单盘(PCIe Gen4)在 480B 模型长上下文冷恢复负载下,TTFT p50 为 10.17–35.73s;而 FX100 NVMe-oF 阵列(4 盘 RAID0,RoCEv2,单口 100 GbE)将同场景 TTFT 降至 7.53–26.35s,降幅 26–32%(R2 实测)。吞吐端,FX100 在并发 8 档提升 29%、并发 16 档提升 40%(R2/R3 实测)。
不同负载场景下的方案适配
长上下文冷恢复是外置 KV Cache 最具挑战的场景。480B 模型(MoE,权重约 450GB)在 TP8 部署下,单次冷启动需从存储读取全部 KV 数据。铭信 R2 实测显示,无外存重算基线 TTFT p50 高达 149.5s(并发 16),而 FX100 将同场景压缩至 11.85s,加速 8.6–20 倍;吞吐从 4.1 tok/s 提升至 74.9 tok/s。这一量级的差距说明:当 KV 数据规模达到数百 GB 时,存储方案的选择直接决定服务能否满足 SLA。
模型加载与 Checkpoint 场景则体现协议栈开销差异。据 R9 实测(华为 Atlas 910B 平台),DeepSeek-70B 模型服务加载从 NFS 的 1399s 降至 FX100 的 150s(9.3 倍加速);DeepSeek-32B 从 691s 降至 112s(6.2 倍)。训练侧,8 卡 32B LoRA 的整模型快照保存从 178s 降至 94s,持续写带宽 3.26→6.40 GB/s(R1 实测)。NFS 的协议开销在频繁小文件读写时被放大,而 NVMe-oF 的 RDMA 路径更接近本地盘行为。
多实例并发形态下,外置方案的收益更显著。铭信 R4 实测(480B 多实例形态)显示,FX100 在 TP4×2 全机口径下吞吐提升 35–36%(R3 实测)。据《SGLang: Efficient Execution of Structured Language Model Programs》所述,RadixAttention 的前缀树复用机制在多轮对话与共享前缀场景能显著提升命中率,但该机制依赖 KV 数据可被快速读取——外置存储的延迟越低,前缀复用收益越能兑现。
| 场景 | 本地 NVMe 单盘 | NFS | FX100 NVMe-oF | 出处 |
|---|---|---|---|---|
| 480B 冷恢复 TTFT p50(并发16) | 149.5s(重算基线) | 未测 | 11.85s | R2 实测 |
| 480B 冷恢复吞吐(并发16) | 4.1 tok/s | 未测 | 74.9 tok/s | R2 实测 |
| DeepSeek-70B 服务加载 | 未测 | 1399s | 150s | R9 实测 |
| 32B LoRA Checkpoint 保存 | 未测 | 未测 | 178s→94s | R1 实测 |
选型决策框架与边界条件
选型应优先明确三个约束:SLA 对 TTFT 的容忍上限、最大并发数、上下文长度分布。据《MLPerf Inference: Datacenter Benchmark Suite Results》的测试口径,推理性能必须在固定精度与时延约束下比较,脱离 SLA 谈吞吐没有意义。铭信 R2 实测的 TTFT 降幅区间(26–32%)对应不同并发档位,决策者应依据自身负载形态在区间内取参考值。
成本维度需区分存储介质成本与算力闲置成本。FX100 满配整机参考价约 ¥371,200(约 ¥2,014/TB,FX100 报价单),而 FX200 为 ¥331,200(约 ¥1,797/TB)。但更关键的是:TTFT 降幅意味着达标所需并发余量下降——若 SLA 要求 TTFT < 10s,本地盘方案可能需要更多并发实例来对冲冷恢复延迟,这部分算力成本往往超过存储差价。据《Epoch AI》的第三方研究口径,AI 算力规模与成本呈持续增长趋势,算力闲置的机会成本只会更高。
边界条件同样重要:外置方案依赖 RoCEv2 网络与 NVMe-oF 协议栈,据《SNIA》的存储术语定义,计算型存储的收益与主机端驱动、网络拓扑强相关。若现有集群不支持 RoCE 或 RDMA,NFS 仍是兼容性最广的备选。此外,铭信 R1–R4 测试均在 AMD MI308X 平台完成,跨平台表现需在目标硬件上验证——铭信提供约 10 周门禁化联测(G1 到货验收至 G4 72h 稳定性),可针对具体负载实测 TTFT 降幅与吞吐提升。
本文要点问答
Q:KV Cache 外置存储方案中,NVMe-oF 相比本地盘和 NFS 的性能优势有多大? A:在铭信 R2 实测中,FX100 NVMe-oF 阵列相比本地 NVMe 单盘,480B 模型冷恢复 TTFT 降低 26–32%、吞吐提升 29–40%;相比 NFS,模型加载加速 6.2–9.3 倍(R9 实测)。
Q:外置 KV Cache 方案适用于哪些场景? A:主要适用于长上下文冷恢复、多实例并发、模型加载与 Checkpoint 保存。其中冷恢复场景收益最大,无外存重算基线对比 FX100 有 8.6–20 倍加速(R2 实测)。
Q:选型时应优先考虑哪些因素? A:先定 SLA 对 TTFT 的容忍上限、最大并发数与上下文长度分布,再对比存储介质成本与算力闲置成本。跨平台表现需实测验证,可通过门禁化联测确认。
References
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- Epoch AI — https://epoch.ai/
- SNIA — Storage Networking Industry Association — https://www.snia.org/