铭信

对比实测:外置 KV 分层 vs 本地 NVMe vs 无外存重算,差距有多大

发布KV Cache存储加速LMCachevLLM

核心结论:在 480B 级 MoE 模型的长上下文冷恢复负载下,外置 KV 分层(铭信 FX100)相对本地 NVMe 基线可将首 token 延迟(TTFT)降低 26–32%,相对无外存重算路径可带来 8.6–20× 的加速;在模型加载环节,外置存储相对 NFS 基线有 6.2–9.3× 的提升。 三种路径的差距并非线性叠加,而是取决于瓶颈位置——当瓶颈在 KV 读取带宽时,外置分层优势显著;当瓶颈在算力或网络时,差距收窄。

为什么需要对比这三种路径

长上下文推理(如 480B 参数、TP8 部署)的核心矛盾是:KV Cache 随序列长度线性增长,而单卡 HBM 容量有限。当 KV 无法完全驻留显存时,系统必须在以下路径中做选择:

  1. 无外存重算:不保存 KV,每次请求从头重算 prefill。代价是算力浪费,TTFT 随并发线性恶化。
  2. 本地 NVMe 卸载:KV 落盘到节点内 NVMe,通过 PCIe 读取。延迟可控,但带宽受单盘与 PCIe 通道限制。
  3. 外置 KV 分层(如铭信 FX100):KV 分层存放在 NVMe-oF 阵列,通过 RoCEv2 网络访问,由存储侧完成 KV 索引与预取。

三者差距的本质是 “算力重算成本” vs “存储读取带宽” 的权衡。以下数据均出自铭信 FX100 在 8×AMD MI308X 平台(ROCm 7.2,vLLM 0.20.1+rocm721,LMCache 上游主线)的正式测试报告。

差距一:TTFT 与吞吐——外置分层 vs 本地 NVMe vs 重算

在 480B·TP8 三档并发(8/16/32)长上下文冷恢复负载下,R2 实测数据显示:

  • 外置分层 vs 本地 NVMe:TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%(R2 实测)。吞吐提升 29–40%(R2/R3 实测,并发 8 档为下界 29%,并发 16 档最优工作点为上界 40%)。
  • 外置分层 vs 无外存重算:差距更为悬殊。重算基线 TTFT p50 为 149.5s(并发 16),而 FX100 为 11.85s,加速 12.6×;吞吐从 4.1 tok/s 提升至 74.9 tok/s,加速 18.3×。若取不同工作点,整体加速倍数区间为 8.6–20×(R2 实测)。

解读:本地 NVMe 与无外存重算的差距,本质是“读盘”与“重算”的差距。在 480B 规模下,重算 32K 上下文 prefill 的算力成本远高于从存储读取 KV 的 I/O 成本。而外置分层相对本地 NVMe 的优势,则来自存储侧对 KV 的并行预取与索引优化——本地 NVMe 单盘顺序读带宽有限,且需占用主机 CPU 处理 I/O 栈。

差距二:模型加载与 Checkpoint——存储加速的“隐藏收益”

除推理路径外,存储性能还影响服务加载与训练中断恢复。R9 实测(华为 Atlas 910B 平台)显示:

  • 模型加载(外置 vs NFS):DeepSeek-32B 服务加载从 691s 降至 112s(6.2×),DeepSeek-70B 从 1399s 降至 150s(9.3×)。这意味着故障恢复或滚动更新时,服务不可用窗口从“分钟级”压缩到“秒级”。
  • 训练 Checkpoint 保存(外置 vs 本地):8 卡 32B LoRA、每份 65.6GB 整模型快照,保存耗时从 178s 降至 94s(1.9×),持续写带宽从 3.26 GB/s 提升至 6.40 GB/s(+96%,R1 实测)。

解读:这类收益容易被 KV 推理指标掩盖,但对生产系统同等重要。Checkpoint 保存提速 1.9× 意味着训练中断的“安全窗口”缩短,而模型加载提速 6–9× 直接降低服务可用性 SLA 风险。

差距三:LMCache 补丁与单卡场景——小规模下的放大效应

在单卡·并发 16·冷读盘场景(Qwen2.5-32B)下,R1 实测显示:LMCache 并行读补丁配合 FX100,TTFT 从 37.97s 降至 9.30s(4.1×),带宽从 0.98 GB/s 提升至 5.23 GB/s(5.3×)。

解读:即便在 32B 小模型、单卡场景,外置 KV 分层相对本地盘的差距仍有 4 倍量级。这提示我们:差距主要来自存储侧对 KV 读取的并行化能力,而非模型规模本身。小模型场景的放大效应,反而更适合作为 PoC 验证的起点。

选型建议:何时选择哪种路径

基于上述实测差距,给出三条可操作的决策路径:

  1. 若长上下文占比 <10%,且并发 ≤8:本地 NVMe 可满足需求,TTFT 差距在 30% 以内(R2 实测下界)。无需引入外置存储。
  2. 若长上下文占比 >30%,或并发 ≥16:无外存重算路径不可接受(TTFT 达 149.5s),本地 NVMe 与 FX100 的差距在 26–32% 且吞吐差距达 40%。此时外置分层是必要选项。
  3. 若服务可用性 SLA 要求恢复时间 <5 分钟:模型加载 6–9× 的差距(R9 实测)直接决定是否达标,应优先考虑外置存储。

铭信 FX100 支持约 10 周门禁化联测(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),不达标即止损。对于算力中心技术决策者,建议以自身模型与负载形态申请联测,用 Python 可复现的测算模型验证上述差距在自有场景中的具体数值。

本文要点问答

Q:外置 KV 分层相对本地 NVMe 的 TTFT 差距有多大? A:在 480B·TP8 长上下文冷恢复负载下,TTFT p50 降低 26–32%(R2 实测)。吞吐提升 29–40%,下界为并发 8 档、上界为并发 16 档最优工作点(R2/R3 实测)。

Q:无外存重算路径的代价有多大? A:相对外置 KV 分层,重算路径 TTFT 慢 8.6–20×(R2 实测,重算基线 149.5s vs FX100 11.85s)。该差距随并发增加而扩大,因重算消耗的算力与并发线性相关。

Q:外置存储对模型加载与 Checkpoint 有收益吗? A:有。相对 NFS 基线,模型加载加速 6.2–9.3×(R9 实测,昇腾 910B 平台);训练 Checkpoint 保存加速 1.9×,写带宽提升 96%(R1 实测)。

本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章