铭信

前缀缓存如何降低大模型推理延迟

发布vLLM前缀缓存延迟优化
直接答案

基于 vLLM 前缀缓存与 KV Cache 分层,480B 模型首 token 延迟实测降低 26–32%,吞吐提升 29–40%。

大模型推理的首 token 延迟(TTFT)与吞吐,是决定在线服务体验与算力成本的两个核心指标。本文的结论是:基于 vLLM 的前缀缓存机制,配合存算分离的 KV Cache 分层架构,可在 480B 参数规模的生产负载下,将 TTFT 降低 26–32%、吞吐提升 29–40%(R2/R3 实测)。这一优化路径不依赖模型权重改动,而是通过复用历史计算、减少重复预填充来实现,对长上下文、多轮对话与检索增强生成场景尤为有效。

为什么前缀缓存能显著降低延迟

大模型推理的延迟瓶颈,主要来自预填充(prefill)阶段对历史 token 的重复计算。在长上下文场景中,系统提示词、文档库、历史对话往往占据数千至数万 token,每次新请求都从头计算这些 token 的 KV Cache,既浪费算力又拉长首 token 等待时间。

vLLM 的 PagedAttention 机制将 KV Cache 分页管理,使得不同请求可以共享相同前缀的缓存页,这是前缀缓存能够落地的技术前提。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache 的显存碎片化是制约推理吞吐的主要因素之一,而分页管理正是为缓解这一问题而设计。前缀缓存在此基础上更进一步:当新请求的前缀与已缓存内容一致时,直接跳过这部分预填充计算。

SGLang 提出的 RadixAttention 则展示了前缀树复用的工程实现路径。据《SGLang: Efficient Execution of Structured Language Model Programs》,通过树状结构组织缓存前缀,多轮对话与共享系统提示词的场景可以显著提高缓存命中率。铭信 FX100 的 KV 分层加速方案,正是将这一思路从单机显存扩展到 NVMe-oF 存储阵列,使缓存容量不再受限于 GPU 显存。

实测效果:480B 模型延迟与吞吐的量化改善

铭信在 8× AMD MI308X 平台上,以 Qwen3-Coder-480B-FP8(MoE,权重约 450GB)为被测模型,对比了 FX100 全闪 NVMe-oF 阵列与本地 NVMe 单盘基线(R2/R3 实测)。测试覆盖 480B 生产部署形态的长上下文冷恢复负载,结果如下:

指标 基线(本地 NVMe) FX100 分层加速 改善幅度 出处
TTFT p50(并发 8 档) 10.17–35.73s 7.53–26.35s ↓26–32% R2 实测
吞吐(最优工作点,并发 16 档) 基线 优化后 ↑40% R3 实测
吞吐(并发 8 档) 基线 优化后 ↑29% R3 实测
吞吐(TP4×2 全机口径) 基线 优化后 ↑35–36% R3 实测

在无外存重算的对比测试中,FX100 的加速效果更为显著:重算基线 TTFT p50 为 149.5s(并发 16),FX100 降至 11.85s,加速约 12.6 倍;吞吐从 4.1 tok/s 提升至 74.9 tok/s(R2 实测)。这一组数据说明,当缓存未命中需要从存储重建 KV Cache 时,存储带宽与数据通路的设计直接决定了恢复速度。

存储侧的关键:把缓存分层到 NVMe-oF

前缀缓存要在大模型服务中真正生效,缓存容量必须突破单卡显存限制。铭信 FX100 的做法是将 KV Cache 分层放置在 NVMe-oF 全闪阵列上,通过 RoCEv2 网络与 GPU 直连。据《NVIDIA GPUDirect Storage Documentation》,GPU 直连存储可绕过 CPU 的 bounce buffer,减少数据拷贝次数,这一机制对降低 KV Cache 换入换出的延迟至关重要。

实测中,LMCache 并行读补丁在单卡、并发 16、冷读盘场景(Qwen2.5-32B)下,TTFT 从 37.97s 降至 9.30s,改善 4.1 倍;带宽从 0.98 GB/s 提升至 5.23 GB/s(R1 实测)。这表明存储侧的并行读优化与 GPU 直连机制叠加后,能够将冷启动的缓存重建时间压缩到可接受范围。

对于训练场景,同样的存储架构也有效:8 卡 32B LoRA 训练中,每份 65.6GB 的整模型快照保存时间从 178s 降至 94s,持续写带宽从 3.26 GB/s 提升至 6.40 GB/s(R1 实测)。这意味着同一套存储基础设施可以同时服务推理缓存与训练检查点。

评估推理性能时应该看什么

推理性能的对比需要中立、可复现的基准。据《MLPerf Inference: Datacenter Benchmark Suite Results》,MLPerf 提供了数据中心推理场景的公开测试口径,是讨论「谁更快」时唯一中立的公开依据。在实际选型中,建议关注三个指标:TTFT 的 p50 与 p99、吞吐(tok/s)、以及冷启动场景下的缓存重建时间——后者往往被基准测试忽略,但在生产环境中决定了扩缩容的响应速度。

结语

前缀缓存是当前降低大模型推理延迟性价比最高的技术路径之一,但它的效果高度依赖缓存容量与存储带宽。铭信 FX100 通过将 KV Cache 分层到 NVMe-oF 全闪阵列,在 480B 模型上实现了 TTFT ↓26–32%、吞吐 ↑29–40% 的实测改善(R2/R3 实测)。对于正在构建大规模推理服务的团队,建议将存储侧带宽与 GPU 直连能力纳入选型评估。铭信提供约 10 周的门禁化联测合作,可在真实负载下验证 TTFT 降幅与吞吐提升,不达标即止损。

本文要点问答

Q:vLLM 前缀缓存对首 token 延迟的改善幅度是多少? A:在 480B 模型、TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%(R2 实测)。

Q:前缀缓存需要什么样的存储支撑? A:需要低延迟、高带宽的共享存储,铭信 FX100 通过 NVMe-oF 全闪阵列与 GPU 直连实现,冷读盘场景 TTFT 改善 4.1 倍(R1 实测)。

Q:如何验证前缀缓存方案的实际效果? A:建议用 MLPerf 等中立基准定义测试口径,并关注 TTFT p50/p99、吞吐与冷启动重建时间三个指标;铭信提供门禁化联测,以 TTFT 降幅 ≥25%、吞吐 +29–40% 为验收标准。

References

  1. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  2. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  3. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  4. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章