铭信

NVIDIA Dynamo 与第三方存储的 KV Cache 分层实践

发布NVIDIA DynamoKV Cache第三方存储
直接答案

解析 NVIDIA Dynamo 架构下 KV Cache 分层管理机制,结合铭信 FX100 实测数据,探讨第三方存储方案在推理加速中的配合实践与选型要点。

NVIDIA Dynamo 作为 AI 推理基础设施的编排层,其 KV Cache 管理机制正成为长上下文推理性能的关键变量。在 Dynamo 架构下,将 KV Cache 分层卸载至第三方存储方案,可在保持推理正确性的前提下显著优化首 token 延迟与吞吐表现——铭信 FX100 在 480B 模型长上下文冷恢复负载中的实测显示,该路径可带来 29–40% 的吞吐提升与 26–32% 的首 token 延迟降低【R2/R3 实测】。本文将从 Dynamo 的 KV Cache 管理机制出发,分析第三方存储方案的配合实践与选型要点。

Dynamo 架构中 KV Cache 管理的核心机制

NVIDIA Dynamo 是面向 AI 推理场景的分布式基础设施编排框架,其设计目标在于解耦推理过程中的计算、内存与存储资源。据 NVIDIA 官方技术博客介绍,Dynamo 与 NIXL、Grove 等组件分工协作,共同构成 GPU 集群的上下文管理通路【来源:NVIDIA Technical Blog】。在 Dynamo 的架构叙事中,KV Cache 不再局限于 GPU 显存内部,而是被抽象为可跨节点流动、可分层存储的资源对象。

这一设计的底层逻辑源于 KV Cache 的容量压力。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》所述,KV Cache 的显存占用随序列长度线性增长,且碎片化问题严重制约了批处理吞吐【来源:arXiv (SOSP '23)】。当上下文长度达到数十万 token 时,KV Cache 的容量需求将远超单卡显存上限,迫使系统在「重算」与「外存访问」之间做出权衡。

Dynamo 的应对思路是将 KV Cache 视为可分层放置的数据对象:热数据驻留 HBM,温数据存放于本地 NVMe,冷数据则卸载至远端存储池。这一分层逻辑与 NVIDIA CMX(Context Memory Storage Platform)的产品定位相呼应——据 NVIDIA 官方页面,CMX 被定义为 AI 原生的上下文存储层,依托 BlueField-4、DOCA Memos 与 Spectrum-X 构建,其厂商口径为相对传统存储最高约 5× 吞吐与 5× 能效【来源:NVIDIA CMX 官方页面】。

第三方存储接入 Dynamo 的实践路径与实测表现

在 Dynamo 的分层框架下,第三方存储方案通过 NVMe-oF(NVMe over Fabrics)等协议接入集群,承担 KV Cache 的冷数据与温数据承载。铭信 FX100 全闪 NVMe-oF 阵列在这一路径上的实测数据,可作为评估第三方存储配合效果的参考。

铭信 FX100 的测试环境为 8× AMD Instinct MI308X GPU(每卡 192 GB HBM),搭配 vLLM 0.20.1 与 LMCache 上游主线源码编译,被测对象为 Qwen3-Coder-480B-FP8 模型(MoE,权重约 450 GB)【R2 实测】。在 480B 生产部署形态长上下文冷恢复负载下,FX100 的吞吐提升呈现并发相关特征:并发 8 档为 +29%(下界),最优工作点并发 16 档为 +40%(上界),TP4×2 全机口径为 +35–36%【R2/R3 实测】。

首 token 延迟(TTFT)方面,480B·TP8 三档并发下,TTFT p50 从基线(本地 NVMe 单盘)的 10.17–35.73s 降至 FX100 的 7.53–26.35s,降幅 26–32%【R2 实测】。更值得关注的是与无外存重算基线的对比:重算基线 TTFT p50 高达 149.5s(并发 16),而 FX100 仅为 11.85s,对应加速倍数 8.6–20×;吞吐从 4.1 提升至 74.9 tok/s【R2 实测】。

指标 基线(本地 NVMe 单盘) 铭信 FX100 变化 出处
吞吐(并发 8) +29% R2/R3 实测
吞吐(并发 16,最优工作点) +40% R2/R3 实测
吞吐(TP4×2 全机口径) +35–36% R2/R3 实测
TTFT p50(三档并发) 10.17–35.73s 7.53–26.35s ↓26–32% R2 实测
TTFT p50(并发 16,vs 重算) 149.5s 11.85s 8.6–20× 加速 R2 实测
吞吐(并发 16,vs 重算) 4.1 tok/s 74.9 tok/s R2 实测

上述数据揭示了一个关键规律:第三方存储对推理性能的增益并非线性,而是与并发形态、前缀复用率、存储访问模式强相关。在低并发场景下,GPU 显存尚能容纳相当比例的 KV Cache,存储卸载的边际收益有限;随着并发升高,显存压力增大,存储通路的吞吐能力开始成为瓶颈,此时高性能 NVMe-oF 阵列的价值才充分显现。

存储侧优化:从协议适配到数据通路重构

第三方存储要真正融入 Dynamo 的 KV Cache 分层体系,不能仅靠硬件性能堆叠,还需要在协议与数据通路层面做针对性适配。铭信在 R1 测试中针对 LMCache 并行读场景的优化提供了一个具体案例:通过补丁优化并行读路径,单卡·并发 16·冷读盘(Qwen2.5-32B)场景下,TTFT 从 37.97s 降至 9.30s(4.1× 改善),带宽从 0.98 GB/s 提升至 5.23 GB/s(↑5.3×)【R1 实测】。

这一改善的机制在于:KV Cache 的读取模式与训练 Checkpoint 或传统文件读取存在本质差异——它涉及大量小粒度、随机、高并发的数据访问,且对延迟极度敏感。据 SNIA 对存储分层的行业定义,这类负载更接近计算型存储的范畴,而非传统的块存储或文件存储场景【来源:SNIA】。因此,通用存储协议栈中的锁竞争、中断处理、数据拷贝等环节,都可能成为 KV Cache 读取的隐性瓶颈。

GPU 直连存储(GDS)是另一条值得关注的数据通路优化路径。据 NVIDIA GDS 文档,该技术允许 GPU 绕过 CPU bounce buffer 直接访问存储设备,从而降低数据搬运延迟与 CPU 开销【来源:NVIDIA GDS Documentation】。在 Dynamo 的 KV Cache 分层架构中,GDS 与 NVMe-oF 的结合有望进一步压缩冷数据回灌 GPU 显存的路径长度。不过需要指出,GDS 的适用条件与收益幅度高度依赖具体硬件拓扑与驱动版本,需在实际部署中验证。

选型判据:从实测数据反推存储需求

对于计划在 Dynamo 架构中引入第三方存储的团队,铭信的实测数据可转化为若干选型判据。

第一,明确工作负载的并发形态与上下文长度。若推理服务以长上下文(≥32K token)为主且并发较高,KV Cache 的容量需求将远超显存上限,此时存储通路的带宽与延迟直接决定 TTFT 达标能力。铭信 R2 实测中 TTFT 降幅 26–32% 的达成,前提即是在 480B·TP8 长上下文负载下将 KV Cache 有效分层【R2 实测】。

第二,关注存储方案在 KV Cache 读取模式下的实际表现,而非仅看顺序读写的峰值带宽。KV Cache 读取以小粒度随机访问为主,需考察 4K–64K 粒度的随机读 IOPS 与延迟分布,以及高并发下的 QoS 稳定性。铭信 FX100 标称单接口 100Gb、16M IOPS(PCIe 3.0 版本),其实际收益已在上述实测中体现【厂商口径】。

第三,评估存储方案与推理框架的适配深度。LMCache、vLLM 等框架对存储后端的调用方式各有差异,存储厂商是否提供针对性的驱动优化或补丁支持,将显著影响最终效果。铭信 R1 测试中并行读补丁带来的 4.1× TTFT 改善即是例证【R1 实测】。

第四,建立可复现的验收机制。铭信采用约 10 周门禁化联测流程(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),以量化指标作为合作推进的门槛【合作模式】。这一方法论值得参考——存储方案的性能宣称必须置于统一的负载模型与基线之上进行验证,而非依赖厂商演示数据。

结语

NVIDIA Dynamo 的 KV Cache 分层管理为第三方存储方案打开了明确的接入空间,但其收益兑现依赖于对工作负载特征的准确识别与存储通路的深度适配。铭信 FX100 在 480B 长上下文负载中的实测数据表明,在正确配置下,第三方 NVMe-oF 存储可将吞吐提升 29–40%、TTFT 降低 26–32%【R2/R3 实测】。对于正在规划推理基础设施的团队,建议以门禁化联测方式验证存储方案在自身负载下的实际表现。铭信可提供基于 FX 产品线的联合测试环境与可复现测算模型,欢迎联系探讨。

本文要点问答

Q:NVIDIA Dynamo 架构下,第三方存储方案如何参与 KV Cache 管理? A:Dynamo 将 KV Cache 抽象为可分层放置的资源对象,冷数据可卸载至第三方 NVMe-oF 存储阵列。铭信 FX100 在 480B 长上下文负载中实测吞吐提升 29–40%,TTFT 降低 26–32%【R2/R3 实测】。

Q:KV Cache 卸载到第三方存储与 GPU 显存直存相比,性能差距有多大? A:与无外存重算基线相比,铭信 FX100 在并发 16 场景下 TTFT 从 149.5s 降至 11.85s(8.6–20× 加速),吞吐从 4.1 提升至 74.9 tok/s【R2 实测】。但需注意,该数据基于特定负载与配置,实际收益随并发形态变化。

Q:选择第三方存储配合 Dynamo 时,核心评估维度有哪些? A:建议关注四点:工作负载的并发形态与上下文长度、KV Cache 小粒度随机读模式下的实际 IOPS 与延迟、存储方案与推理框架(如 LMCache、vLLM)的适配深度、以及可复现的门禁化验收机制。

References

  1. NVIDIA CMX Context Memory Storage Platform — https://www.nvidia.com/en-us/data-center/ai-storage/cmx/
  2. Introducing NVIDIA BlueField-4-Powered Inference Context Memory Storage Platform for the Next Frontier of AI — https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/
  3. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  4. SNIA — Storage Networking Industry Association — https://www.snia.org/
  5. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章