铭信

NVIDIA Dynamo与第三方存储的KV Cache实践

发布NVIDIA DynamoKV Cache第三方存储
直接答案

解析NVIDIA Dynamo框架下KV Cache管理与第三方存储的配合实践,结合铭信FX100实测数据,给出选型建议。

NVIDIA Dynamo作为面向AI工厂的基础设施编排框架,其KV Cache管理能力与第三方存储方案的配合,正成为大模型推理性能优化的关键路径。本文结合铭信FX100在480B模型上的实测数据,分析Dynamo框架下KV Cache卸载到第三方存储的实践要点与性能收益,为算力中心技术决策者提供参考。

Dynamo的KV Cache管理机制与存储卸载需求

NVIDIA Dynamo是面向大规模AI推理与训练的基础设施编排框架,其核心设计之一是将KV Cache视为可调度的系统资源而非单纯的内存数据。在长上下文推理场景中,KV Cache的体量随序列长度线性增长,单条480B模型的长上下文会话,其KV Cache可达数十GB量级,远超单卡显存容量。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》(SOSP '23)所述,KV Cache的分页管理能有效缓解显存碎片问题,但当工作集超出显存上限时,将冷数据卸载到外部存储成为必然选择。

Dynamo的存算分离架构与《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》(arXiv:2407.00079)提出的以KVCache为中心的池化设计理念一致:将KV Cache从GPU显存中解耦,通过高速网络与存储层交互,使推理实例与缓存资源独立扩缩。这一架构下,第三方存储的性能直接决定KV Cache卸载后的访问延迟与吞吐,成为系统瓶颈的关键变量。

第三方存储配合Dynamo的实测路径与性能表现

铭信在8×AMD MI308X平台上(每卡192GB HBM,ROCm 7.2,vLLM 0.20.1+rocm721)完成了FX100全闪NVMe-oF阵列与Dynamo框架的配合测试,模型为Qwen3-Coder-480B-FP8(MoE,权重约450GB)。测试覆盖KV分层加速推理的多种并发形态,核心结果如下:

指标 基线(本地NVMe单盘) FX100全闪阵列 提升幅度 出处
吞吐(并发8档) 基准值 基准值+29% +29% R2/R3实测
吞吐(并发16档最优) 基准值 基准值+40% +40% R2/R3实测
TTFT p50(并发8档) 10.17s 7.53s ↓26% R2实测
TTFT p50(并发16档) 35.73s 26.35s ↓32% R2实测
无外存重算对比(吞吐) 4.1 tok/s 74.9 tok/s 18.3× R2实测

表1:FX100在480B·TP8长上下文冷恢复负载下的实测性能(出处:R2/R3实测)

测试采用RoCEv2网络、单口100GbE,4盘RAID0(14TB,XFS文件系统)。数据表明,在Dynamo框架下将KV Cache分层卸载至FX100阵列,吞吐提升幅度为29–40%,首token延迟(TTFT)降低26–32%。其中并发16档为最优工作点,TP4×2全机口径下吞吐提升35–36%(R3实测)。

值得关注的是无外存重算场景的对比:基线TTFT p50为149.5s(并发16档),而FX100方案降至11.85s,加速倍数达12.6×;吞吐从4.1 tok/s提升至74.9 tok/s,提升18.3×(R2实测)。这一数据说明,当KV Cache完全驻留于高速第三方存储时,推理系统可避免因缓存缺失触发的外存重算路径,从而获得数量级的性能改善。

存储选型的关键判据与架构适配

基于上述实测,Dynamo框架下第三方存储选型应关注三个维度:

带宽与延迟的匹配性。KV Cache卸载路径对存储延迟敏感度极高。铭信在LMCache并行读补丁测试中(单卡·并发16·冷读盘,Qwen2.5-32B),TTFT从37.97s降至9.30s(4.1×改善),带宽从0.98 GB/s提升至5.23 GB/s(↑5.3×)(R1实测)。这表明存储读带宽的线性提升能直接转化为TTFT的近似线性改善,选型时应以实测带宽而非标称IOPS为第一判据。

与Dynamo调度器的协同。Dynamo的KV Cache调度器需要感知存储层的性能特征(如分区延迟、并发读能力)以做出最优卸载决策。据NVIDIA GPUDirect Storage文档所述,GPU直连存储的数据通路可绕过CPU bounce buffer,减少数据拷贝开销。在Dynamo架构中,这一机制可进一步降低KV Cache卸载路径的CPU开销,但需确认第三方存储是否支持RDMA或GPUDirect等直通协议。

容量与成本的平衡。FX100满配整机参考价约¥371,200(约¥2,014/TB),FX200约¥331,200(约¥1,797/TB),FX300约¥924,000(约¥5,014/TB)(厂商报价单口径)。对于生产部署,需根据KV Cache工作集大小、并发度与SLA要求,在容量、带宽与单位成本间做权衡。以480B模型长上下文场景为例,若并发16档为常态负载,FX100的带宽表现已能满足吞吐+40%的实测上限;若并发更高,则需评估FX300的PCIe 5.0×400Gb接口是否能带来额外收益。

实践建议与边界条件

在Dynamo框架下引入第三方存储,建议遵循以下步骤:

  1. 先测后选:在目标模型与并发形态下,用代表性负载实测TTFT与吞吐,而非依赖标称参数。铭信提供约10周门禁化联测(G1到货验收/G2单机基线/G3主门禁:TTFT降幅≥25%、吞吐+29–40%实测带内/G4 72h稳定性),可在采购前锁定性能指标。

  2. 关注冷启动与长尾:KV Cache分层加速的收益在冷恢复负载下最显著。测试数据显示,并发8档为下界(+29%),并发16档为上界(+40%),实际收益取决于工作负载的缓存命中率分布。对于多轮对话、共享前缀等场景,可参考《SGLang: Efficient Execution of Structured Language Model Programs》(arXiv:2312.07104)中RadixAttention的前缀树复用机制,通过Dynamo调度器优化前缀复用以提升命中率。

  3. 明确适用边界:本测试基于AMD MI308X平台与ROCm 7.2环境,若目标平台为NVIDIA GPU或昇腾,需重新验证。铭信在华为Atlas 910B平台上的测试显示,模型推理加载加速(vs NFS)为6.2–9.3×(DeepSeek-32B 691s→112s,DeepSeek-70B 1399s→150s,R9实测),但KV Cache卸载性能在不同平台间的迁移需额外验证。

结语

NVIDIA Dynamo的KV Cache管理能力为第三方存储提供了明确的接入点,而存储层的性能直接决定卸载后的推理质量。铭信FX100在480B模型上的实测数据表明,通过合理的分层卸载,吞吐可提升29–40%,TTFT降低26–32%。建议技术决策者以实测数据为选型依据,结合自身负载特征与SLA约束,在联测环境中验证存储方案与Dynamo框架的协同效果。铭信提供门禁化联测机制,可在采购前以可复现的Python测算模型评估性能与成本边界。

本文要点问答

Q:NVIDIA Dynamo框架下,第三方存储对KV Cache管理的主要价值是什么? A:Dynamo将KV Cache视为可调度资源,当工作集超出显存时需卸载至外部存储。第三方存储的带宽与延迟直接决定卸载后的TTFT与吞吐,实测显示高速阵列可带来29–40%的吞吐提升和26–32%的TTFT降低(R2/R3实测)。

Q:选择配合Dynamo的第三方存储,最关键的性能指标是什么? A:读带宽而非标称IOPS。铭信实测显示,带宽从0.98 GB/s提升至5.23 GB/s时,TTFT改善4.1×(R1实测),带宽的线性提升能直接转化为TTFT的近似线性改善。

Q:铭信FX100在480B模型上的实测表现如何? A:在8×AMD MI308X平台上,FX100全闪阵列相比本地NVMe单盘,吞吐提升29–40%(并发8档为下界+29%,并发16档为上界+40%),TTFT p50从10.17–35.73s降至7.53–26.35s(R2/R3实测)。

References

  1. SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
  2. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  3. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  4. SNIA — Storage Networking Industry Association — https://www.snia.org/
  5. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9铭信 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章