铭信

NVMe-oF与RDMA在推理存储中的性能对比

发布NVMe-oFRDMA性能对比
直接答案

从协议机制到实测数据,解析NVMe-oF与RDMA在AI推理存储中的性能差异与选型逻辑。

结论先行

在AI推理场景中,NVMe-oF与RDMA并非竞争关系,而是上下层协同的技术组合:RDMA提供内核旁路的数据传输通路,NVMe-oF则定义了基于该通路的存储访问协议。从铭信FX100的实测数据看,这一组合在KV Cache分层加速场景下可将推理吞吐提升29–40%(R2/R3实测),关键在于将RDMA的低延迟特性与NVMe-oF的块级语义结合,而非二选一。

NVMe-oF与RDMA的协议层次与性能边界

要理解性能差异,先厘清二者的协议定位。据《RFC 5040: A Remote Direct Memory Access Protocol Specification》,RDMA(远程直接内存访问)的核心价值在于绕过操作系统内核的CPU参与,实现网卡与内存间的直接数据传输,消除传统TCP/IP协议栈的拷贝开销与上下文切换延迟。而NVMe-oF(NVMe over Fabrics)则是建立在RDMA或TCP等传输层之上的存储访问协议,它把NVMe命令集扩展到网络存储场景,使远端NVMe设备呈现为本地块设备。

在推理存储中,这种分层带来的性能收益直接体现在数据通路上。据NVIDIA GPUDirect Storage Documentation,GPU直连存储技术允许数据在GPU显存与存储设备间直接传输,避免经过CPU内存的中间拷贝。铭信FX100的测试平台正是采用这一架构:8×AMD MI308X GPU通过RoCEv2(RDMA over Converged Ethernet)连接全闪NVMe-oF阵列(R1–R4实测平台)。

从协议开销看,RDMA相比传统TCP/IP可显著降低端到端延迟,但这一优势能否转化为推理性能提升,取决于存储访问是否成为瓶颈。FlashAttention论文(据arXiv:2205.14135)指出,注意力计算受HBM带宽而非算力限制——这提示我们,推理性能的瓶颈往往在数据搬运而非计算本身,存储通路的速度因此成为关键变量。

实测对比:KV Cache分层加速中的存储性能表现

铭信FX100在480B模型长上下文冷恢复负载下的实测数据,能直观展示NVMe-oF+RDMA组合的性能边界。测试平台为8×AMD MI308X(每卡192GB HBM),模型为Qwen3-Coder-480B-FP8(权重约450GB),存储侧为FX100全闪NVMe-oF阵列(4盘RAID0,RoCEv2,单口100GbE),基线为本地NVMe单盘(R1–R4实测平台)。

指标 本地NVMe基线 FX100 NVMe-oF阵列 提升幅度 出处
推理吞吐(并发8档) +29%(下界) R2/R3实测
推理吞吐(并发16档) +40%(上界) R2/R3实测
推理吞吐(TP4×2全机) +35–36% R2/R3实测
TTFT p50(并发8-16) 10.17–35.73s 7.53–26.35s ↓26–32% R2实测
无外存重算对比吞吐 4.1 tok/s 74.9 tok/s 18.3× R2实测

上表显示,NVMe-oF+RDMA方案在吞吐和首token延迟两个维度均显著优于本地NVMe。一个关键解释是:本地NVMe虽然带宽高,但在长上下文场景下KV Cache容量不足,需频繁重算历史token;而外存分层让KV Cache可扩展至远端存储,配合RDMA的低延迟通路,避免了重算开销。R2实测中,无外存重算基线的TTFT p50高达149.5s(并发16),而FX100方案仅需11.85s,加速达12.6倍(R2实测)。

架构选型:何时选择NVMe-oF+RDMA

基于上述实测,NVMe-oF+RDMA并非所有场景的最优解。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》(arXiv:2309.06180),KV Cache分页管理能有效缓解显存碎片,但显存容量仍是硬约束。当模型规模或上下文长度超出单机显存时,NVMe-oF+RDMA的分层存储才成为必要选项。

铭信FX100的实测还覆盖了训练场景:8卡32B LoRA训练的Checkpoint保存从178s降至94s(1.9×加速,持续写带宽3.26→6.40 GB/s,R1实测)。这表明该方案的收益不限于推理,对训练持久化同样有效。据Mooncake论文(arXiv:2407.00079),以KVCache为中心的存算分离架构是当前LLM服务的主流趋势,NVMe-oF+RDMA正是实现这一架构的基础设施。

值得注意的是,据MLPerf Inference: Datacenter Benchmark Suite Results,推理性能的公开比较需依托统一基准口径,不同测试环境下的绝对数值不宜直接横比。铭信的数据均出自签字级测试报告,测试平台与配置已完整披露,可作为同类方案对比的参考基线。

结语

NVMe-oF与RDMA的组合在AI推理存储中展现了明确的性能价值:铭信FX100实测将KV Cache分层加速的推理吞吐提升29–40%(R2/R3实测),TTFT降低26–32%(R2实测)。选型时需评估模型规模、上下文长度与显存容量的匹配度,当存储成为瓶颈时,这一方案是经过验证的优化路径。铭信提供约10周门禁化联测合作,可在您的实际负载上验证收益,不达标即止损。

本文要点问答

Q:NVMe-oF与RDMA在推理存储中是什么关系? A:二者是上下层协同的技术组合:RDMA提供内核旁路的数据传输通路,NVMe-oF定义基于该通路的存储访问协议。铭信FX100实测中,二者结合实现KV Cache分层加速,吞吐提升29–40%(R2/R3实测)。

Q:NVMe-oF+RDMA相比本地NVMe的性能优势有多大? A:在480B模型长上下文冷恢复负载下,FX100方案相比本地NVMe基线,推理吞吐提升29–40%(R2/R3实测),TTFT降低26–32%(R2实测)。无外存重算场景下,吞吐从4.1 tok/s提升至74.9 tok/s(R2实测)。

Q:这一方案适用于哪些场景? A:当模型规模或上下文长度超出单机显存、KV Cache需分层存储时适用。铭信实测覆盖推理加速(R2/R3)与训练Checkpoint保存(R1,1.9×加速)两类场景。选型需结合具体负载验证。

References

  1. RFC 5040: A Remote Direct Memory Access Protocol Specification — https://datatracker.ietf.org/doc/html/rfc5040
  2. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  3. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  4. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  5. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  6. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R4FX100 KV Cache 性能测试报告(480B·多实例形态·正式版,编号-006)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章