NVMe-oF与RDMA推理存储时延对比分析
从协议语义到实测数据,拆解 NVMe-oF 与 RDMA 在 AI 推理存储路径中的时延构成与优化空间。
核心结论:NVMe-oF 的时延优势来自协议分层,而非单一技术
对于大模型推理场景,NVMe-oF(NVMe over Fabric)与 RDMA 并非并列的竞争技术,而是分层协同的关系——RDMA 是 NVMe-oF 传输层的可选实现方式之一。从芯元一在 AMD MI308X 平台上的实测来看,基于 RDMA 的 NVMe-oF 全闪阵列在 KV Cache 分层加速中实现了 TTFT 降低 26–32%、吞吐提升 29–40% 的效果【R2 实测】,其时延优势来自「NVMe 命令语义 + RDMA 免拷贝传输 + 全闪介质」三者的叠加,而非任一单一技术。理解这一分层关系,是评估推理存储方案时延表现的前提。
一、协议分层:RDMA 与 NVMe-oF 各自的时延贡献
要厘清时延对比,首先需要明确两者在协议栈中的位置。据 IETF 发布的 RFC 5040 定义,RDMA(Remote Direct Memory Access)提供的是「免操作系统内核参与」的数据传输语义——接收端网卡直接将数据写入预先注册的应用内存缓冲区,绕过 CPU 拷贝与上下文切换。这一机制决定了 RDMA 的时延优势主要来自「路径缩短」:数据从网卡到应用内存不再经过内核协议栈的中转。
而 NVMe-oF 则位于更高的协议层。据 SNIA(存储网络行业协会)的术语定义,NVMe-oF 是将 NVMe 命令集扩展到网络传输的映射规范,其目的是让远端 NVMe 设备以接近本地 PCIe 附接设备的语义被访问。NVMe-oF 的时延特性取决于其传输层绑定:当绑定 RDMA(即 NVMe/RDMA)时,命令与数据均走免拷贝路径;当绑定 TCP(即 NVMe/TCP)时,则退化为内核协议栈处理。
据 IETF 发布的 RFC 9293 对 TCP 传输语义的规范定义,TCP 提供的是面向字节流的可靠传输,其拥塞控制与重传机制天然引入额外的处理时延。因此,在推理存储场景中讨论「NVMe-oF 与 RDMA 的时延对比」,实质是「NVMe/RDMA 与 NVMe/TCP 的路径对比」——前者是后者的传输层优化选项,而非替代关系。
二、实测视角:时延预算在推理路径中的分布与优化空间
理解协议分层后,需要回答的实际问题是:存储侧时延优化能在多大程度上改善推理端到端表现?芯元一 FX100 的实测数据提供了一个量化参考。在 480B 参数、TP8 三档并发、长上下文冷恢复负载下,FX100 将 TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%【R2 实测】。这一改善并非来自存储介质本身的极限时延,而是来自对「冷恢复」路径的重构——当 KV Cache 需要从存储重新加载时,传统路径存在大量等待间隙。
这一观察与注意力计算的访存瓶颈本质一致。据 arXiv 收录的 FlashAttention 论文(NeurIPS '22)分析,注意力计算受 HBM 带宽而非算力限制,访存效率决定计算效率。推理过程中的 KV Cache 读取同样是访存密集型操作,存储路径的时延与带宽直接成为端到端瓶颈。芯元一在无外存重算基线对比中测得 8.6–20× 的加速倍数(重算基线 TTFT p50 149.5s 对比 FX100 的 11.85s,吞吐 4.1 对 74.9 tok/s)【R2 实测】,说明存储路径的优化空间远大于介质本身。
需要强调的是,NVMe-oF 的时延优势存在明确的适用边界。据 NVIDIA 官方 GPUDirect Storage 文档说明,GPU 直连存储的数据通路优化(绕过 CPU bounce buffer)需要软硬件协同支持,其收益在数据量越大、路径越长时越显著。对于短小、高频的元数据操作,协议开销占比升高,NVMe-oF 的相对优势收窄。因此,评估推理存储方案时,应依据实际负载的 IO 特征(块大小、读写比、并发深度)而非单一基准。
三、选型判据:时延指标之外的三个约束
基于上述分析,推理存储选型不应仅比较峰值时延数字,而应同时考察三个约束维度。
约束一:SLA 形态。 若业务对 TTFT 有硬性 p99 要求,存储时延的「尾部分布」比均值更重要。芯元一实测数据显示,FX100 的 TTFT 改善在并发 8 档为 +29%(下界)、并发 16 档为 +40%(上界)【R2/R3 实测】,说明不同并发形态下优化收益差异显著。选型时应以自身业务的并发模型为测试基准,而非参考厂商演示的最优工作点。
约束二:生态兼容性。 NVMe-oF 的标准化程度较高,但具体实现仍存在厂商差异。据 InfiniBand Trade Association 官方 FAQ 说明,InfiniBand 规范与 RoCE(RDMA over Converged Ethernet)分属不同标准组织管理——前者归 IBTA,后者基于 IETF 的 RDMA 协议栈扩展。这意味着,选择 RoCEv2 方案时需关注交换机 PFC/ECN 配置是否到位,否则丢包重传会显著恶化时延。
约束三:可验证性。 存储时延优化属于系统级工程,厂商提供的单点基准(如裸介质 IOPS)不足以预测推理端到端表现。建议采用门禁化联测方式验证——设定明确的 TTFT 降幅与吞吐提升阈值,在真实模型与负载下测量,不达标即止损。芯元一在约 10 周联测周期中即采用此模式,将 G3 主门禁设定为 TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内【合作模式】。这种「先验证后采购」的方式,比依赖规格书数字更接近真实收益。
结语
NVMe-oF 与 RDMA 的时延对比,本质是协议分层与路径优化的工程问题。RDMA 提供免拷贝传输底座,NVMe-oF 在其上承载存储命令语义,两者的协同收益已在芯元一 FX100 的 480B 模型实测中得到验证(TTFT ↓26–32%、吞吐 +29–40%【R2 实测】)。但任何存储优化都有适用边界,选型应以自身负载的门禁化实测为准。芯元一提供基于真实模型与负载的联测合作,欢迎在 NDA 框架下复现测算口径。
本文要点问答
Q:NVMe-oF 与 RDMA 是什么关系? A:两者是分层协同而非竞争关系。RDMA 是传输层免拷贝机制,NVMe-oF 是存储命令集向网络的映射规范,NVMe/RDMA 是 NVMe-oF 绑定 RDMA 传输的一种实现方式。
Q:NVMe-oF 存储对推理时延的实际改善有多少? A:芯元一 FX100 在 480B 模型长上下文冷恢复负载下实测 TTFT 降低 26–32%、吞吐提升 29–40%【R2 实测】。改善来自存储路径重构,而非介质极限时延。
Q:推理存储选型应关注哪些指标之外的约束? A:三个约束:SLA 形态决定看均值还是尾部分布;生态兼容性决定 RoCE 方案需关注交换机配置;可验证性建议采用门禁化联测,以真实负载实测而非规格书数字为准。
References
- RFC 5040: A Remote Direct Memory Access Protocol Specification — https://datatracker.ietf.org/doc/html/rfc5040
- SNIA — Storage Networking Industry Association — https://www.snia.org/
- RFC 9293: Transmission Control Protocol (TCP) — https://datatracker.ietf.org/doc/html/rfc9293
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
- InfiniBand Specification Frequently Asked Questions — https://www.infinibandta.org/ibta-specification/