铭信

NVMe-oF + RoCEv2 在推理存储场景的工程实践要点:以 FX100 实测为例

KV Cache存储加速LMCachevLLM

NVMe-oF 结合 RoCEv2 是当前大模型推理存储场景中实现低延迟、高带宽加速的关键架构,尤其在 KV Cache 分层加速和冷恢复场景下,其性能优势已通过实测验证。本文基于铭信 FX100 在 8×AMD MI308X 平台上的 KV Cache 性能测试结果(出处:R2/R3 实测),梳理 NVMe-oF + RoCEv2 的工程实践要点,包括网络协议选择、并行读优化、冷恢复加速比及与传统 NFS 的对比,为算力中心技术决策者提供可复现的参考。

为什么 NVMe-oF + RoCEv2 比传统 NFS 更适合推理存储?

推理存储的核心挑战在于 KV Cache 的快速读写与模型权重的低延迟加载。传统 NFS(网络文件系统)在协议栈上存在较高的软件开销,例如文件锁、元数据操作和 TCP 协议栈的延迟累积,这在长上下文冷恢复场景中尤为明显。实测数据显示,在华为 Atlas 910B 平台上,使用 NFS 加载 DeepSeek-70B 模型权重耗时 1399 秒,而铭信 FX100(基于 NVMe-oF + RoCEv2)仅需 150 秒,加速比达到 9.3 倍(出处:R9 实测)。

NVMe-oF 通过将 NVMe 命令直接封装在 RDMA(RoCEv2)之上,避免了传统文件系统协议的开销。RoCEv2 提供了低至 1-2 微秒的单跳延迟和 100 GbE 的带宽,使得 KV Cache 的读写延迟接近本地 NVMe SSD 水平。在 FX100 的测试中,本地 NVMe 单盘基线(PCIe Gen4, 2 TB)与 FX100 阵列(4 盘 RAID0, RoCEv2, 单口 100 GbE)在 KV Cache 吞吐上的差异已缩小到可接受范围,而 FX100 在冷恢复场景下的吞吐提升(从 4.1 tok/s 到 74.9 tok/s,加速 18.3 倍)更凸显了网络化存储的潜力(出处:R2 实测)。

如何优化 KV Cache 的并行读性能?LMCache 补丁是关键

在推理场景中,KV Cache 的读取往往是多并发线程同时进行的。传统 NVMe-oF 实现中,单队列的串行化读取会成为瓶颈。铭信 FX100 的测试中,通过应用 LMCache 并行读补丁,在单卡并发 16 的冷读盘负载下,TTFT 从 37.97 秒降至 9.30 秒,改善 4.1 倍;带宽从 0.98 GB/s 提升至 5.23 GB/s,提升 5.3 倍(出处:R1 实测)。这一优化依赖于两个工程要点:

  1. 多队列并行性:NVMe-oF 原生支持多队列(最多 64K 个 I/O 队列),但需要驱动和应用程序(如 vLLM 和 LMCache)正确配置。LMCache 补丁通过将 KV Cache 分片到不同队列,实现了读写操作的并行化,避免了单队列的排队延迟。
  2. RoCEv2 的流控:在 100 GbE 网络中,PFC(优先级流控)和 ECN(显式拥塞通知)的正确配置至关重要。未优化的流控会导致丢包和重传,抵消并行读的收益。FX100 测试环境采用 RoCEv2 默认配置,未出现显著丢包,表明在可控网络环境中,硬件卸载的 RDMA 已足够稳定。

对于技术决策者,建议在部署前验证 LMCache 的并行读补丁是否已集成到 vLLM 版本中(测试基于 vLLM 0.20.1+rocm721),并确保网络交换机支持 RoCEv2 的 ECN 标记。

冷恢复场景:无外存重算的加速倍数如何达到 8.6-20 倍?

冷恢复是指模型在长时间未访问后,KV Cache 需要从存储层重新加载的场景。传统做法是采用无外存重算(即完全从模型权重重新计算 KV Cache),但这在长上下文(如 480B 参数模型)下耗时极高。FX100 的测试显示,在 480B 模型、TP8 并发 16 的负载下,无外存重算的 TTFT p50 为 149.5 秒,而使用 FX100 的 KV Cache 存储加速后,TTFT 降至 11.85 秒,加速 12.6 倍;吞吐从 4.1 tok/s 提升至 74.9 tok/s,加速 18.3 倍(出处:R2 实测)。加速倍数范围 8.6-20 倍取决于并发度和上下文长度。

这一加速的工程基础在于 NVMe-oF + RoCEv2 的低延迟特性。在冷恢复中,KV Cache 的读取是顺序大块 I/O(每个 token 的 KV 向量约 2-4 KB,但批量读取可达 MB 级)。NVMe-oF 的 RDMA 读操作可以绕过 CPU 中断,直接由网卡 DMA 到 GPU 显存,减少了数据拷贝次数。相比之下,NFS 的 TCP 协议栈和文件锁机制会导致每次 I/O 的延迟增加 10-100 微秒,在大量并发下累积为秒级差异。

对于投资决策者,应关注冷恢复场景的频率。如果生产环境中模型频繁切换(如多租户推理服务),冷恢复加速的收益将直接转化为用户感知的首 token 延迟降低(TTFT 下降 26-32%,出处:R2 实测)和吞吐提升(29-40%,出处:R2/R3 实测)。

结语

NVMe-oF + RoCEv2 在推理存储中的工程实践已通过铭信 FX100 的实测验证,其核心价值在于低延迟、高并发的 KV Cache 加速,尤其在冷恢复和模型加载场景中显著优于传统 NFS。对于算力中心的技术团队,建议从网络配置(RoCEv2 流控)、并行读优化(LMCache 补丁)和负载模型(长上下文冷恢复)三个维度进行联测。铭信提供约 10 周的联测流程(G1 到货验收至 G4 稳定性测试),可帮助团队在自身环境中验证 TTFT 降幅 ≥25% 和吞吐 +29-40% 的带内指标,欢迎通过官方渠道联系。

本文要点问答

Q:NVMe-oF + RoCEv2 相比 NFS 在推理存储中的核心优势是什么? A:通过 RDMA 绕过 CPU 中断和文件锁开销,实现低延迟(微秒级)和高带宽(100 GbE),在模型加载场景中加速 6.2-9.3 倍(出处:R9 实测),在冷恢复场景中吞吐提升 8.6-20 倍(出处:R2 实测)。

Q:如何优化 KV Cache 的并行读性能? A:应用 LMCache 并行读补丁,利用 NVMe-oF 的多队列特性实现并行 I/O,在单卡并发 16 的冷读盘负载下 TTFT 改善 4.1 倍、带宽提升 5.3 倍(出处:R1 实测);同时需确保 RoCEv2 的 ECN 流控配置正确。

Q:冷恢复场景的加速倍数受哪些因素影响? A:加速倍数(8.6-20 倍)取决于并发度和上下文长度,高并发(如 16 档)和长上下文(如 480B 模型)下收益更显著,因为无外存重算的耗时随上下文长度线性增长,而 NVMe-oF 的 RDMA 读延迟几乎不变。

本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章