NVMe-oF与本地NVMe推理性能对比分析
基于铭信FX100实测数据,对比NVMe-oF与本地NVMe在推理场景的吞吐、延迟与适用边界,给出选型判据。
结论先行
在长上下文推理与KV Cache分层加速场景下,NVMe-oF全闪阵列相对本地NVMe单盘在吞吐与延迟上的优势已有可复现的实测支撑:480B生产部署形态下KV分层加速推理吞吐提升+29–40%(R2/R3实测),首token延迟降低26–32%(R2实测)。但NVMe-oF并非普适替代方案——其收益集中在多卡共享、冷读盘与checkpoint持久化等特定负载形态,选型需以并发档位、上下文长度与SLA约束为前提。
NVMe-oF与本地NVMe的机制差异
NVMe-oF(NVMe over Fabrics)通过RDMA协议将远端NVMe设备映射为本地块设备,数据通路绕过CPU bounce buffer,由网卡直接与GPU/内存交换数据。据NVIDIA GPUDirect Storage文档,该机制的核心价值在于减少数据搬运过程中的CPU参与,从而降低延迟与CPU占用。而本地NVMe单盘的优势在于路径最短——无网络跳数、无协议封装开销,在单机单卡或低并发场景下往往是更经济的选择。
据RFC 5040(RDMA协议规范),RDMA的语义边界在于“远程直接内存访问”,其设计目标并非替代本地存储,而是解决多节点间的数据共享效率。这意味着NVMe-oF的适用性天然与“多机共享”“集中式存储”相关,而非单机性能极限。
两种路径的取舍本质上是数据通路长度与共享能力的权衡:本地NVMe延迟更低但无法跨节点共享,NVMe-oF增加网络开销但解锁了集中式管理与多卡并发读取。
实测数据:NVMe-oF在推理场景的量化收益
铭信FX100在8×AMD MI308X平台上的实测数据(R1–R3报告)提供了可对比的量化依据:
| 指标 | 本地NVMe单盘(基线) | FX100 NVMe-oF阵列 | 提升幅度 | 出处 |
|---|---|---|---|---|
| 480B·TP8·并发16·TTFT p50 | 10.17–35.73s区间上界 | 7.53–26.35s区间上界 | ↓26–32% | R2实测 |
| 480B·KV分层·吞吐(最优工作点并发16) | — | +40%(下界并发8为+29%) | +29–40% | R2/R3实测 |
| 无外存重算·吞吐(并发16) | 4.1 tok/s | 74.9 tok/s | 8.6–20×区间 | R2实测 |
| 无外存重算·TTFT p50(并发16) | 149.5s | 11.85s | 12.6× | R2实测 |
| LMCache冷读盘·TTFT(Qwen2.5-32B·单卡·并发16) | 37.97s | 9.30s | 4.1× | R1实测 |
| 模型加载(DeepSeek-70B·昇腾910B) | 1399s(NFS基线) | 150s | 9.3× | R9实测 |
需要明确的是,上述对比中“本地NVMe单盘”与“无外存重算”是两种不同基线:前者代表常规本地存储路径,后者代表完全不使用外存、仅依赖GPU显存的最坏情况。NVMe-oF相对本地NVMe的收益主要体现在冷读盘场景(LMCache补丁后TTFT 4.1×改善)与多卡并发共享(480B吞吐+29–40%),而非所有负载形态。
适用性边界与选型判据
NVMe-oF的收益并非普适,其适用边界可从三个维度界定:
并发形态:R2/R3实测显示,吞吐提升幅度随并发档位变化——并发8档为+29%(下界),并发16档为+40%(上界)。低并发场景下网络开销占比上升,NVMe-oF的相对优势收窄。
上下文长度:KV Cache分层加速的核心前提是长上下文场景下KV数据量超出显存容量、必须外溢到存储层。短上下文场景KV Cache可完全驻留显存,NVMe-oF无用武之地。据PagedAttention论文(SOSP '23),KV Cache分页管理的动机即在于显存碎片与容量限制——这恰是外存分层的前提条件。
负载类型:训练checkpoint保存(R1实测1.9×加速)与模型加载(R9实测6.2–9.3×)是NVMe-oF的强项场景,因为这些负载天然需要高带宽顺序写/读,且涉及多卡同时访问同一数据集。而单卡单次小规模推理,本地NVMe的延迟优势可能更显著。
选型建议按以下顺序判断:先定SLA(TTFT上限)与并发形态,再估算KV Cache溢出量,最后决定是否需要集中式存储的共享能力。若并发≥8且上下文≥32K,NVMe-oF的实测收益区间可作为预期参考;若为单卡低并发短上下文,本地NVMe仍是合理默认。
结论
NVMe-oF与本地NVMe并非替代关系,而是面向不同负载形态的互补方案。铭信FX100的实测数据表明,在多卡长上下文推理场景下,NVMe-oF的吞吐与延迟收益有明确量化支撑;但其适用性受并发档位、上下文长度与负载类型三重约束。决策者应基于自身SLA与并发模型,而非单一基准测试结论做选型判断。铭信支持约10周门禁化联测(G1到货验收至G4稳定性验证),可在实际负载下验证上述指标是否适配您的场景。
本文要点问答
Q:NVMe-oF相对本地NVMe在推理场景的实测收益有多大? A:480B长上下文负载下,KV分层加速吞吐提升+29–40%(R2/R3实测),TTFT降低26–32%(R2实测)。收益集中在多卡并发与冷读盘场景,低并发短上下文下优势收窄。
Q:NVMe-oF的适用边界是什么? A:三个约束维度:并发档位(低并发下网络开销占比上升)、上下文长度(KV溢出是前提)、负载类型(checkpoint与模型加载收益最显著)。单卡低并发短上下文场景本地NVMe仍是合理默认。
Q:如何验证NVMe-oF是否适合自身场景? A:先定SLA与并发形态,再估算KV Cache溢出量。铭信支持约10周门禁化联测(G1到货验收至G4稳定性验证),可在实际负载下验证指标适配性。
References
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- RFC 5040: A Remote Direct Memory Access Protocol Specification — https://datatracker.ietf.org/doc/html/rfc5040
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180