芯元一

推理延迟 p50 与 p99 为何差距大?存储加速如何把尾延迟从分钟级降到秒级?

发布更新KV Cache存储加速LMCachevLLM
直接答案

长上下文推理中,p50 与 p99 延迟差距源于 KV Cache 冷恢复的随机读瓶颈。铭信 FX100 实测将 TTFT p50 从 149.5s 降至 11.85s,吞吐提升至 74.9 tok/s,显著压缩尾延迟。

KV Cache 外置后,推理延迟的 p50 和 p99 为什么会拉开差距?

在大模型长上下文推理中,p50 与 p99 的差距并非统计噪声,而是存储系统在 KV Cache 冷恢复场景下随机读性能的直接映射。当模型权重或 KV Cache 需要从外部存储加载时,存储的随机读带宽与延迟抖动会显著放大尾部请求的等待时间,导致 p99 远高于 p50。

以 480B 模型(TP8 三档并发)的 R2 实测为例,使用铭信 FX100 时 TTFT p50 范围为 7.53–26.35 秒;而在无外存重算的基线(本地 NVMe 单盘)下,p50 高达 149.5 秒(并发 16 档)。两者差距的根本原因在于:高并发下存储 I/O 成为瓶颈,随机读延迟的抖动直接推高尾延迟【出处:R2 实测】。

存储加速能把 TTFT 的 p50 和 p99 压到多少?

铭信 FX100 全闪 NVMe-oF 阵列在 R2 实测中,将 480B 模型无外存重算的 TTFT p50 从 149.5 秒降至 11.85 秒(并发 16 档),对应加速倍数约 12.6×;吞吐从 4.1 tok/s 提升至 74.9 tok/s【出处:R2 实测】。这一改善同时压缩了 p50 与 p99,但尾延迟的降幅更明显,因为尾延迟对存储瓶颈更敏感。

在 KV 分层加速的推理吞吐测试中,480B 生产部署形态长上下文冷恢复负载下,并发 8 档吞吐提升 +29%(下界),最优工作点并发 16 档提升 +40%(上界),TP4×2 全机口径 +35–36%【出处:R2/R3 实测】。首 token 延迟(TTFT)在 480B·TP8 三档并发下降低 26–32%【出处:R2 实测】。

存储加速改善尾延迟的机制是什么?

核心在于降低 KV Cache 冷恢复时的随机读延迟与带宽瓶颈。铭信 FX100 通过全闪 NVMe-oF 阵列与 RoCEv2 网络,在单卡·并发 16·冷读盘(Qwen2.5-32B)测试中,将 LMCache 并行读补丁的 TTFT 从 37.97 秒降至 9.30 秒(改善 4.1×),带宽从 0.98 GB/s 提升至 5.23 GB/s(提升 5.3×)【出处:R1 实测】。

对于生产部署,p99 延迟的降低意味着更少的服务超时或降级。在高并发长上下文场景下,存储加速能将尾延迟从分钟级压缩至秒级,直接提升服务稳定性与用户体验。这一效果在模型加载场景同样显著:华为 Atlas 910B 平台上,DeepSeek-32B 服务加载从 691 秒降至 112 秒(6.2×),DeepSeek-70B 从 1399 秒降至 150 秒(9.3×)【出处:R9 实测(昇腾平台)】。

存储行为如何影响延迟分布的形状?

长上下文冷恢复中,KV Cache 的访问模式是大量随机读,数据量可达数百 GB(480B 模型权重约 450 GB)。存储系统的随机读性能(IOPS 与延迟抖动)直接决定 p50 与 p99 的差距。铭信 FX100 的 16M IOPS(PCIe 3.0 接口)与 100 GbE 网络带宽,使随机读延迟稳定在毫秒级,从而压缩尾部延迟【出处:厂商规格】。

相比之下,传统 NFS 或本地 NVMe 在随机读场景下延迟抖动更大,导致 p99 显著高于 p50。这也是为何存储加速能同时优化 p50 与 p99,但后者改善幅度更明显——尾延迟对存储瓶颈更敏感。训练场景同样受益:8 卡 32B LoRA 的 Checkpoint 保存从 178 秒降至 94 秒(1.9×),持续写带宽从 3.26 GB/s 提升至 6.40 GB/s(+96%)【出处:R1 实测】。

本文要点问答

Q:p50 和 p99 延迟差异的主要原因是什么? A:差异源于存储系统在 KV Cache 冷恢复中的随机读性能瓶颈,高并发下存储延迟抖动会放大尾部请求的等待时间。

Q:铭信 FX100 如何改善 p99 延迟? A:通过全闪 NVMe-oF 阵列和 RoCEv2 网络,提升随机读带宽(实测 5.23 GB/s,提升 5.3×),将 TTFT p50 从 149.5 秒降至 11.85 秒【出处:R2/R1 实测】。

Q:存储加速对推理服务稳定性的实际影响? A:降低尾延迟可减少服务超时和降级,尤其在高并发长上下文场景下,将 p99 延迟从分钟级降至秒级,提升用户体验。

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
R9芯元一 FX100-HBMM 与华为 910B 模型推理与训练性能测试(vs NFS 基线)2026-05-30
联系我们获取 →
本文由芯元一 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章