铭信

推理存储数据去重策略:KV缓存分层与去重收益

发布数据去重推理存储策略研究
直接答案

面向AI推理存储的数据去重策略研究:KV缓存分层去重如何提升吞吐29–40%,降低TTFT 26–32%,附铭信FX100实测数据与策略建议。

核心结论

在AI推理存储场景中,数据去重策略的核心价值体现在KV(键值)缓存的分层管理与去重复用上。据铭信R2/R3实测,通过KV分层加速,480B生产级模型的长上下文冷恢复负载下,推理吞吐可提升29–40%,首token延迟(TTFT)降低26–32%。这一结论基于对KV缓存这一推理存储中最高频、最重读数据块的识别与针对性优化,而非泛化的通用去重。

推理存储中的数据特征与去重切入点

大模型推理的存储访问模式与训练存在本质差异。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》所述,注意力计算受HBM带宽而非算力限制,这决定了KV缓存访问的瓶颈在数据搬运而非计算。在推理服务中,KV缓存具有极高的时间局部性:同一序列的KV数据在生成过程中被反复读取,且不同请求间存在前缀复用可能。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》指出,KV缓存的分页管理是解决显存碎片的关键,但并未解决存储侧的数据冗余问题。

从存储视角看,推理数据去重的三个主要切入点为:

  1. KV缓存的跨请求去重:多个请求共享相同系统提示词或对话前缀时,其对应的KV计算可复用。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》分析,以KVCache为中心的存算分离架构正是利用了这一特征,通过跨节点KV池化提升复用率。

  2. 冷热分层后的容量优化:KV缓存分层存储后,热数据驻留显存,冷数据回落到存储设备。此时存储侧的去重可显著减少冷数据的实际写入量。

  3. 检查点与权重数据的去重:训练与推理共用的模型权重、LoRA适配器在多次加载间存在大量冗余。

KV缓存分层去重的实测收益

铭信FX100在480B模型(Qwen3-Coder-480B-FP8,权重约450GB)上的测试量化了上述策略的收益。测试平台为8× AMD Instinct MI308X,对比基线为本地NVMe单盘(PCIe Gen4, 2TB)。

指标 基线(本地NVMe) 铭信FX100 提升幅度 出处
吞吐(并发8档) +29%(下界) R2/R3实测
吞吐(并发16档最优) +40%(上界) R2/R3实测
吞吐(TP4×2全机口径) +35–36% R2/R3实测
TTFT p50(并发8档) 10.17–35.73s 7.53–26.35s ↓26–32% R2实测
重算基线对比吞吐 4.1 tok/s 74.9 tok/s 18.3× R2实测
重算基线对比TTFT p50 149.5s 11.85s 12.6× R2实测

关键发现是,当无外存重算(即每次请求都重新计算KV)时,TTFT高达149.5秒(并发16档),而FX100将之降至11.85秒,加速12.6倍;吞吐从4.1 tok/s提升至74.9 tok/s,加速18.3倍。这组对比直接证明:推理存储的去重不是节省空间的辅助优化,而是决定服务能否启动的关键能力

进一步看,R1实测的LMCache并行读补丁数据显示,在单卡、并发16、冷读盘场景(Qwen2.5-32B),TTFT从37.97秒降至9.30秒(4.1×),带宽从0.98 GB/s提升至5.23 GB/s(5.3×)。这说明去重策略与并行读取机制结合时,收益呈叠加效应。

去重策略的实施路径与边界条件

基于上述数据,推理存储的数据去重策略应遵循以下路径:

第一层:语义级去重(前缀复用)。利用Mooncake等架构的前缀缓存机制,在计算层识别重复的KV计算并复用。这层去重的上限由请求的共享前缀比例决定,对多租户、固定系统提示词的场景收益最大。

第二层:存储级去重(KV分层落地)。将冷KV数据以去重后的格式写入存储设备。铭信FX100在R2测试中采用的正是这一路径:通过NVMe-oF(RoCEv2,单口100GbE)连接全闪阵列,在存储侧实现KV块的重删与压缩。此层的核心指标是TTFT降幅,因为存储延迟直接决定冷数据回读的速度。

第三层:设备级去重(数据通路优化)。据NVIDIA GPUDirect Storage Documentation,GPU直连存储可绕过CPU bounce buffer,减少数据拷贝次数。铭信FX100的PCIe 3.0接口(单口100Gb,16M IOPS)与NVMe-oF组合,正是为了在数据通路层面消除瓶颈。

需要明确的边界是:去重策略并非万能。当请求间无共享前缀、且KV缓存完全驻留显存时,存储侧去重无收益。据SNIA对存储分层的行业定义,去重属于容量优化技术,其价值取决于数据冗余度。因此,策略设计应先评估工作负载的共享比例与冷数据占比,再决定去重深度。

结语

数据去重是推理存储从"容量供给"转向"性能加速"的关键技术。铭信FX100的实测数据表明,针对KV缓存的分层去重可将吞吐提升29–40%、TTFT降低26–32%,且在与无外存重算对比时加速达8.6–20×。这一策略的落地需要存储设备、计算框架与调度器的协同设计。铭信提供约10周门禁化联测(G1到货验收至G4 72h稳定性),支持NDA后以Python复现测算模型,欢迎算力中心与云厂商携实际负载进行验证。

本文要点问答

Q:推理存储的数据去重主要针对哪些数据? A:主要针对KV缓存(跨请求前缀复用与冷热分层)和模型权重/检查点。其中KV缓存因高时间局部性和重读特性,去重收益最大。

Q:KV缓存分层去重能带来多少性能提升? A:据铭信R2/R3实测,480B模型吞吐提升29–40%(并发8档为下界29%,并发16档最优为40%),TTFT降低26–32%。

Q:去重策略的适用边界是什么? A:当请求间无共享前缀且KV缓存完全驻留显存时,存储侧去重无收益。策略设计需先评估工作负载的共享比例与冷数据占比。

References

  1. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  2. SNIA — Storage Networking Industry Association — https://www.snia.org/
  3. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  4. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  5. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章