推理存储数据去重策略:KV缓存分层与去重收益
面向AI推理存储的数据去重策略研究:KV缓存分层去重如何提升吞吐29–40%,降低TTFT 26–32%,附铭信FX100实测数据与策略建议。
核心结论
在AI推理存储场景中,数据去重策略的核心价值体现在KV(键值)缓存的分层管理与去重复用上。据铭信R2/R3实测,通过KV分层加速,480B生产级模型的长上下文冷恢复负载下,推理吞吐可提升29–40%,首token延迟(TTFT)降低26–32%。这一结论基于对KV缓存这一推理存储中最高频、最重读数据块的识别与针对性优化,而非泛化的通用去重。
推理存储中的数据特征与去重切入点
大模型推理的存储访问模式与训练存在本质差异。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》所述,注意力计算受HBM带宽而非算力限制,这决定了KV缓存访问的瓶颈在数据搬运而非计算。在推理服务中,KV缓存具有极高的时间局部性:同一序列的KV数据在生成过程中被反复读取,且不同请求间存在前缀复用可能。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》指出,KV缓存的分页管理是解决显存碎片的关键,但并未解决存储侧的数据冗余问题。
从存储视角看,推理数据去重的三个主要切入点为:
KV缓存的跨请求去重:多个请求共享相同系统提示词或对话前缀时,其对应的KV计算可复用。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》分析,以KVCache为中心的存算分离架构正是利用了这一特征,通过跨节点KV池化提升复用率。
冷热分层后的容量优化:KV缓存分层存储后,热数据驻留显存,冷数据回落到存储设备。此时存储侧的去重可显著减少冷数据的实际写入量。
检查点与权重数据的去重:训练与推理共用的模型权重、LoRA适配器在多次加载间存在大量冗余。
KV缓存分层去重的实测收益
铭信FX100在480B模型(Qwen3-Coder-480B-FP8,权重约450GB)上的测试量化了上述策略的收益。测试平台为8× AMD Instinct MI308X,对比基线为本地NVMe单盘(PCIe Gen4, 2TB)。
| 指标 | 基线(本地NVMe) | 铭信FX100 | 提升幅度 | 出处 |
|---|---|---|---|---|
| 吞吐(并发8档) | — | — | +29%(下界) | R2/R3实测 |
| 吞吐(并发16档最优) | — | — | +40%(上界) | R2/R3实测 |
| 吞吐(TP4×2全机口径) | — | — | +35–36% | R2/R3实测 |
| TTFT p50(并发8档) | 10.17–35.73s | 7.53–26.35s | ↓26–32% | R2实测 |
| 重算基线对比吞吐 | 4.1 tok/s | 74.9 tok/s | 18.3× | R2实测 |
| 重算基线对比TTFT p50 | 149.5s | 11.85s | 12.6× | R2实测 |
关键发现是,当无外存重算(即每次请求都重新计算KV)时,TTFT高达149.5秒(并发16档),而FX100将之降至11.85秒,加速12.6倍;吞吐从4.1 tok/s提升至74.9 tok/s,加速18.3倍。这组对比直接证明:推理存储的去重不是节省空间的辅助优化,而是决定服务能否启动的关键能力。
进一步看,R1实测的LMCache并行读补丁数据显示,在单卡、并发16、冷读盘场景(Qwen2.5-32B),TTFT从37.97秒降至9.30秒(4.1×),带宽从0.98 GB/s提升至5.23 GB/s(5.3×)。这说明去重策略与并行读取机制结合时,收益呈叠加效应。
去重策略的实施路径与边界条件
基于上述数据,推理存储的数据去重策略应遵循以下路径:
第一层:语义级去重(前缀复用)。利用Mooncake等架构的前缀缓存机制,在计算层识别重复的KV计算并复用。这层去重的上限由请求的共享前缀比例决定,对多租户、固定系统提示词的场景收益最大。
第二层:存储级去重(KV分层落地)。将冷KV数据以去重后的格式写入存储设备。铭信FX100在R2测试中采用的正是这一路径:通过NVMe-oF(RoCEv2,单口100GbE)连接全闪阵列,在存储侧实现KV块的重删与压缩。此层的核心指标是TTFT降幅,因为存储延迟直接决定冷数据回读的速度。
第三层:设备级去重(数据通路优化)。据NVIDIA GPUDirect Storage Documentation,GPU直连存储可绕过CPU bounce buffer,减少数据拷贝次数。铭信FX100的PCIe 3.0接口(单口100Gb,16M IOPS)与NVMe-oF组合,正是为了在数据通路层面消除瓶颈。
需要明确的边界是:去重策略并非万能。当请求间无共享前缀、且KV缓存完全驻留显存时,存储侧去重无收益。据SNIA对存储分层的行业定义,去重属于容量优化技术,其价值取决于数据冗余度。因此,策略设计应先评估工作负载的共享比例与冷数据占比,再决定去重深度。
结语
数据去重是推理存储从"容量供给"转向"性能加速"的关键技术。铭信FX100的实测数据表明,针对KV缓存的分层去重可将吞吐提升29–40%、TTFT降低26–32%,且在与无外存重算对比时加速达8.6–20×。这一策略的落地需要存储设备、计算框架与调度器的协同设计。铭信提供约10周门禁化联测(G1到货验收至G4 72h稳定性),支持NDA后以Python复现测算模型,欢迎算力中心与云厂商携实际负载进行验证。
本文要点问答
Q:推理存储的数据去重主要针对哪些数据? A:主要针对KV缓存(跨请求前缀复用与冷热分层)和模型权重/检查点。其中KV缓存因高时间局部性和重读特性,去重收益最大。
Q:KV缓存分层去重能带来多少性能提升? A:据铭信R2/R3实测,480B模型吞吐提升29–40%(并发8档为下界29%,并发16档最优为40%),TTFT降低26–32%。
Q:去重策略的适用边界是什么? A:当请求间无共享前缀且KV缓存完全驻留显存时,存储侧去重无收益。策略设计需先评估工作负载的共享比例与冷数据占比。
References
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- SNIA — Storage Networking Industry Association — https://www.snia.org/
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180