铭信

技术专题

AI 推理存储加速 / KV Cache 分层细分赛道的技术专题库。每篇置顶 40–60 字直接答案, 全部数字附报告编号(R1–R9),任何第三方可查证复现。

KV Cache 外置存储

KV Cache 外置存储:把推理缓存放到全闪阵列上

KV Cache 外置存储是把大模型推理产生的键值缓存从显存下沉到外置全闪阵列,命中时跳过重算。铭信 FX100 在 480B 生产形态实测吞吐提升 29–40%。

KV Cache 分层缓存

KV Cache 分层缓存:显存 → 内存 → 全闪的三级架构

KV Cache 分层是把推理缓存按热度放在显存、主机内存与外置全闪三级介质上,容量逐级放大、成本逐级下降。铭信 FX100 为第三级提供 NVMe-oF 全闪池。

AI 推理存储加速

AI 推理存储加速:不加卡提升集群产出的第三条路

推理存储加速指用高性能存储层提升 GPU 集群的 token 产出:KV 分层免重算、模型秒级加载、切换不空转。铭信实测三项分别带来 29–40%、6.2–9.3×、1.9× 的改善。

TTFT 优化

TTFT 优化:把大模型首 token 时延降下来的工程路径

TTFT 由排队、prefill 重算与 KV 读回三部分构成。长上下文场景 prefill 重算是大头,KV Cache 外置读回可将其大幅消除:铭信实测 TTFT p50 降 26–32%。

长上下文冷恢复

长上下文冷恢复:Agent 时代的推理性能主战场

冷恢复指长上下文会话中断后重新激活:KV 已被逐出显存,只能重算或从外置层读回。铭信实测外置读回比重算快 8.6–20×,比本地盘快 26–32%。

NVMe-oF 推理存储

NVMe-oF 推理存储:RoCEv2 全闪阵列的实测表现

NVMe-oF 通过 RDMA 网络把全闪阵列以近本地时延挂给 GPU 节点。铭信 FX100 经 100GbE RoCEv2 实测:KV 读回性能超过本地 NVMe 单盘,TTFT 低 26–32%。

大模型加载加速

模型加载加速:从 23 分钟到 2.5 分钟的实测路径

模型加载受制于存储读带宽:NFS 方案下 70B 模型加载要 23 分钟。铭信 FX100 实测把 DeepSeek-70B 加载压到 150 秒(9.3×),32B 压到 112 秒(6.2×)。

上下文缓存

上下文缓存(Context Caching)背后的存储技术

各大模型 API 的上下文缓存本质是 KV Cache 持久化复用:命中缓存的输入按折扣计价。自建推理平台用外置 KV 分层可获得同样机制,铭信实测吞吐 +29–40%。

显存等效替代

显存不够怎么办:外置 KV 层的显存等效替代方法论

显存不足的出路有三:加卡、量化压缩、KV 外置。R5 七组对照实测表明外置 KV 层可等效替代 128GB 级显存驻留,成本远低于等量 HBM。

LMCache 生产部署

LMCache 生产化:从开源组件到签字级实测的工程实践

LMCache 是 vLLM 生态的开源 KV Cache 分层框架。铭信完成 ROCm 源码级编译适配并提交并行读补丁,实测 TTFT 改善 4.1×,代码以导出包形式可复现。

KV Cache 逐出策略

KV Cache 逐出策略:被逐出的缓存去哪了

KV Cache 逐出通常按 LRU/前缀引用计数执行。关键不是逐出算法本身,而是逐出后的去向:直接丢弃则回访即重算(实测 TTFT p50 149.5s),下沉外置层则可读回(11.85s)。

PD 分离

PD 分离(Prefill/Decode 分离)与 KV Cache 的传输层

PD 分离把 prefill 与 decode 放到不同实例,KV Cache 成为两者之间的「交接物」。分离架构放大了 KV 层的重要性:既要实例间传输,也要外置持久化承接冷会话。

vLLM LMCache 集成

vLLM + LMCache 集成实战:版本、编译与踩坑记录

vLLM 经 LMCache connector 接入外置 KV 层:ROCm 平台需源码编译适配。铭信实测栈为 vLLM 0.20.1+rocm721 + LMCache 上游主线,含并行读补丁(TTFT 4.1×)。

SGLang KV Cache

SGLang 的前缀复用与外置 KV 层:能不能配合

SGLang 的 RadixAttention 在显存内做前缀树复用,命中效率高但容量受限于显存。外置 KV 分层解决的是「逐出后找回」,两者机制互补。铭信实测基于 vLLM 栈,SGLang 适配以实测回填。

Prefix Caching

前缀缓存(Prefix Caching):从显存内复用到集群级资产

Prefix caching 让相同前缀(系统提示、文档、会话历史)的 KV 只算一次。显存内版本容量有限;外置分层把它扩展为集群级资产:跨实例共享、天级保留(R3 实测验证)。

KV Cache 容量规划

KV Cache 容量规划:外置层要配多大、怎么配

KV 容量 = 并发会话数 × 单会话 KV 体积 × 保留窗口系数。生产配比锚点:每台 FX100(满配 184.3TB)服务 8 个 GPU 节点,测算模型 Python 可复现。

ROCm 推理部署

ROCm 推理栈工程指南:vLLM/LMCache 在 AMD 平台的生产化

ROCm 平台跑通生产级推理的关键是源码级适配能力:vLLM 0.20.1+rocm721 + LMCache 主线编译 + 并行读补丁,480B 实测吞吐 +29–40%(R2/R3),全栈版本公开可复现。

MoE 模型推理存储

MoE 大模型推理的存储挑战:以 480B 实测为例

MoE 模型参数量大(480B 级权重 ≈450GB)但激活稀疏,显存被权重挤占后 KV 空间更紧张。外置分层实测:吞吐 +29–40%、TTFT 降 26–32%(Qwen3-Coder-480B-FP8)。