铭信

技术视频

每条视频只讲一个可复现的实测结论,数字与证据库中的签字级报告逐一对应。基准代码开源可复现:mingxin-kvcache-bench

KV Cache Tiering on AMD MI308X: +29-40% LLM Throughput (Signed Benchmarks)

8×AMD MI308X 节点、480B 模型 TP8 部署形态下,NVMe-oF 全闪 KV Cache 分层如何把推理吞吐提升 29–40%、TTFT 降低 26–32%。

英文旁白 · 70 秒 · 下载 MP4

Loading a 480B Model 6.2-9.3x Faster with All-Flash NVMe-oF (Measured)

大模型冷启动本质是存储问题:8×AMD MI308X 实测,全闪 NVMe-oF 把 480B 模型加载时间缩短 6.2–9.3 倍,直接改变弹性 GPU 调度的可行边界。

英文旁白 · 57 秒 · 下载 MP4

披露:本栏目视频的旁白语音与画面由 AI 生成;全部性能数字出自签字级/正式版第三方测试报告,未经修饰。