FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)
测试范围
Qwen3-Coder-480B-FP8 八卡单实例(TP=8 标准生产部署形态),长上下文冷恢复,三方对照×并发梯度
原始文件名:test/AISSD5000-KVCache性能测试报告(480B·TP8长上下文·正式版).pdf
测试平台(免费公开)
8 × AMD Instinct MI308X(每卡 192 GB HBM,gfx942);2 × AMD EPYC 9654(384 线程),≈1.5 TB 内存;ROCm 7.2;vLLM 0.20.1+rocm721;LMCache(上游主线 2026-06-29 源码编译)。被测设备:铭信 FX100 全闪 NVMe-oF 阵列:4 盘 RAID0(14 TB, XFS),RoCEv2,单口 100 GbE。对照基线:本地 NVMe 单盘(PCIe Gen4, 2 TB);无外存重算。
本报告支撑的关键实测数字(免费公开)
这些数字本身不设付费墙——它们是本站对外承诺的性能结论,任何人都应当能免费核对。 付费部分是报告原件:完整测试方法、逐档原始数据、图表、截图与签章。
480B 生产部署形态长上下文冷恢复负载:并发 8 档 +29%(下界)、最优工作点并发 16 档 +40%(上界)、TP4×2 全机口径 +35–36%
口径:实测(R2/R3 实测)
480B·TP8 三档并发:TTFT p50 从 10.17–35.73s 降至 7.53–26.35s
口径:实测(R2 实测)
重算基线 TTFT p50 149.5s(conc16)对比 FX100 11.85s;吞吐 4.1 对 74.9 tok/s
口径:实测(R2 实测)
样张:三方对照实测数据(免费公开)
| 并发 | FX100 TTFT p50 | 本地盘 TTFT p50 | 重算 TTFT p50 | FX100 吞吐 | 本地盘吞吐 |
|---|---|---|---|---|---|
| 8 | 7.53 s | 10.17 s | — | 56.6 tok/s | 43.9 tok/s |
| 16 | 11.85 s | 17.31 s | 149.48 s | 74.9 tok/s | 53.6 tok/s |
| 32 | 26.35 s | 35.73 s | — | 71.6 tok/s | 53.9 tok/s |
R2 实测(TTFT 单位秒,吞吐单位 tok/s;重算仅测 conc16 档)
该报告支撑的解决方案
获取完整报告原件
付费即可下载 2 个文件:签字中文原件 + 英文参考译文(同一份研究成果不按语言二次收费)。 下载链接自购买起 7 天内有效,最多下载 10 次; 付款后页面立即可下载,同时邮件补发一份链接。
销售方:王启源(个人);记录商户:Creem(由其向买家开票并申报各国 VAT/GST)。结账页支持信用卡/借记卡、Apple Pay、Google Pay,暂不支持微信与支付宝付款; 无国际卡请联系support@mingxinstorage.xyz。许可范围与退款政策见服务条款。
英文 PDF 为 AI 参考译文(数字保真机检),签字中文原件为权威版本,图表/截图/签章仅见原件。 本页内容不构成投资建议。