铭信

行业洞察(第 3 页)

按发布时间倒序排列的第 3 页,共 5 页。 全部文章由铭信 AI 内容引擎生成、经自动质检,事实性数字须来自实测报告或注明来源的白名单数据。

国产算力ROCm昇腾国产 GPU

MoE 大模型在国产算力平台落地,KV Cache 存储瓶颈如何破?——铭信 FX100 实测数据解读

针对 480B/744B 级 MoE 模型在国产 GPU 平台的 KV Cache 存储瓶颈,本文基于铭信 FX100 在 AMD MI308X 与华为 910B 的实测,给出推理吞吐提升 29–40%、TTFT 降低 26–32% 的量化路径与验证方法。

国产算力ROCm昇腾国产 GPU

开源补丁如何加速国产算力硬件适配?LMCache 并行读优化实测解析

铭信科技向 LMCache 上游贡献并行读补丁,在 AMD ROCm 平台实现单卡冷读盘 TTFT 降低 4.1 倍、带宽提升 5.3 倍(R1 实测),并已在昇腾平台验证加载加速 6.2–9.3 倍(R9 实测)。本文解析补丁技术路径与生态启示。

AI 应用Agent视频生成私有化部署

大模型 API 定价地板是多少?长上下文推理成本如何降 40% 以上?

大模型 API 定价地板由显存、存储与并发共同决定。实测显示,KV Cache 分层加速可将长上下文推理吞吐提升 29–40%、TTFT 降低 26–32%,使私有化部署成本降至公有云的 40%–60%。

AI 应用Agent视频生成私有化部署

AI 编程助手的算力账单:KV Cache 存取延迟是最大瓶颈吗?

本文解析 AI 编程助手 token 消耗的关键瓶颈——长上下文下的 KV Cache 存取延迟。基于铭信 FX100 实测,展示存储加速如何将 TTFT 降低 26–32%、吞吐提升 29–40%,并给出系统级优化路径与可复现的验证方法。

KV Cache存储加速LMCachevLLM

推理延迟 p50 与 p99 为何差距大?存储加速如何把尾延迟从分钟级降到秒级?

长上下文推理中,p50 与 p99 延迟差距源于 KV Cache 冷恢复的随机读瓶颈。铭信 FX100 实测将 TTFT p50 从 149.5s 降至 11.85s,吞吐提升至 74.9 tok/s,显著压缩尾延迟。

KV Cache存储加速LMCachevLLM

480B 模型部署选 TP8 还是 TP4×2?KV Cache 存储压力与实测加速对比

基于铭信 FX100 实测数据,对比 480B 模型 TP8 单实例与 TP4×2 双实例在 KV Cache 存储压力、吞吐与 TTFT 上的差异,给出生产部署选型建议。

效能优化GPU 利用率推理优化

480B 长上下文推理,单节点吞吐锚点与多机扩展效率如何权衡?

基于铭信 FX100 在 8×AMD MI308X 平台的实测,单节点 480B 模型吞吐可达 4,082 tok/s(R3 实测),多机扩展效率约 67%。本文拆解 KV Cache 加速与互联瓶颈,为算力中心规划提供可复现的参考数据。

效能优化GPU 利用率推理优化

铭信FX存储系统如何实现单盘与单链路故障下的业务无感?

铭信FX系列全闪NVMe-oF阵列通过冗余RAID与多路径IO设计,在单盘或单链路故障时实现业务无感切换。本文基于故障注入测试视角,解析其如何保障GPU算力持续利用,并给出可核证的性能数据。

效能优化GPU 利用率推理优化

存量GPU集群如何挖潜?存储I/O优化能带来多少实测收益?

不盲目扩卡,先挖潜存量GPU集群。本文基于铭信科技实测数据,回答存储I/O优化对推理延迟、吞吐及训练效率的具体量化收益,并给出数据流、软件栈、硬件协同三层面的可落地方案。

国产算力ROCm昇腾国产 GPU

如何在 AMD MI308X 上实现 ComfyUI + LTX-Video 的完整部署与零算子错误?

本文基于 AMD MI308X 与 ROCm 7.2 实测,回答如何在非 NVIDIA 平台完成 ComfyUI + LTX-Video 2.3 工作流中 7 个核心视频模型的完整适配,并实现零算子错误。文中提供可复用的算子替换、分阶段验证策略,并分析其对国产算力生态的参考价值。

效能优化GPU 利用率推理优化

多实例推理服务如何实现独立容错与弹性扩缩?存储资源切分方案详解

多实例AI推理服务如何避免相互干扰?本文基于铭信FX100实测数据,解析通过存储资源切分实现独立容错与弹性扩缩的关键路径,涵盖NVMe-oF命名空间隔离、逻辑卷管理等技术方案与量化收益。

国产算力ROCm昇腾国产 GPU

非NVIDIA算力卡推理栈适配:ROCm生态的存储I/O瓶颈如何量化与优化?

本文基于实测数据,分析AMD ROCm与昇腾平台推理栈适配中的存储I/O瓶颈,量化KV Cache外置对TTFT与吞吐的影响,并给出可复现的优化路径与评估方法。

国产算力ROCm昇腾国产 GPU

AMD MI308X 192GB HBM 单卡推理能力与存储瓶颈实测解析

本文基于铭信科技 AMD MI308X 平台实测,回答 192GB HBM 单卡能跑多大模型、存储 I/O 如何制约推理性能,以及 FX100 存储加速如何将 480B 模型 TTFT 降低 26–32%、吞吐提升 29–40%。

国产算力ROCm昇腾国产 GPU

昇腾910B部署大模型,存储瓶颈怎么破?铭信FX100实测对比NFS

在昇腾910B平台,铭信FX100全闪NVMe-oF阵列实测将DeepSeek-32B/70B模型加载时间从NFS的691秒/1399秒降至112秒/150秒,加速6.2倍与9.3倍(R9实测)。本文量化对比存储方案差异,为国产算力集群优化提供参考。

算力中心TCO数据中心算力建设

千卡推理集群选型:Clos 网络架构的成本效益与决策框架

千卡推理集群的 Clos 网络选型,核心在于平衡 BOM 成本、TCO 与业务性能。本文基于铭信 FX100 实测数据,回答网络架构如何影响成本、如何建立 TCO 模型,以及如何按业务驱动逻辑进行选型验证。

国产算力ROCm昇腾国产 GPU

MoE大模型在国产算力平台落地难在哪?存储加速实测能带来多少提升?

480B级MoE模型在国产算力平台部署面临显存、加载与KV Cache三大瓶颈。铭信FX100实测显示,KV Cache分层加速可提升推理吞吐29–40%、降低首token延迟26–32%,为国产算力提供可复现的存储加速路径。

算力中心TCO数据中心算力建设

算力中心从百卡到千卡扩容,为什么门禁化联测是关键路径?

算力扩容如何规避性能不达预期与TCO失控?门禁化联测以分阶段实测门禁替代供应商承诺,将TTFT、吞吐等关键指标前置验证并配套止损机制,为百卡到千卡平滑扩展提供可复现路径。

效能优化GPU 利用率推理优化

如何量化评估推理服务重启风暴下的存储需求?

面对AI推理服务重启风暴带来的存储I/O压力,本文基于铭信FX100实测数据,量化评估存储性能需求,并分析如何通过AISSD提升GPU利用率与推理效率。

国产算力ROCm昇腾国产 GPU

vLLM 在 ROCm 上如何源码编译与调优?面向国产算力的实践指南

在 AMD ROCm 平台源码编译 vLLM 并调优,核心是启用 ROCm 后端并集成 LMCache 实现 KV Cache 分层加速。实测表明,通过源码级配置可提升推理吞吐 29–40%,降低首 token 延迟 26–32%(R2/R3 实测),为国产算力部署提供可复现路径。

KV Cache存储加速LMCachevLLM

长上下文会话冷恢复:Agent/代码助手的“恢复风暴”问题与解法

长上下文会话冷恢复导致 Agent 服务首 token 延迟飙升至分钟级,形成“恢复风暴”。铭信 FX100 通过 NVMe-oF 存储加速,在 480B 模型上实测 TTFT 降低 26-32%,无外存重算场景加速 8.6-20 倍,为生产环境提供了可工程化的解法。

KV Cache存储加速LMCachevLLM

NVMe-oF + RoCEv2 在推理存储场景的工程实践要点:以 FX100 实测为例

基于铭信 FX100 在 8×AMD MI308X 平台上的实测数据,本文回答 NVMe-oF + RoCEv2 为何比 NFS 更适合推理存储,以及如何通过并行读优化实现冷恢复场景 8.6-20 倍加速。

KV Cache存储加速LMCachevLLM

推理集群的存储配比怎么定:每台阵列服务 8 节点的实测依据

基于铭信 FX100 在 480B 模型、8 卡 AMD MI308X 平台上的实测,单台 4 盘全闪 NVMe-oF 阵列可稳定服务 8 个 GPU 节点,实现 TTFT 降低 26–32%、吞吐提升 29–40%。这一配比由 KV Cache 高并发访问模型和 FX100 的 IOPS/带宽能力共同决定,并可通过主门禁测试验证。

KV Cache存储加速LMCachevLLM

外置KV分层 vs 本地NVMe vs 无外存重算:480B大模型推理实测差距有多大?

在480B级大模型长上下文推理中,外置KV分层加速方案(如铭信FX100)相比本地NVMe,首Token延迟降低26–32%,推理吞吐提升29–40%;相比无外存重算,加速倍数达8.6–20倍。本文基于R2/R3实测数据,量化对比三种方案的TTFT、吞吐与场景适用性。

KV Cache存储加速LMCachevLLM

KV Cache 命中率如何影响大模型推理成本与缓存定价?

大模型推理中,KV Cache 命中率直接决定首 token 延迟与吞吐效率。基于铭信 FX100 实测,分层加速可提升吞吐 29–40%、降低 TTFT 26–32%。本文从命中率与延迟的量化关系、缓存定价的存储经济学、以及 vLLM 与 LMCache 生态实践三个维度,为技术决策者提供可复用的分析框架。