MaaS 单位经济:牌价到实收的折扣链条
从牌价到实收,MaaS 单位经济受折扣链条与存储时延影响。铭信实测数据显示 KV 分层加速可提升吞吐 29–40%。
MaaS(模型即服务)市场的单位经济,其真实成本并非云厂商牌价,而是经过多层折扣与隐性损耗后的实收价格。本文核心结论:决定 MaaS 单位经济的关键变量,一是从牌价到实收的折扣链条(承诺用量、预付、竞价实例等多重折扣叠加),二是推理服务中存储时延对 GPU 利用率的隐性侵蚀——后者在长上下文场景下可使有效吞吐下降近三成。据铭信 FX100 在 480B 生产部署形态下的实测(R2/R3 实测),KV 分层加速可将推理吞吐提升 29–40%,这意味着在相同 SLA 约束下,算力中心所需配置的并发余量可显著下调。
折扣链条:MaaS 定价的“三层漏斗”
MaaS 厂商的公开牌价(On-Demand 按需价格)只是定价起点。据 AWS EC2 On-Demand 定价页的计费口径,按需实例按小时计费、无承诺约束,单价最高;而预留实例与竞价实例则提供显著折扣。据 Microsoft Azure 与 Google Cloud 的计费模型说明,云侧 GPU 虚拟机普遍存在按需、预留、竞价三档计费模式,预留与竞价的价格依次递减。
这构成了 MaaS 单位成本的“三层漏斗”:第一层是牌价与预留价的差距,第二层是预留与竞价的差距,第三层则是实际利用率对单位成本的放大效应。据 Epoch AI 的公开研究口径,AI 算力成本趋势受规模效应与利用率双重驱动。对算力中心运营者而言,折扣链条的核心含义是:牌价是谈判起点,实收才是单位经济模型的分母。
存储时延:被低估的单位经济杀手
折扣链条之外,更隐蔽的成本变量是存储时延对 GPU 利用率的侵蚀。在长上下文推理场景中,KV Cache 的读取延迟直接决定首 token 延迟(TTFT)与吞吐。铭信 R2 实测显示,在 480B·TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%。这一实测值的意义在于:TTFT 是 SLA 的核心约束,TTFT 越高,为达标所需预留的并发余量越大,GPU 闲置率越高,单位实收成本越高。
| 指标 | 基线(无外存重算) | FX100 加速后 | 变化 | 出处 |
|---|---|---|---|---|
| TTFT p50(conc16) | 149.5s | 11.85s | ↓92% | R2 实测 |
| 吞吐(conc16) | 4.1 tok/s | 74.9 tok/s | ↑18.3× | R2 实测 |
| 推理加载(DeepSeek-70B,vs NFS) | 1399s | 150s | ↑9.3× | R9 实测 |
| Checkpoint 保存(8 卡 32B LoRA) | 178s | 94s | ↑1.9× | R1 实测 |
上表显示,存储时延的优化空间远大于折扣谈判的空间。据 NVIDIA DGX SuperPOD 参考架构的说明,大规模 GPU 集群的设计需在计算、存储、网络三层间做分层规划,存储层的性能短板会直接拖累计算层利用率。Kubernetes 官方文档亦指出,存储卷接入方式与调度策略直接影响工作负载的启动与运行效率。
算力中心选型:从“买卡”到“买吞吐”
对算力建设决策者而言,上述数据的含义是:单位经济的优化重点应从“买更便宜的卡”转向“让已有卡的吞吐更高”。据 Alibaba Cloud GPU 实例族的官方分类说明,不同负载应匹配不同实例族,但实例族的选择只决定理论峰值,实际吞吐取决于存储与网络的配合。
铭信 FX100 的实测数据(R2/R3 实测)显示,KV 分层加速在 480B 生产部署形态下,并发 8 档时吞吐提升 29%(下界),并发 16 档时提升 40%(上界),TP4×2 全机口径下提升 35–36%。这一提升带意味着:在相同 SLA 下,算力中心可以减少并发余量配置,或在不增加 GPU 的情况下承载更多并发请求。据 Uptime Institute 的资源页说明,数据中心可用性分级与能效实践直接影响机房侧供电与制冷约束——存储优化间接降低了单位请求的能耗分摊。
结语
MaaS 单位经济的优化,既在商务侧(折扣链条谈判),更在技术侧(存储时延消除)。铭信提供存储加速与算力中心全产业链服务,支持约 10 周门禁化联测(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),不达标即止损。如需验证特定负载下的收益,可在联测中实测。
本文要点问答
Q:MaaS 单位经济的核心成本变量是什么? A:一是从牌价到实收的折扣链条(按需、预留、竞价多层叠加),二是存储时延对 GPU 利用率的隐性侵蚀。后者在长上下文场景下可使有效吞吐下降近三成,优化空间大于折扣谈判。
Q:铭信 FX100 对推理吞吐的实测提升是多少? A:480B 生产部署形态下,并发 8 档提升 29%、并发 16 档提升 40%、TP4×2 全机口径提升 35–36%(R2/R3 实测)。TTFT p50 降幅 26–32%。
Q:算力中心选型应关注什么指标? A:应关注“单位 GPU 的有效吞吐”而非单纯“单卡算力”。存储时延直接决定 TTFT 与吞吐,存储优化可减少并发余量配置,降低单位实收成本。
References
- Uptime Institute Resource Page — https://uptimeinstitute.com/resources
- Epoch AI — https://epoch.ai/
- Kubernetes Documentation — https://kubernetes.io/docs/home/
- EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
- Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
- VM instance pricing | Google Cloud — https://cloud.google.com/compute/gpus-pricing
- Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families
- NVIDIA DGX SuperPOD - NVIDIA Docs — https://docs.nvidia.com/dgx-superpod/