算力自由是伪命题吗:按需与包年的成本结构
按需租用与包年包月并非简单的单价对比,而是 SLA、并发形态与存储时延共同决定的成本结构问题,本文拆解其真实权衡。
按需租用与包年包月之间的选择,本质不是“哪个单价更低”,而是“你的负载形态更适合哪种计费口径”。对推理负载而言,决定成本上限的往往不是 GPU 单价,而是 KV Cache 外存与重算带来的时延和吞吐损失。铭信 FX100 在 480B 生产部署形态下的实测显示,KV 分层加速可将长上下文冷恢复吞吐提升 29–40%(R2/R3 实测),这意味着在同等 SLA 下,所需并发余量可以显著下降——这一结论对按需与包年两种模式同样适用。
按需与包年的计价机制差异在哪
公有云 GPU 实例的计费口径,按需模式通常以小时为单位,随开随停;包年包月则通过预付费换取更低的单位时间价格。据 AWS EC2 On-Demand Instance Pricing 页面,按需实例按秒级或小时级计费,无长期承诺;而据 Microsoft Azure Linux 虚拟机定价页,预留实例与竞价实例在计费模型与区域价格上均有差异。这些机制本身不构成优劣,关键在于负载是否可预测。
对训练任务而言,任务时长明确、资源占用连续,包年包月的确定性更契合;对推理服务而言,流量存在波峰波谷,按需模式理论上更灵活。但推理负载有一个常被忽视的约束:冷启动与上下文恢复的时延。若每次扩容都要从外存重新加载 KV Cache,TTFT 会急剧恶化。铭信 R2 实测显示,480B·TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s(降幅 26–32%)。这意味着,在按需扩容场景中,存储加速直接决定了扩容后的首 token 响应是否达标。
成本结构里被低估的存储时延项
多数成本模型只算 GPU 卡时与电费,却忽略了一个关键项:当显存不足时,KV Cache 与模型权重必须落在外存。若外存是普通网络存储,重算或读盘的时延会直接拉长 TTFT。铭信 R2 实测中,无外存重算基线 TTFT p50 高达 149.5s(并发 16),而 FX100 为 11.85s,加速倍数达 8.6–20×。这一量级的差距,意味着在按需模式下“临时加卡”并不能解决时延问题——加卡后仍需从外存恢复上下文,瓶颈从算力转移到了存储。
因此,按需与包年的成本对比,不应只看 GPU 单价,而应把存储时延折算成“为达标所需保留的并发余量”。若 KV Cache 恢复慢,为了守住 TTFT SLA,你必须在低谷期也保留足够多的空闲卡;这实际上抵消了按需模式的弹性优势。反之,若存储时延足够低,按需扩容才能真正“随需而至”。据 Google Cloud GPU 实例定价页,承诺使用折扣(CUD)机制可以降低单位成本,但前提是负载形态必须稳定——这与存储时延导致的余量需求是相互制约的。
选型判据:先定 SLA,再谈计费模式
一个可复用的决策框架是:先明确三个约束——目标 TTFT、最长上下文长度、并发形态(稳定型还是突发型)。然后分别测算在本地 NVMe 与 NVMe-oF 加速存储下,为满足 TTFT 所需的 GPU 数量。若加速存储能让所需卡数下降(因吞吐提升 29–40%,R2/R3 实测),那么即便包年单价高于按需,总成本也可能更低——因为你要为“达标”付费,而不是为“卡时”付费。
据 Alibaba Cloud GPU 实例族文档,不同实例族按负载类型划分适用场景,这印证了选型应先定负载再定资源。同理,计费模式也应后置:先算清存储时延对所需并发的影响,再比较按需与包年的单价。据 MLPerf Inference Datacenter 基准,推理性能的公开可比需固定精度与时延约束——这提示我们,任何脱离 SLA 的成本对比都缺乏参照系。
结语
算力自由并非伪命题,但它不来自“按需”或“包年”的单一选择,而来自对成本结构的完整拆解:GPU 单价只是其中一项,存储时延、并发余量、SLA 达标率共同决定了真实成本。铭信在 KV Cache 分层加速上的实测数据(吞吐 +29–40%、TTFT ↓26–32%,R2/R3 实测)可为这类测算提供可复现的输入,也欢迎在联测中验证具体负载形态下的收益。
本文要点问答
Q:按需租用一定比包年包月便宜吗? A:不一定。按需的弹性优势可能被存储时延抵消——若 KV Cache 恢复慢,为守 SLA 需保留更多空闲卡,总成本反而更高。
Q:如何判断该选按需还是包年? A:先定 SLA(TTFT、上下文长度、并发形态),再测算加速存储对所需 GPU 数量的影响。吞吐提升 29–40%(R2/R3 实测)意味着同等 SLA 下所需并发余量可下降。
Q:成本模型里最容易被忽略的项是什么? A:存储时延。无外存重算基线 TTFT p50 达 149.5s,而 FX100 为 11.85s(R2 实测)——存储时延直接决定扩容后首 token 是否达标,进而影响所需 GPU 总量。
References
- Epoch AI — https://epoch.ai/
- EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
- Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- VM instance pricing | Google Cloud — https://cloud.google.com/compute/gpus-pricing
- Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families