算力自由是伪命题吗:按需与包年的成本结构拆解
按需租用与包年包月各有适用边界,成本结构差异集中在利用率与并发余量。本文从计费机制与实测 SLA 出发,给出选型框架。
按需租用与包年包月并非简单的“贵”与“省”之争,其真实成本结构差异取决于工作负载的利用率、并发形态与 SLA 约束。对持续运行的推理服务,包年包月通常更匹配;对波动明显的研发测试,按需更具弹性。本文从计费机制与实测数据出发,拆解两种模式的成本构成与选型判据。
按需与包年的成本结构差异在哪里
公有云 GPU 实例的计费机制,是理解成本结构的起点。据 AWS EC2 On-Demand Instance Pricing,按需实例按小时计费、无长期承诺,适合不可预测或短时负载;据 Microsoft Azure 的 Linux 虚拟机定价页,其计费模型区分按需、预留与竞价三种模式,预留实例以承诺用量换取更低单价。据 Google Cloud 的 GPU 定价页,承诺使用折扣(Committed Use Discounts)进一步拉低单位成本,但要求 1 年或 3 年期的用量承诺。
三种计费口径的共同逻辑是:单价与承诺时长负相关。按需的“自由”体现在可随时释放,代价是单价最高;包年的“便宜”建立在负载持续、利用率高的前提上。若包年实例的实际利用率不足,单位 token 成本反而可能高于按需——这是成本结构分析的第一条分界线。
利用率与并发余量:成本结构的两个隐藏变量
成本结构不能只看单价,还要看为满足 SLA 而预留的并发余量。铭信在 480B 生产部署形态长上下文冷恢复负载下的实测显示,KV 分层加速的推理吞吐提升落在 +29–40% 区间(并发 8 档为下界 +29%,并发 16 档为最优工作点上界 +40%,TP4×2 全机口径 +35–36%,出处:R2/R3 实测)。同一 SLA 下吞吐的提升,意味着达标所需的并发实例数可以下降——这在包年场景中直接转化为可缩减的承诺实例数。
首 token 延迟(TTFT)是另一个约束维度。据铭信 R2 实测,480B·TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%。若业务 SLA 要求 TTFT 低于某阈值,按需模式下的弹性扩容往往以“多开实例”为手段,而实测降幅意味着在同样实例数下可以支撑更长上下文或更高并发,从而减少为峰值预留的闲置资源。
选型框架:先定 SLA,再算利用率
成本结构的对比不应从“按需还是包年”出发,而应从工作负载的三个特征出发:负载是否持续、上下文长度是否稳定、并发峰值与均值的比值有多大。
| 负载特征 | 按需租用 | 包年包月 | 出处 |
|---|---|---|---|
| 持续运行、利用率 >70% | 单价高,不经济 | 承诺折扣摊薄单价,更优 | AWS/Azure/GCP 计费口径(定性) |
| 短时爆发、利用率 <30% | 弹性释放,避免闲置 | 闲置时段仍计费,浪费 | 同上(定性) |
| 长上下文、高并发峰值 | 需为峰值多开实例 | 实测吞吐提升可压缩并发余量 | 铭信 R2/R3 实测 |
| 研发测试、负载波动大 | 随时启停,成本可控 | 承诺期锁定,灵活性差 | AWS/Azure/GCP 计费口径(定性) |
需要强调的是,上表中的铭信实测值仅代表 FX100 在特定平台(8× AMD MI308X + ROCm 7.2 + vLLM 0.20.1)与特定负载(Qwen3-Coder-480B-FP8,权重约 450GB)下的表现,不构成对其他平台或模型的普遍承诺。选型时建议以自身负载在目标平台上的门禁化联测数据为准。
结论:没有绝对自由的算力,只有匹配负载的计费结构
“算力自由”在成本意义上并不存在——按需的弹性以单价为代价,包年的低价以承诺为代价。真正的决策变量是负载的持续性与 SLA 约束:持续负载适合包年,波动负载适合按需;而在长上下文推理场景中,通过存储加速压缩并发余量,可以同时改善两种模式的成本效率。铭信提供约 10 周门禁化联测(G1 到货验收至 G4 72 小时稳定性验证),可在自身负载上验证 TTFT 降幅与吞吐提升是否落在实测带内,再决定采购形态。
本文要点问答
Q:按需租用和包年包月,哪种更省钱? A:取决于负载利用率。持续运行、利用率高的负载适合包年;短时波动负载适合按需,避免闲置计费。
Q:为什么说并发余量影响成本结构? A:SLA 达标所需的并发实例数直接决定总成本。铭信实测显示 KV 分层加速可提升吞吐 29–40%,同一 SLA 下可减少预留实例。
Q:选型时应该先看什么? A:先定 SLA(TTFT、吞吐、上下文长度),再算负载利用率,最后对比计费模式。建议以自身负载的门禁化联测数据为准。
References
- Epoch AI — https://epoch.ai/
- EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
- Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- VM instance pricing | Google Cloud — https://cloud.google.com/compute/gpus-pricing
- Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families