租GPU按卡时还是按token计费更划算
两种计费模式的成本边界取决于负载形态。按卡时适合高利用率长任务,按token适合低利用率推理。决策链与实测数据解析。
结论先行:计费模式没有绝对优劣,成本边界由负载形态决定
按卡时计费与按 token 计费哪个更划算,答案取决于你的工作负载特征:按卡时计费在 GPU 利用率高、任务可预测的长时负载下更优;按 token 计费在利用率低、并发波动大的推理场景下更优。两种模式的分界点不是某个固定价格,而是你的实际利用率曲线与 SLA 约束。本文从计费机制、负载形态与实测数据三个维度拆解成本边界。
两种计费模式的机制差异与适用场景
公有云 GPU 的主流计费模式分为按卡时(实例时长)与按 token(推理输出量)两种。
据《EC2 On-Demand Instance Pricing》,AWS 的按需实例按小时计费,按实例族区分价格,用户为占用的 GPU 时长付费,无论 GPU 是否满载。据《Pricing - Linux Virtual Machines | Microsoft Azure》,Azure 提供按需、预留与竞价三种计费模型,预留实例承诺使用周期换取折扣,竞价实例以低优先级换取低价。据《VM instance pricing | Google Cloud》,Google Cloud 的 GPU 机型支持按秒计费与承诺使用折扣(CUD),长期承诺可降低单位成本。
按 token 计费则是推理服务商(如各类模型 API 平台)的通行做法,用户只为实际生成的 token 数量付费,不承担空闲时段的成本。
两种模式的成本边界可以这样概括:如果你的 GPU 利用率长期高于某个阈值(通常约 60–70%),按卡时计费的单位 token 成本会低于按 token 计费;反之,利用率越低,按 token 计费越划算。据《Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud》,阿里云将 GPU 实例按适用场景划分为计算优化型与 GPU 加速型等家族,推理与训练负载应选择不同实例族——这提示我们,选型的第一步是先确认负载类型,再谈计费模式。
成本边界的三个决定性变量
变量一:GPU 利用率与空闲成本
按卡时计费的本质是购买"可用性"而非"产出"。当推理服务在夜间或低峰期利用率降至 20% 以下时,按卡时计费的单位 token 成本会急剧上升。此时按 token 计费的优势显现——服务商承担了空闲风险,用户只为产出付费。
变量二:并发形态与 KV Cache 成本
长上下文推理场景下,KV Cache 占用的显存与存储资源随并发数非线性增长。铭信 FX100 在 480B 生产部署形态长上下文冷恢复负载下的实测数据显示:并发 8 档时吞吐提升 +29%(下界),最优工作点并发 16 档时 +40%(上界),TP4×2 全机口径 +35–36%(R2/R3 实测)。这意味着,在相同 SLA 下,KV 分层加速让达标所需的并发余量下降——并发余量越小,按卡时计费的闲置成本越低。
| 指标 | 并发 8 档 | 并发 16 档(最优) | TP4×2 全机 | 出处 |
|---|---|---|---|---|
| 吞吐提升 | +29% | +40% | +35–36% | R2/R3 实测 |
| TTFT 降低 | — | — | ↓26–32% | R2 实测 |
| 无外存重算加速 | — | 8.6–20× | — | R2 实测 |
变量三:首 token 延迟(TTFT)与 SLA 约束
按 token 计费的服务通常有明确的时延 SLA。铭信 FX100 在 480B·TP8 三档并发下的实测显示,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s(R2 实测)。TTFT 降幅落在实测带内,意味着服务商可以在更低的并发余量下满足 SLA——这直接压缩了按卡时计费模式下的预留资源量。
决策框架:先定约束,再选计费模式
对采购与预算决策者,建议按以下顺序决策:
- 先定 SLA 约束:明确可接受的 TTFT、吞吐与并发峰值。据《H100 GPU | NVIDIA》,NVIDIA 官方给出的规格口径包括显存类型与互联形态,这些硬件规格决定了单卡能承载的并发上限——但规格与实测性能之间存在差距,选型时应以实测为准。
- 测算利用率曲线:按 24 小时周期统计 GPU 实际利用率。若平均利用率低于 50%,按 token 计费更优;若高于 70%,按卡时计费更优。
- 评估 KV Cache 优化空间:KV 分层加速能显著降低长上下文负载的 TTFT,从而减少为满足 SLA 而预留的并发余量。铭信 FX100 的实测数据(R2/R3)可作为这一环节的参考基准。
- 考虑混合模式:高峰期用按 token 计费的弹性资源,低谷期用按卡时计费的预留实例,是折中方案。
需要明确的是,上述框架不涉及具体价格数字——云厂商定价页的数值随时变动,且不同区域、不同实例族的价差显著。据《Epoch AI》,AI 算力成本趋势的公开研究显示,硬件成本与利用率是影响单位算力成本的两大长期变量,但该机构的研究口径为第三方统计,具体数值需以当期公开数据为准。
结语
按卡时与按 token 计费的成本边界,本质上是"购买可用性"与"购买产出"之间的选择。决策的关键不在价格表,而在你的负载形态与 SLA 约束。铭信科技提供存储加速与算力中心全产业链服务,支持约 10 周门禁化联测(G1 到货验收 / G2 单机基线 / G3 主门禁:TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内 / G4 72h 稳定性),不达标即止损。如需验证 KV 分层加速在特定负载下的成本效益,可在联测中实测。
本文要点问答
Q:按卡时计费和按 token 计费,哪个更划算? A:取决于 GPU 利用率。利用率高于约 70% 的长时负载,按卡时更优;利用率低于 50% 的波动推理,按 token 更优。没有绝对优劣,只有负载匹配度。
Q:KV Cache 优化如何影响计费模式选择? A:KV 分层加速可降低 TTFT(铭信 FX100 实测 ↓26–32%,R2 实测),从而减少为满足 SLA 而预留的并发余量,压缩按卡时模式下的闲置成本。
Q:决策时应该先看什么? A:先定 SLA 约束,再测算 24 小时利用率曲线,最后评估 KV Cache 优化空间。价格数字应以当期公开定价页为准,不宜写死。
References
- EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
- Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
- VM instance pricing | Google Cloud — https://cloud.google.com/compute/gpus-pricing
- Epoch AI — https://epoch.ai/
- Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families
- H100 GPU | NVIDIA — https://www.nvidia.com/en-us/data-center/h100/