显卡租赁计费:卡时与时长如何选
突发推理场景下,显卡租赁按卡时计费与按时长计费各有适用边界,本文给出选型判据与实测依据。
突发推理负载下,显卡租赁的计费方式直接决定单位成本。结论先行:按卡时计费更适合短时高并发突发,按时长计费更适合长稳占用,但实际选型需结合推理负载的并发形态与SLA约束综合判断。本文基于铭信FX100在480B模型上的实测数据,给出两种计费方式的适用边界。
突发推理的成本结构:为什么计费口径重要
推理成本由卡时、电费、机房、网络、存储与运维构成。公有云GPU实例普遍按小时计费,据《EC2 On-Demand Instance Pricing》,AWS按实例族与小时粒度计价,这意味着空闲时段仍需支付全额费用。对于突发推理——例如营销活动引发的瞬时请求洪峰——按时长计费会产生大量闲置成本。
按卡时计费的逻辑不同:它按GPU实际被占用的时间与卡数结算,空闲即不计费。这种口径对短时高并发负载更友好,但要求调度系统能快速扩缩容。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache的分页管理已让显存利用率显著提升,这为更细粒度的资源调度提供了基础——但该论文未给出具体数值,此处仅作机制说明。
实测依据:突发负载下的性能边界
铭信FX100在480B模型(Qwen3-Coder-480B-FP8,MoE架构,权重约450GB)上的实测数据,可用于判断突发负载的资源需求。测试平台为8×AMD Instinct MI308X,vLLM 0.20.1+rocm721,LMCache上游主线编译【R2/R3实测】。
| 指标 | 并发8档 | 并发16档(最优工作点) | 出处 |
|---|---|---|---|
| KV分层加速吞吐提升 | +29% | +40% | R2/R3实测 |
| TTFT p50降低 | ↓26% | ↓32% | R2实测 |
| 无外存重算加速倍数 | 8.6× | 20× | R2实测 |
以TTFT为例:480B·TP8三档并发下,TTFT p50从10.17–35.73s降至7.53–26.35s【R2实测】。这意味着在相同SLA约束下,采用KV分层加速后,达标所需的并发余量下降——直接反映为所需卡时总量减少。但需注意:这是实测值本身,不能外推为具体金额节省。
选型判据:三种典型突发场景
场景一:短时高并发(分钟级)。例如实时推荐系统的峰值查询。此时按时长计费需预留整小时资源,而按卡时计费只需为实际占用的分钟数付费。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以KVCache为中心的存算分离架构支持前缀缓存复用与跨节点KV池化,这使突发负载的资源供给更灵活——该论文只作定性支撑,无具体数字。
场景二:长上下文冷恢复(小时级)。480B生产部署形态下,长上下文冷恢复负载的吞吐提升落在+29–40%带内【R2/R3实测】。若负载持续数小时,按时长计费可能更划算,因为扩缩容的调度开销被摊薄。
场景三:混合负载(周期波动)。建议按峰值并发需求选型,但用按卡时计费覆盖波动部分。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》,注意力计算受HBM带宽而非算力限制,IO感知优化能显著提升有效吞吐——这提示突发负载的瓶颈常在访存而非计算,选型时应优先考虑存储加速能力。
权衡与不确定性
上述判据成立的前提是:调度系统能快速扩缩容。若平台扩缩容延迟超过分钟级,按卡时计费的节省会被调度等待抵消。此外,跨平台性能对比无公开统一口径——据《MLPerf Inference: Datacenter Benchmark Suite Results》,MLPerf提供推理性能的公开可比基准,但具体数值需按当期提交结果核对,本文不引用任何跨平台对比数字。
另一个不确定因素是显存管理策略。据《PyTorch Documentation》,框架侧显存行为影响实际可承载的并发数,但具体数值取决于模型与算子实现。据《NVIDIA GPUDirect Storage Documentation》,GPU直连存储可绕过CPU bounce buffer,但适用条件受硬件与驱动版本约束。
结论
按卡时计费适合分钟级突发、并发峰谷明显的负载;按时长计费适合小时级以上、资源占用稳定的负载。铭信FX100的实测数据(吞吐+29–40%、TTFT↓26–32%【R2/R3实测】)表明,KV分层加速能显著压缩达标所需资源,但具体选型需结合SLA、并发形态与调度能力综合判断。如需在自有平台上验证,可通过约10周门禁化联测(G1到货验收/G2单机基线/G3主门禁:TTFT降幅≥25%、吞吐+29–40%实测带内/G4 72h稳定性)确认效果。
本文要点问答
Q:突发推理场景下,按卡时计费一定比按时长计费划算吗? A:不一定。按卡时计费适合分钟级短时高并发,按时长计费适合小时级稳定占用。选型需结合并发形态、SLA约束与调度扩缩容能力综合判断。
Q:铭信FX100的实测数据如何支撑计费选型? A:480B模型下KV分层加速的吞吐提升为+29–40%(并发8档至16档)【R2/R3实测】,TTFT降低26–32%【R2实测】。这意味着达标所需并发余量下降,直接减少所需卡时总量,但实测值不能外推为具体金额节省。
Q:选型时有哪些不确定性? A:调度扩缩容延迟、显存管理策略、跨平台性能对比均无统一公开口径。MLPerf提供中立基准但数值需按当期提交核对,本文不引用任何跨平台对比数字。
References
- Epoch AI — https://epoch.ai/
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
- Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
- NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
- PyTorch Documentation — https://pytorch.org/docs/stable/index.html
- EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/