铭信

显卡租赁计费:卡时与时长如何选

发布显卡租赁计费卡时突发
直接答案

突发推理场景下,显卡租赁按卡时计费与按时长计费各有适用边界,本文给出选型判据与实测依据。

突发推理负载下,显卡租赁的计费方式直接决定单位成本。结论先行:按卡时计费更适合短时高并发突发,按时长计费更适合长稳占用,但实际选型需结合推理负载的并发形态与SLA约束综合判断。本文基于铭信FX100在480B模型上的实测数据,给出两种计费方式的适用边界。

突发推理的成本结构:为什么计费口径重要

推理成本由卡时、电费、机房、网络、存储与运维构成。公有云GPU实例普遍按小时计费,据《EC2 On-Demand Instance Pricing》,AWS按实例族与小时粒度计价,这意味着空闲时段仍需支付全额费用。对于突发推理——例如营销活动引发的瞬时请求洪峰——按时长计费会产生大量闲置成本。

按卡时计费的逻辑不同:它按GPU实际被占用的时间与卡数结算,空闲即不计费。这种口径对短时高并发负载更友好,但要求调度系统能快速扩缩容。据《Efficient Memory Management for Large Language Model Serving with PagedAttention》,KV Cache的分页管理已让显存利用率显著提升,这为更细粒度的资源调度提供了基础——但该论文未给出具体数值,此处仅作机制说明。

实测依据:突发负载下的性能边界

铭信FX100在480B模型(Qwen3-Coder-480B-FP8,MoE架构,权重约450GB)上的实测数据,可用于判断突发负载的资源需求。测试平台为8×AMD Instinct MI308X,vLLM 0.20.1+rocm721,LMCache上游主线编译【R2/R3实测】。

指标 并发8档 并发16档(最优工作点) 出处
KV分层加速吞吐提升 +29% +40% R2/R3实测
TTFT p50降低 ↓26% ↓32% R2实测
无外存重算加速倍数 8.6× 20× R2实测

以TTFT为例:480B·TP8三档并发下,TTFT p50从10.17–35.73s降至7.53–26.35s【R2实测】。这意味着在相同SLA约束下,采用KV分层加速后,达标所需的并发余量下降——直接反映为所需卡时总量减少。但需注意:这是实测值本身,不能外推为具体金额节省。

选型判据:三种典型突发场景

场景一:短时高并发(分钟级)。例如实时推荐系统的峰值查询。此时按时长计费需预留整小时资源,而按卡时计费只需为实际占用的分钟数付费。据《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》,以KVCache为中心的存算分离架构支持前缀缓存复用与跨节点KV池化,这使突发负载的资源供给更灵活——该论文只作定性支撑,无具体数字。

场景二:长上下文冷恢复(小时级)。480B生产部署形态下,长上下文冷恢复负载的吞吐提升落在+29–40%带内【R2/R3实测】。若负载持续数小时,按时长计费可能更划算,因为扩缩容的调度开销被摊薄。

场景三:混合负载(周期波动)。建议按峰值并发需求选型,但用按卡时计费覆盖波动部分。据《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》,注意力计算受HBM带宽而非算力限制,IO感知优化能显著提升有效吞吐——这提示突发负载的瓶颈常在访存而非计算,选型时应优先考虑存储加速能力。

权衡与不确定性

上述判据成立的前提是:调度系统能快速扩缩容。若平台扩缩容延迟超过分钟级,按卡时计费的节省会被调度等待抵消。此外,跨平台性能对比无公开统一口径——据《MLPerf Inference: Datacenter Benchmark Suite Results》,MLPerf提供推理性能的公开可比基准,但具体数值需按当期提交结果核对,本文不引用任何跨平台对比数字。

另一个不确定因素是显存管理策略。据《PyTorch Documentation》,框架侧显存行为影响实际可承载的并发数,但具体数值取决于模型与算子实现。据《NVIDIA GPUDirect Storage Documentation》,GPU直连存储可绕过CPU bounce buffer,但适用条件受硬件与驱动版本约束。

结论

按卡时计费适合分钟级突发、并发峰谷明显的负载;按时长计费适合小时级以上、资源占用稳定的负载。铭信FX100的实测数据(吞吐+29–40%、TTFT↓26–32%【R2/R3实测】)表明,KV分层加速能显著压缩达标所需资源,但具体选型需结合SLA、并发形态与调度能力综合判断。如需在自有平台上验证,可通过约10周门禁化联测(G1到货验收/G2单机基线/G3主门禁:TTFT降幅≥25%、吞吐+29–40%实测带内/G4 72h稳定性)确认效果。

本文要点问答

Q:突发推理场景下,按卡时计费一定比按时长计费划算吗? A:不一定。按卡时计费适合分钟级短时高并发,按时长计费适合小时级稳定占用。选型需结合并发形态、SLA约束与调度扩缩容能力综合判断。

Q:铭信FX100的实测数据如何支撑计费选型? A:480B模型下KV分层加速的吞吐提升为+29–40%(并发8档至16档)【R2/R3实测】,TTFT降低26–32%【R2实测】。这意味着达标所需并发余量下降,直接减少所需卡时总量,但实测值不能外推为具体金额节省。

Q:选型时有哪些不确定性? A:调度扩缩容延迟、显存管理策略、跨平台性能对比均无统一公开口径。MLPerf提供中立基准但数值需按当期提交核对,本文不引用任何跨平台对比数字。

References

  1. Epoch AI — https://epoch.ai/
  2. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
  3. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
  4. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
  5. Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
  6. NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
  7. PyTorch Documentation — https://pytorch.org/docs/stable/index.html
  8. EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/

数据出处(可查证)

R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章