算力租赁选型:盯紧三个 SLA 指标而非单价
算力租赁选型不能只看单价。本文给出三个必须写入 SLA 的关键指标:TTFT、吞吐与稳定性,并附铭信实测数据与选型框架。
算力租赁选型时,单价之外必须盯紧三个 SLA 指标:首 token 延迟(TTFT)、稳态吞吐、以及长尾稳定性。只比单价会在部署后付出远超差价的隐性成本——同一 SLA 约束下,TTFT 与吞吐直接决定你需要租多少卡才能达标。铭信在 480B 生产级负载上的实测显示,KV 分层加速可将吞吐提升 29–40%、TTFT 降低 26–32%【R2/R3 实测】,这正是选型时应当写入 SLA 的量化依据。
为什么单价是最不可靠的选型锚点
公有云 GPU 实例的计费口径高度同质化——按小时、按实例族、按区域差异定价,这是 AWS、Azure、阿里云官方价目页共同采用的模式(据《EC2 On-Demand Instance Pricing》《Pricing - Linux Virtual Machines | Microsoft Azure》《Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud》)。但单价只回答了"租一小时多少钱",没回答"跑完一个任务要租多少小时、多少卡"。
后者的决定因素是性能与效率。以长上下文推理为例:若某负载的 TTFT 达标需要 16 卡并发,而另一平台在同样负载下 8 卡即可达标,那么后者的有效单价只有前者的一半——尽管小时报价可能完全相同。这就是为什么选型框架的第一步应当是"先定 SLA 约束,再算卡时需求",而不是反过来先比价。
三个必须写入 SLA 的指标
指标一:TTFT(首 token 延迟)的 p50 与 p99
TTFT 直接决定用户体验与 SLA 达标率。铭信在 480B·TP8 三档并发下的实测中,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%【R2 实测】。对无外存重算的基线,TTFT p50 高达 149.5s(并发 16),而 FX100 仅为 11.85s【R2 实测】。
选型时不应只看平均 TTFT,必须同时要求 p99 分位数——长尾延迟才是 SLA 违约的主要来源。建议在合同中同时约定 p50 与 p99 两个分位的上限值。
指标二:稳态吞吐(tok/s)与并发扩展性
吞吐决定单位时间能服务多少请求,直接换算为所需卡数。铭信在 480B 生产部署形态的冷恢复负载下,并发 8 档时吞吐提升 +29%(下界),最优工作点并发 16 档时 +40%(上界),TP4×2 全机口径为 +35–36%【R2/R3 实测】。
关键在"并发扩展性":平台在低并发下表现良好不代表高并发下依然如此。选型时应要求供应商提供至少两个并发档位的实测数据,验证吞吐是否随并发线性扩展,而非在某个并发点后急剧衰减。
指标三:长尾稳定性(p99 延迟抖动与故障恢复)
这是最常被忽略、却最影响实际成本的指标。GPU 集群的故障率与延迟抖动直接决定你需要多少冗余余量。据《NVIDIA DGX SuperPOD - NVIDIA Docs》,大规模集群设计需按计算/存储/网络分层规划扩展单元——这意味着稳定性是架构设计的结果,而非偶然。
选型时建议要求:72 小时连续压测的 p99 延迟波动数据、故障恢复时间(RTO)上限、以及降级模式下的性能承诺。铭信的合作模式中即包含 72 小时稳定性门禁(G4),这正是将稳定性量化的做法。
三个指标的联动关系与选型判据
三个指标并非独立,而是相互制约。TTFT 与吞吐共同决定"达标所需并发数",稳定性则决定"为应对波动需要预留多少余量"。下表给出选型判据框架:
| 指标 | 建议 SLA 要求 | 实测参考(铭信 FX100) | 出处 |
|---|---|---|---|
| TTFT p50 | 明确上限值(秒级) | 10.17–35.73s → 7.53–26.35s(↓26–32%) | R2 实测 |
| 稳态吞吐 | 至少两个并发档位数据 | 并发 8 档 +29%,并发 16 档 +40% | R2/R3 实测 |
| 长尾稳定性 | p99 抖动 ≤ 某阈值 + 72h 压测 | 门禁化联测含 72h 稳定性验证 | 合作模式 |
一个可复用的选型流程:先定义业务 SLA(如"TTFT p50 ≤ 8s"),再要求候选平台提供同负载、同并发下的实测数据,最后用实测值反推所需卡数,乘以单价得出真实总成本。据《MLPerf Inference: Datacenter Benchmark Suite Results》,推理性能的公开可比基准是讨论"谁更快"时唯一中立的公开依据——选型时应优先要求供应商提供符合该口径的测试结果。
结语
算力租赁选型的本质是"在 SLA 约束下最小化总成本",而非最小化单价。TTFT、吞吐、稳定性三个指标写入合同,才能将性能风险从采购方转移给供应方。铭信在 480B 生产级负载上完成了可复现的实测(R2/R3 报告),并支持门禁化联测验证——如需在您的负载上验证上述指标,可在联测中确认。
本文要点问答
Q:算力租赁选型时,为什么不能只看单价? A:单价只反映小时成本,不反映完成任务所需的卡时总量。TTFT 与吞吐决定达标所需并发数,稳定性决定冗余余量,三者共同决定真实总成本。
Q:三个关键 SLA 指标分别是什么? A:TTFT(首 token 延迟,需同时看 p50 与 p99)、稳态吞吐(需验证并发扩展性)、长尾稳定性(p99 抖动与故障恢复)。铭信实测中 TTFT 降幅 26–32%、吞吐提升 29–40%【R2/R3 实测】。
Q:如何验证供应商的 SLA 承诺是否可信? A:要求提供同负载、同并发下的实测数据,优先采用符合 MLPerf 口径的测试结果(据《MLPerf Inference: Datacenter Benchmark Suite Results》),并设置门禁化联测(如 72 小时稳定性压测)作为验收条件。
References
- Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families
- EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
- Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
- NVIDIA DGX SuperPOD - NVIDIA Docs — https://docs.nvidia.com/dgx-superpod/
- MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/