铭信

算力租赁选型:盯紧三个 SLA 指标而非单价

发布算力租赁选型SLA单价
直接答案

算力租赁选型不能只看单价。本文给出三个必须写入 SLA 的关键指标:TTFT、吞吐与稳定性,并附铭信实测数据与选型框架。

算力租赁选型时,单价之外必须盯紧三个 SLA 指标:首 token 延迟(TTFT)、稳态吞吐、以及长尾稳定性。只比单价会在部署后付出远超差价的隐性成本——同一 SLA 约束下,TTFT 与吞吐直接决定你需要租多少卡才能达标。铭信在 480B 生产级负载上的实测显示,KV 分层加速可将吞吐提升 29–40%、TTFT 降低 26–32%【R2/R3 实测】,这正是选型时应当写入 SLA 的量化依据。

为什么单价是最不可靠的选型锚点

公有云 GPU 实例的计费口径高度同质化——按小时、按实例族、按区域差异定价,这是 AWS、Azure、阿里云官方价目页共同采用的模式(据《EC2 On-Demand Instance Pricing》《Pricing - Linux Virtual Machines | Microsoft Azure》《Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud》)。但单价只回答了"租一小时多少钱",没回答"跑完一个任务要租多少小时、多少卡"。

后者的决定因素是性能与效率。以长上下文推理为例:若某负载的 TTFT 达标需要 16 卡并发,而另一平台在同样负载下 8 卡即可达标,那么后者的有效单价只有前者的一半——尽管小时报价可能完全相同。这就是为什么选型框架的第一步应当是"先定 SLA 约束,再算卡时需求",而不是反过来先比价。

三个必须写入 SLA 的指标

指标一:TTFT(首 token 延迟)的 p50 与 p99

TTFT 直接决定用户体验与 SLA 达标率。铭信在 480B·TP8 三档并发下的实测中,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅 26–32%【R2 实测】。对无外存重算的基线,TTFT p50 高达 149.5s(并发 16),而 FX100 仅为 11.85s【R2 实测】。

选型时不应只看平均 TTFT,必须同时要求 p99 分位数——长尾延迟才是 SLA 违约的主要来源。建议在合同中同时约定 p50 与 p99 两个分位的上限值。

指标二:稳态吞吐(tok/s)与并发扩展性

吞吐决定单位时间能服务多少请求,直接换算为所需卡数。铭信在 480B 生产部署形态的冷恢复负载下,并发 8 档时吞吐提升 +29%(下界),最优工作点并发 16 档时 +40%(上界),TP4×2 全机口径为 +35–36%【R2/R3 实测】。

关键在"并发扩展性":平台在低并发下表现良好不代表高并发下依然如此。选型时应要求供应商提供至少两个并发档位的实测数据,验证吞吐是否随并发线性扩展,而非在某个并发点后急剧衰减。

指标三:长尾稳定性(p99 延迟抖动与故障恢复)

这是最常被忽略、却最影响实际成本的指标。GPU 集群的故障率与延迟抖动直接决定你需要多少冗余余量。据《NVIDIA DGX SuperPOD - NVIDIA Docs》,大规模集群设计需按计算/存储/网络分层规划扩展单元——这意味着稳定性是架构设计的结果,而非偶然。

选型时建议要求:72 小时连续压测的 p99 延迟波动数据、故障恢复时间(RTO)上限、以及降级模式下的性能承诺。铭信的合作模式中即包含 72 小时稳定性门禁(G4),这正是将稳定性量化的做法。

三个指标的联动关系与选型判据

三个指标并非独立,而是相互制约。TTFT 与吞吐共同决定"达标所需并发数",稳定性则决定"为应对波动需要预留多少余量"。下表给出选型判据框架:

指标 建议 SLA 要求 实测参考(铭信 FX100) 出处
TTFT p50 明确上限值(秒级) 10.17–35.73s → 7.53–26.35s(↓26–32%) R2 实测
稳态吞吐 至少两个并发档位数据 并发 8 档 +29%,并发 16 档 +40% R2/R3 实测
长尾稳定性 p99 抖动 ≤ 某阈值 + 72h 压测 门禁化联测含 72h 稳定性验证 合作模式

一个可复用的选型流程:先定义业务 SLA(如"TTFT p50 ≤ 8s"),再要求候选平台提供同负载、同并发下的实测数据,最后用实测值反推所需卡数,乘以单价得出真实总成本。据《MLPerf Inference: Datacenter Benchmark Suite Results》,推理性能的公开可比基准是讨论"谁更快"时唯一中立的公开依据——选型时应优先要求供应商提供符合该口径的测试结果。

结语

算力租赁选型的本质是"在 SLA 约束下最小化总成本",而非最小化单价。TTFT、吞吐、稳定性三个指标写入合同,才能将性能风险从采购方转移给供应方。铭信在 480B 生产级负载上完成了可复现的实测(R2/R3 报告),并支持门禁化联测验证——如需在您的负载上验证上述指标,可在联测中确认。

本文要点问答

Q:算力租赁选型时,为什么不能只看单价? A:单价只反映小时成本,不反映完成任务所需的卡时总量。TTFT 与吞吐决定达标所需并发数,稳定性决定冗余余量,三者共同决定真实总成本。

Q:三个关键 SLA 指标分别是什么? A:TTFT(首 token 延迟,需同时看 p50 与 p99)、稳态吞吐(需验证并发扩展性)、长尾稳定性(p99 抖动与故障恢复)。铭信实测中 TTFT 降幅 26–32%、吞吐提升 29–40%【R2/R3 实测】。

Q:如何验证供应商的 SLA 承诺是否可信? A:要求提供同负载、同并发下的实测数据,优先采用符合 MLPerf 口径的测试结果(据《MLPerf Inference: Datacenter Benchmark Suite Results》),并设置门禁化联测(如 72 小时稳定性压测)作为验收条件。

References

  1. Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families
  2. EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
  3. Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
  4. NVIDIA DGX SuperPOD - NVIDIA Docs — https://docs.nvidia.com/dgx-superpod/
  5. MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/

数据出处(可查证)

R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章