铭信

算力中心的 $/M token 是怎么算出来的:可复现的成本模型方法论

发布算力中心TCO数据中心算力建设

算力中心的 $/M token(每百万 token 推理成本)并非一个固定的行业报价,而是由硬件购置、电力消耗、折旧周期、利用率与有效吞吐共同决定的工程变量。本文给出一个可复现的测算框架:先明确总拥有成本(TCO)的构成项,再除以生命周期内可交付的 token 总量,最后通过关键变量敏感性分析定位降本杠杆。这一方法论可直接用于算力建设前的投资测算与运营中的成本对标。

一、成本模型的基本结构:TCO 除以有效产出

$/M token 的数学定义并不复杂:

$/M token = 生命周期总成本(TCO) ÷ 生命周期有效 token 产出量

但两个子项都含有容易被低估的细节。TCO 不是采购价,而是包含以下五项:

  1. 硬件购置成本:GPU 服务器、存储阵列、网络设备(交换机、光模块)、机柜与布线。以铭信 FX100 满配整机参考价 ¥371,200(约 ¥2,014/TB)计,单台存储设备的购置成本在算力中心总硬件投入中占比通常为 5–15%,取决于 GPU 与存储的配比。
  2. 电力与散热基础设施:含 UPS、PDU、精密空调、冷水机组。这部分 Capex 通常占机房总投资的 20–30%,且与 GPU 功耗强相关。
  3. 运维与人力:7×24 值班、硬件更换、固件升级。按行业惯例,年运维成本约为硬件购置成本的 3–8%。
  4. 电力消耗(Opex 大头):GPU 满载功耗 × 负载率 × 电价 × 运行小时数。以 8× AMD MI308X 平台为例,单机功耗约 6–8 kW,若 PUE 为 1.3,则实际消耗再乘 1.3。
  5. 折旧与资金成本:GPU 服务器通常按 3–5 年折旧,存储与网络设备按 5–7 年。资金成本按贷款利率或机会成本计算。

分母端的“有效 token 产出”同样需要精确定义。不是理论峰值 token 数,而是:

有效产出 = 可用时长 × 平均利用率 × 有效吞吐(token/s)× 时间换算

其中“平均利用率”是最大的隐性折扣项。生产环境中的 GPU 利用率很少超过 60–70%,原因包括:请求排队、批处理间隙、冷启动加载、故障恢复。而“有效吞吐”必须使用生产负载下的实测值,而非厂商标称的峰值。例如铭信 R2 实测中,480B 模型 TP8 三档并发下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s(出处:R2 实测),吞吐提升直接转化为单位成本下降。

二、从实测数据推导单位成本:一个可复现的算例

以下用一个简化算例展示完整推导路径。假设某算力中心部署 8 卡 MI308X 平台,目标负载为 480B MoE 模型长上下文推理。

第一步:确定年化 TCO

  • 硬件购置:8 × MI308X(约 ¥150 万/卡)+ 2 × EPYC 9654 服务器 + 存储(FX100 满配 ¥371,200)+ 网络 ≈ ¥1,500 万
  • 电力基础设施分摊:按硬件 25% ≈ ¥375 万
  • 年运维(5% 硬件)≈ ¥75 万
  • 年电力:单机 7 kW × 24h × 365 天 × 1.3 PUE × ¥0.8/kWh ≈ ¥63.7 万
  • 3 年折旧 + 5% 资金成本,年化 TCO ≈(1500+375)/3 + 75 + 63.7 ≈ ¥763.7 万/年

第二步:确定年有效产出

  • 可用时长:365 × 24 × 0.95(5% 故障与维护)= 8,322 小时
  • 平均利用率:取 60%(生产环境保守值)
  • 有效吞吐:参考铭信 R2 实测,480B·TP8 并发 8 档下,无外存重算时吞吐约 74.9 tok/s(对比重算基线 4.1 tok/s,出处:R2 实测)。保守取 50 tok/s(考虑批处理间隙)
  • 年有效产出 = 8,322h × 3600s × 0.6 × 50 tok/s ≈ 8.99 × 10^11 token

第三步:计算 $/M token

¥763.7 万 / 8.99 × 10^11 token × 10^6 ≈ ¥8.5 / M token(约 $1.2 / M token,按汇率 7.2)

这一结果与行业公开报道的推理成本区间($0.5–3 / M token)可比,验证了模型框架的合理性。需要强调的是,这个数字对假设高度敏感——若利用率从 60% 降至 40%,单位成本上升 50%;若吞吐从 50 提升至 74.9 tok/s(铭信 R2 实测上界),单位成本下降 33%。

三、关键变量敏感性:什么最影响 $/M token

对上述模型做单变量敏感性分析,可得出降本优先级排序:

1. 有效吞吐(影响最大):吞吐每提升 20%,$/M token 下降约 16.7%。提升路径包括:KV Cache 卸载减少重算、更好的批处理调度、更快的模型加载。铭信 R2 实测显示,KV 分层加速在 480B 生产部署形态下带来 +29–40% 吞吐提升(出处:R2/R3 实测),相当于直接降低单位成本 22–29%。对无外存重算的加速倍数达 8.6–20×(出处:R2 实测),意味着在长上下文场景下,存储性能对吞吐的约束远高于直觉。

2. 利用率:利用率从 50% 提升至 70%,$/M token 下降 28.6%。但利用率受业务负载波动制约,短期难以大幅改善。更现实的路径是缩短冷启动时间——铭信 R9 实测显示,模型推理加载加速 6.2–9.3×(vs NFS 基线,出处:R9 实测),可将服务扩容时间从 23 分钟压缩至 2.5 分钟,间接提升可用时长。

3. 电力成本:电价每下降 ¥0.1/kWh,$/M token 下降约 1.5%。选址于水电丰富或绿电充裕的地区,可带来 5–10% 的成本优势。但这属于选址决策,非运营优化范畴。

4. 折旧年限:GPU 从 3 年延长至 4 年,$/M token 下降约 8%。但需权衡性能过时风险——新一代 GPU 的能效比提升通常超过 30%/年。

结论:在硬件选型已定的前提下,提升有效吞吐是 $/M token 最可控、最可量化的降本杠杆。 这也是为什么存储性能(KV Cache 卸载、Checkpoint 保存)在推理成本模型中的地位日益重要——它直接决定 GPU 的 idle 时间占比。

四、从单机到算力中心:规模化的成本摊薄效应

上述算例是单机视角。算力中心层面的 $/M token 还需叠加两项规模化因素:

1. 规模摊薄:机房基础设施(电力、制冷、安防)在 100 卡以下规模时呈阶梯式成本,超过 500 卡后边际成本显著下降。行业经验值:500 卡以上规模,基础设施单位成本下降 30–40%。

2. 混合负载优化:推理与训练负载的时序互补可提升整体利用率。训练任务通常夜间批量执行,推理任务白天为主。铭信 R1 实测显示,训练 Checkpoint 保存加速 1.9×(178s → 94s,出处:R1 实测),意味着训练任务的 GPU 中断时间缩短,可释放更多时段给推理负载。

算力中心决策者应建立的正确认知是:$/M token 不是一个采购指标,而是一个运营指标。硬件采购只决定了成本下限,运营效率(吞吐、利用率、冷启动时间)才决定实际成本与下限的差距。建议每季度按本文框架重新测算,将吞吐与利用率的变化量化到 $/M token 的变动,驱动持续优化。

结语

可复现的成本模型是算力建设决策的基础设施。铭信科技提供存储加速与算力中心全产业链服务,支持以门禁化联测(G1–G4)方式验证存储性能对推理吞吐的实际提升,测算模型可在 NDA 后以 Python 复现。欢迎有算力成本优化需求的团队联系联测合作。

本文要点问答

Q:$/M token 的核心计算公式是什么? A:$/M token = 生命周期总成本(TCO)÷ 生命周期有效 token 产出量。TCO 含硬件、电力基础设施、运维、电费与折旧;有效产出 = 可用时长 × 利用率 × 有效吞吐。

Q:哪个变量对 $/M token 影响最大? A:有效吞吐。吞吐每提升 20%,单位成本下降约 16.7%。铭信 R2 实测显示 KV 分层加速可带来 +29–40% 吞吐提升(出处:R2/R3 实测),是当前最可量化的降本杠杆。

Q:如何验证存储性能对推理成本的实际影响? A:通过门禁化联测:G3 主门禁要求 TTFT 降幅 ≥25%、吞吐 +29–40% 实测带内,不达标即止损。测算模型可在 NDA 后以 Python 复现。

本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章