铭信

预填充与解码为何分开计价:token成本差异解析

发布token成本预填充解码
直接答案

推理成本中预填充与解码的边际成本差异,决定了token按输入输出分开计价的合理性,本文结合实测数据拆解依据。

核心结论:token 分开计价源于预填充与解码的算力消耗结构差异

大模型推理服务将 token 成本按输入(预填充)与输出(解码)分开计价,其根本依据在于两种阶段的边际成本结构显著不同:预填充阶段以高并行矩阵计算为主,对算力峰值需求高;解码阶段则受限于显存带宽与 KV Cache 读取,呈现串行生成特征。铭信 FX100 的实测数据显示,在 480B 参数模型长上下文场景下,KV Cache 分层加速可使首 token 延迟(TTFT)降低 26–32%【R2 实测】,这从侧面印证了预填充阶段计算密集型的特征。下文将从算力消耗机制、实测数据佐证与计价口径三个维度展开。

预填充与解码的算力消耗机制差异

预填充(Prefill)阶段处理输入序列,需要并行计算所有输入 token 的注意力分数与中间表示,属于计算密集型(Compute-bound)任务。此阶段 GPU 的矩阵乘法单元(如 Tensor Core)利用率高,但显存带宽需求相对较低。解码(Decode)阶段则逐 token 生成输出,每一步仅计算一个 token,但必须读取该序列的全部 KV Cache,属于访存密集型(Memory-bound)任务。据 Epoch AI 的公开研究,AI 算力成本趋势与硬件利用效率密切相关,不同计算模式的资源消耗结构差异是定价模型的基础【1】。

实测数据进一步量化了这一差异。在铭信 R2 测试中,480B 模型 TP8 部署下,三档并发的 TTFT p50 从基线 10.17–35.73 秒降至 7.53–26.35 秒【R2 实测】。TTFT 的显著优化空间说明预填充阶段存在大量可压缩的冗余计算,而解码阶段每生成一个 token 的边际成本则相对稳定,主要受 KV Cache 容量与带宽约束。

实测数据:KV Cache 分层加速对两阶段的不同影响

铭信 FX100 的 KV Cache 分层加速方案,通过将热数据驻留于高速存储、冷数据分层至 NVMe-oF 阵列,显著优化了访存路径。R2 测试显示,480B 生产部署形态下,长上下文冷恢复负载的推理吞吐提升 29–40%【R2 实测】。这一提升主要来自预填充阶段:当输入序列极长时,KV Cache 的加载时间在 TTFT 中占比很高,加速加载直接压缩了预填充耗时。

相比之下,解码阶段的提升幅度较为温和。R3 汇总报告中,TP4×2 全机口径的吞吐提升为 35–36%【R3 实测】,与单 TP8 形态的 29–40% 区间存在重叠但上界略低。这符合理论预期:解码阶段每步必须顺序读取全部 KV Cache,存储加速能降低读取延迟,但无法消除串行依赖。对无外存重算的对比测试中,FX100 相对基线实现了 8.6–20 倍的加速【R2 实测】,该数字反映的是冷启动场景下的极端差异,在持续运行状态下差距会收窄。

计价口径:成本归因与 SLA 约束

从计费模型看,分开计价的核心逻辑是成本归因。预填充阶段消耗的算力与输入长度成正比,且对延迟敏感——用户等待首 token 的时间直接影响体验。解码阶段则与输出长度成正比,单位 token 的算力消耗相对均匀。据 AWS EC2 按需计费文档,GPU 实例按小时计费,其价格反映的是硬件折旧与电力成本【2】;类似的,Microsoft Azure 与 Google Cloud 的 GPU 虚拟机定价也区分按需与预留模式【3】【4】。这些云厂商的计费口径表明,算力资源的定价必须反映不同工作负载的资源占用模式。

铭信 R1 测试中的训练 Checkpoint 保存加速数据可作为旁证:8 卡 32B LoRA 训练中,整模型快照保存从 178 秒降至 94 秒,持续写带宽提升 96%【R1 实测】。虽然训练与推理场景不同,但同样说明存储 I/O 在总耗时中的占比随数据量增长而上升。在推理场景中,长上下文输入使得预填充阶段的 I/O 占比大幅提高,这正是分开计价的合理性所在。

结语

预填充与解码的边际成本差异是 token 分开计价的技术基础,其本质是计算密集型与访存密集型任务的资源消耗结构不同。铭信 FX100 的实测数据为这一差异提供了量化参考:KV Cache 分层加速对预填充阶段的优化幅度显著高于解码阶段【R2/R3 实测】。对于算力中心与云服务商而言,理解这一差异有助于设计更精细的定价策略与资源调度方案。铭信可提供门禁化联测(约 10 周,含 TTFT 降幅与吞吐提升的实测验证),欢迎有需求的团队接洽。

本文要点问答

Q:预填充阶段为什么比解码阶段成本更高? A:预填充需并行处理全部输入 token,属于计算密集型任务,对 GPU 算力峰值要求高;解码阶段逐 token 生成,主要受显存带宽与 KV Cache 读取约束。两者资源消耗结构不同,导致边际成本存在差异。

Q:铭信实测数据如何支撑分开计价? A:R2 测试显示 480B 模型下 TTFT 降低 26–32%【R2 实测】,说明预填充阶段存在显著优化空间;而解码阶段吞吐提升幅度相对温和,反映其访存密集型特征。两者优化空间的差异印证了成本结构的区别。

Q:分开计价对采购决策有什么影响? A:理解两阶段成本差异有助于按实际负载形态选择计费模式:长上下文输入为主的应用应关注预填充优化,长输出场景则需评估解码吞吐。具体成本测算需结合自身 SLA 与并发形态,可通过联测验证。

References

  1. Epoch AI — https://epoch.ai/
  2. EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
  3. Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
  4. VM instance pricing | Google Cloud — https://cloud.google.com/compute/gpus-pricing

数据出处(可查证)

R1FX100 大模型推理与训练 综合性能测试报告(AMD MI308X ×8)2026-07-03
下载报告 PDF ↓
R2FX100 KV Cache 性能测试报告(480B·TP8 长上下文·正式版)2026-07-05
下载报告 PDF ↓
R3FX100 KV Cache 性能测试汇总报告(480B·TP4×2·全指标·品牌统一版)2026-07-06
下载报告 PDF ↓
本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章