LLM 推理成本估算器

把「每百万 token 成本」拆开算的一张交互表。核心公式只有一个:

成本=GPU 单价吞吐×3600×利用率×106  (¥/1M token)\text{成本} = \frac{\text{GPU 单价}}{\text{吞吐} \times 3600 \times \text{利用率}} \times 10^6 \; (\text{\yen}/\text{1M token})

折扣率 =1−成本÷官网价= 1 - \text{成本} \div \text{官网价}:正值为有安全垫,负值即按官网价卖要亏。


估算器

手机上如果内嵌页显示不全,可以直接打开独立页:LLM 推理成本估算器。

功能说明

  • 预设:模型侧默认 Kimi K3(吞吐 8279/58.6 tok/s、官网价 20/100 ¥/1M),可切 DeepSeek-V4.1-Flash(API 价输入 1 / 输出 4,吞吐自填);硬件侧四档成本基数——B300 整机租用 60.76(35 万元/月·台 ÷ 8 卡 ÷ 720 h)、B300/GB300/B200 自建 15.14/15.48/11.6 ¥/h
  • GPU 单价推导链:月租金、单台卡数、每月小时数三个输入实时摊算,也可以直接手填单价
  • 保本点:输出侧保本吞吐 / 保本 GPU 单价 / 保本利用率三个反解维度(同一批参数下 B300 租用口径的输出侧保本吞吐 ≈ 281 tok/s,约为默认 58.6 的 4.8 倍)
  • 利用率阶梯:30/60/80/100% 四档的成本与折扣率对照
  • 保本输入输出比:收入线与成本线相交的结构线(默认毛利表口径下约 15.25:1,输入输出比低于它就转亏)
  • 交叉校验:重排公式的独立路径复算,差值小于 1e-6 判 PASS

口径提醒

默认组合(B300 租用单价 × B200 吞吐)是混口径敏感性演示,不是 B300 实测单位成本;要算真实成本必须换成对应硬件上实测的吞吐对。输入侧按全量 prefill(缓存未命中)计,是最保守档。详细口径拆解见文内说明。

参考

  • 蓝本:Kimi K3 on B200 成本与折扣率测算表(输入/输出两侧、折扣率口径)
  • SemiAnalysis InferenceX TCO $/chip·hr(自建基数 $1.73/$2.26/$2.31 × 6.70)
  • DeepSeek API 定价页、Kimi K3 官网价