LLM 推理成本估算器

公式:成本 = GPU 单价 ÷(吞吐 × 3600 × 利用率)× 1,000,000(¥/1M token)。折扣率 = 1 − 成本 ÷ 官网价;正 = 有安全垫,负 = 亏。默认参数取自 Kimi K3 · B300 整机租用口径,全部可改。

① 预设(填初值,之后可手改)

¥/GPU·h
tok/s/chip
tok/s/chip
%
¥/1M
¥/1M
GPU 单价推导(租用口径):月租金 ÷ 单台卡数 ÷ 每月小时数。 ¥/月·台 ÷ 卡 ÷ h = 60.7639 ¥/GPU·h 

② 结果

输入 token · 成本 / 折扣率
—
—
输出 token · 成本 / 折扣率
—
—
输入/输出成本比
—
= 吞吐反比,与 GPU 单价无关
每卡每月产出(30 天)
—
M token:输入 + 输出

③ 保本点(折扣率 = 0 反解)

侧保本吞吐 (tok/s)保本 GPU 单价 (¥/h)保本利用率
输出———
输入———

保本吞吐 = 吞吐 × 成本 ÷ 官网价;保本单价 = 单价 × 官网价 ÷ 成本;保本利用率 = 利用率 × 成本 ÷ 官网价。保本单价与利用率相互独立于当前 GPU 单价。

④ 利用率阶梯(随上面输入实时重算)

利用率输入成本 ¥/1M输入折扣率输出成本 ¥/1M输出折扣率

⑤ 保本输入输出比(结构线)

收入 = P_in·r + P_out,成本 = C_in·r + C_out(按每 1M 输出 token 折算,r = 输入 token ÷ 输出 token)。默认取第 7 节毛利表口径,可改。

¥/1M
¥/1M
¥/1M
¥/1M

⑥ 混合口径营收测算(32 台 B300 算例)

不分输入输出、按聚合混合吞吐计:成本 = GPU 单价 ÷(混合吞吐 × 3600 × 填充率)× 1e6;日营收 = 售价 × 混合吞吐 × 86400 × 填充率。默认值取自《32台 B300 营收测算》表。

tok/s
%
¥/1M
台卡
混合成本 / 折扣率
—
—
集群月营收 / 月租金(仅扣租金净利)
—
—
盈亏平衡 / 敏感性保本混合吞吐 (tok/s/chip)保本填充率保本售价 (¥/1M)
口径:折扣率 = 0 反解———

保本吞吐 = 当前吞吐 × 成本 ÷ 售价;保本填充率 = 当前填充率 × 成本 ÷ 售价;保本售价 = 当前售价 × 成本 ÷ 售价(即成本本身)。填充率阶梯:30% → — · 50% → — · 80% → — · 100% → —(混合成本 ¥/1M)。

⑦ 交叉校验(独立路径重排公式,差 < 1e-6 为 PASS)

校验项期望值实际值状态

默认参数出处:吞吐 8279/58.6 tok/s、官网价 20/100 ¥/1M(Kimi K3 蓝本);B300 整机租用 35 万元/月·台 ÷ 8 卡 ÷ 720 h = 60.763889 ¥/GPU·h;自建基数 11.6/15.14/15.48 ¥/h(SemiAnalysis InferenceX $/chip·hr × 6.70);DeepSeek-V4.1-Flash API 价(空闲档):输入未命中 1 ¥ / 输出 4 ¥,吞吐请自填。