公式:成本 = GPU 单价 ÷(吞吐 × 3600 × 利用率)× 1,000,000(¥/1M token)。折扣率 = 1 − 成本 ÷ 官网价;正 = 有安全垫,负 = 亏。默认参数取自 Kimi K3 · B300 整机租用口径,全部可改。
| 侧 | 保本吞吐 (tok/s) | 保本 GPU 单价 (¥/h) | 保本利用率 |
|---|---|---|---|
| 输出 | — | — | — |
| 输入 | — | — | — |
保本吞吐 = 吞吐 × 成本 ÷ 官网价;保本单价 = 单价 × 官网价 ÷ 成本;保本利用率 = 利用率 × 成本 ÷ 官网价。保本单价与利用率相互独立于当前 GPU 单价。
| 利用率 | 输入成本 ¥/1M | 输入折扣率 | 输出成本 ¥/1M | 输出折扣率 |
|---|
收入 = P_in·r + P_out,成本 = C_in·r + C_out(按每 1M 输出 token 折算,r = 输入 token ÷ 输出 token)。默认取第 7 节毛利表口径,可改。
不分输入输出、按聚合混合吞吐计:成本 = GPU 单价 ÷(混合吞吐 × 3600 × 填充率)× 1e6;日营收 = 售价 × 混合吞吐 × 86400 × 填充率。默认值取自《32台 B300 营收测算》表。
| 盈亏平衡 / 敏感性 | 保本混合吞吐 (tok/s/chip) | 保本填充率 | 保本售价 (¥/1M) |
|---|---|---|---|
| 口径:折扣率 = 0 反解 | — | — | — |
保本吞吐 = 当前吞吐 × 成本 ÷ 售价;保本填充率 = 当前填充率 × 成本 ÷ 售价;保本售价 = 当前售价 × 成本 ÷ 售价(即成本本身)。填充率阶梯:30% → — · 50% → — · 80% → — · 100% → —(混合成本 ¥/1M)。
| 校验项 | 期望值 | 实际值 | 状态 |
|---|
默认参数出处:吞吐 8279/58.6 tok/s、官网价 20/100 ¥/1M(Kimi K3 蓝本);B300 整机租用 35 万元/月·台 ÷ 8 卡 ÷ 720 h = 60.763889 ¥/GPU·h;自建基数 11.6/15.14/15.48 ¥/h(SemiAnalysis InferenceX $/chip·hr × 6.70);DeepSeek-V4.1-Flash API 价(空闲档):输入未命中 1 ¥ / 输出 4 ¥,吞吐请自填。