LLM 推理成本估算器
把「每百万 token 成本」拆开算的一张交互表。核心公式只有一个:
折扣率 :正值为有安全垫,负值即按官网价卖要亏。
把「每百万 token 成本」拆开算的一张交互表。核心公式只有一个:
成本=吞吐×3600×利用率GPU 单价×106(¥/1M token)
折扣率 =1−成本÷官网价:正值为有安全垫,负值即按官网价卖要亏。
长上下文 decode 的显存瓶颈几乎全在 KV cache。MLA 已经把每 token 每层的缓存压到 576 维 latent(对比 MHA 约 43× 压缩),但 1M 上下文下 Kimi K3 仍要 27.6 GB——如果每张卡都存一份完整副本,8 卡一组就是无谓的 8 倍冗余。Decode Context Parallelism(DCP)的解法一句话可以说完:沿序列维度把 KV 切成条带,每张卡只缓存自己那一段;KV 全程不通信,通信只发生在 Q 侧,而 Q 的通信量正比于 batch、与上下文长度无关。本文以 SGLang 的 DCP 实现为线索,从 MLA 的两个吸收恒等式讲起,拆到 decode 一步的八阶段流水,最后算清显存和通信两笔账(维度取 Kimi K3 实测值)。
DeepSeek-V4.1-Flash 的技术报告副标题是 “Pushing the Limits of KV Cache Compression”——整篇论文的野心写在脸上:把 KV Cache 压到极致,把长上下文 Agent 负载的部署成本打下来。552B 骨干 + 196B 条件记忆,prefill 每 token 只激活 8B 参数,全局 KV 压到 890 字节/token(约 V4-Flash 的 1/4、V1 的 1/437),持久化 KV 压到 V4-Flash 的约 1/8。本文按报告第 2 章(架构)和第 3 章(推理系统)的顺序,把六个核心设计串成一条线:CED、CSA2、SWA Bounded Replay、Single-Pass mHC、FP4 主 KV、DSpark 与 Engram,最后算一笔总账。数字口径除标注外均来自论文原文,部分以 vLLM 实现/HF config 佐证。