ggaaooppeenngg

为什么计算机科学是无限的但生命是有限的

把「每百万 token 成本」拆开算的一张交互表。核心公式只有一个:

成本=GPU 单价吞吐×3600×利用率×106  (¥/1M token)\text{成本} = \frac{\text{GPU 单价}}{\text{吞吐} \times 3600 \times \text{利用率}} \times 10^6 \; (\text{\yen}/\text{1M token})

折扣率 =1−成本÷官网价= 1 - \text{成本} \div \text{官网价}:正值为有安全垫,负值即按官网价卖要亏。

阅读全文 »

长上下文 decode 的显存瓶颈几乎全在 KV cache。MLA 已经把每 token 每层的缓存压到 576 维 latent(对比 MHA 约 43× 压缩),但 1M 上下文下 Kimi K3 仍要 27.6 GB——如果每张卡都存一份完整副本,8 卡一组就是无谓的 8 倍冗余。Decode Context Parallelism(DCP)的解法一句话可以说完:沿序列维度把 KV 切成条带,每张卡只缓存自己那一段;KV 全程不通信,通信只发生在 Q 侧,而 Q 的通信量正比于 batch、与上下文长度无关。本文以 SGLang 的 DCP 实现为线索,从 MLA 的两个吸收恒等式讲起,拆到 decode 一步的八阶段流水,最后算清显存和通信两笔账(维度取 Kimi K3 实测值)。

阅读全文 »

DeepSeek-V4.1-Flash 的技术报告副标题是 “Pushing the Limits of KV Cache Compression”——整篇论文的野心写在脸上:把 KV Cache 压到极致,把长上下文 Agent 负载的部署成本打下来。552B 骨干 + 196B 条件记忆,prefill 每 token 只激活 8B 参数,全局 KV 压到 890 字节/token(约 V4-Flash 的 1/4、V1 的 1/437),持久化 KV 压到 V4-Flash 的约 1/8。本文按报告第 2 章(架构)和第 3 章(推理系统)的顺序,把六个核心设计串成一条线:CED、CSA2、SWA Bounded Replay、Single-Pass mHC、FP4 主 KV、DSpark 与 Engram,最后算一笔总账。数字口径除标注外均来自论文原文,部分以 vLLM 实现/HF config 佐证。

阅读全文 »