ggaaooppeenngg

为什么计算机科学是无限的但生命是有限的

长上下文 decode 的显存瓶颈几乎全在 KV cache。MLA 已经把每 token 每层的缓存压到 576 维 latent(对比 MHA 约 43× 压缩),但 1M 上下文下 Kimi K3 仍要 27.6 GB——如果每张卡都存一份完整副本,8 卡一组就是无谓的 8 倍冗余。Decode Context Parallelism(DCP)的解法一句话可以说完:沿序列维度把 KV 切成条带,每张卡只缓存自己那一段;KV 全程不通信,通信只发生在 Q 侧,而 Q 的通信量正比于 batch、与上下文长度无关。本文以 SGLang 的 DCP 实现为线索,从 MLA 的两个吸收恒等式讲起,拆到 decode 一步的八阶段流水,最后算清显存和通信两笔账(维度取 Kimi K3 实测值)。

阅读全文 »

DeepSeek-V4.1-Flash 的技术报告副标题是 “Pushing the Limits of KV Cache Compression”——整篇论文的野心写在脸上:把 KV Cache 压到极致,把长上下文 Agent 负载的部署成本打下来。552B 骨干 + 196B 条件记忆,prefill 每 token 只激活 8B 参数,全局 KV 压到 890 字节/token(约 V4-Flash 的 1/4、V1 的 1/437),持久化 KV 压到 V4-Flash 的约 1/8。本文按报告第 2 章(架构)和第 3 章(推理系统)的顺序,把六个核心设计串成一条线:CED、CSA2、SWA Bounded Replay、Single-Pass mHC、FP4 主 KV、DSpark 与 Engram,最后算一笔总账。数字口径除标注外均来自论文原文,部分以 vLLM 实现/HF config 佐证。

阅读全文 »

解法是分块递归:对角块的逆互不依赖、可以并行求,块间耦合退化成矩阵乘。C=32C = 32 时依赖链从 31 步压到 17 步,代价是算术量涨到 1.88 倍;C=64C = 64 多切一层,63 步压到 19 步。本文以 Qwen 团队 flash_qla 里的 kkt_solve 为样本,把这个 kernel 从数学恒等式一路拆到 bank conflict,包括三个不看代码想不到的工程细节,以及块长 CC 到底该取 32 还是 64。

阅读全文 »