READING NOTES · DEEPSEEK-V2

把 MoE 的计算优势真正带到推理端

MLA 压缩 KV cache,DeepSeekMoE 提高专家专门化;两者分别处理带宽瓶颈与训练成本。
返回中文全文 →

两个核心模块解决两个问题

MEMORYMLA 联合压缩 K/V
COMPUTE21B 激活 / 236B 总参
SPECIALIZATIONShared + routed experts

MoE 让每个 token 只经过少量专家,但 autoregressive decoding 仍可能被 KV cache 与内存带宽卡住。MLA 通过低秩潜在表示重建各头的 key/value,把这个推理瓶颈直接纳入架构设计。

MLA 为什么不是普通低秩投影

如果 RoPE 直接作用在被压缩的 key 上,位置相关变换会妨碍推理时吸收权重。论文把承载 RoPE 的 query/key 分量解耦出来,其余内容分量走低秩压缩,使缓存缩减与相对位置编码能够同时成立。

所以阅读 MLA 公式时,应把每个向量拆成两类:负责“内容匹配”的压缩分量,以及负责“位置信息”的 RoPE 分量。

DeepSeekMoE 的关键不是只做稀疏

  • 把专家切得更细,让路由组合拥有更高灵活度。
  • 设置共享专家吸收常见知识,减少 routed experts 之间重复学习。
  • 增加设备受限路由与多级负载均衡损失,控制跨机通信和专家拥塞。

论文给出的效率证据

相较 DeepSeek 67B,论文报告训练成本降低 42.5%、KV cache 减少 93.3%、最大生成吞吐达到 5.76 倍;同时以 8.1T token 预训练,并扩展到 128K 上下文。

批判性判断

DeepSeek‑V2 的价值是把“参数效率”从 FLOPs 指标推进到真实系统瓶颈。效率数字仍依赖论文的硬件、并行策略、batch 与序列长度;迁移到其他推理栈时,应复现实测而不是把倍率当作架构常数。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭