两个核心模块解决两个问题
MEMORYMLA 联合压缩 K/V
COMPUTE21B 激活 / 236B 总参
SPECIALIZATIONShared + routed experts
MoE 让每个 token 只经过少量专家,但 autoregressive decoding 仍可能被 KV cache 与内存带宽卡住。MLA 通过低秩潜在表示重建各头的 key/value,把这个推理瓶颈直接纳入架构设计。
MLA 为什么不是普通低秩投影
如果 RoPE 直接作用在被压缩的 key 上,位置相关变换会妨碍推理时吸收权重。论文把承载 RoPE 的 query/key 分量解耦出来,其余内容分量走低秩压缩,使缓存缩减与相对位置编码能够同时成立。
所以阅读 MLA 公式时,应把每个向量拆成两类:负责“内容匹配”的压缩分量,以及负责“位置信息”的 RoPE 分量。
DeepSeekMoE 的关键不是只做稀疏
- 把专家切得更细,让路由组合拥有更高灵活度。
- 设置共享专家吸收常见知识,减少 routed experts 之间重复学习。
- 增加设备受限路由与多级负载均衡损失,控制跨机通信和专家拥塞。
论文给出的效率证据
相较 DeepSeek 67B,论文报告训练成本降低 42.5%、KV cache 减少 93.3%、最大生成吞吐达到 5.76 倍;同时以 8.1T token 预训练,并扩展到 128K 上下文。
DeepSeek‑V2 的价值是把“参数效率”从 FLOPs 指标推进到真实系统瓶颈。效率数字仍依赖论文的硬件、并行策略、batch 与序列长度;迁移到其他推理栈时,应复现实测而不是把倍率当作架构常数。