LLM WIKI · 课程精读

FORMULAS · TRANSFORMERS · SYSTEMS

从公式到系统
大模型原理与
推理优化

把海安雨的手绘短视频按知识依赖重组为数学地基、Transformer 机制、推理系统、GPU 内核与模型压缩等主题单元,适合大模型原理学习和算法面试复习。

YOUR READING PROGRESS

学习进度

0 / 20 个单元
COURSE MAP · COMPLETE

五阶段 · 二十个主题单元

全部 174 条短视频已按知识依赖重组;每节都含人工筛选截图、原视频时间戳、公式推导与折叠练习答案。

  1. 01
    阶段 1 · 数学与计算地基11 节 · 34:52已整理 · 可阅读

    矩阵计算与反向传播

    从矩阵乘法的局部梯度出发,建立广播、归约、链式法则和 Jacobian 的统一视角。

    • 路径从矩阵乘法的局部梯度出发,建立广播、归约、链式法则和 Jacobian 的统一视角。
    进入单元 →11 节课 + 单元综合
  2. 02
    阶段 1 · 数学与计算地基6 节 · 23:48已整理 · 可阅读

    多元优化与几何直觉

    把泰勒展开、梯度下降、拉格朗日乘子和聚类边界从一元与平面直觉推广到高维。

    • 路径把泰勒展开、梯度下降、拉格朗日乘子和聚类边界从一元与平面直觉推广到高维。
    进入单元 →6 节课 + 单元综合
  3. 03
    阶段 1 · 数学与计算地基5 节 · 17:15已整理 · 可阅读

    概率与信息论

    用码长和高维几何理解熵、交叉熵、KL 散度与多元正态分布。

    • 路径用码长和高维几何理解熵、交叉熵、KL 散度与多元正态分布。
    进入单元 →5 节课 + 单元综合
  4. 04
    阶段 2 · Transformer 表示与训练11 节 · 25:24已整理 · 可阅读

    Transformer 计算图与语言模型训练

    建立从加权平均、分块矩阵乘法到 teacher forcing、错位预测和并行训练的完整计算图。

    • 路径建立从加权平均、分块矩阵乘法到 teacher forcing、错位预测和并行训练的完整计算图。
    进入单元 →11 节课 + 单元综合
  5. 05
    阶段 2 · Transformer 表示与训练14 节 · 38:52已整理 · 可阅读

    注意力机制与结构变体

    比较 MHA、MQA、GQA、MLA、自注意力与交叉注意力,并解释缩放、掩码和残差的计算语义。

    • 路径比较 MHA、MQA、GQA、MLA、自注意力与交叉注意力,并解释缩放、掩码和残差的计算语义。
    进入单元 →14 节课 + 单元综合
  6. 06
    阶段 2 · Transformer 表示与训练14 节 · 41:30已整理 · 可阅读

    RoPE:从旋转到相对位置

    从欧拉公式、和差角与旋转矩阵推导 RoPE,并连接 Llama 实现、外推和平移不变性。

    • 路径从欧拉公式、和差角与旋转矩阵推导 RoPE,并连接 Llama 实现、外推和平移不变性。
    进入单元 →14 节课 + 单元综合
  7. 07
    阶段 2 · Transformer 表示与训练5 节 · 13:26已整理 · 可阅读

    MoE 路由与负载均衡

    理解专家选择、门控归一化、无辅助损失均衡以及 prefill 阶段的并行负载。

    • 路径理解专家选择、门控归一化、无辅助损失均衡以及 prefill 阶段的并行负载。
    进入单元 →5 节课 + 单元综合
  8. 08
    阶段 2 · Transformer 表示与训练9 节 · 21:56已整理 · 可阅读

    残差流与超连接

    把普通残差、反向残差和超连接统一为可视化的前向信息流与反向梯度流。

    • 路径把普通残差、反向残差和超连接统一为可视化的前向信息流与反向梯度流。
    进入单元 →9 节课 + 单元综合
  9. 09
    阶段 2 · Transformer 表示与训练3 节 · 09:42已整理 · 可阅读

    训练动态与 Adam

    从指数移动平均、初期动量修正和二阶矩归一化理解 Adam 的训练行为。

    • 路径从指数移动平均、初期动量修正和二阶矩归一化理解 Adam 的训练行为。
    进入单元 →3 节课 + 单元综合
  10. 10
    阶段 3 · 推理与服务系统14 节 · 42:00已整理 · 可阅读

    KV Cache 与 Prefill/Decode 推理路径

    沿 prefill、decode、多轮对话、前缀复用和滑动窗口追踪 KV 的生成、堆积、复用与淘汰。

    • 路径沿 prefill、decode、多轮对话、前缀复用和滑动窗口追踪 KV 的生成、堆积、复用与淘汰。
    进入单元 →14 节课 + 单元综合
  11. 11
    阶段 3 · 推理与服务系统10 节 · 31:17已整理 · 可阅读

    采样、投机解码与多 Token 预测

    从采样退化条件、拒绝采样和概率树证明出发,理解投机解码与 MTP 的无损性和加速边界。

    • 路径从采样退化条件、拒绝采样和概率树证明出发,理解投机解码与 MTP 的无损性和加速边界。
    进入单元 →10 节课 + 单元综合
  12. 12
    阶段 4 · 内核效率与模型压缩11 节 · 32:04已整理 · 可阅读

    在线 Softmax 与 FlashAttention

    用分块等价性和在线归约状态解释 FlashAttention 的前向、反向、掩码与显存复杂度。

    • 路径用分块等价性和在线归约状态解释 FlashAttention 的前向、反向、掩码与显存复杂度。
    进入单元 →11 节课 + 单元综合
  13. 13
    阶段 4 · 内核效率与模型压缩9 节 · 21:20已整理 · 可阅读

    GPU 算子与稀疏计算

    从算子融合、SIMD、双缓冲和网格步进延伸到广播索引、CSR 与稀疏矩阵向量乘。

    • 路径从算子融合、SIMD、双缓冲和网格步进延伸到广播索引、CSR 与稀疏矩阵向量乘。
    进入单元 →9 节课 + 单元综合
  14. 14
    阶段 4 · 内核效率与模型压缩10 节 · 31:45已整理 · 可阅读

    GEMM、Tensor Core 与分布式并行

    追踪矩阵乘的数据复用,并连接双层缓冲、Tensor Core、张量并行和通信原语。

    • 路径追踪矩阵乘的数据复用,并连接双层缓冲、Tensor Core、张量并行和通信原语。
    进入单元 →10 节课 + 单元综合
  15. 15
    阶段 4 · 内核效率与模型压缩14 节 · 40:29已整理 · 可阅读

    量化与误差修正

    比较线性量化、聚类量化、SmoothQuant、OBQ、QAT 与残差修正的目标和硬件代价。

    • 路径比较线性量化、聚类量化、SmoothQuant、OBQ、QAT 与残差修正的目标和硬件代价。
    进入单元 →14 节课 + 单元综合
  16. 16
    阶段 4 · 内核效率与模型压缩11 节 · 32:00已整理 · 可阅读

    剪枝与二阶压缩

    从权重置零出发,比较 OBD、OBS、GPTQ 式二阶目标以及结构化注意力头剪枝。

    • 路径从权重置零出发,比较 OBD、OBS、GPTQ 式二阶目标以及结构化注意力头剪枝。
    进入单元 →11 节课 + 单元综合
  17. 17
    阶段 5 · 模型扩展、生成与对齐2 节 · 06:13已整理 · 可阅读

    多模态模型的结构可视化

    用人类可读的结构图理解 CLIP 与 OCR 模型中的表示、对齐和信息流。

    • 路径用人类可读的结构图理解 CLIP 与 OCR 模型中的表示、对齐和信息流。
    进入单元 →2 节课 + 单元综合
  18. 18
    阶段 5 · 模型扩展、生成与对齐3 节 · 11:02已整理 · 可阅读

    扩散过程的高维几何

    用旋转插值、球壳集中和非均匀角度理解 DDPM 的加噪与采样。

    • 路径用旋转插值、球壳集中和非均匀角度理解 DDPM 的加噪与采样。
    进入单元 →3 节课 + 单元综合
  19. 19
    阶段 5 · 模型扩展、生成与对齐7 节 · 17:54已整理 · 可阅读

    SFT、LoRA 与知识蒸馏

    比较合成思维链、低秩旁路、初始化、梯度差异与教师学生迁移。

    • 路径比较合成思维链、低秩旁路、初始化、梯度差异与教师学生迁移。
    进入单元 →7 节课 + 单元综合
  20. 20
    阶段 5 · 模型扩展、生成与对齐5 节 · 16:25已整理 · 可阅读

    强化学习与偏好优化

    从策略、价值、折扣回报和策略梯度连接 DQN、DPO 与语言模型交叉熵。

    • 路径从策略、价值、折扣回报和策略梯度连接 DQN、DPO 与语言模型交叉熵。
    进入单元 →5 节课 + 单元综合