personal chatgpt — LLMs 实践系列
B站 @chunhuizhang(五道口纳什)的 30 讲大模型实践课程。知识库将视频、带时间戳转录和固定提交的 Notebook 保存在原始资料层,再把内容编译为逐讲摘要与跨讲次概念页。
| 维度 | 状态 |
|---|---|
| 课程规模 | 30 讲 |
| 原始视频索引 | 30/30 |
| 带时间戳自动转录 | 30/30 |
| 逐讲知识摘要 | 30/30 |
| 已归档 Notebook | 34 份,均有 SHA-256 |
| 用户学习进度 | 28/30;第 29、30 讲尚未在滴答清单标记完成 |
| 状态核对时间 | 2026-08-02 19:04 CST |
1. 模型谱系与参数高效微调(第 1–4、6、24 讲)
Section titled “1. 模型谱系与参数高效微调(第 1–4、6、24 讲)”从 LLaMA、Alpaca、Vicuna 的关系和自回归推理开始,进入 LoRA(低秩适配) 的数学结构、PEFT 模块注入、8-bit 基座训练、adapter 加载与 merge/unload 生命周期。
2. 数值精度、量化和训练显存(第 5、7–8、11、13–14 讲)
Section titled “2. 数值精度、量化和训练显存(第 5、7–8、11、13–14 讲)”围绕 低精度浮点格式(FP16 与 BF16)、自动混合精度(AMP)、LLM.int8 量化、梯度累积与梯度检查点,区分权重、激活、梯度、优化器状态和重计算所解决的不同显存瓶颈。
3. Tokenizer 与数据管线(第 9–10、12、26 讲)
Section titled “3. Tokenizer 与数据管线(第 9–10、12、26 讲)”从 文本 Tokenizer 与 Byte-level BPE 的 normalization、pre-tokenization、BPE merge 和 special token,连接到 Hugging Face Datasets 数据管线、SFT 文本模板,以及 GPT-4o o200k_base 的多语言压缩率与大词表代价。
4. Llama 2/3 架构与生成源码(第 14–22、25、28–29 讲)
Section titled “4. Llama 2/3 架构与生成源码(第 14–22、25、28–29 讲)”沿源码串联 RMSNorm、SwiGLU、RoPE(旋转位置编码)、KV Cache、GQA(分组查询注意力) 与 自回归解码与采样;再通过 LLM 参数量分解 比较 Llama 2 7B 与 Llama 3 8B。第 28 讲额外介绍研究性方法 CoPE(上下文位置编码)。
5. SFT、Reward Modeling 与 RLHF(第 12、16、23、27、30 讲)
Section titled “5. SFT、Reward Modeling 与 RLHF(第 12、16、23、27、30 讲)”从 SFT(监督微调) 进入 奖励模型与 Bradley–Terry 偏好模型、PPO(近端策略优化) 和完整 RLHF(人类反馈强化学习) 组件关系,明确 policy、reference、reward 与 value 的不同职责。
| 讲次 | 主题 | 时长 | 学习状态 | 摘要与转录 | 课件/代码 |
|---|---|---|---|---|---|
| 01 | llama、alpaca、vicuna 整体介绍及 llama 推理过程 | 20:24 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 02 | LoRA(Low Rank Adaption)基本原理与基本概念,fine-tune 大语言模型 | 17:27 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 03 | LoRA fine-tune 大语言模型(peft、bloom 7b) | 27:25 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 04 | PEFT/LoRA 源码分析 | 13:21 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 05 | float16 与 bf16 表示和计算细节 | 13:27 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 06 | LLaMA,Alpaca LoRA 7B 推理 | 14:13 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 07 | fp16 与自动混合精度训练(amp)显著提升 batch size | 11:55 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 08 | LLM.int8 量化细节 (load_in_8bit)以及 bitsandbytes 库 | 18:12 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 09 | BPE gpt2 tokenizer 与 train tokenizer | 21:30 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 代码1 · 🔒 代码2 |
| 10 | 预训练语料,mapping & streaming(load_dataset) | 15:05 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 代码1 · 🔒 代码2 |
| 11 | gradient accumulation 显存优化 trick | 08:22 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 12 | LLM SFT training (trl SFTTrainer、alpaca dataset) | 10:34 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 13 | gradient checkpointing 显存优化 trick | 13:38 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 14 | llama2 introduction 及 fine tune llama2(guanaco dataset) | 17:20 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 15 | llama2 源码初步(text completion & chat completion) | 22:34 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 16 | trl 基础介绍:reward model,ppotrainer | 16:51 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 17 | llama2 源码分析(RMSNorm 与 SwiGLU) | 10:26 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 18 | llama2 源码分析 RoPE 相对位置编码的复数形式 | 12:05 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 19 | llama2 源码分析 RoPE apply_rotary_emb 从绝对位置编码到相对位置编码 | 15:27 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 20 | llama2 源码分析 cache KV(keys、values cache)加速推理 | 14:10 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 21 | llama2 源码分析 GQA:Grouped Query Attention | 07:34 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 22 | 1 llama2 源码分析 generate 的完整过程 | 26:55 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 23 | trl reward model 与 RewardTrainer(奖励模型,分类模型) | 18:36 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 24 | peft LoRA merge pipeline(lora inject,svd) | 20:44 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 代码1 · 🔒 代码2 · 🔒 代码3 |
| 25 | LLAMA 3 整体介绍(与 LLama 2 的不同?) | 19:54 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 26 | gpt-4o tokenizer 及特殊中文tokens(压缩词表),o200k_base | 10:00 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 27 | trl rlhf PPOTrainer,原理分析与代码走读(OpenRLHF framework) | 26:46 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 28 | 从 RoPE 到 CoPE(绝对位置编码,相对位置编码,Contextual Position Encoding) | 26:33 | ✅ 已完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 29 | Llama2 7B vs. Llama3 8B (词表、attention 及 mlp) | 19:10 | ⏳ 未完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
| 30 | instructGPT 中的 reward modeling,概率建模与损失函数性质 | 22:47 | ⏳ 未完成 | 摘要 · 🔒 转录 | 🔒 Notebook |
原始资料入口
Section titled “原始资料入口”- 🔒 30 讲原始资料索引
- 🔒 课件与代码映射表
- 🔒 课程权威清单
- 🔒 逐讲材料索引
- 🔒 Notebook SHA-256 清单
- 代码快照:
personal_chatgpt@7fbc298、bert_t5_gpt@c8b73f6
运行与证据边界
Section titled “运行与证据边界”- 自动转录是可追溯的原始资料,不等同于人工逐字校对稿;术语结论以 Notebook、源码和视频上下文交叉校正。
- 课程中的 CUDA、bitsandbytes、4-bit/8-bit 和大模型权重实验没有在当前 macOS 上冒充完成运行;页面明确区分静态代码审计与本地实测。
- 具体显存、吞吐和 batch size 只代表讲者当时的模型、硬件和软件版本,不作为跨环境固定结论。
- TRL、PEFT、Transformers 内部 API 高度版本化;知识点页面保留机制,逐讲页面保留当时实现。
- 当前未发现独立 PPT/PDF 课件;作者视频描述所链接的 Notebook 作为主要课件与代码来源。
- 先从逐讲“摘要”理解目标、关键公式和运行边界;
- 对关键结论跳转“转录”中的时间戳核对讲者原话;
- 再打开固定提交的 Notebook/源码复核实现;
- 跨讲次复习时,从本页的五条学习路线和概念页进入。