LEARNING UNIT · 03
概率与信息论
用码长和高维几何理解熵、交叉熵、KL 散度与多元正态分布。
- 已整理章节
- 6 节
- 单元来源
- 5 条视频
- 总时长
- 17:15
- 状态
- 已发布
- 学习位置
- 3 / 20
主题讲解 · 03:26
前向 KL 与反向 KL:模式覆盖和模式寻优
学习目标
- 区分 与 的加权分布。
- 从支撑集和零概率项解释两种 KL 的不同惩罚。
- 理解 mode covering 与 mode seeking 为何会在受限模型中出现。
- 识别“前向平均、反向专精”结论成立的条件与边界。
前置与衔接
设 是真实分布, 是模型分布。
离散情形的前向 KL 为:
反向 KL 为:
两式只交换 , 但这一步同时改变了:
- 谁提供加权权重。
- 哪些区域会被实际采样。
- 哪一种支撑缺失产生无限损失。
前向 KL 与反向 KL 只交换 的位置,但期望由谁加权会改变损失关注的区域。
原视频 · 00:20 ↗本课默认概率分布定义在同一离散样本空间。
连续情形把求和替换为积分, 并把“某点有概率”改为“某区域有正密度或正测度”。
核心讲解
1. 前向 KL 由真实分布 加权
展开单项:
只有 的位置会被 的期望看见。
若:
则:
在 中,只要 ,若 就会产生无限惩罚。
原视频 · 01:00 ↗因此前向 KL 有限需要:
直觉上, 模型不能漏掉任何真实可能发生的事件。
这就是“模式覆盖”的支撑基础。
2. 的项如何处理
当 时, KL 单项按极限约定为:
当 时,约定 ,该位置不会直接贡献前向 KL。
原视频 · 01:20 ↗这不表示 可以在所有真实零质量位置随意增大。
因为 仍需归一化:
把概率质量放到 不支持的位置, 会减少真实支撑上的 , 从而间接增加那些位置的损失。
所以更准确的表述是:
3. 为什么前向 KL 常表现为模式覆盖
考虑具有两个相隔很远峰值的真实分布 。
若模型族 足够强, 最优解当然可以直接做到:
此时前向和反向 KL 都为零。
差异出现在模型表达能力受限时。
例如只允许 是一个单峰、较简单的分布。
受限模型用单个平缓分布覆盖多个真实峰值,是前向 KL 常见的 mode-covering 倾向。
原视频 · 01:40 ↗前向 KL 对两个真实峰都有 权重。
若 只覆盖左峰, 右峰处的 太小, 会产生很大损失;
若只覆盖右峰, 左峰同理。
受限模型于是可能选择:
- 均值落在两个峰之间。
- 方差增大。
- 用一个宽而低的分布同时照顾两个峰。
这种行为称为:
mode covering, 即尽量覆盖真实分布的多个模式。
4. “平均”不是前向 KL 的无条件结论
视频用模糊手写数字说明平均化直觉。
需要补上三个条件:
- 本身具有多个互相分离的模式。
- 无法精确表达这些模式。
- 模型的参数化允许通过中心化或增大方差折中。
若模型是多峰混合模型且容量足够, 最优前向 KL 不需要生成峰间的“平均样本”。
若输出空间的均值不具备语义, “平均”也可能表现为其他覆盖策略, 不一定是像素级模糊。
因此课程标题中的“倾向平均”应理解为:
5. 反向 KL 由模型分布 加权
反向 KL 的单项为:
若:
则该项为 。
所以反向 KL 有限需要:
模型若把质量放到真实分布完全不支持的位置, 会受到无限惩罚。
6. 为什么能忽略一个真实模式
当 且 时, 按极限:
另一方面, 若 , 则:
在反向 KL 的某个真实有质量区域, 的项按极限为零,而 时也有 。
原视频 · 02:20 ↗关键在于期望由 加权。
模型没有采样到的区域, 不会在这个期望中直接出现。
因此一个容量有限的模型可以:
- 选择一个真实高密度区域。
- 在该区域内贴近 。
- 几乎不给其他模式概率质量。
7. 为什么反向 KL 常表现为模式寻优
受限模型集中拟合一个峰并避开低密度山谷,是反向 KL 常见的 mode-seeking 倾向。
原视频 · 02:40 ↗若 跨过两个峰, 它可能不得不在峰间山谷放置概率质量。
山谷处 很小, 而 不小, 于是:
会变大。
为了避开低密度区域, 模型可能只选择其中一个峰。
这种行为称为:
mode seeking, 即集中寻找并拟合一个高密度模式。
在生成任务中, 它可能表现为:
- 样本很清晰。
- 生成类别较少。
- 某些真实模式长期不出现。
这与 mode collapse 有相似现象, 但二者不能机械等同; 实际 GAN 的 mode collapse 还涉及对抗优化动态和网络训练问题。
8. 一个更严格的高斯例子
以下为编者补充。
假设真实分布是双峰混合分布, 而模型被限制为单个高斯。
最小化:
时, 高斯指数族的最优解会匹配 的一、二阶矩。
所以模型均值可能落在两峰之间, 方差覆盖两峰间距。
这给出“宽而平均”的严格例子。
最小化:
时, 若 覆盖两峰, 山谷的低 会提高损失; 局部最优常落在某个峰附近。
但具体选择哪个峰, 可能受初始化、峰高、峰宽和优化器影响。
9. 与最大似然的关系
对固定真实数据分布 :
第一项与 无关。
因此最小化前向 KL 等价于最大化数据对数似然。
这也是监督密度估计常自然得到前向 KL 的原因。
反向 KL 则需要在 下取期望, 并评估真实密度 ; 在很多真实数据任务中, 只可采样而不可直接计算, 所以并不总能直接优化。
10. 支撑规则汇总
| 情况 | 前向 | 反向 |
|---|---|---|
| 单项为 | ||
| 单项为 | ||
| 期望加权者 | ||
| 常见受限模型倾向 | mode covering | mode seeking |
这里的“单项为零”采用标准极限约定, 且不能忽略全分布归一化。
跟练与练习
编者练习
真实分布为: 比较两个模型: 判断四个 KL: 哪些为无穷大。
查看参考答案
,
因为 而 。
有限,
因为 的支撑包含于 的支撑。
,
同样因为 而 。
,
因为 而 。
这个例子说明:
前向 KL 检查 是否被 覆盖,
反向 KL 检查 是否越出 。
常见误区
误区 1:前向 KL 必然生成均值
只有模型族受限时, 覆盖多个模式才可能以宽分布或平均样本表现出来。
容量足够时, 两种方向的全局最优都是 。
误区 2:反向 KL 会无成本删除任意概率质量
被删除区域没有直接的 -加权项, 但剩余质量必须重新归一化, 其他区域的比值会随之变化。
误区 3:KL 是对称距离
一般:
KL 也不满足三角不等式, 所以不是严格意义上的距离度量。
误区 4:连续分布中只检查某个点是否为零
连续分布的单点通常概率为零。
真正相关的是密度比、 绝对连续性和具有正测度的支撑区域。
误区 5:JS 或 Wasserstein 自动解决所有问题
不同散度改变梯度和支撑行为, 但仍受模型容量、估计误差和优化算法限制。
选择目标函数不能脱离训练方式与任务评价。
本课小结
- 前向 KL 由 加权,漏掉真实支撑会产生无限惩罚。
- 反向 KL 由 加权,越出真实支撑会产生无限惩罚。
- 受限模型下,前向 KL 常表现为 mode covering,反向 KL 常表现为 mode seeking。
- “平均”和“专精”是条件化倾向,不是对所有模型族的无条件定理。
- 支撑、归一化和极限约定必须一起检查。
- 最大似然对应最小化数据分布到模型分布的前向 KL。
主题讲解 · 03:17
从自信息到 KL:码长视角下的熵与交叉熵
学习目标
- 从自信息 理解概率与理想码长的关系。
- 区分信息熵、交叉熵和 KL 散度各自由谁加权、使用谁的码长。
- 用二元数值例子算出最优、错配与浪费的平均码长。
- 准确区分理想码长、单符号整数前缀码和渐近块编码。
前置与衔接
本课考虑离散事件集合:
真实分布为:
若对数以 为底, 信息单位是 bit。
单个事件的自信息定义为:
概率越小, 事件越意外, 自信息越大。
本课视频把自信息直接解释为码长。
为了保持数学严谨, 正文会使用“理想码长”一词, 并在后文说明实际二进制前缀码的整数限制。
核心讲解
1. 为什么概率倒数的对数像码长
若有 个等概率符号:
则每个符号的自信息为:
八个等概率符号的自信息为 bit,恰好可用三位定长码区分。
原视频 · 00:40 ↗三位二进制串正好有:
种取值。
这个例子中, 理想码长恰好是整数, 可以直接实现为单符号定长码。
更一般地, 若一个事件概率为 , 理想码长就是 bit。
2. 真实分布与编码分布是两件事
视频使用两个事件:
但编码者事先不知道 , 采用假设分布:
真实分布 与假设分布 会导出两套不同的理想码长。
原视频 · 01:00 ↗这里要分清:
- 决定真实数据中事件出现的频率。
- 决定编码器为事件分配的理想码长。
若按分布 设计, 理想码长为:
3. 两套分布给出两套理想码长
按真实分布 :
按假设分布 :
按分布 设计的理想码长为 ,概率越大,理想码长越短。
原视频 · 01:20 ↗概率大的事件获得短码, 概率小的事件获得长码。
错配 把 看得比真实情况更常见, 所以给 更短的理想码;
同时把 看得更少见, 所以给 更长的理想码。
4. 平均时为什么必须由 加权
即使编码器使用 设计码长, 现实中抽到 的频率仍由 决定。
无论码长由 还是 设计,实际平均码长都必须按真实出现频率 加权。
原视频 · 02:00 ↗所以平均理想码长的一般形式是:
注意两个位置:
- 求和外的权重始终是 。
- 对数里的码长模型可以是 或 。
这正是信息熵与交叉熵的区别。
5. 信息熵是使用真实分布时的平均理想码长
令 :
代入二元例子:
使用真实分布的理想码长时,期望长度为 bit。
原视频 · 02:20 ↗更精确地:
这表示:
在理想化或渐近编码意义下, 每个符号至少需要约 bit。
它不是说单独一个 可以用 个物理 bit 直接存储。
6. 交叉熵是使用错配分布时的平均理想码长
令 :
代入例子:
使用错配分布 的理想码长时,交叉熵约为 bit,多出的约 bit 是 KL 散度。
原视频 · 02:40 ↗更精确地:
它比 大:
这就是因分布错配造成的平均额外理想码长。
7. KL 散度就是两者之差
由定义:
展开对数:
所以本例:
三者的码长解释为:
| 量 | 使用的理想码长 | 真实权重 | 含义 |
|---|---|---|---|
| 匹配编码的平均理想码长 | |||
| 错配编码的平均理想码长 | |||
| 两者之差 | 平均额外理想码长 |
8. “熵等于最优码长”的严格边界
以下是视频直觉之外的必要补充。
二进制单符号前缀码的码字长度必须是整数:
而:
通常不是整数。
对任意二进制前缀码, 平均长度 满足:
Shannon 码或 Huffman 码可达到:
当把很多独立符号组成长度为 的块再编码时, 可以让每符号平均长度趋近:
算术编码也能接近这一极限。
因此更准确的说法是:
视频中的小数码长适合用于这一理想化分析, 不能直接画成单个二进制码字的物理长度。
9. 支撑不匹配会怎样
若存在某事件:
则:
从而:
编码解释是:
模型 认为该事件绝不发生, 根本没有为它准备有限理想码长;
但真实分布 又确实会生成它。
跟练与练习
编者练习
设: 用以 为底的对数计算:
查看参考答案
因为 为均匀分布,
两事件的理想码长都是 bit:
所以:
常见误区
误区 1:概率就是码长
码长对应的是概率的负对数, 不是概率本身:
误区 2:交叉熵由 加权
在 中, 权重仍是 :
只决定码长。
误区 3:0.97 bit 可以作为单个二元符号的整数前缀码
单个码字长度必须是整数。
0.97 bit 是期望下界或渐近每符号速率, 不是单次存储长度。
误区 4:对数底不影响数值
对数底改变单位:
- 对应 bit。
- 对应 nat。
同一个散度的两个数值相差常数因子。
误区 5:KL 是“多写了多少个完整 bit”
KL 是平均额外理想码长, 可以是任意非负实数。
在有限块编码中, 还要考虑整数舍入和编码器开销。
本课小结
- 自信息 把低概率事件映射为较长的理想码长。
- 信息熵 是按真实分布使用匹配理想码长的期望。
- 交叉熵 仍由 加权,但码长来自 。
- KL 散度 是平均额外理想码长。
- 熵是整数前缀码平均长度的下界,并在长块编码中渐近可达。
- 若 有质量而 给零概率,交叉熵和前向 KL 都为无穷大。
主题讲解 · 03:06
KL 非负为何等价于信息熵最优
学习目标
- 理解 、 和 的精确恒等式。
- 说明“KL 非负”与“匹配分布给出最小交叉熵”为何互相等价。
- 从真实频率与模型码长的配对理解分布错配。
- 写清等号条件、支撑条件和理想码长边界。
前置与衔接
设离散真实分布为:
模型或假设分布为:
二者都满足:
视频使用二元例子:
真实分布 与模型分布 构成一个具体的错配编码例子。
原视频 · 00:20 ↗本课采用以 为底的对数解释 bit。
若改用自然对数, 所有量按常数比例变为 nat, 不影响非负性和最优分布。
核心讲解
1. 真实出现频率永远由 决定
按分布 设计的理想码长为:
若编码器采用错误模型 , 理想码长变为:
但真实数据中事件 出现的长期频率仍是 。
即使码长由 设计,事件在真实数据中的出现频率仍由 决定。
原视频 · 01:00 ↗因此实际平均理想码长是:
这正是交叉熵:
2. 匹配编码得到信息熵
若使用真实分布 设计理想码长:
平均理想码长为:
所以 和 的共同点是:
- 都在真实分布 下取期望。
- 都使用 作为加权权重。
区别只在码长来自:
- 自己。
- 假设分布 。
3. 编码树与带权路径长度的类比
树的带权路径长度可类比平均码长:边权表示真实频率,叶子代价表示采用的码长。
原视频 · 01:20 ↗树的带权路径长度写作:
将它类比到编码:
- 对应真实出现频率 。
- 对应事件的码长。
于是:
这里是概念类比, 不是说概率本身等于树边的整数长度。
视频画出的 通常是小数, 应理解为理想码长。
对实际单符号二进制前缀码, 码长必须为整数; 熵是平均长度下界, 长块编码可渐近逼近它。
4. 平均浪费码长就是两者相减
定义平均额外理想码长:
把平均浪费码长写成错配码长与理想码长之差。
原视频 · 01:40 ↗展开:
因此:
不是近似关系, 而是定义展开后的精确恒等式。
5. 为什么两个平均量都由 加权
交叉熵与信息熵都由 加权,区别只在对数项使用 还是 。
原视频 · 02:00 ↗写成期望形式:
数据来自真实世界, 所以期望的采样分布都是 。
编码模型只决定:
这也是机器学习中交叉熵训练的基本结构:
- 样本来自数据分布。
- 模型给样本分配概率。
- 损失是模型概率的负对数。
6. 从 KL 非负推出信息熵最优
Gibbs 不等式给出:
代入恒等式:
移项:
这说明在所有候选分布 中, 使用真实分布 自己的理想码长不会更差。
分布错配带来的平均额外理想码长不能为负。
7. 从信息熵最优反推 KL 非负
反过来, 若已知对任意可行 :
两边相减:
再使用恒等式:
与 通过同一恒等式互相等价。
原视频 · 02:40 ↗因此二者“等价”的准确含义是:
在恒等式:
成立的同一概率模型中, 任一不等式都能直接推出另一个。
8. 等号什么时候成立
对规范化概率分布, 若 KL 有限:
当且仅当:
在 几乎处处成立。
离散情形可理解为:
所有 的事件上都有 。
由于 都归一化, 这也会排除在 处额外放置正质量。
于是:
9. 支撑不匹配时仍成立吗
若存在:
则约定:
同时:
所以扩展实数意义下:
仍与“错配码长不小于匹配码长”一致。
为了进行普通有限数运算, 应要求:
10. “信息熵最优”最优的是什么
这里的最优对象是:
即在所有概率预测 中, 真实分布 使期望 log-loss 最小。
这也说明 log-loss 是严格 proper scoring rule:
诚实报告真实概率在期望意义下最优。
这是视频之外的编者补充。
若讨论实际整数前缀码, 还需经过 Kraft 不等式、Huffman 编码或块编码, 不能把每个 直接当作可实现的整数码长。
跟练与练习
编者练习
已知: 不直接计算 KL 求和, 先算 与 , 再用恒等式求 。
查看参考答案
以 为底:
所以:
结果为正,
并量化了使用 所增加的平均理想码长。
常见误区
误区 1:交叉熵的权重是
期望由真实分布 加权, 只进入码长。
误区 2:KL 非负与熵最优是两个无关结论
它们由:
直接连接, 是同一不等式的两种表述。
误区 3:信息熵小于任何交叉熵,包括任意未归一化分数
这里要求 是合法概率分布。
若输入任意未归一化分数, 必须先说明归一化方式或改写目标。
误区 4:等号可以在 时成立
对规范化分布和标准 KL, 等号要求 几乎处处。
误区 5:最优平均理想码长等于任意实际码的平均长度
单符号前缀码受整数码长限制。
信息熵是下界, 长块编码才可把每符号长度逼近该下界。
本课小结
- 与 都由真实概率 加权。
- 二者的区别是理想码长分别来自 与 。
- 精确恒等式是 。
- KL 非负与 可通过恒等式互相推出。
- 等号在 时成立;支撑缺失会让前向 KL 和交叉熵变为无穷大。
- 码长解释属于理想或渐近编码语境,不能忽略整数前缀码边界。
主题讲解 · 03:47
多元正态分布:从标量方差到协方差几何
学习目标
- 从一元正态公式逐项推广到多元正态密度。
- 用 shape 解释向量输入为什么仍得到标量密度。
- 从协方差矩阵的特征值、特征向量理解椭圆等高线。
- 说明多元标准正态在扩散模型噪声采样中的作用。
前置与衔接
一元正态分布写作:
密度为:
它由两个标量参数唯一确定:
- 均值 控制中心。
- 方差 控制尺度。
一元正态由均值 定位中心,由方差 控制曲线的宽窄和峰值高度。
原视频 · 00:40 ↗密度值不是单点概率。
对连续随机变量:
多元推广仍保持这个原则: 输入变成向量, 输出仍是标量密度。
核心讲解
1. 从两个标量参数到两个张量参数
多元正态写作:
其中:
均值向量为:
协方差矩阵为:
其元素:
所以:
- 对角线 是每一维的方差。
- 非对角线 描述两维的线性共同变化。
2. 多元正态密度公式
当 对称正定时, 非退化多元正态密度为:
公式可分成三部分:
- 决定中心。
- Mahalanobis 二次型决定离中心的标准化距离。
- 负责总体积尺度的归一化。
若 仅半正定且奇异, 分布会落在低维仿射子空间; 此时不能直接使用含普通逆矩阵和普通 维密度的上式。
这是视频之外的必要边界。
3. 为什么一元正态是 的特例
当 :
于是:
这里使用 。
并且:
同时:
当 时,向量退化为标量,协方差矩阵退化为 ,多元公式还原为一元公式。
原视频 · 01:20 ↗代回多元公式:
恰好得到一元正态密度。
这不是形状相似, 而是严格的代数特例。
4. 向量输入为什么映射到标量
令:
采用列向量约定:
因此:
Mahalanobis 二次型由行向量、 逆协方差和列向量相乘,最终输出标量。
原视频 · 02:00 ↗行列式:
也是标量。
指数函数输入、归一化系数和最终密度全是标量。
所以:
多元不是“输出一个概率向量”, 而是“给一个空间位置计算一个密度高度”。
5. Mahalanobis 距离修正了各方向尺度
定义平方 Mahalanobis 距离:
若某方向方差大, 沿该方向移动同样的欧氏距离不那么异常;
若某方向方差小, 同样位移会得到更大的标准化距离。
密度等高线满足:
在二维中, 这是椭圆。
6. 特征分解给出椭圆主轴
对称正定协方差可分解为:
其中:
几何含义:
- 的列向量给出椭圆主轴方向。
- 给出对应方向的方差。
- 固定等高线半轴长度与 成正比。
这比只记“协方差控制形状”更精确。
7. 单位阵与对角协方差
若:
则:
所有方向尺度相同, 二维等高线是圆。
若:
第一维标准差为 , 第二维标准差为 。
单位协方差给出圆形等高线,对角方差不等时等高线沿坐标轴拉伸为椭圆。
原视频 · 02:40 ↗椭圆沿第一维更宽, 但主轴仍与坐标轴重合。
8. 非零协方差为什么旋转椭圆
考虑:
非对角元为正, 表示两个变量倾向同向变化。
椭圆长轴朝 同号方向倾斜。
再考虑:
非对角元为负, 表示两个变量倾向反向变化。
非零协方差会旋转椭圆主轴;正负协方差对应相反的倾斜方向。
原视频 · 03:00 ↗原始 ASR 在负相关示例处仍识别成“协方差是一”。
画面明确写为 , 且后文说“负相关”, 所以本文依据画面与上下文校正负号。
更一般地, 倾斜方向由特征向量决定, 不能只靠非对角元正负判断高维全部几何。
9. 行列式控制总体积尺度
协方差特征值满足:
因此:
它与等密度椭球的体积尺度成正比。
协方差整体变大时, 分布在空间中铺得更开;
为了让总积分仍为 , 峰值高度相应降低。
10. 多元标准正态与扩散噪声
多元标准正态为:
它满足:
以原点为中心、各维单位方差,是扩散模型常用的噪声分布。
原视频 · 03:20 ↗因为是联合高斯且协方差为单位阵, 各分量不仅不相关, 而且相互独立:
DDPM 的终端噪声和反向生成初值通常围绕这一分布构造。
“通常”很重要: 具体扩散模型可能采用其他先验、潜空间尺度或协方差约定。
11. 从标准高斯生成一般高斯
以下为编者补充。
若 是 Cholesky 分解, 且 , 则 满足:
验证协方差:
这把协方差几何直接连接到采样算法。
跟练与练习
编者练习
给定: 回答:
- 等高线是圆还是椭圆?
- 长轴沿哪个坐标方向?
- 两个主轴方向的标准差分别是多少?
查看参考答案
它是轴对齐椭圆。
第一维方差为 ,
标准差为 ;
第二维方差为 ,
标准差为 。
所以长轴沿第一坐标方向,
相同 Mahalanobis 半径下,
第一维半轴长度是第二维的 倍。
常见误区
误区 1: 的每个元素都是方差
只有对角元素是方差。
非对角元素是协方差。
误区 2:零协方差对任意分布都推出独立
一般只能推出不相关。
联合高斯是特殊情形: 零协方差可以推出独立。
误区 3:密度高度就是某点概率
连续变量单点概率通常为零。
概率由区域上的密度积分得到。
误区 4:任意对称矩阵都能做协方差
协方差至少要对称半正定。
普通非退化密度公式还要求正定。
误区 5:协方差只改变宽窄,不改变方向
非对角协方差会改变特征向量, 从而旋转椭圆或椭球主轴。
本课小结
- 一元正态的均值和方差在多元中推广为均值向量和协方差矩阵。
- 时,多元密度逐项严格还原一元密度。
- Mahalanobis 二次型把向量、矩阵、向量收缩为标量。
- 协方差特征向量控制方向,特征值控制各主轴尺度。
- 非对角协方差旋转等高线;画面确认负相关示例的非对角元为 。
- 是扩散模型常用噪声分布,并可经线性变换生成一般高斯。
主题讲解 · 03:39
只用对数不等式证明 KL 散度非负
学习目标
- 用高中导数证明 。
- 把对数不等式逐项代入 KL 求和。
- 写出概率归一化如何把下界化为零。
- 正确处理 、、对数底和等号条件。
前置与衔接
离散 KL 散度定义为:
本课使用自然对数,单位是 nat。
需要证明:
证明的关键只有一个一元不等式:
对 , 位于 与 之间,其中下界将用于证明 KL 非负。
原视频 · 00:20 ↗它与更常见的不等式:
二者可以通过倒数代换得到。
核心讲解
1. 先用导数证明
定义:
求导:
因此:
- 当 时,。
- 当 时,。
- 当 时,。
所以 在 处取得全局最小值:
于是:
即:
等号仅在:
时成立。
2. 通过倒数代换得到所需下界
在上式中令:
则:
利用:
得到:
两边乘 时不等号反向:
等号同样仅在 时成立。
3. 建立真实分布与假设分布
视频用三个事件 :
概率满足:
真实数据出现频率由 决定,模型 只给出另一套概率估计。
柱状图不重合, 表示模型概率与真实概率错配。
4. 码长图像提供物理直觉
信息熵与交叉熵分别为:
信息熵与交叉熵都按真实概率 加权,但叶子理想码长分别来自 与 。
原视频 · 01:00 ↗两者相减即:
因此 KL 是错配模型增加的平均理想码长。
5. 概率与码长为什么要反向排序
高概率事件应分配短码, 低概率事件应分配长码。
高概率事件应匹配短码长;分布错配会打乱真实频率与理想码长的配对。
原视频 · 01:40 ↗视频用排序不等式说明: 高概率与短码匹配会降低平均代价。
这只是直觉辅助; 严格证明仍依赖对数不等式, 且不要求 是 的排列。
6. 先处理会让 KL 直接无穷大的情况
定义真实支撑:
若存在 满足:
则:
此时:
结论已经成立。
所以有限情形只需讨论:
这一步保证后面的比值:
严格为正, 可以代入对数不等式。
7. 对每个真实支撑上的事件使用不等式
对 , 令:
令 ,由 得到 。
原视频 · 02:40 ↗由:
得到:
因为 , 两边乘 不改变不等号方向:
8. 消去分母得到
乘回 后, 化简为 。
原视频 · 03:00 ↗右侧直接化简:
所以:
在真实支撑 上求和:
9. 用概率归一化闭合证明
因为所有真实概率质量都在 :
而 在 上的质量不超过全部质量:
因此:
利用 ,下界化为零,从而得到 。
原视频 · 03:20 ↗若所有 , 则 是完整样本空间, 视频中的简化正好是:
本文使用 的写法, 是为了兼容某些 的一般情况。
10. 等号条件
KL 等于零需要两层不等式都取等:
第一, 对所有 :
对数不等式只在比值为 时取等, 所以:
第二:
即 不能在 支撑外另放概率质量。
因此:
在离散情形逐点成立。
11. 换对数底仍然非负
若 ,则:
由于 , 正比例缩放不改变非负性和等号条件。
- 自然对数对应 nat。
- 以 为底对应 bit。
跟练与练习
编者练习
设: 不用计算精确对数, 只用本文证明中的下界估计: 至少不小于多少?
查看参考答案
真实支撑为:
所以:
这里 把 的质量放在 不支持的第三个事件上,
导致真实支撑上的总质量只有 。
实际 KL 可能大于这个下界,
但一定不小于 nat。
常见误区
误区 1:不检查 就代入对数不等式
必须先保证 。 时 KL 已经是无穷大,应单独处理。
误区 2:两边乘 后不改变不等号
从 乘 后必须变为 。
误区 3: 时继续除以
对这些位置采用 的极限约定, 并只在 上代换。
误区 4:非负性意味着 KL 是距离
KL 一般不对称, 也不满足三角不等式。
它是散度, 不是严格的度量距离。
误区 5:排序直觉已经完成了严格证明
概率与短码配对提供编码直觉。
对任意 的严格非负证明, 仍需对数不等式或其他等价工具。
本课小结
- 高中导数可证明 ,再由倒数代换得到 。
- 对 逐项应用下界,可得 。
- 概率归一化把求和下界化为非负数,从而证明 KL 非负。
- 若 ,KL 为无穷大;若 ,该项按极限为零。
- KL 等于零当且仅当 。
- 更换对数底只做正比例缩放,不改变非负性。
单元综合
从最优码长到高斯几何:概率分布的差异与形状
单元能力目标
完成本单元后,应能从两条互补路线理解概率分布:
- 信息路线:事件概率如何对应自信息、熵、交叉熵与 KL 散度;
- 几何路线:均值向量与协方差矩阵如何决定多元正态分布的位置、方向和尺度。
具体需要做到:
- 用理想码长解释 、 与 ;
- 处理 、 和支撑不匹配;
- 用两种方法证明 KL 非负,并写出等号条件;
- 区分 forward KL 与 reverse KL 的加权方向;
- 说明 mode covering / mode seeking 只是受限模型族下的典型倾向;
- 从协方差矩阵读出多元高斯的主轴、尺度和相关方向;
- 检查一维极限与标准高斯特例。
概念连接
1. 自信息把概率变成理想码长
对概率为 的事件,自信息定义为
概率越小,事件越意外,理想码长越长。
概率为 1 的确定事件自信息为 0;概率趋近 0 时,自信息趋向无穷。
这里的 是理想实数码长。
单个前缀码字长度必须为整数;理想平均长度可通过长块编码渐近逼近。
2. 熵是匹配分布下的平均理想码长
对离散分布 :
它用真实事件概率 加权,并使用来自同一分布的理想码长 。
若对数底为 2,单位是 bit;若使用自然对数,单位是 nat。
改变对数底只会乘一个正的常数,不改变最优分布或非负性结论。
3. 交叉熵使用了错误码本
如果事件仍按 发生,却使用 给出的理想码长:
加权概率仍是 ,只是码长从 换成 。
因此交叉熵不是“对 和 各平均一次”,而是用 编码 的样本。
4. KL 是平均额外理想码长
两者之差为
码长视角下,它表示使用 的理想码长描述来自 的事件,相比使用匹配分布 多付出的平均码长。
因为 与模型参数无关,最大似然或最小交叉熵常可写成最小化数据分布到模型分布的 forward KL。
5. 支撑条件决定 KL 是否有限
若
则 给真实可能事件分配零概率,所需理想码长为无穷:
若 ,对应项按极限记为
因此计算 KL 前必须先检查真实支撑是否包含在近似分布的支撑中。
不能直接把零概率代入普通实数对数公式。
6. KL 非负的码长证明
因为匹配真实分布的理想码长达到最小期望,使用其他 不应得到更短的平均理想码长:
结合恒等式:
等号在 与 在真实支撑上相同且都归一化时成立,即 。
7. KL 非负的对数不等式证明
基本不等式为
将 换为 ,得到
对 应用:
乘以 :
求和并使用概率归一化:
对零概率项仍需使用前述极限和支撑约定。
8. forward KL 与 reverse KL 的权重方向
forward KL 为
它由 加权,真实分布有质量而模型给零概率时惩罚无穷。
reverse KL 为
它由 加权,模型在真实支撑之外放概率质量时惩罚无穷。
交换参数会改变期望分布与支撑条件,所以 KL 不是距离,通常不对称。
9. mode covering 与 mode seeking 的条件
当 受限、不能完美表示多峰 时:
- forward KL 强烈惩罚漏掉 的有质量区域,常倾向覆盖多个模式;
- reverse KL 只在 自己放置质量的位置取期望,常倾向选择一个高密度模式。
但这是模型族受限、目标不可同时达到零时的典型行为。
若 足够表达 并优化到全局最优,两种 KL 都在 处达到零。
因此“平均”与“专精”不是无条件定理。
10. 多元高斯把方差推广为协方差
一元正态由均值 和方差 决定。
维多元正态由
决定,密度为
11. Mahalanobis 二次型定义等密度几何
指数中的
是一个标量。
它衡量点 相对均值的协方差归一化距离。
等密度集合满足
在二维中形成椭圆,在更高维中形成椭球。
12. 特征向量控制方向,特征值控制尺度
对称正定协方差可分解为
的列是主轴方向, 的特征值决定各方向方差。
非对角协方差会旋转椭圆主轴。
正协方差与负协方差对应不同的倾斜方向,但相关性不代表因果关系。
若 仅半正定且奇异,普通密度公式中的逆与行列式不再直接适用;分布会退化到低维子空间。
13. 一维与标准高斯是两个自检点
当 :
多元密度应严格还原一元正态公式。
当
得到标准多元高斯
它的各方向方差相同,等密度面为球面,也是扩散模型常用的基础噪声分布。
对比与决策
1. 需要评估编码代价时
- 单一分布本身的不确定性:看 。
- 数据来自 、模型或码本来自 :看 。
- 只关心相对多出的理想码长:看 。
2. 选择 KL 方向前先写清谁在取期望
- 数据覆盖优先、不能漏掉真实模式:forward KL 的支撑惩罚更符合这一方向。
- 近似分布只在自己采样到的区域上评估:reverse KL 体现另一种权衡。
具体行为仍取决于模型族、参数化和优化是否到达全局最优。
3. 读多元高斯时先做三项检查
- 的 shape 是否为 ;
- 是否对称正定或是否明确处理奇异情况;
- 二次型和归一化系数是否都为标量。
若只是要生成一般高斯样本,可从
且 出发。
综合训练
编者练习
设 ,。用以 2 为底的对数写出 、 与 ,并检查恒等式。
查看参考答案
bit。。。逐项整理可验证 ,因为 。
编者练习 2
真实分布在两个模式都有正概率,而受限模型只能覆盖其中一个模式。分别说明 forward KL 与 reverse KL 的支撑风险。
查看参考答案
若模型对真实仍有质量的模式给零概率,forward KL 出现 项并趋于无穷,因此倾向避免漏模。reverse KL 由模型自身采样加权,只要模型不在所选模式之外放质量,就不会直接评价未覆盖区域,因而在受限族下可能选择一个模式。若分布使用非零尾部而非严格零概率,惩罚不再真为无穷,但倾向仍可出现。
编者练习 3
给定 判断它是否正定,并解释非对角负值对等密度椭圆的影响。
查看参考答案
特征值为 1 和 3,均为正,所以 正定。非对角元为负表示两个变量负相关,等密度椭圆的主轴相对坐标轴旋转,较长方向沿一增一减的方向。它描述联合几何,不证明一个变量因果地导致另一个变量下降。
进入下一单元前
- 已能从自信息推到熵、交叉熵与 KL 的码长解释。
- 已能处理零概率、支撑缺失与对数底。
- 已能用码长最优性和对数不等式两条路线证明 KL 非负。
- 已能区分 forward/reverse KL 的期望方向与典型模式倾向。
- 已能从 、、特征向量和特征值读出多元高斯几何。
- 若仍会把 KL 当作对称距离,回看 P84 并写出两种期望分布。
- 若仍会把理想小数码长当作单个实际码字,回看 P164、P165 的编码边界。
- 若无法判断协方差几何,先验证 与 两个特例。