LLM WIKI · 课程精读

LEARNING UNIT · 03

概率与信息论

用码长和高维几何理解熵、交叉熵、KL 散度与多元正态分布。

已整理章节
6 节
单元来源
5 条视频
总时长
17:15
状态
已发布
学习位置
3 / 20
01

主题讲解 · 03:26

前向 KL 与反向 KL:模式覆盖和模式寻优

学习目标

  • 区分 DKL(PQ)D_{\mathrm{KL}}(P\|Q)DKL(QP)D_{\mathrm{KL}}(Q\|P) 的加权分布。
  • 从支撑集和零概率项解释两种 KL 的不同惩罚。
  • 理解 mode covering 与 mode seeking 为何会在受限模型中出现。
  • 识别“前向平均、反向专精”结论成立的条件与边界。

前置与衔接

PP 是真实分布, QQ 是模型分布。

离散情形的前向 KL 为:

DKL(PQ)=ipilogpiqi=EXP[logp(X)q(X)].D_{\mathrm{KL}}(P\|Q) =\sum_i p_i\log\frac{p_i}{q_i} =\mathbb E_{X\sim P} \left[\log\frac{p(X)}{q(X)}\right].

反向 KL 为:

DKL(QP)=iqilogqipi=EXQ[logq(X)p(X)].D_{\mathrm{KL}}(Q\|P) =\sum_i q_i\log\frac{q_i}{p_i} =\mathbb E_{X\sim Q} \left[\log\frac{q(X)}{p(X)}\right].

两式只交换 P,QP,Q, 但这一步同时改变了:

  • 谁提供加权权重。
  • 哪些区域会被实际采样。
  • 哪一种支撑缺失产生无限损失。
图 1

前向 KL 与反向 KL 只交换 P,QP,Q 的位置,但期望由谁加权会改变损失关注的区域。

原视频 · 00:20 ↗

本课默认概率分布定义在同一离散样本空间。

连续情形把求和替换为积分, 并把“某点有概率”改为“某区域有正密度或正测度”。

核心讲解

1. 前向 KL 由真实分布 PP 加权

展开单项:

pilogpiqi.p_i\log\frac{p_i}{q_i}.

只有 pi>0p_i>0 的位置会被 PP 的期望看见。

若:

pi>0,qi=0,p_i>0,\qquad q_i=0,

则:

pilogpiqi=+.p_i\log\frac{p_i}{q_i}=+\infty.
图 2

DKL(PQ)D_{KL}(P\|Q) 中,只要 pi>0p_i>0,若 qi=0q_i=0 就会产生无限惩罚。

原视频 · 01:00 ↗

因此前向 KL 有限需要:

supp(P)supp(Q).\operatorname{supp}(P) \subseteq \operatorname{supp}(Q).

直觉上, 模型不能漏掉任何真实可能发生的事件。

这就是“模式覆盖”的支撑基础。

2. pi=0p_i=0 的项如何处理

pi=0p_i=0 时, KL 单项按极限约定为:

0log0qi=0,qi0.0\log\frac{0}{q_i}=0, \qquad q_i\ge0.
图 3

pi=0p_i=0 时,约定 pilog(pi/qi)=0p_i\log(p_i/q_i)=0,该位置不会直接贡献前向 KL。

原视频 · 01:20 ↗

这不表示 qiq_i 可以在所有真实零质量位置随意增大。

因为 QQ 仍需归一化:

iqi=1.\sum_i q_i=1.

把概率质量放到 PP 不支持的位置, 会减少真实支撑上的 qiq_i, 从而间接增加那些位置的损失。

所以更准确的表述是:

3. 为什么前向 KL 常表现为模式覆盖

考虑具有两个相隔很远峰值的真实分布 PP

若模型族 QθQ_\theta 足够强, 最优解当然可以直接做到:

Qθ=P,Q_\theta=P,

此时前向和反向 KL 都为零。

差异出现在模型表达能力受限时。

例如只允许 QθQ_\theta 是一个单峰、较简单的分布。

图 4

受限模型用单个平缓分布覆盖多个真实峰值,是前向 KL 常见的 mode-covering 倾向。

原视频 · 01:40 ↗

前向 KL 对两个真实峰都有 PP 权重。

QQ 只覆盖左峰, 右峰处的 qq 太小, 会产生很大损失;

若只覆盖右峰, 左峰同理。

受限模型于是可能选择:

  • 均值落在两个峰之间。
  • 方差增大。
  • 用一个宽而低的分布同时照顾两个峰。

这种行为称为:

mode covering, 即尽量覆盖真实分布的多个模式。

4. “平均”不是前向 KL 的无条件结论

视频用模糊手写数字说明平均化直觉。

需要补上三个条件:

  1. PP 本身具有多个互相分离的模式。
  2. QθQ_\theta 无法精确表达这些模式。
  3. 模型的参数化允许通过中心化或增大方差折中。

若模型是多峰混合模型且容量足够, 最优前向 KL 不需要生成峰间的“平均样本”。

若输出空间的均值不具备语义, “平均”也可能表现为其他覆盖策略, 不一定是像素级模糊。

因此课程标题中的“倾向平均”应理解为:

5. 反向 KL 由模型分布 QQ 加权

反向 KL 的单项为:

qilogqipi.q_i\log\frac{q_i}{p_i}.

若:

qi>0,pi=0,q_i>0,\qquad p_i=0,

则该项为 ++\infty

所以反向 KL 有限需要:

supp(Q)supp(P).\operatorname{supp}(Q) \subseteq \operatorname{supp}(P).

模型若把质量放到真实分布完全不支持的位置, 会受到无限惩罚。

6. qi=0q_i=0 为什么能忽略一个真实模式

qi=0q_i=0pi>0p_i>0 时, 按极限:

0log0pi=0.0\log\frac{0}{p_i}=0.

另一方面, 若 qi=piq_i=p_i, 则:

qilogqipi=qilog1=0.q_i\log\frac{q_i}{p_i} =q_i\log1 =0.
图 5

在反向 KL 的某个真实有质量区域,qi=0q_i=0 的项按极限为零,而 qi=piq_i=p_i 时也有 log1=0\log1=0

原视频 · 02:20 ↗

关键在于期望由 QQ 加权。

模型没有采样到的区域, 不会在这个期望中直接出现。

因此一个容量有限的模型可以:

  • 选择一个真实高密度区域。
  • 在该区域内贴近 PP
  • 几乎不给其他模式概率质量。

7. 为什么反向 KL 常表现为模式寻优

图 6

受限模型集中拟合一个峰并避开低密度山谷,是反向 KL 常见的 mode-seeking 倾向。

原视频 · 02:40 ↗

QQ 跨过两个峰, 它可能不得不在峰间山谷放置概率质量。

山谷处 p(x)p(x) 很小, 而 q(x)q(x) 不小, 于是:

q(x)logq(x)p(x)q(x)\log\frac{q(x)}{p(x)}

会变大。

为了避开低密度区域, 模型可能只选择其中一个峰。

这种行为称为:

mode seeking, 即集中寻找并拟合一个高密度模式。

在生成任务中, 它可能表现为:

  • 样本很清晰。
  • 生成类别较少。
  • 某些真实模式长期不出现。

这与 mode collapse 有相似现象, 但二者不能机械等同; 实际 GAN 的 mode collapse 还涉及对抗优化动态和网络训练问题。

8. 一个更严格的高斯例子

以下为编者补充。

假设真实分布是双峰混合分布, 而模型被限制为单个高斯。

最小化:

DKL(PQθ)D_{\mathrm{KL}}(P\|Q_\theta)

时, 高斯指数族的最优解会匹配 PP 的一、二阶矩。

所以模型均值可能落在两峰之间, 方差覆盖两峰间距。

这给出“宽而平均”的严格例子。

最小化:

DKL(QθP)D_{\mathrm{KL}}(Q_\theta\|P)

时, 若 QθQ_\theta 覆盖两峰, 山谷的低 p(x)p(x) 会提高损失; 局部最优常落在某个峰附近。

但具体选择哪个峰, 可能受初始化、峰高、峰宽和优化器影响。

9. 与最大似然的关系

对固定真实数据分布 PdataP_{\text{data}}

DKL(PdataQθ)=H(Pdata)EPdata[logqθ(X)].D_{\mathrm{KL}}(P_{\text{data}}\|Q_\theta) =-H(P_{\text{data}}) -\mathbb E_{P_{\text{data}}}[\log q_\theta(X)].

第一项与 θ\theta 无关。

因此最小化前向 KL 等价于最大化数据对数似然。

这也是监督密度估计常自然得到前向 KL 的原因。

反向 KL 则需要在 QθQ_\theta 下取期望, 并评估真实密度 p(x)p(x); 在很多真实数据任务中, p(x)p(x) 只可采样而不可直接计算, 所以并不总能直接优化。

10. 支撑规则汇总

情况前向 D(PQ)D(P|Q)反向 D(QP)D(Q|P)
pi>0,qi=0p_i>0,q_i=0++\infty单项为 00
pi=0,qi>0p_i=0,q_i>0单项为 00++\infty
pi=qi>0p_i=q_i>00000
期望加权者PPQQ
常见受限模型倾向mode coveringmode seeking

这里的“单项为零”采用标准极限约定, 且不能忽略全分布归一化。

跟练与练习

编者练习

真实分布为: P=(0.5,0.5,0),P=(0.5,0.5,0), 比较两个模型: QA=(1,0,0),QB=(0.5,0,0.5).Q_A=(1,0,0), \qquad Q_B=(0.5,0,0.5). 判断四个 KL: D(PQA),D(QAP),D(PQB),D(QBP)D(P\|Q_A),\quad D(Q_A\|P), \quad D(P\|Q_B),\quad D(Q_B\|P) 哪些为无穷大。

查看参考答案

D(PQA)=+D(P\|Q_A)=+\infty
因为 p2>0p_2>0qA,2=0q_{A,2}=0
D(QAP)D(Q_A\|P) 有限,
因为 QAQ_A 的支撑包含于 PP 的支撑。
D(PQB)=+D(P\|Q_B)=+\infty
同样因为 p2>0p_2>0qB,2=0q_{B,2}=0
D(QBP)=+D(Q_B\|P)=+\infty
因为 qB,3>0q_{B,3}>0p3=0p_3=0
这个例子说明:
前向 KL 检查 PP 是否被 QQ 覆盖,
反向 KL 检查 QQ 是否越出 PP

常见误区

误区 1:前向 KL 必然生成均值

只有模型族受限时, 覆盖多个模式才可能以宽分布或平均样本表现出来。

容量足够时, 两种方向的全局最优都是 Q=PQ=P

误区 2:反向 KL 会无成本删除任意概率质量

被删除区域没有直接的 QQ-加权项, 但剩余质量必须重新归一化, 其他区域的比值会随之变化。

误区 3:KL 是对称距离

一般:

DKL(PQ)DKL(QP).D_{\mathrm{KL}}(P\|Q) \ne D_{\mathrm{KL}}(Q\|P).

KL 也不满足三角不等式, 所以不是严格意义上的距离度量。

误区 4:连续分布中只检查某个点是否为零

连续分布的单点通常概率为零。

真正相关的是密度比、 绝对连续性和具有正测度的支撑区域。

误区 5:JS 或 Wasserstein 自动解决所有问题

不同散度改变梯度和支撑行为, 但仍受模型容量、估计误差和优化算法限制。

选择目标函数不能脱离训练方式与任务评价。

本课小结

  • 前向 KL 由 PP 加权,漏掉真实支撑会产生无限惩罚。
  • 反向 KL 由 QQ 加权,越出真实支撑会产生无限惩罚。
  • 受限模型下,前向 KL 常表现为 mode covering,反向 KL 常表现为 mode seeking。
  • “平均”和“专精”是条件化倾向,不是对所有模型族的无条件定理。
  • 支撑、归一化和极限约定必须一起检查。
  • 最大似然对应最小化数据分布到模型分布的前向 KL。
02

主题讲解 · 03:17

从自信息到 KL:码长视角下的熵与交叉熵

学习目标

  • 从自信息 I(x)=logp(x)I(x)=-\log p(x) 理解概率与理想码长的关系。
  • 区分信息熵、交叉熵和 KL 散度各自由谁加权、使用谁的码长。
  • 用二元数值例子算出最优、错配与浪费的平均码长。
  • 准确区分理想码长、单符号整数前缀码和渐近块编码。

前置与衔接

本课考虑离散事件集合:

X={x1,,xn}.\mathcal X=\{x_1,\ldots,x_n\}.

真实分布为:

P=(p1,,pn),ipi=1.P=(p_1,\ldots,p_n), \qquad \sum_i p_i=1.

若对数以 22 为底, 信息单位是 bit。

单个事件的自信息定义为:

IP(xi)=log2pi=log21pi.I_P(x_i) =-\log_2p_i =\log_2\frac1{p_i}.

概率越小, 事件越意外, 自信息越大。

本课视频把自信息直接解释为码长。

为了保持数学严谨, 正文会使用“理想码长”一词, 并在后文说明实际二进制前缀码的整数限制。

核心讲解

1. 为什么概率倒数的对数像码长

若有 88 个等概率符号:

pi=18,p_i=\frac18,

则每个符号的自信息为:

log218=log28=3 bit.-\log_2\frac18 =\log_2 8 =3\text{ bit}.
图 1

八个等概率符号的自信息为 log2(1/8)=3-\log_2(1/8)=3 bit,恰好可用三位定长码区分。

原视频 · 00:40 ↗

三位二进制串正好有:

23=82^3=8

种取值。

这个例子中, 理想码长恰好是整数, 可以直接实现为单符号定长码。

更一般地, 若一个事件概率为 2k2^{-k}, 理想码长就是 kk bit。

2. 真实分布与编码分布是两件事

视频使用两个事件:

P(A)=0.4,P(B)=0.6.P(A)=0.4,\qquad P(B)=0.6.

但编码者事先不知道 PP, 采用假设分布:

Q(A)=0.3,Q(B)=0.7.Q(A)=0.3,\qquad Q(B)=0.7.
图 2

真实分布 P=(0.4,0.6)P=(0.4,0.6) 与假设分布 Q=(0.3,0.7)Q=(0.3,0.7) 会导出两套不同的理想码长。

原视频 · 01:00 ↗

这里要分清:

  • PP 决定真实数据中事件出现的频率。
  • QQ 决定编码器为事件分配的理想码长。

若按分布 RR 设计, 理想码长为:

R(xi)=log2R(xi).\ell_R(x_i) =-\log_2R(x_i).

3. 两套分布给出两套理想码长

按真实分布 PP

P(A)=log20.41.3219,\ell_P(A) =-\log_2 0.4 \approx1.3219,
P(B)=log20.60.7370.\ell_P(B) =-\log_2 0.6 \approx0.7370.

按假设分布 QQ

Q(A)=log20.31.7370,\ell_Q(A) =-\log_2 0.3 \approx1.7370,
Q(B)=log20.70.5146.\ell_Q(B) =-\log_2 0.7 \approx0.5146.
图 3

按分布 RR 设计的理想码长为 R(x)=log2R(x)\ell_R(x)=-\log_2R(x),概率越大,理想码长越短。

原视频 · 01:20 ↗

概率大的事件获得短码, 概率小的事件获得长码。

错配 QQBB 看得比真实情况更常见, 所以给 BB 更短的理想码;

同时把 AA 看得更少见, 所以给 AA 更长的理想码。

4. 平均时为什么必须由 PP 加权

即使编码器使用 QQ 设计码长, 现实中抽到 A,BA,B 的频率仍由 PP 决定。

图 4

无论码长由 PP 还是 QQ 设计,实际平均码长都必须按真实出现频率 PP 加权。

原视频 · 02:00 ↗

所以平均理想码长的一般形式是:

EXP[R(X)]=ipiR(xi).\mathbb E_{X\sim P}[\ell_R(X)] =\sum_i p_i\ell_R(x_i).

注意两个位置:

  • 求和外的权重始终是 pip_i
  • 对数里的码长模型可以是 pip_iqiq_i

这正是信息熵与交叉熵的区别。

5. 信息熵是使用真实分布时的平均理想码长

R=PR=P

H(P)=ipilog2pi=EP[log2P(X)].H(P) =-\sum_i p_i\log_2p_i =\mathbb E_{P}[-\log_2P(X)].

代入二元例子:

H(P)=0.4log210.4+0.6log210.6.H(P) =0.4\log_2\frac1{0.4} +0.6\log_2\frac1{0.6}.
图 5

使用真实分布的理想码长时,期望长度为 H(P)0.97H(P)\approx0.97 bit。

原视频 · 02:20 ↗

更精确地:

H(P)0.97095 bit.H(P)\approx0.97095\text{ bit}.

这表示:

在理想化或渐近编码意义下, 每个符号至少需要约 0.970950.97095 bit。

它不是说单独一个 AA 可以用 1.32191.3219 个物理 bit 直接存储。

6. 交叉熵是使用错配分布时的平均理想码长

R=QR=Q

H(P,Q)=ipilog2qi=EP[log2Q(X)].H(P,Q) =-\sum_i p_i\log_2q_i =\mathbb E_P[-\log_2Q(X)].

代入例子:

H(P,Q)=0.4log210.3+0.6log210.7.H(P,Q) =0.4\log_2\frac1{0.3} +0.6\log_2\frac1{0.7}.
图 6

使用错配分布 QQ 的理想码长时,交叉熵约为 1.001.00 bit,多出的约 0.030.03 bit 是 KL 散度。

原视频 · 02:40 ↗

更精确地:

H(P,Q)1.00353 bit.H(P,Q)\approx1.00353\text{ bit}.

它比 H(P)H(P) 大:

1.003530.970950.03258 bit.1.00353-0.97095 \approx0.03258\text{ bit}.

这就是因分布错配造成的平均额外理想码长。

7. KL 散度就是两者之差

由定义:

DKL(PQ)=ipilog2piqi.D_{\mathrm{KL}}(P\|Q) =\sum_i p_i\log_2\frac{p_i}{q_i}.

展开对数:

DKL(PQ)=ipilog2piipilog2qi=H(P,Q)H(P).\begin{aligned} D_{\mathrm{KL}}(P\|Q) &=\sum_i p_i\log_2p_i -\sum_i p_i\log_2q_i\\ &=H(P,Q)-H(P). \end{aligned}

所以本例:

DKL(PQ)0.03258 bit.D_{\mathrm{KL}}(P\|Q) \approx0.03258\text{ bit}.

三者的码长解释为:

使用的理想码长真实权重含义
H(P)H(P)log2pi-\log_2p_ipip_i匹配编码的平均理想码长
H(P,Q)H(P,Q)log2qi-\log_2q_ipip_i错配编码的平均理想码长
D(PQ)D(P|Q)两者之差pip_i平均额外理想码长

8. “熵等于最优码长”的严格边界

以下是视频直觉之外的必要补充。

二进制单符号前缀码的码字长度必须是整数:

iN.\ell_i\in\mathbb N.

而:

log2pi-\log_2p_i

通常不是整数。

对任意二进制前缀码, 平均长度 LL 满足:

LH(P).L\ge H(P).

Shannon 码或 Huffman 码可达到:

H(P)L<H(P)+1.H(P)\le L^*<H(P)+1.

当把很多独立符号组成长度为 nn 的块再编码时, 可以让每符号平均长度趋近:

LnnH(P).\frac{L_n}{n}\rightarrow H(P).

算术编码也能接近这一极限。

因此更准确的说法是:

视频中的小数码长适合用于这一理想化分析, 不能直接画成单个二进制码字的物理长度。

9. 支撑不匹配会怎样

若存在某事件:

pi>0,qi=0,p_i>0,\qquad q_i=0,

则:

logqi=+,-\log q_i=+\infty,

从而:

H(P,Q)=DKL(PQ)=+.H(P,Q)=D_{\mathrm{KL}}(P\|Q)=+\infty.

编码解释是:

模型 QQ 认为该事件绝不发生, 根本没有为它准备有限理想码长;

但真实分布 PP 又确实会生成它。

跟练与练习

编者练习

设: P=(0.75,0.25),Q=(0.5,0.5).P=(0.75,0.25), \qquad Q=(0.5,0.5). 用以 22 为底的对数计算: H(P),H(P,Q),DKL(PQ).H(P),\quad H(P,Q),\quad D_{\mathrm{KL}}(P\|Q).

查看参考答案

H(P)=0.75log20.750.25log20.250.8113 bit.H(P) =-0.75\log_2 0.75 -0.25\log_2 0.25 \approx0.8113\text{ bit}.
因为 QQ 为均匀分布,
两事件的理想码长都是 11 bit:
H(P,Q)=0.75log20.50.25log20.5=1 bit.H(P,Q) =-0.75\log_2 0.5 -0.25\log_2 0.5 =1\text{ bit}.
所以:
DKL(PQ)=10.81130.1887 bit.D_{\mathrm{KL}}(P\|Q) =1-0.8113 \approx0.1887\text{ bit}.

常见误区

误区 1:概率就是码长

码长对应的是概率的负对数, 不是概率本身:

=log2p.\ell=-\log_2p.

误区 2:交叉熵由 QQ 加权

H(P,Q)H(P,Q) 中, 权重仍是 PP

H(P,Q)=ipilogqi.H(P,Q)=-\sum_i p_i\log q_i.

QQ 只决定码长。

误区 3:0.97 bit 可以作为单个二元符号的整数前缀码

单个码字长度必须是整数。

0.97 bit 是期望下界或渐近每符号速率, 不是单次存储长度。

误区 4:对数底不影响数值

对数底改变单位:

  • log2\log_2 对应 bit。
  • ln\ln 对应 nat。

同一个散度的两个数值相差常数因子。

误区 5:KL 是“多写了多少个完整 bit”

KL 是平均额外理想码长, 可以是任意非负实数。

在有限块编码中, 还要考虑整数舍入和编码器开销。

本课小结

  • 自信息 log2p-\log_2p 把低概率事件映射为较长的理想码长。
  • 信息熵 H(P)H(P) 是按真实分布使用匹配理想码长的期望。
  • 交叉熵 H(P,Q)H(P,Q) 仍由 PP 加权,但码长来自 QQ
  • KL 散度 D(PQ)=H(P,Q)H(P)D(P\|Q)=H(P,Q)-H(P) 是平均额外理想码长。
  • 熵是整数前缀码平均长度的下界,并在长块编码中渐近可达。
  • PP 有质量而 QQ 给零概率,交叉熵和前向 KL 都为无穷大。
03

主题讲解 · 03:06

KL 非负为何等价于信息熵最优

学习目标

  • 理解 H(P)H(P)H(P,Q)H(P,Q)DKL(PQ)D_{\mathrm{KL}}(P\|Q) 的精确恒等式。
  • 说明“KL 非负”与“匹配分布给出最小交叉熵”为何互相等价。
  • 从真实频率与模型码长的配对理解分布错配。
  • 写清等号条件、支撑条件和理想码长边界。

前置与衔接

设离散真实分布为:

P=(p1,,pn),P=(p_1,\ldots,p_n),

模型或假设分布为:

Q=(q1,,qn).Q=(q_1,\ldots,q_n).

二者都满足:

pi,qi0,ipi=iqi=1.p_i,q_i\ge0, \qquad \sum_i p_i=\sum_i q_i=1.

视频使用二元例子:

P=(0.4,0.6),Q=(0.3,0.7).P=(0.4,0.6), \qquad Q=(0.3,0.7).
图 1

真实分布 P=(0.4,0.6)P=(0.4,0.6) 与模型分布 Q=(0.3,0.7)Q=(0.3,0.7) 构成一个具体的错配编码例子。

原视频 · 00:20 ↗

本课采用以 22 为底的对数解释 bit。

若改用自然对数, 所有量按常数比例变为 nat, 不影响非负性和最优分布。

核心讲解

1. 真实出现频率永远由 PP 决定

按分布 RR 设计的理想码长为:

R(xi)=logR(xi).\ell_R(x_i) =-\log R(x_i).

若编码器采用错误模型 QQ, 理想码长变为:

Q(xi)=logqi.\ell_Q(x_i) =-\log q_i.

但真实数据中事件 xix_i 出现的长期频率仍是 pip_i

图 2

即使码长由 QQ 设计,事件在真实数据中的出现频率仍由 PP 决定。

原视频 · 01:00 ↗

因此实际平均理想码长是:

ipiQ(xi)=ipilogqi.\sum_i p_i\ell_Q(x_i) =-\sum_i p_i\log q_i.

这正是交叉熵:

H(P,Q)=ipilogqi.H(P,Q) =-\sum_i p_i\log q_i.

2. 匹配编码得到信息熵

若使用真实分布 PP 设计理想码长:

P(xi)=logpi,\ell_P(x_i) =-\log p_i,

平均理想码长为:

H(P)=ipilogpi.H(P) =-\sum_i p_i\log p_i.

所以 H(P)H(P)H(P,Q)H(P,Q) 的共同点是:

  • 都在真实分布 PP 下取期望。
  • 都使用 pip_i 作为加权权重。

区别只在码长来自:

  • PP 自己。
  • 假设分布 QQ

3. 编码树与带权路径长度的类比

图 3

树的带权路径长度可类比平均码长:边权表示真实频率,叶子代价表示采用的码长。

原视频 · 01:20 ↗

树的带权路径长度写作:

WPL=iwii.\mathrm{WPL} =\sum_i w_i\ell_i.

将它类比到编码:

  • wiw_i 对应真实出现频率 pip_i
  • i\ell_i 对应事件的码长。

于是:

WPLP=ipi(logpi)=H(P),\mathrm{WPL}_P =\sum_i p_i(-\log p_i) =H(P),
WPLQ=ipi(logqi)=H(P,Q).\mathrm{WPL}_Q =\sum_i p_i(-\log q_i) =H(P,Q).

这里是概念类比, 不是说概率本身等于树边的整数长度。

视频画出的 logpi-\log p_i 通常是小数, 应理解为理想码长。

对实际单符号二进制前缀码, 码长必须为整数; 熵是平均长度下界, 长块编码可渐近逼近它。

4. 平均浪费码长就是两者相减

定义平均额外理想码长:

H(P,Q)H(P).H(P,Q)-H(P).
图 4

DKL(PQ)=H(P,Q)H(P)D_{KL}(P\|Q)=H(P,Q)-H(P) 把平均浪费码长写成错配码长与理想码长之差。

原视频 · 01:40 ↗

展开:

H(P,Q)H(P)=ipilogqi+ipilogpi=ipi(logpilogqi)=ipilogpiqi=DKL(PQ).\begin{aligned} H(P,Q)-H(P) &=-\sum_i p_i\log q_i +\sum_i p_i\log p_i\\ &=\sum_i p_i \left(\log p_i-\log q_i\right)\\ &=\sum_i p_i\log\frac{p_i}{q_i}\\ &=D_{\mathrm{KL}}(P\|Q). \end{aligned}

因此:

DKL(PQ)=H(P,Q)H(P)\boxed{ D_{\mathrm{KL}}(P\|Q) =H(P,Q)-H(P) }

不是近似关系, 而是定义展开后的精确恒等式。

5. 为什么两个平均量都由 pip_i 加权

图 5

交叉熵与信息熵都由 pip_i 加权,区别只在对数项使用 qiq_i 还是 pip_i

原视频 · 02:00 ↗

写成期望形式:

H(P)=EXP[logP(X)],H(P) =\mathbb E_{X\sim P}[-\log P(X)],
H(P,Q)=EXP[logQ(X)].H(P,Q) =\mathbb E_{X\sim P}[-\log Q(X)].

数据来自真实世界, 所以期望的采样分布都是 PP

编码模型只决定:

logP(X)logQ(X).-\log P(X) \quad\text{或}\quad -\log Q(X).

这也是机器学习中交叉熵训练的基本结构:

  • 样本来自数据分布。
  • 模型给样本分配概率。
  • 损失是模型概率的负对数。

6. 从 KL 非负推出信息熵最优

Gibbs 不等式给出:

DKL(PQ)0.D_{\mathrm{KL}}(P\|Q)\ge0.

代入恒等式:

H(P,Q)H(P)0.H(P,Q)-H(P)\ge0.

移项:

H(P,Q)H(P)\boxed{ H(P,Q)\ge H(P) }

这说明在所有候选分布 QQ 中, 使用真实分布 PP 自己的理想码长不会更差。

分布错配带来的平均额外理想码长不能为负。

7. 从信息熵最优反推 KL 非负

反过来, 若已知对任意可行 QQ

H(P,Q)H(P),H(P,Q)\ge H(P),

两边相减:

H(P,Q)H(P)0.H(P,Q)-H(P)\ge0.

再使用恒等式:

DKL(PQ)0.D_{\mathrm{KL}}(P\|Q)\ge0.
图 6

DKL(PQ)0D_{KL}(P\|Q)\ge0H(P,Q)H(P)H(P,Q)\ge H(P) 通过同一恒等式互相等价。

原视频 · 02:40 ↗

因此二者“等价”的准确含义是:

在恒等式:

D(PQ)=H(P,Q)H(P)D(P\|Q)=H(P,Q)-H(P)

成立的同一概率模型中, 任一不等式都能直接推出另一个。

8. 等号什么时候成立

对规范化概率分布, 若 KL 有限:

DKL(PQ)=0D_{\mathrm{KL}}(P\|Q)=0

当且仅当:

P=QP=Q

PP 几乎处处成立。

离散情形可理解为:

所有 pi>0p_i>0 的事件上都有 qi=piq_i=p_i

由于 P,QP,Q 都归一化, 这也会排除在 pi=0p_i=0 处额外放置正质量。

于是:

H(P,Q)=H(P)Q=P.H(P,Q)=H(P) \quad\Longleftrightarrow\quad Q=P.

9. 支撑不匹配时仍成立吗

若存在:

pi>0,qi=0,p_i>0,\qquad q_i=0,

则约定:

pilogpiqi=+.p_i\log\frac{p_i}{q_i}=+\infty.

同时:

H(P,Q)=+.H(P,Q)=+\infty.

所以扩展实数意义下:

D(PQ)=H(P,Q)H(P)=+D(P\|Q)=H(P,Q)-H(P)=+\infty

仍与“错配码长不小于匹配码长”一致。

为了进行普通有限数运算, 应要求:

qi>0wheneverpi>0.q_i>0 \quad\text{whenever}\quad p_i>0.

10. “信息熵最优”最优的是什么

这里的最优对象是:

EP[logQ(X)].\mathbb E_P[-\log Q(X)].

即在所有概率预测 QQ 中, 真实分布 Q=PQ=P 使期望 log-loss 最小。

这也说明 log-loss 是严格 proper scoring rule:

诚实报告真实概率在期望意义下最优。

这是视频之外的编者补充。

若讨论实际整数前缀码, 还需经过 Kraft 不等式、Huffman 编码或块编码, 不能把每个 logpi-\log p_i 直接当作可实现的整数码长。

跟练与练习

编者练习

已知: P=(0.5,0.5),Q=(0.75,0.25).P=(0.5,0.5), \qquad Q=(0.75,0.25). 不直接计算 KL 求和, 先算 H(P)H(P)H(P,Q)H(P,Q), 再用恒等式求 DKL(PQ)D_{\mathrm{KL}}(P\|Q)

查看参考答案

22 为底:
H(P)=1 bit.H(P)=1\text{ bit}.
H(P,Q)=12log20.7512log20.251.2075 bit.\begin{aligned} H(P,Q) &=-\frac12\log_2 0.75 -\frac12\log_2 0.25\\ &\approx1.2075\text{ bit}. \end{aligned}
所以:
DKL(PQ)=H(P,Q)H(P)0.2075 bit.D_{\mathrm{KL}}(P\|Q) =H(P,Q)-H(P) \approx0.2075\text{ bit}.
结果为正,
并量化了使用 QQ 所增加的平均理想码长。

常见误区

误区 1:交叉熵的权重是 QQ

H(P,Q)=ipilogqi.H(P,Q)=-\sum_i p_i\log q_i.

期望由真实分布 PP 加权, QQ 只进入码长。

误区 2:KL 非负与熵最优是两个无关结论

它们由:

D(PQ)=H(P,Q)H(P)D(P\|Q)=H(P,Q)-H(P)

直接连接, 是同一不等式的两种表述。

误区 3:信息熵小于任何交叉熵,包括任意未归一化分数

这里要求 QQ 是合法概率分布。

若输入任意未归一化分数, 必须先说明归一化方式或改写目标。

误区 4:等号可以在 PQP\ne Q 时成立

对规范化分布和标准 KL, 等号要求 P=QP=Q 几乎处处。

误区 5:最优平均理想码长等于任意实际码的平均长度

单符号前缀码受整数码长限制。

信息熵是下界, 长块编码才可把每符号长度逼近该下界。

本课小结

  • H(P)H(P)H(P,Q)H(P,Q) 都由真实概率 pip_i 加权。
  • 二者的区别是理想码长分别来自 PPQQ
  • 精确恒等式是 D(PQ)=H(P,Q)H(P)D(P\|Q)=H(P,Q)-H(P)
  • KL 非负与 H(P,Q)H(P)H(P,Q)\ge H(P) 可通过恒等式互相推出。
  • 等号在 P=QP=Q 时成立;支撑缺失会让前向 KL 和交叉熵变为无穷大。
  • 码长解释属于理想或渐近编码语境,不能忽略整数前缀码边界。
04

主题讲解 · 03:47

多元正态分布:从标量方差到协方差几何

学习目标

  • 从一元正态公式逐项推广到多元正态密度。
  • 用 shape 解释向量输入为什么仍得到标量密度。
  • 从协方差矩阵的特征值、特征向量理解椭圆等高线。
  • 说明多元标准正态在扩散模型噪声采样中的作用。

前置与衔接

一元正态分布写作:

XN(μ,σ2),σ>0.X\sim\mathcal N(\mu,\sigma^2), \qquad \sigma>0.

密度为:

f(x)=12πσexp((xμ)22σ2).f(x)=\frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right).

它由两个标量参数唯一确定:

  • 均值 μ\mu 控制中心。
  • 方差 σ2\sigma^2 控制尺度。
图 1

一元正态由均值 μ\mu 定位中心,由方差 σ2\sigma^2 控制曲线的宽窄和峰值高度。

原视频 · 00:40 ↗

密度值不是单点概率。

对连续随机变量:

Pr(aXb)=abf(x)dx.\Pr(a\le X\le b) =\int_a^b f(x)\,dx.

多元推广仍保持这个原则: 输入变成向量, 输出仍是标量密度。

核心讲解

1. 从两个标量参数到两个张量参数

多元正态写作:

XN(μ,Σ),X\sim\mathcal N(\mu,\Sigma),

其中:

X,μRd,ΣRd×d.X,\mu\in\mathbb R^d,\qquad \Sigma\in\mathbb R^{d\times d}.

均值向量为:

μ=E[X].\mu=\mathbb E[X].

协方差矩阵为:

Σ=E[(Xμ)(Xμ)T].\Sigma=\mathbb E[(X-\mu)(X-\mu)^T].

其元素:

Σij=Cov(Xi,Xj).\Sigma_{ij}=\operatorname{Cov}(X_i,X_j).

所以:

  • 对角线 Σii\Sigma_{ii} 是每一维的方差。
  • 非对角线 Σij\Sigma_{ij} 描述两维的线性共同变化。

2. 多元正态密度公式

Σ\Sigma 对称正定时, 非退化多元正态密度为:

f(x)=1(2π)d/2Σ1/2exp[12(xμ)TΣ1(xμ)].f(x)=\frac{1}{(2\pi)^{d/2}|\Sigma|^{1/2}} \exp\left[-\frac12(x-\mu)^T\Sigma^{-1}(x-\mu)\right].

公式可分成三部分:

  1. μ\mu 决定中心。
  2. Mahalanobis 二次型决定离中心的标准化距离。
  3. Σ1/2|\Sigma|^{1/2} 负责总体积尺度的归一化。

Σ\Sigma 仅半正定且奇异, 分布会落在低维仿射子空间; 此时不能直接使用含普通逆矩阵和普通 dd 维密度的上式。

这是视频之外的必要边界。

3. 为什么一元正态是 d=1d=1 的特例

d=1d=1

x,μR,Σ=[σ2].x,\mu\in\mathbb R,\qquad \Sigma=[\sigma^2].

于是:

Σ1/2=σ21/2=σ,|\Sigma|^{1/2}=|\sigma^2|^{1/2}=\sigma,

这里使用 σ>0\sigma>0

并且:

Σ1=[1σ2].\Sigma^{-1}=\left[\frac1{\sigma^2}\right].

同时:

(2π)d/2=(2π)1/2.(2\pi)^{d/2}=(2\pi)^{1/2}.
图 2

d=1d=1 时,向量退化为标量,协方差矩阵退化为 [σ2][\sigma^2],多元公式还原为一元公式。

原视频 · 01:20 ↗

代回多元公式:

f(x)=12πσexp((xμ)22σ2),f(x)=\frac1{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right),

恰好得到一元正态密度。

这不是形状相似, 而是严格的代数特例。

4. 向量输入为什么映射到标量

令:

δ=xμRd.\delta=x-\mu\in\mathbb R^d.

采用列向量约定:

δT:(1,d),Σ1:(d,d),δ:(d,1).\delta^T:(1,d),\qquad \Sigma^{-1}:(d,d),\qquad \delta:(d,1).

因此:

δTΣ1δ:(1,d)(d,d)(d,1)(1,1).\delta^T\Sigma^{-1}\delta: (1,d)(d,d)(d,1)\rightarrow(1,1).
图 3

Mahalanobis 二次型由行向量、d×dd\times d 逆协方差和列向量相乘,最终输出标量。

原视频 · 02:00 ↗

行列式:

Σ|\Sigma|

也是标量。

指数函数输入、归一化系数和最终密度全是标量。

所以:

f:RdR0.f:\mathbb R^d\rightarrow\mathbb R_{\ge0}.

多元不是“输出一个概率向量”, 而是“给一个空间位置计算一个密度高度”。

5. Mahalanobis 距离修正了各方向尺度

定义平方 Mahalanobis 距离:

dM(x,μ)2=(xμ)TΣ1(xμ).d_M(x,\mu)^2=(x-\mu)^T\Sigma^{-1}(x-\mu).

若某方向方差大, 沿该方向移动同样的欧氏距离不那么异常;

若某方向方差小, 同样位移会得到更大的标准化距离。

密度等高线满足:

(xμ)TΣ1(xμ)=c.(x-\mu)^T\Sigma^{-1}(x-\mu)=c.

在二维中, 这是椭圆。

6. 特征分解给出椭圆主轴

对称正定协方差可分解为:

Σ=UΛUT,\Sigma=U\Lambda U^T,

其中:

Λ=diag(λ1,,λd),λi>0.\Lambda=\operatorname{diag}(\lambda_1,\ldots,\lambda_d), \qquad \lambda_i>0.

几何含义:

  • UU 的列向量给出椭圆主轴方向。
  • λi\lambda_i 给出对应方向的方差。
  • 固定等高线半轴长度与 λi\sqrt{\lambda_i} 成正比。

这比只记“协方差控制形状”更精确。

7. 单位阵与对角协方差

若:

Σ=I,\Sigma=I,

则:

(xμ)TΣ1(xμ)=xμ22.(x-\mu)^T\Sigma^{-1}(x-\mu)=\|x-\mu\|_2^2.

所有方向尺度相同, 二维等高线是圆。

若:

Σ=[4001],\Sigma= \begin{bmatrix} 4&0\\ 0&1 \end{bmatrix},

第一维标准差为 22, 第二维标准差为 11

图 4

单位协方差给出圆形等高线,对角方差不等时等高线沿坐标轴拉伸为椭圆。

原视频 · 02:40 ↗

椭圆沿第一维更宽, 但主轴仍与坐标轴重合。

8. 非零协方差为什么旋转椭圆

考虑:

Σ+=[4111].\Sigma_+ = \begin{bmatrix} 4&1\\ 1&1 \end{bmatrix}.

非对角元为正, 表示两个变量倾向同向变化。

椭圆长轴朝 x1,x2x_1,x_2 同号方向倾斜。

再考虑:

Σ=[4111].\Sigma_- = \begin{bmatrix} 4&-1\\ -1&1 \end{bmatrix}.

非对角元为负, 表示两个变量倾向反向变化。

图 5

非零协方差会旋转椭圆主轴;正负协方差对应相反的倾斜方向。

原视频 · 03:00 ↗

原始 ASR 在负相关示例处仍识别成“协方差是一”。

画面明确写为 1-1, 且后文说“负相关”, 所以本文依据画面与上下文校正负号。

更一般地, 倾斜方向由特征向量决定, 不能只靠非对角元正负判断高维全部几何。

9. 行列式控制总体积尺度

协方差特征值满足:

Σ=i=1dλi.|\Sigma|=\prod_{i=1}^d\lambda_i.

因此:

Σ1/2=i=1dλi.|\Sigma|^{1/2}=\prod_{i=1}^d\sqrt{\lambda_i}.

它与等密度椭球的体积尺度成正比。

协方差整体变大时, 分布在空间中铺得更开;

为了让总积分仍为 11, 峰值高度相应降低。

10. 多元标准正态与扩散噪声

多元标准正态为:

ZN(0,Id).Z\sim\mathcal N(0,I_d).

它满足:

E[Z]=0,Cov(Z)=Id.\mathbb E[Z]=0,\qquad \operatorname{Cov}(Z)=I_d.
图 6

XN(0,Id)X\sim\mathcal N(0,I_d) 以原点为中心、各维单位方差,是扩散模型常用的噪声分布。

原视频 · 03:20 ↗

因为是联合高斯且协方差为单位阵, 各分量不仅不相关, 而且相互独立:

ZiiidN(0,1).Z_i\overset{\mathrm{iid}}{\sim}\mathcal N(0,1).

DDPM 的终端噪声和反向生成初值通常围绕这一分布构造。

“通常”很重要: 具体扩散模型可能采用其他先验、潜空间尺度或协方差约定。

11. 从标准高斯生成一般高斯

以下为编者补充。

Σ=LLT\Sigma=LL^T 是 Cholesky 分解, 且 ZN(0,Id)Z\sim\mathcal N(0,I_d), 则 X=μ+LZX=\mu+LZ 满足:

XN(μ,Σ).X\sim\mathcal N(\mu,\Sigma).

验证协方差:

Cov(X)=LCov(Z)LT=LLT=Σ.\operatorname{Cov}(X) =L\operatorname{Cov}(Z)L^T =LL^T =\Sigma.

这把协方差几何直接连接到采样算法。

跟练与练习

编者练习

给定: Σ=[9001].\Sigma= \begin{bmatrix} 9&0\\ 0&1 \end{bmatrix}. 回答:

  1. 等高线是圆还是椭圆?
  2. 长轴沿哪个坐标方向?
  3. 两个主轴方向的标准差分别是多少?
查看参考答案

它是轴对齐椭圆。
第一维方差为 99
标准差为 33
第二维方差为 11
标准差为 11
所以长轴沿第一坐标方向,
相同 Mahalanobis 半径下,
第一维半轴长度是第二维的 33 倍。

常见误区

误区 1:Σ\Sigma 的每个元素都是方差

只有对角元素是方差。

非对角元素是协方差。

误区 2:零协方差对任意分布都推出独立

一般只能推出不相关。

联合高斯是特殊情形: 零协方差可以推出独立。

误区 3:密度高度就是某点概率

连续变量单点概率通常为零。

概率由区域上的密度积分得到。

误区 4:任意对称矩阵都能做协方差

协方差至少要对称半正定。

普通非退化密度公式还要求正定。

误区 5:协方差只改变宽窄,不改变方向

非对角协方差会改变特征向量, 从而旋转椭圆或椭球主轴。

本课小结

  • 一元正态的均值和方差在多元中推广为均值向量和协方差矩阵。
  • d=1d=1 时,多元密度逐项严格还原一元密度。
  • Mahalanobis 二次型把向量、矩阵、向量收缩为标量。
  • 协方差特征向量控制方向,特征值控制各主轴尺度。
  • 非对角协方差旋转等高线;画面确认负相关示例的非对角元为 1-1
  • N(0,Id)\mathcal N(0,I_d) 是扩散模型常用噪声分布,并可经线性变换生成一般高斯。
05

主题讲解 · 03:39

只用对数不等式证明 KL 散度非负

学习目标

  • 用高中导数证明 lnx11/x\ln x\ge1-1/x
  • 把对数不等式逐项代入 KL 求和。
  • 写出概率归一化如何把下界化为零。
  • 正确处理 pi=0p_i=0qi=0q_i=0、对数底和等号条件。

前置与衔接

离散 KL 散度定义为:

DKL(PQ)=ipilnpiqi.D_{\mathrm{KL}}(P\|Q)=\sum_i p_i\ln\frac{p_i}{q_i}.

本课使用自然对数,单位是 nat。

需要证明:

DKL(PQ)0.D_{\mathrm{KL}}(P\|Q)\ge0.

证明的关键只有一个一元不等式:

lnx11x,x>0.\boxed{\ln x\ge1-\frac1x},\qquad x>0.
图 1

x>0x>0lnx\ln x 位于 11/x1-1/xx1x-1 之间,其中下界将用于证明 KL 非负。

原视频 · 00:20 ↗

它与更常见的不等式:

lnxx1\ln x\le x-1

二者可以通过倒数代换得到。

核心讲解

1. 先用导数证明 lnxx1\ln x\le x-1

定义:

f(x)=x1lnx,x>0.f(x)=x-1-\ln x,\qquad x>0.

求导:

f(x)=11x=x1x.f'(x)=1-\frac1x=\frac{x-1}{x}.

因此:

  • 0<x<10<x<1 时,f(x)<0f'(x)<0
  • x=1x=1 时,f(x)=0f'(x)=0
  • x>1x>1 时,f(x)>0f'(x)>0

所以 ffx=1x=1 处取得全局最小值:

f(1)=0.f(1)=0.

于是:

f(x)0,f(x)\ge0,

即:

lnxx1.\boxed{ \ln x\le x-1 }.

等号仅在:

x=1x=1

时成立。

2. 通过倒数代换得到所需下界

在上式中令:

y=1x>0.y=\frac1x>0.

则:

ln1x1x1.\ln\frac1x \le \frac1x-1.

利用:

ln1x=lnx,\ln\frac1x=-\ln x,

得到:

lnx1x1.-\ln x \le \frac1x-1.

两边乘 1-1 时不等号反向:

lnx11x.\boxed{ \ln x \ge 1-\frac1x }.

等号同样仅在 x=1x=1 时成立。

3. 建立真实分布与假设分布

视频用三个事件 A,B,CA,B,C

P=(p1,p2,p3),Q=(q1,q2,q3).P=(p_1,p_2,p_3), \qquad Q=(q_1,q_2,q_3).

概率满足:

ipi=1,iqi=1.\sum_i p_i=1, \qquad \sum_i q_i=1.

真实数据出现频率由 PP 决定,模型 QQ 只给出另一套概率估计。

柱状图不重合, 表示模型概率与真实概率错配。

4. 码长图像提供物理直觉

信息熵与交叉熵分别为:

H(P)=ipiln1pi,H(P,Q)=ipiln1qi.H(P)=\sum_i p_i\ln\frac1{p_i}, \qquad H(P,Q)=\sum_i p_i\ln\frac1{q_i}.
图 2

信息熵与交叉熵都按真实概率 PP 加权,但叶子理想码长分别来自 PPQQ

原视频 · 01:00 ↗

两者相减即:

H(P,Q)H(P)=ipilnpiqi=DKL(PQ).H(P,Q)-H(P) =\sum_i p_i\ln\frac{p_i}{q_i} =D_{\mathrm{KL}}(P\|Q).

因此 KL 是错配模型增加的平均理想码长。

5. 概率与码长为什么要反向排序

高概率事件应分配短码, 低概率事件应分配长码。

图 3

高概率事件应匹配短码长;分布错配会打乱真实频率与理想码长的配对。

原视频 · 01:40 ↗

视频用排序不等式说明: 高概率与短码匹配会降低平均代价。

这只是直觉辅助; 严格证明仍依赖对数不等式, 且不要求 QQPP 的排列。

6. 先处理会让 KL 直接无穷大的情况

定义真实支撑:

S={i:pi>0}.S=\{i:p_i>0\}.

若存在 iSi\in S 满足:

qi=0,q_i=0,

则:

pilnpiqi=+.p_i\ln\frac{p_i}{q_i}=+\infty.

此时:

DKL(PQ)=+0,D_{\mathrm{KL}}(P\|Q)=+\infty\ge0,

结论已经成立。

所以有限情形只需讨论:

qi>0,iS.q_i>0, \qquad i\in S.

这一步保证后面的比值:

piqi\frac{p_i}{q_i}

严格为正, 可以代入对数不等式。

7. 对每个真实支撑上的事件使用不等式

iSi\in S, 令:

x=piqi>0.x=\frac{p_i}{q_i}>0.
图 4

x=pi/qix=p_i/q_i,由 lnx11/x\ln x\ge1-1/x 得到 ln(pi/qi)1qi/pi\ln(p_i/q_i)\ge1-q_i/p_i

原视频 · 02:40 ↗

由:

lnx11x\ln x\ge1-\frac1x

得到:

lnpiqi1qipi.\ln\frac{p_i}{q_i} \ge 1-\frac{q_i}{p_i}.

因为 pi>0p_i>0, 两边乘 pip_i 不改变不等号方向:

pilnpiqipi(1qipi).p_i\ln\frac{p_i}{q_i} \ge p_i\left(1-\frac{q_i}{p_i}\right).

8. 消去分母得到 piqip_i-q_i

图 5

乘回 pip_i 后,pi(1qi/pi)p_i(1-q_i/p_i) 化简为 piqip_i-q_i

原视频 · 03:00 ↗

右侧直接化简:

pi(1qipi)=piqi.p_i\left(1-\frac{q_i}{p_i}\right) =p_i-q_i.

所以:

pilnpiqipiqi.p_i\ln\frac{p_i}{q_i} \ge p_i-q_i.

在真实支撑 SS 上求和:

DKL(PQ)iS(piqi).D_{\mathrm{KL}}(P\|Q) \ge \sum_{i\in S}(p_i-q_i).

9. 用概率归一化闭合证明

因为所有真实概率质量都在 SS

iSpi=1.\sum_{i\in S}p_i=1.

QQSS 上的质量不超过全部质量:

iSqi1.\sum_{i\in S}q_i\le1.

因此:

DKL(PQ)1iSqi0.\begin{aligned} D_{\mathrm{KL}}(P\|Q) &\ge 1-\sum_{i\in S}q_i\\ &\ge0. \end{aligned}
图 6

利用 ipi=iqi=1\sum_i p_i=\sum_i q_i=1,下界化为零,从而得到 DKL(PQ)0D_{KL}(P\|Q)\ge0

原视频 · 03:20 ↗

若所有 pi>0p_i>0, 则 SS 是完整样本空间, 视频中的简化正好是:

i(piqi)=11=0.\sum_i(p_i-q_i) =1-1 =0.

本文使用 SS 的写法, 是为了兼容某些 pi=0p_i=0 的一般情况。

10. 等号条件

KL 等于零需要两层不等式都取等:

第一, 对所有 iSi\in S

lnpiqi=1qipi.\ln\frac{p_i}{q_i} =1-\frac{q_i}{p_i}.

对数不等式只在比值为 11 时取等, 所以:

pi=qi,iS.p_i=q_i, \qquad i\in S.

第二:

iSqi=1,\sum_{i\in S}q_i=1,

QQ 不能在 PP 支撑外另放概率质量。

因此:

DKL(PQ)=0P=QD_{\mathrm{KL}}(P\|Q)=0 \quad\Longleftrightarrow\quad P=Q

在离散情形逐点成立。

11. 换对数底仍然非负

b>1b>1,则:

DKL(b)(PQ)=DKL(e)(PQ)lnb.D_{\mathrm{KL}}^{(b)}(P\|Q) =\frac{D_{\mathrm{KL}}^{(e)}(P\|Q)}{\ln b}.

由于 lnb>0\ln b>0, 正比例缩放不改变非负性和等号条件。

  • 自然对数对应 nat。
  • 22 为底对应 bit。

跟练与练习

编者练习

设: P=(0.5,0.5,0),Q=(0.4,0.4,0.2).P=(0.5,0.5,0), \qquad Q=(0.4,0.4,0.2). 不用计算精确对数, 只用本文证明中的下界估计: DKL(PQ)D_{\mathrm{KL}}(P\|Q) 至少不小于多少?

查看参考答案

真实支撑为:
S={1,2}.S=\{1,2\}.
所以:
DKL(PQ)iS(piqi)=(0.50.4)+(0.50.4)=0.2.\begin{aligned} D_{\mathrm{KL}}(P\|Q) &\ge \sum_{i\in S}(p_i-q_i)\\ &=(0.5-0.4)+(0.5-0.4)\\ &=0.2. \end{aligned}
这里 QQ0.20.2 的质量放在 PP 不支持的第三个事件上,
导致真实支撑上的总质量只有 0.80.8
实际 KL 可能大于这个下界,
但一定不小于 0.20.2 nat。

常见误区

误区 1:不检查 x>0x>0 就代入对数不等式

必须先保证 pi>0,qi>0p_i>0,q_i>0qi=0<piq_i=0<p_i 时 KL 已经是无穷大,应单独处理。

误区 2:两边乘 1-1 后不改变不等号

lnx1/x1-\ln x\le1/x-11-1 后必须变为 lnx11/x\ln x\ge1-1/x

误区 3:pi=0p_i=0 时继续除以 pip_i

对这些位置采用 0ln(0/qi)=00\ln(0/q_i)=0 的极限约定, 并只在 S={i:pi>0}S=\{i:p_i>0\} 上代换。

误区 4:非负性意味着 KL 是距离

KL 一般不对称, 也不满足三角不等式。

它是散度, 不是严格的度量距离。

误区 5:排序直觉已经完成了严格证明

概率与短码配对提供编码直觉。

对任意 P,QP,Q 的严格非负证明, 仍需对数不等式或其他等价工具。

本课小结

  • 高中导数可证明 lnxx1\ln x\le x-1,再由倒数代换得到 lnx11/x\ln x\ge1-1/x
  • x=pi/qix=p_i/q_i 逐项应用下界,可得 piln(pi/qi)piqip_i\ln(p_i/q_i)\ge p_i-q_i
  • 概率归一化把求和下界化为非负数,从而证明 KL 非负。
  • qi=0<piq_i=0<p_i,KL 为无穷大;若 pi=0p_i=0,该项按极限为零。
  • KL 等于零当且仅当 P=QP=Q
  • 更换对数底只做正比例缩放,不改变非负性。
06

单元综合

从最优码长到高斯几何:概率分布的差异与形状

单元能力目标

完成本单元后,应能从两条互补路线理解概率分布:

  • 信息路线:事件概率如何对应自信息、熵、交叉熵与 KL 散度;
  • 几何路线:均值向量与协方差矩阵如何决定多元正态分布的位置、方向和尺度。

具体需要做到:

  • 用理想码长解释 H(P)H(P)H(P,Q)H(P,Q)DKL(PQ)D_{KL}(P\Vert Q)
  • 处理 pi=0p_i=0qi=0q_i=0 和支撑不匹配;
  • 用两种方法证明 KL 非负,并写出等号条件;
  • 区分 forward KL 与 reverse KL 的加权方向;
  • 说明 mode covering / mode seeking 只是受限模型族下的典型倾向;
  • 从协方差矩阵读出多元高斯的主轴、尺度和相关方向;
  • 检查一维极限与标准高斯特例。

概念连接

1. 自信息把概率变成理想码长

对概率为 p(x)p(x) 的事件,自信息定义为

I(x)=log2p(x).I(x)=-\log_2p(x).

概率越小,事件越意外,理想码长越长。

概率为 1 的确定事件自信息为 0;概率趋近 0 时,自信息趋向无穷。

这里的 log2p-\log_2p 是理想实数码长。

单个前缀码字长度必须为整数;理想平均长度可通过长块编码渐近逼近。

2. 熵是匹配分布下的平均理想码长

对离散分布 PP

H(P)=ipilogpi.H(P) = -\sum_i p_i\log p_i.

它用真实事件概率 pip_i 加权,并使用来自同一分布的理想码长 logpi-\log p_i

若对数底为 2,单位是 bit;若使用自然对数,单位是 nat。

改变对数底只会乘一个正的常数,不改变最优分布或非负性结论。

3. 交叉熵使用了错误码本

如果事件仍按 PP 发生,却使用 QQ 给出的理想码长:

H(P,Q)=ipilogqi.H(P,Q) = -\sum_i p_i\log q_i.

加权概率仍是 pip_i,只是码长从 logpi-log p_i 换成 logqi-log q_i

因此交叉熵不是“对 PPQQ 各平均一次”,而是用 QQ 编码 PP 的样本。

4. KL 是平均额外理想码长

两者之差为

DKL(PQ)=H(P,Q)H(P)=ipilogpiqi.D_{KL}(P\Vert Q) = H(P,Q)-H(P) = \sum_i p_i\log\frac{p_i}{q_i}.

码长视角下,它表示使用 QQ 的理想码长描述来自 PP 的事件,相比使用匹配分布 PP 多付出的平均码长。

因为 H(P)H(P) 与模型参数无关,最大似然或最小交叉熵常可写成最小化数据分布到模型分布的 forward KL。

5. 支撑条件决定 KL 是否有限

pi>0,qi=0,p_i>0, \qquad q_i=0,

QQ 给真实可能事件分配零概率,所需理想码长为无穷:

DKL(PQ)=+.D_{KL}(P\Vert Q)=+\infty.

pi=0p_i=0,对应项按极限记为

0log(0/qi)=0.0\log(0/q_i)=0.

因此计算 KL 前必须先检查真实支撑是否包含在近似分布的支撑中。

不能直接把零概率代入普通实数对数公式。

6. KL 非负的码长证明

因为匹配真实分布的理想码长达到最小期望,使用其他 QQ 不应得到更短的平均理想码长:

H(P,Q)H(P).H(P,Q)\ge H(P).

结合恒等式:

DKL(PQ)=H(P,Q)H(P)0.D_{KL}(P\Vert Q) = H(P,Q)-H(P) \ge0.

等号在 PPQQ 在真实支撑上相同且都归一化时成立,即 P=QP=Q

7. KL 非负的对数不等式证明

基本不等式为

lnxx1,x>0.\ln x\le x-1, \qquad x>0.

xx 换为 1/x1/x,得到

lnx11x.\ln x\ge1-\frac1x.

x=pi/qix=p_i/q_i 应用:

lnpiqi1qipi.\ln\frac{p_i}{q_i} \ge 1-\frac{q_i}{p_i}.

乘以 pip_i

pilnpiqipiqi.p_i\ln\frac{p_i}{q_i} \ge p_i-q_i.

求和并使用概率归一化:

DKL(PQ)i(piqi)=0.D_{KL}(P\Vert Q) \ge \sum_i(p_i-q_i) =0.

对零概率项仍需使用前述极限和支撑约定。

8. forward KL 与 reverse KL 的权重方向

forward KL 为

DKL(PQ)=ExP[logP(x)Q(x)].D_{KL}(P\Vert Q) = \mathbb E_{x\sim P} \left[ \log\frac{P(x)}{Q(x)} \right].

它由 PP 加权,真实分布有质量而模型给零概率时惩罚无穷。

reverse KL 为

DKL(QP)=ExQ[logQ(x)P(x)].D_{KL}(Q\Vert P) = \mathbb E_{x\sim Q} \left[ \log\frac{Q(x)}{P(x)} \right].

它由 QQ 加权,模型在真实支撑之外放概率质量时惩罚无穷。

交换参数会改变期望分布与支撑条件,所以 KL 不是距离,通常不对称。

9. mode covering 与 mode seeking 的条件

QQ 受限、不能完美表示多峰 PP 时:

  • forward KL 强烈惩罚漏掉 PP 的有质量区域,常倾向覆盖多个模式;
  • reverse KL 只在 QQ 自己放置质量的位置取期望,常倾向选择一个高密度模式。

但这是模型族受限、目标不可同时达到零时的典型行为。

QQ 足够表达 PP 并优化到全局最优,两种 KL 都在 Q=PQ=P 处达到零。

因此“平均”与“专精”不是无条件定理。

10. 多元高斯把方差推广为协方差

一元正态由均值 μ\mu 和方差 σ2\sigma^2 决定。

dd 维多元正态由

μRd,ΣRd×d\mu\in\mathbb{R}^{d}, \qquad \Sigma\in\mathbb{R}^{d\times d}

决定,密度为

p(x)=1(2π)d/2Σ1/2exp(12(xμ)TΣ1(xμ)).p(x) = \frac1{ (2\pi)^{d/2}|\Sigma|^{1/2} } \exp \left( -\frac12 (x-\mu)^T \Sigma^{-1} (x-\mu) \right).

11. Mahalanobis 二次型定义等密度几何

指数中的

(xμ)TΣ1(xμ)(x-\mu)^T\Sigma^{-1}(x-\mu)

是一个标量。

它衡量点 xx 相对均值的协方差归一化距离。

等密度集合满足

(xμ)TΣ1(xμ)=c,(x-\mu)^T\Sigma^{-1}(x-\mu)=c,

在二维中形成椭圆,在更高维中形成椭球。

12. 特征向量控制方向,特征值控制尺度

对称正定协方差可分解为

Σ=UΛUT.\Sigma=U\Lambda U^T.

UU 的列是主轴方向,Λ\Lambda 的特征值决定各方向方差。

非对角协方差会旋转椭圆主轴。

正协方差与负协方差对应不同的倾斜方向,但相关性不代表因果关系。

Σ\Sigma 仅半正定且奇异,普通密度公式中的逆与行列式不再直接适用;分布会退化到低维子空间。

13. 一维与标准高斯是两个自检点

d=1d=1

Σ=[σ2],Σ=σ2,Σ1=[1/σ2],\Sigma=[\sigma^2], \qquad |\Sigma|=\sigma^2, \qquad \Sigma^{-1}=[1/\sigma^2],

多元密度应严格还原一元正态公式。

μ=0,Σ=Id,\mu=0, \qquad \Sigma=I_d,

得到标准多元高斯

N(0,Id).\mathcal N(0,I_d).

它的各方向方差相同,等密度面为球面,也是扩散模型常用的基础噪声分布。

对比与决策

1. 需要评估编码代价时

  • 单一分布本身的不确定性:看 H(P)H(P)
  • 数据来自 PP、模型或码本来自 QQ:看 H(P,Q)H(P,Q)
  • 只关心相对多出的理想码长:看 DKL(PQ)D_{KL}(P\Vert Q)

2. 选择 KL 方向前先写清谁在取期望

  • 数据覆盖优先、不能漏掉真实模式:forward KL 的支撑惩罚更符合这一方向。
  • 近似分布只在自己采样到的区域上评估:reverse KL 体现另一种权衡。

具体行为仍取决于模型族、参数化和优化是否到达全局最优。

3. 读多元高斯时先做三项检查

  1. μ\mu 的 shape 是否为 dd
  2. Σ\Sigma 是否对称正定或是否明确处理奇异情况;
  3. 二次型和归一化系数是否都为标量。

若只是要生成一般高斯样本,可从

zN(0,I),x=μ+Lz,z\sim\mathcal N(0,I), \qquad x=\mu+Lz,

LLT=ΣLL^T=\Sigma 出发。

综合训练

编者练习

P=(1/2,1/2)P=(1/2,1/2)Q=(3/4,1/4)Q=(3/4,1/4)。用以 2 为底的对数写出 H(P)H(P)H(P,Q)H(P,Q)DKL(PQ)D_{KL}(P\Vert Q),并检查恒等式。

查看参考答案

H(P)=1H(P)=1 bit。H(P,Q)=(1/2)log2(3/4)(1/2)log2(1/4)H(P,Q)=-(1/2)\log_2(3/4)-(1/2)\log_2(1/4)DKL(PQ)=(1/2)log2((1/2)/(3/4))+(1/2)log2((1/2)/(1/4))D_{KL}(P\Vert Q)=(1/2)\log_2((1/2)/(3/4))+(1/2)\log_2((1/2)/(1/4))。逐项整理可验证 DKL=H(P,Q)H(P)>0D_{KL}=H(P,Q)-H(P)>0,因为 PQP\neq Q

编者练习 2

真实分布在两个模式都有正概率,而受限模型只能覆盖其中一个模式。分别说明 forward KL 与 reverse KL 的支撑风险。

查看参考答案

若模型对真实仍有质量的模式给零概率,forward KL 出现 p>0,q=0p>0,q=0 项并趋于无穷,因此倾向避免漏模。reverse KL 由模型自身采样加权,只要模型不在所选模式之外放质量,就不会直接评价未覆盖区域,因而在受限族下可能选择一个模式。若分布使用非零尾部而非严格零概率,惩罚不再真为无穷,但倾向仍可出现。

编者练习 3

给定 Σ=[2112],\Sigma= \begin{bmatrix} 2&-1\\ -1&2 \end{bmatrix}, 判断它是否正定,并解释非对角负值对等密度椭圆的影响。

查看参考答案

特征值为 1 和 3,均为正,所以 Σ\Sigma 正定。非对角元为负表示两个变量负相关,等密度椭圆的主轴相对坐标轴旋转,较长方向沿一增一减的方向。它描述联合几何,不证明一个变量因果地导致另一个变量下降。

进入下一单元前

  • 已能从自信息推到熵、交叉熵与 KL 的码长解释。
  • 已能处理零概率、支撑缺失与对数底。
  • 已能用码长最优性和对数不等式两条路线证明 KL 非负。
  • 已能区分 forward/reverse KL 的期望方向与典型模式倾向。
  • 已能从 μ\muΣ\Sigma、特征向量和特征值读出多元高斯几何。
  • 若仍会把 KL 当作对称距离,回看 P84 并写出两种期望分布。
  • 若仍会把理想小数码长当作单个实际码字,回看 P164、P165 的编码边界。
  • 若无法判断协方差几何,先验证 d=1d=1Σ=I\Sigma=I 两个特例。