LLM WIKI · 课程精读

LEARNING UNIT · 02

多元优化与几何直觉

把泰勒展开、梯度下降、拉格朗日乘子和聚类边界从一元与平面直觉推广到高维。

已整理章节
7 节
单元来源
6 条视频
总时长
23:48
状态
已发布
学习位置
2 / 20
01

主题讲解 · 01:53

从切线到 Hessian:多元 Taylor 展开

学习目标

  • 从一元切线近似推导多元一阶项。
  • 解释梯度内积为什么仍是标量增量。
  • 理解 Hessian 二次型如何编码局部曲率。
  • 用 shape 和适用条件检查二阶 Taylor 公式。

前置与衔接

设损失函数:

L:RdR.L:\mathbb{R}^{d}\rightarrow\mathbb{R}.

参数基点为:

w0Rd.w_0\in\mathbb{R}^{d}.

目标点写成:

w=w0+Δw.w=w_0+\Delta w.

其中 Δw\Delta w 是从基点到目标点的位移。

本课只讨论标量值函数。

因此无论参数是一维还是多维, L(w)L(w)、一阶增量与二阶增量最终都必须是标量。

核心讲解

1. 一元与多元使用同一条局部近似路线

一元 Taylor 展开写成:

L(w0+Δw)=L(w0)+L(w0)Δw+12L(w0)(Δw)2+.L(w_0+\Delta w) = L(w_0) + L'(w_0)\Delta w + \frac12L''(w_0)(\Delta w)^2 + \cdots.

多元展开的结构没有改变:

  • 基点函数值。
  • 一阶局部变化。
  • 二阶曲率修正。
  • 更高阶项或余项。
图 1

一元与多元 Taylor 展开都以基点函数值为起点,再加入一阶和二阶局部信息。

原视频 · 00:00 ↗

真正变化的是导数对象:

  • 一阶导数从标量变成梯度。
  • 二阶导数从标量变成 Hessian。
  • 位移从标量变成向量。

2. 一元一阶项来自切线斜率乘位移

w0w_0 附近, 切线斜率为 L(w0)L'(w_0)

横向位移为 Δw\Delta w

切线预测的纵向变化为:

ΔLlinear=L(w0)Δw.\Delta L_{\mathrm{linear}}=L'(w_0)\Delta w.
图 2

一元情形中,切线斜率乘位移 Δw\Delta w 给出一阶函数增量。

原视频 · 00:20 ↗

因此一阶近似是:

L(w0+Δw)L(w0)+L(w0)Δw.L(w_0+\Delta w)\approx L(w_0)+L'(w_0)\Delta w.

当曲线弯曲明显或位移较大时, 只用切线会出现误差。

二阶项用局部曲率修正这种误差。

3. 多元参数从数变成向量

一元情形是:

wR,L(w)R.w\in\mathbb{R},\qquad L(w)\in\mathbb{R}.

多元情形变为:

w=[w1wd]Rd,L(w)R.w= \begin{bmatrix} w_1\\ \vdots\\ w_d \end{bmatrix} \in\mathbb{R}^{d}, \qquad L(w)\in\mathbb{R}.
图 3

推广到多元后,参数 ww 从标量变成包含多个分量的向量,而损失 L(w)L(w) 仍是标量。

原视频 · 00:40 ↗

深度学习中, ww 可以概念性地收集模型的全部参数。

实际实现通常不会真把所有参数拼成一个长向量, 但数学上可以把每个参数元素赋予一个统一坐标。

4. 梯度内积取代斜率乘位移

w0w_0 处定义列梯度:

g0=L(w0)=[L/w1L/wd]w0.g_0=\nabla L(w_0) = \begin{bmatrix} \partial L/\partial w_1\\ \vdots\\ \partial L/\partial w_d \end{bmatrix}_{w_0}.

多元一阶增量是:

ΔLlinear=g0TΔw.\Delta L_{\mathrm{linear}}=g_0^T\Delta w.
图 4

多元一阶项 g(w0)TΔwg(w_0)^T\Delta w 是梯度与位移的内积,对应切平面给出的高度变化。

原视频 · 01:00 ↗

展开索引:

g0TΔw=i=1dLwi(w0)Δwi.g_0^T\Delta w = \sum_{i=1}^{d} \frac{\partial L}{\partial w_i}(w_0)\Delta w_i.

每个参数方向的局部变化相加, 得到总的一阶损失变化。

梯度与位移的内积也说明:

  • 沿梯度方向移动,一阶增量最大。
  • 沿负梯度方向移动,一阶增量最小。
  • 与梯度正交的位移,一阶变化为零。

最后一条只表示一阶近似为零, 不保证真实函数完全不变。

5. Hessian 把二阶偏导组织成矩阵

Hessian 定义为:

H0=2L(w0),(H0)ij=2Lwiwj(w0).H_0=\nabla^2L(w_0), \qquad (H_0)_{ij} = \frac{\partial^2L}{\partial w_i\partial w_j}(w_0).

其 shape 为:

H0Rd×d.H_0\in\mathbb{R}^{d\times d}.
图 5

二阶项由 Hessian 组成二次型 12ΔwTH(w0)Δw\frac12\Delta w^T H(w_0)\Delta w

原视频 · 01:20 ↗

二阶增量为:

ΔLquadratic=12ΔwTH0Δw.\Delta L_{\mathrm{quadratic}} = \frac12 \Delta w^T H_0 \Delta w.

展开为:

12i=1dj=1d(H0)ijΔwiΔwj.\frac12 \sum_{i=1}^{d} \sum_{j=1}^{d} (H_0)_{ij} \Delta w_i \Delta w_j.

对角元素描述各坐标方向曲率。

非对角元素描述两个坐标方向之间的二阶耦合。

LL 在邻域内二阶连续可微, 混合偏导相等, Hessian 为对称矩阵。

6. 完整二阶公式与 shape 账本

二阶 Taylor 形式为:

L(w0+Δw)=L(w0)+g0TΔw+12ΔwTH0Δw+R2(Δw).L(w_0+\Delta w) = L(w_0) + g_0^T\Delta w + \frac12\Delta w^TH_0\Delta w + R_2(\Delta w).

shape 检查:

g0TΔw:(1,d)(d,1)(1,1),g_0^T\Delta w: (1,d)(d,1)\rightarrow(1,1),
ΔwTH0Δw:(1,d)(d,d)(d,1)(1,1).\Delta w^TH_0\Delta w: (1,d)(d,d)(d,1)\rightarrow(1,1).
图 6

标量、行向量、方阵和列向量依次相乘,一阶项与二阶项最终都必须是标量。

原视频 · 01:40 ↗

LLw0w_0 附近足够光滑时, 可写:

R2(Δw)=o(Δw2).R_2(\Delta w)=o(\|\Delta w\|^2).

这意味着位移趋近于零时, 余项相对于 Δw2\|\Delta w\|^2 更快趋近于零。

Taylor 是局部结论。

不能因为写了二阶项, 就认为远离 w0w_0 仍能准确描述函数。

7. 曲率符号决定二阶变化方向

对任意方向 vv, 方向曲率由:

vTH0vv^TH_0v

给出。

H0H_0 正定, 所有非零方向的二阶项为正。

H0H_0 负定, 所有非零方向的二阶项为负。

H0H_0 不定, 不同方向可能一正一负, 这通常对应鞍点附近的局部结构。

因此 Hessian 不是“总让近似更高”的矩阵。

它编码的是带方向的局部曲率。

8. 编者补充:与二阶剪枝的关系

视频提到 OBD 等剪枝理论使用 Taylor 展开。

在驻点附近, 若:

g00,g_0\approx0,

移除或扰动某个参数造成的损失变化可近似为:

ΔL12ΔwTH0Δw.\Delta L \approx \frac12\Delta w^TH_0\Delta w.

这是理解二阶敏感度的入口。

但具体剪枝方法还会采用对角 Hessian、近似逆 Hessian或其他计算简化。

本课公式不能替代这些算法细节。

跟练与练习

跟练:二维函数的二阶展开

设:

L(w1,w2)=w12+3w1w2+2w22.L(w_1,w_2)=w_1^2+3w_1w_2+2w_2^2.

梯度为:

L=[2w1+3w23w1+4w2].\nabla L = \begin{bmatrix} 2w_1+3w_2\\ 3w_1+4w_2 \end{bmatrix}.

Hessian 为:

H=[2334].H= \begin{bmatrix} 2&3\\ 3&4 \end{bmatrix}.

因为函数本身就是二次函数, 它在任意基点的二阶 Taylor 展开都精确等于原函数, 余项为零。

编者练习

设: g0=[12],H0=[4112],Δw=[0.10.2].g_0= \begin{bmatrix} 1\\ -2 \end{bmatrix}, \quad H_0= \begin{bmatrix} 4&1\\ 1&2 \end{bmatrix}, \quad \Delta w= \begin{bmatrix} 0.1\\ 0.2 \end{bmatrix}. 计算一阶增量、二阶增量和二阶近似的总增量。

查看参考答案

一阶增量:
g0TΔw=1×0.12×0.2=0.3.g_0^T\Delta w = 1\times0.1-2\times0.2 = -0.3.
先计算:
H0Δw=[0.60.5].H_0\Delta w = \begin{bmatrix} 0.6\\ 0.5 \end{bmatrix}.
二阶增量:
12ΔwTH0Δw=12(0.1×0.6+0.2×0.5)=0.08.\frac12\Delta w^TH_0\Delta w = \frac12(0.1\times0.6+0.2\times0.5) = 0.08.
所以:
ΔL0.3+0.08=0.22.\Delta L\approx-0.3+0.08=-0.22.
这只是基于 w0w_0 的局部二阶预测。

常见误区

误区 1:多元一阶项是梯度乘位移后仍为向量

g0TΔwg_0^T\Delta w 是内积, 输出为标量。

误区 2:Hessian 的每个元素都是同一变量的二阶导

非对角元素是不同变量之间的混合偏导。

误区 3:二阶项一定为正

只有在相应方向曲率为正时, ΔwTH0Δw\Delta w^TH_0\Delta w 才为正。

误区 4:Taylor 二阶式对任意远处点都准确

Taylor 展开是局部近似。

位移大小、函数光滑性和高阶导数都会影响误差。

误区 5:写出 Hessian 就等于实现了二阶优化

实际模型的 Hessian 极大。

算法通常使用 Hessian-vector product、对角近似或其他结构化近似。

本课小结

一元 Taylor 的斜率、二阶导与标量位移, 在多元情形分别推广为梯度、Hessian 与向量位移。

二阶展开为:

L(w0+Δw)L(w0)+L(w0)TΔw+12ΔwT2L(w0)Δw.L(w_0+\Delta w) \approx L(w_0) + \nabla L(w_0)^T\Delta w + \frac12 \Delta w^T \nabla^2L(w_0) \Delta w.

一阶项是切平面的标量高度变化。

二阶项是 Hessian 定义的方向曲率修正。

可靠使用它时必须同时检查:

  • 每一项的 shape。
  • 位移是否足够局部。
  • 函数是否满足所需光滑性。
  • Hessian 在目标方向上的符号。
02

主题讲解 · 03:17

拉格朗日乘子法:从约束曲线到梯度共线

学习目标

  • 把等式约束优化写成目标函数与约束函数。
  • 从可行切向方向推导梯度共线条件。
  • 正确处理 Lagrangian 中 λ\lambda 的正负号约定。
  • 区分驻点必要条件与最小值充分条件。

前置与衔接

考虑:

minx,yf(x,y)=x2+y2\min_{x,y} f(x,y)=x^2+y^2

且满足:

y=2x.y=2-x.

把约束移到等号左侧:

g(x,y)=x+y2=0.g(x,y)=x+y-2=0.

没有约束时, ff(0,0)(0,0) 取得最小值 0。

(0,0)(0,0) 不满足约束。

约束优化只能在可行集合 g=0g=0 上寻找最优点。

核心讲解

1. 约束改变了允许搜索的集合

目标函数:

f(x,y)=x2+y2f(x,y)=x^2+y^2

的图像是向上开的抛物面。

约束:

y=2xy=2-x

xyxy 平面上是一条直线。

图 1

目标 f=x2+y2f=x^2+y^2 与约束 y=2xy=2-x 构成一个等式约束最小化问题。

原视频 · 00:00 ↗

代入法可以直接验证答案:

ϕ(x)=f(x,2x)=x2+(2x)2.\phi(x) = f(x,2-x) = x^2+(2-x)^2.

求导:

ϕ(x)=4x4.\phi'(x)=4x-4.

令其为零:

x=1,y=1.x=1,\qquad y=1.

目标值:

f(1,1)=2.f(1,1)=2.

2. 三维中,约束平面切出可行曲线

把直线约束沿竖直方向延伸, 得到一个竖直平面。

它与抛物面相交, 形成一条抛物线。

图 2

约束直线在三维图中对应竖直平面;它与抛物面相交后,只能沿交线寻找最低点。

原视频 · 00:40 ↗

约束最小化就是:

沿这条相交曲线寻找高度最低的点。

这个几何图强调:

  • 目标曲面仍定义在整个平面上。
  • 可行点只占其中一条曲线。
  • 可行移动方向受到约束限制。

3. 用 Lagrangian 合并一阶条件

采用加号约定:

L(x,y,λ)=f(x,y)+λg(x,y).\mathcal{L}(x,y,\lambda) = f(x,y)+\lambda g(x,y).

一阶驻点条件为:

x,yL=0,\nabla_{x,y}\mathcal L=0,

以及原约束:

g(x,y)=0.g(x,y)=0.

展开:

f+λg=0.\nabla f+\lambda\nabla g=0.

这里 λ\lambda 是为了让两个法向量线性组合为零的标量。

4. 加号与减号只改变乘子符号

有的教材定义:

L=f+λg.\mathcal L=f+\lambda g.

也有教材定义:

L~=fλ~g.\widetilde{\mathcal L}=f-\widetilde\lambda g.

若令:

λ~=λ,\widetilde\lambda=-\lambda,

两种写法完全等价。

图 3

采用 L=f+λg\mathcal L=f+\lambda g 时驻点条件为 f+λg=0\nabla f+\lambda\nabla g=0;换成减号只会翻转乘子符号。

原视频 · 01:20 ↗

不能把一套定义下算出的 λ\lambda 直接与另一套定义的 λ\lambda 比较。

真正不变的是:

fspan{g}.\nabla f\in\operatorname{span}\{\nabla g\}.

5. 本例的梯度与方程组

目标梯度:

f=[2x2y].\nabla f = \begin{bmatrix} 2x\\ 2y \end{bmatrix}.

约束梯度:

g=[11].\nabla g = \begin{bmatrix} 1\\ 1 \end{bmatrix}.
图 4

本例中 f=(2x,2y)T\nabla f=(2x,2y)^Tg=(1,1)T\nabla g=(1,1)^T,并需同时满足 g(x,y)=0g(x,y)=0

原视频 · 01:40 ↗

按加号约定:

{2x+λ=0,2y+λ=0,x+y2=0.\begin{cases} 2x+\lambda=0,\\ 2y+\lambda=0,\\ x+y-2=0. \end{cases}

前两式相减得到:

x=y.x=y.

再代入约束:

x=y=1.x=y=1.

最后:

λ=2.\lambda=-2.

若采用 L=fλ~g\mathcal L=f-\widetilde\lambda g, 同一点对应 λ~=2\widetilde\lambda=2

6. 梯度为何是等值线的法向量

沿目标等高线移动时, ff 保持不变。

vv 是等高线切向量, 方向导数为:

Dvf=fTv=0.D_vf=\nabla f^Tv=0.

所以 f\nabla f 垂直于目标等高线。

同理, 沿约束曲线 g=0g=0 的切向量 vv 满足:

Dvg=gTv=0.D_vg=\nabla g^Tv=0.

所以 g\nabla g 垂直于约束曲线。

图 5

目标梯度垂直于目标等高线,约束梯度垂直于约束曲线。

原视频 · 02:20 ↗

7. 最优点处为什么需要梯度共线

在正则可行点, 约束切向量 vv 满足:

gTv=0.\nabla g^Tv=0.

若该点是局部极值, 沿任何可行切向方向的一阶变化也必须为零:

fTv=0.\nabla f^Tv=0.

在二维单约束情形下, 与约束切线垂直的法向空间只有一维。

因此:

f=λg.\nabla f=-\lambda\nabla g.
图 6

在可行最优点 (1,1)(1,1),两条法向共线;按加号约定解得 λ=2\lambda=-2

原视频 · 03:00 ↗

几何上, 目标等高线逐渐向低值移动, 直到刚好与约束曲线相切。

若两者横穿, 就仍可沿约束向更低的目标等高线移动。

8. 必须满足约束资格

上述推导要求:

g(x)0.\nabla g(x^\star)\neq0.

这保证约束在局部确实定义一条光滑曲线, 其切空间和法向空间可由 g\nabla g 描述。

若约束梯度为零, 简单的 Lagrange 条件可能无法给出乘子, 即使该点确实是最优点。

这类条件统称约束资格条件。

9. 共线只是必要条件,不自动保证最小

解出:

f+λg=0,g=0\nabla f+\lambda\nabla g=0,\qquad g=0

得到的是候选驻点。

候选点可能是:

  • 约束局部最小。
  • 约束局部最大。
  • 约束鞍点。

还需检查二阶条件、比较目标值或利用问题结构。

本例中:

  • f=x2+y2f=x^2+y^2 严格凸。
  • 约束 x+y=2x+y=2 是仿射集合。

因此可行驻点 (1,1)(1,1) 是唯一全局最小点。

这个结论来自凸性, 不是来自“梯度共线”四个字本身。

10. 多个约束与不等式的边界

若有多个等式约束 gr(x)=0g_r(x)=0, 条件推广为:

f+rλrgr=0.\nabla f + \sum_r\lambda_r\nabla g_r =0.

目标梯度位于所有约束梯度张成的法向空间。

它不要求与每一个约束梯度分别共线。

不等式约束还需要可行性、互补松弛和乘子符号条件, 即 KKT 框架。

不能直接套用单个等式约束的共线图。

跟练与练习

跟练:用代入法核对结果

约束给出:

y=2x.y=2-x.

代入目标:

ϕ(x)=x2+(2x)2=2(x1)2+2.\phi(x) = x^2+(2-x)^2 = 2(x-1)^2+2.

因为平方项非负:

ϕ(x)2.\phi(x)\ge2.

等号只在 x=1x=1 时成立。

所以:

(x,y)=(1,1)(x,y)=(1,1)

是唯一全局最小点。

编者练习

求: minx,yx2+4y2\min_{x,y} x^2+4y^2 满足: x+y3=0.x+y-3=0. 采用: L=f+λg.\mathcal L=f+\lambda g. 写出方程组并求解 x,y,λx,y,\lambda

查看参考答案

梯度为:
f=[2x8y],g=[11].\nabla f= \begin{bmatrix} 2x\\ 8y \end{bmatrix}, \qquad \nabla g= \begin{bmatrix} 1\\ 1 \end{bmatrix}.
方程组:
{2x+λ=0,8y+λ=0,x+y3=0.\begin{cases} 2x+\lambda=0,\\ 8y+\lambda=0,\\ x+y-3=0. \end{cases}
由前两式:
2x=8y,x=4y.2x=8y,\qquad x=4y.
代入约束:
5y=3.5y=3.
因此:
y=35,x=125,λ=245.y=\frac35, \qquad x=\frac{12}{5}, \qquad \lambda=-\frac{24}{5}.
目标严格凸且约束仿射,
所以该候选点是唯一全局最小点。

常见误区

误区 1:忘记把原约束写回方程组

f+λg=0\nabla f+\lambda\nabla g=0 只有变量与乘子关系。

还必须同时满足 g=0g=0

误区 2:不同教材的 λ\lambda 数值必须相同

Lagrangian 的加号或减号会翻转乘子符号。

最优点和共线关系不变。

误区 3:梯度共线一定是最小值

它通常只是一阶必要条件。

必须继续检查问题结构或二阶信息。

误区 4:多个约束时仍要求两两共线

多个约束下, f\nabla f 位于约束梯度的线性张成空间。

误区 5:约束梯度为零也可直接套公式

若约束资格失败, 标准乘子条件可能不适用。

本课小结

等式约束把搜索限制在可行曲线或可行流形上。

在正则局部极值处, 目标沿所有可行切向方向的一阶变化为零。

因此目标梯度位于约束的法向空间。

单个二维约束下表现为:

f+λg=0.\nabla f+\lambda\nabla g=0.

使用 Lagrange 乘子法时要同时检查:

  1. Lagrangian 的符号约定。
  2. 原约束是否写入方程组。
  3. 约束资格是否成立。
  4. 驻点是否真是最小值。
03

主题讲解 · 02:17

K-Means 的 Voronoi 边界与高维超平面

学习目标

  • 复述 K-Means 的分配与质心更新两步。
  • 证明两个质心的欧氏等距边界是中垂超平面。
  • 从二维中垂线推广到高维 Voronoi 单元。
  • 识别初始化、局部最优和高维距离的适用边界。

前置与衔接

给定样本:

x1,,xnRd.x_1,\ldots,x_n\in\mathbb{R}^{d}.

K-Means 要把它们分到 KK 个簇, 并为每个簇求一个质心:

μ1,,μKRd.\mu_1,\ldots,\mu_K\in\mathbb{R}^{d}.

经典目标是最小化簇内平方和:

J=i=1nxiμzi22,J = \sum_{i=1}^{n} \|x_i-\mu_{z_i}\|_2^2,

其中 ziz_i 是样本 ii 的簇标签。

本课结论依赖欧氏距离。

若更换距离或采用非球形簇模型, 边界与更新公式都可能改变。

核心讲解

1. 分配步骤:交给最近质心

先选取 KK 个初始质心。

固定质心后, 每个样本选择:

zi=argminkxiμk22.z_i = \arg\min_{k} \|x_i-\mu_k\|_2^2.
图 1

K-Means 的分配步骤把每个样本交给欧氏距离最近的质心。

原视频 · 00:20 ↗

平方距离与距离给出相同的最近者, 因为平方根在非负数上单调。

使用平方距离可以避免不必要的开方。

2. 更新步骤:簇内均值是最优质心

固定标签后, 第 kk 个簇的质心更新为:

μk=1Cki:zi=kxi.\mu_k = \frac{1}{|C_k|} \sum_{i:z_i=k}x_i.
图 2

分组后用各簇样本均值重算质心;新质心不必落在原始数据点上。

原视频 · 00:40 ↗

为什么是均值?

固定一个簇 CkC_k, 最小化:

iCkxiμ22.\sum_{i\in C_k}\|x_i-\mu\|_2^2.

μ\mu 求梯度:

2Ckμ2iCkxi=0.2|C_k|\mu - 2\sum_{i\in C_k}x_i =0.

解得簇内均值。

所以更新步骤不是经验猜测, 而是固定标签时的精确最优解。

3. 两步交替使目标不增

一次完整迭代包含:

  1. 固定质心,重新分配每个样本。
  2. 固定标签,重新计算每个簇均值。

第一步为每个样本选取更近或同样近的质心, 不会增大 JJ

第二步为每个簇选择平方误差最小的中心, 也不会增大 JJ

图 3

重复最近质心分配和均值更新,直到标签或质心不再变化,或达到迭代上限。

原视频 · 01:00 ↗

常见停止条件包括:

  • 标签不再变化。
  • 质心移动小于阈值。
  • 目标下降小于阈值。
  • 达到最大迭代次数。

目标不增不等于找到全局最优。

不同初始化可能收敛到不同局部固定点。

4. 两个质心的边界是等距集合

只考虑两个质心:

a,bRd.a,b\in\mathbb{R}^{d}.

分类边界上的点 xx 满足:

xa2=xb2.\|x-a\|_2=\|x-b\|_2.

等价地比较平方:

xa22=xb22.\|x-a\|_2^2=\|x-b\|_2^2.
图 4

两个质心的等距点构成中垂线;其两侧分别更靠近其中一个质心。

原视频 · 01:20 ↗

边界的一侧满足:

xa2<xb2,\|x-a\|_2<\|x-b\|_2,

所以归入 aa 所在簇。

另一侧归入 bb 所在簇。

边界上的点出现距离并列, 实现需要固定 tie-breaking 规则。

5. 代数展开直接得到超平面

展开等距式:

(xa)T(xa)=(xb)T(xb).(x-a)^T(x-a) = (x-b)^T(x-b).

消去两侧的 xTxx^Tx

2aTx+a2=2bTx+b2.-2a^Tx+\|a\|^2 = -2b^Tx+\|b\|^2.

整理:

2(ba)Tx=b2a2.2(b-a)^Tx = \|b\|^2-\|a\|^2.

也可写成:

(ba)T(xa+b2)=0.(b-a)^T \left( x-\frac{a+b}{2} \right) =0.

由此立刻读出:

  • 法向量是 bab-a
  • 边界经过中点 (a+b)/2(a+b)/2
  • 边界是一个 d1d-1 维仿射超平面。

二维时是中垂线。

三维时是中垂面。

更高维时是中垂超平面。

6. 二维勾股证明

在二维图中, 从点 CC 向质心连线作垂线。

若垂足 DD 位于中点靠近 AA 的一侧, 则:

AD<BD.AD<BD.

两条斜边共享同一个垂直高度 hh

AC2=AD2+h2,AC^2=AD^2+h^2,
BC2=BD2+h2.BC^2=BD^2+h^2.

所以:

AC<BC.AC<BC.
图 5

在中垂线一侧比较水平分量,再加上相同垂直分量,可由勾股定理证明距离次序。

原视频 · 01:40 ↗

这个证明与代数展开表达同一事实。

代数式更容易推广到任意维度。

7. 三维与高维推广

三维中, 两个质心的等距集合是经过中点、 垂直于质心连线的平面。

图 6

三维的等距边界是中垂面;推广到 dd 维则是垂直于两质心连线的超平面。

原视频 · 02:00 ↗

高维中, 公式仍是:

(ba)T(xa+b2)=0.(b-a)^T \left( x-\frac{a+b}{2} \right) =0.

因此边界仍然线性。

这不是因为高维图形看起来像平面, 而是因为平方欧氏距离展开后 xTxx^Tx 抵消。

8. 多个质心形成 Voronoi 单元

对质心 μk\mu_k, 它的分配区域为:

Vk={x:xμk2xμj2, j}.V_k = \left\{ x: \|x-\mu_k\|_2 \le \|x-\mu_j\|_2, \ \forall j \right\}.

每一个两两比较都给出一个线性半空间。

VkV_k 是这些半空间的交集, 称为该质心的 Voronoi 单元。

所以:

  • 两个质心之间是一个中垂超平面。
  • 多个质心的边界由多块超平面片段拼成。
  • 整体分类函数是分片线性的几何划分。

质心更新后, 整套 Voronoi 划分也随之移动。

9. 高维结论成立,但距离未必好用

等距超平面公式对任意有限维欧氏空间都成立。

但在高维数据中还要注意:

  • 不同特征量纲会主导欧氏距离。
  • 无关维度会稀释有用的聚类结构。
  • 距离可能出现集中现象。
  • 稀疏数据未必适合球形簇假设。

常见前处理包括标准化、特征选择或降维。

这些问题不推翻超平面公式, 而是提醒“数学边界成立”不等于“聚类语义一定合理”。

10. K-Means 的模型边界

经典 K-Means 更适合:

  • 以欧氏距离衡量相似性。
  • 簇大致凸且接近各向同性。
  • 均值对数据有合理含义。

它不天然适合:

  • 弯月形等非凸簇。
  • 类别型变量。
  • 强烈离群点。
  • 需要不同协方差形状的簇。

更换为余弦距离、曼哈顿距离或其他相似度后, “更新为算术均值”和“边界是中垂超平面”都不能直接照搬。

跟练与练习

跟练:求二维中垂线

设:

a=(0,0),b=(4,2).a=(0,0),\qquad b=(4,2).

边界:

(ba)T(xa+b2)=0.(b-a)^T \left( x-\frac{a+b}{2} \right) =0.

中点为 (2,1)(2,1), 法向量为 (4,2)(4,2)

所以:

4(x12)+2(x21)=0,4(x_1-2)+2(x_2-1)=0,

即:

2x1+x2=5.2x_1+x_2=5.
编者练习

在三维空间中, 两个质心为: a=(1,0,0),b=(3,2,0).a=(1,0,0),\qquad b=(3,2,0). 回答:

  1. 等距边界的法向量是什么?
  2. 边界经过哪个中点?
  3. 写出平面方程。
  4. x=(1,1,0)x=(1,1,0) 更靠近哪个质心?
查看参考答案

法向量:
ba=(2,2,0).b-a=(2,2,0).
中点:
a+b2=(2,1,0).\frac{a+b}{2}=(2,1,0).
平面方程:
(2,2,0)T(x(2,1,0))=0.(2,2,0)^T \left( x-(2,1,0) \right) =0.
即:
2x1+2x26=0,2x_1+2x_2-6=0,
或:
x1+x2=3.x_1+x_2=3.
对点 (1,1,0)(1,1,0)
xa22=1,xb22=5.\|x-a\|_2^2=1, \qquad \|x-b\|_2^2=5.
所以它更靠近 aa

常见误区

误区 1:质心必须是某个真实样本

K-Means 质心是簇内均值, 通常不落在原始数据点上。

误区 2:目标单调下降就保证全局最优

交替更新只保证目标不增。

最终结果依赖初始化。

误区 3:高维边界仍叫“中垂线”

二维是线, 三维是面, dd 维是 d1d-1 维超平面。

误区 4:任意距离的边界都是中垂超平面

线性边界来自平方欧氏距离中的 xTxx^Tx 抵消。

其他距离需要重新推导。

误区 5:边界公式正确就说明聚类合理

高维量纲、噪声和簇形状仍会影响欧氏距离的语义。

本课小结

K-Means 在两个步骤间交替:

  1. 每个样本分配给最近质心。
  2. 每个质心更新为簇内均值。

对两个质心 a,ba,b, 欧氏等距边界为:

(ba)T(xa+b2)=0.(b-a)^T \left( x-\frac{a+b}{2} \right) =0.

它经过两质心中点, 法向量是质心差。

二维是中垂线, 三维是中垂面, 高维是超平面。

多个质心的两两半空间交集形成 Voronoi 单元。

使用这套几何解释时, 还必须记住欧氏距离、特征尺度、初始化和局部最优的边界。

04

主题讲解 · 03:06

梯度为何与参数同形:从一元更新到张量更新

学习目标

  • 说明标量损失对参数张量的梯度为何与参数同 shape。
  • 对齐偏导、nabla 与代码中 dW 等常见记号。
  • 把一元梯度下降推广为向量和张量更新。
  • 判断负梯度方向与学习率的适用边界。

前置与衔接

设模型参数为张量 WW, 损失为标量:

L=L(W)R.L=L(W)\in\mathbb{R}.

深度学习反向传播通常计算:

WL.\nabla_WL.

因为输出是标量, 每个参数元素只需要保存一个对应偏导。

所以梯度可以按参数原位置排回同一个 shape。

如果输出本身是向量或张量, 完整导数一般是 Jacobian, 不再只是与输入同 shape 的梯度。

核心讲解

1. 标量损失的梯度按参数原位排列

设:

W=[w11w12w21w22].W= \begin{bmatrix} w_{11}&w_{12}\\ w_{21}&w_{22} \end{bmatrix}.

标量损失对 WW 的梯度定义为:

WL=[L/w11L/w12L/w21L/w22].\nabla_WL = \begin{bmatrix} \partial L/\partial w_{11} & \partial L/\partial w_{12}\\ \partial L/\partial w_{21} & \partial L/\partial w_{22} \end{bmatrix}.
图 1

标量损失对参数张量的梯度由各元素偏导按原位置排列,因此与参数同 shape。

原视频 · 00:20 ↗

每个梯度元素回答:

在其他参数暂时不变时, 对应参数增加一个微小量, 损失的一阶变化率是多少。

shape 相同使得后续更新:

WηWLW-\eta\nabla_WL

可以逐元素对齐。

2. “同 shape”结论的准确边界

对任意参数张量:

WRs1××sr,W\in\mathbb{R}^{s_1\times\cdots\times s_r},

若:

L(W)R,L(W)\in\mathbb{R},

则:

WLRs1××sr.\nabla_WL \in \mathbb{R}^{s_1\times\cdots\times s_r}.

但若:

Y=f(W)Y=f(W)

也是多元素张量, 完整 Jacobian 要同时保留输出轴和输入轴。

所以更严谨的说法是:

“标量损失对参数张量的梯度与参数同 shape。”

不能把它误写成“任何张量对张量求导都同 shape”。

3. 不同梯度记号描述同一组偏导

常见写法包括:

LW,\frac{\partial L}{\partial W},
WL,\nabla_WL,

以及代码或算子推导中的:

dW.dW.
图 2

L/W\partial L/\partial WWL\nabla_WL 和代码中的 dW 可表示同一参数梯度,但 d 也可能用于微分。

原视频 · 01:00 ↗

这些记号在具体语境中都可表示:

[LWα]α.\left[ \frac{\partial L}{\partial W_\alpha} \right]_\alpha.

dWdW 有歧义:

  • 在反向传播代码中常表示参数梯度。
  • 在微分推导中常表示参数的微小变化。

阅读公式时要先确认作者的记号约定。

4. 一元与多元的映射类型

一元损失:

L:RR.L:\mathbb{R}\rightarrow\mathbb{R}.

输入 ww 与输出 LL 都是标量。

多元损失:

L:RdR.L:\mathbb{R}^{d}\rightarrow\mathbb{R}.

输入扩为:

w=[w1wd],w= \begin{bmatrix} w_1\\ \vdots\\ w_d \end{bmatrix},

输出仍是一个标量损失。

图 3

一元优化是标量到标量,多元优化把参数扩为向量或张量,但损失仍是标量。

原视频 · 01:40 ↗

多元并不是“损失也变成向量”。

它表示需要同时优化多个参数自由度。

5. 一元示例:L(w)=w2L(w)=w^2

损失:

L(w)=w2.L(w)=w^2.

导数:

L(w)=2w.L'(w)=2w.

w=1w=1

L(1)=2.L'(1)=2.
图 4

L(w)=w2L(w)=w^2,一元梯度就是普通导数 2w2w;在 w=1w=1 时等于 2。

原视频 · 02:00 ↗

梯度下降更新:

w+=wηL(w).w^+=w-\eta L'(w).

取:

η=0.25,\eta=0.25,

得到:

w+=10.25×2=0.5.w^+=1-0.25\times2=0.5.

参数从 1 向最小点 0 移动。

6. 多元示例:各偏导组成梯度

设:

L(w1,w2)=w12+w22.L(w_1,w_2)=w_1^2+w_2^2.

分别求偏导:

Lw1=2w1,Lw2=2w2.\frac{\partial L}{\partial w_1}=2w_1, \qquad \frac{\partial L}{\partial w_2}=2w_2.

按参数顺序组成列梯度:

L(w)=[2w12w2].\nabla L(w) = \begin{bmatrix} 2w_1\\ 2w_2 \end{bmatrix}.
图 5

L(w1,w2)=w12+w22L(w_1,w_2)=w_1^2+w_2^2,梯度为 (2w1,2w2)T(2w_1,2w_2)^T

原视频 · 02:20 ↗

在:

w=(1,1)Tw=(1,1)^T

处:

L(w)=[22].\nabla L(w) = \begin{bmatrix} 2\\ 2 \end{bmatrix}.

7. 统一更新是同 shape 张量减法

统一写成:

W+=WηWL(W).W^+ = W-\eta\nabla_WL(W).

对二维示例:

[11]0.25[22]=[0.50.5].\begin{bmatrix} 1\\ 1 \end{bmatrix} - 0.25 \begin{bmatrix} 2\\ 2 \end{bmatrix} = \begin{bmatrix} 0.5\\ 0.5 \end{bmatrix}.
图 6

统一更新 w+=wηL(w)w^+=w-\eta\nabla L(w);在 (1,1)(1,1)η=0.25\eta=0.25 时得到 (0.5,0.5)(0.5,0.5)

原视频 · 02:40 ↗

对矩阵、卷积核或更高阶参数, 公式仍不变。

梯度与参数同 shape, 所以每个元素都有对应更新量。

8. 为什么使用负梯度方向

一阶 Taylor 近似:

L(W+ΔW)L(W)+WL,ΔWF.L(W+\Delta W) \approx L(W) + \langle\nabla_WL,\Delta W\rangle_F.

若限制步长:

ΔWFϵ,\|\Delta W\|_F\le\epsilon,

使内积最小的方向是:

ΔW=ϵWLWLF.\Delta W = -\epsilon \frac{\nabla_WL}{\|\nabla_WL\|_F}.

因此在欧氏或 Frobenius 几何下, 负梯度是局部最陡下降方向。

“最陡”依赖所选范数或度量。

换成自然梯度等方法后, 方向会按不同几何重新缩放。

9. 学习率决定是否真的下降

负梯度给出局部方向, 但更新长度由 η\eta 决定。

对:

L(w)=w2,L(w)=w^2,

更新为:

w+=(12η)w.w^+ =(1-2\eta)w.

要让迭代收敛到 0, 需要:

12η<1,|1-2\eta|<1,

即:

0<η<1.0<\eta<1.

视频中的 η=0.25\eta=0.25 满足该条件。

η\eta 太大, 即使方向是负梯度, 一步也可能跨过谷底并造成振荡或发散。

10. 编者补充:一般光滑函数的下降保证

L\nabla Lβ\beta-Lipschitz, 下降引理说明在 0<η<2/β0<\eta<2/\beta 时, 标准梯度步具有单步下降保证。

这是视频外的条件说明。

非凸深度网络中仍不能据此保证到达全局最优, 更常见的目标是找到驻点或较低损失区域。

跟练与练习

跟练:矩阵参数的同 shape 梯度

设:

L(W)=12WF2.L(W)=\frac12\|W\|_F^2.

展开:

L(W)=12i,jWij2.L(W) = \frac12 \sum_{i,j}W_{ij}^2.

所以:

LWij=Wij.\frac{\partial L}{\partial W_{ij}}=W_{ij}.

按原位排列:

WL=W.\nabla_WL=W.

更新为:

W+=(1η)W.W^+=(1-\eta)W.
编者练习

设: L(w1,w2)=w12+4w22,L(w_1,w_2)=w_1^2+4w_2^2, 初始点: w=(2,1)T,w=(2,1)^T, 学习率: η=0.1.\eta=0.1. 计算梯度和一步更新后的参数, 并比较更新前后的损失。

查看参考答案

梯度为:
L(w)=(2w1,8w2)T=(4,8)T.\nabla L(w)=(2w_1,8w_2)^T=(4,8)^T.
一步更新为:
w+=(2,1)T0.1(4,8)T=(1.6,0.2)T.w^+=(2,1)^T-0.1(4,8)^T=(1.6,0.2)^T.
更新前:
L(2,1)=4+4=8.L(2,1)=4+4=8.
更新后:
L(1.6,0.2)=1.62+4(0.2)2=2.72.L(1.6,0.2)=1.6^2+4(0.2)^2=2.72.
本步使损失下降。

常见误区

误区 1:任何导数都与输入同 shape

只有标量输出对输入的梯度可直接按输入 shape 排列。

多元素输出的完整导数是 Jacobian。

误区 2:dW 永远只表示梯度

在微分推导中, dW 也可能表示参数变化。

必须查看上下文定义。

误区 3:负梯度方向保证任意步长都下降

方向是局部结论。

学习率过大仍可能上升或发散。

误区 4:多元更新需要为每个元素写新算法

只要梯度与参数 shape 对齐, 统一张量公式即可逐元素更新。

误区 5:梯度下降保证深度网络全局最优

一般非凸问题没有这种保证。

本课小结

标量损失对参数张量的梯度, 是所有参数元素偏导按原位置排成的同 shape 张量。

一元和多元使用同一更新:

W+=WηWL.W^+=W-\eta\nabla_WL.

多元推广只把:

  • 标量参数变成向量或张量。
  • 普通导数变成同 shape 梯度。
  • 标量减法变成张量减法。

负梯度是欧氏几何下的局部最陡下降方向。

是否真正下降还取决于学习率、函数光滑性和优化问题结构。

05

主题讲解 · 11:14

三种多元推广:高斯、梯度下降与 Taylor

学习目标

  • 区分三种“从一元到多元”分别推广了什么对象。
  • 用 shape 读懂多元正态密度中的行列式与二次型。
  • 把一元导数更新推广为参数张量的梯度更新。
  • 把一元 Taylor 的一、二阶导推广为梯度与 Hessian。

前置与衔接

本课把三个主题并排比较:

  • 正态分布。
  • 梯度下降。
  • Taylor 展开。

它们都从标量走向向量和矩阵, 但不是同一条公式的三个名字。

三者分别处理:

  • 概率分布的随机输入与参数。
  • 优化中的参数与下降方向。
  • 标量函数在基点附近的局部近似。
图 1

正态分布、梯度下降和 Taylor 展开分别把随机变量、参数与局部近似从一维推广到多维。

原视频 · 00:00 ↗

核心讲解

1. 先建立三条 shape 路线

正态分布:

xRxRd.x\in\mathbb{R} \quad\longrightarrow\quad x\in\mathbb{R}^{d}.

梯度下降:

wRwRd 或参数张量.w\in\mathbb{R} \quad\longrightarrow\quad w\in\mathbb{R}^{d} \text{ 或参数张量}.

Taylor 展开:

L(w0)L(w0),L'(w_0) \quad\longrightarrow\quad \nabla L(w_0),
L(w0)2L(w0).L''(w_0) \quad\longrightarrow\quad \nabla^2L(w_0).

共同点是线性代数结构增加。

不同点是变量的概率、优化与近似语义不能混用。

2. 一元正态由均值和方差参数化

一元正态写作:

XN(μ,σ2).X\sim\mathcal N(\mu,\sigma^2).

密度为:

p(x)=12πσexp((xμ)22σ2),σ>0.p(x) = \frac{1}{\sqrt{2\pi}\sigma} \exp \left( -\frac{(x-\mu)^2}{2\sigma^2} \right), \qquad \sigma>0.

μ\mu 决定中心。

σ2\sigma^2 决定宽度。

密度 p(x)p(x) 是实数输入到非负标量的映射。

单点密度值不是单点概率。

连续分布在区间上的积分才给出概率。

3. 多元正态由均值向量和协方差矩阵参数化

设:

x,μRd,x,\mu\in\mathbb{R}^{d},
ΣRd×d.\Sigma\in\mathbb{R}^{d\times d}.

非退化多元正态密度为:

p(x)=1(2π)d/2Σ1/2exp ⁣(12(xμ)TΣ1(xμ)).p(x)=\frac{1}{(2\pi)^{d/2}|\Sigma|^{1/2}} \exp\!\left(-\frac12(x-\mu)^T\Sigma^{-1}(x-\mu)\right).
图 2

多元正态由均值向量 μ\mu 与协方差矩阵 Σ\Sigma 参数化,二次型把向量输入映射为标量密度。

原视频 · 04:20 ↗

这里要求 Σ\Sigma 对称正定, 从而:

  • Σ1\Sigma^{-1} 存在。
  • Σ>0|\Sigma|>0
  • 公式定义普通的 dd 维密度。

Σ\Sigma 仅半正定且奇异, 分布可能集中在低维子空间, 不能直接使用上式的逆矩阵与普通体积密度。

这是视频图示之外的重要边界。

4. 多元密度为什么仍输出标量

shape 账本:

(xμ)T:(1,d),(x-\mu)^T:(1,d),
Σ1:(d,d),\Sigma^{-1}:(d,d),
(xμ):(d,1).(x-\mu):(d,1).

所以 Mahalanobis 二次型:

q(x)=(xμ)TΣ1(xμ)q(x) =(x-\mu)^T\Sigma^{-1}(x-\mu)

的 shape 是:

(1,d)(d,d)(d,1)(1,1).(1,d)(d,d)(d,1)\rightarrow(1,1).

行列式 Σ|\Sigma| 也是标量。

因此:

p:RdR0.p:\mathbb{R}^{d}\rightarrow\mathbb{R}_{\ge0}.

输入从数扩为向量, 输出仍是密度高度。

5. 一元正态是 d=1d=1 的特例

d=1d=1

μ=[μ],Σ=[σ2].\mu=[\mu],\qquad \Sigma=[\sigma^2].

于是:

Σ1/2=σ,|\Sigma|^{1/2}=\sigma,
Σ1=[1/σ2],\Sigma^{-1}=[1/\sigma^2],
(2π)d/2=2π.(2\pi)^{d/2}=\sqrt{2\pi}.

代回多元公式, 正好得到一元正态密度。

这不是相似类比, 而是参数维度退化后的严格特例关系。

6. 协方差决定等密度椭球

固定密度等价于固定:

(xμ)TΣ1(xμ)=c.(x-\mu)^T \Sigma^{-1} (x-\mu) =c.

二维中, 它给出椭圆。

高维中, 它给出椭球面。

图 3

二维高斯的等密度线由协方差控制:单位阵给出圆,方向方差不同时变成椭圆。

原视频 · 05:20 ↗

更精确地说:

  • μ\mu 决定中心。
  • Σ\Sigma 的特征向量决定主轴方向。
  • Σ\Sigma 的特征值决定对应方向的方差尺度。
  • 非零协方差会旋转等密度椭圆。

正协方差与负协方差给出相反倾斜方向。

原 ASR 在负相关片段漏掉负号, 此处按画面与“负相关”语义校正。

7. 多元标准正态

多元标准正态写作:

XN(0,Id).X\sim\mathcal N(0,I_d).

它满足:

  • 均值为零向量。
  • 每个维度方差为 1。
  • 不同维度协方差为 0。
  • 在 Gaussian 情形下,各维度相互独立。

其密度只依赖 x2\|x\|_2, 所以具有旋转对称性。

DDPM 等扩散模型常从这一分布采样噪声。

8. 梯度下降把参数和导数推广为同 shape 张量

设标量损失:

L:RdR.L:\mathbb{R}^{d}\rightarrow\mathbb{R}.

梯度:

L(w)=[L/w1L/wd].\nabla L(w) = \begin{bmatrix} \partial L/\partial w_1\\ \vdots\\ \partial L/\partial w_d \end{bmatrix}.
图 4

标量损失对参数张量求梯度时,各偏导按原位置排列,结果与参数同 shape。

原视频 · 06:40 ↗

参数若是矩阵或高阶张量, 梯度也按相同位置排列。

这个同 shape 结论要求输出是标量损失。

向量输出对向量输入的完整导数一般是 Jacobian。

9. 一元与多元共享同一个更新式

统一更新为:

w+=wηL(w).w^+ = w-\eta\nabla L(w).

一元中, ww 和梯度都是标量。

多元中, 它们是同 shape 向量或张量。

图 5

梯度下降统一写成 w+=wηL(w)w^+=w-\eta\nabla L(w),标量和向量只在参数与梯度 shape 上不同。

原视频 · 09:00 ↗

对:

L(w1,w2)=w12+w22,L(w_1,w_2)=w_1^2+w_2^2,

有:

L=(2w1,2w2)T.\nabla L=(2w_1,2w_2)^T.

(1,1)(1,1)η=0.25\eta=0.25 时:

(1,1)T0.25(2,2)T=(0.5,0.5)T.(1,1)^T - 0.25(2,2)^T = (0.5,0.5)^T.

负梯度是欧氏几何下的局部最陡下降方向。

学习率过大时仍可能发散, 非凸问题也不保证全局最优。

10. Taylor 展开把导数升级为梯度与 Hessian

一元二阶形式:

L(w0+Δw)L(w0)+L(w0)Δw+12L(w0)(Δw)2.L(w_0+\Delta w) \approx L(w_0) + L'(w_0)\Delta w + \frac12L''(w_0)(\Delta w)^2.

多元中:

w0,ΔwRd,w_0,\Delta w\in\mathbb{R}^{d},
g0=L(w0)Rd,g_0=\nabla L(w_0)\in\mathbb{R}^{d},
H0=2L(w0)Rd×d.H_0=\nabla^2L(w_0)\in\mathbb{R}^{d\times d}.

二阶形式变为:

L(w0+Δw)L(w0)+g0TΔw+12ΔwTH0Δw.L(w_0+\Delta w) \approx L(w_0) + g_0^T\Delta w + \frac12\Delta w^TH_0\Delta w.
图 6

多元 Taylor 的一阶项是梯度与位移的内积,二阶项是位移、Hessian 与位移组成的标量二次型。

原视频 · 11:00 ↗

一阶项 shape:

(1,d)(d,1)(1,1).(1,d)(d,1)\rightarrow(1,1).

二阶项 shape:

(1,d)(d,d)(d,1)(1,1).(1,d)(d,d)(d,1)\rightarrow(1,1).

Taylor 是基点附近的局部近似。

准确性取决于位移大小、函数光滑性与被省略的高阶项。

11. 三种推广的统一点与不同点

统一点:

  • 标量自由度扩为多个坐标。
  • 向量、矩阵与内积组织分量关系。
  • 最终关注量常仍是标量。

不同点:

主题输入推广参数或导数推广标量输出
正态分布随机变量 \to 随机向量均值 μ\to\mu,方差 Σ\to\Sigma密度 p(x)p(x)
梯度下降标量参数 \to 参数张量导数 L\to\nabla L损失 LL
Taylor标量位移 \to 向量位移一阶导 g\to g,二阶导 H\to H局部函数值

不能因为三者都出现矩阵, 就把协方差、Hessian 与参数梯度视为同一对象。

它们的单位、对称性和数学作用都不同。

跟练与练习

跟练:逐项检查多元正态 shape

设:

d=3.d=3.

则:

x,μ:(3,1),Σ:(3,3).x,\mu:(3,1),\qquad \Sigma:(3,3).

二次型:

(xμ)TΣ1(xμ)(x-\mu)^T\Sigma^{-1}(x-\mu)

的 shape 为:

(1,3)(3,3)(3,1)(1,1).(1,3)(3,3)(3,1)\rightarrow(1,1).

行列式:

Σ|\Sigma|

也是标量。

所以 p(x)p(x) 为标量。

编者练习

对以下三条陈述分别判断正确与否,并说明原因:

  1. 多元正态的协方差矩阵可以任意不可逆,仍直接使用含 Σ1\Sigma^{-1} 的普通密度公式。
  2. 标量损失对矩阵参数的梯度与参数同 shape。
  3. 多元 Taylor 的二阶项 ΔwTHΔw\Delta w^TH\Delta w 是向量。
查看参考答案

第 1 条错误。
含逆矩阵和正行列式的普通密度公式要求 Σ\Sigma 正定。
奇异协方差对应退化 Gaussian,
需要在低维支撑上单独处理。
第 2 条正确。
每个参数元素有一个标量偏导,
可按原位置排成同 shape 梯度。
第 3 条错误。
shape 为:
(1,d)(d,d)(d,1)(1,1),(1,d)(d,d)(d,1)\rightarrow(1,1),
所以二阶项是标量。

常见误区

误区 1:连续密度值就是单点概率

概率由区域上的密度积分给出。

误区 2:任意协方差都能代入逆矩阵公式

非退化密度要求 Σ\Sigma 对称正定。

误区 3:零协方差在所有分布中都等于独立

这一等价在联合 Gaussian 中成立, 一般分布中不成立。

误区 4:负梯度方向允许任意大学习率

方向是局部信息, 步长过大仍可能发散。

误区 5:协方差、Hessian 与梯度只是不同名字

它们分别描述随机变量联合变化、局部二阶曲率与损失一阶变化。

本课小结

三种多元推广都使用向量和矩阵, 但各自推广对象不同:

  • 多元正态:随机变量变成随机向量,参数变成均值向量和协方差矩阵。
  • 梯度下降:参数变成向量或张量,导数变成同 shape 梯度。
  • 多元 Taylor:一阶导变成梯度,二阶导变成 Hessian。

可靠理解这些公式的共同方法是:

  1. 写清输入与输出类型。
  2. 给每个向量、矩阵标出 shape。
  3. 检查最终标量如何由内积或二次型得到。
  4. 分别检查正定性、学习率与局部光滑性等主题专属条件。
06

主题讲解 · 02:01

一元到多元:三类公式的共同升级路径

学习目标

  • 看清 Taylor 展开、正态分布和梯度下降各自推广了什么。
  • 用 shape 区分梯度、Hessian、均值向量与协方差矩阵。
  • 从一元公式推导对应的多元写法,而不是只背符号。
  • 识别三类推广的共同结构与不可混淆的数学语义。

前置与衔接

本课把三个常见的“一元到多元”放在同一张地图上:

  • Taylor 展开研究函数在基点附近的局部近似。
  • 正态分布描述随机变量或随机向量的概率规律。
  • 梯度下降给出标量目标函数的迭代优化方向。
图 1

Taylor 展开、正态分布和梯度下降都可从一元推广到多元,但三者推广的对象并不相同。

原视频 · 00:00 ↗

三者都会出现向量或矩阵, 但“出现矩阵”不等于“矩阵的意义相同”。

后文统一采用列向量约定:

w,Δw,L(w)Rd.w,\Delta w,\nabla L(w)\in\mathbb R^d.

视频画面中把梯度横放、位移竖放, 对应这里的 L(w0)TΔw\nabla L(w_0)^T\Delta w

核心讲解

1. 一元 Taylor:用导数补出局部高度差

在基点 w0w_0 附近, 令目标位置为:

w=w0+Δw.w=w_0+\Delta w.

二阶 Taylor 展开写作:

L(w0+Δw)=L(w0)+L(w0)Δw+12L(w0)(Δw)2+o((Δw)2).L(w_0+\Delta w) =L(w_0) +L'(w_0)\Delta w +\frac12L''(w_0)(\Delta w)^2 +o((\Delta w)^2).
图 2

一元 Taylor 在 w0w_0 处用函数值、导数和二阶导数近似附近函数值。

原视频 · 00:20 ↗

四部分各有明确角色:

  • L(w0)L(w_0) 是基点高度。
  • L(w0)ΔwL'(w_0)\Delta w 是切线给出的一阶高度变化。
  • 12L(w0)(Δw)2\frac12L''(w_0)(\Delta w)^2 修正曲率。
  • 余项说明这仍是局部近似,不是任意远处的恒等式。

若只保留一阶项, 得到局部线性化:

L(w0+Δw)L(w0)+L(w0)Δw.L(w_0+\Delta w) \approx L(w_0)+L'(w_0)\Delta w.

2. 多元 Taylor:导数升级为梯度与 Hessian

当参数变成向量:

w0=(w1,w2,,wd)T,w_0=(w_1,w_2,\ldots,w_d)^T,

函数仍输出一个标量:

L:RdR.L:\mathbb R^d\rightarrow\mathbb R.

二阶展开变为:

L(w0+Δw)=L(w0)+L(w0)TΔw+12ΔwTH(w0)Δw+o( ⁣(Δw2)),L(w_0+\Delta w) =L(w_0) +\nabla L(w_0)^T\Delta w +\frac12\Delta w^T H(w_0)\Delta w +o(\!\left(\|\Delta w\|^2\right)),

其中:

H(w0)=2L(w0)Rd×d.H(w_0)=\nabla^2L(w_0)\in\mathbb R^{d\times d}.
图 3

多元 Taylor 把导数扩为梯度,把二阶导数扩为 Hessian,并保持每项为标量。

原视频 · 00:40 ↗

shape 账本为:

L(w0)TΔw:(1,d)(d,1)(1,1),\nabla L(w_0)^T\Delta w: (1,d)(d,1)\rightarrow(1,1),
ΔwTH(w0)Δw:(1,d)(d,d)(d,1)(1,1).\Delta w^TH(w_0)\Delta w: (1,d)(d,d)(d,1)\rightarrow(1,1).

两个修正项最终都必须是标量, 才能与标量 L(w0)L(w_0) 相加。

这就是多元公式中“横着的梯度”和“竖着的位移”要配对的原因。

LL 二阶连续可微时, Hessian 满足对称性:

Hij=Hji.H_{ij}=H_{ji}.

这是视频之外的数学边界补充: 若混合偏导条件不满足, 不能不加条件地断言 Hessian 对称。

3. 一元正态:一个随机变量配两个标量参数

一元正态写作:

XN(μ,σ2),X\sim\mathcal N(\mu,\sigma^2),

其中:

  • XX 是一个随机变量。
  • μ\mu 是均值标量。
  • σ2\sigma^2 是方差标量。

它的密度是从实数到非负实数的函数:

p:RR0.p:\mathbb R\rightarrow\mathbb R_{\ge 0}.

这里 p(x)p(x) 是密度高度, 单点密度值不是连续随机变量取到该点的概率。

4. 多元正态:随机变量升级为随机向量

多元情形把一个随机变量换成随机向量:

X=(X1,X2,,Xd)TRd.X=(X_1,X_2,\ldots,X_d)^T\in\mathbb R^d.

对应记作:

XN(μ,Σ).X\sim\mathcal N(\mu,\Sigma).
图 4

一元正态描述一个随机变量,多元正态描述随机向量 X=(X1,,Xd)TX=(X_1,\ldots,X_d)^T

原视频 · 01:00 ↗

参数的 shape 也随之变化:

μ=E[X]Rd,\mu=\mathbb E[X]\in\mathbb R^d,
Σ=E[(Xμ)(Xμ)T]Rd×d.\Sigma =\mathbb E[(X-\mu)(X-\mu)^T] \in\mathbb R^{d\times d}.
图 5

多元正态把标量均值和方差扩为均值向量与协方差矩阵。

原视频 · 01:20 ↗

协方差矩阵的对角线是各分量的方差:

Σii=Var(Xi).\Sigma_{ii}=\operatorname{Var}(X_i).

非对角线描述两分量的线性共同变化:

Σij=Cov(Xi,Xj).\Sigma_{ij} =\operatorname{Cov}(X_i,X_j).

因此从 σ2\sigma^2Σ\Sigma, 并不只是把多个方差排成一列; 还要记录分量之间的协方差。

任意协方差矩阵都应当对称半正定:

aTΣa0,aRd.a^T\Sigma a\ge 0, \qquad \forall a\in\mathbb R^d.

若要使用含 Σ1\Sigma^{-1}Σ1/2|\Sigma|^{-1/2} 的普通多元正态密度公式, 还需 Σ\Sigma 正定、可逆。

奇异协方差对应分布落在较低维子空间, 这是视频未展开的边界情况。

5. 一元梯度下降:沿负导数方向更新

对于:

L:RR,L:\mathbb R\rightarrow\mathbb R,

一元梯度下降为:

wk+1=wkηL(wk),w_{k+1}=w_k-\eta L'(w_k),

其中 η>0\eta>0 是学习率。

L(wk)>0L'(w_k)>0 时, 减去正数使 ww 向左移动; 当 L(wk)<0L'(w_k)<0 时, 减去负数使 ww 向右移动。

局部上,这两种情况都沿函数下降方向前进。

6. 多元梯度下降:沿曲面的最陡下降方向更新

当参数为向量、损失仍为标量:

L:RdR,L:\mathbb R^d\rightarrow\mathbb R,

更新变为:

wk+1=wkηL(wk).w_{k+1}=w_k-\eta\nabla L(w_k).
图 6

多元梯度下降在损失曲面上沿负梯度方向更新参数向量。

原视频 · 01:40 ↗

梯度收集所有一阶偏导:

L(w)=[Lw1Lwd].\nabla L(w) = \begin{bmatrix} \frac{\partial L}{\partial w_1}\\ \vdots\\ \frac{\partial L}{\partial w_d} \end{bmatrix}.

对任意小位移 Δw\Delta w, 一阶变化近似为:

ΔLL(w)TΔw.\Delta L\approx\nabla L(w)^T\Delta w.

在欧氏范数约束 Δw=ε\|\Delta w\|=\varepsilon 下, 使一阶变化最小的方向是:

Δw=εL(w)L(w).\Delta w =-\varepsilon \frac{\nabla L(w)}{\|\nabla L(w)\|}.

所以负梯度是欧氏几何下的局部最陡下降方向。

“最陡”依赖所选度量; 自然梯度等方法会使用不同几何。 这一点属于视频之外的边界补充。

学习率也不能省略讨论。 即使方向正确, η\eta 过大仍可能越过低点并振荡或发散。

7. 三条推广的共同骨架

可以把本课压成一张对照表:

主题一元对象多元对象新增结构最终输出
TaylorwRw\in\mathbb RwRdw\in\mathbb R^d梯度、Hessian标量近似值
正态分布随机变量 XX随机向量 XX均值向量、协方差矩阵标量密度
梯度下降标量参数 ww向量或参数张量 ww梯度新参数

共同骨架是:

  1. 原来的单个分量扩成多个分量。
  2. 分量之间的联合关系需要向量、矩阵或内积表达。
  3. 最终结果的 shape 必须与原任务匹配。

但三种矩阵对象不能互换:

  • Hessian 是标量函数的二阶导数矩阵。
  • 协方差是随机向量二阶中心矩的期望。
  • 梯度是标量函数对参数的一阶导数组。

它们可能 shape 相同, 定义、单位和用途仍完全不同。

8. “参数同形”该怎样准确表述

LL 是标量, 对向量参数 ww 有:

wLRd.\nabla_wL\in\mathbb R^d.

若参数是矩阵 WRm×nW\in\mathbb R^{m\times n}, 则在 Frobenius 内积约定下:

WLRm×n.\nabla_WL\in\mathbb R^{m\times n}.

这就是工程中常说的“梯度与参数同形”。

但若输出不是标量, 例如:

f:RdRm,f:\mathbb R^d\rightarrow\mathbb R^m,

其一阶导一般是 Jacobian:

JfRm×d,J_f\in\mathbb R^{m\times d},

不能继续简单说“导数与输入同形”。

跟练与练习

编者练习

练习 1:检查 Taylor 项的 shapewR3w\in\mathbb R^3L:R3RL:\mathbb R^3\rightarrow\mathbb R。 写出 L\nabla LHHΔw\Delta w 的 shape, 并判断下式能否与 L(w0)L(w_0) 相加: ΔwTHΔw.\Delta w^TH\Delta w.

查看参考答案

L,ΔwR3\nabla L,\Delta w\in\mathbb R^3
HR3×3H\in\mathbb R^{3\times3}
(1,3)(3,3)(3,1)(1,1),(1,3)(3,3)(3,1)\rightarrow(1,1),
所以二次型是标量,
可以与 L(w0)L(w_0) 相加。

编者练习

练习 2:判断协方差矩阵是否合理 判断: Σ=[1221]\Sigma= \begin{bmatrix} 1&2\\ 2&1 \end{bmatrix} 能否作为普通二维正态分布的协方差矩阵?

查看参考答案

不能。
它虽然对称,
但特征值为 331-1
不是半正定矩阵,
因此不能作为任何随机向量的协方差矩阵。

编者练习

练习 3:区分三类矩阵 请分别回答:

  1. 2L(w)\nabla^2L(w) 来自什么运算?
  2. Σ\Sigma 来自什么运算?
  3. 它们 shape 相同是否意味着可以互换?
查看参考答案

2L(w)\nabla^2L(w) 是标量函数对参数的二阶偏导数组;
Σ\Sigma 是随机向量中心化外积的期望。
即使二者都是 d×dd\times d
定义、单位和作用都不同,
不能因 shape 相同而互换。

常见误区

误区 1:多元就是把同一个标量复制多份

多元正态不仅需要每一维的均值和方差, 还要用协方差表达维度之间的联合变化。

多元 Taylor 也不仅是分别做多个一元展开, Hessian 的非对角项还记录变量之间的二阶耦合。

误区 2:梯度、Hessian、协方差都是矩阵,所以含义接近

shape 只是合法运算的第一道检查。

数学对象还要检查:

  • 它对谁求导或取期望。
  • 它的每个元素表示什么。
  • 它是否带有对称、正定等条件。

误区 3:负梯度一定让损失下降

负梯度给出局部一阶下降方向, 并不保证任意长度的更新都下降。

学习率过大、函数不光滑或数值误差, 都可能破坏单步下降。

误区 4:Taylor 展开在所有距离上都准确

Taylor 是围绕基点的局部近似。

离基点越远, 高阶项和余项越可能不可忽略。

误区 5:协方差为零总等于独立

零协方差通常只说明没有线性相关。

联合正态是一个重要特例: 对联合正态向量, 分量间零协方差可以推出独立。

本课小结

  • 一元 Taylor 的导数与二阶导,在多元中升级为梯度与 Hessian。
  • 一元正态的随机变量、均值与方差,在多元中升级为随机向量、均值向量与协方差矩阵。
  • 一元梯度下降的导数更新,在多元中升级为沿负梯度的向量或张量更新。
  • 三条路线都需要线性代数,但 Hessian、协方差与梯度承担不同角色。
  • 读多元公式时先列 shape,再核对定义、条件和最终输出语义。
  • 视频给出了统一直觉;正定性、余项、度量与 Jacobian 边界属于本文明确标注的补充。
07

单元综合

从一元公式到高维几何:多元优化的 shape 驱动读法

单元能力目标

完成本单元后,应能把熟悉的一元导数、正态分布、Taylor 展开和约束极值系统地推广到向量与矩阵,而不是只背高维公式。

具体需要做到:

  • 写出标量损失的梯度与 Hessian shape;
  • 从一元 Taylor 推导多元二阶近似;
  • 解释负梯度为何是欧氏度量下的局部最陡下降方向;
  • 说明等式约束极值处目标梯度为何位于约束法向空间;
  • 推导 K-Means 两质心的 Voronoi 超平面;
  • 区分梯度、Hessian 与协方差矩阵的角色;
  • 用“输入类型—参数 shape—输出语义—成立条件”检查多元公式。

概念连接

1. 多元推广的共同动作:标量变向量,导数变线性对象

一元函数

f:RRf:\mathbb R\to\mathbb R

只有一个输入方向,导数 f(x)f'(x) 用一个标量描述局部变化率。

多元标量函数

f:RdRf:\mathbb R^d\to\mathbb R

dd 个坐标方向,一阶偏导组成梯度:

f(x)=[f/x1f/xd]Rd.\nabla f(x) = \begin{bmatrix} \partial f/\partial x_1\\ \vdots\\ \partial f/\partial x_d \end{bmatrix} \in\mathbb R^d.

梯度不是一个新的函数值,而是局部一阶变化的系数向量。

2. 标量损失的梯度与参数同形

若参数

WRm×nW\in\mathbb R^{m\times n}

而损失

L(W)R,L(W)\in\mathbb R,

WLRm×n.\nabla_WL \in\mathbb R^{m\times n}.

它把每个偏导

LWij\frac{\partial L}{\partial W_{ij}}

放回对应参数位置。

“梯度与参数同形”依赖输出是标量。

若输出本身是向量,对输入的一阶导数一般是 Jacobian,而不是同 shape 梯度。

3. 梯度下降从标量减法推广为张量减法

一元更新为

w+=wηL(w).w^+=w-\eta L'(w).

多元或张量更新为

W+=WηWL.W^+=W-\eta\nabla_WL.

同形保证逐元素减法合法。

对单位方向 uu,方向导数为

Duf=fTu.D_uf=\nabla f^Tu.

由 Cauchy–Schwarz,不同单位方向中最小值在

u=ffu=-\frac{\nabla f}{\|\nabla f\|}

处取得,所以负梯度是欧氏度量下的一阶最陡下降方向。

4. 最陡方向不保证任意步长都下降

梯度给出局部方向,但实际更新跨越有限距离。

学习率过大时可能越过低谷、震荡或发散。

函数非光滑、尺度病态或使用不同参数度量时,“最陡”的定义也会变化。

因此负梯度是局部一阶结论,不是任何 η\eta 下的全局保证。

5. 一元 Taylor 的三个对象怎样升级

一元二阶 Taylor 为

f(x0+Δx)f(x0)+f(x0)Δx+12f(x0)(Δx)2.f(x_0+\Delta x) \approx f(x_0) +f'(x_0)\Delta x +\frac12f''(x_0)(\Delta x)^2.

多元中:

  • 标量位移 Δx\Delta x 变为向量 Δw\Delta w
  • 一阶导 ff' 变为梯度 f\nabla f
  • 二阶导 ff'' 变为 Hessian H=2fH=\nabla^2f

于是

f(w0+Δw)f(w0)+f(w0)TΔw+12ΔwTH(w0)Δw.f(w_0+\Delta w) \approx f(w_0) +\nabla f(w_0)^T\Delta w +\frac12\Delta w^TH(w_0)\Delta w.

6. 每一项的 shape 都必须回到标量

wRdw\in\mathbb R^d

f(w0)TΔw:(1×d)(d×1)1,\nabla f(w_0)^T\Delta w : (1\times d)(d\times1)\to1,
ΔwTHΔw:(1×d)(d×d)(d×1)1.\Delta w^TH\Delta w : (1\times d)(d\times d)(d\times1)\to1.

一阶项描述切平面上的高度变化。

二阶项由 Hessian 描述沿位移方向的曲率修正。

只看到矩阵符号不够;必须检查收缩轴和最终标量语义。

7. Hessian 是损失曲率,不是协方差

Hessian 定义为

Hij=2fwiwj.H_{ij} = \frac{\partial^2f} {\partial w_i\partial w_j}.

它描述函数局部曲率,并依赖当前参数点。

协方差矩阵定义为

Σ=E[(Xμ)(Xμ)T],\Sigma = \mathbb E [(X-\mu)(X-\mu)^T],

描述随机向量各维的联合波动。

二者都可能是对称矩阵,也都可进入二次型,但定义、数据来源和语义不同。

8. 多元正态从均值和方差升级而来

一元随机变量使用均值 μ\mu 与方差 σ2\sigma^2

多元随机向量

XRdX\in\mathbb R^d

使用均值向量

μRd\mu\in\mathbb R^d

与协方差矩阵

ΣRd×d.\Sigma\in\mathbb R^{d\times d}.

密度中的

(xμ)TΣ1(xμ)(x-\mu)^T\Sigma^{-1}(x-\mu)

是标量 Mahalanobis 二次型。

均值控制中心,协方差控制尺度、相关性与主轴方向。

9. 三条推广路线共享线性代数,但不能混用

可以用一张角色表区分:

  • 梯度:标量损失的一阶局部变化,shape 与参数相同;
  • Hessian:标量损失的二阶曲率,shape 为参数维度平方;
  • 协方差:随机向量的二阶统计量,shape 为随机维度平方。

Hessian 正定可表示局部凸曲率。

协方差半正定来自随机变量方差非负。

相似的矩阵性质来自不同定义,不能把一个公式直接当成另一个。

10. 等式约束把可行方向限制在切空间

考虑

minxf(x)s.t.g(x)=0.\min_x f(x) \quad\text{s.t.}\quad g(x)=0.

约束曲线或流形的可行切向 vv 满足

g(x)Tv=0.\nabla g(x)^Tv=0.

在正则局部极值处,目标沿所有可行切向的一阶变化也为零:

f(x)Tv=0.\nabla f(x)^Tv=0.

所以 f\nabla fg\nabla g 都位于法向方向,二者共线。

11. Lagrange 乘子统一写出法向条件

若定义

L(x,λ)=f(x)+λg(x),\mathcal L(x,\lambda) = f(x)+\lambda g(x),

驻点条件为

xL=f+λg=0,\nabla_x\mathcal L = \nabla f+\lambda\nabla g =0,

以及原约束

g(x)=0.g(x)=0.

若 Lagrangian 采用 fλgf-\lambda g,乘子符号相应改变,但几何条件不变。

求得驻点后还需检查约束资格与极值类型。

12. K-Means 边界也是一个法向超平面

样本 xx 在两个质心 a,ba,b 之间的等距边界满足

xa2=xb2.\|x-a\|^2=\|x-b\|^2.

展开并消去 xTxx^Tx

(ba)Tx=12(b2a2).(b-a)^Tx = \frac12 (\|b\|^2-\|a\|^2).

等价写为

(ba)T(xa+b2)=0.(b-a)^T \left( x-\frac{a+b}{2} \right) =0.

法向量为 bab-a,超平面经过两质心中点。

二维中是中垂线,三维中是中垂面,更高维中是超平面。

13. 多质心形成 Voronoi 单元

质心 aa 的区域由一组两两比较半空间交集构成:

xa2xbj2,j.\|x-a\|^2 \le \|x-b_j\|^2, \qquad \forall j.

这就是欧氏距离下的 Voronoi 单元。

K-Means 在两个步骤间交替:

  1. 将样本分配给最近质心;
  2. 把质心更新为簇内均值。

算法可能收敛到局部最优,并对初始化、特征尺度和距离度量敏感。

14. 统一读法:类型、shape、收缩、条件

面对任意多元公式,依次检查:

  1. 输入是标量、向量、矩阵还是随机变量?
  2. 输出是标量还是向量?
  3. 每个导数对象的 shape 是什么?
  4. 哪些轴通过内积或二次型收缩?
  5. 最终结果的语义是什么?
  6. 成立需要光滑、正定、可逆、正则约束还是局部小步长?

这套流程比把公式当图案记忆更可靠。

对比与决策

1. 什么时候用梯度,什么时候用 Hessian

  • 只需要局部一阶下降方向:使用梯度。
  • 需要分析方向曲率、局部二阶近似或二阶优化:使用 Hessian。
  • 需要描述随机数据的联合波动:使用协方差,而不是 Hessian。

2. 有约束时不能直接沿负梯度走

无约束负梯度可能离开可行集。

等式约束下应使用 Lagrange 条件、投影梯度或其他保持可行性的优化方法。

Lagrange 乘子给出候选驻点,不自动完成全局最优证明。

3. K-Means 几何解释的边界

中垂超平面依赖欧氏距离。

换成其他距离、未标准化特征或非球形簇结构时,边界与聚类含义会变化。

综合训练

编者练习

f(w)=w12+3w22+2w1w2.f(w)=w_1^2+3w_2^2+2w_1w_2. 求梯度与 Hessian,并写出在 w0w_0 附近的二阶 Taylor 形式。

查看参考答案

f=[2w1+2w2, 6w2+2w1]T\nabla f=[2w_1+2w_2,\ 6w_2+2w_1]^TH=[2226]H=\begin{bmatrix}2&2\\2&6\end{bmatrix}。因为 ff 本身是二次函数,f(w0+Δw)=f(w0)+f(w0)TΔw+12ΔwTHΔwf(w_0+\Delta w)=f(w_0)+\nabla f(w_0)^T\Delta w+\frac12\Delta w^TH\Delta w 精确成立,没有更高阶余项。

编者练习 2

在约束 x2+y2=1x^2+y^2=1 上最小化 f(x,y)=x+2yf(x,y)=x+2y。写出 Lagrange 方程,并解释梯度共线的几何意义。

查看参考答案

L=x+2y+λ(x2+y21)\mathcal L=x+2y+\lambda(x^2+y^2-1)。驻点条件为 1+2λx=01+2\lambda x=02+2λy=02+2\lambda y=0x2+y2=1x^2+y^2=1。目标梯度 [1,2]T[1,2]^T 与圆的法向 [2x,2y]T[2x,2y]^T 共线,说明目标沿圆的切向没有一阶变化。比较候选点可确定最小值点。

编者练习 3

两个 K-Means 质心为 a=(0,0)a=(0,0)b=(2,4)b=(2,4)。写出等距边界,并指出法向量和经过的中点。

查看参考答案

ba=(2,4)b-a=(2,4),中点为 (1,2)(1,2)。边界为 (2,4)T((x,y)T(1,2)T)=0(2,4)^T((x,y)^T-(1,2)^T)=0,即 2(x1)+4(y2)=02(x-1)+4(y-2)=0,化简为 x+2y5=0x+2y-5=0。法向量与两质心连线平行,边界经过中点。

进入下一单元前

  • 已能从一元 Taylor 写出多元梯度与 Hessian 二阶项。
  • 已能解释标量损失梯度与参数同形的前提。
  • 已能区分梯度、Hessian 与协方差的定义和作用。
  • 已能写出 Lagrange 驻点条件并检查原约束。
  • 已能推导 K-Means 的 Voronoi 超平面。
  • 若仍会把负梯度当作任意学习率下的下降保证,回看 P161。
  • 若仍会把 Hessian 与协方差混同,回看 P162、P163 的角色表。
  • 若公式 shape 失配,先回到输入输出类型与收缩轴,不要继续符号推演。