LEARNING UNIT · 02
多元优化与几何直觉
把泰勒展开、梯度下降、拉格朗日乘子和聚类边界从一元与平面直觉推广到高维。
- 已整理章节
- 7 节
- 单元来源
- 6 条视频
- 总时长
- 23:48
- 状态
- 已发布
- 学习位置
- 2 / 20
主题讲解 · 01:53
从切线到 Hessian:多元 Taylor 展开
学习目标
- 从一元切线近似推导多元一阶项。
- 解释梯度内积为什么仍是标量增量。
- 理解 Hessian 二次型如何编码局部曲率。
- 用 shape 和适用条件检查二阶 Taylor 公式。
前置与衔接
设损失函数:
参数基点为:
目标点写成:
其中 是从基点到目标点的位移。
本课只讨论标量值函数。
因此无论参数是一维还是多维, 、一阶增量与二阶增量最终都必须是标量。
核心讲解
1. 一元与多元使用同一条局部近似路线
一元 Taylor 展开写成:
多元展开的结构没有改变:
- 基点函数值。
- 一阶局部变化。
- 二阶曲率修正。
- 更高阶项或余项。
一元与多元 Taylor 展开都以基点函数值为起点,再加入一阶和二阶局部信息。
原视频 · 00:00 ↗真正变化的是导数对象:
- 一阶导数从标量变成梯度。
- 二阶导数从标量变成 Hessian。
- 位移从标量变成向量。
2. 一元一阶项来自切线斜率乘位移
在 附近, 切线斜率为 。
横向位移为 。
切线预测的纵向变化为:
一元情形中,切线斜率乘位移 给出一阶函数增量。
原视频 · 00:20 ↗因此一阶近似是:
当曲线弯曲明显或位移较大时, 只用切线会出现误差。
二阶项用局部曲率修正这种误差。
3. 多元参数从数变成向量
一元情形是:
多元情形变为:
推广到多元后,参数 从标量变成包含多个分量的向量,而损失 仍是标量。
原视频 · 00:40 ↗深度学习中, 可以概念性地收集模型的全部参数。
实际实现通常不会真把所有参数拼成一个长向量, 但数学上可以把每个参数元素赋予一个统一坐标。
4. 梯度内积取代斜率乘位移
在 处定义列梯度:
多元一阶增量是:
多元一阶项 是梯度与位移的内积,对应切平面给出的高度变化。
原视频 · 01:00 ↗展开索引:
每个参数方向的局部变化相加, 得到总的一阶损失变化。
梯度与位移的内积也说明:
- 沿梯度方向移动,一阶增量最大。
- 沿负梯度方向移动,一阶增量最小。
- 与梯度正交的位移,一阶变化为零。
最后一条只表示一阶近似为零, 不保证真实函数完全不变。
5. Hessian 把二阶偏导组织成矩阵
Hessian 定义为:
其 shape 为:
二阶项由 Hessian 组成二次型 。
原视频 · 01:20 ↗二阶增量为:
展开为:
对角元素描述各坐标方向曲率。
非对角元素描述两个坐标方向之间的二阶耦合。
若 在邻域内二阶连续可微, 混合偏导相等, Hessian 为对称矩阵。
6. 完整二阶公式与 shape 账本
二阶 Taylor 形式为:
shape 检查:
标量、行向量、方阵和列向量依次相乘,一阶项与二阶项最终都必须是标量。
原视频 · 01:40 ↗当 在 附近足够光滑时, 可写:
这意味着位移趋近于零时, 余项相对于 更快趋近于零。
Taylor 是局部结论。
不能因为写了二阶项, 就认为远离 仍能准确描述函数。
7. 曲率符号决定二阶变化方向
对任意方向 , 方向曲率由:
给出。
若 正定, 所有非零方向的二阶项为正。
若 负定, 所有非零方向的二阶项为负。
若 不定, 不同方向可能一正一负, 这通常对应鞍点附近的局部结构。
因此 Hessian 不是“总让近似更高”的矩阵。
它编码的是带方向的局部曲率。
8. 编者补充:与二阶剪枝的关系
视频提到 OBD 等剪枝理论使用 Taylor 展开。
在驻点附近, 若:
移除或扰动某个参数造成的损失变化可近似为:
这是理解二阶敏感度的入口。
但具体剪枝方法还会采用对角 Hessian、近似逆 Hessian或其他计算简化。
本课公式不能替代这些算法细节。
跟练与练习
跟练:二维函数的二阶展开
设:
梯度为:
Hessian 为:
因为函数本身就是二次函数, 它在任意基点的二阶 Taylor 展开都精确等于原函数, 余项为零。
编者练习
设: 计算一阶增量、二阶增量和二阶近似的总增量。
查看参考答案
一阶增量:
先计算:
二阶增量:
所以:
这只是基于 的局部二阶预测。
常见误区
误区 1:多元一阶项是梯度乘位移后仍为向量
是内积, 输出为标量。
误区 2:Hessian 的每个元素都是同一变量的二阶导
非对角元素是不同变量之间的混合偏导。
误区 3:二阶项一定为正
只有在相应方向曲率为正时, 才为正。
误区 4:Taylor 二阶式对任意远处点都准确
Taylor 展开是局部近似。
位移大小、函数光滑性和高阶导数都会影响误差。
误区 5:写出 Hessian 就等于实现了二阶优化
实际模型的 Hessian 极大。
算法通常使用 Hessian-vector product、对角近似或其他结构化近似。
本课小结
一元 Taylor 的斜率、二阶导与标量位移, 在多元情形分别推广为梯度、Hessian 与向量位移。
二阶展开为:
一阶项是切平面的标量高度变化。
二阶项是 Hessian 定义的方向曲率修正。
可靠使用它时必须同时检查:
- 每一项的 shape。
- 位移是否足够局部。
- 函数是否满足所需光滑性。
- Hessian 在目标方向上的符号。
主题讲解 · 03:17
拉格朗日乘子法:从约束曲线到梯度共线
学习目标
- 把等式约束优化写成目标函数与约束函数。
- 从可行切向方向推导梯度共线条件。
- 正确处理 Lagrangian 中 的正负号约定。
- 区分驻点必要条件与最小值充分条件。
前置与衔接
考虑:
且满足:
把约束移到等号左侧:
没有约束时, 在 取得最小值 0。
但 不满足约束。
约束优化只能在可行集合 上寻找最优点。
核心讲解
1. 约束改变了允许搜索的集合
目标函数:
的图像是向上开的抛物面。
约束:
在 平面上是一条直线。
目标 与约束 构成一个等式约束最小化问题。
原视频 · 00:00 ↗代入法可以直接验证答案:
求导:
令其为零:
目标值:
2. 三维中,约束平面切出可行曲线
把直线约束沿竖直方向延伸, 得到一个竖直平面。
它与抛物面相交, 形成一条抛物线。
约束直线在三维图中对应竖直平面;它与抛物面相交后,只能沿交线寻找最低点。
原视频 · 00:40 ↗约束最小化就是:
沿这条相交曲线寻找高度最低的点。
这个几何图强调:
- 目标曲面仍定义在整个平面上。
- 可行点只占其中一条曲线。
- 可行移动方向受到约束限制。
3. 用 Lagrangian 合并一阶条件
采用加号约定:
一阶驻点条件为:
以及原约束:
展开:
这里 是为了让两个法向量线性组合为零的标量。
4. 加号与减号只改变乘子符号
有的教材定义:
也有教材定义:
若令:
两种写法完全等价。
采用 时驻点条件为 ;换成减号只会翻转乘子符号。
原视频 · 01:20 ↗不能把一套定义下算出的 直接与另一套定义的 比较。
真正不变的是:
5. 本例的梯度与方程组
目标梯度:
约束梯度:
本例中 ,,并需同时满足 。
原视频 · 01:40 ↗按加号约定:
前两式相减得到:
再代入约束:
最后:
若采用 , 同一点对应 。
6. 梯度为何是等值线的法向量
沿目标等高线移动时, 保持不变。
若 是等高线切向量, 方向导数为:
所以 垂直于目标等高线。
同理, 沿约束曲线 的切向量 满足:
所以 垂直于约束曲线。
目标梯度垂直于目标等高线,约束梯度垂直于约束曲线。
原视频 · 02:20 ↗7. 最优点处为什么需要梯度共线
在正则可行点, 约束切向量 满足:
若该点是局部极值, 沿任何可行切向方向的一阶变化也必须为零:
在二维单约束情形下, 与约束切线垂直的法向空间只有一维。
因此:
在可行最优点 ,两条法向共线;按加号约定解得 。
原视频 · 03:00 ↗几何上, 目标等高线逐渐向低值移动, 直到刚好与约束曲线相切。
若两者横穿, 就仍可沿约束向更低的目标等高线移动。
8. 必须满足约束资格
上述推导要求:
这保证约束在局部确实定义一条光滑曲线, 其切空间和法向空间可由 描述。
若约束梯度为零, 简单的 Lagrange 条件可能无法给出乘子, 即使该点确实是最优点。
这类条件统称约束资格条件。
9. 共线只是必要条件,不自动保证最小
解出:
得到的是候选驻点。
候选点可能是:
- 约束局部最小。
- 约束局部最大。
- 约束鞍点。
还需检查二阶条件、比较目标值或利用问题结构。
本例中:
- 严格凸。
- 约束 是仿射集合。
因此可行驻点 是唯一全局最小点。
这个结论来自凸性, 不是来自“梯度共线”四个字本身。
10. 多个约束与不等式的边界
若有多个等式约束 , 条件推广为:
目标梯度位于所有约束梯度张成的法向空间。
它不要求与每一个约束梯度分别共线。
不等式约束还需要可行性、互补松弛和乘子符号条件, 即 KKT 框架。
不能直接套用单个等式约束的共线图。
跟练与练习
跟练:用代入法核对结果
约束给出:
代入目标:
因为平方项非负:
等号只在 时成立。
所以:
是唯一全局最小点。
编者练习
求: 满足: 采用: 写出方程组并求解 。
查看参考答案
梯度为:
方程组:
由前两式:
代入约束:
因此:
目标严格凸且约束仿射,
所以该候选点是唯一全局最小点。
常见误区
误区 1:忘记把原约束写回方程组
只有变量与乘子关系。
还必须同时满足 。
误区 2:不同教材的 数值必须相同
Lagrangian 的加号或减号会翻转乘子符号。
最优点和共线关系不变。
误区 3:梯度共线一定是最小值
它通常只是一阶必要条件。
必须继续检查问题结构或二阶信息。
误区 4:多个约束时仍要求两两共线
多个约束下, 位于约束梯度的线性张成空间。
误区 5:约束梯度为零也可直接套公式
若约束资格失败, 标准乘子条件可能不适用。
本课小结
等式约束把搜索限制在可行曲线或可行流形上。
在正则局部极值处, 目标沿所有可行切向方向的一阶变化为零。
因此目标梯度位于约束的法向空间。
单个二维约束下表现为:
使用 Lagrange 乘子法时要同时检查:
- Lagrangian 的符号约定。
- 原约束是否写入方程组。
- 约束资格是否成立。
- 驻点是否真是最小值。
主题讲解 · 02:17
K-Means 的 Voronoi 边界与高维超平面
学习目标
- 复述 K-Means 的分配与质心更新两步。
- 证明两个质心的欧氏等距边界是中垂超平面。
- 从二维中垂线推广到高维 Voronoi 单元。
- 识别初始化、局部最优和高维距离的适用边界。
前置与衔接
给定样本:
K-Means 要把它们分到 个簇, 并为每个簇求一个质心:
经典目标是最小化簇内平方和:
其中 是样本 的簇标签。
本课结论依赖欧氏距离。
若更换距离或采用非球形簇模型, 边界与更新公式都可能改变。
核心讲解
1. 分配步骤:交给最近质心
先选取 个初始质心。
固定质心后, 每个样本选择:
K-Means 的分配步骤把每个样本交给欧氏距离最近的质心。
原视频 · 00:20 ↗平方距离与距离给出相同的最近者, 因为平方根在非负数上单调。
使用平方距离可以避免不必要的开方。
2. 更新步骤:簇内均值是最优质心
固定标签后, 第 个簇的质心更新为:
分组后用各簇样本均值重算质心;新质心不必落在原始数据点上。
原视频 · 00:40 ↗为什么是均值?
固定一个簇 , 最小化:
对 求梯度:
解得簇内均值。
所以更新步骤不是经验猜测, 而是固定标签时的精确最优解。
3. 两步交替使目标不增
一次完整迭代包含:
- 固定质心,重新分配每个样本。
- 固定标签,重新计算每个簇均值。
第一步为每个样本选取更近或同样近的质心, 不会增大 。
第二步为每个簇选择平方误差最小的中心, 也不会增大 。
重复最近质心分配和均值更新,直到标签或质心不再变化,或达到迭代上限。
原视频 · 01:00 ↗常见停止条件包括:
- 标签不再变化。
- 质心移动小于阈值。
- 目标下降小于阈值。
- 达到最大迭代次数。
目标不增不等于找到全局最优。
不同初始化可能收敛到不同局部固定点。
4. 两个质心的边界是等距集合
只考虑两个质心:
分类边界上的点 满足:
等价地比较平方:
两个质心的等距点构成中垂线;其两侧分别更靠近其中一个质心。
原视频 · 01:20 ↗边界的一侧满足:
所以归入 所在簇。
另一侧归入 所在簇。
边界上的点出现距离并列, 实现需要固定 tie-breaking 规则。
5. 代数展开直接得到超平面
展开等距式:
消去两侧的 :
整理:
也可写成:
由此立刻读出:
- 法向量是 。
- 边界经过中点 。
- 边界是一个 维仿射超平面。
二维时是中垂线。
三维时是中垂面。
更高维时是中垂超平面。
6. 二维勾股证明
在二维图中, 从点 向质心连线作垂线。
若垂足 位于中点靠近 的一侧, 则:
两条斜边共享同一个垂直高度 :
所以:
在中垂线一侧比较水平分量,再加上相同垂直分量,可由勾股定理证明距离次序。
原视频 · 01:40 ↗这个证明与代数展开表达同一事实。
代数式更容易推广到任意维度。
7. 三维与高维推广
三维中, 两个质心的等距集合是经过中点、 垂直于质心连线的平面。
三维的等距边界是中垂面;推广到 维则是垂直于两质心连线的超平面。
原视频 · 02:00 ↗高维中, 公式仍是:
因此边界仍然线性。
这不是因为高维图形看起来像平面, 而是因为平方欧氏距离展开后 抵消。
8. 多个质心形成 Voronoi 单元
对质心 , 它的分配区域为:
每一个两两比较都给出一个线性半空间。
是这些半空间的交集, 称为该质心的 Voronoi 单元。
所以:
- 两个质心之间是一个中垂超平面。
- 多个质心的边界由多块超平面片段拼成。
- 整体分类函数是分片线性的几何划分。
质心更新后, 整套 Voronoi 划分也随之移动。
9. 高维结论成立,但距离未必好用
等距超平面公式对任意有限维欧氏空间都成立。
但在高维数据中还要注意:
- 不同特征量纲会主导欧氏距离。
- 无关维度会稀释有用的聚类结构。
- 距离可能出现集中现象。
- 稀疏数据未必适合球形簇假设。
常见前处理包括标准化、特征选择或降维。
这些问题不推翻超平面公式, 而是提醒“数学边界成立”不等于“聚类语义一定合理”。
10. K-Means 的模型边界
经典 K-Means 更适合:
- 以欧氏距离衡量相似性。
- 簇大致凸且接近各向同性。
- 均值对数据有合理含义。
它不天然适合:
- 弯月形等非凸簇。
- 类别型变量。
- 强烈离群点。
- 需要不同协方差形状的簇。
更换为余弦距离、曼哈顿距离或其他相似度后, “更新为算术均值”和“边界是中垂超平面”都不能直接照搬。
跟练与练习
跟练:求二维中垂线
设:
边界:
中点为 , 法向量为 。
所以:
即:
编者练习
在三维空间中, 两个质心为: 回答:
- 等距边界的法向量是什么?
- 边界经过哪个中点?
- 写出平面方程。
- 点 更靠近哪个质心?
查看参考答案
法向量:
中点:
平面方程:
即:
或:
对点 :
所以它更靠近 。
常见误区
误区 1:质心必须是某个真实样本
K-Means 质心是簇内均值, 通常不落在原始数据点上。
误区 2:目标单调下降就保证全局最优
交替更新只保证目标不增。
最终结果依赖初始化。
误区 3:高维边界仍叫“中垂线”
二维是线, 三维是面, 维是 维超平面。
误区 4:任意距离的边界都是中垂超平面
线性边界来自平方欧氏距离中的 抵消。
其他距离需要重新推导。
误区 5:边界公式正确就说明聚类合理
高维量纲、噪声和簇形状仍会影响欧氏距离的语义。
本课小结
K-Means 在两个步骤间交替:
- 每个样本分配给最近质心。
- 每个质心更新为簇内均值。
对两个质心 , 欧氏等距边界为:
它经过两质心中点, 法向量是质心差。
二维是中垂线, 三维是中垂面, 高维是超平面。
多个质心的两两半空间交集形成 Voronoi 单元。
使用这套几何解释时, 还必须记住欧氏距离、特征尺度、初始化和局部最优的边界。
主题讲解 · 03:06
梯度为何与参数同形:从一元更新到张量更新
学习目标
- 说明标量损失对参数张量的梯度为何与参数同 shape。
- 对齐偏导、nabla 与代码中 dW 等常见记号。
- 把一元梯度下降推广为向量和张量更新。
- 判断负梯度方向与学习率的适用边界。
前置与衔接
设模型参数为张量 , 损失为标量:
深度学习反向传播通常计算:
因为输出是标量, 每个参数元素只需要保存一个对应偏导。
所以梯度可以按参数原位置排回同一个 shape。
如果输出本身是向量或张量, 完整导数一般是 Jacobian, 不再只是与输入同 shape 的梯度。
核心讲解
1. 标量损失的梯度按参数原位排列
设:
标量损失对 的梯度定义为:
标量损失对参数张量的梯度由各元素偏导按原位置排列,因此与参数同 shape。
原视频 · 00:20 ↗每个梯度元素回答:
在其他参数暂时不变时, 对应参数增加一个微小量, 损失的一阶变化率是多少。
shape 相同使得后续更新:
可以逐元素对齐。
2. “同 shape”结论的准确边界
对任意参数张量:
若:
则:
但若:
也是多元素张量, 完整 Jacobian 要同时保留输出轴和输入轴。
所以更严谨的说法是:
“标量损失对参数张量的梯度与参数同 shape。”
不能把它误写成“任何张量对张量求导都同 shape”。
3. 不同梯度记号描述同一组偏导
常见写法包括:
以及代码或算子推导中的:
、 和代码中的 dW 可表示同一参数梯度,但 d 也可能用于微分。
原视频 · 01:00 ↗这些记号在具体语境中都可表示:
但 有歧义:
- 在反向传播代码中常表示参数梯度。
- 在微分推导中常表示参数的微小变化。
阅读公式时要先确认作者的记号约定。
4. 一元与多元的映射类型
一元损失:
输入 与输出 都是标量。
多元损失:
输入扩为:
输出仍是一个标量损失。
一元优化是标量到标量,多元优化把参数扩为向量或张量,但损失仍是标量。
原视频 · 01:40 ↗多元并不是“损失也变成向量”。
它表示需要同时优化多个参数自由度。
5. 一元示例:
损失:
导数:
在 :
对 ,一元梯度就是普通导数 ;在 时等于 2。
原视频 · 02:00 ↗梯度下降更新:
取:
得到:
参数从 1 向最小点 0 移动。
6. 多元示例:各偏导组成梯度
设:
分别求偏导:
按参数顺序组成列梯度:
对 ,梯度为 。
原视频 · 02:20 ↗在:
处:
7. 统一更新是同 shape 张量减法
统一写成:
对二维示例:
统一更新 ;在 且 时得到 。
原视频 · 02:40 ↗对矩阵、卷积核或更高阶参数, 公式仍不变。
梯度与参数同 shape, 所以每个元素都有对应更新量。
8. 为什么使用负梯度方向
一阶 Taylor 近似:
若限制步长:
使内积最小的方向是:
因此在欧氏或 Frobenius 几何下, 负梯度是局部最陡下降方向。
“最陡”依赖所选范数或度量。
换成自然梯度等方法后, 方向会按不同几何重新缩放。
9. 学习率决定是否真的下降
负梯度给出局部方向, 但更新长度由 决定。
对:
更新为:
要让迭代收敛到 0, 需要:
即:
视频中的 满足该条件。
若 太大, 即使方向是负梯度, 一步也可能跨过谷底并造成振荡或发散。
10. 编者补充:一般光滑函数的下降保证
若 是 -Lipschitz, 下降引理说明在 时, 标准梯度步具有单步下降保证。
这是视频外的条件说明。
非凸深度网络中仍不能据此保证到达全局最优, 更常见的目标是找到驻点或较低损失区域。
跟练与练习
跟练:矩阵参数的同 shape 梯度
设:
展开:
所以:
按原位排列:
更新为:
编者练习
设: 初始点: 学习率: 计算梯度和一步更新后的参数, 并比较更新前后的损失。
查看参考答案
梯度为:
一步更新为:
更新前:
更新后:
本步使损失下降。
常见误区
误区 1:任何导数都与输入同 shape
只有标量输出对输入的梯度可直接按输入 shape 排列。
多元素输出的完整导数是 Jacobian。
误区 2:dW 永远只表示梯度
在微分推导中, dW 也可能表示参数变化。
必须查看上下文定义。
误区 3:负梯度方向保证任意步长都下降
方向是局部结论。
学习率过大仍可能上升或发散。
误区 4:多元更新需要为每个元素写新算法
只要梯度与参数 shape 对齐, 统一张量公式即可逐元素更新。
误区 5:梯度下降保证深度网络全局最优
一般非凸问题没有这种保证。
本课小结
标量损失对参数张量的梯度, 是所有参数元素偏导按原位置排成的同 shape 张量。
一元和多元使用同一更新:
多元推广只把:
- 标量参数变成向量或张量。
- 普通导数变成同 shape 梯度。
- 标量减法变成张量减法。
负梯度是欧氏几何下的局部最陡下降方向。
是否真正下降还取决于学习率、函数光滑性和优化问题结构。
主题讲解 · 11:14
三种多元推广:高斯、梯度下降与 Taylor
学习目标
- 区分三种“从一元到多元”分别推广了什么对象。
- 用 shape 读懂多元正态密度中的行列式与二次型。
- 把一元导数更新推广为参数张量的梯度更新。
- 把一元 Taylor 的一、二阶导推广为梯度与 Hessian。
前置与衔接
本课把三个主题并排比较:
- 正态分布。
- 梯度下降。
- Taylor 展开。
它们都从标量走向向量和矩阵, 但不是同一条公式的三个名字。
三者分别处理:
- 概率分布的随机输入与参数。
- 优化中的参数与下降方向。
- 标量函数在基点附近的局部近似。
正态分布、梯度下降和 Taylor 展开分别把随机变量、参数与局部近似从一维推广到多维。
原视频 · 00:00 ↗核心讲解
1. 先建立三条 shape 路线
正态分布:
梯度下降:
Taylor 展开:
共同点是线性代数结构增加。
不同点是变量的概率、优化与近似语义不能混用。
2. 一元正态由均值和方差参数化
一元正态写作:
密度为:
决定中心。
决定宽度。
密度 是实数输入到非负标量的映射。
单点密度值不是单点概率。
连续分布在区间上的积分才给出概率。
3. 多元正态由均值向量和协方差矩阵参数化
设:
非退化多元正态密度为:
多元正态由均值向量 与协方差矩阵 参数化,二次型把向量输入映射为标量密度。
原视频 · 04:20 ↗这里要求 对称正定, 从而:
- 存在。
- 。
- 公式定义普通的 维密度。
若 仅半正定且奇异, 分布可能集中在低维子空间, 不能直接使用上式的逆矩阵与普通体积密度。
这是视频图示之外的重要边界。
4. 多元密度为什么仍输出标量
shape 账本:
所以 Mahalanobis 二次型:
的 shape 是:
行列式 也是标量。
因此:
输入从数扩为向量, 输出仍是密度高度。
5. 一元正态是 的特例
当 :
于是:
代回多元公式, 正好得到一元正态密度。
这不是相似类比, 而是参数维度退化后的严格特例关系。
6. 协方差决定等密度椭球
固定密度等价于固定:
二维中, 它给出椭圆。
高维中, 它给出椭球面。
二维高斯的等密度线由协方差控制:单位阵给出圆,方向方差不同时变成椭圆。
原视频 · 05:20 ↗更精确地说:
- 决定中心。
- 的特征向量决定主轴方向。
- 的特征值决定对应方向的方差尺度。
- 非零协方差会旋转等密度椭圆。
正协方差与负协方差给出相反倾斜方向。
原 ASR 在负相关片段漏掉负号, 此处按画面与“负相关”语义校正。
7. 多元标准正态
多元标准正态写作:
它满足:
- 均值为零向量。
- 每个维度方差为 1。
- 不同维度协方差为 0。
- 在 Gaussian 情形下,各维度相互独立。
其密度只依赖 , 所以具有旋转对称性。
DDPM 等扩散模型常从这一分布采样噪声。
8. 梯度下降把参数和导数推广为同 shape 张量
设标量损失:
梯度:
标量损失对参数张量求梯度时,各偏导按原位置排列,结果与参数同 shape。
原视频 · 06:40 ↗参数若是矩阵或高阶张量, 梯度也按相同位置排列。
这个同 shape 结论要求输出是标量损失。
向量输出对向量输入的完整导数一般是 Jacobian。
9. 一元与多元共享同一个更新式
统一更新为:
一元中, 和梯度都是标量。
多元中, 它们是同 shape 向量或张量。
梯度下降统一写成 ,标量和向量只在参数与梯度 shape 上不同。
原视频 · 09:00 ↗对:
有:
在 且 时:
负梯度是欧氏几何下的局部最陡下降方向。
学习率过大时仍可能发散, 非凸问题也不保证全局最优。
10. Taylor 展开把导数升级为梯度与 Hessian
一元二阶形式:
多元中:
二阶形式变为:
多元 Taylor 的一阶项是梯度与位移的内积,二阶项是位移、Hessian 与位移组成的标量二次型。
原视频 · 11:00 ↗一阶项 shape:
二阶项 shape:
Taylor 是基点附近的局部近似。
准确性取决于位移大小、函数光滑性与被省略的高阶项。
11. 三种推广的统一点与不同点
统一点:
- 标量自由度扩为多个坐标。
- 向量、矩阵与内积组织分量关系。
- 最终关注量常仍是标量。
不同点:
| 主题 | 输入推广 | 参数或导数推广 | 标量输出 |
|---|---|---|---|
| 正态分布 | 随机变量 随机向量 | 均值 ,方差 | 密度 |
| 梯度下降 | 标量参数 参数张量 | 导数 | 损失 |
| Taylor | 标量位移 向量位移 | 一阶导 ,二阶导 | 局部函数值 |
不能因为三者都出现矩阵, 就把协方差、Hessian 与参数梯度视为同一对象。
它们的单位、对称性和数学作用都不同。
跟练与练习
跟练:逐项检查多元正态 shape
设:
则:
二次型:
的 shape 为:
行列式:
也是标量。
所以 为标量。
编者练习
对以下三条陈述分别判断正确与否,并说明原因:
- 多元正态的协方差矩阵可以任意不可逆,仍直接使用含 的普通密度公式。
- 标量损失对矩阵参数的梯度与参数同 shape。
- 多元 Taylor 的二阶项 是向量。
查看参考答案
第 1 条错误。
含逆矩阵和正行列式的普通密度公式要求 正定。
奇异协方差对应退化 Gaussian,
需要在低维支撑上单独处理。
第 2 条正确。
每个参数元素有一个标量偏导,
可按原位置排成同 shape 梯度。
第 3 条错误。
shape 为:
所以二阶项是标量。
常见误区
误区 1:连续密度值就是单点概率
概率由区域上的密度积分给出。
误区 2:任意协方差都能代入逆矩阵公式
非退化密度要求 对称正定。
误区 3:零协方差在所有分布中都等于独立
这一等价在联合 Gaussian 中成立, 一般分布中不成立。
误区 4:负梯度方向允许任意大学习率
方向是局部信息, 步长过大仍可能发散。
误区 5:协方差、Hessian 与梯度只是不同名字
它们分别描述随机变量联合变化、局部二阶曲率与损失一阶变化。
本课小结
三种多元推广都使用向量和矩阵, 但各自推广对象不同:
- 多元正态:随机变量变成随机向量,参数变成均值向量和协方差矩阵。
- 梯度下降:参数变成向量或张量,导数变成同 shape 梯度。
- 多元 Taylor:一阶导变成梯度,二阶导变成 Hessian。
可靠理解这些公式的共同方法是:
- 写清输入与输出类型。
- 给每个向量、矩阵标出 shape。
- 检查最终标量如何由内积或二次型得到。
- 分别检查正定性、学习率与局部光滑性等主题专属条件。
主题讲解 · 02:01
一元到多元:三类公式的共同升级路径
学习目标
- 看清 Taylor 展开、正态分布和梯度下降各自推广了什么。
- 用 shape 区分梯度、Hessian、均值向量与协方差矩阵。
- 从一元公式推导对应的多元写法,而不是只背符号。
- 识别三类推广的共同结构与不可混淆的数学语义。
前置与衔接
本课把三个常见的“一元到多元”放在同一张地图上:
- Taylor 展开研究函数在基点附近的局部近似。
- 正态分布描述随机变量或随机向量的概率规律。
- 梯度下降给出标量目标函数的迭代优化方向。
Taylor 展开、正态分布和梯度下降都可从一元推广到多元,但三者推广的对象并不相同。
原视频 · 00:00 ↗三者都会出现向量或矩阵, 但“出现矩阵”不等于“矩阵的意义相同”。
后文统一采用列向量约定:
视频画面中把梯度横放、位移竖放, 对应这里的 。
核心讲解
1. 一元 Taylor:用导数补出局部高度差
在基点 附近, 令目标位置为:
二阶 Taylor 展开写作:
一元 Taylor 在 处用函数值、导数和二阶导数近似附近函数值。
原视频 · 00:20 ↗四部分各有明确角色:
- 是基点高度。
- 是切线给出的一阶高度变化。
- 修正曲率。
- 余项说明这仍是局部近似,不是任意远处的恒等式。
若只保留一阶项, 得到局部线性化:
2. 多元 Taylor:导数升级为梯度与 Hessian
当参数变成向量:
函数仍输出一个标量:
二阶展开变为:
其中:
多元 Taylor 把导数扩为梯度,把二阶导数扩为 Hessian,并保持每项为标量。
原视频 · 00:40 ↗shape 账本为:
两个修正项最终都必须是标量, 才能与标量 相加。
这就是多元公式中“横着的梯度”和“竖着的位移”要配对的原因。
在 二阶连续可微时, Hessian 满足对称性:
这是视频之外的数学边界补充: 若混合偏导条件不满足, 不能不加条件地断言 Hessian 对称。
3. 一元正态:一个随机变量配两个标量参数
一元正态写作:
其中:
- 是一个随机变量。
- 是均值标量。
- 是方差标量。
它的密度是从实数到非负实数的函数:
这里 是密度高度, 单点密度值不是连续随机变量取到该点的概率。
4. 多元正态:随机变量升级为随机向量
多元情形把一个随机变量换成随机向量:
对应记作:
一元正态描述一个随机变量,多元正态描述随机向量 。
原视频 · 01:00 ↗参数的 shape 也随之变化:
多元正态把标量均值和方差扩为均值向量与协方差矩阵。
原视频 · 01:20 ↗协方差矩阵的对角线是各分量的方差:
非对角线描述两分量的线性共同变化:
因此从 到 , 并不只是把多个方差排成一列; 还要记录分量之间的协方差。
任意协方差矩阵都应当对称半正定:
若要使用含 与 的普通多元正态密度公式, 还需 正定、可逆。
奇异协方差对应分布落在较低维子空间, 这是视频未展开的边界情况。
5. 一元梯度下降:沿负导数方向更新
对于:
一元梯度下降为:
其中 是学习率。
当 时, 减去正数使 向左移动; 当 时, 减去负数使 向右移动。
局部上,这两种情况都沿函数下降方向前进。
6. 多元梯度下降:沿曲面的最陡下降方向更新
当参数为向量、损失仍为标量:
更新变为:
多元梯度下降在损失曲面上沿负梯度方向更新参数向量。
原视频 · 01:40 ↗梯度收集所有一阶偏导:
对任意小位移 , 一阶变化近似为:
在欧氏范数约束 下, 使一阶变化最小的方向是:
所以负梯度是欧氏几何下的局部最陡下降方向。
“最陡”依赖所选度量; 自然梯度等方法会使用不同几何。 这一点属于视频之外的边界补充。
学习率也不能省略讨论。 即使方向正确, 过大仍可能越过低点并振荡或发散。
7. 三条推广的共同骨架
可以把本课压成一张对照表:
| 主题 | 一元对象 | 多元对象 | 新增结构 | 最终输出 |
|---|---|---|---|---|
| Taylor | 梯度、Hessian | 标量近似值 | ||
| 正态分布 | 随机变量 | 随机向量 | 均值向量、协方差矩阵 | 标量密度 |
| 梯度下降 | 标量参数 | 向量或参数张量 | 梯度 | 新参数 |
共同骨架是:
- 原来的单个分量扩成多个分量。
- 分量之间的联合关系需要向量、矩阵或内积表达。
- 最终结果的 shape 必须与原任务匹配。
但三种矩阵对象不能互换:
- Hessian 是标量函数的二阶导数矩阵。
- 协方差是随机向量二阶中心矩的期望。
- 梯度是标量函数对参数的一阶导数组。
它们可能 shape 相同, 定义、单位和用途仍完全不同。
8. “参数同形”该怎样准确表述
若 是标量, 对向量参数 有:
若参数是矩阵 , 则在 Frobenius 内积约定下:
这就是工程中常说的“梯度与参数同形”。
但若输出不是标量, 例如:
其一阶导一般是 Jacobian:
不能继续简单说“导数与输入同形”。
跟练与练习
编者练习
练习 1:检查 Taylor 项的 shape 设 , 。 写出 、 与 的 shape, 并判断下式能否与 相加:
查看参考答案
,
。
所以二次型是标量,
可以与 相加。
编者练习
练习 2:判断协方差矩阵是否合理 判断: 能否作为普通二维正态分布的协方差矩阵?
查看参考答案
不能。
它虽然对称,
但特征值为 与 ,
不是半正定矩阵,
因此不能作为任何随机向量的协方差矩阵。
编者练习
练习 3:区分三类矩阵 请分别回答:
- 来自什么运算?
- 来自什么运算?
- 它们 shape 相同是否意味着可以互换?
查看参考答案
是标量函数对参数的二阶偏导数组;
是随机向量中心化外积的期望。
即使二者都是 ,
定义、单位和作用都不同,
不能因 shape 相同而互换。
常见误区
误区 1:多元就是把同一个标量复制多份
多元正态不仅需要每一维的均值和方差, 还要用协方差表达维度之间的联合变化。
多元 Taylor 也不仅是分别做多个一元展开, Hessian 的非对角项还记录变量之间的二阶耦合。
误区 2:梯度、Hessian、协方差都是矩阵,所以含义接近
shape 只是合法运算的第一道检查。
数学对象还要检查:
- 它对谁求导或取期望。
- 它的每个元素表示什么。
- 它是否带有对称、正定等条件。
误区 3:负梯度一定让损失下降
负梯度给出局部一阶下降方向, 并不保证任意长度的更新都下降。
学习率过大、函数不光滑或数值误差, 都可能破坏单步下降。
误区 4:Taylor 展开在所有距离上都准确
Taylor 是围绕基点的局部近似。
离基点越远, 高阶项和余项越可能不可忽略。
误区 5:协方差为零总等于独立
零协方差通常只说明没有线性相关。
联合正态是一个重要特例: 对联合正态向量, 分量间零协方差可以推出独立。
本课小结
- 一元 Taylor 的导数与二阶导,在多元中升级为梯度与 Hessian。
- 一元正态的随机变量、均值与方差,在多元中升级为随机向量、均值向量与协方差矩阵。
- 一元梯度下降的导数更新,在多元中升级为沿负梯度的向量或张量更新。
- 三条路线都需要线性代数,但 Hessian、协方差与梯度承担不同角色。
- 读多元公式时先列 shape,再核对定义、条件和最终输出语义。
- 视频给出了统一直觉;正定性、余项、度量与 Jacobian 边界属于本文明确标注的补充。
单元综合
从一元公式到高维几何:多元优化的 shape 驱动读法
单元能力目标
完成本单元后,应能把熟悉的一元导数、正态分布、Taylor 展开和约束极值系统地推广到向量与矩阵,而不是只背高维公式。
具体需要做到:
- 写出标量损失的梯度与 Hessian shape;
- 从一元 Taylor 推导多元二阶近似;
- 解释负梯度为何是欧氏度量下的局部最陡下降方向;
- 说明等式约束极值处目标梯度为何位于约束法向空间;
- 推导 K-Means 两质心的 Voronoi 超平面;
- 区分梯度、Hessian 与协方差矩阵的角色;
- 用“输入类型—参数 shape—输出语义—成立条件”检查多元公式。
概念连接
1. 多元推广的共同动作:标量变向量,导数变线性对象
一元函数
只有一个输入方向,导数 用一个标量描述局部变化率。
多元标量函数
有 个坐标方向,一阶偏导组成梯度:
梯度不是一个新的函数值,而是局部一阶变化的系数向量。
2. 标量损失的梯度与参数同形
若参数
而损失
则
它把每个偏导
放回对应参数位置。
“梯度与参数同形”依赖输出是标量。
若输出本身是向量,对输入的一阶导数一般是 Jacobian,而不是同 shape 梯度。
3. 梯度下降从标量减法推广为张量减法
一元更新为
多元或张量更新为
同形保证逐元素减法合法。
对单位方向 ,方向导数为
由 Cauchy–Schwarz,不同单位方向中最小值在
处取得,所以负梯度是欧氏度量下的一阶最陡下降方向。
4. 最陡方向不保证任意步长都下降
梯度给出局部方向,但实际更新跨越有限距离。
学习率过大时可能越过低谷、震荡或发散。
函数非光滑、尺度病态或使用不同参数度量时,“最陡”的定义也会变化。
因此负梯度是局部一阶结论,不是任何 下的全局保证。
5. 一元 Taylor 的三个对象怎样升级
一元二阶 Taylor 为
多元中:
- 标量位移 变为向量 ;
- 一阶导 变为梯度 ;
- 二阶导 变为 Hessian 。
于是
6. 每一项的 shape 都必须回到标量
若 :
一阶项描述切平面上的高度变化。
二阶项由 Hessian 描述沿位移方向的曲率修正。
只看到矩阵符号不够;必须检查收缩轴和最终标量语义。
7. Hessian 是损失曲率,不是协方差
Hessian 定义为
它描述函数局部曲率,并依赖当前参数点。
协方差矩阵定义为
描述随机向量各维的联合波动。
二者都可能是对称矩阵,也都可进入二次型,但定义、数据来源和语义不同。
8. 多元正态从均值和方差升级而来
一元随机变量使用均值 与方差 。
多元随机向量
使用均值向量
与协方差矩阵
密度中的
是标量 Mahalanobis 二次型。
均值控制中心,协方差控制尺度、相关性与主轴方向。
9. 三条推广路线共享线性代数,但不能混用
可以用一张角色表区分:
- 梯度:标量损失的一阶局部变化,shape 与参数相同;
- Hessian:标量损失的二阶曲率,shape 为参数维度平方;
- 协方差:随机向量的二阶统计量,shape 为随机维度平方。
Hessian 正定可表示局部凸曲率。
协方差半正定来自随机变量方差非负。
相似的矩阵性质来自不同定义,不能把一个公式直接当成另一个。
10. 等式约束把可行方向限制在切空间
考虑
约束曲线或流形的可行切向 满足
在正则局部极值处,目标沿所有可行切向的一阶变化也为零:
所以 与 都位于法向方向,二者共线。
11. Lagrange 乘子统一写出法向条件
若定义
驻点条件为
以及原约束
若 Lagrangian 采用 ,乘子符号相应改变,但几何条件不变。
求得驻点后还需检查约束资格与极值类型。
12. K-Means 边界也是一个法向超平面
样本 在两个质心 之间的等距边界满足
展开并消去 :
等价写为
法向量为 ,超平面经过两质心中点。
二维中是中垂线,三维中是中垂面,更高维中是超平面。
13. 多质心形成 Voronoi 单元
质心 的区域由一组两两比较半空间交集构成:
这就是欧氏距离下的 Voronoi 单元。
K-Means 在两个步骤间交替:
- 将样本分配给最近质心;
- 把质心更新为簇内均值。
算法可能收敛到局部最优,并对初始化、特征尺度和距离度量敏感。
14. 统一读法:类型、shape、收缩、条件
面对任意多元公式,依次检查:
- 输入是标量、向量、矩阵还是随机变量?
- 输出是标量还是向量?
- 每个导数对象的 shape 是什么?
- 哪些轴通过内积或二次型收缩?
- 最终结果的语义是什么?
- 成立需要光滑、正定、可逆、正则约束还是局部小步长?
这套流程比把公式当图案记忆更可靠。
对比与决策
1. 什么时候用梯度,什么时候用 Hessian
- 只需要局部一阶下降方向:使用梯度。
- 需要分析方向曲率、局部二阶近似或二阶优化:使用 Hessian。
- 需要描述随机数据的联合波动:使用协方差,而不是 Hessian。
2. 有约束时不能直接沿负梯度走
无约束负梯度可能离开可行集。
等式约束下应使用 Lagrange 条件、投影梯度或其他保持可行性的优化方法。
Lagrange 乘子给出候选驻点,不自动完成全局最优证明。
3. K-Means 几何解释的边界
中垂超平面依赖欧氏距离。
换成其他距离、未标准化特征或非球形簇结构时,边界与聚类含义会变化。
综合训练
编者练习
设 求梯度与 Hessian,并写出在 附近的二阶 Taylor 形式。
查看参考答案
,。因为 本身是二次函数, 精确成立,没有更高阶余项。
编者练习 2
在约束 上最小化 。写出 Lagrange 方程,并解释梯度共线的几何意义。
查看参考答案
取 。驻点条件为 、、。目标梯度 与圆的法向 共线,说明目标沿圆的切向没有一阶变化。比较候选点可确定最小值点。
编者练习 3
两个 K-Means 质心为 、。写出等距边界,并指出法向量和经过的中点。
查看参考答案
,中点为 。边界为 ,即 ,化简为 。法向量与两质心连线平行,边界经过中点。
进入下一单元前
- 已能从一元 Taylor 写出多元梯度与 Hessian 二阶项。
- 已能解释标量损失梯度与参数同形的前提。
- 已能区分梯度、Hessian 与协方差的定义和作用。
- 已能写出 Lagrange 驻点条件并检查原约束。
- 已能推导 K-Means 的 Voronoi 超平面。
- 若仍会把负梯度当作任意学习率下的下降保证,回看 P161。
- 若仍会把 Hessian 与协方差混同,回看 P162、P163 的角色表。
- 若公式 shape 失配,先回到输入输出类型与收缩轴,不要继续符号推演。