动量法中的速度更新加权平均极限四则_第1页
动量法中的速度更新加权平均极限四则_第2页
动量法中的速度更新加权平均极限四则_第3页
动量法中的速度更新加权平均极限四则_第4页
动量法中的速度更新加权平均极限四则_第5页
已阅读5页,还剩4页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

动量法中的速度更新加权平均极限四则动量法(Momentum)作为梯度下降优化算法的重要变体,通过引入“速度”概念模拟物理中的动量效应,有效加速模型收敛并抑制震荡。其核心在于速度更新的加权平均机制——通过历史梯度的指数加权平均,平衡当前梯度与过去运动趋势的影响。在长期迭代过程中,这种加权平均会逐渐收敛于特定极限状态,而对这一极限的数学分析,是理解动量法收敛特性、调参策略及改进方向的关键。本文将从四个维度展开,系统解析动量法速度更新加权平均的极限行为,揭示其背后的数学本质与实践价值。一、单参数线性场景下的极限收敛:稳态速度与梯度的平衡关系在最简单的单参数线性回归场景中,损失函数可表示为(L(w)=\frac{1}{2}(yw-x)^2),其中(w)为模型参数,(x)和(y)为输入输出对。此时,损失函数关于(w)的梯度为(g_t=\frac{\partialL}{\partialw}=y(yw_t-x)),即当前参数(w_t)与最优解(w^*=x/y)的偏差线性相关。动量法的速度更新公式为:[v_t=\gammav_{t-1}+\etag_t]其中(\gamma\in[0,1))为动量系数,(\eta)为学习率。参数更新则为(w_t=w_{t-1}-v_t)。当迭代进入稳态(即(w_t\tow^*),梯度(g_t\to0)),我们可以通过数学推导求解速度的极限值。假设迭代足够多次后,参数(w_t)趋近于最优解(w^*),此时梯度(g_t)可近似为(g_t\approxg'(w^)(w_t-w^)),其中(g'(w^*))为损失函数在最优解处的二阶导数(即海森矩阵的对角元素,在线性场景中为常数(y^2))。将梯度代入速度更新公式,并对两边取极限(t\to\infty),由于稳态下(v_t\tov^*),可得:[v^*=\gammav^*+\etag'(w^)(w^-w^)]显然,当(w_t\tow^)时,右边第二项趋近于0,因此(v^*=0)。这表明在单参数线性场景中,动量法最终会收敛到速度为0的稳态,参数不再更新,与梯度下降的收敛结果一致。但在收敛过程中,速度的加权平均极限呈现出更复杂的动态。通过展开速度更新公式的递推关系,我们可以得到:[v_t=\eta\sum_{k=0}^t\gamma^kg_{t-k}]这是一个历史梯度的指数加权和,权重随时间步长呈指数衰减。当迭代次数足够大时,若梯度序列({g_t})收敛于(g^*),则速度的极限可表示为:[v^*=\etag^*\sum_{k=0}^\infty\gamma^k=\frac{\etag^}{1-\gamma}]这一结果揭示了动量法的“累积效应”:即使单个梯度(g^)较小,通过累积历史梯度,最终速度会放大(1/(1-\gamma))倍。例如,当(\gamma=0.9)时,速度极限是当前梯度的10倍,这正是动量法加速收敛的核心原因——通过持续积累同方向的梯度,形成“惯性”推动参数快速向最优解移动。进一步分析参数更新的收敛速度,我们可以将动量法的迭代过程转化为线性递推系统。定义状态向量(\mathbf{z}_t=[w_t,v_t]^T),则迭代过程可表示为:[\mathbf{z}t=\mathbf{A}\mathbf{z}{t-1}+\mathbf{b}]其中矩阵(\mathbf{A}=\begin{bmatrix}1&-1\\etag'(w^)&\gamma\end{bmatrix}),向量(\mathbf{b}=[0,-\etag'(w^)w^]^T)。系统的收敛速度由矩阵(\mathbf{A})的特征值决定,其特征方程为:[\lambda^2-(1+\gamma)\lambda+\gamma+\etag'(w^)=0]求解特征值可得:[\lambda=\frac{(1+\gamma)\pm\sqrt{(1+\gamma)^2-4(\gamma+\etag'(w^))}}{2}]为保证收敛,特征值的模必须小于1。当(\etag'(w^)<1-\gamma)时,特征值为实数且模小于1,系统单调收敛;当(1-\gamma<\etag'(w^*)<(1+\gamma)^2/4)时,特征值为共轭复数,系统会出现震荡收敛,但震荡幅度随迭代次数逐渐衰减。这一结论解释了动量法在处理线性问题时的收敛特性:通过调整动量系数(\gamma)和学习率(\eta),可以在收敛速度与稳定性之间取得平衡。二、非凸损失函数中的极限震荡:局部极小值与鞍点的速度行为在实际的深度学习任务中,损失函数通常是非凸的,存在多个局部极小值和鞍点。此时,动量法的速度更新加权平均极限不再是简单的稳态收敛,而是呈现出复杂的震荡行为。(一)局部极小值附近的极限循环当参数收敛到局部极小值点(w^*)时,损失函数在该点的梯度为0,但二阶导数(海森矩阵)可能存在正特征值(表示极小值)和负特征值(表示鞍点)。假设局部极小值点附近的损失函数可近似为二次型:[L(w)\approxL(w^)+\frac{1}{2}(w-w^)^TH(w-w^)]其中(H)为海森矩阵,且所有特征值均为正。此时,梯度(g_t=H(w_t-w^)),代入动量法的速度更新公式可得:[v_t=\gammav_{t-1}+\etaH(w_t-w^*)]参数更新为(w_t=w_{t-1}-v_t)。将参数更新公式代入速度更新公式,可得到关于(w_t)的二阶递推关系:[w_t-w^*=(I+\etaH)w_{t-1}-\gammaw_{t-2}-(I+\etaH-\gammaI)w^*]当(w_t\tow^*)时,上式可简化为:[w_t-w^*=(I+\etaH)(w_{t-1}-w^)-\gamma(w_{t-2}-w^)]令(\delta_t=w_t-w^*),则递推关系为:[\delta_t=(I+\etaH)\delta_{t-1}-\gamma\delta_{t-2}]这是一个线性递推系统,其解的形式取决于矩阵((I+\etaH))和(\gammaI)的特征值。假设(H)的特征值为(\lambda_i>0),则对应的特征向量(\mathbf{u}i)满足(H\mathbf{u}i=\lambda_i\mathbf{u}i)。此时,(\delta_t)在特征向量(\mathbf{u}i)方向上的分量(\delta{t,i})满足:[\delta{t,i}=(1+\eta\lambda_i)\delta{t-1,i}-\gamma\delta{t-2,i}]其特征方程为:[r^2-(1+\eta\lambda_i)r+\gamma=0]求解特征根:[r=\frac{(1+\eta\lambda_i)\pm\sqrt{(1+\eta\lambda_i)^2-4\gamma}}{2}]当((1+\eta\lambda_i)^2<4\gamma)时,特征根为共轭复数,模长为(\sqrt{\gamma}),此时(\delta_{t,i})会呈现衰减震荡的趋势,即参数在局部极小值附近围绕最优解震荡,震荡幅度随迭代次数以(\sqrt{\gamma}^t)的速度衰减。这表明在非凸损失函数的局部极小值附近,动量法的速度更新加权平均极限并非零,而是围绕零值震荡,最终收敛到一个以最优解为中心的极限环。(二)鞍点处的极限发散与逃逸鞍点是损失函数梯度为零但海森矩阵存在负特征值的点。在鞍点处,损失函数在某些方向上是凸的(特征值为正),而在另一些方向上是凹的(特征值为负)。对于凹方向,梯度会随着参数远离鞍点而增大,这可能导致动量法的速度更新出现发散行为。假设鞍点(w^*)处的海森矩阵(H)有一个负特征值(\lambda<0),对应的特征向量为(\mathbf{u})。此时,参数在(\mathbf{u})方向上的分量(w_{t,\mathbf{u}})满足:[\delta_{t,\mathbf{u}}=(1+\eta\lambda)\delta_{t-1,\mathbf{u}}-\gamma\delta_{t-2,\mathbf{u}}]由于(\lambda<0),(1+\eta\lambda)可能小于1。当(|1+\eta\lambda|>2\sqrt{\gamma})时,特征方程的根为实数,且至少有一个根的模大于1,导致(\delta_{t,\mathbf{u}})随迭代次数指数增长,即参数会沿着凹方向远离鞍点。但动量法的加权平均机制可能对这种发散行为产生抑制作用。由于速度更新是历史梯度的加权和,当参数远离鞍点时,梯度的符号可能发生变化(例如,在凹方向上,参数远离鞍点会导致梯度增大,但符号与参数偏离方向相反),从而使速度更新的方向发生反转。通过调整动量系数(\gamma)和学习率(\eta),可以控制这种反转的时机,使参数能够“逃逸”鞍点,继续向更优的局部极小值收敛。例如,当(\gamma=0.9),(\eta=0.1),(\lambda=-2)时,(1+\eta\lambda=0.8),特征方程为(r^2-0.8r+0.9=0),特征根为共轭复数,模长为(\sqrt{0.9}\approx0.9487),此时参数在凹方向上的分量会呈现衰减震荡,最终收敛到鞍点。但如果增大学习率至(\eta=0.5),则(1+\eta\lambda=0),特征方程为(r^2+0.9=0),特征根为纯虚数,模长为(\sqrt{0.9}),参数会围绕鞍点做等幅震荡。而当(\eta=1.0)时,(1+\eta\lambda=-1),特征方程为(r^2+r+0.9=0),特征根的模长为(\sqrt{0.9}),但实部为负,参数会在远离鞍点的过程中震荡衰减,最终仍收敛到鞍点。这表明在鞍点处,动量法的速度更新加权平均极限可能是围绕鞍点的震荡,而非发散,具体行为取决于动量系数、学习率与海森矩阵特征值的组合。三、随机梯度场景下的极限分布:噪声抑制与偏差-方差权衡在深度学习中,我们通常使用随机梯度下降(SGD)来训练模型,即每次迭代仅使用一个或一小批量样本计算梯度,导致梯度(g_t)包含随机噪声。此时,动量法的速度更新加权平均不仅要处理梯度的确定性部分,还要应对随机噪声的影响。假设随机梯度(g_t=\bar{g}_t+\epsilon_t),其中(\bar{g}t)为真实梯度(即全样本梯度),(\epsilon_t)为零均值的随机噪声,且满足(\mathbb{E}[\epsilon_t]=0),(\mathbb{E}[\epsilon_t\epsilon_t^T]=\Sigma)(协方差矩阵)。动量法的速度更新公式为:[v_t=\gammav{t-1}+\eta(\bar{g}_t+\epsilon_t)](一)速度的极限期望与偏差对速度更新公式两边取期望,可得:[\mathbb{E}[v_t]=\gamma\mathbb{E}[v_{t-1}]+\eta\mathbb{E}[\bar{g}_t]]当迭代进入稳态,真实梯度(\bar{g}_t\to0),因此(\mathbb{E}[v_t]\to0)。这表明在随机梯度场景下,速度的期望最终会收敛到零,与确定性场景一致。但在收敛过程中,速度的期望会呈现出一定的偏差。通过展开递推关系,可得:[\mathbb{E}[v_t]=\eta\sum_{k=0}^t\gamma^k\mathbb{E}[\bar{g}_{t-k}]]若真实梯度(\bar{g}_t)收敛到0的速度为(O(1/t))(如在强凸损失函数下),则(\mathbb{E}[v_t])的收敛速度为(O(1/t)),与SGD的收敛速度一致。但动量法通过加权平均历史梯度,相当于对真实梯度进行了低通滤波,减少了梯度噪声对参数更新的影响,从而在相同迭代次数下获得更低的训练损失。(二)速度的极限方差与噪声抑制速度的方差反映了随机噪声对速度更新的影响程度。对速度更新公式两边取方差,假设随机噪声(\epsilon_t)与历史速度(v_{t-1})独立,则:[\text{Var}(v_t)=\gamma^2\text{Var}(v_{t-1})+\eta^2\text{Var}(\epsilon_t)]当迭代进入稳态,(\text{Var}(v_t)\to\text{Var}(v)),因此:[\text{Var}(v)=\gamma^2\text{Var}(v)+\eta^2\Sigma]解得:[\text{Var}(v)=\frac{\eta^2\Sigma}{1-\gamma^2}]与SGD的参数更新方差(\text{Var}(\etag_t)=\eta^2\Sigma)相比,动量法的速度方差放大了(1/(1-\gamma^2))倍。这似乎表明动量法会加剧噪声的影响,但实际上,参数更新的方差需要结合参数更新公式(w_t=w_{t-1}-v_t)来分析。参数更新的方差为:[\text{Var}(w_t-w_{t-1})=\text{Var}(v_t)=\frac{\eta^2\Sigma}{1-\gamma^2}]但由于动量法的参数更新是速度的累积,参数的长期方差需要考虑迭代过程中的相关性。通过分析参数序列({w_t})的自协方差,可得参数的稳态方差为:[\text{Var}(w)=\frac{\eta^2\Sigma}{(1-\gamma)^2(2-\gamma)}]而SGD的参数稳态方差为(\text{Var}(w_{\text{SGD}})=\frac{\eta^2\Sigma}{2\mu})(其中(\mu)为损失函数的强凸系数)。当(\gamma)接近1时,动量法的参数方差会显著大于SGD,这表明动量法在加速收敛的同时,可能会导致参数在最优解附近的震荡幅度增大。为了平衡收敛速度与参数方差,需要进行偏差-方差权衡。通过调整动量系数(\gamma)和学习率(\eta),可以在保证收敛速度的同时,控制参数的震荡幅度。例如,当批量大小较小时,梯度噪声较大,此时应选择较小的(\gamma)(如0.5)以减少噪声的累积;当批量大小较大时,梯度噪声较小,可选择较大的(\gamma)(如0.9)以充分利用动量的加速效应。(三)加权平均的极限分布当迭代次数足够大时,速度(v_t)的分布会趋近于一个正态分布。根据中心极限定理,由于速度是历史梯度的加权和,而每个梯度包含独立的随机噪声,因此(v_t)会渐近服从正态分布(\mathcal{N}(0,\frac{\eta^2\Sigma}{1-\gamma^2}))。参数(w_t)的分布则取决于速度的累积效应。由于(w_t=w_0-\sum_{k=1}^tv_k),而(v_k)是相关的随机变量(因为(v_k)依赖于(v_{k-1})),因此参数的分布需要通过自回归过程的稳态分布来求解。在强凸损失函数下,参数(w_t)会渐近服从正态分布(\mathcal{N}(w^*,\text{Var}(w))),其中(\text{Var}(w))如前所述。通过分析速度和参数的极限分布,我们可以为动量法的调参提供理论依据。例如,当模型在验证集上的损失出现震荡时,可能是由于动量系数过大导致速度方差过大,此时应减小(\gamma)或学习率(\eta);当模型收敛速度过慢时,可适当增大(\gamma)以利用动量的加速效应。四、动量法变体中的极限特性:Nesterov加速与自适应动量的加权平均动量法经过多年发展,衍生出了多种变体,如Nesterov加速梯度(NAG)、自适应动量估计(Adam)等。这些变体通过修改速度更新的加权平均方式,改变了极限收敛特性,从而在不同场景下获得更好的性能。(一)Nesterov加速梯度的超前梯度加权平均Nesterov加速梯度的核心思想是“超前一步”计算梯度,即先根据当前速度更新参数,再计算新参数处的梯度。其速度更新公式为:[v_t=\gammav_{t-1}+\eta\nablaL(w_{t-1}-\gammav_{t-1})]参数更新为(w_t=w_{t-1}-v_t)。与标准动量法相比,NAG的速度更新使用了“未来”参数(w_{t-1}-\gammav_{t-1})处的梯度,而非当前参数(w_{t-1})处的梯度。这种修改改变了加权平均的结构,使得速度更新更能反映参数的未来运动趋势。在单参数线性场景下,NAG的速度更新公式可展开为:[v_t=\gammav_{t-1}+\etag_t']其中(g_t'=\nablaL(w_{t-1}-\gammav_{t-1})=y(y(w_{t-1}-\gammav_{t-1})-x)=g_{t-1}-\gammay^2v_{t-1})。代入速度更新公式可得:[v_t=\gammav_{t-1}+\eta(g_{t-1}-\gammay^2v_{t-1})=\etag_{t-1}+\gamma(1-\etay^2)v_{t-1}]与标准动量法的速度更新公式(v_t=\gammav_{t-1}+\etag_t)相比,NAG的速度更新包含了上一步的梯度(g_{t-1}),而非当前梯度(g_t)。这种时间上的偏移使得NAG的加权平均更注重近期的梯度变化,从而在收敛过程中减少震荡。当迭代进入稳态时,NAG的速度极限可通过类似的推导得到。假设(w_t\tow^*),则(g_t'\to0),因此(v^*=\gammav^*),即(v^*=0),与标准动量法一致。但在收敛过程中,NAG的速度收敛速度更快。通过分析线性递推系统的特征值,NAG的特征方程为:[\lambda^2-(1-\gamma+\eta\lambda_i)\lambda+\gamma=0]其特征根的模长小于标准动量法的特征根模长,因此NAG的收敛速度更快,尤其是在接近最优解时,能够更快速地收敛到稳态。(二)自适应动量估计的动态加权平均Adam算法结合了动量法和自适应学习率的思想,通过对梯度的一阶矩和二阶矩进行指数加权平均,动态调整每个参数的学习率。其速度更新公式为:[m_t=\beta_1m_{t-1}+(1-\beta_1)g_t][v_t=\beta_2v_{t-1}+(1-\beta_2)g_t^2]其中(m_t)为梯度的一阶矩估计(即动量),(v_t)为梯度的二阶矩估计,(\beta_1,\beta_2\in[0,1))为矩估计的衰减系数。Adam的参数更新公式为:[w_t=w_{t-1}-\frac{\hat{m}_t}{\sqrt{\hat{v}_t}+\epsilon}\eta]其中(\hat{m}_t=m_t/(1-\beta_1^t))和(\hat{v}_t=v_t/(1-\beta_2^t))为偏差修正后的矩估计,(\epsilon)为防止分母为零的小常数。与标准动量法相比,Adam的速度更新(即一阶矩估计(m_t))是梯度的指数加权平均,但权重系数(\beta_1)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论