人工神经网络7Boltzma_第1页
人工神经网络7Boltzma_第2页
人工神经网络7Boltzma_第3页
人工神经网络7Boltzma_第4页
人工神经网络7Boltzma_第5页
已阅读5页,还剩13页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

人工神经网络玻尔兹曼机从统计物理到深度信念网络的演进之路Contents目录人工神经网络:玻尔兹曼机与深度学习的起源01理论基石:物理与神经网络的交汇02核心机制:能量函数与随机搜索03算法突破:清醒与睡眠的学习循环04演进与影响:从RBM到深度信念网络CHAPTER01理论基石:物理与神经网络的交汇探索霍普菲尔德网络与热力学平衡的深层联系BOLTZMANNMACHINES从霍普菲尔德到玻尔兹曼:引入随机性传统霍普菲尔德网络作为确定性系统,极易陷入局部能量极小值,导致无法找到最优解。玻尔兹曼机通过引入随机二进制神经元与热噪声,模拟物理系统的退火过程,使网络具备逃离局部最优、探索全局能量最低态的能力。01霍普菲尔德网络的局限性确定性更新规则导致网络一旦陷入局部能量洼地,便无法自拔,难以处理复杂的视觉或认知任务。02随机二进制神经元神经元状态(0或1)不再确定,而是根据输入总和的概率决定,引入"热噪声"机制。03物理学的启示借鉴统计力学中的玻尔兹曼分布,系统处于某一状态的概率与该状态的能量呈指数关系。04核心目标构建生成模型,不仅能识别模式,还能通过"做梦"生成符合真实数据分布的新样本。GeoffreyHinton·深度学习的先驱与玻尔兹曼机的奠基者BoltzmannMachine·Perception视觉诠释与隐藏变量:内克尔立方体内克尔立方体展示了人类视觉系统如何在模糊输入中构建稳定的三维解释。在玻尔兹曼机中,隐藏神经元编码高维抽象的"解释",网络通过最小化能量函数决定当前最可能的感知状态。NeckerCube—视网膜接收的2D线框图多稳态感知视网膜接收恒定2D图像,大脑在凹面体与凸面体两种3D解释间交替,证明感知是生成性的。Multistable隐藏神经元可见层对应视网膜输入(2D线条),隐藏层对应大脑三维诠释,网络寻找使整体能量最低的状态。HiddenLayer能量函数系统能量由神经元连接权重和偏置决定,正确的"解释"对应能量的局部极小值。LocalMinima搜索与学习避免陷入错误解释(局部最优)、自动调整权重以习得正确物理规则,是两大核心计算难题。OptimizationBoltzmannMachine搜索问题:利用噪声逃离局部最优确定性网络只能沿能量梯度下降,极易受困于局部极小值。玻尔兹曼机利用随机噪声(Temperature)赋予网络"爬坡"的能力,通过模拟退火机制使系统在高温下探索广阔状态空间,在低温下收敛至全局最优解。01局部最优陷阱在复杂的能量地形(EnergyLandscape)中,错误的解释往往对应着较深的局部洼地,贪婪算法无法逃脱。局部洼地02随机更新机制神经元激活概率遵循Sigmoid函数,输入接近零时随机性最大,允许系统以一定概率接受能量升高的状态变化。Sigmoid03热平衡收敛随着时间推移,网络状态分布收敛于玻尔兹曼分布,低能量状态占据主导,但高能量状态仍有微小概率出现。玻尔兹曼分布04系综视角物理学家通过想象无数个并行运行的网络副本,来理解概率分布的稳定性,低能量配置在系综中占比最高。并行副本CHAPTER02核心机制:能量函数与随机搜索解析玻尔兹曼分布与热力学平衡的数学本质BoltzmannDistribution玻尔兹曼分布:能量决定概率玻尔兹曼分布是连接微观状态与宏观统计规律的桥梁。学习的本质,就是重塑能量地形,使真实数据位于能量谷底。公式含义P(s)∝e^(−E/kT),能量越低概率越大;温度T控制随机性,高温分布平坦,低温更尖锐。P(s)∝e^(−E/kT)生成模型的本质不同于判别模型直接分类,玻尔兹曼机学习数据的联合概率分布,从而具备生成新样本的能力。JointDistribution能量的构成由神经元间连接权重与偏置决定:E=−Σw·sᵢsⱼ−Σbᵢsᵢ,参数重塑即能量地形重塑。Weights&Biases热平衡的意义系统在所有可能状态间按玻尔兹曼分布进行概率性跃迁,不再停留单一状态,达到动态平衡。DynamicEquilibriumCHAPTER03算法突破:清醒与睡眠的学习循环揭秘基于相关性差异的权重调整法则BoltzmannMachine清醒阶段(WakePhase):感知现实在清醒阶段,可见神经元被外部数据钳位,网络在约束下演化至热平衡。此时,神经元之间的共激活反映了真实世界中的统计相关性,算法通过增加这些连接的权重来强化对现实的记忆。数据钳位(Clamping)将训练样本固定在可见层(VisibleUnits),迫使隐藏层(HiddenUnits)去"解释"这些输入。VISIBLEUNITS演化至平衡隐藏神经元通过随机更新,寻找与当前输入最匹配的内部状态,直至达到受约束的热平衡。THERMALEQUILIBRIUM赫布学习规则(HebbianLearning)"一起激发的神经元连在一起"。统计同时处于开启状态的神经元对,增加其连接权重。Δw∝⟨sᵢsⱼ⟩data能量降低这一过程实质上是在降低真实数据配置的能量,使其成为能量地形中的深谷。ENERGYMINIMABoltzmannMachine·SleepPhase睡眠阶段(SleepPhase):自由做梦在睡眠阶段,移除外部约束,让网络在所有神经元上自由运行至热平衡,模拟"梦境";算法通过减少共激活神经元的连接权重来抑制虚假相关性,确保网络"相信现实,不信梦境"。自由运行(FreeRunning)可见层不再受数据约束,与隐藏层一起随机更新,网络根据当前权重生成"幻想"样本。负相学习(NegativePhase)统计无约束下的神经元共激活频率,并据此减少连接权重,削弱非真实关联。抑制幻觉削弱梦境中的强连接,防止网络陷入虚假循环激发,确保能量地形中只有真实数据对应的谷底最深。对比发散(CD)的雏形Hinton后来提出更高效的CD算法,但"睡眠"阶段的对抗思想是其理论源头。LearningRule核心法则:相关性差异(ContrastiveHebbianRule)玻尔兹曼机的学习规则可概括为:Δwᵢⱼ∝⟨sᵢsⱼ⟩wake−⟨sᵢsⱼ⟩sleep。通过对比"数据驱动"与"模型生成"的统计差异,驱动权重向最大似然方向演化,是生成模型训练的鼻祖。正相PositivePhase基于真实数据统计量,增加低能量状态权重,使模型贴近现实。网络在数据驱动下学习真实模式的特征关联。负相NegativePhase基于模型生成统计量,减少虚假模式权重,防止过拟合。通过自由运行识别并抑制网络自身的幻觉输出。梯度Gradient等价于对数似然梯度上升,生成真实数据的概率单调增加。每次迭代都朝着提升模型似然度的方向优化。瓶颈Bottleneck睡眠阶段需全局热平衡采样,计算耗时限制大规模应用。吉布斯采样的收敛速度成为制约实用化的关键障碍。玻尔兹曼机学习阶段对比阶段网络状态权重调整物理意义清醒(Wake)可见层钳位(数据驱动)输入样本固定,隐层自由演化+Δw(增强)降低真实数据的能量使观测样本对应的状态成为低能谷睡眠(Sleep)自由运行(模型生成)网络自主采样,探索能量景观−Δw(减弱)提升虚假幻觉的能量抑制模型自发产生的非真实模式核心洞见:通过对抗性的两个阶段,网络学会了区分"真实"与"想象"。正相建立数据表征,负相消除模型偏见,二者之差即为最优更新方向。Chapter04演进与影响:从RBM到深度信念网络受限玻尔兹曼机如何开启深度学习时代DeepLearningOrigins受限玻尔兹曼机(RBM):结构即效率受限玻尔兹曼机(RBM)通过禁止层内连接,形成了二分图结构。这一限制使得给定一层状态时,另一层的节点条件独立,从而允许高效的块吉布斯采样,解决了全连接模型的采样瓶颈。RBM二分图结构:层间全连接,层内无连接01二分图结构:神经元被严格划分为可见层(Visible)和隐藏层(Hidden),连接只存在于层与层之间,层内无连接。02条件独立性:已知输入图像,所有特征检测器(隐藏节点)可以并行、独立地计算激活概率,P(h|v)可分解为各节点概率之积。03重构能力:RBM不仅能从v推导h,还能从h重构v,这种双向映射使其成为强大的特征提取器。04历史地位:PaulSmolensky(1986)提出,Hinton(2002)发明快速学习算法,成为深度学习爆发的前夜。DeepLearningArchitecture深度信念网络(DBN):堆叠的艺术深度信念网络通过堆叠多层RBM构建,利用贪婪逐层预训练形成高阶抽象表示,解决深层网络难以初始化的难题。贪婪预训练先训练第一个RBM,固定后将其隐藏层作为第二个RBM的可见层,依此类推。这为深层网络提供了极好的初始化参数。Layer-wise特征抽象第一层学习边缘特征,第二层学习轮廓,深层学习语义部件。DBN展示了深度学习"表征学习"的核心魅力。Representation微调Fine-tuning预训练完成后,使用反向传播算法对整个网络进行全局微调,以优化特定的判别任务,如分类。Backprop里程碑意义2006年Hinton的DBN论文被视为深度学习复兴的标志,证明了深层网络在计算上是可行的。2006LEGACY&RESONANCE历史遗产与现代回响尽管受限玻尔兹曼机在2012年后逐渐被判别式深度学习模型取代,但其作为生成模型和能量模型的鼻祖,奠定了现代无监督学习的理论基础。当前的扩散模型在数学本质上与玻尔兹曼机的退火过程有着惊人的相似性。生成式AI的先驱玻尔兹曼机是最早尝试学习数据联合分布的神经网络之一,为后来的GAN、VAE和Diffusion模型指明了方向。GAN·VAE能量模型将学习视为能量地形塑造的思想,在OoD检测和对抗鲁棒性研究中重新受到重视。EBM无监督特征学习证明了从海量无标签数据中学习有效特征是可能的,这一理念是当今大模型预训练的核心。Pre-trainingHinton的坚持在神经网络低谷期坚持研究玻尔兹曼机,最终证明了连接主义的强大威力。ConnectionismMODELTAXONOMY技术坐标系:生成vs判别在机器学习的技术坐标系中,玻尔兹曼机属于"生成式、无监督/自监督、概率模型"阵营。与侧重条件概率P(y|x)的判别模型不同,它致力于建模联合概率P(x,y),在处理缺失数据、多模态分布和因果推断方面具有独特的理论优势。模型类型对比特性玻尔兹曼机CNN/Transformer核心目标学习数据分布P(X)学习条件概率P(Y|X)学习方式无监督/自监督有监督为主输出能力生成新样本、重构分类、检测物理直觉能量最小化、热平衡特征提取、映射玻尔兹曼机代表了AI对"理解数据本质"的早期探索判别模型RES

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论