基于内在动机的强化学习技能发现研究综述_第1页
基于内在动机的强化学习技能发现研究综述_第2页
基于内在动机的强化学习技能发现研究综述_第3页
基于内在动机的强化学习技能发现研究综述_第4页
基于内在动机的强化学习技能发现研究综述_第5页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于内在动机的强化学习技能发现研究综述一、内在动机驱动的技能发现核心理论基础强化学习领域中,智能体的行为驱动机制长期被外在奖励信号主导,传统框架假设环境会提供明确、稠密的奖励反馈指导智能体优化策略。但在开放世界场景下,奖励稀疏甚至缺失的问题成为智能体自主探索的核心瓶颈,内在动机理论的引入为破解这一困境提供了新的研究范式。内在动机的概念起源于心理学中德西和瑞安的自我决定理论,该理论将人类行为动机划分为外在动机与内在动机两类:前者指向行为外部的奖励回报,后者则源于行为本身带来的乐趣、好奇心满足与能力提升,无需依赖外部反馈即可驱动个体持续探索。将心理学中的内在动机迁移到强化学习场景,核心是构建不依赖环境外在奖励的内生激励信号,驱动智能体主动发现可复用的技能序列。当前主流的内在动机建模维度主要分为三类:第一类是基于新奇性的激励,核心思想是鼓励智能体探索之前从未访问过的状态或状态转移模式,这类方法通常通过计数、预测误差、互信息估计等方式衡量状态的新奇程度,当智能体遇到从未见过的状态时获得更高的内生奖励;第二类是基于能力的激励,核心是鼓励智能体学习能够稳定控制环境变化的技能,例如智能体如果学会了“推门”的动作序列,可以稳定地将状态从“门关闭”转移到“门打开”,这类可复现的状态转移会被赋予正向激励;第三类是基于信息增益的激励,核心是鼓励智能体降低对环境动态的认知不确定性,当智能体通过探索更新了环境模型的参数、获得了更多关于环境运行规律的信息时,获得对应的内生奖励。技能发现的本质是从高维、连续的动作状态空间中提取出具有时间抽象性、语义独立性、可复用性的子策略模块。经典的强化学习技能表示框架包括选项框架(OptionFramework)、分层强化学习的子策略结构等,一个标准的技能通常包含三个要素:发起条件(技能在哪些状态下可以被触发)、策略模块(技能执行过程中的动作输出规则)、终止条件(技能执行到哪些状态时结束)。内在动机在技能发现中的核心作用,就是在没有外在任务指导的预训练阶段,驱动智能体自动探索出大量具备实用价值的技能,当后续遇到具体下游任务时,智能体可以直接调用这些预训练好的技能,无需从零开始学习,大幅提升样本效率和泛化能力。二、基于新奇性驱动的技能发现研究进展新奇性驱动是内在动机技能发现领域发展最早、研究最充分的方向,其核心挑战是如何在高维连续状态空间中高效衡量状态的新奇程度,避免计数法在高维空间中遇到的维度灾难问题。早期的计数型方法仅适用于离散状态空间,研究人员通过对状态进行哈希编码、或者使用密度估计模型近似状态的访问频率,将计数思想拓展到连续空间。其中具有代表性的是2016年提出的#探索方法,该方法使用局部敏感哈希函数对连续状态进行编码,统计每个哈希桶的访问次数,将访问次数的倒数作为内生奖励,驱动智能体探索访问次数更少的区域。但这类基于哈希的方法存在精度与计算效率的权衡问题,哈希桶的粒度设置过粗会导致不同状态被误判为同一状态,过细则会回到高维计数的性能瓶颈。基于预测误差的新奇性检测方法是后续的主流发展方向,这类方法的核心假设是:对于智能体从未见过的状态,环境动态模型对该状态下的动作结果预测误差会更高,因此可以将预测误差作为新奇程度的代理指标。2017年提出的好奇心驱动探索方法(Curiosity-DrivenExploration)是该方向的里程碑工作,研究人员设计了两个神经网络模块:一个是负责输出动作的策略网络,另一个是负责预测“当前状态+动作”下下一个状态表示的前向动力学模型,将前向动力学模型的预测误差作为内在奖励加入到强化学习的损失函数中。实验结果表明,在《超级马里奥兄弟》这类奖励稀疏的游戏场景中,仅依靠好奇心内在奖励,智能体就能够学会自主探索游戏地图、发现跳跃、移动、躲避障碍物等基础技能,无需任何游戏通关的外在奖励信号。不过这类方法存在“噪声陷阱”问题:如果环境中存在不可预测的随机噪声,例如游戏场景中随机飘动的云朵,前向模型对这类状态的预测误差始终很高,会导致智能体被无关噪声吸引,停止探索其他有价值的区域。为了解决噪声陷阱问题,研究人员提出了一系列改进方案。其中一类思路是仅对智能体可以控制的状态维度计算预测误差,忽略环境中不受智能体影响的随机变量。2018年提出的可控好奇心方法引入了互信息估计模块,衡量智能体动作与状态转移之间的互信息,仅当预测误差来源于智能体可以控制的状态变化时,才将其计入内在奖励。另一类思路是使用状态表示学习方法,将原始高维状态投影到低维表示空间,在表示空间中计算新奇性,过滤掉无关的噪声维度。2020年提出的Dreamer算法结合了世界模型与内在动机,智能体首先学习环境的世界模型,在世界模型的隐空间中衡量状态的新奇程度,既降低了新奇性计算的维度,也过滤了原始观测中的无关噪声。基于隐空间的新奇性检测方法还进一步衍生出了基于隐变量分布匹配的技能发现思路,例如2021年提出的DIAYN算法,通过最大化技能标签与状态表示之间的互信息,驱动智能体学习不同的技能,每个技能对应隐空间中不同的状态分布区域,最终智能体可以自动发现“向左走”“向右走”“跳跃”等不同的语义技能,且不同技能之间具有良好的区分度。三、基于能力与信息增益的技能发现研究方向与新奇性驱动探索不同,基于能力的内在动机更关注技能的实用性而非新颖性,其核心目标是让智能体发现能够可靠地引发特定状态转移的行为序列。这类方法的核心假设是:一个有价值的技能应该能够稳定地将环境从某个初始状态集合转移到某个目标状态集合,技能的效果越稳定、覆盖的状态转移范围越广,其价值越高。2019年提出的“技能链”(SkillChaining)方法是该方向的典型代表,研究人员设计了内生奖励机制鼓励智能体学习一系列相互衔接的技能:前一个技能的终止状态是后一个技能的发起状态,通过这种方式,智能体可以自动构建出覆盖整个状态空间的技能网络,当后续遇到长程决策任务时,只需要将不同的技能链拼接起来即可完成任务。在机械臂抓取的仿真实验中,仅依靠能力驱动的内在动机,智能体就能够自主发现“靠近物体”“抓取物体”“移动物体到目标位置”等一系列连续技能,比直接用稀疏奖励训练的样本效率提升了4倍以上。能力驱动的技能发现中一个重要的研究分支是自主目标生成方法,这类方法让智能体自主选择想要达成的目标状态,然后学习达成该目标的技能,将技能学习的难度控制在智能体当前的能力边界上。2017年提出的生成对抗内在动机(GAIM)方法使用生成对抗网络来生成目标状态,生成器负责生成智能体当前还不能达成的、难度适中的目标,判别器负责判断一个状态是否是智能体能够达成的,通过这种对抗生成的方式,智能体的能力边界不断拓展,自动学习从简单到复杂的各类技能。后续提出的自适应课程学习方法进一步优化了目标生成的过程,根据智能体当前的能力水平动态调整目标的难度,避免生成过于简单或者过于困难的目标,让技能学习过程始终保持最高的效率。在人形机器人locomotion任务中,这类自主目标生成方法能够驱动智能体先后学会站立、行走、跑步、跨越障碍物等一系列递进的技能,无需人工设计任务课程。基于信息增益的内在动机则从认知科学的视角出发,将技能发现看作是智能体降低对环境认知不确定性的过程。这类方法通常基于贝叶斯框架建模环境动态,将智能体对环境模型参数的后验分布的信息增益作为内生奖励。2018年提出的信息增益驱动探索方法(InformationGainExploration)使用贝叶斯神经网络建模环境动态,当智能体访问一个新的状态时,根据环境模型参数的后验分布变化计算信息增益,将其作为内在奖励。这类方法的优势是能够主动探索能够最大程度降低环境不确定性的状态,比随机探索或者新奇性探索的效率更高,尤其适合模型基强化学习场景。2022年的一项研究将信息增益与技能发现结合,提出了“认知技能”的概念,这类技能的核心作用是帮助智能体获取环境的关键信息,例如在迷宫环境中,“打开灯”的技能可以让智能体观测到更大范围的环境状态,大幅降低对整个迷宫布局的认知不确定性,信息增益驱动的内在动机可以让智能体优先发现这类具备认知价值的技能,为后续完成各类下游任务提供信息基础。四、内在动机技能发现的应用场景与挑战当前内在动机驱动的技能发现已经在多个领域展现出巨大的应用价值。在机器人领域,无监督预训练阶段使用内在动机让机器人自主探索环境、发现各类运动和操作技能,已经成为提升机器人泛化能力的主流方案。2023年谷歌DeepMind发布的RoboCat模型,首先在大量不同的机器人上使用内在动机进行无监督技能预训练,学习到了抓取、移动、组装等通用操作技能,在后续面对新的下游任务时,仅需要10个左右的示范样本就可以适配新任务,比从零训练的模型样本效率提升了上百倍。在游戏AI领域,内在动机技能发现被用于开放世界游戏的智能体预训练,2022年OpenAI在《我的世界》游戏中使用内在动机让智能体自主探索,自动发现了砍树、制作工具、搭建建筑等超过100种不同的技能,基于这些预训练技能,智能体可以快速完成“制作钻石镐”这类需要几十步连续操作的长程任务。在推荐系统领域,内在动机被用于模拟用户的自主探索行为,提升推荐系统的多样性和长期用户满意度,2024年的一项研究将用户的兴趣探索行为建模为内在动机驱动的技能发现过程,设计的推荐算法在长周期用户留存率上比传统算法提升了18%。尽管已经取得了诸多进展,该领域仍然面临一系列核心挑战有待突破。第一是技能的抽象粒度自适应问题,当前大多数方法的技能时间粒度是固定的,无法根据环境复杂度和任务需求自动调整技能的长度,在简单场景下技能粒度过细会导致决策效率低下,在复杂场景下粒度过粗则无法覆盖精细的操作需求。第二是大规模技能的结构化组织问题,当智能体通过无监督探索发现了成千上万的技能之后,如何对这些技能进行分类、索引、检索,在遇到下游任务时快速找到最合适的技能组合,仍然缺乏通用的解决方案。第三是内在动机与外在奖励的融合问题,在有外在奖励的场景下,如何平衡内在探索和任务利用的权衡,既保证智能体能够发现足够丰富的技能,又能够高效完成当前的外在任务,仍然是未解决的难题。第四是真实世界场景下的样本效率问题,当前大多数内在动机技能发现方法的验证都在仿真环境中进行,需要大量的交互样本,而真实世界机器人的交互成本很高,如何降低这类方法的样本需求量,让其能够直接在真实物理环境中高效运行,是未来落地应用需要解决的核心问题。近年来,大语言模型与内在动机技能发现的结合成为新的研究热点。大语言模型具备丰富的世界知识和语义理解能力,可以为技能发现提供先验知识指导,也可以为自动发现的技能

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论