CN119427360A 基于模仿学习的人形机器人多运动切换控制方法及系统 (山东大学)_第1页
CN119427360A 基于模仿学习的人形机器人多运动切换控制方法及系统 (山东大学)_第2页
CN119427360A 基于模仿学习的人形机器人多运动切换控制方法及系统 (山东大学)_第3页
CN119427360A 基于模仿学习的人形机器人多运动切换控制方法及系统 (山东大学)_第4页
CN119427360A 基于模仿学习的人形机器人多运动切换控制方法及系统 (山东大学)_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于模仿学习的人形机器人多运动切换控本发明提出基于模仿学习的人形机器人多动技能的表现情况动态调整对每个运动技能的2将所述人形机器人的本体状态,以及人形机器人的目标运动任务其中,所述预先构建的运动控制模型是通过模仿学习训练得到的生成式对抗网络模对参考动捕数据集中的运动技能编码进行采样,将采样结果与人将所述观测数据分别输入至控制器网络和值函数网络,得到对应的根据所述期望电机位置进行运动,返回所述人形机器人下一时刻的从所述生成数据集和参考数据集中均随机采样样本,其中,参考数据能被采样的概率根据人形机器人执行各项运动技能的表将所采样的样本输入至所述所述条件判别器中,得到每个样本输入参数数据集的概根据得到的每个样本输入参数数据集的概率计算分类损失,采用Ada根据所述人形机器人执行各项运动技能的表现情况动态调整对每个运动技能的采样概率,3根据所统计的每个运动技能对应的风格奖励均值与参考动捕数据集中所有运动技能根据所计算的每个运动技能对应的采样概率,使所述人形机器人均获取模块,其被配置为:获取人形机器人的本体状态,以及人形其中,所述预先构建的运动控制模型是通过模仿学习训练得到的生成式对抗网络模9.一种电子设备,其特征在于,包括存储器和处4[0002]本部分的陈述仅仅是提供了与本发明相关的背景技术信息,不必然构成在先技[0006]而对于现有的基于模仿学习的方法,由于以DeepMimic为例的以轨迹跟踪为基础现有的方法通常以生成式对抗模仿学习框架作为基础,以提高训练得到的控制器的灵活5[0015]利用得到的所述人形机器人待执行的电机力矩,对所述人形机器人进行运动控标运动任务输入至预先构建的运动控制模型中,得到所述人形机器人待执行的电机力矩;6[0037]利用得到的所述人形机器人待执行的电机力矩,对所述人形机器人进行运动控7[0043]本实施例中的控制器网络和值函数网络分别对应演员_评论家强化学习算法中的[0047]步骤3:值函数网络根据当前时刻的观测数据的输入,输出其预测的期望未来回施加的电机力矩τ,具体计算公式为r-h,"(a,-0)tk,si,其中kp和kd是事先调好的PD参t为控制器网络输出的当前时刻的期望电机位置;[0055]为方便后续描述,定义累计奖励为J()=Ermo[R(r)],其中,τ表示一个轨8[0062]根据策略梯度进行反向传播,并使用Adam优化器更新控制器网络参数,即_Q[0071]根据TD误差进行反向传播,并使用Adam优化器来更新值函数网络的参数,即[0076]从生成数据集和参考数据集中采样出N个样本(st,st+1)以及样本对应的运动技能9[0079]根据分类误差损失进行反向传播,并使用Adam优化器更新条件判别器网络的参[0080]条件判别器网络用于判别一个运动状态对样本是来自参考数据集还是来自生成[0086]运动控制模型整体框架的训练采用的强化学习算法为ProximalPolicy[0087]其中,步骤6中生成数据集和参考数据集中的每一个样本由人形机器人相邻两个[0091]从参考动捕数据集中随机抽选运动技能编码c,并在该运动技能对应的动捕数据中随机抽选一系列相邻时刻的运动帧也即运动状态对,该过程结束后会得到一系列样本,这些样本均由运动状态对和该运动状态对对应的运动技能编码c组成;重复多次本步骤之[0092]在运动控制模型训练过程中,所有的运动技能的学习可[0096]根据对第i个运动技能所统计的风格奖励均值Ri,使用以下公式更新其被框架采使控制器网络能够根据对各运动技能的掌握情况动态地调整对不同运动技能的学习倾向,[0099]图2为本实施例使用UnitreeH1人形机器人展示了其所集成的部分运动技能,分H1人形机器人用以后续的训练学习。以下以Dataset1为例子展示其中包含的具体运动技方法全面学习运动技能的能力以及遭受模式坍塌影式)确定所属的运动技能类别(式中DM即参考动捕数据集,m表示参考动捕数据集中的运动tt+1)表示生成数据集中相邻时刻的运动状态对,(G,5.)表示参考数据集中相邻[0111]从实验一的结果可以看出,本实施例的技术在Dataset1_4上均实现了运动[0133]本发明还提供有形地存储在非暂时性计算机可读存储介质上的至少一个计算机[0135]在本发明的上下文中,计

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论