CN119472702A 移动机器人的导航方法以及装置 (中国科学院自动化研究所)_第1页
CN119472702A 移动机器人的导航方法以及装置 (中国科学院自动化研究所)_第2页
CN119472702A 移动机器人的导航方法以及装置 (中国科学院自动化研究所)_第3页
CN119472702A 移动机器人的导航方法以及装置 (中国科学院自动化研究所)_第4页
CN119472702A 移动机器人的导航方法以及装置 (中国科学院自动化研究所)_第5页
已阅读5页,还剩27页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

号本发明提供一种移动机器人的导航方法以置信息,将行人位置信息输入至机器人导航模历史运动信息、邻居运动信息以及未来运动信2将所述行人位置信息输入至机器人导航模型,得到所述机器人导航通过所述记忆池,在当前观测时间窗口内,将目标时间步之前通过所述状态预测模块,基于所述历史运动信息、所述邻居运动信通过所述值估计模块,获取所述移动机器人的机器人状态,基于所述所述第一记忆池用于存储所述机器人导航模型在训练过程中每个时间步的机器人状所述第二记忆池用于存储历史观测时间窗口内所述每个行人的位置信息序列;所述第三记忆池用于存储当前观测时间窗口内所述每个行人的位置信息序列。3.根据权利要求1所述的移动机器人的导航方法,其特征在于,所述状态预测模块包基于所述历史运动信息、所述邻居运动信息以及所述未来运动通过所述循环神经网络,基于注意力机制对所述历史运动信息所述基于所述机器人状态与所述每个行人的预测行人状态,确通过所述关系图网络,基于所述机器人状态与所述每个行人的预通过所述价值网络,基于预设的动作价值函数对所述交互关系特征进行动作价值估3基于预设的教师模型基于最佳相互碰撞避免策略在目标场基于所述目标场景经验数据,对所述预设的教师模型中的状态预基于强化学习与监督学习对初始化之后的所述预设的教师模型中的状态预测模块与通过所述训练后的教师模型,基于所述源场景经验数据对所述预设基于强化学习与监督学习对初始化之后的所述预设的学生模型中的状态预测模块与将所述训练后的学生模型作为训练后的机器机器人导航模块,用于将所述行人位置信息输入至机器人导航模型,通过所述记忆池,在当前观测时间窗口内,将目标时间步之前通过所述状态预测模块,基于所述历史运动信息、所述邻居运动信通过所述值估计模块,获取所述移动机器人的机器人状态,基于所述8.一种电子设备,包括存储器、处理器及存储在程序被处理器执行时实现如权利要求1至6任一项所述移动机行时实现如权利要求1至6任一项所述移动机器人4[0001]本发明涉及机器人导航技术领域,尤其涉及一种移动机器人的导航方法以及装邻居运动信息;将所述目标时间步之后的所述目标行人的位置信息序列作为未来运动信56机程序被处理器执行时实现如上述任一种所述移动机器人这些假设通常是不切实际的。也有一些方法通过直接学习策略网络避免了对行人进行建7[0028]本发明提供了一种移动机器人的导航方法,一方面,设计了一个基于SocialVAE行人状态预测模块在不同的场景下进行蒸馏,使得最终训练得到的导航模型能够学习到不同场景的信息。V*[0036]参考图2,图2是本发明提供的移动机器人导航策略示意图,其中,包括:环境作。V*8第一记忆池用于存储机器人导航模型在训练过程中每个时间步的机器人状态与第二记忆池用于存储历史观测时间窗口内每个行人的位置信第三记忆池用于存储当前观测时间窗口内每个行人的位置信个行人的位置信息序列即按照时间序列存储练时使用和更新,分别用于给值估计模块和状态预测模块提供训练数据。第三记忆池[0041]需要说明的是,采集到的行人位置信息包括过去一段连续时间T0内的所有n个人9行人状态预测器首先对记忆池Mmaj或Mhorizon的数据进行预处理,得到历史观测中的历的社会特征向量。编码后的社会特征向量经过解码器处理,最终得到基于机器人状态与每个行人的预测行人状态,确定移动机器人的目标导航动作,特征是对特征矩阵和关系矩阵进一步编码得到的向量,没有明确的含义,但隐式的表示了智能体之间的相对交互关系,即智能体之间的关注程度)。价值网络是一个多层感知机基于知识蒸馏对预设的机器人导航模型进行训练,得到训练后的机器人导航模[0070]通过本发明实施例不仅可以提升模型的性能,还能降低模型的复杂度和计算需基于强化学习与监督学习对初始化之后的预设的教师模型中的状态预测模块与基于强化学习与监督学习对初始化之后的预设的学生模型中的状态预测模块与初始化值估计模块和状态预测模块。然后,我们使用强化学习和监督学习来联合训练值估计模块和状态预测模块。值估计模块的损失函数LV,是估计值和目标值之间的均方误差qor和先验分布po,之间的KL散度。LP,=MSE(fp,(s',a'),stt')+KL(qw,lpo,)(2)其中,LP,表示教师模型的状态预测模块的损失函数,MSE表示均方误差函数,预测状态,sttAt表示真实状态,KL(ap,Ilpo,)表示教师模型的后验分布和教师模型的先验分布po,之间的KL散度。[0075]在一些实施例中,最佳相互碰撞避免策略(OptimalReciprocalCollision预测模块)的预测状态,sttAt表示真实学生模型的先验分布po;之间的KL散度。预测状态之间的均方误差,以及学生模型的先验分布poKL(po,IPO,)表示学生模型的先验分布pos和教师模型的先验分布po,之间的KL散度。序列作为历史运动信息;将目标时间步之前的其他行人的位置信息序列作为邻居运动信[0095]此外,上述的存储器530中的逻辑指令可以通过软件功能单元的形式实现并作为发明的技术方案本质上或者说对现有技术做出贡献的部分或者该技术方案的部分可以以序,该计算机程序被处理器执行时实现以执行上述各方法提供的移动机器人的导航方法,以是或者也可以不是物理上分开的,作为单元显示的部件可以是或

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论