(模式识别与智能系统专业论文)移动机器人自主避障方法研究.pdf_第1页
(模式识别与智能系统专业论文)移动机器人自主避障方法研究.pdf_第2页
(模式识别与智能系统专业论文)移动机器人自主避障方法研究.pdf_第3页
(模式识别与智能系统专业论文)移动机器人自主避障方法研究.pdf_第4页
(模式识别与智能系统专业论文)移动机器人自主避障方法研究.pdf_第5页
已阅读5页,还剩53页未读 继续免费阅读

(模式识别与智能系统专业论文)移动机器人自主避障方法研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘耍 摘要 移动机器人是一种能够在工作环境中自主移动并完成预定任务的智能系 统,是机器人学和智能控制的一个重要研究领域,在工业、农业、民用以及军事 领域具有广泛的应用前景。移动机器人自主避障问题是机器人研究领域中的热点 问题,己引起了国内外学者的广泛关注。移动机器人在其工作环境中必须具有可 靠而灵活的自主移动能力,因此使得移动机器人具有学习能力是实现自主避障的 关键问题,是提高移动机器人智能性的必然选择。 针对移动机器人避障问题,本文主要做了以下三个方面的工作。 ( 1 ) 在基于行为控制结构的基础上,设计了一种智能控制结构,该结构中引 入了强化学习模块,可以实现移动机器人的自主学习功能,克服了纯粹基于行为 控制结构自学习能力差、编程繁杂的不足。 ( 2 ) 神经网络具有良好的泛化能力,利用神经网络实现q 学习,解决了表格q 学习应用范围小、占用存储空间大的问题,并把其分别应用到移动机器人的静态 和动态避障中,实现了移动机器人的自主避障。 ( 3 ) 提出基于增长型自组织神经网络避障算法i 利用增长型自组织神经网络 实现对移动机器人外部环境的聚类,克服了传统的神经网络需事先确定其规模结 构的不足。在此基础上利用强化学习实现了对移动机器人的控制。实验证明,该 方法能够有效地实现移动机器人自主避障。 关键词神经网络;移动机器人;自主避障;强化学习 a b s t r a c t i a bs t r a c t m o b i l er o b o ti sak i n do fi n t e l l i g e n ts y s t e mt h a tc a nm o v ea n dw o r k a u t o n o m o u s l yi nt h ee n v i r o n m e n ta n dh a v eb e e nw i d e l yu s e di nt h ea r e ao fi n d u s t r y , a g r i c u l t u r e ,d a i l yl i f ea n dm i l i t a r ya f f a i r s a u t o n o m o u so b s t a c l ea v o i d a n c eo f m o b i l e r o b o ti st h em a i na s p e c to fr o b o t i c sa n da t t r a c t sm a n yr e s e a r c h e r s i ti sn e c e s s a r yf o r m o b i l er o b o tt oh a v et h ea b i l i t yo fm o v i n ga r o u n da u t o n o m o u s l ya n ds a f e l y l e a r n i n ga b i l i t yi sk e y t ot h ea u t o n o m yo fm o b i l er o b o t i n t e g r a t i n gl e a r n i n ga b i l i t y t ot h em o b i l er o b o ti st h en e c e s s a r yc h o i c e a c c o r d i n gt ot h ea u t o n o m o u so b s t a c l ea v o i d a n c e ,w ed i ds o m ew o r kt oi m p r o v e t h el e a r n i n ga b i l i t yo ft h em o b i l er o b o t n em a i na c h i e v e m e n t so ft h i sp a p e ra r ea s f o l l o w s : ( 1 ) i n t e l l i g e n tc o n t r o la r c h i t e c t u r ei sd e s i g n e do nt h eb a s i so ft h eb e h a v i o r - b a s e d c o n t r o la r c h i t e c t u r e r e i n f o r c e m e n tl e a r n i n gi si n t e g r a t e dt ot h ea r c h i t e c t u r ew h i c hl e t t h em o b i l er o b o tc a nl e a r nt oa v o i do b s t a c l e sa u t o n o m o u s l y b yd o i n gt h i s ,w ed o n o tn e e dd op r o g r a mf o ra l lp o s s i b l em a t t e r st h a tt h er o b o tm e e t sa n dm a k et h e p r o g r a m m i n ge a s i e r ( 2 ) q l e a r n i n gi so n ek i n do f r e i n f o r c e m e n tl e a r n i n g t h a ti su s e dw i d e l y ,b u ti th a s l i m i t a t i o nf o rt h a ti tc a nn o tb ea p p l i e dt oc o n t i n u o u ss t a t e n e u r a ln e t w o r kh a sa g o o dg e n e r a l i z a t i o na n di s 印p l i e dt oa p p r o x i m a t et h eq - l e a r n i n g w ea p p l i e dt h e q l e a r n i n gb a s e do i ln e u r a ln e t w o r kt o s t a t i ca n dd y n a m i co b s t a c l e sa v o i d a n c e e x p e r i m e n t ss h o wt h a tm o b i l er o b o tc a na v o i do b s t a c l e sa u t o n o m o u s l ya f t e rl e a r n i n g ( 3 ) a sn o r m a ln e u r a ln e t w o r ks t r u c t u r es h o u l db ep r e d e f i n e db e f o r el e a r n i n ga n d c a nn o tb ec h a n g e da c c o r d i n gt ot h ei n p u ts t a t e ,g r o w i n gs e l f - o r g a n i z i n gn e u r a l n e t w o r ki sd e v e l o p e da n di su s e df o rt h ec l u s t e r i n go ft h es t a t ei n f o r m a t i o no ft h e m o b i l er o b o t r e i n f o r c e m e n tl e a r n i n gi su s e do nt h eb a s i so ft h ec l u s t e r i n g 1 1 1 e c a p a c i t yo ft h en e t w o r kc a l lb ec h a n g e da c c o r d i n gt ot h es t a t e e x p e r i m e n t ss h o w m a tt h em o b i l er o b o tc a na v o i do b s t a c l ea u t o n o m o u s l yu s i n gt h i sm e t h o d k e y w o r d sn e u r a ln e t w o r k ;m o b i l er o b o t ;a u t o n o m o u so b s t a c l ea v o i d a n c e r e i n f o r c e m e n tl e a r n i n g i i i 独创性声明 本人声明所呈交的论文是我个人在导师指导下进行的研究工作及取得的研 究成果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含其他 人已经发表或撰写过的研究成果也不包含为获得北京工业大学或其它教育机构 的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均 已在论文中作了明确的说明并表示了谢意。 签名 关于论文使用授权的说明 日期:p 砖 本人完全了解北京工业大学有关保留、使用学位论文的规定,即:学校有权 保留送交论文的复印件,允许论文被查阅和借阅:学校可以公布论文的全部或部 分内容,可以采用影印、缩印或其他复制手段保存论文。 ( 保密的论文在解密后应遵守此规定) 签名:墨l 导师签名:日期:趟:兰 第1 审绪论 1 1 引言 第l 章绪论 早在1 9 2 0 年,捷克斯洛伐克作家卡雷尔恰佩克在他的科幻小说r o s s u m u n i v e r s a lr o b o t s ) ) 中,根据r o b o t a ( 捷克文,原意为“劳役、苦工”和r o b o t n i k ( 波 兰文,原意为“工人”) ,创造出“机器人( r o b o t ) ”这个词,备受关注。机器人 常常被认为是像人一样的机器,经常出现在各种科幻电影和小说当中。 与科幻作家想象的超人机器人不同的是,现实中的机器人只是一类特殊的自 动机器,它具有与人的四肢相比拟的运动机构,可以接受视觉、听觉、触觉等传 感信息,在计算机的指挥下完成各项机械操作功能,就目前来说,机器人主要用 来代替人进行比较通用、灵巧、自主的重复性操作。机器人不仅可以把人类从条 件恶劣、繁重单调的作业中解放出来,而且在力量、精度和速度以及特殊环境下 的生存和工作能力等方面都有着优于人类的特点。机器人的应用与发展对于提高 劳动生产率、推动科技水平的提高都有着重要的意义,成为衡量一个国家科技水 平的重要标志。正因为机器人在工业等方面带来的巨大经济效益,使得机器人成 为一个富有魅力的研究领域。 近几十年来,机器人技术不断得到发展,其应用领域也越来越广泛。随着人 类要求的不断提高,希望机器人能够在人力不能及的区域完成更加复杂的任务, 例如太空探险、军事侦查、防止核化污染以及精密医疗。因此,机器人所要完成 的任务越来越复杂,从而对机器人的性能提出了更高的要求。 1 2 自主移动式机器人 随着人类在生存和工作中对机器人代为劳动的要求不断增长,自主移动式机 器人研究取得了很大发展,我们的目标就是使机器人在没有人干预、无需对环境 做出任何规定和改变的条件下,有目的地移动和完成相应的任务。本节主要介绍 自主移动式机器人的发展过程与现状,以及自主移动式机器人研究的主要内容和 发展前景。 北京工业大学t 学硕士学位论文 1 2 1 自主移动式机器人的发展 移动机器人是机器人学的一个重要分支。其中自主移动式机器人属于智能机 器人范畴,它集人工智能、智能控制、信息处理、图像处理、检测与转换等专业 技术为一体。跨计算机、自动控制、机械、电子等多重学科f 2 1 。 早在6 0 年代,就已经开始了关于移动机器人的研究。斯坦福研究院( s k i ) 的n i l s s e n 和c h a r l e sr o s e n 等人在1 9 6 6 年至1 9 7 2 年中研制出了第一台自主移动机 器人,取名叫s h a k c y 【“】,如图1 1 。其目的是研究应用人工智能技术,在复杂环 境下机器人系统的自主推理、规划和控制。与此同时,最早的操作式步行机器人 也研制成功,从而开始了机器人步行机构方面的研究,以解决机器人在不平整地 域内的运动问题,设计并研制出了多足步行机器人,其中最著名是名为g e n e r a l e l e c t r i cq u a d r u p e d t s l 的步行机器人。7 0 年代末期,随着计算机的应用和传感技术 的发展,移动机器人研究又出现了新的高潮,特别是8 0 年代中期,设计和制造机 器人的浪潮席卷世界。一大批世界著名的公司开始研制移动机器人平台,这些移 动机器人主要作为大学实验室及研究机构的移动机器人实验平台,从而促进了移 动机器人学多种研究方向的出现。9 0 年代以来,以研制高水平的环境信息传感器 和信息处理技术,高适应性的移动机器人控制技术,真实环境下的规划技术为标 志,开展了移动机器人更高层次的研究。1 9 9 6 年。美国航空航天局n a s a 研制的 活性探测移动机器k s o j o u r n e r 首次登上活性执行科学考察任务,利用移动机器人 技术进行空间探测和开发成为2 1 世纪全球各主要国家开展科技和空间资源竞争 的主要目标。为了在火星上进行长距离探险,又开始了新一代样机的研制,命名 为r o c k y 7 ,如图1 2 所示,并在l a v i c 湖的岩溶流上和干涸的湖床上进行了成功的 实验。2 0 0 3 年7 月7 曰美国的“机遇”号火星探测机器人成功升空 6 】,开始踏上去火 星找寻水和生命存在踪迹的慢慢旅途。 目前,在欧美、日本等发达国家,移动式服务机器人已广泛应用于五大领域: 医疗福利服务、商场超市服务、餐厅旅馆服务、维修清洗服务和家庭服务。 图1 - 1 机器人s h a k e y f i g u r e l - 1t h er o b o to f s h a k e y 第1 章绪论 图1 - 2 机器人r o c k y 7 f i g u r e1 - 2r o b o to f r o c k y 7 1 2 2 移动式机器人的分类 移动式机器人有不同的分类方式,移动机器人从工作环境来分,可以分为室 内移动机器人和室外移动机器人,按照移动方式来分,可以分为轮式移动机器人、 步行移动机器人、蛇形移动机器人、履带式移动机器人、爬行机器人等;按照控 制结构来分可以分为功能式结构机器人、行为式结构机器人和混合式移动机器 人;按照其功能和用途来分可以分为医疗机器人、助残机器人、清洁机器人等类 型。另外也可以按照作业空间来分类,可以分为陆地移动机器人、水下机器人、 无人飞机和空间机器人。 1 3 移动机器人避障控制结构 人类通过人的五官的视觉、听觉、味觉、嗅觉来感受外界对人体的刺激,获 取环境的信息,然后把这些信息传送到大脑,大脑根据基于这些信息的知识形成 对环境的理解,做出相应的指令,指挥人体做出相应的行为反应。自主式移动机 器人则是通过机器人所载的传感器获得周围环境的信息,它的目标就是在没有人 干预、无需对环境做任何规定和改变的情况下,有目的地完成相应的任务【7 1 。移 动机器人控制系统结构是实施避障控制的策略与方法。目前采用的避障控制结构 主要有传统的功能式( 水平式) 结构和基于行为( 垂直式) 的控制结构。 1 3 1 功能式控制结构 功能式控制结构( f u n c t i o n a lc o n t r o la r c h i t e c t u r e ) 源自基于认知的人工智能 模型,在这种模型中,智能任务由运行于符号模型纸上的推理来实现,它强调带 北京丁业大学t 学硕士学伊论文 有环境模型或地图的中央规划器是其智能不可缺少的组成部分,而且该模型必须 是准确的、一致的,因此,传感器信息的校验具有与模型本身同等的重要性。并 且传统方法遵循的是一条从感知到动作的串行功能分解控制路线,是一种典型的 自上向下构建系统的方法,如图1 3 所示。控制结构包括的阶段性功能模块有: 图i - 3 传统功能式控制结构 f i g u r e1 - 3t r a d i t i o n a lf u n c t i o n a lc o n t r o la r c h i t e c t u r e 感知模块:在该模块中,传感器转换程序负责消除来在传感器数据的噪声以 及冲突,并寻找环境中存在的目标、障碍物以及其他物体及其可能具有的特征。 建模模块:该模块接收从感知模块传来的数据,并利用这些数据来建立对外 部世界基于符号的表达方式。当然这些基于符号的表达方式包含了机器人外部世 界中所有物体的细节数据,例如几何位置或方向等等。 规划模块:规划器将上述这些机器人外部世界的描述数据进行计算操作,并 输出一系列动作来完成用户所指定的目标。 执行模块:此模块针对规划好的任务生成路店( 即子目标点) 。 电机控制模块:根据任务执行模块所生成的子目标点控制执行器以完成任 务。 现有的一般传统人工智能方法具有如下特征: 递阶结构:传统的人工智能方法以递阶的方式将主要目标分解成不同的任 务,或者子任务等等。高一层次为从属层或下面的底层提供子目标。任务以自上 而下方式完成。 顺序的处理过程:传统的人工智能方法采取顺序处理的方式,从传感器感知 到建模、规划,一直到动作执行完成。 基于符号的规划器:规划器根据自身的外部世界的符号模型来进行推理以及 规划。而外部世界的符号模型则是通过连接物理的传感器与相应的符号表达来实 现的。 第1 章绪论 按照功能模块划分:在每个不同的任务功能模块之间有清晰的细化以及区 别。控制系统的中的每个部分会负责完成相应的功能。 功能式结构以c m u ( 美国卡耐基梅隆大学) 的n a v l a b 系统【8 为典型代表。它 根据信息的流向及行为功能,将机器人的控制过程分解成不同的功能模块,这些 功能模块组成了一条闭环链,信息流由环境经由传感器进入,经规划决策处理后 再经由执行结构返回环境,从而实施控制行为。功能式结构的优点是系统结构层 次清晰、模块功能易于执行,并且比较容易实现高层次的智能行为。缺点是在系 统的每一控制行为都必须经过感知建模规划执行等各模块,延时长,时效性差, 并且还需要精确的外部世界模型;另外,由于各模块串行连接,其中任何一个模 块的故障直接影响整个系统的功能。 1 3 2 基于行为的控制结构 在1 9 世纪8 0 年代,由于机器人在处理真实环境的过程中有限的执行效果,大 量学者开始重新思考构造智能系统的一般性问题。作为第一个新的控制方法的成 功范例,b r o o k s 9 。1 1 】提出了包容式结构,如图1 4 ,这也成为一个新的领域一基 于行为( b a h a v i o r - b a s e da r c h i t e c t u r e ) 的机器人技术诞生的标志。而包容式结构也 成为解决基于行为的机器人技术的第一种方法。 协调器 一竺二! ! 兰 _ 环境 怔至j 刺激 1 习 厂二习 1 帚必州 9i 图1 - 4 包容式结构 f i g u r e l - 4s u b s u m p f i o na r c h i t e c t u r e 和传统的自上而下构造人工智能的方法不同,基于行为的技术使用了类似于 反应式机器人系统的自下而上的体系结构。反应式系统通过使用大量的事先编制 好的程序规则来提供快速的实时相应。反应式系统最大的特点就在于它可以提供 一个快速的相应,但是它没有任何形式的内部状态描述信息,因此它就是不能利 北京工、l k 大学工学硕士学位论文 用内部的对外环境的描述信息来权衡利弊或者对新的行为进行学习。而基于行为 的机器人技术却可以以一种分步描述的形式存储这些内部状态信息,因而可以在 一定程度上进行高级别的权衡各种可供选择。 基于行为的机器人技术是一种设计机器人自主代理体的一种方法。基于行为 的方法是受到生物学的启发的一种自下而上的设计方法,其中的多个行为在完成 目标的时候是并行的。行为按照一定的从输入到输出的控制规律完成执行功能。 这些行为也可以存储状态构成个分布式的代理系统【1 2 】。其基本结构所包括的所 有行为都从机器人的传感器获得输入,同时向执行器发送输出指令,如图1 5 所 示。为了使电机在每一刻获得一个命令,因此就需要一个指令协调器。 建立环境模型 搜索漫游 躲避障碍物 目标趋向 指 令 协 调 器 图1 - 5 基于行为的控制结构 f i g u r e l - 5b e h a v i o r - b a s e da r c h i t e c t u r e 单一的一个行为的内部结构包括通过传感器相互连接的不同模块,或者其它 的多种模块,最终是协调嚣。但是每个行为与行为之间必须是完全独立的。整体 的结构是一个不同行为之间相互作用的网络形式,因此其既包括底层的控制又包 括高层的权衡能力。而这种权衡能力是通过对状态的分步表达并根据所获得的信 息改变行为来实现的。 由于基于行为的机器人的全局行为是依靠多个功能单元的突现性质,所以机 器人一旦发生错误,只是系统性能有所下降而不会导致系统崩溃。b r o o k s 采用包 容式结构构造了多种机器人,这些机器人确实显示出非常强的智能行为。随后, 涌现了一批基于行为的或吸纳了包容思想的研究成果,如g a p p 】、h e r b e r t l l 4 1 、 t c a 1 5 】等。 虽然基于行为的控制方法在自主机器人控制方面体现出了良好的适应能力, 但是,目前在基于行为控制的方法在自主机器人控制的实现过程中存在着一系列 的问题,主要表现在以下几个方面【16 :( 1 ) 绝大多数的基于行为的方法的实现都 是通过人工对不同的任务进行手工编程的。这就要求编程人员能充分地考虑到控 第1 章绪论 制过程中可能出现的各种情况,要求设计人员对机器人与环境之间的交互有充分 的理解。虽然按照这样的设计方法设计出来的系统对于很多任务和环境而言性能 都是鲁棒的,但系统对环境并不具有适应性。( 2 1 人的能力是有限的。很多知识 是很难通过人的力量来赋予机器人的,比如构建个未知环境的地图等等。( 3 ) 机 器人传感和执行机构是会出现一定偏差的,这个对于事先设定好的学习策略来说 也是不利的。 如何克服这些缺点,将基于行为的控制方法更好的应用到机器人控制中,成 为亟待解决的问题。因此有必要在基于行为方法中引入一种学习算法来提高移动 机器人的自适应性。 1 4 本论文的研究内容和组织结构 本课题主要针对移动机器人自主避障做了一些研究。自主避障是移动机器人 领域的一个热点问题,提高移动机器人的自学习能力实现其自主避障是该领域的 必然选择。本课题的研究内容主要分为以下三个部分: ( i ) 在基于行为控制结构的基础上,设计了一种智能控制结构,该结构中引 入了强化学习模块,可以实现移动机器人的自主学习功能,克服了纯粹基于行为 控制结构自学习能力差、编程繁杂的不足。 ( 2 ) 利用神经网络实现q 学习,解决了表格q 学习应用范围小、占用存储空间 大的问题,并把其分别应用到移动机器人的静态和动态避障中,实现了移动机器 人的自主避障。 ( 3 ) 提出了一种增长型自组织神经网络,并用其来实现对移动机器人外部环 境的聚类,克服了传统的神经网络需事先确定其规模结构的不足。在此基础上利 用强化学习实现了对移动机器人的控制。实验证明,该方法能够有效地实现移动 机器人自主避障。 本论文的组织结构如下: 第一章主要阐述了移动机器人的发展历程,并介绍了移动机器人避障的方 法,在此基础上总结了移动机器人的控制结构,即传统的基于模型的机器人控制 结构和基于行为的控制结构。针对现有避障方法存在的不足,阐述了移动机器人 避障的发展趋势,确定了研究的方向。 第二章主要介绍了移动机器人结构和两轮驱动移动机器人运动学模型,并介 绍了m o b o t s i m 实验仿真平台。 第三章主要介绍了强化学习理论及算法,详细阐述了强化学习的基本原理和 模型,分析了强化学习的特点,给出了强化学习的组成要素。在此基础上讨论了 强化学习的几种主要算法,并针对本文需要详细介绍y q 学习算法的特性。 北京1 = 业大学= r = 掌硕十学位论文 第四章首先根据纯粹的基于行为的控制结构缺少自学习能力不足之处,在基 于行为控制结构基础上结合强化学习算法,设计了具有学习能力的智能控制结 构,并详细介绍了控制结构各个组成部分。针对表格式q 学习在连续空间中应用 所存在的问题,利用神经网络来实现q 学习并把其应用到静态和动态避障中。最 后通过仿真实验验证了方法的可行性。 第五章针对一般神经网络需要实现确定网络结构和规模,不能根据实际情况 自主改变,结合自组织神经网络的特点,提出了增长型自组织神经网络并利用其 良好的拓扑能力实现对移动机器人状态的分类,并在此基础上利用强化学习来根 据当前状态选择最佳的动作。最后通过实验验证了该方法的有效性。 最后对全文进行了总结,并提出今后在本研究方向进一步进行研究工作的展 望和设想。 第2 章移动机器人 第2 章移动机器人 我们实现移动机器人自主避障,首先需要对实验对象的结构和功能有一定的 了解,即移动机器人有什么系统装置组成,每个装置的结构以及功能是怎样的。 只有在此基础上,才能有针对性地选用合适的控制算法进行避障实验。本文的实 验是针对先锋机器人的结构进行仿真设计的的,因此有必要对先锋移动机器人系 统和实验仿真平台作一介绍。 2 1 先锋机器人 先锋机器人是一种典型的移动机器人实验平台,它内部继承了智能移动机器 人技术,可以实现对控制算法的验证。p o i n e e r 3 d x 型机器人配备随车的p c 计 算机,使其成为一个完全自治的智能移动机器人系统,如图2 1 所示。p o m e e r 3 d x 型机器人较大多数机器人体积小,可以使其可以在狭小的复杂环境中行驶自如, 例如教室、实验室以及小型办公室等。 图2 - 1 先锋i i i d x 移动机器人 f i g u r e 2 - - 1p o i n e e r 3 - d xm o b i l er o b o t 北京工业大学工学硕士学位论文 2 1 1 本体结构 先锋机器人由以下几个主要的部分构成:顶板;紧急停车按钮:用户控制面 板:车身、鼻和附件面板;声纳环:电机、车轮及编码器;电源、电池等,其本 体结构布局如图2 2 所示。 图2 - 2 先锋i i i d x 本体结构图 f i g u r e2 - 2s t r u c t u r eo f p o i n e e r 3 一d x 顶板顶板由简单的平板构成,可以方便的打开来了解内部的组件。另外可 以在上面搭建各种附件,如摄像头、激光测距仪等。 紧急停车按钮在先锋i 机器人的顶板后方装有紧急停车按钮,可以在紧 急情况下使电机迅速掉电停车,避免发生危险。 用户控制面板通过用户控制面板可以直接对机器人微控制器进行操作。控 制面板有控制键、指示灯、r s 2 3 2 兼容串行口( d b 一9 针接口) 。 声纳环基于a r c o s 的m o b i l e r o b o t s 机器人最多可以支持4 个声纳环,每 个环最多有8 个换能器,可以用于物体检测、距离检测和自动避障,面貌识别、 定位以及导航,扫描频率为2 5 h z 。所有p o i n e e r 3 系列机型上的声纳环位置都是 固定的:两侧各有一个,另外6 个以2 0 度间隔分布在前后侧边。这种声纳阵的 布置可以为机器人提供3 6 0 度无缝检测。 前 围i 1 j j 7 ,p 一0 图2 3 移动机器人声纳传感器分布 f i g u r e2 - 3s o n a ra r r a yo f m o b i l er o b o t 一1 0 第2 苹移动机器人 电机、车轮及编码器p i o n e e r 3 机器人采用了高速、高转矩、可逆转直流电 机,每个电机都装有高分辩率光学编码器,可以用来精确定位、速度测量以及更 先进的计算。般具有两个驱动轮和一个从动轮,通过调节驱动轮的速度来实现 移动机器人的前进、转向等功能,从动轮的作用是保持移动机器人的平衡,起到 支撑作用。 2 + 1 2 控制系统结构 先锋i i i 系列机器人控制系统采用上下两层的控制结构,如图2 4 所示。其 中,h 8 s 微控制器作为底层的控制以及机器人本身传感器的数据采集处理器,其 结构如图2 - 5 所示;车载计算机作为数据的信息处理器以及附件的扩展平台。 图2 _ 4 先锋i 系列机器人控制系统图 f i g u r e 2 4c o n t r o ls y s t e ms t r u c t u r eo f p i o n e e r 3 车载工控机通过自身的c o m l 口与h 8 s 上的a c o s 进行通讯。彼此之间的 指令和数据信息都通过a r i a 结构进行封装,构成了一套完全封装好的通讯和控 制对象,做到了软件的硬件无关性。 同时,车载计算机所做的工作是数据和控制指令的处理和封装;h 8 s 做的工 作是解释指令,数据的采集和封装。任务合理的分配给了两个处理器,这样提高 了整体控制系统的运算效率以及稳定性。 北京工、i k 大学丁学硕十学位论文 露舟 l - l j 口丑l ! 些! ! ! ! ! ! 魑 2 3 二| 降粤口6l 厂 l 妒掣 , 4 sona拶r耐r-l霉雩l_i a u xs e r i a l ;: u uier1 o g r p | j r l | 、i 、i is 卧删r l a s h u vu 兀1r 甚圈。口 , , i i lm ”i l j “o s t s e r i a i 图2 - 5 h 8 s 控制器结构 f i g u r e 2 5h 8 sm i c r o c o n t r o l l e r 2 2 移动机器人运动学模型 图2 - 6 所示为独立两轮驱动型移动机器人模型。设两个车轮的旋转速度分别 为q 和q ,车轮直径为,轮距为。相对于固定坐标系,用移动机构的代表点, 即两个车轮的中心点p 的坐标x ,y ,臼来描述车体的位置和姿态,则与速度有关的 正运动学可以表示为 | = c o s 目 s i n 口 l l c g ) s 臼 s i n 口 1 ( 2 - 1 ) 凼向,布h 对十固足坐杯糸日可位置丰口姿态口j 以遇辽将上述愿度天系瓦枞分求得 口= 岛+ 手f ,( or w,)dt(2-2) 工= + ;f c 。s 占( q + w t ) d t ( 2 - 3 ) y = 胪导f s i n 目( q + w t ) d t ( 2 4 ) 式中,岛,x o ,为t = 0 式的位置和姿态。为了通过这些式子具体计算轨迹,需要 知道两轮的速度以和的时间序列数据,然后进行数值积分。 第2 章移动机器人 i y 图2 - 6 移动机器人运动学模型 f i g u r e2 - 6k i n e m a t i cm o d e lo f m o b i l er o b o t 独立两轮驱动型移动机构模型的逆运动学模型可以根据正运动学的基本公 式,设车体移动速度五y ,臼给定,利用下式可以求出驱动器速度q 和q 。 u = 葺2 + 岁2( 2 5 ) 2 u + 正口 c o r 2 l ; ( 2 石) 2 f ,一毋 q 2 - = 1 ( 2 7 ) 式中,d 为两车轮中点p 的平均速度,为轮距。 2 3 仿真平台 本节主要介绍一下实验仿真平台m o b o t s i m ( m o b i l er o b o ts i m u l a t o r ) ,如图 2 7 所示。这是一款w i n d o w s 下的2 d 动态移动机器人仿真软件,它能够较好地 依照所设计移动机器人的驱动原理,任意改变环境,较逼真地模拟了其在未知环 境中的工作、搜寻目标的过程。m o b o t s i m 软件提供了一个b a s i c 编辑器,可以 利用软件内部提供的一些特定函数来获取机器人的外部环境信息以及机器人的 位置坐标等,并赋给移动机器人驱动速度,从而可以实现移动机器人在环境中运 动。其中该软件的二次开发软件为s a xb a s i c ,它是以b a s i c 语言为基础的一种语 言,可以编写出友好的界面,集数据备份、统计分析和图表生成为一体的使用程 序,使重复性的工作得以快速、高效地完成。 m o b o t s i m 有如下特点:可以提供无限制数量的移动机器人和障碍物,并且 障碍物的形状可以随意设置,例如线形、矩形、圆形、弧形、椭圆形等等,并可 以随意无规则地绘制其它障碍物;传感器的测量范围可以根据不同的需要任意配 北京t 业大学工学硕十学位论文 置;移动机器人平台可以灵活设置,包括平台直径、驱动轮直径、驱动轮之间的 距离、传感器的数量以及传感器之间的夹角;传感器环可以根据实际情况进行配 置,包括传感器环半径、传感器测量范围以及错误率等;提供为仿真快速简单开 发的b a s i c 宏,兼容完整的v i s u a lb a s i c 语言:控制程序可以顺序执行,并可以 设置断点来分步执行;可以方便融合第三方程序,如d l l 文件,并可以方便利 用模糊控制、遗传算法、神经网络等。 图2 7m o b o t s i m 仿真平台 f i g u r e 2 - 7m o b o t s i ms i m u l a t o r m o b o t s i m 仿真平台是专门为研究者、 设计,可以用作自主移动机器人导航技术、 器数据融合等研究课题。 2 4 本章小结 学生、机器人专家以及机器人爱好者 避障、人工智能、人工生命以及传感 本章对移动机器人的本体结构作了介绍,并分析了两轮驱动移动的机器人的 运动学模型。另外介绍了本文在实验部分所应用到的仿真平台软件m o b o t s l m , 此软件可以很方便地根据需要设定移动机器人的构成和不同形状的障碍物,为实 验提供了方便。 第3 奄强化学习珲论及苴锋法 第3 章强化学习理论及其算法 3 1 强化学习原理 强化学习( r e i n f o r c e m e n tl e a r n i n g ) ,又称为再励学习或者增强学习,是一 种重要的机器学习方法。观察生物( 特别是人) 为适应环境的学习过程可以发现 它有两个特点,一是人从来不是静止地被动等待,而是主动对环境作试探,二是 从环境对试探的反馈信号来看,多数情况下是评价性的( 奖励或者惩罚) ,而不 是像监督学习那样给出正确答案。生物在行动评价的环境中获得知识,改进行 动方案以适应环境达到预想的目的,这就是强化学习。 3 1 1 强化学习的基本原理和模型 强化学习的基本原理是:如果智能体的某个行为策略导致环境对智能体正的 奖赏( r e w a r d ) ,那么智能体以后采取这个行为策略的趋势就会加强。w a t k i n s 1 。7 】 指出,智能体为适应环境而采取的学习如果具有如下特征,则成为强化学习:智 能体不是静止地被动等待,而是主动对环境做出试探,即: ( 1 ) 环境对试探动作反馈的信息是评价性的( 好或坏) ( 2 ) 智能体在行动评价的环境中获得知识,改进行动方案以适应环境,以达 到预期目的。 强化学习是一种不同于监督学习和非监督学习方法的在线学习技术,其基本 模型如图3 1 所示。它把学习看作是一个试探评价的过程,首先强化学习系统( 一 般是一个智能体) 感知环境状态,采取某一个动作作用于环境;环境接受该动作 后,状态发生变化,同时给出一个强化信号( 奖励或者惩罚) 反馈给强化学习系 统,强化学习系统根据强化信号和环境当前状态,再选择下一个动作,选择的原 则是使收到正强化信号( 奖励) 的概率增大。选择的动作不仅影响立即强化值, 而且影响下一刻的状态及最终的强化值。 北京丁业大学工学硕士学位论文 图3 - i 强化学习原理 f i g u r e3 - 1p r i n c i p l eo f r e i n f o r c e m e n tl e a r n i n g 强化学习的理论基础是马尔可夫决策过程( m a r k o vd e c i s i o np r o c e s s ,m d p ) , 它可以用一个4 元组( s ,a ,t ,r ) 来表示,其中s 表示有限的环境状态集,a 为 对应每一状态可能的有限动作集,r 表示从状态动作到另一状态的转换函数, t :s a 斗s ;r 为状态一动作对的强化函数,一般返回一个实数强化值, r :e p a 斗r ) 。如果已知环境的状态模型,即在状态s 下执行动作口,环境转 移到状态s 的概率p ( s j s , a ) ,则状态s 下,值函数应该满足贝尔曼方程: 矿0 ) = m a x q ( s ,口) 1 q ( 邓) = r ( s ,) + y 耶1 b a ) z ( s 3 【j - 1 j l 。; 式中,q ( s ,a ) 表示动作的值函数,r ( s ,a ) 为状态一动作对( s ,a ) 的立即奖赏值, ,为累计奖赏折扣因子。 己知p ( j s ,口) 的情况下,可以采用动态规划( d y n a m i cp r o g r a m m i n g ,d p ) 方法通过求解贝尔曼方程来迭代计算出最优策略。 智能体在和环境交互时,在每一刻会发生如下时间序列: ( 1 ) 智能体感知当前的环境状态; ( 2 ) 针对当前的状态和强化信息,智能体选择一个动作: ( 3 ) 当智能体所选择的动作作用于环境时,智能体所处环境发生变化,即环 境状态转移至一新状态,并给出一个奖赏也即强化信号r ; ( 4 ) 奖赏信号r 反馈给智能体。 3 1 2 强化学习特点 在连接主义中,把学习算法分为三种类型,即监督学习( u n s u p e r v i s e d l e a r n i n g ) 、监督学习( s u p e r v i s e dl e a r n i n g ) 和强化学习。 非监督学习在生理上就是p a v l o v 的条件反射原理,当用一个毫无意义的刺 激信号( 如铃的响声) 同时伴有另一个刺激信号( 如食物) 反复加给动物的时候, 第3 牵强化学习理论及其算法 曼皇兰曼寡曼皇量皇皇曼鼍! 曼量曼皇量皇鼍gg!ww i ! 曼笪曼! 曼! 曼曼曼! 皇皇曼曼! ! ! ! 鼍曼曼量皇皇! 兰量曼曼曼! 曼曼曼鼍 经过一段时间的训练后,就会建立一种联想或相关规则。当在接受到刺激信号时, 就会产生条件反射。这种类型的学习完全是开环的。 监督学习( 如图3 2 ) 是一种反馈学习规则。当输入信号作用于系统后,观 察其输出,由教师提供理想的输出信号,利用所产生的误差信号反馈给系统来指 导学习。 图3 - 2 监督学习 f i g u r e3 - 2s u p e r v i s e dl e a r n i n g 强化学习是智能体系统从环境到行为映射的学习,以使奖励信号( 也即强化 信号) 函数值最大。强化学习不同于监督学习,主要表现在教师信号上,强化学 习中由环境产生的强化信号是对产生的动作好坏的种评价( 通常为标量信号) 而不是告诉强化学习系统如何去产生正确的动作。因外部环境提供的信息很少, 强化学习系统必须依靠自身的经历进行学习,在学习评价的环境中获得知识, 改进行动方案以适应环境。强化学习具有如下的特点: ( 1 ) 强化学习是一种弱的学习方式,体现为:智能体通过与环境进行不断的 试错交互来进行学习;强化信息可能是稀疏且合理延迟的;不要求( 或要求很少) 先验知识;智能体在学习中所使用的反馈是一种标量奖赏的形式,不要求提供正 确答案的教师。 ( 2 ) 强化学习基本上是一种增量式的学习方法,并可以在线使用。 ( 3 ) 强化学习可以应用于不确定的环境。 ( 4 ) 强化学习的体系结构是可扩展的。目前,强化学习系统已经扩展至规划 的合并、智能搜索、监控学习和结构控制等领域。 3 2 强化学习系统的组成要素 除了智能体和环境,一个强化学习系统还有四个组成要素 1 8 - 2 0 】:策略 ( p o l i c y ) 、奖赏函数( r e w a r df u n c t i o n ) 、值i n 数( v a l u ef u n “o n ) 以及环境的模型 ( m o d e lo f t h ee n v i r o n m e n t ) ( 非必需) 。 ( 1 ) 策略( p o l i c y ) 智能体的任务是产生控制的动作,动作的选择是根据其策略的。一般而言, 北京工业大学下学硕十学位论文 策略是指智能体在一个给定时间产生动作的方法。 描述针对状态集合s 中的每一个状态s ,智能体应完成动作集a 中的一个动 作a ,策略石= s 斗a 是从一个状态到动作的映射。 关于任意状态所能选择的策略组成的集合f ,成为允许策略集合石= f 。在 允许策略集合中找出使问题具有最优效果的策略丌,成为最优策略。 一定程度上,策略是强化学习智能体的核心,因为策略充分决定了智能体的 行为,即告诉智能体在什情况下采取什么动作( w h a t t od o ) 。一般来说,策略也 是可以随机的。 ( 2 ) 奖赏函数( r e w a r df u n c t i o n ) 奖赏函数决定了强化学习问题中的目标。它是由状态( 或状态一动作对) 到 一个奖赏信号的映射,可记为r ( s ) 或r ( s ,4 ) 。奖赏信号r 是产生的动作的好坏作 一种评价,奖赏信号通常是一个标量。强化学习的目的就是使智能体最终得到的 总的奖赏值达到最大。奖赏函数往往是确定的、客观的,为策略的选择提供依据, 即告诉智能体选择什么动作是好的( w h a ti sg o o d ) 。 ( 3 ) 值函数( v a l u ef u n c t i o n ) 奖赏函

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论