版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于行为克隆与强化学习的智能驾驶技能本发明提供基于行为克隆与强化学习的智率性和舒适性指标均达到预设阈值时,训练完2采集人类驾驶员在预设驾驶场景中的驾驶行为数据,所述驾驶行为数据根据所述初始性能评估结果确定待优化的驾驶技能指标,所述在所述虚拟训练环境中构建测试场景集合,所述测试场景景中未参与训练的场景;将所述优化后的驾驶模型部署至所述测试场景集合中进行测试,将所述驾驶行为数据按照场景类型进行分层,所述场景类型包括对所述训练数据子集中的所述环境感知信息进行特征提取预处理的三维网格特征,将前向视觉图像通过关键区域提取和空间金字塔池化转换为特征向量,基于监督学习方法构建初始驾驶模型,所述初始驾驶模型包括特征模模块和控制输出模块,所述特征提取模块采用三维卷积神经网络处理所述三维网格特将所述输入特征作为输入,将所述输出标签作为训练目标,采用多3将所述验证数据子集输入训练后的所述初始驾驶模型进行性能评中设置与所述驾驶技能指标对应的多样化训练场景;根据所述驾驶技能指标设计奖励函所述驾驶技能指标包括安全性指标、效率性指标和舒适性指标,所基于所述驾驶技能指标构建虚拟训练环境,在所述虚拟训练环采集所述虚拟训练环境中的传感器数据,所述传感器数据包括激根据所述驾驶技能指标设计层次化奖励函数,所述层次化奖励函对所述安全性得分、所述效率性得分和所述舒适性得分设置对应的自适应权重系数,别与对应的所述自适应权重系数相乘后求和得到总将所述初始驾驶模型作为强化学习智能体的策略网络,所述在所述虚拟训练环境中采用深度强化学习算法训练所述策略网根据即时奖励构建经验回放池,从所述经验回放池中采4在训练过程中向所述策略网络输出的动作添加在测试场景中评估所述策略网络的性能,当所述安全性舒适性得分连续多个回合超过预设策略阈值时,将当前的所述策略网络的参数进行优化,5.根据权利要求3所述的方法,其特征在于,在所述虚拟训练环境中构建测试场景集在所述虚拟训练环境中构建测试场景集合,所述测试场景计算所述安全性指标,将所述安全性指标的所述最小时距小于两秒记为一次危险事计算每段测试路径的理论最短通行时间,将所述效率性指计算所述舒适性指标,对所述舒适性指标中的所述纵所述预设测试阈值包括危险事件发生频率阈值、车道偏离距离阈值、基于所述场景特征向量对不同场景进行相似度计算,将相似度构建多层级经验回放缓冲池,所述多层级经验回放缓5将所述场景族群数据按照性能不达标指标所属层次分别存入对应的所述多层级经验基于所述层内优先级和所述层间优先级从所述多层级经验回放缓冲池中采样训练样各层性能指标与对应阈值的差值动态调整不同层次的训练构建层次化强化学习架构,基于所述训练样本对所7.基于行为克隆与强化学习的智能驾驶技能训练系统,用于实现前述权利要求1_6中第一单元,用于采集人类驾驶员在预设驾驶场景中的驾第二单元,用于根据所述初始性能评估结果确定待优化的第三单元,用于在所述虚拟训练环境中构建测试场景集合,其中,所述处理器被配置为调用所述存储器存储的指令,以执行6序指令被处理器执行时实现权利要求1至678将所述驾驶行为数据按照场景类型进行分层,所述场景类型包括直道驾驶场景、对所述训练数据子集中的所述环境感知信息进行特征提取预处理得到输入特征,9述效率性指标将所述平均行驶速度与目标速度的偏差及所述通行时间转换为效率性得分,分别与对应的所述自适应权重系数相乘后求和将所述场景族群数据按照性能不达标指标所属层次分别存入对应的所述多层级基于所述层内优先级和所述层间优先级从所述多层级经验回放缓冲池中采样训基于各层性能指标与对应阈值的差值动态调整不同层次的[0018]图1为本发明实施例基于行为克隆与强化学习的智能驾驶技能训练方法的流程示图2为本发明实施例基于行为克隆与强化学习的智能驾驶技能训练系统的结构示[0021]图1为本发明实施例基于行为克隆与强化学习的智能驾驶技能训练方法的流程示环境感知信息和控制指令信息;将所述驾驶行为数据划分为训练数据子集和验证数据子标均与预设测试阈值额比较结果满足预设条件时,确认所述优化后的驾驶模型训练完成;[0022]在一种可选的实施方式中,将所述驾驶行为数据划将所述驾驶行为数据按照场景类型进行分层,所述场景类型包括直道驾驶场景、对所述训练数据子集中的所述环境感知信息进行特征提取预处理得到输入特征,保证模型的泛化能力,将每种场景类型的数据按照8:2的比例随机划分为训练数据子集和[0030]在一种可选的实施方式中,构建虚拟训练环述效率性指标将所述平均行驶速度与目标速度的偏差及所述通行时间转换为效率性得分,分别与对应的所述自适应权重系数相乘后求和提升训练效率:通过构建多样化的虚拟训练场景和层次化的奖励函数,可以更有[0038]在一种可选的实施方式中,在所述虚拟论最短通行时间为100秒,实际任务完成时间为120秒,则任务完成时间比值为120/100=设定危险事件发生频率阈值为5%,车道偏离距离阈值为0.5米,平均行驶速度阈值为40公[0049]在一种可选的实施方式中,当所述测试性能数据中将所述场景族群数据按照性能不达标指标所属层次分别存入对应的所述多层级基于所述层内优先级和所述层间优先级从所述多层级经验回放缓冲池中采样训基于各层性能指标与对应阈值的差值动态调整不同层次的[0058]根据各层性能指标与对应阈值的差值为训练样本分配层内优先级和层间优先应的测试性能数据连续多次高于预设测试阈值时,将该场景族群从对应的缓冲池中移除。[0061]基于训练样本对层次化强化学习架构中性能不达标层次的网络进行针对性训
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年剖宫产术后伤口护理试题
- 2025年民政局区划地名勘界岗笔试试题及答案
- 骨折后遗症中医理疗探讨
- 预防癌症的膳食指南专家讲座
- 重度子痫前期术后护理措施-20251012-225702
- 白象家族填空考试试题及答案
- 2026中国新型显示材料市场供需分析及投资风险评估报告
- 2026中国智能机器人行业发展趋势与政策评估分析报告
- 2026年电气机械3D打印材料性能研究
- 2026年网络文学内容审核的AI技术实践
- 山东中医药大学学位考试-中医学毕业综合考试试题及参考答案
- 《中国古代兵器演变》课件
- 合肥鼎材科技有限公司光阻车间光刻胶生产线技术改造项目环评报告书
- 信息科技开学第一课课件 哪吒 人工智能 机器人 信息科技
- 社会问题(第三版)课件汇 向德平 第1-7章 社会问题概述 - 人口问题
- 彩钢板房施工方案范文
- (高清版)DB22∕T 1560-2012 农作物种植成本保险查勘定损技术规范总则
- 2025年营养师食品安全及营养健康职业技能及理论资格知识考试题库(附含答案)
- 《第2课 立在地球边上放号》课件 统编版高中语文必修上册
- 郑州财税金融职业学院招聘真题
- 急性胃炎临床路径(2017年县医院适用版)
评论
0/150
提交评论