CN119417671A 基于强化学习的智驾场景自适应教学方法及系统 (易显智能科技有限责任公司)_第1页
CN119417671A 基于强化学习的智驾场景自适应教学方法及系统 (易显智能科技有限责任公司)_第2页
CN119417671A 基于强化学习的智驾场景自适应教学方法及系统 (易显智能科技有限责任公司)_第3页
CN119417671A 基于强化学习的智驾场景自适应教学方法及系统 (易显智能科技有限责任公司)_第4页
CN119417671A 基于强化学习的智驾场景自适应教学方法及系统 (易显智能科技有限责任公司)_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于强化学习的智驾场景自适应教学方法本发明提供基于强化学习的智驾场景自适史数据进行场景分类,生成带标签的训练样本驶场景提供个性化教学,提高驾驶员的驾驶技2通过车载传感器实时采集智能驾驶数据,所述智能驾驶数据包括车练的智能驾驶决策模型中选择对应的模型作为当将所述智能驾驶数据输入所述当前决策模型,得到标准驾根据车辆绝对速度与预设参考速度的比值确定时间窗口长度,所将所述增强特征向量输入基于双向长短时记忆网络构建的场景识别对所述融合隐层状态进行多头自注意力计算得到注意力特征;将所述融基于所述智能驾驶历史数据构建车辆状态特征向量、环境状3控制动作空间与所述纵向控制动作空间组合形计算最小避障距离得到碰撞风险评估值,计算转向变化量与加获取场景类型编码与场景属性向量,将所述场景类型编码与所述将所述场景条件嵌入向量输入价值网络得到状态价值估计;计算所述状态价值估计与目标价值的均方误差得到价构建双重价值网络,将场景条件嵌入向量分别输入状态价值估计值中的最小值作为状态价值估计结果;计算n步累积奖励与目标状态价值的计算即时奖励与目标状态价值的折扣和与当前状态价根据所述更新后优先级计算采样概率分布;基于所述采样概率分布计算重要性权重;4计算驾驶员实际位置与标准位置的欧式距离得到位置偏差值,计算所述综合行为偏差值的均值与标准差;根据所述均值与标准差构建风险评估区7.基于强化学习的智驾场景自适应教学系统,用于实现如权利要求1_6中任一项所述第二单元,用于通过车载传感器实时采集智能驾驶数据,所述场景类型从预训练的智能驾驶决策模型中选择对应的模型驾驶指导信息的反馈结果用于更新所述当前决策模5其中,所述处理器被配置为调用所述存储器存储的指令,以执行序指令被处理器执行时实现权利要求1至66许多研究集中在开发能够模仿甚至超越人类驾驶员在各种场景下的驾驶能力的自动驾驶通过车载传感器实时采集智能驾驶数据,所述智能驾驶数据包括车辆位置信息、预训练的智能驾驶决策模型中选择对应的模型作为当7化特征向量进行滑动分段,计算每个时间窗口内归一化特征向量的差分特征和统计特征,转向控制动作空间与所述纵向控制动作空间组合形成8构建双重价值网络,将场景条件嵌入向量分别输入第一价值网络与第二价值网述第二状态价值估计值中的最小值作为状态价值估计结果;计算n步累积奖励与目标状态计算即时奖励与目标状态价值的折扣和与当前状态价值之差得到时序差分误差;偏差值,计算驾驶员实际纵向控制量与标准纵向控制量的绝对差值得到纵向控制偏差值;9所述反馈时机与反馈强度对所述驾驶指导建议进行输出述场景类型从预训练的智能驾驶决策模型中选择对应的模型作为当前所述驾驶指导信息的反馈结果用于更新所述当前决策模型[0020]图1为本发明实施例基于强化学习的智驾场景自适应教学方法的流程示意图,如S102.通过车载传感器实时采集智能驾驶数据,所述智能驾驶数据包括车辆位置类型从预训练的智能驾驶决策模型中选择对应的模型作为当前指导信息的反馈结果用于更新所述当前决策模[0021]在一种可选的实施方式中,基于每个所述场景识别化特征向量进行滑动分段,计算每个时间窗口内归一化特征向量的差分特征和统计特征,[0033]在一种可选的实施方式中,将所述带场景标签的训转向控制动作空间与所述纵向控制动作空间组合形成[0034]智能驾驶决策模型训练方法,旨在提升智能驾驶系统在不同场景下的决策能置和速度用相对于自车的坐标和速度表示。将驾驶员操作信息转换为驾驶状态特征向量,[0046]在一种可选的实施方式中,将所述带场景标签的训[0054]基于状态价值估计计算时序差分误差。时序差分误差用于衡量当前策略的优[0061]在一种可选的实施方式中,将所述场景条件嵌入向构建双重价值网络,将场景条件嵌入向量分别输入第一价值网络与第二价值网述第二状态价值估计值中的最小值作为状态价值估计结果;计算n步累积奖励与目标状态计算即时奖励与目标状态价值的折扣和与当前状态价值之差得到时序差分误差;得到两个状态价值估计值。选择两个估计值中较小的一个作为最终的状态价值估计结果,积奖励和折扣后的目标状态价值相加,得到n步回报值。为了更全面地利用不同步长的信计算所有样本的时序差分误差的均值和标准差,然后用每个样本的时序差分误差减去均。[0070]2.增强算法稳定性:双重价值[0072]在一种可选的实施方式中,将所述智能驾偏差值,计算驾驶员实际纵向控制量与标准纵向控制量的绝对差值得到纵向控制偏差值;所述反馈时机与反馈强度对所述驾驶指导建议进行输出[0073]为了提升驾驶员的驾驶技能,本方案提供了一种智能驾计算综合行为偏差值的平均值和标准差。根据平均值和标准差构建风险评估区自对综合行为偏差值的贡献度,选取贡献度最大的偏差类型作为当前时刻的主要偏差原[0088]图2为本发明实施例基于强化学习的智驾场景自

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论