智能车辆设计与控制基础课件:智能车辆决策系统与设计_第1页
智能车辆设计与控制基础课件:智能车辆决策系统与设计_第2页
智能车辆设计与控制基础课件:智能车辆决策系统与设计_第3页
智能车辆设计与控制基础课件:智能车辆决策系统与设计_第4页
智能车辆设计与控制基础课件:智能车辆决策系统与设计_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

智能车辆决策系统与设计智能车辆决策系统概述与分类决策系统是智能车辆的“大脑”,是智能车辆智能化水平的核心体现。5.2智能车辆决策系统概述与分类目前的两种主流决策框架——分解式决策框架和集中式决策框架。智能车辆决策系统功能决策系统的功能在于制定驾驶行为策略:如跟车、换道、超车、停车、转弯、掉头等。同时计算未来一段时间内的平滑、安全路径。5.2智能车辆决策系统功能与难点多层次人类智能增强的自动驾驶车辆决策控制方法及系统智能车辆决策的四大挑战随机性:交通参与者意图难测5.2智能车辆决策系统功能与难点动态性:交通环境实时变化复杂性:多样化参与者和规则增加难度博弈性:与其他车辆交互需权衡冲突分解式决策框架详解分解式决策框架通常将决策过程分解为若干独立的子任务。5.3智能车辆分解式决策方法设计优势在于降低了决策过程中的累计误差,提高了可解释性,可以针对处理环境中的不确定因素。分解式决策框架集中式决策框架详解集中式决策框架的核心是建立一个参数模型,由输入直接生成输出。5.3智能车辆分解式决策方法设计优势在于响应速度快,适合低复杂度场景。集中式决策方案目标运动预测概述5.3目标运动预测方法目标运动预测的目的是为智能车辆决策系统提供及时、准确的环境动态信息。其关键挑战包括目标运动的不确定性以及预测实时性和准确性等。自车对周围车辆的运动预测场景目标运动预测基于物理模型的传统预测方法5.3目标运动预测方法其适用于换道、转弯等规律性场景,但面对复杂场景预测精度不足。基于物理模型的预测方法是基于目标实体的动力学及运动学特性,如速度、加速度和运动方向,采用物理学的基本原理建立数学模型。二自由度车辆的运动学模型基于概率模型的目标轨迹预测方法基于概率模型的目标轨迹预测方法是一种通过概率统计的原理来建模和预测运动目标未来轨迹的可能性的方法。5.3目标运动预测方法优势在于可以提供概率分布,能够平衡实时性与准确性。基于深度学习的轨迹预测方法5.3目标运动预测方法基于深度学习的目标轨迹预测方法是一种利用神经网络等深度学习模型,实现对未来目标轨迹预测的技术。其优势在于适应复杂动态场景挑战,但需大量训练数据。基于深度学习的目标轨迹预测模型编码器-解码器结构,其包含编码器、卷积池化、解码器三个模块,三者共同组合形成了一个图结构,具备适应复杂轨迹模式和动态场景的能力。这种图模型的架构设计旨在充分发挥深度神经网络的强大建模能力,通过这些关键组件的协同作用,实现对目标轨迹数据的高效表示、特征提取和准确预测。轨迹预测算法基于规则的行为决策方法FSM系统四大要素:状态、事件、转移条件、动作该方法具有结构简单、可解释性强等特点5.3.2驾驶行为决策方法基于规则的行为决策方法指根据大量交通法规、驾驶经验和驾驶知识构建的规则库,并考虑自动驾驶车辆所处不同状态来进行决策,主要代表为有限状态机(FSM)方法FSM系统高速路上自动驾驶行为决策有限状态机车辆根据当前环境选择合适的驾驶行为,如停车、跟车、换道、超车、并道、避让、缓慢行驶等,状态机模型通过构建有限的有向连通图来描述不同的驾驶状态以及状态之间的转移关系,从而根据驾驶状态的迁移反应生成驾驶动作决策。基于概率的行为决策方法是指考虑环境中不确定性并使用概率模型来指导自动驾驶车辆进行最优决策的方法,其主要代表有马尔可夫决策过程(MDP)。基于概率的行为决策方法

马尔可夫决策过程对系统进行建模描述:

优化目标是最大化从当前时间点开始到未来的累计奖励:最优收益的目标函数通常可用动态规划方法求解:

5.3.2驾驶行为决策方法基于博弈论的行为决策方法是指自动驾驶车辆在与其他车辆、行人等交通参与者交互时,使用博弈论原理来制定最优策略的方法。基于博弈论的行为决策方法博弈问题的构成要素:参与者:TV、RV2策略集:TV换道或保持原车道,RV2减速避让或加速阻止收益:可由安全(距离)收益和速度(时间)收益组成,构建博弈收益矩阵求解最高收益所对应策略即为最优策略策略RV2让行RV2不让行TV换道TV不换道自由换道场景示意图TV与RV2博弈收益矩阵5.3.2驾驶行为决策方法基于图搜索的规划方法的基本思想是采用单元分解法或者道路图法建立环境模型,通过遍历环境地图的方式,获得从起点到终点的最优路径。基于图搜索的路径规划方法Dijkstra算法A*算法Dijkstra算法是一种广度优先搜索算法,通过一个距离数组记录每个节点到起始节点的最短距离初始化选择节点更新距离重复与终止A*算法一种启发式搜索算法,利用估计函数来评估节点的优先级,选择具有最低估计值的节点进行搜索扩展初始化选择节点移除并标记检查目标遍历邻节点重复与终止5.3.3行车路径规划方法基于采样的规划方法通过在连续空间中逐步或批量抽样,构建由离散空间样本连接的树或图,从而捕捉解空间的连通性,进而得出可行或最优解。其主要代表有快速扩展随机树(RRT)算法。基于采样的路径规划方法常用的距离度量函数包括欧几里得距离、曼哈顿距离等常用的树生长策略包括最近邻节点选择策略、分支扩展策略等在当前树中找到里目标最近节点以搜索起点为根节点,构建初始树结构从最近节点向目标节点扩展,生成新节点并加入树中随机采样生成新的叶子节点5.3.3行车路径规划方法RRT算法示意图基于插值曲线的规划方法通过在已知的离散数据点之间进行插值,并利用已知的车辆状态信息求解相关系数,从而生成连续的路径或轨迹。常用的插值曲线包括多项式曲线、样条曲线以及贝塞尔曲线等。基于插值的路径规划方法多项式曲线贝塞尔曲线样条曲线

样条曲线是由多个小曲线段组成的曲线,该方法首先选取一组关键点,而后在这些关键点之间进行样条曲线插值。

贝塞尔曲线是一种在二维图形应用中使用的数学曲线,其形状由一系列向量组成的控制点决定,这些控制点按照特定的顺序相互连接,形成一个控制多边形。5.3.3行车路径规划方法基于数值优化的规划方法将连续的决策变量(如车辆的速度或转向角)转化为离散的变量,然后将决策问题转化为选择最佳离散值序列的优化问题。基于数值优化的路径规划方法规划结果

构造优化问题:约束条件:运动学约束、动力学约束、交通规则限制等求解优化问题:常见的数值优化算法包括梯度下降法、牛顿法、内点法等5.3.3行车路径规划方法基于数值优化的规划结果5.4智能车辆集中式决策方法设计监督学习型决策方法利用环境感知信息和驾驶员操作的数据,训练深度神经网络模型来模仿优秀驾驶员的驾驶行为。基本原理选取策略模型:构建从状态到数据标签的映射。确定损失函数:衡量策略输出与标签数据的差异。迭代更新:通过优化算法最小化损失函数。主要步骤策略神经网络(PolicyNetwork):决策引擎,学习从观测状态到动作的映射关系动作示范(BehaviorDemonstration):提供人类专家的行为样本作为训练数据。环境模拟器(Simulator):提供虚拟驾驶环境,用于训练和评估策略网络。组成部分定义:模仿学习是一种通过学习人类专家的行为来实现特定任务的方法。它旨在让智能系统能够像人类一样做出决策。目标:使智能系统能够通过观察和模仿人类专家的行为,学习到一个有效的决策策略,从而在类似的任务中表现出与人类专家相似的行为。核心概念5.4.1监督学习型决策方法模仿学习概述:行为克隆直接学习从观测状态到动作的映射关系,通过监督学习建立状态和动作之间的对应关系。该方法简化了学习过程,适合快速学习和部署,但存在局限性。数据集构建:行为克隆需要一个包含状态和对应动作的二元组序列的数据集,记作

优化目标:调节参数以实现特定性能指标的优化,即最小化损失函数L:

5.4.1监督学习型决策方法行为克隆针对行为克隆训练数据与实际数据分布不一致所导致的决策失误问题,通常采用数据聚合的方法进行缓解。算法流程:训练策略:从专家数据集中训练一个策略。运行策略:运行策略以获得新的状态数据集。标记数据:对数据集进行标记,以获得新的数据集。数据融合:将新的数据集添加到原始数据集B中,即。重复步骤:重复以上4个步骤,持续采集更多数据,完善数据库,提高训练效果。5.4.1监督学习型决策方法数据聚合

智能体通过与环境交互,最大化长期累计折扣奖励,无需标记数据,适用于复杂动态环境。5.4.2强化学习型决策方法总体流程03核心要素01020405策略:从状态到动作的映射关系。状态:包含环境信息的数据载体。动作:智能体的控制输出量。奖励:评估智能体在状态下执行动作的价值回报。环境:获取智能体执行动作后的下一个状态和奖励值的模型。简要方法图像状态信息量大、表征能力强,但计算资源需求高;数值矩阵状态构造高效,可处理一定复杂度问题。状态空间设计数据矩阵状态:将车辆相对位置、速度和道路边界信息等拼接成矩阵。图像状态:处理感知模块生成的鸟瞰图,提取车道、车辆历史位置等信息。5.4.2强化学习型决策方法基本要素设计离散动作空间:离散动作便于理解和实现,适用于一些简单决策场景。连续动作空间:连续动作可实现更精细的控制,适应复杂多变的交通环境。混合动作空间:混合动作空间兼顾了离散与连续动作的优点,适用性更广。动作空间设计奖励函数设计安全性:碰撞和不合理驾驶行为给予负奖励,完成安全指标给予正奖励。效率性:通过时间步的负奖励促使智能体快速完成任务。舒适性:对加速度变化、违反速度限制和曲率约束等行为施加负奖励。动作空间与奖励函数设计需兼顾任务需求与安全、效率、舒适性。5.4.2强化学习型决策方法基本要素设计算法名称适用动作空间主要特点优势局限性SARSA离散动作空间基于时序差分学习,考虑当前状态、动作、奖励、下一个状态和下一步动作简单易实现,适用于离散动作空间只适用于离散动作空间,收敛速度较慢Actor-Critic连续和离散动作空间结合策略优化和值函数估计,使用时序差分更新值函数,梯度上升优化策略结合策略和值函数的优点,提高学习稳定性和效率算法复杂度较高,训练过程可能不稳定PPO连续和离散动作空间引入信任区域,限制策略更新幅度,避免剧烈变化稳定性和收敛性较好,适用于连续和离散动作空间参数调整较为复杂,训练时间可能较长5.4.2强化学习型决策方法同轨策略更新算法算法名称适用动作空间主要特点优势局限性DQN离散动作空间基于Q-learning,用深度神经网络近似Q值,结合经验回放缓冲区和目标网络提升稳定性。简单易实现,适用于高维状态空间

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论