智能驾驶与多维重建(上篇共上中下3篇)_第1页
智能驾驶与多维重建(上篇共上中下3篇)_第2页
智能驾驶与多维重建(上篇共上中下3篇)_第3页
智能驾驶与多维重建(上篇共上中下3篇)_第4页
智能驾驶与多维重建(上篇共上中下3篇)_第5页
已阅读5页,还剩50页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

智能驾驶与多维重建

第1章

智能驾驶中的三维重建

智能驾驶教学团队1智能驾驶简介

2智能驾驶传感器3智能驾驶感知4SLAM与VLN中的三维重建5智能驾驶仿真6案例:特斯拉视觉重建与仿真智能驾驶简介三维重建是智能驾驶感知、定位、建图、仿真和标注的核心技术,贯穿数据驱动全链条。智能驾驶不但涵盖传统意义上的自动驾驶,还包含智能座舱、自动泊车及ADAS。三维重建在高精地图制作、障碍物检测与识别、路径规划与决策、仿真测试与验证中均发挥关键作用。驾驶自动化分级(GB/T40429—2021):0级(应急辅助)→1级(部分驾驶辅助)→2级(组合驾驶辅助)→3级(有条件自动驾驶)→4级(高度自动驾驶)→5级(完全自动驾驶)。视觉传感器摄像头是智能驾驶最核心的传感器,按布置方式分为单目、双目、三目和环视四种。单目:算法成熟,但视野与远距离不可兼得,测距精度低。双目:通过像素偏移量和基线计算深度,标定要求高。三目:三个不同焦距(窄视野250m、主视野150m、宽视野60m),弥补视野与距离矛盾,特斯拉AutoPilot2.0采用。环视:鱼眼镜头,安装于前后保险杠和左右后视镜,拼接成俯视图(AVM),用于5~10m内障碍物检测和泊车。激光雷达激光雷达具有测距精度高(毫米级)、探测距离远(最远300m)的特点,但成本高且易受天气影响。工作原理:发射激光脉冲,接收反射信号,获取距离、方位、高度、速度等参数。激光雷达激光雷达具有测距精度高(毫米级)、探测距离远(最远300m)的特点,但成本高且易受天气影响。机械式vs固态:机械式线束多(16/32/64线),360°扫描,精度高但体积大成本高;固态式尺寸小成本低(MEMS/OPA方案)。点云数据处理:预处理→聚类→特征提取→分类。应用:障碍物检测与分割、可通行空间检测、高精地图制图与定位、障碍物轨迹预测。毫米波雷达与超声波传感器毫米波雷达全天候工作但缺高度信息,超声波传感器成本低但探测距离短,两者在智能驾驶中各有定位。毫米波雷达:频率10~200GHz,探测距离200m。24GHz(短距,盲点检测)、77GHz(长距,ACC/AEB)、79GHz(更高分辨率)。数据组成:回波强度、障碍物ID、角度、距离、径向速度、运动状态、宽度。超声波传感器:UPA(前后保险杠,15~250cm,120°)和APA(侧面,30~500cm,80°)。对温度敏感,无法精确描述障碍物位置。应用:泊车库位检测(APA传感器距离-时间关系计算库位长度)、高速横向辅助。GPS与IMUGPS+IMU是自动驾驶的"黄金搭档",GPS提供全局修正,IMU提供高频位姿推算。GPS:三角定位法,差分GPS精度从10m提升至米级。高楼存在遮挡和多路径信号问题,频率仅10Hz。IMU:以牛顿力学定律为基础,测量加速度和角速度,积分得速度和位置。频率>100Hz,短期精度高但累积误差大。融合机制:每100ms用GPS修正,中间IMU预测9次,实现100Hz高频稳定定位。多传感器融合多传感器融合通过卡尔曼滤波等算法,将GPS/IMU/轮速计/LiDAR等数据融合,提升定位精度和鲁棒性。融合条件:误差不相关性(单传感器失败不影响其他)、传感器相互补充。卡尔曼滤波:预测阶段(状态方程)+更新阶段(观测方程)。状态误差协方差矩阵P和观测误差协方差矩阵S是核心。多传感器融合框架:状态方程(IMU/轮速计预测)+观测方程(GNSS/LiDAR/视觉匹配更新)。BEV感知BEV感知通过将多摄像头特征转换至鸟瞰视角进行融合,已成为智能驾驶感知的主流方案。BEV流程:2D特征提取→视图变换(IPM/LSS/Transformer)→3D解码器输出。IPM:利用相机内外参实现BEV坐标系到像素坐标系的转化,依赖地面平坦假设。BEV感知BEV感知通过将多摄像头特征转换至鸟瞰视角进行融合,已成为智能驾驶感知的主流方案。LSS:生成深度特征→BEV坐标转换(VoxelPooling)→生成视锥点云特征。BEVDepth增加显式深度监督、相机感知深度预测、多帧融合。BEV感知BEV感知通过将多摄像头特征转换至鸟瞰视角进行融合,已成为智能驾驶感知的主流方案。Transformer-based:BEVFormer(DeformableAttention+TemporalSelf-Attention+SpatialCross-Attention),泛化性好但部署难度高。SLAM与VLN中的三维重建视觉SLAM和VLN技术分别通过几何约束和语言理解实现定位导航,神经表达SLAM(NeRF/3DGS)正成为新趋势。视觉SLAM(ORB-SLAM3):跟踪→局部建图→回环检测→地图融合→全局优化。挑战:光照变化、动态环境、尺度模糊、累积漂移。SLAM与VLN中的三维重建视觉SLAM和VLN技术分别通过几何约束和语言理解实现定位导航,神经表达SLAM(NeRF/3DGS)正成为新趋势。神经表达SLAM:NeRF-based(iMap,隐式神经表征,高真实感渲染但实时性差)和3DGS-based。SLAM与VLN中的三维重建视觉SLAM和VLN技术分别通过几何约束和语言理解实现定位导航,神经表达SLAM(NeRF/3DGS)正成为新趋势。VLN(Vision-LanguageNavigation):Uni-NaVid将视觉语言导航、对象目标导航、跟随、具身问答统一在同一框架,视觉编码器+LLM生成动作或回答。智能驾驶仿真智能驾驶仿真通过场景库构建、新场景合成和真实感渲染,为算法提供安全、高效的测试环境。场景库构建:规则方式(效率高,真实感差)和三维重建方式(真实感强,技术难度高)。NeRF技术开始用于场景重建。新场景合成:2D图像编辑(锥桶检测数据合成)和3D场景合成(GeoSim结合图形学+神经网络合成动态物体行为)。真实感渲染:传统图形学(Mesh)和神经网络渲染(NeRF)。UniSim采用多个NeRF场分别建模静态背景、动态物体和区域外物体。智能驾驶仿真智能驾驶仿真通过场景库构建、新场景合成和真实感渲染,为算法提供安全、高效的测试环境。真实感渲染:传统图形学(Mesh)和神经网络渲染(NeRF)。UniSim采用多个NeRF场分别建模静态背景、动态物体和区域外物体。特斯拉视觉重建与仿真特斯拉采用众包建图路线(车端单次重建+云端聚合),并将仿真数据用于AutoPilot和FSD算法提升。车端单次重建:8路Camera提取特征(Keypoints/Polylines/Pano-seg/Ground),里程计输出100Hz位姿和3D结构。精度RTE=1.3%,RRE=0.14°/100m。云端聚合:CourseAlignment(GNSS对齐)→PairwiseMatching(几何精细匹配)→JointOptimization(图优化)→SurfaceRefinement(Mesh优化)。仿真数据:NeRF重建数字孪生,生成3.71亿张图片、48亿个标注目标。谢谢大家!

36/36智能驾驶与多维重建

第2章

特征点检测与匹配

智能驾驶教学团队1特征点检测与描述

2特征点匹配3深度学习特征点检测与匹配_x0008_4特征点检测与匹配的应用5案例:智能驾驶中的关键点检测与匹配_x0008_智能驾驶简介Harris角点检测通过协方差矩阵的特征值判断角点,对光照鲁棒但对尺度和旋转敏感。角点:局部区域灰度变化较大的点,区别于平坦区域和边缘。Harris原理:协方差矩阵M=[[I_x²,I_xI_y],[I_xI_y,I_y²]]。响应函数R=det(M)-k·trace(M)²。步骤:图像预处理→梯度计算→特征响应计算→非极大值抑制。优缺点:简单准确,对光照鲁棒;但对尺度/旋转敏感,弱纹理区域表现不佳。基于区域与基于尺度不变FAST/ORB计算快,SIFT具有尺度不变性但计算量大,适用于三维重建。FAST:候选点p为圆心构建离散圆,连续n个像素明显亮于/暗于p时检测为特征点。ORB:FAST+旋转不变BRIEF描述子,实时性和准确性平衡良好。SIFT:尺度空间构建→极值点检测→特征点定位→方向分配→128维描述子生成。SIFT优点:尺度/旋转/光照不变性,适合三维重建;缺点:计算量大。特征描述算法SIFT/SURF采用直方图描述子(128维),ORB/BRISK采用二进制描述子(高效存储匹配)。直方图描述子(SIFT):特征点邻域生成→4×4子区域划分→每个子区域8方向梯度直方图→128维向量。二进制描述子(SteerBRIEF):比较点对灰度值生成二进制字符串。SteerBRIEF引入Gabor滤波器和旋转调整,提高旋转鲁棒性。优缺点:直方图描述子精度高但计算量大;二进制描述子计算快、存储少,适合实时应用。特征点匹配特征匹配通过距离度量(欧氏/汉明)和匹配策略(最近邻/相互最近邻/距离比)建立特征对应关系。距离度量:欧氏距离(直方图描述子)、马氏距离、NCC、汉明距离(二进制描述子)。匹配策略:最近邻(简单但不稳定)、相互最近邻(对称约束,更稳定)、最近邻距离比(过滤不稳定匹配)。RANSAC过滤:随机采样+模型拟合,去除错误匹配。深度学习特征点检测与匹配深度学习方法在弱纹理/极端光照下表现优于传统方法,分为基于学习的检测、匹配和端到端三类。三类方法:①基于学习的特征检测(SuperPoint/R2D2/LIFT/ALIKE);②基于学习的特征匹配(SuperGlue/LightGlue);③端到端检测与匹配(LoFTR)。SuperPoint:编码器+两个解码器(兴趣点+描述子),自监督训练(兴趣点预训练→自标注→联合训练)。深度学习特征点检测与匹配深度学习方法在弱纹理/极端光照下表现优于传统方法,分为基于学习的检测、匹配和端到端三类。三类方法:①基于学习的特征检测(SuperPoint/R2D2/LIFT/ALIKE);②基于学习的特征匹配(SuperGlue/LightGlue);③端到端检测与匹配(LoFTR)。SuperGlue:注意力图神经网络+最优匹配层(Sinkhorn算法),优化特定图像对的描述子。LoFTR:局部特征提取→粗特征转换(自注意+交叉注意)→匹配→由粗到精细化,输出密集匹配。评价指标与应用案例特征点检测与匹配通过角点检测平均精度、可重复性、NNmAP、匹配得分等指标量化评估。评价指标:角点检测平均精度(精度-召回曲线面积)、定位误差(欧氏距离)、可重复性(匹配特征数/总检测数)、NNmAP、匹配得分、单应性矩阵估计。应用:三维重建(VIO/SLAM前端)、视觉重定位(地库泊车回环检测)、VR/AR(环境定位/物体跟踪)、图像检索。智能驾驶挑战:弱纹理区域(路面)、夜晚/雨天、动态物体。深度学习方法通过数据驱动可针对性提升。谢谢大家!

36/36智能驾驶与多维重建

第3章

帧间运动估计

智能驾驶教学团队1相机模型及成像

2帧间运动理论模型3帧间运动模型求解4基于深度学习的里程计估计5案例:智能驾驶中的里程计估计相机模型及成像相机成像由光学成像(内参)和相机姿态(外参)共同决定,三维重建是相机成像的逆过程。内参矩阵K:将相机坐标系三维点映射到像素坐标,包含焦距(fx,fy)和主点(cx,cy)。外参:世界坐标系到相机坐标系的变换(R,t)。相机模型及成像相机成像由光学成像(内参)和相机姿态(外参)共同决定,三维重建是相机成像的逆过程。畸变模型:径向畸变(桶形/枕形,Brown-Conrady模型)和切向畸变(光轴与成像平面不垂直)。帧间运动理论模型对极约束通过本质矩阵E和基础矩阵F描述两视图间的几何关系,将匹配搜索从全图缩减到极线。对极几何:两相机光心O1/O2、空间点X和像点x1/x2构成极平面,极线与像平面相交于极线。本质矩阵E(已标定):E=t×R,满足x̂₂^T·E·x̂₁=0。基础矩阵F(未标定):F=K₂^{-T}·E·K₁^{-1},满足x₂^T·F·x₁=0。极线搜索:已知x1,匹配点x2在极线l2上,大幅缩小搜索空间。帧间运动模型求解当场景点位于同一平面或相机纯旋转时,帧间映射退化为单应性变换(2D→2D直接映射)。应用:全景拼接、平面检测、RANSAC中同时估计F和H选择更优模型。8点法:每对匹配点提供1个约束,至少8对匹配点求解F。对F进行SVD分解并重构满足奇异值约束。本质矩阵分解:分解得到4组(R,t)解,选择三角化点同时位于两个相机前方的解。RANSAC:随机采样→模型估计→验证内点→迭代优化。内点比例越高收敛越快。可用Lowe算法过滤错误匹配、语义引导匹配、SuperGlue提高匹配准确度。基于深度学习的里程计估计深度学习里程计通过无监督学习(SfMlearner)、视觉-惯性融合(DeepVIO)和几何优化(BA-Net)提升帧间运动估计性能。SfMlearner:DepthNet(单帧深度)+PoseNet(相邻帧位姿),重投影误差自监督,开创无监督里程计方向。DeepVIO:视觉分支(CNN)+惯性分支(RNN)融合,引入IMU数据提升动态场景鲁棒性。基于深度学习的里程计估计深度学习里程计通过无监督学习(SfMlearner)、视觉-惯性融合(DeepVIO)和几何优化(BA-Net)提升帧间运动估计性能。BA-Net:CNN估计初始深度→BA-Net端到端优化,将传统BA转化为神经网络学习模块。基于学习的视觉重建DROID-SLAM通过稠密束调整(DBA)实现高精度重建,DPVO通过稀疏特征块大幅降低显存消耗。DROID-SLAM:完全基于神经网络的SLAM框架。DBA模块将稠密光流优化分解为姿态和深度优化,参考RAFT架构设计,泛化能力强。基于学习的视觉重建DROID-SLAM通过稠密束调整(DBA)实现高精度重建,DPVO通过稀疏特征块大幅降低显存消耗。DPVO:参考DSO思路,将匹配从稠密图像优化为稀疏特征块(SparsePatch),有效减少特征总量,大幅降低显存消耗。特征点法vs直接法:特征点法最小化重投影误差,分步求解;直接法最小化光度误差,数据关联与位姿估计统一优化。深度学习方法结合两者优势。案例:智能驾驶中的里程计估计特斯拉FSD采用多相机+IMU+轮速计的VIO系统,结合深度神经网络特征点、地面分割、车道线等提供视觉约束。系统架构:参考经典SLAM框架(前端Tracking+后端局部优化),保证实时性。输入:多视角视频、IMU、轮速计。视觉约束:深度神经网络特征点+地面+分割+车道线。结合GPS/高精地图:VIO提供短期精确位姿,与其他长期定位技术结合确保鲁棒性。谢谢大家!

36/36智能驾驶与多维重建

第4章

运动恢复结构

智能驾驶教学团队1三角测量

2透视n点问题3光速法平差非线性优化4运动恢复结构框架5运动恢复结构的加速处理6案例:智能驾驶场景中的SfM重建三角测量三角测量利用多视角投影约束恢复三维点坐标,宽基线有利于提高精度。原理:从光心O_i沿图像点x_i发射射线,多条射线交点即为三维点X。数学推导:每1个观测点提供2个约束,至少2条射线确定1个三维点。构建AX=0,SVD分解求解。宽基线策略:按基线排序,优先选择宽基线匹配对进行三角化,减少求解误差。成像透视n点问题(PnP)PnP问题通过已知三维点和对应二维投影求解相机内外参,DLT是基本方法。问题定义:已知N个三维点X_i和对应二维投影x_i,求解相机投影矩阵P(12自由度)。DLT求解:每对匹配点提供2个约束,至少6对匹配点。构建矩阵A,SVD分解求最小二乘解。参数分解:P=(KR|Kt),对KR进行QR分解得到R和K,再求解t。光束法平差(BA)

非线性优化BA通过最小化重投影误差同时优化所有相机参数和三维点,是SfM后端优化的核心。无约束优化方法:最速下降法(一阶,收敛慢)、牛顿法(二阶,计算量大)、Levenberg-Marquardt(信赖域,效率/稳定性平衡)。BA数学模型:待优化变量θ=(C_1,...,C_m,X_1,...,X_n)。目标函数g(θ)=1/2·Σχ_ij·||û_ij-u_ij(C_j,X_i)||²。稀疏性:雅可比矩阵J和Hessian矩阵H为稀疏矩阵,利用Schur补可高效求解(先解相机增量δ_C,再解点增量δ_X)。SfM框架——增量式SfM增量式SfM从初始图像对开始逐步添加新视角,鲁棒性强但计算量大。流程:特征提取与匹配→图像连接图构建→初始化(选择最佳图像对)→重建新视角(RANSAC-PnP+局部BA)→全局BA。SfM框架——增量式SfM增量式SfM从初始图像对开始逐步添加新视角,鲁棒性强但计算量大。流程:特征提取与匹配→图像连接图构建→初始化(选择最佳图像对)→重建新视角(RANSAC-PnP+局部BA)→全局BA。SfM框架——增量式SfM增量式SfM从初始图像对开始逐步添加新视角,鲁棒性强但计算量大。Tracks:同一三维点及其多视角二维投影的集合。需过滤无穷远点和重投影误差过大的Tracks。SfM框架——增量式SfM增量式SfM从初始图像对开始逐步添加新视角,鲁棒性强但计算量大。场景图:顶点=图像,边=匹配关系。末梢顶点可能不稳定,可过滤提升精度。全局式与分层式SfM全局式SfM一次性估计所有相机姿态(先旋转后平移),效率高但对噪声敏感;分层式SfM通过树状层次

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论