版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
智能驾驶与多维重建
第8章
纯视觉四维标注
智能驾驶教学团队1智能驾驶数据需求2静态场景四维标注3动态场景四维标注4通用障碍物四维标注5案例:人工与半自动标注平台案例智能驾驶数据需求智能驾驶算法从Software1.0(规则驱动)演进到Software3.0(端到端数据驱动),对数据质量和标注精度要求持续提升。第一代(Software1.0):2D图像检测/分割+后处理转3D,依赖人工规则。第二代(Software2.0):BEV感知+Transformer,深度学习主导感知和预测。第三代(Software3.0):端到端(感知到规划),神经网络覆盖全栈。两类方案:①快慢系统(系统1直觉+系统2LLM/VLM推理);②模仿学习(开环仿真训练)。静态场景四维标注静态场景四维标注通过重建(LiDAR/视觉)和定位两大技术路线,实现高精度路面/空中要素标注。特斯拉:纯视觉方案,端上SLAM→多趟云端聚合→新数据通过定位自动标注。地平线LiDAR中心:LIO单趟重建(去除运动物体)→PoseGraph全局聚合(相邻帧/回环帧/Clip间约束)→点云地图标注。静态场景四维标注静态场景四维标注通过重建(LiDAR/视觉)和定位两大技术路线,实现高精度路面/空中要素标注。地平线视觉中心:WIGO(Wheel-IMU-GNSS)→SfM稀疏重建(优化效率)→稠密重建或目标区域重建(RoMe路面重建+VMA矢量标注)。灯牌重建:SfM稀疏点+语义→SAM提取2D角点→3D-2D重投影优化包围盒姿态。通用障碍物四维标注通用障碍物标注通过深度估计(空间/时序几何约束)和占用网络(Occupancy)实现非白名单障碍物的感知真值生成。深度标注:空间几何约束(双目立体匹配)和时序几何约束(MVS)。DeFlowSlam同时建模动静态,SceneFlow描述动态物体运动。占用标注(地平线):LiDAR点云运动分割→静态聚合+动态ICP配准→动静态融合→体素化→图像语义校准。Occ3D数据集:多帧点云聚合→网格重建填充空洞→Ray-casting遮挡推理→图像引导Voxel优化。通用障碍物四维标注通用障碍物标注通过深度估计(空间/时序几何约束)和占用网络(Occupancy)实现非白名单障碍物的感知真值生成。深度标注:空间几何约束(双目立体匹配)和时序几何约束(MVS)。DeFlowSlam同时建模动静态,SceneFlow描述动态物体运动。占用标注(地平线):LiDAR点云运动分割→静态聚合+动态ICP配准→动静态融合→体素化→图像语义校准。Occ3D数据集:多帧点云聚合→网格重建填充空洞→Ray-casting遮挡推理→图像引导Voxel优化。通用障碍物四维标注通用障碍物标注通过深度估计(空间/时序几何约束)和占用网络(Occupancy)实现非白名单障碍物的感知真值生成。深度标注:空间几何约束(双目立体匹配)和时序几何约束(MVS)。DeFlowSlam同时建模动静态,SceneFlow描述动态物体运动。占用标注(地平线):LiDAR点云运动分割→静态聚合+动态ICP配准→动静态融合→体素化→图像语义校准。Occ3D数据集:多帧点云聚合→网格重建填充空洞→Ray-casting遮挡推理→图像引导Voxel优化。案例:人工与半自动标注平台主流标注平台(Scale.ai/MindFlow/Easydata等)提供2D/3D/4D标注工具,Polygon-RNN等人机回圈方案大幅提升标注效率。Scale.ai:2D/3D点云/地图标注,地图标注最具特色(物理层+逻辑层)。MindFlowSEED:2D/3D点云/语音/文本,支持四维标注。Easydata:一站式平台,智能标注降低90%成本。火山引擎:字节旗下,模版丰富,边标边训。倍赛:内嵌18种工具,周期缩短60%,成本节约50%。Vende:自动预处理167小类,准确率90%+。V7Labs:自动标注强,支持数据集管理。Polygon-RNN:人机回圈标注,比传统快4.7倍,IoU达78.4%。案例:人工与半自动标注平台主流标注平台(Scale.ai/MindFlow/Easydata等)提供2D/3D/4D标注工具,Polygon-RNN等人机回圈方案大幅提升标注效率。谢谢大家!
36/36智能驾驶与多维重建
第9章
三维可视化
智能驾驶教学团队1计算机图形学基础2渲染管线3智能驾驶中的渲染元素4案例:智能驾驶中常用的渲染工具介绍光栅化光栅化将三维三角形转换为二维像素阵列,反走样通过超采样或滤波解决锯齿问题。光栅化:以三角形为基本单元(平面性/可定义内外/可拆分),遍历像素判断是否在三角形内。走样问题:锯齿/摩尔纹/车轮效应,根本原因是采样不足。反走样:先模糊后采样(低通滤波过滤高频信号)。方法:超采样(SSAA)、多重采样抗锯齿(MSAA)。曲面转换曲面细分(Loop/Catmull-Clark)增加细节,曲面简化(QEM坍缩)降低复杂度,曲面规则化使三角面均匀。Loop细分:连接边中点生成新三角形→新顶点(1/8(A+B)+3/8(C+D))+旧顶点((1-nu)·原位置+u·邻域和)调整。曲面转换曲面细分(Loop/Catmull-Clark)增加细节,曲面简化(QEM坍缩)降低复杂度,曲面规则化使三角面均匀。曲面简化(QEM):每条边计算坍缩后最小二次误差→选最小误差边坍缩→更新相邻边→迭代至终止。光线追踪光线追踪通过递归追踪光线路径实现全局光照效果(软阴影/光泽反射/间接光照),比光栅化更真实。基本逻辑:光线沿直线传播、互不碰撞、具有可逆性。Whitted光线追踪:视线生成(相机→像素)→求交测试→像素着色(递归追踪反射/折射光线)。渲染方程:出射辐射率=发射辐射率+∫上半球BSDF×入射辐射率×cosθdω。软阴影:面光源产生阴影边缘渐变;光泽反射:粗糙度决定反射模糊程度;间接光照:多次反射产生环境光照。渲染管线渲染管线将三维场景转换为二维图像,包含应用程序、几何、光栅化三个阶段,通过可编程着色器控制渲染效果。三个阶段:应用程序阶段(碰撞/输入/动画)→几何阶段(模型视点变换→顶点着色→投影→裁剪→屏幕映射)→光栅化阶段(三角形设定→遍历→像素着色→融合)。渲染管线渲染管线将三维场景转换为二维图像,包含应用程序、几何、光栅化三个阶段,通过可编程着色器控制渲染效果。OpenGL渲染流程:输入顶点→顶点着色器→图元装配→光栅化→片段着色器→帧缓存。渲染管线渲染管线将三维场景转换为二维图像,包含应用程序、几何、光栅化三个阶段,通过可编程着色器控制渲染效果。WebGL:基于OpenGLES2.0,内嵌浏览器,无需安装插件。页面包含HTML5+JavaScript+GLSLES三种语言。可编程渲染管线阶段顶点着色器(坐标变换)、细分着色器(增加细节)、几何着色器(生成新图元)、片段着色器(像素颜色)组成可编程渲染管线。顶点着色器:模型→世界→齐次裁剪空间变换,光照计算,纹理坐标生成。细分控制/评估着色器:控制细分程度和方式,动态调整LOD。几何着色器:输入图元可生成新图元(粒子系统/毛发)。片段着色器:纹理采样、光照计算、颜色混合,决定最终像素颜色。3D检测与深度估计3D检测可视化通过旋转矩阵计算包围框8个顶点,深度估计可视化通过颜色映射展示像素距离。3D检测可视化:中心点+长宽高+欧拉角→旋转矩阵→8个顶点坐标。深度估计可视化:深度图→jet颜色映射→显示每个像素到相机的距离。光流与占用网络可视化光流通过HSV颜色编码(色调=方向,亮度=速度)可视化像素运动;占用网络通过热力图展示3D空间占据概率。光流可视化:u/v分量→magnitude和angle→HSV映射(Hue=angle,Value=magnitude)→BGR显示。占用网络可视化:3D占用网格→选择高度层→热力图展示占据概率。案例:智能驾驶常用渲染工具Webviz和Foxglove是基于Web的ROS数据可视化工具,支持ROSBag回放、实时数据流和模块化面板布局。谢谢大家!
36/36智能驾驶与多维重建
第10章
自动驾驶仿真
智能驾驶教学团队1传统仿真系统2基于深度学习的仿真系统3智能驾驶仿真系统样例4案例:大语言模型与端到端智能驾驶传统仿真系统物理引擎(刚体动力学/碰撞检测/约束/车轮模型/环境交互)和决策规划(路径规划/行为决策/运动规划/控制/通信协调)构成传统仿真系统核心。物理引擎核心模块:刚体动力学(牛顿运动定律)、碰撞检测(广义/窄阶段)、约束和关节(铰链/滑动)、车轮和轮胎模型、环境交互。决策规划:路径规划(A*/Dijkstra全局+局部细化)、行为决策(FSM/规则驱动/情境分析)、运动规划(轨迹生成/动力学模型/优化算法)、控制(PID/MPC)、通信与协调(V2V/V2I)。CARLA仿真框架CARLA是基于UE的开源全栈仿真框架,服务端(渲染/物理/传感器)+客户端(Python控制世界)+TrafficManager模拟真实交通。服务端:渲染(UE)、物理引擎、传感器模型(相机/LiDAR/Radar/IMU/GNSS)、真值传感器(深度/语义/光流)。客户端:Python脚本控制天气、车辆、速度等。核心模块:TrafficManager(模拟交通环境)、Sensor(传感器模型)、Recorder(记录/复现)、ROSBridge(与ROS/Autoware交互)、OpenAsset(自定义物体库)。基于深度学习的仿真风格迁移通过GAN将游戏渲染画面转换为真实数据风格(EPE),或通过贴图+风格一致化生成带标签训练数据(GeoSim)。EPE(EnhancingPhotorealismEnhancement):HRNetV2图像增强网络+RAD模块+G-buffer编码器+感知判别器,将GTAV渲染画面迁移到Cityscapes风格。基于深度学习的仿真风格迁移通过GAN将游戏渲染画面转换为真实数据风格(EPE),或通过贴图+风格一致化生成带标签训练数据(GeoSim)。GeoSim:真实图像+深度估计→插入车辆→SynNet风格迁移一致化→生成带标签数据,可批量化生成训练数据。局限性:目前仅支持汽车,尚不支持行人/自行车,无法360°自由视角。隐式表达仿真LightSim通过NeRF重建数字孪生体,结合神经延迟渲染实现真实、可控、可扩展的驾驶场景仿真。数字孪生构建:UniSim重建场景(静态/动态分离)→Marchingcube提取几何→估算HDR环境图(太阳+天空)。神经照明仿真:修改场景(增加/移除物体、改变光照)→基于物理渲染生成光照数据→神经延迟渲染(合成网络)生成最终图像。能力:真实(准确模拟阴影/光照)、可控(编辑场景/生成安全关键场景)、可扩展(SinglePass即可重建)。动态物体仿真动态物体仿真通过SDF+反射率计算+物理辐射模块+RGB组合,重建动态物体资产并插入仿真场景。核心流程:SDF计算(fsdf)→法线计算(梯度)→反射率计算(反照率α/镜面属性as/γ)→物理辐射(可学习环境光+光照分解)→RGB组合→LiDAR深度/强度/掩码渲染。应用:重建车辆资产插入仿真场景,生成多传感器数据(前视图像+LiDAR点云)。智能驾驶仿真系统样例UniSim基于NeRF的动静态场景分解表达,实现高度逼真、闭环测试、可扩展的驾驶场景仿真。场景分解:静态背景(建筑/道路)+动态物体(车辆/行人)+区域外物体(天空)。Instant-NGP+SDF表示,HyperNet生成动态物体HashGrid共享形状信息。渲染:VolumeRendering生成低分辨率特征图→CNN采样生成高清图片。能力:重放原始数据、动态物体行为控制(删除/插入车辆生成罕见场景)、自由视角渲染(改变相机/LiDAR位置)。案例:大语言模型与端到端智能驾驶大语言模型通过预训练+微调+RLHF的训练范式,可与端到端智能
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 行政能力测试试题及答案
- 中级母婴护理师考试题及答案
- 2026年内蒙古自治区包头市辅警人员招聘考试试卷带答案
- 山东省潍坊市昌乐二中2026届九年级下学期第一次月清质量监测历史试卷(有答案)
- 安全管理月度考核实施方案
- 2026年中国不锈钢蒸包柜市场调查研究报告
- 2026年中国V-0盒市场调查研究报告
- 2026年中国IC端子市场调查研究报告
- 2026年中国AD营养奶市场调查研究报告
- 2026年轻纺行业技能鉴定考试-纺织纤维检验工历年参考题库含答案解析
- 医学课件-胰腺癌研究及诊疗新进展
- 2026年苏州轨道交通有限公司人员招聘笔试备考题库及答案详解
- 2026年建筑施工企业安管人员继续教育试题(含答案)
- 2025年通信工程师中级传输与接入(无线)真题及答案解析
- ISOTS 68182024 中药艾条质量试验方法废颗粒浓度标准立项发展报告
- 工业园区物业服务方案
- 初中地理七年级城镇与乡村(第2课时):变迁·守望·振兴-跨学科主题学习教案
- 糖尿病治疗管理技术进展2026
- 砂石料场土地复垦方案报告书
- 土建质量员继续教育考试2026年试题总汇及答案
- 2026招商局集团岗位招聘6人易考易错模拟试题(共500题)试卷后附参考答案
评论
0/150
提交评论