版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
智能驾驶与多维重建
第5章
多视图稠密重建
智能驾驶教学团队1多视图稠密重建
2基于学习方法3基于COLMAP的多视图稠密重建4三维占用重建5案例:驾驶场景中的稠密点云重建法向估计与视角选择法向估计联合估计深度和法线(PatchMatch),视角选择通过几何先验(三角化/分辨率/入射角)选择最优视图。法向估计:PatchMatch采样和传播深度与法线信息。视角选择:三角化先验(夹角越大越好)、分辨率先验(分辨率相近)、入射角先验(越小越好)。蒙特卡洛视图采样:综合几何先验计算概率分布,随机采样选择最优视图。时空平滑、光度一致与几何一致时空平滑减少遮挡振荡,光度一致(NCC)和几何一致(像素级视角选择)共同提升重建质量。时空平滑:空间平滑(相邻像素遮挡状态相似)+时间平滑(当前迭代与前一次迭代相似),减少遮挡状态振荡。光度一致:归一化互相关(NCC)度量图像块相似度。双边滤波降低噪声影响,保留边缘。几何一致:像素级视角选择,结合光度先验(颜色相似)和几何先验(三角化角度/入射角/分辨率),用PatchMatch优化深度和法线。集成与点云融合通过联合似然函数统一优化深度/法线/遮挡状态,过滤不可靠点云后融合生成完整三维模型。联合优化:EM算法迭代优化(E步更新遮挡,M步更新深度和法线)。点云过滤:光度一致性和几何一致性过滤不可靠像素。点云融合:将可靠像素视为图节点(共视关系为边),聚类成簇,计算平均深度和法线,融合成完整点云。基于深度学习的MVSMVSNet是首个将深度学习应用于MVS的方法,通过可微单应性变换和三维代价体实现端到端深度估计。输入:已知相机姿态的多视角图像(SfM获取)。核心步骤:特征提取(CNN)→可微单应性变换构建代价体→代价体正则化(3DCNN)→深度回归→深度图优化。优势:处理低纹理/反射/透明表面,端到端训练;缺点:3D卷积计算量大。基于2D卷积的MVSSimpleRecon通过2DCNN+4D元数据替代3D卷积,大幅提升效率,实现实时处理。创新点:①2DCNN(代替3D卷积,提升效率);②4D元数据(集成关键帧、几何元数据到4D张量,经MLP降维)。流程:参考图像+源图像+内外参→特征提取匹配→代价体+MetaData→MLP→2DEncoder-Decoder→稠密深度图。5.3COLMAP多视图稠密重建实践COLMAP提供完整的SfM+MVS流水线,从图像输入到稠密点云输出,是三维重建的常用开源工具。安装与编译:通过apt安装依赖,gitcloneCOLMAP源码,cmake编译。运行SfM:feature_extractor(特征提取)→sequential_matcher(顺序匹配)→mapper(SfM重建)→bundle_adjuster(BA优化)。COLMAPMVS:在SfM结果基础上运行MVS模块,但计算量大(30s数据需数十~数百GPU时)。5.3COLMAP多视图稠密重建实践COLMAP提供完整的SfM+MVS流水线,从图像输入到稠密点云输出,是三维重建的常用开源工具。RoMe路面重建:基于SfM结果,通过Nerf可微分渲染重建高精度路面曲面。三维占用重建三维占用(Occupancy)将空间划分为体素并预测占据状态,是深度估计从2D到3D的演进。SurroundDepth:环视深度估计→后处理得到占用。核心:Cross-ViewTransformer(跨视角特征交互)、SfM预训练(恢复真实尺度)、联合位姿估计(利用外参)。三维占用重建三维占用(Occupancy)将空间划分为体素并预测占据状态,是深度估计从2D到3D的演进。SurroundOcc(端到端):2D骨干提取多尺度特征→2D-3D空间注意力→3D卷积上采样→占用预测。真值自动标注:多帧点云融合→泊松重建填补空洞→体素化。三维占用重建三维占用(Occupancy)将空间划分为体素并预测占据状态,是深度估计从2D到3D的演进。占用流(EmerNeRF):静态场+动态场+光流场分解,4D时空表示,不依赖有监督分割或光流估计。案例:驾驶场景中的稠密点云重建MVS在驾驶场景面临动态物体、光照变化、视角单一、算力限制四大挑战,需针对性解决。挑战:动态物体(语义分割剔除)、光照变化与阴影(特征映射、Block-NeRF可控光照)、视角单一(场景先验/路面建模)、大场景算力(仅关键区域重建)。Block-NeRF:对相同视角进行白天/夜晚光照控制。RoMe:路面曲面建模,结合语义信息实现高精度路面重建。谢谢大家!
36/36智能驾驶与多维重建
第6章
纹理表面重建
智能驾驶教学团队1三维物体的表面表达方式6神经辐射场重建
2基于图像分割的表面重建73D高斯溅射
3基于隐函数的表面重建
4基于多视角的网格细化5纹理图像重建8案例:智能驾驶中的稠密点云重建
三维物体表面表达方式三维物体表面可通过边界表示法(三角形Mesh最常用)、空间划分法(Voxel/八叉树)和构造体素法表达。边界表示法:离散化(三角形Mesh最稳定)、参数化(规则物体)、非参数化(隐式曲面/符号距离函数)。三维物体表面表达方式三维物体表面可通过边界表示法(三角形Mesh最常用)、空间划分法(Voxel/八叉树)和构造体素法表达。空间划分法:均匀划分(简单但内存大)、八叉树(自适应分辨率)、BSP(二叉树划分)。三维物体表面表达方式三维物体表面可通过边界表示法(三角形Mesh最常用)、空间划分法(Voxel/八叉树)和构造体素法表达。构造体素法:通过并/交/差组合规则形状,仅适用于简单实体。三维物体表面表达方式三维物体表面可通过边界表示法(三角形Mesh最常用)、空间划分法(Voxel/八叉树)和构造体素法表达。三角形Mesh:顶点(位置/法线/纹理坐标)+面+边,是图形学中最常用的表达方式。基于图像分割的表面重建图像分割法通过空间划分(德劳内三角剖分)和二分类(最小割)提取物体表面。德劳内三角剖分:最大化最小角、空圆特性、与维诺图对偶。增量算法逐步插入点并进行劳森翻转。基于图像分割的表面重建图像分割法通过空间划分(德劳内三角剖分)和二分类(最小割)提取物体表面。最小割二分类:建立有向图(顶点=四面体,边=三角面),添加source/sink顶点,划分代价=可视性约束+光度一致性约束+面积约束。优势:适用于室内外场景,可处理复杂表面;缺点:依赖剖分质量,受噪声影响。基于隐函数的表面重建隐函数重建通过符号距离函数(SDF)的零势面提取物体表面,分为局部(速度快)和全局(抗噪强)两类。空间划分:八叉树非均匀划分,点密集区域高分辨率,稀疏区域低分辨率。基于隐函数的表面重建隐函数重建通过符号距离函数(SDF)的零势面提取物体表面,分为局部(速度快)和全局(抗噪强)两类。符号距离函数(SDF):f(x)=d(x,∂Ω)(内部为正,外部为负),零势面即为物体表面。基于隐函数的表面重建隐函数重建通过符号距离函数(SDF)的零势面提取物体表面,分为局部(速度快)和全局(抗噪强)两类。局部隐函数:每个点的SDF由邻域点加权得到。鲁棒方法在局部坐标系中定义符号距离和权重,对噪声更鲁棒。全局隐函数:RBF重建、泊松重建,全局拟合但可能过度平滑。基于隐函数的表面重建隐函数重建通过符号距离函数(SDF)的零势面提取物体表面,分为局部(速度快)和全局(抗噪强)两类。MarchingCube:查表法从SDF场提取三角网格。DualMarchingCube处理八叉树相邻体素分辨率不同的情况。网格细化与纹理图像网格细化通过光度一致性优化网格顶点位置,纹理贴图通过视角选择和颜色调整提升真实感。网格细化:连续梯度流离散化,以光度一致性误差作为能量函数,结合平滑约束优化网格顶点位置。网格细化与纹理图像网格细化通过光度一致性优化网格顶点位置,纹理贴图通过视角选择和颜色调整提升真实感。纹理贴图:视角选择(多标签分配,数据项=图像质量/尺度,平滑项=相邻面标签一致性)→纹理坐标计算(投影→包围盒→归一化)→纹理图像创建。神经辐射场(NeRF)重建NeRF通过MLP学习5D辐射场(位置+方向→颜色+密度),实现高保真新视角合成。基本原理:F(x,θ,φ)→(c,σ)。位置编码γ(v)增强高频信息。体积渲染沿射线累积颜色和密度。NeuS:将表面表示为SDF零集,改进体积渲染权重函数(无偏性+遮挡自适应),提高表面重建精度。后续改进:Voxurf(粗到细训练)、VMesh(混合隐式/显式表示)、DMTet(直接优化重建表面)。神经辐射场(NeRF)重建NeRF通过MLP学习5D辐射场(位置+方向→颜色+密度),实现高保真新视角合成。基本原理:F(x,θ,φ)→(c,σ)。位置编码γ(v)增强高频信息。体积渲染沿射线累积颜色和密度。NeuS:将表面表示为SDF零集,改进体积渲染权重函数(无偏性+遮挡自适应),提高表面重建精度。后续改进:Voxurf(粗到细训练)、VMesh(混合隐式/显式表示)、DMTet(直接优化重建表面)。神经辐射场(NeRF)重建NeRF通过MLP学习5D辐射场(位置+方向→颜色+密度),实现高保真新视角合成。基本原理:F(x,θ,φ)→(c,σ)。位置编码γ(v)增强高频信息。体积渲染沿射线累积颜色和密度。NeuS:将表面表示为SDF零集,改进体积渲染权重函数(无偏性+遮挡自适应),提高表面重建精度。后续改进:Voxurf(粗到细训练)、VMesh(混合隐式/显式表示)、DMTet(直接优化重建表面)。神经辐射场(NeRF)重建NeRF通过MLP学习5D辐射场(位置+方向→颜色+密度),实现高保真新视角合成。基本原理:F(x,θ,φ)→(c,σ)。位置编码γ(v)增强高频信息。体积渲染沿射线累积颜色和密度。NeuS:将表面表示为SDF零集,改进体积渲染权重函数(无偏性+遮挡自适应),提高表面重建精度。后续改进:Voxurf(粗到细训练)、VMesh(混合隐式/显式表示)、DMTet(直接优化重建表面)。3D高斯溅射(3DGS)3DGS通过大量可微3D高斯基元显式表示场景,实现实时高质量渲染(>100FPS),是NeRF的有力竞争者。3DGS表示:每个基元参数=均值μ、协方差Σ(缩放s+旋转q)、不透明度θ、颜色c(球谐函数)。渲染(Splatting):基元投影到2D→按深度排序→Alpha混合合成像素颜色。动态场景处理:PVG(时间相关均值/不透明度)、StreetGaussians(BBOX控制动态车辆)、HUGS(语义/光流监督)、DrivingGaussian(LiDAR先验+增量静态高斯解决大场景累积误差)。3D高斯溅射(3DGS)3DGS通过大量可微3D高斯基元显式表示场景,实现实时高质量渲染(>100FPS),是NeRF的有力竞争者。3DGS表示:每个基元参数=均值μ、协方差Σ(缩放s+旋转q)、不透明度θ、颜色c(球谐函数)。渲染(Splatting):基元投影到2D→按深度排序→Alpha混合合成像素颜色。动态场景处理:PVG(时间相关均值/不透明度)、StreetGaussians(BBOX控制动态车辆)、HUGS(语义/光流监督)、DrivingGaussian(LiDAR先验+增量静态高斯解决大场景累积误差)。3D高斯溅射(3DGS)3DGS通过大量可微3D高斯基元显式表示场景,实现实时高质量渲染(>100FPS),是NeRF的有力竞争者。3DGS表示:每个基元参数=均值μ、协方差Σ(缩放s+旋转q)、不透明度θ、颜色c(球谐函数)。渲染(Splatting):基元投影到2D→按深度排序→Alpha混合合成像素颜色。动态场景处理:PVG(时间相关均值/不透明度)、StreetGaussians(BBOX控制动态车辆)、HUGS(语义/光流监督)、DrivingGaussian(LiDAR先验+增量静态高斯解决大场景累积误差)。3D高斯溅射(3DGS)3DGS通过大量可微3D高斯基元显式表示场景,实现实时高质量渲染(>100FPS),是NeRF的有力竞争者。3DGS表示:每个基元参数=均值μ、协方差Σ(缩放s+旋转q)、不透明度θ、颜色c(球谐函数)。渲染(Splatting):基元投影到2D→按深度排序→Alpha混合合成像素颜色。动态场景处理:PVG(时间相关均值/不透明度)、StreetGaussians(BBOX控制动态车辆)、HUGS(语义/光流监督)、DrivingGaussian(LiDAR先验+增量静态高斯解决大场景累积误差)。案例:智能驾驶中的稠密点云重建(StreetSurf)StreetSurf将驾驶场景划分为近景(NeuS,几何精度)、远景(NeRF++,渲染质量)和天空(MLP),实现高质量场景重建和仿真。近景:长窄立方体空间+NeuS+哈希网格+路面初始化+多阶段射线步进。远景:超立方体NeRF+++多分辨率哈希网格+倒立方体变形+立方体壳层采样。天空:定向MLP处理,配合2D语义分割精确区分。输出:场景网格、渲染图、法向图、深度图,精度高且一致。可用于LiDAR仿真(ChamferDistance仅0.067)。谢谢大家!
36/36智能驾驶与多维重建
第7章
智能驾驶云端建图
智能驾驶教学团队1行车场景的建图方案2行车场景的定位方案3泊车场景的建图方案4泊车场景的定位方案5视觉建图与定位案例三维物体表面表达方式高精地图(HDMap)具有厘米级精度和丰富元素(物理层/拓扑层/定位图层),但覆盖范围有限、鲜度低。物理层:基础图层(三维地理空间)+几何图层(车道中心线/边界/路面高程)。拓扑层:车道连接关系(前驱/后继/左右相邻)、十字路口虚拟车道、灯牌与车道关联。定位图层:LiDAR点云图层或视觉关键点图层,应对隧道/城区峡谷等定位退化场景。地图引擎:资源调度+导航支持。挑战:覆盖不足(仅高速和部分城区)、鲜度低、法规限制。三维物体表面表达方式高精地图(HDMap)具有厘米级精度和丰富元素(物理层/拓扑层/定位图层),但覆盖范围有限、鲜度低。物理层:基础图层(三维地理空间)+几何图层(车道中心线/边界/路面高程)。拓扑层:车道连接关系(前驱/后继/左右相邻)、十字路口虚拟车道、灯牌与车道关联。定位图层:LiDAR点云图层或视觉关键点图层,应对隧道/城区峡谷等定位退化场景。地图引擎:资源调度+导航支持。挑战:覆盖不足(仅高速和部分城区)、鲜度低、法规限制。高精地图构建与众包建图高精地图通过LiDAR+高精度定位采集制作,众包建图利用量产车辆降低采集成本、提升鲜度。高精地图构建(百度Apollo):数据采集(64线+16线LiDAR/GPS/IMU/相机)→数据处理(RTK+SLAM点云拼接)→元素识别(深度学习)→人工验证。众包建图:单趟成图(车载感知+GPS/IMU/轮速计)→云端聚合(元素匹配+图优化)→自动化地图更新。众包挑战:数据一致性差(不同车辆传感器)、车载算力不足、车队规模小。重感知轻地图重感知轻地图模式通过BEV+Transformer提升车端感知能力,降低对高精地图的依赖。SDPro地图:精度米级,侧重拓扑关系(车道数目/关联关系)和超视距感知要素(坡度曲率)。记忆行车:用户路线多次重建,实现天级别地图更新。对比:重地图(HDMap)→轻地图(SDPro)→无图(仅SD导航地图)。矢量地图矢量地图通过点/线/面几何元素表示地理实体,VectorMapNet实现端到端BEV矢量地图生成。矢量地图vs高精地图:矢量地图精度米级,侧重基本地理要素;高精地图厘米级,包含车道/交通设施等丰富信息。矢量地图矢量地图通过点/线/面几何元素表示地理实体,VectorMapNet实现端到端BEV矢量地图生成。VectorMapNet:车载传感器→BEV特征→预测稀疏多段线元素(高清地图几何结构),省去后处理步骤。行车场景定位方案——基于地图的定位基于地图的定位通过2D感知或BEV感知结果与先验地图匹配,结合多传感器融合实现全局定位。2D感知定位:前视图像感知(车道线/灯牌杆等)→与矢量地图匹配→EKF融合GPS/轮速计→输出全局姿态。行车场景定位方案——基于地图的定位基于地图的定位通过2D感知或BEV感知结果与先验地图匹配,结合多传感器融合实现全局定位。BEV感知定位(BEV-Locator):周视图像→Transformer转BEV+HDMap编码→跨模态Transformer融合→MLP输出6自由度姿态。行车场景定位方案——基于地图的定位基于地图的定位通过2D感知或BEV感知结果与先验地图匹配,结合多传感器融合实现全局定位。关键点图层定位:SfM重建稀疏3D点云,全局描述子(场景识别)+局部描述子(PnP位姿计算)。Relo
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 辽宁省阜新市博大教育2027届物理高二第一学期期中监测试题含解析
- 2026年全媒体运营师招聘考试全真模拟试卷内容策划与推广专项卷
- 2026年采购工程师题库及答案详解
- 2026年广东省东莞市继续教育公需科目模拟试卷及答案详解
- 2026年电工(高级)操作证理论考试题库及答案详解
- 2026年基础金融知识考试题库单选题及答案详解
- 2026年四川省八年级生物上册第5单元生物多样性测试卷
- 2026年科技档案的管理与发展
- 2026年连锁经营三级题库及答案详解
- 2026年中国防火板行业分析与投资潜力分析报告
- 高一学生生涯规划讲座
- 两人合伙人协议书2024年
- 聪明的投资者-
- 2024年贵州省粮食储备集团有限公司招聘笔试参考题库附带答案详解
- 脑出血患者围手术期护理
- 福建省泉州白濑水利枢纽工程环评
- 地理学基础一章
- 项目总结报告范文
- 云南中环 表D-5参比方法评估气态污染物CEMS(含氧量)准确度
- JJG 1011-2018角膜曲率计
- 水岸山居调研课件
评论
0/150
提交评论