版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
-PAGE44--PAGE43-基于投票的物体位姿估计算法分析目录TOC\o"1-3"\h\u4274基于投票的物体位姿估计算法分析 1230311.1 算法思想 119681.2 像素级投票网络PVNet 285371.2.1 网络结构 2280501.2.2 关键点选择 3307841.2.3 RANSAC算法 564861.3 3D-2DPnP 513121.1.1 PnP算法思路 6238911.1.2 PnP算法数学推导 7102311.1.2 不确定性驱动的PnP 872971.4 目标姿态估计实验及分析 858711.4.1 实验环境及硬件配置 8243711.4.2 数据集和预处理 9247561.4.3 目标姿态估计结果 131.1 算法思想在单张RGB图像的六自由度位姿估计问题上,很多位姿估计算法都采取两阶段的方法实现对目标物体的位姿估计,通常是先采用CNN检测关键点,然后通过PnP算法求解出物体的估计位姿,因此成功检测出准确的关键点是很重要的。但是很多方法仅仅通过回归图像坐标或热图确定关键点,在处于遮挡截断情况下时目标物体的部分关键点往往是不可见的,这使得这些算法在面对目标物体处于被遮挡和截断问题时有很大的困难,即使它们能够利用卷积神经网络来预测看不见的关键点,但泛化是很困难的。本文使用基于像素投票的方式能够很好地解决遮挡和截断情形下的关键点检测问题。基于像素投票的物体位姿估计算法分为两个阶段,第一阶段中PVNet先对输入RGB图像进行处理得到向量场预测和语义标签,之后利用PVNet输出的语义标签和从像素指向预测关键点的单位向量,随机选择一对像素的向量,把它们的交叉点看作为一个关键点,重复这样的过程的得到一个关键点假设集合,然后基于RANSAC投票生成关键点预测;第二阶段在已知目标物体的2D关键点位置后可以使用PnP算法求解目标物体的六自由度位姿。但是不同的一点是它考虑了不同关键点的可靠度不同,并引入了关键点概率分布的协方差矩阵,进一步提高了目标姿态估计的鲁棒性。算法基本流程如下图所示:图1.1基于像素投票位姿估计算法流程1.2 像素级投票网络PVNet1.2.1 网络结构本文采用的PVNet网络结构是在基于ResNet-18网络模型的进行修改,网络模型如图1.2,在ResNet-18网络模型有三个部分的修改,第一部分是取消网络中的特征图大小为H=8×W=8时后续的池化,不对特征图进行下降采样,减少信息的损失。因为减少池化层改变了感受野,因此需要将Res-Net18里后续的卷积层替换为合适的空洞卷积层,空洞卷积的原理如图1.3,空洞卷积的优点是在不做池化损失信息的同时增大了感受野,使得卷积输出信息范围增大。同时需要将Res-Net18网络里的全连接层替换为卷积层采用全卷积的结构,使得输入图片的大小不受限制。图1.2网络结构图图1.3DilatedconvPVNet的输入为H×W×3的图像,用全卷积结构PVNet对它进行处理,输出为H×W×(K×2×C)的单位向量和类概率,输出结果如图1.4。图1.4网络输出结果1.2.2 关键点选择在目标物体位姿估计中,要求已知三维物体关键点的关键点,结合通过投票机制得到的2D关键点,再由PnP算法求解位姿。因此三维物体关键点的定义对关键点的定位影响很大,很多深度学习方法定义目标物体在3D包围框的八个角点为关键点如图1.5,显然2D图像中这8个角点距离目标物体图像像素距离较远,由于关键点假设是由从目标物体开始的矢量生成的,这些关键点距离目标物体像素的距离越远定位误差就越大,检测关键点的难度就越大。因此考虑到在目标物体表面选择关键点,我们使用最远点采样算法(FPS)选择关键点。图1.53D包围框最远点采样算法(FPS)是一种常用的采样算法,能够实现对样本的均匀采样,其基本原理如下:假设有n个点,要从里面按照FPS算法,采样出k个点。将所有点分类到两个集合A,B里面。A表示选中的点形成的集合,B表示未选中的点构成的集合。最远点采样算法的逻辑如下:每次从集合B里面选一个到集合A里面的点距离最大的点将其分类到A集合,A集合中的点就是我们采样得到的关键点集。初始情况下,集合A为空,集合B包括所有点。第一步从集合B中随机选一个点到A集合中。接着选第二个点,选出集合B中所有点中距离A中的点最远的点,将其分类到A集合中,此时集合A包含两个点,集合B包含n-1个点。选第三个点,这是最远点采样算法的核心;因为集合A中不止有一个点,所以我们假设集合B中一个点pB:先分别计算出pB到集合A中每个点的距离,再取pB使用最远点采样方法选择关键点的结果如下图1.6:图1.6最远点采样法的关键点分布1.2.3 RANSAC算法PVNet输出目标对应的语义标签以及每个像素趋于2D关键点XK的向量场预测,对于每个像素点P,其趋向于2D关键点XK的单位向量VV已知语义标签和单位向量Vkh最后,用目标物体的所有像素对关键点假设进行投票,关键点的投票分数的定义如下:w投票分数越高代表与更多的预测方向一致,其置信度更高,根据关键点假设可以估算关键点的空间概率分布,这里可以求出关键点XK的均值μk和协方差μk1.3 3D-2DPnP根据前面工作我们已经得到了目标物体的2D关键点位置,可以使用PnP算法求解6D姿态,但是本文的投票机制得出关键点信息是每个关键点的概率分布,所以区别于很多姿态估计算法中直接使用现有的PnP求解器求解,PVNet算法考虑了关键点置信度的差异和不确定性,使用不确定性驱动的PnP算法求解目标物体的6D姿态。1.1.1 PnP算法思路PnP问题就是解决在已知世界坐标系中三维物体关键点信息以及其在图像上的投影的情况时如何计算相机位姿或物体位姿的问题,PnP问题求解方法还有很多,例如直接线性变换(DLT)、EPnP、P3P、非线性优化方式等。我们接下来对PnP算法的讨论的前提是假设以下相机处于点Oc,P1、P2、P1为特征点。当n=1时,即只有一个特征点时,假设P1位于图像的中心,那么显然向量Oc当n=2时,即多了一个约束,显然OcP1P2形成一个三角形,由于P1、P2两点位置确定,三角形的边P1P2确定。再加上向量OcP1和OcP2,从Oc点射向特征点的方向角也能确定。于是能够计算出OcP1的长度=r1,OcP2的长度=r2。于是这种情况下得到两个球:以P1为球心,半径为r1的球A;以P2为球心,半径为r2的球B。显然,相机位于球A,球B的相交处,依旧是无数个解。当n=3时,即多了一个以P3为球心的球C,相机位于ABC三个球面的相交处,这次有4组解,其中一个正解就是相机真实的位姿。当n>3时,n=3时已经求出4个解,再加一个特征点就可以求出唯一正解,但是计算量过大,过于复杂,因此可以先通过3个特征点计算出4组解,根据公式:x将第四个点的世界坐标代入,能够得到在图像上的四个投影,将投影误差最小的作为我们的正解。1.1.2 PnP算法数学推导记世界坐标系中的三维坐标点为A,B,C,2D点为a,b,c其中a,b,c为A,B,C在相机成像平面上的投影。示意图如下:图1.7P3P问题示意图由余弦定理有:O两边同时除以,并记为,记为,得x记v=A有:x可以解得:(1−u)已知图像上2D点的位置,则公式中的余弦角已知,可以通过世界坐标系下A,B,C的坐标算出。未知的,求解这样一个二元二次方程组是困难的,需要用到吴消元法,最多得到四个解,使用验证点来确定最可能的解,从而得到相机坐标系下的3D坐标,再使用ICP计算相机的位姿信息。1.1.2 不确定性驱动的PnP因为PVNet网络中基于RANSAC投票的机制给出了每个关键点的空间概率分布,所以要考虑这种不确定性的带给姿态估计精度的影响。我们在前面式子中已经给出了关键点的均值μk以及协方差kmin
X因为PVNet网络中基于RANSAC投票的机制给出了每个关键点的空间概率分布,所以要考虑信息的不确定性,在原来公式中添加了协方差矩阵如下:Xk这里的Xk代表关键点的3D坐标,Xk是1.4 目标姿态估计实验及分析1.4.1 实验环境及硬件配置本项目使用数据集为LINEMOD数据集。LINEMOD数据集在深度学习目标姿态估计中被广泛应用,它是一个标准6D姿态检测数据集,数据集中包含13个子集,每个子集中包含1300张目标图像和目标3D模型相关的虚拟3D控制点文件。实验中OcclusionLINEMOD数据集用于测试,LINEMOD数据集和blender渲染合成的数据集作为训练数据进行训练。本实验环境配置如下:表1.SEQ表\*ARABIC\s11项目所用实验环境及设备参数类型名称参数显卡型号NvidiaGeforceRTX1050Ti操作系统Ubuntu18.0464位pytorch版本1.4CUDA版本CUDA10.1、cuDNNv7.6.5Python版本1.61.4.2 数据集和预处理(1)LINEMOD数据集LINEMOD数据集是一个有许多遮挡场景、低纹理目标等数据的数据集,它可以作为标准6D姿态检测数据集,LINEMOD格式数据集中包含JPEIGmages,Lable,Label_occlusion等文件。JPEGImages中存放的是训练集图片,格式为jpg,如图1.8所示:图1.8训练集样本但真正输入网络训练的并不是训练集中的所有图片,而是train.txt随机选择的图片作为训练集,如下图所示。图1.9训练集选取照片Labels文件夹下存放的是txt格式文件,每个文件对应一张训练集图片的关键点的标注信息如1.10图所示,第一个数据为类别编号,其余18个数据为关键点的坐标。图1.10训练集标注信息Mask文件下存放的是与JPEGImages文件中训练集图像对应的掩码图像,如图1.11所示:图1.11训练集掩码test.Txt文件夹下保存的是测试用的所有样本的绝对路径,train.txt中存在训练样本的所有路径,.ply文件中是目标物体的3D图像信息如下图1.12所示图1.12三维模型(2)基于渲染的训练数据合成为了避免产生过拟合,我们在训练集中加入了渲染合成的图像,使用Blender从3D模型合成渲染图像,对每个目标对象呈现均匀视点采样的10000幅图像,结合从SUN397数据集中随机的背景合成10000幅图像。基于渲染合成的训练数据如图1.13所示。图1.13基于渲染合成的训练数据(3)数据预处理首先获得图片索引以及高宽,并获得图片像素、2D关键点坐标以及图像掩码用于数据增强。首先对像素格式进行转换,再计算是否属于前景物体,若在前景物体则对图像进行随机角度旋转,此时像素、图像掩码、二维关键点坐标都会旋转,之后再对图像随机进行裁剪操作和改变图像大小,如果只有背景没有前景则直接进行裁剪和填充操作将图片变换到固定大小。具体代码实现如图1.14所示。图1.13数据增强1.4.3 目标姿态估计结果(1)测试模型检测效果图1.14cat测试检测效果在LINEMOD数据集上的测试结果如下图1.15所示。图1.15LINEMOD数据集测试结果在Occlusion_LINEMOD数据集上的测试结果,如图1.16所示。图1.16OccluedLINEMOD结果我们使用2D映射量化(2DProjectionmetric)和模型点平均3D距离量化(ADDmetric)这两个两个量化标准对我们的模型进行评估,2D映射量化通过计算给定的估计值和真实姿态的三维模型点投影之间的平均距离,当姿态距离小于5像素时我们认为姿态估计姿态正确。使用LINEMOD数据和合成数据训练的模型,在LINEMOD数据集进行测试的效果如表1.2所示。表1.2本文方法PVNet与常见的姿态估计方法的ADD(-s)评估方法SSD-6DBB8PVNetcat0.5145.279.34glue027.095.66duck032.852.58ape027.941.62eggbox8.940.099.15为了测试算法对遮挡的鲁棒性,我们使用LINEMOD和合成数据训练的模型来测
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年风扇行业创新成果与市场分析报告001
- 2026年辽宁鞍山钢都职业学院单招综合素质考试模拟试卷含完整答案详解(各地真题)
- 2026年山东明湖职业学院高职单招职业技能考试模拟试卷【夺冠】附答案详解
- 2025年内蒙古机电职业学院单招职业技能考试模拟试卷及完整答案详解(考点梳理)
- 2024年陕西咸阳渭城职业学院高职单招职业技能考试模拟试卷及参考答案详解(A卷)
- 2026年山东鲁安职业学院高职单招职业技能考试模拟试卷附完整答案详解【典优】
- 2025年长春职业技术学院高职单招职业适应性测试考试题库及答案详解【夺冠系列】
- 2027年湖北省武汉市高职单招职业技能考试模拟试卷及完整答案详解(夺冠)
- 2024年山东海阳职业学院单招综合素质考试模拟试卷及参考答案详解【巩固】
- 2026年饲用化工添加剂创新技术突破与应用报告
- 2026年周口市国有污水处理厂公开招聘工作人员19名笔试备考试题及答案详解
- 2026年上海市徐汇区社工招聘笔试真题(附答案)
- 2026年高中秋季开学军训蜕变新生班会
- 园林景观工程施工施工组织设计
- 交管12123学法减分题库200题(含答案解析2026完整版)
- 2026年晚期结直肠癌肝转移转化治疗临床指南
- 2026年湖北省中考道德与法治、历史合卷试卷(含答案)
- 农业机械托管服务合同书
- 2026年保安员(初级)证考试试题及答案(完整版)
- 2028年网络文学版权授权合同三篇
- 商品和服务税收分类编码表-财税实操
评论
0/150
提交评论