CN117011929B 一种头部姿态估计方法、装置、设备以及存储介质 (腾讯科技(深圳)有限公司)_第1页
CN117011929B 一种头部姿态估计方法、装置、设备以及存储介质 (腾讯科技(深圳)有限公司)_第2页
CN117011929B 一种头部姿态估计方法、装置、设备以及存储介质 (腾讯科技(深圳)有限公司)_第3页
CN117011929B 一种头部姿态估计方法、装置、设备以及存储介质 (腾讯科技(深圳)有限公司)_第4页
CN117011929B 一种头部姿态估计方法、装置、设备以及存储介质 (腾讯科技(深圳)有限公司)_第5页
已阅读5页,还剩51页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本申请实施例提供了一种头部姿态估计方一网络模型得到待识别图像中目标人脸图像的个二维关键点坐标的不确定度以及目标人脸图识别待识别图像中目标人脸图像对应的头部姿2将所述待识别图像输入第一网络模型得到所述待识别图像中目标人脸图像的二维关述第二分支网络用于识别得到所述三维关键点根据所述不确定度将所述二维关键点坐标集合中的各个二维关键点不确定度大于预设阈值的二维关键点坐标从所述二维关键点坐标集合中剔除得到中间二根据所述中间二维关键点坐标集合从所述三维关键点坐标集合中获取中间三维关键根据所述中间二维关键点坐标集合和所述中间三维关键点坐标集合识别所述待识别根据所述中间二维关键点坐标集合和所述中间三维关键点坐标集合利用PnP解算识别获取第一训练样本集,并建立第一初始网络模型,所述第一训练将所述第一训练样本集合输入所述特征提取网络得到所述第一训练样本集合中各个将所述特征表示输入所述初始第一分支网络得到预测二维关键点坐标集合以及所述根据所述预测二维关键点坐标集合、所述预测不确定度和所述真实二维根据所述第一损失值调整所述初始第一分支网络得到所述第一根据所述第一分支网络和所述第二分支网络得到所述第通过深度摄像头采集训练图像集合,所述训练图像集合中的各个训练将所述训练图像集合输入图像处理网络中输出所述训练3将所述训练图像集合输入所述图像处理网络得到所述训练图像中人脸图像的稀疏关根据所述人脸轮廓点从所述训练图像中获取所根据所述五官点将所述目标人脸图像水平对齐并缩放至目标尺寸得到所述训练样本7.根据权利要求3所述的方法,其特征在于,所述特征提取网络包括残差神经网络所述预测不确定度和所述真实二维关键点坐标集合计算第一根据所述预测三维关键点坐标集合和所述真实三维关键点坐标集合计算第二损失值利用回归损失函数根据所述预测三维关键点坐标集合和所述真实三维关键点坐标集获取第二训练样本集,并建立第二初始网络模型,所述第二训练将所述第二训练样本集合输入所述特征提取网络得到所述第二训练样本集合中各个将所述特征表示输入所述初始第一分支网络得到预测二维关键点坐标集合以及所述将所述预测二维关键点坐标集合和所述预测三维关键点坐标集合计算根据所述预测二维关键点坐标集合、所述预测不确定度和所述真实二维根据所述第一损失值、所述第二损失值和所述第三损失值调整所述10.根据权利要求9所述的方法,其特征在于,所述特征提取网络包括残差神经网络411.根据权利要求1至2中任一项或者权利要求4至8中任一项或者权利要求10所述的方将所述待处理图像输入图像预处理网络得到所述目标人脸图像根据所述人脸轮廓点从所述待处理图像中获取所根据所述五官点将所述目标人脸图像水平对齐并缩放至目标尺寸得到所述待识别图处理模块,用于将所述待识别图像输入第一网络模型得到所述待识别图输出模块,用于根据所述二维关键点坐标集合、所述不确定度和所述输出模块,具体用于根据所述不确定度将所述二维关键点坐标集根据所述中间二维关键点坐标集合从所述三维关键点坐标集合中获取中间三维关键根据所述中间二维关键点坐标集合和所述中间三维关键点坐标集合识别所述待识别二维关键点坐标集合和所述中间三维关键点坐标集合利用PnP解算识别所述待识别图像中该头部姿态估计装置还包括训练模块,用于将所述第一训取网络得到所述第一训练样本集合中各个训练样将所述特征表示输入所述初始第一分支网络得到预测二维关键点坐标集合以及所述根据所述预测二维关键点坐标集合、所述预测不确定度和所述真实二维5根据所述第一损失值调整所述初始第一分支网络得到所述第一根据所述第一分支网络和所述第二分支网络得到所述第将所述训练图像集合输入图像处理网络中输出所述训练根据所述人脸轮廓点从所述训练图像中获取所根据所述五官点将所述目标人脸图像水平对齐并缩放至目标尺寸得到所述训练样本18.根据权利要求14所述的装置,其特征在于,所述特征提取网络包括残差神经网络三维关键点坐标,所述计算网络用于根据二维关键点坐标和三维关键点坐标求解头部姿该头部姿态估计装置还包括训练模块,用于将所述第二训取网络得到所述第二训练样本集合中各个训练样将所述特征表示输入所述初始第一分支网络得到预测二维关键点坐标集合以及所述将所述预测二维关键点坐标集合和所述预测三维关键点坐标集合计算根据所述预测二维关键点坐标集合、所述预测不确定度和所述真实二维6根据所述第一损失值、所述第二损失值和所述第三损失值调整所述21.根据权利要求20所述的装置,其特征在于,该特征提取网络包括残差神经网络22.根据权利要求12至13中任一项或者权利要求15至19任一项或者权利要求21所述的将所述待处理图像输入图像预处理网络得到所述目标人脸图像根据所述人脸轮廓点从所述待处理图像中获取所根据所述五官点将所述目标人脸图像水平对齐并缩放至目标尺寸得到所述待识别图所述处理器用于执行所述存储器中的程序,所述处理器用于根据程所述总线系统用于连接所述存储器以及所述处理器,以使所述存储7比较主流的头部姿态估计方法,多为利用传统的运动传感器,另外就是通过三维(3_标的变化来实现对头部姿态的估计以及头部动作[0003]上述方法是基于求解3D到2D点对运动的方法(也称为Perspective_n_Point,8[0012]根据该中间二维关键点坐标集合从该三维关键点坐标集合中获取中间三维关键[0013]根据该中间二维关键点坐标集合和该中间三维关键点坐标集合识别该待识别图模块,具体用于根据该中间二维关键点坐标集合和该中间三维关键点坐标集合利用PnP解取网络层得到该第一训练样本集合中各个训练样[0017]将该特征表示输入该初始第一分支网络得到预测二维关键点坐标集合以及该预9[0026]根据该五官点将该目标人脸图像水平对齐并缩放至目标尺寸得到该训练样本集点坐标集合和该真实三维关键点坐标集合计算第取网络层得到该第二训练样本集合中各个训练样[0032]将该特征表示输入该初始第一分支网络得到预测二维关键点坐标集合以及该预[0053]图6为本申请实施例中待处理图像通过图像处理模型处理得到待识别图像的一个[0055]图7a为本申请实施例中待处理图像通过头部姿态估计之后生成的虚拟形象的一比较主流的头部姿态估计方法,多为利用传统的运动传感器,另外就是通过三维(3_[0064]计算机视觉技术(ComputerVision,CV)计算机视觉是一门研究如何使机器“看”系是以人的头部的中心或重心为原点,由人脸的一侧耳朵指向另一侧耳朵的方向为X轴方[0074]卷积层(Convolutionallayer,Conv)是指卷积神经网络层中由若干成的层状结构,卷积神经网络(ConvolutionalNeuralNetwork,CNN)是一种前馈神经网[0076]全连接层(FullyConnectedlayer,FC)是指该层状结构中的每一个结计的多个应用场景。例如,增强现实(AugmentedReality,AR)游戏、虚拟现实(Virtual设备1001和终端设备1002)通过网络200连接服务器300,服务器300连接数据库400,网络所支持的数据库模型来作分类,例如关系式、可扩展标记语言(ExtensibleMarkup所用查询语言来作分类,例如结构化查询语言(StructuredQueryLanguage,SQL)、[0081]在一些实施例中,服务器300可以执行本申请实施例提供的头部姿态估计方法以其具体流程可以如下:从终端设备100和/或数据库400中获取对应有标注有真实2D关键点网络模型对该第一训练样本集进行检测处理得到该第一训练样本集中各个人脸的预测2D关键点坐标对应的不确定度对应的第一损失值以及确定该预测3D关键点坐标对应的第二[0087]在该服务器300训练该第一网络模型时,该第一网络模型的初始模型架构可以包等CNN网络或者为具有特征金字塔的高分辨率网络(High_ResolutionnetV2P,[0088]在另一些实施例中,服务器300可以执行本申请实施例提供的头部姿态估计方法第二初始网络模型对该第二训练样本集进行检测处理得到该第二训练样本集中各个人脸该预测2D关键点坐标对应的不确定度对应的第一损失值以及确定该预测3D关键点坐标对应的第二损失值;然后再根据预测2D关键点坐标和该预测3D关键点坐标计算预测头部姿[0094]在该服务器300训练该第一网络模型时,该第一网络模型的初始模型架构可以包者AlexNet等CNN网络或者为具有特征金字塔的高分辨率网络(High_ResolutionnetV2P,输出的预测2D关键点坐标和不确定度以及该第二分支网络输出的预测3D关键点坐标计算终端设备100在图形界面110(示例性示出了图形界面1101和图形界面1102)中显示头部姿界面110(示例性示出了图形界面1101和图形界面1102)中显示[0101]步骤2、将该待识别图像通过该第一网络模型进行检测得到2D关键点坐标以及该确定度小于预测阈值的目标2D关键点坐标和目[0109]702、将该待识别图像输入第一网络模型得到该待识别图像中目标人脸图像的二分支网络将输出该待识别图像中的目标人脸图像的二维关键点坐标(即2D关键点坐标)集间二维关键点坐标利用PnP算法求解得到该目标人脸图像对应的头部姿态。一个示例性方戏人物构建为例进行说明。游戏设备通过摄像头采集用户的面部数据并进行头部姿态估显示的头部动作是歪头;然后通过本申请实施例提供的头部姿态估计得到如图7a中的(b)以在实现该虚拟形象的动作与用户的动作同步,有效实现用户与观看视频的用户的互动,[0117]获取一个40人约50万张图片的数据集,用来评估我们方法和其他方法的技术指[0123]处理模块202,用于将该待识别图像输入第一网络模型得到该待识别图像中目标[0127]该输出模块203,具体用于根据该不确定度将该二维关键点坐标集合中的各个二[0128]根据该中间二维关键点坐标集合从该三维关键点坐标集合中获取中间三维关键[0129]根据该中间二维关键点坐标集合和该中间三维关键点坐标集合识别该待识别图间三维关键点坐标集合利用PnP解算识别该待识别图像中目标人脸图像对[0135]该头部姿态估计装置还包括训练模块204,用于将该第一训练样本集合输入该特征提取网络层得到该第一训练样本集合中各个训练样本[0136]将该特征表示输入该初始第一分支网络得到预测二维关键点坐标集合以及该预训练图像集合中的各个训练图像包括人脸图像的三维点云数据以及[0147]根据该五官点将该目标人脸图像水平对齐并缩放至目标尺寸得到该训练样本集回归损失函数根据该预测三维关键点坐标集合和该真实三维关键点坐标集合计算第二损[0157]该头部姿态估计装置还包括训练模块204,用于将该第二训练样本集合输入该特征提取网络层得到该第二训练样本集合中各个训练样本[0158]将该特征表示输入该初始第一分支网络得到预测二维关键点坐标集合以及该预[0168]根据该五官点将该目标人脸图像水平对齐并缩放至目标尺寸得到该待识别图一个以上处理器)和存储器332,一个或一个以上存储应用程序342或数据344的存储介质[0173]图11示出的是与本申请实施例提供的终端设备相关的智能手机的部分结构的框包括但不限于天线、至少一个放大器、收发信机、耦合器、低噪声放大器(lownoise上述无线通信可以使用任一通信标准或协议,包括但不限于全球移动通讯系统(globalsystemofmobilecommunication,GSM)、通用分组无线服务(generalpacketradioservice,GPRS)、码分多址(codedivisionmultipleaccess,CDMA)、宽带码分多址(widebandcodedivisionmultipleaccess,W[0176]存储器420可用于存储软件程序以及模块,处理器480通过运行存储在存储器420[0177]输入单元430可用于接收输入的数字或字符信息,以

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论