CN113449548B 更新物体识别模型的方法和装置 (华为技术有限公司)_第1页
CN113449548B 更新物体识别模型的方法和装置 (华为技术有限公司)_第2页
CN113449548B 更新物体识别模型的方法和装置 (华为技术有限公司)_第3页
CN113449548B 更新物体识别模型的方法和装置 (华为技术有限公司)_第4页
CN113449548B 更新物体识别模型的方法和装置 (华为技术有限公司)_第5页
已阅读5页,还剩56页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

A,2011.01.12A,2017.09.29A,2018.07.17A,2019.05.24本申请提供人工智能领域中的更新物体识别模型的方法和装置。本申请提供的技术方案所述第一语音信息用于指示所述目标图像中的目标物体的特征和用于表示所述第一类别的第2获取语音设备采集的第一语音信息,所述第一语音信息标物体的第一类别;根据所述目标图像和所述第一语音信息,更新第一物体识别模型,更根据所述第一标签和至少一类标签中每类标签的相似度,确定所使用第二物体识别模型,根据所述目标图像,确定所述在所述第一概率大于或等于预设的概率阈值时,将所述目标根据所述第一标签的语义特征和至少一类标签中每类标签的语义特征之间的相似度,其中所述第一标签与所述第一类标签的相似度大于所述第一标签与所述至少一类标所述第一标签的语义特征与所述第一类标签的语义特征之间的距离标物体为所述目标图像中位于所述第一物体指示的方向上且离所述第一物体最近的物体,根据所述边界框中的图像确定所述第一物体根据所述第一物体指示的方向,从所述多个显著区域中确定目标根据所述目标显著区域更新所述第一物体识别模型,其中,所述目3根据所述第一物体的目标类别确定所述第一物体所述获取模块还用于获取语义设备采集的第一语音信息,所述第一语所述目标图像中的目标物体的第一类别;根据所述第一标签和至少一类标签中每类标签的相似度,确定所使用第二物体识别模型,根据所述目标图像,确定所述在所述第一概率大于或等于预设的概率阈值时,将所述目标根据所述第一标签的语义特征和至少一类标签中每类标签的语义特征之间的相似度,其中,所述第一标签与所述第一类标签的相似度大于所述所述第一标签的语义特征与所述第一类标签的语义特征之间的距离标物体为所述目标图像中位于所述第一物体指示的方向上且离所述第一物体最近的物体,根据所述边界框中的图像确定所述第一物体根据所述第一物体指示的方向,从所述多个显著区域中确定目标根据所述目标显著区域更新所述第一物体识别模型,其中,所述目4根据所述第一物体的目标类别确定所述第一物体所述处理器用于执行所述存储器中存储的指令,以使得所述装置执行如所述处理器执行如权利要求1至5中任一项5[0004]随着人工智能技术的发展,物体识别已经不再仅仅是依靠传统的人工识别来实型来识别出手机等终端拍摄到的图像中的物体的类6所述第一类标签的相似度大于所述第一标签与所述至少一类标签中其他类标签的相似度,标签的语义特征与所述其他类标签的语义特类别标记到用户指定的目标物体,从而可以提高更新后的第一物体识别模型的识别准确图像中的所述第一物体的边界框;根据所述边界框中的图像确定所述第一物体指示的方7于获取摄像设备采集的目标图像;所述获取模块还用于获取语音设备采集的第一语音信于:根据所述第一标签的语义特征和至少一类标签中每类标签的语义特征之间的相似度,标签标记到用户指定的目标物体,从而可以提高更新后的第一物体识别模型的识别准确8所述第一物体的目标类别确定所述第一物体指示图像进行识别,以得到所述图像中的物体的类别标签为至少一类标签中的每类标签的概相似度大于所述第一标签与所述至少一类标签中其他类标签的标签与所述第一类标签的相似度大于所述第一标签与所述至少一类标签中其他类标签的述第一标签的语义特征与所述其他类标签的语义特述第一指示信息包括语音设备采集的语音信息或通过触摸装置采9识别模型是根据摄像设备采集的目标图像和语音设备采集的第一语音信息添加所述目标物体的特征和第一标签得到的,且所述目标物体的特征和所述第一标签之间具有对应关述第一标签与所述第一类标签的相似度大于所述第一标签与所述至少一类标签中其他类理器用于执行第十五方面或其中任意一种可能的实现方式在计算机上运行时,使得计算机执行第十五方面或其中任意一种可能的实现方式中的方[0074]图1示出一种人工智能主体框架示意图,该主体框架描述了人工智能系统总体工提供给基础平台提供的分布式计算系统中的智能芯片[0081]基础设施的上一层的数据用于表示人工智能领域的数据来源。数据涉及到图形、[0093]物体识别模型可以通过训练得到。下面结合图2介绍训练物体识别模型的一种示设备220基于数据库230中维护的训练数据训练得到物体识[0096]下面对训练设备220基于训练数据得到物体识别模型201进行描述,训练设备220练设备120输出的图像类别与原始图像标注的类别的差值小于一定的阈值,从而完成物体的是,训练设备220也不一定完全基于数据库230维护的训练数据进行物体识别模型201的[0098]根据训练设备220训练得到的物体识别模型201可以应用[0099]预处理模块213用于根据I/O接口212接收到的输入数据(如待处理图像)进行预处[0100]在执行设备210对输入数据进行预处理,或者在执行设备210的处理模块211执行提供给用户。户设备240中设置相应权限。用户可以在客户设备240查看执行设备210输出的类别识别结212直接将I/O接口212的输入数据及输出I/O接口212的输出结果,作为新的样本数据存入[0108]神经网络可以是由神经单元组成的,神经单元可以是指以xs和截距1为输入的运第2个神经元的线性系数定义为上标3代表系数W所在的层数,而下标对应的是输出的作是使用一个可训练的滤波器与一个输入的图像或者卷积特征平面(featuremap)做卷图像上沿着水平方向一个像素接着一个像素(或两个像素接着两个像素……这取决于步长的权重值形成的各个权重矩阵可以用来从输入图像中提取信息,从而使得卷积神经网络[0132]在经过卷积层/池化层320的处理后,卷积神经网络300还不足以输出所需要的输而为了生成最终的输出信息(所需要的类信息或其他相关信息),卷积神经网络300需要利含的参数可以根据图像识别的相关训练数据进行预先训练(如图3由340至310方向的传播为反向传播)就会开始更新前面提到的各层的权重值以及偏别提取的特征均输入给全神经网络层430进行处理。神经网络层430可以包括多个隐含层,[0136]图5为本申请实施例提供的一种用于运行或训练物体识别模型的芯片的硬件结[0137]神经网络处理器NPU50作为协处理器挂载到主中央处理器(centralprocessing制运算电路503提取存储器(权重存储器或输入存储器)中矩阵A数据与矩阵B进行矩阵运算,得到的矩阵的部分结果或最终结果,保存在累加器层的网络计算,如池化(pooling),批归一化(batchnormalization),局部响应归一化(localresponsenormalizati[0141]在一些实现种,向量计算单元能507将经处理的输出的向量存储到统一缓存器[0143]权重数据直接通过存储单元访问控制器505(directmemoryaccesscontroller,DMAC)将外部存储器中的输入数据搬运到输入存储器501和/或统一存储器率同步动态随机存储器(doubledataratesynchronousdynamicrandomaccess[0148]其中,图3和图4所示的卷积神经网络中各层的运算可以由运算电路503或向量计[0149]如图6所示,本申请实施例提供了一种系统架构600。该系统架构包括本地设备[0151]用户可以操作各自的用户设备(例如本地设备601和本地设备602)与执行设备610[0152]每个用户的本地设备可以通过任何通信机制/通信标准的通信网络与执行设备610发送待识别图像,执行设备610利用其上部署的物体识别模型对待识别图像进行识别,识别模型对待识别图像进行识别。型来识别出手机等终端拍摄到的图像中的物体的类以运行用户对物体识别模型进行更新,以使得物体识别模型的识别结果可以满足用户需[0167]用户在使用机器人对其感兴趣的物体进行识别时,机器[0170]图7为本申请一个实施例的更新物体识别模型的方法的示意性流程图。如图4所[0183]目标物体的特征可以是第一物体识别模型对目标图像进行特征提取得到的。例每类标签可以包括第一物体识别模型的所有类别标签中的一个或[0194]例如,可以使用BERT模型来提取第一物体识别模型中每个类别标签的语义特BERT的全称为bidirectionalencoderrepresentationfromtran[0197]以第一物体识别模型的训练集包括ImageNet数据集为例,可以使用BERT模型对体识别模型输入的图像时能够推理出图像中的物[0200]以第一物体识别模型的训练集包括ImageNet数据集,且聚类得到上述200类标签[0201]下面结合图9介绍获取所述目标置信度以及根据目标置信度更新第一物体识别模[0205]第一标签与所述每类标签的中心标签之间的相似度可以通过第一标签的语义特[0206]第一标签的语义特征与所述每类标签的中心标签的语义特征之间的距离的一种[0211]S930,根据所述第一概率确定第一类别为所述目标物体的真实类别的目标置信[0217]由图10所示的示例可以看出,本申请中根据目标置信度来更新第一物体识别模[0218]可以理解的是,图9所示的方法中的第一标签不局限于是用户通过第一语音信息[0226]以第一物体包括手为例,可以使用单目标多框检测法(singleshotmulti-box[0227]以第一物体包括眼球为例,可以使用SSD检测法检测出人脸所在位置和人脸的边[0229]以第一物体包括手为例,可以使用训练好的分类模型对合的平均显著性概率值和非主体像素集合的平均显著性概率值,并求这两个概率值的比性区域中获取位于用户指示的方向上的目标显[0248]使用ImageNet数据集对应的1000类标签,对这1000类标签使用BERT模型提取特[0256]S1305,基于目标图像中的用户指示的方向(手势指示的方向or眼球指示的方向)[0257]例如,可以执行以下步骤获取用户指示的显著性区域:a)使用手部数据集训练入手部检测FastRCNN模型,获取手部位置区域;d)将手部位置区域输入手指方向分类模[0263]该装置1400可以实现前述任意一种方法。例如,获取模块1410用于执行S710和1504中还可以包括操作系统等其他运行进程所需的软件模块。操作系统可以为LINUXTM,1504可以包括易失性存储器(volatilememory),例如随机存取存储器(randomaccess算机软件产品存储在一个存储介质中,包括若干指令用以使得一台计算机设备(可以是个

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论