【单视域行人重识别算法设计案例分析5500字】_第1页
【单视域行人重识别算法设计案例分析5500字】_第2页
【单视域行人重识别算法设计案例分析5500字】_第3页
【单视域行人重识别算法设计案例分析5500字】_第4页
【单视域行人重识别算法设计案例分析5500字】_第5页
已阅读5页,还剩4页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

PAGE4单视域行人重识别算法设计案例分析目录TOC\o"1-3"\h\u3221单视域行人重识别算法设计案例分析 157651.1基于组合损失动态训练的金字塔模型构建 2259181.1.1金字塔模型结构设计 2254421.1.2组合损失动态训练 4230991.2基于负样本的自适应度量学习模型 6208161.2.1改进的在线自适应度量学习模型 627831.2.2度量迭代策略 8因目前多目标追踪算法存在技术瓶颈,导致通过视频获得的行人轨迹存在断裂、漂移等情况。异常徘徊行为的识别需要对行人轨迹进行分析和判断,因此轨迹的断裂和漂移给异常徘徊行为的识别造成困难。为获得完整的轨迹信息,本文采用行人重识别方法对行人图像进行匹配,并根据实际应用需求对行人重识别算法进行改进。本章首先构建了基于RESNET-101网络的行人重识别金字塔模型,并对模型进行多损失动态训练,以提取行人有效的表观特征。其次,针对训练数据集与应用场景中的行人图像存在领域差异的问题,挖掘训练数据集中的假阳样本,进行基于负样本的在线自适应度量学习,最大化正样本和负样本之间的距离,进行行人表观特征的有效匹配。本章研究任务和目的如图1.1所示。图1.1第3章研究框架Fig.1.1TheresearchframeworkofChapter31.1基于组合损失动态训练的金字塔模型构建1.1.1金字塔模型结构设计本章的研究目的为进行行人重识别,以获取行人在单视域的完整轨迹。结合2.2.1小节中行人重识别的相关研究分析,本文基于图像对行人表观特征进行提取。为有效提取行人图像的全局信息和局部信息,本文将金字塔模型ADDINEN.CITE<EndNote><Cite><Author>Zheng</Author><Year>2019</Year><RecNum>125</RecNum><DisplayText><styleface="superscript">[41]</style></DisplayText><record><rec-number>125</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618042970">125</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Zheng,Feng</author><author>Deng,Cheng</author><author>Sun,Xing</author><author>Jiang,Xinyang</author><author>Guo,Xiaowei</author><author>Yu,Zongqiao</author><author>Huang,Feiyue</author><author>Ji,Rongrong</author></authors></contributors><titles><title>Pyramidalpersonre-identificationviamulti-lossdynamictraining</title><secondary-title>ProceedingsoftheIEEE/CVFConferenceonComputerVisionandPatternRecognition</secondary-title></titles><pages>8514-8522</pages><dates><year>2019</year></dates><urls></urls></record></Cite></EndNote>[49]应用于行人图像的表观特征学习过程。模型以RESNET101网络作为骨干网络,将金字塔结构融入到模型构建中。首先,对行人图像特征进行分解和合并,构成金字塔结构。将通过骨干网络提取的完整特征图M分为n个基础部分。设M=BN(I),M为C*H*W的张量,其中C为编码通道数,W和H分别为此张量的空间长宽,则每个基础部分的特征图大小为C*H/n*W。从底层的n个部分开始对特征图进行逐层合并。更高一层的分支由前一层的对应分支及其左右邻域组合而成。将模型的滑动步长设置为1,则模型中的每一层分支数都比前一层减少1。模型顶层有且仅有一个分支即行人图像的完整特征图,模型结构如图1.2所示。模型中第l层的第k个特征子图定义如下:(1.1)其中,1:C表示索引为1至C的所有通道,本文采用RGB通道C=3。金字塔模型P是一个从细到粗的映射,每层映射用于捕捉不同空间尺度的判别信息。金字塔模型中既包含全局特征图M,也包含局部特征图PCB(Part-basedConvolutionalBaseline)ADDINEN.CITE<EndNote><Cite><Author>Sun</Author><Year>2018</Year><RecNum>126</RecNum><DisplayText><styleface="superscript">[42]</style></DisplayText><record><rec-number>126</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618043011">126</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Sun,Yifan</author><author>Zheng,Liang</author><author>Yang,Yi</author><author>Tian,Qi</author><author>Wang,Shengjin</author></authors></contributors><titles><title>Beyondpartmodels:Personretrievalwithrefinedpartpooling(andastrongconvolutionalbaseline)</title><secondary-title>ProceedingsoftheEuropeanconferenceoncomputervision(ECCV)</secondary-title></titles><pages>480-496</pages><dates><year>2018</year></dates><urls></urls></record></Cite></EndNote>[46]。模型中共有层,第层有个分支。随着索引的增大,特征图从细到粗,形成金字塔结构。图1.2行人重识别金字塔网络结构Fig.1.2ThepyramidstructureofPedestrianre-identificationnetwork其次,将模型中的每一个分支作为一个子图,进行模型的基本运算。为了捕获子图中不同通道的统计属性,将所有分支的特征图分别输入到全局平均池化层(GMP)和全局最大池化层(GAP)进行特征降维和融合。将融合后的特征输入到卷积层中进行卷积。为保障网络模型的训练稳定、加快训练速度、防止过拟合,对特征进行批归一化和Relu激活。最终生成一个降维的特征向量用于后续的行人重识别任务。记为,表示模型的基本运算。图1.3基本运算单元结构Fig.1.3TheBasicoperationalunitstructure综上,行人重识别金字塔模型构建完成。为使模型输出具有足够判别能力的特征表示,还需要对模型进行有效的训练。研究表明多训练任务学习能够通过适当提取任务间共享信息来提高检测器的性能。其原因是多个训练任务可以通过探索关联性而相互受益,从而提高泛化性能。因此,需要对金字塔模型的训练过程进行设计,以获取行人图像更显著的特征表示。假设指的是包括BN、P和BOs在内的所有嵌入操作,则可将特征简单表示为。后续,通过计算查询图像和待匹配图库G中图像由本模型得到的表观表示的距离,并对其进行排序来完成再识别任务。1.1.2组合损失动态训练为了使模型具有足够的判别能力,使用识别损失和三元组损失ADDINEN.CITE<EndNote><Cite><Author>Kumar</Author><Year>2010</Year><RecNum>127</RecNum><DisplayText><styleface="superscript">[43,44]</style></DisplayText><record><rec-number>127</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618043087">127</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Kumar,MPawan</author><author>Packer,Benjamin</author><author>Koller,Daphne</author></authors></contributors><titles><title>Self-PacedLearningforLatentVariableModels</title><secondary-title>NIPS</secondary-title></titles><pages>2</pages><volume>1</volume><dates><year>2010</year></dates><urls></urls></record></Cite><Cite><Author>Wang</Author><Year>2018</Year><RecNum>178</RecNum><record><rec-number>178</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618282029">178</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Wang,Guanshuo</author><author>Yuan,Yufeng</author><author>Chen,Xiong</author><author>Li,Jiwei</author><author>Zhou,Xi</author></authors></contributors><titles><title>Learningdiscriminativefeatureswithmultiplegranularitiesforpersonre-identification</title><secondary-title>Proceedingsofthe26thACMinternationalconferenceonMultimedia</secondary-title></titles><pages>274-282</pages><dates><year>2018</year></dates><urls></urls></record></Cite></EndNote>[47,48]对金字塔模型进行训练。识别损失任务以Softmax为激活函数,如公式1.2,以每个分支特征作为输入。在行人重识别问题中识别损失的定义与一般分类问题中点损失的定义一致,如公式1.3所示。三元组损失属于度量学习领域的研究范畴。将金字塔结构中的各层进行全连接形成关于行人图像的融合特征,将融合后的完整特征作为三元组损失任务的输入。三元组损失的具体定义如公式1.4,对于设定的三元组(基准样本、正样本和负样本:基准样本与正样本为同类样本,与负样本为异类样本),三元组损失训练的目的是学习到一个特征空间,在该空间中基准样本与正样本的特征距离更近,与负样本的特征距离更远,使得类内间距更小,类间间距更大。(1.2)(1.3)其中,为行人图像的数量,为输入图像对应的行人身份标签,表示softmax函数,为分支中标记为的行人图像的全连接层参数矩阵。(1.4)是控制类内和类间距离差异的边缘超参数,N是可获得的三元组数量。当式1.4大于0时三元组损失对网络的反向传播和参数更新产生作用。上述两种损失的应用并不新颖,然而如何将两者有效的集成起来仍是个值得研究的问题。目前的大多数组合损失方法通常对任务进行并行训练,使用平衡参数对任务之间进行加权,并且将一些任务作为正则化项。平衡参数在训练过程中为固定常数,但随着模型的迭代更新,不同任务的训练状态是不断变化的,平衡参数应当是不断变化的。并且整个行人重识别模型的性能严格取决于一个合适的参数,通过手工测试确定超参数的过程是十分困难且偶然的。因此,需要对识别损失任务和三元组损失任务进行有效的结合,避免两者之间的采样和训练冲突。识别损失的训练需要对样本进行随机小批量的采样,而三元组损失要求对指定样本的正负样本分别采样。针对解决二者之间的采样冲突,设计不平衡采样策略,以确保用于训练的随机小批量样本中存在有效的三元组。针对二者不一致的训练目的难以通过平衡参数得到协调的问题,设计一种动态训练的方法,在训练过程中同步进行采样方式的调整,以对金字塔模型进行有效的组合损失训练。首先,设计了一种动态权重调整策略,以实现两种损失任务的动态训练。首先,定义了一个性能度量来估计两种损失在每轮迭代中减小的可能性。设为t损失()在最近轮迭代中的平均损失。利用指数移动平均法对t损失在本轮中的损失进行估计,如公式1.5。其中,是一个折算系数,,则t损失在本轮迭代中减小的可能性定义为公式1.6。(1.5)(1.6)利用min函数对进行归一化处理,减小采样偶然性对损失选择的影响,使动态训练过程呈现平滑而稳定的状态。表示t损失在本轮迭代中没有减小,越大损失t陷入局部极小值的概率就越大。本文借鉴焦点损失(Focalloss)对交叉熵损失(CrossEntropyloss)的改进,降低简单采样的权重,增加困难样本采样的权重,定义函数对权重进行控制:(1.7)其中,γ控制聚焦强度,为超参数。对t损失任务的权重进行度量,以选择本轮迭代要优化的期望损失类别。因此,迭代的优化总目标表示为公式1.8。(1.8)其次,为了进行有效的训练,分别针对识别损失任务和三元组任务进行随机抽样和三元组抽样,并在训练过程中同步进行采样方式的调整。随机抽样通过设定抽样批次和每批次的样本数量,即batch的大小对样本进行等概率抽样。为保证三元组采样的ID平衡,设计以下采样策略:首先随机选取8个行人身份ID,再对每个身份ID随机选取8个图像,构成每个batch的采样。这种采样策略能够实现对最大类内间距和最小类间间距的硬性正/负挖掘。当时,采用随机小批量采样,由识别损失主导任务的训练。因为识别损失的收敛速度快而三元组损失的收敛速度慢,所以在开始训练的时候,总是由识别损失主导训练。此时模型处于不成熟状态,所有样本的被采样概率相同。某种程度上进行随机小批量采样使得基于硬采样的三元组损失任务失效,三元组损失任务没有在模型的优化过程中展现至关重要的作用。此时的模型模型迭代过程类似于ADDINEN.CITE<EndNote><Cite><Author>Kumar</Author><Year>2010</Year><RecNum>127</RecNum><DisplayText><styleface="superscript">[43]</style></DisplayText><record><rec-number>127</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618043087">127</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Kumar,MPawan</author><author>Packer,Benjamin</author><author>Koller,Daphne</author></authors></contributors><titles><title>Self-PacedLearningforLatentVariableModels</title><secondary-title>NIPS</secondary-title></titles><pages>2</pages><volume>1</volume><dates><year>2010</year></dates><urls></urls></record></Cite></EndNote>[47]中分阶段训练的第一阶段。模型首先进行简单的随机采样,经过一段时间的训练后硬三元组样本采样才会被采用。虽然三元组采样在此阶段中没有发挥足够重要的作用,但两种损失任务的重要程度是相同的,我们仍然采用公式1.8对其联合损失进行计算。当,三元组损失主导优化过程时,公式1.8中的识别损失与三元组损失均能够被优化,因为硬采样的使用并不会影响识别的优化。这种优化方式能够有效避免两损失任务结合过程中复杂的参数调整过程,无缝过渡识别损失和三元组损失,进行联合学习,提高了算法性能。1.2基于负样本的自适应度量学习模型常用的行人重识别解决方案是利用官方数据集对模型进行训练,得到行人重识别预训练模型,将预训练模型直接应用到在线的无标签测试数据上。但由于训练数据和测试数据之间存在领域差异,预训练模型在实际应用中的性能受到限制,严重影响行人重识别模型的识别准确度。因此,本节提出基于负样本的自适应度量学习模型,解决领域差异的问题。1.2.1改进的在线自适应度量学习模型领域差异主要体现为把训练好的模型在目标域上进行测试,较训练域模型性能存在巨大下降。Zhou等ADDINEN.CITE<EndNote><Cite><Author>Zhou</Author><Year>2020</Year><RecNum>128</RecNum><DisplayText><styleface="superscript">[45]</style></DisplayText><record><rec-number>128</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618043126">128</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Zhou,Jiahuan</author><author>Su,Bing</author><author>Wu,Ying</author></authors></contributors><titles><title>OnlineJointMulti-MetricAdaptationFromFrequentSharing-SubsetMiningforPersonRe-Identification</title><secondary-title>ProceedingsoftheIEEE/CVFConferenceonComputerVisionandPatternRecognition</secondary-title></titles><pages>2909-2918</pages><dates><year>2020</year></dates><urls></urls></record></Cite></EndNote>[49]中对目前表现优秀的6个算法进行了跨数据域的测试,这些算法通过在Market-1501数据集上进行训练,得到的top1结果的准确率均达到了85%以上,而模型在DukeMTMC-reid数据集上的top1测试准确率只有40%。这是由于Market-1501数据集采集于夏天的国内校园,行人多着短袖,色彩鲜明,而DukeMTMC-reid数据集采集于冬天的国外校园,色彩暗沉。为了使训练模型在实际场景中达到较好的识别效果,针对领域差异问题,本节设计了在线的自适应度量学习模型,对行人图像的度量进行在线学习。本阶段学习模型的任务为通过学习训练集中对识别造成干扰的假阳性样本与实际正样本之间的差异,减小干扰特征的表达。本文采用最大间隔度量对特征权重矩阵进行学习,降低造成误判的特征权重,提高具有判别能力的特征权重,使学习到得特征度量矩阵能够更好的区分这些假阳性样本和查询样本的行人身份。并通过放松马氏距离矩阵的半正定约束,降低学习过程的复杂性,已有研究证明在这类学习任务中放松半正定约束能够与原有约束达到同样的效果,但训练速度和复杂程度大大降低ADDINEN.CITE<EndNote><Cite><Author>Fetaya</Author><Year>2015</Year><RecNum>129</RecNum><DisplayText><styleface="superscript">[46]</style></DisplayText><record><rec-number>129</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618043175">129</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Fetaya,Ethan</author><author>Ullman,Shimon</author></authors></contributors><titles><title>Learninglocalinvariantmahalanobisdistances</title><secondary-title>InternationalConferenceonMachineLearning</secondary-title></titles><pages>162-168</pages><dates><year>2015</year></dates><publisher>PMLR</publisher><urls></urls></record></Cite></EndNote>[50]。因本文模型的应用场景为实时监控系统,为了对实时产生的查询样本进行快速的响应,模型在闲时进行迭代和学习,将每个摄像头作为一个数据域,以当天累计的样本作为一个训练轮次,提升应用场景下单视域行人重识别性能。图1.4在线自适应度量学习模型结构示意图Fig.1.4Schematicdiagramofonlineadaptivemetriclearningmodelstructure在构建在线自适应度量学习模型之前,首先对全局度量学习过程进行明确,以梳理金字塔模型和在线自适应度量学习模型之间的关系。全局度量学习是通过训练集来学习单一的全局马氏度量矩阵MG的过程。其将特征提取器提取到的通用特征通过全局度量矩阵MG投影到另一个特征空间,在测试阶段查询图像和候选图库中的图像匹配过程为:(1.9)其中,是严格半正定的,W为特征权重向量,即特征的投影向量。多损失动态训练金字塔模型中金字塔结构和两损失训练任务就是在完成这一过程。全局度量矩阵的训练目的是降低训练测试集中所有样本的整体查询误差,因此当将模型迁移到实际场景中的某摄像头中的时候,由于摄像头捕捉的样本和训练集样本的差异,导致误差和失真。因此,在金字塔模型全局度量的基础上,提出基于负样本的在线自适应度量模型,以减小摄像头捕捉的真实样本和训练集样本的领域差异。通过增大假阳性样本与查询样本的间隔距离,降低对判断造成干扰的特征影响。本文受ADDINEN.CITE<EndNote><Cite><Author>Zhou</Author><Year>2017</Year><RecNum>130</RecNum><DisplayText><styleface="superscript">[47]</style></DisplayText><record><rec-number>130</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618043229">130</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Zhou,Jiahuan</author><author>Yu,Pei</author><author>Tang,Wei</author><author>Wu,Ying</author></authors></contributors><titles><title>Efficientonlinelocalmetricadaptationvianegativesamplesforpersonre-identification</title><secondary-title>ProceedingsoftheIEEEInternationalConferenceonComputerVision</secondary-title></titles><pages>2420-2428</pages><dates><year>2017</year></dates><urls></urls></record></Cite></EndNote>[47]中提出的在线局部度量自适应算法启发,进行二次设计和开发。ADDINEN.CITE<EndNote><Cite><Author>Zhou</Author><Year>2017</Year><RecNum>130</RecNum><DisplayText><styleface="superscript">[47]</style></DisplayText><record><rec-number>130</rec-number><foreign-keys><keyapp="EN"db-id="ed5rdwvs7pwa0ierxe4pwps3v50fefv2tzvd"timestamp="1618043229">130</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Zhou,Jiahuan</author><author>Yu,Pei</author><author>Tang,Wei</author><author>Wu,Ying</author></authors></contributors><titles><title>Efficientonlinelocalmetricadaptationvianegativesamplesforpersonre-identification</title><secondary-title>ProceedingsoftheIEEEInternationalConferenceonComputerVision</secondary-title></titles><pages>2420-2428</pages><dates><year>2017</year></dates><urls></urls></record></Cite></EndNote>[51]中针对每一个查询样本进行独立的负样本挖掘和自适应度量学习,与之不同的是本文针对每个查询样本进行硬负样本采样,以摄像头为单位进行自适应度量学习,通过只使用硬负样本训练,以最小训练代价完成每次迭代。具体来讲,针对查询图像,通过挖掘其硬负样本集,并进行训练,完成所在摄像头A的本地马氏距离矩阵的更新。通过应用上一小节的金字塔预训练模型计算得到。选取与表观特征相似度排序为topk的样本,作为查询样本的假阳性样本。因为数据集和实际场景的数据差异,能够轻松获得非常可靠的假阳性样本,假阳性样本集被表示为。从金字塔模型中可以得到正样本的全局特征映射向量和负样本的全局特征映射向量.通过最大化数据集中的假阳性样本与查询样本的距离,对局部度量进行在线学习,以进一步调整特定摄像头查询样本的局部相似性,如式1.10所示。(1.10)其中,k表示每个查询样本对应的假阳性样本数量,i表示查询样本对应的正样本数量;m表示每天产生的查询样本数量。正则化以得到一个针对特定摄像头的稳定局部度量。为了增大数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论