版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、浙江大学硕士学位论文 STYLEREF 标题,章标题(无序号) * MERGEFORMAT Abstract PAGE i基于协作式标注图像的垃圾标签检测和垃圾图像过滤方法研究摘要随着web的普及,越来越多的人上传图片和标注图片,这种由用户上传并添加标注的图片称为协作式标注图像,这些标注提供了大量语义信息,但由于用户标注的随意性造成一些标注与图像内容的关联性并不强,直接影响到协作式标注图像检索的准确性,因此,本文设计了一种垃圾标签检测和垃圾图像过滤方法,提高标注和图像之间的关联性,从而提高协作式标注图像检索的准确性。本文垃圾标签检测的方法是通过计算同一图像的所有标注词之间的语义相似性进行聚类,
2、得到的聚类标签较少的那类标签即为垃圾标签。其中标注词之间的语义相似性采用本文设计的多重信息源的标注语义相似性,它整合了标签的WordNet语义词典相似性以及标签的同现频率的统计特性,能够更加准确的描述标签之间的语义相关性。垃圾图像过滤方面,通过对同一标注下所有图像的视觉特征进行基于混合核的最大最小聚类从而过滤垃圾图像。混合核的方法更加准确的描述了图像的视觉相关性。垃圾标签检测和垃圾图像过滤互为补充,共同提高图像和标签之间的关联性。最后,本文设计了双曲可视化的图像显示界面。实验表明,本文方法能够较为准确的检测协作式标注图像的垃圾标签以及过滤垃圾图像,从而提高检索准确性。关键词:协作式标注,垃圾标
3、签,垃圾图像,WordNet语义词典,混合核,SIFT浙江大学硕士学位论文 Abstract浙江大学硕士学位论文 Abstract 目录 PAGE IV PAGE II目录 TOC o 1-3 h z u HYPERLINK l _Toc353041325 摘要 PAGEREF _Toc353041325 h i HYPERLINK l _Toc353041326 Abstract PAGEREF _Toc353041326 h ii HYPERLINK l _Toc353041327 图目录 PAGEREF _Toc353041327 h III HYPERLINK l _Toc353041
4、328 表目录 PAGEREF _Toc353041328 h V HYPERLINK l _Toc353041329 第1章 绪论 PAGEREF _Toc353041329 h 1 HYPERLINK l _Toc353041330 1.1研究背景及意义 PAGEREF _Toc353041330 h 1 HYPERLINK l _Toc353041331 1.2 国内外研究现状 PAGEREF _Toc353041331 h 2 HYPERLINK l _Toc353041332 1.3课题研究内容 PAGEREF _Toc353041332 h 3 HYPERLINK l _Toc35
5、3041333 1.4 论文结构安排 PAGEREF _Toc353041333 h 4 HYPERLINK l _Toc353041334 第2章垃圾标签检测 PAGEREF _Toc353041334 h 6 HYPERLINK l _Toc353041335 2.1 标签的可靠度分析 PAGEREF _Toc353041335 h 7 HYPERLINK l _Toc353041336 2.1.1发生频率 PAGEREF _Toc353041336 h 7 HYPERLINK l _Toc353041337 2.1.2 标签的同现频率 PAGEREF _Toc353041337 h 8
6、HYPERLINK l _Toc353041338 2.1.3 标签的可靠度评价函数 PAGEREF _Toc353041338 h 9 HYPERLINK l _Toc353041339 2.2 WordNet语义相似性 PAGEREF _Toc353041339 h 10 HYPERLINK l _Toc353041340 2.2.1 WordNet语义词典介绍 PAGEREF _Toc353041340 h 10 HYPERLINK l _Toc353041341 2.2.2 单词的WordNet语义相似性 PAGEREF _Toc353041341 h 11 HYPERLINK l _
7、Toc353041342 2.2.3 两个短语之间的WordNet语义相似性 PAGEREF _Toc353041342 h 15 HYPERLINK l _Toc353041343 2.3多重信息源的标签语义相似性上下文 PAGEREF _Toc353041343 h 17 HYPERLINK l _Toc353041344 2.3.1标签语义相似性描述 PAGEREF _Toc353041344 h 17 HYPERLINK l _Toc353041345 2.3.2语义相似性描述实验结果 PAGEREF _Toc353041345 h 18 HYPERLINK l _Toc3530413
8、46 2.4协作式标注图像垃圾标签检测 PAGEREF _Toc353041346 h 20 HYPERLINK l _Toc353041347 2.4.1最大最小聚类法 PAGEREF _Toc353041347 h 20 HYPERLINK l _Toc353041348 2.4.2 垃圾标签检测 PAGEREF _Toc353041348 h 21 HYPERLINK l _Toc353041349 2.4.3 实验结果与分析 PAGEREF _Toc353041349 h 22 HYPERLINK l _Toc353041350 2.5 本章小结 PAGEREF _Toc3530413
9、50 h 24 HYPERLINK l _Toc353041351 第3章垃圾图像过滤 PAGEREF _Toc353041351 h 25 HYPERLINK l _Toc353041352 3.1 标签与视觉内容的相关性 PAGEREF _Toc353041352 h 25 HYPERLINK l _Toc353041353 3.2 图像的混合核特征 PAGEREF _Toc353041353 h 26 HYPERLINK l _Toc353041354 3.2.1 颜色特征 PAGEREF _Toc353041354 h 26 HYPERLINK l _Toc353041355 3.2.
10、2 纹理特征 PAGEREF _Toc353041355 h 31 HYPERLINK l _Toc353041356 3.2.3图像感兴趣特征点的SIFT特征向量提取 PAGEREF _Toc353041356 h 34 HYPERLINK l _Toc353041357 3.2.4 图像视觉特征的归一化 PAGEREF _Toc353041357 h 39 HYPERLINK l _Toc353041358 3.2.5 混合核 PAGEREF _Toc353041358 h 39 HYPERLINK l _Toc353041359 3.2.6 混合核实验结果分析 PAGEREF _Toc3
11、53041359 h 42 HYPERLINK l _Toc353041360 3.3 同一标注的垃圾图像过滤 PAGEREF _Toc353041360 h 44 HYPERLINK l _Toc353041361 3.4 垃圾图像过滤实验结果与分析 PAGEREF _Toc353041361 h 45 HYPERLINK l _Toc353041362 3.5 本章小结 PAGEREF _Toc353041362 h 46 HYPERLINK l _Toc353041363 第4章双曲可视化显示 PAGEREF _Toc353041363 h 47 HYPERLINK l _Toc3530
12、41364 4.1 图像网络的可视化显示 PAGEREF _Toc353041364 h 47 HYPERLINK l _Toc353041365 4.1.1 双曲空间的介绍 PAGEREF _Toc353041365 h 48 HYPERLINK l _Toc353041366 4.1.2 布局 PAGEREF _Toc353041366 h 49 HYPERLINK l _Toc353041367 4.1.3 映射 PAGEREF _Toc353041367 h 51 HYPERLINK l _Toc353041368 4.1.4 动态显示 PAGEREF _Toc353041368 h
13、52 HYPERLINK l _Toc353041369 4.2 图像检索 PAGEREF _Toc353041369 h 53 HYPERLINK l _Toc353041370 4.3 本章小结 PAGEREF _Toc353041370 h 53 HYPERLINK l _Toc353041371 第5章实验结果与分析 PAGEREF _Toc353041371 h 54 HYPERLINK l _Toc353041372 5.1 总体设计方案 PAGEREF _Toc353041372 h 54 HYPERLINK l _Toc353041373 5.2 实验与分析 PAGEREF _
14、Toc353041373 h 58 HYPERLINK l _Toc353041374 5.2.1 实验环境 PAGEREF _Toc353041374 h 58 HYPERLINK l _Toc353041375 5.2.2 垃圾标签检测实验与分析 PAGEREF _Toc353041375 h 58 HYPERLINK l _Toc353041376 5.2.3 垃圾图像过滤实验与分析 PAGEREF _Toc353041376 h 61 HYPERLINK l _Toc353041377 5.2.4 协作式图像检索实验与分析 PAGEREF _Toc353041377 h 64 HYPE
15、RLINK l _Toc353041378 5.3 本章小结 PAGEREF _Toc353041378 h 70 HYPERLINK l _Toc353041379 第6章总结与展望 PAGEREF _Toc353041379 h 71 HYPERLINK l _Toc353041380 6.1 总结 PAGEREF _Toc353041380 h 71 HYPERLINK l _Toc353041381 6.2 展望 PAGEREF _Toc353041381 h 72 HYPERLINK l _Toc353041382 参考文献 PAGEREF _Toc353041382 h 74 HY
16、PERLINK l _Toc353041383 作者简历 PAGEREF _Toc353041383 h 79 HYPERLINK l _Toc353041384 致谢 PAGEREF _Toc353041384 h 80浙江大学硕士学位论文 STYLEREF 样式1 * MERGEFORMAT 表目录 PAGE V图目录 TOC h z c 图 HYPERLINK l _Toc359883796 图2.1 WordNet结构示意图 PAGEREF _Toc359883796 h 13 HYPERLINK l _Toc359883797 图2.2 WordNet语义相似度 PAGEREF _T
17、oc359883797 h 19 HYPERLINK l _Toc359883798 图2.3 多重信息源的标签语义相似性 PAGEREF _Toc359883798 h 20 HYPERLINK l _Toc359883799 图2.4 标注词对应的图像 PAGEREF _Toc359883799 h 22 HYPERLINK l _Toc359883800 图2.5 标签聚类 PAGEREF _Toc359883800 h 24 HYPERLINK l _Toc359883801 图 3.1 空间示意图 PAGEREF _Toc359883801 h 27 HYPERLINK l _Toc
18、359883802 图3.2 HSV的颜色空间示例图 PAGEREF _Toc359883802 h 28 HYPERLINK l _Toc359883803 图3.3 花朵和美食原图像 PAGEREF _Toc359883803 h 30 HYPERLINK l _Toc359883804 图3.4 花朵颜色直方图 PAGEREF _Toc359883804 h 30 HYPERLINK l _Toc359883805 图3.5 美食颜色直方图 PAGEREF _Toc359883805 h 30 HYPERLINK l _Toc359883806 图3.6 Gabor纹理特征 PAGERE
19、F _Toc359883806 h 33 HYPERLINK l _Toc359883807 图3.7 尺度空间的构建过程 PAGEREF _Toc359883807 h 35 HYPERLINK l _Toc359883808 图3.8 DOG尺度空间局部极值检测 PAGEREF _Toc359883808 h 36 HYPERLINK l _Toc359883809 图3.9 梯度方向直方图 PAGEREF _Toc359883809 h 37 HYPERLINK l _Toc359883810 图3.10 SIFT特征向量 PAGEREF _Toc359883810 h 38 HYPER
20、LINK l _Toc359883811 图3.11 恐龙原图像 PAGEREF _Toc359883811 h 38 HYPERLINK l _Toc359883812 图3.12 兴趣点的梯度向量 PAGEREF _Toc359883812 h 38 HYPERLINK l _Toc359883813 图3.13 混合核模型的建立过程 PAGEREF _Toc359883813 h 41 HYPERLINK l _Toc359883814 图3.14 恐龙检索结果 PAGEREF _Toc359883814 h 42 HYPERLINK l _Toc359883815 图3.15 权值选择
21、 PAGEREF _Toc359883815 h 43 HYPERLINK l _Toc359883816 图3.16 查准率对比 PAGEREF _Toc359883816 h 43 HYPERLINK l _Toc359883817 图3.17 查全率对比 PAGEREF _Toc359883817 h 44 HYPERLINK l _Toc359883818 图3.18 垃圾标签过滤结果 PAGEREF _Toc359883818 h 46 HYPERLINK l _Toc359883819 图4.1 返回图像的双曲显示过程 PAGEREF _Toc359883819 h 47 HYPE
22、RLINK l _Toc359883820 图4.2 欧式空间和双曲空间对比 PAGEREF _Toc359883820 h 48 HYPERLINK l _Toc359883821 图4.3 庞加莱投影原理 PAGEREF _Toc359883821 h 51 HYPERLINK l _Toc359883822 图4.4 动态显示过程 PAGEREF _Toc359883822 h 52 HYPERLINK l _Toc359883823 图5.1 总体方案设计 PAGEREF _Toc359883823 h 54 HYPERLINK l _Toc359883824 图5.2 标签的Word
23、Net语义相似性 PAGEREF _Toc359883824 h 55 HYPERLINK l _Toc359883825 图5.3 短语的语义相似性 PAGEREF _Toc359883825 h 56 HYPERLINK l _Toc359883826 图5.4 单词的语义相似性 PAGEREF _Toc359883826 h 57 HYPERLINK l _Toc359883827 图5.5 图像视觉相似性上下文 PAGEREF _Toc359883827 h 58 HYPERLINK l _Toc359883828 图5.6 垃圾标签检测正确率实验对比 PAGEREF _Toc3598
24、83828 h 59 HYPERLINK l _Toc359883829 图5.7 垃圾标签检测正确率与标签数量的关系 PAGEREF _Toc359883829 h 60 HYPERLINK l _Toc359883830 图5.8 dog标签所标注图像的垃圾图像过滤结果 PAGEREF _Toc359883830 h 61 HYPERLINK l _Toc359883831 图5.9 food标签所标注图像的垃圾图像过滤结果 PAGEREF _Toc359883831 h 62 HYPERLINK l _Toc359883832 图5.10 垃圾图像过滤正确率对比 PAGEREF _Toc
25、359883832 h 63 HYPERLINK l _Toc359883833 图5.11 垃圾图像过滤正确率与图像数量的关系 PAGEREF _Toc359883833 h 64 HYPERLINK l _Toc359883834 图5.12 drink检索返回结果 PAGEREF _Toc359883834 h 65 HYPERLINK l _Toc359883835 图5.13 拖动图像视图变换结果 PAGEREF _Toc359883835 h 66 HYPERLINK l _Toc359883836 图5.14 单独进行垃圾标签检测后drink检索结果 PAGEREF _Toc35
26、9883836 h 66 HYPERLINK l _Toc359883837 图5.15 仅垃圾图像过滤后drink检索结果 PAGEREF _Toc359883837 h 67 HYPERLINK l _Toc359883838 图5.16 sunset检索结果 PAGEREF _Toc359883838 h 68 HYPERLINK l _Toc359883839 图5.17 查准率对比 PAGEREF _Toc359883839 h 69 HYPERLINK l _Toc359883840 图5.18 查全率对比 PAGEREF _Toc359883840 h 69表目录 TOC h z
27、 c 表 HYPERLINK l _Toc352977574 表 2.1 部分标签的可靠度得分 垃圾标签检测 PAGE 2 PAGE 25垃圾标签检测由网络的普及使得更多的人使用网络来共享或者检索喜欢的图片,用户将图片上传到网站并对上传图片添加简短的标注,同样的,其他用户也会根据自己的认识对感兴趣的图片添加标注,由此得到的这一类在线图像就是我们所说的协作式标注图像,而图像的标注就是协作式标签,这样的标签是用户根据自己的理解对图片的注释,包含了大量的语义信息,对这类标签的有效利用,将能够大大提高协作式标注图像的检索准确性。然而,由于添加标签的用户的背景,关注点,专业知识等的不同,这类标签伴随着很
28、大的主动性,一些标签是与图像视觉内容相符合的,一些标签是与图像的视觉内容并不相符合的,同时,一些标注太过于主观性而过于偏离客观事实不具有普遍性,这类标签都属于垃圾标签,这类标签的存在,极大的影响了协作式标注图像的检索准确性,给用户带来极大的不便,因此,必须过滤掉。检测垃圾标签,首先需要分析标签的特征,协作式标签包含大量语义信息,因此,首先要获取的是标签的语义信息,我们称之为内在语义相似性上下文。标签消歧的方法对标签上下文信息的提取有着很深的依赖性,上下文语义内容获取的是否全面准确将直接影响到标签过滤结果的正确性。本文主要强调在基于词典的语义相似性上下文的概念。在协作式标注系统中根据共生标签的不
29、同定义,通常情况下,资源的标注词的语义相似性上下文的信息来源主要包括以下几个方面30:(1)同一个用户对同一资源进行的所有标注。(2)资源的所有标签,不仅仅包括当前用户的标注,也包括所有其他用户对该资源进行的标注。(3)当前用户所使用过的所有的标签,而不仅仅指对当前资源的标注。用户所使用的整个的词汇表或许能够为他所标注的标签是否为垃圾标签提供一些线索,用户词汇表应当被充分利用。(4)当用户的标签信息(可以是用户主动标注的)极度缺乏的时候,社区网络中所有用户接触过的标签也可以被使用采集有价值的信息。(5)整个协作式标注系统中所使用到的全部标签,具体的资源和用户不进行区分,以便于寻找当前标签含义的
30、普遍理解。大众分类法中对上下文信息的来源范围的设定是有一定价值的,其中包括从用户习惯性方面获取有用信息。但是用户习惯性数据需要在线支持,即使在线情况下也是很难从互联网上获取的,并且简单的信息无法获得真正的用户偏好,因此,本文中所提出的垃圾标签过滤算法并不考虑用户习惯性问题,而主要从用户对图像进行标注的标签以及描述信息入手,探索同一图像的所有标签之间的关联性,从而检测垃圾标签。概念本体论并不适用于协作式标注,因为概念本体论的IS-A模型是在概念层分析对象之间的关联,但是,大规模协作式标注的关联并不仅仅在概念层,他们上下文关系是描述标签之间关联性的一个重要信息这比IS-A模型复杂的多,每个图像标签
31、与多个标签之间的关联使得形成一个标签网络31。因此针对协作式标注的语义相似性,我们研究一种算法整合了标签的内在语义相似性和标签之间的统计信息,标签语义相似性采用WordNet语义词典计算标签之间的WordNet语义相似性,采用标签的同现频率描述标签之间的潜在语义相似性。本文垃圾标签检测的方法共分为两步:根据标签的发生频率和标签的同现频率分析标签的可靠度,可靠度低的为垃圾标签,从而初步检测垃圾标签。对一幅图像的所有标注进行聚类,聚类后标签数目较少的类的标签是这幅图像的垃圾标签,根据同一幅图像的标注之间的语义关系检测垃圾标签。2.1 标签的可靠度分析由于协作式标注图像的标注是用户自主添加的因此在添
32、加的时候难免会因为各种主观因素导致一些标注词并不能很好的描述图像的视觉内容,其中有一些词是拼写错误或者语法错误或者是使用错误的单词和短语,这一类型的错误可以根据大量标注的统计信息来获得,如果是一个正确的单词没有语法或者拼写的错误,那么这个单词出现的频率应当比错误单词出现的频率高的多,这种出现频率高的单词作为标签的可靠性也会比较高。另一方面,如果一个单词出现的频率并不是很高,但是却经常和一些可靠性较高的单词同时出现,那么这个单词的潜在可靠性就较高。本文结合标签的发生频率和和标签的同现频率来决定标签的可靠性得分,得分高于一定的阀值则判定为可靠标签,反之,则为垃圾标签。2.1.1发生频率协作式标注系
33、统由于用户标注的随意性,又由于在用户标注时并不对用户标注词进行正确性的检测,由此,会产生一些拼写错误的单词或短语,以及组合错误的短语,这些标注也是垃圾标签的一部分,针对垃圾标签的这一特性,可以利用标签的发生频率来过滤,即给定标注词被使用的频率,如果一个标注词频繁的出现则不仅能够说明这个单词是存在的,正确的,且能够表明这个单词有较高的使用频率,重要性较高,用这个单词做标注的可能性是较高的。同样的,如果标签的发生频率过低,说明标签被用户用来标注图像的次数较少,很可能是错误的单词或词组,或这是一些极为生僻的单词,这些单词包含的专业性太强,通常不具有普遍性,用户也很少会用此类标签进行检索,因此,本文将
34、这一类标注也认为是协作式标注图像的垃圾标签。由于协作式标注图像所有用户浏览者都可以对图像进行标注,因而,协作式标注的另一特点就是标注词众多,通常一幅图像可对应许多标注词,对大量的标注词进行统计分析可以得到标注词的普遍意义,初步检测垃圾标签。统计分析是指对所搜集并经过整理的大量统计资料,运用统计特有的方法进行系统的分析研究、判断推理,从定量分析入手,揭示社会经济现象一般特征和规律的过程。根据以上分析,标签的发生频率是标签重要性的一个重要衡量标准。标签的发生频率是指用这个标签作为图像标注的次数,它是衡量词语的重要性的一个关键因素。标签的发生频率越大,说明这个标签作为为图像的标注词的次数就越多,那么
35、就越有可能成为用户检索时关注的词,说明这个词是得到大众认可的词,它的可靠性自然就比较高。相反,如果在大规模在线标注图像中,一个标签的发生频率很小,说明很少用户使用这个标签,未来使用的可能也会很小,用户对这个词的认可度较低,很可能是垃圾标签。给定一图像标注,它的可靠性取决于用这一标签作为标注的图像数量,用这一标签的图像数量越多说明这一标签越受大众认可,可靠性就越高。2.1.2 标签的同现频率仅仅使用发生频率描述标签的可靠度是不准确的,两个标注的发生频率一样并不能表示他们具有相等的重要性了,因为标注的重要性还和与这个标签相关联的标注的数量有关。例如,标签a和b的发生频率相同,并且与a相关的标签也就
36、是与a共同标注一幅图像的标签有m个,而与b相关的标签有n个,但是m比n大得多,那么标签a的重要性会得到增强,b的重要性就没有a大了。互联网中判断网页重要性的PageRank方法与标签同现频率在思想上有相同之处32。PageRank方法可以较为准确的评价网站的重要性,事实上要完全客观的评价一个网站是否重要是很难的,显然评估网站的重要性是具有一定主观性的,但如果根据所有用户使用网站的统计特性即偏好性比如访问量方面分析网站的重要性也是具有普遍性的。因为当用户浏览或通过搜索引擎搜索网页时普遍会选择他们“重要”的网页,且如果大多数的用户都认为一个网站是重要的,那么这个网站就可以被认为是一个较为重要的网站
37、。网页之间通过相互的链接使之相互关联,PageRank的基本思想是:如果一个网页与很多优质的网页有链接,那么可以认为这个网页必定也是个优质的网页。也就是说假如许多权威的、重要的网页都链接了同一个网页,那么可以认为这个网页同样是比较权威且重要的,并且从内容上看这个网页与那些与它有链接关系的权威网页也是具有关联性的。同样的,标签的可靠性也可以借鉴PageRank的思想,假设标签w使用频率较高,并且有很多可靠性较高的词都和w同时出现,则说明这个标签和这些可靠性较高的标注词相似性较高,则标注词w的可靠性被认为也是较高的。因此,根据以上分析,标签的发生频率不太高的情况下,如果这个标注词频繁的和其他标注词
38、共同标注一幅图像,说明这个标注的重要性较高,那么它的可靠性也较高。因此,如果一个标注词的发生频率不高,但是同现频率很高,那么我们认为这个词很可能是可靠的。2.1.3 标签的可靠度评价函数综上所述,我们定义标签可靠性评价函数,对于给定的标签C,它的可靠度函数(C)依赖于:(1)它的发生频率t(C)(发生频率越高可靠性越高);(2)它的同现频率(C)(同现频率越高可靠性越高);对于标签C的发生频率t(C)等于用标签C的作为标注的图像数量,同现频率(C)等于同时用标签C和一个任意词汇表中标签做标注的图像数量。这样给定一个标签C,我们可将可靠性函数(C)定义为: (2.1)公式中前半部分描述标签C在大
39、规模图像标注数据中的发生频率t(C)的可靠度得分,后半部分描述了给定标签的同现频率(C)的可靠度得分,和为同发生频率和同现频率的可靠度得分的想关参数。表2.1列举了使用本文方法获得一部分图像标注的可靠度得分,统计所依据的是1000幅LabelMe的标注。从表2.1可发现,第一列标签是人们不常用到且不熟悉甚至不用的标签,这些标签的可靠度得分也较低;而第二列标签是人们经常用到且熟悉的高频词汇,这些标签的可靠度得分也是较高的。由此可见,本文的可靠度评价方法能够较较为准确的计算标签的可靠度得分。表 STYLEREF 1 s 2. SEQ 表 * ARABIC s 1 1 部分标签的可靠度得分标签可靠度
40、得分标签可靠度得分Poster0.30148book0.97865doorPartial0.20167Apple0.99832Cpu occluded0.20175Dog0.95432Arm chair crop0.43312Hospital0.90234Whiteboard crop0.53012Chair0.88325Monitor0.47152Cat0.93768Screen crop0.69654Beautiful Girl0.85324bookshelfSide0.32634Necklace0.80453tallboy0.16742Trees0.97321ChairWhole0.10
41、287wedding0.884322.2 WordNet语义相似性本文是通过英文WordNet语义词典计算协作式图像标注之间的语义相似性。之所以使用英文WordNet语义词典来计算的原因如下:1、本文的实验部分所采用的图像和标注数据库中的标注词为英文。2、英文WordNet语义词典发展的成熟,而中文WordNet语义词典仍然没有统一的标准这将会影响对本文方法的分析,本文旨在挖掘协作式标注与图像之间的关联从而过滤垃圾标签和图像,对语义词典的结构并不做研究。综上所述,本文根据英文WordNet语义词典获得图像标注之间的wordnet语义相似性。2.2.1 WordNet语义词典介绍WordNet语
42、义词典是由Princeton大学的计算机工程师,心理学、语言学的专家们共同开发设计的一种基于人类认知语言学的英语语义词典33。这个语义词典根据每个单词的词义以及单词之间的词义联系将单词构成一个单词网络,而并不像传统词典那样将单词按照首字母顺序排列,这种组织方式即是按照词义而不是单词的词形来组织词汇。实质上, WordNet语义词典也可以被认为是一种基于心理学和语言学的英文词典,因为它组织词汇信息的最小单位是同义词集合,对于查询结果的语义描述方法也是按照符合人类思维定式的方式;WordNet给出了查询结果的同义词的定义和例句,这和传统字典是相似的。并且在同义词集合中包含对这些同义词的定义,不同的
43、同义词也给出各自适合的例句来进一步描述区分。WordNet是根据三个假设论据而开发的,即“可分离性假设”、“可模式化假设”和“广泛性假设”34;其中“可分离性假设”,是指语言的构成成分即词汇能够被分离出来加以分析研究。而“可模式化假设”,则是语言都有一定的系统规律,这体现在语言的组织和词义间的关系;所谓“广泛性假设”,描述的是计算机需要尽可能都的收集词汇知识,就如人类处理语言的前提也是收集了大量的词汇知识。WorNet描述分类单词及其概念是通过同义词集关系来完成的,同义词集关系组将单词同义词的集合聚集到一起共同解释一个单词的语义。WordNet是一个包括了成千上万的同义集的词汇表,并且利用这些
44、同义集来诠释单词的语义以及单词间相互的关系。同义集包含了单词的大量概念,其中包括有单词的上位关系、下位关系35,WordNet也涉及到了相似但又不是完全同义的概念间的映射。WordNet系统可以分为四部分:(l)WordNet词典由编纂人员写的所有源文件;(2)能够将源文件转换成WordNet词汇数据库的软件;(3)WordNet词汇数据库;(4)访问词汇数据库的一套用户客户端软件工具。2.2.2 单词的WordNet语义相似性通常情况下,通过WordNet语义词典获得的单词的语义相似性内容都是采用单词的直接语义距离来描述的,即两个单词的共同的父辈上位词的语义深度 36。如果父辈单词有较深的语
45、义距离则说明两个单词的语义相似性内容较小;反之,如果父辈单词的语义深度比较浅则表示两个单词有较高的语义相似性。这种方法虽然简单但是对于语义网络这种有复杂结构的词汇库的度量效果并不理想。传统的Wordnet语义相似性评估方法对与协作式标注的效果不佳的原因如下分析:WordNet是有单词的上位词、下位词、同义词和反义词等共同组成的单词的语义词汇树,也是一个包含单词之间语义的单词网络。这种语义树中,节点就代表一个单词,树枝则表述两个单词之间的语义相似性。因此,既然是树则必然有树枝及叶子的茂密和稀疏之分以及树枝的长短之别。经常用到的单词的上位单词,下位单词,反义单词和同义单词就比较多,也就是说这些单词
46、所在的词汇树就比较茂盛。同样的,一些不经常用到的单词比如专业名词,与这些词相关的单词就会比较少,自然词汇树也会比较稀疏。因此,使用WordNet语义词典中单词的共同父辈上位词的深度来描述单词之间的语义相似性内容并不是准确的。如图2.1描述的是WordNet语义词典里的语义树形结构的小部分的分支结构。比如计算(car、Fork)的单词间的语义相似性以及(Car、Bicycle)的语义相似性从而评估单词car与Fork、Bicycle中相似性较高的单词。从图2.1的语义树观察,car和Fork的共同父辈节点是Artlfact,并且在wordnet语义词典中单词Artifact的语义深度是3.53,
47、则car和Fork的语义相似性是3.53。同理,Car和Bicycle的共同父辈节点是vehicle,在wordnet语义词典中vehicle的语义深度是8.3,因此Car与Bicycle的语义相似性为8.3。但是根据人类生活中的普遍认知可以判断:car与Bicyde的相似性与car和fork之间的相似性比较应该更大一些。但仅仅通过共同父辈节点得到的语义相似性却与人类普遍认知的结果相反。事实上,这是由于我们在计算单词间的语义距离时忽略了语义树的茂密或稀疏对单词语义相似性的影响。由图2.1中可明显观察到,左边的树枝的茂密程度明显大于右边的树枝,这也是我们用共同父辈节点计算car与Fork、Bic
48、ycle之间相似性不准确的原因。所以,通过WordNet计算单词间的语义相似性应该结合语义树的茂密程度。基于以上分析,本文设计了一种通过WordNet语义词典获得单词之间的语义相似性的方法。在计算两个单词的语义相似性时,本文使用语义词典得到两个单词间最短路径的语义距离以及每个单词的语义深度从而获得两单词间的语义相似性内容。详细的步骤如下所示:(1)给定两个单词,计算这两个单词相似性内容首先必须计算在WordNet语义树形结构中待计算的两个单词的最短路径距离,也就是两个单词的语义距离;单词间的最短路径距离即表示了两单词的语义距离,本文定义Length表示最短路径距离37。如图2.1中所示Car和
49、Bicycle的最短路径距离为5,同时Bicycle与Fork的最短路径为10。(2)计算两个单词的最近的共同父辈节点的语义深度,节点的语义深度是通过词汇表中的根节点到这个节点的路径距离来描述的,本文节点深度用Depth表示。如图2.1所示,单词car和单词bicycle的共同父辈节点的语义深度表示为5,同时bicycle与Fork的共同父辈节点深度是2。图 STYLEREF 1 s 2. SEQ 图 * ARABIC s 1 1 WordNet结构示意图(3)公式(2.2)描述的是两个单词间的语义相似性,ci和cj,表示作为图像标注的单词,s(ci,cj)则表示的是两个标注词的语义相似性。
50、(2.2)表2.2是计算图像标注间的WordNet语义相似性的部分结果,显然表2.2中的结果是和人类认知相符合的。协作式标注具有随意性,为了更好的利用wordNet语义词典计算协作式标注间的语义相似性,还需要解决一些问题,详细分析如下: (1)协作式标注的词性虽然很多,但本文只关注单词是动词或者名词的情况。因为用动词或者名词作为标注词的标注描述的通常是图像客观存在的事物,具有一定的普遍认知性和客观一致性,因此,这类单词有共同的认知标准,不同的人对这些词所描述的内容的认知是相同的,所以,分析这类标注词是有价值的。相反的,形容词和副词这些标注词具有很强的主观性和浓厚的个人色彩,由于没有固定准则分析
51、这类标注词是没有意义的,也因为这样,在检测垃圾标签时,对这些标注词本文不进行分析。表 STYLEREF 1 s 2. SEQ 表 * ARABIC s 1 2 部分单词WordNet语义相似性示例标签WordNet语义相似性标签WordNet语义相似性标签WordNet语义相似性Monkey-monkey1Food-love0.8City-lake0.31Monkey-animal0.64Food-animal0.4City-bus0.35Monkey-mineral0.33Food-food1City-car0.35Monkey-vegetable0.56Food-monkey0.36Cit
52、y-village0.75Monkey-cat0.8Food-flower0.43Flower-rose0.73Monkey-sea0.33Food-bird0.83Flower-bird0.4(2)一些单词在中有多重继承,这些单词所属的分类可能并不只有一个,因为这类单词的语义是多义的,比如,bank同时具有银行和岸边的意思,且两个语义的词性都为名词。这时就会有两个单词之间的路径为多条的现象,遇到这种情况,本文会采用最短路径。(3)上述方法适用于两个单词的词性相同的情况。WordNet语义词典的词汇表是由名词,动词,副词以及形容词共四个词性的词汇表构成的。并且词汇表与词汇表之间是没有交集的,所
53、以,当两个单词的词性不相同时是无法直接计算它们之间的语义相似性的。比如,由于动词和名词不属于一个词汇表,因此我们无法计算一个词性为动词的标注词和一个词性为名词的标注词之间的语义相似性,我们能考虑的情况是两个单词同为动词或者同为名词的情况。但若从单词间的相似性角度分析,如果两个单词都仅仅属于一个词性,且这两个词性并不相同,那么可以认为这两个单词的相似性也会是很小。如果单词拥有多个词性,那么本文优先考虑单词为名词的情况,则动词的词性将不再考虑,加入单词不是名词那么再考虑该单词是动词的情况。(4)图像标注并不是只有单词,还会有短语。这时短语需要首先解析为单词然后获得短语语义相似性。2.2.3 两个短
54、语之间的WordNet语义相似性协作式标注存在标注词为短语的情况,这使得我们可靠标签中也有存在短语的情况38。本文在单词相似性基础上进行改进,设计了一种短语之间wordnet语义相似性的计算方法。具体方法如下:(1)用英文分词方法对短语进行分词。即将短语依据空格分割成一组单词。(2)标注单词的词性。判断步骤(1)中的两组单词的词性。(3)对两组单词进行两两相似性匹配,若相似单词对的数量越多,则短语越相似。根据语义词典计算单词相似性时单词的词性必须是已知的,然后才知道要进行语义相似性计算的词汇表是哪个,所以,在计算短语语义相似性之前首先要分析并确定两组单词中每个单词的词性39。本文进行词性标注采
55、用的是Brill tagger,它是个英文词性标注工具。Brill tagger是一种基于错误机制而进行转换最终收敛并确定词性的英文词性标注方法40。它的包含了三种核心的思想,分别为:(1)通过反复修正词性标注结果的方法使词性标注不断接近正确结果最终收敛稳定。(2)不断修改错误词性标注直到最终趋于收敛的过程是遵循一定的规律的,词性的分布与根据句子结构是有一定关联的。(3)计算机可以学习步骤(1)中的规律,学习到的稳定的规律即为转换规则,在之后可以根据转换规则直接进行标注,且不断学习优化转换规则。转换规则有两个主要因素:改写规则(rewriting rule)与激活环境(triggering e
56、nvironment)。比如,转换规则T1的改写规则是将待定词性为动词(v)的单词的词性修改为名词(n)词性,而它的激活环境即能够运用T1的前提条件是单词的左边相邻的第一个单词的词性为量词(q)。假定短语S0的初始词性为:S0是He/r did/v a/q report/v,S0运用了T1之后的词性结果是:S1为He/r did/v a/q report/n。其中,改写规则总结为一句话是将句子中的原本词性为x的单词词性改写成y。但激活环境的规则有三种,分别如下:(1)当前单词的前或者后相邻的单词的词性标注是z;(2)当前单词的前或者后相邻的第二个单词的词性标注是z;(3)当前单词的前或者后相邻
57、的两个单词中其中一个单词的词性是z;根据上述规范进行排列组合获得的Brill Tagger的转换规则分别如下:1.T1:假设当前单词前一个相邻的单词的词性标注为量词,且当前单词的词性标注为动词那么将它标注为名词;2.T2:当前单词的后一个单词的词性是动词,且当前单词的词性也是动词那么就改为名词;3.T3:假设当前单词的词性是动词同时它后面的一个单词是形容词,将这个单词修改为名词;4.T4:假如当前单词词性为形容词同时单词前的两个单词中有一个单词的词性标注为名词,那么就将当前单词词性改为数词;Brill Tagger在标注单词的词性所使用的类似的转换规则还很多。基于上面分析,短语语义相似性的描述
58、方法为:由于短语是由单词组成的,因此可以利用组成短语的单词组的相似性来描述短语之间的相似性。具体方法如下:首先,构建一个m*n的矩阵R,m及n分别代表了两个短语x与y中的各自的单词数量。Ri,j表示短语x的第i个单词与短语y的第j个单词之间的语义相似性。然后,根据单词的两两相似性获得短语之间的语义相似性。具体需要将两组单词的两两相似性整合为一个总的短语的语义相似性,也就是将相似性矩阵R通过运算最终形成一个相似性得分来表示两个短语的语义相似性。这里我们用两组单词中匹配的单词对与两组单词的总数之比来描述这两个短语的语义相似性。得到的相似性得分如果高于一定阈值则表示相似,如果低于这个阈值则表示不相似
59、。比如:两个单词x和y,x和y中的单词数量分别为4和5,设置单词相似阈值是0.5,在相似度矩阵R中的元素有3个相似性分别是0.6,0.7,0.8,高于阈值0.5,那么认为x和y有存在的相似单词对有3对。则x,y的相似性是Rx,y=2*(1+1+1)/(4+5)=0.67。那么短语作为图像标注的两个标注词间WordNet语义相似性公式如下: (2.3)ci,cj表示短语ci和短语cj,表示ci,cj中单词的数量,表示两个短语中相似单词对的数量。表2.3是用上述方法获得的短语之间的语义相似性以及单词和短语之间的相似性的部分结果。表中可见,本文方法所得到的短语WordNet语义相似性和人类的普遍认知
60、是相符的,得到的结果准确。表 STYLEREF 1 s 2. SEQ 表 * ARABIC s 1 3 用WordNet得到的短语的语义相似性标签WordNet语义相似性标签WordNet语义相似性A walking person, people0.54Cat, a beautiful girl0.646The college students, A walking person0.5625A cute cat, football0.44Speak loudly, a walking person0.1875Football, football game0.9467People,a beaut
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2024考研全国统考数学三冲刺试卷(精排打印版)
- 2026考研中国人民大学信号与系统习题集(精排打印版)
- 全国统考数学三习题集|2026考研(名师编写)
- 2026年中职(水产养殖技术)鱼类养殖专项测试卷及答案
- 句容市2026年数学三年级第一学期期末达标检测模拟试题含解析
- 2026年大学农业信息学(农业信息理论)试题及答案
- 初级基础护理考试题库及答案
- 2026年中职电力技术(电力营销基础)试题及答案
- 江西省宜春市铜鼓县2026年三年级数学第一学期期末教学质量检测试题含解析
- 工程行业常规技术标准指南
- 2027年鄂尔多斯职业学院单招职业适应性测试题库及答案一套
- 2026年秋季学期泰山版(新教材)五年级信息科技上册教学计划
- 《机械制图》电子教材
- 第二十四届上海市青少年计算机创新应用竞赛 python校内选拔试题及答案
- 创新思维与方法(第2版)PPT全套完整教学课件
- 专业化讲师培训课件
- 建筑工程管理专业中级职称理论考试题库
- 哮喘控制测试评分表(ACT-C-ACT)
- 法律硕士民事诉讼法学课件
- 机动车环检标准方法验证模板
- 环境仪器分析教材课件汇总完整版ppt全套课件最全教学教程整本书电子教案全书教案课件合集
评论
0/150
提交评论