已阅读5页,还剩74页未读, 继续免费阅读
(通信与信息系统专业论文)数字图书馆文档图像的检索.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
, , c 1 u j 一 - 沈阳理工大学 硕士学位论文原创性声明 本人郑重声明:本论文的所有工作,是在导师的指导下,由作者本 人独立完成的。有关观点、方法、数据和文献的引用已在文中指出, 并与参考文献相对应。除文中已注明引用的内容外,本论文不包含任 何其他个人或集体已经公开发表的作品成果。对本文的研究做出重要 贡献的个人和集体,均己在文中以明确方式标明。本人完全意识到本 声明的法律结果由本人承担。 作者( 签字) :袖日张龟 日期 :押夕年月7 0 日 学位论文版权使用授权书 本学位论文作者完全了解沈阳理工大学有关保留、使用学位论文 的规定,即:沈阳理工大学有权保留并向国家有关部门或机构送交学 位论文的复印件和磁盘,允许论文被查阅和借阅。本人授权沈阳理工 大学可以将学位论文的全部或部分内容编入有关数据库进行检索,可 以采用影印、缩印或其它复制手段保存、汇编学位论文。 ( 保密的学位论文在解密后适用本授权书) 学位论文作者签名:枷鹤嘲 指导教师 日期:知9 6 , 0 日 一 : 。挚 一+ ;g i , _ ,- ? o : 分类号:t p 3 9 1 udc :0 0 4 密级: 编号: 工学硕士学位论文 数字图书馆一文档图像的检索 硕士研究生:杨晓娟 指导教师:宋凯教授 学科、专业:通信与信息系统 沈阳理工大学 2 0 0 9 年6 月 ,一 l 气l l_1,: , :o 、,:逻。1j广、=_-_-,j“ ,;冬。鼍 “。,=,一霉1气弩,j 7,7鼍。 1 :瑕毋 :弭骈粤藓岩勒 兀= 1 了芤历矿:娶审当渔岩勒 柯:劬与不右焉孓工面目砀_ :罂翱不肃 飞乏翻孵3 鲻翱藿! f 鳕 千盈。眙砖茸砚 :目鹫茸拱 么叼 一矽蓊蛳台一3 矽薯茎羞 箕跸否毒犁群“乱妻”瓣巢刨群斜丁豳治互翠瞠目哥审革群 壕协按茸砚码杀千避斟圄审翠犁冒歆錾浓嘭国审d j 呲3 y 翳晕刨箕到串妊影辛碰璐聱右壕融髯疆粝豳壬早厢诵 世髫群磉莓弓茸观再杂千迹斟堑靼国士。擎髯茸弓士章群 骠茸弓茸观百嘉千逾斟錾黔国士翠璁翠谁士砷( 硝平椠) 肚睁 半杂国串莓瞽茸镇再嘉朝y 章球晕留( “黜妻”牲鲥土诵) 歌 嘉研f f j 章群磉茸弓茸观再杀千避斟錾黔国审晕刨弓毕y 章 沣砰弭到毋茸歌玛嘉 “ 照群弛h!舅 ,+。置q i l。! 誓翻剧引引illll ,;尹omp 矗iffl 沈阳理工大学硕士学位论文 摘要 随着数字图书馆的飞速发展,图书馆的信息采集、加工( 分类、编目) 、形成 m a r c 记录、提供二次文献检索等手段已很难满足用户的需求j 信息检索技术已由 字段检索、全文检索向内容检索、搜索引擎等方向发展。其中大量信息是文本图像。 本文就是基于内容的针对文档图像的检索进行的研究。通过机器自动提取图像的内 容作为检索特征,并利用相似性度量算法进行的近似匹配。 本文主要从两个方面进行论述,一方面从理论的角度讨论了文档图像检索的原 理和模型,并结合原理和检索模型对检索系统中各主要部分的算法进行研究。另一 方面,从系统实现的角度对检索平台进行了说明。本系统检索算法中主要有四大部 分构成:文档图像预处理,汉字图像分割,特征提取及匹配,用户端检索。采用阈 值法二值化对文档图像进行预处理。针对文档图像的特点,采用投影法,将汉字图 像分割为单个汉字块儿图像,在此基础上,采用改进的模板对其进行细化,实验效 果较好,细化毛刺明显减少。主要介绍了六种特征提取方法,对比传统的方法,本 系统采用一种基于骨架特征和点阵特征的二级特征提取及匹配策略,使识别率和识 别速度都较为理想。在用户端检索端,可以实现字级检索以及图像检索的双重检索, 按照相似度输出检索结果。 采用v c + + 软件平台编程实现系统,对实验建立的图像库进行检索,查找率达 到9 6 5 ,识别率较高,具有一定的鲁棒性和实时性。 关键词:文档图像;图像分割;细化;特征提取;相似度匹配;图像检索 沈阳理工大学硕士学位论文 a b s t r a c t a l o n gw i t ht h er a p i dd e v e l o p m e n to fd i g i t a ll i b r a r y , t h em e t h o do ft h el i b r a r y - f 目录 目录 第1 章绪论1 1 1 研究背景与意义1 1 1 1 研究背景1 1 1 2 研究意义1 1 2 数字图书馆的起源与发展2 1 2 1国外数字图书馆的发展历史2 1 2 2 国内数字图书馆发展历史2 1 3 数字图书馆的检索技术3 1 4 论文结构5 第2 章文档图像的预处理o 。6 2 1 文档图像二值化的研究6 2 1 1 概述6 2 1 2 文档图像的二值化6 2 1 3 基于灰度直方图的全局最佳平均阈值法的实现7 2 2 文档图像中的汉字图像的分割9 2 2 1概述9 2 2 2 本系统的文档图像分割算法。9 2 3 汉字图像的细化1 1 2 3 1形态学算法的基本概念1 1 2 3 2 形态学细化原理1 5 2 3 3 传统的数学形态学细化算法1 8 2 3 4 本文改进的数学形态学细化算法1 9 2 4 本章小结2 1 第3 章文档图像的特征提取及匹配2 2 3 1 文档图像识别原理2 2 3 1 1文档图像特征提取及相似度计算2 2 vo。岭,菇,、,jk咚嗡。? 如一j o,o落量麓致髟攀m一qq一卜rrtll 沈阳理工大学硕士学位论文 3 1 2 本系统对特征提取方法的改进3 0 3 2 本章小结3 1 第4 章数字图书馆的检索3 2 4 1 系统总体结构。3 2 4 1 1 文本搜索服务器3 3 4 1 2 图像检索服务器。3 4 4 2 索引模型的比较3 4 4 2 特征提取和索引建立:4 3 4 2 一些提高查询速度和准确率的方法4 3 4 3 本章小结“ 第5 章基于内容的文档图像检索的设计4 5 5 1 基于内容的文档图像检索的系统结构4 5 5 2 基于内容的文档图像的检索过程4 6 5 3 基于内容的文档图像的检索的相关技术4 7 5 3 1 图像数据库4 7 5 3 2 维数缩减技术4 8 5 3 3图像检索的多维索引技术4 8 5 3 4 图像检索的查询反馈技术4 8 5 4 文档图像的索引。4 9 5 4 1 概述。4 9 5 4 2 本文的索引设计4 9 5 5 本文的系统设计以及分析h 5 2 5 5 本章小结5 5 结论5 6 参考文献5 8 攻读学位期间发表的论文以及所取得的研究成果。6 2 致谢6 3 毋 1 。 t 一, h o ,轧 _爱够一分。 f 【一 。, i 。 瓤, 酞 i 己 :i ,r 奠 : 第1 章绪论 第1 章绪论 1 1 研究背景与意义 当前,世界已经进入了信息时代,各种信息成为了社会发展的关键因素之一。 其中文本形式的信息处理技术最先发展起来,现在发展的非常迅速,取得了巨大 的成功。而现在随着多媒体技术和网络的发展给人们带来巨大的多媒体信息海洋。 而传统的检索技术已经无法满足发展的需要,如何在这个多媒体信息海洋中查找 信息成为急需要解决的问题。 1 1 1 研究背景 绺- 一 文档图像作为一类特殊的多媒体资源,广泛存在于在企业,政府机关,数字 图书馆等机构中n 1 。例如企业的资料、信函、合同,政府机关的文档信息,数字图 书馆的数字信息都以文档图像的方式保存。通过文档图像检索技术,可以快速, 简捷的从这些海量的文档图像信息中查找某些信息。让企业,政府机关,个人都 可以利用这种技术,提高工作效率,从海量信息中提取有用信息,为企业,政府 , 机关以及个人的决策提供帮助。 1 1 2 研究意义 基于内容的文档图像检索技术越来越成为人们研究的焦点船3 。可见文档图像检 索技术有着非常重大的应用意义。它可以处理文档图像这些特殊的多媒体信息源, 让用户根据自己的需求,从这些海量的文档图像信息源中,快速的,简捷的,准 确的查找信息。由于当前人工智能技术还没法让机器理解文档图像的高级语义( 即 像人那样理解文档图像的内容) ,机器只能理解文档图像的低层的特征,如颜色, 纹理,形状等,而人们理解的是高级语义。而基于内容的文档图像检索技术可以7 实现机器提取文档图像的某些底层特征,同时将用户的检索条件也转换成对应的 底层特征,通过底层特征的匹配来检索到用户所需要的信息。 沈阳理工大学硕士学位论文 1 2 数字图书馆的起源与发展 ,一 1 2 1 国外数字图书馆的发展历史 其实,早在1 9 8 5 年,由西班牙文化部等部门就开始了着手对a g i 的建设,主要 是建立数字图像库。实际上是数字图书馆的雏形。而正式提出数字图书馆( d i 西t m l i b r a r y ) 的则是美国的科技工作者,其提出的背景是因为互联网的出现p 】。 1 9 9 4 年,美国国会图书馆宣布将耗资巨额资金建立国家数字化图书馆,计划 在2 0 0 0 年前把全国5 0 0 多种藏品数字化,并于1 9 9 5 年在华盛顿召开了网络信息联盟 会议,共有1 6 个图书馆加人了信息联盟,目的就是要用数字化与动态的方式来保 存美国的文化遗产,建设分布式的开放型图书馆,以图实现全球范围内的资源共 享。1 9 9 5 年5 月,美、英、法、日、德、加、意、俄8 个国家成立了g 8 全球信息社 会电子图书馆。1 9 9 5 年秋,美国国会图书馆在美国第1 0 4 届国会的支持下,正式启 动国家数字图书馆项目( n d l p ) ,在i n t e r n e t 上的名称为“美国的回忆。 美国的行动随即推动了世界范围数字图书馆的建设。日本、“日本国会图书 馆关西馆工程 ,预期在2 0 0 2 年完成一期工程。法国的“国家图书馆数字化工程, 数字资源已达到了3 0 0 0 g b 以上。英国“国家图书馆存储创新倡议 中的项目大部 分己完成,并在因特网上提供服务。俄罗斯也相继开辟了“往事项目 和“电子 图书馆项目。德国政府斥资6 0 0 0 万马克开始启动“数字图书馆项目 。在新加 坡,政府在“2 0 0 0 年图书馆燕尾服计划中,也重点地突出了数字图书馆的建设 项目。 这些欧美及发达国家对数字化图书馆的重视,其主要的目的就是要使本国所 拥有的文献资源得到完好无损地保护以及在因特网上占据着重要的一席之地。 1 2 2 国内数字图书馆发展历史 1 9 9 7 年4 月,我国的四大网络( g s a n e t 、c e r n e t 、c h i n a n e t 、c h i n a g b n ) 开始互 联,为中文信息上网提供了良好的网络环境。1 9 9 7 年9 月,在北京大学举办的首届 亚太地区数字图书馆研讨会,标志着我国对数字图书馆的建设开始得到重视与关 注,1 9 9 8 年7 乒j 2 0 b ,国家图书馆向文化部递交了关于在国家立项“中国数字图书 馆工程 建设的报告。同年1 1 月,教育部开始启动二期工程中国高等教育文 献保障系统( c a l l s ) 的建设,即数字图书馆建设。2 0 0 0 年4 f j 5 日,在国家图书馆召 第1 章绪论 开了“中国数字图书馆工程建设联席会议 第一次会议,标志着中国数字图书馆 工程建设工程开始启动。清华大学图书馆与m m 联合创建的“中国高校学位论文联 机服务系统应用软件,表明了清华大学在国内数字图书馆的研究开发方面走在 了前列。最近,各地区、各省市图书馆开始了对数字图书馆建设的论证与实施。 2 0 0 1 年1 0 月2 6 日,佛山市数字图书馆工程方案论证会在佛山图书馆召开方案确立 了佛山数字图书馆工程建设目标,并分为三个阶段实施,以统一的标准和规范为 基础,以数字化信息为底层,以分布式海量资源库为支撑,以智能检索为手段, 以宽带高速为传输通道,以电子商务管理为服务方式,将各种丰富的信息资源传 递给用户,使数字图书馆成为文献信息数字化处理中心、数字信息存储、管理和 发布中心。 我国台湾地区在1 9 9 4 年制定了建设“亚太智能信息服务中心的计划,该计 划耗资上百亿美元,计划在2 0 0 0 年前后完成。 。 玉, 1 3 数字图书馆的检索技术 9 1 信息技术飞速发展,因特网迅速地在世界各国普及,信息采集和传播的速度 卜, 乎 达到了空前的水平。据统计因特网上的主页目前已经达n 1 3 亿页,并且正在以每 。 天1 0 万页、近2 0 0 0 万个单词的速度递增。而全世界印刷信息的生产量平均每五年 就会翻一番。人类近3 0 年来生产的信息超过了过去5 0 0 0 年生产的信息总和。美国弘 新泽西州n e c 研究所劳伦斯和吉尔斯在1 9 9 8 年4 月l o 日一期美国科学杂志上发 表最新研究结果指出,因特网上超文本文件数目可能大大高出人们原先的估计, 作为全球最大的信息资源库,因特网上超文本文件总数已达3 2 亿。 传统图书馆的信息采集、加工( 分类、编目) 、形成m a r c 记录、提供二次文 献检索等手段已很难满足用户的需求。信息检索技术已由字段检索、全文检索向 内容检索、搜索引擎等方向发展。同时在信息资源的描述上也出现了元数据、资 源描述框架等对信息本身进行说明的标准或方案。下面分别对这些数字图书馆的 关键技术进行介绍。 内容检索:传统的数据库检索采用基于关键词的检索方式 4 1 ,早期的图像数据 库沿袭了这种检索方式,采用描述性文本进行检索。但一般来说,这种检索技术 往往不能满足人们的需要。由于图像和视频信息的内容具有丰富的内涵,在许多 情况下仅用几个关键词难以充分描述,而且作为关键词的图像特征的选取也有很 沈阳理工大学硕士学位论文 大的主观性。于是,基于内容检索( c o n t e n tb a s e di m a g er e t r i e v a l c b i r ) 技术应运而 一一一生f 。它区别于传统的检索手段,融合了图像理解技术,能够根据人们的要求进行 有效检索。与传统的检索方式相比较,基于内容检索具有以下特点: l 利用图像视频内容的特征来进行检索。 2 是相似度检索,即根据库中各个被检索单元( 图像或镜头) 与检索要求的相似 程度而返回检索结果f ,】。 3 除了利用图像视频内容的特征来进行特征检索外,基于内容检索还提供了许多 其他检索手段,如可通过提供样本图像进行相似性检索,也可通过人机交互进 行浏览检索。 元数据的研究:元数据是有关数据的数据。在元数据的研究方面,都柏林核 心是目前应用较多的方案。它是一个由1 5 个基本的元数据元素组成的体系,旨在 有利于电子资源的发现。原先的设想是由创作者本人对要发布到万维网上的信息 进行描述,但它也吸引那些正式的资源描述团体( 如博物馆和图书馆) 的注意。都柏 林核心系列研讨会集中了图书馆、网络和数字图书馆研究机构和另外一系列特别 组织的专家们。作为一个突出的电子资源描述方案,都柏林核心有以下特点: 1 简洁性:都柏林核心可以被那些非编目人员以及有正式的资源描述模型经验的 人员使用。1 5 个组成元素大多数有一般的语义学含义,用它描述电子资源可粗 略地等同于做目录卡片 6 1 。 2 语义的互操作性:在因特网上,不同的描述模型中对信息的检索存在着学科范 围的限制界线。推行一套可普遍采用的描述符来进行数据内容的统一描述可增 加跨学科的语义上的互操作性。都柏林核一t l , 是目前在因特网上的资源发现方面 领先的方案。 3 国际上的统一:在万维网的资源发现方面能够得到国际范围的认可进行有效的 发现工作的基础和关键。都柏林核心在此方面得益于英国、澳大利亚、瑞典、 丹麦、挪威、芬兰、德国、法国、泰国、日本、加拿大以及美国等国家的支持。 4 灵活性:虽然最初是为了作者本人进行资源描述的需要,但是都柏林核一t l , 有足 够灵活性以表现附加的结构和进行更详尽的语义学描述,在这方面,完全和正 式的资源描述方法一样。 其它的元数据方案还有万维网的元数据体系结构等。世界万维网协会( w 3 c ) 第1 章绪论 是关于万维网标准的首要的论坛,并且于前不久开始集中于考虑万维网的元数 据体系结构。资源描述框架( r d f ) ,在不断进化以便支持许多不同的元数据来满 足卖主和信息供应者的需要。都柏林核心的代表在积极地从事这种体系结构的 发展工作,并将以数字图书馆的观点来影响这个万维网基础的重要的组成部分。 1 4 论文结构 本论文共分六章 第一章绪论,介绍国内外数字图书馆的现状,课题研究的背景和意义以及相 关技术等,为下面的研究奠定理论基础。 第二章文档图像的预处理,介绍了为了方便后续处理,从几个角度对文档图 像进行预处理,以及相应的处理方法和算法,并提出了图像的分割方法和汉字图 像块细化,介绍如何将文档图像分割成一个一个的汉字图像块,以及如何对分割 后的汉字图像块细化。 j 第三章文档图像的特征提取及匹配,介绍了几种文档图像的特征提取方法以 及相似度的计算方法,本文对其进行了改进,使得特征更加准确的描述了文档图 像。 “ 第四章介绍了数字图书馆的检索结构及主要方法。 第五章研究了基于内容的文档图像的检索,本系统所使用的检索方法以及检 索结果。 沈阳理工大学硕士学位论文 第2 章文档图像的预处理 2 1 文档图像二值化的研究 2 1 1 概述 文档图像预处理别是为了使文档图像内容良好,符合后续处理要求,。因为后 续的处理都要建立在好的、符合要求的文档图像的基础上的。如果前面文档图像 的预处理没有做好,没有符合后续处理的要求则可能会影响到后面结果和效率, 所以说这个步骤很重要。这里的文档图像的预处理主要指二值化操作。 2 1 2 文档图像的二值化 二值化是图像分割中的一个重要方法。它是为了将图像中有意义的特征或者 需要应用到的特征提取出来1 7 1 。这些特征可以是图像的原始特征,如物体占有区的 像素灰度值,物体轮廓线和纹理特征等,也可以是空间频谱,或者直方图特征等。 二值化的方法是利用图像中要提取的目标物与背景有灰度特性上的差异,如 设置一个灰度阈值,凡是灰度值低于这个阈值的像素值置0 ,而灰度值高于这个阈 值的像素值置1 。这样,就可以将图像中的背景和目标明显地区分出来。 设图像f ( x ,y ) ,其灰度级范围是 z 1 ,z 2 】。在z l 和z 2 之间选择一个合适的灰 度阈值v a l v e ,则按上述方法分割后的图像f v a l v e ( x ,y ) 用下式表示嘲 f v a l v e ( x , y ,= 骺凳暑裟 弘, 或 f v a l v e t o p d o w n ( x , y ) = 砖警鹏八五力龇脚( 2 2 ) 阈值也可以设为一个灰度、范 v a l v e d o w n ,v a l v e t o p 】。图像中像素灰度值在范 围内的变为1 ,其他的均变为0 。即 第2 章文档图像的分割 肛舰聊加器警吖 却 阈值分割的一般性公式为: f y a l v e r 唰w ,= 罨姗d2 小嘴 ( 2 3 ) ( 2 4 ) 式中,f y a l v e r a n g e 为给定的灰度级范围,o b j e c t 为设定的目标像素灰度值, b a c k g r o u n d 为设定的背景像素灰度值。 2 1 3 基于灰度直方图的全局最佳平均阈值法的实现 图像二值化的关键技术是阈值选取。在过去3 0 年中,许多学者在“如何确定 合适的图像阈值”方面做了大量的研究工作1 9 1 。上述的图像阈值选取技术来看,如 果只顾提高二值化算法效果及其通用性,必然会增加算法的复杂度和执行时间。 在许多对图像处理的速度较高要求的场合,特别是利用硬件实现的系统,这些算 法是不能满足需求的。针对上述情况,本文采用一种计算简单,处理速度快,二 值化效果好的基于灰度直方图的全局最佳平均阈值法。 ,。 设,l 。,分别为目标和背景的像素数,l 。( g ) 和刀。( g ) 分别表示在某一灰度值g 下的像素数。为获得最佳阈值,必须保证分布交叉而引起的错误归类的像素个数 最小。即如果取一个阈值t ,则应保证下式成立。 和( g ) = ;1 1 1 1 1 1 b ( g ) g , 给出具体算法如下,其中m i n ,m a x 为灰度值的最小和最大值,i t h r e s h 为求得 的阈值。 1 求得灰度直方图h ( i ) ; 2 从灰度直方图中找出整幅图像的最大、最小灰度值i m a x ,i m i n : 3 令i n e w t h r e s h = ( i m a x + i m i n ) 2 ,i t h r e s h = i n e w t h r e s h ; 4 分别求出i m i n i t h r e s h 和i t h r e s h i m a x 两个区域的灰度像素平均值 i m e a n l 。i m e a n 2 : 沈阳理工大学硕士学位论文 5 i n e w t h r e s h = ( i m e a n l + i m e a n 2 ) 2 : 6 判断i n e w t h r e s h 是否等于i t h r e s h ,若是则所得阈值即i t h r e s h ,若不是,则将 i n e w t h r e s h 赋给i t h r e s h ,再转到步骤4 。 在实验中,可以根据实验需求实现给定阈值,也可以自动选取阈值。在所进 行的文档分割试验中,几种效果较好的方法为:给予梯度均值的阈值选取方法, 基于熵的阈值选取方法以及基于梯度均值的阂值选取方法。 廖困| 荔黾夔| 园| 留| 数。陶 丐馆检索系统与豇联蚓搜索引擎部采用全文 信息检索技术。由于圈书馆的行业特点,在数字资源元 数据的创建和检索要求上有所不同。数j 图书馆检索系 统所处理的文档有很大部分是结构化的元数据,在生成 索引时,要记录索引词在元数据中的j 尹段位置,以实现准 确的? 段检索。互联刚搜索引擎主要是对爬虫程序抓来 的蚓页进行编辑。然后对摘缨徽伞文榆索处理字段级的 图2 1 二值化前的文档图像片段 图2 2 阈值选择图 第2 章文档图像的分割 | 国团| 蒿毡园 国;冒 数字图书馆检索系统与互联网搜索引擎都采用全文 信息检索技术由于图书馆的行业特点。在数字资源元 数据的创建和检索要求上有所不同数字图书馆检索系 统所处理的文档有很大部分是结构化的元数据,在生成 索引时。要记录索引词在元数据中的宇段位置,以实现准 确的字段检索- 互联网搜索引擎主要是对爬虫程序抓来 的网页进行编辑,然后对摘要做全文检索处理,宇段级的 图2 3 二值化后的文档图像片段 2 2 文档图像中的汉字图像的分割 2 2 1 概述 一般来说,图像分割的目的是为了更好的理解图像的内容,提取出我们感兴 趣的对象物体。图像分割按照具体的应用要求和具体图像的内容,将图像分割成。? :;二; 一块块目标对象区域。图像分割主要采用聚类的方法,即假设图像中组成我们感 兴趣的对象的像素具有一些相似的特征,例如相似的灰度值,相似的颜色值等等。 对于一般图像的分割技术可分为三类【l o 】: 1 基于像素灰度值的分割技术:例如图像直方图分割技术【1 1 1 ,直方图分割技术的局 限性在于只告诉我们像素灰度值的变化范围,但没有告诉图像中灰度分布的空 间情况,所以这种技术应用范围有限i l l l 。 2 基于区域的分割技术:这种技术把图像分割成一个个区域,每个区域中的像素 具有相同的性质。区域生长法就属于这类技术,查看一个像素的邻近像素是否 具有相似的性质,如果是就扩展区域的面积,然后递归下去【1 2 j 。 3 基于边界的分割技术:边缘提取技术就是属于这类技术,边缘所围成区域的内 部和外部特征不一样,借此进行图像分割1 1 3 】。 2 2 2 本系统的文档图像分割算法 本文设计的文档图像检索系统是基于文档图像汉字图像的检索,所以必须将 文档图像分割成一个一个汉字图像块,然后对这些汉字图像块进行特征提取。所 o 沈阳理工大学硕士学位论文 有这些汉字图像块的特征就是一幅文档图像的特征信息,所以分割效果的好坏将 直接影响后面的汉字图像块的特征提取。 以上三种图像分割方法都不适合文档图像的分割,因为一般图像上的物体或 目标都是不规则的,而文档图像的一个主要特点是其上的目标( 汉字图像块) 相对 来说规则多了,这些目标一行行水平排列的。 所以本文采用了基于投影法的文档图像分割算法,将文档图像分割成一个一 个汉字图像块。首先,根据水平投影进行水平分割,分割出一行汉字图像块,然 后对这一行汉字图像块进行垂直分割,分割成一个一个汉字图像块。为了提高分 割效率和过滤一些无关的标点符号的干扰,分割算法中采用启发式分割。一般一 幅文档图像中的汉字的大小一般都是一样的,在水平分割了几行后就可以得出字 体的大概高度信息和水平宽度信息,在后续的分割过程利用这些信息,提高分割 效率。同时标点符号和字母的宽度远小于汉字的宽度,所以可以过滤这些标点符 号和字母。 具体的水平和垂直分割过程如下: 垂直投影 - j i - _ - - 生 数宇捌一f 5 锫捡索系统与互联列搜索引擎部采埘全文_ l i 邑! 信息稔索技术。由f 圈书馆的行业特点在数! 资源元_ l i | ! l 三 数据的创建和检索要求上有所4 i 婀。数字豳书馅捡索系_ _ _ l 童e 统所处理的文捎仃很大韶分足结构化的元数据在生成l i _ l _ 曼! ! = 尽下议髟 索引时爱记采索引诩在元数据r 1 的譬段位置以蜜现准- _ l l l l 皇e 确的。段检索。互联鳟搜索引擎主要是对窿虫程序抓来i _ _ l l 曼重量 的列更进f f 编辑然后对摘要敲全文检索处理事段级的_ _ l _ l _ 重要 图2 4 文档图像水平、垂直投影图 第2 章文档图像的分割 勇,。益缴锄磊磊女磊毳如荭兹貔叛旎旒;苏i 曩磊巍凌勰荔l 篪三复彩;彩玩溯籀罐锄锄渤燃澎渤羹2 磊级:搋貔巍叛瓣囊辘 。 , 0 岔口i :,铲i :? ” m 数字图书馆检索系统与互联网搜索引摹都采用全文 信息检索技术由于图书馆的行业特点在数字资源元 数据的创建和检索要求上有所不回数字图书馆检索系 统所处理的文档有很大部分是结构化的元数据。在生成 索引时。要记录索引诃在元鼓据中的字段位置以实现准 确的字段检索互联网搜索弓i 摹主要是对爬虫程序抓来 的舟页进行编辑,然后对掎要做全文检索处理。字段级的 图2 5 二值化后的文档图像字符分割结果图 2 3 汉字图像的细化 考虑到汉字图像块特征的特征提取过程,要忽略字体粗细的因素,而下面的 设计的几种汉字图像块的特征提取方法,有的方法可以在提取特征和相似度计算 时,就可以忽略字体大小和和字体粗细的因素,而有的需要一些前期处理,通过 对分割后的汉字块进行细化操作,可以只保留汉字的骨架特征,这里先介绍文档t 图像细化的数学理论基础f 1 4 1 0 5 1 : 2 3 1 形态学算法的基本概念 腐蚀和膨胀是二值图像的初等形态学运算。许多形态学的算法都是在腐蚀和 膨胀的基础上进行的。下面分别介绍以下这些相关概念的定义f 3 】 1 膨胀 由于a 和b 是z 2 中的集合,a 被b 膨胀定义为: 4 0 曰= zj ( b ) z 厂、口a ( 2 6 ) 这个公式是以得到b 的相对于它自身原点的映像并且由z 对映像进行位移为基 础的。a 被b 膨胀是所有位移z 的集合,这样,台和a 至少有一个元素是重叠的。根据 这种解释,公式( 2 - 5 ) 可以重写为: a o b = 扛i ( b ) zn a 椰( 2 - 7 ) 与在其他形态学运算中一样,集合b 通常叫做膨胀的结构元素。 在当前关于形态学方面的著述中公式( 2 5 ) 并不是膨胀的唯一定义形式。然而, 1 1 沈阳理工大学硕士学位论文 当把结构元素b 看作一个卷积模板时,公式( 2 5 ) 的定义形式比其他定义形式更为直 观。这是它区别于其他定义形式的突出优点。尽管膨胀是以集合运算为基础,但 相对于b 的原点对b 进行翻转,而后逐步移动b 以便b 能滑过集合( 图像) a 。 图2 6 ( a ) 显示了一个简单的集合,图2 6 ( b ) 显示了一个结构元素和它的映像( 黑 色点表示元素的原点) 。此时,结构元素和它的映像是相等的,因为b 关于它的原 点对称。图2 6 ( c ) 中的虚线显示了作为基准的初始集合,实线显示了对雪的原点进 一步移动n z 的限制。超出这个限制会使台和a 的交集为空。所以,所有处在这一边 界之内的点构成了使用b 进行的a 的膨胀。图2 6 ( d ) 显示了一个被设计用来在垂直方 向比水平方向进行更多膨胀的结构元素。图2 6 ( e ) 显示了用这个结构元素进行膨胀 的结果。 d ( a ) d 叭 口扪 矗一8 么ob 图2 6c a ) 集合a ,( b ) 方形结构元素( 黑点为中心) ,( c ) n 对a 膨胀以阴影显示,( d ) 拉长的 结构元素,( o ) 使用这个元素进行的a 的膨胀 2 腐蚀 第2 章文档图像的分割 对z 中的集合a 和b ,使用b 对a 进行腐蚀,用a o b 表示,并定义为 a b = zi ( 口) :a ( 2 8 ) 这个公式说明,使用b 对a 进行腐蚀是所有b 中包含于a 中的点z 的几何用z 平移。 同膨胀的情况一样,公式( 2 7 ) 并不是腐蚀唯一的定义形式。 图2 7 显示了与图2 6 相似的过程。对比图2 7 ( c ) ,以前的集合a 显示为虚线。阴 影区域的边界说明b 的原点进一步移动的界限。超出这个界限会使集合不在完全包 含于集合a 中。因此,在这个边界内( 也就是阴影区域) ,点的位置构成了使用b 对a 进行的腐蚀。图2 7 ( d ) 显示了用这个元素腐蚀a 的结果。原来的集合被腐蚀成一条 线。 d a 鲋 口矾 b 广一一一一一一一一1 粥i i 3 d ,4 、 抓 【c , a b 广一一 i lid 2 i i i i i i i a bid 2 i l i 一j 从 3 鲋 从 ( e ) 图2 7 ( a ) 集合a ,( b ) 方形结构元素,( c ) 由b 对a 腐蚀,如阴影所示,( d ) 拉长的结构元素, ( e ) 使用这个元素对a 腐蚀 膨胀和腐蚀对于集合求补运算和反射运算是彼此对偶的。即: ( 彳o 曰) 。= a 。o b( 2 9 ) 为了说明确定形态学表达式有效性的典型方法,我们对这个结果进行正规的 证明。从腐蚀的定义开始,我们有: 叭一b 沈阳理工大学硕士学位论文 ( 么0 口) = zi ( 曰) :n 椰。( 2 1 0 ) 如果集合( b ) :包含于集合a ,则( b ) :n 彳= g ,此时前述公式变为: ( 彳) 。= zi ( 曰) :f la 。= a ) 。( 2 1 1 ) 但,满足( b ) :n = 囝的z 的集合的补集是满足( b ) :n o 的集合。因此: ( 彳o 曰) 。= zi ( 召) :n 彳。囝) = a ob( 2 - 1 2 ) 这是从公式( 2 5 ) 得出的最后一步,这就证明了这个结论。 3 击中击不中变换 形态学上的击中或击不中变换是形状检测的基本工具。我们用图2 8 作为辅助 介绍这个概念。图2 8 显示了一个由3 种形状( 子集) 组成的集合a ,子集用x ,y 和z 表示。图2 8 ( a ) 到( c ) 中的阴影部分指明了初始集合,而图2 8 ( d ) 和( e ) 中的阴 影部分指出了进行形态学操作后的结果。目的是找到3 种形状之一的位置。如x 的位置。 令每种形状的重心为它的原点。设x 被包围在一个小窗口w 中。与w 有关 的x 的局部背景定义为集合的差( w 一) ( ) ,如图2 8 ( b ) 所示。图2 8 ( c ) 显示了a 的补 集,在后面将使用到它。图2 8 ( d ) 显示了由x 对a 腐蚀的结果( 显示虚线作为参考) 。 使用x 对a 进行的腐蚀是x 原点位置的集合。这样,x 就完全包含在a 中了。换 一个角度解释,a o x 从几何上可以被看作x 的原点所有位置的集合,在这些位置 x 找到了在a 中的匹配( 击中) 。图2 8 中a 只包含3 种彼此不相连的集合x ,y 和 z 。 图2 8 ( e ) 显示了由局部背景集合( w - x ) 对集合a 的补集腐蚀的结果。图2 8 ( e ) 的外圈阴影区域是腐蚀部分。我们根据图2 8 ( d ) 和( e ) 注意到,x 在a 内能得到精 确拟台的位置集合,是由x 对a 的腐蚀和由( w - x ) 对a c 的腐蚀的交集,如图2 8 ( f ) 所示。这个交集正好是我们要找的位置。换句话说,如果b 表示由x 和置的背景。l 构成的集合,则在a 中对b 进行的匹配( 或匹配操作的集合) 表示为ao b : 彳ob = ( 4 0 e ) 一( 么。岛) ( 2 1 3 ) 第2 章文档图像的分割 我们可以通过令b = ( 蜀,展) 对这种表示法稍微进行推广。这里蜀是由与一个 对象相联系的口元素构成的集合。最是与相应背景有关的召元素的集合。根据前 面的讨论目= x ,岛= ( w - x ) 。用这个表示方法,公式( 2 1 1 ) 变为: ao b = ( a o s , ) c i ( a 咝) ( 2 - 1 4 ) 因此,集合彳o b 同时包含了所有的原点,蜀在a 内找到匹配,垦在爿。中找 到匹配。通过集合之差的定义和腐蚀与膨胀间的对偶关系,我们可以将公式( 2 1 2 ) 写成: 彳ob = ( a o s , ) - ( a o 哎) ( 2 - 1 5 ) 然而,公式( 2 1 2 ) 更为直观。我们将上述3 个公式称为形态学上的击中或击不 中变换。使用与对象有关的结构元素骂和与背景有关的垦的原因是基于以下假设 ? 。! ? 的定义,即只有在两个或更多对象构成彼此不相交( 不连通) 的集合时,这些对象才 是可区分的。要保证这个假设,需要在每个对象周围至少被一圈一个像素宽的背 j ;i , 景围绕的条件。在某些应用中,我们也许对在某个集合中检测1 和0 组成的某种 模式感兴趣,而此时是不需要背景的。在这种场合,击中或击不中变换转变成简 单的腐蚀过程。正如前边所指出的那样,腐蚀是进行一系列的匹配,但对于检测 单个对象来说不需要额外的背景匹配。 2 3 2 形态学细化原理 集合a 使用结构元素b 进行细化用彳o b 表示。细化过程可以根据击中或击 不中变换定义: a o b = a 一( 彳o b ) = 彳n ( 彳o b ) 。( 2 1 6 ) 如上一节,我们仅对用结构元素进行模式匹配感兴趣,所以在击中或击不中 变换中没有背景运算。相应的对于a 的细化更为有用的一种表达方式是以结构元 素序列为基础的: b ) = b i , 召2 ,口3 ,b ”)( 2 1 7 ) 沈阳理工大学硕士学位论文 白画 图2 8 ( a ) 集合a ,( b ) 窗d w 和与w 有关的x 的局部背景( w _ x ) ,( c ) a 的补集,( d ) 用x 对a 腐蚀, ( e ) 用( w _ x ) 对a 腐蚀,( f ) ( d ) 和( e ) 的交集,显示了我们希望得到的x 的原点位置 彩钐 蕊 形 沁 沁髟 沁心 勿 心 蕊 怒,钐 沁 蕊 沁钐 淤 图2 9 限制凸壳生成,以便不超过初始点集合在水平和垂直方向上的最大尺寸 1 6 弟2 苹文档图像的分割 一一_ _ 这里b 是b 卜1 旋转后的形式。使用这个概念,我们现在用结构元素序列定义细 化为: 彳o b ) = ( ( ( ( 彳o b l ) o 曰2 ) o 艿”) ( 2 1 8 ) 这种处理通过使用b 1 经一遍处理对彳进行细化,然后使用b 2 经一遍处理对得 到的结果进行细化,如此进行下去,直到a 使用b ”进行一次细化。整个过程不断 重复直到得到的结果不再发生变化。每遍独立的细化过程均使用式( 2 1 4 ) 执行。 图2 1 0 ( a ) 显示了一组通常用于细化的结构元素,图2 1 0 ( b ) 显示了使用刚才描 述的细化过程进行处理的集合a 。图2 1 0 ( c ) 显示了用b 1 对a 进行一遍扫描得到 的细化结果。图2 1 0 ( d ) 到( k ) 显示了使用其他结构元素处理多遍的结果。在用b 4 进行第2 次处理后得到收敛的结果。图2 1 0 ( k ) 显示了细化的结果。最后图2 1 0 ( 1 ) 显示了被转换为m 连通的细化集合以达到消除多重路径的目的。 朗口口口口口口口 接譬b o 蹬跨 世谬暌 。: 。2、 薯 a g o 3 图2 1 0 ( a ) 用于细化的经旋转的结构元素序列,( b ) 集合a ,( c ) 使用第1 个结构元素进行细化 1 7 沈阳理工大学硕士学位论文 的结果,( d ) ( i ) 使用接下来7 个结构元素进行细化得到的结果( 第7 个和第8 个结构元素之间没 有区矍j j j ) ,( j ) 再次使用第1 个结构元素得到的结果( 与接下来的两个结构元素没有区别) ( k ) 收敛后的结果( 1 ) 转换为具有m 连通度的结果 2 3 3 传统的数学形态学细化算法 传统的细化就是对图像逐层剥离的过程1 1 6 l 。如对集合a 进行基于结构元素 弘) = 假,岛,e ) 的细化,可以用迭代运算彳 研= ( ( ( 彳。忍) 垦) ) 只表示。 随着迭代次数的增加,目标图像将不断细化,且始终保持彳。曰ca 。 通过常用结构元素对序列d = d i ,d 2 ,皿,皿) 和e = 五,垦,局,毛) ,对基于形 态学的细化算法进行测试。其中结构元素对序列d 用来消去4 5 0 ,1 3 5 0 ,2 2 5 。,3 1 5 0 四个方向上的点,如下图所示,“l ”表示目标图像上的点,“o ”表示背景图像上的点, “ 既可以表示目标图像上的点,也表示背景图像上的点。 木o o 1l0 ll 木 qd 2 上 图2 1 1 结构对序列d 皿 e ke :e i e 4 图2 1 2 结构对序列e 利用结构对序列d 、e 对二值汉字图像进行细化的结果如图2 1 3 所示: 通过实验可以看出,利用这种结构对序列对图像细化后,存在明显缺陷:细 化后的图像发生了畸变,且有毛刺现象。 第2 章文档图像的分割 一1 一| d 口口:荽渤繇i 警! 譬 口、 一一w u ; 图2 1 3 利用结构对序列d 、e 细化后的图像 。 2 3 4 本文改进的数学形态学细化算法 汉字细化有助于突出汉字的形状结构特征,减少冗余的信息量。目前针对图 像的细化
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 施工现场环境保护方案
- 诚信教育:扬弃诚信之风小学主题班会课件
- 预防火灾事故守护校园安全,小学主题班会课件
- 灌注桩文明施工管理制度
- 高层钢结构抗震方案
- 传统村落运维管理工作制度
- 采掘接续计划编制实施报告
- 包装废弃物预处理车间设计
- 小学主题班会课件:团结互助情义无价
- 餐饮定制化平台服务合同
- 乡镇合法性审查工作报告
- 医学美容科宣传
- 怎样提高护理工作效率
- 深基坑施工方案(一体化污水提升泵站)
- GB/T 8492-2024一般用途耐热钢及合金铸件
- 大学生创新创业能力的测试与评估研究
- 感觉统合与感觉统
- 陕西诺正生物科技有限公司年产20000吨农药原药及中间体生产线建设项目环境影响报告
- GB/T 3478.5-2008圆柱直齿渐开线花键(米制模数齿侧配合)第5部分:检验
- GB/T 26148-2010高压水射流清洗作业安全规范
- 降低注汽锅炉油耗
评论
0/150
提交评论