已阅读5页,还剩49页未读, 继续免费阅读
(检测技术与自动化装置专业论文)汉字图像识别机研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
汉字图像识别机研究 摘要 针对手写体汉字图像及车牌汉字图像,研究汉字图像的稳定特征和整体性、 可分解性,构建了汉字图像识别机。通过粗分类、特征提取、判别与反馈校正, 以提高汉字图像识别适应性和识别准确率。笔者主要完成了以下几个方面的有 意义工作: ( 1 ) 仿人汉字图像智能识别机。研究了仿人( 专家) 经验知识、模式识别理 论及反馈控制过程。提出了一种仿人汉字图像智能识别机。该识别机采用决策 控制级、模式识别级和反馈校正级并行式结构。决策控制级选择最佳的识别策 略和参数,模式识别级依据识别策略进行多分类器结果融合识别,并根据对模 式识别级输出的可信度判断结果进行反馈校正识别方法和参数,以提高汉字的 识别率。 ( 2 ) 汉字图像编码识别机。研究了多种汉字图像编码识别方法共同特性及不 同点。提出了一种汉字图像编码识别机。该识别机能够综合提取各个编码识别 方法中的稳定特征,进行粗分类,再根据现场识别的具体情况,有针对性的进 行系统反馈识别,并在识别的过程中记录各编码识别方法的识别结果对各方法 的识别效果进行动态评价、排序,进而调整识别方案,加快了分类速度,提高 了识别率。 ( 3 ) 采用上述两种汉字图像识别机结构,在总结相关文献资料和实验室前期 研究成果的基础上,采用小波变换等数学工具,以汉字图像识别为对象,以v c + + 和m a t l a b 6 5 编程语言为实现手段,成功实现了对多种类型手写体汉字图像 ( 复杂、简单、左右结构、上下结构等) 及车牌汉字的识别。并且,随着识别 次数的增多,识别机所获得的经验知识不断累积,进一步自我学习、完善,能 够不断提高汉字图像的识别速度和准确率。 本文研究表明:上述两种汉字图像识别机能够有效的对待识别汉字图像进 行粗分类判断、最佳识别方案决策及细分类多分类器融合识别,并能对识别结 果进行可信度判断与反馈校正。提高了识别准确率。 关键词:汉字图像识别,粗分类,反馈,仿人汉字图像智能识别机,汉字图像 编码识别机 r e s e a r c ho nc h i n e s ec h a r a c t e r i m a g e r e c o g n i t i o nm a c h i n e a b s t r a c t a i m i n ga tt h es c r i p tc h i n e s ec h a r a c t e ri m a g e sa n dt h ev l pc h i n e s ec h a r a c t e r i m a g e s ,t h es t a b i l i z a t i o nc h a r a c t e r i s t i c s ,t h eh o l i s t i ec h a r a c t e r i s t i c sa n dr e s o l v a b i l i t y a r er e s e a r c h e di n t h i st h e s i st oc o n s t r u c tt h ec h i n e s ec h a r a c t e ri m a g er e c o g n i t i o n m a c h i n e t h ec o a r s ec l a s s i f i c a t i o n ,c h a r a c t e r i s t i c sp i c k - u p ,j u d g e m e n ta n df e e d b a c k a r eu s e di nt h em a c h i n et oi n c r e a s et h er e c o g n i t i o na d a p t a b i l i t ya n da c c u r a c y t h ef o l l o w i n ga r et h em a j o rc o n t e n t si nt h et h e s i s : ( 1 ) aa p e r yc h i n e s ec h a r a c t e ri m a g ei n t e l l i g e n tr e c o g n i t i o nm a c h i n e t h ea p e r y ( e x p e r t ) e x p e r i e n c e ,p a t t e mr e c o g n i t i o na n dt h ep r o c e s so fi n t e l l i g e n tc o n t r o l j u d g e m e n ta n df e e d b a c ka r er e s e a r c h e d aa p e r yc h i n e s ec h a r a c t e r si m a g ei n t e l l i g e n t r e c o g n i t i o nm a c h i n ei sp r e s e n t e d ap a r a l l e l i n gs t r u c t u r eo fd e c i s i o n - m a k i n gl e v e l , p a t t e r nr e c o g n i t i o nl e v e la n df e e d b a c kl e v e li sa d o p t e d d e c i s i o n m a k i n gl e v e l c h o o s e st h eb e s tr e c o g n i f i n gs t r a t e g i e sa n d p a r a m e t e r s ,p a t t e r nr e c o g n i t i o nl e v e lu s e s m u l t i c l a s s i f i e rr e s u l t sf u s i o n ,f e e d b a c kl e v e lc a nf e e db a c kt or e v i s et h er e c o g n i z i n g m e t h o d sa n dp a r a m e t e r sd e p e n d i n go nt h er e s u l t so fr e l i a b i l i t yj u d g e m e n t t h i s s t r u c t u r ec a l li n c r e a s et h er e c o g n i t i o nr a t e ( 2 ) ac h i n e s ec h a r a c t e ri m a g ec o d i n gr e c o g n i t i o nm a c h i n e t h es a n l ea n d d i f f e r e n tc h a r a c t e r i s t i c so fm a n yc h i n e s ec h a r a c t e ri m a g ec o d i n gr e c o g n i t i o n m e t h o d sa r er e s e a r c h e d ac h i n e s ec h a r a c t e ri m a g ec o d i n gr e c o g n i t i o nm a c h i n ei s p r e s e n t e d i tc a nc h o o s et h es t e a d yc h a r a c t e r i s t i c so fe a c hc o d i n gr e c o g n i t i o n m e t h o d st om a k ec o a r s ec l a s s i f i c a t i o n ,t h e n ,u s es y s t e mf e e d b a c kr e c o g n i t i o n d e p e n d i n go nd i f f e r e n ts i t u a t i o na n dm e m o r i z et h er e c o g n i t i o nr e s u l t st oj u d g ea n d q u e u et h er e c o g n i t i o ne f f e c to fe v e r yc o d i n gr e c o g n i t i o nm e t h o d sd y n a m i c a l l y i tc a n i n c r e a s et h ec l a s s i f i c a t i o nr a t ea n dr e c o g n i t i o nr a t e ( 3 ) d e p e n d i n go nt h ei n t e r r e l a t e dl i t e r a t u r ed a t u ma n dt h ef o r m e rr e s e a r c h r e s u l t so fm yl a b ,t h ew a v e l e tt r a n s f o r ma n do t h e rm a t h e m a t i ci n s t r u m e n t sa r e a d o p t e d ;t h ev c + + a n dt h em a t l a b 6 5a r eu s e da st h er e a l i z a t i o nm e t h o d si nt h i s t h e s i s t h er e c o g n i t i o no fv a r i o u ss t y l es c r i p tc h i n e s ec h a r a c t e ri m a g e sa n dt h ev l p c h i n e s ec h a r a c t e ri m a g e sd e p e n d i n go nt h ea b o v et w oc h i n e s ec h a r a c t e ri m a g e r e c o g n i t i o nm a c h i n es t r u c t u r e sa r ea c c o m p l i s h e ds u c c e s s f u l l y t h em o r er e c o g n i t i o n t i m e s ,t h em o r ee x p e r i e n c et h em a c h i n eg e t s ,a n dt h eh i g h e rr e c o g n i t i o nr a t e t h er e s e a r e hi n t h i st h e s i ss h o w st h a tt h ea b o v et w oc h i n e s ec h a r a c t e ri m a g e r e c o g n i t i o nm a c h i n e sc a nm a k ec o a r s ec l a s s i f i c a t i o n , t h eb e s tr e c o g n i t i o ns t r a t e g i e s d e c i s i o n - m a k i n g ,m u l t i c l a s s i f i e rr e s u l t sf u s i o nr e c o g n i t i o n ,r e l i a b i l i t yj u d g e m e n ta n d f e e d b a c kr e v i s i o nd e p e n d i n go nt h er e c o g n i t i o nr e s u l t s t h e s ec a ni n c r e a s et h e r e c o g n i t i o na c c u r a c y k e y w o r d s :c h i n e s ec h a r a c t e ri m a g er e c o g n i t i o n ,c o a r s ec l a s s i f i c a t i o n ,f e e d b a c k ,a a p e r yc h i n e s ec h a r a c t e ri m a g ei n t e l l i g e n tr e c o g n i t i o nm a c h i n e ,a c h i n e s ec h a r a c t e ri m a g ec o d i n gr e c o g n i t i o nm a c h i n e 插图清单 图2 1仿人汉字图像智能识别机模型 图2 2 汉字基元示意图 图3 1汉字图像编码识别机模型 图3 2 汉字轮廓特征提取示意图 图4 1三层多分辨分析树结构图 图4 2图像小波分解示意图 图4 3 汉字“津”的小波分解示意图 图4 4 识别流程图 图4 5 手写体“休”的汉字图像 图4 6 手写体“休”的二值图像 图4 7 标准汉字图像“休” 图4 8 标准汉字图像“体” 图4 9 手写体“羹”的汉字图像 图4 1 0 手写体“羹”的二值图像 图4 1 l 标准汉字图像“羹” 图4 1 2 车牌汉字图像“沪” 图4 1 3 车牌汉字图像“沪”的二值图像 图4 1 4 十码汉字编码法粗分类结果 图4 1 5 八形编码法粗分类结果 1 3 一1 6 2 3 一2 8 3 2 3 4 3 5 一3 6 3 6 3 7 3 8 3 8 3 9 3 9 4 0 4 1 4 1 4 2 。4 2 表格清单 表3 1十码汉字编码法编码规则表2 9 表3 2 八形编码法编码规则表3 0 独创性声明 苯人声明所呈交的学位论文是本人在导师指导下进行的研究工作及取得的研究成果。 据我所知除了文中特别加以标注和致谢的地方外论文中不包含其他人已经发表或撰写 过的研究成果,也不包含为获得盒魍王些太堂或其他教育机构的学位或证书而使 用过的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说明 并表示谢意。 学位论文作者签名 多鼻 签字日期:肋占年,月j d 日 学位论文版权使用授权书 本学位论文作者完全了解佥胆王些太堂有关保留、使用学位论文的规定,有权保留 并向国家有关部门或机构送交论文的复印件和磁盘。允许论文被查阅和借阅。本人授权金 胆王些太堂可以将学位论文的全部或部分内容编入有关数据库进行检索,可以采用影印、 缩印或扫描等复制手段保存、汇编学位论文。 ( 保密的学位论文在解密后适用本授权书) 学位论文作者签名: 多坪 签字日期:2 月g 年r 月2 口日 导师签名 谲手 签字日期:础朋炙扫 学位论文作者毕业后去向:谛彳( 司亏蔽祝i 挺1 分有限公黾 工作单位:堵牛l 习方反名见眨份 电话: 通讯地址:e 享辛双清蹄 邮编: 致谢 本文的主要工作是在我的导师王建平教授的悉心指导下完成的。从课题的 选题到研究都倾注了王老师大量的心血,我的每一点进步都离不开王老师的精 心指导和帮助。王老师精湛的专业知识,严谨的治学态度,求实的科学精神、 敏锐的学术思维以及对学生的殷殷教诲与激励,使我受益匪浅,终身难忘。在 此对王老师三年来的辛勤培养致以诚挚的感谢! 衷心感谢合肥工业大学智能控制研究所的王金玲老师、罗国军老师、穆道 明老师、郑洁老师给我学习上的无私帮助。 在实验室期间,得到了秦剑、钱自拓、丘志刚、季学锋、陈军、郭之辉、 赵丽欣、蔺菲、赵莉同学在学习上热情关心和无私帮助,在此向他们表示衷心 感谢;感谢同实验室的李帏韬、王熹徽、穆举胜、刘伟、杨金付、马宾、孙伟、 朱克忠等同学的关心和帮助;感谢好友张翰、张雅顺、鲍伟、周彬、王骏同学, 这段与你们一起度过的学习和生活时光是我人生的美好回忆! 感谢我的父母和亲人,焉得谖草,言树之背,养育之恩,无以回报。你们 永远健康、快乐是我最大的心愿! 最后,要感谢我的女朋友吴敏,感谢她一直以来对我学习与生活的理解、 支持和无私帮助! 在今后的人生道路上有她的相伴是我最大的幸福l 衷心感谢所有关心和帮助过我的同学和朋友! 作者:黄冉 2 0 0 6 年5 月 第一章绪论 汉字识别技术是一种高速、自动的信息录入手段,成为未来计算机的重要 职能接口,还可以作为办公自动化、新闻出版、机器翻译等领域的理想输入方 式,有着广泛的应用前景。所以在信息技术及计算机技术日益普及的今天,如 何将汉字方便、快速地输入到计算机中已成为关系到计算机技术能否在我国真 正普及的关键问题。 汉字是历史悠久的中华民族文化的重要结晶,闪烁着中国人民智慧的光芒。 汉字数量众多,仅清朝编纂的康熙字典就包含了4 9 0 0 0 多个汉字,目前使 用汉字达到万余字( 国家标准g b l 8 0 3 0 中共有2 7 4 8 4 个汉字) ,其数量之大, 构思之精,为世界文明史所仅有。由于汉字为非字母化、非拼音化的文字又数 量浩大、结构繁杂、变化多端,使得解决汉字的自动输入问题要比西方的少量 字符拼音文字的自动输入问题要艰巨的多。印刷文字有不同字体,不同大小之 分;手写汉字的书写更是因人而异,因时而变,形态变化十分巨大,如何解决 好这样一种完全有别于西方文字的超多类的,变化多端的模式识别问题需要从 理论和方法上加以研究。 1 1 汉字图像识别研究的发展历程1 1 1 2 1 1 3 1 1 4 i 文字识别很早就是人们的梦想,早在1 9 2 9 年,t a u s h c k 就在德国获得了一 项有关o c r ( o p t i c a lc h a r a c t e rr e c o g n i t i o n ) 的专利。欧美国家为了将浩如烟海、 与日俱增的大量报刊杂志、文件资料和单据报表等文字材料输入计算机进行信 息处理,从5 0 年代就开始了西文o c r 技术的研究,以便代替人工键盘输入。 汉字的识别最早可以追溯到6 0 年代,1 9 6 6 年,i b m 公司的c a s e y 和n a g y 利用 简单的模板匹配法识别了1 0 0 0 个印刷体汉字。7 0 年代以来,日本学者做了许多 工作,其中有代表性的系统有1 9 7 7 年东芝综合研究所研制的可以识别2 0 0 0 汉 字的单体印刷汉字识别系统;8 0 年代初期,日本武藏野电气研究所研制的可以 识别2 3 0 0 个多体汉字的印刷体汉字识别系统,代表了当时汉字识别的最高水平。 此外,日本的太平洋、松下、理光和富士等公司也有其研制的汉字识别系统。 这些系统在方法上,大都采用基于k l 数字变换的匹配方案,使用了大量专用 硬件,其设备有的相当于小型机甚至大型机,价格极其昂贵,没有得到广泛应 用。我国对汉字识别研究工作始于七十年代末,其研究工作大致可以分为三大 阶段: 第一阶段从7 0 年代末期到8 0 年代末期。这一阶段主要研究的是汉字识别 的算法和方案,研究人员提出了用于汉字识别的各种方法和特征,如特征点方 法、汉字周边特征、汉字的结构元特征等,并在此基础上研究成功一批汉字识 别系统,其中比较突出的有清华大学电子工程系研制成功的清华多字体印刷汉 字识别系统,沈阳自动化所研制的沈阳印刷汉字识别系统和北京信息工程学院 研制成功的北信单体印刷汉字识别系统。这一阶段是印刷汉字识别成果倍出的 时期。但是,这些成果还仅仅处于实验室阶段,没有转化为产品来实际解决印 刷汉字的自动输入问题。 第二阶段是九十年代初期开始,汉字o c r 技术进入了一个重要、蓬勃发展 的时期即将实验室的研究成果推向市场,推向实用,在实际的汉字识别输入应 用条件下,检验和考查这些研究成果。而一个汉字识别能否通过这一严峻的考 验,并进一步发展,取决于两个重要因素: 识别方案本身是否具有足够的抗干扰能力,以适应实际应用环境中各种干 扰噪声的影响,保持较高的识别正确率,满足实际应用的要求。 识别系统是否可以根据用户的要求、市场的需要,不断及时地改进系统的 性能指标和使用环境,从而在激烈的市场竞争中取得一席之地。 印刷体汉字识别系统的研究还要解决好实用汉字识别系统所必须解决的一 些问题,如版面的自动分析、行字切分、人机界面和良好的应用环境等等。这 一阶段,形成了一些初步实用的印刷体汉字识别系统开始进入市场。典型的系 统有:清华大学电子工程系完成的清华o c r ( t ho c r ) ,北京信息工程学院完 成的北信o c r ( b i o c r ) 和沈阳自动化所完成的沈阳o c r ( s v - o c r ) 。其中清华 o c r 以其较高的性能和良好的使用环境,颇受用户欢迎。 九十年代计算机硬件资源发生了巨大的变化,为手写体汉字识别提供了相 对充分的研究环境。更为重要的是,从8 0 年代开始,汉字o c r 的研究开发就 一直受到国家“8 6 3 计划”的很大资助,人而促进了许多o c r 重大成果的获得。 特别是在手写体识别方面。大量有关手写体o c r 方面的论文和系统开始出现。 到了1 9 9 2 年后,一些手写体汉字识别系统逐渐向实用化发展。 1 2 汉字识别的问题和困难1 5 1 1 6 1 1 7 i 与所有模式识别系统一样。汉字识别的主要性能指标是正确识别率和识别 速度:从实用角度看,还应考虑系统的复杂性、可靠性和价格等等。对识别系 统识别率和识别速度的要求,很难有一种统一的、严格的标准,主要根据实际 应用的需要来确定。但是作为一种输入手段,汉字识别系统的性能应该可以和 其它的输入手段( 如人工键入) 相比拟。目前由专业人员操作的汉字键入的错 误率约为1 ,键入速度最高达2 0 0 字m i n ,平均速度也在5 0 字r a i n 以上。作 为参考,这些指标应该是汉字识别系统必须达到的最低要求,在某些需要大量 输入的场合( 如数据库的建立) 对识别系统性能的要求还应更高。 要达到上述要求是相当困难的。这是因为:从客观上说,汉字是一种特殊 的模式集合。这种集合的模式种类( 汉字字数) 很多,结构复杂,有些模式十 2 分相似,加上印刷质量与干扰的影响,以及人们在书写时的随意性使字形不够 规范等原因,都使正确识别( 特别是要求具有高识别率) 十分困难。从技术上 说,人们关于模式识别的研究虽已有较长的历史,但迄今仍没有能够全面地适 用于分析或描述各种模式的严谨的理论。在研究某一种模式识别问题时,有的 方法比较巧妙,或者说,某种识别方法较符合被识别的模式集合的情况,因而 得到较好的效果。但是即使这是一种好的方法,由于不容易顾及所有各方面的 问题,所得结果往往也不是全局最佳的。例如,某一种方法可能得到较高的正 确识别率,但算法可能过于复杂,开销较大。 汉字集合识别的特点: ( 1 ) 字量大 目前我国常用汉字约3 0 0 0 4 0 0 0 个,国标g b 2 3 1 2 8 0 两级汉字共6 7 6 3 个。 识别系统一般应能正确识别这些常用的字,才能满足实际应用的需要。显然, 汉字集合的字量越大,识别速度越低。为了提高识别速度,常采用树分类,即 多级识别方法。采用这种方法以后,识别速度虽然可以提高,但也可能使识别 率下降。汉字集合字数愈多,正确识别率与识别速度的矛盾愈大。这是汉字识 别的主要困难之一。 ( 2 ) 字体多 我国印刷字体主要有宋体、仿来体、黑体和楷体四种,手写体则有楷书、 行书和草书三大类。印刷体汉字不同字体的同一个字虽然拓扑结构基本相同, 但笔划的粗细、长短、位置及姿态,都有一定的差别,各个部件( 如偏旁、部首 与主体) 的大小比例与位置,也都有所变异。换句话说,不同字体的同一个字的 字形点阵并不相同。对于手写汉字,这种差别就更大。因此,计算机自动识别 时,很难把不同字体的同一个字,用一个参考汉字来比较、判定。这种情况将 使多体汉字识别系统所需的参考模板数成倍增加,或者要求所选用的识别特征 能适应不同字体的字形变化,否则将难以获得足够高的识别率。 ( 3 ) 结构复杂、字形相似 和拼音文字相比,汉字笔划多,结构复杂。笔划最多的汉字有3 6 划,平均 每个汉字笔划为1 1 划。由于笔划多,有的汉字结构十分复杂,有的字虽然笔划 较少,但往往字形十分相似,如“人、入”;“巳、已、己”;“戊、戍、戎”:“王、 主、玉”;“大、犬、太”等。这些字有的只有一点之差,或者某一笔划长短略 有差别,其意义就迥然不同。识别时必须能正确判定这些微小差异,否则就会 发生错误。我国工作者已经在这方面进行了大量研究并取得了一定的成果。 汉字识别可简单的分为两个过程:学习( 训练) 过程和识别过程。学习过 程就是让计算机通过样本学习或训练提取出每个汉字的特征并存储起来,作为 标准特征库,即模板库;识别过程中,计算机首先按学习过程中的特征提取方 法提取出输入模式的特征,然后再与标准特征库中的特征进行匹配,匹配程度 最大的汉字即为识别结果。因此,如何确定表达待识别汉字模式的最佳特征, 如何进行特征匹配,从而进行高效、快速的识别,是汉字识别技术的关键所在。 1 3 汉字图像识别方法分析 s l 9 1 1 0 1 1 1 1 1 1 1 2 l 汉字的模式表达形式和相应的字典形成方法有多种,每种形式又可以选择 不同的特征,每种特征又有不同的抽取方法,这使得判别方法和准则以及所用 的数学工具不同,形成了种类繁多,形式特别的文字识别方法。用于汉字识别 的模式识别可以大致分为以几下类:第l 类是基于汉字结构特征的方法,第2 类是基于汉字统计特征的方法,包括传统的海量样本搜集法、多特征集成法和 非线性归一化法等;第3 类是基于人工神经网络的识别方法;此外一些结构与 统计相结合的识别方法和基于仿人视觉的识别方法也逐渐兴起。 1 3 1 结构模式识别方法 结构模式识别理论在2 0 世纪7 0 年代初形成,是早期汉字识别研究的主要 方法。其思想是直接从汉字的轮廓或骨架上提取的汉字像素分布特征,如:笔 画、圈、端点、节点、弧、突起、凹陷等多个基元组合,再用结构方法描述基 元组合所代表的结构和关系。通常,提取笔段或基本笔划作为基元,由基元组 合及其相互关系完全可以精确地对汉字加以描述,最后利用形式语言及自动机 理论进行文法推断,即识别。结构模式识别方法的主要优点在于对字体变化的 适应性强,区分相似字的能力强,缺点是抗干扰能力差,从汉字图像中精确的 抽取基元、轮廓、特征点比较困难。匹配过程复杂。要想将这种方法发扬光大, 首先要寻求有效的预处理算法,待识别汉字的结构在经历预处理后能够清晰、 完整、标准化地再现:其次,在特征提取方法上也还有很多工作可做,只有得 到可靠、稳定、独立且数量较小的特征,结构识别方法的优势才能够最大限度 地发挥出来。如果上述两点问题得到较好的解决的话,结构识别方法将显示出 其巨大的优势,匹配方法直观、形象:识别稳定性好,算法的泛化能力强。 常见的结构模式识别方法有: ( 1 ) 笔划密度特征:笔划密度的描述有许多种,这里采用如下定义:字符图 像某一特定范围的笔划密度是在该范围内,以固定扫描次数沿水平、垂直或对 角线方向扫描时的穿透次数。这种特征描述了汉字的各部分笔划的疏密程度, 提供了比较完整的信息。在图像质量可以保证的情况下,这种特征相当稳定。 在脱机手写体的识别中也经常用到这种特征。但是在字符内部笔划粘连时识别 的误差会较大。 ( 2 ) 外围特征:汉字的轮廓包含了丰富的特征,即使在字符内部笔划粘连的 情况下,轮廓部分的信息也还是比较完整的。这种特征非常适合于作为粗分类 的特征,但细分的能力不强。 ( 3 ) 基于微结构特征的方法:这种方法的出发点在于,汉字是由笔划组成的, 而笔划是由一定方向,一定位置关系与长宽比的矩形段组成的。这些矩形段则 称为微结构。利用微结构及微结构之间的关系组成的特征对汉字进行识别,获 得了良好的效果。其不足之处是,在内部笔划粘连时,微结构的提取会遇到困 难。 ( 4 ) 特征点特征:早在1 9 5 7 年,s o l a 廿o ne l e c t r o n i c sg r o u p 公司发布了第一 个利用窥视孔( p e e p h o l e ) 方法的o c r 系统。其主要思想是利用字符点阵中一些 有代表性的黑点( 背景) ,白点( 笔划) 作为特征来区分不同的字符。后有人又 将这种方法运用到汉字识别中,对其中的黑点又增加了属性的描述,如端点、 折点、交叉点等。也获得了比较好的效果。其特点是对于内部笔划粘连的字符 的识别的适应性较强,直观性好,但是不易表示为矢量形式,不适合作为粗分 类的特征,匹配难度大。 1 3 2 统计模式识别方法 统计决策论发展较早,理论也较成熟。其要点是提取待识别模式的一组统 计特征,然后按照一定准则所确定的决策函数进行分类判决。汉字的统计模式 识别是将字符点阵看作一个整体,其所用的特征是从这个整体经过大量的统计 而得到的。统计特征的特点是抗干扰性强,匹配与分类的算法简单,易于实现。 不足之处在于细分能力较弱,区分相似字的能力差一些。另外,与结构法相比, 特征无直观性的物理意义。 常见的统计模式识别方法有: ( 1 ) 模板匹配:模板匹配并不需要特征提取过程。字符的图像直接作为特征, 与字典中的模板相比,相似度最高的模板类即为识别结果。这种方法简单易行, 可以并行处理。但是一个模板只能识别同样大小、同种字体的字符,对于倾斜、 笔划变粗变细均无好的适应能力,因此对大字符集不适用。 ( 2 ) 利用变换特征的方法:对字符图像进行二进制变换( w a l s h ,h a r d a m a 变 换) 或更复杂的变换( 如小波变换、k a r h u n e n l o e v e ,f o u r i e r ,c o s i n e ,s l a n t 变换铆, 变换后的特征的维数大大降低。但是这些变换不是旋转不变的,因此对于倾斜 变形的字符的识别会有较大的偏差。二进制变换的计算虽然简单,但变换后的 特征没有明显的物理意义。k - l 变换虽然从最小均方误差角度来说是最佳的, 但是运算量较大。小波变换是空间和频率的局域变换,能有效地从信号中提取 信息,它通过伸缩和平移等运算功能对函数或信号进行多尺度细化分析,解决 了傅里叶变换不能解决的许多困难问题,因而被誉为“数学显微镜”。总之,变 换特征的运算复杂度较高。 ( 3 ) 投影直方图法:利用字符图像在水平及垂直方向的投影作为特征。该方 法对倾斜旋转非常敏感,对图像质量要求高,细分能力差。 ( 4 ) 几何矩( g e o m e m cm o m e n t ) 特征:m k h u 提出利用矩不变量作为特征 的想法,引起了研究矩的热潮。研究人员又确定了数十个移不变、比例不变的 矩。人们都希望找到稳定可靠的、对各种干扰适应能力很强的特征,在几何矩 方面的研究正反映了这一愿望。以上所涉及到的几何矩均在线性交换下保持不 变。但在实际环境中,很难保证线性变换这一前提条件。 ( 5 ) s p l i n e 曲线近似与傅立叶描绘子f f o 谢e rd e s c r i p t o r ) :两种方法都是针对 字符图像轮廓的。s p l i n e 曲线近似是在轮廓上找到曲率大的折点,利s p l i n e 曲 线来近似相邻折点之间的轮廓线。而傅立叶描绘子则是利用傅立叶函数模拟封 闭的轮廓线,将傅立叶函数的各个系数作为特征的。前者对于旋转很敏感。后 者对于轮廓线不封闭的字符图像不适用,因此很难用于笔划断裂的字符的识别。 当然还有许多种不同的统计特征,诸如图描述法、包含配选法、脱壳透视 法等,这里就不一一介绍了。 1 3 3 人工神经网络方法 人工神经网络( a r t i f i c i a ln e u r a ln e t w o r k ,以下称a n n ) 是一种模拟人脑神经 元细胞的网络结构,它是由大量简单的基本元件神经元相互连接成的自适 应非线性动态系统。虽然目前对于人脑神经元的研究还很不完善,无法确定 a n n 的工作方式是否与人脑神经元的运作方式相同,但是a n n 正在吸引着越 来越多的注意力。a n n 中的各个神经元的结构与功能较为简单,但大量的简单 神经元的组合却可以非常复杂,从而可以通过调整神经元间的连接系数完成分 类、识别等复杂的功能。a n n 还具有一定的自适应的学习与组织能力,组成网 络的各个“细胞”可以并行工作,并可以通过调整“细胞”间的连接系数完成 分类、识别等复杂的功能。a n n 可以作为单纯的分类器( 不包含特征提取,选 择) ,也可以用作功能完善的分类器。在英文字母与数字的识别等类别数目较少 的分类问题中,常常将字符的图像点阵直接作为神经网络的输入。不同于传统 的模式识别方法,在这种情况下,神经网络所“提取”的特征并无明显的物理 含义,而是储存在神经物理中各个神经元的连接之中,省去了由人来决定特征 提取的方法与实现过程。从这个意义上来说,a n n 提供了一种“字符自动识别” 的可能性。此外,a n n 分类器是一种非线性的分类器,它可以提供很难想象到 的复杂的类间分界面,这也为复杂分类问题的解决提供了一种可能的解决方式。 1 3 4 仿人视觉的识别方法 除此之外,利用人的视觉特性,对原始图像进行一定处理后进行特征提取, 6 也是有效的特征提取方法。人类的视觉感知始终是计算机视觉研究追踪的目标 模仿人类视觉特性对原始图像的处理无疑是十分吸引人的。如有的研究已经证 明,人类在抽取低层次视觉特征时,其视皮层简单细胞对图像信号的响应与二 维g a b o r 滤波器及其相似。利用g a b o r 变换可达到空域和频域的最佳联合清晰 度,和对噪声,小位移,旋转和尺度变化的不敏感性,对原始文字图像进行了 g a b o r 变换处理进行的特征提取的研究和实验结果说明,在对灰度图像上汉字的 识别,包括对于手写汉字的识别,都获得了极高的抗干扰和鲁棒性。 1 4 汉字图像识别原理分析f 1 3 1 1 1 伽1 15 1 1 1 6 】| 1 7 1 1 1 8 i 汉字识别属于模式识别的研究范畴。汉字识别技术涉及数字图像处理、模 式识别、人工智能、模糊数学、组合数学、心理学等多个学科,是- - f l 综合的 技术。其实质是解决文字的分类问题,一般通过特征辨别及特征匹配的方法来 实现。目前汉字识别技术按照识别的汉字不同可以分为印刷体汉字识别和手写 体汉字识别。印刷体汉字识别从识别字体上可分为单体印刷体汉字识另u ( p d n t e d c h a r a c t e r r e c o g n i t i o n ) 与多体印刷体汉字识别( m u l t i f o n tp r i n t e dc h a r a c t e r r e c o g n i t i o n ) ;手写体汉字识别根据实时性又可以分为联机手写体识别( o n - l i n e h a n d w r i t t e nc h a r a c t e rr e c o g n i t i o n ) 和脱机手写体识别( o f f - l i n eh a n d w r i t t e nc h a r a c t e r r e c o g n i t i o n ) 。汉字识别的原理如图1 所示。汉字通过用扫描仪扫描或者数码相 机拍摄等光学方式输入后得到图像或者灰度图像,然后利用各种模式识别算法 对汉字图像进行分析,提取汉字的特征,与标准汉字进行匹配判别,从而达到 识别汉字的目的。汉字图像识别技术包括预处理、特征提取、识别和后处理四 个步骤。 1 4 1 预处理 由于用数码相机或扫描仪作为输入设备得到的数据不可避免地存在着各种 外在的干扰,图像质量也有偏差,对识别效果有一定影响。因此,在对原始汉 字图像进行识别处理之前,尽可能将干扰因素影响降低,是非常有必要的,也 就是要先对原始采样信号进行预处理。预处理通常包括图像二值化、平滑化( 去 噪) 、归一化、字符分割等方面。 1 4 2 特征提取 汉字识别中的关键问题之一就在于怎样快速地抽取能充分描述汉字模式地 稳定可靠地特征,良好的特征应该使一种汉字的不同书写样本之间的差异性尽 可能小,而在不同汉字之间的差异性尽可能大。与其他模式识别问题不同的是, 能准确地知道哪些特征能够将不同的汉字区别开来。但是,由于在汉字图像处 7 理过程中的困难。使得无法得到所需的所有特征。因此就要研究哪些特征比较 具有分类价值,同时又比较容易通过程序计算得到。在寻找汉字特征时,还要 考虑特征对字体的不同、汉字大小的不同及噪声的影响等因素的不敏感性。 在相当长的文字识别的研究过程中,是利用人们的经验知识,指导文字特 征的提取:人们经历了许多特征的提取。例如边缘特征、交换特征、穿透特征、 网格特征、特征点特征、方向线索特征等等,视其在汉字识别过程中的实际效 果决定其取舍。经过长期和大量的实验研究,才选取得到的良好的识别特征。 这些特征在汉字识别的研究发展中发挥了重要作用。 当然,采用单一的特征提取方法利用的汉字信息量有限,因此不可避免地 会存在一些识别的“死角”,也就是存在利用该特征很难区分的汉字。现在人们 通常运用数据融合的理论,由不同的原始特征向量进行多特征融合,合成新的 特征向量将有利于增强特征向量的分类能力,新特征保留了参与融合的单个特 征对各个类别的有效鉴别信息,在一定程度上消除了多个特征之间的信息冗余, 实现了信息压缩,可以实现最优识别特征的自动提取,滤除对类别识别无效的 特征和干扰,有利于信息的实时处理。 1 4 3 分类识别 识别算法是整个识别过程的核心部分。原始图像经过预处理后,得到一个 较为理想的二值图像,然后就可以对这个处理后的二值图像进行识剐。识别的 过程包括根据识别算法选择和提取汉字的特征、与标准文字的特征进行匹配判 别。 现有的分类器主要有两类:基于距离的分类器和神经网络分类器,二者原 理不同,性能各有所长,但总的来说每个单独的分类器无法达到很高的识别率 和可靠度。由于每种分类方法都有自己的优、缺点和不同的适用范围,现在人 们通常采用多分类器集成方法( 包括串行、并行以及串并行混合三种集成方式) 来提高识别率。 1 4 。4 后处理 由于汉字形状变化各异,单字识别率的提高就受到一定的限制。为了提高 识别率,人们往往在分类识别后进行识别后处理。后处理就是利用词义、词频、 语法规则等语言先验知识或其他分类识别结果对识别结果进行校正,进一步提 高识别率和适应性,降低系统的误识率。目前,常见的后处理方法有:基于统 计概率的后处理,基于隐形马尔可夫模型的后处理等。 1 5 汉字图像识别技术的发展趋势1 1 5 1 1 1 9 i 我国近2 0 年汉字识别研究取得的令人瞩目突出进展覆盖了所有的汉字识别 领域。不仅在理论和算法上,而且在软件开发上成功开发出一系列具有自主知 识产权的国际领先水平的文字识别商用软件产品。 但到目前为止,适应各种书写体,性能稳定、抗干扰能力强的高效实用系 统仍处于研究阶段,因此对于汉字图像识别还有许多工作要做。 现阶段,汉字图像识别急待解决的主要问题有: 由于汉字的特征向量维数较高,将待识别汉字的特征向量同样本库中的海 量模板匹配会占用很多识别时间,因此如何提高识别速度也是一个需要深入研 究的课题; 在特征提取阶段,如何避免识别的“死角”,对不同的汉字图像选择一组或 多组适用于该汉字图像字体、笔迹的最佳特征向量; 在分类识别阶段,如何构造分类器,以提高识别率和可靠度; 在后处理阶段,如何对识别结果进行评判和自适应校正,迸一步提高识别 率和适应性,降低系统的误识率: 另外,我国尚未建立标准的手写体汉字测试数据库和测试机制,对汉字识 别效果缺乏标准的鉴定和评价依据,这使得目前的研究成果无法进行比较和评 判。 因此,到目前为止,适应各种书写体,性能稳定、抗干扰能力强、高效实 用的汉字图像识别系统仍处于实验室研究阶段,对于汉字图像识别还有许多工 作要做。 1 6 本文工作及内容安排 1 6 1 论文研究的主要内容 本文在总结相关文献资料和实验室前期研究成果的基础上,采用小波变换 等数学工具,以汉字图像识别为对象,以v c + + 和m a t l a b 6 5 编程语言为实现 手段,对汉字图像识别机理和过程进行了研究。针对手写体汉字图像及车牌汉 字图像,研究汉字图像的稳定特征和整体性、可分解性,构建汉字图像识别机。 通过粗分类、特征提取、判别与反馈校正,以提高汉字图像识别适应性和识别 正确率。笔者主要完成了以下几个方面的有意义工作: ( 1 ) 仿人汉字图像智能识别机。研究了仿入( 专家) 经验知识、模式识别理 论及智能控制评判与反馈判断过程。提出了一种仿人汉字图像智能识别机。该 识别机采用决策控制级、模式识别级和反馈校正级并行式结构,能够首先选取 待识别汉字图像中最频繁、最稳定的特征,实现快速、准确的粗分类,构建该 9 汉字图像的粗分类特征模型,并依据粗分类特征模型选择适用于该汉字图像结 构、字体、笔迹的最佳识别方法策略( 一组有序的分类器) ;其次采用所选择的 最佳识别方法策略对待识别汉字图像进行多分类器结果融合识别,避免了识别 的“死角”,提高了识别的效率;最后对该汉字图像的识别结果进行可信度判断 与反馈校正。若可靠则输出正确结果,反之则将识别和
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- GB/T 48079-2026豆瓣酱质量通则
- 2026年桐柏县带编教师招聘笔试备考试题及答案解析
- 2026年武宁县带编教师招聘考试模拟试题及答案解析
- 2026年东丰县带编教师招聘笔试参考题库及答案解析
- 2026年仁寿县带编教师招聘考试备考试题及答案解析
- DB32/T 5263-2025 城市轨道交通工程防水技术规程
- 2026年天峻县带编教师招聘考试备考题库及答案解析
- 兰州大学《大气科学》期末考试试题及答案
- 2026年江城哈尼族彝族自治县带编教师招聘考试模拟试题及答案解析
- 2026年富顺县带编教师招聘笔试备考试题及答案解析
- 2026年河南中职对口升学机电类专业试题含答案
- 2026年江苏省徐州市中考英语真题(含答案)
- 20起典型火灾事故案例合集-2024年消防月专题培训
- Nikon尼康D3100中文说明书
- 高中化学必修一必修二综合测试题和解答
- (正式版)JBT 14660-2024 额定电压6kV到30kV地下掘进设备用橡皮绝缘软电缆
- 建筑工程分部分项工程划分表(新版)
- 消防安全技术实务1
- 《化工设备基础》课程标准
- GB/T 29163-2012煤矸石利用技术导则
- GB/T 20634.3-2008电气用非浸渍致密层压木第3部分:单项材料规范由桦木薄片制成的板材
评论
0/150
提交评论