已阅读5页,还剩73页未读, 继续免费阅读
(计算数学专业论文)ocr中的细化算法与多进制小波在人脸识别中的应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
中山大学硕士论文 0 c r 中的细化算法与多进制小波在人脸识别中的应用 o c r 中的细化算法与多进制小波在人脸识别 中的应用 专业:计算数学 硕士生:董健卫 指导老师:杨力华 摘要 本文由两部分组成,第一部分主要研究在o c r 中所进行的细化处理方法,第 二部分主要研究多进制小波在人脸识别中的应用。 o c r 是模式识别中应用最成功的研究方向之一,自2 0 世纪5 0 年代中期以 来,o c r 一直是一个非常热门的研究领域。特征提取是整个o c r 中最重要的一 环,它是从单个字符图像中提取统计特征或结构特征的过程,提取的特征的稳定 性及有效性,直接决定了识别的性能。对字符图像进行细化处理,是许多特征提 取方法的一个重要的前期步骤。细化算法的主要困难是如何提高运行速度和避免 产生伪笔划段。为了避免产生伪笔划,许多学者提出了不同的算法,获得了比较 满意的结果。在系统分析和整理这些算法的基础上,本文提出了两种改进的基于 像素八邻域分析的细化算法,抑制了字符交叉处的畸变,有效地减少了伪笔划, 得到了中心对称骨架;而且处理速度快,具有一定的抗噪声能力,取得了较好的 细化效果。 多进制小波是小波分析理论的一个重要分支,它在兼顾对称性、光滑性、正 交性和紧支性方面优于二进制小波,能够解决一些二进制小波不能解决的问题, 因而得到了广泛的重视和研究。目前,多进制小波理论和应用已取得了许多重要 的成果,在模式识别领域中也得到了一些应用。本文把八进制小波分解应用到人 脸识别中,获得了良好的实验结果。 关键词;0 c r ,模式识别,特征提取,细化,多进制小波分析,人脸识别 中山大学硕士论文 0 c r 中的细化算法与多进制小波在人脸识别中的应用 t h i n n i n ga i g o r i t h m so no c r a n dt h e a p p | _ c a t i o no fm u i t i b a n dw a v e i e t s t of a c e r e c o g n i t i o n v m 司o r :c o m p u t a t i o n a lm a t l l e m a t i c 8 s t u d e n t :j i a n w e id o n g s u p e r v i s o r :l i h u a l g a b s t r a c t t h i sp a p e ri sc o m p o s e do ft w op a r t s t h ef i r s tm a i n l ya i m sa tm i n n i n ga l g o r i t h m s o no c ra l l dt h es e c o n df o c u s e sm a i n l yo nt l l ea p p n c a t i o no fm u l t i b a n dw a v e l c t st o f a c er e c o g n i t i o n o p t i c a lc h 缸t c ri k c o g n m o n ( o c r ) i so n eo fs u c ha r e a s 血a th a v ef o u n dm e m o s ts u c c e s s f u la p p l i c a t i o n si np a t t e mr c c o g n i t i o n s i n c em ef i f t i e so ft w e 蚯e t h c e n t u r y ,o c rh a sb e e nav e r ya t t r a c 曲gf i e l di np a t t e mr c c o g n i t i o n f e a t u r e e x t r a c t i o ni sc n i c i a lt ot 1 1 ef e c o g n i 6 0 nm t ei no c ra n ds t a t i s t i co rs t m c t u r a if e a t i l r e s a 豫c o m m o n l yu s e d t h i n n i n gi sav e r yi i i l p o r t a n ta n dt y p i c a lp r e p r o c e s s i n gf o rm a n y m e t h o d so ff e a t u r ee x t r a c t i o ni nc h a r a c t e rr e c o g n i t i o n ag o o da l g o r i t h mo fm i n n i n g s h o u l db el e s st i m e c o n s u n l i i l ga n dp r o d u c e su n w a n t e da r t i f a c t sa sl e s sa sp o s s i b l e m a n ya l g 州t h m sa n dt e c h n i q u e sf o rc h a r a c t e rt h i n n i n gh a v eb e e nd e v e l o p e di nt h e p a s td e c a d e s i nt t i i sp a p e r ,b yc o n s i d c i i n g 山ee 追h t - n e i g h b o r so fm ec o i l t o u rp i x e l so f i m a g e ,t w oi m p m v e dm i n n i n ga l g o r i t h m sa r ep r o p o s e dw h i c hc a np r o d u c ea s k e l e t o n w i 血g o o ds y m m e ya n dl e s sd e f o 衄a t i o na t t h ec r o s so ri n t e r s c c t i o no fs t m k e s m u l t i - b a n dw a v d e ti s 弛i 1 p o n a n tb r a n c ho fw a v e l c ta n a l y s i s i ti ss u p e t i t o2 - b a i l d w a v e l e t c o n s i d e r i n gs y r n i i 圮t 阱c o m p a c ts u p p o r t ,o r d l o g o a l i t y a n d r e g u l a r i t y s i m u l t a n e o u s l y m a i l ya c h i e v e n l e n t sh a v eb e e nm a d eo n l et h e o r yo f 删l t i - b a i l d w a v e l e t sa n di t sa p p l i c a t i o n si nt h er e c e n ty e a r s hm i sp a p e r e i 曲t - b a n dw a v e l e ti s a p p l i e dt of a c er e c o g n i t i o n e x p e r i m e n t sg i v ee n c o u r a g i n gr e s u l t s yw o 州s :o c r ,p a t t e mr e c o g n j t i o n ,f e a t u r ee x t r a c t i 叩,t l l i n l l i n g ,m u l t i - b a n dw a v e l e t ,f a c e r e c 0 旦n i d o n 中山大学硕士论文0 c r 中的细化算法与多进制小波在人脸识别中的应用 第一章绪论 1 1 论文的选题背景及意义 骨架提取在模式识别、图像数据压缩、特征提取以及线状目标自动跟踪等方 面均有广泛的应用。例如在汉字识别( 印刷体汉字识别及手写体汉字识别) 、手 写体数字识别、指纹识别、车牌识别等模式识别系统以及生物医学系统中,由细 化方法获得图像骨架是一个十分重要的预处理步骤。尤其在0 c r 识别系统中, 显得更为重要,因为骨架包含了原字符图像中最有效的一些特征以及数字化信 息,所以能对字符图像进行有效地描述。但现有的很多算法在字符交叉处所提取 的骨架会有很多伪笔划,因此对识别结果产生了很大的影响,鉴于此,本文提出 了改进的细化算法,取得了比较好的结果。 人脸识别因其在公安( 罪犯识别等) 、安全验证系统、信用卡验证、医学、档 案管理、视频会议、人机交互系统等方面的巨大应用前景而越来越成为模式识别 和人工智能领域的一个研究热点。虽然人类能毫不费力地识别出人脸及其表情, 但人脸的自动机器识别却是一个难度极大的课题。它牵涉到模式识别、图象处理 及生理、心理学等方面的诸多知识,与指纹、视网膜、虹膜、基因等其他人体生 物特征识别系统相比,人脸识别系统更加直接、友好,使用者无任何心理障碍。 并且通过人脸的表情姿态分析,还能获得其他识别系统难以获得的一些信息。人 脸识别的方法中,小波变换方法是一种重要的方法【赖】9 9 9 】,【y a n g2 0 0 3 。小波 分析由于其良好的时频局部性能而成为有力的信号处理分析工具,它对信号用一 组不同尺度的带通滤波器进行滤波,将信号分解到不同的频带上,进行分析处理。 图像信息可以看做是一类复杂的非线性非平稳的信号源,所以小波变换在图像处 理和模式识别中有着广泛的应用。多进制小波是小波分析理论的一个重要分支, 它在兼顾称性、光滑性、正交性和紧支性方面优于二进制小波,能够解决一些二 进制小波不能解决的问题,因而得到了广泛的重视和研究。目前,多进制小波理 论和应用己取得了许多重要的成果,在模式识别领域中也得到了一些应用。鉴于 此,本文成功地把八进制小波分解应用到人脸识别中,取得了很好的结果。 中山大学硕士论文0 c r 巾的细化算法与多进制小波在人脸识尉中的应用 1 2 本文的主要研究内容 本文主要研究在0 c r 中所进行的细化处理方法以及多进制小波在人脸识别 当中的应用。在o c r 中,通常,为了抽取字符笔画需要将原始点阵图像进行细 化处理,但是一般细化算法不仅速度慢,而且容易产生伪笔画段,如将一个四叉 点变成了二个三叉点,给准确抽取基元造成了困难。对于一般细化算法在笔划的 交叉或分叉处会出现较大的畸变现象,这种畸变将对识别结果产生很大的影响。 为了尽最大可能地避免这些情况的发生,减少畸变的产生,本文提出了两种改进 的并行细化算法,通过对图像轮廓像素的八邻域的处理得到了二值图像中心对称 骨架。该中心对称骨架有效地抑制了交叉点处的畸变,因而可以获得很好的细化 效果,而且具有较快的处理速度和一定的抗噪声能力。 多进制小波是近年来发展起来的小波理论的一个重要分支,它在兼顾对称 性、光滑性、正交性和紧支性方面优于二进制小波,能够解决一些二进制小波不 能解决的问题【朱2 0 0 2 】,【杨1 9 9 9 ,【王2 0 0 2 】,因而得到了广泛的重视和研究。八 进制小波分解是标准的二进肯4 小波分解的自然延伸,而它比之二进制小波分解的 优点在于:八进制小波分解能把信息分解到更多频道上,从而能对信息进行更细 节的分析。而实际表明八进制小波的这种特性能够很好的适应纹理信息多频道分 布的特点。本文把八进制小波分解应用到人脸识别中。首先对图像进行八进制小 波分解,把它分成6 4 个子带,然后对部分子带提取特征,形成一个特征向量,从 而得到每种人脸的特征,形成人脸特征库。最后利用该库对众多不同人脸进行分 类。实验结果表明,八进制小波分解在人脸识别中的应用能得到很好的结果。 1 3 本文的章节安排 第一章是绪论,简单介绍论文的选题背景和意义以及本文研究内容及章节安 排 第二章是为后面章节做准备,介绍本文使用到的相关基础知识 第三章研究现有关于骨架提取以及细化算法,并指出现有一些方法的不足, 继后提出本文的细化处理方法 第四章是基于多进制小波理论,本文提出了一种人脸识别方法 2 中山大学硕士论文0 c r 中的细化算法与多进制小波在人脸识别中的应用 第二章基础知识 2 1 图像表示 图像是用各种观测系统以不同的形式和手段观测客观世界而获得的,可以直 接或间接作用于人眼并进而产生视知觉的实体。例如人的视觉系统就是一个观测 系统,通过它得到的图像就是客观景物在人心目中形成的影像。视觉是人类观察 世界、认知世界的重要功能手段。视觉信息来源于图像,这里图像是比较广义的, 例如照片、绘图、视像,等等。图像带有大量的信息,百闻不如一见,一图值千 字都是说明了这个事实。这也是图像在近年得到广为宣传和应用的多媒体中占据 重要地位的主要原因。 客观世界在空间上是三维( 3 。d ) 的,但大部分成像装置都将3 d 世界投影 到二维( 2 - d ) 像平面,所以得到的图像是2 一d 的。一幅图像一般可以用一个2 d 数组月) 来表示,这里算和) ,表示2 - d 空间x y 空间中一个坐标点位置,而厂则 代表图像在点 y ) 的某种性质f 的数值。例如常用的灰度图,这时,表示灰度值, 当对可见光成像时,灰度值对应客观景物被观察到的亮度。 常见图像是连续的,即,_ c ,y 的值可以是任意实数。为了能用计算机对图 像进行加工,需要把连续图像在坐标空间和性质空间都离散化,这种离散化了的 图像就是数字图像,表达数字图像的2 一d 数组他y ) 中,x ,y 都在整数集合中 取值。在离散化了的数字图像中,每个基本单元叫做图像元素,简称像素( p i c t u r e e l e m e n t ) 。对2 - d 图像,英文里常用p i x e l ( 也有用p e l ) 代表像素。 不管用哪种图像表示方法,实际图像中的像素在空间是按某种规律排列的, 互相之间有一定的关系,像素之间的关系与像素的由近邻像素组成的邻域有关。 对1 个坐标为化y ) 的像素p ,它在水平和垂直方向上有4 个近邻像素,它们的坐 标分别是 + j ,) ,) ,o - j ,y ) , y + j ) ,伉) ,一j ) 。这些像素组成p 的4 一邻域,记为 n 4 ( p ) ,如图2 1 左图中的r 所示,需要指出,如果像素p 本身处在图像的边缘, 则它的n 4 ( p ) 中的若干像素会落在图像之外。 像素p 的4 个对角近邻像素的坐标是 + j ,y + j ) ,0 + j ,) ,n0 j ,y + j ) ,o j , y 一,) 。它们记为n d ( p ) ,如图2 1 中间图中的j 所示,像素p 的4 个4 一邻域近邻像 中山大学硕士论文o c r 中的细化算法与多进斛小波在人脸识别中的应用 素加上4 个对角邻域像素合起来构成p 的8 一邻域,记为n 8 ( p ) ,如图2 1 中右图 所示。同上,如果像素p 本身处在图像的边缘,则它的n d ( p ) 和n 8 ( p ) 中的若干个 像素会落在图像外 章2 0 0 2 】。 r r p r r 5j p js j,s r p r s r j 图2 1 从左至右依次是像素p 的n 4 ( p ) 、n d ( p ) 、n 8 ( p ) 像素之间关系的一个重要的概念是像素之间的距离。给定3 个像素p ,q ,r , 坐标分别为 ) ,) ,“o ,( “,v ) ,如果下列条件满足,则称函数d 是距离量度函数: ( 1 ) d ( p ,日) o ( d ( p ,目) = o 当且仅当p = 日) ; ( 2 ) d ( p ,q ) = d ( 鼋,p ) ; ( 3 ) d ( p ,r ) d ( p ,q ) + d ( 鼋,r ) 上述3 个条件中,第一个条件表明两个像素之间的距离总是正的( 两个像素 空间位置相同时,其间的距离为零) ;第二个条件表明两个像素之间的距离与起 终点的选择无关;第三个条件表明两个像素之间的最短距离是沿直线的。 在数字图像中,距离有不同的量度方法,点p 和q 之间的欧氏( e u d i d e a n ) 距 离定义为: 眈( p ,口) = ( j s ) 2 + ( y f ) 2 l ,2 根据这个距离量度,与y ) 的距离小于或等于某个值d 的像素都包括在以 y ) 为中心以d 为半径的圆中。 点p 和g 之间的距离d 4 ,也称为城区( c i t y b l o c k ) 距离,定义为: d 。( p ,碍) = i 工一s l + i y f 根据这个距离量度,与 y ) 的d 4 距离小于或等于某个值d 的像素组成以) ) 为中 心的菱形。 点p 和9 之间的距离d 8 ,也称为棋盘( c h e s s b o a r d ) 距离,定义为: 4 中山大学硕士论文0 c r 中的细化算法与多进制小波在人脸识别中的应用 d g ( p ,目) = m x ( 1 石一j i ,j y f i ) 根据这个距离量度,与) ) 的d 8 距离小于或等于某个值d 的像素组成以伉) ) 为中 心的正方形。 2 2 模式识别的基本概念 2 2 1 模式识别和模式 什么是模式呢? 广义地说,存在于时间和空间中可观察的事物,如果我们可 以区别它们是否相同或是否相似,都可以称之为模式。但模式所指的不是事物本 身,而是我们从事物中所获得的特征信息。因此,模式往往表现为具有时间或空 间分布的信息。本文所说的模式识别是指用计算机实现人的模式识别能力。信息 进入计算机之前通常要经过取样和量化,在计算机中具有时空分布的信息表现为 向量即数组。数组中元素的序号可以对应时间与空间,也可以对应其它的标识 【边2 0 0 0 。 人们为了掌握客观事物,按事物相似的程度组成类别。模式识别的作用和目 的就在于面对某一具体事物时将其正确地归入某一类别。例如,数字“4 ”可以 有各种不同的字体或写法以及大小,但它们都属于同一类,即使我们看到从未见 过的某种写法的“4 ”,也能正确地将其分到“4 ”这一类中去。 2 2 2 模式类的紧致性 为了能在某个空间中进行分类,通常假设圊一类的各个模式在该空间中组成 一个紧致集。从这个紧致集中的任何点可以均匀地过渡到同一集中的另外一 点,而在过渡途中的所有各点仍然属于这个紧致集,也就是说属于同一模式类。 紧致集应该具有以下性质: 临界点的数量与总的点数相比很少。 集合中任意两个点可以用光滑线连接,在该连线上的点也属于这个集合。 每个内点都有一个足够大的邻域,在该邻域中只包含同一集合中的点。 图2 2 中,( a ) 是没有临界点,( b ) 有许多i 临界点, ( c ) 的临界点已经多到 使分类不可能实现。也就是说只有( a ) 是满足紧致集的要求的。 5 中山大学硕士论文o c r 中的细化算法与多进制小波在人脸识别中的应用 (a)(b) m 啊 、 、 、! 7 m 崔 ( c ) 图2 2 假如每个模式类都满足紧致性假设,则解决模式识别问题就不会碰到什么原 则上的困难。但对于很多实际问题,这个假设是不成立的。然而,我们可以设计 出一种变换方法,使测量空间上属于同一类的所有各点都映射至特征空间上的同 一点,而把另一类的所有各点都映射到特征空间上的另外一点,且使这两点相隔 一个显著的距离。显然,经过这样的映射,模式类在特征空间是满足紧致性假设 的。实际上,我们可以说,只要各个模式类是可分的,总存在这样一个空间,使 变换到这个空间中的集合是满足紧致性要求的。如图2 2 中( a ) ,( b ) 是可分的, ( c ) 则是不可分的。但这样一种变换只能在解决识别任务的过程中求取,是和 具体问题紧密相关的。 2 2 3 相似与分类 模式识别是把具体事物归入某一类别的过程。要进行归类,首先要有类存在; 同时,分类要存在着划分的准则,也就是相似性度量。目前,得到广泛应用的相 似性度量是在空间中定义的某种距离。给定一个输入样本集合,我们用d 维空 间中一个点表示某个样本,两个样本t 和x ,之间的相似性度量占( 以,x ,) 应满足以 下要求: ( 1 ) 相似性度量应为非负数,即占( 也,x ,) o ; ( 2 ) 样本本身之间相似性度量应为最大值: ( 3 ) 相似性度量应满足对称性,即:万( ,x f ) = 万0 ,鼍) ( 4 ) 在模式类满足紧致性条件下,相似性应是点间距离的单调函数。 2 3o c r 技术 6 业啊* x* 哏譬 10叶2 搿 中山大学硕士论文0 c r 中的细化算法与多进制小波在人睑识别中的应用 2 3 1o c r 概述 自从2 0 世纪4 0 年代计算机诞生以后,人们对计算机的要求在不断提高,希 望计算机能具备类似于人的智能。随着2 0 世纪5 0 年代人工智能兴起,模式识别 作为一门新兴的学科逐步形成。并且,这一学科在生活中各个领域得到了成功的 应用。其中光学字符识别o c r ( o p t i c a lc h a r a c t e rr e c o g n i t i o n ) 系统就是一个很 好的例子。o c r 是模式识别的一个最成功的应用,自2 0 世纪5 0 年代中期以来, o c r 一直是一个非常热门的研究领域【m o r i1 9 9 2 】。o c r 是利用光学技术对文字 或字符进行扫描识别并转换成计算机内码。其概念首先由德国科学家t a u s h e c k 于1 9 2 9 年提出。几年后,美国科学家h a n d e l 也提出了利用光学技术对文字进行 识别的想法。但这种梦想直到计算机的诞生才变成了现实。它主要采用光学的方 式将文档资料转换成为原始资料黑白点阵的图像文件,然后通过识别软件将图像 中的文字转换成文本格式,以便文字处理软件进一步编辑加工的系统技术。在 6 0 7 0 年代,世界各国相继开始了o c r 的研究,而研究的初期,多以文字的识 别方法研究为主,且识别的文字仅为o 至9 的数字。以同样拥有方块文字的日本 为例,1 9 6 0 年左右开始研究o c r 的基本识别理论,初期以数字为对象,直至1 9 6 5 至1 9 7 0 年之间开始有一些简单的产品,如印刷文字的邮政编码识别系统,识别 邮件上的邮政编码,帮助邮局作区域分信的作业:对于汉字的识别最早可以追溯 到6 0 年代,1 9 6 6 年,m m 公司的c a s e y 和n a g y 发表了第一篇关于印刷体汉字 识别的论文,在这篇论文中他们利用简单的模板匹配法识别了1 ,o o o 个印刷体汉 字。7 0 年代以来,日本学者做了许多工作,其中有代表性的系统有1 9 7 7 年东 芝综合研究所研制的可以识别2 0 0 0 个汉字的单体印刷汉字识别系统:8 0 年代初 期,日本武藏野电气研究所研制的可以识别2 3 0 0 个多体汉字的印刷体汉字识别 系统,代表了当时汉字识别的最高水平。此外,日本的三洋、松下、理光和富 士等公司也有其研制的印刷汉字识别系统。这些系统在方法上,大都采用基于 k - l 数字变换的匹配方案,使用了大量专用硬件,其设备有的相当于小型机甚至 大型机,价格极其昂贵,没有得到广泛应用。同国外相比,我国的光学字符识别 研究起步较晚。我国0 c r 技术自7 0 年代才开始对数字、英文字母及符号的识别 进行研究。 o c r 作为模式识别一个重要的部分已经取得了很大的发展,市场上已经有 7 中山大学硕士论文o c r 中的细化算法与多进制小波在人脸识别中的虚用 很多比较成熟的o c r 系统,特剐是对高质量的印刷文档,已经有相当高的识别 率了。当前对o c r 的研究主要集中在有噪声较多的、多字体多字号的印刷字符 以及手写字符的识别上。 通常,一个o c r 系统由以下几个部分组成 刘1 9 9 5 】: 特掬 讽 男j j 揽 文 耥仪 鬻 分 类 f l 舨i l + | 颡l i1 分l i 析l jl j 结 裂 行 字 矜 符 分 割涮 图2 3o c r 系统的组成 通常,原始文稿通过光电扫描仪等输入设备转换成原始的二维图像信号,可 以是灰度图像( g r a ys c a l e i m a g e ) 或二值图象( b i n a r yi m a g e ) 。行字切分是将整 页版面的原始图像先按书写行分割开,然后再从每行中切分出单个汉字图像。预 处理通常包括大小归一化、平滑、细化或轮廓化等处理过程。特征抽取与分类器 的设计是整个系统中最为重要的环节,稳定特征的抽取与良好性能的分类器的设 计是整个识别系统的核心,它们直接决定了识别系统的性能。文本识别后处理是 指对单字识别的结果,利用词义、语义等上下文先验信息进行识别结果的确认或 纠错。总的来说,不同的特征抽取和分类器的设计方法决定了识别系统采用不同 的处理方法,通常可以分为结构模式识别方法、统计模式识别方法、统计与结构 相结合的识别方法以及人工神经网络方法等。 2 3 2o c r 技术的分类 o c r 技术按照待识别对象的不同可以分为:印刷体识别、手写体识别、手 写体数字识别。下面着重介绍印刷体汉字识别、手写体汉字识别以及手写体数字 识别。 中山大学硕士论文0 c r 中的细化算法与多进制小波在人脸识别中的应用 2 3 2 1 印刷体汉字识别 从识别技术的难度来说,印刷体识别要比手写体识别容易,而且与手写体识 别相比,印刷体识别已经实用化,而且在向更高的性能、更完善的用户界面的方 向发展。因为它有着广泛的应用前景。目前,办公自动化已成为信息社会不可避 免的发展趋势。虽然在计算机网络飞速发展的今天,许多信息已经电子化,世界 各地出现了许多“电子版”的报纸、杂志等出版物,但是我们可以看到印刷材料 的数量也大大地增加了,一些专业单位如新闻社、图书馆、古籍出版社、档案馆 等所接触的印刷材料更是浩如烟海,毕竟阅读印刷材料更为符合人的自然阅读习 惯;同时,网络信息资源的爆炸性增长以及网络传输容量的限制,都是方便、快 速地获取这些信息的约束因素。电子文档与印刷文本材料如同一枚硬币的两面, 互相补充、互相促进,在未来的十几年或更长的时间内将不会出现一者被另一者 取代的情况。 印刷体文字的识别很早以前就是人们的梦想,早在1 9 2 9 年,t a u s h e k 就在德 国获得了一项有关o c r ( 光学字符识别) 的专利。欧美国家为了将浩如烟海、 与日俱增的大量报刊杂志、文件资料和单据报表等文字材料输入计算机进行信息 处理,从5 0 年代就开始了西文o c r 技术的研究,以便代替人工键盘输入。 ( i ) 汉字识别概述 汉字已有数千年的历史,也是世界上使用人数最多的文字,对于中华民族灿 烂文化的形成和发展有着不可磨灭的功勋,并将继续发挥重要的、其它文字形式 难以取代的作用。然而,汉字是非字母化、非拼音化的文字,在当今高度信息化 的社会里,如何快速高效地将汉字输入计算机,已成为影响人机交流信息效率 的一个重要瓶颈,也关系到计算机能否真正在我国得到普及应用。围绕这一问题, 人们提出了各种解决方案。目前,汉字输入主要分为人工键盘输入和机器自动识 别输入两种。自动识别输入分为语音识别和字符识别两种。 汉字识别是模式识别的一个重要分支,也是文字识别领域最为困难的问题, 它涉及模式识别、图象处理、数字信号处理、自然语言理解、人工智能、模糊数 学、信息论、计算机、中文信息处理等学科,是一门综合性技术,在中文信息处 理、办公室自动化、机器翻译、人工智能等高技术领域,都有着重要的实用价值 9 中山大学硕士论文o c r 中的细化算法与多进制小波在人脸识别中的应用 和理论意义。 汉字识别技术可分为印刷体汉字识别和手写体汉字识别两大类,后者又可分 为联机手写汉字识别和脱机手写汉字识别。如图2 4 所示。从识别的角度来看, 手写体识别难于印刷体识别,而脱机手写识别又难于联机手写体识别。可喜的是, 经过科研人员的努力,我国已有印刷体汉字识别和联机手写汉字识别的商品出 售,目前已形成百家争鸣、百花齐放的局面,但是脱机手写汉字识别还处于实验 室研究阶段。在脱机手写汉字识别领域,非特定人脱机手写汉字识别又难于特定 人手写汉字识别。 图2 4文字识别的分类 印刷体汉字的识别最早可以追溯到6 0 年代。1 9 6 6 年,i b m 公司的c a s e v 和 n a g y 发表了第一篇关于印刷体汉字识别的论文,在这篇论文中他们利用简单的 模板匹配法识别了1 ,0 0 0 个印刷体汉字。7 0 年代以来,日本学者做了许多工作, 其中有代表性的系统有1 9 7 7 年东芝综合研究所研制的可以识别2 0 0 0 个汉字的单 体印刷体汉字识别系统:8 0 年代初期,日本武藏野电气研究所研制的可以识别 2 3 0 0 个多体汉字的印刷体汉字识别系统,代表了当时汉字识别的最高水平。此 外,日本的三洋、松下、理光和富士等公司也有其研制的印刷体汉字识别系统。 这些系统在方法上,大都采用基于数字变换的匹配方案,使用了大量专用硬件, 其设各有的相当于小型机甚至大型机,价格极其昂贵,没有得到广泛应用。 我国对印刷体汉字识别的研究始于7 0 年代末8 0 年代初,大致可以分为三大 阶段: 1 ) 第一阶段从7 0 年代末期到8 0 年代末期,主要是算法和方案探索。 2 ) 第二阶段是9 0 年代初期,中文o c r 由实验室走向市场,初步实用。 1 0 中山大学硕士论文o c r 中的细化算法与多进制小波在人脸识别巾的应用 3 ) 第三阶段也就是目前,主要是印刷体汉字识别技术和系统性能的提高,包括 汉英双语混排识别率的提高和稳定性的增强。 同国外相比,我国的印刷体汉字识别研究起步较晚。但由于我国政府对汉字 自动识别输入的研究从8 0 年代开始给予了充分的重视和支持,经过科研人员十 多年的辛勤努力,印刷体汉字识别技术的发展和应用,有了长足进步:从简单的 单体识别发展到多种字体混排的多体识别,从中文印刷材料的识别发展到中英混 排印刷材料的双语识别。各个系统可以支持简、繁体汉字的识别,解决了多体多 字号混排文本的识别问题,对于简单的版面可以进行有效的定量分析,同时汉字 识别率已达到了9 8 以上。 印刷体文字识别的过程如图2 5 所示。原始图像是通过光电扫描仪,c c d 器 件或电子传真机等获得的二维图像信号,可以是灰度( g r a y s c a i e ) 或二值( b i n a r y ) 图像。为简单计,在本文以后的论述中,除非特别提及,图像输入的方式均指由 扫描仪输入。 图2 5印刷体文字识别的简单流程图 预处理包括对原始图像的去噪、倾斜校正或各种滤波处理。版面分析完成对 于文本图像的总体分析,区分出文本段落及排版顺序,图像、表格的区域:对于 文本区域将进行识别处理,对于表格区域进行专用的表格分析及识别处理,对于 图像区域进行压缩或简单存储。行字切分是将大幅的图像先切割为行,再从图像 行中分离出单个字符的过程。特征提取是整个环节中最重要的一环,它是从单个 中山大学硕士论文0 c r 中的细化算法与多进制小波在人脸识别中的应用 字符图像上提取统计特征或结构特征的过程,包括为此而做的细化( t h i n n i n g ) 、 归一化( n o r m a i i z a t i o n ) 等步骤。提取的特征的稳定性及有效性,直接决定了识别 的性能。文字识别即从学习得到的特征库中找到与待识字符相似度最高的字符类 的过程。后处理贝q 是利用词义、词频、语法规则或语料库等语言先验知识对识别 结果进行校正的过程。 由此可见,印刷汉字识别技术主要包括: 1 ) 扫描输入文本图像。 2 ) 图像的预处理,包括倾斜校正和滤除干扰噪声等。 3 ) 图像版面的分析和理解。 4 ) 图像的行切分和字切分。 5 ) 基于单字图像的特征选择和提取及模式分类。 6 ) 将被分类的模式赋予识别结果。 7 ) 识别结果的编辑修改后处理。 其中4 ) 、5 ) 和6 ) ,也就是图2 5 中的阴影部分,是印刷汉字识别中最为核心 的技术。近几年来,印刷汉字识别系统的单字识别正确率已经超过9 5 ,为了 进一步提高系统的总体识别率,扫描图像、图像的预处理以及识别后处理等方面 的技术,也都得到了深入的研究,并取得了长足的进展,有效地提高了印刷汉字 识别系统的总体性能。 ( )印刷体汉字识别方法 用于汉字识别的模式识别方法可以大致分为结构模式识别、统计模式识别及 两者的结合及其人工神经网络( a 嘣i c i a in e u 限ln e l w o 峋。下面分别进行介绍。 ( 1 ) 结构模式识别 汉字是一种特殊的模式,其结构虽然比较复杂,但具有相当严格的规律性。 换言之,汉字图形含有丰富的结构信息,可以设法提取含有这种信息的结构特征 及其组字规律,作为识别汉字的依据,这就是结构模式识别。 中山大学硕士论文 0 c r 巾的细化算法与多进制小波在人脸识别中的应用 结构模式识别方法是人们最初用来进行手写汉字识别研究的方法,一般需要 先抽取笔段或基本笔画作为基元,由这些基元再构成部件( 子模式) ,由部件的 组合来描述汉字( 模式) ,最后再利用形式语言及自动机理论进行文法推断,即 识别。然而,人们美好的初衷并未能如愿以偿,这是因为从汉字图像中抽取笔画 等基元比较困难。通常,为了抽取笔画需要将原始点阵图像进行细化处理,但是 一般细化算法不仅速度慢,而且容易产生伪笔画段,如将一个四叉点变成了二个 三叉点,给准确抽取基元造成了困难。为了解决这个问题,有些学者试图不经过 细化直接从汉字点阵图像中抽取笔画等基元,但效果仍不尽如人意。因此,有些 研究人员放弃了抽取笔画或笔段作为基元然后进行文法推断的思路,采用汉字轮 廓结构信息作为特征,这一方案的识别结果优于基于基元抽取的方法,但识别方 法需要进行松弛迭代匹配,耗时严重,而且对于笔画较模糊的汉字图像,抽取内 轮廓会遇到极大困难,外轮廓的抽取也不太稳定。也有些学者采用抽取汉字图像 中关键特征点来描述汉字,汉字的关键特征点包括端点、折点、交点、歧点、背 景特征点、局部曲率最大点等,但是特征点的抽取易受噪声点、笔画的粘连与断 裂等影响。 总之,早期的脱机手写汉字识别研究者将精力主要集中在如何准确地抽取基 元、轮廓、特征点等能够反映汉字结构信息的特征上,并且在假设这些特征已经 比较准确地抽取完毕的前提下,研究文法匹配、属性图匹配、松弛迭代匹配等。 然而,单纯采用结构模式识别方法的脱机手写汉字识别系统,识别率较低,这就 促使人们将目光转向了统计模式识别方法。 ( 2 ) 统计模式识别 统计决策论发展较早,理论也较成熟。其要点是提取待识别模式的一组统计 特征,然后按照一定准则所确定的决策函数进行分类判决。 汉字的统计模式识别是将字符点阵看作一个整体,其所用的特征是从这个整 体上经过大量的统计而得到的。统计特征的特点是抗干扰性强,匹配与分类的算 法简单,易于实现。不足之处在于细分能力较弱,区分相似字的能力差一些。常 见的统计模式识别方法有: 中山大学硕士论文0 c r 中盼细化算法与多进制小波在人脸识别中的应用 1 ) 模板匹配。模板匹配并不需要特征提取过程。字符的图像直接作为特征 与字典中的模板相比,相似度最高的模板类即为识别结果。这种方法简单易行, 可以并行处理;但是一个模板只能识别同样大小、同种字体的字符,对于倾斜、 笔划变粗变细均无良好的适应能力。 2 ) 利用变换特征的方法。对字符图像进行二进制变换( 如w a l s h ,h a r d a m a 变换) 或更复杂的变换( 如k a r h u n e n l o e v e ,f ou r i e r ,c o s i n e ,s i a n l 变换等) ,变 换后的特征的维数大大降低。但是这些变换不是旋转不变的,因此对于倾斜变形 的字符的识别会有较大的偏差。二进制变换的计算虽然简单。但变换后的特征没 有明显的物理意义。k - l 变换虽然从最小均方误差角度来说是最佳的,但是运算 量太大,难以实用。总之,变换特征的运算复杂度较高。 3 ) 投影直方图法。利用字符图像在水平及垂直方向的投影作为特征。该方 法对倾斜旋转非常敏感,细分能力差。 4 ) 几何矩( g e o m e l r cm o m e n f ) 特征。m k h u 提出利用矩不变量作为特 征的想法,引起了研究矩的热潮。研究人员又确定了数十个移不变、比例不变的 矩。我们都希望找到稳定可靠的、对各种干扰适应能力很强的特征,在几何矩方 面的研究正反映了这一愿望。以上所涉及到的几何矩均在线性变换下保持不变。 但在实际环境中,很难保证线性变换这一前提条件。 5 ) s p n e 曲线近似与傅立叶描绘子( f o u n e rd e s c n p t o r ) 。两种方法都是针 对字符图像轮廓的。sp | n e 曲线近似是在轮廓上找到曲率大的折点,利用sp | n e 曲线来近似相邻折点之间的轮廓线。而傅立叶描绘子则是利用傅立叶函数模拟 封闭的轮廓线,将傅立叶函数的各个系数作为特征的。前者对于旋转很敏感。后 者对于轮廓线不封闭的字符图像不适用,因此很难用于笔划断裂的字符的识别。 6 ) 笔划密度特征。笔划密度的描述有许多种,这里采用如下定义:字符图 像某一特定范围的笔划密度是在该范围内,以固定扫描次数沿水平、垂直或对角 线方向扫描时的穿透次数。这种特征描述了汉字的各部分笔划的疏密程度,提供 了比较完整的信息。在图像质量可以保证的情况下,这种特征相当稳定。在脱机 手写体的识别中也经常用到这种特征。但是在字符内部笔划粘连时误差较大。 1 4 中山大学硕士论文0 c r 中的细化算法与多进制小波存人脸识别中的应用 7 ) 外围特征。汉字的轮廓包含了丰富的特征,即使在字符内部笔划粘连的情 况下,轮廓部分的信息也还是比较完整的。这种特征非常适合于作为粗分类的特 征。 8 ) 基于微结构特征的方法。这种方法的出发点在于,汉字是由笔划组成的, 而笔划是由一定方向,一定位置关系与长宽比的矩形段组成的。这些矩形段则称 为微结构。利用微结构及微结构之间的关系组成的特征对汉字进行识别,尤其是 对于多体汉字的识别,获得了良好的效果。其不足之处是,在内部笔划粘连时, 微结构的提取会遇到困难。 9 ) 特征点特征。早在1 9 5 7 年,s o | a t r o ne i e c ”o n i c sg r o u p 公司发布了第 一个利用窥视孔( p e e p h o l e ) 方法的o c r 系统。其主要思想是利用字符点阵中一 些有代表性的黑点( 笔划) ,白点( 背景) 作为特征来区分不同的字符。后有人又将 这种方法运用到汉字识别中,对其中的黑点又增加了属性的描述,如端点、折点、 交叉点等。也获得了比较好的效果。其特点是对于内部笔划粘连的字符的识别的 适应性较强,喜观性好,但是不易表示为矢量形式,不适合作为粗分类的特征, 匹配难度大。 当然还有许多种不同的统计特征,诸如图描述法、包含配选法、脱壳透视法、 差笔划法等,这里就不一一介绍了。 ( 3 ) 统计识别与结构识别的结合 由上述可见,统计与结构方法各有优缺点。统计方法具有良好的鲁棒性,较 好的抗干扰抗噪声的能力,它一般按一定的距离度量匹配准则,采用多维特征值 累加的办法,把局部噪声和微小畸变淹没在最后的累加和里,但是,可以用来区 分“敏感部位”的差异也随之消失,因此区分相似字的能力较差;而结构方法对 结构特征较敏感,区分相似字的能力较强,但是结构特征难以抽取,不稳定。因 此,人们已注意到将两种方法结合起来使用,这种结合包括两个方面: 1 ) 特征的结合:在特征抽取过程中,注意抽取能反映手写汉字结构信息的统计 特征,如方向线素特征、四平面笔画穿透数目特征等。 中山大学硕士论文o c r 中的细化算法与多进制小波在人脸识尉中的应用 2 ) 识别方法的结合:可以先用统计方法进行粗分类,再用结构方法进行细分类 来区分相似字,即两种方法的串联;也可以将两种方法并联使用,然后进行综合 集成,这是近年来文字识别领域的一个重要研究方向。 随着我们对于两种方法认识的深入,这两种方法正在逐渐融合。网格化特征 就是这种结合的产物。字符图像被均匀地或非均匀地划分为若干区域,称之为“网 格”。在每一个网格内寻找各种特征,如笔划点与背景点的比例,交叉点、笔划 端点的个数,细化后的笔划的长度、网格部分的笔划密度等等。特征的统计以网 格为单位,即使个别点的统计有误差也不会造成大的影响,增强了特征的抗干扰 性。这种方法正得到日益广泛的应用。 ( 4 ) 人工神经网络 人工神经网络( a n i f i c i a ln e u r a in e t w o r k ) ,以下称a n n ) 是一种模拟人脑神经 元细胞的网络结构,它是由大量简单的基本元件一神经元相互连接成的自适应非 线性动态系统。虽然目前对于人脑神经元的研究还很不完善,我们无法确定a n n 的工作方式是否与人脑神经元的运作方式相同,但是a n n 正在吸引着越来越多 的注意力。 a n n 中的各个神经元的结构与功能较为简单,但大量的简单神经元的组合 却可以非常复杂,我们从而可以通过调整神经元间的连接系数完成分类、识别等 复杂的功能。这是冯诺依曼的计算机无法做到的。 a n n 可以作为单纯的分类器( 不包含特征提取,选择) ,也可以用作功能完善的 分类器。在英文字母与数字的识别等类别数目较少的分类问题中,常常将字符的 图像点阵直接作为神经网络的输入。不同于传统的模式识别方法,在这种情况下, 神经网络所“提取”的特征并无明显的物理含义,而是储存在神经物理中各个神 经元的连接之中,省去了由人来决定特征提取的方法与实现过程。从这个意义上 来说,a n n 提供了一种“字符自动识别”的可能性。此外,a n n 分类器是一种 非线性的分类器,它可以提供我们很难想象到的复杂的类问分界面,这也为复杂 分类问题的解决提供了一种可能的解决方式。 通常,用于文字识别的人工神经网络模型有:h o p f i e l d 神经网络、前向多层 神经网络( 如b p 算法、r b f 网络等) 、a n 网络、自组织特征映射网络
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 电子陶瓷挤制成型工成果测试考核试卷含答案
- 花卉栽培工创新意识评优考核试卷含答案
- 船舶电子技工操作规范能力考核试卷含答案
- 沥青混合料拌和设备操作工岗中环保知识考核试卷含答案
- 染色师安全检查考核试卷含答案
- 水族造景工安全检查能力考核试卷含答案
- 焦化装置操作工岗前标准化考核试卷含答案
- 塑料模具工岗前价值创造考核试卷含答案
- 保健按摩师岗前技能竞赛考核试卷含答案
- 贸易数据申报师班组管理强化考核试卷含答案
- 计算机图形学 课件 第1章绪论
- HL1ST601-2023 钢结构焊接连接节点通 用图B册 (Q355钢)
- 2026年河北省保定市公安招聘辅警考试试卷含答案
- 彩钢瓦屋顶光伏支架安装施工技术方案
- 《西藏自治区国家固边兴边富民行动示范区创建条例》深度解析课件
- 2026年患者身份识别与腕带使用管理相关制度(3篇)
- 眼眶骨折诊疗专家共识(2026版)
- 2026山东能源集团西北矿业有限公司技能操作岗位招聘200人笔试参考题库附带答案详解
- APQC跨行业流程分类框架 (8.0 版)( 中文版-2026年4月)
- 电竞场馆突发事件处置预案
- 2026年国企管理人员竞聘考试题库及答案
评论
0/150
提交评论