(计算机应用技术专业论文)离线笔迹鉴别的特征提取技术研究.pdf_第1页
(计算机应用技术专业论文)离线笔迹鉴别的特征提取技术研究.pdf_第2页
(计算机应用技术专业论文)离线笔迹鉴别的特征提取技术研究.pdf_第3页
(计算机应用技术专业论文)离线笔迹鉴别的特征提取技术研究.pdf_第4页
(计算机应用技术专业论文)离线笔迹鉴别的特征提取技术研究.pdf_第5页
已阅读5页,还剩48页未读 继续免费阅读

(计算机应用技术专业论文)离线笔迹鉴别的特征提取技术研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

哈尔滨i :程大学硕十学位论文 摘要 随着科学技术的发展,基于笔迹的身份鉴别方法已经成为重要生物特征 识别手段之一,广泛应用于公安、司法、考古、金融、电子商务等领域。近 年来,社会对计算机笔迹鉴别技术提出了新的要求。笔迹特征提取技术作为 笔迹鉴别过程中的关键技术,直接影响鉴别效果。研究特征提取技术具有十 分重要的理论意义和实用价值。 本文在对己有的笔迹特征提取方法进行详细研究的基础上,提出了将文 本分块,并对各文本块提取重心特征、形状特征,最后结合文本整体的纹理 特征进行笔迹鉴别的方法。其中重心特征提取的是各个笔迹块的重心,这些 重心整体上反映了书写的笔迹相对于水平方向上的偏移,是一种与文本无关 的笔迹特征。形状特征是在分析了几何矩物理性质的前提下提出的,通过将 笔迹分块后提取笔迹块的形状信息作为特征。也是一种文本无关的笔迹特征, 纹理特征反映了笔迹的纹理特性。它是通过对笔迹图像进行g a b o r 滤波获得 的。这种特征完全摆脱了文本内容的限制,是一种被广泛使用的特征。 为了判别所提取笔迹特征的有效性,论文设计了一个简单的笔迹鉴别系 统。这个系统包括预处理模块、重心特征提取与分类模块、形状特征提取与 分类模块、纹理特征提取与分类模块,对各个识别结果进行综合的模块。通 过这几个模块对所提出的特征提取方法进行了测试,结果表明:基于三种特 征的鉴别方法都达到了良好的效果,而且三种方法的综合效果最佳。 关键词:笔迹鉴别;重心特征;形状特征;纹理特征;信息融合 哈尔滨工程大学硕+ 学位论文 a b s tr a o t w i t ht h e d e v e l o p m e n to fs c i e n c e ,w r i t e ri d e n t i f i c a t i o n ( w ob a s e do n h a n d w r i t i n g h a sb e c o m ea n i m p o r t a n tt e c h n o l o g yo f b i o m e t r i c p e r s o n a l i d e n t i f i c a t i o n t h i st e c h n o l o g yh a sb e e nw i d e l yu s e di nt h e p u b l i cs e c u r i t y , a d m i n i s t r a t i o no fj u s t i c e ,a r c h a e o l o g y , f i n a n c ea n de l e c t r o n i cb u s i n e s sa r e a s i n r e c e n ty e a r s ,s o c i a lb a c k g r o u n d su r g em o r ea c h i e v e m e n t si nc o m p u t e r ( w 0 f e a t u r e se x t r a c t i o ni sa ni m p o r t a n tp a r to fh a n d w r i t i n gr e c o g n i t i o n ,a n dh a sa d i r e c ti m p a c to nt h er e c o g n i t i o nr e s u l t s s or e s e a r c h i n go i lf e a t u r ee x t r a c t i o n t e c h n o l o g yh a si m p o r t a n tt h e o r e t i c a ls i g n i f i c a n c ea n da p p l i c a t i o nv a l u e a f t e rd e t a i l e dr e s e a r c h i n go nt h er e l a t e dt e c h n o l o g yo fh a n d w r i t i n gf e a t u r e e x t r a c t i o n ,t h i st h e s i sp r o p o s e st os e g m e n th a n d w r i t i n gi m a g et os u b - i m a g ea n d e x t r a c tt h ec e n t e ro fg r a v i t yf e a t u r e s ,s h a p ef e a t u r e so fe a c hs u b - i m a g e ,t h e n e x t r a c tt e x t u r ef e a t u r e sf o rt h ew h o l ei m a g et or e a l i z eh a n d w r i t i n gi d e n t i f i c a t i o n , a n da tl a s tt os y n t h e s i z et h er e s u l t so fe a c hw a yt og e tt h ef i n a lr e s u l t i nt h e s e w a y s t h ec e n t r a lo fg r a v i t yf e a t u r e sr e f l e c t h a n d w r i t i n gg r a v i t y , i t i st h e p e r f o r m a n c eo fw r i t i n gh a b i t sa n di t i sa l s oak i n do ft e x ti n d e p e n d e n tf e a t u r e s s h a p ef e a t u r e sa r ep r o p o s e da f t e ra n a l y z i n gt h ep h y s i c a lp r o p e r t i e so fg e o m e t r i c m o m e n t s t h e s ef e a t u r e sa r ee x t r a c t e df r o mh a n d w r i t i n gb l o c k s ,a n di ti sa l s oa t e x t i n d e p e n d e n tf e a t u r e t e x t u r ef e a t u r e sr e f l e c tt h e t e x t u r ec h a r a c t e r i s t i c so f h a n d w r i t i n g t h e s ef e a t u r e sa r eo b t a i n e db yf i l t e r i n gi m a g eu s e dg a b o rf i l t e r i ti s ak i n do ft e x ti n d e p e n d e n tf e a t u r e sa b s o l u t e l ya n di ti su s e dw i d e l y f i n a l l yi nt h i st h e s i s ,id e s i g nas i m p l eh a n d w r i t i n gi d e n t i f i c a t i o ns y s t e mf o r t e s t i n ge f f e c t i v e n e s so f e a c hf e a t u r et h es y s t e mi n c l u d e sp r e - p r o c e s s i n gm o d u l e , t h ec e n t r a lo fg r a v i t yf e a t u r ee x t r a c t i o na n dc l a s s i f i c a t i o nm o d u l e s ,s h a p ef e a t u r e s e x t r a c t i o na n dc l a s s i f i c a t i o nm o d u l e s ,t e x t u r ef e a t u r e se x t r a c t i o na n dc l a s s i f i c a t i o n m o d u l e s ,a l s oi n c l u d e sa ni n t e g r a t e dm o d u l ef o re a c hr e c o g n i t i o nr e s u l t e a c h p r o p o s e dm e t h o dh a sb e e nt e s t e dt h r o u g ht h e s em o d u l e s r e s u l t ss h o w e dt h a t :t h e h a n d w r i t i n gi d e n t i f i c a t i o nb a s e do n t h e s et h r e ek i n d s f e a t u r e sa c h i e v e sg o o d r e s u l t s ,a n di n t e g r a t e dr e s u l to fe a c hw a yc a ng e tb e t t e rr e s u l t s 哈尔滨i :稃人学硕十学何论文 k e y w o r d s :h a n d w r i t i n gi d e n t i f i c a t i o n ;t h ec e n t e ro fg r a v i t yf e a t u r e ;s h a p e f e a t u r e ;t e x t u r ef e a t u r e ;i n f o r m a t i o nf u s i o n 哈尔滨工程大学 学位论文原创性声明 本人郑重声明:本论文的所有工作,是在导师的指导下,由 作者本人独立完成的。有关观点、方法、数据和文献的引用已在 文中指出,并与参考文献相对应。除文中已注明引用的内容外, 本论文不包含任何其他个人或集体已经公开发表的作品成果。对 本文的研究做出重要贡献的个人和集体,均已在文中以明确方式 标明。本人完全意识到本声明的法律结果由本人承蚝。、, 作者( 签字) :俐 日期: 协c 7年;月6 日 哈尔滨工程大学 学位论文授权使用声明 本人完全了解学校保护知识产权的有关规定,即研究生在 校攻读学位期间论文工作的知识产权属于哈尔滨工程大学。哈尔 滨工程大学有权保留并向国家有关部门或机构送交论文的复印 件。本人允许哈尔滨工程大学将论文的部分或全部内容编入有关 数据库进行检索,可采用影印、缩印或扫描等复制手段保存和汇 编本学位论文,可以公布论文的全部内容。同时本人保证毕业后 结合学位论文研究课题再撰写的论文一律注明作者第一署名单位 为哈尔滨工程大学。涉密学位论文待解密后适用本声明。 本论文( 口在授予学位后即可口在授予学位1 2 个月后 口解密后) 由哈尔滨工程大学送交有关部门进行保存、汇编等。 作者( 签字) :枷 日期: 一勺年弓月日 导师( 签字) : 穹j | i 中 7 年7 月日 哈尔滨t 程大学硕十学位论文 第1 章绪论 1 1 论文研究的目的和意义 笔迹作为一种行为特征,是书写者自身生理特点和后天学习过程的综合 反映。所以笔迹具有唯一性、稳定性、可采集性和获取的非侵犯性等优点, 基于笔迹的这些特点,它已经成为人们进行身份鉴别的重要手段之一。笔迹 鉴别技术可以广泛应用于公安、司法、考古、金融、电子商务等领域。如公 安、司法部门的刑事调查和法庭审判、金融、财会部门的签名对照,海关护 照持有人身份的验证,计算机终端访问人的认定,仓库保管员身份的证实, 等等。特别是在刑事调查中,笔迹是一种重要的犯罪证据,笔迹鉴别是寻找 和确认罪犯的重要手段,匿名信、反动传单、标语书写人的调查等往往都是 通过笔迹鉴别实现的。在金融领域,信用卡的使用要求持卡人当场签字,并 与卡上预留的签名进行对照,判断是否为同一个人所写,从而接受或拒绝使 用。由此可以看出对笔迹进行可靠、有效、快速的鉴定具有重要的社会意义 和实用价值。 目前笔迹基本上都是采用人工的方式鉴别,这种鉴别过程慢而且不可靠, 主要是由于容易引入人为主观因素,所以这种鉴别的真实性还不是十分确定。 利用计算机辅助进行笔迹鉴别,可以提高鉴别的速度与准确性,避免人为因 素的干扰。通过计算机对笔迹进行鉴别能够很好的缩小鉴定的范围,为人工 鉴定提供有利的帮助。因此,计算机笔迹鉴别的意义更是十分明显的。 由于笔迹存在的多种多样,使得其特征上也存在多样性,在不同条件下 不同的特征会占据主导地位。因此针对不同的笔迹采用某些特定的方法来识 别是很难达到稳定的识别效果。如果能够摆脱书写内容的限制,对多样化的 笔迹进行识别,并提高笔迹鉴别的效率和科学性、准确性与有效性,那么笔 迹鉴别技术将进入一个新的时代,会使得该技术在社会中能够有更加广泛的 应用。 本论文j 下是在深入研究各种笔迹鉴别特征提取方法的基础上,尝试探索 哈尔滨t 稗人学硕十学位论文 新的特征提取思想:对笔迹图像分块提取重心,形状特征并对整体提取纹理 等特征,然后尝试对这些特征的分类结果进行决策级的信息融合以达到最终 的识别目的。这种基于多个特征提取、分类和结果融合的方式为达到良好的 笔迹鉴别效果做铺垫,同时也会为笔迹鉴别技术后续的研究做好准备。 1 2 计算机笔迹鉴别简介 1 2 1 笔迹鉴别的概念 笔迹鉴别( h a n d w r i t i n gi d e n t i f i c a t i o n ) 也称为笔迹检验( h a n d w r i t i n g e x a m i n a t i o n ) ,它是通过分析和比较人的手写笔迹的风格和特征来判断书写 人身份的一门科学和技术。笔迹鉴别中的身份判断有两种方式:一种是直接 比较两份手写笔迹,确定它们是否为同一人所写;另一种是从不同人书写的 参考笔迹中找出与检验笔迹的书写特征最接近的样本。前一种方式称为验证 或鉴定,后一种方式称为鉴别或识别。笔迹鉴别中假设参考笔迹的书写者是 已知的,从而通过书写特征就可以确定检验笔迹的书写者。 计算机笔迹鉴别主要分为在线( o n - ii n e ) 和离线( o f f - l i n e ) 两类【1 1 【2 】。前 者是通过专用的数字板或数字仪实时采集书写信号,它不仅可以采集到笔迹 序列并转化成图像,而且可以记录书写的压力、速度等信息,可为笔迹鉴别 提供比较丰富的数据信息。而后者所要识别的对象是写在纸上的字符,通过 扫描仪和摄像机转化为计算机能处理的信号。 从考察对象的提取特征的方法来看,离线笔迹鉴别可分为文本有关和文 本无关两大类1 3 1 。前一种方法从检验笔迹和参考笔迹中选择相同的单字( 称为 特征字) 进行比较,在相同的基础上鉴别,因而提取的笔迹特征是依附于字符 类型的,即依赖于文本内容,可以提取更多的特征进行细致深入的分析,故 可以得到比文本独立方法更多的鉴别率和可靠性。后一种方法的特征是从大 量字符集中提取、通过对多数字符统计得到,鉴别笔迹并不依赖于文本内容, 鉴别难度较大。 1 2 2 计算机笔迹鉴别的系统流程 计算机笔迹鉴别的过程就是模式识别的过程,具有模式识别的普遍特性 i4 。所以计算机笔迹鉴别的过程如下: 2 哈尔滨rf i f ! 人学硕十学位论文 图1 1 计算机笔迹鉴别的系统的流程 1 数据获取 笔迹样本的获取是通过图像输入设备例如扫描仪,摄像机等获取的,这 些所获取的二维笔迹样本存在这一定的噪音干扰,并且由于样本中的背景、 格线对笔迹都有一定的影响,所以需要对笔迹图像进行预处理。 2 预处理 预处理的目的是通过一定的算法将笔迹样本中的噪声去除,加强有用的 信息,并对输人测量仪器或其他因素所造成的退化现象进行复原。主要包括 灰度化、二值化、去背景、消噪声等操作。 3 特征提取和选择 为了有效地实现分类识别,就要对原始数据进行变换,得到最能反映分 类本质的特征。这就是特征提取和选择的过程。一般我们把原始数据组成的 空间叫测量空间,把分类识别赖以进行的空间叫特征空间,通过变换,可把 在维数较高的测量空间中表示的模式变为在维数较低的特征空间中表示的模 式。笔迹识别中就需要对采集的笔迹进行特征提取,生成特征向量以便于识 别。 4 分类决策 分类决策就是在特征空间中用统计方法把被识别对象归为某一类别。基 本作法是在样本训练集基础确定某个判决规则,使按这种判决规则对被识别 对象进行分类所造成的错误识别率最小或引起的损失最小。 针对以上4 步,由于笔迹鉴别中特征提取和选择的好坏将直接影响到对 笔迹分类决策的效果,所以本文主要研究的是特征提取这一关键步骤。 3 哈尔滨t 甲# 大学硕十学位论文 1 3 特征提取技术的研究现状 计算机笔迹鉴别的研究最早始于上个世纪6 0 年代。1 9 6 6 年苏联的几名 研究者发表了用电子计算机进行笔迹鉴别的研究报告,这大概是最早的报导 了。他们的方法是从字符骨架提取一些代表点作为特征,用字母“k ”作为实 验样本,得到了7 5 的鉴别正确率。至7 0 年代末、8 0 年代初,计算机笔迹鉴 别的研究和开发形成一个热潮。其中影响最大的要算前联邦德国刑事技术部 主持研制的计算机联网笔迹鉴别系纠们。该项目投资大、历时长,有大量专 家学者参加了研究,提出了一系列行之有效的方法。日本虽未公开报导过他 们的笔迹鉴别系统,但他们至少在研究上做出了很大的贡献。日本学者在这 方面发表的文献数量最多,质量也都比较高。由于语言文字上的渊源,日本 的方法比较适合中国的情况,很值得我们借鉴。 在欧美、日本、以色列等发达国家,笔迹分析成为一种广泛运用于心理 分析、人事管理、历史研究、刑事侦察等诸多领域,并且为广大民众所接受 的手段和途径。 中国汉字笔迹分析的研究的开始只是在近十年的事情,先是成立并担任 比利时国际汉字研究所所长的梅纳斯夫人,组织进行了从字符文字笔迹分析 的方法中寻找汉字笔迹分析的方法,取得了较好地效果,首创汉字笔迹分析 的先河。她于1 9 9 0 年左右两次到中国大陆开展汉字笔迹分析的交流,这交流 活动促进了大陆汉字笔迹的研究。之后,在中国大陆出现了职业的笔迹分析 人员,专门从事笔迹分析服务。1 9 9 4 年1 0 月中国笔迹学研究正式成立,来 自全国1 0 个省市自治区的代表与会,共同研讨了汉字笔迹学。1 9 9 9 年1 2 月 中国笔迹学研究会第二届会议召开。汉字笔迹的研究目前正处于方兴未艾的 发展阶段。 总结各国的笔迹鉴别技术的发展,对笔迹鉴别中特征提取技术进行分类, 将笔迹中的提取技术分为两大类。一是文本无关的特征提取方法,二是文本 相关的特征提取方法。 1 3 1 文本无关方法 文本无关的笔迹特征反映个人书写的整体布局特征或字符大致形态,倾 4 哈尔滨。1i 程大学硕十学何论文 斜和方位等信息,是与字符无关的特征信息。常用的特征提取方法有变换法、 游程直方图法、游程长度分析法、独立分量分析法、灰度共生矩阵法、多通 道分解方法等。 ( 1 ) f o u r i e r 变换和自相关法:也叫谱分析法,主要根据整体纹理基本能 够反映了个人的书写笔迹的特征,而这种特征可以通过图像信号的频谱反映 出来。而提取频谱可以用如f o u r i e r 变换、w a l s h 变换、g a b o r 变换等,基本方 法如下:计算二值图像的f o u r i e r 功率谱,用区域平均、l e g e n d r e 多项式或余 弦函数拟合的方法对功率普系数进行数据压缩得到特征矢量,自相关法是计 算图像的自相关值,取唯一的较小的1 6 1 6 个值作为特征。k u c k u c k w 等人使 用f o u r i e r 变换对2 0 个人书写的8 0 0 份( 2 0 x 4 0 ) 笔迹进行了试验,用最小欧 式距离分类,对部分和特定样本而言平均识别率为9 0 以上【7 1 ,其中自相关法 的平均识别率达至1 1 9 5 。当自相关系数仅取1 6 个值时,识别率也达至s j 9 3 。 ( 2 ) 游程直方图法:主要思想是对笔迹图像进行水平和垂直方向扫描,计 算白像素链游离直方图,该直方图基本上反映了书写的整体特征。s i m p c d o v o 等人用水平游程直方图的差的绝对值作为距离度量,把统一人笔迹的距离归 一化至u 1 0 0 ,则发现不同人笔迹之间的最小距离为1 5 0 ,从而识别率达1 0 0 ; 垂直游离直方图的距离度量是先将直方图平方后再对绝对值求和,通过实验 可以使识别率达到7 0 ,但是该方法只对特定的版面有效【8 l 。 ( 3 ) 游程长度分析法:所谓游程长度是指连续、共线、并且具有相同灰度 的像素的数目。游程长度既反映纹理的粗糙程度,也反映纹理的方向性。根 据灰度游程能够得到以下纹理信息:短游程优势、长游程优势灰度分布、游 程长度分布和游程百分比。杨子华等人对1 9 个人的中文笔迹进行测试,采用 欧式距离进行分类。当对纹理信息中游程长度分布进行识别是获得最高的识 别率9 4 7 4 【9 1 。 ( 4 ) 独立分量分析方法:是根据人类视觉系统对图像的反应,特别是大脑 对于图像形状、方向和色彩等信息的提取,采用独立分量分析的方法来提取 笔迹的纹理特征,并利用竞争学习方法确定笔迹编码。黄雅平等人提取了3 0 个人的笔迹,每个人包含了1 0 幅笔迹图像,每幅笔迹图像包含4 0 0 个常用汉字。 经扫描仪以2 0 0 d p i 的精度转换为狄度图像,归一化处理后,将字问距和行间 距固定为1 0 个像素,字的大小为5 0 5 0 。经过测试识别率达n 8 6 p a 上l l o l 。 5 哈尔滨i :程大学硕十学位论文 ( 5 ) 灰度共生矩阵法是对图像上保持某距离的两像素分别具有某灰度的 状况进行统计得到的,描述了成对像素的灰度组合分布。灰度共生矩阵反映 了纹理关于方向、相邻问隔、变化幅度的综合信息。根据综合信息反映图像 的4 个纹理特征:一致性,对比度,相关性,熵。进而进行模式匹配, 用欧式距离分类器进行识别。杨子华等人采集了2 0 个人的中文笔迹进行测试, 测试得到的最高识别率为9 0 6 8 1 1 1 l 。由于算法不涉及复杂的计算所以很容易 在系统中使用。 ( 6 ) 多通道分解方法【1 2 】【1 3 】:g a b o r 变换和小波变换作为一种多通道分解方 法,非常适合纹理分析问题,因为纹理是一种有规律的灰度分布,具有很强 的频率特性。如在图像的频域表示中,粗的纹理对应低频成分,而纹理的排 列方向也与频域参数的伸展方向垂直。不同的纹理对应不同的频率和方向。 通过g a b o r 变换和小波变换,不同的纹理信号分布在不同的频带,从而便于纹 理分类,或者从中得到纹理的结构信息。文献 9 选取1 7 个人的笔迹,通过 g a b o r 滤波器提取特征值,用欧式距离法进行分类,中文笔迹识别率达至1 j 9 4 。 该方法对字符进行方向分解和频带分解,再用分解信号作为笔迹特征,最大 的优点在于可以不限定汉字,大大提高了算法的适用范围和适用性。 当然还有很多基于不同的文字和应用场合而改进的算法【1 4 】,g a b o r d 、波 变换是一种多通道信号分解方法,其函数为 c ( x ,y ,“,y ) 一r r ,o ,y 涫g 一x ,y 一y ) e - 铆似+ 哆d r d y ( 卜1 ) 式中:g ( x ,y ) 一g a u s sg o ,y ) 函数,可以是园对称或者椭圆形不变形式的。 二维g a b o r 滤波器的数学模型【1 4 1 : 限o ,y ) = g o ,y ) c o s 2 万f o c o s o + y s i n o ) 】, lh o o ,y ) = g ( x ,y ) s i n f 2 9 t f ( x c o s o + y s i n p ) 】 如y 纠一扣x p i - 等i ( 1 - 3 ) 式中:g o ,y ,仃) 一g a u s s ,日方向参数,一是中心频率,仃空间参数, 见,h 一表示奇、偶滤波器。o g a b o r 基于纹理分析的特征提取,既可提取笔迹图像的全局特征,又可提取它 的局部特征,把二者结合起来的方法,可取得更好的识别准确率和鉴别效果, 6 哈尔滨一i 二稗人学硕十学位论文 是近年来有一个新热点。文献 1 6 正是利用快速g a b o r 小波提取笔迹的整体 纹理特征,用s v m 进行训练和识别的方法,在对8 7 人的笔迹实验中取得了良 好的效果,表明了基于纹理的笔迹鉴别方法是有效的。 1 3 2 文本依存方法 文本相关的特征提取主要是提取更多的字符特征并进行更加细致的分 析,主要有w i n g e r 分布法,基本笔画起收笔特征分析法,基本笔画特征分析 法,有标准模板变形法、线段高阶相关法、方向指数直方图法、笔画匹配法、 矩特征分析法和多通道分解法等。 ( 1 ) 基本笔画特征分析法:主要是基于汉字笔迹鉴定的有效特征蕴于手写 汉字笔画运笔中的设想,提出以汉字笔画作为笔迹鉴定的主要对象。在选用 手写基本笔画为研究对象的基础上进一步从手书汉字中抽取基本笔画作为 对象,在基本笔画中抽取反映各自行笔部运笔的特征,形成多维特征空间。 求得各鉴定对象在特征空间中的分布,计算它与辞书中各书写者位置间的广 义距离,从而实现笔迹的鉴定。文颖,吴赛等人根据“横 、“竖 、“撇 、 “捺”笔画在汉字出现的不同情况来提取他们的起收笔特征。当实验选用1 0 位书写者。8 种基本笔画,每种笔画采用1 0 个样本。结果显示对于单一笔画和 简单的汉字取得令人满意的鉴定率f 1 7 】f 1 8 l 。 ( 2 ) w i g n e r 分布方法:w i g n e r 分布表示的是图像的局部功率谱( 局部相关 函数的f o u r i e r 变换) 。将归一化后的5 4 5 4 字符点阵上伪w i g n e r 分布作为笔 迹特征进行特征字的比较。刘成林等人对2 0 个人笔迹中的单字、5 个字结合、 1 0 个字结合、1 5 个字结合、2 0 个字结合的情况分别进行识别,最大的平均识 别率达到1 0 0 ,但w i g n e r 分布也存在计算量大,对重复文字进行分割的要求 高等问题。刘成林等人提出简化w i g n e r 的笔迹鉴别方法,计算量和存储量小, 但还是只对相同单字进行比较1 1 9 j 。 ( 3 ) 标准模板变形法:一些文献从字符相对标准模板的变形( 用像素位移 表示) 中提取笔迹特征,具体方法是:将手写字符和标准模板点阵分成1 0 1 0 网格,在网格结点周围设定一个5 5 点的子区域。将标准模板变形与手写字 符尽量接近或反过来变形,接近的原则是使标准模板和字符的对应之间海明 距离最小。这样变形后得到各个子区域中心的位移共1 0 0 个特征,经白化变换 7 哈尔滨j i :程人学硕+ 学位论文 压缩n 5 0 维,用b a y e s 方法或最小距离分类,对单个字母的鉴别正确率为1 7 份4 6 ,利用9 个字母的组合得到鉴别率9 8 。这种方法在英文字母识别有很好 的识别率。 ( 4 ) 笔划匹配法:有的文献对笔迹图像进行平滑消除噪声,并经过细化后, 抽取笔划。笔划定义为任意两个控制点( 端点、交点、折点) 之间的连续像素 集。计算每个笔划的重心和二阶中心距,得n 5 维特征矢量,用加权欧氏距离 进行分类。张慧档等人采集了大量实验样本,通过实验其识别率达到了 9 6 7 1 2 0 j 。这种方法也比较符合文检专家的检验知识,是一种结构分析的方 法。但是这种方法只适用于简单字符,对复杂字符,笔划的提取和对准都是 很困难的,因此这种方法有待进一步研究。 对不同方法性能( 鉴别正确率) 的比较,应考虑这么几个因素:算法复杂 性、应用便利性、样本数和样本质量、抗干扰性、可理解( 解释) 性、推广性 等。综合起来,可以得出以下几点结论: ( 1 ) 文本独立方法和文本依存方法相比,后者的鉴别正确率要高得多,但 笔迹中特征字较多,并且特征字的选择还需要人工干预,不适合大范围( 样本 较多) 应用。前者因为没有文本内容的限制,自动化程度高,若能做到在允许 一定错误接受的条件下基本能将错误排除,是可以大范围应用的笔迹鉴别方 法。 ( 2 ) 文本依存方法中,对东方文字的鉴别率要比对西方文字的鉴别率高, 因为东方文字汉字结构复杂,笔划多,笔迹特征对字符类比较敏感,容易通 过特定字符来把握书写者的书写风格,其中矩特征的提取方法就是最先应用 于文本依存的笔迹鉴别中。 ( 3 ) 基于纹理分析的方法是一种应用广泛的方法,是一种既可以应用的文 本相关又可以应用到文本无关的笔迹鉴别方法。他把不同人书写的笔迹图像 当作不同的纹理看待,有助于挖掘更多的非直观意义上的特征,与其它方法 相比,其优势比较明显。 8 哈尔滨丁程人学硕十学位论文 1 4 论文的主要研究内容与结构 1 4 1 主要研究内容 基于以上对笔迹鉴别技术的发展历史和研究现状的分析可以看出,每种 方法都有其自身的特点,但每种方法又存在其局限性。本文对文本相关中字 符矩的特征提取方法进行应用,对笔迹图像进行分块,尝试提取笔迹图像中 的重心特征,笔迹图像块的形状特征及并根据g a b o r 滤波器提取纹理特征。 在对这些特征的分类结果进行决策分析以达到最终的识别目的。其过程如图: 笔迹块 1 4 2 论文结构 图1 2 鉴别过程 本文是提取笔迹图像块的重心特征、形状特征和纹理特征,并通过实验 验证各个方法的有效性,最后再对决策融合后的结果进行比较。本文共分为 以下六章: 第一章介绍笔迹鉴别的相关信息和特征提取技术的发展现状。 9 哈尔滨丁程大学硕十学位论文 第二章介绍基于矩的特征提取方法,对笔迹图像分块处理用以提取笔迹 的重心特征和形状特征,并通过实验来验证这些特征的对于笔迹鉴别的有效 性。 第三章运用纹理分析的方法提取不同书写者笔迹的纹理特征。使用多通 道的g a b o r 滤波器组,提取笔迹图像的纹理特征,生成特征向量( 方差和均值) 。 第四章通过对前两章所提取的特征进行分析,将得到的每种方法的结果 进行决策级的信息融合,用以产生好的识别效果。 第五章对各种方法的效果进行验证,通过实验分析各种方法的适用性和 局限性。并能通过实验来发现问题。 第六章总结全文并展望未来笔迹鉴别中特征提取的发展方向。 1 0 哈尔滨j f :稃人学硕十学位论文 第2 章基于分块的矩特征提取 本文研究的是与文本无关的笔迹鉴别特征提取技术。本章在分析了矩特 性的基础上,对笔迹图像进行分块处理。通过对笔迹块进行重心及形状特征 提取来生成特征向量,再通过对特征向量进行分类来识别书写者。其中重心 特征主要是提取每个块的重心,并通过比对每个块的重心来确定彼此间的差 异,而形状特征是通过对笔迹块进行一系列操作提取笔迹块的形状方面的特 性。 2 1 矩及其物理意义 机械学中矩是指力对某个点的旋转效应。而在图像处理领域,矩描述了 灰度图像中所有像素点的整体分布情况,是计算机视觉和模式识别领域用来 表示物体形状和进行不变性物体识别的一种重要的方法。有许多新的矩方法 被提出并且在模式识别领域得到了广泛的应用。 笔迹块的形状特征是通过对整体结构进行分析,获得如外形( 方型、扁型 等) ,倾斜( 直立、左倾、右倾) 、重心偏移( 对称、偏左、偏右) 等特征。由于 这些特征能够反映了笔迹的书写风格,而且特征的物理意义明确。所以使得 提取笔迹块形状特征来进行笔迹鉴别是可能的。 对于一个二维连续函数厂o ,y ) ,其中p + q 阶的几何距定义: m 明z 聪妒y qi ( x ,y ) d x d y ( 2 - 1 ) 对于一个大小为mx n 离散数字图像的几何距定义为: ( 2 - 2 ) 从零阶距和一阶距可以获得物体的重心,假设物体的重心坐标是( ;,多) , 那么可以得出: 、- 、y0 , 碍 y p x m v 箭乏 暑 w m 哈尔滨:t = 斧,。人学硕十学位论文 王。监,多。鱼 m o o m 以重心为坐标可以得出物体的中心距: ( 2 - 3 ) 6 g x z 荟荟( 卜帕一多) ( 2 _ 4 ) 由此可以推导出= m ,1 0 = 0 1 = 0 ,图像的中心距相对于位移 是不变的1 2 1 l 【2 2 1 。 低阶矩具有明显的物理意义。零阶矩表示图像中所有像素点灰度之和( 对 于二值图像则表示黑像素点的个数,就是前景区域的而积) 。相应的二、三阶 矩能表达一些更复杂的形状特征,而这些特征就是在笔迹鉴别中要用到的。 下面介绍一下二阶和三阶距的物理意义。 二阶距: 胪磊荟( 卜妒m y ) 驴荟磊( y 一歹) 2 肥y ) ( 2 - 5 ) ( 2 - 6 ) 胪磊荟( 卜而( r - 多) f x ( 2 - 7 ) 其中加很明显的表示为横坐标的方差,即水平方向的伸展度;同理t 0 2 就 表示为垂直方向的伸展度;而对于二阶矩以,其基函数o x ) ( y 一多) 表示二 值图像中黑像素点坐标( 以重心为原点) 的分布。h 。 0 说明第一象限和第三 象限的黑像素点比例大于第二象限和第四象限的黑像素点所占比例。由于数 字图像中y 轴是向下的。以。 0 表明字符是向左上倾斜的,反上心。 0 时对应字符重 心偏左, o 对应重心偏上,而 o ;若黑像素点位于字符重心以 下,则o 一;) 2 ( y 一多) 0 对应物体下部的水平伸展比上部大,反之上部的水平伸展比下部大。 同理,以:表示字符垂直伸展的均衡程度,一: 0 对应字符右部的水平伸展 比左部大,反之字符左部的水平伸展比右部大。 2 2 矩特征提取 本节中提取的矩特征是在对图像分块的前提下实现的,那么首先必须对 笔迹图像分块。由于笔迹图像重心特征相对来说反映的是整幅笔迹的水平方 向上的书写者的书写风格,而形状特征则是对笔迹图像中某些块提取形状特 征的一种综合,所以,两种特征对与分块的要求也是不同。本节将对两种方 式的分块要求进行介绍,并对每种方式下的特征提取进行阐述。 1 3 哈尔滨下程大学硕十学位论文 2 2 1 重心特征提取 重心特征反映的是个人的书写风格,是一个人写字书写姿势的反映。大 体通过重心特征可以发现书写的笔迹相对于水平方向的浮动情况。分为三类: 1 基本上保持水平,2 笔迹向下倾斜,3 笔迹向上倾斜。其形式如图: l 向上倾: 一 图2 1 笔迹倾斜方式 重心特征的提取需要反映出笔迹行的特性,所以对于笔迹的图像矩阵在 行上划分没有太大要求。可以将笔迹图像划分为若干块并求取每一块的重心, 具体分块操作如下: 笔迹图像 图2 2 笔迹分块方式 也可以对每一列进行等分操作。当笔迹行浮动较大的时候,若对每一列 分得的块数较多的时候,那么对应的块之间的重心特征将会被相互干扰,若 每个行的浮动都比较细微,那么可以进行列分块。再使用公式( 2 - 1 ) 、( 2 - 2 ) 、 ( 2 - 3 ) 获取各个块的重心坐标,坐标形式如图所示: 图2 3 笔迹重心表示 1 4 哈尔滨下程大学硕+ 学位论文 由于笔迹图像在边界容易有空格,所以对笔迹图像中的左右两边的分块 不进行操作。获得的重心坐标后再比对每个笔迹中相应块上坐标点的浮动情 况,获取最相似波动的笔迹,并将最相似的笔迹作为候选。 2 2 2 形状特征提取 这种方法是在对笔迹分块的前提下,选取某些笔迹块形状特征作为整体 的形状特征。图像分块操作原本是为了提取图像中感兴趣的部分,这主要应 用于人脸识别等图像处理技术中【2 3 l 。由于考虑的笔迹中汉字比较多,并不能 提取单一字符作为兴趣对象,所以只能在像素的分布规律上考虑【2 4 】。这里采 用3 次分块判定的方法: ( 1 ) 首先将大小为m n 的图像f ( i ,) 分为若干个m x n 个图像块 g ( u ,1 ,) ,其中0 f m - 1 ,0 ,n 一1 ,0 u m l ,0 1 ,刀一1 ,m 和,l 都应该是2 的正整数幂,m = r = 1 6 ,计算各个小块的均值a ( u ,) : a ( u ,v ) = ( u + 1 ) m - i ( v + 1 ) n - i g ( u ,v ) i = u m j = v n ( 2 - 1 2 ) mxn 并获得整个笔迹的均值。 ( 2 ) 对大小为r e r 的所有图像块计算均值,获取均值数大于并且排 名在前七名位的笔迹块记为鸭瓯,若其中的笔迹块有相邻那么取 排名较大的,将较小的去除,再次获得前五名的笔迹块。 ( 3 ) 将喁口2 0 f 3 0 f 4 0 f 5 的笔迹块扩大为原来的2 被变为2 m x 2 n 。并计算 其均值,再次获排名的前五名。 ( 4 ) 将( 3 ) 的前三名进行再次扩大为第三步骤的图像块的2 倍,计算均 值并获得排名第一,第二的笔迹块,那么就可以断定此笔迹块由小到大在笔 迹的分布规律上保持了一定得连续性,可以用以此块作为形状特征提去的块。 哈尔滨1 :稃人学硕十学位论文 2 4 形状特征笔迹块划分 由2 1 节所得出的二、三阶中心矩的特性,针对笔迹块可以从中得出该区 域的形状特征,将得到的数据作为特征变量,提取特征如下: ( 1 ) 长宽度特性 由于和分别表示某笔迹区域在水平方向和垂直方向上的伸展度, 因此他们的比值能够反映该区域的长度和宽度之比,归一化处理这个比值后为: 五。芦 丝+ 1 ) 2 ( 2 1 3 ) + 舵 当宽度较大的时候五( 0 5 ,1 ) ,当宽度较小的时候五( o 0 5 ) 。 ( 2 ) 倾斜方向 笔迹区域点阵的协方差矩阵氏;【2 0心1 】反映区域中黑色像素的分 。 m 1 布情况,协方差的本特征向量指向子都的两个正交轴,其主轴方向就是笔迹 块的伸展方向。笔迹块在两个正交轴上的惯性距的比值就是笔迹块的拉伸度, 由协方差矩阵可以计算出主轴的方向角: 口。t 锄一丝二丝! 型! 丝二丝! :兰缒( 2 1 4 ) 2 胜1 将方向角特征提取为: 一 厂t ,_( 2 - 1 5 ) j 了| j 2 ,2 的取值范围【- 1 ,1 】,厶一o 对应字符的主轴指向水平方向,厂2 0 对应于左 倾斜,厂 0 5 则表示笔迹区域重心偏右 兀 0 5 则表示笔迹区域重心偏下, ,6 1 3 i n 舒 1 9 ( 2 - 2 4 ) 哈尔滨t :程大学硕士学何论文 一是所分块的个数,s 是所求得的第i 块中两个坐标的距离。 2 求得各个图像间坐标距离的方差: 盯2 一三罗( s j c l ) 2 ( 2 2 5 ) n 符 计算待测笔迹与笔迹样本间的距离的方差,这个值就是两幅笔迹间距离 的浮动情况,方差越小,则两个笔迹间的距离就相对越稳定。这样就可以将 最小的方差作为最佳的候选。 其本文通过对1 5 人( 编号0 0 1 ,0 0 2 ,0 0 3 ,0 1 5 ) 共8 0 幅笔迹进行分 析。将所有笔迹调整为矩阵大小相同的图片,对其进行分块提取重心特征。 对每人的3 幅笔迹进行训练,生成每人笔迹的重心特征数据( 数据编号1 0 1 , 1 0 2 ,o o o 91 1 5 ) ,存入数据库。对待测笔迹进行重心提取,再获取待测样本 和数据库中每幅笔迹的重心特征数据的最短距离,将距离最短的作为第一候 选人,其次第二候选人,以此类推取前五名作为候选。笔迹编号0 0 1 ,0 0 2 , 0 0 3 ,0 1 5 ,各个笔迹的识别,根据其最短距离进行由小到大排序位置( 给 出前6 个) 如表2 2 所示: 表2 2 排序位置 待测样本编号距离最短前五名排序 0 0 11 0 1 ,1 0 3 ,1 0 9 ,1 1 5 ,1 1 3 0 0 21 0 5 ,l1 3 ,1 0 9 ,1 0 7 ,1 0 3 0 0 31 0 3 ,11 4 ,1 0 6 ,1 0 2 ,1 0 8 0 0 41 1 3 ,1 0 4 ,1 0 3 ,1 0 1 ,1 0 7 0 0 51 0 2 ,1 1 3 ,1 0 9 ,1 1 1 ,1 0 1 0 0 61 0 6 ,1 0 4 ,1 0 8 ,1 1 2 ,1 1 3 通过对这1 5 个笔迹样本进行识别,获知第一名所占比率是7 2 。前两名有 占总数的8 0 ,前五名所占9 3 。对于获取每个待测样本前五名的候选人可以 为后续的决策级信息融合做准备。 2 形状特征的获取 对笔迹样本a 来说,其行间距比较大,当分块的时候不利于提取形状特征。 所以对笔迹a 进行去行间距操作,其去行间距后的图像为: 2 0 哈尔滨t 程大学硕十学位论文 承转秀界零手码两匿摊方嘲五身蝇j 溅5 畸蚺佛计碍桂诅不县 奄鲁盛代:i 瞌母少啦的应司刚每枷i 砾a 行拉耠酗鲁壶量丸睾国珐 弓文咖lj 蝴最是u 啦虹青俸维错慢空同时九粒抽怖拍积触是 人睑电蛀蜘马硌码伽批龟隹和只守靠同的转事下曲 却峰 铀蛔哼悔不l i l 靠扣炳融而人崎裕缸碾捌i 冠蛀宴啾摊出彤撇 图2 7 行间距去除后的笔迹 针对图2 5 笔迹提取任意的大小为6 4 6 4 的笔迹块,并通过三次分块判 定方法来选取合适的块,所以经过筛选获得如图2 8 的笔迹块: 酗- - r 怔7 翻 m 剐h 忡i 广蝴_ 毛誓 氛- 饿供1 社确i j i h 毫1 :擒“二移应囝l 秭j 缸丘铂k 毫匕刘酞村j 浍m - 处卉嗣 图2 85 个笔迹块 由于第5 个笔迹块不满足条件所以不对其进行处理,对前4 份笔迹块记为 编号1 、2 、3 、4 提取形状特征,数据如下表: 表2 3 笔迹块的形状特征 絮 1234 特征值 长宽度特性五 0 4 8 70 5 2 60 5

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论