【《错题识别与录入系统的原理分析案例概述》4200字】_第1页
【《错题识别与录入系统的原理分析案例概述》4200字】_第2页
【《错题识别与录入系统的原理分析案例概述》4200字】_第3页
【《错题识别与录入系统的原理分析案例概述》4200字】_第4页
【《错题识别与录入系统的原理分析案例概述》4200字】_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第第页错题识别与录入系统的原理分析案例概述目录TOC\o"1-3"\h\u1990错题识别与录入系统的原理分析案例概述 194741.1手写体和印刷体区分 130751.1.1形态学算法 1166611.1.2形状测量 4125611.2颜色识别及去除 528701.3BP神经网络 6图像文字提取又分为动态图像文字提取和静态图像文字提取两种,其中,静态图像文字提取是动态图像文字提取的基础,其应用范围更为广泛,对它的研究具有基础性,所以本文主要讨论静态图像的文字提取技术。静态图像中的文字可分成两大类:一种是图像中场景本身包含的文字,称为场景文字;另一种是图像后期制作中加入的文字,称为人工文字。场景文字由于其出现的位置、小、颜色和形态的随机性,一般难于检测和提取;而人工文字则字体较规范、大小有一定的限度且易辨认,颜色为单色,相对与前者更易被检测和提取,又因其对图像内容起到说明总结的作用,故适合用来做图像的索引和检索关键字。1.1手写体和印刷体区分文字信息采集、信息分析与处理、信息分类判别是文字识别技术的主要步骤。信息采集是将纸中的文字信息转换成电流信号,并自动输入到计算机。信息分析与处理是对电信号进行消噪及偏转、粗细、大小等润色处理。信息分类判别是对处理后的文字信息进行分类判别,输出识别结果。下面分别介绍两种以文字形态学算法为基础和以形状测量为基础的方法的对于文字识别和处理的方法。1.1.1形态学算法形态学通常是使用二值图像,提取边界,骨架提取,孔洞填充,角点提取,图像重建。基本的算法:膨胀腐蚀,开操作,闭操作。几种算法进行组合,就可以实现一些非常复杂的功能。以B结构中心点为准心。腐蚀:在A中找能满足B结构的点。膨胀:把A结构的每个点放到B中心点,以B结构外扩。开操作是先腐蚀后膨胀;闭操作是先膨胀后腐蚀。腐蚀操作的主要目的是使边界缩小,腐蚀能够消融物体的边界,具体的腐蚀结果与图像本身和结构元素的形状有关。腐蚀:结构A被结构B腐蚀的定义为:A⨀B={z|(B)z⊆A}(2-1)可以理解为,移动结构B,如果结构B与结构A的交集完全属于结构A的区域内,则保存该位置点,所有满足条件的点构成结构A被结构B腐蚀的结果。腐蚀操作的主要目的是使边界缩小,腐蚀能够消融物体的边界,具体的腐蚀结果与图像本身和结构元素的形状有关。图2-1腐蚀操作结果示意图膨胀:结构A被结构B膨胀的定义为,A⨁B={z|(B^)z⋂A≠∅}(2-2)可以理解为,将结构B在结构A上进行卷积,如果移动结构B的过程中,与结构A存在重叠区域,则记录该位置,所有移动结构B与结构A存在交集的位置的集合为结构A在结构B作用下的膨胀结果。膨胀操作是与腐蚀操作相反的过程,经过运算之后可以使图像变大,内部空洞变小。在图像二值化的过程中,很容易出现连通区域断裂或孔洞较多的情况,可以用于合并裂缝、填充孔洞。图2-2膨胀操作结果示意图3.开操作

先腐蚀后膨胀的操作称之为开操作。它具有消除细小物体,在纤细处分离物体和平滑较大物体边界的作用。

图2-3开操作结果示意图4.闭操作

:先膨胀后腐蚀称为闭操作。它具有填充物体内细小空洞,连接邻近物体和平滑边界的作用。图2-4闭操作结果示意图图2-5所示为二值图片腐蚀,膨胀,开操作,闭操作的结果对比。去除小的亮细节,同时保持总体灰度级和较大的明亮区不变是开操作的效果。原因是腐蚀操作会去除亮细节,但会使得图片变暗,接下来的膨胀操作会提高图像亮度且不会把已经去除的细节重新引入。闭操作通常会去除细节中的暗细节,而相对保持明亮部分不受影响。图2-5图像各种形态学处理对比图像处理是通过对图像中的文本区域进行定位,文本分割也是同理,从而分离真实文本,进行识别;识别处理部分是对分离的文本图像信息进行筛别,去除信号中的黑点、空白等无效部分,再对文本图像信息进行增强[1]。并根据一定的标准忽略掉一些不必要的信号,获得相同大小、位置及笔画的信号,从而降低判断的复杂性。特征提取部分是将识别出的信号的特有部分进行提取,为后续识别提供模版;学习部分则是通过提取出的信号特征优化模板库的内容,并存储到指定位置[2]。图2-6文字识别原理图[3]基于形态学算法的文字识别是在二值图像的基础上进行操作。通常会有离散的黑点存在于放大的二值图像。可以对图像分别进行横与纵向腐蚀膨胀处理。并把图片中的文字分割,保存在文件夹中,创建字符集,后续匹配时调字符匹配采用模板匹配算法,将与现有字符相减误差最小的模版字符作为匹配字符[3]。然而,此种算法有以下几个缺点:(1)算法具有识别局限性。对于左右结构的字符(如:川)容易造成误识别,“川”字将会被识别成三部分。当图片中文字有一定倾斜角度时,这将造成识别困难。(2)模板匹配效率低。(3)伸缩范围比较小。1.1.2形状测量形状测量方法应用于字体识别,主要是基于形态学处理图片的方法之上。此算法的原理是通过识别图中的连通区域,锁定连通区域后,通过计算连通区域的面积并对比,来达到对手写字体的区分。Matlab中这一功能的实现可以采用regionprops函数,它是用来度量图像区域属性的函数。通常用来统计被标记的区域的面积分布,显示区域总数。其语法通常为S=regionprops(L,properties)。其中,L为任意维数的数值数组。标注为0的像素构成背景。标注为1的像素构成一个对象,标注为2的像素构成第二个对象,以此类推。连续区域也称为对象、连通分量或斑点。包含连续区域的标注图像L看起来可能像下面这样:图2-7连续区域LL中等于1的元素属于第一个连续区域或连通分量,L中等于2的元素属于第二个连通分量,以此类推。不连续区域是可以包含多个连通分量的区域。包含不连续区域的标注图像看起来可能像下面这样:图2-8不连续区域的LL中等于1的元素属于第一个区域,该区域是不连续的,包含两个连通分量。L中等于2的元素属于第二个区域,它是单个连通分量。Properties里会包含各种属性字符串,包含计算出在图像各个区域中像素总个数的字符串和1行ndims(L)*2列的向量,即包含相应区域的最小矩形。图2-9boundingbox的示例如图2-9为boundingbox在生活中运用到的示例,也就是包含相应区域的最小矩阵。Boundingbox(x,y,w,h)分别表示窗口左上角坐标和宽和高。然而在图片文字识别处理中,我们可以通过开运算闭运算后,对于连通区域的锁定,通过计算窗口的面积的大小代替字体大小来进行比对,给定一个判定范围,在范围内的我们认为是手写痕迹和手写字体。从而达到对于手写字体和印刷体的区分的目的[4]。然而,这种算法虽然相比形态学算法来说,对手写和印刷体字体的识别,简洁了很多,但不足之处也很明显:由于是通过比对面积的计算方法,对于稍小的手写痕迹是识别不到的。例如手写的逗号,句号和其他比较细小的痕迹来说,识别无疑是一种困难。但也可通过开运算闭运算的处理,把稍小的区域与其他大块区域连通,以此来解决此类问题。1.2颜色识别及去除图像的颜色识别:先设定一个颜色对应区间,再将图片有色彩的图片,通常是RGB图,进行每个像素点的对应颜色区间的判断。事实上,颜色的描述是十分复杂的。例如RGB三基色加光系统就不能涵盖所有可能的颜色,出于各种色彩表达,以及色彩变换和软硬件应用的需求,存在各种各样的颜色模型及色彩空间的表达方式。这些颜色模型,根据不同的划分标准,可以按不同的原则划分为不同的类别。图2-6可见光所需的三原色光比例曲线对于处理图像中的色彩时,可以先读取颜色在对应区间中的任意数量的颜色图像,读取图像像素点的颜色区间值来规定颜色区间范围,再将学习到的颜色区间值编写进程序再对颜色进行判断。要想对颜色空间的图像进行的有效处理相对简单,可以在HSV空间进行[5]。不同颜色的HSV阈值如图2-7可见。图2-7十种基础颜色对应的HSV颜色分量范围[6]图2-7为十种基础颜色分别是黑、灰、白、红、橙、黄、绿、青、蓝、紫的HSV对应区间数值范围。此次主要用到红、蓝、黑三种颜色。从图2-7中可以清楚的看到红、蓝、黑三种颜色的HSV对应区间。分别是:黑(H:0-180;S:0-255;V:0-46),红(H:0-10&156-180;S:43-255;V:46-255),蓝(H:100-124;S:43-255;V:46-255)[6]。通过根据不同的颜色设定不同的阈值,从而达到对颜色识别的目的。1.3BP神经网络BP(Back

Propagation)网络,是1986年由Rumelhart和McCelland为首的科学家小组提出的,一种按误差逆传播算法训练的多层前馈网络,是目前应用最广泛的神经网络模型之一。人工神经网络首先要以一定的学习准则进行学习,然后才能工作。网络学习的准则应该是:如果网络作出错误的的判决,则通过网络的学习,应使得网络减少下次犯同样错误的可能性。其网络模型如图2-8所示。图2-8神经网络模型图[7]首先,给网络的各连接权值赋予(0,1)区间内的随机值,将“A”所对应的图象模式输入网络,网络将输入模式加权求和、与门限比较、再进行非线性运算,得到网络的输出。在此情况下,网络输出为“1”和“0”的概率各为50%,也就是说是完全随机的。这时如果输出为“1”(结果正确),则使连接权值增大,以便使网络再次遇到“A”模式输入时,仍然能作出正确的判断[7]。如果输出为“0”(即结果错误),就把网络连接权值朝着减小综合输入加权值的方向调整,其目的在于使网络下次再遇到“A”模式输入时,减小犯同样错误的可能性。如此操作调整,当给网络轮番输入若干个手写字母“A”、“B”后,按以上学习方法进行若干次学习后,网络判断的正确率将大大提高。以上说明网络对这两个模式的学习已经获得了成功,它已将这两个模式分布地记忆在网络的各个连接权值上。当网络再次遇到其中任何一个模式时,能够作出迅速、准确的判断和识别。一般说来,网络中所含的神经元个数越多,则它能记忆、识别的模式也就越多[8]。BP网络的算法核心是将输出和预期输出之间的差值归纳为权数和临界值的“偏差”,然后通过反向传播将差值“分派”给各个神经元的权数和临界值,权值和临界值进行具体推导。本课题将采用Matlab神经网络来实现数字图片库的训练和识别,包括基本数学符号和数字,以实现简单数学计算题目的识别与录入[9]。然而,在数据降维时,运用到了PCA(principalcomponentsanalysis)。PCA主要用于数据降维,降维就是一种对高维度特征数据预处理方法[9]。降维:将高维数据中的最重要的一些特征保留下来,去除不重要的特征和干扰噪声,从而对数据处理速度加以提升[10]。对于由各种例子的特征组成的多维

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论