视频与图像处理-文字特征提取_第1页
视频与图像处理-文字特征提取_第2页
视频与图像处理-文字特征提取_第3页
视频与图像处理-文字特征提取_第4页
视频与图像处理-文字特征提取_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

图像文本提取算法研究

摘要:根据图像中文字与背景区城的形态特征,提出了一种基于形态运算和连通域标记的复杂背景图像文档提取算法。

实验结果说明.即使在图像分辨率不高以及文字布局较复杂的情况下,该算法仍然较快较准确地提取出复杂背景图像中的

文字。

关键词:Ostu,二值化.形态学,连通域

1引言2算法描述

近年来,随着计算机和网络技术的开展,网页上本文设计用于实现义本的提取的方法,改方法主

的数字化图像和视频呈现爆炸式增长。而随着移动数要分为三个步骤:

码摄像设备的普及,用户也可以方便地使用移动设第一步:阈值分割,通过Ostu法计算图像的阈值,

备拍摄自然场景中的数字化图像。同时,传统的图书并对图像进展二值化,实现目标和背景的别离;

馆为了满足用户对多媒体内容的查询需求,也开场

第二步:形态学处理,二值化的图像进展膨胀、腐蚀、

收藏图像和音视频等内容。多样的信息给人们的生产

开、闭运算,实现文字区域的连通,便于文字区域的

和生活带来了巨大便利的同时,也使如何能让用户

提取;

准确迅速地找到自己所需的多媒体内容成为口益突

出和紧迫的需求,因而也需要有效的方法来组织和第三步:连通域标记,处理后的图像的大局部连通区

检索这些多媒体内容。域是文字区域。利用连通域标记算法实现连通域的标

记,再对每个连通域画矩形框从而实现文档的提取。

以往的文档分析与识别领域,主要着眼于对一些

布局较有规律的二值文档进展字符/图形分割与识2.1阈值分割

别。目前,随着WWW页面中图片的大量使用,以及

2.1.1阈值分割方法

图像、视频数据库的广泛应用,使得图像成为另一种

为了便于对文字的识别,我们需要将检测到的文

重要的信息载体。Loprest指出,互联网上相当一局部

文字是嵌入在图像中的,而且其中大局部文字并没字进展二值化。图像二值化的方法主要分为局部阈值

有在HTML页面的其他地方重复出现⑴。Wong那么二值化和全局阈值二值化两种[7],全局阈值二值化

认为视频图像中的文字可为我们提供关于该视频产是整幅图像都用同一个阈值进展二值化的方法,其

品的丰富语义信息图。不幸的是,目前大多数的搜索计算简单,但是适合背景简单,灰度直方图只有连个

引擎都无法直接对嵌入在图像中的文字内容进展检明显的波峰的图像。对于背景复杂、噪声严重或者图

索。因此,如何在更杂的图像背景卜.快速、准确地分像光照分布不均时全局阈值二值化的效果就会很差,

割与提取文字将具有广泛的应用前景和研究价值。文造成很多虚景或者造成目标的丧失[8]。局部阈值的方

法是将图像分块,对每块使用不同的阈值进展二值

献[1「文献⑹分别在Web图像及视频图像的文字分

割领域进展了相关研究。化。局部阈值能很好的克制全局阈值所面临的问题,

但是局部阈值计算相对较为复杂,对图像的分块方

经大量观察后我们发现,WWW图片、Video图像

及杂志封面图片一般具有以下特点:式不同会影响二值化的效果[9]。

图像闽值分割技术的关键在于如何选取闽值。根据其对像素的处理方

(1)图像中包含色彩较为丰富的文字与背景;

北主要分为三类:

(2)图像背景可能由一些具有较多灰度变化的

(I)全局阅值法:是指在二值化过程中只使用一个全局阈值丁的方法。

复杂图案构成;

它将图像的每个像素的灰度值与T进展比拟,假设大于T.那么取为前

(3)图像中文字的分辨率一般不高,这是由于在

风光(白色):否则,取为背风光(黑色)。

生成文字时使用了图像处理软件中的反锯齿效果

设图像的灰度函数为f(x,y),那么二值化算法的表达式:

(Anti-Aliased)而造成的;

J255f^y)>T

(4)图像中文字布局的随意性较大,而且文字与〃“寸。其他⑴

背景的层次关系可能很好杂。

我们称这类图像为包含复杂背景及文字的图像。全局阈值法土要适合于质量较好、口标和背景比

本文将讨论如何在这一类图像中提取文字。

照度较大,旦直方图呈现双峰的图像。典型的全局阈Ostu方法二值化和固定阈值二值化的比拟图。

值法有Ostu法[10]、最大牖方法等。

(2)局部阈值法:由当前像素灰度值与该像素

周围点局部灰度特征来确定像素的阈值。例如可以将

原图像划分为一些不相交的小块,将各块图像的灰

度均值作为该部块图像的阈值,局部采用全局阈值

法。典型的局部阈值法有Bemsen法。

(3)动态阈值法:它的阈值选择不仅取决于该

像素及周围像素的灰度值,而且还与该像素的坐标

位置有关。例如我们可以在局部上统计该区域灰度值

图1原图效果

分布特征,根据统计结果来确定不同的局部阈值。

在下面的小节中我们主要讨论本实验使用的

ostu法的原理和特点。

震国元法

2.1.2OSTU法

B月礼谎信

在众多阈值分割算法中,1979色由Otsu提出的基

于类间方差最大化的分割算法一直被认为是分割阈团结反香

值自动选取的最优方法。它将图像分为背景与目标两勤检自/强、

类,通过搜索计算类间方差最大值,得到最优阈值。

图2Oscu二值化效果图3固定阈值二值化效果

图像中像素值(KT的均值为:

原图中比拟灰暗的文字如果当做文档来提取增加了

文档提取的难度,所以当做背景来处理。从效果图比

〃(丁)=Zk・p(k)⑵拟可以看出采用Ostu法二值化效果较好,适应性较

0<*<T强。本实验中要对20幅图像进展处理采用固定阈

值二值化对于不知道背景和目标像素区别的情况下,

式中P")为图像中像素值为K的概率。效果不好。而Ostu对于这种情况较好。

图像中像素值0-T的概率和为:图像形态学处理

w(T)=Zp(&)(3)2.2.1根本原理

Q<k<T

原理:在特殊领域运算形式一一构造元素

图像总的均值为:

(SturctureElement),在每个像素位置上与二值图像

u=Zk・p(k)(4)

对应的区域进展特定的逻辑运算。运算构造是输出图

0<Jt<255

像的相应像素。运算效果取决于构造元素大小内容以

图像背景和目标两类像素的类间方差定义为:

及逻辑运算性质。

(〃二(丁)一〃(丁))2

构造元素:膨胀和腐蚀操作的最根本组成局部,

vv(T).(1-vv(T))用于测试输出图像,通常要比待处理的图像小还很

多。二维平面构造元素由一个数值为。或1的矩阵组

在Ostu方法中,图像最正确阈值g那么为max(G(T))

成。构造元素的原点指定了图像中需要处理的像素范

下的T值。根据阈值g,整幅图像可以分为背景和目

围,构造元素中数值为1的点决定构造元素的邻域像

标两局部。由于方差是衡量图像中像素灰度分布均匀

素在进展膨胀或腐蚀操作时是否需要参与计算。

性的一个度量,方差值越大,说明组成图像的背景和

先来定义一些根本符号和关系。

目标两局部的差异越大。当局部背景被错误地划分为

1.元素

目标或者局部FI标被错误地划分为背景时,会导致

两局部的差异变小。因此,Ostu方法实际上是以错分设有一幅图象X,假设点a在X的区域以内,那么

概率最小作为分割阈值的选取准则的。以下是采用称a为X的元素,记作aex,如图4所示。

2.B包含于X设有两幅图象B,X.假设X是被史理的对象,而

设有两幅图象B,Xo对于B中所有的元素ai,都B是用来处理X的,那么称B为构造元素(structure

有aiWX,那么称B包含于(includedin)X,记作BX,如element),又被形象地称做刷子。构造元素通常都是

图5所示。一些比拟小的图象。

3.B击中X7.对称集

设有两幅图象B,Xo假设存在这样一个点,它即设有一幅图象B,将B中所有元素的坐标取反,

是B的元素,又是X的元素,那么称B击中(hit)X,记即令(x,y)变成(-x,-y),所有这些点构成的新的集合称

作BlX,如图6所示。为B的对称集,记作Bv,如图9所示。

8.平移

4.B不击中X

设有一幅图象B,有一个

设有两幅图象B,X。点a(xO,yO),将B平移a

假设不存在任何一个点,后的结果是,把B中所有

它即是B的元素,又是X元素的横坐标加xO,纵坐

的元素,即B和X的交集标加yO,即令(x,y)变成

是空,那么称B不击中(x+xO,y+yO),所有这些点

(miss)X,记作Bnx=u);其构成的新的集合称为B的

中n是集合运算相交的符平移,记作Ba,如图10所

号,中表示空集。如图7z5o

所示。

X图10平移的示意图

图4元素

图9对称集的示意图

2.2.2腐蚀

把构造元素B平移a后得到Ba,假设Ba包含于X,我

们记下这个a点,所有满足上述条件的a点组成的集

合称做X被B腐蚀(Erosion)的结果。用公式表示为:

E(X)={a|BaX)=XB,如图11所示。

5.补集

设有一幅图象X,所有X区域以外的点构成的集合称

为X的补集,记作Xc,如图6.5所示。显然,如果B

nx=a),那么B在x的补集内,即BXC。

图8补集的示意图

1211腐蚀的示意图

6.构造元素

图11中X是被处理的对象,B是构造元素。不难知道,

对于任意一个在阴影局部的点a,Ba包含于X,所以X

1±-

被B腐蚀的结果就是那个阴影局部。阴影局部在X的、1B"

不说话就丽R不说玷京昭晶R

范围之内,旦比X小,就象X被剥掠了一层似的,这

的企划术

W的金句术

就是为什么叫腐蚀的原因。

打法必It商用文本“迅必M向川文本

值得注意的是,上面的B是对称的,即B的对称集

Bv=B,所以X被B腐蚀的结果和X被Bv腐蚀的结果

电e

是一样的。如果B不是对称的,让我们看看图12,就

会发现X被B腐蚀的结果和X被Bv腐蚀的结果不同。婚引

图14原图图15腐怛后的结果图

2.2.3膨胀

膨胀(dilation)可以看做是腐蚀的对偶运算,

其定义是:把构造元素B平移a后得到Ba,假设Ba

击中X,我们记下这个a点。所有满足.上述条件的a

点组成的集合称做X被B膨胀的结果。用公式表示为:

D(X)={a|BatX}二XB,如图16所示。图16中X是

被处理的对象,B是构造元素,不难知道,对•于任意

一个在阴影局部的点a,Ba击中X,所以X被B膨胀

的结果就是那个阴影局部.阴影局部包括X的所有范

围,就象X膨胀了一圈似的,这就是为什么叫膨胀

的原因。

图11和图12都是不意图,让我们来看看实际上是怎

同样,如果B不是对称的,X被B膨胀的结果和X被

样进展腐蚀运算的。

Bv膨胀的结果不同。

在图13中,左边是被处理的图象X(二值图象,我们让我们又看看实际上是怎样进展膨胀运算的。在图

针对的是黑点),中间是构造元素E,那个标有17中,左边是被处理的图象X(二值图象,我们针对

origin的点是中心点,即当前处理元素的位置,我的是黑点),中间是构造元素B。膨胀的方法是,拿B

们在介绍模板操作时也有过类似的概念。腐蚀的方法的中心点和X上的点及X周围的点一个一个地对,如

是,拿B的中心点和X上的点一个一个地比照,如果果B上有一个,点;落在X的范围内,那么该点就为黑;

B上的所有点都在X的范围内,那么该点保存,否那右边是膨胀后的结果。可以看出,它包括X的所有范

么将该点去掉;右边是腐蚀后的结果。可以看出,它围,就象X膨胀了一圈似的。

仍在原来X的范围内,且比X包含的点要少,就象X

被腐蚀掉了一层。

图13腐蚀运算

图14为原图,图15为腐蚀后的结果图,能够很明显

地看出腐蚀的效果。

图16膨胀的示意图

连通域标号替换第一阶段的临时连通域标号,此阶

段的像素点连通域标号就是最终的H标标号,称为

目标连通域标号。

等价标号:在待合并连通域标号矩阵中,会有不同的

连通域标号属于同一目标,那么将此类连通域标号

称为等价标号,也称为冲突标号。

图17膨胀运算共同连通域标号:指示待合并连通域标号所标记的

连通域所属的目标的标号,用一维数组保存,以待

图19为图18膨胀后的结果图,能够很明显的看出膨

合并连通域标号为下标,该值指示临时连通域标号

胀的效果。

所标记的连通域属于哪个目标。

口郎函的做ZHAO3IA0TOU3IAO3.2算法简介

XMN网ANFALUWEMJIAMJIt{曰晒

本算法分为两个阶段。

建设工程招标投标第一阶段,对二值图像进展一次扫描,按某种连通

(4邻域或8邻域)规则,标记所有像素点的待合

相关法律文件及合同文本并连通域标号,同时,按一定的规则,标记待合

并连通域标号的共同连通域标号。由于4邻域和8邻

图18原图域的模板核过小,无法一次正确标记所有的目标,

会有大量:等价标号存在。用共同连通域标号标记各等

价标号所属的共同连通域。

第二阶段,扫描临时连通域标号矩阵,纠正矩阵中

的临时连通域标号,即用共同连通域标号替换各像

素点的临时连通域标号,实现连通域的合并。合并时,

按共同连通域标号出现的次序,重新定序,确保目

标连通域标号连续。合并后,矩阵中的像素点连通域

标号即是最终所得的目标连通域标号。

图19膨胀后效果图3.3算法原理

形态学处理中开运算是对原图先进展腐蚀处理,后本算法的8邻域和4邻域的处理方法相似,以4

再进展膨胀的处理。开运算可以在别离粘连目标物的邻域为例,对算法阈述。

同时,根本保持原目标物的大小。闭运算是对原图先设某像素点f(x,y),那么f(xT,y),f(x+1,y),

进展膨胀处理,后再进展腐蚀的处理。闭运算可以在f(x,y-1),f(x,y+1)为其四邻域左、右、上、下像

合并断裂目标物的同时,根本保持原目标物的大小。素点。设merge(x,y)是f(x,y)像素点连通域标号。

当扫描f(x,y)时,已完成了f(x-1,y)和f(x,y-1)

连通域标记算法

3扫描,irerge(x-l,y)和merge(x,yT)为数。因此

3.1图像初始标记在4邻域内,f(x,y)像素点连通域标号merge(x,y)

仅和像素点、及其像素点连通

连通域标号:图像像素点所在的连通域的序号,f(x-l,y)f(x,yT)

域标号、有关,如式

用与图像大小一样的二维数组保存每个像素点的连merge(xT,y)merge(x,yT)

所示。

通域标号。连通域标号在本算法有两个阶段:(6)

第一阶段,对二值图像扫描取得的临时连通域

标号,此阶段,会有不同的连通域标号属于同一目

标。因此,将此阶段的像素点连通域标号称为待合并(6)

连通域标号或临时连通域标号。

第二阶段,合并等价连通域标号,即利用共同

式⑹表示:

⑴当像素点f(x,y)=f(xT,y)且f(x,y)!f(x.一元素i,假设common(i)=common(merge(x-1.y))那

y-1),即f(x,y)和左邻域像素点值相等时,说明么修改其共同连通域标号

f(x,y)与左邻域像素点是连通的,那么f(x,y)的conimon(i)=common(nierge(x,y-1))。扫描图像时,⑴

像素点连通域标号merge(x,y)与merge(xT,y)标说明出现新的孤点,共同连通域标号common新增元

号一样。素标记该元素。(ii)说明元素f(x,y)与它的左邻域

⑵当像素点f(x,y)!f(xT,y)且f(x,y)=f(x,y)和上邻域f(x,y-1)连通,且连通域标号merge(x-1,y)

yT)时,表示f(x,y)与上邻域连通,但与左邻域不与merge(x,y-1)不一致,即左邻域和上邻域冲突,需

连通,那么f(x,y)的像素点连通域标号merge(x,y)要合并,因此要对共同连通域标号common中所有的

与merge(x,yT)标号相等。值等于merge(x-1,y)的元素改为merge(x,y-l)o经合

(3)当像素点f(x,y)=f(x,yT)且f(x,并处理后,merge的元素仍是临时连通域标号,有大

y)=f(x-l,y)时,那么f(x,y)与上邻域、左邻域在量的冲突标号,但图像的每个像素点f(x,y)可通过

同一个连通域内,那么需考虑:common(merge(x,y)),得到共同连通域标号,且是唯

(i)假设merge(x,y-l)=merge(x-l,y),那么说一的。此时,common的值是断续的,对后续的处理很

明fix,y)的上邻域和左邻域连通域标号一致,仅需不利,需要对common及merge的标号调整。

merge(x,y)=merge(x,y-l)即可。调整方法如下:

定义临时一维数组temp及变量nlndex,temp大小

(ii)假设merge(x,y-l)!merge(x-l,y),那么说明f(x,y)

与common一样。lemp元素初始化为-I,nlndex初始

的上邻域和左邻域连通域标号冲突,,然后mcrgc(x,

化为0。扫描merge数组,对任一元素merge(x,y)作

y)=merge(x,y-1)。

如下操作:

(4)假设f(x,y)!f(x-l,y)且f(x,y)!f(x,y-l)时,说明像素⑴假设lemp(common(merge(x,y)))<0,即该共同

点f(x,y)属于新的连通域,因此连通域标号自动加1,连通域标号首次扫描到,那么nlndcx=nlndcx+1;

即Newlabel=Newlabel+1,并将新的连通域标号(emp(common(merge(x,y)))=nlndex;merge(x,

Ncwlabcl赋予mcrgc(x,y)。y)=temp(common(merge(x,y)));

3.4等价标号处理(ii)假设temp(common(merge(x,y)))0,即该共同

连域已出现过,那么merge(x,

本算法的实现难点主要是等价标号的处理和共

y)=tcmp(common(mcrge(x,y)));

同连通域的标记。如上节所述,在算法的第•阶段,

上述调整主要完成合并图像等价连通域即用唯

扫描图像后获得临时连通域标号merge.其中会出现

一的标号标记连通域,井按出现的先后次序,标记连

大量的等价标号即标号冲突,用一维数组记录各临

通域。操作⑴表示:该等价标号所指的共同连通域标

时连通域标号的共同连通域标号,数组的下标为临

号首次H现,因此标号自动加1。操作(ii)表示:该等

时连通域标号,其值为共同连通域标号。当遇到标号

价标号所指的共同连通域标号至少已出现过1次,因

冲突时,要合并等价连通域标号,即对共同连通域数

此只需temp的已分配的标号直接赋给merge(x,y)即

组扫描一遍,将等价标号的共同连通域标号标记成

可。至此,对于每个像素点f(x,y),均可在merge的

一致。

一样位置检索到连通域标号merge(x,y)<,

设一维数组common,其下标为临时连通域标号,

图像的第一行像素点没有上邻域,第一列没有左

即merge(x,y)的值,common元素的值表示某个共同

邻域,需特殊处理。如下所示:

连通域标号.common(merge(x,y))表示像素点f(x,y)

⑴二值图像左上角的像素f(0,0),由于是第1个

的共同连通域标号。

扫描的像素,无需考虑相邻点连通性。

扫描二值图像时,common按如下方法处理:

(ii)二值图像第1行(最上行)的像素f(x,0),只需

(i)当f(x,y)!f(x,y-1)且f(x,y)!f(x-l,y)时,说明像

考虑左相邻像素的连通性。

素点f(x,y)属于新的连通,那么共同连通域标号

(iii)二值图像第I列(最左列)的像素f(0,y),只需

common新增一个元素,即common(merge(x,

考虑上相邻像素的连通性。

y))=inerge(x,y)。

除此之外的所有像素都要考虑左、上2个相邻像

(ii)扫描图像时,当出现f(x,y)=f(x,y-1)且f(x,

素的连通性来确定自己的连通性。

y)=f(x-l,y)和merge(x-l,y)!merge(x,y-1)时,那么说

明遇到标号冲突,需扫描common数组-遍,对于任4实验结果与分析

利用本文提出的算法对20幅书刊封面图像二值化,

形态处理.,文档提取。实验效果图如下列图所示:

不说话就雨R

皿嚼耳I的企可采I

击d图23实验效果图(4)

从实验效果图分析,文档提取效果较好,根本能提

图20实验效果图(1)取出文档区域,但有些区域产生误检。主要原因是产

生误检的区域与文字区域的像素值相近,在图像处

理过程口误当作文字区域来处理。本实验方法中通过

提取的方框长、宽限制可以略去很大一局部误检区

域。

本实验口的20幅中,有15幅图像文字提取效果较好、

能够提取出大局部的文字区域;而剩下的5幅图像提

取效果略差。

4结论

本实验在详细分析图像的预处理知识、文本区域

定位方法、文字识别方法的根底上,给出了识别的三

个主要步骤,分别为图像二值化,形态学处理,连通

域标记的文本区域定位。

图21实验效果图(2)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论