已阅读5页,还剩56页未读, 继续免费阅读
(控制理论与控制工程专业论文)视频图像中文本定位与提取的方法研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
硕士论文 视频图像中文本定位与提取方法的研究 摘要 文本是视频图像中重要的内容信息。视频图像中文本的检测和识别在视频分析过程 中起到很大的作用。文本可以作为视频图像的内容标识和索引,例如在视频监控中出现 的车牌号码,如同身份证般具有唯一性,可用于视频资料的检索以确定目标车辆。所以 对视频图像中文本的检测和分析是视频分析的重要内容。可见,如何从背景复杂的视频 图像中快速而准确地定位和提取文本,一直是这些年来国际上热门的研究课题。 针对图形文本的角点信息较为丰富的特点,本文给出了一种基于角点检测和形态学 的文本定位方法。我们注意到,视频图像中的文本一般都与背景有着颜色与亮度的强度 对比,这使得文本区域包含了丰富的角点信息。利用这个特征,可先检测出图像的角点 信息,接着就能通过形态学的方法定位出候选文本区域。实验表明,该方法可以提取出 大部分的文本区域,特别是对于背景简单的图像或视频帧,具有较高的准确性。 随后,本文讨论了阈值分割技术,并成功实现了基于小波变换跟支持向量机、小波 变换跟k 均值聚类两种文本分割方法,实验结果显示:在复杂背景下,即便是对于字体、 大小和位置都不确定的文本信息,该方法仍然具有良好的分割效果。文章在最后还简要 地介绍了字符识别原理以及几种常用的字符识别方法。 关键词:角点检测,数学形态学,阈值分割,小波变换,支持向量机,k 均值聚类 a b s t r a c t 硕士论文 a b s t r a c t t e x ti s p a r to ft h ei m p o r t a n ti n f o r m a t i o ni nv i d e o sa n di m a g e s t e x td e t r e e t i o na n d r e c o g n i t i o ni nv i d e o sa n di m a g e sc a l lh e l pal o ti nv i d e oe o n t e ma n a l y s i sa n du n d e r s t a n d i n g , s i n c et e x tc a np r o v i d ec o n c i s ea n dd i r e c td e s c r i p t i o no ft h es t o r i e sp r e s e n t e di nt h ev i d e o sa n d i m a g e s s u c h 觞t h eu n i q u el i c e n s ep l a t en u m b e rs h o w e di nt h es u r v e i l l a n c ev i d e oc a nb e u s e df o rs e a r c h i n gt h et a r g e tv e h i c l ei fw ec a ng e tt h er e c o g n i z e dt e x t s ot e x td e t e c t i o na n d a n a l y s i si si m p o r t a n ti nv i d e oa n a l y s i s t h u s ,h o wt o l o c a l i z ea n de x t r a c tf r o mv i d e oa n d i m a g ed a t au n d e rc o m p l e x - b a c k g r o u n d i so n eo ft h e h o tt o p i c s i nt h i sp a p e r , a na l g o r i t h mf o rf i n d i n gt e x ti ni m a g e sa n dv i d e of r a m e si sp r o p o s e db a s e d o nt h et e x t u r ec h a r a c t e ro ft e x tt h a ti sc a l l e dt h ec o m e r so ft h et e x t ,e s p e c i a l l yg r a p h i ct e x t ,a r e r i c ho fc o m e r s w en o t i c et h a tt h e r ei ss t r o n gc o l o ra n db r i g h t n e s sc o n t r a s tb e t w e e nt h et e x t a r e aa n di t sb a c k g r o u n d ,w h e r et h e r si sr i c hi n f o r m a t i o no fc o m e r s s o ,c o l t i e i sd e t e c t i o ni s f i r s tu s e di ni m a g e sa n dv i d e of r a m e s ,g e t t i n gt h ec o m e rm a p ,t h ew ec a ng e tt h ec a n d i d a t e t e x tr e g i o nb yu s i n gm a t h e m a t i cm o r p h o l o g y e x p e r i m e n t a lr e s u l t ss h o wt h a tt h ea l g o r i t h mi s a c c u r a t ea n ds p e n dl i t t l et i m ew h e nt h et e x tb a c k g r o u n di ss i m p l e t h e n ,t h i sp a p e rd i s c u s st h em e t h o d so ft h r e s h o l ds e g m e n t a t i o na n dr e a l i z et w oc l a s s i c m e t h o d so ft e x ts e g m e n t a t i o nw h i c ha r eb a s e do nw a v e l e tt r a n s f o r n li nc o m b i n a t i o nw i m s u p p o r tv e c t o rm a c h i n ea n dw a v e l e tt r a n s f o r i l l i nc o m b i n a t i o nw i t hk - m e a n sc l u s t e r i n g e x p e r i m e n t a lr e s u l t ss h o wt h a tb o t ha l g o r i t h m s a r es u c c e e dw h e nt h eb a c k g r o u n di s c o m p l i c a t e d ,e v e ni ft h et e x ti ni m a g e sh a sd i f f e r e n ts t y l e ,s i z eo rp o s i t i o n i nt h ee n do ft h i s p a p e r , w es i m p l yd os o m e r e s e a r c ha b o u tt h et h e o r yo fc h a r a c h e rr e c o g n i t i o n k e yw o r d s :c o m e rd e t e c t i o n ,m a t h e m a t i cm o r p h o l o g y , t h r e s h o l ds e g e m e n t a t i o n , w a v e l e tt r a n s f o r m ,s v m ,k - m e a n sc l u s t e r i n g h 声明 本学位论文是我在导师的指导下取得的研究成果,尽我所知,在本 学位论文中,除了加以标注和致谢的部分外,不包含其他人已经发表或 公布过的研究成果,也不包含我为获得任何教育机构的学位或学历而使 用过的材料。与我一同工作的同事对本学位论文做出的贡献均已在论文 中作了明确的说明。 研究生签名:李蒸焦难一矽夕声舌月夕日 学位论文使用授权声明 南京理工大学有权保存本学位论文的电子和纸质文档,可以借阅或 上网公布本学位论文的部分或全部内容,可以向有关部门或机构送交并 授权其保存、借阅或上网公布本学位论文的部分或全部内容。对于保密 论文,按保密的有关规定和程序处理。 研究生签名: 矽7 年彳膨口日 硕士论文 视频图像中文本定位与提取方法的研究 1 绪论 1 1 课题的研究意义和目的 随着信息数字化技术发展以及多媒体技术的广泛应用,越来越多的信息以多媒体的 方式数字化,我们每天都会获得大量的数字视频与图像。如果对于这些视频图像没有一 种有效地描述和表示方法,它们将被淹没在数据库中,无法被检索。这些海量的数字信 息中蕴藏着财富、机遇,当然还有便是它能给人们带来休闲娱乐,因此如何从中获取我 们所感兴趣的、有用的信息已成为当今的一个研究热点。 我们知道视频图像中的文本信息对检索和浏览有十分重要的意义。在视频图像中, 文本信息包含了丰富的语义信息,它能在一定程度上反映出该图像的内容。例如,在新 闻视频中出现的标题字幕包含有丰富的信息( 事件发生的时间、地点、人物等简要描述 等) ,利用这些出现的文字信息作为索引可以快速而准确地定位出该段新闻视频;各类 体育比赛如足球比赛中,通过检测到进球后的比分,便会有助于足球比赛精彩镜头的检 测;电视广告中的文本则能够显示产品名称、公司名称等重要信息;车辆牌照的提取、 识别技术可以广泛应用于智能交通领域。这些对于人们理解图像内容,检索有关图像都 有着非常重要的作用。 大量的文献资料显示,目前视频图像中的文字提取技术主要存在以下困难: ( 1 ) 图像,特别是视频图像的分辨率较低,噪声种类多,图像质量相对较差; ( 2 ) 文本,特别是场景文本所处的背景比较复杂; ( 3 ) 字符的尺寸、颜色、字体、排列方式等复杂多变; ( 4 ) 在视频图像中,处于运动状态文本,其背景会显得更为复杂。 因此,若能够找到解决这些问题的方法,并能构造出相应的文本定位和提取的模型, 对于基于内容的视频检索技术的发展,具有重要的实用价值和理论意义。 1 2 国内外研究现状 对于视屏图像中蕴藏的丰富的文本信息,诸多国内外研究单位对此都展开了研究。 国外的如:卡耐基梅隆大学( c m u ) 计算机系【l 】 2 】、瑞典联邦工学院【3 】、i n t e l 研究中 心【4 1 、哥伦比亚大学多媒体研究中心【5 】【6 1 、韩国s o o n g s i l 大学信息工程系【7 1 、韩国y o n s e i 大学计算机系【8 】、荷兰g r o n i n g e n 大学【9 】、德国s i e g e n 大学【1 0 1 、英国利物浦大学计算机 系【1 1 1 、密西根大学的a n i l k j a i n 1 2 1 、微软亚洲研究院【1 3 】等。 国内的研究机构有:香港中文大学信息工程系【1 4 】、浙江大学【1 5 】、中国科学院计算技 术研究所【1 6 】、诺基亚研中心视觉通讯实验室【1 7 1 、清华大学【1 8 】、中国科学院自动化研究 1 绪论硕士论文 所【1 9 1 、南京大学【2 0 1 等。 针对不同类型的字幕,研究人员们的成果有目共睹。卡耐基梅隆大学的s a t o 1 】检测 新闻视频中的叠加文字用于新闻视频结构化分析。s a t o 提出了v i d e oo c r 的概念,通过 图像梯度特征和视频时域特征检测并且提取视频帧中的文字,然后使用o c r 进行识别。 c h e n 2 基于c a n n y 边缘检测文字,也形成了完整的检测、分割和识别系统。t a n g 1 4 】等人 主要使用时域内的梯度差检测视频帧中的文字,其主要研究目的是用于新闻视频的结构 化分析和内容分析。h l t e | 的“锄h 缸【4 】基于神经网络和图像梯度特征提出了一个检测并 且分割文字和视频帧中文字的系统。z h a n g 5 】主要研究基于b a y s i a n 网络识别视频中质量 很差的文字。韩国s o o n g s i l 大学的k i m 7 】基于支持向量机和c a m s h i f l 算法检测视频帧中 的文字。微软亚洲研究院h u a 1 3 】提出了一个视频帧文字检测的公共测视集合和测试方 法。浙江大学的张引、潘云鹤等【2 1 】提出了一个检测视频帧中文字的彩色边缘算子,其算 子对于彩色视频帧中的文字行定位效果很好。中科院自动化所y a n 1 9 】基于小波特征和神 经网络分类器( b p n n ) 检测视频帧中的文字用于视频内容分析。中科院计算所的王伟强 研究了新闻视频叠加文字检测系统,主要基于颜色信息检测和分割新闻视频中的文字。 以上的研究对象均为后期叠加上的文本信息 而对于自然场景中的文本检测成果也颇丰。耐基梅隆大学计算机系的g a oj i a n g , y a n gj i e 等研究人员对自然场景文字定位、分割、识别、形变恢复等问题都先后进行了 深入的研究。他们前期的研究面对各种自然场景文字,目前主要集中于交通指示牌等【2 2 1 。 哥伦比亚大学的z h a n g 卅研究了基于m a r k o vr a n d o mf i d d ( m r f ) 和b e l i e f p r o p a g a t i o n 的方 法检测3 维场景的文字,主要是利用了m r f 解决局部和整体之间的空间关系。a n i l k j a i n 是较早研究文字检测的人员,他主要是基于颜色和空间布局检测电子文档、扫描报纸图 像中的文字。e z a k i 9 】基于连接成份进行自然场景下的文字检测,并且构建了一个面向外 国人的文字识别系统。o l l a v a t a t l o 】主要是使用无监督的方法对于小波分解的高频系数进 行来进行自然场景中的文字区域定位。这种方法考虑了同一幅图片中的文字特性往往很 相近,所以使用了无监督的方法进行文字像素的聚类和检测,在未来的研究中具有借鉴 意义。在国内,清华大学丁晓青教授和其研究生进行了场景文字检测的深入研究,而且 他们在字符识别方面的研究也很领先。在她们的方法中【1 8 】,首先使用c - m e a n 聚类分类 图像像素,然后定义了定位“c h a r a c t e rs l i c e 的规则定位文字行。在其后来的研究中, 还使用了边缘特征和颜色连接成份分析进行文字定位。南京大学的j i n 2 0 】基于小波域特 征和图像“假 运动进行文档图像中的文字行定位,其通过“假运动将文字区域进行 连接的方法具有新颖性。 另外,许多针对汽车牌照、街道门牌、特殊字符的检测和识别方面的研究也都有着 丰富的成果。因为涉及的研究目的不同、方法繁多,在此不进行列举。 在过去的研究中,研究者们提出了许多文字检测的算法,这些算法也分别使用了文 2 g 论文视频圈像中文幸定位与提取方法舶研究 本信息的不同属性,并且提出、使用了各种各样的特征,所以在后续章节中我们还会从 特征上将相关的方法进行分类综述。 1 3 文本的分类 通过归纳研究现状可以发现,视频图像中文本基本可分为两类:后期叠加的文本通 常称为图形文本( o r a p h i ct e x t ) ,而自然场景中的文本即称为场景文本( s c e n et e x t ) ,分别 如图1 1 和图1 2 。 场景文本是指在场景内出现并由记录设备记录下来的文本,包括汽车照片中的牌照 字符,视频画面中的广告牌、商店的招牌和运动员球衣上的号码等,这些文字对诸如机 器人视觉,视频监控等方面应用非常有价值。但是由于光照不均匀、拍摄角度、曝光不 足,文本载体被污染等原因,使得这些文本字符在形态、大小、角度、光照上有很多不 同之处,所以这些文本很难被提取和识别。 图形文本标题文本不属于原始视频,而是在对视频的后处理中有目的的叠加上去 的,以便对当前视频内容进行解释或者补充说明。例如,在电影或电视剧的片头、片尾 中,常常会有导演、演员、赞助商等文本信息,在片中会有人物的对白;在新闻类节目 中,会有对当前事件的文本性的概述,有的下方还会有滚动的当日新闻;在体育类节目 中,会通过文本方式来给观众播报比分或者球员的简介以及数据统计等:在广告类视频 中,则会通过文本来显示产品的名称、厂家以及其他重要的产品信息。 图1 1 图形文本圈1 2 场景文本 通过以上分析可以看出,场景文本相对于图形文本一般是难以检测和识别的,而且 对场景内容的理解意义不大,如果无关的场景文本用于了视频检索和索引,甚至有可能 会起到误导的作用,因此本文的研究主要针对的是图形文本,而不是场景文本。 1 4 文本的特征 通常视频图像中的文本包含非常丰富的特征,而且这些复杂细致的特征对于文本的 1 绪论硕士论文 定位与提取有着关键作用。总结起来,主要具有以下几个主要特征: ( 1 ) 排列特征 通常情况下,文字大多为正向的水平或垂直排列,而且分布比较集中,即一个文本 区域,一般包含多个字符,例如电视新闻标题和字幕对白。在实际中,也会有少数文本 是倾斜排列的,如扫描图像或图像中的场景文本的排列通常都有一个倾斜角度,在字符 识别前需要进行倾斜校正。 ( 2 ) 颜色和亮度特征 在图像或视频帧中,文本分布在复杂的背景之上,通常文本与背景具有不同的颜色 和亮度。一幅图像中可能含有各种不同颜色或亮度的文本,但大多数同一文本中的各个 字符具有相似的颜色或亮度,有些文本的颜色会沿着某一方向逐渐变化。 ( 3 ) 尺寸特征 图像与视频中图形文本的字符具有各种不同的尺寸,不过,图像和视频中文本的自 。动提取一般只要求提取人的眼睛能够识别的字符,因此文本字符通常有一个最小尺寸。 对于静态图像文本中的字符,当字符的高度小于8 介像素时,或当字符的宽度小于1 6 个像素时,人的眼睛己经难以识别;对于视频中的文本,要求人的眼睛在有限的时间内, 在一定对距离内能够识别,因此,字符的高和宽通常大于1 6 个像素。 ( 4 ) 字符间距特征 对于字幕或新闻标题等图形文本,字符之间一般都具有一定的间距,也就是说字符 没有粘连现象,相邻字符间的间距和字符的宽度成一定的比例关系。对于场景文本,在 各种噪声的影响下,可能会产生字符粘连的现象。 ( 5 ) 边缘特征 由于图形文本和背景通常具有较明显的对比度,而且文本通常由不少的笔画构成, 因此文字区域的边缘信息一般都比较丰富,通过检测边缘方法可以提高文本提取的性 能。 ( 6 ) 纹理特征 由多个字符构成的文本具有一种独特的纹理,文本区域内亮度的方差比较大。 ( 7 ) 运动特征 在视频中,字幕或新闻标题等图形文本在视频序列中的位置可能会发生变化,但是 它们的变化方式非常简单,或是水平运动或是垂直运动。在运动的过程中,文本一般都 保持原有的尺寸、字体、排列方向等特性。 1 5 文本的提取流程 视频图像中文本提取与识别的步骤一般如下: ( 1 ) 文本区域的检n - 检测到候选文本的具体位置,尽量减少虚假文本区域的数目; 4 硕士论文 视频图像中文本定位与提取方法的研究 ( 2 ) 文本区域的定位:根据检测结果,定位出候选文本区域。如一个典型的文本区 域可以标示为一个水平或垂直矩形区域; ( 3 ) 文本字符的提取:对文本区域的图像进行增强,抑制背景,然后进行二值化, 分割出文本字符,得到较为干净清晰的二值化文本图像,为最后的文本识别做好准备; ( 4 ) 文本字符的识别:采用目前较为成熟的印刷体字符识别技术,对二值化后的文 本图像进行文本识别,得到文本的字符序列。 图1 3 给出了文本提取步骤的流程图: 圈一 文文 本 本 检定 测位 文 本 分 割 和 增 强 o o 刃 字 符 识 别 图1 3 文本提取系统 1 6 论文的研究内容及组织安排 字 幕 文 本 视频图像中的文本提取是典型的图像分割问题,目前还面临着不少的困难:例如视 频图像的分辨率低,图像质量较差;视频文本所处的背景复杂;字符的尺寸、字体、颜 色;字符的角度、形态、光照上变化非常大。这些问题都会导致虚假文本区域,以及字 符分割的不完整等问题。因而如何准确地定位出文本区域,将是本文思考和解决的重点 问题。 本文主要针对视频图像中的图形文本定位及分割提取算法做了一些研究。对一些经 典的算法综合归类并分析其优点和不足,随后给出了一种基于角点检测和形态学的算法 来进行文本检测和定位的方法,该方法首先获取文本与背景形成颜色与亮度的对比后所 能产生的角点信息,加以形态学上的处理从而定位出候选文本区域。该方法可以定位出 大部分的文本区域,特别是对于背景简单的图像或视频帧,具有较高的准确性。 为使定位方法更能适用于复杂背景或复杂情况,本文进一步使用基于小波变换跟支 持向量机分类的方法对文本区域和非文本区域进行分类。对于待测图像,首先进行多尺 度的两级小波分解,并分别重构两级分解得到的高频细节;然后将所有重构图像分别切 分成大小为n x n 的若干子块,计算每一子块的统计特征,形成各子块的特征向量,然 后对每一子块应用已训练好的s v m 分类器进行判决分类,把每个子块分别标注为字幕 和非字幕两类,最后通过候选字幕区域合并处理和连通性分析,实现对视频的字幕检测、 定位。 5 1 绪论硕士论文 本文紧随其后地将k 均值聚类跟小波变换相结合,对文本与非文本区域进行分类。 步骤类似小波变换跟支持向量机的方法。实验证实这两种基于小波分解的方法一样能有 效地应对背景复杂,字体、大小和位置都不确定的情况,分割效果良好。 论文内容共分为六章,各章节内容安排如下: 第一章:绪论。着重地介绍了论文的研究背景,国内外研究现状,图像和视频中文 本的类型和特征,并给出了论文的研究内容及结构安排。 第二章:文本定位与提取方法综述。先简要地介绍了文本提取与识别系统结构和原 理,然后对目前存在的一些文本定位和提取算法进行分类综述和比较。 第三章:基于角点检测和形态学的文本定位方法。通常情况下,图像和视频帧中的 文本,在颜色或亮度方面与背景有着显著的强度对比,因此文本区域将会包含丰富的角 点信息。对于中文图形文本,可根据图像的角点信息来确定候选文本区域。首先检测图 像的角点从而得到图像的角点分布图;然后对角点分布图进行滤波融合;最后利用形态 学运算将角点聚合形成文本区域,并根据规则进行区域验证。 第四章:文本图像分割。从文本分割目的着手,讨论了经典阈值分割方法的原理和 特点,并成功实现了基于小波变换跟支持向量机、小波变换跟k 均值聚类两种文本分割 方法,两种方法都需要先通过对视频图像帧进行二级小波分解,从而形成6 维特征向量 作为各子块特征;然后对得到的子块经过两种方法各自不同的处理,成功将图像帧分为 字幕跟非字幕域;最后辅以形态学方面的处理便得到分割结果。 第五章:字符识别。简单分析了字符识别的原理,并介绍了三种常用的字符识别方 法。 第六章:总结与展望。 6 硕士论文视频图像中文本定位与提取方法的研究 2 相关方法综述 2 1 引言 视频图像中的文字、标题以及符号反映了图像内容方面的重要信息。但是要将这些 文本内容从视频中提取出来,首先面临的一个问题就是确定相应的文本信息在图像中的 位置,即文本的定位。所谓文本定位是指在实际拍摄的图像中确定文本区域的位置,以 便提取分割出文本区域图像。文本的快速准确定位是字符识别系统中非常关键的一步, 是典型的图像分割问题。 如何准确、可靠地检测与定位图像中的文本区域是一个很困难的课题。首先在一幅 图像中,不同位置的文本之间字符尺寸的变化范围可能很大;其次,不同位置文本之间 的字体可能不同;而且在视频内容的不同图像帧中,同一文本的位置可能是不断变化的 以及文本的排列方向等各种情况。因此要实现一个理想的、能够检测所有图像背景下、 以任何形式存在的文本区域的定位方法,在目前还很困难。 在本章中我们主要介绍了目前存在视频图像的文本定位和提取算法,并进行分类分 析和讨论。 2 2 方法的分类综述 通过对相关文献的归纳总结可以看出,对于文字的定位和提取,目前主要存在的方 法总的来说有以下五种。 2 2 1 基于边缘的方法 基于边缘的方法是通过寻找垂直边缘来检测文字。由于文本区域一般具有较多的笔 画,而且文本的灰度或颜色通常和背景不同,因此文本区域通常具有丰富的边缘特性。 而且边缘提取算法一般都具有简单而且速度快的特点,因此很多视频文本的分割算法都 是基于边缘特性的。但是这类算法大多是在灰度图上提取边缘,而没有利用色彩信息。 而有时候文本的颜色虽然和背景完全不同,但是灰度值却有可能很接近,这种情况下, 基于灰度边缘的算法效果就不好了。 c h e n 等【3 】提出算法通过边缘分析提取候选文字区域,再利用基线信息将其分割成水 平文本行,最后利用s v m 分类器在基于边缘的距离特征空间中进行文本行验证。 a g n i h o t r i 等【2 3 】提出算法利用中值滤波器对图像进行平滑处理,除去噪声、杂质等, 然后利用边缘检测算子进行边缘检测,并设计边缘滤波器,去除非文本边缘,最后利用 连通域分析确定出文本区域。 c a i 等【2 4 】利用文本和背景具有很强对比度的特性,对图像进行彩色边缘提取,分析 7 2 相关方法综述 硕士论文 图像中文字的边缘特征,分别用全局阈值和动态阈值对边缘图像进行阈值分割,进而使 用两种卷积模板进行文字增强,最后用投影法检测出文本块的准确位置。 l i u 等【2 5 】利用文本的笔划宽度均匀的特点,设计出一种笔划滤波器,在此基础上, 结合连通域分析或者支持向量机进行文本块的定位和验证。 g a o 等【2 6 】提出算法,首先对图像进行多尺度边缘检测,利用尺寸、位置、边缘的上 升或下降等属性对边缘连通域进行聚类,完成文本块的粗检测,然后为了克服字符颜色 渐变的影响,采用高斯混合模型对候选文本块内的颜色分布进行建模,用e m ( 期望最 大化) 算法来估计模型参数,进行文本抽取,最后,对抽取结果进行版面分析,划分文 本块和找回漏检的字符。 基于边缘的文字检测方法计算量小,效果明显,但是算法容易受到其他因素的制约, 如:当字符尺寸较大时边缘稀疏,较小时边缘密集;背景中某些规则排列的物体容易被 误检为文本块;如果背景轮廓和字符粘连,也容易得到错误结果。这就需要结合其它的 信息来扩大检测范围并对检测结果进行验证。 2 2 2 基于纹理的方法 纹理是图像中一个重要的特征。纹理是图像所具有的局部不规则而宏观有规律的特 性。纹理特征包括对比度、方向性和粗糙度等。图像和视频帧中的文字也可以看成是一 种特殊的纹理。基于纹理的方法是利用纹理特征去决定一个像素点或像素块是否属于文 字。由于字符通常由许多较细笔划组成,因此存在笔划的区域通常也是全图纹理较丰富 的区域,实现对纹理的寻找即可以寻找到字符的区域。 王建等【2 7 】对j p e g 压缩格式的图像提出一种算法,在不完全解码的情况下,直接在 d c t 域中利用图像块的纹理能量特征,先初步定位文本区域,然后利用文本的连通性和 几何特性精确地定位出文本区域。 w u 等【2 8 】利用高斯滤波器对图像进行纹理分割,然后自下而上的进行连通域分析来 提取出文字。 m a o 等【2 9 】对原始图像进行多尺度小波分解,进而抽取各个像素的局部能量变化特 征,进行二值化和连通域分析,得到文本块的检测结果。 l i 等【3 0 1 利用固定尺寸的窗口在原始图像中滑动,计算每个窗口内的灰度均值、二阶 中心矩、三阶中心矩等统计量作为特征,利用神经网络对图像块进行筛选,以通过筛选 的图像块为基础,构建文本区域。 g l l a v a t a 等【l o 】提出算法将原始图像进行小波变换,在三个高频子图上分别进行直方 图统计,提取方差作为特征,然后利用k 均值算法将图像分为文字和非文字区域。由于 聚类是一种无监督的方法,当图像中不包含文字时,强行聚成两类会产生错误,为此, 在检测前首先将图像扩展一块,人工加上一些文字,以避免聚类错误。 8 硕士论文视频图像中文本定位与提取方法的研究 基于纹理的文字检测方法可有效地检测出文字所在区域,但也会检出具有类似纹理 的背景区域,因此需要结合其它特征进行文本验证。 2 2 3 基于区域的方法 基于区域的方法是把字符作为满足特定启发式规则的单色区域来检测。假设每个字 符的像素都有相似的颜色,那么,用颜色聚类及图像分割的方法或者连通区分析技术即 可把字符从背景中分割出来:然后再使用一些简单的启发式规则,如区域的尺寸和长宽 比或者基线等来对分割得到的区域进行进一步筛选即可得到字符。 汪孔桥等【3 l 】提出算法,首先用颜色聚类对图像进行分割,以颜色为单位形成多个图 层,在每个图层中进行连通域标定,利用位置信息对连通域进行组合,构建文本块,最 后对各文本块进行验证,去掉虚警区域。 j a i n 掣3 2 】引入量化颜色空间,对图像进行颜色聚类,把图像分解成几块,然后对于 每块子图利用连通区域的方法确定其是否为文字区域,最后将检测到的文字区域投影到 原图上,得到文本检测结果。 t h i u o u 等【3 3 】为了克服颜色过渡对文本定位的影响,利用欧氏距离和余弦相似度 分别对原始图像做k 均值聚类( k = 3 ) ,然后利用l o g 。g a b o r 滤波器在各个子空间进行滤 波,并根据滤波结果选取最合适的子空间进行文字检测。 p e i 等【3 5 】利用自组织映射神经网络进行多次颜色聚类( 采用不同的聚类数目) ,每次 聚类后进行文字检测,然后多次检测得到的结果进行投票,从而得到最终的检测结果。 s t r o u t h o p o u l o s 3 6 】和p a p a m a r k o s 3 7 1 等人将颜色和局部纹理特征结合起来,自上而下 的逐级进行聚类,并结合连通域分析定位文字区域。 基于区域的方法主要通过颜色聚类来实现,其主要难点在于无法预知文字和背景的 颜色,因而也就难以确定颜色子图的个数,聚类数过多或者过少都会影响检测性能,同 时,图像中存在的颜色过渡现象,影响聚类结果,进而增加文本定位的难度。 2 2 4 基于学习的方法 对视频流字幕进行定位面临很多困难,如:视频流字幕的大小尺寸经常发生变化, 视频流字幕字体呈现多样性,视频字幕和视频背景颜色都是多变的,字幕的位置进行左 右平移或上下垂直移动等。由此可见,视频字幕的定位不能只考虑字幕本身固有特征, 还应该考虑利用一种学习机制去处理这些多变因素。事实上,视频字幕定位就是构造一 个学习机,使之能实现两类模式分类,即在视频中对字幕与非字幕进行分类,考虑到特 征提取因素,考虑分类机制和如何保证不产生过学习问题,取得最好分类效果。 l ih u i p i n g l 3 0 】等使用前向反馈的神经网络来定位视频中的文字,即将单帧的高频小 波系数作为网络的输入来训练神经网络监视视频中是否有文字字幕出现,如果没有文字 出现,那么每次就继续处理一定数量的帧:如果有,就使用块匹配去追踪简单背景下的 o 2 相关方法综述 硕士论文 文字。该方法只适用于视频,并且是只能在块水平检测文字,一旦文字行不是均匀运动 的,则该方法将产生一些问题。 庄越挺【3 8 】中提出了一种使用s v m 机制来自动定位提取视频字幕的方案。即首先对 每幅视频图像按照m x n 大小切分成若干个图像子块,再把每个子块分别加入人工训练 标注为字幕和非字幕两类,并通过提取图像的子块特征向量来训练s v m 分类器,随后 应用训练好的s v m 分类器对其进行判断。最后通过后期处理进行去噪与合成,就能得 到字幕提取得结果。 基于学习的方法一般分七步:( 1 ) 产生样本集;( 2 ) 特征选取;( 3 ) 学习机结构的选取; ( 4 ) 对学习机进行训练;( 5 ) 使用学习机对图像进行纹理分割;( 6 ) 多尺度融合;( 7 ) 文本区 域验证。基于学习的方法可以提取不同分辨率图像中不同尺寸、不同语言和不同字体的 文本,具有通用性。但它有一个缺点,就是用分割结果受训练样本集与测试样本集的相 似程度的影响较大。 2 2 5 综合性方法 在文本定位中,很难找到单一的具有很强鉴别能力的方法,因此,将两种或多种方 法融合后经常会有更好的实验结果。 k i m 等人【8 】分别利用颜色聚类、灰度边缘和彩色边缘进行文本检测,将三者的检测 结果进行合并,其中共同的部分予以保留,剩余的部分利用s v m 分类器进行验证,完 成文本定位。 e z a k i 等人【9 】提出算法,对小字体采用了基于数学形态学的检测方法,对大字体则 采用了基于边缘和多颜色通道的检测方法。 c h c n 等人【3 9 吲入了机器学习中的a d a b o o s t 方法,通过集成学习来选取最好的一组 特征,该方法在i c d a r 2 0 0 5 的竞赛中获得了第二名的好成绩。文献【4 0 和 4 1 】也采用了 类似的方法。 t e k i n a l p 4 2 】等人综合利用了纹理、对比度和颜色等多种信息来进行文本检测,并使 用g a b o r 滤波器对每个子窗口进行纹理分类,使用高斯函数求各像素的梯度值并进行二 值化,将图像分成若干子空间进行判断,最后利用规则将三种结果综合起来定位文本块。 蔡波【4 3 】等人提出了一种综合考虑文字边缘、文字尺寸、文字区域像素密度及纹理的 视频文本定位算法,该算法能够对一般质量的视频图像进行有效的字幕区域提取。为了 避免对视频中的每一帧都进行字幕区域提取,他们还提出了文本事件检测算法,检测出 现文字的帧,减少不必要的计算量。 2 2 6 其他方法 除了上述几类方法外,研究者还提出了其它一些文字检测方法。 王蓉蓉等人【4 4 】【4 5 】利用多帧融合后的图像来进行文本检测,具体做法是:取3 0 帧连 1 0 硕士论文视频图像中文本定位与提取方法的研究 续的视频图像分别执行取大和取小计算,得到两幅融合图像,在多帧融合过程中,背景 像素的影响得到抑制,然后取边缘像素较少的图像,进行文本检测。 l u o 等人 4 6 1 1 4 7 提出对于图像中的每个像素,取其在连续若干帧中的灰度值组成一个 向量,对于这样得到的每一个向量,设计一个分类器判断其属于前景还是背景,然后在 分类结果的基础上寻找文本区域。 张佑生等人【4 8 】提出了一种基于子图像v c h ( 变异灰度直方图) 的文本定位方法, 通过对行分割子图像中的凸台和列分割子图像v c h r 中的凹谷进行识别与定位,在图像 中定位文本区域。 赵峰等人【4 9 】提出了一种基于分行特征的工程图纸文字提取方法,在机械图纸图像中 计算各个像素点及其邻域内的分形特征,对其进行直方图统计和门限处理,形成图像的 分割区域图,对区域图像的长方形区域进行检测,即可得到文本区域。该区域代表了原 图中候选文本块的位置,同时每个区域还提供了区域内的离散文本形成字符串的依据, 并包含了字符串的走向信息。该方法适用横向、竖向和斜向文本的定位。 2 3 小结 本章中,我们主要介绍了目前存在的图像和视频中的文字提取算法,并结合国内外 的研究情况,将现有方法进行归类分析,讨论了各类方法的基本原理、实现步骤和特点。 3 基子角点检测和形态学的文本检测 硕士论文 3 基于角点检测和形态学的文本定位 3 1 引言 边缘、轮廓和角点是对象的三个主要特征。角点包含于对象的边缘和轮廓中,能够 充分描述物体的特征,并且数量少,信息冗余小,对加快图像的处理速度具有重要意义。 本文中选择角点作为文本对象的特征点。 角点是图像的一种二维特征,它独立于对比度、字体颜色、字体尺寸等文本特征。 图像中的文字信息,特别是汉字,含有更多和更密的角点。通常情况下,图像和视频帧 中的文本,在颜色或亮度方面与背景有着显著的强度对比,因此文本区域将会包含丰富 的角点信息。因此对于中文图形文本,首先可根据图像中角点的信息来确定文本区域。 在本章中,我们将详细介绍几种经典的角点检测法:m o r a v e c 、h a r r i s 、s u s a n 和m i c , 并使用h a r r i s 角点检测方法,结合形态学运算对文本进行定位和提取。实验结果表明, 该算法可以提取出大部分的文本区域,特别是对背景本身包含的角点不是很丰富的图像 或视频帧,具有较高的准确性。 3 2 角点检测算法 目前,角点的定位方法可分成两类:一是首先对图像进行预处理分割出图像的边界, 然后再基于边界图像进行角点分析:二是直接根据图像的灰度信息进行角点的定位分 析。 基于图像中边界的角点定位方法认为,角点一般是位于线段之间的交叉点或结合 点。因此,这类算法发现角点一般需要三个阶段:首先,对图像进行预分割:其次,从 图像中抽取目标的边界:最后,使用相应的角点定位算法沿目标的边界对图像中目标的 角点进行定位。这类算法的特点是:在角点定位前需要复杂的预处理操作,从而增加了 算法的复杂性。因此,在众多的角点定位算法中,直接依据图像中像素的灰度值进行定 位的算法占有较大的比重。 基于图像像素灰度值的角点定位算法是利用数字图像中明显目标角点与其邻域内 像素间的灰度梯度特性来进行角点的判断。多年来出现了多种角点检测方法。k i t c h e n 和r o s e n f e l d 5 们,通过局部梯度大小乘以梯度方向的变化来判断角点:m o r a v e c 5 1 】发展了 “感兴趣的点 ( p o i n t so fi n t e r e s t ) 的思想,在一个局部窗口内计算各个方向的图像亮度 变化,找到在各个方向亮度变化很大的点作为角点。h a r r i s 和s t e p h e n s t a 5 2 】在m o r a v e e 方法上作了改进,形成h a r o s 角点检测方法。它与m o r a v e e 方法主要不同在于用一阶偏 导来描述亮度变化。s m i t h 和b r a d y 5 3 1 提出s u s a n ( s m a l lu n i v a l u es e g m e n ta s s i m i l a t i n g 1 2 硕士论文视频图像中文本定位与提取方法的研究 n u l e u s 最小核值相似区) 方法,它通过计算u s a n ( u n i v a l u es e g m e n ta s s i m i l a t i n gn u l e u s 单一值分割相似的核心) 区域来判断角点。最小亮度变化( m i n i m u mi n t e n s i t yc h a n g e ,m i c ) 是t r a i k 0 访c 【蚓等在u s a n 的关于角点的定义的基础上提出的一种快速角点检测算法。 这第二类算法的特点是无需对图像进行边界分割的预处理操作,降低了算法的复杂 性。本文采用的就是该类算法。下面将介绍几种常用的角点检测算法的原理和特点。 ( 1 ) m o r a v e 圮角点检测 m o r a v e c 算法的思路是计算像素在任意方向上的灰度变化,即使用一个移动窗口, 在像素点的不同方向上进行移动,计算窗口内的灰度变化的加权平均值,然后求取不同 方向中的最大值。在均匀灰度中,灰度的变化在各个方向都很小:在边缘处,最小值依 赖于边缘的方向:但是在角点处,每个方向上灰度的变化都较大,取不同方向中的最小 值定义为像素的灰度变化即e 值,如果它仍大于某一给定阈值,即可认为此像素为角点。 e 值的计算如下: 岛( x ,y ) = 呒,if ( u + x ,+ y ) 一f ( u ,v ) 1 2 ( 3 1 ) e ( x ,y ) = 砬h ( x ,y ) ( 3 2 ) 其中:易( z ,y ) 表示点( x ,y ) 的窗口邻域内的灰度变化值:w 表示滑动窗i e i :睨,表 示窗口内在点( “,v ) 处的权值,厂( ) 为像素点的灰度值:u 和v 分别为窗口滑动过程中相 对于像素点的坐标值。给定角点检测阈值疋,如果e ( x ,y ) 疋,则认为像素点( 石,y ) 是 角点。 鬣 ( 2 ) h a r r i s 角点检测 h a r r i s 算子是c h a r r i s 和m j s t e p h e n s 在m o r a v e c 算法的基础上提出的一种基于信 号的点特征提取算子,它利用泰勒级数展开方法将算法进行了扩展,同时引入了高斯平 滑因子,增强了抗干扰能力。其原理为:如果某一点向任一方向偏移都会引起灰度的很 大变化,这就说明该点是角点。 该算法的处理过程表示如下: m = g i 徊f 髯铃1 ( 3 3 ) 1 x yy r = d e t ( m ) - k 护2 ( m ) ,k = 0 0 4 0 0 6 ( 3 4 ) 其中,l 为x 方向的梯度,为y 方向的梯度,g s ) 为高斯模版,d e t 为矩阵的行 列式,t r 为矩阵直迹,k 为默认常数,通常情况下取0 0 4 ( h a r r i s 设定的最有参数) 。矩阵 r 中每一点的元素值对应于原图相应点的兴趣值。 h a r r i s 算子是一种有效的点特征提取算子,其优点有: a 计算简单:h a r r i s 算子中只用到灰度的一阶差分,操作简单; b 提取的点特征均匀而且合理:h a r r i s 算子对图像中的每个点都计算其兴趣值,然 后在邻域中选择最优点。在纹理信息丰富的区域,h a r r i s 算子可以提取出大量有用的特 1 3 3 基于角点检测和形态学的文奉检测硕士论文 征点,而在纹理信息少的区域,提取的特征点则较少; c 可定量的提取特征角点; d 即使存在有图像的旋转、灰度的变化、噪声影响和视点的变换,它也是最稳定的 一种点特征提取算法9 ”。 ( 3 ) s u s a n 角点检狈 1 9 9 7 年s m i t h 和b r a d y
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年CPA会计全真模拟试题(含答案解析)
- 介入手术室护理文书质控问题原因及整改措施
- 2026年一级建造师《建设工程经济》练习题及答案
- 2025年12345热线诉求研判人员业务考核题库完整
- 甜品店菜单更新与优化手册
- 电信服务规范与客户投诉处理手册
- 锂电池隔膜孔隙率调控拉伸工艺
- 2025-2026年考研物理力学与热学专项训练题库
- 2025-2026年医学考研外科学考点巩固习题
- 2025-2026年电子商务师考试备考习题
- 客服中心绩效考核标准手册
- 《艾索美拉唑》课件
- 【国网-变电运维】刀闸控制回路及五防(统一格式版本)
- 学校食堂餐饮服务投标方案(技术方案)
- 七年级数学下册专题04平方根与立方根压轴四大类型(原卷版+解析)
- ISO28000:2022供应链安全管理体系
- 肝内胆管癌护理查房课件
- 叙事护理外部见证人介绍课件
- 把未来点亮歌词打印版
- GB/T 30020-2023玻璃缺陷检测方法光弹扫描法
- 工艺变更履历表
评论
0/150
提交评论