已阅读5页,还剩86页未读, 继续免费阅读
(管理科学与工程专业论文)粗糙集在网络图片广告过滤中的应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
南开大学学位论文原创性声明 本人郑重声明:所呈交的学位论文,是本人在导师指导下,进行研究工作 所取得的成果。除文中已经注明引用的内容外,本学位论文的研究成果不包含 任何他人创作的、已公开发表或者没有公开发表的作品的内容。对本论文所涉 及的研究工作做出贡献的其他个人和集体,均已在文中以明确方式标明。本学 位论文原创性声明的法律责任由本人承担。 学位论文作者签名: 少尸年乡月多日 摘要 摘要 互联网的迅速发展和 】益普及,使其蕴含了海量的信息资源,已成为人们 获取信息的重要途径之一。然而,与此同时网络广告口益泛滥,产生了许多负 而影响。一方而,网络广告会干扰网民浏览或杏找网络信息,网民对网络广告 的反感逐年上升:另方面,网络广告会淹没网页巾的有用信息,严重损害了 w e b 挖掘的质量。在这种背景下,对网络广告进行过滤显得尤为必要,特别是 由于品牌图片广告占据了整个网络广告市场的半壁江山,所以针对网络图片广 告过滤的研究很有实际意义。 本文将网络图片广告过滤问题转化为文本分类问题,这种文本分类问题是 r 1 _ f 以通过粗糙集模型来处理的。已有研究存在着各种各样的不足之处,本文针 对这些4 i 足,根据网络图片数据集的特点,在一般粗糙集模型的基础上,提出 了一种针埘网络网片广告过滤的“粗糙集分组约简模犁”,采用分组约简的方法 对文本数据集进 f 特征选择,能够提高算法时问效率。设计了对比实验,利用 u c i 机器学习数据库巾的i n t e m e ta d v e r t i s e m e n t s 数据集,分别州粗糙集分组约 简模型和般粗糙集模型进行了对比分类实验。 本文的卡要上作和贡献体现诅:以卜儿点。片先,较全面地总结了国内外基 于数据挖掘的网络图片广告过滤领域的研究成果;其次,率先将粗糙集理论应 j j 于网络图片广告过滤领域,实证研究表明粗糙集理沦能很好地处理网络图片 ,“告过滤问题,分类准确牢达到共垒超过了以往的研究结果;第三,根据网络 图片数据的特点,改进了般粗糙集模型,提出了新的粗糙集分组约简模型: 最后,设计了对比实验用实际数据对两个模型进行了实证分析,表明粗糙集 分组约简模型能进一步提高分类质繁。 本文提出的粗糙集分组约简模犁具有较好通用性,可以类比应用于那些鬯可 以将特征项分为若t i 组的数据集,这种数据集在文本分类领域足比较多见的, 例如垃圾邮件过滤问题。 关键词:粗糙集 分组约简广告过滤文本分类 a b s t r a c t a b s t r a c t i n t e r n e ti sa ni m p o r t a n tw a yo fa c q u i r i n gi n f o r m a t i o nb e c a u s ei tc o n t m n sam a s s o fi n f o r m a t i o nr e s o u r c e sw i t hi t sr a p i de x p a n d i n ga n di n c r e a s i n gp o p u l a r i t y b u t i n t e r n e ta d v e r t i s e m e n t sh a v eb e c o m em o r ea n dm o r er a m p a n ta n di n d u c es o m e n e g a t i v ei m p a c t s o n t h eo n eh a n d ,i n t e r n e tu s e r s r e s e n t m e n t a g a i n s t t h e a d v e r t i s e m e n t si sr i s i n gy e a ro ny e a r o nt h eo t h e rh a n d ,i n t e r n e ta d v e r t i s e m e n t sw i l l t a k ea w a yt h eu s e f u li n f o r m a t i o n ,a n dd a m a g et h et h eq u a l i t yo fw e b m i n i n gs e r i o u s l y i nt h i sc o n t e x t ,t h e f i l t e r i n go fi n t e m e ta d v e r t i s e m e n t si sp a r t i c u l a r l yn e c e s s a r y e s p e c i a l l yt h er e s e a r c ho fi n t e r n e tp i c t u r ea d v e r t i s e m e n t sf i l t e r i n gi sv e r yp r a c t i c a l s i g n i f i c a n tb e c a u s et h ep i c t u r ea d v e r t i s e m e n t so c c u p y e dt h ee n t i r eh a l fo ft h ei n t e m e t a d v e r t i s i n gm a r k e t t h i st h e s i sc o n v e r t st h ei s s u eo fp i c t u r ea d v e r t i s e m e n t sf i l t e r i n gi n t oat e x t c a t e g o r i z a t i o np r o b l e mw h i c hc a nb er e s o l v e db yr o u g hs e tt h e o r y i nt h i st h e s i s ,a r o u g hs e tg r o u p i n gr e d u c tm o d e li sp r o p o s e db a s e do nt h et r a d i t i o n a lr o u g hs e t t h e o r yi na c c o r d a n c ew i t ht h ec h a r a c t e r i s t i c so fi n t e r n e ti m a g e s t h em o d e lc a r r i e s o u tf e a t u r es e l e c t i o nu s i n ga g r o u p i n gr e d u c t m e t h o dw h i c hc a ni m p r o v et h et i m e e f f i c i e n c yo fa l g o r i t h m s e x p e r i m e n t sa r ed e s i g n e dt oc o m p a r et h ec l a s s i f i c a t i o n q u a l i t yo ft h er o u g hs e tg r o u p i n gr e d u c tm o d e la n dt h et r a d i t i o n a lr o u g hs e tm o d e l u s i n gu c i i n t e r n e ta d v e r t i s e m e n t sd a t as e t m a n yc o n t r i b u t i o n se x i s ti nt h i st h e s i s f i r s to fa l l ,ac o m p r e h e n s i v es u m m a r yo f d o m e s t i ca n di n t e r n a t i o n a lr e s e a r c h e so fi n t e r n e tp i c t u r ea d v e r t i s e m e n t sf i l t e r i n gw a s a c c o m p l i s h e d ;s e c o n d l y ,r o u g hs e tt h e o r yw a sa p p l i e dt ot h ei n t e r n e ta d v e r t i s e m e n t s f i l t e r i n gf o rt h ef i r s tt i m ei nt h i st h e s i s ,e m p i r i c a ls t u d i e ss h o wt h a tt h er o u g hs e t t h e o r yc a nh a n d l et h ei s s u eo fi n t e r n e tp i c t u r ea d v e r t i s e m e n t sf i l t e r i n gp e r f e c t l y ; t h i r d l y , t h et r a d i t i o n a lr o u g hs e tt h e o r yw a si m p r o v e dt oa d a p tt ot h ec h a r a c t e r i s t i c s o ft h ei n t e r n e ti m a g e s ,an e wm o d e lc a l l e d “t h er o u g hs e tg r o u p i n gr e d u c tm o d e l w a sp r o p o s e d ;f i n a l l y , ae x p e r i m e n tw a s d e s i g n e dt oc o m p a r et h et w om o d e l ,t h r o u g h c o m p a r a t i v ea n a l y s i s o fv a r i o u s i n d i c a t o r s ,t h en e wm o d e la c h i e v e dab e t t e r c l a s s i f i c a t i o nr e s u l t ,t h ec l a s s i f i c a t i o na c c u r a c ym e to re v e ne x c e e d e dt h er e s u l t so f l l a b s t r a c t p r e v i o u ss t u d i e s t h er o u g hs e tg r o u p i n gr e d u c tm o d e lc a nb ea p p l i e dt oo t h e rd a t as e t st h a t h a v ea n a l o gc h a r a c t e r i s t i c :i t e m sc a nb ed i v i d e di n t os e v e r a lg r o u p s t h e s ed a t as e t s a r er e l a t i v e l yc o m m o ni nt h ef i e l do ft e x tm i n i n g ,j u s tl i k et h es p a m f i l t e r i n g k e yw o r d s :r o u g hs e t g r o u p i n gr e d u c t a d v e r t i s e m e n t s f i l t e r i n g t e x tc a t e g o r i z a t i o n l - l 第二节网络广告过滤研究现状4 一、 网络广告特征表示4 :、 网络广告特征降维7 三、 网络广告分类方法及分类效果一11 p l i 、现有研究的彳i 足之处1 6 第三节本义主要内容及研究思路l7 第二章网络图片广告过滤相关理论基础1 9 第一节粗糙集理论1 9 、粗糙集邗论概述l9 二、 信息表与不町分辨关系2 0 二、 属性约简与决策规则2 2 四、小确定性与集合近似2 4 “、变精度羊h 糙集2 6 第:节文本分类理论2 8 、文本分炎概述2 8 二、特征表示2 9 二、特征降维3 2 四、分类算法3 3 第三章网络图片广告过滤的粗糙集模犁3 7 第一节网络图片的属性特征3 7 一、网络图”的h t m l 代码3 7 、 刚络图片的特彳i f :表示3 9 一、 刚络图片数据的垂直分组“4 l 第:节网络图片粗糙集分组约简模犁4 2 、 般粗糙集模,钭4 2 i v h 录 二、粗糙集分组约简模型4 6 三、新模型的优点4 8 第三节模型质量的比较标准4 9 一、规则质晕指标”4 9 二、分类质量指标5 0 第四章网络图片广告过滤的实证分析5 4 第一节网络图片实验数据5 4 一、 实验数据的获取5 4 _ 、 文验数据的特征项5 5 第二节网络图片数据预处理5 6 一、 水l ,多子割5 6 _ 二、 空值处理5 7 三、属性离散化5 9 第三节韦h 糙集分组约简模型的应用6 1 、 垂直分组6 1 。:、 属性约简计算6 3 _ t 、 规则导l 叶j 6 4 阴、分炎质最测度6 4 第四节般粗糙集模型对比分析6 6 一、 般聿 l 糙集模掣实验6 6 二、 分类质量刘比及分析6 8 第五章总结与展望一7 1 第一节论文总结7 1 第二爷研究展望一7 2 参考文献7 4 附录7 8 致 射一8 4 个人简历、在学期间发表的学术沦文及研究成果8 5 v 第一章绪论 第一章绪论 作为论文的开篇,本章首先介绍论文的研究背景和研究意义,通过卡h 关领 域研究文献的查阅,对现有网络广告过滤相关研究的梳理,总结现有研究的可 取之处与4 i 足之处,找出潜在的研究空间,进而确定本论文的研究思路和整体 框架的结构安排。 第一节研究背景及意义 互联网的迅速发展和日益普及,使其蕴含了海蹙的信息资源,已成为人们 获取信息的重要途径之。根据中国l :联网网络信息中心( c n n i c ) 发布的第 2 3 次中国瓦联网络发展状况统计报告,截,i l :2 0 0 8 年底中同网站数量已达2 8 7 8 万个,较2 0 0 7 年增长9 1 4 i 。 然l 酊,与此同时互联网中的垃圾f 占息、无用信息和网络广告也u 益泛滥。 以网络广告为例,根据艾瑞咨询集闭( 1 r e s e a r c h ) 发布的( 2 0 0 8 年第二季度中 困网络广告市场监测报告显示,2 0 0 8 年第二季度我困网络广告市场规模达到 4 5 7 亿元,较第一季度增长9 7 亿元,研:比增长2 7 1 ,如图1 1 所示。预计全 2 0 1 0 年,中同网络广告市场规模( 不含渠道代理商收入) 将达到1 5 7 亿无。 2 0 0 7 q 22 0 0 7 q 32 0 0 7 q 42 0 0 8 q 12 0 0 8 c 1 2 嘲巾场规模( 亿元) , - 4 - - 增长率 图1 12 0 0 7 年二季度一2 0 0 8 年二季度中国1 勾9 络广告市场规模 资料来源:艾瑞咨询集团h t t p :w w w i r e s e a r c h c o m c n c o n s u l t i n g o n l i n e a d v e r t i s i n g f r e e a s p ? c l a s s i d = 3 & i d = 1 lo o l l 】原:之见h t t p :w w w c n n i c n e t i n d e x o e 0 0 i1 i n d e x h i m 加 扣 竹 。 第一章绪论 这些数据反映出网络广告在互联网信息中占了很大比重,这导致了许多问 题的出现,其中两个重要的问题是对用户体验和w e b 挖掘的影响。 首先,存用户体验方面,由于诱惑式强迫式的网络广告众多、部分广告形 式和创意落后,网民对网络广告的反感逐年上升,多数网民希望在浏览或查找 网络信息的时候不受网络广告的干扰。根据c n n l c 的数据,只有不到2 0 的网 民经常浏览网络j 告,如图1 2 所示。 6 0 o 5 0 0 4 0 0 3 0 0 2 0 o 1 0 0 o o 从束小洲览很少浏览白时浏览纤常测览 豳2 0 0 8 1 2 0 0 8 7 矧1 2 网民对网络广告的态度 数据来源:c n n i c 。h t t p :w w w c n n i c n e t i n d e x 0 e 0 0 ll i n d e x h t m 时,红w 曲挖掘方而,网络广告会淹没网负中有用的正文信息,会严霞损 害w e b 信息e l 动收集以及w e b 挖掘( 例如网页聚类、网贞分类、信息查询和信息 提取) 的质最f i 】。这就要求存w e b 挖掘之前对w e b 文档进行清洗等预处理:r :作, 将其中的网络广告等噪声数据过滤掉而这点在人多数研究工作中律稃被忽 视【2 】o 在这种背景f ,对网络,。告及其他无用w e b 信息进行过滤显得尤为必要, 也现了很多网络广告过滤软件。特别是由j 二品牌图片广告占据了整个网络广 告市场的半壁江山( 如图1 3 所示) ,所以针对图片f “告过滤的研究1 f 常具有实 际意义。 i i ll a ny i ,b i n gl i u x i a o l il i e l i m i n a t i n gn o i s yi n f o r m a t i o ni nw e b p a g e sf o rd a t am i n i n g i n t e r n a t i o n a l c o n f e r e n c e0 1 1k n o w l e d g ed i s c o v e r ya n dd a t am i n i n g ,2 0 0 3 :2 9 6 3 0 5 1 2 l 张波,王继成,f ”强等w e b 文档清沈技术的研究与实现计算机研究与发腱,2 0 0 2 ,v 0 1 3 9 ( 1 1 ) :1 4 8 4 1 4 9 0 2 第章绪论 1 0 0 8 0 6 0 4 0 2 0 o 2 0 0 7 q 2 2 0 0 7 q 32 0 0 7 q 42 0 0 8 q 12 0 0 8 q 2 圄品牌图形广告曰搜索引擎广告畜媒体广告 固定文字链广告分类广告其他形式广告 图1 32 0 0 7 年二季度2 0 0 8 年二季度中困书要网络,“告形式的l l j 场份额 数据来源:艾瑞咨询集 封,h n p :w w w i r e s e a r c h c o m c n r e p o r t c h a r g e a s p ? i d = 1 2 2 2 黄晓斌,邱明辉指出目前的研究按过滤手段町以分为两类:丛于网址的方 法、基于内容的方法l 。 基于刚址的方法运用事先定义好的规则,对认为青问题的网址、超链接进 行控制,例如电子邮件过滤中的黑名单技术。常见的,告过滤软件( 如a d m u n c h e r ) 。股也属于这类。该方法的缺点是舰则是人j :输入的,需要消耗人量 时问2 】;规贝u 无法完全覆盖所有可疑网址链接,也不能实时跟踪网站的变化【3 1 , 规则冲突的现象也时有发生。 基j - 内容的方法其实就是采用数据挖掘的方法进行分类。采瑁文本分类理 论分析网络图片h t m l 代码的义字信息,利用数据挖掘方法在人量样本的基础 卜得出分类器,对链接进行过滤,其有较好的适应性。 本文所讨论的嘲络广告过滤研究基于文本分类的数据挖掘方法。这种研究 l i 】黄晓域,_ 丘l ;明辉| q 络信息过滤系统研究馅报学报,2 0 0 4 ,v 0 1 2 3 ( 3 ) :3 2 6 3 3 2 1 2 jl ks h i h ,d rk a r g e r u s i n g u r l sa n dt a b l el a y o u tf o rw e bc l a s s i f i c a t i o nt a s k s i n :f e l d m a ns 1 u r e m k ym 。 n a j o r km ,w i l l sc e 。e d s p r o c o f t h e1 3 t hi n t lc o n f o nt h ew o r l dw i d ew e b ( w w w - 2 0 0 4 ) n e wy o r k : a c mp r e s s ,2 0 0 4 = 1 9 3 2 0 2 1 3 1 乍慧娩震f 产摹j :混合模式的闩页过滤系统研究信息技术,2 0 0 7 1 2 :7 3 一7 6 3 第章绪论 还可以扩展到垃圾邮件过滤、过滤不相关查询内容、个人隐私及企业机密的保 护,有较好的实际应用价值。下面介绍基于内容的网络,“告过滤的研究历史和 现状。 第二节网络广告过滤研究现状 尽管w e b 信息过滤是一项重要的工作,但是该领域的研究相对来说不多l 】。 已有的研究一般都将网络图片数据转换成文本来进行处理,转化成文本分类的 问题。有关文本分类的相关理论基础在2 2 节介绍。 网络广告过滤的研究大致可以分为j 个方面:网络图,j 的特征表示、特征 降维与分类算法。下面从这三个方面对以往的研究进行总结,许多研究在这二 个方面都有涉及,并不是孤立的。 一、网络广告特征表示 n i c h o l a sk u s h m e r i c k l 2 在网络广告过滤万面做i l j 了开创悔的研究,建t 了网 络广告数据集,现存该数据集已成为u c i 机器学列数据库里的一个标准数据集: i n t e m e ta d v e r t i s e m e n t s 。该数据集以短语作为项( i t e m ) ,通过a d g r a b b e r 软件搜 集以及人工标注的方式,搜集了3 2 7 9 条网络图”记录,从h t m l 代码。 j 提取图 片u l u 、i 删页u r l 、图片超链接u r l 、图片替代文本、图片标题、图片的高度 宽度等信息构造特征项。项的权值崩简单的布尔值 l ,0 j ,表示该项有没有存文 档巾出现。 南京大学的张波、千继成和王强1 3 】对网络图像特征的选择和提取进行j ,详细 分析,针对k u s h m e r i c k 2 】研究中对特征选择存在的问题,作者首先对出现的特征 词根据其样本所属类别进行、浏频统计,其次引入归属度的概念。将特征项取值 从 l ,o 扩展为谚i 属度计量。 l i 】l a ny i b i n gl i u x i a o l il i e l i m i n a t i n gn o i s yi n f o r m a t i o ni nw e bp a g e sf o rd a t am i n i n g i n t e r n a t i o n a l c o n f e r e n c eo nk n o w l e d g ed i s c o v e r ya n dd a t am i n i n g 2 0 0 3 :2 9 6 、3 0 5 f 2 1n k u s h m e r i c k l e a r n i n gt or e m o v e i n t c r n e ta d v e r t i s 锄e n t s i n :o e t z i o n i ,j pm u i l e r ,j m b r a d s h a w , e d s p r o c e e d i n g so f t h et h i r da n n u a lc o n f e r e n c eo na u t o n o m o u sa g e n t s s e a t t l e w a u s a :a c mp 陀s s ,1 9 9 9 : 1 7 5 1 8 l 1 3 1 张波乇继成,工强等w 曲丈挡清洗技术的研究与交现计算机研究j j 发艘,2 0 0 2 ,v 0 1 3 9 1 1 ) :1 4 8 4 1 4 9 0 4 第。一章绪论 该研究改进了k u s h m e r i c k 对特征项权值的表示,但是实验结果并没有 k u s h m e r i c k 的研究好。 n e i lr o w e 和j i mc o f f m a n 等【l 】的研究表明综合考虑逻辑方法和统计方法可 以提高广告过滤的准确率,除了常用的文本、u r l 等特征外,还根据这些特征 生成了一些统计指标。实验表明图片的大小、图片u r l 中的数字个数( l o n g i n t e g e r s ) 对决策类结果影响较大,其他的包括图片u r l 中的文字、图片替代文 本的长度等等。 该研究的亮点是考虑了“数字个数”等统计指标,这是以往研究所没有的。 但是分类实验设计不够完善,只是进行了样本个数为1 7 6 的小样本测试。 在如何寻找网络图片的特征项方面,新加坡国立大学的l a ny i 、b i n gl i u 【2 】 提出了一种新的特征权重技术( f e a t u r e w e i g h t i n g t e c h n i q u e ) ,首先建立一个压缩 结构树( c o m p r e s s e ds t r u c t u r et r e e ,c s t ) 获取网页中的通用结构和块:接着评 价每个压缩结构树结点的重要性,赋予相应权值,在w e b 挖掘r f l 考虑这种权值。 实验表明通过这种方法进乱:数据清洗后,挖掘效果得到了提高。 在另一篇研究中,l a ny i 、b i n gl i u 、x i a o l il i l 3 1 在特瓠f 表方面考虑+ j ,数据的 视觉表现风格。认为在一个给定网站中,噪声数据通常具有相吲的内容和表现 风格,而网页主要内容则4 i 足这样。根据这种观点他们提出种名为“s t y l e t r e e ” 的树结构来捕获那蝗经常山现的表现风格,达到消除噪声数据、 寿沈网页的目 的。作者进行了两个流行的w e b 页血聚类和w e b 页血分类仔务,褒明该方法可 以显著提高准确率和f s c o r e 。 这两项研究的基本思路相同。但是它们的假设前提使它只适于清洗某一给 定网站巾的局部噪音( l o c a ln o i s e s ) 。如果想过滤另外刚站的某一网贞中的网络 j 告,必须查找该例页所在恻站中的其他i 嘲页,建立新的数据集厦新建立 c o m p r e s s e ds t r u c t u r et r e e 或s t y l et r e e ,l :这种方法的实际应用价值人减。 f i n e i lc r o w e ,j i mc o f f m a n ,y i l m a zd e g i r m e n c i 眦a u t o m a t i cr e m o v a lo fa d v e r t i s i n gf r o mw e b - p a g e d i s p l a y i np r o c e e d i n g so f t h e2 n da c m i e e e - c sj o i n tc o n f e r e n c eo nd i g i t a ll i b r a r i e s o r e g o n ,u s a j u l y , 2 0 0 2 l 甜l a ny i b i n gl i u w e bp a g ec l e a n i n gf o rw e bm i n i n gt h r o u g hf e a t u r ew e i g h t i n g i n :t h ep r o c e e d i n g so f e i g h t e e n t hi n t e r n a t i o n a lj o i n tc o n f e r e n c eo na r t i f i c i a li n t e l l i g e n c e ( i j c a i 一0 3 ) ,a c a p u l c o ,m e x i c o ,2 0 0 3 0 8 1 3 】l 锄y i b i n gl i u ,x i a o l il i e l i m i n a t i n gn o i s yi n f o r m a t i o ni nw e bp a g e sf o rd a t am i n i n g i np r o c e e d i n g so f t h en i n t ha c ms i g k d di n t e r n a t i o n a lc o n f e r e n c eo nk n o w l e d g ed i s c o v e r ya n dd a t am i n i n g w a s h i n g t o n d c a u g u e s t 2 0 0 3 :2 9 6 3 0 5 5 第一章绪论 麻省理工学院的l a w r e n c ek a is h i h 和d a v i dr k a r g e r i l l 指出以前的研究_ 般 都是将w e b 看成一个大的文本集,然而事实上w e b 并不仅仅是文本。作者考虑 网页超链接的u r l 以及该超链接的视觉位置,而不是考虑网页正文内容,提高 了网页分类质量。这种特征不像“字数”这种标量度量,而是具有树结构的。 作者将超链接u r l 等不看成单纯的文本,而是具有树结构,并考虑超链接 的视觉位置等因素。但是这种数据的可获取性4 i 高,需要人工进行计算。 中国科学技术大学的d o n g f a n gl i 、b i nw a n g 等【2 l 综合了四种图片特征:文 本特征、超链接特征、视觉布局特征( 例如图片四个顶点的举标,高度和宽度) 、 视觉内容特征( 例如图片格式,颜色种类,灰度百分比,对比度) ,认为这些特 征并不是同等有效的,作者用a d a b o o s t 方法评估不同特征组合策略,选择最有 效的组合用来探测网络广告图片。实验证明最重要的特征中大部分是图片的视 觉布局特征。 作者从多种角度非常伞面地考虑了图片的特征,是很人的。个亮点。但是 该研究也存在一些缺陷,有哆特征( 例如视觉布局特征、视觉内容特征) 在h t m l 代码中足没有的,无论是离线训练还是在线分类都需要人i :进行标注,显然4 i 合实际要求。 i o nm u s l e a 、s t e v e nm i n t o n 和c r a i gk n o b l o c k l 3 j 指出k u s h m e r i c k 所研究的i 】c ) 4 络广告过滤问题就是一个多视墙问题( m u l t i v i e w p r o b l e m ) ,即特征项丌j 以分割 成1 i 相交的子集( 视角) 。作者认为,网络广告数据的一个视角来自图片本身, 例如图片u r l 文字和标题;另一个视角来自相关网贞,例如网贞u r l 文字、 超链接u r l 文字。 该研究将网络广告数据仅仪粗略地分为两个视角,z h i h u az h o u 、d e c h u a n z h a n 和q i a n gy a n 9 1 4 1 将i n t e m e ta d v e r t i s e m e n t s 数据集分成u r l 视角、o r i g i n a l u r l ”j l ks h i h ,d rk a 唱e r u s i n g u l u l s a n d t a b l e l a y o u t f o rw e b c l a s s i f i c a t i o n t a s k s i n :f e l d m a n s l u r e t s k v m n a j o r km ,w i l l sc e ,e d s p r o c o f t h e1 3 t hi n t ic o n f o i lt h ew o r l dw i d ew e bi w w w - 2 0 0 4 ) n 州y o r k : a c mp 他s s ,2 0 0 4 :1 9 3 2 0 2 i z i d o n g f a n gl i b i nw a n g z h i w e il ie t c o nd e t e c t i o no fa d v e r t i s i n gi m a g e s i np r o c e e d i n g so fi e e e i n t e r n a t i o n a lc o n f e f e n c e 伽m u l t i m e d i aa n de x p o ,2 0 0 7 1 州i m u s l e a s m i n t o n ,c k n o b l o c k a c t i v e + s e m i s u p e r v i s e dl e a r n i n g = r o b u s tm u l t i - v i e wl e a r n i n g 1 n p r o c e e d i n g so f l c m l 0 2 1 9 t hi n t e m a t i o n a lc o n f e r e n c eo nm a c h i n el e a r n i n g j u l y2 0 0 2 :4 3 5 4 4 2 1 q z h z h o u d c z h a n q y a n g s e m i - s u p e r v i s e dl e a r n i n gw i t hv e r yf e wl a b e l e dt r a i n i n g e x a m p l e s p r o c e e d i n g so f 2 2 n da a a lc o n f a r t i f i c i a li n t e l l i g e n c e 2 0 0 7 :6 7 5 6 8 0 6 第一章绪论 视角、a n c u d 视角、c a p t i o n 视角和a l t 视角等五个视角,但是这五个视角没有包 括图片几何特征等,在研究中也只是选取其中某两个视角进行实验分析。s e r g i o a l v a r e z 、t a k e s h ik a w a t o 和c a r o l i n ar u i z 0 将该数据集分为u j m 2 、u b a s e 、u 曲、 a l t 、c a p t i o n 、g e o m e t 珂等六个部分,但是并非从多视角问题这个角度来分组。 综上所述,网络图片的特征表示绝大多数研究都是从图片的h t m l 代码中 提取文本,用文本作为特征项。也有的研究考虑了其他视觉特征、表现风格等, 但是这些特征需要人工标注,对于数据挖掘来说不太现实。本文第三章采用一 般的方法考虑网络图片的h t m l 代码特征,从h t m l 代码中提取文本或数字进 行特征农示;并在“多视角问题”研究的基础上进行扩展,提出新的粗糙集分 组约简模型。 二、网络广告特征降维 特征降维分为特征提取和特征选择,网络广告过滤研究中大部分集中在特 征选择,也有比较特征提取和特征选择对分类的影响的研究,同时也有许多研 究并没有进行特征降维。 n i c h o l a sk u s h m e r i c k l 2 】在实验巾对网络广告数据集进行了特征选择,不过仪 仪是凋整短语的最大长度k 、短语出现的最小次数m 两个参数,k 越小、m 越 大得到的特征个数就越少:同时设定足召:使用“停用浏表”、是台使用“l o c a l ? ” 属性、是否使 l “a r a t i o ”属性,以达到降维的目的。如图1 4 所示,“n u m b e ro f f e a t u r e s ”列表示经过特祉降维后保留的特征数口。最少能将特征数日降到4 个, 同时分类准确率并不低。 但这种降维方法完全是根据经验来进 0 :的,没有用到分类信息,卜符合数 据挖掘的思想。应该保留对分类有用的特征项,l f l 删去时分类无用的特征项。 而不足这样随意删除。 s e r g i oa a l v a r e z ,t a k e s h ik a w a t o ,c a r o l i n ar u i z m i n i n go v e rl o o s e l yc o u p l e dd a t as o u r c e su s i n gn e u r a l e x p e r t s b o s t o nc o l l e g e ,2 0 0 3 2 1 n k u s h m e r i c k l e a r n i n gt or e m o v ei n t e r a c ta d v e r t i s e m e n t s i n :0 e t z i o n i ,j pm u l l e r ,j m ,b r a d s h a w 。 e d s p r o c e e d i n g so f t h et h i r da n n u a lc o n f e r e n c eo na u t o n o m o u sa g e n t s s e a t t l e ,w a ,u s a :a c mp r e s s t19 9 9 : 1 7 5 1 8 l 7 第。一章绪论 e n c o d i n ge 互 誉 ! 薏 - 盖 趸 基 - 一 迎 銎 o 葛 霉 生 g 旦 萋 墨 童 豪 。 九 童 差 l蚕 知 。一 兰0 室畜 o o 5盘 暖。蠢 o s t a n d a r d 2 1 0 y e sy e sy e s 1 5 5 89 7 2o 0 61 j u s t - w o r d s l 1 0 7 99 6 90 0 91 4 3 l o n g - p h r a s e s 41 9 7 99 7 10 0 50 7 9 m o s t - p h r a s e s 2 9 1 1 39 7 60 0 1o 1 7 f r e q - p h r a s e s 1 0 03 59 6 62 84 4 n o -
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026事业单位工勤技能-江苏-江苏水工闸门运行工一级(高级技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-江苏-江苏土建施工人员四级(中级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-新疆-新疆无损探伤工五级(初级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-新疆-新疆保安员二级(技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-天津-天津工勤技能(公共科目)历年参考题库含答案详解3套试卷
- 肠镜检查健康指导总结
- 加压调蓄供水设施设备改造及庭院供水管道改造项目可行性研究报告模板-备案审批
- 2026年秋季开学初三学长寄语动员大会课件
- 2026年秋季开学大学一年级新生军训摄影展览活动课件
- 云南省迪庆藏族自治州香格里拉县2025-2026学年十校联考最后数学试题含解析
- 2025浙江温州瓯海科技产业发展集团有限公司及下属子公司招聘调整部分岗位笔试历年常考点试题专练附带答案详解试卷2套
- 2025 GOPS 全球运维大会暨研运数智化技术峰会·北京站:AI赋能的新一代CMDB智能运营场景创新实践
- 橄榄青果购销合同范本
- 企业管理层培训考试题
- 党支部自查自纠存在问题及整改措施
- ECRS四大原则课件
- 团队列名法课件
- 2025年中国远洋渔业行业市场全景评估及发展战略规划报告
- 高原肺水肿护理查房
- 住院患者烫伤应急预案及处理流程
- 河道清漂协议书
评论
0/150
提交评论