已阅读5页,还剩48页未读, 继续免费阅读
(计算机应用技术专业论文)信息检索中迁移markov网络模型的研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 w e b 信息的快速增长,给信息检索系统带来了巨大挑战。传统的检索模型需 要在一个相对固定的数据集上通过训练得到,不具备开放的学习功能,而w e b 上 的信息是实时更新的,检索模型由于无法对新的数据进行学习,检索性能必将随 着w e b 信息的更新而逐渐下降,现有的解决办法之一是将新数据加入到原有的数 据集中对模型重新进行训练,由于模型对原有数据集学习所获得的知识并没有被 保留,这势必浪费大量的时间进行重复学习;另一种方法则是在新数据集上对模 型进行训练,若新的数据集数据量不够则会影响模型的学习效果。因而,如何使 得检索模型能较好学习新的数据并实现在目标数据集上的准确检索乜 ,邑1 1 1 ,成为 了信息检索模型研究的热点之一。 本文中我们将检索模型在发生变化的数据上的训练可以看作是一个学习迁 移的过程陋1 引,检索模型在原有数据集上的训练势必对其在新数据上的学习有所 影响,即在原有数据集上建立模型中所获得的知识对该模型在新数据上的训练有 所帮助,从而减少由于数据发生改变而导致模型需要重新进行学习所耗费的时 间。 因此,为解决上述问题,我们结合迁移学习理论和m a r k o v 网络理论呻1 ,提 出了一种新的方法,思想是迁移m a r k o v 网络用于实现检索模型的学习,通过获 取先验知识,实现在目标数据集上高效检索目的。具体的思路是:首先建立一个 数据集上的初始检索模型,其次,衡量用于建模的先验数据集和目标数据集中数 据分布的差异性,在本文中我们使用k u l l b a c k l e i b l e rd i v e r g e n c e 口,7 1 ( k l 偏 离度) 的测量公式来度量这一分布的不同。且所得的k l 偏离值也可用于确定检 索公式中的平衡参数( 也就是确定迁移先验数据中知识的“量”) ,然后,通过 迁移旧数据集上的先验知识到目标数据集上,我们对基于m a r k o v 网络的检索模 型进行修正,并在目标数据集上进行检索。这样就可以将以将以往被摒弃的先验 数据通过有效的迁移学习利用到目标数据集的学习中,使检索模型能够快速学习 并实现目标文档的高效检索。多组实验结果验证了我们的新方法在性能上要优于 b m 2 5 算法,2 “2 引,t 一检验n6 删的结果也显示模型的性能提高水平是显著的。 本文的工作和创新点在于: 1 首次将迁移学习理论用于信息检索领域,将知识的迁移和有指导的迁移学 习等思想成功应用在基于m a r k o v 网络的信息检索模型聆氐峨删中,从构造的m a r k o v 网络中成功地学习先验数据。 2 本文通过迁移先验数据集的知识,并利用部分新数据集,来修正所提出的 检索模型,并最终实现基于m a r k o v 网络的检索模型能在新的数据集上的高效检 索。这样可以大大减少重新建立一个适用于新数据集的检索模型所耗费的时间。 3 通过实验验证并分析了进行迁移学习后的基于m a r k o v 网络的信息检索模 型的性能,并将常用的b m 2 5 算法与经过迁移学习的m a r k o v 网络信息检索模型的性 能进行比较。实验表明本文提出迁移基于m a r k o v 网络模型的方法表现比较优异, 在很大程度上提高了检索效率。 关键词:信息检索;迁移学习;m a r k o v 网络;k u l l b a c k 1 e i b l e r 偏离度; u a bs t r a c t a l o n gw i t ht h ed e v e l o p m e n to fi n t e m e t ,al o to fn e wd a t aa p p e a r si nt h ew e b e v e r yd a y i tb r i n g sag r e a tc h a l l e n g et or e t r i e v a ls y s t e m i n f o r m a t i o ni si nc h a n g i n g a n do u rr e t r i e v a lm o d e li sg o t t e nb yt r a i n i n go na m o u n to fd a t a s e ta n dn e e dm u c ht i m e t or e b u i l d t oc o n s t r u c tar e t r i e v a lm o d e lt oa d a p tt h en e wd a t aq u i c k l ya n dt or e t r i e v a l t h en e wd o c u m e n t sa c c u r a t e l yi sb e c o m i n ga ni m p o r t a n tr e s e a r c ht o p i c t r a d i t i o n a lr e t r i e v a lm o d e li si m p o s s i b l ei nl e a r n i n gn e wd a t a ,r e t r i e v a le f f e c t b e c o m e1 0 w e w h e nt h ed o c u m e n t si n c r e a s e a n dr e t r i e v a lm o d e ln e e dc o s tal o to f t i m et om o d i f yf o ra d a p t i n gn e wd a t as e t b e c a u s ei n f o r m a t i o ni si nt h ee x p o n e n t i a l g r o w t h ,a n dt h et r a i n i n go fr e t r i e v a lm o d e li s d e s c r i b e da sap r o c e s so ft r a n s f e r l e a r n i n gp r o c e s s a n dt h et r a i n i n go f o l dd a t ah a si n f l u e n c eo nt h et r a i n i n gi nn e wd a t a s oi nt h ep r o c e s so fa c h i e v i n gr e t r i e v a li nt h et a r g e td a t as e t s w en e e dn o tr e - t r a i n i n g t h ep r i o rd a t aa n dn e wd a t a , b u to n l yt r a n s f e r r i n gp r i o r ik n o w l e d g eo fo l dd a t aa n d a c c o r d i n gt ot h ec h a r a c t e r i s t i c so fn e wd a t at or e v i s et h er e t r i e v a lm o d e l b yt h i sw a y , w ec a ns a v et i m ea n dm a n p o w e r i nt h i sp a p e r , w ep u tf o r w a r db o l d l yan e wr e t r i e v a lm o d e lb yi n c o r p o r a t i n gt h e t h e o r yo ft r a n s f e rl e a r n i n gw i t hm a r k o vn e t w o r k f i r s t l y , c o m p a r i n gt e r ms p a c e s n e t w o r ko fo l dd a t a s e ta n dn e w ( t a r g e t ) d a t a s e t ,a n dt h ed i s t a n c eb e t w e e nd a t as e t si s m e a s u r e du s i n gt h ek u l l b a c k - l e i b l e rd i v e r g e n c e m o r e o v e r , k l - d i v e r g e n c ei su s e dt o d e c i d et h et r a d e o f fp a r a m e t e ri nr e t r i e v a lf o r m u l a t h e nw et r a n s f e rt h eu s e f u lp r i o r k n o w l e d g eo fo l dd a t a s e tt o t h en e w ( t a r g e t ) d a t a s e t ,a n df i n a l l yi m p l e m e n tt h e r e t r i e v a lp r o c e s so nt h et a r g e td a t a s e t e x p e r i m e n t so nm u l t i p l ed a t a s e t si n d i c a t et h a t o u rn e wa p p r o a c ho u t p e r f o r m so t h e rm e t h o d s f u r t h e r m o r e ,w ep e r f o r ms e v e r a l t - t e s t st od e m o n s t r a t et h ei m p r o v e m e n t sa r es t a t i s t i c a l l ys i g n i f i c a n t t h ei n n o v a t i o n si nt h i sp a p e ra r ef o l l o w i n g : 1 i ti sf i r s tt i m ew ea p p l yt r a n s f e rl e a r n i n gt h e o r yi ni n f o r m a t i o nr e t r i e v a l i n t h i s p a p e r , t h e k n o w l e d g eo fm i g r a t i o n ,s u p e r v i s e d t r a n s f e r l e a r n i n g s u c c e s s f u l l yu s e di no u rr e t r i e v a lm o d e lb a s e do nm a r k o vn e t w o r k a n db y c o n s t r u c tt h em a r k o vt e r m s p a c e ,t h em o d e lc a nl e a r nt h ep r i o rd a t aq u i c k l y 2 k n o w l e d g ei np r i o rd a t ai st r a n s f e r r e dt ot a r g e td a t a ,w i t ht h eh e l po f t h en e w d a t a ,w ec a nm o d i f yr a p i d l yo u rr e t r i e v a lm o d e l ,a n dr e t r i e v a lm o d e lb a s e d m a r k o vn e t w o r kg e t sh i g hr e t r i e v a lp e r f o r m a n c eo nt h et a r g e td o c u m e n ts e t s i i i b yt h i sw a y , w en e e dn o tr e b u i l dan e wr e t r i e v a lm o d e la n ds a v et i m ea n d e f f o r t 3 o u rm o d e li st e s t e db ye x p e r i m e n t s ,a n da f t e ra n a l y z i n gt h er e s u l t sw ef i n d t h a to u rm o d e l w h i c ht r a n s f e r r e dl e a r n i n gb e c o m em o r ee f f i c i e n to ns e a r c h p r o c e s s a n dc o m p a r ew i t ht h eb a s i cr e t r i e v a lm o d e l ( b m 2 5 ) ,o u rm e t h o d s d e m o n s t r a t e ds t a t i s t i c a l l ys i g n i f i c a n ti m p r o v e m e n t s k e yw o r d s :i n f o r m a t i o nr e t r i e v a l ;t r a n s f e rl e a r n i n g ;k u l l b a c k l e i b l e rd i v e r g e n c e ; m a r k o vn e t w o r k ; i v 独创性声明 本人声明所呈交的学位论文是本人在导师指导下进行的研究工 作及取得的研究成果。据我所知,除了文中特别加以标注和致谢的地 方外,论文中不包含其他人已经发表或撰写过的研究成果,也不包含 为获得或其他教育机构的学位或证书而使用过的材料。与我一同工作 的同志对本研究所做的任何贡献均已在论文中作了明确的说明并表 示谢意。 学位论文作者签名:签字日期:年月 日 学位论文版权使用授权书 本学位论文作者完全了解江西师范大学研究生院有关保留、使用 学位论文的规定,有权保留并向国家有关部门或机构送交论文的复印 件和磁盘,允许论文被查阅和借阅。本人授权江西师范大学研究生院 可以将学位论文的全部或部分内容编入有关数据库进行检索,可以采 用影印、缩印或扫描等复制手段保存、汇编学位论文。 ( 保密的学位论文在解密后适用本授权书) 学位论文作者签名: 签字日期:年月 日 导师签名: 签字日期:年月 日 信息检索中迁移m a r k o v 网络模型的研究 第一章绪论 随着互联网的普及和社会信息化的发展,信息呈指数级增长,i n t e r n e t 逐 渐成为人们搜寻各种信息的主要来源,信息检索技术也在人们的日常生活和学习 中发挥着无可替代的重要作用。 信息检索口叫是一个具有丰富内涵和广泛外延的术语,虽然没有统一的定义, 但已经被人们所广为使用。综合一些现有的定义,可对其作如下简单描述:“信 息检索,是指从大量文档资源集合中自动地找到与用户查询请求相关的各种信 息。,虽然该定义不是十分精确,但是却说明了信息检索所具备的特点。用户在 检索信息时,通常把信息需要用查询词的形式表达出来,检索系统根据查询词返 回可能的相关文档。 1 1 研究背景 随着互联网上信息的急剧膨胀,信息的瞬息万变使得根据大量先验数据训练 学习得到的检索模型由于新数据的增加而检索性能降低,而众所周知,训练一个 新的模型所耗费的人工和周期是非常漫长的,所以如果一开始建立一个健壮的模 型,在大量新数据出现时,能通过修正该检索模型,使得其能继续在出现新的 w e b 网页时,仍为用户高效地提供海量信息,提高检索系统的准确率。因此,已 有的检索模型如何学习并迅速适应新的目标文档集,并在整个文档集中能发挥高 效检索性能成为现代信息检索技术研究的重要课题。 机器学习瞳 1 和数据挖掘n 6 1 系统领域有个很重要的假设就是训练数据和测试 数据的分布是相同的,即它们是处在同一分布下,是来自同一特征空间的。然而, 在许多实际应用口一钉中,这种假设不总是成立的,举例来说,在一个任务领域有 一个新的分类任务,但是仅只有足够的训练数据是来自另一任务领域的,且这个 来自另外一个领域的训练数据是不同分布或者可能在另一种特征空间的。遇到这 样的情况,如果知识迁移能成功,这将有助于我们学习有兴趣的领域,并能避免 重新付出昂贵的代价进行标注任务。近几年来,迁移学习已经成为了解决这类问 题的新技术。本文就旨在研究迁移学习口在信息检索中的应用问题。而且,本文 还讨论了迁移学习的领域适应性,讨论新的知识迁移研究领域的潜在问题。 许多机器学习方法普遍在这样一个假设下:就是训练数据集和测试数据集服 从同一分布拍1 。当分布改变时,许多机器学习方法需要重新抓取数据,要求用 户去重新收集很多的训练数据。在真实世界的许多应用中,重新收集所需训练数 据并重新训练模型是需要很大代价的。如果知识能够在不同的任务领域之间进行 硕士学位论文 迁移将大大减少精力。迁移学习侧重于迁移跨领域的知识,不同任务的经验迁移, 和相似但不同分布的数据之间的迁移n 2 j 引。比如,学会认识苹果的孩子就会慢慢 学会认识梨,学会了弹电子琴的人就会很容易学会弹钢琴。这就是迁移学习理论 的雏形:人们总是很自然地使用先验经验来解决新的问题。迁移学习在机器学习 领域的研究动机始于n i p s 一9 5 的研讨会有关“学会学习( 1 e a r n i n go nl e a r n ) , 的议题,该议题研究如何让机器学习方法能够保留并重复利用己学的知识。 在计算机技术发展的初期,由于互联网上的文档集有限,信息检索系统的速 度基本满足用户的需求。但随着网页的日新月异,极速增长,用户不再为找不到 信息而烦恼,而是如何为用户找到最满意,最新,最具前瞻性的信息。所以如何 让检索系统在短时间内适应互联网上涌现的大批新文档,保持系统高效的检索性 能也成为信息检索中的一个研究热点。 1 2 研究意义 随着信息检索技术的不断发展,挖掘更加有效的信息对检索的结果进行优化 成为一种有效的手段。有效的将各方面的附加信息融合进信息检索的过程将带来 更好的检索效果且在实践中得到了不断证实。 通常,我们在一个数据集上建立检索模型,并通过多组实验去训练该模型使 之能达到很好的检索效果。如果训练的模型在测试数据上检索效果优良,但一旦 放到新的文档集中,模型的检索性能便会有所降低。 因此,如何将性能优良检索系统经过学习修正,迁移到新的数据集中便成了 我们研究的目标。本文便针对一个具体的检索模型一基于m a r k o v 网络的检索模 型,去研究该模型的迁移学习。该研究的意义在于:充分利用已有的知识来减少 训练一个模型所花费的时间和精力,从而提高检索模型的适用性和健壮性。 本文研究了基于m a r k o v 网络的检索模型如何迁移先验知识,学习目标数据, 来实现目标数据集上的高效检索。m a r k o v 网络是一种较好的表示知识关联的图 形表示方法,可以从实例数据来训练得到,并且它的无向性可以更能好地解释信 息检索中知识之间的关系,具有了强大的学习和推导能力。而迁移学习是主要研 究人类在认知上的迁移能力并将其思维模式应用到机器学习领域。通过迁移学 习,可以将一个领域学习到的知识合理地应用到一个全新的领域中( 目标领域与 源领域有一定的相关性) 。 1 3 本文工作 基于m a r k o v 网络的信息检索方法,不同于传统的基于词汇匹配的检索方法, 是一种新型的基于概念的检索模型。它将图理论、概率理论的思想融合起来,将 文档检索看成是图形推理过程,也是当前的主要研究方向之一。m a r k o v 网络对于 2 信息检索中迁移m a r k o v 网络模型的研究 处理不确定性知识的优良特性,使其很好的表示变量之间的证据传递。检索推理 网络是将查询作为证据源,被激活的文档视为相关文档,将与查询密切相关的信 息也作为证据源检索更多的相关文档,达到提高检索效果的目的。 迁移学习是机器学习中主要的研究任务,它将一个问题或任务中所获知识用 于另一个不同但相关的问题或任务,举个例子来说:日常生活中人们也经常迁移 过去学到的知识或技能到新的领域:例如c + + 专j a v a ,p h y s i c s 专c o m p u t e r s c i e n c e 。而这种在人脑中保留的掌握某种技能会很自然地被运用到相关的新领 域当中,这就是有指导的迁移学习的过程。 本文中,通过对训练文档集的学习,以词与词之间的关联性来构造m a r k o v 网络,网络中的无向边准确地刻画了词与词之间的关联度,使得词在某一文档中 所占的权重得到了准确体现,更能实现检索中准确描述用户的查询意图。 首先对先验文档集,构造这个文档集的索引项的网络,并抽取索引项之间的 关系。并在先验文档集上构造一个初始的基于m a r k o v 网络的检索模型,然后学习 先验数据特征空间中的知识( 即索引项空间中词与词之间的关系) ,即通过迁移 先验文档集获得索引词之间的新关系,得到一个可以在目标数据集中实现高效检 索的检索模型。 如何将检索性能优良的模型迁移学习到新的目标数据集中便成了我们研究 的目标。这样可以减少训练模型所需要的时间,而且能提高检索模型的性能。 拟解决的关键问题: 1 经过学习的m a r k o v 检索模型迁移到新的数据集上性能是否依旧很好; 2 新数据集与训练检索模型的先验数据集的差异度的多少是否会影响 m a r k o v 检索模型的检索结果,不同领域的数据集对于迁移学习的影响; 3 在目标数据集上怎样更好地获得检索模型的先验知识; 通过不同数据集的多组交叉实验证明,迁移学习后的m a r k o v 网络检索模型 的检索效果表现优异。分别在a d i 、c i s i 、c a c m 、c r a n 、m e d 文档集进行了 二十组交叉实验,均取得了l 匕b m 2 5 检索模型更好的检索效果。 具体来说,本文的工作主要包括以下几点: 1 )分析m a r k o v 网络的优点,对m a r k o v 网络检索模型相关工作进行综述, 叙述该模型能有效地提取索引词与索引词之间的关联性用于检索; 2 )研究迁移学习理论,使得基于m a r k o v 网络的检索模型能很好地学习旧数 据集当中的先验知识,以备通过迁移学习运用在目标领域上; 3 ) 在相同的文本数据预处理情况下,分析了经过迁移学习后的m a r k o v 网络 信息检索模型与b m 2 5 检索模型之间的性能差异,通过比较这几种模型实 验结果,得出迁移学习后的m a r k o v 网络检索模型在整体检索性能上相 对最优的结论; 4 )构建了一个完整的信息检索实验平台,完成多种检索模型的比较实验。 硕士学位论文 1 4 论文结构 论文的第一章介绍了本文的研究背景和研究意义,并对相关研究领域的主要 研究工作加以介绍,最后提出了本文的主要工作。 第二章阐述了迁移学习的发展历史,以及迁移学习理论在本研究中的重要意 义。 第三章详细介绍了信息检索的基本概念,评价方法以及各种经典的文本信息 检索模型。 第四章对基于m a r k o v 网络的信息检索模型进行了分析,给出了该模型的相关 知识、网络构造以及检索模型的公式。 第五章介绍了迁移学习在m a r k o v 网络检索模型中应用的理论依据和具体流 程,并在标准文档集上的实验结果并和经典的检索算法进行了比较。 第六章总结与展望,对全文工作进行了总结并提出了未来的工作展望。 4 信息检索中迁移m a r k o v 网络模型的研究 第二章背景知识和相关研究 2 1 迁移学习理论 2 1 1 迁移学习发展历史 在“维基百科 当中是这样定义“迁移学习”的:它是机器学习中的一种应 用,它将一个问题或任务中所获知识用于另一个不同但相关的问题或任务。举例 来说,一个人认识了小轿车的形状之后,就会很容易地认识卡车。迁移学习很好 地获得在完成一个任务时所应用的知识,而这一先验知识可以很有效地为一新任 务做有效地假设,当通过问题实例泛化所有的学习后,迁移学习就着重迁移跨领 域,跨任务的知识,或者在相似但不同分布的数据中进行迁移学习。当人们熟悉 了迁移学习之后,即使在面对大相径庭的领域时,只要有计算学习理论的关联, 也存在少量的知识可用迁移n 仉1 1 - 1 2 1 。 在n i p s 9 5 主持了一场成功的有关“学会学习( 1 e a r n i n gt oi e a r n ) 两日 专题讨论会,该议题主要研究了对机器学习终身学习有益的值得保留并重用的先 验知识。研究这个议题的目的是大家逐渐认识到可从相关的先验经验中熟练控制 知识并用于机器学习系统。该专题讨论组发表了一系列关于“关联科学” c o n n e c t i o ns c i e n c e c s1 9 9 6 ,机器学习m a c h i n el e a r n i n g v 0 1 2 8 ,1 9 9 7 文章和一本书题为“学会学习l e a r n i n gt ol e a r n ” p r a t ta n dt h r u n1 9 9 8 的书有关推导迁移的研究从1 9 9 5 年开始持续至今,期间衍生了许多名字:学会 学习( 1 e a r n i n gt ol e a r n ) ,终生学习( 1 i f e l o n gl e a r n i n g ) ,知识迁移 ( k n o w l e d g et r a n s f e r ) ,迁移学习( t r a n s f e rl e a r n i n g ) ,多任务学习 ( m u l t i t a s kl e a r n i n g ) ,知识合并( k n o w l e d g ec o n s o l i d a t i o n ) ,语境敏感性学习 ( c o n t e x t - s e n s i t i v el e a r n i n g ) ,基于知识的推导偏差( k n o w l e d g e b a s e d i n d u c t i v e b i a s ) ,元学习乜2 1 ( m e t a - l e a r n i n g ) ,和增量学习 ( i n c r e m e n t a l c u m u l a t i v el e a r n i n g ) 而近两年,在这方面的研究活动主要是在 用核贝叶斯语境进行多任务学习中,研究通过捕捉任务的相关性来改进学习 a n d oa n dz h a n g0 4 ,b a k k e ra n dh e s k e s0 3 ,j e b a r a0 4 ,e v g e nio u ,a n dp o n ti1 0 4 ,e v g e n i o u ,m i c c h e l l ia n dp o n t i l0 5 ,c h a p e l l ea n dh a r c h a o u i0 5 2 0 0 5 年,b b a ( b r o a da g e n c ya n n o u n c e m e n t ) 赋予了迁移学习一个新的定义 即系统在过去的任务中识别和应用知识和技能应用到新任务中的能力。这就意味 着迁移学习是指迁移一个或多个源任务的知识到目标任务中,而不是同时学习所 有的源任务和目标任务。源任务和目标任务是不同的,这有别于“多任务学习 。 迁移学习技术是旨在试图利用少量训练数据将知识从以往的任务中迁出,转移到 硕十学位论文 新的目标任务当中。用图2 1 详细刻画如下: 图2 1 知识迁移的学习过程 在迁移学习中,存在三个主要的研究议题:( 1 ) 迁移什么? ;( 2 ) 如何迁移? ; ( 3 ) 何时迁移? ;“迁移什么 主要是研究哪部分知识可以跨领域,跨任务的进 行迁移。有些知识可能是某个任务和某个领域的特定知识,对于其他领域这些知 识是没用的,而且还有可能是噪音数据,所以迁移的意义不大,但有些领域的知 识可能是不同领域之间的普遍知识,那么这类知识的迁移则有助于新任务的实 现。在找到适合迁移的知识后,接下来的问题就涉及到了“如何迁移的问题, 这就需要研究算法去具体实现知识的迁移。“何时迁移”是指在什么场合下需要 进行迁移,同样需要明白什么时候不需要迁移。如果源领域和目标领域相关度很 低,大规模的知识迁移反而会带来噪音,降低系统的性能,这样的迁移是不成功 的,被称之为“负迁移( n e g a t i v et r a n s f e r ) ”。目前迁移学习的主要研究工作 是“迁移什么”和“如何迁移。所以目前有关迁移学习的研究工作是在假定源 领域和目标领域是相关的条件下进行的。然而,如何避免负迁移也是一个重要议 题,在未来会有更多关于这个议题的研究。 2 1 2 迁移学习的思想 在不同的情况,不同的条件背景下,迁移学习可以分为不同的种类,每一 类都有其特定的适应环境,根据现有的机器学习研究,将迁移学习分为以下几种: 1 在“诱导式迁移学习b 3 h 中,目标领域的一些已标注数据是可用的,根 据源领域的不同情况,可以进一步划分诱导迁移学习。( 1 ) 在源领域中如 果有很多已标注数据那么这就类似于“多任务学习”。然而诱导式的迁 移学习旨在通过迁移旧任务中的知识来实现目标任务的高性能,而多任 务学习是试图同时学习旧任务和目标任务;( 2 ) 如果源领域中没有足够的 已标注数据,这就类似于“自学习; 2 在“直推式迁移学习口3 埘m 中,源领域是足够的已标注数据,但目标领域 却没有已标注数据。这种情况下,需要假定条件概率p ( yx ) 不会随着领 6 信息检索中迁移m a r k o v 网络模型的研究 域的改变而改变,这里的x 是指输入变量,而y 是对应的标签。直推式迁 移学习同样与文本分类中知识迁移的领域适应性有关 2 4 。 3 最后,在“无指导迁移学习m h 中,源领域与目标领域的数据都是不可 得的,因此该背景下的研究主要是如何迁移知识用于聚类,维数约减和 其他无指导的学习任务中心5 1 。 表2 1 :不同背景下的迁移学习 背景 相关领域源领域标签目标领域标签任务 诱导式多任务学习可用可用回归;分类 迁移学习 自学习 不可用可用回归:分类 直推式 领域适应性,样本选 迁移学习择偏差,协方差变换可用 不可用回归:分类 无监督 不可用不可用聚类:维数约 迁移学习 减 表2 2 :不同的迁移学习方式 迁移学习的方法 简要描述 实例迁移对迁移到新领域的已标注先验数据进行重新赋权值 特征表示的迁移 寻找一个“好”的特征表示,减少不同领域的分类和回归模型的错误 参数迁移寻找源领域和目标领域中的公共参数或先验参数,将有利丁迁移学习 相关知识的迁移 在源领域和目标领域相关的基础上建立相关知识的映射。 表2 1 中提出的三种不同背景下的迁移学习根据“迁移什么? ”这一实质, 可归纳为四种迁移学习的途径( 见表2 - 2 ) 。第一种方式是“实例的迁移m h ,该 方法假设源领域的部分数据可以通过重新赋权值而被再次使用于目标领域。因为 重新赋权值和重要样本是该方法最重要的技术;第二种方式的迁移学习可被看作 “特征表示的迁移h ,这一方法的实质是:为目标领域学习一个“好的特征 表示。在这一背景中,跨领域迁移知识是学习一个高质量的特征表示的关键。在 新的特征表示中,目标任务的性能会有显著性提高;第三种迁移学习也叫做“参 数的迁移h 3 伽,该方法假设源任务和目标任务共享模型的参数和先验知识。所迁 移的知识是在共享的参数和先验数据中。因此,通过探寻共享的参数或先验数据, 知识便迁移到不同任务中去;最后一种迁移学习的方法称为“相关知识的迁移”, 该方法是用于解决相关领域的迁移学习问题。它的基本假设就是源领域和目标领 域是存在某种联系的。因此,知识可以通过数据之间的关系来进行迁移,近几年 7 硕士学位论文 来,统计关联学习技术占主导地位。 表2 3 :不同背景下使用不同迁移方法 诱导式迁移学习直推式迁移学习无监督迁移学习 实例迁移 _ 特征表示迁移 参数迁移 相关知识迁移 表2 3 显示了不同背景下使用不同的迁移学习方法。可以看到诱导式迁移学 习已经有了很多的研究,而无监督迁移学习还是个全新的研究课题,仅在特征表 示中进行了研究。此外,特征表示的迁移方法几乎运用到了所有的迁移学习背景 下。而参数迁移方法和相关知识迁移方法仅在诱导式迁移学习背景下有所研究。 2 2 迁移学习的应用研究 迁移学习理论主要研究人类在认知上的迁移能力并将其思维模式应用到机 器学习领域。该课题的研究能够带来机器学习的极大发展。通过迁移学习,可以 将一个领域学习到的知识应用到一个全新的领域中。对于提高机器学习的能力以 及人力财力上的消耗会有极大的帮助。考虑至u w e b 的数据复杂多样、这就使得需 要迁移学习的问题非常多,也意义重大,因此,迁移学习对于w e b 搜索与挖掘中 有很多的应用,主要包括:1 基于过时训练数据的文本分类,因为网络环境的日 新月异造成已标注的数据很容易因过时而被废弃,设计有效算法去充分利用先验 数据是非常有帮助的;2 跨语言文本分类,通过对开放式目录所做的统计发现己 标注英文网页数量达到2 m ,而其他语言的语料库非常小,例如,我们只能获得大 小为1 6 k 的中文网页,这样的大小差异性使得建立有效的分类器变得很困难;3 跨领域的敏感分类器。在当前敏感分类任务中,对于每个领域都需要标注大量的 训练数据,非常耗时耗力,我们希望通过将某一领域的知识迁移应用到其他领域, 实现分类知识的迁移m 一“3 2 】。 近几年来,迁移学习技术已被成功地运用到许多现实世界的领域。r a i n ae t 提出了利用迁移学习技术去挖掘跨领域的数据。b l i t z e re ta 1 u 刮提出了使用 s c l 来解决自然语言处理的问题,同样还有学者提出了扩展的s c l 来解决情感分类 问题。迁移学习主要强调通过多领域,多任务和相似分布的知识的迁移。 d a u m e i i i m a r c u ( 2 0 0 6 ) 乜朝结合大量的已标注的领域外的数据和部分已标注的领 域内数据,去训练一个统计分类器,并实现了对领域内的其他大部分数据类标的 信息检索中迁移m a r k o v 网络模型的研究 准确预测。w e n y u a nd a i ( 2 0 0 7 ) 1 研究了迁移朴素贝叶斯分类器用于文本分类, 首先估计已标注数据的初始概率,采用k l 距离测量不同分布的数据集的差异,然 后使用e m 算法去修正分类模型,使模型能成功对新的未标注数据进行分类。 迄今为止,国际上至少有两个关于“迁移学习”的比赛,在e c m l p k d d 一2 0 0 6 啪1 比赛的探索任务一一该任务就是解决个性化垃圾邮件过滤和多个相关学习任务 的泛化问题。为了训练一个垃圾邮件过滤器,通常需要收集大量的用户邮件,并 将这些邮件一一进行标注:垃圾邮件或非垃圾邮件,接着利用这些已标注的邮件 进行训练得到一个垃圾邮件分类器。对于一个新用户,我们希望这个分类器能很 好地为其分类出垃圾邮件和正常邮件,但由于训练所用的邮件和新用户的邮件分 布是不同的,这就涉及到了这个分类器的“迁移学习 问题。如何让已有的检索 模型适应新数据,适应新环境成为了一个重要的研究课题。 9 硕士学位论文 第三章信息检索概述 3 1 信息检索背景 随着社会的不断进步,特别是在互联网迅猛发展的今天,信息生活在人们的 日常生活中占据了越来越重要的地位。面对i n t e r n e t 海量的信息,如何对其进行 过滤,从而提取出对自己真正有用的内容,成为目前亟待解决的问题之一。早在 4 0 0 0 年前,人们就开始使用图书目录,方便快速查找大量的书籍。当面对更大规 模的数据量时,传统的目录已经远远不能满足人们的需求,于是出现了专门的数 据结构来存放目录信息,并逐渐的出现了索引的概念。电子计算机出现之后,索 引即可通过指向相关信息或文档的指针来实现。索引是每个现代信息检索系统的 核心,它们提供了数据的快速查询处理任务的速度。 自从1 9 4 8 年c n m o o e r s 在其m i t 的硕士论文中第一次创造了“i n f o r m a t i o n r e t r i e v a l 这个术语以来,在经过了以康奈尔大学的s a l t o n 等人为代表的学者 的精心研究之后,信息检索技术终于从实验室走向了大规模的商业应用之中。8 0 年代已经出现了一些商用的较大规模数据库检索系统,例如:l e x i s - - n e x i s 、 d i a o g 、m e d l i n e 。9 0 年代是i n t e r n e t 的繁荣时期,单纯的手工检索和机械检索都 显现出各自或多或少的缺点,因此有必要发展一种新型的信息检索方式,第一个 网络搜索引擎加拿大蒙特利尔大学开发的f t p 搜索工具a r c h j e 于1 9 9 0 年应运 而生了。受至u a r c h i e 的启发,美国明尼苏达大学的一个学生m a r km c c a h i 于1 9 9 1 年发明了一种口q g o p h e r 的搜索引擎,不仅能够搜索网络的文件,同时对网页也能 进行索引。随着1 9 9 4 年美国卡耐基梅隆大学的m i c h a e lm a u l d i n 仓1 建了l y c o s ,搜 索引擎终于迎来了它的繁荣时代。l y c o s 最大的优势是远胜过其它同时代搜索引 擎( 如:e x c i t e 、g a l a x y 、y a h o o 等) 的数据量,1 9 9 4 年创立之初收集了大约3 9 4 0 0 0 个文档。到1 9 9 5 年1 月,这个数量达到了1 5 0 万。而到1 9 9 6 年1 1 月,l y c o s 已经有 超过6 0 0 0 万个的文档。 如今,g o o g l e 和b a i d u 的巨大成功让整个世界都把眼光投入到搜索引擎这个 领域中。仿佛一夜之间,各种各样的搜索服务席卷而来。从最初的g o o g l e 、y a h o o 到现今的b a i d u 、m s n 、中搜、s o g o u 等等,搜索引擎的品牌越来越多,服务也越 来越丰富。同时,伴随着w e b 2 0 的普及,网络信息的膨胀速度呈指数级增长, 各种各样的网站都需要为其加入检索功能,以满足用户的需要。 1 0 信息检索中迁移m a r k o v 网络模型的研究 3 2 信息检索流程 信息检索( i r ,i n f o r m a t i o nr e t r i e v a l ) 研究的是如何从大量的信息资源中 找到满足用户信息需求的信息子集,涉及信息的搜集,表示,组织,存储,访问, 搜索等问题 b a e z a - y a t e s r i b e i r o - n e t o ,1 9 9 9 。广义的信息检索所覆盖的范 围比较广,从被检索的信息的表现形式来看,包括文本检索,图像检索,音频 视频检索等。狭义的信息检索是指文本检索( t e x tr e t r i e v a l ) 或者文档检索 ( d o c u m e n tr e t r i e v a l ) ,其任务就是研究如何从相对稳定的文本数据集中检索出 与用户查询相关的文本,并以相关度从高到低的顺序将检索结果返回给用户。在 i r 领域,这种检索问题也称为a dh o c 检索。其中用户提交的查询是对其信息需求 的一种描述,通常为几个关键字或是用自然语言描述的句子。 总体上,信息检索流程昭2 4 7 1 可分为四个部分:数据预处理,索引生成,查询 处理,检索。下面我们分别对各个部分采用的技术加以介绍。 1 数据预处理 目前检索系统的主要数据来源是w e b ,格式包括网页、w o r d 文档、p d f 文档等, 这些格式的数据除了正文内容之外,还有大量的标记信息,因此从多种格式 的数据中提取正文和其他所需的信息就成为数据预处理的主要任务。此外,众所 周知,中文字符存在多种编码,i :l 女i g b 2 3 1 2 、b i g 5 、u n i c o d e ( c j k 区) ,而原始数 据集往往包含多种编码,因此要正确地检索到结果必须进行统一编码转换。研究 者们对预处理部分要提取哪些信息并没有共识,这与后续处理所需的信息密切相 关,一般来说,正文、锚文本和链接地址都是需要提取的部分。 2 索引生成 对原始数据建索引是为了快速定位查询词所在的位置,为达到这个目的,索 引的结构非常关键。目前主流的方法是构造倒排文档表,每个文档都由一串词组 成,而用户输入的查询条件通常是若干关键词,因此如果预先记录这些词出现的 位置,那么只要在索引文件中找到这些词,也就找到了包含它们的文档。为了进 一步提高查询的速度,在组织索引时还可以采用一些更复杂的方法,i :t 女i b 树、 t r i e 树、哈希表等。这个阶段还需要对预处理之后的文档进行词法分析,这是因 为很多语言的文本都不宜直接把文中的字符串用于建立索引。例如,中文里的词 与词之间不存在分隔符,因此必须先进行分词;而英文中的词存在很多变形,比 如“c o m p u t e r 就存在“c o m p u t e s ”,“c o m p u t i n g ,“c o m p u t e d 等多种变形, 应先进行词根还原。此外,有些词虽然出现频率很高,但对于查询没有任何帮助, 比如“的 、“了”等,就无需放入索引,为此需要预备一个停用词表( s t o p w o r d l i s t ) 对这类词进行过滤。 3 查询处理 用户输入的查询条件可以有多种形式,包括关键词、布尔表达式、自然语言 硕十学位论文 形式的描述语句甚至是文本,但如果把这些输入仅当作关键词去检索,显然不能
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 出口包装符合性认证协议
- 车辆维保合同
- 电化学反应工岗前实操评优考核试卷含答案
- 花卉园艺工安全生产意识知识考核试卷含答案
- 磁选工变革管理水平考核试卷含答案
- 汽车拆解工岗前安全宣传考核试卷含答案
- 景泰蓝制胎工操作强化考核试卷含答案
- 中药材生产技术员岗前协同综合考核试卷含答案
- 2026年秋季小学一年级新生班主任适应教育课件
- 玻璃釉印工安全检查水平考核试卷含答案
- 知识点复习提纲 高一统编版2019必修中外历史纲要上册
- 老年痴呆健康教育知识讲座
- 数字化教材与传统教材的比较研究与发展趋势
- 《长征精神》课件
- 高级微观经济学
- 除雪设备操作保养规程
- 音乐欣赏(高职)PPT完整全套教学课件
- 设施农业环境工程学(陈)课件
- 2022年辽宁医药职业学院教师招聘考试真题
- 高考作文指导如何进行事例分析
- 2023年淄博市第一人民医院康复医学与技术岗位招聘考试历年高频考点试题含答案解析
评论
0/150
提交评论