基于PARADISE平台论文检索系统_第1页
基于PARADISE平台论文检索系统_第2页
基于PARADISE平台论文检索系统_第3页
基于PARADISE平台论文检索系统_第4页
基于PARADISE平台论文检索系统_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

表格3]表格SEQ表格\*ARABIC3analysisindexsearchfront_evidence(1)analysis是预处理模块,用于对网页进行去噪、消重以及编码转换等等处理,如果是对网页构建搜索引擎,这一步骤就可以省略了。(2)index是索引模块,用于将需要检索的部分建立倒排索引。具体如何使用5.2会提到(3)search是搜索模块,将index建成之后,就可以利用index数据开启搜索服务,对于每一个词,去倒排索引里面查找包含它的文档中的id号(网页中为url),从而完成检索。(4)front_evidence是前台模块,完成一个类似于天网搜索引擎的前台界面。除了现实结果之外,还进行摘要处理,一个文档的摘要。这个地方需要注意的就是与index部分有一定的结合,会在后面提到。除了以上4个大的模块之外,paradise还提供了很多可供选择以及继承修改的小模块例如,在search的语言模型这个部分,可以选择需要的模型,也可以自己重写一些语言模型。压缩的时候,可以选择vint、pfordelta等等各种压缩算法paradise系统接口设计得非常好,当需要对上面任何一个模块进行修改时,不需要修改源代码,只需要自己重写一些继承的类就可以了。

5.2修改索引部分 对于本次的文献检索部分,只需要继承一个索引部分的类就可以了,具体代码如下(这里只贴出最关键的两端代码,中间还省略了一些代码),其中黄色背景的是需要我们修改的部分。voidmain(){Analyzer*analyzer=newNaiveAnalyzer(); compressorFactory=newPForDeltaCompressorFactory(); IndexWriter*writer=newIndexWriter(fsdir,analyzer,compressorFactory);writer->setMergeThreshold(mergesize);PDFParserparser;if(begin!=0){while(begin>0){parser.hasNext();begin--;}}intdoc_id=1;Timert;while(parser.hasNext()){shared_ptr<paradise::PDFContent>pContent=parser.getContent();addDocument(pContent,writer,doc_id);if(num>=0&&doc_id>=num){break;}}} 在上面的这段代码中,可以看出,首先建立了一个分析模块,然后选择压缩方式为pfordata,然后建立一个IndexWriter,这个是建立索引的类。而我们需要做的事情,就是:重写一个Parser类,这里的名称为PDFParser,这个parser需要有hasNext,getContent这两个函数即可。重写一个Content类,里面存有所需要建立索引的document的内容,由上面的getContent类返回。重写adddocument函数,如下,其中关键部分黄色背景标注intaddDocument(shared_ptr<paradise::PDFContent>pContent,IndexWriter*pWriter,int&doc_id){paradise::index::document::Documentdocument;shared_ptr<Field>field_content=Field::TextStatistics("Content");shared_ptr<FieldData>field_content_data(newFieldData(pContent->getContentToken()));field_content.get()->setFieldData(field_content_data);document.addField(field_content,NONSTATIC);shared_ptr<Field>field_ID=Field::Keywords("Url");shared_ptr<FieldData>field_ID_data(newFieldData(PDFFunction::Int2Str(pContent->getID())));field_ID->setFieldData(field_ID_data);document.addField(field_ID,NONSTATIC);…document.setDocId(doc_id);pWriter->addDocument(document);doc_id++;} 上面的代码中,首先建立一个Content域,内容为我们的文献全文形成的字符串。然后建立了一个url域。其中,url域及其重要,是必须有的一个域,而且必须名为Url。我们知道,所谓倒排索引,是指对一系列文本的内容简历索引,通过这些内容,可以获得这些文本的ID号,就如网页搜索一样,我们通过那些网页的内容,搜索到网页的url。这里我们将文献的文本内容存在BerkeleyDB中的,因此需要获得每个文章的id号。Paradise系统的设置是,在我们开启一个搜索服务时,一个请求发向服务器端之后,服务器端会将搜索到得结果的url列表返回给前端,这个url列表必须是来自上面的Url域。因为Paradise主要是针对网页搜索的,所以称这个域为Url,实际上应该叫DocumentID更确切一点。5.3修改前台部分Paradise的前台部分也设计的很好,特别是摘要算法也已经完成,因此对于前台部分,只需要修改一点,就是提供一个候选摘要的数据库。我们知道,不可能对整篇文章进行摘要算法,那样会耗费大量的时间,最终会导致前段所耗费的时间比后端检索所花费的时间还多,这显然是用户无法接受的。因此,前台部分唯一需要修改的部分,就是给定一个ID号,获得它的摘要。这里,我们利用了前面获得的metadata.dpt文件,里面存有一篇论文的摘要,获得摘要段落之后,对其利用摘要算法,可以获取较好的效果。另外,我们这个系统不是简单的一个论文检索系统,检索只是方便使用的工具,更重要的,它是一个知识提取系统,因此,还需要自己编写一些界面用来显示知识,这些就不再赘述。5.4系统示意图

5.4.1主界面5.4.2搜索结果界面5.4.3评论界面

第6章实验结果与分析6.1实验结果 在我们的实验数据里,我们总共抓取了2500篇论文,其中在我们的论文集里被其他论文引用的文章个数为1686篇,总共被引用72471次,平均每个论文被42论文引用。这些论文中,总共能找到的评论句子个数为160046个。平均每个论文有个95评论句子,每个论文在被另外一篇论文引用时,平均约被评论2.2次 根据上面的比率,可以看出,如果我们最终显示在界面上的评论个数需要是5个,那么一篇论文,它被1到2篇论文引用时,就会获得足够的评论集。如果被5篇论文引用时,就会获得效果很好的评论集了。6.2具体分析为了很好的说明我们所做的这个系统的效果,下面随即选取一篇评论较多论文为例,来说明我们获得的这些评论以及概括的作用。[5]AaronElkiss,SiweiShen,AnthonyFader.Blindmenandelephants:Whatdocitationsummariestellusaboutaresearcharticle?JournaloftheAmericanSocietyforInformationScienceandTechnology,pages51-62

,2008.

PaperName:Three-levelcachingforefficientqueryprocessinginlargeWebsearchengines 从题目可以看出,这篇论文是用三级缓存来处理搜索引擎中大规模的请求的。Abstract:Largewebsearchengineshavetoanswerthousandsofqueriespersecondwithinteractiveresponsetimes.Duetothesizesofthedatasetsinvolved,oftenintherangeofmultipleterabytes,asinglequerymayrequiretheprocessingofhundredsofmegabytesormoreofindexdata.Tokeepupwiththisimmenseworkload,largesearchenginesemployclustersofhundredsorthousandsofmachines,andanumberoftechniquessuchascatching,indexcompression,andindexandquerypruningareusedtoimprovescalability.Inparticular,two-levelcachingtechniquescacheresultsofrepeatedidenticalqueriesatthefrontend,whileindexdataforfrequentlyusedquerytermsarecachedineachnodeatalowerlevel.Weproposeandevaluateathree-levelcachingschemethataddsanintermediatelevelofcachingforadditionalperformancegains.Thisintermediatelevelattemptstoexploitfrequentlyoccurringpairsoftermsbycachingintersectionsorprojectionsofthecorrespondinginvertedlists.Weproposeandstudyseveralofflineandonlinealgorithmsfortheresultingweightedcachingproblem,whichturnsouttobesurprisinglyrichinstructure.Ourexperimentalevaluationbasedonalargewebcrawlandrealsearchenginequerylogshowssignificantperformancegainsforthebestschemes,bothinisolationandincombinationwiththeothercachinglevels.Wealsoobservethatacarefulselectionofcacheadmissionandevictionpoliciesiscrucialforbestoverallperformance. 摘要部分,先说了搜索引擎的负载很重的概况;然后介绍现有的两级catch有一定的缺点,而作者完成了一个三级缓存,在原有的缓存加入了一个中间层;最后说本文用到了一些算法,并且最终实验结果的性能也很好。 通过阅读摘要,我们就知道这篇论文的概况以及来龙去脉。Comment:(1)Theymaybeconsideredseparateandcomplementarytoacache-basedapproach.RaghavanandSever[thecitedpaper],inoneofthefirstpapersonexploitinguserqueryhistory,proposeusingaquerybase,builtuponasetofpersistent“optimal”queriessubmittedinthepast,toimprovetheretrievaleffectivenessforsimilarfuturequeries.Markatos[10]showstheexistenceoftemporallocalityinqueries,andcomparestheperformanceofdifferentcatchingpolicies.(2)Ourresultsshowthatevenunderthefairlygeneralframeworkadoptedinthispaper,geographicsearchqueriescanbeevaluatedinahighlyefficientmannerandinsomecasesasfastasthecorrespondingtext-onlyqueries.ThequeryprocessorthatweuseandadapttogeographicsearchquerieswasbuiltbyXiaohuiLong,andearlierversionswereusedin[26,27].ItsupportsvariantsofalltheoptimizationsdescribedinSubsection1.(3)thesurveybyGaedeandG¨ntherin[17].Inparticular,ourualgorithmsemployspatialdataorganizationsbasedonR∗-tree[5],gridfiles[thecitedpaper],andspace-fillingcurves-see[17,36]andthereferencestherein.AgeographicsearchenginemayappearsimilartoaGeographicInformationSystem(GIS)[20]wheredocumentsareobjectsinspacewithadditionalnon-spatialattributes(thewordstheycontain). 下面我们来逐条分析上面获得的评论。 从(1)中可以看出,该条评论并没有源论文的三级缓存结构,而是比较看重其中的一个方法:利用用户请求的历史记录,基于以前所获得的比较理想的查询词,简历一个用户请求库,来提高搜索引擎的中相似的请求的处理速度。这句话就很好的告诉了我们源论文中三级缓存的一个方法,并且可以看出,这个方法并不仅仅可以用在三级缓存中,也可以用在个性化搜索等方面。 从(2)中可以看出,该条评论说明了它利用了源论文中的请求处理器,来搭建了一个地理搜索引擎。通过这一条评论我们可以看出源论文的后续工作,有什么用处。源论文并不仅仅在三级缓存结构上有研究,其请求处理模型很可能用处更大。 从(3)中可以看出,源论文中使用了一种gridfiles的系统或者算法,它和R*-tree、空间填充曲线这些算法结合,能够形成一种特殊的数据结构。这也代表了源论文后续工作的一种,方便了读者以更加广阔的视野来看待该论文。 Impact-basedSummary:(1)Thismotivatesthesearchfornewtechniquesthatcanincreasethenumberofqueriespersecondthatcanbesustainedonagivensetofmachines,andinadditiontoindexcompressionandquerypruning,cachingtechniqueshavebeenwidelystudiedanddeployed.(2)Ourexperimentalevaluationbasedonalargewebcrawlandrealsearchenginequerylogshowssignificantperformancegainsforthebestschemes,bothinisolationandincombinationwiththeothercachinglevels.(3)Todoso,theenginetraversestheinvertedlistofeachqueryterm,andusestheinformationembeddedintheinvertedlists,aboutthenumberofoccurrencesofthetermsinadocument,theirpositions,andcontext,tocomputeascoreforeachdocumentcontainingthesearchterms.(4)Querycharacteristics:Wefirstlookatthedistributionoftheratiosandtotalcostsforquerieswithvariousnumbersofterms,byissuingthesequeriestoourqueryprocessorwithcachingcompletelyturnedoff.(5)Thus,recentqueriesareanalyzedbythegreedyalgorithmtoallocatespaceinthecacheforprojectionslikelytobeencounteredinthefuture,andonlytheseprojectionsareallowedintothecache. 最后我们来分析获得的基于影响的概括,这里,为了节省篇幅,只取了前5句来进行分析。 从(1)中可以看出,该论文缓存不仅仅是为了提高每秒钟处理的请求量,还能够进行索引压缩以及请求的删减等工作。这些工作可能研究点更多,后续工作较多,影响较大,因此排在了前面。 从(2)中可以看出,这篇论文是基于网页抓取以及真实得搜索引擎请求的日志来进行评测的,在单独处理以及与其他的结合方面都很好,这是这篇论文的成果。 (3)主要介绍了这篇论文的一个技术细节。 从(4)中可以看出,这篇论文为了实现缓存结构,需要对请求的性质进行描述,并计算出一些概率方面的只是。 从(5)中可以看出,这里提到了一个贪婪算法,用于为缓存分配空间,以便于未来搜索的数据的增大,缓存也不断增大所带来的空间需求。 综上所述,我们在对这篇文章完全没有了解的情况下,通过阅读摘要,知道了它的大体内容是做三级缓存的。知道了它被别的文章经常引用的地方在于三级缓存中的记录用户日志的方法,以及这篇文章的实际用途。我们还了解到这篇文章的重点部分,包括完成缓存之后的后续工作,与搜索引擎结合,记录用户日志等等。这样,我们在阅读一篇论文时,就可以带着一定的目的性去阅读它。如果我们是在阅读了这篇文章之后,再阅读以上的这些信息,那么可能更加有助于我们对这篇文章的理解,除了站在作者的角度考虑他对自己的文章中那些部分比较侧重,还可以从别的专家对这篇文章的评论中获得这篇文章还有那些更加值得我们注意的和学习的地方。

第7章后续工作

在获得了别人对一篇论文的评论以及这篇论文基于影响力的概括之后,我们可以对这两段话做更多的分析,获得更好的效果。

例如,可以对基于影响力的概括进行分类[6]Nanba,Hidetsugu,NorikoKando,andManabuOkumura.Classificationofresearchpapersusingcitationlinksandcitationtypes:Towardsautomaticreviewarticlegeneration.InProceedingsofthe11thSIGClassificationResearchWorkshop,pages117–134,2004,分成定义和实现这两大类Nanba,Hidetsugu,NorikoKando,andManabuOkumura.Classificationofresearchpapersusingcitationlinksandcitationtypes:Towardsautomaticreviewarticlegeneration.InProceedingsofthe11thSIGClassificationResearchWorkshop,pages117–134,2004VahedQazvinian,DragomirR.Radev.ScientificPaperSummarizationUsingCitationSummaryNetworks.undisclosedconferenceorjournal,pages1-9,2008.还有,我们获得的这些评论以及概括,都是对于一些相对于老的论文比较有效,而对于较新的论文,显然易见,它的被引用次数会很少,很难获得评论,似乎这个系统对这些论文就没有什么作用了。但是实际上,我们可以利用自己的系统,对这些新来的论文进行评价。如,一篇会议刚刚接收了一篇新论文A,它引用了一个老论文B,我们可以获得B的评论以及概括commentB和impact-basedsummaryB,而A中如果有一句话s对B进行了评论,那么,就可以通过s与commentB以及impact-basedsummaryB之间的关系,判断s这句话是好是坏。对A的每一个引用都进行上述过程,那么,最终,可以自动判断这篇新论文A的质量如何。在对获得的那些评论以及基于影响的概括进行打分排序时,可以利用到一些那些评论的作者以及发表的会议等先验知识。显然,当一篇论文的作者较有知名度,发表的会议等级较高时,那么它对它引用的论文的评论要更加具有专业性。 此外,关于论文的检索部分,学术检索有其自己的特点。和websearch不一样,学术检索一篇文本的长度非常之长,因此文献页很多,一个查询词来了,可能第一个词在第一页,第二个词在最后一页,实际不相关,却作为相关结果返回了,因此,可以利用基于对象的语言模型([8]ZaiqingNie,YunxiaoMa,ShumingShi,Ji-RongWenandWei-Yi

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论