汉语自动分词与内容分析法研究_第1页
汉语自动分词与内容分析法研究_第2页
汉语自动分词与内容分析法研究_第3页
汉语自动分词与内容分析法研究_第4页
汉语自动分词与内容分析法研究_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、汉语自动分词与内容分析法研究前言汉语自动分词是目前中文信息处理中公认的难题,因为汉语自动分词是自然语言理解、机器翻译、信息检索、语言文字研究、汉语文本自动标引、内容分析等研究领域中最根本的一个环节,也是中文信息自动处理的“瓶颈。假如能打破这一“瓶颈,那么中文信息的自动处理就会迎刃而解,甚至意味着中华民族文化复兴的开场,因为它已经为汉语走向全世界翻开了一扇方便之门。近年来,由于计算机技术的飞速开展,汉语自动分词研究获得了打破性进展,其应用研究也越来越受到人们的重视,应用范围也越来越广。内容分析就是汉语自动分词应用研究的重要领域之一,因为汉语自动分词是内容分析法的前提和基矗随着内容分析法的兴起及其

2、广泛应用,研究汉语自动分词在内容分析法中的应用就变得非常迫切和必要了。1已有的分词方法为了克制汉语词计算机自动切分这一难题,许多年来,大量的学者都参加了这一领域的研究,使汉语自动分词获得了丰硕的研究成果。归纳起来,目前国内公开报道过的汉语自动分词系统采用的分词方法主要有三种类型18:(1)机械分词法。又称词典式切分法。机械分词法主要有最大匹配法法、逆向最大匹配法(R、I)、逐词匹配法、部件词典法、词频统计法、设立标志法、并行分词法、词库划分和联想匹配法等。(2)语义分词法。语义分词法引入了语义分析,对自然语言自身的语言信息进展更多的处理,如扩大转移网络法、知识分词语义分析法、邻接约束法、综合匹

3、配法、后缀分词法、特征词库法、约束矩阵法、语法分析法等。(3)人工智能法。又称理解分词法。人工智能是对信息进展智能化处理的一种形式,主要有两种处理方式:一种是基于心理学的符号处理方法,模拟人脑的功能。像专家系统即是希望模拟人脑的功能,构造推理网络,经过符号转换,从而可以进展解释性处理。一种是基于生理学的模拟方法。神经网络旨在模拟人脑的神经系统机构的运作机制来实现一定的功能。以上两种思路也是近年来人工智能领域研究的热点问题,应用到分词方法上,产生了专家系统分词法和神经网络分词法9。2当前汉语自动分词研究的重要趋势汉语自动分词是一个综合性的难题,涉及到众多的学科和研究领域,需要多个学科的研究成果作

4、为基矗但是随着科学技术的快速开展,汉语自动分词也并非遥不可及。根据目前汉语自动分词的研究现状,以及相关学科的开展情况,汉语自动分词有望在三个重大研究领域获得打破性进展。2.1克制汉语文本切分中的困难,继续研究传统文本切分的有效方法目前,汉语自动分词的研究重心主要集中在克制传统文本切分中存在的困难,对传统文本的有效切分上。在计算机科学、情报科学和语言文字研究三个领域的学者专家们的共同努力之下,传统文本的有效切分已经获得了重大进展。(1)汉语词的标准研究。汉语词的标准是汉语自动分词的基矗没有统一和明确的汉语词的定义,没有标准的汉语分词词表,汉语自动分词就无从谈起。在汉语语言学家和计算机中文信息处理

5、专家们的共同努力之下,目前,我国汉语词的标准研究和汉语分词标准词表的制定已经有了较大打破。?信息处理用现代汉语分词词表?的制定及不断完善,说明了我国在汉语自动分词词表方面获得了重大研究成果,这为汉语自动分词的研究铺平了道路1014。(2)汉语词自动分词算法研究。分词算法研究是汉语自动分词的重点和难点,每一次分词算法上的打破都会使汉语自动分词的速度和精度有较大进步。据不完全统计,目前,在汉语自动分词方法和算法研究中,已经出现了上百种分词方法和算法1519。传统汉语自动分词要获得新的打破,只能结合新的信息技术,在分词算法上做文章,必须在现有的分词算法和方法的根底上找到新的分词算法,这是今后汉语自动

6、分词努力的重要方向之一。(3)汉语自动分词歧义处理研究。汉语自动分词的主要困难是歧义切分,而歧义在自动分词中普遍存在。随着自动分词研究的打破,分词歧义处理研究也获得了重大进展。以前的消歧方法大体可分为两类:规那么方法与统计方法20。由于自动分词中存在三种歧义类型,不同类型的歧义,其产生的根源和消除的方法各不一样。因此,应针对不同的歧义类型采取不同的解决方法。对于第一类歧义,由于他们本身就是汉语言中的歧义问题,解决这类歧义需要依靠上、下文语义信息,即增加语义、语用知识的处理。这无异对自动分词的效率有很大的影响时间上和空间上,而且实现起来比拟困难。假设是在词处理的相应阶段,结合对分词阶段未解决的歧

7、义字段进展处理,那么会起到事半功倍的效果。统计说明,第一类歧义字段不到整个歧义字段总数的1/30,因此不必在分词阶段花费宏大的开销来处理它们。目前对第二类歧义处理方法主要有以下几种:分词知识处理法、联想回溯法、基于词频统计的方法、邻接约束法、基于数学期望的方法。处理第三类歧义目前主要有两种方法:一是增加构词知识,扩大词典,二是增加临时词典。此外,还可以人工干预分词,人工分词与计算机自动分词结合。在遇到计算机解决不了的歧义时,借助于人工干预来完成。为了有效地消除歧义字段,还可以在上述方法的根底上建立分词歧义知识库或规那么库2123。随着计算机技术和汉语语言研究的进展,汉语词自动切分歧义处理技术将

8、会有更大的打破。(4)汉语自动分词应用研究。目前,汉语自动分词主要在信息检索、自动标引、自动文摘、机器翻译、语言文字研究、搜索引擎研究、自然语言理解和中文信息处理等方面的应用获得了可喜的成绩。随着汉语自动分词技术的进一步开展,这一研究成果将会更广泛地应用到更多的研究领域,如词频统计、内容分析、概念分析、认知心理学和汉语语言学等方面24。2.2将人工智能技术与汉语自动分词研究有机结合起来汉语自动分词是中文信息处理的“瓶颈问题,它的最终解决依赖于汉语的分词构造、句法构造、语义等语言知识的深化系统的研究;依赖于对语言与思维的本质的提醒;同时,在很大程度上还依赖于神经网络、专家系统、知识工程等人工智能

9、技术研究的新进展。计算机技术和人工智能技术是汉语自动分词的技术根底,计算机技术开展的每一次宏大飞跃都是汉语自动分词的福音。因为自然语言处理与理解既是人工智能研究领域需要解决的重大课题,也是汉语自动分词研究的重要内容。因此,汉语自动分词研究开展的同时也寄希望于人工智能技术的新打破。目前,人工智能技术的重点研究领域主要是专家系统、神经网络技术和生物芯片技术。从人工智能技术的开展和汉语自动分词的要求出发,比拟理想的自动分词系统应该综合词法、句法和语义信息,而用计算机对语义、语法进展自动分析尚处在研究阶段。因此,已经推出的汉语分词与标引系统只能采用以机械分词为主,辅之以能局部反映词法、句法和语义规那么

10、的改良算法,但仍难以解决复杂的汉语组词关系。因此,今后应注重汉语句法和语义的自动分析研究,并将其应用到汉语自动分词领域。重点应集中在引入知识分词的技术与方法,采用知识分词语义分析法进展自动分词系统的研究。从目前已经公开的各种分词方法看,性能比拟优异且具开展前景的应首推基于符号和启发式推理的专家系统和基于数值和算法的神经网络技术。神经网络具有联想、容错、记忆、自适应、自学习和处理复杂多形式等优点,缺乏的是网络连接模型表达复杂,训练过程较长,不能对自身的推理方法进展解释,对未在训练样本中出现过的新词汇不能给予正确切分。专家系统具有显式的知识表达形式,知识容易维护,能对推理行为进展解释,并可利用深层

11、知识来切分歧义字段,缺点是不能从经历中学习,当知识库庞大时难以维护,在进展多歧义字段切分时耗时较长,同时在知识表示、知识获取和知识验证等方面存在一些问题。因此,将人工智能技术与汉语自动分词研究有机结合起来,把神经网络技术与专家系统严密联络起来用于汉语自动分词与标引系统将是该领域的开展趋向25。2.3改造汉语文本书写规那么使之利于计算机自动处理当现有的分词方法和人工智能技术不能有效地解决汉语词自动切分中的困难时,必须有一种新的思维方式来引导汉语自动分词的研究,那就是要研究汉语语言本身的特点和规律,从汉语书面语的书写规那么出发来寻求汉语自动分词的打破口。这也许是汉语自动分词开展的新方向。对汉语书写

12、规那么进展适当改造,以使其便于计算机自动切分,不是一种主观梦想。这样做既有理论根据,又有现实例子。其理论根据在于,其他许多语言虽然没有汉语那样博大精深和妙不可言,但却有利于计算机自动处理的优势,实有可取之处。而且任何一种语言都处于不断变化和开展之中,有益的东西要吸收进来,不利的东西要抛弃,并使其趋于完善。完善是相对而言,并非一成不变。语言产生和开展的真正意义还在于,便于交流和利用。这就是为什么解放后我国要进展屡次汉语改革的原因。而这些成功的汉语改革正是我们对汉语书写规那么进展改造的现实根据。为了使汉语走向全球,为了中华文化的再次伟大复兴,随着信息时代的到来,我们必须对汉语进展改革。因为它牵系一

13、个民族开展的前途和命运。对书面汉语书写规那么进展改造与标准,可以吸收其他语言在计算机处理中的优点。如可以从西方语系如英语得出启示,也可以从东方语系如日语和韩语得到启发,还可以汲取藏文自动处理的做法。这些语言都有合适计算机自动处理的优势。西方语系与汉语的明显不同之处在于,西文都是拼音文字,词与词之间有空格等明显的间隔符,因此不存在语词切分的问题。西语的这一显著特征适应了计算机自动处理开展的要求,使得西语在计算机自动文字处理上具有较大优势。这是一种偶尔,可以说是上帝赐予西方人的最好礼物。汉语显然不具备这一特征,而恰恰正是这一点又使得汉语不利于计算机自动处理,给我们留下了一个世纪难题。这是否能给我们

14、一些启示呢?我们能否在汉语的书写上向西方人学习呢?这是值得我们考虑的。当然,我们不必完全模拟西文而抛弃中文应有的特色和优点。为了使汉语便于计算机自动处理,我们只需要对现有的汉语语法规那么作如下改造:一是要对汉语词进展明确规定,即界定什么是词;二是要在汉语文本的词与词之间增加适当的间隔符,即设立分词标志;三是要制定完好的汉语书写规那么。这些都可以在汉语文本生成之前完成,如,由作者本人在写作时完成,或由出版编辑部门在稿件编辑时完成。这样我们就不必消耗巨资设计种种算法、编写各种软件来对传统文本进展切分了。假如我们觉得西方语系难以承受的话,那么我们只要看看日语和韩语就应该有所启发了。日语同汉语非常接近

15、,但日语较汉语合适于计算机自动处理。这是因为日语有丰富的词缀,日语中大量使用片假名和平假名构成了书面日语的词尾变化,而这些词缀可以作为计算机识别词的标志。虽然汉语不能像日语那样构造大量的词缀来作为词的标志,但是可以模拟日语设立其他词缀来区分词,如在词与词之间增加分隔符。韩语本身也有合适计算机自动处理的优势,因为韩语是部件式构造,能进展自由拆分和组合。而我国藏族的藏语是黏着性语言,在一定意义上,我们可以把传统藏文语法看作是由格助词及其接续特征规那么构成的语法系统。这一语法系统的主要特点就是:各类名词性成分借助格助词及其接续特征规那么构成句节进而由句节结合动词来组织句子。一般而言,藏语的句子是以动

16、词为中心来组织的,动词决定着格助词的添接规那么26。相比之下,汉语那么明显缺乏足够的自动分词信息,所以必须对汉语文本进展改造,添加必要的分词信息。基于以上启示,汉语的书写规那么是完全可以进展改造的。假如词的范畴已经明确,书写规那么已经制定,而且分隔符也已确定,那么我们就可以对汉语书写规那么进展适当的改造了。这是一种新的分词思维,是一种类似英语词切分的无词典式分词方法,即改造书面汉语书写规那么,在标准词的根底上,书写或录入时在词与词之间增加分隔符,增加自动分词信息,以便计算机自动识别和切分。这是一种一劳永逸的分词方法。尽管目前我们还不习惯,但是一旦它形成标准,而编辑部和出版社又按此标准对稿件进展

17、标准时,我们有理由相信只要假以时日,就会有一种新的合适计算机自动处理的新的汉语文本出现,而这种文本并不破坏汉语自身固有的特色和优点。此外,在进展信息交流和处理时,我们除了使用自然语言之外,还有很多其他的人工语言,如数学语言、检索语言、逻辑语言、程序设计语言等,是自然语言交流的补充。这些人工语言和自然语言一样都有一个共同特点,那就是都有一定数量的符号系统和一套完好的语法规那么。但是,这些人工语言在很大程度上都适应了计算机技术的开展,具有较强的生命力。由此可得,我们应该能像这些人工语言一样设计出一套新的语言符号系统,模拟现有的汉语语言,并对其进展改造。例如,在数学语言中,“因为通常用“表示,“所以

18、通常用“表示,清楚明白,一看便知。又如,在普通逻辑的三段论推理中,分别用“P、“S、“表示大前提、小前提和结论。数理逻辑和各种程序设计语言中的符号系统更是非常完备,完全可以用来进展信息表示、信息传递、信息存储和信息处理,并实现信息的自由交流。3汉语自动分词应用研究书面汉语自动分词的研究具有重要的理论和应用价值,它的最终解决将对以下几个方面产生本质性影响35:汉语语言理解;计算机系统的汉语人机接口;机器翻译;情报检索、信息检索和自然语言检索;自动标引;自动编制文摘、目录与索引;词频统计、概念分析和内容分析;语言文字自动处理;人工智能和知识工程;智能计算机;专家系统和知识库;搜索引擎和网站建立;数

19、据挖掘、知识挖掘;汉语语言学;认知心理学等。正是由于自动分词问题在以上研究领域的重要性,所以它受到人工智能界、汉语语言学界、情报检索界、计算机应用界和其他各界人士的广泛关注。汉语自动分词应用相当广泛,已经在信息检索、自动标引、自动文摘、机器翻译、语言学研究、搜索引擎研究和自然语言理解等方面获得了重大的研究成果。(1)信息检索。自动分词与信息检索的结合实现自然语言检索接口是自然语言检索的一个重要方面,自动分词是实现基于自然语言理解的智能检索的前提,是贯穿于信息检索系统整体流程中不可缺少的处理步骤27。在信息检索系统的设计中,假如能先解决自动分词问题,就会大大进步检索系统的检索效率。检索语言的开展

20、趋势应是检索语言的自然语言化开展与自然语言的检索语言化开展的双向结合。转贴于论文联盟.ll.(2)自动标引。以自动分词为根底,专家学者们研制出了多种自动标引系统,归结起来有:词典切分标引法、单汉字标引法、机助标引法、统计标引法、逻辑推理法、语法语义分析标引法、自动标引专家系统和神经网络分词标引法等。这些自动标引方法可以分为三类,即统计法、语言法和人工智能法。并相应地开发出了一些科学实用的自动标引系统2830。(3)自动文摘。自动文摘是自动分词的一个非常重要的应用领域。国外在自动文摘研究方面已经获得了丰富的研究成果,并开发了大量实用的自动文摘系统。相比之下,汉语自动文摘研究较为困难,研究成果也相

21、对较少。汉语自动文摘必须首先攻克汉语自动分词这一难题。尽管困难重重,我国在自动文摘研究方面仍然获得了一系列可喜的成绩,自动文摘理论和方法研究成果不断涌现,针对汉语自身特点而开发的中文自动文摘系统也开场由实验走向应用31。(4)机器翻译。机器翻译本质上是对人类思维和语言活动的模拟,打破的焦点是让计算机理解和表达人类的语言。目前国内外关于机器翻译研究已获得了丰富的研究成果,并已经进入了实用性应用阶段。但要实现全自动高质量的机器翻译仍是一个长远目的,不可能在短期内实现,需要多个领域的学者专家们长期不懈的努力和追求32。(5)搜索引擎研究。中文搜索引擎的重点在于中文关键信息的提取,其中的难点就是中文自

22、动分词。随着因特网在我国的开展和普及,中文搜索引擎研究有了重大打破。在短期内就涌现出了许多重要的中文搜索引擎,并得到了广泛应用。目前,已开发并投入使用的中文搜索引擎已达上百种,并且数量仍在不断增加,质量也不断进步。但是,中文搜索引擎研究开发仍然存在大量的问题,如在信息组织、检索速度、检准率和检全率等方面还有较大的开展空间。今后,中文搜索引擎的研究方向应是将中文自动分词、信息检索、自然语言理解和人工智能等与搜索引擎研究相结合3334。(6)语言文字研究。计算机的出现和开展,引起了科学技术的宏大变化,也为语言学研究开拓了新的开展途径。计算机一方面对语言学提出了一系列新的要求,希望能用语言学武装其“

23、头脑,以开展它的智力如赋予它信息检索才能、语言翻译才能、自然语言理解才能;给它添加“翅膀,以赋予它更强的听觉如识别口语、视觉如识别文字、说话如言语合成和听写才能如语音打字。另一方面它又充当语言学的得力助手,帮助语言学工作者对语言素材进展分类、统计、演算、控制和模拟等。这也正是内容分析法需要研究的重要内容之一。将计算机与语言学有机结合起来,彼此互助,彼此互补,计算机便可能实现高度智能化。利用计算机来处理自然语言是一门新学科,即计算语言学。目前研究得比拟多的课题有:机器翻译、情报检索、言语识别和言语合成、汉字信息处理、语音分析、人工智能中的自然语言理解等35。(7)自然语言理解。自然语言理解是人工

24、智能研究的最重要课题之一,同时也是自动分词研究最前沿的难题之一。国外在自然语言理解方面的研究起步较早,一些卓有成就的计算机专家、语言学家、逻辑学家和心理学家都在自然语言理解中的语法、句法及语义分析方面提出了一系列较为系统的理论的方法。比拟有影响的理论有:转换生成语法、依存语法、语义网络、蒙塔鸠语法、扩展转换网络、系统语法、格语法和语义网络理论、概念依存理论、境况语义学和语料库语言学等。这些理论和方法大致可归为基于语法的分析法、基于语法与语义相结合的分析法和基于语义的分析法三类。尽管国外在自然语言理解上研究较早,成熟的理论和方法也不少,开发的实验系统也不计其数,但到目前为止,这些系统离真正的实用

25、要求尚存在较大间隔 。国内在自然语言理解研究方面起步较晚,且较为系统的研究成果也为数不多。因为我国的自然语言理解研究必须以汉语为研究对象,而我国传统的汉语研究,并不以计算机处理汉语为目的,尽管语言学家设计了许多汉语语法体系,可这些体系很难直接在自然语言理解的研究中得到有效应用。同时,由于汉语是无形态变化的语种,因此无法直接套用西方现有的语法、语义构造体系,这使得汉语自然语言理解研究工作困难重重。但令人欣慰的是,近几年,国内自然语言理解的研究获得了很大的成绩,无论在汉语书面语的自动切分、汉语电子词典、汉语机读语料库、机器翻译、汉语人机对话、汉语情报检索等应用研究领域中,还是在结合汉语、汉字特点探

26、究计算语言学根底理论的研究中,都出现了不少拓荒之作,获得了骄人的成果3637。(8)内容分析研究。除以上应用研究外,汉语自动分词还在其他一些相关领域也得到了充分的利用,如词频统计、文本内容分析、概念分析和数据库编制等。其中内容分析已成为汉语自动分词应用研究的重要内容之一。汉语自动分词及其研究成果都可以直接或者间接地应用到内容分析法中来,并构成内容分析法的重要研究内容、方法和手段。此外,汉语自动分词还可以直接用于词频统计、主题分析、篇幅分析、文献内容分析、概念分析和数据库系统设计等方面。因为就目前来看,所有词典式汉语自动分词系统几乎都是以词频统计分析为前提和根底的。例如,自动标引和信息检索系统的

27、设计就是以词典式汉语自动分词系统为基矗在信息检索系统的设计中,假如能先解决自动分词问题,就会大大进步检索系统的检索效率。而信息检索系统又是内容分析法进展统计和分析的数据来源,同时也是内容分析法的一种重要的辅助手段。信息检索系统检索效率的上下及数据完备程度,可以决定内容分析法结论的准确和客观程度。4汉语自动分词研究与内容分析法汉语自动分词是内容分析法的前提和根底,对内容分析法技术、方法和应用具有宏大的影响。如何综合利用汉语自动分词研究成果、计算机技术、文献计量方法和内容分析方法,深化文献内部,对其内容、信息和知识进展测度和综合研究,实现内容分析的自动化,进步研究效率和分析结果的可靠性与准确性是目

28、前急需重点研究和解决的重大课题,也是情报学和文献计量学开展当前所面临的重大课题之一。4.1汉语自动分词研究对内容分析技术与方法的影响内容分析法(ntentAnlysis)是一种对文献内容进展客观、系统和量化描绘与分析的研究方法,是社会科学研究中普遍使用的一种科学方法3839。对文献内容的研究可分为定性研究与定量研究两种方式,分别从不同的侧面对文献中所包含的信息和知识进展加工处理与分析,从而得出相应的研究结论。但人们通常将对文献内容的定量研究称为内容分析法。内容分析法最早萌发于新闻界,后来扩展到图书情报乃至整个社会科学领域,在信息传播、情报研究与决策分析中有着重要的地位和作用4041。客观、系统

29、和定量是内容分析法的根本特征,而“定量是内容分析法最为显著的特征,是到达“准确和“客观的一种必要手段。因此,内容分析法结论的准确性、客观性和可靠性取决于定量化的程度。在定量化的过程中,除了对大量的文献样本进展统计分析之外,还必须对样本文献自身所包含的知识内容进展统计分析。词频统计分析法是内容分析法中最根本的分析方法之一,而计算机辅助词频统计那么是内容分析法最重要的技术手段之一,目前国内外有关内容分析法的理论与应用研究主要以词频统计分析为基矗从广义上来说,词频统计分析法包括所有以词或词组为单元的分析技术和方法,如主题词词频分析法、指示词词频分析法和关键词词频分析法等42。而汉语自动分词是词频统计

30、分析法的根底,汉语自动分词的精度决定了词频统计的准确度。只有首先对文本文献进展有效切分之后,才能对文献中的词或词组进展准确的统计,然后再对统计结果进展分析,对文献中隐含的信息和知识进展有效挖掘。由于汉语自动分词研究一度进展非常缓慢,使得词频统计分析法在相当长的时间内还存在着一些问题。但近些年来,由于计算机技术应用于内容分析领域以及汉语自动分词研究的打破性进展,对内容分析法产生了根本性影响。以汉语自动分词研究为根底的信息检索系统如书目数据库、文摘数据库、全文数据库和搜索引擎等的开展以及数据挖掘和知识发现技术的应用,为内容分析方法研究提供了便利的条件,带来了蓬勃的活力4345。所以说,汉语自动分词

31、研究是内容分析法的前提和根底,特别是在利用计算机技术辅助内容分析法方面,汉语自动分词研究对内容分析技术与方法具有重大的影响。4.2汉语自动分词研究对内容分析法应用的影响内容分析法应用相当广泛。由于科学技术开展的突飞猛进,信息知识社会的到来,当今世界的“信息过剩、信息充裕、“知识爆炸给人们学习、工作和生活带来了沉重的压力,怎样才能在浩如烟海的文献和知识信息中找到自己需要的文献和知识信息,已经变得越来越重要。而内容分析法正是解决这一问题的有效方法,它借助于计算机对各个学科领域中海量的文献、信息和知识进展统计分析,找出其关键信息和核心内容,以供人们利用,从而进步管理程度和决策效率。因此,内容分析法受

32、到了各个学科领域的热烈欢送。目前内容分析法主要在计算机和人工智能领域、图书情报领域、政治与军事领域、科技与经济领域、新闻与传播领域、社会学研究和心理学研究等研究领域的分析与预测中应用得非常普遍。计算机和人工智能领域研究内容分析法,注重于研究对象内容的自动分析、提炼和表达,因此,其主要研究领域,如自然语言理解、语义分析、自动编文摘、知识工程、机器翻译和专家系统等研究中都包含着内容分析。图书情报领域主要利用文献计量方法和内容分析方法对图书馆学、情报学、科技、经济和社会等方面的文献进展统计分析,理解其开展现状,并预测其开展趋势。因为内容分析法是一种重要的文献计量分析方法和情报研究方法,不仅自动标引系

33、统、情报检索系统和搜索引擎等设计中包含着内容分析,而且词频统计、主题分析、关键词抽娶概念分析和篇幅分析等本质上就是内容分析法的重要内容和方法。政治、军事、科技与经济领域主要利用内容分析法对这些领域目前的文献信息进展统计分析,理解国内外开展动态,并对其开展动向进展科学的预测,以便采取有效的应对措施。新闻与传播领域主要利用内容分析法对新闻媒介所含的大量信息进展统计分析,捕捉新闻热点和焦点。社会学主要利用内容分析法对有关社会学研究的文献进展统计分析,找出社会开展中人们普遍关心的问题,如人口问题、老年问题、教育问题、犯罪问题、妇女问题和儿童问题等。心理学研究那么通过对人们的语言和行为及其相关文献进展分

34、析,以理解人们的心理状态和心理变化等4659。内容分析法的应用以文献计量方法和词频统计方法为根底,而文献计量方法和词频统计方法离不开汉语自动分词研究。内容分析法与汉语自动分词研究具有较高的关联度。内容分析法的应用和开展为汉语自动分词研究提出了迫切需求。因此,内容分析法的深化应用也受制于汉语自动分词研究。4.3内容分析法的开展趋势目前,内容分析法主要是基于词频统计包括主题词、关键词和指示诃等而进展的。基于词频统计分析的内容分析法不能深化文献内部,很难挖掘出文献中隐藏的知识和信息,容易无视词与词之间的关联,而且词频统计和处理的量非常庞大。因此,要进步内容分析法的科学性和准确性,内容分析法必须从语法

35、分析走向语义分析和语用分析,从手工统计分析走向计算机自动统计分析,即从计算机词频统计分析走向概念分析、段落分析和篇幅分析,这是内容分析法开展的必然趋势。而要实现这一目的,就要首先打破汉语自动分词这一难关,实现计算机对自然语言的有效理解和处理。完毕语汉语自动分词和内容分析法研究是目前情报学研究领域两大最重要和最富有挑战性的课题,它们既有各自独立的研究内容,又存在高度的关联性。因为汉语自动分词中的词典式分词法和内容分析法都是以文献计量方法与词频统计方法为根底而进展的。同时,文献计量方法和词频统计分析方法的改良又能促进词典式自动分词系统的完善。在计算机科学界、情报信息界和汉语语言学界三大领域的专家学

36、者们的共同努力之下,汉语自动分词研究获得了重大的进展,但是离真正的问题解决还有相当漫长的路要走。目前,汉语自动分词研究有望在传统文本的有效切分即寻找新的分词算法、人工智能技术与自动分词结合研究和汉语文本书写规那么的标准与改造三个方面获得打破。汉语自动分词研究是内容分析法的前提和根底,同时又对内容分析法的研究具有宏大的推动作用。内容分析法的深化开展必须借助于汉语自动分词研究成果,只有解决了汉语自动分词问题,对文献内容的分析才能真正做到准确、客观和可靠。其实我们都知道,汉语自动分词研究无论如何已经不是一个单纯的技术问题了,因为它已经同汉语走向世界、中华民族文化的伟大复兴严密地联络在一起。汉语,作为

37、全世界使用人数最多的一门语言,随着信息时代的到来,其自身的开展和更新已是迫在眉睫。让更多的人理解汉语、学习汉语、使用汉语,将汉文化撒播到全球每一个角落,应该是每一个中国人的梦想。而要实现这一目的,就必须首先解决汉语自动分词问题,以便计算机能对汉语文本进展自由处理,增强汉语的生命力。【参考文献】1黄崑,符绍宏.自动分词技术及其在信息检索中应用的研究.现代图书情报技术,2001(1):26292黄昌宁.中文信息处理中的分词问题.语言文字应用,1997(1):72783孙宾.适用于信息检索和提取的汉语词典.北京大学计算语言学研究所研究报告4殷建平.汉语自动分词方法.计算机工程与科学,1998(3):

38、60655吴胜远.并行分词方法的研究.计算机研究与开展,1997(7):5425456杨宗泽.中文自动分词讨论.西南民族学院学报自科版,1994(3):2412457文庭孝.情报检索中汉语语词自动切分研究.图书与情报,2001(2):57588尹锋.汉语自动分词研究的现状与新思维.现代图书情报技术,1998(4):22269黄崑,符绍宏.自动分词技术及其在信息检索中应用的研究.现代图书情报技术,2001(1):262910王洪君.?信息处理用现代汉语分词词表?的内部构造和汉语的构造特点.语言文字应用,2001(4):909711孙茂松,黄昌宁等.信息处理用现代汉语分词词表.语言文字应用,200

39、1(4):848912揭春雨.“信息处理用现代汉语分词标准的假设干问题讨论.中文信息学报,1989(4):334113袁毓林.关于分词标准和标准词表假设干意见.语言文字应用,2001(4):11014夏历.中文信息处理与语言文字标准化.语文学刊,2002(6):747615殷建平.汉语自动分词方法.计算机工程与科学,1998(3):606516陈桂林,王永成等.一种改良的快速分词算法.计算机研究与开展,2000(4):41842417李家福,张亚非.基于E算法的汉语自动分词算法.情报学报,2002(6):26927218林绮屏.基于词形的最正确途径分词算法.华南师范大学学报自然科学版,2002

40、(4):818419何炎祥,冯夏根,周水庚.演化算法在中文自动分词中的应用.计算机工程,2002(5):808220曹星明,鲁汉榕,李玉珍.基于多种知识源的汉语自动分词.计算机工程与设计,1998(2)21李国臣.汉语自动分词及歧义组合构造的处理.中文信息学报,1988(3):909322郑延斌.书面汉语自动分词及歧义分析.河南师范大学学报自科版,1997(4):909323孙茂松,邹嘉彦.汉语自动分词中的假设干理论问题.语言文字研究,1995(4):404724黄祥喜.书面汉语自动分词的现状和问题.情报学报,1989(2):12513225林春实,方燕,全吉成.汉语文献自动分词与标引技术开展

41、浅析.情报学报,1997增刊:303326陈玉忠,李保利,渝士文.藏文自动分词系统的设计与实现.中文信息学报,2022(3):152027黄祥喜.书面汉语自动分词的现状和问题.情报学报,1989(2):12513228黄崑,符绍宏.自动分词技术及其在信息检索中应用的研究.现代图书情报技术,2001(1):262929李培.汉语自动标引方法述评.晋图学刊,2000(1):101930顾敏,史丽萍,李春玲.自动标引综述.黑龙江水专学报.2000(9):10310431苏新宁.汉语文献自动标引综析.情报学报,1993(4):30931832郭慧燕,钟义信等.自动文摘综述.情报学报,2002(5):58259133白锡嘉.机器翻译与自然语言理解.中国科技翻译,1996(2):313434欧振

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论