基于自然语言处理技术的研究主题抽取与分析_第1页
基于自然语言处理技术的研究主题抽取与分析_第2页
基于自然语言处理技术的研究主题抽取与分析_第3页
基于自然语言处理技术的研究主题抽取与分析_第4页
基于自然语言处理技术的研究主题抽取与分析_第5页
已阅读5页,还剩24页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1ExtractionandAnalysisofResearchTopics摘要本论文针对研究主题分析的问题,提出一系列以自然语言处理为基础的技术,从学术领域中发表的论文资料中抽取重要的关键词语,并将这些词语依据彼此间共现关系进行丛集,以丛集所得到的词语集合表示领域中重要的研究主题。研究主题分析在学术领域的应用上,可以提供研究人员一个清楚的梗概;在信息检索的过程中,则可以帮助使用者厘清信息需求。我们并将所提出的方法应用到这个方法可以应用于国内学术领域的特殊环境,同时抽取出中文和英文的关键词语,所得到的词语丛集结果也可以表示领域中重要的研究主题。这样的结果初步的验证了本论文所提出方法的可行性。从研究结果中,我们也发现计算语言学研究与实务应用有密切的关系,抽取出来的词语丛集中有许多与机器翻译、语音处理和信息检索相关,在语言的计算模式上,语法模式与剖析、断词和统计式语言2模型的建立则是国内计算语言学家所关心的主题。信息检索研究着重的问题是人与信息之间的界面,近来的研究趋势注重于使用者所具有的背景知识、在检索过程中对问题的认知[Wilson,1999]及资料的娴熟程度(materialmastery)[Bishop,1999现象进行全面的了解,所谓的「领域分析」(domai要的学术活动,诸如研究、论文发表、会议参与等等进行分析,探讨研究人员所使用或产生的知识组织、结构、合作模式、语言和通讯形式、信息系统以及相关项要务,了解重要的研究主题可以掌握领域中的知识组织,帮助使用者厘清信息主题并加以分析,可以展示学术领域研究一个完整的面貌,提供新进学者在初期进入领域时的参考,也可以作为学术研究领域发展的指引(roadmap),提供已经深入的研究人员扩展学术研究的范畴。本论文提出一个自动化的研究主题抽取方法,从学术领域中发表的论文集合中选出关键词语,再依据词语彼此间出现在相同论文中具有特定意义的共现 重要研究主题的依据。我们认为论文的丰富词汇讯息蕴含了研究主题。在论文发3表的过程中,作者藉由论文题名、摘要以及本文中的词语将研究的问题、方法与结果等主题传达给读者,甚至论文所引用的参考文献题名也包含许多与主题相关的词语讯息;而读者在阅读论文时,便可以依据这些词语判断与本身研究兴趣上『论文』等等词语,目的是希望读者在阅读时,可以从这些词语的共同出现与使用,了解我们所研究的主题是从学术论文中抽取重要的研究主题,而有兴趣的读者在阅读后,便可在研究与发表上加以利用。进一步地,在一个学术领域中,可以发现某些受到重视的研究主题相关的词语在许多论文中出现。以计算语言学领文中出现,这些都是这个领域中的重要研究主题。而且与研究主题相关的一组词语会重复出现在许多论文中。因此,如果对学术领域出版的论文进行分析,选取具有代表主题意义的词语,统计这些词语间的共现现象,利用这些信息将经常一起出现的一组词语丛聚成一个集合,所形成的词语集合可以视为是某一特定的研究主题。在分析某一论文的主题时,便可以估算代表各研究主题的词语丛聚与该论文的相关性,作为判断该论文是否具有此一主题的信息。因此,本论文尝试利用自然语言处理技术来分析学术领域中发表的论文,确认论文中出现的词语,抽析的信息。4我们并将所发展出来的技术应用于国内计算语言学领域的主题分析。选择以计算语言学作为研究对象的主要原因是这个领域具有科际整合研究 究与实际的系统和产品研发[Lenders,2001]。参与这个领域研究的研究人员主要来自于语言学和计算机科学两个学科,对于计算机科学家来说,主要的研究工作在于建构一个实用的计算机系统来处理有关自然语言的问题,比方说机器翻译、字型辨认、语音辨认、信息检索等等。语言学家的工作则在于计算性理论的规范与应用,用来解释自然语言的认知现象模式及模拟验证的能力[王士元,1988]。计算机科学家的工作需要依赖语言学家所形成的语言理论来建立合理而有效率的计算机系统;而语言学家则是利用计算机科学家所发展的计算理论与系统探究自然语言的规律[Huang,2000]。在这个领域中的重要研究除了将计算机方法应用于自然语言理论的探讨之外,最受瞩目的研究还包括利用语料库(corpus所)发展出来的语言理论领域所进行的学术活动,可以观察语言学和计算机科学两种不同学科的学者在互对研究主题分析是一项具有挑战且有意义的研究。除此之外,另一方面则是我们对于这个领域的熟悉,将有助于研究方法的发展,对于所得到的初步结果做出合理的诠释,并作为下一阶段改进的参考。在使用ROCLING一到十四届的学术研讨会论文资料,共235篇,我们共抽5取出343个关键词语。研究主题丛集后得到34个代表重要研究主题的词语集合。结果显示所发展的词语抽取法可以同时抽取出中文和英文的关键词语,所得到的词语丛集结果也可以表示领域中重要的研究主题。初步验证了本论文所提出方法的可行性。从研究结果中,我们也发现计算语言学研究与实务应用有密切的关系,抽取出来的词语丛集中有许多与机器翻译、语音处理和信息检索相关,在语言的计算模式上,语法模式与剖析、断词和统计式语言模型的建立则是国内计算语言学家所关心的主题。本论文其余的章节架构如下:在第二节中首先说明一些相关研究及本论文所提出研究主题分析方法的概念与合理性,并且依据这些概念设计出利用一系列自然语言处理技术进行研究领域分析的方法。接着在第三节和第四节中分法中的核心技术:词语抽取和研究主题丛聚。第三节中,我们提出了在多语环境下的关键词语抽取方法,可以从中英文论文资料中取得代表研究主题的关键词语。第四节则提出一个词语丛聚方法,利用词语的共现关系,将词语进行多重丛聚来代表可能的研究主题;本节中并且说明研究主题与论文之间相关程度的计算方式。第五节中报告将此分析方法应用到国内计算语言学研究的结果。最后,第六节则是结论。二、本论文提出的研究主题分析方法本论文希望发展一套研究主题抽取方法,可以从特定学术领域中出版的论文6中,抽取用来表达研究人员共识的重要研究主题,作为进一步分析或信息检索应用的信息。在信息检索研究范畴中与这个问题相近的研究有主题侦测(topic detection)。主题侦测是希望从一序列来源各不相同的新闻中,侦测出与某些『事 hypothesis)可以适用于解决这个问题[Yang,PierceandCarbonell, 现有文件集合具有相似的词语分布情形,将文件归入相关事件的集合中;若文件与现有集合皆不相近,则视为是一个新事件,产生一个新的集合。因此,我们尝试应用丛聚假说,探索领域中可能的研究主题。再者,主题侦测研究已应用专有名词(propernouns)等相关词汇作为区隔不同新闻事件的重要讯息[Hatzivassiloglou,GravanoandMaganti,2000],本论文也将尝试利用论文中与领域相关的词语抽取出来作为分析的主要讯息。此外,主题侦测应用所谓的『新闻热潮』(newsburs象,将时间讯息加入丛聚算法,提升侦测的结果[Yang,PierceandCarbonell, 的说法,也就是在某一项新的理论、研究方法或技术提出后,如果得到很大的成文并不考虑加入时间讯息。7在本论文中,我们利用相同研究主题的论文中具有相似词汇讯息的概念,利用在论文中词语的共现关系,找出词语的丛聚情形来代表研究主题。以论文中出现的词语取代整篇论文作为分析对象的主要原因是希望能获得较可信赖的统计讯息。并非所有的研究领域都有足够多的学术论文发表可供进行研究,较小的学术领域所出版的论文数量较为不足,以整篇论文进行分析,统计上不容易得到研究主题的分析结果。以关键词语作为分析对象,可以获得充足的统计讯息,克服文件数量较少的问题。某些论文具有多个研究主题也可藉由词语的多重丛聚加以表词语丛聚则容易直接由成员的语义进行解释。本论文方法的架构如图一所示。首先对需要进行分析的学术领域搜集相关论文资料,建立论文数据库。数据库中收录的资料包括论文的题名、摘要和参考文献的题名等作为词语抽取与丛聚分析的信息,论文作者和出版年等项目则用来作英语双语并行,许多领域皆接受论文以中文或英文发表,然而并非所有的论文同时具有中、英文双语的题名和摘要,无法单就某一种语言的文本进行分析。若只考虑以某一种语言发表的论文进行分析,而忽略另一种语言,有可能造成某些特殊的研究主题被遗漏的情形。若是分别处理各种语言的论文,缺乏分属两种语言的词语在论文中的共现讯息,无法分析出这些词语的相关性,在整合上有相当大的困难。因此需要考虑这个特殊的论文发表现象,提出可以同时分析两种语言论8文的方法。本论文所提出的解决之道是加入论文中参考文献的题名进行分析,通常参考文献的题名与研究的理论、方法及技术等也有密切的关系,而且参考文献的题名可能包含两种语言,若能提出适当的多语词语抽取方法,便可以统计分属两种语言的相关词语的共现现象,整合两种语言的词语讯息,而得到较佳的研究關鍵詞語抽取論文關鍵詞語论文搜集与關鍵詞語抽取論文關鍵詞語数据库詞語詞語詞語叢集词语丛集詞語叢集研究主题图一本论文提出的研究主题抽取与分析方法在建立好论文数据库后,接着便利用多语的关键词语抽取方法从论文资料中自动抽取领域中具有意义的词语,统计词语在论文中的共现关系,利用这些信息将相关的词语丛集成集合,用来代表某一个特定研究主题。在进行研究领域分析词语丛集所代表研究主题。下面的两节中,将针对多语环境下的重要词语抽取以9及词语丛聚技术详细说明。三、多语环境下的关键词语抽取为了抽取可以代表学术领域研究主题的关键词语,我们首先确认论文资料中重要的中英文词组以及中文的多字词,增强词语的语汇讯息,再选择具有代表研究主题意义的词语,作为这一阶段的结果。在学术论文中,常以词组的形式表达model”、“machinetranslation或”是中文的语“言模型”、“机器翻译”等等。此外,中文的文本里,词与词之间没有明显的界限,进行自然语言处理前,需要先进行分词,确认文本内可能的词。所以要进行研究主题分析,首要工作是从论文中确认重要的中英文词组以及中文的多字词。然而学术论文中经常有许多新的词语出现,来代表新的概念、方法和技术,我们无法事先收录各个领域里所有可能的词语来制作十分完整的词典,进行断词。而且利用构词律的规则式断词方法,需要处理同时中文和英文两种语言的文本,难以整合应用。所以本论文采用统计式的处理方法[Chien,et.al.,1999],以便同时解决中文的多字词及中英文的词组问题。本论文所使用的方法如下:首先利用题名、摘要和参考文献的题名等论文资串及它们所在的论文资料[Chien,1997]。接选词语,以统计讯息及经验法则(heuristicrules)作为判断字符串是否为词语的标准。在本论文中,所使用的统计讯息包括字符串在所有资料中的出现总频次、字符串在出现论文中的平均频次和标准差(standarddeviation)以及字符串前后接字的复杂度。字串的出现总频次代表该字符串在领域中的重要性,出现频次高表示这个字符串在领域里的论文经常出现而具有重要意义。字符串在出现论文中的平均频次和标准差用来表示字符串对出现论文的重要程度,如式(1)S的平均频次超过某一阈值时,表示此字符串极有可能在许多论些论文的关键词语,应该被选取出来。或是虽然字符串S在论文的平均频次较低,但在某些论文中出现多次,是这些论文的关键词语,也需要被选取出来,此时字串S会有一个较大的标准差σS。因此,我们可以利用字符串在出现论文中的平均频次和标准差的总和RS代表字符串对出现论文的重要程度,RS值愈高的字符串对出文愈重要。字符串前后接字的复杂度则可以判断是否是一个完整的词语或是其他词语的部分,字符串S的前后接字复杂度C1S和C2S分别如式(2a)和(2b所)示式(2a)和(2b中),a和b代表字符串S在论文资料中任一个可能的前接字和后接字,FS、FaS和FSb分别是字符串S、aS和Sb的出现总频次。以式(2a)前接字的情形来看,若是字符串S有愈多种类的前接字,而且每一种前接字出现的次数越接近时,接字出现的机会较其他大非常多时,则C1的S值接近于0,表示该字符串再加上这个前接字可能才是一个词语。愈大的前接字复杂度代表该字符串愈有可能是独立的词语而不是其他词语的一部分;后接字的情形也是相同的道理。通过上面条件的字符串,再利用停用词(stopwords)不能出现在字符串首尾的经验法则,进一步过滤去不完整的词语。在过去的经验中,介词和定词等停用词常出现在抽取出字符串的首尾,如“名词+的”、“名加以保留。在确认论文资料中重要的中英文词组以及中文的多字词后,以这些词语建立断词处理所需的词典。我们使用长词优先法则与词语的出现总频次将所有论文资料加以断词,确认所有在论文资料中出现的词语。此时,我们分出来的词语包括了一些中英文的词组、词和一些中文单字。在本论文中并非需要确认论文资料中所有可能的词语,而是希望抽取所有可能代表研究主题的关键词语,因此我们过之RS值太小的词语,也加以过滤,其理由如前面所述。剩下的词语与它们在论文资料中的出现情形则是下一阶段分析的对象。四、研究主题丛聚为了探索学术领域中重要的研究主题,本论文依据词语在论文资料的共现关系,建立词语之间的相关程度,将词语进行丛聚,以一组丛聚的相关词语作为一个研究主题。由于有些词语可能包含在不同的研究主题中,本节中提出一个可以对词语进行多重丛集的算法。首先,我们将上一阶段抽取出来的词语,利用可以进行多重丛聚的cliques丛集算法[KowalskiandMaybury,2000]进行词语丛集。在选定最小相关程度的情形下,我们可以得到若干个词语丛集,在这些词语丛集中的词语,彼此间的相关程度都在所选定的最小相关程度之上;而且词语因它们与其他词语相关程度的不同,可以丛集在多个集合中。本论文所使用的词语相关程度的计算方式如下:我们先计算每一词语在每一篇论文的题名、摘要和参考文献的题名等资料中出现的频次,作为词语的特征值运算的信息。但因为只取用上述论文资料的资料量较小,词语在其中出现的频次不会太高,为了使低频次的词语差异不会太大,以词语在每一篇论文资料的频次的平方根作为一个特征值。如此一来,对每一词语有一组特征矢量(featurevector),计算词语间的相关程度便可以利用所对应特征矢量间夹角的余弦值(cosinevalue)来估算。如式(3)和式(4)分别表示词语A的特征矢量和词语A与B间的相关程度估算方式。i,A代表词语A在第i篇论文资料中出现的频次。式(4中),分子部分是词语A和B的特征矢量EQ\*jc3\*hps23\o\al(\s\up7(r),v)A和EQ\*jc3\*hps23\o\al(\s\up7(r),v)B内积(innerproduct的)值,分母部分则是两个特征矢量长度EQ\*jc3\*hps23\o\al(\s\up7(r),v)A和EQ\*jc3\*hps23\o\al(\s\up7(r),v)B的乘积。经过cliques算法所得到的结果是相当严格的,只有以词语的共现关系所估算的相关程度在某一阈值以上的一对词语才有可能丛集在一个集合内。然而,在研究主题中相同或相近的概念可能以不同词语来表示,这些词语不一定出现在相同的论文资料中,利用上述以词语共现现象的相关程度估算方法将会得到很小的相关程度估算值,无法利用cliques算法将这些词语丛集起来。本论文采用以下两种技术来解决上述的问题。首先我们利用LSI(LatentSemanticsIndexing)技术对上述的特征矢量所形成的『词语-特征』矩阵M进行奇异值分解(SVD,singularvaluedecomposition)运算其大小分别为t×r和d×r,t和d分别为词语和特征的数目,r则为矩阵M的秩o为一个大小为r×r的对角线矩阵(diagonalmatriEQ\*jc3\*hps24\o\al(\s\up2(ˆ),M)EQ\*jc3\*hps24\o\al(\s\up2(ˆ),M)So对角线上的前k个奇异值,产生一个大小为k×k的新矩阵S,同时To和Do也分别取前k个行矢量(columnvectors),形成矩阵T和D,大小分别为t×k和d×k。矩阵EQ\*jc3\*hps24\o\al(\s\up2(ˆ),M)便可由EQ\*jc3\*hps23\o\al(\s\up2(ˆ),M)=TSD计'算得到。在使用LSI技术的检索过程,当进行词语的相关EQ\*jc3\*hps24\o\al(\s\up2(ˆ),M)EQ\*jc3\*hps24\o\al(\s\up2(ˆ),M)(5所)表示,MM'≈EQ\*jc3\*hps24\o\al(\s\up2(ˆ),M)EQ\*jc3\*hps24\o\al(\s\up2(ˆ),M)'=TSD'(TSD')'=TSD'DS'T'=TSS'T'=TS2T'(5)在式(5中),由于矩阵D中的行矢量彼此互为单位正交(othonormal),DD’=I,EQ\*jc3\*hps23\o\al(\s\up2(ˆ),M)EQ\*jc3\*hps23\o\al(\s\up2(ˆ),M)2T'估算得很小的两个相关词语,可以获得较大的估算值[Deerwester,et.al.,1990]。其次,进行cliques丛集算法后,我们对于所得到的结果依据它们成员间重叠的情形再次进行丛集。假设两个丛集之间有三个以上的成员是相同的,而且其余的成员间虽然没有很强的词语共现关系,但是也曾在某些论文资料中一起出经过比对,丛集Χ1剩下的成员D和丛集Χ2剩下的成员E和F出现的论文资料有一些是相同的,我们便将Χ1和Χ2两个丛集进行合并,使得所得到的丛集更具有研究BBBΧ2ΧFΧFDCCDCCEEAAAA▲BBFFDCDCEEAA图二将Χ1和Χ2两个具有相同成员的丛集进行合并的示意图最后经过上述的丛集处理后,可以得到一些代表领域中重要研究主题的词语丛集。在分析研究主题时,我们计算每一丛集与论文间的相关程度,计算方式依据为LSI的相关估计方式[Deerwester,et.al.,1990],如式(6计)算丛集Χ对所有论文的相关程度。RΧ=χTSD'(6)否出现在丛集Χ之中,换言之,如果第i个词语包含于这个丛集中则,e的i值为1;否则若是这个丛集不包含这个词语,e的i值相关程度估算值。最后依据这个结果,将相关程度大的论文资料取出,作为研究主题相关的论文资料来进行分析。五、国内计算语言学的研究主题分析的实验结果计算语言学研讨会ROCLING是国内的计算语言学领域相当重要的学术活学领域学者的心血结晶,所蕴含的研究主题也是他们所关心的研究主题。因此,本论文将以ROCLING研讨会的论文资料做为分析国内计算语言学研究主题的素材。篇。进行词语抽取时,首先抽取重要的多字词及词组,所设定的字符串出现总频次字符串对出现论文资料的重要程度RS(平均频次和标准差的总和设)为2.5,前后接字分词,依据第三节的方法对所有词语进行统计,过滤去不重要的词语。最后的结果共得到343个关键词语。由于篇幅所限,无法将所有的词语一一列出,我们将出现总频次最高的前50个词语及出现的总频次列表于表一。表一关键词语抽取所得到的前50个出现总频次最高的词语及总频次词名词名1parsingparser2probabilistic3动词4语音56mandarin语法78语言9usedrecognition国语处理mandarinchineseproblemmachinetranslationwordsphrase语料库汉语应用接着将取出来的词语进行研究主题丛聚。进行词语的cliques丛集时,我们分别以第四节中原先的词语特征矢量与经过SVD处理的特征矢量,k值为30、60及 并后,所得到三个词语以上的丛集的数目,如表二所示。表二不同相关程度估算方法进行研究主题丛cliques丛集丛集合并从表二中可,以观察到经过SVD处理的cliques丛集数目较原先的特征矢量来得多,显然LSI技术有助于捕捉词语不共现却相关的隐含语义结构,产生较多cliques丛集。因此,我们以经SVD处理k值为60的特征矢量进行词语相关程度估算,将所得到的34个词语丛集作为进一步的分析的对象,这34个词语丛集列表于附录一。从词语丛集的结果我们可以看到几个现象。第一、若干丛集同时具有中文词 文资料,可以获得中文和英文两种语言的词汇讯息,而且利用词语的共现关系可以将相关的词语丛聚起来。第二、大部分的词语丛聚都可以明显地用来代表一个特定的研究主题。除了丛集3、丛集11与丛其余丛集的词语间都具有相关性,而且可以用来代表计算语言学领域中的特定研究主题。比方说,丛集7为语音辨认的相关词语、丛集9则为文件分类的相关词语。因此,本论文所提出来的研究主题抽取方法的可行性便可以得到初步验证。丛集编号词语相关论文资料语法模式分析,表达,剖析,格位,讯息,动词,结构,词类,汉语,语法,语法模式,语意,模式,关系1989讯"息为本的格位语法--一个适用于表达的表达形式"词"unknownword,wordsegmentation,言模型的建立bigram,classbased,1994"AnEstimationoftheEntropyofChinese-ANewApproachtoConstructingClass-basedn-gramModelLanguageModelUsingKullback-LeiblerDistanceCriter联性"由于篇幅的限制,本论文无法对所有抽取出来词语丛集一一进行详尽的报告,以下针对几个主题较明确的词语丛集进行说明。表三是与语言的计算模式相关的词语丛集及相关论文的列表,论文前的数值是论文在ROCLING研讨会中发表的年份。表三可以验证早期的计算语言学多以规则式的语法模式与剖析为主,近来则较多发展统计式语言模型,而断词则是一直以来国内计算语言学领域相当重视的独特问题。此外从研究结果中,我们也发现计算语言学研究与实务应用有密切的关系,表四到表六分别列出与机器翻译、语音处理和信息检索相关的集合。从表四的结果,说明机器翻译是计算语言学最早的应用问题之一[Lenders,2001],而其发展从规则式的自动翻译到统计式,近期的应用则是在跨语言检索部分。丛集编号词语相关论文资料只(有与丛集12相关)在过去计算语言学所处理的对象多为书写语言(orthographiclanguages),近年来语音处理已经成为计算语言学相当重视的研究主题。从ROCLING的论文资料中所得到的结果可以分析成语言模型、声学辨认以及语音合成三个研究主题(表五)。国内计算语言学较早进行研究的主题是语言模型和语音合成,近年在声学辨认研究上,也有许多研究人员进入这个领域发表相关论文。在表五,另外还可将语音合成研究分成系统制作(丛集30)与声学讯息研究(丛集31)两个部分。丛集编号词语相关论文资料语言模型语言模型,语音辨认1993国"语语音辨认中词群双连语言模型的1994国"语语音辨认中词群语言模型之分群方1996国"语语音辨认中多领域语言模型之训练、侦1999国"语电话语音辨认之强健性特征参数及其调只(有与丛集17相关)语言模型国语,语言模型,语音辨认,辨认7声学辨认hiddenmarkov,recognition,RecognitionUnderTel1999国"语电话语音辨认之强健性特征参数及其调用"语音合成文句翻语音,合成,系统,音节,国语,连音,语音,输入1996时"间比例基周波形内差--一个国语音节信号合成之新方之发展"只(有与丛集30相关)1999国"语文句翻台语音系统之研究"只(有与丛集30相关)2001"PitchMarkingBasedonanPeak-ValleyEstimationMethod",只(有与丛集31相关)语音合成pitch,prosodic,speech,文句翻语音,合成在计算语言学领域中,信息检索比起其他研究可说是一个较新的主题,然而由于网际网络与电子文件的发展使得这项应用成为相当具有潜力的研究主题。我们可以从表六中发现国内计算语言学在这方面的重要研究包括信息检索和文件分类。丛集编号词语相关论文资料信息检索informationretrievatextretrieval,检索UsingLatentSemanticIndexing"1999"ANewSyllable-BasedApproachforRetrievingMandarin9textcategorization,textcategorization,文件自动,关键词六、结论本论文针对研究主题分析的问题,提出一系列以自然语言处理为基础的技术,从学术领域中发表的论文资料中抽取重要的关键词语,并将这些词语依据彼此间共现关系进行丛集,以丛集所得到的词语集合表示领域中重要的研究主题。在本论文中,我们将所提出的方法应用到ROCLING研讨会的论文资料上,抽取计算语言学领域的重要研究主题,结果显示这个方法可以同时抽取出中文和英文的关键词语,所得到的词语丛集结果也可以表示领域中重要的研究主题。这样的结果初步验证了本论文所提出方法的可行性。从研究结果中,我们也发现计算语言学研究与实务应用有密切的关系,抽取出来的词语丛集中有许多与机器翻译、语音处理和信息检索相关,在语言的计算模式上,语法模式与剖析、断词和语言模型则是国内计算语言学家所关心的主题。在后续的研究上,除了进一步改善目前所提出来的方法,并且深入探讨各研究主题的起源、发展与演变之外,我们将探索各个研究主题之间的相关性,并尝试将结果以图形化的方式加以呈现。另外,对于不同学术领域间的相关研究主题的发掘和分析,比方说信息检索同样是图书信息学所关心的研究主题,如何利用自然语言处理技术来分析两个领域间的共通与相异,是一项值得探讨的研究。附录一ROCLING研讨会论文资料所得到的词语丛集丛集编号词语1generation,generator,systemic,tex2acquisition,explanation,generalization,l3方法,系统,问题,处理4initial,min,taiwanese,台语,台湾,数据库丛集编号词语5atn,attachment,pp,pre6complexity

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论