(计算机应用技术专业论文)宋词风格的计算机辅助分析研究.pdf_第1页
(计算机应用技术专业论文)宋词风格的计算机辅助分析研究.pdf_第2页
(计算机应用技术专业论文)宋词风格的计算机辅助分析研究.pdf_第3页
(计算机应用技术专业论文)宋词风格的计算机辅助分析研究.pdf_第4页
(计算机应用技术专业论文)宋词风格的计算机辅助分析研究.pdf_第5页
已阅读5页,还剩55页未读 继续免费阅读

(计算机应用技术专业论文)宋词风格的计算机辅助分析研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 宋词作为中国古代文学历史上一颗璀璨的明珠,古往今来,无数的学者和研 究人员对其投入了大量的研究精力。而对宋词风格的研究更是这些研究中较为重 要的一个方面,然而,目前这方面的研究主要集中在人文学领域。本文主要从计 算机的角度出发,利用现代的信息处理技术,对宋词的风格进行辅助性分析。具 体来说本文主要讨论以下几个方面的问题: 1 对诗词风格的计算机辅助分析进行了总结和分类,介绍了主要的几种使 用方法的思想和大体步骤。并在此基础上简单的分析了这几种方法的差异及优 劣。 2 建立和完善宋词语料库。按照格律、风格、情感分析等的需要将宋词细 分为子句,并对子句字串进行统计,利用词频、互信息和共现度等参数来抽取结 合强度大的字串。在此基础上对语料库中的宋词作品进行了词语切分,同时对语 料库中的部分词语进行了格律和词性标注。 3 提出了适合宋词风格表示的宋词文档表示模型。根据宋词风格表现整体 性的特点,本文优化了数据挖掘中的发现关联规则的方法,寻找宋词风格分类中 所需要的频繁关键词共现集合,借此来更多地保留风格评判中所需要的分类信 息。同时结合知网中使用到的义原,将宋词文档中的词语和频繁关键词共现映射 到概念级,用部分语义来表示词语集合。随后,提出了基于概念和频繁关键词共 现的诗词风格表示模型,并用该模型来表示一篇宋词文档。 4 将宋词的风格分类转化成文本分类问题,运用文本分类的算法对宋词的 风格进行评判。文中分别比较了不同分类算法的差异,从实际情况出发,选择了 一种适合宋词风格分类的分类算法,优化了算法中的各项参数,最后在此基础上 实现了宋词风格类型的评判。 实验表明,本文建立的诗词风格表示模型可以很好地应用于诗词风格的分 类,并有助于不同风格诗歌的计算机生成。 关键词:计算诗学:文本分类方法;关联规则发现;宋词风格表示模型 a b s t r a c t a sar e p r e s e n t a t i v et y p eo fc h i n e s ea n c i e n tl i t e r a t u r e 。s o n g d y n a s t y p o e t r yh a sb e e ns t u d y i n gb yl o t so fs c h o l a r sa n dr e s e a r c h e r ss i n c es o n g d y n a s t y , m a n yo fw h od e v o t e dt h e m s e l v e st ot h es t u d yo nt h es t y l eo fs o n g d y n a s t yp o e t r y a n dt h i sk i n do fr e s e a r c hm a i n l yf o c u s e so nt h ea r e ao fl i t e r a e h u m a n i o r e s h o w e v e r , t h em a j o rt a s ko ft h i sp a p e ri st od os o m er e s e a r c ho f c o m p u t e ra s s i s t a n ta n a l y s i so nt h es t y l eo fs o n gd y n a s t yp o e t r y t h er e l e v a n t w o r ko ft h i sp a p e ri n c l u d e sa s p e c t sm e n t i o n e da sf o l l o w s : f i r s to fa l l 。t h i sp a p e rm a k e sas u m m a r i z a t i o no fc o m p u t e ra n a l y s i so nt h e s t y l eo fp o e t r y i nt h i sp a r t 。t h ep a p e ri n t r o d u c e sd i f f e r e n tk i n d so fm a i n m e t h o d sa sw e l la st h e i rs k e l e t o n sa n di m p l e m e n t a ls t e p s a f t e rt h a t ,t h i s p a p e ra i m st of i n do u tn o to n l yt h e i rd i f f e r e n c e sb u ta l s ot h e i ra d v a n t a g e sa n d d i s a d v a n t a g e si no r d e rt op r o p o s eas u i t a b l em e t h o df o ro u rr e s e a r c ho nt h e c o m p u t e r - a s s i s t n gs t y l ec l a s s i f i c a t i o n s e c o n d l y , b u i l da n di m p r o v et h ec o r p u so fs o n gd y n a s t yp o e t r y a c c o r d i n g t ot h er u l e sa n df o r m so fs o n gp o e m s ,s e n t e n c e sa r ed i v i d e di n t os u b p i e c e s c l o s e l yc o m b i n e dw o r d sa r ee x t r a c t e db yc a l c u l a t i n gt h ef r e q u e n c y , m u t u a l i n f o r m a t i o na n dc o l l o c a t i o nr a t e s t r a t e g i e ss u c ha sc o n d i t i o n a lp r o b a b i l i t ya r e u s e dt oi m p l e m e n t g e l s - t a g g i n ga n dp a r t - o f - s p e e c h t a g g i n g f u r t h e r m o r e ,a c c o r d i n gt ot h et r a i t so fs o n gp o e m s e x p r e s s i o n 。t h i sp a p e r p r o p o s e sat e x tr e p r e s e n t a t i o nm o d e lw h i c hi ss u i t a b l ef o rs o n gp o e m s s t y l e c l a s s i f i c a t i o n b a s e do na p r i o da l g o r i t h m - c l a s s i c a la l g o r i t h mo fd a t am i n i n gt o f i n da s s o c i a t i n gw o r d s ,t h i sp a p e rf i n d so u tw o r d st h a ta p p e a rc o n c u r r e n t l yi n o n et e x t w eu s et h i sm e t h o dt os a v em o r ei n f o r m a t i o no fs o n gp o e m s s t y l e w h a ti sm o r e ,t h i sp a p e rm a k e sf u l lu s eo fh o wn e tt om a k eo u r a l g o r i t h mab i t u n d e r s t a n dt h em e a n i n go fw o r d s t h em a i nc o n t e n t su s e di nh o wn e ta r e c a l l e dc o n c e p t s b yc o m b i n i n gw o r d sa n d f r e q u e n ta s s o c i a t i n gw o r d s ,t h e p a p e rm a p sf 的mw o r d sa n df r e q u e n ta s s o c i a t i n gw o r d st oc o n c e p t s ,a n d p r o p o s e sv s mw h i c hi sb a s e do nt w om e t h o d sm e n t i o n e da b o v et op r e s e n t 1 1 1 s o n gp o e m s t h ef o l l o w i n ge x p e r i m e n t sp r o v et h a to u rv s mi se f f e c t i v e f i n a l l y , t h i sp a p e ri n t r o d u c e sd i f f e r e n tm e t h o d so ft e x tc l a s s i f i c a t i o na n dt h e m a i ni d e a so ft h e s e m e t h o d s a c c o r d i n gt o t h er e q u i r e m e n t 。t h ep a p e r c h o o s e so n eo ft h e m ,t h a ti sk n na l g o r i t h m 。a n du s eg e n e t i ca l g o r i t h mt o s e l e c tw e i g h t so ft e r m si nt h ev s m a n dt h e n ,t h ep a p e ri m p r o v e sk n n a l g o r i t h m sp a r a m e t e ri n o r d e rt om a k ei tf i tf o r s o n gp o e m s s t y l e c l a s s i f i c a t i o n i nt h ee n d ,t h i sp a p e ri m p l e m e n t sac l a s s i f i c a t i o na l g o r i t h mf o r d i f f e r e n ts t y l eo fs o n gp o e m s ,a n dg e t ss a t i s f y i n gr e s u l t s k e y w o r d s :c o m p u t a t i o n a lp o e t r y ;t e x tc l a s s i f i c a t i o nm e t h o d s ;a s s o c i a t i o n r u l e sf i n d i n g ;s o n gp o e m s s t y l er e p r e s e n t a t i v em o d e l i v 厦门大学学位论文原创性声明 兹呈交的学位论文,是本人在导师指导下独立完成的研究成 果。本人在论文写作中参考的其他个人或集体的研究成果,均在 文中以明确方式标明。本人依法享有和承担由此论文产生的权利 和责任。 。:昊看勿 乃d 3 年f 月乡de l 厦门大学学位论文著作权使用声明 本人完全了解厦门大学有关保留、使用学位论文的规定。厦门大 学有权保留并向国家主管部门或其指定机构送交论文的纸质版和电 子版,有权将学位论文用于非赢利目的的少量复制并允许论文进入学 校图书馆被查阅,有权将学位论文的内容编入有关数据库进行检索, 有权将学位论文的标题和摘要汇编出版。保密的学位论文在解密后适 用本规定。 本学位论文属于 1 保密( ) ,在年解密后适用本授权书。 2 不保密( ) ( 请在以上相应括号内打“) 作者签名;昊苍疹 刷币签轹( 日期:弘。8 年j 月乡oe t 日期:硼年9 月) 日 第一章绪论 第一章绪论 1 1 前言 诗词作为中国文学史上的瑰宝之一,因其恒久不衰的魅力而流传千古。这种 受到普罗大众和文人骚客青睐的文学形式经过不断的成长、演变以及传播,在唐 代和宋代达到了发展的顶峰。对唐诗宋词的研究一直是广大学者和文学爱好者的 一个研究热点。自古以来,无数专家学者前仆后继,从文学的角度对唐诗宋词进 行了广泛而深入的研究。然而,随着信息科学技术的不断发展,人们开始尝试利 用信息科学技术来处理工作生活中遇到的语言方面的一些问题。自然语言学在近 年来得到了飞速的发展。面对自然语言处理在现代汉语中取得的一个又一个的胜 利,本文尝试着将某些自然语言处理的方法运用到古代诗词中。同时针对古代诗 词区别于现代汉语的不同之处,从计算机的角度出发,综合数据挖掘、遗传算法 等技术和知网等资源,着重阐述了文本分类技术在宋词风格分类方面的应用。 1 2 研究背景 文本的自动分类始于5 0 年代末,h p l u l m 在这一领域进行了开创性的研究 【l 】。早在1 9 6 1 年,m a r o n 发表了第一篇关于自动分类技术的文章,之后国际上 许多著名的学者都对这一问题进行了深入的研究,如:k s p a r c h 2 1 、g s l a t o n 3 】以 及b u c k l e yc 1 4 】等都在这一领域取得了卓有成效的研究成果。我国的自动分类工 作始于8 0 年代初期,大体上经历了:可行性探讨辅助分类系统自动分 类系统三个发展阶段。所谓的自动分类系统产生于上世纪9 0 年代,其特点是将 基于统计的方法和机器学习的方法引入到文本自动分类中。其中,基于统计的方 法考虑了文档上下文的相关信息,而机器学习的方法较少考虑文本的语义信息 因此将语义分析和概念网络等方法与机器学习方法相结合会取得较好的分类效 果。 基于机器学习的文本分类方法主要由三个部分组成:文本的表示 ( r e p r e s e n t a t i o n ) ,分类方法以及效果( e f f e c t i v e n e s s ) 评估【5 】。也就是说文本分 来词风格的计算机辅助分析研究 类首先关心的是项( t e r m ) 或者特征的向量空间表示模型( v s m ) 以及特征选择 ( s e l e c t i o n ) 与特征提取( e x t r a c t i o n ) 两种表示空间降维( d i m e n s i o n a l i t yr e d u c t i o n ) 的策略;其次应考虑分类算法的构造或模型的挖掘学习过程;最后是分类效果评 估指标的选择,如正确率( p r e c i s i o n ) 、召回率( r e c a l l ) 、均衡点( b e p ) 、f i ( 常 用f i ) 和精度( a c c u r a c y ) 等【6 】。 在文本分类开始之前,需要将非结构化的文档数据表示成计算机能够理解的 数据形式,这就要求先对文档进行相应的预处理和特征表示,将非结构化或半结 构化的数据形式转化成计算机能够处理的结构化数据形式。这包括了分词、低频 词和禁用词过滤、特征表示、特征提取等一系列过程。所谓分词,就是在中文文 档中的各词条间加入分隔符,将中文文档的连续字符流形式转化成离散的词流形 式。目前采用的分词方法主要有:正向、逆向最大匹配法,逐词遍历法,最佳匹 配法,词频统计法,此外还有二次扫描法,邻接约束法等【_ 兀。特征表示是指用一 定的特征项来表示文档,在文本分类时只需对这些特征项进行处理,进而实现对 非结构化的文本的处理。目前常用的特征表示模型有:布尔模型( b o o l e a n m o d e l ) 、概率模型( p r o b a b i l i s t i cm o d e l ) 【8 】和向量空间模型( v e c t o rs p a c em o d e l ) 。 其中向量空间模型是常用的特征项表示模型。特征提取是通过高维数据变换将数 据映射到低维空间,以此来降低文档特征表示模型的空间维数,达到简化计算以 及防止过度匹配的目的。目前常用的特征提取方法主要有:文档频率d f ( d o c u m e n tf r e q u e n c y ) 、互信息m i ( m u t u a li n f o r m a t i o n ) 、贮统计和信息增益 i g ( i n f o r m a t i o ng a i n ) 【9 】。 目前常用的分类算法可以分为以下三种类型:第一,基于统计方法的分类算 法,如:b a y e s 算法【l o j 、k n n ( k - n e a r e s tn e i g h b o r ) f i i j 算法、类中心向量、回 归模型、支持向量机【1 2 1 、最大熵模型等方法;第二,基于连接的方法,如:人工 神经网络算法;第三,基于规则的方法:如决策树、关联规则等方法。三种不同 的分类技术在方法上各有不同的侧重点,因此具有各自的优缺点。基于统计的方 法本质上是一种不确定性的定量推理。它对大规模的语料信息进行统计,是一种 基于概率的定量统计。其特点在于它所有的知识是通过对大规模语料库分析得到 的,能够从整体上为信息处理提供比较客观的数据依据和可靠的质量保证,具有 较好的一致性和较高的覆盖率。但于此同时,它也必然造成对统计中所占比例较 2 第一章绪论 小的类别的忽视。使用基于连接的方法可以实现信息的分布存取,提高运算的并 行性,同时具有高容错性等特点,适合于学习一个复杂的非线性映射。其缺点在 于系统本身的透明性不好。基于规则的分类方法是在人类专家总结出来的大量知 识的基础之上进行演绎推理,它能够根据确定的上下文对事件进行描述,是种 充分利用现有语言学成果的技术。但是,也正是因为该技术过多地依赖于人类专 家,它对不确定性事件的描述就存在很大的缺陷,系统规则之间的相容性方面也 存在一定的限制,这样就限制了系统的智能化程度。 1 3 相关领域已有的研究 随着计算机科学技术的蓬勃发展,计算机硬件技术和软件技术在2 1 世纪初 就取得了令人瞩目的成果。以此为基础兴起的自然语言处理研究更是不断深入。 作为自然语言处理的一个相关研究领域,中国古代文学的计算机辅助研究也取得 了丰硕的成果。研究人员利用海量的计算机存储介质建立了中国古代诗词语料 库,并结合目前较为成熟的自然语言处理技术和古代诗词自身的特点,对中国古 代的诗词进行了计算机辅助研究。在我国,一些著名的学者已经开始了一系列相 关的研究工作,例如:厦门大学的周昌乐教授率先提出了“计算诗学1 3 】的概念 并就这一概念开展了一系列相关的研究工作;北京大学计算语言所与台湾元智大 学古文献研究所合作开展了“古代诗词研究的计算机支持环境 研列1 4 】【1 5 1 f 1 6 】; 重庆大学的李良炎提出了基于词连接【1 7 】的自然语言处理技术,并将其应用于诗词 语言的理解;中国科学院自动化所的费越【1 8 】和重庆大学的易勇【1 9 】对计算机自动 生成对联都进行了分析和探索。 1 4 本课题研究的内容和目标 本课题在已取得的研究成果的基础上,主要讨论宋词风格的计算机辅助分 析。这一课题得到了国家自然科学基金项目的资助。在悠久的中国古代文学历史 上,宋词一直是中国文坛上一种典型的文学创作类型。许多文人墨客曾经在这里 留下了被世人广为传诵的优秀作品。然而,不同时期、不同作者,其写作的风格 各不相同,即使是同一位作家也有不同风格类型的作品流传于世。它们或婉丽 清新、富艳精工,或豪爽旷达、奇崛清劲。百家争鸣的景象更使得宋词成为不少 3 未词风格的计算机辅助分析研究 研究人员竞相研究的对象,不少专家学者已经从人文科学的角度对不同风格流派 进行了深入的研究,并取得了一定的成绩。 面对国内外对宋词风格的计算机辅助分析还相对较少的情况,本文结合已有 的全宋词语料库和相关的知识库,将已有的计算机文本分类技术按照宋词风格表 示的需要进行适当的改进,利用数据挖掘中的寻找关联规则的方法和知网中的义 原结构,寻找到适合宋词风格表示的文档表示模型;同时利用遗传算法对分类算 法的权值进行选择。在此基础上取得到了较好的分类结果。 本文希望通过相关实验,寻找到一种适合宋词风格分类的文档表示模型,为 文档的风格分类提供一个新的视角。同时,希望通过本文的讨论,可以为后续诗 词的风格意象研究和诗词生成奠定一定的基础。 1 5 本课题研究的主要贡献 本文在已有宋词语料库和相关知识库的基础上,利用文本分类技术和数据挖 掘的相关技术,同时结合知网的义原结构,实现了宋词风格的计算机自动分类。 主要贡献体现在如下几点: 在阅读了国内外关于文学风格研究的相关文献后,对文学风格分类领域到目 前为止所使用的方法进行了分类、总结和分析。同时,对比了各种分类方法之间 的差异。 到目前为止,利用文本分类方法对文学作品进行风格分类的研究还相对较 少。对于已有的该领域的分类方法大多从文字集合的角度来进行简单的分i - j n 类。本文适当考虑了影响宋词风格的整体性因素,结合相关的文学知识和知网中 丰富的义原结构,运用数据挖掘的相关算法,提出了适合宋词风格分类的文档表 示模型基于概念和频繁关键词共现的诗词风格表示模型,该模型被运用到 州分类算法中。实验证明,利用了这一表示模型的分类算法可以得到令人较 为满意的宋词风格分类精度。 1 6 论文结构 本文的主要结构和内容安排如下: 第一章:介绍诗词的计算机辅助分析的相关技术背景和知识背景。在已有的 4 第一章绪论 背景下介绍本文所讨论的主要问题,接着,简要介绍了解决这一问题的方法及预 计要达到的目标。最后,简单描述了本文对“计算诗学”领域的贡献。 第二章:中国古代汉语的计算机辅助研究的综述。主要介绍了“计算诗学” 概念的由来,以及不同科研机构和研究人员在这一领域开展的工作。随后,站在 现有研究方法的角度,简述了本文的写作思路。 第三章:介绍与宋词风格的计算机辅助分析相关的全宋词语料库的内容。 第四章:介绍有助于宋词风格分类的频繁关键词共现的发现算法。算法主要 修改了数据挖掘中寻找关联规则的a p r i o r i 算法,将它应用到全宋词数据库的所 有句子当中。最后介绍了该算法发现的部分频繁关键词共现。 第五章:提出了宋词风格表示的特征表示方法。根据宋词风格分类的需要, 简述了如何在分类过程中更多保留对分类有用的信息。最后,提出了基于概念和 频繁关键词共现的诗词风格表示模型。 第六章:介绍了本文使用的主要分类算法,并结合遗传算法和爬山算法对 k n n 算法的主要参数进行训练。随后,给出了本文实验的主要数据,并对实验 结果进行了分析。 第七章:总结了本文提出的基于概念和频繁关键词共现的诗词风格分类模型 的优点和不足。同时,展望今后的进一步工作。 5 永词风格的计算机辅助分析研究 第二章中国古代汉语计算机辅助研究综述 2 1 前言 目前,国内外所进行的中国古代汉语计算机辅助研究工作相对较少。在国内, 从事这部分研究的科研机构和单位主要有:厦门大学、北京大学、重庆大学、中 国科学院、微软亚洲研究院等。这些科研机构和单位主要以诗词和对联最为主要 的研究对象,取得了丰硕的成果。 2 2 诗词计算机辅助研究的相关工作 我国学者从2 0 世纪9 0 年代就开始利用计算机技术对中国的古代文学进行辅 助研究。目前已经在语料库建设、词汇语义分析、创作风格辨析、联语应对等方 面取得了一定的进展。下面就对这些工作的相关内容进行简单的介绍: 厦门大学周昌乐教授在其著作心脑计算举要【1 3 】中首次提出了“计算诗学” 这一重要概念。概念的具体定义为:使用计算思想、方法和技术等从事诗歌( 推 而广之,也可以包括其它文学形式) 的研究工作,可以统称为计算诗学的研究。 广义的计算诗学,可以包括许多方面的工作,主要是对诗歌文本的各种规律的研 究,例如像诗歌机器分类、诗歌风格的计算机辅助归纳、诗学知识的计算机辅助 发现、诗歌创作的计算机辅助系统工具、诗歌用词用语的统计、诗学语料库、文 献库等等。而狭义的计算诗学,则主要是指使计算机系统具备诗歌理解、欣赏和 创作的能力,如诗歌作品的机器理解、计算机诗歌创作系统以及计算机词曲创作 系统等。围绕“计算诗学 这一重要概念,厦门大学艺术认知与计算实验室进行 了一系列的实验与研究,运用自然语言处理技术,建立了全宋词,唐诗等语料库 【2 0 】,在诗词的情感、格律、风格等方面开展了计算机的辅助研究。 北京大学计算语言学研究所运用计算语言学的手段对中国的古代诗词进行 了研究,从一个新的角度为古代汉语的计算机辅助研究提供了解决某些问题的方 法。其研究成果为古诗词和古汉语的计算机辅助研究提供了有益的帮助。他们的 研究主要是根据古代诗词的特点,将一些现代计算语言学的技术进行相应的改 6 第二章中圈古代汉语计算机辅助研究综述 造,从而达到计算机辅助分析的目的。在9 0 年代中后期,北京大学计算语言研 究所和台湾元智大学合作,开发了“古诗研究的计算机支持环境 模型系统【2 , 该系统初步实现了超文本阅读、全文检索、关键词检索、统计以及计算语言学辅 助研究等功能。随后,他们以1 6 0 万字的宋代名家诗为研究对象,运用基于统 计的语言模型。并结合宋诗自身的特点,采用条件概率策、互信息策略和规则策 略三种多音字自动注音策略,开发了“宋代名家诗自动注音系统”。该系统能够 实现宋诗的自动注音2 2 k 2 3 1 。目前北京大学计算语言学研究所在词汇自动切分、 相似词句检索技术等方面都取得了一定的应用成果,并在有关篇章分析、意象分 析、认知心理等领域展开了计算语言学的相关研究北京大学“唐宋诗计算机辅 助研究系统”的基本框架图如图2 1 所示。 图2 1 北京大学“唐宋诗计算机辅助研究系统一基本框架图 北京大学的胡俊峰博士在其博士论文中讨论了基于唐宋诗语料库的词汇 7 未词风格的计算机辅助分析研究 自动提取、基于词汇的统计知识库的构建、基于统计的词汇语义关系的自动发现、 诗词构词规则的提取等方面的研究。他的论文还介绍了以多条件复合检索技术为 依托的唐宋诗计算机辅助研究系统的开发及应用。简言之,其论文是基于古代诗 词的特点,将现代的计算语言学技术加以改造后运用于唐宋诗的辅助研究中。 重庆大学的李良炎博士在其博士论文【1 7 1 中提出了基于词联接的自然语言处 理技术( t e r mc o n n e c t i o nt e c h n i q u ef o rn l p ,简称t c t ) ,并将该技术运用于诗 词语言的理解中。在其论文中主要介绍了词联接最大语义符合度计算和最优句树 搜索的初级语言分析算法,并用该算法进行了诗词语料标注测试、诗词语言初级 分析测试、诗词语言豪放与婉约风格的评价测试,实验取得较为满意的结果。该 论文在深入分析n l p 技术背景的基础上,提出并初步构建了基于词联接的n l p 技术,并把这一技术应用到诗词语言处理系统中。 在春联的计算机辅助研究领域,中国科学院自动化研究所的费越利用人工神 经网络的方法研究形象思维层次的“语义”,并利用大量在春联中使用的对仗词 语进行了实验【l 引。他利用人工神经网络对人类学习词语的过程进行模拟,实现了 语义的数值表现序列从无序到有序的一个动态过程。在他论文中提出的汉语处理 的神经网络并行模型能够构造初六个汉字以内的计算机春联生成系统。 重庆大学的易勇博士将对联的上下联分别看作两个具有相同长度的语言单 位的序列,采用机器学习方法对其学习,实现了一个联语生成系统。在分析了传 统对联的特点后,将对联的生成问题抽象为有监督的序列学习问题【1 9 】。他提出了 不限字数的联语应对生成的计算模型,并分别运用n 元统计语言模型序列学习 法、隐马尔可夫模型序列学习法和基于转换的驱动序列学习法对联语生成进行建 模分析,并在建立的对联语料库机器学习的基础上分别上机编程实现。构建了基 于语料库不限字数的计算机联语应对实验系统,取得了较好的实验成果。 微软亚洲研究院自然语言组于2 0 0 4 年启动了计算机自动对联的研究【2 5 1 ,于 2 0 0 4 年年底完成了方案设计。历经1 年半的开发,微软对联系统和微软对联聊 天机器人系统已于2 0 0 6 年完成。当用户给定上联时,系统能自动提供若干下联 供用户选择,用户可以通过交互手段优选字词来生成满意的下联;当确定- n 对 联后还可以生成若干四字横批供用户参考。目前本系统可处理八字以下的对联, 并已在互联网上投入使用。 8 第二章中国古代汉语计算机辅助研究综述 重庆大学易勇的博士论文【1 9 】计算机辅助诗词创作中的风格辨析及联语应对 研究则着重对诗词风格的机器评判进行了研究。在他的博士论文中,用基于机 器学习的朴素贝叶斯等方法,采用向量空间模型对诗词进行表示,首次提出了古 典诗词的豪放和婉约风格辨析计算模型。并在此基础上用遗传算法对模型进行了 改进,取得了诗词风格辨析较为满意的结果。在他的论文中还建立了诗词的作者 辨析计算模型,利用之前相似的机器学习方法,对诗词作者进行了辨析,得到了 较好的结果。 2 3 课题研究思路 利用已有的机器学习方法,可以将宋词的风格辨析转化成文本分类问题。但 是宋词风格分类又不同于一般的文本分类,需要对已有的文本分类模型进行适当 的改进。 在阅读了大量有关古代文学作品的研究文献后,可以发现诗词的风格是通过 文章整体体现出来的。诗词作品总是利用一个个特定词语的集合向读者展现了一 副客观存在的景象。这副景象经过读者理性思维和感性思维的共同加工后,才形 成读者对豪放或婉约风格的体会。因此,文学作品的风格分类不能仅仅从词语使 用的频率上来考虑,更应该从作品的整体上把握风格的表现。 不同风格类型的文学作品可以使用相同的词汇,但是通过词汇间不同的组合 方式却能体现出截然不同的风格类型。本文率先考虑了词语与词语之间的联系对 宋词风格表现的影响。在思考如何让计算机寻找词语与词语之间联系的问题时, 本文考虑利用数据挖掘技术中寻找关联规则的方法,来寻找全宋词语料库中经常 同时出现的词语集合,从而为分类算法保存更多的风格分类所需的重要信息为 了建立适合宋词风格分类的文档表示模型,本文计划利用知网中丰富的语义信 息,为分类器在适当理解语义的前提下,降低向量空间模型的维度。而且,利用 知网的语义信息可以同时解决宋词中频繁出现的“一义多词 的问题。最后本文 打算利用遗传算法来优化特征项在向量空间中的权值比重,并用爬山算法寻找最 合适的k 值。最后,实现对宋词风格的自动辨析。 9 宋词风格的计算机辅助分析研究 2 4 本章小结 本章主要从计算诗学现有的研究方法出发,介绍了厦门大学、北京大学、重 庆大学、中国科学院自动化研究所、微软亚洲研究院等科研机构利用信息科学技 术对中国古代汉语进行的部分研究。 随后,以现有的研究技术和成果为出发点,简单介绍了本文对宋词风格的计 算机分类问题的看法,以及解决该问题的理论依据和实现手段。 1 0 第三章宋词风络研究语料库的建立 第三章宋词风格研究语料库的建立 3 1 前言 语料库的建立是本文后续设计文档表示模型和机器学习的重要基础之一,因 此有必要先对本文所依赖的语料库进行简单的介绍。在自然语言处理的众多问题 当中,它们中大部分的解决多依赖一个合理语料库的建立。本文着重对宋词进行 风格方面的辨析,因此主要的语料库【2 0 】的建立除了考虑到自然语言处理技术,还 结合了宋词本身的特点和宋词风格表示的特点。为了便于编程和管理,本文所依 赖的语料库以a c c e s s 数据库格式进行存储。 3 2 宋词的特点和语料库建立技术 中国古代文学的特点之一是比较讲究表达文学作品整体的意境,而在语法方 面则多出现词性活用等现象。从传统语义学角度来看,汉语这种没有完整语法形 态,讲究意合,强调语义的语言,很难用什么方法来表示或评价。在中国古代诗 词中,意象的产生对语言结构形式要求不高,因此,有些诗词语言中没有明确的 主谓宾形式。这样就很难采用传统的词法、语法、语义的三元结构来分析诗词语 吉【2 6 】 日 为了建立适合宋词风格辅助研究的语料库,本文将诗词引入到语料库中。但 是诗词的语言给语料库引入了特殊的语言学问题【2 7 1 。因为诗词语言可以不必过多 理会语义甚至是语法的要求 2 1 】,所以通常都认为诗词的熵( 即诗词语言的不确定 性) 大,信息少。这就带来了计算机语言处理的新问题。本文利用了宋词中的领 字、典故和字串的出现频率、互信息和共现度等来建立全宋词的词表。同时考虑 到宋词风格辨析的需要,在语料库中还适当地抽取了知网中的部分信息。 3 3 宋词风格研究语料库的主要组成部分 i 。全宋词数据库 本文的全宋词主要来自唐圭璋编著的全宋词 2 9 】和南京师范大学的网络版 l l 永词风格的计算机辅助分析研究 词d 词牌 标题 作者 首句 生语料简体 生语料繁体 熟语料简体 风格类型 需要说明的是,其中的风格类型只标注了目前为止收集到的由诗词专家评定 的共计5 6 4 首豪放与婉约的宋词作品。 2 作者数据库 本文的作者数据库建立在南京师范大学的网络版全宋词的基础上。数据 库中包含的作者共1 4 9 7 人,就风格分析而言,记录下作者的相关信息有利于日 后针对不同时期的不同作者的写作风格进行归纳和分析。该数据库的结构如下: 作者号 字号 生卒年 词作品数 3 词牌数据库 词作为一种特殊的文学体裁有其特定的格式,这种特定的格式就称作词牌。 词牌又称为词调,正所谓“调有定句,旬有定字,字有定声 ,每首词都有一个 特定的词牌名,该词牌名规定了该首词需要遵循的格式。这种“格式”主要包括 以下几个方面的内容:l 、调名;2 、分片( 阕) ,以分上下两片居多,短的不分片, 长的有多片:3 、句数和字数,多采用长短句,也有五言、六言、七言的整齐句 式;4 、韵的位置和押韵方式( 有的中间要换韵) :5 、字的声调( 以平仄为主) 。千 百年来,词牌在流传的过程中不断增加和演变,一个词牌名可能存在一个正体和 1 2 第三章宋词风络研究语料库的建立 多个别体。为了后续处理的方便,本文使用的词牌数据库建立在南京师范大学的 网络版全宋词的基础上,其中包含词牌1 3 8 4 个,词牌正体9 2 2 个。该数据 库的结构如下: 词牌正名 词牌别名 词牌注释 4 全宋词专有名词数据库 宋词中运用了大量的专有名词,这些专有名词无法利用计算机将其分离出 来,例如:人名、地名等具有特殊含义的词语。本文的专有名词数据库利用了宋 词大辞典t 3 1 和前人的归纳d 2 1 ,将专有名词分为:人名、地名、天文、时令、 音乐、人伦、人事、闺阁、形体、文事、珍宝、建筑、服饰、饮食、草木、百花 等,共计1 5 类。数据库中包含的宋词专有名词共6 8 0 个。专有名词数据库和典 故数据库的建立都是为了宋词词语切分的需要。该数据库结构设计如下: 专有名词 释义 类别 5 。全宋词典故数据库 考虑到全宋词中运用的大量典故,本文中用到全宋词典故数据库主要以全 宋词典故考释辞典【3 3 】和台湾元智大学罗凤珠老师的诗词典故资料数据库1 6 】为 基础,包含了全宋词典故共计4 4 6 7 条。该数据库结构如下: 典故 相关典故 同义典故 相关人物 释义 6 单字数据库 采用统计的方法建立的数据库。该数据库主要记录全宋词数据库中出现的所 有字的频率,以及出现在该字前后的不同字的频率。数据库中包含汉字5 9 5 0 字, 其具体结构如下: 1 3 宋词风格的计算机辅助分析研究 字 频率 前字频率 后字频率 7 “二字字串 数据库 采用统计方法建立的“二字字串 数据库中包含二字字串3 3 7 8 8 2 条。该数 据库主要记录全宋词中出现的二字字串的频率、出现在每个二字字串前后的二字 字串的频率以及该二字字串的互信息。该数据库的结构设计如下: 二字字串 字串频率 前字串频率 后字串频率 互信息 8 词表数据库 采用频率、互信息和共现度等统计抽词方法,结合宋词相关词典建立的数据 库【2 0 】。该数据库结构如下: 词 词义 词结构 9 词语一义原数据库 考虑到风格分类的需要,本文将词语的词义表示成概念的形式( 具体的表示 方法将在第五章进行详细介绍) 。为了实现宋词文档中的词语到概念的映射,在 语料库中设计了词语一义原数据库。该数据库的结构如下: 词语 第一义原 其余义原 3 4 本章小结 全宋词风格研究语料库的建立为后续工作的展开奠定了坚实的基础。数据挖 1 4 第三章宋词风络研究语料库的建立 掘、词语一义原的映射等都需要有完善的语料库作为支持。目前该语料库基 本符合宋词风格的计算机辅助分析的需要。本文介绍的后续工作都是在该数据库 上逐步开展的。 1 5 宋诃风格的计算机辅助分析研究 第四章频繁关键词共现的抽取 4 1 前言 诗词作品的风格分类,可以被看作是一种文本分类问题。但由于诗词风格的 自身的特点,文本分类中常用的由仅表示关键词的特征项所组成的向量空间,在 风格分类方面却无法取得令人理想的效果。 现代汉语小词典对诗词风格的解释是:“文艺作品所表现出的主要的思 想特点和艺术特点”。而辞海文学分册则认为风格是“写作主体在创作中 所表现出来的艺术特色和创作个性。一一般说来,“风格就是作品的风貌与格调。 风格与作品的内容直接有关,与作品的艺术表现直接有关,更是作者的精神面貌、 才质修养、审美情趣等主观因素在作品中的体现 3 4 1 ”。综合上述观点,一篇文学 作品中单个字、词或者词组并不能完整体现其风格,只有当它们结合在一起时, 才反映出诗词的整体风格。对诗词的风格分析应该基于通篇文章来考虑。 在阅读了大量有关风格知识的文学方面的论著后,本文提出了将“词共现” 的概念运用在风格分类中的想法。因为宋词的风格是通过整首宋词所采用的一个 个词语“集体”体现出来的,一个个孤立的词语并不能决定整首宋词作品的风格 特征。人们在判断一首宋词作品的风格类别的时候,往往需要通读全文,将这些 词汇所描绘的场景映像到脑海中之后,利用大脑对该场景的感知反映出该宋词作 品的风格类型。为了说明这个问题,本文列举东坡乐府中,最具有英雄气概 的代表作,也是被誉为“千古绝口昌”的赤壁怀古苏轼的念奴娇【3 习 为例: 大江东去,浪淘尽、千古风流人物。故垒西边,人道是、三国周郎赤壁。乱 石穿空,惊涛拍岸,卷起千堆雪。江山如画,一时多少豪杰。遥想公瑾当年,小 乔初嫁了,雄姿英发。羽扇纶巾,谈笑问、樯虏灰飞烟灭。故国神游,多情应笑 我,早生华发。人生如梦,一尊还酹江月。 整首词描写了大江、故垒、乱石、惊涛等自然景物,令人联想到三国时候的 英雄人物,一幅雄伟壮阔的景象在读者面前展现,不难判别,这首 以一) ) t h e n e = a u 口保留k 一2 个相同的项,连同两个不相同的项构成k 项集 e n di f i fh a s i n fr e q u e n t s u b s e t ( c ,最一1 ) t h e n 批中将c 删除 e l s e 将c 添加到e 中 e n di f e n df o , 图4 2a p r i o r i - g e n ( f k _ 1 ) 2 算法h a si n f r e q u e n t _ s u b s e t ( e ,g k - 1 ) 筝j 伪代码如图4 3 所示。 2 0 第四章频繁关键词共现的抽取 图4 3h a si n f r e q u e n t _ $ u b s e t ( c ,f k - 1 ) 3 规则生成算法的伪代码如图4 4 所示。 图4 4 规则生成算法的伪代码 4 算法印- g e m u l e s ( f k ,h m ) 的伪代码如图4 5 所示。 2 l 束词风格的计算机辋助分析研究 k - - i f , i m = l 以i f k m + 1t h e n 以+ l = a p r i o r i - g e n ( h m ) 加厂e a c hh i + l 风+ l 如 c 咖老 i fc o n f m i n c o 矿t h e n 输出规则( 五- h + ) 专k 小 e l s e 从以+ 。中删除死“ e n di f e n df o , a p g e n r u l e s ( f k ,以+ i ) e n di f 图4 5a p - g e n r u l e s ( f k , h m ) 4 6a p r i o r i 算法的实验数据 本文利用a 研o r i 算法对全宋词语料库中的存在“句子 进行关联规则挖掘。 这里所谓的“句子 的定义是:以句号、感叹号和问号作为分隔符,将文档集合 中的文档表示成一系列字符串的集合,每个字符串在文档处理过程中被称为“句 子 。在每个“句子一中,本文忽略了其中除了以上三种标点符号以外的其它标 点符号。经过对全宋词语料库中句子的提取,一共产生了近1 6 万个句子。这些 句子被看作是数据挖掘过程中的事务集。 同时为了随后处理的方便和快捷,在a p r i o r i 开始之前,首先对每个句子中 出现的词语按照规定好的序列进行排序。例如:经过切分后的原始句子为“正是 i 一年l 秋光i 好 ,经过排序算法处理后输出为:“一年i 秋光f 好f 正是 。经过这样简 单的处理,可以在a p r i o r i 中省掉大部分不必要的重复比较计算,大大提高a p r i o r i 2 2 第四章频繁关键词共现的抽

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论