《计算语言学》试卷附答案_第1页
《计算语言学》试卷附答案_第2页
《计算语言学》试卷附答案_第3页
《计算语言学》试卷附答案_第4页
《计算语言学》试卷附答案_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《计算语言学》试卷附答案一、单项选择题(每题2分,共20分)1.以下哪项不属于计算语言学的核心研究目标?A.开发自然语言处理系统(如机器翻译、问答系统)B.分析语言的历史演变规律(如古汉语到现代汉语的语音变化)C.构建语言的形式化模型(如句法树、语义网络)D.利用统计方法挖掘语言数据中的模式(如词频分布、共现关系)2.乔姆斯基(Chomsky)提出的形式语法体系中,上下文无关语法(Context-FreeGrammar,CFG)对应哪一型语法?A.0型(无约束短语结构语法)B.1型(上下文有关语法)C.2型(上下文无关语法)D.3型(正则语法)3.在隐马尔可夫模型(HiddenMarkovModel,HMM)中,“状态”与“观测”的关系是?A.状态是可直接观测的,观测是隐含的B.状态是隐含的,观测是可直接获取的C.状态与观测一一对应,均为可观测变量D.状态与观测无直接关联,由外部特征决定4.中文分词中的“交集型歧义”是指?A.一个字符串存在两种以上不同的切分方式,且切分结果有部分重叠(如“乒乓球拍卖完了”可切为“乒乓球/拍卖/完了”或“乒乓/球拍/卖完了”)B.一个字符串的切分结果完全不重叠(如“大学生活动中心”可切为“大/学生/活动/中心”或“大学/生/活动/中心”)C.切分结果中存在生僻词,导致歧义(如“门把手”切为“门/把手”或“门把/手”)D.因标点符号缺失导致的歧义(如“他说的对吗”切为“他说/的/对吗”或“他/说的/对吗”)5.以下哪种方法不属于句法分析(SyntacticParsing)的常用技术?A.基于规则的递归下降分析(RecursiveDescentParsing)B.最大熵模型(MaximumEntropyModel)C.依存句法分析(DependencyParsing)D.情感极性分析(SentimentPolarityAnalysis)6.计算词的相似度时,若使用向量空间模型(VectorSpaceModel),“余弦相似度”衡量的是?A.两个向量的长度差异B.两个向量的方向一致性C.两个向量的维度数量D.两个向量的元素和的比值7.语料库标注(CorpusAnnotation)中,“词性标注”(Part-of-SpeechTagging)的主要目的是?A.标注词语的情感倾向(如褒义、贬义)B.标注词语在句子中的语法功能(如名词、动词)C.标注词语的历史来源(如古汉语、外来词)D.标注词语的发音特征(如声母、韵母)8.在统计机器翻译(StatisticalMachineTranslation,SMT)中,“翻译模型”(TranslationModel)主要处理的问题是?A.源语言到目标语言的词序调整B.源语言短语与目标语言短语的对应概率C.目标语言句子的流畅性评估D.源语言句子的句法结构分析9.以下哪项属于语义分析(SemanticAnalysis)的任务?A.计算句子的字符长度B.识别句子中的命名实体(如人名、地名)C.统计文本中的重复词汇D.检测句子的语法错误10.在神经网络模型(如LSTM、Transformer)中,“注意力机制”(AttentionMechanism)的核心作用是?A.减少模型的参数量B.增强模型对序列中长距离依赖的捕捉能力C.加速模型的训练速度D.提高模型的可解释性二、填空题(每空2分,共20分)1.计算语言学的两大研究范式是__________(基于规则)和__________(基于数据)。2.形式语言中,正则语法(3型语法)可被__________(自动机类型)识别。3.隐马尔可夫模型的三个基本问题是:评估问题(给定观测序列求概率)、__________(给定观测序列求最可能的状态序列)、__________(给定观测序列估计模型参数)。4.中文分词的主要歧义类型包括交集型歧义、__________(如“他将来北京”中的“将来”与“将/来”)。5.句法分析的输出通常是__________(如短语结构树)或__________(如依存关系图)。6.词嵌入(WordEmbedding)的典型方法包括__________(基于全局统计的矩阵分解)和__________(基于局部上下文的预测模型)。7.机器翻译的评价指标中,__________(BLEU)通过计算候选翻译与参考翻译的n元语法匹配度来评估质量。三、简答题(每题8分,共40分)1.简述规则驱动方法与数据驱动方法在计算语言学中的优缺点。2.解释“句法歧义”(SyntacticAmbiguity)的概念,并举例说明两种常见类型。3.什么是语料库语言学(CorpusLinguistics)?其核心研究手段与传统语言学研究有何差异?4.对比短语结构语法(PhraseStructureGrammar)与依存语法(DependencyGrammar)的分析视角。5.说明TF-IDF(词频-逆文档频率)的计算公式及其在文本处理中的作用。四、分析题(每题10分,共20分)1.给定句子“他用钢笔写论文”,请用短语结构语法(CFG)绘制其句法树(需标注非终结符,如S、NP、VP、PP等)。2.某语料库中“苹果”一词在1000篇文档中出现,其中在50篇文档中出现过“苹果手机”,在30篇文档中出现过“苹果电脑”,在20篇文档中同时出现“苹果手机”和“苹果电脑”。假设总文档数为10000篇,计算“苹果”与“手机”的互信息(MutualInformation,MI)值(公式:MI(w1,w2)=log2(P(w1,w2)/(P(w1)P(w2))),结果保留两位小数)。五、论述题(共20分)结合具体实例,论述深度学习(如Transformer模型)对自然语言处理任务(如机器翻译、文本生成)的革新性影响,并分析其局限性。答案一、单项选择题1.B(分析语言历史演变属于传统语言学范畴,非计算语言学核心目标)2.C(乔姆斯基体系中,2型语法对应上下文无关语法)3.B(HMM中状态隐含,观测可直接获取)4.A(交集型歧义的定义是切分结果部分重叠)5.D(情感分析属于语义/语用任务,非句法分析)6.B(余弦相似度衡量向量方向一致性)7.B(词性标注的核心是语法功能标注)8.B(翻译模型处理源-目标短语对应概率)9.B(命名实体识别属于语义分析)10.B(注意力机制增强长距离依赖捕捉)二、填空题1.符号主义;统计主义(或经验主义)2.有限状态自动机(或确定性有限自动机/DFA)3.解码问题;学习问题(或参数估计问题)4.组合型歧义(或覆盖型歧义)5.短语结构树;依存关系图6.LSA(潜在语义分析);Word2Vec(或GloVe也可,但需区分全局与局部)7.蓝信值(或双语评估替换值)三、简答题1.规则驱动方法:优点是可解释性强,能精确处理特定规则覆盖的语言现象(如中文“把”字句的结构约束);缺点是规则库构建成本高,难以覆盖语言的开放性和歧义性(如自然语言中的大量例外用法)。数据驱动方法:优点是可自动从大规模数据中学习模式(如通过语料库统计词频共现关系),适应性强;缺点是依赖高质量标注数据,对小样本或低频现象效果较差(如低资源语言的处理任务)。2.句法歧义指句子因结构分析不同导致多种理解。常见类型:①结构歧义(如“咬死了猎人的狗”可理解为“(咬死了猎人)的狗”或“咬死了(猎人的狗)”);②成分附着歧义(如“他看到女孩和男孩在跳舞”中“和男孩”可附着于“女孩”或“看到”的宾语)。3.语料库语言学以大规模真实文本(语料库)为研究对象,通过统计和计算方法挖掘语言规律(如词频分布、搭配模式)。与传统语言学差异:传统语言学依赖内省或小样本举例,结论可能受主观影响;语料库语言学基于客观数据,结论更具统计显著性(如通过词频统计验证“的”是汉语最高频虚词)。4.短语结构语法关注句子的层级结构(如S→NPVP,VP→VNP),通过非终结符的递归展开描述句法;依存语法关注词与词之间的依赖关系(如“写”支配“他”“钢笔”“论文”,形成“写→他(施事)、写→钢笔(工具)、写→论文(受事)”的有向图)。前者强调整体结构,后者强调局部关系。5.TF-IDF公式:TF-IDF(w,d)=TF(w,d)×IDF(w),其中TF(w,d)是词w在文档d中的词频,IDF(w)=log(N/df(w))(N为总文档数,df(w)为包含w的文档数)。作用:衡量词w在文档d中的重要性(过滤高频通用词如“的”,突出领域关键词如“计算语言学”)。四、分析题1.句法树示例(层级从顶至底):S(句子)→NP(名词短语:他)+VP(动词短语)VP→V(动词:写)+NP(名词短语:论文)+PP(介词短语)PP→P(介词:用)+NP(名词短语:钢笔)(注:具体标注可调整,核心结构需体现“他(NP)用钢笔(PP)写论文(VP中的动宾结构)”)2.计算步骤:-P(苹果,手机)=50/10000=0.005-P(苹果)=1000/10000=0.1-P(手机)=(出现“苹果手机”的文档数+其他含“手机”的文档数),但题目未明确其他文档,假设“手机”仅在“苹果手机”中出现,则P(手机)=50/10000=0.005-MI=log2(0.005/(0.1×0.005))=log2(10)≈3.32五、论述题深度学习(如Transformer)对NLP的革新:①长距离依赖建模:Transformer的自注意力机制(Self-Attention)通过计算序列中任意位置的关联,突破了LSTM的长距离依赖限制(如处理“虽然...但是...”等跨句逻辑关系)。②端到端学习:传统方法需人工特征工程(如手工设计句法特征),而Transformer通过多层注意力层自动学习语义表征(如BERT预训练模型可捕捉“苹果”在“吃苹果”与“苹果公司”中的不同语义)。③多任务迁移:预训练-微调(Pre-train&Fine-tune)范式使模型能从大规模无标注数据中学习通用语言知识(如GPT-3通过千亿参数训练,支持

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论