版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
自然语言处理领域介绍(Introduction)单元测验一1.单选题:依存句法分析任务用算法自动预测
选项:
A、短语结构
B、词与词之间的句法关系
C、句法树与句法树之间的依存关系
D、短语和短语之间的依存关系
答案:【词与词之间的句法关系】2.单选题:为什么要使用统计方法进行自然语言处理
选项:
A、统计方法原理简单,便于实现
B、统计方法有助于发挥语言学优势
C、统计方法有助于解决语言中的歧义
D、统计方法是计算机科学的重要基础
答案:【统计方法有助于解决语言中的歧义】3.单选题:给定一段文字,判断其蕴含的正面、负面情感的任务叫做
选项:
A、立场检测
B、讽刺识别
C、垃圾邮件检测
D、情感分类
答案:【情感分类】4.多选题:下列哪些结构属于语义分析的对象?
选项:
A、一阶谓词逻辑
B、对话意图分析
C、抽象语言义表达
D、层次短语结构
答案:【一阶谓词逻辑;对话意图分析;抽象语言义表达;层次短语结构】5.多选题:下列哪些属于信息抽取任务?
选项:
A、事件自动检测
B、命名实体识别
C、机器阅读理解
D、医药关系抽取
答案:【事件自动检测;命名实体识别;机器阅读理解;医药关系抽取】6.多选题:下列哪些应用背后包含自然语言处理技术?
选项:
A、搜索引擎
B、火车站人脸识别
C、语音输入法
D、导航系统
答案:【搜索引擎;语音输入法;导航系统】7.多选题:自然语言处理发展经历了哪些历史阶段?
选项:
A、基于规则的方法
B、统计方法
C、深度学习方法
D、自然科学方法
答案:【基于规则的方法;统计方法;深度学习方法】8.多选题:下列哪些任务属于计算语言学的研究范畴?
选项:
A、语音转文字
B、成分句法分析
C、篇章结构分析
D、脑电波转文字
答案:【成分句法分析;篇章结构分析】9.多选题:语言处理相关机器学习模型可以分为
选项:
A、有监督学习和无监督学习
B、主动学习和被动学习
C、分类问题和结构预测问题
D、线性模型和非线性模型
答案:【有监督学习和无监督学习;线性模型和非线性模型】10.多选题:下列哪些任务使用文本生成技术?
选项:
A、自然语言推断(文本蕴含)
B、机器翻译
C、细粒度情感分类
D、开放领域问答
答案:【机器翻译;开放领域问答】11.多选题:下列陈述正确的包括
选项:
A、信息检索和信息抽取是相同的任务
B、推荐系统是自然语言处理的一个分支
C、基于事件的股市预测属于文本挖掘任务
D、自动作文评分属于文本生成任务
答案:【推荐系统是自然语言处理的一个分支;基于事件的股市预测属于文本挖掘任务】12.多选题:从机器学习的视角学习自然语言处理的优势,包括
选项:
A、自然语言处理任务动态变化,而背后的机器学习方法相对固定
B、机器学习算法有助于对深刻的语言学规律的研究
C、同样的机器学习方法可以解决很多不同的自然语言处理任务
D、自然语言处理是机器学习的一个分支领域
答案:【自然语言处理任务动态变化,而背后的机器学习方法相对固定;机器学习算法有助于对深刻的语言学规律的研究;同样的机器学习方法可以解决很多不同的自然语言处理任务】概率模型(CountingRelativeFrequency)单元测验二1.单选题:朴素贝叶斯模型(NaiveBayesclassifiermodel)有几个参数类别
选项:
A、1
B、2
C、3
D、5
答案:【2】2.单选题:用同样的数据训练的语言模型,下列哪个更大?(提示:参数实例数量影响模型大小)
选项:
A、一元语言模型
B、三元语言模型
C、五元语言模型
D、一样大
答案:【五元语言模型】3.单选题:掷骰子,得到1~6这6个不同的点数。该问题所对应的概率分布是
选项:
A、二项式分布(binomialdistribution)
B、伯努利分布(Bernoullidistribution)
C、多项式分布(multinomialdistribution)
D、分类分布(categoricaldistribution)
答案:【伯努利分布(Bernoullidistribution)】4.单选题:在一般意义上,建模过程中的参数化(parameterization)步骤是指
选项:
A、定义模型参数,实现从输入到输出的映射函数的过程
B、优化模型参数,拟合数据分布的过程
C、定义模型参数,实现概率估算方法的过程
D、优化模型参数,实现特定训练目标最大化的过程
答案:【定义模型参数,实现从输入到输出的映射函数的过程】5.单选题:给定连续的两个词,计算第三个词的条件概率。这样的语言模型是
选项:
A、一元语言模型
B、二元语言模型
C、三元语言模型
D、四元语言模型
答案:【三元语言模型】6.单选题:什么是未登录词(out-of-vocabulary;OOV)?
选项:
A、词典里没有的词
B、拼写错误的词
C、训练数据中没有出现过的词
D、没有在网络词汇表中注册过的词
答案:【训练数据中没有出现过的词】7.多选题:如果有七元语言模型,那么它的主要技术挑战包括
选项:
A、速度慢
B、稀疏性强
C、表达能力弱
D、内存占用多
答案:【速度慢;稀疏性强;内存占用多】8.多选题:朴素贝叶斯模型参数化的过程使用了
选项:
A、贝叶斯法则(bayesrule)
B、概率链式法则(probabilitychainrule)
C、概率边缘化计算(Marginalization)
D、条件无关假设(Independenceassumption)
答案:【贝叶斯法则(bayesrule);概率链式法则(probabilitychainrule);条件无关假设(Independenceassumption)】9.多选题:下列关于概率正确的表达有
选项:
A、P(A)P(B|A)=P(B)P(A|B)
B、A与B条件无关,则B与A条件无关
C、P(A)一定P(A|B)
D、P(B,C|A)=P(B|A)P(C|B,A)
答案:【P(A)P(B|A)=P(B)P(A|B);A与B条件无关,则B与A条件无关;P(B,C|A)=P(B|A)P(C|B,A)】10.多选题:关于超参数,下列哪些说法是正确的
选项:
A、模型参数属于超参数
B、超参数影响模型性能
C、一般来说,超参数的数量相对模型参数较少
D、超参数允许手工定义
答案:【超参数影响模型性能;一般来说,超参数的数量相对模型参数较少;超参数允许手工定义】11.多选题:关于概率链式法则与条件无关假设,下列说法正确的有
选项:
A、生成式概率模型,参数化过程中的重要工具
B、N元语言模型句子概率计算过程的推导手段
C、朴素贝叶斯模型建模过程中使用的重要技巧
D、最大似然估计推导过程中的必要步骤
答案:【生成式概率模型,参数化过程中的重要工具;N元语言模型句子概率计算过程的推导手段;朴素贝叶斯模型建模过程中使用的重要技巧;最大似然估计推导过程中的必要步骤】12.多选题:下列哪些技术可以减少数据稀疏性对模型带来的不利影响
选项:
A、平滑(smoothing)
B、回退(backoff)
C、条件概率(conditionalprobability)
D、边缘化(marginalization)
答案:【平滑(smoothing);回退(backoff)】13.多选题:关于生成式模型(generativemodel),下列表述正确的有
选项:
A、建模的对象是联合概率表达
B、具有较高的可解释性,表达生成过程
C、不使用条件无关假设
D、一般难以处理(overlappingfeatures)特征
答案:【建模的对象是联合概率表达;具有较高的可解释性,表达生成过程;一般难以处理(overlappingfeatures)特征】14.多选题:手中有枚硬币。对它不进行任何的事先假设。向上抛掷100次,其中56次面朝上,得到硬币面朝上的概率是56%,上述过程使用的估算方法是
选项:
A、相对频率估算
B、最大后验概率估算
C、最小二乘估算
D、最大似然估计
答案:【最大后验概率估算;最大似然估计】向量数学模型(FeatureVectors)单元测验三1.单选题:对向量空间进行聚类所依赖的基本数学关系是?
选项:
A、概率关系
B、空间距离关系
C、向量长度关系
D、贝叶斯法则
答案:【空间距离关系】2.单选题:多分类支持向量机不再需要参数b的原因是
选项:
A、特征向量表达能力增强
B、模型训练的目标函数改变,用正确类别和错误类别的相对分值而不是绝对分值进行决策
C、对于多分类问题,模型的超平面定义彻底改变了,不需要平移参数就可以定义点到超平面的距离
D、多分类问题需要非线性变换,参数b变换之后不能保证代表空间平移距离,因此只能舍弃
答案:【模型训练的目标函数改变,用正确类别和错误类别的相对分值而不是绝对分值进行决策】3.多选题:多分类感知机与二分类感知机相同之处
选项:
A、都将向量空间分成两个部分
B、训练目标都是使正确输出的分数高于错误输出的分数值
C、都在训练数据上迭代多轮更新
D、都使用正确输出的特征减去错误输出的特征进行参数调整
答案:【都将向量空间分成两个部分;都在训练数据上迭代多轮更新】4.多选题:线性模型在训练数据上能够完全区分不同的样本,取决于:
选项:
A、训练数据的线性可分性
B、模型特征定义的丰富程度
C、模型是不是判别式模型
D、模型是不是在训练数据上过拟和
答案:【训练数据的线性可分性;模型特征定义的丰富程度】5.多选题:下列陈述正确的包括
选项:
A、训练数据表现越准确的模型在测试数据表现不一定越准确
B、判别模型一定比生成模型准确
C、模型的特征定义的越丰富越多模型就越准确
D、感知机和支持向量机都是线性模型,但是有办法在线性不可分的数据上进行训练
答案:【训练数据表现越准确的模型在测试数据表现不一定越准确;感知机和支持向量机都是线性模型,但是有办法在线性不可分的数据上进行训练】6.多选题:下列关于特征的陈述,哪些是正确的
选项:
A、是对具体信息的抽象数学表达
B、可以取整数值,也可以取实数值
C、必须同时包括输入和输出信息
D、分为特征类别和特征实例,后者经常作为特征向量的一部分
答案:【是对具体信息的抽象数学表达;可以取整数值,也可以取实数值;分为特征类别和特征实例,后者经常作为特征向量的一部分】7.多选题:下列哪些手段可以解决信息量低的高频词对于基于词频的文档向量表示的不利影响
选项:
A、停用词的排除
B、对所有词的频率进行加一平滑
C、使用TF/IDF文档向量
D、对向量中的每个元素除以一个常数
答案:【停用词的排除;使用TF/IDF文档向量】8.多选题:关于支持向量机(SVM)正确的说法有
选项:
A、利用点到超平面的距离定义训练目标
B、模型参数可以被看成是一个超平面
C、可以很自然地解决二分类问题,但不能直接解决多分类问题
D、是一种在线的学习算法
答案:【利用点到超平面的距离定义训练目标;模型参数可以被看成是一个超平面;可以很自然地解决二分类问题,但不能直接解决多分类问题】9.多选题:关于感知机(perceptron)正确的说法有
选项:
A、是一种在线的学习算法
B、模型参数可以被看成是定义一个超平面
C、给定一个输入,模型分数大于一则判断为正例,模型分数小于1则判断为负例
D、模型参数的数量和输入特征向量的长度无关
答案:【是一种在线的学习算法;模型参数可以被看成是定义一个超平面;给定一个输入,模型分数大于一则判断为正例,模型分数小于1则判断为负例】10.多选题:允许支持向量机和感知机用一个超平面完成多分类问题的关键因素包括
选项:
A、将超平面映射成超曲面
B、将多分类问题转换成正确类别和错误类别的二分类
C、一个超平面不能解决多分类问题,需要对每个类别分别定义一个超平面
D、通过对输入和输出同时提取特征,对特征向量空间增维
答案:【将多分类问题转换成正确类别和错误类别的二分类;通过对输入和输出同时提取特征,对特征向量空间增维】11.多选题:下列对于K-均值聚类正确的说法有
选项:
A、是一种有监督的机器学习方法
B、依赖于向量之间的空间距离度量
C、是一种迭代的算法
D、可以解决文本分类问题
答案:【依赖于向量之间的空间距离度量;是一种迭代的算法】12.多选题:K-均值聚类中关于K取值的说法正确的有
选项:
A、是一个模型的超参数
B、可以在模型优化中自动学习
C、取值会影响模型聚类的效果
D、需要在聚类算法运行之前确定
答案:【是一个模型的超参数;取值会影响模型聚类的效果;需要在聚类算法运行之前确定】13.多选题:关于分类问题和聚类问题正确的说法有
选项:
A、都是在向量空间寻找切分方式的算法
B、都只依赖输入文档的向量表示
C、效果都受到特征类别定义的影响
D、分类问题比聚类问题对向量空间的切分可控,是因为相应的模型参数更多
答案:【都是在向量空间寻找切分方式的算法;效果都受到特征类别定义的影响;分类问题比聚类问题对向量空间的切分可控,是因为相应的模型参数更多】14.多选题:关于支持向量机(supportvectormachine)和朴素贝叶斯模型,下列说法错误的是
选项:
A、都是文本分类模型
B、都是概率模型
C、都是二分类模型模型
D、都是判别式模型
答案:【都是概率模型;都是二分类模型模型;都是判别式模型】对数线性模型(DiscriminativeLinearClassifiers)单元测验四1.单选题:在随机梯度下降算法优化对数线性模型的过程中,每一轮迭代针对当前样本计算的是
选项:
A、当前样本的模型概率。
B、当前样本对于输入变量的梯度。
C、当前样本局部损失函数对于模型参数的导数。
D、当前样本模型概率对于模型参数的导数。
答案:【当前样本局部损失函数对于模型参数的导数。】2.单选题:关于多分类感知机和支持向量机的比较
选项:
A、感知机没有明确的优化目标函数,但支持向量机具有。
B、感知机的训练目标函数和支持向量机相似,但是后者多了一项正则项。
C、支持向量机优化向量空间中的超平面,但感知机不具有空间解释。
D、两种算法的目标函数都可以看成是正确输出和错误输出之间的分差,且优化的目标分差相同。
答案:【感知机的训练目标函数和支持向量机相似,但是后者多了一项正则项。】3.单选题:0/1损失函数为什么不能用于定义模型的损失函数
选项:
A、这种损失函数会增大模型的经验风险。
B、这种损失函数属于离散函数。
C、这种损失函数,计算复杂度太高。
D、这种损失函数无法对模型参数求导。
答案:【这种损失函数无法对模型参数求导。】4.单选题:对数线性模型的训练目标函数是
选项:
A、最大边缘Maximummargin
B、最大似然Maximumlikelihood
C、最小二乘Minimumsquareerror
D、以上都不是
答案:【最大似然Maximumlikelihood】5.单选题:感知机支持向量机和对数线性模型的训练目标函数都可以看作是
选项:
A、最小化训练数据上的经验风险。
B、最小化任何数据上的期望风险。
C、最小化开发数据上的经验风险。
D、最小化测试数据上的期望风险。
答案:【最小化训练数据上的经验风险。】6.单选题:显著性检验的p值Significancelevel具体代表
选项:
A、两个模型性能具有差别的概率。
B、实验结果存在误差的概率。
C、一个模型强于另一个模型的概率。
D、两个模型内在性能相同的概率。
答案:【两个模型内在性能相同的概率。】7.多选题:感知机支持向量机和对数线性模型可以看成是一个一般感知机模型的不同特例,它们之间的不同之处在于
选项:
A、有些模型是线性模型,有些模型是非线性模型
B、激活函数不同
C、正则项不同
D、输出神经元的个数不同
答案:【激活函数不同;正则项不同】8.多选题:关于对数线性模型,下列说法正确的有
选项:
A、对数线性模型属于线性判别模型
B、对数线性模型是概率模型
C、二分类对数线性模型,又叫做逻辑回归(Logisticregression)
D、多分类对数线性模型使用sigmoid激活函数
答案:【对数线性模型属于线性判别模型;二分类对数线性模型,又叫做逻辑回归(Logisticregression)】9.多选题:下列关于梯度下降算法正确的说法有
选项:
A、是一种数值优化算法
B、是一种迭代算法
C、随机梯度下降是梯度下降算法的一种近似,运行效率更高。
D、随机梯度下降算法可以用于训练对数线性模型,但不能用来训练支持向量机。
答案:【是一种数值优化算法;是一种迭代算法;随机梯度下降是梯度下降算法的一种近似,运行效率更高。】10.多选题:关于半监督学习,说法错误的有
选项:
A、属于有监督训练。
B、属于无监督训练。
C、自监督训练属于半监督训练。
D、属于自监督训练。
答案:【属于有监督训练。;属于无监督训练。;属于自监督训练。】11.多选题:关于co-training正确的说法是
选项:
A、是一种半监督学习的方法。
B、需要两个模型。
C、需要未经标注的数据。
D、是一种数据增广的方式。
答案:【是一种半监督学习的方法。;需要两个模型。;需要未经标注的数据。;是一种数据增广的方式。】12.多选题:多分类感知机和对数线性模型在随机梯度下降训练过程中,相同的地方不包括
选项:
A、梯度更新都以正确输出的特征向量和模型分数最高的输出的特征向量的差为基础。
B、都考虑所有可能的输出类别。
C、都考虑模型概率。
D、二者都奖励正确输出的特征向量。
答案:【梯度更新都以正确输出的特征向量和模型分数最高的输出的特征向量的差为基础。;都考虑所有可能的输出类别。;都考虑模型概率。】13.多选题:L1正则和L2正则的相同之处不包括
选项:
A、都使得参数向量的模变小。
B、都使得参数向量还有更多的零值。
C、都降低模型的过拟合程度。
D、都不适用于逻辑回归。
答案:【都使得参数向量的模变小。;都使得参数向量还有更多的零值。;都不适用于逻辑回归。】14.多选题:集成模型Ensemblemodel的概念
选项:
A、和单模型相比可以降低泛化误差。
B、可以通过多个模型加权投票的方式进行。
C、可以通过多个模型堆叠(Stacking)的方式进行。
D、要求每一个模型都是概率模型。
答案:【和单模型相比可以降低泛化误差。;可以通过多个模型加权投票的方式进行。;可以通过多个模型堆叠(Stacking)的方式进行。】信息论(UsingInformationTheory)单元测验五1.单选题:关于点互信息(point-wisemutualinformation),正确的说法是
选项:
A、衡量两个随机变量整体之间的关系
B、两个随机变量的取值,共同出现的频率越高,点互信息就一定越大
C、取值范围零到正无穷
D、与联合概率和边缘概率都有关
答案:【与联合概率和边缘概率都有关】2.单选题:下列表述正确的是
选项:
A、条件熵一定大于非条件熵
B、KL散度不能为负数
C、两个概率分布的交叉熵一定小于其中一个变量的熵
D、互信息是非对称的
答案:【KL散度不能为负数】3.单选题:服从均匀分布的随机数一共有52种可能,得到其中一个数字所消除的不确定性可以用多少个比特编码?
选项:
A、52比特
B、13比特
C、3比特到4比特之间
D、5比特到6比特之间
答案:【5比特到6比特之间】4.单选题:篮子里边有一个红球,三个绿球和四个蓝球,抓到蓝色球所消除的不确定性是
选项:
A、1比特
B、2比特
C、3比特
D、4比特
答案:【1比特】5.单选题:信息和熵分别表示___和___的不确定性:
选项:
A、随机事件,随机事件的结果
B、随机事件的结果,随机事件
C、随机事件,随机变量
D、随机事件的结果,随机变量的取值
答案:【随机事件的结果,随机事件】6.多选题:下边关于模型困惑度的描述正确的有
选项:
A、可以用于评价语言模型的质量
B、可以用于定义损失函数
C、和条件熵有关,与交叉熵无关
D、不会为负值
答案:【可以用于评价语言模型的质量;可以用于定义损失函数;不会为负值】7.多选题:关于词的向量表示,说法正确的有
选项:
A、可以用词汇表中的每一个词与当前词在特定上下文共同出现的频率作为当前词的向量表示
B、可以用点互信息来取代词汇表中的每一个词与当前词在特定上下文共同出现的频率
C、理想状态意思相近的词在向量空间里边的位置相近
D、词语的向量表示全都是低维稠密的
答案:【可以用词汇表中的每一个词与当前词在特定上下文共同出现的频率作为当前词的向量表示;可以用点互信息来取代词汇表中的每一个词与当前词在特定上下文共同出现的频率;理想状态意思相近的词在向量空间里边的位置相近】8.多选题:下列描述两个随机变量的概念包括
选项:
A、条件熵
B、交叉熵
C、KL散度
D、互信息
答案:【条件熵;互信息】9.多选题:最小化KL散度相当于
选项:
A、最小化交叉熵
B、最小化模型困惑度
C、最大化数据似然
D、最大化互信息
答案:【最小化交叉熵;最小化模型困惑度;最大化数据似然】10.多选题:下边关于熵和困惑度的描述正确的有
选项:
A、具有对数和指数的关系
B、是相互对立的两个值
C、描述多面色子,前者可以描述编码的比特数,后者描述其对应的色子面数
D、都描述随机变量的统计特性
答案:【具有对数和指数的关系;描述多面色子,前者可以描述编码的比特数,后者描述其对应的色子面数;都描述随机变量的统计特性】11.多选题:下列和最大熵原则有关的论述包括
选项:
A、训练过程最大化目标变量的不确定性
B、训练过程最小化目标变量的不确定性
C、奥卡姆的剃刀
D、最大似然估算
答案:【训练过程最大化目标变量的不确定性;奥卡姆的剃刀;最大似然估算】隐变量(HiddenVariables)单元测验六1.单选题:下列哪种算法可以对隐变量进行学习?
选项:
A、相对频率计算
B、期望最大算法
C、感知机
D、对数线性模型
答案:【期望最大算法】2.单选题:本节课中K均值聚类里边的隐变量是
选项:
A、向量到类别中心的距离
B、类别中心向量
C、向量对类别的归属
D、类别个数
答案:【向量对类别的归属】3.单选题:隐变量(Hiddenvariable)指的是:
选项:
A、训练数据中不存在的变量
B、模型没有考虑的变量
C、模型不对用户公开的隐私变量
D、训练数据中存在,但测试数据中不存在的变量
答案:【训练数据中不存在的变量】4.单选题:IBMmodel1有几个参数类别?
选项:
A、一个
B、两个
C、三个
D、和词汇表的平方成正比
答案:【两个】5.单选题:IBMmodel1的隐变量
选项:
A、是任务输出
B、任务收入和任务输出之外的变量
C、既包括任务输出,又包括额外变量
D、没有隐变量
答案:【任务收入和任务输出之外的变量】6.单选题:IBMModel1最后为翻译的句间关系进行了哪些化简
选项:
A、两句话词与词之间一一对应互为翻译
B、源语言的一个词可以对应目标语言的多个词,但是反过来不行
C、源语言中每个单词必须对应目标句子中的某个单词,但目标句子中可以有单词不对应源语言句子中的任何词
D、目标语言句子中的第一个单词可以对应源语言中的多个单词。
答案:【目标语言句子中的第一个单词可以对应源语言中的多个单词。】7.单选题:在运行无监督朴素贝叶斯模型之前,需要事先随机初始化:
选项:
A、模型参数
B、隐变量
C、类别个数
D、支持向量取值
答案:【模型参数】8.多选题:下列PLSA描述正确的有
选项:
A、可以给文档提供乘幂向量表示
B、是一种生成式概率模型
C、是有隐变量的模型
D、模型训练具有封闭解
答案:【可以给文档提供乘幂向量表示;是一种生成式概率模型;是有隐变量的模型】9.多选题:下列关于期望最大算法理论正确的说法有
选项:
A、使用了Jenseninequality推导
B、间接最大化了可观测数据的似然
C、E-step可以被认为是为了优化训练目标寻找隐变量的后验概率形式
D、可以在理论上证明,无论随机初始化如何,都能找到全局最优解
答案:【使用了Jenseninequality推导;间接最大化了可观测数据的似然;E-step可以被认为是为了优化训练目标寻找隐变量的后验概率形式】10.多选题:隐变量在不同问题中可以包括
选项:
A、任务输入
B、任务输出
C、输入输出之外的其他变量
D、模型参数
答案:【任务输出;输入输出之外的其他变量】11.多选题:K均值聚类可以看成一种
选项:
A、期望最大算法
B、化简的期望最大算法
C、概率算法
D、迭代优化算法
答案:【化简的期望最大算法;概率算法;迭代优化算法】12.多选题:IBMmodel1的参数化过程使用了哪些技术
选项:
A、贝叶斯法则
B、概率链式法则
C、条件无关假设
D、特征工程
答案:【贝叶斯法则;概率链式法则;条件无关假设】13.多选题:对于hardEM算法,下列正确的有
选项:
A、是期望最大算法的一种化简形式
B、通过迭代的调整模型参数和隐变量来优化数据似然
C、期望步骤和最大步骤优化的目标都是可观测到的变量的对数概率
D、迭代的终止条件是隐变量和模型参数不再显著改变
答案:【是期望最大算法的一种化简形式;通过迭代的调整模型参数和隐变量来优化数据似然;迭代的终止条件是隐变量和模型参数不再显著改变】14.多选题:下列关于期望最大算法说法正确的有
选项:
A、是一种最大似然训练算法,考虑到隐变量
B、建模对象是可观测的变量和隐变量的联合概率
C、参数化过程只需针对模型建模对象的联合概率进行
D、可以看成是一种坐标上升(coordinateascent)数值优化算法
答案:【是一种最大似然训练算法,考虑到隐变量;建模对象是可观测的变量和隐变量的联合概率;参数化过程只需针对模型建模对象的联合概率进行;可以看成是一种坐标上升(coordinateascent)数值优化算法】15.多选题:下列关于无监督朴素贝叶斯模型说法正确的有
选项:
A、建模对象和参数设置与有监督朴素贝叶斯模型相同
B、隐变量是输入和输出之外的变量
C、需要事先定义类别个数
D、与k均值聚类算法完全等同
答案:【建模对象和参数设置与有监督朴素贝叶斯模型相同;需要事先定义类别个数】生成式序列标注(GenerativeSequenceLabeling)单元测验七1.单选题:标签词性标注任务的解码过程
选项:
A、给定词性标签序列,生成相应的词序列
B、给定词序列,预测相应的词性标签序列
C、给定加密的标签序列,输出原始的标签序列
D、给定加密的模型参数,还原词性标签
答案:【给定词序列,预测相应的词性标签序列】2.单选题:词性标注的输出序列个数与输入序列长度成
选项:
A、线性关系
B、²关系
C、质数关系
D、阶乘关系
答案:【质数关系】3.单选题:二阶HMM的维特比算法在时间复杂度方面与输入长度成
选项:
A、线性关系
B、²关系
C、³关系
D、质数关系
答案:【线性关系】4.单选题:维特比(Viterbi)算法属于
选项:
A、动态规划算法
B、近似算法
C、贪心算法
D、A*算法
答案:【动态规划算法】5.单选题:二阶隐马尔科夫模型之中,每一个输出标签概率依赖于几个历史标签?
选项:
A、1
B、2
C、3
D、4
答案:【2】6.单选题:隐马尔科夫模型有几个特征类别?
选项:
A、1
B、2
C、3
D、4
答案:【2】7.单选题:对于序列标注,前项后项算法所寻找的边缘概率是
选项:
A、首个标签的条件概率
B、最后K个标签的条件概率
C、任意连续k个标签的条件概率
D、最后一个标签的条件概率
答案:【任意连续k个标签的条件概率】8.单选题:对于序列标注问题,使用前项后项算法之后,可以直接(通过常数复杂度)获得
选项:
A、特定位置的边缘概率
B、任意位置的边缘概率
C、特定输出序列的条件概率
D、任意输出序列的条件概率
答案:【任意位置的边缘概率】9.单选题:前项后项(forwardbackward)算法
选项:
A、是动态规划算法
B、是贪心算法
C、是住搜索算法
D、是A*算法
答案:【是动态规划算法】10.多选题:隐马尔科夫模型(HMM)参数化的过程使用技巧
选项:
A、贝叶斯法则
B、概率链式法则
C、条件无关假设
D、维特比算法
答案:【贝叶斯法则;概率链式法则;条件无关假设】11.多选题:一阶隐马尔科夫模型
选项:
A、是生成式模型
B、是判别式模型
C、每个词只依赖于前一个词
D、每个标签只依赖前一个标签
答案:【是生成式模型;每个标签只依赖前一个标签】12.多选题:Baum-Welch算法
选项:
A、使用了动态规划算法
B、是迭代算法
C、是无监督学习
D、是精确求解算法
答案:【使用了动态规划算法;是迭代算法;是无监督学习】13.多选题:隐马尔科夫模型的训练
选项:
A、使用随机梯度下降算法
B、使用相对频率
C、使用最大边缘损失函数
D、使用最大似然估算原则
答案:【使用相对频率;使用最大似然估算原则】14.多选题:下列哪些任务属于结构预测任务
选项:
A、中文分词
B、词性标注
C、成分句法分析
D、垃圾邮件过滤
答案:【中文分词;词性标注;成分句法分析】15.多选题:对于词性标注,局部模型
选项:
A、可以看成零阶马尔科夫模型
B、不考虑输出标签之间的相互关联
C、不能利用全局输入句子特征
D、不能利用朴素贝叶斯模型
答案:【可以看成零阶马尔科夫模型;不考虑输出标签之间的相互关联】判别式序列标注(DiscriminativeSequenceLabeling)单元测验八1.单选题:什么是标签偏置(labelbias)?
选项:
A、序列标注模型的输出更倾向于含有较大转移概率的片段
B、序列标注模型的输出更倾向于含有边缘概率更大的片段
C、序列标注模型更倾向于预测较短的序列
D、序列标注模型的输出更倾向于含有相对频率更大的标签
答案:【序列标注模型的输出更倾向于含有较大转移概率的片段】2.单选题:给定相同的特征模板,MEMM和CRF对于序列标注相同输入
选项:
A、参数向量一样长
B、前者的参数向量更长
C、后者的参数向量更长
D、不能判断两者谁的参数向量长
答案:【参数向量一样长】3.单选题:MM、MEMM和CRF三个模型的维特比算法,制表过程中表格的结构___,表内元素的计算方法___
选项:
A、相同,相同
B、相同,不同
C、不同,相同
D、不同,不同
答案:【相同,不同】4.单选题:最大熵马尔科夫模型的训练目标是计算___,解码的目标是寻找___最大的序列
选项:
A、局部标签概率,标签序列概率
B、局部标签概率,局部标签概率
C、标签序列概率,标签序列概率
D、标签序列概率,局部标签概率
答案:【局部标签概率,标签序列概率】5.单选题:最大熵马尔科夫模型经典的解码算法使用
选项:
A、贪婪搜索
B、动态规划
C、柱搜索
D、A*算法
答案:【动态规划】6.单选题:用于序列标注的感知机structuredperceptron和标准二分类的感知机相比
选项:
A、原理一致,但是使用动态规划计算边缘概率
B、原理一致,但是使用动态规划计算最优序列
C、都使用了数值优化算法,但是前者更复杂,含有更多近似
D、二者完全不同,没有类比
答案:【原理一致,但是使用动态规划计算最优序列】7.单选题:朴素贝叶斯模型与隐马尔可夫模型的关系,最像逻辑回归模型与___的关系
选项:
A、条件随机场
B、结构支持向量机
C、感知机
D、最大熵马尔可夫模型
答案:【条件随机场】8.单选题:条件随机场与二分类的对数线性模型相比,训练过程最大的挑战在于
选项:
A、训练过程相同
B、训练目标函数对于模型参数的导数不像分类任务一样有封闭解
C、二者都需要对特征向量求期望,但是由于序列标注任务的特征结构更复杂,因此期望算法更复杂
D、二者都需要对参数向量求期望,但是由于输出个数更多,期望计算更复杂
答案:【二者都需要对参数向量求期望,但是由于输出个数更多,期望计算更复杂】9.单选题:条件随机场的训练和二分类对数线性模型的训练相比
选项:
A、原理一致,但是使用动态规划计算边缘概率
B、原理一致,但是使用动态规划计算最优序列
C、都使用了数值优化算法,但是前者更复杂,含有更多近似
D、二者完全不同,没有类比
答案:【原理一致,但是使用动态规划计算边缘概率】10.单选题:结构支持向量机StructuredSVM和标准二分类的支持向量机相比
选项:
A、原理一致,但是使用动态规划计算边缘概率
B、原理一致,但是使用动态规划计算最优序列
C、都使用了数值优化算法,但是前者更复杂,含有更多近似
D、二者完全不同,没有类比
答案:【原理一致,但是使用动态规划计算最优序列】11.多选题:下列关于条件随机场的说法正确的有
选项:
A、是一种判别模型
B、是一种概率模型
C、是一种结构预测模型
D、建模过程中使用马尔可夫假设
答案:【是一种判别模型;是一种概率模型;是一种结构预测模型;建模过程中使用马尔可夫假设】12.多选题:最大熵马可夫模型的参数化过程使用
选项:
A、贝叶斯法则
B、概率的链式法则
C、条件无关假设
D、与特征向量相应的参数向量
答案:【概率的链式法则;条件无关假设;与特征向量相应的参数向量】13.多选题:最大熵马尔科夫模型(MEMM)的训练过程使用了
选项:
A、最大似然估算
B、随机梯度下降
C、相对频率
D、最大边缘计算
答案:【最大似然估算;随机梯度下降】14.多选题:下列有关平均感知机的说法正确的包括
选项:
A、对训练数据进行平均计算
B、对模型参数进行平均计算
C、通过类似集体学习的方式减少过拟合
D、比起标准感知机,大幅地增加模型的训练时间
答案:【对模型参数进行平均计算;通过类似集体学习的方式减少过拟合】15.多选题:关于不正确的训练样本的代价(cost),说法正确的有
选项:
A、体现不同错误输出之间的相对优劣
B、量化指标容易融合到最大边缘损失
C、影响结构支持向量机的训练过程,改变其对负样本的选择
D、不适用于分类任务
答案:【体现不同错误输出之间的相对优劣;量化指标容易融合到最大边缘损失;影响结构支持向量机的训练过程,改变其对负样本的选择】16.多选题:关于条件随机场的前项后项算法,说法正确的有
选项:
A、前项和后项算法都与维特比算法框架相似,具有相同的时间复杂度
B、可以计算序列中连续k个标签的边缘概率
C、设计过程利用了全局特征向量可分解的性质
D、是针对指数求和的多项式时间简化方法
答案:【前项和后项算法都与维特比算法框架相似,具有相同的时间复杂度;可以计算序列中连续k个标签的边缘概率;设计过程利用了全局特征向量可分解的性质;是针对指数求和的多项式时间简化方法】17.多选题:以下哪些是判别式模型
选项:
A、隐马尔科夫模型
B、感知机
C、条件随机场(CRF)
D、朴素贝叶斯模型
答案:【感知机;条件随机场(CRF)】序列切分(SequenceSegmentation)单元测验九1.单选题:如果对词的长度进行最大限制,那么中文分词的一阶半马尔科夫条件随机场模型(firstordersemiCRF)动态规划解码对于输入长度的时间复杂度为
选项:
A、线性复杂度
B、²复杂度
C、三次方复杂度
D、四次方复杂度
答案:【线性复杂度】2.单选题:半马尔可夫条件随机场(Semi-MarkovConditionalRandomField)、结构支持向量机(structuredSVM)和结构感知机(structuredperceptron)在解决序列切分问题时,
选项:
A、训练可以相同,解码可以相同
B、训练可以相同,解码不同
C、训练不同,解码可以相同
D、训练不同,解码不同
答案:【训练不同,解码可以相同】3.单选题:半马尔可夫条件随机场(Semi-MarkovConditionalRandomField))和条件随机长(ConditonalRandomField)的随机梯度下降(SGD)训练方法,单个样本的导数在公式形式上___,其中计算期望的求和实现算法___
选项:
A、相同,相同
B、相同,不同
C、不同,相同
D、不同,不同
答案:【相同,不同】4.单选题:semiCRF模型计算边缘概率(片段概率)所使用的算法是
选项:
A、维特比算法
B、前项后项算法
C、封闭解
D、暴力枚举
答案:【前项后项算法】5.单选题:使用一阶半马尔科夫模型进行中文分词,对于输出“〈s〉我吃了苹果〈/s〉”,激活“连续两个词”特征模板,可以产生几个特征实例?
选项:
A、三
B、15
C、五
D、一
答案:【五】6.单选题:对于中文分词,使用一阶半马尔科夫模型,其动态规划解码算法的时间复杂度对于输入长度
选项:
A、线性复杂度
B、²复杂度
C、三次方复杂度
D、四次方复杂度
答案:【三次方复杂度】7.单选题:对于序列标注和序列切分问题来说,结构支持向量机进行训练时,损失函数形式___,负样本求解方法___
选项:
A、相同,相同
B、相同,不同
C、不同,相同
D、不同,不同
答案:【相同,不同】8.单选题:对于二阶半马尔可夫模型,进行柱搜索解码,时间复杂度对于输入长度
选项:
A、线性复杂度
B、平方复杂度
C、三次方复杂度
D、四次方复杂度
答案:【线性复杂度】9.单选题:同阶semiCRF的维特比算法和前项算法,表格结构___,运算时间复杂度___
选项:
A、相同,相同
B、相同,不同
C、不同,相同
D、不同,不同
答案:【相同,相同】10.单选题:复杂度相对输入长度来计算,semiCRF的后项算法计算过程含有___个项的求和,每项是___个指数的乘积
选项:
A、线性,线性
B、线性,指数
C、指数,线性
D、指数、指数
答案:【指数,线性】11.单选题:对于semiCRF,经过前项后项算法过程,得到相应表格,在计算片段的边缘概率
选项:
A、直接从表格中读数相乘
B、从表格中读取相应数字相乘,再除以一个常数
C、从表格中读取数字相乘,再除以一个配分函数,,后者可以用线性复杂度的简单求和计算
D、从表格中读取数字相乘,再除以一个配分函数,后者需要动态规划计算。
答案:【从表格中读取数字相乘,再除以一个配分函数,后者需要动态规划计算。】12.单选题:semiCRF模型训练过程,需要对特征求期望。该项算法与相同模型的计算边缘概率算法相比,前项后项过程___,后续计算过程___
选项:
A、相同,相同
B、相同,不同
C、不同,相同
D、不同,不同
答案:【相同,不同】13.单选题:中文分词在机器学习视角属于什么问题?下列最正确的描述
选项:
A、序列切分问题
B、序列标注问题
C、分类问题
D、回归问题
答案:【序列切分问题】14.单选题:对于序列切分问题,使用条件随机场和维特比算法进行序列标注解决
选项:
A、不可行,因为问题属性差别
B、可以用于中文分词任务,但是不可以用于命名实体识别等任务
C、是一种具有线性复杂度,但是片段特征受到限制的可行实现方式
D、是一种运算复杂度较低,但是特征范围非常灵活的实现方式
答案:【是一种具有线性复杂度,但是片段特征受到限制的可行实现方式】15.多选题:下列哪些特征可以用于命名实体识别的条件随机场模型?
选项:
A、输入的第一个单词和当前单词
B、输出的第一个标签和当前标签
C、当前标签和下一个单词
D、当前单词在外部命名实体识别词典中的匹配关系
答案:【输入的第一个单词和当前单词;当前标签和下一个单词;当前单词在外部命名实体识别词典中的匹配关系】16.多选题:使用一阶半马尔科夫模型解决中文分词,可行的特征有
选项:
A、连续两个输出词中,每个词的第一个字
B、某个输出词中间连续三个字
C、连续三个输出词的长度(所含字数)组合
D、句首字和当前词进行组合
答案:【连续两个输出词中,每个词的第一个字;某个输出词中间连续三个字】17.多选题:在感知机引导的柱搜索算法中,提前更新(earlyupdate)理解正确的有
选项:
A、作用是调整模型,引导搜索过程更加准确
B、可以取代解码完成之后的参数更新
C、更新后当前样本的解码过程立刻结束
D、导致相应模型速度提升,性能略微损失
答案:【作用是调整模型,引导搜索过程更加准确;更新后当前样本的解码过程立刻结束】18.多选题:准确率(precision)和召回率(recall)的说法正确的有
选项:
A、相同概念对于不同任务产生的不同评价指标
B、两个比率指标,分子相同,分母不同
C、两个比率指标,分母相同,分子不同
D、前者是以模型输出为基础进行评价,后者是以黄金标准输出为基础进行评价
答案:【两个比率指标,分子相同,分母不同;前者是以模型输出为基础进行评价,后者是以黄金标准输出为基础进行评价】贝叶斯网络(BayesianNetwork)单元测试十1.单选题:吉布斯采样的每个样本:
选项:
A、在前一个样本上改变一个变量
B、与前一个样本无关
C、在前一个样本上改变多个变量
D、是前两个样本的随机组合
答案:【在前一个样本上改变一个变量】2.单选题:一元语言模型Addalphasmoothing背后的理论来自
选项:
A、贝叶斯一元语言模型
B、最大后验一元语言模型训练
C、回退
D、主题模型
答案:【贝叶斯一元语言模型】3.单选题:贝叶斯网络中的推断指的是
选项:
A、计算网络中的所有必备变量的联合概率
B、计算网络中的条件概率
C、训练网络参数
D、计算给定某些变量值,网络中其他特定变量的概率
答案:【计算给定某些变量值,网络中其他特定变量的概率】4.单选题:最大后验估算和最大似然估算的最大区别
选项:
A、考虑了参数的先验概率
B、考虑了隐变量
C、属于判别模型
D、计算步骤简化
答案:【考虑了参数的先验概率】5.单选题:Bayesianlearning和maximumlikelihoodestimation的最大区别是
选项:
A、计算效率更高
B、考虑了参数的所有可能取值
C、属于判别模型
D、最大化数据和参数的联合概率
答案:【考虑了参数的所有可能取值】6.单选题:一般来说,贝叶斯网络模型的建模对象是:
选项:
A、一组事件之中某个事件的概率
B、一组事件的联合概率
C、一组事件中某个事件的分数
D、一组事件的整体分数
答案:【一组事件的联合概率】7.单选题:贝叶斯网络中的节点和边分别表示
选项:
A、事件、事件之间的关系
B、实体、实体之间的关系
C、事件、概率条件相关性
D、实体、实体概率相关性
答案:【事件、概率条件相关性】8.单选题:对于贝叶斯网络,给定一个节点的parent集合,该节点和___概率无关。
选项:
A、non-descendent节点
B、所有其他节点
C、邻居节点
D、马尔可夫地毯之外的节点
答案:【non-descendent节点】9.单选题:贝叶斯网络有哪三种基本训练方式?
选项:
A、maximumlikelihood,maximumentropy,Bayesian
B、MLE,EM,MAP
C、MLE,EM,Bayesian
D、maximumlikelihood,MAP,Bayesian
答案:【maximumlikelihood,MAP,Bayesian】10.多选题:下列关于吉布斯采样,表述正确的有
选项:
A、是动态规划算法
B、是近似算法
C、可以用于推断
D、是训练算法
答案:【是近似算法;可以用于推断】11.多选题:下列LDA相关说法,正确的有
选项:
A、是贝叶斯模型
B、是考虑隐藏变量的模型
C、是主题模型
D、可用吉布斯采样推断
答案:【是贝叶斯模型;是考虑隐藏变量的模型;是主题模型;可用吉布斯采样推断】12.多选题:以下哪些模型可以看作是贝叶斯网络模型?
选项:
A、朴素贝叶斯模型
B、支持向量机
C、隐马尔可夫模型
D、对数线性模型分类器
答案:【朴素贝叶斯模型;隐马尔可夫模型】13.多选题:下列关于conjugateprior的描述,正确的有:
选项:
A、体现了先验概率和似然的内在联系
B、为了计算简便
C、在贝叶斯网络中体现参数的先验概率
D、一般应用在贝叶斯学习过程
答案:【为了计算简便;在贝叶斯网络中体现参数的先验概率;一般应用在贝叶斯学习过程】14.多选题:下列先验和似然分布匹配的是
选项:
A、Beta,Binomial
B、Beta,Multinomial
C、Dirichlet,Binomial
D、Dirichlet,Multinomial
答案:【Beta,Multinomial;Dirichlet,Multinomial】神经网络(NeuralNetworks)单元测验十一1.单选题:一个用于二分类问题的多层感知机(multilayerperceptron),输入向量100维,唯一的隐层长度100维,输出层计算概率分布。该模型可能有多少个参数?
选项:
A、10100
B、201
C、10002
D、20000
答案:【10100】2.单选题:在SGDwithmomentum之中,momentum代表
选项:
A、当前梯度
B、历史梯度总和
C、历史更新平均值
D、当前更新大小
答案:【当前更新大小】3.单选题:使用随机梯度下降(SGD)算法对于多层感知机(MLP)进行参数更新,前项计算的作用
选项:
A、为了计算输出层上的损失(loss)
B、为了计算每层参数的导数
C、为了验证每层参数的梯度计算正确
D、上述训练过程不需要前项推断计算
答案:【为了计算每层参数的导数】4.单选题:关于模型参数的初始化,单层感知机(Singlelayerperceptron)___,而多层感知机(multi-layerperceptron)___。
选项:
A、可以全零初始化或者随机初始化,可以全零初始化或随机初始化
B、可以全零初始化或随机初始化,只能随机初始化
C、只能随机初始化,可以全零初始化或随机初始化
D、只能随机初始化,只能随机初始化
答案:【可以全零初始化或随机初始化,只能随机初始化】5.单选题:词嵌入(Wordembedding's)是___的___向量。
选项:
A、高维,稀疏
B、低维,稀疏
C、高维,稠密
D、低维、稠密
答案:【低维、稠密】6.单选题:下列哪个神经网络可以把一个向量序列(Alistofvectors)转化为一个向量表示?
选项:
A、多层感知机
B、单层感知机
C、池化(pooling)
D、卷积神经网络(ConvolutionalNeuralNetwork)
答案:【池化(pooling)】7.单选题:给一个多分类任务的单层感知机加上隐层,使之变成多层感知机。假如添加的隐层使用identity激活函数,且输入的特征向量保持不变,那么得到的多层感知机与原先的单层感知机相比,对于输入特征向量空间的切分能力
选项:
A、增加了,可以拟合任意超平面难以表达的空间划分。
B、没有变化,仍然只能使用超平面切分输入特征空间。
C、减小了,对于原先的超平面增加了空间特征限制。
D、表达能力取决于具体的参数维度和设置,因此变化的具体表现不能确定。
答案:【没有变化,仍然只能使用超平面切分输入特征空间。】8.单选题:多层感知机(MLP)与单层感知机在多分类问题的损失函数方面
选项:
A、可以选择相同的损失函数
B、可以使用更多的损失函数
C、只能使用更少的损失函数,因为最大边缘(maxmargin)损失函数不再适用
D、只能使用更少的损失函数,因为最大似然(maximumlikelihood)不再适用
答案:【可以选择相同的损失函数】9.单选题:下列对于反向传播算法(backpropagation)最准确的描述
选项:
A、数值优化算法,用于模型训练
B、梯度计算方法,用于模型训练
C、求和优化算法,用于模型推理
D、参数更新算法,用于模型推理
答案:【梯度计算方法,用于模型训练】10.单选题:下列哪个技术可以有效解决梯度爆炸问题?
选项:
A、gradientclipping
B、residualnetwork
C、dropout
D、momentum
答案:【gradientclipping】11.单选题:残差网络(residualnetwork)可以解决
选项:
A、梯度爆炸
B、梯度消失
C、过似合
D、covariateshift
答案:【梯度消失】12.单选题:层正则化(layernormalization)的基本思路是通过计算___减小___变化对模型稳定性的影响
选项:
A、均值与方差,网络参数
B、均值与方差,网络输入
C、最值、网络参数
D、最值,网络输入
答案:【均值与方差,网络参数】13.单选题:Dropout是指神经网络___过程中随机将一部分___置零的方法。
选项:
A、训练,向量
B、推理,向量
C、训练,参数矩阵
D、推理,参数矩阵
答案:【训练,向量】14.单选题:池化函数___参数,且___反向传播训练
选项:
A、有,需要
B、没有,需要
C、有,不需要
D、没有,不需要
答案:【没有,需要】15.单选题:一个用于文本分类问题的神经网络,由一个embedding层,一个CNN层,一个pooling层,以及一个output层组成。词表共有V个词,词嵌入长度为d,CNN卷积窗口为3,隐层长度为h,输出层使用softmax激活函数实现4分类。它的参数量为
选项:
A、Vd+3dh+4h
B、V+d+3dh+h+4
C、Vd+4dh
D、12Vdh
答案:【Vd+3dh+4h】16.单选题:梯度消失(gradientdiminishing)是指神经网络训练过程中,某些参数的导数随着神经网络总的层数___而发生___的现象
选项:
A、增加,增加
B、增加,减少
C、减少,增加
D、减少,减少
答案:【增加,减少】17.多选题:对于超参数选择,正确说法的有
选项:
A、gridsearch相对更加耗时,但列可能找到较优的超参数组合
B、randomsearch可作为省时选择
C、超参数可以使用SGD优化
D、神经网络超参相对稳定,不需要特殊筛选技巧
答案:【gridsearch相对更加耗时,但列可能找到较优的超参数组合;randomsearch可作为省时选择】18.多选题:下列激活函数中,非线性的包括:
选项:
A、Identity
B、ReLU
C、tanh
D、sigmoid
答案:【ReLU;tanh;sigmoid】19.多选题:下列关于卷积神经网络(CNN)说法正确的有
选项:
A、可以学习N元组(n-gram)特征
B、给定一个输入,每个卷积操作(convolutionfilter)参数相同
C、给定不同长度的收入句子,卷积操作的计算次数恒定不变
D、卷积函数可以用单层感知机实现
答案:【可以学习N元组(n-gram)特征;给定一个输入,每个卷积操作(convolutionfilter)参数相同;卷积函数可以用单层感知机实现】表示学习(RepresentativeLearning)单元测验十二1.单选题:BinarytreeLSTM可以看成是序列LSTM的一种扩展,其主要不同在于
选项:
A、对于每个结点,父结点数量增加了
B、对于每个结点,子结点数量增加了
C、自左向右编码改成了深度优先遍历顺序编码
D、自左向右编码改成了广度优先遍历顺序编码
答案:【对于每个结点,子结点数量增加了】2.单选题:GRN、GCN和GAT的主要区别
选项:
A、不同结点之间所交换信息的编码方式不同
B、不同结点之间交换信息的方法不同
C、embedding层信息编码的算法不同
D、输出层的计算方式不同
答案:【不同结点之间交换信息的方法不同】3.单选题:使用QKVattention,如果Q包括nq个输入向量,K包括nk个输入向量,而V包括nv个向量,那么输出序列含有___个向量。
选项:
A、nq
B、nk
C、nv
D、都不是
答案:【nq】4.单选题:与binarytreeLSTM相比,childsumtreeLSTM的主要特点是
选项:
A、处理任意的树结构
B、运行速度更快
C、性能更强
D、可以对于每个子结点使用不同参数进行编码
答案:【处理任意的树结构】5.单选题:与childsumtreeLSTM相比,binarytreeLSTM的主要特点是
选项:
A、处理任意的树结构
B、运行速度更快
C、性能更强
D、可以对于每个子结点使用不同参数进行编码
答案:【可以对于每个子结点使用不同参数进行编码】6.单选题:RMSProp与AdaGrad的最大不同在于
选项:
A、对最近的历史导数更重视
B、对初始导数更敏感
C、使用更少的超参数
D、引入了历史导数的均方根计算衰减系数。
答案:【对最近的历史导数更重视】7.单选题:AdaDelta比AdaGrad减速少的超参数是
选项:
A、初始学习率\ita
B、历史导数上的权重\rou
C、历史导数均方差计算中的加数\epsilon
D、没少参数
答案:【初始学习率\ita】8.单选题:ADAM与AdaGrad的最大区别是
选项:
A、引入了一阶惯性
B、引入了二阶惯性
C、引入了初始学习率
D、去掉了历史导数的均方根计算
答案:【引入了一阶惯性】9.单选题:t-SNE是一种___算法,利用___不变的特性进行运算
选项:
A、高维向量降维可视化,相对距离
B、高维向量降维可视化,相对权重
C、模型决策分析,相对距离
D、模型决策分析,相对权重
答案:【高维向量降维可视化,相对距离】10.单选题:探针(probing)利用___任务,在___被分析模型参数的基础上进行分析
选项:
A、外部,改变
B、外部,不改变
C、内部,改变
D、内部,不改变
答案:【外部,不改变】11.单选题:去掉模型的某些组成部分,并且和原始模型进行性能对比,从而验证被去掉的组成部分的重要性。上述实验叫做
选项:
A、开发实验
B、超参数搜索
C、消融实验
D、探针实验
答案:【消融实验】12.单选题:双向RNN对于每一个输入单元所计算的隐层向量含有___信息
选项:
A、从左向右的上下文
B、当前输入单元周围k个输入单元的窗口信息
C、全局上下文
D、从右向左上下文
答案:【全局上下文】13.单选题:RNN训练的一个挑战是
选项:
A、等价的MLP层数太多,可以导致训练过程梯度爆炸或者消失
B、每层RNN反向计算太复杂,使得梯度逐渐消失,但不会增加
C、逐层计算导数导致内存占用过大,时间复杂度过高
D、层数太多可导致梯度爆炸,但不会消失
答案:【等价的MLP层数太多,可以导致训练过程梯度爆炸或者消失】14.单选题:与pooling和CNN相比,RNN的重要优点
选项:
A、运算量更小
B、可以并行
C、编码每个输入单元的时侯可以抽取所有历史上下文的特征
D、可以处理的文本长度更长
答案:【编码每个输入单元的时侯可以抽取所有历史上下文的特征】15.单选题:给定一个输入,如果把RNN的计算过程按照时间序列展开,所得到的神经网络结构类似于
选项:
A、MLP
B、pooling
C、CNN
D、Singlelayerperceptron
答案:【MLP】16.单选题:QKVattention与标准attention区别主要在于
选项:
A、将原hidden分为key与value
B、将原query分为query与key
C、将原query分为query与value
D、没有区别
答案:【将原hidden分为key与value】17.单选题:LSTM的recurrentstep主要是
选项:
A、inputgate的计算
B、forgetgate的计算
C、cell的计算
D、hiddenstate的计算
答案:【cell的计算】18.多选题:图循环神经网络(GRN)的时间步骤
选项:
A、是序列LSTM时间步骤的自然扩展
B、与图结点之间的结构和顺序无关
C、可以看成是图神经网络的层数
D、是树LSTM时间步骤的自然扩展
答案:【与图结点之间的结构和顺序无关;可以看成是图神经网络的层数】19.多选题:给定一个语义结构的GNN编码输出,如果后续要做分类任务,可以
选项:
A、先使用MLP进行隐向量的非线性变换,再接分类输出层
B、可以先进行池化(pooling),再接分类输出层
C、可以先接入attentionlayer,再接分类输出层
D、可以直接接入分类输出层进行推断
答案:【可以先进行池化(pooling),再接分类输出层;可以先接入attentionlayer,再接分类输出层】20.多选题:与RNN相比,SAN的优势包括
选项:
A、所有隐向量可以并行计算
B、每个输入向量在进行编码的时侯,可以直接和其它所有输入向量进行信息交互
C、计算量更低
D、更加准确
答案:【所有隐向量可以并行计算;每个输入向量在进行编码的时侯,可以直接和其它所有输入向量进行信息交互】21.多选题:AdaGrad与标准SGD的最大不同包括
选项:
A、每步学习率不同
B、每个参数学习率不同
C、使用历史导数的均方根计算学习率的衰减速系数
D、使用了惯性momentum
答案:【每步学习率不同;每个参数学习率不同;使用历史导数的均方根计算学习率的衰减速系数】22.多选题:给定一个句子,使用双向RNN对其进行编码,然后进行多分类任务。在RNN编码层和输出层之间可以怎样连接?
选项:
A、使用pooling将所有词的隐层加和,然后连接到分类输出层
B、可以使用自左向右的RNN最后一个隐层向量和自右向左的RNN最后一个隐层向量拼接,再连接到分类输出层
C、可以使用任意一个词的隐层表示连接到分类输出层
D、可以使用自左向右的RNN最后一个隐层向量连接到分类输出层
答案:【使用pooling将所有词的隐层加和,然后连接到分类输出层;可以使用自左向右的RNN最后一个隐层向量和自右向左的RNN最后一个隐层向量拼接,再连接到分类输出层】23.多选题:下列哪些方法可以缓解RNN训练过程中的梯度问题?
选项:
A、限定back-propagationthroughtime(BPTT)步数
B、控制初始参数
C、使用GRU、LSTM等替换模型
D、加大learningrate
答案:【限定back-propagationthroughtime(BPTT)步数;控制初始参数;使用GRU、LSTM等替换模型】24.多选题:dot-productattetion、scaleddot-productattention、generalattention和additiveattention的主要区别包括
选项:
A、输入隐向量之间的权重计算方式不同
B、将输入隐向量映射为key/value向量的计算不同
C、输入隐向量之间信息交换方式不同
D、query向量和key/value隐向量之间的组合计算不同
答案:【输入隐向量之间的权重计算方式不同;query向量和key/value隐向量之间的组合计算不同】25.多选题:下列哪些attentionfunction不需要模型参数?
选项:
A、dot-productattention
B、scaleddot-productattention
C、generalattention
D、additiveattention
答案:【dot-productattention;scaleddot-productattention】26.多选题:下列哪些attentionfunction要求query和hidden向量维度相同?
选项:
A、dot-productattention
B、scaleddot-productattention
C、generalattention
D、additiveattention
答案:【dot-productattention;scaleddot-productattention】27.多选题:比起RNN,LSTM的主要优势包括
选项:
A、缓解训练过程中的梯度问题
B、统计性能往往更强
C、运行速度更快
D、内存占用显著减少
答案:【缓解训练过程中的梯度问题;统计性能往往更强】28.多选题:下列关于LSTM的说法正确的有
选项:
A、inputgate与forgetgate相加一定等于全1向量
B、可以像RNN一样进行双向扩展
C、可以像RNN一样进行多层叠加
D、使用gate机制,进行向量按位相乘
答案:【可以像RNN一样进行双向扩展;可以像RNN一样进行多层叠加;使用gate机制,进行向量按位相乘】29.多选题:下列哪些函数可以将一个向量序列(arrayofvectors)转化为一个向量?
选项:
A、pooling
B、attention
C、LSTM
D、GRU
答案:【pooling;attention】基于神经网络的结构预测(NeuralStructuredPrediction)单元测验十三1.单选题:使用基于转移(transition-based)方法解决结构预测问题。在构造全局(global)神经网络模型,配合柱搜索(beam-search)解码时,模型用该怎样计算分数?
选项:
A、对每个动作打分,加和得到全局分数,并进行全局概率归一计算
B、对全局动作序列打整体分,并进行全局概率归一计算。
C、对每个动作打分,进行概率归一计算,并加和得到全局分数
D、对每个动作打分,再进行非线性组合得到序列分数。
答案:【对每个动作打分,加和得到全局分数,并进行全局概率归一计算】2.单选题:使用神经网络解决序列标注问题,网络结构包括输入词嵌入层,序列编码biLSTM层,以及每个词上的独立softmax标签预测层。这样的模型没有显式建模标签依存关系,为什么可以达到线性CRF的性能?
选项:
A、biLSTM连通所有输入,隐式通过反向传播训练(Backpropagationtraining)融入标签序列特征。
B、softmax层表达能力很强,不同softmax层可以通过biLSTM特征相互显示交互。
C、Wordembedding层的表达能力超越了传统离散特征,输入输出不再需要表达于同一特征向量。
D、每个softmax输出长参数不同,整个模型参数量远超CRF。
答案:【biLSTM连通所有输入,隐式通过反向传播训练(Backpropagationtraining)融入标签序列特征。】3.单选题:使用神经网络解决序列标注问题,网络结构包括输入词嵌层,序列编码biLSTM层,以及每个词上的独立softmax标签预测层。模型在训练过程中,每个输入词嵌入获得的gradient,是从___反向传播得到的。
选项:
A、该词对应的softmax输出
B、该词及左边所有词的softmax输出
C、该词及右边所有词的softmax输出
D、所有输入词所对应的softmax输出
答案:【所有输入词所对应的softmax输出】4.单选题:分类问题的神经网络模型与结构预测的神经网络模型,在设计方面最大的不同在于_____。
选项:
A、词嵌入层(embeddinglayer)
B、序列编码层(Sequenceencodinglayer)
C、输出层(Outputlayer)
D、没有不同
答案:【输出层(Outputlayer)】5.单选题:neuralCRF训练过程,CRF部分___看成一个神经网络层进行反向传递,而且___进行前向后向计算。
选项:
A、可以,需要
B、可以,不需要
C、不可以,需要
D、不可以,不需要
答案:【可以,需要】6.单选题:biLSTM-CRF模型对于输入可以抽取___特征,对于输出可以抽取___特征。
选项:
A、n-gram,n-gram
B、全局,n-gram
C、n-gram,全局
D、全局,全局
答案:【全局,n-gram】7.单选题:把treeCRF替换成neuraltreeCRF,可以将其__分数替换成任意神经网络函数,而后者需要编码___特征。
选项:
A、局部,输入
B、局部,输入输出组合
C、全局,输入
D、全局,输入输出组合
答案:【局部,输入】8.单选题:对于序列标注问题,建立基于图(graphbased)的模型线性离散特征CRF的优势有___,而biLSTM+局部标签softmax神经网络的优势有___。
选项:
A、特征更可解释,输入序列深层全局特征
B、输出标签之间关系建模,特征更可解释。
C、输入序列深层全局特征,非线性特征抽取。
D、参数量更少,性能更强。
答案:【特征
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 饲用冬瓜种植技术方法
- 单招古诗文试题及答案
- IT基础设施维护合同协议2026
- 衢州市2026年二级造价工程师考试模拟题库及答案:建设工程计量与计价实务、水利工程
- 宁夏公务员考试申论试题及答案
- 麻精药品培训考试试题测试题库含答案
- 叉车安全知识培训及试题答案
- 2026年浙江教师招聘教育学心理学试题及答案
- 2026年司法卷三民事诉讼法模拟试题及答案
- 2026年企业人力管理师之三级人力管理师题库及答案
- 2026重庆西算大数据有限公司招聘(第二批次)3人考试参考题库及答案详解
- 教育数字化行业市场服务供应竞争及投资风险规划分析研究报告
- 中国口服避孕药市场产销趋势分析与投资策略深度调查研究报告
- 2026文山边境管理支队第一次边境管控专职辅警招聘(120人)考试备考题库及答案详解
- 2026天津高校大学《辅导员》招聘考试题库及答案
- 蒙古驾驶证考试题目及答案
- 医院培训课件:《静脉血栓栓塞症(VTE)专题培训》
- T-CI 263-2024 水上装配式钢结构栈桥(平台)施工技术规程
- 软件项目 过程和工作产品检查记录表全套
- TZJXDC 002-2022 电动摩托车和电动轻便摩托车用阀控式铅酸蓄电池
- GB 7258-2017机动车运行安全技术条件
评论
0/150
提交评论