【答案】《环境数据分析》(国家高等教育智慧教育平台)章节期末中国大学慕课答案_第1页
【答案】《环境数据分析》(国家高等教育智慧教育平台)章节期末中国大学慕课答案_第2页
【答案】《环境数据分析》(国家高等教育智慧教育平台)章节期末中国大学慕课答案_第3页
【答案】《环境数据分析》(国家高等教育智慧教育平台)章节期末中国大学慕课答案_第4页
【答案】《环境数据分析》(国家高等教育智慧教育平台)章节期末中国大学慕课答案_第5页
已阅读5页,还剩27页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第一章数据统计描述与图形化第一章数据统计描述与图形化1.多选题:数据探索性分析包括

选项:

A、缺失值分析

B、异常值分析

C、错误值分析

D、可行性分析

答案:【缺失值分析;异常值分析】2.多选题:缺失值处理方式有

选项:

A、随机插补

B、固定值插补

C、均值插补

D、最近数据插补

答案:【固定值插补;均值插补;最近数据插补】3.单选题:网络爬虫道德规范是一系列指导原则,旨在确保爬虫的开发和使用合法合规

选项:

A、正确

B、错误

答案:【正确】4.单选题:robots.txt协议用于指示网络爬虫如何与网站互动

选项:

A、正确

B、错误

答案:【正确】5.单选题:ChatGPT具有较强代码撰写能力,可在对话中理解需求生成代码并反复修改

选项:

A、正确

B、错误

答案:【正确】6.网络爬虫的发展历程包括

答案:【1990年代发展初期,1990年代中期至2000年代初搜索引擎的崛起,2000年代复杂性增加,2010年代聚焦数据提取与智能化】7.网络爬虫应用领域包括

答案:【网络安全数据挖掘搜索引擎优化法律合规性检查】8.当前网络爬虫主流框架包括

答案:【BeautifulSoup,Scrapy】9.网络爬虫的流程框架包括

答案:【获取URL发送请求收到响应解析内容数据存储】第二章抽样分布与假设检验第二章抽样分布与假设检验1.单选题:样本中所包含的个体数目称为

选项:

A、样本容量

B、样本统计量

C、样本均值

D、样本方差

答案:【样本容量】2.单选题:以下哪种分布属于离散型分布

选项:

A、正态分布

B、指数分布

C、二项分布

D、卡方分布

答案:【二项分布】3.多选题:以下哪种检验方法属于参数检验

选项:

A、t检验

B、Z检验

C、F检验

D、卡方检验

答案:【t检验;Z检验;F检验】4.单选题:样本比率是具有相同特征的个体占总体的比值

选项:

A、正确

B、错误

答案:【错误】5.单选题:单比率检验用于比较样本比率与总体比率是否相同,检验样本与总体之间的差异。双比率检验则比较两个样本的比率是否相同,检验两总体间的差异。

选项:

A、正确

B、错误

答案:【正确】6.单选题:针对绝大多数总体,当样本量大于30时,样本均值的分布近似服从正态分布

选项:

A、正确

B、错误

答案:【正确】7.单选题:单样本科尔莫戈罗夫-斯米尔诺夫(Kolmogorov-Smirnov,K-S)检验适合样本量小于50的检验

选项:

A、正确

B、错误

答案:【错误】8.单选题:参数估计是经过抽样及抽样分布分析后根据获得的样本统计量来推断总体参数的方法

选项:

A、正确

B、错误

答案:【正确】9.单选题:一个事件如果发生的概率很小,它在一次试验中是几乎不可能发生的,但在多次重复试验中必然发生

选项:

A、正确

B、错误

答案:【正确】10.抽样误差主要包括

答案:【抽样平均误差抽样极限误差】11.统计假设检验具体步骤包括

答案:【提出原假设和备择假设选择适当的检验统计量规定显著性水平计算检验统计量的P值】12.比率检验根据总体的数量可分为

答案:【单比率检验双比率检验】13.对于单比率检验,当样本量小于30时,应当采用什么检验方式

答案:【精确二项分布检验】14.总体具有的三大典型特征

答案:【同质性变异性大量性】15.常用随机抽样方法包括

答案:【简单随机抽样等距抽样分层抽样整群抽样】第三章t检验第三章t检验1.单选题:比较15株麦苗在污染物暴露前后的高度,应该选择哪种t检验?

选项:

A、单样本t检验

B、独立样本t检验

C、配对样本t检验

D、均不适合

答案:【配对样本t检验】2.单选题:t检验适合用于数据量(_)的均值比较。

选项:

A、<20

B、<30

C、>20

D、>30

答案:【<30】3.多选题:关于t检验的适用条件,说法正确的是?

选项:

A、样本统计量为分类变量

B、样本统计量为连续变量

C、样本来自正态总体或近似正态总体

D、样本量小于30

答案:【样本统计量为连续变量;样本来自正态总体或近似正态总体;样本量小于30】4.单选题:多组计量资料(n≥3)比较也可以采用t检验。

选项:

A、正确

B、错误

答案:【错误】5.单选题:独立样本t检验前需要先进行方差齐性分析。

选项:

A、正确

B、错误

答案:【正确】6.单选题:t分布曲线形状与标准正态分布相似。

选项:

A、正确

B、错误

答案:【正确】7.t检验包括

答案:【单样本t检验双样本t检验】8.双样本t检验包括

答案:【独立样本t检验配对样本t检验】9.使用()可以进行单样本和双样本t检验的Python分析。

答案:【scipy.stats】第四章方差分析第四章方差分析1.单选题:方差分析(ANOVA)的主要目的是

选项:

A、计算单个样本的标准差

B、研究类别自变量对数值因变量的影响是否显著

C、比较各总体的方差是否相等

D、上述全部

答案:【研究类别自变量对数值因变量的影响是否显著】2.单选题:在单因素方差分析中,如果F统计量高于临界值,则

选项:

A、接受零假设

B、增加样本大小后重新测试

C、拒绝零假设

D、降低显著性水平后重新测试

答案:【拒绝零假设】3.单选题:为比较某污染物在不同处理条件的降解率,采用3种方法进行处理,在3种不同浓度(mg/L)下进行试验,分析处理方法、浓度对降解率的影响。上述情况适合采用以下哪种方差分析?

选项:

A、单因素方差分析

B、多因素方差分析

C、重复测量方差分析

D、多元方差分析

答案:【多因素方差分析】4.多选题:方差分析的适用条件有哪些?

选项:

A、处理组相互独立,相关数据为随机样本数据

B、处理组数据服从正态分布

C、处理组数据样本量相等

D、处理组的总体方差满足方差齐性

答案:【处理组相互独立,相关数据为随机样本数据;处理组数据服从正态分布;处理组的总体方差满足方差齐性】5.多选题:重复测量方差分析需要满足的条件有

选项:

A、各组数据独立

B、各组数据服从正态分布

C、满足球形假设条件

D、各组数据满足方差齐性

答案:【各组数据独立;各组数据服从正态分布;满足球形假设条件;各组数据满足方差齐性】6.单选题:多元方差分析是用于检验一个独立变量是否受一个或多个因素或变量影响。

选项:

A、正确

B、错误

答案:【正确】7.单选题:在进行多元方差分析时,如果因变量之间的相关性很低,相比于多次单独进行单因素方差分析,使用多元方差分析不会显著增加统计检验的功效。

选项:

A、正确

B、错误

答案:【正确】8.单选题:方差分析只能用来比较两组的均值。

选项:

A、正确

B、错误

答案:【错误】9.处理组测量数据的总变异分解为()和()。

答案:【处理效应随机误差】10.在方差分析中,组内误差由()平方和来衡量。

答案:【组内】11.HotellingT2检验用于()与总体均数向量比较

答案:【多变量样本均数向量】第五章非参数检验第五章非参数检验1.单选题:‌满足参数统计分析方法条件的数据用非参数统计分析方法,下列哪项正确

选项:

A、减少I类错误

B、增加II类错误

C、增加I类错误

D、减少II类错误

答案:【增加II类错误】2.单选题:(),应该用非参数统计方法

选项:

A、两组百分比资料的平均数比较

B、正态分布资料两样本方差都比较大时两样本均数的比较

C、两组等级资料比较

D、正态分布资料n不相等时两样本均数的比较

答案:【两组等级资料比较】3.单选题:经四组率比较的卡方检验,p值小于0.01,可认为

选项:

A、各总体率均不相同。

B、各总体率相差较大。

C、最多有两总体率间存在差异。

D、至少有两总体率间存在差异。

答案:【至少有两总体率间存在差异。】4.单选题:对两样率比较的四格表资料中,若有一个实际数为0,则

选项:

A、可直接用卡方检验。

B、必须用校正卡方检验。

C、还不能决定是否能用卡方检验。

D、不可用卡方检验。

答案:【还不能决定是否能用卡方检验。】5.单选题:应用四格表Fisher精确概率法的条件是

选项:

A、n>40

B、T<5

C、n<40或T<1

D、n>40,1<5<5

答案:【n<40或T<1】6.单选题:两个独立小样本计量资料比较的假设检验,首先考虑

选项:

A、用Z检验

B、t检验或Wilcoxon秩和检验均可

C、判断资料符合t检验还是Wilcoxon秩和检验条件

D、用Wilcoxon秩和检验

答案:【判断资料符合t检验还是Wilcoxon秩和检验条件】7.单选题:下列资料不能用卡方检验的是

选项:

A、配对设计的两样本率的比较

B、两个(或多个)构成比间的比较

C、多个样本率的比较

D、等级资料实验效应间的比较

答案:【等级资料实验效应间的比较】8.单选题:行列表资料的卡方检验中,应注意

选项:

A、1/5以上的格子1<5时,要合理归并。<5时,要合理归并。

B、有一个格子的理论频数E<1,需要使用校正公式。

C、理论频数1<5的格子频数均应合并在一起。<5的格子频数均应合并在一起。

D、有一个格子理论频数1<5,需要用校正公式。<5,需要用校正公式。

答案:【1/5以上的格子1<5时,要合理归并。<5时,要合理归并。】9.多选题:下述对非参数检验的描述正确的是

选项:

A、是不依赖于总体分布形式的检验方法。

B、与参数检验相比,非参数检验犯Ⅰ类错误的可能性较大。

C、是利用了总体分布信息的检验方法。

D、是不需要利用总体参数信息的检验方法。

答案:【是不依赖于总体分布形式的检验方法。;是不需要利用总体参数信息的检验方法。】10.单选题:卡方分布是连续性分布,而不是间断性分布。

选项:

A、正确

B、错误

答案:【正确】11.单选题:四格表资料也是行列表资料。

选项:

A、正确

B、错误

答案:【正确】12.某病患病120人,其中男性114人,女性6人,分别占95%和5%,则结论为

答案:【尚不能得到结论】第六章相关分析第六章相关分析1.单选题:如果两个变量的相关系数为0,则表示:

选项:

A、它们之间存在强烈的正相关

B、它们之间存在强烈的负相关

C、它们之间没有相关性

D、以上都不对

答案:【它们之间没有相关性】2.单选题:在以下选项中,哪个最好地描述了相关性分析?

选项:

A、一种分析方法,用于检测和衡量两个随机变量之间的关联性。

B、一种用于创建基于样本的数据模型的技术。

C、一种用于预测未来趋势并解决有问题的可能性的技术。

D、一种用于检测数据点之间的统计差异的技术。

答案:【一种分析方法,用于检测和衡量两个随机变量之间的关联性。】3.单选题:在以下情况下,哪种类型的相关性分析是最适当的?假设我们有一个包含基于等级评级的用户反馈和销售数据的数据集,我们希望了解用户反馈和销售之间的关系。

选项:

A、斯皮尔曼的等级相关

B、皮尔逊相关

C、点二列相关数

D、克莱姆指数

答案:【斯皮尔曼的等级相关】4.单选题:以下哪一项描述了斯皮尔曼等级相关系数?

选项:

A、用于测量两个定类变量之间的相关性

B、一种基于等级的,用于衡量两变量之间非线性、单调的关系的方法

C、衡量一个等级变量与一个定类变量之间的相关性的方法

D、一种用于衡量两变量之间任意函数关系的方法

答案:【一种基于等级的,用于衡量两变量之间非线性、单调的关系的方法】5.多选题:对于某两个变量X和Y,它们的Person相关系数为-0.8,请选择下述正确的描述

选项:

A、X增加时,Y也会上升。

B、X增加时,Y会下降。

C、X和Y之间存在很强的正相关关系。

D、X和Y之间存在很强的负相关关系。

答案:【X增加时,Y会下降。;X和Y之间存在很强的负相关关系。】6.单选题:无论什么类型的数据,皮尔逊相关系数都是适用的。

选项:

A、正确

B、错误

答案:【错误】7.单选题:相关性分析可以确定两个变量之间的因果关系。

选项:

A、正确

B、错误

答案:【错误】8.单选题:如果皮尔逊相关系数接近于1或-1,那么这代表两个变量之间存在强烈的线性相关。

选项:

A、正确

B、错误

答案:【正确】9.在相关性分析中,我们常说"相关不代表因果",这句话的意思是(_)

答案:【只因为两个变量存在相关性,并不意味着一个变量的变化会引起另一个变量的变化,即不存在因果关系。】10.在进行相关性分析时,我们通常使用皮尔逊相关系数来衡量两个(_)变量间的线性相关性。

答案:【连续】11.(_)相关性系数可以用来衡量两个有序变量之间的单调关系,即使这种关系不是线性的。

答案:【斯皮尔曼(Spearman)】第七章回归分析第七章回归分析1.单选题:在回归分析中,如果自变量之间存在高度相关性,会导致什么问题?

选项:

A、过拟合

B、欠拟合

C、多重共线性

D、异方差性

答案:【多重共线性】2.单选题:多元线性回归中,样本量考虑事件发生数与自变量个数后的比例下限为:

选项:

A、5倍

B、10倍

C、15倍

D、20倍

答案:【10倍】3.单选题:在线性回归中,下列哪个方法可以用来拟合最佳拟合直线?

选项:

A、支持向量机

B、最小二乘法

C、随机森林

D、神经网络

答案:【最小二乘法】4.单选题:在多元线性回归中,下列哪个指标可以用来评估模型的整体拟合程度?

选项:

A、R²

B、标准误差

C、t检验

D、F检验

答案:【R²】5.多选题:在多元线性回归中,下列哪些方法可以检验自变量之间是否存在共线性?

选项:

A、方差膨胀因子(VIF)

B、杜宾-沃森统计量

C、特征相关系数

D、杰克-比亚克表

答案:【方差膨胀因子(VIF);杜宾-沃森统计量】6.单选题:在逻辑回归中,如果模型的预测概率超过0.5,则将样本分类为正例;如果预测概率小于等于0.5,则将样本分类为负例。

选项:

A、正确

B、错误

答案:【错误】7.单选题:如果回归模型中的残差显示出明显的自相关性,这可能会导致模型的系数估计偏误。

选项:

A、正确

B、错误

答案:【正确】8.单选题:统计检验中,如果P值小于0.05,那么可认为自变量与因变量间的关系具有统计学意义。

选项:

A、正确

B、错误

答案:【正确】9.逻辑回归模型的系数解释为自变量每单位变化对(_)的对数几率的影响。

答案:【事件发生的几率】10.逻辑回归中,关注的因变量通常是()分类,意味着每个观测值都属于其中一个类别,而且这两个类别是()。

答案:【二互斥的】11.在逻辑回归中,我们使用(_)函数来将线性组合的预测值转换为概率值。

答案:【sigmoid(或者logistic)】第八章降维分析第八章降维分析1.单选题:KMO值(_),说明该数据非常适合因子分析。

选项:

A、<0.9

B、<0.95

C、>0.9

D、>0.95

答案:【>0.9】2.单选题:在python分析中,因子分析FactorAnalyzer包中的Rotation参数提供(_)种旋转方法?

选项:

A、6

B、7

C、8

D、9

答案:【7】3.多选题:特征提取的主要方法包括(_)?

选项:

A、因子分析

B、主成分分析

C、对应分析

D、最优尺度分析

答案:【因子分析;主成分分析;对应分析;最优尺度分析】4.单选题:降维分析主要包括特征提取和特征选择两类。

选项:

A、正确

B、错误

答案:【正确】5.单选题:特征提取是从全部特征中选择出最有效的特征。

选项:

A、正确

B、错误

答案:【错误】6.单选题:因子分析是线性降维方法。

选项:

A、正确

B、错误

答案:【正确】7.单选题:主成分分析不是线性降维方法。

选项:

A、正确

B、错误

答案:【错误】8.单选题:在进行主成分分析时,可以根据累计方差贡献率确定主成分个数

选项:

A、正确

B、错误

答案:【正确】9.单选题:因子分析中的公共因子需有可解释性。

选项:

A、正确

B、错误

答案:【正确】10.KMO值(_),说明该数据不适合因子分析。

答案:【<0.5】11.Bartlett球形度检验评估的p值<(_),说明可进行因子分析。

答案:【0.05】第九章聚类分析第九章聚类分析1.单选题:划分数据类型是一般会选择哪种聚类算法

选项:

A、DBSCAN算法

B、高斯混合算法

C、K-means算法

D、BIRCH算法

答案:【K-means算法】2.多选题:聚类算法包含

选项:

A、划分聚类算法

B、层次聚类算法

C、基于概率分布的聚类算法

D、基于密度的聚类算法

答案:【划分聚类算法;层次聚类算法;基于概率分布的聚类算法;基于密度的聚类算法】3.多选题:聚类分析的外部评估指标包含

选项:

A、兰德指数

B、F值

C、纯度

D、簇内平方和

答案:【兰德指数;F值;纯度】4.多选题:聚类分析的原则

选项:

A、高的类内相似度

B、低的类间相似度

C、同类相同

D、异类相异

答案:【高的类内相似度;低的类间相似度;同类相同;异类相异】5.单选题:k-means算法中,k取值过小会导致分类过度

选项:

A、正确

B、错误

答案:【错误】6.单选题:高斯混合聚类ARI值最接近于1,CH指数最高,聚类效果最好

选项:

A、正确

B、错误

答案:【正确】第十章机器学习第十章机器学习1.单选题:区分大语言模型(LLM)与以前的预训练语言模型(PLM)最显著的特征之一是

选项:

A、神经网络架构不同

B、使用领域不同

C、涌现能力

D、训练流程不同

答案:【涌现能力】2.单选题:ChatGPT基于什么神经网络架构?

选项:

A、卷积神经网络(CNN)

B、循环神经网络(RNN)

C、生成对抗网络(GAN)

D、Transformer

答案:【Transformer】3.多选题:深度学习包含

选项:

A、卷积神经网络

B、循环神经网络

C、逻辑回归

D、随机森林

答案:【卷积神经网络;循环神经网络】4.多选题:聚类算法包含

选项:

A、学习能力强

B、数据驱动,上限高

C、覆盖范围大,适应性强

D、可移植性好

答案:【学习能力强;数据驱动,上限高;覆盖范围大,适应性强;可移植性好】5.多选题:按照学习范式的不同,机器学习可以分为哪几类

选项:

A、监督学习

B、非监督学习

C、半监督学习

D、强化学习

答案:【监督学习;非监督学习;半监督学习;强化学习】6.多选题:以下哪些属于数据预处理

选项:

A、数据离散性分析

B、缺失值处理

C、数据归一化

D、不平衡数据处理

答案:【缺失值处理;数据归一化;不平衡数据处理】7.多选题:以下哪些属于数据角度下的不平衡处理方法

选项:

A、过采样

B、权重平衡

C、欠采样

D、SMOTE

答案:【过采样;欠采样;SMOTE】8.多选题:哪些是大语言模型的特点?

选项:

A、巨大的规模

B、上下文感知

C、多语言支持

D、多模态支持

E、存在伦理和风险问题

答案:【巨大的规模;上下文感知;多语言支持;多模态支持;存在伦理和风险问题】9.多选题:关于大语言模型的训练数据,以下哪些陈述是正确的?

选项:

A、大型语言模型通常需要海量的文本数据进行训练。

B、训练数据必须是结构化数据。

C、训练数据可以包括来自互联网的非结构化文本。

D、所有训练数据都需要人工标记。

答案:【大型语言模型通常需要海量的文本数据进行训练。;训练数据可以包括来自互联网的非结构化文本。】10.多选题:下列关于大语言模型表述正确的是:

选项:

A、仅能理解单一语言。

B、能够进行多任务学习和跨任务迁移。

C、可以生成具有特定风格或主题的文本。

D、需要人类在每次使用时提供详细指导。

答案:【能够进行多任务学习和跨任务迁移。;可以生成具有特定风格或主题的文本。】11.单选题:大语言模型无法生成新的文本内容。

选项:

A、正确

B、错误

答案:【错误】12.单选题:大语言模型可以直接用于新的任何任务,无需额外的微调或训练。

选项:

A、正确

B、错误

答案:【错误】13.单选题:在所有情况下,大语言模型都能准确理解和回答所有的问题。

选项:

A、正确

B、错误

答案:【错误】14.在自然语言处理中,将单词转换成机器可理解的向量的过程被称为()

答案:【词嵌入】15.大语言模型的发展阶段经历了统计语言模型、()、预训练语言模型和()。

答案:【神经网络语言模型大语言模型】16.2020年OpenAI提出的GPT-3是首个千亿级模型,包含()亿参数。

答案:【1750】期末考试期末考试1.单选题:方差分析(ANOVA)的主要目的是

选项:

A、计算单个样本的标准差

B、研究类别自变量对数值因变量的影响是否显著

C、比较各总体的方差是否相等

D、上述全部

答案:【研究类别自变量对数值因变量的影响是否显著】2.单选题:在单因素方差分析中,如果F统计量高于临界值,则

选项:

A、接受零假设

B、增加样本大小后重新测试

C、拒绝零假设

D、降低显著性水平后重新测试

答案:【拒绝零假设】3.单选题:为比较某污染物在不同处理条件的降解率,采用3种方法进行处理,在3种不同浓度(mg/L)下进行试验,分析处理方法、浓度对降解率的影响。上述情况适合采用以下哪种方差分析?

选项:

A、单因素方差分析

B、多因素方差分析

C、重复测量方差分析

D、多元方差分析

答案:【多因素方差分析】4.单选题:ChatGPT基于什么神经网络架构?

选项:

A、卷积神经网络(CNN)

B、循环神经网络(RNN)

C、生成对抗网络(GAN)

D、Transformer

答案:【Transformer】5.单选题:t检验适合用于数据量(_)的均值比较。

选项:

A、<20>

B、<30>

C、>20

D、>30

答案:【<30>】6.单选题:比较15株麦苗在污染物暴露前后的高度,应该选择哪种t检验?

选项:

A、单样本t检验

B、独立样本t检验

C、配对样本t检验

D、均不适合

答案:【配对样本t检验】7.单选题:KMO值(_),说明该数据非常适合因子分析。

选项:

A、<0>

B、<0>

C、>0.9

D、>0.95

答案:【>0.9】8.单选题:在python分析中,因子分析FactorAnalyzer包中的Rotation参数提供(_)种旋转方法?

选项:

A、6

B、7

C、8

D、9

答案:【7】9.单选题:满足参数统计分析方法条件的数据用非参数统计分析方法,下列哪项正确

选项:

A、减少I类错误

B、增加II类错误

C、增加I类错误

D、减少II类错误

答案:【增加II类错误】10.单选题:(),应该用非参数统计方法

选项:

A、两组百分比资料的平均数比较

B、正态分布资料两样本方差都比较大时两样本均数的比较

C、两组等级资料比较

D、正态分布资料n不相等时两样本均数的比较

答案:【两组等级资料比较】11.单选题:应用四格表Fisher精确概率法的条件是

选项:

A、n>40

B、T<5>

C、n<40T>

D、n>40,1

答案:【n<40T>】12.单选题:两个独立小样本计量资料比较的假设检验,首先考虑

选项:

A、用Z检验

B、t检验或Wilcoxon秩和检验均可

C、判断资料符合t检验还是Wilcoxon秩和检验条件

D、用Wilcoxon秩和检验

答案:【判断资料符合t检验还是Wilcoxon秩和检验条件】13.单选题:区分大语言模型(LLM)与以前的预训练语言模型(PLM)最显著的特征之一是

选项:

A、神经网络架构不同

B、使用领域不同

C、涌现能力

D、训练流程不同

答案:【涌现能力】14.单选题:GPT模型是一种基于神经网络的()语言模型。

选项:

A、自回归

B、自编码

答案:【自回归】15.单选题:聚类分析属于

选项:

A、监督分类

B、非监督分类

答案:【非监督分类】16.单选题:划分数据类型是一般会选择哪种聚类算法

选项:

A、DBSCAN算法

B、高斯混合算法

C、K-means算法

D、BIRCH算法

答案:【K-means算法】17.单选题:在线性回归中,下列哪个方法可以用来拟合最佳拟合直线?

选项:

A、支持向量机

B、最小二乘法

C、随机森林

D、神经网络

答案:【最小二乘法】18.单选题:在多元线性回归中,下列哪个指标可以用来评估模型的整体拟合程度?

选项:

A、R²

B、标准误差

C、t检验

D、F检验

答案:【R²】19.单选题:在回归分析中,如果自变量之间存在高度相关性,会导致什么问题?

选项:

A、过拟合

B、欠拟合

C、多重共线性

D、异方差性

答案:【多重共线性】20.单选题:多元线性回归中,样本量考虑事件发生数与自变量个数后的比例下限为:

选项:

A、5倍

B、10倍

C、15倍

D、20倍

答案:【10倍】21.单选题:下列资料不能用卡方检验的是

选项:

A、配对设计的两样本率的比较

B、两个(或多个)构成比间的比较

C、多个样本率的比较

D、等级资料实验效应间的比较

答案:【等级资料实验效应间的比较】22.单选题:行列表资料的卡方检验中,应注意

选项:

A、1/5以上的格子1

B、有一个格子的理论频数E<1>

C、理论频数1

D、有一个格子理论频数1

答案:【1/5以上的格子1】23.单选题:经四组率比较的卡方检验,p值小于0.01,可认为

选项:

A、各总体率均不相同。

B、各总体率相差较大。

C、最多有两总体率间存在差异。

D、至少有两总体率间存在差异。

答案:【至少有两总体率间存在差异。】24.单选题:对两样率比较的四格表资料中,若有一个实际数为0,则

选项:

A、可直接用卡方检验。

B、必须用校正卡方检验。

C、还不能决定是否能用卡方检验。

D、不可用卡方检验。

答案:【还不能决定是否能用卡方检验。】25.单选题:在以下情况下,哪种类型的相关性分析是最适当的?假设我们有一个包含基于等级评级的用户反馈和销售数据的数据集,我们希望了解用户反馈和销售之间的关系。

选项:

A、斯皮尔曼的等级相关

B、皮尔逊相关

C、点二列相关数

D、克莱姆指数

答案:【斯皮尔曼的等级相关】26.单选题:以下哪一项描述了斯皮尔曼等级相关系数?

选项:

A、用于测量两个定类变量之间的相关性

B、一种基于等级的,用于衡量两变量之间非线性、单调的关系的方法

C、衡量一个等级变量与一个定类变量之间的相关性的方法

D、一种用于衡量两变量之间任意函数关系的方法

答案:【一种基于等级的,用于衡量两变量之间非线性、单调的关系的方法】27.单选题:样本中所包含的个体数目称为

选项:

A、样本容量

B、样本统计量

C、样本均值

D、样本方差

答案:【样本容量】28.单选题:以下哪种分布属于离散型分布

选项:

A、正态分布

B、指数分布

C、二项分布

D、卡方分布

答案:【二项分布】29.单选题:如果两个变量的相关系数为0,则表示:

选项:

A、它们之间存在强烈的正相关

B、它们之间存在强烈的负相关

C、它们之间没有相关性

D、以上都不对

答案:【它们之间没有相关性】30.单选题:在以下选项中,哪个最好地描述了相关性分析?

选项:

A、一种分析方法,用于检测和衡量两个随机变量之间的关联性。

B、一种用于创建基于样本的数据模型的技术。

C、一种用于预测未来趋势并解决有问题的可能性的技术。

D、一种用于检测数据点之间的统计差异的技术。

答案:【一种分析方法,用于检测和衡量两个随机变量之间的关联性。】31.多选题:以下哪种检验方法属于参数检验

选项:

A、t检验

B、Z检验

C、F检验

D、卡方检验

答案:【t检验;Z检验;F检验】32.多选题:对于某两个变量X和Y,它们的Person相关系数为-0.8,请选择下述正确的描述

选项:

A、X增加时,Y也会上升。

B、X增加时,Y会下降。

C、X和Y之间存在很强的正相关关系。

D、X和Y之间存在很强的负相关关系。

答案:【X增加时,Y会下降。;X和Y之间存在很强的负相关关系。】33.多选题:聚类分析的外部评估指标包含

选项:

A、兰德指数

B、F值

C、纯度

D、簇内平方和

答案:【兰德指数;F值;纯度】34.多选题:聚类分析的原则

选项:

A、高的类内相似度

B、低的类间相似度

C、同类相同

D、异类相异

答案:【高的类内相似度;低的类间相似度;同类相同;异类相异】35.多选题:下述对非参数检验的描述正确的是

选项:

A、是不依赖于总体分布形式的检验方法。

B、与参数检验相比,非参数检验犯Ⅰ类错误的可能性较大。

C、是利用了总体分布信息的检验方法。

D、是不需要利用总体参数信息的检验方法。

答案:【是不依赖于总体分布形式的检验方法。;是不需要利用总体参数信息的检验方法。】36.多选题:在多元线性回归中,下列哪些方法可以检验自变量之间是否存在共线性?

选项:

A、方差膨胀因子(VIF)

B、杜宾-沃森统计量

C、特征相关系数

D、杰克-比亚克表

答案:【方差膨胀因子(VIF);杜宾-沃森统计量】37.多选题:哪些是大语言模型的特点?

选项:

A、巨大的规模

B、上下文感知

C、多语言支持

D、多模态支持

答案:【巨大的规模;上下文感知;多语言支持;多模态支持】38.多选题:关于大语言模型的训练数据,以下哪些陈述是正确的?

选项:

A、大型语言模型通常需要海量的文本数据进行训练。

B、训练数据必须是结构化数据。

C、训练数据可以包括来自互联网的非结构化文本。

D、所有训练数据都需要人工标记。

答案:【大型语言模型通常需要海量的文本数据进行训练。;训练数据可以包括来自互联网的非结构化文本。】39.多选题:下列关于大语言模型表述正确的是:

选项:

A、仅能理解单一语言。

B、能够进行多任务学习和跨任务迁移。

C、可以生成具有特定风格或主题的文本。

D、需要人类在每次使用时提供详细指导。

答案:【能够进行多任务学习和跨任务迁移。;可以生成具有特定风格或主题的文本。】40.多选题:深度学习包含

选项:

A、卷积神经网络

B、循环神经网络

C、逻辑回归

D、随机森林

答案:【卷积神经网络;循环神经网络】41.多选题:数据探索性分析包括

选项:

A、缺失值分析

B、异常值分析

C、错误值分析

D、可行性分析

答案:【缺失值分析;异常值分析】42.多选题:缺失值处理方式有

选项:

A、随机插补

B、固定值插补

C、均值插补

D、最近数据插补

答案:【固定值插补;均值插补;最近数据插补】43.多选题:方差分析的适用条件有哪些?

选项:

A、处理组相互独立,相关数据为随机样本数据

B、处理组数据服从正态分布

C、处理组数据样本量相等

D、处理组的总体方差满足方差齐性

答案:【处理组相互独立,相关数据为随机样本数据;处理组数据服从正态分布;处理组的总体方差满足方差齐性】44.多选题:重复测量方差分析需要满足的条件有

选项:

A、各组数据独立

B、各组数据服从正态分布

C、满足球形假设条件

D、各组数据满足方差齐性

答案:【各组数据独立;各组数据服从正态分布;满足球形假设条件;各组数据满足方差齐性】45.多选题:以下哪些属于分类指标

选项:

A、准确率

B、召回率

C、均方差

D、精确度

答案:【准确率;召回率;精确度】46.多选题:以下哪些属于分类算法

选项:

A、逻辑回归

B、决策树

C、支持向量机

D、k近邻算法

答案:【逻辑回归;决策树;支持向量机;k近邻算法】47.多选题:以下哪些属于集成算法

选项:

A、随机森林

B、XGBoost

C、LightGBM

D、决策树

答案:【随机森林;XGBoost;LightGBM】48.多选题:聚类算法包含

选项:

A、划分聚类算法

B、层次聚类算法

C、基于概率分布的聚类算法

D、基于密度的聚类算法

答案:【划分聚类算法;层次聚类算法;基于概率分布的聚类算法;基于密度的聚类算法】49.多选题:聚类算法包含

选项:

A、学习能力强

B、数据驱动,上限高

C、覆盖范围大,适应性强

D、可移植性好

答案:【学习能力强;数据驱动,上限高;覆盖范围大,适应性强;可移植性好】50.多选题:按照学习范式的不同,机器学习可以分为哪几类

选项:

A、监督学习

B、非监督学习

C、半监督学习

D、强化学习

答案:【监督学习;非监督学习;半监督学习;强化学习】51.多选题:以下哪些属于数据预处理

选项:

A、数据离散性分析

B、缺失值处理数据归一化

C、不平衡数据处理

答案:【缺失值处理数据归一化;不平衡数据处理】52.多选题:以下哪些属于数据角度下的不平衡处理方法

选项:

A、过采样

B、权重平衡

C、欠采样

D、SMOTE

答案:【过采样;欠采样;SMOTE】53.多选题:关于t检验的适用条件,说法正确的是?

选项:

A、样本统计量为分类变量

B、样本统计量为连续变量

C、样本来自正态总体或近似正态总体

D、样本量小于30

答案:【样本统计量为连续变量;样本来自正态总体或近似正态总体;样本量小于30】54.多选题:特征提取的主要方法包括(_)?

选项:

A、因子分析

B、主成分分析

C、对应分析

D、最优尺度分析

答案:【因子分析;主成分分析;对应分析;最优尺度分析】55.单选题:大语言模型可以直接用于新的任何任务,无需额外的微调或训练。

选项:

A、正确

B、错误

答案:【错误】56.单选题:k-means算法中,k取值过小会导致分类过度

选项:

A、正确

B、错误

答案:【错误】57.单选题:高斯混合聚类ARI值最接近于1,CH指数最高,聚类效果最好

选项:

A、正确

B、错误

答案:【正确】58.单选题:卡方分布是连续性分布,而不是间断性分布。

选项:

A、正确

B、错误

答案:【正确】59.单选题:多元方差分析是用于检验一个独立变量是否受一个或多个因素或变量影响。

选项:

A、正确

B、错误

答案:【正确】60.单选题:在进行多元方差分析时,如果因变量之间的相关性很低,相比于多次单独进行单因素方差分析,使用多元方差分析不会显著增加统计检验的功效。

选项:

A、正确

B、错误

答案:【正确】61.单选题:在所有情况下,大语言模型都能准确理解和回答所有的问题。

选项:

A、正确

B、错误

答案

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论