版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年秋江苏开放大学数据挖掘技术060734第1次形考作业答案单选题题型:单选题客观题分值2分难度:简单得分:21、假设12个销售价格记录已经排序如下:5,10,11,13,15,35,50,55,72,92,204,215使用如下每种方法将它们划分成四个箱。等宽划分时(宽度为50),15又在哪个箱子里?()A、第二个B、第三个C、第一个D、第四个学生答案:C题型:单选题客观题分值2分难度:简单得分:22、使用交互式的和可视化的技术,对数据进行探索属于数据挖掘的哪一类任务?()A、预测建模B、探索性数据分析C、寻找模式和规则D、建模描述学生答案:B题型:单选题客观题分值2分难度:简单得分:23、建立一个模型,通过这个模型根据已知的变量值,来预测其他某个变量值属于数据挖掘的哪一类任务?()A、建模描述B、根据内容检索C、预测建模D、寻找模式和规则学生答案:C题型:单选题客观题分值2分难度:中等得分:24、以下两种描述分别对应哪两种对分类算法的评价标准?()(a)警察抓小偷,描述警察抓的人中有多少个是小偷的标准。(b)描述有多少比例的小偷给警察抓了的标准。A、Precision,ROCB、Recall,PrecisionC、Precision,RecallD、Recall,ROC学生答案:C题型:单选题客观题分值2分难度:一般得分:25、以下哪种方法不属于特征选择的标准方法()。A、抽样B、过滤C、包装D、嵌入学生答案:A题型:单选题客观题分值2分难度:简单得分:26、数值属性的相异性不包括()。A、切比雪夫距离B、欧几里得距离C、牛顿距离D、闵可夫斯基距离学生答案:C题型:单选题客观题分值2分难度:简单得分:27、假设12个销售价格记录已经排序如下:5,10,11,13,15,35,50,55,72,92,204,215使用如下每种方法将它们划分成四个箱。等频(等深)划分时,15在第几个箱子内?()A、第二个B、第一个C、第四个D、第三个学生答案:A题型:单选题客观题分值2分难度:简单得分:28、什么是KDD?()A、数据挖掘与知识发现B、动态知识发现C、领域知识发现D、文档知识发现学生答案:A题型:单选题客观题分值2分难度:简单得分:29、图像数据分析的常用方法不包括()。A、图像编码和压缩B、图像增强和复原C、图像数据采集D、图像变换学生答案:C题型:单选题客观题分值2分难度:一般得分:210、下面哪个不属于数据的属性类型。()A、区间B、相异C、序数D、标称学生答案:B题型:单选题客观题分值2分难度:中等得分:211、考虑值集{1、2、3、4、5、90},其截断均值(p=20%)是()。A、3B、5C、2D、3.5学生答案:D题型:单选题客观题分值2分难度:简单得分:212、下列的类型,哪一个不属于属性的分类()。A、标称属性B、集合属性C、二元属性D、数值属性学生答案:B题型:单选题客观题分值2分难度:简单得分:213、目前数据分析和数据挖掘面临的挑战性问题不包括()。A、数据分析与数据挖掘结果的可视化B、离散点数据C、高维度数据D、数据类型的多样性学生答案:B题型:单选题客观题分值2分难度:简单得分:214、用户有一种感兴趣的模式并且希望在数据集中找到相似的模式,属于数据挖掘哪一类任务?()A、预测建模B、寻找模式和规则C、根据内容检索D、建模描述学生答案:C题型:单选题客观题分值2分难度:简单得分:215、某超市研究销售记录数据后发现,买啤酒的人很大概率也会购买尿布,这种属于数据挖掘的哪类问题?()A、聚类B、自然语言处理C、关联规则发现D、分类学生答案:C题型:单选题客观题分值2分难度:中等得分:216、假设有学生考试成绩的值:60,45,33,77,80,100,100,90,70,65,找出这组数据的中列数()。A、100B、82.5C、78D、66.5学生答案:D题型:单选题客观题分值2分难度:简单得分:217、下面不属于创建新属性的相关方法的是()。A、特征提取B、映射数据到新的空间C、特征修改D、特征构造学生答案:C题型:单选题客观题分值2分难度:简单得分:218、当不知道数据所带标签时,可以使用哪种技术促使带同类标签的数据与带其他标签的数据相分离?()A、隐马尔科夫链B、聚类C、分类D、关联分析学生答案:B题型:单选题客观题分值2分难度:一般得分:219、将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务?()A、频繁模式挖掘B、数据流挖掘C、分类和预测D、数据预处理学生答案:D题型:单选题客观题分值2分难度:简单得分:220、假设有学生考试成绩的值:60,45,33,77,80,100,100,90,70,65,找出这组数据的中位数()。A、100B、78.5C、73.5D、55学生答案:C题型:单选题客观题分值2分难度:简单得分:221、目的是缩小数据的取值范围,使其更适合于数据挖掘算法的需要,并且能够得到和原始数据相同的分析结果的是()。A、数据清洗B、数据归约C、数据变换D、数据集成学生答案:C题型:单选题客观题分值2分难度:简单得分:222、下面哪种不属于数据预处理的方法?()A、变量代换B、聚集C、离散化D、估计遗漏值学生答案:D题型:单选题客观题分值2分难度:简单得分:223、下列不属于分析与挖掘的数据类型的是()。A、数据库数据B、数据矩阵C、数据分析D、事务数据学生答案:C题型:单选题客观题分值2分难度:简单得分:224、属于定量的属性类型是()。A、区间B、标称C、相异D、序数学生答案:A题型:单选题客观题分值2分难度:中等得分:225、只有非零值才重要的二元属性被称作()。A、计数属性B、非对称的二元属性C、离散属性D、对称属性学生答案:B题型:单选题客观题分值2分难度:简单得分:226、为数据的总体分布建模,把多维空间划分成组等问题,属于数据挖掘的哪一类任务?()A、建模描述B、预测建模C、寻找模式和规则D、探索性数据分析学生答案:A多选题题型:多选题客观题分值2分难度:中等得分:21、数据分散度量有()A、分位数B、四分位数C、方差D、极差E、标准差学生答案:A;B;C;D;E题型:多选题客观题分值2分难度:中等得分:22、分析与挖掘的数据类型有()A、其它类型的数据B、事务数据C、数据矩阵D、数据库数据E、图和网状数据F、数据仓库数据学生答案:A;B;C;D;E;F题型:多选题客观题分值2分难度:中等得分:23、基本统计图形显示有()A、饼图B、散点图C、箱图D、频率直方图学生答案:A;B;C;D填空题题型:填空题客观题答案不允许乱序分值4分难度:简单得分:41、数据分析与数据挖掘的方法有、、、。正确答案:频繁模式;分类与回归;聚类分析;离群点分析题型:填空题客观题答案不允许乱序分值4分难度:一般得分:42、数据预处理的方法包括、、、。学生答案:数据清理;数据集成;数据变换;数据归约简答题题型:简答题主观题分值8分难度:简单得分:81、什么是数据分析和数据挖掘?简单论述他们之间的区别和联系。答案:定义数据分析:以明确业务目标为导向,对已有的结构化数据进行统计、清洗、可视化和解释,聚焦于从数据中提取已知维度的信息,验证预设假设,回答“发生了什么、为什么发生”的问题,是面向业务决策的基础数据处理过程。数据挖掘:属于无监督/半监督的高级数据分析分支,依托机器学习、统计建模等技术,在大规模数据中自动发现隐藏的、未知的模式、关联规则和潜在规律,聚焦于预测未来趋势、挖掘数据中未被人工发现的价值,回答“未来会发生什么、背后有什么隐藏规律”的问题。区别目标差异:数据分析侧重验证已知假设、解释已发生的现象;数据挖掘侧重发现未知的潜在模式,实现预测性分析。技术门槛差异:数据分析以基础统计、SQL、可视化工具为主,技术门槛相对较低;数据挖掘需要掌握机器学习、算法建模等专业技术,门槛更高。数据规模差异:数据分析可适配中小规模数据集;数据挖掘通常面向TB级以上的大规模复杂数据集。联系二者是数据价值挖掘流程中的上下游环节,数据分析是数据挖掘的基础,数据挖掘是数据分析的延伸升级;二者都需要依托数据预处理技术提升数据质量,最终目标都是从数据中提取有效信息,为决策提供支撑。题型:简答题主观题分值7分难度:简单得分:72、数据预处理的主要方法有哪些?每个方法的主要内容是什么?答案:数据清洗:是预处理的核心基础步骤,通过填充缺失值、剔除/修正异常值、删除重复记录、统一数据格式,解决原始数据的不完整、噪声大、不一致问题,实现数据标准化。数据集成:将多个不同来源、不同格式的数据集合并到统一的存储体系中,解决多源数据的属性命名冲突、数据冗余问题,构建完整的数据集。数据变换:通过归一化(Min-Max缩放)、标准化(Z-Score处理)、特征编码(独热编码)、离散化分箱等操作,将原始数据转换为适配后续算法的统一格式,消除不同特征的量纲差异。数据归约:在保留核心关键信息的前提下,通过PCA降维、特征选择、数据聚合等方式减少数据整体规模,降低后续分析的计算成本,提升模型运行效率。题型:简答题主观题分值6分难度:简单得分:63、什么是极差、分位数、方差?答案:极差:也叫全距,是一组数据中最大值与最小值的差值,公式为,直观反映数据的整体波动范围,计算简便但仅依赖两个极端值,易受异常值干扰。分位数:将排序后的数据集划分为若干等份的数值点,常用的有四分位数(将数据分为4等份)、百分位数,用于描述数据在不同位置的分布特征,比如上四分位数代表排序后前75%数据的分界点,不受极端值影响,可用于计算四分位距衡量离散程度。方差:衡量所有数据点与数据集均值的偏离程度的统计量,分为总体方差和样本方差,总体方差公式为,数值越大代表数据整体离散程度越高、波动越剧烈。题型:简答题主观题分值6分难度:简单得分:64、阐述二元属性的状态以及每种状态表示的含义。答案:二元属性是标称属性的特殊子类,仅包含两个互斥的状态取值,根据取值特性可分为两类,对应不同状态含义:对称二元属性:两个状态的权重完全对等,没有主次、正负之分,两个状态分别代表“是/否”“存在/不存在”两种对等的事实,比如“性别”属性的“男/女”两个状态,两个状态的重要性完全一致,不存在谁是“正类”谁是“负类”的区别。非对称二元属性:两个状态的重要性不对等,其中一个状态是“正状态”(通常用1表示),代表我们关注的特征存在;另一个是“负状态”(通常用0表示),代表特征不存在,比如“疾病检测结果”属性,“阳性(1)”是我们重点关注的状态,“阴性(0)”是次要状态,两个状态的价值权重不对等。题型:简答题主观题分值7分难度:简单得分:75、简述均值、中位数、众数和中列数的定义。答案:均值:也叫算术平均数,是数据集所有数值的总和除以数据总个数,反映数据的整体平均水平,是最常用的集中趋势度量指标,但易受极端值影响。中位数:将数据集按大小顺序排序后,位于中间位置的数值;若数据个数为偶数,则取中间两个数的平均值,完全不受极端值干扰,适合描述存在偏态分布的数据集的集中趋势。众数:数据集中出现频率最高的数值,可用于定性数据和定量数据的集中趋势描述,一个数据集可以存在一个或多个众数,也可以不存在众数。中列数:数据集最大值和最小值的算术平均值,即(最大值+最小值)/2,计算简便,仅通过两个极端值快速估算数据的中心位置,但结果极易受极端值影响,仅用于粗略的集中趋势估算。
2026年秋江苏开放大学数据挖掘技术060734第2次形考作业答案单选题题型:单选题客观题分值2分难度:中等得分:21、OLAM技术一般简称为”数据联机分析挖掘”,下面说法正确的是()。A、由于OLAM的立方体和用于OLAP的立方体有本质的区别B、OLAP和OLAM都基于客户机/服务器模式,只有后者有与用户的交互性C、基于WEB的OLAM是WEB技术与OLAM技术的结合D、OLAM服务器通过用户图形借口接收用户的分析指令,在元数据的知道下,对超级立方体作一定的操作学生答案:D题型:单选题客观题分值2分难度:简单得分:22、概念分层图是()图。A、无向无环B、无向有环C、有向有环D、有向无环学生答案:D题型:单选题客观题分值2分难度:简单得分:23、关于OLAP和OLTP的说法,下列不正确的是()。A、OLTP以应用为核心,是应用驱动的B、OLAP的最终数据来源与OLTP不一样C、OLTP面对的是决策人员和高层管理人员D、OLAP事务量大,但事务内容比较简单且重复率高学生答案:D题型:单选题客观题分值2分难度:简单得分:24、一所大学内的各年纪人数分别为:一年级200人,二年级160人,三年级130人,四年级110人。则年级属性的众数是()。A、三年级B、二年级C、四年级D、一年级学生答案:D题型:单选题客观题分值2分难度:简单得分:25、数据仓库设计的三级数据模型不包括()。A、概念模型B、数据模型C、逻辑模型D、物理模型学生答案:B题型:单选题客观题分值2分难度:较难得分:26、假定用于分析的数据包含属性age。数据元组中age的值如下(按递增序):13,15,16,16,19,20,20,21,22,22,25,25,25,30,33,33,35,35,36,40,45,46,52,70,问题:使用按箱平均值平滑方法对上述数据进行平滑,箱的深度为3。第二个箱子值为()。A、18.3B、27.9C、22.6D、26.8学生答案:A题型:单选题客观题分值2分难度:简单得分:27、在图集合中发现一组公共子结构,这样的任务称为()。A、频繁数据项挖掘B、频繁子集挖掘C、频繁模式挖掘D、频繁子图挖掘学生答案:D题型:单选题客观题分值2分难度:简单得分:28、OLAP技术的核心是()。A、在线性B、对用户的快速响应C、互操作性D、多维分析学生答案:D题型:单选题客观题分值2分难度:简单得分:29、下列哪一项不是数据仓库的关键性质()。A、与空间相关B、集成性C、面向主题D、与时间相关学生答案:A题型:单选题客观题分值2分难度:一般得分:210、下面()属于映射数据到新的空间的方法。A、傅里叶变换B、维归约C、渐进抽样D、特征加权学生答案:A题型:单选题客观题分值2分难度:一般得分:211、频繁项集、频繁闭项集、最大频繁项集之间的关系是()A、频繁项集=频繁闭项集=最大频繁项集B、频繁项集频繁闭项集最大频繁项集C、频繁项集频繁闭项集=最大频繁项集D、频繁项集=频繁闭项集最大频繁项集学生答案:B题型:单选题客观题分值2分难度:简单得分:212、下列哪一个选项是数据立方体中的基本方体的概念()。A、每一个数据立方体B、最高层抽象的立方体C、不同层创建的数据立方体D、最低抽象层创建的立方体学生答案:D题型:单选题客观题分值2分难度:简单得分:213、关于OLAP的特性,下面正确的是()。(1)快速性(2)可分析性(3)多维性(4)信息性(5)共享性A、(1)(2)(3)(4)(5)B、(2)(3)(4)C、(1)(2)(3)D、(1)(2)(3)(4)学生答案:A题型:单选题客观题分值2分难度:简单得分:214、有关数据仓库的开发特点,不正确的描述是()。A、数据仓库开发要从数据出发B、数据仓库使用的需求在开发出去就要明确C、数据仓库的开发是一个不断循环的过程,是启发式的开发D、在数据仓库环境中,并不存在操作型环境中所固定的和较确切的处理流,数据仓库中数据分析和处理更灵活,且没有固定的模式学生答案:B题型:单选题客观题分值2分难度:简单得分:215、将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务()。A、数据预处理B、频繁模式挖掘C、分类和预测D、数据流挖掘学生答案:A题型:单选题客观题分值2分难度:简单得分:216、数据仓库的三层体系结构不包括()。A、数据仓库服务器B、SMTP服务器C、前端工具D、OLAP服务器学生答案:B题型:单选题客观题分值2分难度:一般得分:217、熵是为消除不确定性所需要获得的信息量,投掷均匀正六面体骰子的熵是()。A、2.6比特B、3.8比特C、1比特D、3.2比特学生答案:A题型:单选题客观题分值2分难度:简单得分:218、下面关于数据粒度的描述不正确的是()。A、数据综合度越高,粒度也就越大,级别也就越高B、粒度是指数据仓库小数据单元的详细程度和级别C、数据越详细,粒度就越小,级别也就越高D、粒度的具体划分将直接影响数据仓库中的数据量以及查询质量学生答案:A题型:单选题客观题分值2分难度:一般得分:219、在抽样方法中,当合适的样本容量很难确定时,可以使用的抽样方法是()。A、分层抽样B、无放回的简单随机抽样C、有放回的简单随机抽样D、渐进抽样学生答案:D题型:单选题客观题分值2分难度:一般得分:220、关于基本数据的元数据是指()。A、基本元数据包括与企业相关的管理方面的数据和信息B、基本元数据包括日志文件和简历执行处理的时序调度信息C、基本元数据与数据源,数据仓库,数据集市和应用程序等结构相关的信息D、基本元数据包括关于装载和更新处理,分析处理以及管理方面的信息学生答案:D题型:单选题客观题分值2分难度:一般得分:221、设X={1,2,3}是频繁项集,则可由X产生()个关联规则。A、6B、5C、7D、4学生答案:A题型:单选题客观题分值2分难度:中等得分:222、未来房价的预测,这种属于数据挖掘的哪类问题()。A、回归分析B、关联规则C、分类D、聚类学生答案:A题型:单选题客观题分值2分难度:中等得分:223、考虑值集{12243324556826},其四分位数极差是()。A、55B、31C、3D、24学生答案:B题型:单选题客观题分值2分难度:中等得分:224、考虑下面的频繁3-项集的集合:{1,2,3},{1,2,4},{1,2,5},{1,3,4},{1,3,5},{2,3,4},{2,3,5},{3,4,5}假定数据集中只有5个项,采用合并策略,由候选产生过程得到4-项集不包含()。A、1,2,3,4B、1,2,3,5C、1,2,4,5D、1,3,4,5学生答案:C题型:单选题客观题分值2分难度:一般得分:225、数据仓库是随着时间变化的,下面的描述不正确的是()。A、捕捉到的新数据会覆盖原来的快照B、数据仓库随事件变化不断删去旧的数据内容C、数据仓库中包含大量的综合数据,这些综合数据会随着时间的变化不断地进行重新综合D、数据仓库随时间的变化不断增加新的数据内容学生答案:B题型:单选题客观题分值2分难度:简单得分:226、下列哪个不是专门用于可视化时间空间数据的技术:()A、矢量场图B、曲面图C、饼图D、等高线图学生答案:C题型:单选题客观题分值2分难度:简单得分:227、关于OLAP和OLTP的区别描述,不正确的是()。A、与OLAP应用程序不同,OLTP应用程序包含大量相对简单的事务B、OLAP主要是关于如何理解聚集的大量不同的数据.它与OTAP应用程序不同C、OLAP的特点在于事务量大,但事务内容比较简单且重复率高D、OLAP是以数据仓库为基础的,但其最终数据来源与OLTP一样均来自底层的数据库系统,两者面对的用户是相同的学生答案:C题型:单选题客观题分值2分难度:较难得分:228、假设属性income的最大最小值分别是12000元和98000元。利用最大最小规范化的方法将属性的值映射到0至1的范围内。对属性income的73600元将被转化为()。A、0.821B、1.224C、0.716D、1.458学生答案:C题型:单选题客观题分值2分难度:简单得分:229、在有关数据仓库测试,下列说法不正确的是()。A、在完成数据仓库的实施过程中,需要对数据仓库进行各种测试.测试工作中要包括单元测试和系统测试.B、在测试之前没必要制定详细的测试计划C、系统的集成测试需要对数据仓库的所有组件进行大量的功能测试和回归测试D、当数据仓库的每个单独组件完成后,就需要对他们进行单元测试学生答案:B题型:单选题客观题分值2分难度:简单得分:230、下列哪一项不是数据规范化的常用方法()。A、z-score规范化B、按整数定标规范法C、最小-最大值规范化D、按小数定标规范化学生答案:B填空题题型:填空题客观题答案不允许乱序分值5分难度:简单得分:51、相关性分析有正确答案:提升度;杠杆度;皮尔森相关系数;IS度量;确信度题型:填空题客观题答案不允许乱序分值2分难度:简单得分:22、项集包含或_项的集合正确答案:0个;多个题型:填空题客观题答案不允许乱序分值2分难度:简单得分:23、变量之间的关系可分为正确答案:确定性关系;非确定性关系题型:填空题客观题答案不允许乱序分值3分难度:简单得分:34、多维数据模型主要分为。学生答案:星型模型;雪花模型;事实星座模型题型:填空题客观题答案不允许乱序分值5分难度:简单得分:55、回归分析的步骤。正确答案:确定变量;建立预测模型;进行相关分析;计算预测误差;确定预测值简答题题型:简答题主观题分值10分难度:困难得分:101、【案例分析题】某公司存储员工信息的数据库中表示收入的字段income排序后的值(元)为:900,1000,1300,1600,1600,1900,2000,2400,2600,2900,3000,3600,4000,4600,4900,5000。1.按照等深分箱法进行分箱。2.按照等宽分箱法进行分箱。答案:(1)等深分箱法(等频分箱)等深分箱要求每个箱子包含的样本数量相等,这里总样本数16,我们将其划分为4个箱子,每个箱子包含4个样本,分箱结果如下:箱1:[900,1000,1300,1600]箱2:[1600,1900,2000,2400]箱3:[2600,2900,3000,3600]箱4:[4000,4600,4900,5000](2)等宽分箱法等宽分箱要求每个箱子的数值区间宽度相等。首先计算数据的极差:最大值5000-最小值900=4100。我们将其划分为4个等宽区间,每个区间宽度为4100/4≈1025,分箱结果如下:箱1:区间[900,1925],包含样本:900,1000,1300,1600,1600,1900箱2:区间(1925,2950],包含样本:2000,2400,2600,2900箱3:区间(2950,3975],包含样本:3000,3600,4000箱4:区间(3975,5000],包含样本:4600,4900,5000题型:简答题主观题分值6分难度:简单得分:62、变量间的确定性关系和非确定性关系分别指的是什么?答案:确定性关系:也叫函数关系,指两个变量之间存在严格的一一对应数学表达式,当自变量取确定值时,因变量有唯一确定的数值与之对应,不存在随机误差干扰。比如圆的面积S和半径r的关系:,给定半径就能唯一确定面积。非确定性关系:也叫相关关系,变量之间存在明显的统计关联,但不存在严格的函数对应关系,自变量取确定值时,因变量会在一定范围内呈现随机波动,无法得到唯一确定的结果。比如人的身高和体重的关系,身高相近的人体重会有明显差异,无法通过身高精确计算出体重。题型:简答题主观题分值7分难度:简单得分:73、简述数据仓库概念模型与逻辑模型的设计步骤。答案:概念模型设计步骤需求梳理:明确企业的业务分析主题,梳理决策层和业务层的核心分析需求,划定数据仓库的业务覆盖范围。确定核心主题域:按照业务维度划分出销售、客户、库存等核心主题,定义每个主题的核心实体、关键属性和实体之间的业务关联关系。构建E-R概念图:用实体-关系图的形式,直观呈现所有核心实体、实体的关键属性,以及实体之间的一对一、一对多关联关系,形成全局统一的概念数据视图,不涉及具体技术实现细节。逻辑模型设计步骤概念模型转换:将E-R概念图转换为关系型数据库的二维表结构,把每个实体转换为对应的维度表或事实表,定义每张表的主键、外键和全部属性字段。选择建模范式:根据业务场景选择第三范式(3NF)、星型模式或雪花模式,完成表结构的规范化设计,减少数据冗余,同时适配分析查询的效率需求。模型优化调整:根据数据量、查询频率和业务使用习惯,调整表结构的关联关系,补充必要的冗余字段提升查询性能,最终形成可直接用于物理实现的逻辑数据模型。
2026年秋江苏开放大学数据挖掘技术060734第3次形考作业答案单选题题型:单选题客观题分值2分难度:一般得分:21、影响基本K-均值算法的主要因素有()。A、模式相似性测度B、样本的数量C、聚类准则D、样本输入顺序正确答案:A题型:单选题客观题分值2分难度:简单得分:22、关于欠拟合,下面哪个说法是正确的()。A、训练误差不变,测试误差较大B、训练误差较小,测试误差较大C、训练误差较大,测试误差较大D、训练误差较大,测试误差较小学生答案:C题型:单选题客观题分值2分难度:简单得分:23、我们想在大数据集上训练决策树,为了使用较少时间,我们可以()。A、减少树的数量B、增加树的深度C、增加学习率D、减少树的深度学生答案:D题型:单选题客观题分值2分难度:简单得分:24、简单地将数据对象集划分成不重叠的子集,使得每个数据对象恰在一个子集中,这种聚类类型称作()。A、划分聚类B、非互斥聚类C、层次聚类D、模糊聚类学生答案:A题型:单选题客观题分值2分难度:中等得分:25、“点击率问题”是这样一个预测问题,99%的人是不会点击的,而1%的人是会点击进去的,所以这是一个非常不平衡的数据集。假设,现在我们已经建了一个模型来分类,而且有了99%的预测准确率,我们可以下的结论是()。A、以上都不对B、无法下结论C、模型预测准确率已经很高了,我们不需要做什么了D、模型预测准确率不高,我们需要做点什么改进模型学生答案:B题型:单选题客观题分值2分难度:简单得分:26、以下()算法是关联规则挖掘。A、ID3B、K-MeansC、DBSCAND、Apriori学生答案:D题型:单选题客观题分值2分难度:一般得分:27、关联规则的评价指标是()。A、平均绝对误差、相对误差B、支持度、置信度C、Kappa统计、显著性检验D、均方误差、均方根误差学生答案:B题型:单选题客观题分值2分难度:简单得分:28、下列哪个描述是正确的()。A、回归和聚类都是无指导的学习B、回归和聚类都是有指导的学习C、回归是无指导的学习,聚类是有指导的学习D、回归是有指导的学习,聚类是无指导的学习学生答案:D题型:单选题客观题分值2分难度:简单得分:29、以下不属于影响聚类算法结果的主要因素有()。A、模式相似性测度B、分类准则C、已知类别的样本质量D、特征选取学生答案:C题型:单选题客观题分值2分难度:简单得分:210、BIRCH是一种()。A、分类器B、关联分析算法C、特征选择算法D、聚类算法学生答案:D题型:单选题客观题分值2分难度:简单得分:211、以下哪个算法是分类算法()。A、DBSCANB、EMC、K-MeanD、C4.5学生答案:D题型:单选题客观题分值2分难度:简单得分:212、以下哪种技术对于减少数据集的维度会更好()。A、删除不同数据趋势的列B、删除缺少值太多的列C、删除数据差异较大的列D、都不是正确答案:B题型:单选题客观题分值2分难度:简单得分:213、一监狱人脸识别准入系统用来识别对待进入人员的身份,此系统一共包括识别4种不同的人员:狱警,小偷,送餐员,其他。下面哪种学习方法最适合此种应用需求()。A、二分类问题B、K-中心点聚类问题C、多分类问题D、层次聚类问题学生答案:C题型:单选题客观题分值2分难度:简单得分:214、以下哪项关于决策树的说法是错误的()A、决策树算法对于噪声的干扰非常敏感B、子树可能在决策树中重复多次C、寻找最佳决策树是NP完全问题D、冗余属性不会对决策树的准确率造成不利的影响正确答案:D题型:单选题客观题分值2分难度:简单得分:215、当分析顾客消费行业,以便有针对性的向其推荐感兴趣的服务,属于什么问题()。A、关联规则B、主成分分析C、分类D、聚类学生答案:A题型:单选题客观题分值2分难度:中等得分:216、下列关于凝聚层次聚类的说法,说法正确的是()。A、具有全局优化目标函数B、算法的终止条件是仅剩下一个簇C、空间复杂度D、一旦两个簇合并,该操作还能撤销学生答案:B题型:单选题客观题分值2分难度:简单得分:217、以下哪个聚类算法不属于基于网格的聚类算法()。A、STINGB、MAFIAC、WaveClusterD、BIRCH学生答案:D题型:单选题客观题分值2分难度:简单得分:218、以下哪个分类方法可以较好地避免样本的不平衡问题()。A、BayesB、KNNC、神经网络D、SVM学生答案:B题型:单选题客观题分值2分难度:简单得分:219、一般,K-NN最近邻方法在()的情况下效果较好。A、样本呈链状分布B、样本呈团状分布C、样本较少但典型性好D、样本较多但典型性不好学生答案:C题型:单选题客观题分值2分难度:一般得分:220、决策树中不包含以下哪种节点()。A、内部节点B、根节点C、叶结点D、外部节点学生答案:D填空题题型:填空题客观题答案不允许乱序分值6分难度:简单得分:61、支持向量机的3种模型可分为:学生答案:线性可分支持向量机;线性支持向量机;非线性支持向量机题型:填空题客观题答案不允许乱序分值10分难度:简单得分:102、回归分析的步骤。正确答案:确定变量;建立预测模型;进行相关分析;计算预测误差;确定预测值题型:填空题客观题答案不允许乱序分值4分难度:简单得分:43、分类的基本过程:正确答案:学习阶段;分类阶段题型:填空题客观题答案不允许乱序分值6分难度:简单得分:64、惰性学习法主要包括:正确答案:K最近邻分类法(KNN);局部加权回归法;基于案例的推理题型:填空题客观题答案不允许乱序分值4分难度:简单得分:45、层次聚类方法可分为:正确答案:凝聚层次聚类;分裂层次聚类简答题题型:简答题主观题分值10分难度:困难
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026届高考地理考向核心卷含答案(江西)
- 2026届高考物理考向核心卷含答案(陕晋青宁)
- 2026麻疹风疹腮腺炎联合疫苗市场创新动态分析报告
- 2026年5G通信技术对制造业创新升级的影响报告
- 2026年零售行业订阅电商创新报告
- 高中信息技术必修1《Python条件判断-智能贵阳地铁2号线计费程序设计》教学设计
- 高中信息技术必修教学设计:信息技术与青少年身心发展
- 初中物理八年级沪科版“实践:创作七彩梦幻般的彩虹”教学设计
- 高三思想政治复习教案:世界的物质性与规律的客观性教学设计
- 2026年生产L型氨基酸的新酶种行业技术分析报告
- 老年人认知障碍预防干预技术标准
- 2026年湖南中医药高等专科学校高职单招笔试职业技能测验试题库含答案解析3套试卷
- 成本实操-有色金属矿采选成本核算SOP
- 2025国家义务教育质量监测小学四年级语文试题
- 《全国校园心理危机分级识别专业技术指导原则(试行)》
- 《跨境电子商务英语》课件-跨境电子商务的概念与特点
- 生产异常举手制度
- 施工安全课件
- (一模)榆林市2026届高三第一次模拟测试地理试卷(含答案详解)
- 雨课堂学堂云在线《人工智能原理》单元测试考核答案
- 高速公路收费站安全课件
评论
0/150
提交评论