版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《大数据导论》第1章大数据基础
练习题一、单项选择题1.数智时代的技术基础由以下哪组技术深度融合而成?A.硬件、软件、通讯和网络B.大数据、云计算、物联网和人工智能C.大数据、区块链、5G和量子计算D.云计算、物联网、VR和AR2.关于物联网的定义,下列说法正确的是?A.物联网的核心和基础是传感器技术B.物联网完全独立于互联网而存在C.物联网的核心和基础仍然是互联网,是在互联网基础上的延伸和扩展D.物联网仅指人与物之间的连接3.云计算是分布式计算的一种,其核心概念是?A.以本地服务器为中心提供计算服务B.以互联网为中心,在网站上提供快速且安全的云计算服务与数据存储C.以单台超级计算机处理所有数据D.以局域网为中心进行数据传输4.根据佩雷斯的技术-经济范式演化理论,一项技术的发展依次经历哪四个阶段?A.引入期、扩展期、控制期、集成期B.爆发期、狂热期、协同期、成熟期C.萌芽期、成长期、成熟期、衰退期D.起步期、发展期、高峰期、低谷期5.舍恩伯格指出大数据时代人们对待数据的思维方式发生了三个变化,下列哪项不属于这三个变化?A.从样本数据变成全部数据,"样本=总体"B.接受数据的混杂性,放弃对精确性的追求C.放弃对因果关系的渴求,转而关注相关关系D.从全量数据中随机抽取少量样本进行分析6.关于IT时代与DT时代的区别,下列说法正确的是?A.IT时代让自己去服务别人,DT时代让别人为自己服务B.IT时代让自己更强大,DT时代让别人更强大C.IT时代以服务大众为主,DT时代以自我控制为主D.IT时代和DT时代没有本质区别7.大数据4V特征中,"Value"指的是?A.数据量巨大B.数据处理速度快C.数据的价值密度低D.数据类型多样8.大数据的价值密度低,下列哪个例子最能说明这一特征?A.电商网站每秒产生上万条交易记录B.连续不间断的视频监控中,可能有用的数据仅仅有一两秒C.社交媒体上每天产生大量文本数据D.传感器网络实时采集环境温度数据9.从数据到智慧的阶梯中,"知识"是指?A.各种符号和原始事实,如字符、数字、声音、图片等B.经过加工后对某现象具有一定解释力的数据C.信息的进一步提升,是更加系统化、理论化的信息D.运用知识并结合经验创造性地预测、解释和发现10.下列关于大数据结构类型的说法,正确的是?A.企业ERP和财务系统中的数据属于非结构化数据B.网页中大量音频和视频数据属于结构化数据C.半结构化数据具有一定的结构性,但不如关系数据库数据有严格理论模型D.XML和HTML属于结构化数据11.关于Hadoop的特点,下列说法错误的是?A.Hadoop维护多个工作数据副本,具有高可靠性B.Hadoop以并行方式工作,处理速度快C.Hadoop能够处理PB级数据,具有高扩展性D.Hadoop只能在单台高性能服务器上运行,不能分布式部署12.关于OLTP和OLAP的区别,下列说法正确的是?A.OLTP侧重于信息和知识处理,OLAP侧重于数据处理B.OLTP侧重于数据处理,OLAP侧重于信息和知识处理C.OLTP和OLAP是完全相同的技术,没有区别D.OLTP用于大数据分析,OLAP用于日常事务处理13.数据科学的理论基础不包括以下哪项?A.统计学B.机器学习C.数据可视化D.量子物理14.数据存储容量单位换算中,1PB等于?A.1024GBB.1024TBC.1024EBD.1024ZB15.关于Python语言的特点,下列说法错误的是?A.Python是一种面向对象的解释型计算机程序设计语言B.Python具有丰富的标准库,可移植性强C.Python程序需要编译成二进制代码后才能运行D.Python既支持面向过程编程也支持面向对象编程二、判断题(正确打√,错误打×)1.物联网是指物物相联的互联网,其核心和基础仍然是互联网。()2.大数据的价值在于数据量"大",数据量越大,价值就越高。()3.大数据必然无法用单台的计算机进行处理,必须采用分布式架构。()4.大数据的价值密度低,意味着大数据的商业价值也低。()5.数据是信息的载体,是信息的原始记录;信息是经过加工后具有一定解释力的数据。()6.IT时代以自我控制、自我管理为主,DT时代以服务大众、激发生产力为主。()7.大数据时代,人们处理的数据从全部数据变为样本数据。()8.半结构化数据和结构化数据一样,都具有严格的关系数据库理论模型。()9.Hadoop是高效的,因为它以并行的方式工作,通过并行处理加快处理速度。()10.大数据技术的战略意义在于掌握庞大的数据信息本身。()11.科学可视化处理的是具有天然几何结构的数据,如MRI数据和气流数据。()12.数据科学以统计学、机器学习、数据可视化以及领域知识为理论基础。()13.大数据时代,人类通过对大数据的处理,放弃对相关关系的关注,转而追求因果关系。()14.云计算的发展为整合打通业务系统、聚合数据提供了技术支撑。()15.非结构化数据没有预定义的数据模型,不方便用数据库二维逻辑表来表现。()
参考答案一、单项选择题1.B2.C3.B4.B5.D6.B7.C8.B9.C10.C11.D12.B13.D14.B15.C二、判断题1.√2.×3.√4.×5.√6.√7.×8.×9.√10.×11.√12.√13.×14.√15.√第二章试题一、单项选择题1.虚拟化技术是云计算的核心支撑技术,是将各种计算及存储资源充分整合和高效利用的关键技术,其中包括()。服务器虚拟化、存储虚拟化、模块虚拟化、桌面虚拟化服务器虚拟化、存储虚拟化、模块虚拟化、应用虚拟化模块虚拟化、存储虚拟化、应用虚拟化、桌面虚拟化服务器虚拟化、存储虚拟化、应用虚拟化、桌面虚拟化2.云计算典型的服务模式不包括()。硬件即服务软件即服务平台即服务基础设施即服务()是云计算的核心支撑技术,是将各种计算及存储资源充分整合和高效利用的关键技术。并行运算技术虚拟化技术数据存储技术数据管理技术以下关于“云计算”和“大数据”的说法,错误的是()。云计算与大数据都是为数据存储和处理服务的,都需要占用大量的存储和计算资源大数据根植于云计算最终目的都是通过充分挖掘海量数据以发现数据中的价值云计算可以节省IT部署成本云计算的()技术实现了把有限的固定的资源根据不同需求进行重新规划,以达到最大利用率的思路,从而实现简化管理,优化资源等目的。虚拟化技术海量数据管理技术并行计算技术海量数据存储技术以下()是云计算的特征。广泛的网络访问按需自助式服务快速弹性使用以上所有()单独为一个用户客户使用而构建的云基础设施,可以对数据的安全和服务质量进行最有效的控制。公共云社区云混合云私有云()为用户提供对资源层的各项云计算服务的封装,帮助用户构建所需应用。用户访问层平台层管理层应用层()是对大规模数据进行计算、分析和处理的技术,如互联网的各种搜索引擎。虚拟化技术并行计算技术海量数据存储技术海量数据管理技术下列关于“云计算”和“超算”错误的是()。超级计算机主要面向科学计算、工程模拟等领域,大多属于计算密集型的应用;而云计算则主要是在社交网络、企业IT建设等领域。云计算以分布式为特色,而超算逻辑上是集中式的,针对计算密集型任务更强调通过并行计算获得高性能。相对于超算,云计算成本更高。云计算中心与超级计算中心的建设理念及应用模式类似,都采用计算资源集中部署。钉钉在线文档、阿里云盘属于云计算哪一层服务()。AIaaSBPaaSCSaaSDHPC高性能计算以下不属于云计算核心特征的是()。A按需弹性扩容B按量计费C本地硬件固定不可变更D远程网络访问天河一号属于哪类算力集群()。A商用公有云集群B高性能HPC超算集群C个人存储集群D小型办公集群下列属于大数据与云计算关系描述正确的是()。A大数据是算力载体,云计算是数据内容B云计算提供算力存储底座,大数据依托云完成处理分析C二者无任何关联D大数据可以脱离云计算独立处理EB级数据并行计算实现海量数据快速运算的硬件基础是()。A集群多节点协同运算B单CPU单核运算C手机处理器D单机显卡二、判断题(正确打√,错误打×)云计算根据服务模式可以分为私有云、社区云、公共云和混合云四类。()需要同时满足共享、计时、有效的条件才可称之为云计算。()云存储可以分为四种存储方式:对象存储、块存储、元数据存储和文件存储。()云计算作为一种新的超级计算方式和服务模式,以数据统计和分析为中心,是一种数据密集型的超级计算。()云计算的体系结构由5部分组成,分别为应用层、平台层、资源层、用户访问层和实践层。()云存储不是一种存储,而是一种服务。()云计算是分布式计算面向应用的延伸,分布式计算是云计算的实现基础。()云计算中心与超级计算中心的建设理念及应用模式完全不同。()云计算为大数据提供了有力的工具和途径,也为大数据提供了很有价值的用武之地。()目前天津超算中心已成为高端信息技术创新和转化的引领和示范基地。()狭义云计算仅指IaaS基础设施服务,包含云服务器、云存储、网络资源。()SaaS层服务需要用户自行搭建服务器、安装大数据组件才能使用。()计算机集群由多台独立节点组成,可并行拆分处理海量大数据任务。()云存储数据仅保存在单台服务器硬盘中,硬件损坏会直接丢失全部数据。()大数据无法脱离云计算集群完成TB、PB级别海量数据的存储与运算。()天河一号商用超算和阿里云公有云集群定位完全一致,使用场景无区别。()PaaS大数据平台会自动调度底层IaaS集群算力,无需人工管理硬件。()百度网盘、在线表格软件都属于SaaS层的典型应用。()云计算资源扩容需要线下采购、安装物理服务器,耗时周期长。()广义云计算覆盖IaaS、PaaS、SaaS三层,完整支撑大数据全流程处理。()
第二章答案一、单项选择题DABC从目的上来看,大数据主要是通过充分挖掘海量数据以发现数据中的价值,而云计算是节省企业的IT部署成本。ADDBDC云计算是规模经济,讲究成本效益,而超算则舍得花费资金堆积计算和存储能力,因此超算成本更高。CCBBA二、判断题×应该是按照服务对象分类。×需要同时满足租用、计时、有效的条件才可称之为云计算。×为三种存储方式,其中不包括元数据存储。×云计算以数据为中心而不是以数据统计和分析为中心。×实践层应该为管理层。√√×云计算中心与超级计算中心的建设理念及应用模式类似,都采用计算资源集中部署。两者的技术是相通的,也都面临着包括并行编程、能耗效率等的挑战。×云计算为大数据提供了有力的工具和途径,大数据为云计算提供了很有价值的用武之地。√√×√×√×√√×√第三章试题一、单项选择题1.下列属于日志收集系统具有的基本特征是()高可用性高可靠性可扩展性以上都是2.以下哪种数据采集方法是针对非结构数据,将其从网页中抽取并以结构化的方式将其存储起来。()系统日志采集网络数据采集数据库采集以上都是3.数据质量的评估标准不包括以下哪一项()完整性一致性及时性针对性4.以下哪一项属于数据质量最为基础的评估标准。()一致性完整性及时性准确性5.在对天津的16个区的经济情况做调查时,发现区域数量一共14个,说明数据质量存在()问题。一致性完整性准确性及时性6.163邮箱用户的号码一般都以163.com结尾,这遵循了数据质量评估标准的哪一项()完整性一致性准确性及时性7.一份数据文件中出现的字符型数据乱码现象,这份数据不具备数据质量评估标准的哪一项()完整性一致性准确性及时性8.以下数据质量评估标准,哪一条主要跟数据的同步和处理过程的效率相关。()完整性一致性准确性及时性9.以下不属于数据质量的影响因素的是()信息因素时间因素流程因素管理因素10.信息因素是影响数据质量的一条重要因素,关于对信息因素的理解,下列说法正确的是()指由于技术处理异常造成的数据质量问题指由于系统流程和操作流程设置不当造成的数据质量问题指由于元数据对数据的描述以及理解错误、数据源规格不统一造成的质量问题指由于人员素质以及管理机制方面造成的数据质量问题11.当在测量一个变量时出现了相对于真实值的偏差或错误,这种数据会影响后续的分析。这种数据属于()。冗余数据残缺数据噪声数据错误数据12.以下不属于处理残缺数据的方法是()。忽略整个元组人工填写缺失值分箱设置允许存在空值规则13.使用分箱法处理噪声数据时,发现每个箱子的区间相等,因此使用的分箱法为()。等深分箱法等高分箱法等宽分箱法用户自定义分箱法14.以下哪种方法可以处理冗余数据()重复过滤回归分箱聚类15.以下哪一种属于数据概化()将“××年××月××日”日期形式转换为“××/××/××/”根据病人得分将健康状况分为“优秀、良好、中等、合格、不合格”等级根据出生日期的属性将其转化为80后、90后、00后等根据半径的属性计算出球的表面积和体积16.一份数据的最小值和最大值分别是6和659899,其中一个值为569,将其使用小数定标法将其标准化,结果为()0.5695.690.05690.00056917.属性“支出”的最小值和最大值分别为15000元和96000元。将属性值56000元进行0-1标准化后可得()0.5600.5660.5060.65818.以下不属于在实现数据集成时需要解决的问题是()模式匹配数据值冲突数据冗余数据残缺19.以下不属性属于标称数据的有()地理位置属性工种属性商品类型属性分数属性20.经过一些列数据处理,在基本保持原始数据完整性的基础上,减少数据规模的是()数据清洗数据融合数据归约数据挖掘21.维归约的目的是()找到最小属性集找到最大属性集解决数据值冲突减少数据冗余22.维归约时为了找到最小属性集采用的逐步向前选择方法,将()作为初始值。一个拥有所有属性的属性集一个空的属性集随机选择部分属性后的属性集以上都可23.我国的手机号码一定是11位数字,满足数据质量中的哪一条标准()完整性一致性准确性及时性24.一个学校中学生的学号是唯一的,某班级共有30个人。在统计全班的学生信息时得到的唯一值总数小于30,则可以断定该数据缺乏()。完整性一致性准确性及时性25.数据获取过程中出现的采集点不正确、取数时点不正确以及接口数据在过程中失真的情况,比如编码转换处理错误以及精度不够,导致指标统计结果不一致、数据无效等降低了数据的质量,这属于()。信息因素技术因素流程因素管理因素26.以下说法正确的是()同样的顾客ID,在A系统中的字段名是Cust_id,在B系统中是Customer_Num,因此在集成时会出现数据冗余A系统中有月营业额属性,B系统中有日营业额属性,A和B集成时不会出现数据冗余地理位置、工种、商品类型属于标称数据对数值数据一般通过检测他们之间的相关系数估计两个属性之间的相关度27.以下说法错误的是()数据规约对后续的分析处理不产生影响,即规约前后的数据的分析结果相同逐步向前选择是指从一个拥有所有属性的属性集开始逐步向后删除是指从一个拥有所有属性的属性集开始数值规约常用的方法有直方图、聚类、抽样、参数回归等二、判断题(正确打√,错误打×)1.数据采集属于大数据生命周期的第一个环节,之后的分析挖掘都建立在数据采集的基础之上。()2.数据采集产品Logstash是一个接收,处理,转发日志的工具。支持系统日志、webserver日志、错误日志、应用日志等各种日志类型。()3.一个班级中及格率为101%,这违背了数据质量的准确性。()4.元数据:又称中介数据、中继数据,为描述数据的数据,主要被用于描述数据属性。()5.当填写残缺值时,如果数据量很大并且缺失值很多,可以采用人工填写法。()6.一份数据存在缺失值,这意味着数据存在错误。()7.平滑处理中按边界值处理数据时,一般使用距离边界值较小的边界值来代替箱子中的所有数据。()8.冗余数据既包括重复的数据,也包括对分析处理的问题无关的数据,通常采用过滤数据的方法来处理冗余数据。()9.数据概化是指用低层次的属性代替高层次或者抽象的数据。()10.根据正方形的边长属性可以计算其周长属性和面积属性,这一过程属于属性构造。()11.标称数据:指具有有穷多个不同值(但可能很多),且值之间无序的属性。如地理位置、工种、商品类型等。()12.对于标称数据,可以通过计算两个属性之间的相关系数来估计这两个属性之间的相关度。()13.对于数值数据,可以通过检测他们之间的相关系数来估计这两个属性之间的相关度。相关系数越大,代表两个属性相关度越高。()14.数据归约也称数据削减,是指在尽可能保持数据原貌的前提下,最大限度地精简数据量。数据归约对后续的分析处理不产生影响。()15.数值归约中使用的抽样,其中的优点是:得到样本的花费正比于样本集的大小,而不是数据集的大小。()16.将一个班中各学生的语文成绩按照0~59、60~69、70~79、80~89、90~100的数值型数据依次转化为不及格、及格、中等、良好、优秀的字符型数据类型。这种由原属性到目标属性之间的映射关系为多对一映射。()17.数据集成是指将不同数据源中的数据,逻辑地(生成一个视图)或物理地(生成一个新的关系表)集成到一个统一的数据集合中。()第三章答案一、单项选择题1.D2.B3.D4.B5.B6.B7.C8.D9.B10.C11.C12.C13.C14.A15.C16.D17.C18.D19.D20.C21.A22.B23.A24.A25.B26.B27.B二、判断题1.√2.√3.×4.√5.×6.×7.√8.√9.×10.√11.√《大数据导论》第4章数据分析与数据挖掘题库一、单选题(10题)1.数据分析的主要作用不包括()A.现状分析B.原因分析C.预测分析D.随意删除数据答案:D2.层次分析法通常建立的层次结构不包括()A.目标层B.准则层C.方案层D.噪声层答案:D3.多元线性回归分析主要用于研究()A.一个被解释变量与多个解释变量之间的关系B.图像像素之间的颜色关系C.文本词频之间的包含关系D.多个无标签样本之间的聚类关系答案:A4.数据挖掘的核心目标是()A.从大量数据中发现潜在有价值的信息和知识B.只进行数据录入和备份C.完全消除所有数据误差D.只展示数据表格答案:A5.分类分析与聚类分析的主要区别是()A.分类通常需要已知类别标签,聚类通常不依赖预先定义的类别标签B.分类只能处理文本数据,聚类只能处理图像数据C.分类不需要训练数据,聚类必须先人工标注类别D.分类和聚类没有任何区别答案:A6.K-Means算法中的K表示()A.样本总数B.聚类个数C.特征维度D.迭代误差答案:B7.KNN算法判断新样本类别的主要依据是()A.距离最近的若干邻近样本的类别B.样本编号的大小C.数据采集时间的先后D.随机选择的类别答案:A8.随机森林算法的基本思想是()A.将多棵决策树组合起来进行分类或预测B.只使用一条固定规则判断类别C.只计算样本之间的欧氏距离D.只处理时间序列数据答案:A9.卷积神经网络适合处理图像数据,主要原因是其能够()A.自动提取图像的空间层次特征B.完全替代数据标注工作C.保证任何任务都不出现误差D.只识别表格中的数字答案:A10.YOLOv8目标检测模型的整体结构主要包括()A.Backbone、Neck和HeadB.Input、Print和SaveC.Word、Excel和PowerPointD.State、Action和Reward答案:A二、判断题(10题)1.数据分析的过程通常包括明确分析目的、数据收集、数据预处理、数据分析和数据可视化等环节。(√)2.层次分析法中,一致性比率CR小于0.1时,一般认为判断矩阵具有满意的一致性。(√)3.多元线性回归模型只能包含一个解释变量,不能处理多个解释变量。(×)4.数据挖掘只能处理结构化数据,不能处理文本、图像等非结构化数据。(×)5.聚类分析通常不依赖预先给定的类别标签,属于探索性分析方法。(√)6.Apriori算法常用于关联规则挖掘,主要用于发现频繁项集和强关联规则。(√)7.异常分析中的离群点一定都是无意义噪声,应该全部删除。(×)8.YOLOv8属于单阶段目标检测模型,能够直接预测目标类别和边界框位置。(√)9.RNN适合处理时间序列数据,但传统RNN在长序列建模中可能出现梯度消失或梯度爆炸问题。(√)10.强化学习的核心思想是智能体通过与环境交互,根据奖励反馈不断调整策略。(√)ADDINCNKISM.UserStyle第5章习题单选:所谓加密是指将一个信息经过(A)及加密函数转换,变成无意义的密文,而接受方则将此密文经过解密函数、(A)还原成明文。加密钥匙、解密钥匙解密钥匙、解密钥匙加密钥匙、加密钥匙解密钥匙、加密钥匙对于零日漏洞正确的是(D)。零日漏洞又名零时差漏洞零日漏洞价格昂贵零日漏洞几乎是无敌的D.以上全部(A)是信息系统安全的第一道防线。A.计算机设备和环境安全B.计算机系统安全C.防火墙D.计算机软件安全在云攻击中,下列哪一项属于后面攻击?(C)A.黑客利用Web应用中的安全漏洞,盗取企业数据库中的信息B.竞争者利用CPUCovertChannel安全缺陷,盗取同一物理机上对方虚拟机的密钥C.不满者利用管理员权限,盗取客户信息黑客窃听属于(B)风险。A.信息储存安全B.信息传输安全C.信息接见安全D.以上都不正确下列哪种数据是系统间的共享数据,具有唯一性、有效性、稳定性和共享性?(B)A.元数据B.主数据7.为了避免冒名发送数据或发送数据后不承认的情况出现,可以采取的方法是(B)。A.数字水印B.数字签名C.访问控制D.发电子邮件确认黑盒测试是通过分析程序的(C)来设计测试用例的。应用范围内部逻辑功能输入数据2021年9月1日,我国开始施行(A)。《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》《中华人民共和国网络安全法》10.下列哪一项不属于区块链的隐私保护方案?(D)A.同态加密B.零知识证明C.环签名D.Sharding11.数据治理更强调数据(B)数据体量B.数据价值C.数据分享D.数据权属12.早期的数据质量不包括(BD)A.数据的正确性B.数据的一致性C.数据的时效性D.数据的关联性13.数据伦理的技术层面治理遵循的一般性原则不包括(D)A.风险最小必要原则B.数据最少必要原则C.算法设计的前瞻性道德嵌入D.数据的过渡采集判断:计算机系统一般可以看作是由软硬件基础设施、数据和信息以及人3个要素组成,因此,设计的安全防护通常应该包括物理安全、运行安全、数据安全、内容安全和管理安全。(√)数据共享服务是让不同大数据用户通过数据发布技术或数据交换技术对这些数据资源进行相关计算、分析和可视化等处理活动。(×)大数据时代要求架构云化,这对网络安全没有威胁。(×)随机化、阻塞和凝聚都是基于数据失真的隐私保护技术。(√)5.数据销毁方法和技术是指对存储在闪存、硬盘、磁带、光盘等介质中的数据进行删除的技术与机制、操作规程等。(×)6.个人信息的收集、使用者采用匿名化技术对个人信息进行处理之后,使其无法识别出特定个人且不能复原的,向他人提供这些匿名化的数据无须经过被收集者的同意。(√)7.信息隐藏技术所隐藏的是消息的存在形式,数据加密技术隐藏消息内容。(√)8.《网络安全法》只对网络安全产品提出了遵循网络安全标准的要求,不涉及通用网络产品。(×)9.公钥证书是不可以在网络上公开的,否则其他人可能冒充身份或假造数字签名。(×)10.白盒测试又称为功能测试或数据驱动测试,黑盒测试又称为结构测试或逻辑驱动测试。(×)11.数据治理和数据管理是同一含义。(×)12.数据伦理问题处理时,数据采集遵守最多必要原则。(×)13.算法作为伦理治理的技术手段,需要采纳全周期算法的道德化治理。(√)《大数据导论》第6章数据可视化题库一、单选题(10题)1.下列图表中,最适合展示时间序列变化趋势的是()A.饼图B.折线图C.雷达图D.树状图答案:B2.想要展示各业务占总体比例占比,应优先选用()A.柱状图B.散点图C.饼图D.箱线图答案:C3.以下不属于大数据可视化特点的是()A.海量数据处理B.动态交互展示C.静态单一展示D.多维度数据分析答案:C4.用来直观对比多组别、多类别数值高低差异的图表是()A.柱状图B.词云C.关系网络图D.地图答案:A5.通过颜色明暗反映区域数据热度分布的可视化方式是()A.折线图B.热力图C.饼图D.散点图答案:B6.下列属于地理空间数据可视化的是()A.词云图B.地图可视化C.雷达图D.流程图答案:B7.大数据可视化的核心目的不包括()A.简化复杂数据B.快速发现规律C.掩盖数据异常D.辅助决策分析答案:C8.展示词语出现频率高低的可视化图表是()A.散点图B.词云C.饼图D.直方图答案:B9.适合展示两个变量之间相关关系的图表是()A.散点图B.饼图C.柱状图D.折线图答案:A10.下列不属于常用大数据可视化工具的是()A.EChartsB.TableauC.WordD.PowerBI答案:C二、判断题(10题)1.数据可视化只能展示数值型数据,无法处理文本、图像类数据。(×)2.柱状图主要用于对比不同类别数据的大小差异。(√)3.折线图不适合用来展示数据随时间变化的趋势。(×)4.饼图适合表现各部分占整体的比例关系。(√)5.热力图是通过颜色深浅直观反映数据大小与分布密集程度。(√)6.大数据可视化不需要考虑数据量级,小数据与海量数据展示方式完全一致。(×)7.地图可视化可以直观呈现地理空间维度的数据分布特征。(√)8.词云可视化无法体现高频关键词出现频次高低。(×)9.可视化图表越复杂、元素越多,表达效果就越好。(×)10.交互式可视化支持缩放、筛选、钻取,更适合大数据分析场景。(√)《大数据导论》第7章社交媒体与大数据的融合
练习题一、单项选择题1.社交媒体的产生依赖以下哪项技术的发展?A.WEB1.0B.WEB2.0C.WEB3.0D.语义网2.社交媒体的特点表现为大批网民自发贡献、提取、创造新闻资讯并传播。构成社交媒体范畴必须具备的两个因素是?A.技术先进和资金充足B.人数众多和自发的传播C.平台知名和用户活跃D.内容丰富和更新频繁3.社交媒体大数据的主要特征分析是从以下哪三个方面进行的?A.用户、关系和内容B.文本、图像和视频C.技术、平台和应用D.数据、算法和算力4.关于社群结构的分类,下列说法正确的是?A.分为以用户个体为中心的社群结构和以话题为中心的社群结构B.分为开放型社群和封闭型社群C.分为临时性社群和永久性社群D.分为线上社群和线下社群5.从网络链接分析的角度看,用户关系强度计算方法不包括以下哪项?A.相似度计算B.边介数C.影响力图D.隐马尔科夫模型6.影响力最大化问题中,针对同时传播的多条相互影响的信息的研究属于?A.传统影响力最大化问题B.竞争性影响力最大化问题C.最低成本影响力最大化问题D.自适应影响力最大化问题7.文本特征抽取方法中,将文档转化为词序列(去除标点符号)的处理属于?A.句法分析B.语义分析C.形态分析D.情感分析8.词性标注(POS)属于文本特征抽取中的哪类分析方法?A.形态分析B.句法分析C.语义分析D.话题分析9.在文本特征选择中,最常见的是基于频率的技术,其典型代表是?A.隐马尔科夫模型(HMM)B.TF/IDF技术C.支持向量机(SVM)D.K-均值聚类10.话题检测与跟踪(TDT)包括哪两个主要任务?A.在线新事件检测和历史事件追溯B.文本分类和文本聚类C.关键词提取和摘要生成D.情感分析和意见挖掘11.情感分析也被称为?A.话题挖掘B.意见挖掘C.特征提取D.信息检索12.信息茧房的形成主要源于推荐算法对什么的单一优化?A.数据存储效率B.用户参与度C.内容多样性D.信息传播速度13.社交媒体导致的信息风险类型不包括以下哪项?A.用户位置信息泄露造成的信息风险B.社交媒体平台运营商引发的信息风险C.社交媒体侵犯个人隐私造成的信息风险D.硬件设备老化导致的数据丢失风险14.社交媒体信息风险治理方案中,社交媒体运营商在用户信息安全保护中的角色是?A.第二责任人B.第一责任人C.监督者D.无责任15.某电商企业希望利用社交媒体数据分析来优化KOL(关键意见领袖)投放策略。以下哪项技术方案最能帮助企业准确评估某个KOL的真实影响力,从而避免"粉丝数多但转化效果差"的问题?A.直接采用该KOL的粉丝总数作为影响力排序的唯一依据B.结合该KOL粉丝的关系网络结构(边介数/中心性)以及其发布内容与粉丝关注话题的语义相关性进行综合评估C.仅比较各KOL的历史发文数量,选择发文频率最高者D.选择粉丝群体中认证用户(黄V/蓝V)占比最高的KOL即可二、判断题(正确打√,错误打×)1.社交媒体的概念虽然开始于20世纪90年代末期,但其发展历史可以追溯到20世纪70年代产生的Usenet、ARPANET和BBS系统。()2.社交媒体最大的特点是赋予每个人创造并传播内容的能力。()3.社群内部用户关系强度弱、离散程度大,而社群之间用户关系强度强、聚合强度大。()4.影响力最大化问题的全局最优化已被证明是NP难问题。()5.文本预处理中去除停用词(如"the"、"a"、"or")主要是为了削减文档包含词的数量,提高文本处理的效率和效果。()6.语义网技术利用的是词语的明显关键字而非背景信息来理解句子含义。()7.以话题为中心的社群结构中,社群成员地位平等,分布均匀,这种结构随着话题的结束而消失。()8.情感分析面临的挑战之一是缺乏多维度的情感度量方法。()9.信息茧房只会局限个人视野,不会对社会层面产生影响。()10.社交媒体运营商通常在"使用条款"中列出的免责条款可以完全免除其法律责任。()11.通过社交媒体的位置信息分享,结合数据分析挖掘,可能得到用户的工作单位、家庭地址等敏感信息。()12.社交媒体平台的账号关联机制使得当一个平台的用户账户信息被盗取后,其他关联的社交媒体也面临信息泄露的风险。()13.用户只要设置了社交媒体平台的最高级隐私保护,运营商就无法获取用户的任何个人信息。()14.社交媒体中互惠关系是指两用户之间存在的相互的双向关注关系。()15.短视频平台上的视频主未经当事人同意拍摄并发布视频,不会构成侵权。()
参考答案一、单项选择题1.B2.B3.A4.A5.D6.B7.C8.B9.B10.A11.B12.B13.D14.B15.B二、判断题1.√2.√3.×4.√5.√6.×7.√8.√9.×10.×11.√12.√13.×14.√15.×第八章试题一、单项选择题1.随着技术的发展与进步,近年来智能手环逐渐普及。智能手环的开发与应用,体现了()的数据采集技术的应用。A.统计报表B.网络爬虫C.API接口D.生物传感器2.对于人的身体健康而言,健康大数据使用的关键是()。A.数据收集B.数据存储C.数据分析D.数据再利用3.健康大数据环境下的隐私担忧,主要表现为()。A.个人信息的被识别与暴露B.用户画像的生成C.恶意广告的推送D.病毒入侵4.患者就诊时,为防止医疗影像等文件信息泄露,医院常采用()方法进行处理。A.数据脱敏技术B.网络爬虫C.建立标准化数据模型D.扩大医疗系统权限5.可以使治疗效果最好,副作用最小的一种医疗模式是()。A.电子病历的应用B.远程会诊C.智能医疗D.精准医疗6.下列不属于基于云计算的电子病历档案系统的层面是()。A.接入层B.应用层C.资源层D.管理层7.下列属于基于云计算的电子病历档案系统的接口层的作用是()。A.包含各个医疗单位,是最主要的基础数据来源.B.负责对信息资源进行日常的管理与维护,包括对硬件设备的维护管理、数据资源的安全访问、运行环境的监测等.C.管理平台所有的数据资源,负责存储并备份所有病案信息、对数据资源进行分类挖掘。D.保障用户层次的安全认证和管理;提供使用云计算相关资源的对外接口。8.解决由医疗水平不均衡导致的治疗效率低下的问题的医疗方式是()。A.电子病历的应用B.精准医疗C.远程会诊D.智能医疗9.在下列选项中,哪些属于客观检验数据()。A.化验结果B.服药记录C.手术操作记录D.患者口述病情10.在下列选项中,哪项是健康大数据独有的特点()。A.时效性、多态性、隐私性B.数据容量大C.数据种类繁多D.真实性11.下列数据中,不属于公共卫生领域健康大数据的是()。A全国法定传染病发病统计数据B社区居民年度体检数据集C电商商品销售订单数据D医院电子病历汇总数据12.个人病历、基因测序数据在法律层面被划定为()。A普通公开信息B敏感个人信息C无关公共数据D可随意交易数据13.基因大数据属于健康大数据细分门类,其主要依托的算力载体是()。A分布式云集群/高性能超算B单机办公U盘C普通家用路由器D手机本地内存14.智慧公共卫生中,智能手环、体检仪采集实时健康数据属于大数据流程的()。A数据采集环节B数据销毁环节C数据打印环节D数据售卖环节15.整合区域多年人群体检、慢病随访、环境监测多源健康大数据开展空间关联建模,该分析成果最核心用于公共卫生哪项工作()。A医院门诊线上挂号系统开发B区域慢性病综合防控规划制定C医用耗材线上进销存统计D医疗机构内部办公流程优化二、判断题(正确打√,错误打×)1.谷歌流感趋势充分体现了数据重组和扩展对数据价值的重要意义。()2.大数据可以分析与挖掘之前人们不知道或者未注意到的模式,可以从海量数据中发展趋势,虽然也有不精准的时候,但并不能因此而否定大数据挖掘的价值。()3.基于云计算的电子病历共包括四个层面,分别为表现、语义处理层、数据处理层、数据存储层。()4.大数据时代,信息孤岛问题普遍存在。()5.电子病历是医院信息系统向医疗业务工作的延伸,是整个医院信息系统的组成部分。()6.通过增加访问控制层和可信第三方可以加强对电子病历的访问控制和隐私保护。()7.在建立的标准化数据模型中,表现层、语义处理层和数据处理层间的工作流程是单向的。()8.应用大数据技术时,可以通过扩大系统权限、实现跨系统调用信息来解决信息孤岛问题。()9.智能医疗的应用特征是:信息化、智能化、病患医生双向互动。()10.在新药研发流程中,大数据技术仅在新药发现阶段发挥作用。()11.居民电子病历、CT影像、基因序列都属于公共卫生健康大数据范畴。()12.健康大数据仅能用于医院看病,无法用于传染病疫情预警防控。()13.健康信息属于敏感个人信息,严禁未经授权泄露、交易。()14.处理基因、体检等健康大数据无需做加密、权限隔离等安全防护。()15.社区批量体检大数据可用于统计区域高血压、糖尿病患病分布规律。()16.《数据安全法》将健康医疗数据划入重要数据,要求全生命周期防护。()17.智能穿戴设备采集的心率、睡眠数据不属于健康大数据。()18.突发公共卫生事件中,健康大数据可辅助追踪病毒传播范围与风险人群。()19.医疗机构可以随意将患者健康数据提供给商业企业用于营销。()20.云存储集群能够承载PB级海量健康、基因大数据长期存储。()
第八章答案一、单项选择题DDAADBDCAACBAAB二、判断题×√×√√√×√√×√×√×√√×√×√第9章练习题一、单选:1、我国于碳减排方面采取更加有力的措施,计划于_年实现碳达峰,_年实现碳中和。AA、2030年,2060年B、2020年,2060年C、2030年,2055年D、2025年,2055年碳中和的关键是()C零碳排放量碳排放量最低碳排放与碳吸收相抵碳吸收量最高“碳中和”不是指()D碳源与碳汇平衡温室气体排放与被捕捉封存利用量平衡煤、石油、天然气发电被可再生能源发电替代二氧化碳与氮氧化物中和下列对于个人数据的描述,错误的是()B个人数据能够反应本人全部的信息个人数据是共享的个人数据都是独一无二的个人数据具有可识别性加快转变经济发展方式的着力点是()C建设科技开发型,环境创新型社会建设科技开发型,环境友好型社会建设资源节约型,环境友好型社会建设资源节约型,能源创新型社会下列关于碳减排的措施,不正确的是()C提高能源利用效率调整能源消费结构减少工业生产产业加强国际合作下列哪一项不是实现碳达峰、碳中和这一目标的措施?()D大力发展清洁能源和可再生能源绿色出行植树造林多使用化石燃料下列哪一项不属于个人节能减排行为?()A每年换季为追潮流都要买新衣服以公共交通工具代替私家车出行使用节能电器节约粮食物联网的基础和核心是()B有线通信网互联网无线通信网传感器网络如果每台空调在国家提倡的(
)
基础上调高1°C.每年可节电22千瓦时,相应减排二氧化碳21千克。如果全国1.5
亿台空调都采取这一措施,那么每年可节电约33亿千瓦时,减排二氧化碳317万吨。C
A.25°
B.24°
C.26°
D.27°二、判断:1、碳中和即我国的个人、团体、企业在一个时间段内排放的二氧化碳量,通过植树造林、节能减排等行为能够将排放的二氧化碳量抵消掉,达到碳排放相对为零的目标,其侧重点就在于“收支相抵”。()对2、碳达峰和碳中和是完全一样的事情。()错3、实现碳达峰、碳中和中长期目标,是我国贯彻新发展理念、推动高质量发展的必然要求。()对4、个人数据神圣不可侵犯。()对5、森林、草地等绿色植被在环境保护中起到吸收二氧化碳,产生二氧化硫的作用。()错6、物联网是网络与网络之间的连接。()错7、数据科学是以数学、统计学、信息技术等为基础,以大数据为研究对象的交叉性学科。()对8、人工智能本身的高能耗计算需求、大规模数据训练过程以及庞大的算力基础设施,也可能成为新的碳排放源。()对9、新能源包含风能、石油、太阳能、生物质能、核电能等。()错10、要实现碳中和,主要从两方面着手,一方面是碳减排,另一方面是碳吸收。()对《大数据导论》第10章大数据时代智能金融的挑战与机遇题库一、单选题(10题)1.金融大数据的核心价值主要体现在()A.只用于保存客户姓名和电话号码B.从海量金融数据中及时识别、获取有价值的信息C.完全替代金融监管D.只用于纸质档案管理答案:B2.第10章中提到,金融大数据可以概括为()A.行为数据流+想法数据流B.图像数据+音频数据C.静态数据+手工数据D.纸质数据+离线数据答案:A3.金融数据的第一数据平面主要是指()A.以大数据平台为核心的数据平面B.基于原有金融IT平台、以交易为中心的数据平面C.只包含社交媒体评论的数据平面D.只用于生成图片的数据平面答案:B4.下列不属于金融大数据在银行业应用方向的是()A.客户画像B.精准营销C.风险管控D.农作物病虫害识别答案:D5.银行利用大数据和人工智能识别异常交易、盗刷和反洗钱风险,属于()A.风险管控B.页面美化C.文字排版D.离线归档答案:A6.保险行业利用大数据分析客户职业、爱好、家庭结构和消费习惯,主要用于()A.客户细分及精细化营销B.删除历史保单C.统一所有客户费率D.停止产品优化答案:A7.证券行业将新闻、研报、公告和社交媒体文本纳入分析,主要是为了辅助()A.股价预测与市场情绪分析B.打印纸质账单C.减少所有交易数据D.替代交易所结算答案:A8.金融创新的四个维度不包括()A.深度B.广度C.厚度D.湿度答案:D9.大数据金融风险控制的一般流程包括()A.数据获取、数据分析、数据建模、风险控制产品应用B.截图、复制、粘贴、删除C.上色、排版、打印、装订D.注册、登录、退出、关机答案:A10.基于大语言模型的智能投研平台结合RAG技术,主要目的是()A.将生成内容与权威金融数据源结合,提高结果准确性与可溯源性B.让模型完全脱离金融数据源C.只生成娱乐内容D.取消用户提问功能答案:A二、判断题(10题)1.金融业本身就是高度数据化的行业,交易、报价、客户行为、风险控制等环节都会产生大量数据。(√)2.金融大数据只包括已经发生的历史数据,不包括现期数据和未来可能发生的行为数据。(×)3.大数据与人工智能结合后,可以推动金融业从“数据驱动”进一步迈向“智能驱动”。(√)4.银行开展客户画像时,只能使用客户姓名,不能结合消费能力、兴趣和风险偏好等信息。(×)5.精准营销可以依据客户实时位置、消费记录、生命周期状态等信息进行个性化推荐。(√)6.金融大数据在保险行业中可用于客户细分、欺诈行为分析和精细化运营。(√)7.证券行业的大数据应用完全不能使用新闻、公告、研报等文本信息。(×)8.大数据风险控制建模可以结合规则引擎、逻辑回归、XGBoost、深度神经网络等方法。(√)9.AIGC和大语言模型应用于金融投研时,不需要考虑数据真实性、可追溯性和合规风险。(×)10.智能投研平台可以通过研报摘要、观点提炼
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国医用内窥镜行业进口替代进程与供应链安全研究报告
- 2026中国新能源汽车电池回收行业政策环境与商业模式研究报告
- 2026全球互联网科技行业竞争态势与投资前景分析报告
- 2026中国远程教育服务行业市场现状服务质量评价及投资发展策略研究分析报告
- 2026中国物流园区规划布局及基础设施配套与区域经济协同发展报告
- 2026农业机械行业市场分析供需现状研究投资咨询服务发展规划报告
- 2026全球芯片制造光罩市场供需分析及投资评估布局规划研究报告
- 2026中国小米科技行业市场现状分析供需及投资评估规划发展研究报告
- 2026中国新能源汽车轻量化材料技术研究及市场发展趋势分析报告
- 2026Fast芯片组行业壁垒突破与增量空间预测分析
- 干燥综合征间质性肺炎
- 施工机械设备应急抢修保障措施
- Vensim中文学习手册
- 中国电信2024年燎原计划跨省联训(AI专业)考试含答案
- 人教精通版小学英语3-6年级单词词汇表
- 做最勇敢的自己
- 球囊面罩通气术讲解
- DAM全固态中波发射机
- 第八章排泄护理排尿护理学基础讲解
- 企业法务培训课件
- 2024年《315消费者权益保护法》知识竞赛题库及答案
评论
0/150
提交评论