上海市2025上海复旦大学发展研究院招聘商业分析研究助理1名笔试历年参考题库典型考点附带答案详解_第1页
上海市2025上海复旦大学发展研究院招聘商业分析研究助理1名笔试历年参考题库典型考点附带答案详解_第2页
上海市2025上海复旦大学发展研究院招聘商业分析研究助理1名笔试历年参考题库典型考点附带答案详解_第3页
上海市2025上海复旦大学发展研究院招聘商业分析研究助理1名笔试历年参考题库典型考点附带答案详解_第4页
上海市2025上海复旦大学发展研究院招聘商业分析研究助理1名笔试历年参考题库典型考点附带答案详解_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

[上海市]2025上海复旦大学发展研究院招聘商业分析研究助理1名笔试历年参考题库典型考点附带答案详解一、选择题从给出的选项中选择正确答案(共50题)1、在商业数据分析中,以下哪种指标最能反映用户粘性与留存情况?

A.日活跃用户数(DAU)

B.用户获取成本(CAC)

C.月留存率

D.客单价2、若线性回归模型的决定系数(R²)接近1,说明什么?

A.模型完全无法解释因变量的变化

B.自变量对因变量的解释能力极强

C.数据存在严重的多重共线性

D.模型过拟合严重3、在A/B测试中,P值小于0.05通常意味着什么?

A.原假设成立,两组无显著差异

B.备择假设成立,两组存在显著差异

C.实验样本量不足

D.测试时间过短4、以下哪种图表最适合展示部分与整体的比例关系?

A.散点图

B.折线图

C.饼图

D.箱线图5、在SQL查询中,用于连接两个表并返回所有匹配行的关键字是?

A.LEFTJOIN

B.INNERJOIN

C.RIGHTJOIN

D.FULLJOIN6、在商业分析中,用于描述数据分布离散程度的统计指标是?A.均值B.中位数C.众数D.标准差7、以下哪种图表最适合展示部分与整体之间的比例关系?A.折线图B.柱状图C.饼图D.散点图8、在SQL查询中,用于从数据库表中提取特定列数据的命令是?A.INSERTB.SELECTC.UPDATED.DELETE9、A/B测试中,P值小于0.05通常意味着什么?A.原假设成立B.差异不显著C.有统计显著性D.样本量不足10、下列哪项属于非结构化数据?A.Excel表格B.数据库记录C.社交媒体评论文本D.传感器数值11、在商业数据分析中,以下哪种方法最常用于处理缺失值,且假设缺失是完全随机缺失(MCAR)?

A.均值插补

B.多重插补

C.删除缺失记录

D.回归插补12、下列哪项指标最能反映一家公司短期偿债能力?

A.资产负债率

B.流动比率

C.净资产收益率

D.存货周转率13、在构建线性回归模型时,如果发现残差存在异方差性,最可能的后果是?

A.参数估计无偏但无效

B.参数估计有偏且不一致

C.假设检验失效,置信区间不准确

D.模型完全无法拟合14、下列哪种聚类算法不需要预先指定聚类中心?

A.K-Means

B.层次聚类

C.K近邻

D.支持向量机15、在时间序列分析中,若数据呈现明显的季节性波动,最适合使用的预处理方法是?

A.差分

B.对数变换

C.季节调整

D.标准化16、在商业数据分析中,若某变量呈现偏态分布,以下哪种统计量最能代表其集中趋势?

A.平均数

B.中位数

C.众数

D.标准差17、以下哪项不属于商业分析中常用的“5W1H”提问法要素?

A.Why(为什么)

B.Who(谁)

C.Where(哪里)

D.Which(哪一个)18、在SQL查询中,用于从多个表中基于相关列连接数据的关键字是?

A.JOIN

B.SELECT

C.WHERE

D.GROUPBY19、以下哪种图表最适合展示部分与整体的比例关系?

A.折线图

B.柱状图

C.饼图

D.散点图20、在A/B测试中,P值小于0.05通常意味着?

A.结果不显著

B.结果显著,拒绝原假设

C.样本量不足

D.实验设计错误21、在商业分析中,用于描述数据分布离散程度的常用统计量是?A.均值B.中位数C.标准差D.众数22、以下哪种数据可视化图表最适合展示部分与整体之间的比例关系?A.折线图B.饼图C.散点图D.直方图23、在SQL查询中,用于从数据库表中提取特定列数据的关键字是?A.SELECTB.INSERTC.UPDATED.DELETE24、下列哪项属于非结构化数据?A.Excel表格B.关系型数据库C.文本文件D.CSV文件25、在A/B测试中,P值小于0.05通常意味着什么?A.原假设成立B.备择假设成立C.实验无效D.样本量不足26、在商业分析中,描述性分析(DescriptiveAnalytics)主要回答的核心问题是?A.未来会发生什么?B.为什么事情会发生?C.过去发生了什么?D.我们应该采取什么行动?27、以下哪项指标最能反映一家公司的短期偿债能力?A.资产负债率B.流动比率C.净资产收益率D.总资产周转率28、在SQL查询中,若要查找“销售额大于1000且小于5000”的所有记录,应使用的逻辑运算符组合是?A.ORB.ANDC.NOTD.UNION29、以下哪种数据结构最适合实现“先进先出”(FIFO)的业务逻辑?A.栈(Stack)B.队列(Queue)C.链表(LinkedList)D.树(Tree)30、在A/B测试中,P值(P-value)小于0.05通常意味着什么?A.实验组结果完全由随机误差导致B.零假设成立的可能性很大C.有统计学显著性差异,拒绝零假设D.样本量不足,无法得出结论31、在商业数据分析中,若某指标的标准差显著增大,但均值保持不变,这通常意味着什么?A.数据分布更加集中B.数据的离散程度增加C.数据的偏度增加D.数据的峰度降低32、在进行回归分析时,判定系数(R²)越接近1,表示什么?A.模型拟合效果越差B.自变量对因变量的解释能力越强C.残差平方和越大D.模型复杂度越高33、以下哪种抽样方法属于概率抽样?A.方便抽样B.雪球抽样C.简单随机抽样D.判断抽样34、在假设检验中,P值小于显著性水平α(如0.05)时,我们应如何处理原假设?A.接受原假设B.拒绝原假设C.无法判断D.修改显著性水平35、下列哪项指标最能反映一组数据的集中趋势且不受极端值影响?A.均值B.众数C.中位数D.标准差36、在商业分析中,描述性分析(DescriptiveAnalytics)主要解决的核心问题是?A.未来会发生什么?B.为什么会发生?C.过去发生了什么?D.我们应该做什么?37、以下哪种数据类型属于非结构化数据?A.Excel表格中的销售记录B.数据库中的客户IDC.社交媒体上的用户评论文本D.传感器采集的温度数值38、在假设检验中,P值(P-value)的含义是?A.原假设为真的概率B.备择假设为真的概率C.在原假设为真的前提下,观察到当前样本结果或更极端结果的概率D.样本误差的大小39、下列哪项指标最能反映客户对企业的忠诚度及长期价值?A.客户获取成本(CAC)B.客户终身价值(CLV)C.转化率(ConversionRate)D.跳出率(BounceRate)40、在数据可视化中,若要展示各部分占整体的比例关系,最适合使用的图表是?A.折线图B.散点图C.饼图D.直方图41、在商业分析中,用于衡量一组数据离散程度(即数据波动大小)的最常用统计指标是?A.均值B.中位数C.标准差D.众数42、假设某电商平台发现用户购买行为呈现“啤酒与尿布”的高相关性,这主要应用了哪种数据挖掘技术?A.聚类分析B.关联规则挖掘C.分类算法D.回归分析43、在构建线性回归模型时,若发现自变量之间存在高度线性相关,导致系数估计不稳定且标准误增大,这种现象称为?A.多重共线性B.异方差性C.自相关D.内生性44、下列哪种图表最适合用于展示两个连续变量之间的相关关系及分布形态?A.柱状图B.散点图C.饼图D.直方图45、在假设检验中,若原假设H0为真,但样本统计量落入了拒绝域,从而拒绝了H0,这种错误被称为?A.第一类错误B.第二类错误C.显著性水平D.统计功效46、在商业数据分析中,若需衡量一组数据离散程度的相对指标,以消除量纲影响,最适宜使用的统计量是?A.方差B.标准差C.变异系数D.极差47、在构建线性回归模型时,若发现自变量之间存在高度相关性,导致参数估计不稳定且标准误增大,这种现象称为?A.异方差性B.多重共线性C.自相关性D.非线性关系48、在SQL数据库中,用于从多个表中基于相关列提取数据的操作是?A.UnionB.JoinC.GroupByD.OrderBy49、在A/B测试中,若P值小于0.05,通常意味着?A.原假设成立B.备择假设成立,差异具有统计学显著性C.实验设计存在严重错误D.样本量不足50、下列哪种图表最适合展示部分与整体之间的比例关系?A.折线图B.柱状图C.饼图D.散点图

参考答案及解析1.【参考答案】C【解析】留存率衡量的是经过一定时间后,最初获取的用户中仍在使用产品或服务的比例,直接反映用户粘性和产品价值。DAU仅反映当日活跃规模,不体现长期粘性;CAC是获客成本,属于效率指标;客单价反映交易金额,侧重营收而非留存。因此,月留存率是评估用户留存与粘性的核心指标。2.【参考答案】B【解析】决定系数R²表示模型解释的变异占总变异的比例,取值范围[0,1]。R²接近1意味着自变量能极好地解释因变量的变化,模型拟合效果优异。A项描述相反;C项多重共线性影响系数稳定性,不直接由R²判断;D项过拟合需通过验证集误差判断,高R²在训练集上可能伴随过拟合,但本身含义是解释能力强。3.【参考答案】B【解析】P值是在原假设(H0)为真的前提下,观察到当前或更极端结果的概率。P<0.05表示在原假设成立时出现当前结果的概率极低,因此拒绝原假设,认为两组存在统计学上的显著差异。A项错误;C、D项是实验设计问题,不直接由P值决定。4.【参考答案】C【解析】饼图通过扇形面积直观展示各部分占总体的百分比,适合展示构成比例。散点图用于展示两个变量的相关性;折线图用于展示数据随时间变化的趋势;箱线图用于展示数据分布、中位数及异常值。因此,展示部分与整体关系首选饼图。5.【参考答案】B【解析】INNERJOIN返回两表中连接字段相匹配的行,即交集。LEFTJOIN返回左表所有行及右表匹配行;RIGHTJOIN返回右表所有行及左表匹配行;FULLJOIN返回两表所有行。题目要求“仅返回所有匹配行”,故为INNERJOIN。6.【参考答案】D【解析】均值、中位数和众数均为描述数据集中趋势的指标,反映数据的中心位置。标准差则是衡量数据离散程度的核心指标,它表示数据偏离均值的平均幅度。标准差越大,数据分布越分散;标准差越小,数据越集中在均值附近。在商业数据分析中,理解离散程度对于评估风险、稳定性及数据质量至关重要,因此标准差是本题正确答案。7.【参考答案】C【解析】折线图主要用于展示数据随时间变化的趋势;柱状图适用于比较不同类别的数据大小;散点图用于观察两个变量之间的相关性。饼图通过扇形面积的大小,直观地展示各部分占总体的百分比,专门用于表现部分与整体的构成关系。因此,在需要分析市场份额、预算分配等占比场景时,饼图是最佳选择。8.【参考答案】B【解析】SQL中,INSERT用于插入新数据,UPDATE用于修改现有数据,DELETE用于删除数据,它们都属于数据操作语言(DML)。SELECT命令则是数据查询语言(DQL)的核心,专门用于从表中检索数据。用户可通过指定列名来提取特定列,或使用*提取所有列。掌握SELECT语句是进行基础数据分析的前提。9.【参考答案】C【解析】P值用于衡量在原假设成立的前提下,观察到当前样本结果或更极端结果的概率。通常设定显著性水平为0.05,若P值小于0.05,说明在原假设成立的情况下,出现当前结果的概率极低,从而拒绝原假设,认为两组数据之间存在统计显著性差异。这是商业实验设计中判断策略有效性的关键统计依据。10.【参考答案】C【解析】结构化数据具有固定的格式和字段,如Excel表格、数据库记录及传感器数值,易于计算机处理。非结构化数据则没有预定义的数据模型,如社交媒体评论文本、图片、视频和音频等。随着大数据发展,处理非结构化数据成为商业分析的重要挑战,需要借助自然语言处理等技术进行挖掘。11.【参考答案】A【解析】均值插补是将缺失值替换为该变量的均值,计算简单,但会低估方差,通常适用于MCAR情况。多重插补(B)更复杂,能更好地保留数据变异性;删除记录(C)在缺失比例高时会导致样本偏差;回归插补(D)利用其他变量预测缺失值,适用于非完全随机缺失情况。对于基础MCAR场景,均值插补是常见且直接的初步处理方式,尽管其局限性明显,但在特定简化模型中仍被提及。本题考察对缺失值处理基本假设的理解。12.【参考答案】B【解析】流动比率是流动资产与流动负债的比值,直接衡量企业用流动资产偿还短期债务的能力,是核心短期偿债指标。资产负债率(A)反映长期偿债能力和资本结构;净资产收益率(C)衡量股东权益的收益水平,属盈利能力指标;存货周转率(D)反映营运效率,属运营能力指标。因此,评估短期偿债能力时,流动比率是最直接且科学的依据。13.【参考答案】C【解析】异方差性指误差项的方差随观测值变化。它不会导致参数估计有偏(OLS估计量仍无偏),但会导致标准误估计偏差,从而使t检验和F检验失效,置信区间不再可靠。选项A描述不准确,因为虽然无偏,但效率降低,且主要后果是推断错误;选项B错误,OLS在无偏性上不受影响;选项D错误,模型仍可拟合,只是推断不可靠。因此,C是异方差最直接且严重的后果。14.【参考答案】B【解析】K-Means(A)需要预先指定K值和初始中心;层次聚类(B)通过合并或分裂构建聚类树,无需预设中心数;K近邻(C)是分类算法而非聚类;支持向量机(D)是监督学习的分类/回归算法。因此,只有层次聚类在不预设中心的情况下即可执行聚类过程,适合探索性数据分析。15.【参考答案】C【解析】季节性调整旨在消除数据中的季节性成分,以便观察趋势和循环波动,是处理季节性波动的直接方法。差分(A)主要用于消除趋势或非平稳性;对数变换(B)用于稳定方差;标准化(D)用于量纲统一。针对“明显季节性波动”,季节调整(如X-12-ARIMA)是专门设计的技术,能有效分离季节效应,为后续建模提供平稳数据。16.【参考答案】B【解析】平均数易受极端值影响,在偏态分布中不能准确反映数据中心位置。中位数将数据从小到大排列后位于中间的值,对异常值不敏感,因此在偏态分布下更能代表数据的集中趋势。众数仅反映出现频率最高的值,标准差衡量离散程度而非集中趋势。故选B。17.【参考答案】D【解析】5W1H分析法包括:Why(原因)、What(对象)、Where(地点)、When(时间)、Who(人员)、How(方法)。Which不属于标准5W1H框架,通常用于选择性问题,而非基础分析维度。故选D。18.【参考答案】A【解析】JOIN用于根据两个或多个表之间的相关列组合行数据。SELECT用于选择列,WHERE用于过滤记录,GROUPBY用于分组。只有JOIN实现多表关联。故选A。19.【参考答案】C【解析】饼图通过扇形面积直观展示各部分占总体的百分比,适用于比例关系。折线图展示趋势,柱状图比较类别数值,散点图展示变量间相关性。故选C。20.【参考答案】B【解析】P值衡量在原假设成立时观察到当前结果或更极端结果的概率。P<0.05表示小概率事件发生,有足够证据拒绝原假设,认为差异具有统计显著性。故选B。21.【参考答案】C【解析】均值、中位数和众数均为集中趋势度量指标,反映数据的中心位置。标准差则是衡量数据离散程度的核心指标,它计算各数据点与均值之差的平方平均数的平方根。标准差越大,表明数据分布越分散;反之则越集中。在商业分析中,理解数据的波动性对于风险评估和市场预测至关重要,因此标准差是衡量离散程度的正确选择。22.【参考答案】B【解析】饼图通过扇形面积的大小直观展示各部分占总体的百分比,特别适合表现结构性比例。折线图主要用于展示数据随时间变化的趋势;散点图用于分析两个变量之间的相关性;直方图则用于展示连续数据的频率分布。因此,在需要强调“部分与整体”关系时,饼图是最恰当的工具。23.【参考答案】A【解析】SQL中,SELECT语句用于从表中检索数据,可指定具体列或所有列(*)。INSERT用于插入新记录,UPDATE用于修改现有记录,DELETE用于删除记录。因此,执行数据提取操作的核心关键字为SELECT,这是数据查询语言(DQL)的基础功能。24.【参考答案】C【解析】结构化数据具有固定格式和字段,如Excel、关系型数据库和CSV文件。非结构化数据指没有预定义数据模型的数据,如文本、图像、音频和视频等。文本文件内容灵活,无固定表结构,属于典型的非结构化数据,需通过NLP等技术进行处理和分析。25.【参考答案】B【解析】P值衡量在原假设为真的情况下,观察到当前样本结果或更极端结果的概率。若P值小于显著性水平(如0.05),则有充分证据拒绝原假设,接受备择假设,表明差异具有统计显著性。这通常意味着实验组与对照组之间存在真实差异,而非随机波动导致。26.【参考答案】C【解析】商业分析通常分为四个层级。描述性分析侧重于对历史数据的整理和总结,旨在回答“过去发生了什么”,如销售额趋势、用户留存率等。预测性分析(Predictive)关注“未来会发生什么”,利用统计模型和机器学习算法进行预测。规范性分析(Prescriptive)则回答“我们应该采取什么行动”,提供优化建议。诊断性分析(Diagnostic)负责回答“为什么事情会发生”,挖掘数据背后的原因。因此,描述性分析对应的是对过去事实的回顾与总结,选项C正确。27.【参考答案】B【解析】评估企业财务健康需关注不同维度的指标。流动比率是流动资产与流动负债的比值,直接衡量企业用短期资产偿还短期债务的能力,是典型的短期偿债能力指标。资产负债率反映长期偿债能力及资本结构;净资产收益率(ROE)衡量股东权益的收益水平,属于盈利能力指标;总资产周转率反映资产的使用效率,属于营运能力指标。因此,若要评估短期偿债风险,流动比率是最直接且科学的参考依据,选项B正确。28.【参考答案】B【解析】SQL中的逻辑运算符用于组合多个条件。AND表示“与”,要求所有条件同时满足;OR表示“或”,只要满足任一条件即可;NOT表示“非”,用于排除特定条件。题目要求记录必须同时满足“大于1000”和“小于5000”两个条件,属于交集关系,因此必须使用AND运算符。例如:WHEREsales>1000ANDsales<5000。UNION用于合并两个查询结果集,不属于逻辑判断运算符。故选项B正确。29.【参考答案】B【解析】数据结构的选择取决于业务场景的需求。栈遵循“后进先出”(LIFO)原则,类似于叠盘子;队列遵循“先进先出”(FIFO)原则,类似于排队买票,新元素从队尾进入,旧元素从队头移除,完美契合订单处理、任务调度等需要按时间顺序处理的场景。链表和树是更通用的存储结构,虽然可以实现队列或栈的功能,但它们本身并不直接定义FIFO逻辑。因此,专门用于实现FIO逻辑的标准数据结构是队列,选项B正确。30.【参考答案】C【解析】P值是假设检验中的关键指标,表示在零假设(即两组无差异)成立的前提下,观察到当前或更极端结果的概率。当P值小于预设的显著性水平(通常为0.05)时,说明在零假设成立的情况下,出现当前结果的可能性极低,属于小概率事件。因此,我们拒绝零假设,认为实验组与对照组之间存在统计学上的显著差异,这种差异不太可能仅由随机波动引起。选项A和B描述的是P值较大的情况,选项D与P值大小无直接逻辑关系,故选项C正确。31.【参考答案】B【解析】标准差是衡量数据离散程度的核心指标。标准差越大,说明数据点偏离均值的程度越高,即数据分布越分散。均值不变仅表示中心位置未移动,不影响对离散度的判断。因此,标准差显著增大直接对应数据离散程度的增加。选项A描述相反;选项C和D分别涉及分布的不对称性和尖锐程度,虽可能伴随变化,但不是标准差变化的直接定义。此题考查描述统计学基本概念,需准确理解变异程度的度量方式。32.【参考答案】B【解析】判定系数R²用于衡量回归模型对观测数据的拟合程度,其取值范围为0到1。R²越接近1,说明模型解释的变异占总变异的比例越高,即自变量对因变量的解释能力越强,拟合效果越好。此时残差平方和应越小。选项A错误;选项C与R²高时情况相反;选项D混淆了拟合优度与模型复杂度,高R²不一定意味着高复杂度,也可能源于强线性关系。33.【参考答案】C【解析】概率抽样要求总体中每个个体都有已知且非零的概率被选中,主要包括简单随机抽样、分层抽样、系统抽样和整群抽样。简单随机抽样完全符合这一定义。选项A、B、D均属于非概率抽样,其选择依赖于研究者的主观判断或便利性,无法保证样本的代表性和统计推断的有效性。在商业研究中,为确保结论可推广至总体,通常优先选用概率抽样方法。34.【参考答案】B【解析】P值是在原假设为真的前提下,观察到当前样本统计量或更极端情况的概率。当P值小于预设的显著性水平α时,表明在原假设成立的情况下,观察到当前数据是小概率事件,从而有充分证据反对原假设,因此应拒绝原假设。接受原假设是错误的表述,统计推断中只能“拒绝”或“不拒绝”。此原则是统计决策的基础,确保控制第一类错误的概率。35.【参考答案】C【解析】集中趋势指标包括均值、中位数和众数。均值易受极端值影响;众数可能不唯一或无意义;标准差反映离散程度而非集中趋势。中位数是将数据排序后位于中间位置的数值,其计算仅依赖位置,对极大或极小值不敏感,因此在数据存在偏态或异常值时,中位数比均值更能稳健地代表数据的中心位置。36.【参考答案】C【解析】商业分析通常分为四个层级。描述性分析关注历史数据,旨在总结“过去发生了什么”,如销售额、用户增长等指标。预测性分析(A)利用统计模型预测未来趋势;诊断性分析(B)探究数据背后的原因,即“为什么发生”;规范性分析(D)则基于预测和建议采取行动,回答“我们应该做什么”。因此,描述性分析的核心在于对历史数据的汇总与呈现,帮助管理者了解现状。掌握这一基础概念是进行更高级数据分析的前提。37.【参考答案】C【解析】结构化数据具有固定格式和字段,如关系型数据库中的表格(A、B)或数值型传感器数据(D)。非结构化数据没有预定义的数据模型,难以用二维表形式展示,主要包括文本、图像、音频和视频等。社交媒体上的用户评论(C)属于自由文本,包含大量语义信息,但格式不固定,是典型的非结构化数据。商业分析中处理此类数据需借助自然语言处理(NLP)等技术进行清洗和特征提取。38.【参考答案】C【解析】P值是假设检验中的关键统计量。它表示在原假设(H0)成立的情况下,获得当前观测数据或更极端数据的概率。P值越小,说明在原假设成立时出现当前结果的可能性越低,从而越有理由拒绝原假设。通常设定显著性水平(如0.05),若P值小于该水平,则拒绝原假设。需要注意的是,P值并不直接代表原假设或备择假设为真的概率(A、B错误),也不直接等同于样本误差大小(D错误)。39.【参考答案】B【解析】客户终身价值(CLV)预测了客户在整个关系周期内为企业带来的净利润总和,是衡量客户忠诚度和长期价值的核心指标。客户获取成本(CAC)衡量获取新客户的费用;转化率反映潜在用户转化为实际用户的比例;跳出率反映用户访问页面后未互动即离开的比例。虽然CAC、转化率和跳出率对优化营销至关重要,但只有CLV直接关联客户的长期贡献和留存质量,是评估客户资产的关键。40.【参考答案】C【解析】饼图(PieChart)通过将圆形分割成扇形区域,直观地展示各部分占总体的百分比,非常适合表现构成比例。折线图(A)主要用于展示数据随时间变化的趋势;散点图(B)用于分析两个变量之间的相关性或分布模式;直方图(D)用于展示连续数据的频率分布。因此,当目标是强调“部分与整体”的关系时,饼图是最恰当的选择,有助于受众快速理解结构构成。41.【参考答案】C【解析】均值、中位数和众数均属于集中趋势的度量,用于描述数据的中心位置。标准差则是衡量离散程度的核心指标,它反映了数据点相对于均值的平均偏离程度。标准差越大,表明数据分布越分散;标准差越小,表明数据越集中在均值附近。在商业数据分析中,评估风险、稳定性及数据一致性时,标准差是最具代表性的离散程度指标。42.【参考答案】B【解析】“啤酒与尿布”是经典的关联规则挖掘案例。该技术旨在从大量交易数据中发现项集之间的有趣联系或共现关系。聚类分析是将相似对象分组;分类算法是根据已知标签预测新数据类别;回归分析是研究变量间依赖关系以进行预测。只有关联规则挖掘(如Apriori算法)专门用于发现类似“A购买则B也常购买”的强关联模式,常用于推荐系统和市场篮子分析。43.【参考答案】A【解析】多重共线性是指线性回归模型中的解释变量之间存在精确相关或高度相关关系。它会导致最小二乘估计量方差变大,使得系数估计值不稳定,难以解释单个变量对因变量的独立影响。异方差性指误差项方差随自变量变化;自相关指误差项之间存在相关性(常见于时间序列);内生性指解释变量与误差项相关,导致估计有偏。题干描述的特征完全符合多重共线性的定义。44.【参考答案】B【解析】散点图通过在二维坐标系中绘制点的分布,直观展示两个连续变量之间的相关关系(正相关、负相关或无相关)及非线性趋势。柱状图主要用于比

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论