版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
数据挖掘基础与案例习题参考答案
第1章绪论
习题1:
统计方法与数据挖掘方法之间的关系如下:
(1)同源性与基础支撑
①数据挖掘中大量使用了经典统计方法。例如,聚类分析的思想源于统计中的聚类
分析;分类算法(如朴素贝叶斯、线性判别分析)直接基于统计概率理论;回归分
析是预测模型的基础;假设检验用于评估模型或模式的有效性②统计学为数据挖掘
提供了坚实的数学理论基础。没有统计学,数据挖掘就如同无源之水。
(2)目标重叠两者的终极目标是一致的,均是从数据中发现有价值的信息、模
式或知识,以支持决策和预测。
(3)相互促进与融合数据挖掘面临的大规模、高维度数据挑战,也推动了统计
学在新领域的发展,例如高维统计学。
现代数据分析中,纯粹的“统计”或“数据挖掘”项目越来越少,更多的是两者的
混合。
尽管统计方法与数据挖掘方法同源,但在处理实际数据分析问题时,二者是有差异
的,表1.1描述了统计方法与数据挖掘的不同之处。
表1.1统计方法与数据挖掘的不同之处
比较的方面统计方法数据挖掘方法
内在逻辑假设驱动:先有理论或假设,然后使数据驱动:事先无明确假设,让数据
用数据验证或拒绝这个假设,即问题先自己“说话”,通过算法自动地、迭代
行地探索可能存在的所有模式和关系,即
让数据发现问题
主要目标推断与解释:关注理解变量之间的关预测与发现:关注构建具有商预测精
系和因果关系,模型的可解释性至关重度的模型,或发现未知的、有用的模式
要,即关注“为什么?”,验证已知(如关联规则)。“是什
么?”和“接下来会怎样?”探索
未知
数据规模与中小规模,结构化:传统上处理经过海量数据,多种类型:专为处理海量
精心设计的、相对干净的结构化数据(如•TB/PB级)、高维、有噪声的数据而
类型调查数据、实验数据)生,包括非结构化数据(文本、图像、
日志等)
模型构建方“简约”原则:崇尚简约模型(如奥“有效”原则:倾向于使用复杂模型
卡姆剃刀原则),倾向于用尽可能少的〔如集成学习、深度学习),只要它能
法变量来解释现象,避免过拟合提供更高的预测准确率。接受“黑盒”
模型,只要它有效
对先验知识高:建模需要丰富的领域知识来构建相对较低:更自动化,可以在领域知
假设和选择模型识较少的情况下开始探索,发现知识后
的要求再由专家解释
验证方式统计显著性检验:依赖P值、置信区交叉验证/Hold-out验证:通常将数
间等来判断结果是否由随机偶然造成据分为训练集、验证集和测试集,使用
交叉验证和准确率、召回率、AUC等指标
来评估模型性能。
习题2:
(1)分类与回归的区别和相似之处分类和回归是有监督学习最重要的两个分支。
它们的共同点是模型都是从已标注的数据(有标签数据)中学习,即每个训练栏本目标
表量的值是已知的。
表1.2描述了分类与回归的核心区别。
表L2分类与回归的核心区别
特性分类回归
预测目标离散的类别标签或类别连续的数值
输出形式有限的、固定的几个类别任意数值(在一定范围内)
本质问题“这是什么?”“有多少?”
评估指标准确率、精确率、召回率、F1均方误差(MSE)、平均绝对
度量、AUC等误差(MAE)、R平方等
常用算法逻辑回归、决策树、随机森线性回归、多项式回归、决策
林、SVM、KNN树(回归)、随机森林(回归)
(2)分类与聚类的区别和相似之处分类和聚类都涉及“区分类别”,但这是两
个截然不同的概念,最核心的区别是分类是有监督学习,即训练样本带有标签,而聚类
是无监督学习,即训练样本没有标签。表1.3描述了分类与聚类的核心区别。
表1.3分类与聚类的核心区别
特性分类聚类
学习类型有监督学习无监督学习
训练样本有标签。数据已知类别和结无标签。数据只有特征,没有
果已知结果
核心任务从标笠中学习,构建一个模探索数据内在结构,自动将
型,用丁预测新数据的类别相似的数据点分组到一起
过程特点是一个“预测”的过程是一个“探索”的过程
算法示例逻辑回归、决策树、随机森K-MeanssDBSCAN、层次聚类
林、SVM、KNN等等
二者尽管本质不同,但在某些层面有相似之处。
1)目标都是“分组”。无论是分类还是聚类,最终的目的都是将数据划分到不同
的组别中。
2)依赖特征相似性。两者都基于数据点的特征进行计算,都假设同一组内的数据
点彼此之间更相似,而不同组的数据点则不那么相似。
3)互为补充:在实践中,聚类和分类可以结合使用。比如,先用聚类探索数据,
发现潜在的分组,并由专业人员为这些分组命名(赋予标签),然后用这些新标注的数
据训练一个分类模型,来预测新数据的类别。
习题3:
(1)分类:预测客户流失,实现精准挽留客户流失是电信行业最大的痛点之一。
提前识别出有高流失风险的客户,并采取有效的干预措施。对相关历史数据,使用分类
算法进行训练,学习“流失客户”和“未流失客户”的行为模式差异。模型对当前活跃
用户流失的可能性进行预测,输出每个用户的“流失概率得分”,并列出导致其可能流
失的最重要因素。对高流失风险客户群体,不再进行无差别的优惠,而是提供个性化的
挽留方案。例如,对因流量不够而可能流失的用户,推送定向的“流量加油包”优惠;
对因网络质量投诉的用户,优先安排技术人员上门检测。并将有限的客服和营销资源优
先投入到最需要关注的客户身上,提升挽留成功率和投入产出比。
(2)聚类:发现客户细分,指导产品与营销电信公司的客户群体庞大而复杂,
一刀切的套餐和营销策略效率低下。如何深入了解不同客户群体的自然特征,从而实现
精细化运营是电信公司持续关注的问题。
对包含客户的消费行为特征如额度(ARPU)、通话模式、流量使用时间(夜间/白
天)、APP使用偏好(是否经常使用视频类APP)等构成的数据集,采用hMcans、DBSCAN
等聚类算法,在没有预设标签的情况下,按行为模式相似的客户自动分群。假设算法发
现的典型客户群有4个:高价值商务群,具有高ARPU、高频国际通话、大量商务APP使
用等特点;年轻流量群,具有中等ARPU、夜间流量消耗大、频繁使用社交媒体和视频应
用等特点;节俭长者群:低ARPU、很少使用流量、通话对象固定等特点;潜在价值群:
使用中等流量,但主要用的是竞争对手的OTT服务(如微信、Q语音)。
决策支持可以是:为“高价值商务群”中的客户推出高品质国际漫游包;为“年轻
流量群”群中的客户设计包含大量夜间低价流量的专属套餐;向“节俭长者群”中的客
户推广适合他们的亲情网套餐;以优质的服务。引导“潜在价值群”使用本公司的同类
或相似业务。
(3)关联规则挖掘:实现交叉销售与产品捆绑当客户购买一种产品或服务时,
还能向他成功推荐什么产品?如何设计最受欢迎的产品捆绑包来提升销售额呢?关联
规则挖掘可发现数据集中项之间的有趣联系,即关联规则,而关联规则的有效性可用支
持度、置信度、提升度等评估。
对客户订单、业务办理记录等数据,使用Apriori或FP-Growth算法从中提取强关
联规则。假设有一个强关联规则是{国际漫游服务}一{移动WiFi租赁}(置信度80%),
意思是订购了国际漫游服务的客户,有80%的概率也会租赁移动WiFi。
决策支持:将强关联的产品打包销售:在客户办理业务的流程中(如在线营业厅、
客服电话),根据其当前选择,智能推荐下一个最可能购买的产品;货架规划:虽然适
用于零售业,但其思想也可用于规划电子营业厅的产品展示。
(4)异常检测:欺诈检测与网络运维如何实时发现可疑的欺诈行为?如何在海
量网络设备指标中快速定位故障点?是电信公司必须解决的问题。异常检测方法与技术
能够识别与绝大多数数据模式显著不同的罕见事件、异常点或异常群体。
关于数据来源,欺诈检测:呼叫详细记录数据,如短时间内来自同一号码的大量呼
出电话、异常高的国际通话时长、同时从两个不同地区发起的通话等;网络运维:网络
设备(如基站、路由器等)的性能指标数据流,如CPI使用率、流量吞吐量、错误率等。
关于欺诈检测,可采用异常检测的相关技术与算法发现非正常的用户通话模式,或
学习正常用户的通话模式,并对异常模式发出警报。对于网络运维,所训练的模型会实
时监控设备指标,在其出现异常陡增或下降时(可能是故障前兆)立即发出警农。
决策支持:实时阻止欺诈性通话,为公司减少收入损失;在用户感知到网络问题(如
掉线、卡顿)之前,运维团队就能发现并修复网络故障,保障服务质量(QoS)。
习题4:
根据数据挖掘的定义,数据挖掘涉及从大量数据中发现模式、关联、异常或其他有
价值的信息,通常包括分类、聚类、回归、关联规则挖掘、异常检测等分析技术。而简
单的数据查询、聚合计算或排序操作不属于数据挖掘任务。通过对每项活动进行分析可
知,是大数据挖掘任务的有:4),5),6),7),8),10),12)o
数据挖掘基础与案例习题参考答案
第2章数据挖掘工具
习题1:
元组(tuple).列表(list).字典(diet)和集合(set)是4种非常基础且重要的数
据结构。元组是一个不可变的序列类型,用圆括号()定义,一旦创建,元组中的元素就
不能被修改。列表是一个可变的序列类型,用方括号口定义,列表是动态的,可以随时
添加或删除元素。字典是一个无序的键值对集合,用大括号(}定义,字典中的每个元素
都是一个键值对,键必须是唯一的,而值可以是任意类型。集合是一个尢序的不重复兀
素集,用大括号0或set()函数定义,集合中的元素是唯一的,不支持索引和切片操作。
习题2:
布尔值False,整数0,浮点数0.0,负数0j、空字符串''或二空列表、空元组、空
字典、空集合、None。
习题3:
break保留字立即终止当前循环,跳出循环体执行后续代码。cominue保留字跳过
当前循环continue之后的剩余代码,直接进入下一次循环迭代。pass保留字空操作语
句,不执行任何逻辑,仅作为语法占位符保持代码结构完整性。
习题4:
算术运算符:用于数值计算,包括加(+)、减(・)、乘(*)、除(/)、取模伏)、鬲(**)、取
整除(〃)等;比较运算符:用于比较两个变量的值是否相等或大小关系,包括等于(二二)、
不等于(!二)、大于(>)、小于(<)、大于等于(>二)、小于等于(<二)等;逻辑运算符:用于连
接两个或多个条件,判断它们的逻辑关系,包括与(and)、或(。「)、非(not)等;侑运算符:
用于对二进制数进行位运算,包括按位与(&)、按位或(I)、按位异或(八)、按位取反(~)、
左移位(<<)和右移位(>>)等;成员运算符:用于判断一个值是否在指定的序列中,包括
in和notin;身份运算符:用于判断两个变量是否是同一个对象,包括is和isnot;赋
值运算符:用于给变量赋值,包括等于(二)、加等(+二)、减等(-二)、乘等(*二)、除等(/二)、
取余等伏二)等。
运算符之间的优先级顺序如下:
括号:用于改变运算顺序或创建元组。
鬲运算符:**优先级最高
按位取反:~
乘法、除法、取模、整除:*,/,%,〃
加法、减法:+,・。
左移、右移:>>o
按位与、按位异或、按位或:&八,I。
等于、不等于:二二,!二。
大于、小:>,<o
大于等于、小于等于:>三〈二。
身份比较、成员比较:is,isnot,in,notino
逻辑非、逻辑与、逻辑或:not,and,or0
赋值运算符:=,+=,-=,*=,/=,%=,//=,=
习题5:
(1)代码复用函数将完成特定任务的代码封装起来,避免重复编写相同的代码,
提高代码的复用性。
(2)提高代码的可读性和可维护性通过将代码分解成多个函数,可以使代码结
构更清晰,便于理解和维,户。
(3)参数传递函数可以通过参数接收输入,通过返回值输出结果,使得函数具
有很高的灵活性。
(4)作用域控制函数内部的变量只能在函数内部访问,有助于避免全局变量的
污染,提高代码的安全性。
习题6:
与列表相比Numpy数组在处理数学运算和大数据集时的执行效率更高,Numpy数
组支持广播操作,可以对不同维度的数组进行数学运算,而列表则不支持。Numpy数
组支持更多高级的索引方式。
习题7:
元素级乘法使用或numpy.multiply()方法,作用是数组对应位置元素相乘。矩
阵乘法使用或numpy.matmul()方法,遵循矩阵乘法行列数匹配的规则。点积
numpy.dot()计算内积,结果为标量,数组与标量相乘使用“*”,作用是每个元素乘以标
量。
习题8:
numpy.reshape()方法用于修改数组形状,numpy.transpose()翻转数组,
numpy.broadcast().numpysqueeze。修改数组维度,numpy.concatenate()连接数组,
numpy.split。分割数组、numpy.append()snumpy.insert()添力口数组元素,numpydeleteQ
删除数组元素。
习题9:
在Pandas中,元素访问的索引方式丰富多样,且与关系型数据库索引既有相似之
处,也存在明显差异。位置索引使用iloc[],和Pythcn列表索引的使用方法类似,但索
引值与标签无关,当数据重新排序后,容易引发混淆,代码的可读性欠佳,特别是在列
名有实际意义的时。标签索引使用1。叩。代码的可读性强,能直接通过标签理解访问意
图,索引稳定。但标签必须唯一。布尔索引则通过条件表达式与前两种索引方式结合,
用于过滤数据。能够基于条件灵活筛选数据,且支持复合条件查询,但多次使用会降低
检索性能。多级索引可以高效处理高维数据,适用于分组统计和聚合操作,但索引结构
复杂,理解和调试都有一定难度。
习题10:
在Pandas中,主要通过pd.merge()spd.concat。、join()和append。等方法实现
DataFrame合并。pd.merge()实现类似SQL的表连接操作,基于一个或多个键(列)合
并DataFrame,支持内连接(inner)、左连接(left)、右连接(right)和外连接(outer)o
pd.concat。按轴堆叠两个DataFrame,并支持按索引对齐(join='inner'或join='outer'),
当轴axis为0时按行(垂直堆叠),为1时按列(水平拼接)。索引连接join()方法按索
引(或指定列)合并多个DataFrame,类似pd.merge。,默认以索引作为键。append()
方法向DataFrame末尾追加另一个DataFrame,与pd.concat(axis=0)等价,该方法返
回新对象,原DataFrame不变。
习题11:
Scikit-Learn提供了丰富的内置数据集,这些数据集涵盖分类、回归和聚类等多种
任务,帮助用户快速上手和验证模型。
1)分类数据集较多,主要有莺尾花数据集(Iris),3个类别的分类数据集(3类),
包含150条样本,4个特征(花萼/花瓣的长度/宽度),适合分类(如决策树、SVM),
手写数字数据集(Digits)是10个类别的多分类数据集,1797张8x8像素图像,64个
特征,是图像分类的基础数据集,更应适合传统机器学习算法(如KNN、随机森林),
乳腺癌数据集(BreastCancer)是二分类数据集(良性/恶性),包含569条样本,30
个特征,医疗领域的数据集,类别分布略有不平衡,可测试模型在不平衡数据上的表现“
2)回归数据集。波士顿房价数据集(BostonHousing)包含506条样本,13个特
征(如犯罪率、房屋年龄等),适合测试线性回归、决策树等模型。糖尿病数据集(Diabetes)
包含442条样本,10个特征(如年龄、BMI、血压等),可用于预测慢性病发展。
3)聚类与降维数据集,奥利维蒂人脸数据集(OlivettiFaces)包含400张64降4
像素人脸图像,10个不同人各40张,用于聚类、降维、人脸识别。20新闻组数据集
(20Newsgroups)包含约20,000篇新闻文章,分为20个类别,主要用于文本分类、
聚类、主题建模。
4)生成式数据集,make_classification()^nmake_「egression()可生成分类和回归数据
集。
习题12:
Scikit-Learn提供了丰富的机器学习模型,涵盖回归和分类两大核心任务。回归方
法如普通最小二乘法LinearRegresion()x决策树回归DecisionTreeRegressorQ,随机森
林RandomForestRegresscr。、支持向量机SVR()和SVC()、K近令BKNeighborsRegressor()x
神经网络MLPRegressor。等。分类方法包括逻辑回归LogisticRegression()s线性支持向
量机LinearSVC()、决策树分类DecisionTreeClassifier()、随机森林
RandomForestClassifierQxAdaBoost分类方法AdaBoostClassifier().贝叶斯方法
GaussianNB()和MultinomialNB()s多层感知机MLPCIassifier()、K近邻
KNeighborsClassifier。等。
习题13:
导入Matplotlib库中的pyplot模块后。使用pit.figure。函数创建画布,也可使用
plt.add_subplot()或plt.subplots()函数在画布上创建一个或多个子图。在子图上使用各种
绘图方法,如plot。、scatter。、ba胃等。可以使用set_color()xset_marker()xset_xlim()s
legend。等方法设置图形的颜色、标记样式、坐标轴范围、刻度标签、图例等属性来增
强图形的可读性和美观度。最后使用plt.show()函数采显示绘制的图形。
习题14:
plot。绘制折线图,用于展示数据随时间或其他连续变量的变化趋势,bar()或barh()
绘制柱状图,用于比较不同类别的数据量或频率,scatter。绘制散点图,用于展示两个
变量之间的关系,可以通过点的位置来观察它们之巨的相关性,pie()绘制饼图,用于展
示各个部分占总体的比例,通常用于展示分类数据,hist()绘制直方图,用于展示数据的
分布情况,包括数据的频数分布。
数据挖掘基础与案例习题参考答案
第3章数据
习题1:
属性分类结果判断依据
(1)用AM和PM仅有两个取值(AM/PM),无先后顺序关系(如
二元属性、无序
表示的时间AM不“大于”或“小于"PM)
(2)根据曝光表取值为连续的数值(如0~255的亮度值),旦存
连续属性、有序
测出的亮度在明确大小关系(如亮度100大于亮度50)
(3)根据人的判通常取值为离散等级(如“暗、较暗、中等、较亮、
分类属性、有序
断测出的亮度亮”),有顺序关系但非连续数值
属性分类结果判断依据
(4)医院中的病分类属性(离散取值为非负整数(0.1,2,…),离散且存在大小顺
人数数值型)、有序序(如10个病人多于5个病人)
取值为离散编码,仅用于唯一标识书籍,无顺序
(5)书的ISBN号分类属性、无序关系(如ISBN978-7-111无“大于”其他ISBN的意
义)
(6)用每立方厘
取值为连续数值(如铁的密度7.8g/cm3),存在明
米表示的物质密连续属性、有序
确大小比较关系
度
离散编码,仅用于唯一标识快递,无顺序关系(如
(7)快递单号分类属性、无序
单号SF123456与SF654321无先后之分)
习题2:
(1)常见数据质量问题
1)数据缺失。被调查者漏填部分问题(如敏感信息“收入”、复杂问题“家庭支出结构”)。
2)数据错误。被调查者填写错误(如年龄填“200”、联系方式少写数字)或理解偏差(如“月
消费”误填为“年消费”)。
3)数据不一致。同一问卷中逻辑矛盾(如“职业选学生”但“月收入填10000元”)。
4)响应偏差。被调查者刻意隐瞒真实想法(如“对产品满意度”填“非常满意”但实际不满意)
或受引导性问题影响(如“您是否也认为该产品性价比低?
5)样本偏差。调查样本与目标群体不匹配(如调查“全国青少年偏好”却仅在一线城市
取样)。
(2)避免数据质量问题的方法
1)问卷设计优化。敏感问题采用间接提问(如“收入区间”而非具体数字)或匿名填写;复杂
问题拆分(如“家庭支出”拆分为“食品支出”“住房支出”等);避免引导性问题,采用中性表述
(如“您对该产品的满意度如何?"):增加逻辑校验(如“选学生则隐藏收入填写项”)。
2)调查过程管控。对调查员培训(明确问卷解释规则,避免主观引导);现场复核(回收问卷
时快速检查漏填、错填,及时补填)。
3)数据清洗处理。缺失值处理(少量缺失用“均值/中位数填充”,大量缺失剔除该样本);异常
值检测(用“3。准则”或箱图识别错误数据,联系调查员核实或剔除)。
4)合理设计样本。采用分层抽样、随机抽样等方法,确保样本覆盖目标群体的不同维度(如年
龄、地域、职业)。
习题3:
(1)均值和中位数
均值:所有数据之和除以数据个数。
总和二749,均值=749+27弋27.74。
中位数:数据排序后中间位置的数值。〃=27,中间位置为第14个数据,故中位数=25。
(2)众数
出现次数最多的数值:25出现4次,35出现4次,故众数为25和35(双峰分布)。
(3)中列数
最大值与最小值的平均值:中列数=(最小值+最大值)+2=(13+70)+2=41.5。
(4)四分位数(Ql、Q3)
1)确定四分位数位置。
Qi位置=(n+l)X25%=[27+l)X0.25=7,对应第7个数据。
Q3位置=(n+l)X75%=127+l)X0.75=21,对应第21个数据。
2)读取数据。
第7个数据=20,故Qi=20。
第21个数据=35,故Q3=35。
(5)五数概括及盒图
五数概括:最小值=13,Qi=20,中位数=25,Q3=35,最大值二70。
盒图绘制规则如下:
1)绘制数轴,标注范围13~70。
2)绘制矩形盒:左边界=0尸20,右边界=。叶35,盒内横线=中位数=25。
3)绘制须(Whisker):左须延伸至最小值=13;右须计算临界值二Qs+l.SXIQRGS+lSXGS-
ZO尸57.5,70>57.5为异常值,右须延伸至52(小于57.5的最大值),异常值70用圆点单独标记。
4)标注坐标轴(横轴“年龄”,纵轴“数值”)及异常值说明。
说明:此处介绍盒图绘制过程,不展示盒图结果。
(6)分位数图和分位数-分位数图
年依效提的分位数图年龄依据的QH)图(与正态分布对比)
950005
理论正态分布分位K
1)分位数图。
横轴:数据的分位数(0%,25%,50%,75%/00%)。
纵轴:对应分位数的实际数据值(13,20,25,35,70)。
特点:直接展示数据自身的分位数分布,可快速看出数据右偏(右须长)。
2)分位数-分位数图(Q-Q图)。
横轴:标准分布(如正态分布)的分位数。
纵釉:样本数据的分位数。
特点:用于检验分布一致性,若点近似直线则符合标准分布;本题数据右偏,右侧点偏离直线。
不同点:分位数图仅展示样本自身分位数关系,Q-Q图需与标准分布对比,核心用途是“检验
分布一致性二
习题4:
(1)产量和生产费用的均值、中位数和标准差见下表
指
产量/件生产费用行元
标
总和总和
均=40+42+50+55+65+78+84+100+11=130+150+155+140+150+154+165+170+
值6+125+130+140=925167+180+175+185=1921
均值=925+12=77.08均值=1921+12^60.08
中
〃二12,中间位置为第6、7个数据,
位”12,中位数=(154+165);2=159.5
中位数=(78+84)+2=81
数
标
方差均值)2/(小1.1238.36方差=E(y厂均值)2/(“1户225.92
准
标准差=41238.36=35.2标准差=4225.92=15.03
差
(2)生产费用盒图
最小值=130,Qi=1475(第3个数据140与第4个数据150的平均),中位数=159.5,Q3=172.5
(第9个数据170与第10个数据175的平均),最大值=185,IQR=25,无异常值(1302110,185
W210)。
绘制方式:两个盒图并列,横轴标注''产量”“生产费用”,纵轴分别标注产量范围(40-140)
和生产费用范围(130-185),矩形盒、中位数线、须按规则绘制。
(3)散点图与分位数-分位数图(Q-Q图)
1)散点图。
横轴:产量(40~140)。
纵轴:生产费用(130785)。
绘制12个点(如(40,130),(42,150),•••,(140,185))。
特点:点近似呈上升趋势,说明产量与生产费用正相关。
2)分位数一分位数图(Q-Q图)。
横轴:产量的分位数(40,52.5,81,120.5,140);
纵轴:生产费用的分位数(130,147.5,159.5,172.5,185)。
特点:点近似直线,说明两者分布形态一致(均右偏)。
产量及生产费用的盒须佟、散点图、分位数-分位数图如卜.图所示:
产・与生产衾用的关h(做总部♦心的段)
习题5:
这里以“iris雪尾花数据集”为例说明。
(1)数据集背景包含150个样本,3个类别(山莺尾、变色莺尾、维吉尼亚莺尾),4个属性
(萼片长度、萼片宽度、花瓣长度、花瓣宽度,单位:cm)。
(2)可视化技术应用
1)单变量可视化。
直方图:每个属性的分布(如花瓣长度在l-6cm,变色固尾花瓣长度集中在3-5cm)。
箱图:对比3个类别的属性差异(如山莺尾的花瓣长度明显短于其他两类)。
2)双变量可视化。
散点图矩阵:展示4个属性间的两两关系(如花瓣长度与花瓣宽度正相关,相关系数20.96)。
分类散点图:以“花瓣长度”为横轴,“花瓣宽度”为纵轴,用不同颜色标记类别(可清晰区分
山蒿尾与其他两类)。
3)多变量可视化。
平行坐标图:每个样本用一条折线表示,4个属性为平行纵轴,不同类别用不同颜色(可观察
类别在多属性上的整体差异)C
热力图:展示4个属性的相关系数矩阵(萼片宽度与花瓣长度负相关,相关系数比-0.43)。
习题6:
(1)标称属性(如颜色:红、蓝、绿;性别:男、女)
定义:若两个对象的属性值相同,相异性为0;否则为1。
公式:
示例:一“红列产“蓝”,则如,y)=l;下“男”,产“男”,则如刖=0。
(2)非对称二元属性(如“是否患癌症":是=1,否=0;多数对象取值为0)
定义:仅关注“1-1”匹配(两个对象均取1),忽略“0-0”匹配(因多数为(),无区分度)。
公式:d(x,y)=1—其中a:x=l且尸1的数量,A:ml且)=0的数量,c:40且尸1
的数量。
示例:x=(1,0,0),)=(1,1,0),则a=l,b=\,c=\,d(x,y)=1-1/(1+1+1)=2/3o
(3)数值属性(如年龄、身高,连续/离散数值)
常用公式:欧几里得距离d(%y)=/(适用连续数值,关注绝对差异);曼哈顿距
离d(x,y)=£3a-yil(适用于离散数值,抗异常值能力强
示例:x=(22,10),尸(2(),8),欧几里得距离=J(22-20尸+(10-82二%处2.83,曼哈顿距离
=|22-20|+|10-8|=4.
(4)词频向量(如文档的词频:x=(2,0,3)表示“词1出现2次,词2出现0次,词3出现3
次”)
定义:用余弦距离(1-余弦相似度)衡量相异性,关注向量方向(词频分布)而非长度。
公式:d(x,y)=1----圈型一
示例:下(2,0,3),产(1.1,2),余弦相似度=产+。':上=蜷*0.91,故d(x,y)=1-0.91=0.09。
V4+0+9V1+1+4V13XV6
习题7:
(1)欧几里得距离
公式:d=,(%、-yJ2+(%2-力)2+(%3—丫3)2+(4—%)2
计算:7(22-20)2+(1-0)2+(42-36)2+(10-8)2
=:4+1+36+4=x/45«6.71
(2)曼哈顿距离
公式:d=\x1-y1\+\x2-y2\十|x3-y3l+反4一以1
计算:|22-20|+|1-0|+|42-36|+|10-8|=2+1+6+2=11
(3)闵可夫斯基距离(行3)
公式:d=(着=1%一%|q)i/q
计算:(|22-20|3+11-0|3+|42-36|34-110-8I3)1/3
=(8+14-216+8)1〃=V233»6.15
(4)上确界距离(切比雪夫距离)
公式:d=max(|Xi-yj,|x2-y2\>\x3-y3\,|x4-y4|)
计算:max(2,1,6,2)=6
习题8:
(1)各种距离的计算
1)欧几里得距离(越小越相似)。
d(q,xj=J(1.4-1.5)2+(1.6—1.7)2=VM2«014
d(q,%2)=J(1.4-2.0)2+(1.6-1.9)2=70^45«0.67
22
d(qfx3)=7(1.4-1.6)+(1.6-1.8)=70^08«028
d(qtx4)=J(1.4-1.2)2+(1.6—1.5)2=V0?05«0.22
d(q,&)=1.5)2+(1.6—1.0)2=V037«0.61
2)曼哈顿距离(越小越相似)。
d(q』)=|1.4-1.5|+|1.6-1.7|=0.2
d(q,x2)=11.4—2.0|+|1.6—1.9|=0.9
d(q,x3)=|1.4-1.6|4-|1.6-1.8|=0.4
d(q,x4)=|1.4-1.2|+|1.6—1.5|=0.3
d(q,x5)=|1.4—1.5|+|1.6—1.0|=0.7
3)上确界距离(越小越相似)。
d(q,Xi)=max(|1.4—1.5|,|1.6—1.7|)=0.1
d(qtx2)=max(|1.4-2.0|,|1.6-1.9|)=0.6
d(q,x3)=max(|1.4—1.6|,|1.6—1.8|)=0.2
d(q,%4)=max(|1.4-1.2|,|1.6—1.5|)=0.2
d(q,%5)=max(|1.4-1.5|,|1.6-1.0|)=0.6
4)余弦相似度(越大越相似)。
公式:$而©、)=而悯
1.4x1.5+1.6x1.75.02
sim(q,%D=r=------/.==/------,«0.998
V1.42+1.62xV1.52+1.72V432x\[SAA
1.4x2.0+1.6x1.96.24
sim(Q,x)=,----/==/•----;----x0.992
2V4S2xJ2.02+1.92V4?52xVZ61
1.4x1.6+1.6x1.85.44
sim(q,%3)=X0.999
V«2xV1.624-1.82V452x
1.4x1.2+1.6x1.54.08
sim(q,x)=-=~,=~^=——x0.997
4V452xV1.22+1.52V^52xVT69
,、1.4x1.5+1.6x1.03.7
sim(q,x)=,----,==,---,=0.968
5VT52xV1.52+1.02V452xV325
(3)相似性排序(从高到低)
度量方式排序结果(相似性:高一低)
欧几里得距离Xi>A,4>.丫3>.丫5>工2
曼哈顿距离Xi>X4>X3>X5>X2
上确界距离Xi>X3=X4>X2=XS
余弦相似度X3>Ai>X4>X2>X5
习题%
数据质量的核心评估维度包括准确性、完整性和•致性,三者产生问题的原因与数据生命周期
(采集、存储、处理)密切相关,具体分析如下:
(1)准确性问题:数据与真实情况不符
1)原因。
采集环节误差:人工录入失误(如问卷填写时将“年龄25”误写为“52”)、传感器故障(如温
度传感器故障导致数据偏大10℃)。
数据转换错误:格式转换时精度丢失(如Excel将“身份证自动转为
科学计数法”L10101E+17")、单位换算错误(如将“千克”误按“克”记录)。
主观偏差:调查时被调杳者刻意隐瞒(如求职时虚报“工作年限”)、数据标注者主观判断误差
(如图片分类时将“猫”误标为“狗”)。
2)示例。。
某电商平台用户信息表中,用户“张三”的手机号被录入为“138001380000”(多一位数),导
致无法正常联系,属于采集环节的准确性问题;某工厂的产量统计中,将“月产量500吨”误记为
“5000吨”(单位换算时多补一个0),属于数据转换的准确性问题。
(2)完整性问题:数据存在缺失(部分属性无值)
I)原因。
采集设计缺陷:问卷遗漏关键问题(如“用户购买偏好”未设置选项)、传感器未覆盖所有监测
点(如车间仅3个角落装温感,中间区域无数据)。
被采集者拒绝提供:敏感信息不愿填写(如“月收入”“健康状况”漏填)、复杂问题放弃回答
(如“家庭支出结构”多选项漏填)。
数据传输/存储丢失:网络中断导致部分数据未上传(如APP用户行为数据因断网丢失5min记
录)、存储介质损坏(如硬盘故障导致部分历史订单数据缺失)。
2)示例。
某医院的患者病历表中,10%的患者“过敏史”字段为空(患者不愿透露),5%的患者“入院时
间”字段为空(护士录入时系统崩溃未保存),均属于数据完整性问题;某外卖平台的订单数据中,
因服务器宕机,某小时内200条订单的“配送地址”缺失,也属于完整性问题。
(3)一致性问题:数据逻辑矛盾或格式不统一
1)原因。
格式标准不统一:多数据源整合时格式冲突(如A系统“日期”为“YYYY-MM-DD”,B系统
为“MM/DD/YYYY”,合并后出现“2024-05-01”与“05/01/2024”并存);
业务逻辑冲突:数据间违反预设规则(如“订单状态:已支付”但“支付金额=0",“职业二学生”
但“月收入二10000元”);
更新不同步:关联表更新时遗漏(如用户修改手机号后,“用户表”已更新,但“订单表”中关
联的手机号仍为旧值)。
2)示例。某银行的客户信息系统中,客户“李四”的“开户日期”为“2023-01-15”,但“首笔
交易口期”为“2022-12-30”(早于开户日期),属于业务逻辑一致性问题;某电商的商品表中,“商
品分类二电子产品”但“所属类目ID=3"(类目ID=3对应“服装”),属于数据关联的一致性问题。
习题10:
(1)数据缺失对数据挖掘的影响数据缺失会从“过程有效性”和“结果准确性”两方面干扰
数据挖掘,具体表现为:
I)导致挖掘算法失效:部分算法对完整数据有强依赖,如神经网络、SVM等无法直接处理含
缺失值的数据,若强行输入会报错或终止运行。
2)降低模型精度:即使算法支持缺失值(如决策树),缺失数据会丢失关键信息(如“用户消
费频率”缺失会导致客户细分模型无法准确划分高/低价值客户),最终模型泛化能力下降c
3)引入偏差:若缺失值非随机(如高收入用户普遍漏填“收入”),会导致样本分布偏离真实群
体(如客户样本中“低收入用户占比虚高”),挖掘结果偏向片面结论。
4)减少有效样本量:若直接删除含缺失值的样本,当缺失比例较高(如超过30%)时,样本量
大幅减少,可能无法支撑挖掘任务(如分类任务需至少1000个样本,删除后仅剩500个)。
(2)缺失值处理方法限据缺失值比例和数据特点,缺失值处理可分为“删除法”“填充法”
和“模型法”三类。
1)删除法:直接移除含缺失值的对象或属性。
适用场景:缺失比例极低(如〈5%)、缺失属性无关键意义。
具体方式:
行删除:删除含缺失值的样本(如删除“收入”缺失的用户记录)。
列删除:删除缺失比例极高的属性(如“兴趣爱好”字段80%样本缺失,直接删除该属性)。
优缺点:优点是简单高效,无主观假设;缺点是丢失样本/属性,可能导致样本偏差。
2)填充法:用合理值填补缺失位置。
适用场景:缺失比例中等(5%-30%)、数据分布相对均匀。
具体方式:
统计值填充:用属性的均值(适用于连续数据,如“年龄”缺失用均值27.74填充)、中位数(适
用于含离群点的连续数据,如“工资”含极值100万,用中位数填充)、众数(适用于分类数据,如
“性别”缺失用众数“男”填充)。
插值填充:基于相邻数据的趋势填补,如线性插值(”时间序列温度数据”中10:00缺失,用9:00
和11:00的均值填充)、邻近填充(“地域销售数据”中A城市缺失,用同省份B城市数据填充)。
优缺点:
优点是保留样本,操作简单。
缺点是可能引入偏差(如用均值填充会缩小数据方差)。
3)模型法:用机器学习模型预测缺失值。
适用场景:缺失比例较高(30%-50%)、数据关联性强。
具体方式:以含缺失值的属性为“目标变量”,其他完整属性为“特征”,训练回归模型(连续
属性,如用“年龄”“职业”预测缺失的“收入”)或分类模型(分类属性,如用“消费频率”“购买
品类''预测缺失的“用户等级”):常用模型:决策树、随机森林、K近邻(KNN)。
优缺点:
优点是利用数据关联性,填充值更贴合真实分布。
缺点是计算成本高,需足够多的完整样本训练模型。
习题11:
(1)异同点对比
对比
插值填充法模型填充法
维度
基于数据的“空间/时间连续性”,假基
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年全国护士考试试题及答案
- 机房防尘防潮防静电管理规定
- 中级养老护理员题库(附答案)
- 2026年主管护师(中级)真题附参考答案详解(满分必刷)
- 商场着火应急预案演练脚本
- 酒店装修改造项目施工方案
- 中外历史纲要(下) 板块4 第11单元 第31讲 马克思主义的诞生与传播
- 第一单元综合(单元自测练习卷)-2026-2027学年统编版语文五年级上册
- 生产技术部工作总结(精-选3篇)
- 急性胸痛抢救流程优化方案
- 2026江苏宿迁市工会系统招聘工会社会工作者12人备考题库【历年真题】附答案详解
- 2026年建筑电工(建筑特殊工种)考试题库及建筑电工(建筑特殊工种)附答案
- 2026年一建铁路工程全真押题试卷及答案
- 旅游景区基础设施提升项目专项债可行性研究报告
- 非标自动化钳工模拟考试试题及答案
- 2026年秋新教材沪教版九年级上册英语Unit 1-8词汇表
- 2026年教师选调进城考试试题及答案解析
- DBT29-320-2025 天津市建筑工程消能减震隔震技术规程
- 《中外管理思想史》课件
- 2023年四川宜宾市珙县选调(聘)机关事业单位人员笔试参考题库(共500题)答案详解版
- 劳务施工施工方案
评论
0/150
提交评论