版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
DeepSeek实现分类与聚类从原理到实践:决策树、支持向量机与聚类算法详解课程大纲引言:分类与聚类的核心思想探索无监督与有监督学习的根本差异,奠定机器学习算法理解的基石模块一:决策树分类•工作原理与树的构建方法解析•最佳划分属性:信息熵与基尼指数对比•实战演练:ID3与C4.5算法实现模块二:支持向量机(SVM)•核心概念:最大边缘超平面原理•线性可分场景下的SVM模型训练流程•进阶:大模型框架下的线性SVM落地模块三:聚类分析•聚类分析的定义及典型应用场景•经典实践:K-Means算法原理与调优•进阶实战:DBSCAN密度聚类算法模块一决策树分类模拟人类逻辑判断的分类模型·清晰直观·可解释性强决策树工作原理-概念什么是决策树?一种带有判决规则的树状结构,主要用于解决分类问题,对未知类别的样本进行预测。它通过树状结构,直观地表达了各种可能的决策路径,以及每个路径最终得到的决策结果。三大核心组成🌳根结点(RootNode)
位于树最顶层,包含全部训练样本,是分类的起点。🔀内部结点(InternalNode)
对应一个属性测试(如年龄),根据测试结果将样本划分到不同的子分支中。🏁叶子结点(LeafNode)
位于树的底部,不包含子结点,代表最终的分类结果或类别。场景应用示例预测“顾客是否会购买计算机”的经典场景:1.起点(根):顾客的年龄?
2.分支(内部):30岁以下/31-40岁/40岁以上
3.细分(内部):学生身份?收入水平?
4.结果(叶子):购买(Yes)或不购买(No)逻辑清晰,可解释性强是它最大的优势。决策树工作原理-构建过程核心思想:采用自顶向下递归的方式,通过选择特征进行分叉,不断细分训练样本集,将复杂的决策过程转化为一系列简单的二元或多元判断。01.选择根结点计算所有特征的信息增益或基尼系数,从中选择能最大化样本纯度的属性作为树的根结点。02.创建分支根据选定属性的所有可能取值,在根结点上创建相应的分支路径,形成中间结点。03.划分样本遍历训练集中的每一个样本,根据其属性取值,将其分配到对应的子分支路径下,形成子样本集。04.递归构建对每一个新生成的子结点重复步骤1-3。持续递归直到满足停止条件,最终形成叶子结点。🔑递归停止(返回)条件:1.当前结点包含的所有训练样本均属于同一类别,无需再分。
2.没有剩余属性可用于划分,或所有样本在剩余属性上的取值完全一致。
3.当前结点包含的样本集为空,无法进行划分。选择最佳划分属性的度量核心目标寻找一个划分属性,使划分后的子节点集合的“不纯度”(不确定性)降低得最大,从而提升分类准确性。不纯度降低公式(InformationGain)ΔI=I(parent)-Σ[N(j)/N*I(j)]I:不纯度度量函数|N:父节点样本总数|N(j):第j个子节点样本数信息熵(Entropy)衡量样本集合的混乱程度。熵越高,数据越混乱。ID3和C4.5算法使用该指标。公式:H(p)=-Σp(x)log₂p(x)基尼指数(Gini)衡量从样本集中随机抽取两个样本,类别标记不一致的概率。计算效率通常高于熵。CART算法默认指标。公式:G(p)=1-Σ[p(x)]²误分类率(ErrorRate)直观衡量被错误分类的样本占比。但因其函数非连续可导,在优化过程中较少直接使用。公式:E=1-max{p(x)}不纯度度量-信息熵(Entropy)01信息熵定义核心概念:度量样本集合不确定性的指标。熵值与纯度呈负相关关系:
➡熵越小,样本纯度越高
➡熵越大,样本不确定性越高
02信息增益(IG)划分依据:表示通过属性a对样本划分后,样本集合不确定性的减少程度。减少量越大,说明该属性分类能力越强。
03局限性与偏置固有缺陷:倾向于选择“取值较多”的属性作为划分依据。例如:若将“身份证号”作为属性,每个样本都是唯一值,此时信息增益会很大,但毫无泛化能力。改进方案:信息增益率(GainRatio)引入属性的固有值(IV)作为惩罚因子,解决取值偏置问题,即C4.5算法。不纯度度量-基尼指数与误分类率基尼指数(GiniIndex)表示随机选中的样本被分错的概率。数值越小,代表集合的纯度越高。
💡CART算法选择基尼指数最小的属性作为划分标准。误分类率(ErrorRate)直观地衡量将样本预测为某一类时产生的错误概率,代表了最直观的“犯错”可能。
📌计算简单,但在数学上不如基尼指数平滑。不纯度降低程度衡量属性划分后,节点不纯度下降的幅度,值越大说明划分效果越好。
🔑反映划分带来的信息增益效果。ID3决策树算法算法简介由RossQuinlan于1986年提出,是机器学习领域中最经典的决策树生成算法之一,为后续C4.5等算法奠定了基础。核心策略在构建树的每一步,都采用“贪心”策略:遍历所有属性,选择能使划分后数据集的信息增益最大的属性作为当前节点的划分依据。关键特点•支持多分支划分,结构直观易懂。
•不支持直接处理连续特征(需先进行离散化处理)。
•采用“互斥且无遗漏”原则,属性一旦用于划分,后续不再复用。执行步骤1.计算当前样本集中所有特征的信息增益。
2.选取信息增益最大的特征,将数据集划分为若干子集。
3.对各子集递归执行步骤1-2,直至满足停止条件。ID3算法示例-是否打羽毛球数据集概览本案例基于一份包含14个样本的历史数据,用于预测在不同天气下是否适合打羽毛球。属性特征(Features):•天气状况(晴/阴/雨)•气温(高/中/低)•湿度(高/正常)•风力(强/弱)目标类别(Label):
是否去打羽毛球(是/否)信息增益计算结果数据集整体熵Entropy(S)≈0.940▪天气状况:Gain=0.246▪湿度:Gain=0.152▪风力:Gain=0.048▪气温:Gain=0.029算法结论根据ID3算法的“最大信息增益”原则:选择“天气状况”
作为决策树的
根结点ID3算法示例-决策树生成根结点:天气状况以“天气状况”作为初始划分属性,将样本集分为三类进行递归计算。🌥️阴天样本类别纯净度高
无需继续分裂
→直接形成叶节点:“是”☀️晴天计算信息增益,选“湿度”为子结点:
•高湿度→“否”
•正常湿度→“是”🌧️下雨计算信息增益,选“风力”为子结点:
•低风力→“是”
•高风力→“否”最终决策树价值完整展示了从天气状况到最终决策的逻辑路径,实现了基于历史样本对未知天气状况下是否适合活动的准确预测。图示:决策树层级结构与分支逻辑大模型实现ID3决策树🔑提示词设计关键要素明确任务:清晰告知大模型需要构建ID3决策树分类模型。数据描述:完整列出所有特征属性及其取值范围和类别标签。算法要求:指定ID3算法,并可限制树的最大深度以控制复杂度。格式与过程:定义树结构的展示格式(如缩进)并要求输出信息增益计算。📝示例提示词请使用ID3算法构建一个决策树分类模型,根据以下天气数据预测是否适合打羽毛球:特征:天气状况(晴/阴/雨)、气温(热/适/冷)、湿度(高/常)、风力(低/高)类别标签:是否适合打羽毛球(是/否)要求:计算每个特征的信息增益以确定根节点,构建最大深度为3的决策树,最后用缩进格式清晰展示树的层级结构。C4.5决策树算法算法概览与核心改进▌算法简介C4.5算法是经典ID3算法的扩展与改进,由RossQuinlan于1993年提出,解决了ID3算法的局限性,是目前应用最广泛的决策树算法之一。▌核心改进点ID3的主要缺陷是倾向于选择取值数目较多的属性作为分裂点。C4.5通过引入信息增益率(GainRatio)替代信息增益来选择划分属性,成功克服了这一偏好,使分类更精准。计算逻辑与执行流程
▌启发式选择策略1.计算所有候选属性的信息增益,过滤掉低于平均值的属性。
2.仅对通过筛选的属性,计算其对应的信息增益率。
3.最终选择增益率最高的属性作为当前节点的划分属性。模块02支持向量机(SVM)分类SUPPORTVECTORMACHINECLASSIFICATIONSVM原理-最大边缘超平面01/线性可分在n维空间中,存在一个超平面wx+b=0能够将两类样本数据完全、无误差地分隔开。02/最大边缘(Margin)•满足线性可分条件的超平面通常有无数个,但泛化能力各不相同。
•目标是寻找离它最近的样本点(即“支持向量”)距离最远的超平面。
•这个“最近距离”被定义为模型的边缘(Margin)。03/直观理解边缘越大,分类器对新数据的容错性越强,对噪声不敏感,最终模型的泛化能力更优。SVM原理-线性决策边界与边缘计算决策边界在数学上,SVM的分类界面是一个线性的超平面,其方程定义为:wx+b=0其中,w是垂直于决策边界的法向量,b决定了超平面的偏移量。分类规则样本点通过函数值的符号进行分类:若wx+b>0→判定为类别+1若wx+b<0→判定为类别-1边缘宽度计算两类支持向量到决策边界的距离之和即为边缘宽度:d=2/||w||SVM的核心目标是最大化边缘d,这在数学上完全等价于最小化法向量w的L2范数的平方||w||²。训练线性SVM模型问题形式化本质上是一个带约束的凸优化问题:🎯目标函数:min(1/2)*||w||²📏约束条件:yᵢ*(wᵀxᵢ+b)≥1,∀i求解方法引入拉格朗日乘数法,将原有的带约束优化问题转换为其对偶问题求解。这种方法不仅计算上更高效,还能自然引入“核函数”机制,从而解决非线性可分的数据分类问题。支持向量•满足等式约束yᵢ(wᵀxᵢ+b)=1的样本点。•对应拉格朗日乘子αᵢ>0的样本点。💡核心意义:
分类器的决策边界(超平面)完全由这些支持向量决定,与其他样本点无关。大模型实现线性SVM提示词设计关键要素数据预处理特征标准化、缺失值填补、处理数据类别不平衡等基础操作。模型训练指定核函数(如Linear)、正则化参数C及多分类策略(One-vs-Rest)。模型评估明确评估指标(准确率、混淆矩阵),并提出可视化分析建议。结果解释要求大模型解释特征权重含义,说明哪些特征对分类影响最大。💡示例提示词使用鸢尾花数据集,训练线性SVM模型对三种鸢尾花进行分类。请严格执行以下步骤:1.对特征进行标准化处理,并按7:3随机分割训练集和测试集。
2.使用One-vs-Rest策略训练模型,尝试优化正则化参数C。
3.输出测试集准确率、混淆矩阵,并解释各特征的重要性。模块三聚类分析CLUSTERANALYSIS聚类概念核心定义聚类是将物理或抽象对象的集合,根据对象的属性特征,划分为不同的**簇(Cluster)**。目标是实现:簇内相似度最大化,簇间相似度最小化。核心区别:分类vs聚类分类(Classification)属于**有监督学习**,类别标签已知,需从训练集中学习映射关系。聚类(Clustering)属于**无监督学习**,类别标签完全未知,算法需要从数据中**自动发现**结构和模式。算法关键要求•具备良好的**可伸缩性**,处理海量数据•能处理数值、类别等**不同数据类型**•可发现任意形状、非球形的簇结构•对输入顺序不敏感,且能有效处理噪声•聚类结果具有**可解释性**和实用性K-Means聚类算法简介K-Means是目前数据挖掘和机器学习领域中,最经典、最广泛使用的划分式无监督聚类算法。核心步骤(迭代优化)01.设定与初始化指定簇的数量K,在数据集中随机选择K个点作为初始簇的“质心”。02.分配与更新将所有对象分配给距离最近的质心;再基于新分配的对象,重新计算簇的质心。▶终止条件:不断重复上述过程,直到所有簇的质心位置不再发生显著变化。目标函数(最小化损失)最小化所有数据对象到其所属簇质心的“平方距离和”(SSE),让簇内尽可能紧密。划分式Partitioning将数据集硬性分割为互不相交的K个簇无监督Unsupervised无需标签,仅依靠数据内在的相似度高效性Efficiency计算复杂度低,适合处理大规模数据K-Means算法优缺点分析核心优势●简单高效:原理直观,计算复杂度低,收敛速度快,易于实现和理解。●海量处理:时间复杂度与样本数量呈线性关系,非常适合处理大规模数据集。●效果显著:对于特征空间中分布紧凑、边界清晰且呈球状的簇,能取得理想的聚类效果。主要局限❌参数依赖:必须预先指定K值,在缺乏先验知识时难以准确估计。❌初值敏感:聚类结果受初始中心选择的影响很大,容易收敛到局部最优解。❌数据限制:仅支持数值型数据,且不擅长发现非凸形状或不规则分布的簇。❌噪声干扰:算法基于距离计算均值,对数据集中的噪声点和孤立点非常敏感。密度聚类(DBSCAN)原理图1:DBSCAN核心点、边界点与噪声点示意▍算法简介一种基于密度的空间聚类算法,能够在带有“噪声”的空间数据库中发现任意形状的簇,是处理非凸数据集的经典算法。ε-邻域以给定数据点为圆心,半径为ε的圆形区域。MinPts一个数据点要成为“核心对象”,其ε-邻域内至少包含的样本点数量。核心对象若某点的ε-邻域内包含的点数≥MinPts,则该点被定义为核心对象。边界点(BorderPoint)自身不是核心点,但落在某个核心点的ε-邻域内。它依附于核心点而存在。噪声点(Noise)既不是核心点,也不是边界点的样本点,代表孤立的异常值。DBSCAN算法思想簇的定义由密度相连的点组成的最大集合,是基于密度聚类的核心概念。核心算法流程1.找出所有满足条件的核心对象→2.随机选一个未访问核心对象,找所有密度可达的点形成簇→3.重复直到所有核心对象都被访问→4.剩余的非核心对象即为噪声点(Outlier)。无需指定K值自适应簇数量任意形状簇不限于凸形分布识别噪声点自带异常检测能力大模型实现聚类分析K-Means提示词设计指南🎯明确任务:执行K-Means算法进行无监督聚类分析,将数据聚合成不同组别。📊指定数据与参数:清晰描述数据特征维度、样本量;指定K值范围及距离度量方法。📈评估与可视化:要求计算轮廓系数、肘部法则以验证效果
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 护理团队建设与协作
- 规培生影像考试试卷
- 充电桩绝缘测试施工工艺流程
- 2026年火灾事故应急预案演练总结报告
- 施工警示标识技术交底(标准范本)
- 2026中国疾病预防控制中心结控中心招聘工作人员2人笔试参考题库附
- 2026年事业编生物技术类基因工程测试卷
- 2026年物流应急预案
- 2026年卫生专业技术资格考试(输血技术-专业实践能力主管技师)专项练习题及答案
- 2026年新九年级语文暑假衔接第三单元 游目骋怀主题阅读(专项训练)(原卷版)
- 手术室护理实践指南2025解读
- 驾照考试科目一知识点归纳总结
- RB/T 107-2024能源管理体系公共建筑管理组织认证要求
- 2026年超星尔雅当代大学生国家安全教育题库综合试卷及参考答案详解(完整版)
- 2026重庆西部国际传播中心有限公司招聘2人笔试历年备考题库附带答案详解
- 2025年高考全国卷理综物理高考真题解析(试卷+解析)
- 印刷不合格品处置与返工规范手册
- 2026安全生产法完整版
- 钻孔灌注桩技术培训课件
- 检验科标本离心暴露风险防控
- 2026暖通工程师校招试题及答案
评论
0/150
提交评论