版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第9章
机器学习基础AI第9章知识导图机器学习基础机器学习发展历程关键发展阶段机器学习基础认知第1章计算机工具与计算机演进史第2章计算机系统组成第3章计算机中的数据表示第4章操作系统与网络基础第5章软件构建基础:语言、编译与工程第6章算法与数据结构第7章数据管理与大数据技术第8章人工智能概述第9章机器学习基础第10章深度学习基础第11章机器人学、智能体与具身智能第12章自然语言处理与大语言模型第13章AI伦理、法律、治理与未来第14章AI赋能行业典型应用第15章前沿技术与实践能力培养机器学习定义机器学习三大范式里程碑事件多学科支撑基础核心要素工作流程监督学习无监督学习强化学习三大学习范式的对比机器学习研究方向核心研究领域不同环境下的研究重点机器学习应用领域常见机器学习算法算法概述与学习导航回归算法K-近邻算法决策树随机森林朴素贝叶斯算法K-均值聚类支持向量机神经网络算法内容导航AI第9章
机器学习基础9.1机器学习发展历程9.3机器学习基础认知9.2机器学习定义9.6机器学习三大范式9.4机器学习研究方向9.5机器学习应用领域9.7常见机器学习算法9.1.1关键发展阶段统计方法20世纪50年代之前发现并改进的统计方法;概率推理20世纪60年代开始用于机器学习中概率推理的贝叶斯方法的引入;数据驱动20世纪90年代开始机器学习从知识驱动转变为数据驱动方法;SVM、RNN等逐步流行起来;深度学习21世纪初至今机器学习研究热度主要集中在深度学习;2012年之后,随着算力和海量样本的支持,深度学习急速发展;简单算法20世纪50年代开始使用简单算法进行开创性机器学习研究;反向传播20世纪80年代开始反向传播使得机器学习研究进入新时代;无监督学习21世纪初开始支持向量聚类及无监督学习方法逐步流行起来;图9.1机器学习发展时间轴9.1.2里程碑事件机器学习发展历程中,多个标志性事件推动技术迭代与行业认知:1959年,IBM工程师亚瑟・塞缪尔开发西洋跳棋程序,该程序能通过对弈数据持续优化水平,同时首次提出“机器学习”术语,标志领域正式进入发展期;1997年,IBM“深蓝”计算机击败国际象棋世界冠军卡斯帕罗夫,证明机器学习在复杂博弈场景的能力;2016年,谷歌DeepMind开发的AlphaGo击败世界围棋冠军李世石,展现机器学习在高维度、复杂决策任务中的超凡潜力,进一步推动领域研究热度。时间阶段主要特征代表性技术与算法20世纪50年代开创性研究,简单算法塞缪尔的跳棋程序,感知机20世纪60-70年代贝叶斯方法引入概率推理20世纪80年代神经网络复兴,反向传播BP神经网络20世纪90年代数据驱动,统计学习成为主流决策树(C4.5),支持向量机(SVM)21世纪初深度学习萌芽,无监督学习深度信念网络,支持向量聚类2012年至今深度学习大放异彩深度学习(CNN,RNN,Transformer),生成对抗网络(GAN),图神经网络(GNN)内容导航AI第9章
机器学习基础9.1机器学习发展历程9.3机器学习基础认知9.2机器学习定义9.6机器学习三大范式9.4机器学习研究方向9.5机器学习应用领域9.7常见机器学习算法9.2机器学习定义卡内基梅隆大学汤姆・米切尔教授于1997年提出经典定义,明确“经验(E)-任务(T)-性能度量(P)”核心框架:经验
E
指学习用的数据或环境交互记录(如标注“垃圾/非垃圾”的邮件数据集);任务
T
指需完成的具体工作(如邮件分类);性能度量P
指评估表现的标准(如分类准确率)。基于此,米切尔对机器学习的完整定义是:一个计算机程序从经验
E
中学习,以解决某类任务T,并用性能度量
P来衡量。如果以
P
衡量的、它在任务
T上的性能随着经验E的增加而提高,那么我们就说这个程序具备了学习能力。9.2机器学习定义【类比人类学习:学习骑自行车】我们是如何学会骑自行车的?父母不会给我们讲解牛顿力学,而是让我们自己去尝试、去摔倒、去调整(获取经验E);我们的任务T是“保持平衡并前进”;性能P则是“连续骑行不摔倒的距离”。在一次次的尝试中,我们身体(相当于“算法”)逐渐“悟”出平衡的诀窍,骑得也越来越稳。这正相当于机器学习算法的性能随着经验的积累而不断提升。【实例】台风预测系统任务T:根据气象条件预测是否会有台风。经验E:历史气象数据(如气温、湿度、气压等)以及这些数据是否最终导致了台风。性能P:系统在所有给定条件下,正确预测台风发生的次数占总预测次数的比例(准确率)。系统通过分析历史数据(E)来学习台风形成的规律,从而完成预测任务(T),并通过准确率(P)来评估和改进自己。内容导航AI第9章
机器学习基础9.1机器学习发展历程9.3机器学习基础认知9.2机器学习定义9.6机器学习三大范式9.4机器学习研究方向9.5机器学习应用领域9.7常见机器学习算法9.3.1多学科支撑基础机器学习计算机科学与工程学科算法与理论计算机科学计算理论软件工程数据库技术核心基础学科数学统计学概率论信息论支撑与交叉学科优化理论模式识别控制论信号处理数据挖掘应用与前沿交叉学科人工智能神经科学认知科学物理学生物学运筹学图9.2机器学习的多学科交叉示意图
9.3.2核心要素模型定义了从输入到输出的映射关系,是机器学习的基础。策略定义了如何评价模型的好坏,即损失函数或风险函数的选择。算法是求解最优模型的具体计算方法,即如何找到最小化损失函数的参数。机器学习图9.3机器学习的核心三要素9.3.3工作流程②数据清洗对收集到的数据进行清洗,处理异常值、缺失值,统一数据格式。①数据收集各种来源(数据库、传感器、互联网等)收集用于训练和测试的数据集,确保数据代表了实际问题的不同方面。④算法选择选择适合任务类型(分类、回归、聚类等)和数据特征的机器学习算法。③特征工程对数据进行转换和格式化,以确保它适合用于机器学习模型训练。⑤模型训练使用训练数据集来训练模型,让模型从数据中学习规律或模式,找到输入与输出之间的最佳映射关系。⑦模型优化如果模型在测试集上表现不佳,则需要对模型参数和算法进行微调或重新选择特征,旨在提高其准确度和效率。⑥模型评估使用测试数据集评估模型的性能(准确率、精确率、召回率等),确定其是否达到了预期的目标。⑧模型部署将训练好的模型部署到生产环境中,对新的未知的数据进行预测、分类或推荐,从而产生实际价值并实时监控其表现。图9.4机器学习工作流程示意图
9.3.3工作流程人类学习过程机器的学习过程核心目的上课学习理论知识数据收集获取原始信息总结复习,强化理解数据清洗整理、净化信息,使其可用梳理知识框架特征工程提取关键信息,构建有效输入学习方法的选择算法选择选择合适的学习方法课后作业练习模型训练通过实践调整和优化内部参数每周测验模型评估检查当前学习效果查漏补缺,改善方法模型优化根据反馈进行改进期末考试模型部署将所学知识用于解决新问题表9.2人类学习与机器学习过程类比内容导航AI第9章
机器学习基础9.1机器学习发展历程9.3机器学习基础认知9.2机器学习定义9.6机器学习三大范式9.4机器学习研究方向9.5机器学习应用领域9.7常见机器学习算法9.4.1核心研究领域机器学习研究覆盖多个细分方向,各方向有明确技术逻辑与应用场景:①监督学习,基于已标注数据(每个样本有明确“答案”)学习,核心用于分类与回归任务;②无监督学习,从无标注数据中自主挖掘内在结构与模式,主要应用于聚类与降维;③强化学习,通过智能体与环境交互,依据奖励或惩罚信号学习最优策略,典型应用如AlphaGo、下棋机器人;④集成学习,通过构建并融合多个“弱学习器”,形成性能更强的“强学习器”,随机森林是代表性技术;⑤深度学习,基于深层神经网络的学习方法,凭借强大特征提取与拟合能力,成为当前最热门、影响力最大的研究领域。9.4.2不同环境下的研究重点根据数据规模与技术场景,机器学习研究分为传统与大数据环境两大方向:①
传统机器学习研究:聚焦学习机制本身,以模拟人类学习过程为核心目标,重点探索决策树、随机森林、贝叶斯学习、早期神经网络等算法的优化与理论突破,例如决策树从ID3到C4.5、CART、SLIQ的演进,旨在持续提升算法效率与小规模数据处理能力;②
大数据环境下的机器学习研究:伴随各行业数据爆炸式增长,研究重心转向“高效处理巨量、多源、异构数据”,通过与分布式计算结合,采用并行、分治策略降低数据噪音与冗余,提升学习效率,此时机器学习更多承担“智能数据分析与服务技术”的角色,为行业决策提供支撑。内容导航AI第9章
机器学习基础9.1机器学习发展历程9.3机器学习基础认知9.2机器学习定义9.6机器学习三大范式9.4机器学习研究方向9.5机器学习应用领域9.7常见机器学习算法9.5机器学习应用领域应用领域具体应用举例计算机视觉人脸识别、医疗影像分析(如CT片病灶识别)、自动驾驶中的环境感知自然语言处理智能客服、机器翻译、搜索引擎、舆情分析语音技术智能音箱、语音输入法、实时字幕生成生物信息学基因序列分析、新药研发、蛋白质结构预测工业制造预测性维护(提前预警设备故障)、产品质量检测电商商品推荐(协同过滤,无监督学习)、用户流失预测(分类任务)、销量预测(回归任务)金融科技信用评分(分类任务)、欺诈检测(异常检测,无监督学习)、量化交易(强化学习
/回归预测)交通自动驾驶(强化学习
+计算机视觉)、交通流量预测(回归任务)、违章识别(图像分类)教育个性化学习推荐(协同过滤
+监督学习)、学生成绩预测(回归任务)、作弊检测(异常检测)医疗疾病诊断(图像分类、多分类任务)、病历文本分析(自然语言处理
+监督学习)、药物研发(强化学习优化分子设计)机器学习的应用已渗透到各行各业,成为推动社会智能化变革的核心引擎。目前,机器学习的典型应用领域如表所示。内容导航AI第9章
机器学习基础9.1机器学习发展历程9.3机器学习基础认知9.2机器学习定义9.6机器学习三大范式9.4机器学习研究方向9.5机器学习应用领域9.7常见机器学习算法9.6机器学习三大范式机器学习根据学习过程中监督信息的有无与类型,可分为监督学习、无监督学习和强化学习三大核心范式。它们分别对应“有教师指导的学习”“自主发现规律的学习”和“通过试错反馈的学习”三种机制,共同构成了机器学习的方法体系。9.6.1监督学习(1)定义与核心特征监督学习(SupervisedLearning)是从带有标签的训练数据中学习预测模型的过程。每个样本包含输入特征和对应的输出标签,系统通过拟合特征与标签之间的映射关系,实现对未知数据的预测。【类比人类学习】如同学生在老师指导下学习(老师给出题目与标准答案),模型在“标签”的“监督”下学习规律,不断优化自身以降低预测误差。(2)核心要素①
任务:明确的预测目标。如“判断是否为垃圾邮件”“预测明日气温”等。②
特征:反映样本属性的变量。如图像的像素值、文本的词频等。③
标签:样本的真实结果,是模型学习的“标准答案”。如房屋的真实成交价格。9.6.1监督学习(3)典型任务与学习目标①分类:输出为离散类别,如,二分类、多分类、手写数字识别、图像分类、情感分析等。②回归:输出为连续数值,如,房价预测、气温预测、股票走势预测、得分等。学习目标:最小化预测值与真实标签之间的误差。(4)工作原理在监督学习中,模型使用标记数据集进行训练,其中模型学习每种类型的数据。训练过程完成后,模型会根据测试数据(训练集的子集)进行测试,然后预测输出。带标签的数据标签模型训练训练测试数据图9.5监督学习工作原理示意图
9.6.1监督学习(5)工作流程监督学习一般可以通过以下5个步骤来进行处理,如图9.6所示。验证数据数据准备验证调优
测试评估预测结果模型训练图9.6监督学习工作流程示意图
9.6.1监督学习①数据准备:收集并清洗标注数据,划分训练集(用来训练模型)、验证集(确保模型没有过拟合)、测试集(用来评估模型效果)。②模型训练:使用训练集拟合模型参数。③验证调优:利用验证集调整超参数,防止过拟合。④测试评估:在测试集上评估模型泛化能力。⑤结果预测:将训练好的模型应用于新数据。9.6.1监督学习(6)应用案例:房价预测模型任务:基于房屋特征预测售价特征:面积、卧室数量、楼层、建造年份、地理位置等标签:真实的历史房价数据算法示例:线性回归、决策树、神经网络、随机森林过程:①数据准备:清洗数据,划分训练集、验证集与测试集;对特征进行标准化与编码。②模型训练:使用训练集训练模型(如随机森林)。③验证调优:在验证集上评估并调整超参数,防止过拟合。④测试评估:在测试集上计算RMSE等指标,评估最终泛化性能。⑤部署预测:将模型部署为API,用于新房屋数据的实时估价。9.6.1监督学习(7)应用场景监督学习适用于输入输出关系明确、标注数据充足的场景:①回归类:房价预测、股票收盘价预测、电力负荷预测、预期寿命估计、人口增长预测等。②分类类:垃圾邮件过滤、手写数字识别、客户流失预测、身份欺诈检测、图像内容识别、广告人气预测等。9.6.2无监督学习(1)定义与核心特征无监督学习(UnsupervisedLearning)是从无标签数据中发现隐藏结构或模式的过程。模型不依赖外部标注,而是通过数据自身的分布特性进行学习。【类比人类学习】如同学生自主观察事物寻找规律(无老师指导),也像考古学家面对杂乱的文物碎片,通过分析材质、纹理等特征发现隐藏关联,模型在“无监督”下自主探索数据的内在联系。9.6.2无监督学习(2)核心要素①输入特征:数据的关键属性,无对应标签,是模型挖掘规律的核心依据。例如,用户消费金额、消费频率、新闻文本关键词、图像像素特征、商品购买记录等。②数据分布:数据在特征空间中的自然分布模式,是聚类、降维任务的重要基础。例如,用户消费行为的集中/分散分布、文本特征的稀疏分布、图像像素的灰度值分布等。③结构关联:数据内部隐藏的组织关系或变量间的依存关系,是关联规则学习的核心对象。例如,商品购买的共现关系、特征间的相关性、数据样本的相似性差异等。9.6.2无监督学习(3)典型任务与学习目标①聚类:将样本分组,使组内相似、组间相异。如用户分群、新闻主题聚类、客户细分等。②降维:减少特征数量,保留主要信息。如,PCA降维、图像数据压缩、高维特征可视化等。③关联规则挖掘:发现特征之间的频繁共现关系。如,购物篮分析、关联推荐等。学习目标:揭示数据内在结构,支持数据理解与压缩。9.6.2无监督学习(4)工作原理无监督学习采用未标记的输入数据,它既没有分类也没有给出相应的输出。这些未标记的输入数据被输入机器学习模型以对其进行训练。首先,它将解释原始数据以从数据中找到隐藏的模式,然后应用合适的算法(如k-means聚类、决策树等),一旦应用了合适的算法,该算法就会根据对象之间的相似性和差异性将数据对象分组。原始数据未标记数据解释算法处理输出图9.7无监督学习工作原理示意图
9.6.2无监督学习(5)工作流程①
数据收集与预处理:收集仅含输入特征的原始数据,进行清洗、去噪、归一化、缺失值填充等处理,确保数据质量。②
明确任务方向:根据分析需求确定具体任务类型(聚类、降维或关联规则学习),明确挖掘目标。③
模型训练:将预处理后的数据输入对应模型,模型自主探索数据的分布、相似性或关联关系,无需人工标注引导。④
结果评估与优化:通过轮廓系数(聚类任务)、重构误差(降维任务)、支持度-置信度(关联规则任务)等指标评估结果质量,调整模型超参数以优化效果。⑤
结果应用:将挖掘出的结构、规律或简化后的数据应用于实际场景,如基于用户分群制定营销策略、利用降维数据进行可视化分析等。9.6.2无监督学习(6)应用案例:用户行为分群任务:基于用户消费与交互行为进行自动分群。特征:购买频率、平均金额、活跃时段、点击偏好、最近访问时间。算法示例:K‑means、层次聚类。输出:群体标签,如“高价值用户”、“潜力用户”、“低频用户”。过程:①数据预处理:清洗行为数据,构造特征并标准化。②模型训练与调优:使用聚类算法分组,通过轮廓系数等确定最佳聚类数。③结果解释与应用:分析各群体特征,定义业务标签,用于个性化营销与产品推荐。9.6.2无监督学习(7)应用场景无监督学习适用于数据无标签、希望探索结构或降维的场景:①
聚类类:电商用户分群、新闻主题聚类、客户分层、相似商品分组等。②
降维类:图像数据压缩、高维特征可视化、大数据维度简化等。③
关联规则类:超市商品摆放优化、电商推荐系统、用户行为关联分析等。9.6.3强化学习(1)定义与核心特征强化学习(ReinforcementLearning)是智能体通过与环境交互、依据奖励信号调整策略的学习方式。其核心是序列决策与延迟回报,强调在动态环境中学习最优行为。【类比人类学习】如通过奖励函数(例如考试的得分)的反馈来帮助机器改进自身的行为和算法。强化学习中的智能体(考试的人)通过行为(做题)与环境(考试)相互作用,而环境(考试)通过奖励函数(考试的得分)来帮助智能体调整做出行为决策的策略函数,从而在不断的循环中得到表现优异的行为策略(解题的方法)。9.6.3强化学习(2)核心要素强化学习包括智能体、环境、动作、状态和奖励5个核心要素组成,如图9.6所示①
智能体:学习和执行动作的主体。如,机器人、自动驾驶汽车、游戏AI等。②
环境:智能体所处的外部世界。如,游戏地图、物理世界、交通路况等。③
动作:智能体可执行的操作。如,机器人的前进/转弯、自动驾驶汽车的加速/减速等。④
状态:环境在某一时刻的描述。如,机器人所处的空间坐标,交通路况中的车辆分布等。⑤
奖励:环境对智能体动作的反馈信号(可正可负),引导学习方向。如机器人成功完成任务获得正向奖励、碰撞障碍物获得负向奖励等。环境Environment状态State奖励Reward智能体Agent动作Action序列决策长期收益策略:智能体在特定状态下选择动作的规则。如,90%概率选择最优动作,10%随机探索。价值函数:评估当前状态的长期收益,如,当前位置到终点的预期总奖励。9.6.3强化学习(3)典型任务与学习目标①
序列决策任务:核心是在连续的状态变化中,持续选择最优动作,实现长期目标。例如,游戏通关、机器人导航、自动驾驶路径规划等。②
行为优化任务:核心是通过试错调整动作,优化行为模式,提升任务完成效率。例如,工业机器人操作精度优化、资源调度策略优化等。③
动态适应任务:核心是应对环境的动态变化,快速调整策略,维持稳定性能。例如,复杂路况下的自动驾驶、动态资源需求下的调度优化等。学习目标:学习策略以最大化长期累积奖励。9.6.3强化学习(4)工作流程①
观察状态:智能体感知当前环境的状态。②
执行动作:根据当前策略,智能体做出具体动作。③
环境反馈:环境接收动作后发生变化,同时返回新状态和奖励信号(或称为强化信号)。④
学习改进:智能体根据正向/负向奖励信号更新策略。⑤
循环迭代:重复上述循环,通过成千上万次试错与体验,逐步优化策略,适应复杂环境。9.6.3强化学习(5)应用案例:游戏AI训练任务:训练智能体玩“超级马里奥”智能体:游戏角色马里奥环境:游戏地图(包含平台、敌人、金币、悬崖等元素)状态:马里奥的当前位置、生命值、周围敌人分布、金币位置等动作:移动、跳跃、发射子弹等奖励:吃到金币得+10分、踩死敌人得+100分、通关得+1000分,掉下悬崖扣-100分、被敌人攻击扣-50分9.6.3强化学习9.6.3强化学习关键流程:①试错交互:智能体根据当前策略选择动作(如跳跃),环境反馈新状态和奖励。②策略更新:智能体根据奖励信号(如得分)优化策略,学习哪些动作更有利。③迭代提升:重复以上过程数万次,智能体逐步学会躲避危险、收集物品,最终实现通关。本质:通过与环境的持续交互和来自奖励的反馈,自主学习最优行为策略,无需预先提供正确答案。9.6.3强化学习(6)应用场景适用于动态环境、决策具有序列性、需长期优化的场景:①游戏与仿真:AI玩家、虚拟训练②机器人控制:导航、抓取、步态③智能系统:自适应推荐、实时调度9.6.4三大学习范式的对比对比维度监督学习无监督学习强化学习核心特征数据含输入+标签,有明确监督信号数据仅含输入,无标签,无监督信号智能体与动态环境交互,靠奖惩反馈学习核心要素任务、特征、标签输入特征、数据分布、结构关联智能体、环境、动作、状态、奖励数据要求需大量标注数据(标注成本高)无需标注数据(获取成本低)无需预先准备数据,靠交互动态生成学习目标学习特征→标签的确定性映射,最小化预测误差探索数据内在结构、关联或降维学习最优行为策略,最大化长期累计奖励典型任务回归(预测连续值)、分类(划分离散类别)聚类(相似数据分组)、降维(减少特征数)、关联规则(挖掘数据关联)序列决策、行为优化、动态策略调整应用场景预测、判断类(如房价预测、垃圾邮件识别、疾病诊断、天气预报)数据探索、分群类(如用户分群、特征降维、商品关联推荐、新闻聚类)动态决策类(如游戏
AI、机器人导航、自动驾驶、资源调度)表9.4机器学习的三大范式的对比内容导航AI第9章
机器学习基础9.1机器学习发展历程9.3机器学习基础认知9.2机器学习定义9.6机器学习三大范式9.4机器学习研究方向9.5机器学习应用领域9.7常见机器学习算法9.7.2回归算法(1)核心思想与定义回归算法是监督学习中处理回归任务的核心方法,其本质是构建输入特征(自变量)与连续型输出标签(因变量)之间的映射关系模型,通过学习历史数据中的统计规律,实现对未知数据输出值的精准预测。简单来说,回归分析的核心是“用曲线/直线拟合数据点”,使得数据点到曲线/直线的距离差异最小化,从而捕捉变量间的内在关联。【类比生活场景】根据过去10年的降雨量(自变量)预测明年的粮食产量(因变量),本质就是通过回归模型找到降雨量与产量的关联规律。9.7.2回归算法(2)常见类型与特点①
线性回归线性回归是一种统计方法,用于建模因变量(响应变量)与一个或多个自变量(预测变量)之间的线性关系。在数学上,对于多元线性回归(包含多个自变量),模型可表示为:y=β₀+β₁x₁+β₂x₂+...+βnxn+ε其中:y是因变量(需要预测的变量),x₁,x₂,...,xn是自变量(输入特征),β₀是截距项(当所有自变量为0时y的基线值),β₁,β₂,...,βn
是回归系数(表示每个自变量对y的影响程度),ε是误差项(反映模型未解释的随机波动,通常假设服从均值为0的正态分布)9.7.2回归算法线性回归的核心假设是变量间存在线性关系,这意味着因变量可以表示为自变量的线性组合。例如,在一元线性回归(仅一个自变量)中,模型简化为Y=β₀+β₁X+ε,其目标是通过最小化误差平方和(如使用最小二乘法)找到最佳拟合直线。该模型广泛应用于预测分析(如房价预测、销售趋势估计)和关系量化(如评估广告投入对销量的影响)。9.7.2回归算法
9.7.2回归算法③多项式回归多项式回归是对线性回归的一种扩展,它通过添加多项式项来拟合数据中的非线性关系。其基本思想是将原始特征扩展为多项式特征,然后应用线性回归模型。多项式回归的方程形式如下:y=β₀+β₁x+β₂x2+...+βnxn+ε其中:y是因变量,x是自变量,β₀是截距项,β₁,β₂,...,βn
是回归系数,ε
是误差项。多项式回归能够拟合复杂的曲线模式,解决线性回归无法处理的复杂关系。9.7.2回归算法④正则化回归(岭回归、套索回归、弹性网络)针对多变量回归中可能出现的“过拟合”或“多重共线性”问题,通过在损失函数中加入正则项(惩罚系数),限制模型参数的绝对值大小,提升模型泛化能力。其中,岭回归采用L2正则化,套索回归采用L1正则化(可实现特征选择),弹性网络结合了两者的优点。⑤逐步回归逐步回归是一种自动化的特征选择方法,通过在回归模型中逐步添加或删除自变量,来找到一个最佳的自变量组合,以优化模型的某种性能指标。其核心目的是在保持模型解释力的同时,减少模型复杂度,防止过拟合,并提高模型的泛化能力。9.7.2回归算法(3)算法流程回归算法的核心流程可分为四步:①数据准备:收集含因变量和自变量的标注数据(如房价数据集),处理缺失值、异常值;②模型选择:根据变量关系(线性/非线性)和数据特点,选择合适的回归类型(如线性回归、多项式回归);③模型训练:通过最小二乘法等优化方法,求解模型参数(如权重w和偏置b),使预测值与真实值的误差最小;④模型评估与应用:用均方误差(MSE)、决定系数(R²)等指标评估模型性能,将训练好的模型用于新数据预测。9.7.2回归算法(4)应用案例:房价预测任务:根据房屋特征预测成交价格(因变量);自变量:面积、房间数、楼层、建造年份、地理位置;模型选择:多变量线性回归(假设特征与房价呈线性关系);训练过程:通过大量历史成交数据,学习得到各特征的权重(如面积权重0.25,地理位置权重0.3);预测结果:对于一套“100平米、3室、中层、2020年建造、学区房”的房屋,模型输出预测价格为150万元。y=0.25x+30x为面积,y为预测价格面积每增加1平米,价格平均上涨0.25万元图9.8线性回归拟合示意图
9.7.2回归算法(5)应用场景其典型应用场景包括:①预测类任务:房价预测、股票走势预测、广告点击率预测、电力负荷预测、学生成绩预测;②风险评估:根据患者年龄、体重、血压等特征,预测患糖尿病、心脏病的风险值;③物理模型拟合:基于实验数据(如温度与反应速率),拟合物理或化学规律的数学模型。9.7.3K-近邻算法(1)核心思想与定义K-近邻算法(K-NearestNeighbor,
KNN)是一种基于实例的惰性学习算法,核心思想极为朴素:“物以类聚,人以群分”。它无需预先训练复杂模型,而是直接利用训练数据集中的“邻居”信息对新样本进行预测——对于新输入的实例,在训练集中找到与它最相似的K个样本(即“K个邻居”),通过多数投票(分类任务)或平均值计算(回归任务),确定新样本的类别或数值。KNN算法的关键在于“相似性度量”(常用欧氏距离、曼哈顿距离)和“K值选择”。其本质是利用已有数据的局部特征进行决策。【类比生活场景】判断一个新同学的兴趣爱好(分类),可以观察他最亲近的3个(K=3)或5个(K=5)同学的兴趣,多数人的爱好即为该新同学的预测兴趣。9.7.3K-近邻算法
9.7.3K-近邻算法(3)算法流程KNN算法的核心流程可分为六步:
①数据准备:收集带标签的训练数据,对特征进行归一化(避免量纲差异影响距离计算);②确定参数:选择距离度量方式(如欧氏距离)和K值(常用交叉验证确定);③计算距离:对于待预测样本,计算它与训练集中所有样本的距离;④筛选邻居:按距离从小到大排序,选择前K个样本作为“邻居”;⑤结果推断:分类任务用多数投票法确定类别,回归任务用平均值确定数值;⑥输出结果:返回待预测样本的预测类别或数值。9.7.3K-近邻算法(4)应用案例:K值对分类结果的影响假设我们有一个二维数据集,包含红色三角形(类别A)和蓝色正方形(类别B)两类样本,需对绿色圆点(新样本)进行分类。图中绿色的点就是我们要预测的那个点,假设K=3。那么KNN算法就会找到与它距离最近的三个点(这里用圆圈把它圈起来了),看看哪种类别多一些,比如这个例子中是蓝色三角形多一些,新来的绿色点就归类到蓝三角了,如图9.9所示。图9.9k=3时,KNN算法分类示意图
9.7.3K-近邻算法但是,当K=5的时候,判定就变成不一样了。这次变成红圆多一些,所以新来的绿点被归类成红圆,如图9.10所示。图9.10k=5时,KNN算法分类示意图
可见,K值的改变会直接导致分类结果变化,因此合理选择K值是KNN算法的核心步骤。9.7.3K-近邻算法(5)应用场景K-近邻算法典型应用场景包括:①分类任务:手写数字识别、人脸识别、疾病诊断、垃圾邮件初步过滤;②回归任务:房价预测、气温预测、用户评分和消费金额预测;③推荐系统:基于用户行为相似性的商品推荐、电影推荐。9.7.4决策树(1)核心思想与定义决策树(DecisionTree,DT)算法是一种基于树形结构的监督学习算法,核心是将复杂的决策过程拆解为一系列简单的二元或多元判断,最终形成一条从根节点到叶节点的分类路径。每个内节点代表一个特征判断,每个分支代表判断结果,每个叶节点代表一个最终分类结果。决策树的构建过程就是“特征选择”和“树的生长”:从根节点开始,每次选择最能区分样本类别的特征进行分裂,将样本划分为不同子集,重复该过程直到子集中的样本属于同一类别(或达到停止条件),最终形成完整的树形结构。【类比生活场景】判断一只动物是否为鸟,可通过“是否有羽毛→是否会飞→是否有喙”的逐步判断,最终得出结论,这一系列判断构成一棵简单的决策树。9.7.4决策树(2)核心原理决策树的关键是特征选择(如何选择特征进行分割)和
剪枝(如何避免过拟合):①特征选择:目标是选择使分割后的数据“纯度最高”的特征,常用指标有:信息增益(ID3算法):基于信息熵,衡量分割后不确定性减少的程度;信息增益比(C4.5算法):解决信息增益偏向多取值特征的问题;基尼系数(CART算法):衡量样本集合的不纯度,基尼系数越小,纯度越高。②剪枝:决策树容易过度分割数据(过拟合),剪枝通过删除部分分支简化模型,提高泛化能力,分为:预剪枝:训练过程中限制树的深度、最小样本数等,提前停止生长;后剪枝:训练完成后,删除对模型性能无贡献的分支。9.7.4决策树(3)算法流程①数据准备:收集含特征和标签的训练数据,处理离散/连续特征;;②特征选择:计算每个特征的分割指标(如信息增益),选择最优特征作为根节点;③递归分割:按最优特征的取值将数据分为子集,对每个子集重复特征选择和分割过程;④停止条件:当子集样本全为同一类别(分类)、或方差小于阈值(回归)、或达到最大深度时,停止分割,生成叶子节点;⑤剪枝优化:对生成的决策树进行剪枝,删除冗余分支,避免过拟合;⑥预测应用:新样本从根节点开始,按特征判断条件沿分支向下,最终到达叶子节点,输出分类标签或回归值。9.7.4决策树(4)应用案例:动物识别决策树按照表9.7所示,识别动物是否为鸟,构建决策树如图9.11所示:是否属于鸟类
有羽毛吗?会飞吗?是动物吗?属于鸟类喜鹊是是是是蝙蝠否是是否飞机否是否否小狗否否是否鸵鸟是否是是表9.7识别动物是否为鸟有羽毛吗?会飞吗?不是鸟类是动物吗?是动物吗?是鸟类不是鸟类不是鸟类是鸟类无有会不会是不是是不是(喜鹊、蝙蝠、飞机、小狗、鸵鸟)(蝙蝠、飞机、小狗)(喜鹊、鸵鸟)(鸵鸟)(喜鹊)图9.11判断一个物体是否属于鸟类决策树
决策树通过“有羽毛吗→会飞吗→是动物吗”的三层判断,实现对鸟的分类。对于新样本“有羽毛、会飞、是动物”,从根节点出发,沿“是→会→是”路径到达叶节点,判定为“喜鹊属于鸟类”。9.7.4决策树(5)应用场景决策树的可解释性非常高,可以很容易的解释清楚其计算逻辑,所以适合各种需要强解释性的应用场景:①金融领域:信用评分、风险评估、欺诈检测等。②医疗诊断:医疗诊断,如疾病诊断、药物选择等。③市场营销:市场营销中的用户分类、客户细分等。④生物医学领域:基因表达数据分析、蛋白质结构预测等。⑤电子商务:推荐系统、用户行为分析等。9.7.5随机森林(1)核心思想与定义随机森林(RandomForest,RF)是一种集成学习算法,核心思想是“众智成城”——通过随机采样构建多个独立的决策树(弱学习器),再通过投票(分类)或平均(回归)融合所有决策树的结果,形成性能更强的“强学习器”。随机森林的“随机性”体现在两个方面:①样本随机:从训练集中随机抽取部分样本(有放回采样,Bootstrap采样),用于训练每个决策树;②特征随机:每个决策树训练时,从所有特征中随机选择部分特征,仅基于这些特征进行分割。9.7.5随机森林(2)核心原理随机森林基于Bagging(Bootstrapaggregating)集成策略:①Bootstrap采样:从原始数据集中有放回地随机采样,生成多个子数据集(每个子数据集样本量与原始数据相当);②随机特征选择:每棵决策树训练时,仅从所有特征中随机选择部分特征进行分裂;③集成投票:所有决策树训练完成后,分类任务取多数树的预测类别,回归任务取所有树预测值的平均值。
9.7.5随机森林(3)算法流程采样→训练多棵树→集成决策→输出结果Bootstrap①样本采样:从原始训练集通过Bootstrap进行M次有放回采样,生成M个不同与原数据集大小相同的子数据集;②构建单树:每个子数据集训练一棵决策树,训练时随机选择部分特征;③生成森林:重复步骤1-2,得到
M棵决策树(构成随机森林);④集成预测:待预测样本输入所有决策树,分类任务采用“多数投票制”确定最终类别,回归任务采用“平均值法”确定最终预测值;⑤输出结果:返回集成后的预测结果。9.7.5随机森林(4)应用案例:客户流失预测任务:预测电商客户是否会流失(二分类:流失/不流失);特征:消费频率、平均消费金额、最近一次消费时间、购买商品种类数;模型选择:随机森林(100棵决策树);训练过程:①从10000条客户数据中随机采样,生成100个子集;②每个子集随机选择3个特征,训练一棵决策树;③100棵决策树对训练集的预测准确率均在75%-85%之间;预测结果:对某客户(消费频率2次/月、平均消费300元、最近消费距今日15天、购买3类商品),100棵决策树中有78棵预测“不流失”,22棵预测“流失”,多数投票判定为“不流失”。9.7.5随机森林(5)应用场景①分类任务:客户信用评级、欺诈检测、疾病诊断、图像分类、文本分类;②回归任务:销量预测、股价预测、房地产价格预测、环境污染物浓度预测;③特征工程:评估特征重要性(随机森林可输出每个特征的贡献度)。9.7.6朴素贝叶斯算法(1)核心思想与定义朴素贝叶斯算法是基于贝叶斯定理的监督学习算法。其核心思想是:通过先验概率和条件概率计算后验概率,以后验概率最大的类别作为预测结果。“朴素”体现在一个关键假设:所有特征之间相互独立(条件独立性假设)。这一假设简化了计算复杂度,使算法能快速处理高维数据,尽管在现实中特征独立性往往不成立,但该算法在许多场景下仍能取得较好的效果。【类比生活场景】判断一封邮件是否为垃圾邮件,已知“垃圾邮件中出现‘中奖’关键词的概率”(条件概率)和“整体垃圾邮件的比例”(先验概率),当新邮件出现“中奖”关键词时,可通过贝叶斯定理计算它是垃圾邮件的概率(后验概率),若概率高于阈值则判定为垃圾邮件。9.7.6朴素贝叶斯算法
9.7.6朴素贝叶斯算法(3)算法流程朴素贝叶斯算法的流程分为“准备工作、分类器训练、应用预测”三个阶段,如图9.13所示:图9.13朴素贝叶斯算法流程图9.7.6朴素贝叶斯算法(4)应用案例:垃圾邮件过滤任务:判断某封邮件是否为垃圾邮件(二分类:垃圾/正常)。训练数据:1000封邮件,其中300封为垃圾邮件(先验概率P(垃圾)=0.3),700封为正常邮件(P(正常)=0.7)。特征:邮件中出现的关键词(如“中奖”“转账”“领取”“会议”“工作”)。条件概率统计:垃圾邮件中“中奖”关键词出现的概率P(中奖|垃圾)=0.6;正常邮件中“中奖”关键词出现的概率P(中奖|正常)=0.05。新样本:邮件内容含“中奖”关键词。预测过程:计算其为垃圾邮件的后验概率: P(垃圾|中奖)=P(中奖|垃圾)×P(垃圾)=0.6×0.3=0.18 P(正常|中奖)=P(中奖|正常)×P(正常)=0.05×0.7=0.035比较后验概率:由于0.18>0.035,判定该邮件为垃圾邮件。9.7.6朴素贝叶斯算法(5)典型应用场景①文本分类:垃圾邮件过滤(特征为邮件关键词)、新闻主题分类(特征为新闻词汇)、情感分析(特征为评价词汇)、文本关键词提取;②自然语言处理:词性标注、文本自动摘要、机器翻译中的语言模型;③医疗诊断:特征为症状,预测疾病类型;④客户分类:特征为消费行为,预测客户类型;⑤其他场景:人脸识别、手写数字识别(小规模数据场景)9.7.7K-均值聚类(1)核心思想与定义聚类算法是无监督学习的核心算法,核心目标是“物以类聚”——在无标签数据中,自动发现数据的内在结构,将具有相似特征的样本聚为一类,使同一簇内样本相似度高、不同簇间样本相似度低。K均值聚类(K-Means)是最常用、最经典的聚类算法,其核心是:通过迭代优化找到K个簇的质心(中心),使簇内样本到质心的距离之和最小化。【类比生活场景】在人群中寻找K个“核心人物”,让每个其他人都归属于距离最近的核心人物,最终形成K个群体,每个群体围绕一个核心人物。9.7.7K-均值聚类
9.7.7K-均值聚类(3)算法流程K-均值聚类算法流程简单、效率高,核心步骤如下:①初始化质心:从N个样本数据中随机选取K个对象,作为初始的聚类中心;②分配样本:计算每个样本到K个质心的距离,并逐个分配到距离其最近的簇中;③更新质心:计算每个簇内所有样本的特征平均值,作为新的质心;④收敛判断:若质心位置变化小于阈值(或迭代次数达到上限),停止迭代;否则返回步骤2⑤输出结果:返回每个样本的簇标签和最终质心位置。9.7.7K-均值聚类下图展示了K-均值聚类算法(K=3)的聚类过程,在聚类结束之前,类中心会不断移动,而随着类中心的移动,样本的划分情况也会持续发生改变。②根据每个数据计算并确定最接近的集群的中心点③每个数据被分类到确定的集群中点①随机设置k=3作为群集的中心点④计算每个集群数据的重心,并将集群的中心点移动到那里⑤再次计算最近集群的中心点,并将每个数据分类到集群里⑥重复“每个数据分类到集群”和“移动到中心点的重心”⑨直到中心点收敛,操作结束⑦重复“每个数据分类到集群”和“移动到中心点的重心”⑧重复“每个数据分类到集群”和“移动到中心点的重心”9.7.7K-均值聚类(4)应用案例:电商用户分群任务:某电商平台收集了5000名用户的消费特征数据,采用K-均值聚类(K=3);特征:月消费金额、月购买次数;流程:①迭代1:随机选择3个用户作为初始质心,将所有用户分配到最近的质心,形成3个临时簇;②迭代3:更新每个簇的质心(如簇1质心:月消费5000元、购买10次;簇2:月消费1000元、购买5次;簇3:月消费200元、购买1次);③迭代5:质心稳定,最终聚类结果为:簇1(高价值用户,1000人)、簇2(普通用户,3000人)、簇3(低活跃用户,1000人)。平台针对高价值用户推出VIP服务,对普通用户发放满减券,对低活跃用户发送唤醒短信,提升整体转化率。9.7.7K-均值聚类(5)应用场景①客户分群:电商用户分群(高价值活跃用户、价格敏感用户、沉睡用户)、银行客户分层(VIP客户、普通客户、潜在流失客户);②数据探索:未知数据的结构分析(如基因序列聚类、图像像素聚类)、异常检测(远离所有簇的样本为异常);③内容推荐:新闻主题聚类、商品相似性分组、用户兴趣聚类(用于协同过滤推荐);④其他:城市区域划分(基于人口、经济指标)、气象数据聚类(基于气温、湿度)9.7.8支持向量机(1)核心思想与定义支持向量机(SupportVectorMachine,SVM)是一种基于统计学习理论的监督学习算法,用于分类和回归分析。核心思想是“寻找最优超平面”——在特征空间中,找到一条(二维)或一个(高维)能将不同类别样本完全分开的超平面,且使超平面到两类样本的“间隔”最大化。其中,距离超平面最近的样本称为“支持向量”,这些样本点决定了超平面的位置和间隔大小,是SVM的核心支撑。对于非线性可分的数据,SVM通过核函数将数据映射到更高维的特征空间,使原本非线性可分的数据在高维空间中变得线性可分,从而间接找到最优超平面。【类比生活场景】在平面上无法分开的两类点,通过“折叠”平面(映射到三维),可以找到一个平面将它们分开。9.7.8支持向量机(2)核心原理1)线性数据分类原理:最大间隔分类直观理解:最优决策边界的选择SVM的目标是找到“最优超平面”,满足两个条件:能将不同类别的样本完全分离(线性可分情况下)、
超平面到两类样本的最小距离(间隔)最大。最大间隔原则就是通过最大化两类样本最近点到超平而的距离之和(间隔),最优分界线即是距离两类点间隔最大的直线。假设需用超平面分隔两类数据点(如红、蓝样本),虽存在无数分离超平面,但最优解需满足:即便数据有轻微扰动,分类结果仍稳定。这如同划定国界时,理想边界应远离双方聚居区,为可能的领土争议预留缓冲空间。9.7.8支持向量机间隔最大化的意义在于:间隔越大,模型的泛化能力越强,对新样本的分类准确率越高。如图9.15所示:图9.15SVM最优超平面示意图
9.7.8支持向量机数学实现:支持向量与优化问题SVM通过以下步骤实现最大间隔:①间隔定义:计算各数据点到超平面的距离,两侧最近点(支持向量)的距离之和即为间隔;②
优化求解:通过最小化超平面参数的范数来最大化间隔,同时确保分类准确性(硬间隔)或允许可控误差(软间隔);③支持向量特性:最终模型仅由少数支持向量决定,其余样本对分类边界无影响。此特性使SVM兼具计算效率与模型简洁性。简言之,SVM如同精明的仲裁者,仅聚焦关键样本点(支持向量),忽略冗余信息,最终构建出鲁棒性极强的分类边界。9.7.8支持向量机2)非线性数据分类原理:核函数数据线性不可分时,SVM通过核函数将数据映射到高维空间,使其线性可分。常见核函数①线性核(原空间分类,适合线性可分数据)②多项式核(捕捉多项式关系)③径向基函数核(RBF核,高斯的数映射到无限维空间,适合复杂非线性)④Sigmoid核(类似神经网络激活函数,处理特定非线性)核函数避免显式计算高维坐标,直接在低维空间计算高维内积,大幅降低计算复杂度。9.7.8支持向量机(3)算法流程①数据准备:收集带标签的训练数据,对特征进行归一化;②核函数选择:根据数据分布选择核函数(如线性数据用线性核,非线性数据用高斯核);③模型训练:通过训练数据求解最优超平面,确定支持向量和模型参数;④模型评估:用测试集验证模型分类准确率,调整核函数参数优化性能;⑤预测应用:将新样本映射到特征空间,根据其在超平面的一侧判断类别。9.7.8支持向量机(4)应用案例:人脸识别任务:识别输入图像中的人脸是否为目标人物(二分类:是/否);训练数据:1000张人脸图像(500张目标人物,500张非目标人物),每张图像提取128维特征(如面部关键点距离);
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 医疗行业市场拓展与国际化进程
- 2025年青海省限制临床应用的医疗技术
- 产科护理的护理安全
- 感染病快速检测与诊断
- 2025围手术期抗菌药物合理用药
- 医疗卫生政策与医疗健康产业政策优化策略
- 护士考级必背:护理人员疲劳风险管理课件
- 2026年秋招:iOS开发题库及答案
- 2026年浦发银行招聘笔试题及答案
- 2026年暖通工程师校招面试题及答案
- 事故伤害现场处置方案(包括触电、机械、高空坠落等12项)
- 2026年全国“质量月”活动知识竞赛题库及答案
- 4.1《维护秩序靠规则》 课件 2026-2027学年道德与法治八年级上册 统编版
- 结构化国企面试题及答案解析(2026年版)
- 多磺酸粘多糖乳膏在常见皮肤疾病应用的专家指导意见
- 26个英语字母及字母组合发音规律
- JJG 692-2010无创自动测量血压计
- 城镇道路检查井新建及改造技术导则
- 不停电作业推广方案
- 车辆自动驾驶系统应用 课件全套 能力模块1-5 对自动驾驶系统的基本认知- 掌握自动驾驶系统的应用
- 预拌混凝土企业试验室资料管理系统(全自动化)
评论
0/150
提交评论