版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能通识§3.1机器学习的基本概念课程导航01开篇引入什么是机器学习?通过生动的生活案例,从本质上理解其“让计算机从数据中学习”的核心思想。02机器学习与人类思维方式的关联跳出传统编程逻辑,理解机器学习基于数据的归纳与演绎思维,掌握其解决问题的独特视角。03核心概念掌握特征、标签、模型等关键术语,厘清监督学习与无监督学习两大核心任务的区别。04发展简史:从萌芽到爆发回顾机器学习的演进之路,从早期的符号主义、统计学习,到深度学习时代的爆发,理解技术发展的脉络与关键转折点。05三大基石:数据、模型与算法深入解析构成智能系统的三大支柱:数据是燃料,模型是引擎,算法是驱动逻辑,理解三者如何协同工作。PART01开篇引入:什么是机器学习?机器学习是人工智能的核心驱动力,让计算机脱离“指令式编程”的固有框架,
通过数据自我迭代与模型构建,赋予机器像人类一样“从经验中学习”的能力。📊数据驱动的智能引擎🧠自主进化的决策模型从人类学习到机器学习(MachineLearning,ML)01人类的学习逻辑我们通过经验积累来改变认知。这是一个通过观察、归纳形成对世界理解(规律)的过程,进而利用这些规律去预测未来、解决未知的新问题。02机器学习的本质这是对人类学习行为的智能模仿。计算机通过机器学习算法分析海量历史数据(即机器的“经验”),自动挖掘数据中的模式与逻辑,从而构建出能够进行预测和决策的数学“模型”。经验↔数据人类的过往经验,对应机器的历史数据输入,是模型训练的基础原料。规律↔模型人类总结的认知规律,对应机器训练出的算法模型,是实现预测的核心依据。一个生动的例子:小厨师的美食探索之旅(1/3)让我们从一个小故事“小厨师的美食探索之旅”,开启对机器学习的探索01观察与记录·数据收集🍳厨师视角:每日穿梭市场记录食材色泽、气味与价格,探店品尝并拆解风味配方,积累烹饪的“原始素材库”。
🤖ML视角:为模型采集任务相关的特征数据(如房子的面积、地段、年份等)与目标值,构建训练模型的“燃料库”。02整理与筛选·数据预处理🍳厨师视角:剔除不新鲜食材,补齐遗漏配料,清洗食材杂质,确保烹饪原料的纯净与完整。
🤖ML视角:对数据进行预处理,如清洗、去重、填补缺失值与剔除异常值等,是保障模型预测准确性的“质量安检”。一个生动的例子:小厨师的美食探索之旅(2/3)03/发现关键要素(特征工程)👨🍳厨师视角:寻找灵魂食材小厨师在烹饪中敏锐捕捉到,新鲜的香草与特定的调味料是激发食材本味、提升菜肴层次的关键所在,这是决定菜品风味的基础。🤖ML视角:核心特征提取在数据中筛选出对结果影响最大的关键属性。例如在房价预测模型中,“核心地段”与“房屋面积”就是决定预测准确性的核心特征。04/实践与调整(模型训练)👨🍳厨师视角:试错与精进反复试做,若口味不佳则分析原因,动态调整食材配比与烹饪时长,通过不断的试错与优化,最终做出令人满意的佳肴。🤖ML视角:参数迭代优化算法利用训练数据持续调整模型的内部参数,通过反复迭代优化,使模型逐渐拟合数据中的潜在规律,从而具备准确的预测能力。一个生动的例子:小厨师的美食探索之旅(3/3)05反馈与改进厨师的试错与优化邀请亲友品尝并收集真实反馈,根据口味建议调整配方与火候,反复打磨菜品细节,直到达到最佳口感。模型的评估与验证使用独立的测试数据集来检验模型性能,评估其泛化能力,并据此优化模型参数。06创新与推广招牌菜的诞生与传播在扎实的基本功上创新研发特色新菜式,推向餐厅或市场,接受更广泛食客的检验与喜爱,建立个人品牌。模型部署与实际应用将训练好的模型部署到生产环境中,处理真实场景中的未知数据,解决业务中的实际问题,创造商业价值。07与时俱进持续精进与学习紧跟美食潮流,不断学习新的烹饪技法,尝试新奇的食材组合,突破自我,保持厨艺的生命力与新鲜感。模型的更新与迭代随着数据分布的变化和业务需求的升级,持续利用新数据对模型进行重新训练或微调,确保模型始终精准有效。💡核心洞察:从厨艺修炼到模型构建,“反馈优化-落地应用-持续迭代”的闭环思维,是成就卓越的共同基石。PART02机器学习与人类思维方式的关联——归纳与演绎从海量数据中归纳共性规律,再以逻辑演绎推演出未知结论,
这两种思维的交织,构成了人工智能自我进化的底层逻辑。归纳·从数据到规律机器学习通过样本特征,自动提炼出数据背后的隐含模式与关联,让机器学会“总结经验”。演绎·从规律到结论基于已建立的模型与规则,对新的未知数据进行推理、预测与决策,实现“举一反三”。归纳推理:从特殊到一般归纳推理赋予机器“从经验中学习”的能力。它不依赖于预设的硬性规则,而是通过对大量具体样例的观察与分析,自主提炼出能够泛化到未知场景的通用规律。01.机器学习的核心范式从具体的观察或样例中总结出一般性规律的过程,也被称为“从样例中学习”。它是让AI具备自我进化能力的基础,无需人工逐条编写规则。02.核心:从有限到无限的“泛化”不仅是记忆已知的例子,更是通过对特征的归纳,提炼出适用于所有情况的通用规则。这让模型能够对从未见过的新数据做出准确判断。03.案例:自动判断西瓜好坏通过学习大量西瓜的色泽、根蒂形态、敲击声音等特征与“好瓜”标签的关联,模型最终归纳出通用规则,实现对陌生西瓜的品质预测。演绎推理:从一般到特殊核心逻辑定义演绎是从普遍成立的大前提出发,结合具体的小前提情况,推导出必然成立的具体结论的逻辑思维过程。它是一种“从一般规律到特殊结论”的严密推导方式。经典模型:逻辑三段论●大前提:所有田径运动员都需要长期高强度训练,因此拥有强壮的体魄。
●小前提:小明是校田径队的主力短跑选手,接受系统的专业训练。
●结论:由此可推,小明具备超越常人的身体素质与爆发力。应用一:专家系统早期AI的核心逻辑,将专家知识转化为“规则库(大前提)+事实库(小前提)”,通过机器自动演绎推理,广泛用于医疗诊断、故障排查等领域。应用二:自动驾驶决策感知系统识别“前方有行人(小前提)”,触发预设规则“遇行人需减速避让(大前提)”,系统立即执行减速停车指令,是典型的实时演绎推理。混合推理:归纳与演绎的结合归纳与演绎并非互斥,而是解决复杂问题的“黄金搭档”。前者从特殊经验中提炼普遍规律,后者用普遍规律指导具体实践,二者结合构成了严谨且富有创造力的推理闭环。01经典范式:法官的判案逻辑归纳:从个案到原则
研究过往类似案件,归纳出通用的责任划分标准(如“闯红灯者负主责”),完成从特殊现象到一般规律的提炼。演绎:从原则到判决
将归纳出的法律原则应用于当前案件,结合被告闯红灯的具体事实,推导出其应承担主要责任的结论,实现从一般到特殊的应用。02前沿应用:AI的智能决策生成模型:规律与创造
先归纳学习海量数据的潜在分布规律,再基于这些规律演绎生成全新的、符合逻辑与审美的逼真样本(如图像、文本)。强化学习:策略与行动
智能体通过与环境交互归纳出最优策略规律,再在具体情境中演绎策略,做出最大化收益的实时决策,实现从经验到行动的闭环。✨核心价值:归纳赋予模型“从经验中学习”的能力,演绎赋予其“解决新问题”的智慧,二者结合是实现通用智能的关键。Part3机器学习的核心概念01.定义与核心思想机器学习的一种经典定义是:利用经验来改善计算机系统自身的性能的技术。这个概念最早由汤姆·米切尔教授给出。01感知与学习从外部环境中获取原始数据,通过算法提取关键特征,完成对未知模式的初步探索与信息提取。02知识存储将学习到的规律与经验转化为可复用的模型参数,存储于系统中,形成结构化的知识体系以备调用。03决策与应用基于沉淀的知识模型,对新场景做出智能决策或预测,持续优化系统性能与用户体验。1973年,萨利斯(Saris)曾对学习系统给出以下定义:“一个能够从环境未知特征中学习信息,并将这些信息用于未来决策或控制以改进性能的系统。”这一核心思想奠定了机器学习的理论基础。汤姆·米切尔(TomMitchell)
卡内基梅隆大学教授,机器学习领域权威学者,提出了该领域的经典定义。02.核心要素解析——数据数据是驱动机器学习模型运转的“燃料”,
它的质量直接决定了模型的上限与表现。数据(Data):机器学习的基石数据是模型训练的原材料。没有高质量的数据,再复杂的算法也无法发挥作用。我们将数据分为训练集与测试集,各司其职,共同构建可靠的模型评估体系。训练样本带标签的单个数据点,是模型学习的最小单元,如一张带“猫”标签的图片。训练集样本的集合,模型在此数据集上进行参数学习与优化,是模型的“课堂”。测试集独立于训练集的数据集,用于客观评估模型的泛化能力,即“考试卷”。💡关键原则:质量与划分黄金法则:
“垃圾进,垃圾出”。数据必须准确、无偏见且具有代表性。科学划分:
经典比例为7:3或8:2,严格分离训练集与测试集,避免数据泄露。02.核心要素解析——模型模型(Model):学习的产物模型是机器学习系统从数据中提炼出的“规律”与“模式”,以数学函数或计算图的形式存在,承担着将输入数据映射为期望输出的核心功能,是智能决策的基石。模型的本质:抽象与近似
对现实世界关系的数学化表达。例如预测房价时,模型就是对面积、地段等特征与房价之间关联的精准抽象与量化。模型的表示:多样且灵活
形式不拘一格,既可以是简单的线性方程(如y=ax+b),也能是包含多层隐藏层的复杂神经网络,其复杂度随任务需求动态调整。图示:典型的多层神经网络结构,直观展示了输入层、隐藏层与输出层之间的连接关系,是处理复杂非线性问题的典型模型代表。02.核心要素解析——算法01算法Algorithm·学习的方法算法是实现智能学习的“大脑逻辑”,它定义了数据处理与参数优化的具体步骤。通过在训练数据上反复迭代,不断调整模型参数以最小化预测误差。从基础的线性回归到复杂的神经网络,算法决定了模型如何从数据中提取规律并做出决策。02训练Training·学习的过程训练是将算法付诸实践的动态过程。利用标注数据驱动模型自我进化,通过“损失函数”量化预测偏差,再借助“优化器”反向传播误差并调整参数。这是一个持续的“预测-评估-修正”闭环,直至模型收敛,具备稳定的泛化能力。流程可视化:
图示清晰展现了机器学习的核心闭环:从输入数据开始,经由计算函数生成预测输出,通过与期望输出的对比产生反馈信号,最终驱动学习算法更新模型参数,实现智能的自我优化。三大基石:数据、模型与算法决策树模型结构
直观呈现数据分类与决策的逻辑路径01数据:AI的“燃料”作为机器学习的基础,是驱动模型运转的核心燃料。高质量数据是模型发挥作用的前提,没有它,再复杂的模型也难以输出精准结果,是驱动AI学习的核心动力。02模型:AI的“大脑”模型是承载规律的核心载体,本质是实现输入特征到输出预测的数学映射结构。03算法:AI的“训练师”指导模型学习的核心规则,算法承担模型优化的核心职能,是构建模型的“训练师”。它依托梯度下降这类优化方法迭代调整模型参数,不断提升模型的准确性。04.机器学习的分类(1)监督学习(SupervisedLearning)核心定义与特点定义:利用带有明确标签的数据进行训练,模型学习输入特征与输出标签之间的映射关系。特点:训练过程如同“老师指导”,每个输入都有对应的标准答案作为反馈,学习目标明确。关键任务与算法核心任务:主要解决分类(输出离散值)与回归(输出连续值)问题。经典算法:线性回归、逻辑回归、支持向量机(SVM)、决策树、随机森林及神经网络等。广泛应用场景监督学习是目前应用最成熟的领域,涵盖:计算机视觉:图像分类、人脸识别自然语言:垃圾邮件过滤、情感分析金融领域:信贷风险评估、股票预测💡总结:监督学习是人工智能落地的基石,通过“老师指导”的方式,让模型具备强大的预测与判断能力。04.机器学习分类(2)无监督学习(UnsupervisedLearning)自主探索的本质无需人工标注的“标准答案”,模型通过分析无标签数据,自主发现数据内部的结构、模式或概率分布。如同让AI在没有老师指导的情况下,独立探索数据背后的隐藏规律。两大典型任务聚类分析:将相似特征的数据自动归为若干群组,如用户分群。
维度约简:在保留核心信息的前提下降低数据特征维度,简化计算并提升效率。算法与落地场景经典算法:K-Means、DBSCAN、PCA、关联规则挖掘。
应用领域:客户画像细分、社交网络社区发现、金融交易异常检测、电商商品推荐。核心价值:无监督学习打破了对人工标注数据的依赖,能够从海量原始数据中挖掘出未知的潜在价值,是实现数据驱动决策和智能化分析的关键基石。04.机器学习分类(3)半监督学习(Semi-supervised)结合少量有标签数据与海量无标签数据进行训练,有效解决标注成本高昂的问题。通过挖掘无标签数据中的潜在结构,显著提升模型的泛化能力,广泛应用于医疗影像分析、图像检索等场景。(4)强化学习(ReinforcementLearning)智能体通过与环境持续交互、不断试错来优化策略,以“奖励与惩罚”机制驱动学习目标。其核心是寻求长期累积奖励的最大化,是实现自主决策的关键技术,广泛应用于游戏AI、机器人控制及自动驾驶领域。强化学习典型案例:AlphaGo结合强化学习与蒙特卡洛树搜索,在围棋领域战胜人类顶尖棋手,标志着人工智能在复杂决策领域的重大突破。04.其他机器学习分类方法线性vs.非线性模型线性模型:
假设输入输出呈线性关系,模型结构简单,具备极强的可解释性,典型代表为线性回归。非线性模型:
能捕捉复杂的非线性特征与交互关系,拟合能力更强,典型代表为神经网络、决策树。概率vs.非概率模型概率模型:
对不确定性进行建模,输出结果的概率分布而非单一预测值,典型代表为朴素贝叶斯、高斯混合模型。非概率模型:
直接输出确定性的预测结果,不涉及概率分布的估计,典型代表为支持向量机(SVM)。参数化vs.非参数化参数化模型:
模型结构由固定数量的参数决定,训练过程即学习最优参数值,典型代表为线性回归、逻辑回归。非参数化模型:
参数数量不固定,随训练数据量增加而增长,灵活性更高,典型代表为K近邻(KNN)、决策树。核心价值:不同的分类方式帮助我们从数学本质、模型结构和预测机制等维度理解算法,从而在实际应用中选择最适合的模型解决特定问题。Part4机器学习的发展简史从理论奠基到技术爆发,回顾机器学习跨越半个世纪的演进之路,
探索每一个关键节点如何重塑我们对智能的认知。机器学习发展简史(1/2)艾伦·图灵被誉为“人工智能之父”,他提出的“图灵测试”为机器智能的判定设立了经典标准,是探索机器思维与智能本质的起点,也为后世机器学习的发展埋下了理论的种子。01早期萌芽(1940s-1950s)1950年图灵提出“图灵测试”,定义智能判定标准;1952年诞生首个机器学习程序——西洋跳棋AI;1957年感知机被发明,开启了人工神经网络的早期探索。02符号主义与专家系统(1960s-1980s)研究转向基于逻辑推理与规则的符号主义,专家系统在医疗、金融等领域蓬勃兴起;1980年首届机器学习研讨会召开,标志着该领域正式成为一门独立学科。03统计学习时代(1980s-1990s)统计学理论被深度引入,推动了统计学习框架的建立;1986年反向传播(BP)算法解决了多层人工神经网络训练难题,1995年支持向量机(SVM)的提出为分类问题提供了强力工具。机器学习发展简史(2/2)神经网络结构的持续演进是人工智能发展的核心引擎。从浅层感知机到深层网络,再到Transformer架构的出现,算力的提升与算法的创新共同推动了AI从“感知”向“认知”的跨越。01传统机器学习的黄金时代(2000s-2010s)这一时期,统计学习理论与实用算法迎来全面爆发,随机森林、支持向量机等经典模型相继成熟并广泛应用。2006年,杰弗里·辛顿正式提出“深度学习”概念,为人工智能的下一次飞跃奠定了坚实的理论基础。02深度学习爆发与AGI曙光(2010s-至今)2012年AlexNet在ImageNet竞赛中的压倒性胜利引爆了计算机视觉革命;2017年Transformer架构的提出彻底重塑了自然语言处理领域。近年来,大语言模型(LLMs)与多模态大模型的兴起,不仅推动了AI应用的普及,更让我们看到了通用人工智能(AGI)的曙光。谢谢!探索未知·持续前行人工智能通识§3.2机器学习的基本流程主讲人:严宣辉
教授福建师大计网学院PART01机器学习的六大核心步骤从数据采集到模型部署,每一个环节都环环相扣,共同构成了智能模型从概念到落地的完整生命周期,是构建高效AI系统的基石。01问题定义02数据采集03数据预处理04特征工程05模型训练06模型评估机器学习流程总览机器学习的完整生命周期就像一个精密的流水线,从一个模糊的想法开始,经过数据的挖掘与打磨,最终产出一个能解决实际问题的智能模型。01问题定义明确业务目标与边界,确立模型解决的核心问题,为后续流程定调。02数据采集数据采集是指从真实世界中获得原始数据的过程。03数据预处理对原始数据进行变换、清洗与集成等一系列操作。04特征工程从数据中提取关键特征,进行特征选择与降维,提升模型的拟合能力。05模型训练选择合适算法,利用标注数据训练模型,通过参数优化学习数据规律。。06模型评估使用测试集验证模型性能,分析准确率、召回率等指标,判断效果。
核心洞察:这是一个迭代的闭环模型评估后若效果不佳,并非终点,而是优化的起点。需回溯至特征工程、数据采集甚至问题定义阶段,持续循环迭代,才能产出高质量模型。步骤一:问题定义问题定义要明确机器学习要解决的任务类型和评价标准,其目标是将现实世界的模糊需求,转化为可建模、可评估的数学问题,它决定了后续环节的方向和边界。核心目标:将模糊、抽象的业务需求,拆解转化为清晰、可量化、可执行的机器学习任务,明确任务类型与成功标准,是项目启动的基石。01分类任务(Classification)本质是“做选择题”,预测离散的类别标签。适用于输出结果为有限集合的场景。例:垃圾邮件识别、疾病诊断(是/否)、图片中的物体分类。02回归任务(Regression)本质是“做计算题”,预测连续的数值结果。适用于需要量化预测的场景。例:房价走势预测、下季度销量预估、股票价格趋势分析。03聚类(Clustering)聚类就是把相似的数据自动分到一组,属于不需要预先告诉类别的“无监督学习”。它的核心目标是让同一组内的数据尽可能像,不同组之间的数据差别尽可能大,常被称为“物以类聚”。例:电商用户画像分群。步骤二:数据采集数据是驱动机器学习的核心燃料。这一阶段的目标是围绕业务问题,广泛收集与之相关的原始信息,为后续的清洗与建模打下坚实基础。现实世界的物理感知通过各类硬件传感器与监测设备,实时捕捉环境、物体或行为的物理信号。
示例:气象监测数据、交通摄像头影像、智能手环健康指标。人类活动的主动记录由用户或专业人员在业务流程中主动录入的结构化数据。
示例:电商平台的交易订单、医院的电子病历档案、问卷调查结果。系统运行的自动日志软件与服务器在运行过程中,后台自动生成的行为与状态记录。
示例:APP用户操作埋点、服务器访问日志、游戏内玩家行为数据。步骤三:数据预处理目标是对原始数据进行清洗、转换和整合,这是挖掘流程中最耗时却至关重要的环节。正如烹饪前的择菜与清洗,数据预处理决定了最终“数据佳肴”的基础质量,直接影响模型的准确性与可靠性。01数据清洗(Cleaning)识别并处理缺失值、重复记录与异常数据,剔除干扰“噪声”,确保数据的纯净度与一致性。02数据集成(Integration)合并来自数据库、API或文件的多源异构数据,消除冗余信息,构建统一的数据集视图。03数据变换(Transformation)通过归一化、标准化或离散化等手段,将数据转换为适合算法处理的规范格式。04数据归约(Reduction)在保留核心特征的前提下,通过降维或抽样减少数据规模,显著提升后续计算效率。输入低质量数据,输出的模型预测也必然失真。高质量的数据是机器学习成功的基石。步骤四:特征工程🎯核心目标:从原始数据中挖掘高价值线索,构建对模型预测最具影响力的特征维度。这是决定模型上限的关键,也是将数据转化为洞察的核心环节。🔍形象类比:特征如同侦探破案的关键线索。线索越精准、维度越丰富,模型(侦探)发现规律、做出精准判断的概率就越大,正所谓“巧妇难为无米之炊”。01特征构造基于业务逻辑与领域知识,对原始数据进行组合、变换,创造出更具解释性和预测力的新特征。💡示例:利用“建造年份”计算“房龄”,将时间信息转化为反映资产折旧的关键指标。02特征选择剔除冗余、无关或含噪的特征,从海量变量中筛选出对预测目标最具贡献度的核心特征子集。🎯价值:降低模型复杂度,提升训练效率与泛化能力,有效避免过拟合,让模型更“轻量”。03特征降维通过数学变换将高维特征空间映射到低维子空间,在保留数据主要信息的同时简化数据结构。🛠️方法:PCA(主成分分析)用于无监督降维,LDA(线性判别分析)用于有监督降维场景。步骤五:模型训练核心目标:学习最优参数通过算法和数据对模型进行参数调整和优化,以建立输入数据与输出数据之间的映射关系。01数据集三重划分•训练集:模型的“课堂作业”,用于学习
•验证集:模型的“模拟考试”,用于调参
•测试集:模型的“期末考试”,用于验收02循环迭代优化•计算误差:损失函数衡量预测偏差
•更新参数:用优化算法修正模型参数
•持续收敛:反复迭代直至误差最小避坑指南:切勿用测试集参与模型调优,否则会导致评估结果过于乐观,无法反映模型的真实泛化能力。步骤六:模型评估与优化图示:AUC-ROC曲线直观反映了二分类模型区分正负样本的能力。曲线越靠近左上角,曲线下面积(AUC)越大,代表模型的分类性能越优异。01评估核心目标利用预留的独立测试集,客观验证模型在未见数据上的泛化能力,避免“过拟合”陷阱。通过量化指标精准定位模型偏差或方差问题,为后续的参数调整、数据增强或模型结构升级提供科学依据。🎯分类任务:精准度与覆盖度•准确率:整体预测正确的样本占比
•精确率:预测为正样本中的真实比例
•召回率:真实正样本被识别出的比例📈回归任务:误差量化•均方误差(MSE):预测值与真实值差值的平方均值,对大误差惩罚更重,值越小代表预测越精准。02迭代优化三大方向⚙️参数调优调整学习率、正则化系数等,平衡模型偏差与方差,提升泛化性。📊数据工程增加训练数据、清洗噪声、重构特征,为模型提供更优质的输入。🧠模型升级尝试集成学习、深度学习等更强模型,挖掘数据深层非线性规律。PART02总结与展望回顾机器学习全流程的核心脉络,探索未来技术演进的无限可能与实践方向流程总结与回顾01问题定义明确业务目标与问题边界,为后续建模指明清晰方向,确保所有工作紧扣核心需求展开。02数据采集多渠道获取高质量样本数据,覆盖核心场景与边缘情况,为模型训练构建坚实的基础。03数据预处理清洗噪声、处理缺失值并标准化数据,剔除异常干扰,从源头保障数据的有效性。04特征工程筛选、构造与转换特征以挖掘数据价值,这是决定模型性能上限的关键环节。05模型训练选择适配算法进行参数迭代与拟合,让模型从数据中学习规律,生成预测模型。06模型评估通过测试集验证准确率与泛化能力,评估模型在真实场景下的稳定性与可靠性。💡核心认知机器学习的本质是持续的迭代与实验。请记住一个核心法则:数据与特征决定了模型的上限,而算法和调参只是在努力逼近这个上限。关键洞察:切勿急于求成跳过基础环节,扎实的前期准备工作远比单纯的调参技巧更能决定模型的最终价值。核心概念汇总01问题定义明确任务类型(分类/回归),界定机器需完成的目标。
关键作用:指明建模方向,锚定核心目标,避免方向偏差。02数据采集收集任务相关的原始数据素材,是模型的“食材”。
关键作用:提供模型学习的基础原料,决定数据的覆盖广度。03数据预处理清洗噪声、缺失值与异常值,统一数据格式与范围。
关键作用:保障数据质量,规避“垃圾进,垃圾出”的风险。04特征工程从原始数据中提炼、构造对预测有用的关键线索。
关键作用:决定模型性能的理论上限,挖掘数据潜在价值。05模型训练利用算法让模型从数据中自动学习规律与模式。
关键作用:生成具备预测能力的可用模型参数与逻辑。06模型评估用测试数据检验模型的预测精度与泛化表现。
关键作用:验证效果,确保模型在未知新数据上的可靠性。07训练集模型的“日常作业”,用于学习规律的主要数据。
关键作用:让模型掌握领域知识,形成基础的决策逻辑。08测试集模型的“期末考试”,未参与训练的全新评估数据。
关键作用:客观衡量模型的真实水平与泛化能力。谢谢!探索未知·持续前行人工智能通识
:常用的机器学习算法§3.3回归分析简介主讲人:严宣辉
教授福建师大计网学院一个有趣的发现:“回归”到平均身高弗朗西斯·高尔顿(1822-1911),英国著名统计学家、探险家与遗传学家。他通过对人类身高遗传的海量数据分析,首次发现了“向均值回归”的自然规律,这一洞察也成为了现代统计学中“回归分析”命名的起源。研究缘起:遗传之谜19世纪末,高尔顿致力于探索遗传规律。他收集了大量家庭的身高数据,试图揭示父母特征如何传递给子女,却意外发现了一个有趣的统计学现象。核心发现:均值回归数据显示,极高父母的子女虽高但平均身高低于父母;极矮父母的子女虽矮但平均身高高于父母。这种“趋中”趋势揭示了自然对极端值的一种“拉回”效应。“回归”一词的诞生与深远影响高尔顿将此现象命名为“回归”(Regression),这便是“回归分析”的由来。这一发现不仅解释了生物遗传中的趋同现象,更成为现代统计学中分析变量间关系的基石,广泛应用于经济、医学、社会科学等领域,帮助我们理解变量如何围绕平均值波动。回归分析:揭示变量间的因果关系回归分析是一种统计方法,用于构建自变量(原因)与因变量(结果)的关联模型,量化因素对结果的影响程度。它不仅能解释过去的变化,更是预测未来、辅助决策的关键分析工具。典型应用:回归分析如何回答现实问题?商业增长测算
“若增加20%的营销预算,产品月销售额预计能提升多少个百分点?”教育效果评估
“每天多投入1小时复习,期末考试的平均分预计能提高多少分?”消费需求预测
“夏季气温每升高2℃,冷饮的单日销量预计会随之增长多少?”01预测分析·洞察未来
基于历史数据构建模型,精准推算因变量的未来值,为资源规划与目标制定提供科学依据。02归因分析·锁定关键
量化不同因素对结果的影响权重,识别核心驱动因子,让策略优化更具针对性和有效性。03趋势建模·动态适应
结合时间维度分析数据变化规律,捕捉长期趋势与周期性波动,适配瞬息万变的市场环境。理解回归分析的基本要素01变量类型:定义分析的基石自变量(X)·影响因素/输入被假设为引发变化的“因”,是模型中的输入项。通常是可控或可观测的条件。示例:广告投放费用、每日学习时长、环境温度。因变量(Y)·结果指标/输出我们试图预测或解释的“果”,是模型关注的核心结果。其变化由自变量及其他随机因素共同决定。示例:产品月度销售额、期末考试成绩、夏日冰淇淋销量。02关系类型:分析的核心对象函数关系·精确的数学映射变量间存在唯一、确定的数学推导关系,给定自变量即可准确计算出因变量,无误差干扰。示例:圆的面积公式S=πr²、自由落体位移公式。统计关系·趋势性与随机性共存变量间存在明显的趋势关联,但受众多随机因素影响,无法做到绝对精确的预测,只能描述大概率的变化规律。★回归分析的核心:量化这种带有随机误差的统计关系。从散点图到回归线:寻找“最佳拟合”的直线图示:通过最小二乘法拟合出的一元线性回归线,直观展示了数据的集中趋势。01散点图:数据的直观映射将自变量(X)与因变量(Y)的观测值以坐标点形式绘制在平面中,是观察变量间关联趋势的基础,也是判断是否适合线性回归的第一步。02回归线:趋势的数学表达当散点呈现出明显的线性趋势时,我们用一条直线来近似描述这种关系。它不苛求穿过每一个点,而是捕捉数据变化的核心规律。🎯核心目标:最小化偏差寻找“最佳拟合”的本质,就是找到一条直线,使得所有数据点到这条直线的垂直距离(残差)的平方和达到最小,从而最精准地代表数据的整体走向。一元线性回归模型
01核心参数解析ŷ(预测值)&x(自变量)
ŷ是因变量的拟合值,代表模型对结果的预测;x是用于预测的输入变量。a(截距Intercept)
当x为0时y的基准预测值,反映了因变量的基础水平或初始状态。b(斜率Slope)—核心驱动力
衡量变化幅度:x每增加1个单位,y平均变化b个单位。正值为正相关,负值为负相关。02最优解:最小二乘法(OLS)核心目标
寻找一条“最佳拟合直线”,使得所有数据点到直线的垂直距离的平方和最小,以此最小化模型的预测误差。为何取“平方”?
消除正负距离的相互抵消,同时对较大的误差进行放大惩罚,确保模型稳健。方法优势
计算简便、解析解存在,且在误差服从正态分布时具有最优统计性质。简单的线性方程,揭示了变量间最基础也最强大的线性关系规律,是数据分析的基石。案例1:广告费如何影响销售额?01业务背景与样本某公司连续10个月的广告费投入与销售额记录,形成10组观测样本。我们旨在通过这些历史数据,量化广告投入对营收的实际拉动作用,挖掘增长背后的驱动逻辑。02核心预测问题能否建立数学模型预测销售额?若广告费每增加1万元,销售额预计能提升多少?这是典型的一元线性回归分析应用场景,旨在量化变量间的因果关系。03散点图直观洞察以广告费为X轴、销售额为Y轴绘制散点图,可直观观察到两者呈现明显的正向线性趋势,即广告投入越多,销售额通常越高,为建模提供了坚实的现实依据。广告费/万元489871261069销售额/万元9202215172318251020【例3-1】用Python和Sklearn库对某家公司广告费与销售额进行一元线性回归分析。某家公司每月的广告费和销售额如下表所示。案例1:求解回归方程01分析工具与方法基于Python的Scikit-learn机器学习库,利用最小二乘法对历史数据进行线性拟合。该算法通过最小化实际值与预测值的误差平方和,自动计算出最优模型参数,高效实现从经验数据到数学模型的精准转化。02最终拟合回归方程销售额(预测)=2.2516+1.9808×广告费参数解读:截距a=2.2516(基准销售额),斜率b=1.9808(每万元广告费带来的销售增长)。💡商业洞察:模型显示广告投入与销售额呈强正相关。每增加1万元广告费,预计销售额将提升约1.98万元,证明了该渠道广告投放的高回报率。散点图与拟合回归线图中散点代表实际观测值,黑色虚线为模型拟合的最佳回归线,直观展示了变量间的线性趋势及拟合优度。案例1:解读回归结果01斜率解读(b=1.9808)广告费每增加1万元,销售额平均预计增加约1.98万元。这是衡量广告效益的核心指标,直观量化了投入与产出的边际关系,为企业评估广告预算的性价比、制定投放策略提供了坚实的数据支撑。02截距解读(a=2.2516)当广告费为0时,公司的基础销售额预计为2.25万元。代表企业在无额外广告推动下的自然销售水平,反映了品牌固有的市场影响力和用户基础。该数值是评估品牌资产厚度的重要参考,也为测算盈亏平衡点提供了基础数据。💡业务洞察:回归结果证实了广告投入对营收的显著拉动效应,每单位广告投入可撬动近2倍的销售额增长,显示出极高的营销ROI。同时,稳定的基础销售额表明企业拥有健康的品牌基本盘,为未来的市场扩张和预算规划提供了安全边际与决策信心。多元线性回归:当影响因素不止一个时多因素交织的现实场景现实世界的结果往往是复杂因子共同作用的产物:房价受面积、地段、房龄等多重因子驱动;销售额则与广告投入、定价策略、市场环境等紧密相关。单一维度的分析已无法还原真实的因果规律。从“一元”到“多元”的维度跃升从只能解释单一变量影响的一元回归,进阶到能同时纳入多个自变量的多元回归。它不仅能量化每个因素对结果的独立影响,还能剥离变量间的相互干扰,为预测和决策提供更精准的数学支撑。核心模型:多元线性回归方程
变量定义:x₁,x₂...xₙ代表不同的自变量(如面积、广告费),构成影响结果的多维特征集合。系数意义:b₁,b₂...bₙ为偏回归系数,反映在其他变量不变时,该变量对结果ŷ的独立影响强度。案例2:城市用电量受什么影响?为探究城市电力需求的核心驱动力,我们采集了某城市1990至2006年的宏观经济面板数据。通过构建多元线性回归模型,量化分析经济增长(GDP)与资本投入(全社会投资额)对城市年用电量的具体影响程度,为能源规划与经济发展决策提供实证依据。01核心变量定义因变量(Y):年用电量
单位:万千瓦小时,衡量城市能源消耗总量的核心指标。自变量(X):经济指标
X₁:GDP(万元)/X₂:全社会投资额(万元),反映经济规模与活跃度。案例2:解读Excel分析结果上图为多元线性回归分析的统计输出表。通过对关键统计指标的深入拆解,我们能够科学评估模型的拟合程度与变量的显著性,从而为“GDP与投资额对用电量的影响”这一业务问题提供量化的决策依据。01.RSquare(R²)=0.977衡量模型对数据的解释能力,数值越接近1效果越好。0.977表明GDP与投资额可解释97.7%的用电量变化,模型拟合效果极佳。02.SignificanceF=2.95E-12用于检验模型整体显著性,该值远小于0.05,证明回归模型整体有效,即自变量与因变量之间存在显著的线性关系,模型设定合理。03.P-value(P>|t|)<0.01GDP与投资额的P值均远小于0.01,说明每个自变量对用电量都有独立且显著的影响,不存在无关变量,进一步验证了模型的有效性。案例2:构建多元回归方程最终预测模型:
年用电量=28925.98+0.046188×GDP+0.118491×全社会投资额GDP系数解读(0.046188)
在投资额保持不变的前提下,GDP每增加1万元,年用电量平均增加约0.046万千瓦小时,反映了经济总量增长对电力需求的基础拉动作用。投资额系数解读(0.118491)
在GDP保持不变的前提下,全社会投资额每增加1万元,年用电量平均增加约0.118万千瓦小时,体现了基建与工业投资对电力消耗的强驱动性。核心洞察:投资额对用电需求的影响更为显著
对比两个系数值,投资额的边际效应(0.118)显著高于GDP(0.046),这意味着在该模型框架下,固定资产投资是推动地区用电量增长的更关键因素。非线性回归:当关系不再是直线现实世界中,变量间的关系往往并非简单的直线。如图所示,非线性回归通过拟合曲线(红色线条),能够更精准地捕捉数据的波动趋势、拐点及增速变化,从而还原事物发展的真实规律。01定义与本质当因变量与自变量呈现曲线关系(如抛物线、指数增长或S型曲线)时,摒弃线性假设,改用非线性函数模型来刻画变量间的依存关系,以获得更优的拟合效果。02典型应用场景广泛应用于产品生命周期分析(销量S型增长)、学习曲线效应(边际效益递减)、以及自然科学中复杂的动态系统建模,帮助我们理解和预测非线性的变化趋势。03建模核心逻辑核心在于“量体裁衣”。根据数据的分布特征(如增长上限、拐点位置),选择合适的曲线函数(二次函数、对数函数等)进行拟合,从而最大化模型对现实的解释力。本章小结:回归分析核心要点回顾01核心思想建立自变量(原因)与因变量(结果)的关系模型,通过量化变量间的关联强度与方向,实现对未来趋势的科学预测与现象背后逻辑的深度解释。02核心方法包含线性回归(假设变量呈直线关系,涵盖一元与多元)与非线性回归(处理曲线、指数等复杂关联),可根据数据分布形态灵活选择建模方式。03关键指标R²(评估模型对数据的拟合优度)以及P-value(判断变量关系的统计学显著性)。04核心价值作为数据分析与人工智能领域的基础工具,它帮助我们从杂乱的数据中挖掘潜在规律,为商业策略制定、风险评估及科学决策提供可量化的实证依据。谢谢!探索未知·持续前行人工智能通识:常用分类算法简介主讲人:严宣辉
教授福建师大计网学院课程大纲01引言:我们身边的分类什么是分类?它如何潜移默化地影响我们的日常决策?从物品归置到智能推荐,分类思维是理解复杂世界的基础。02算法一:逻辑回归探索“是”或“否”的概率艺术,理解二分类问题的核心。掌握如何通过对数几率回归,量化事件发生的可能性与边界。03算法二:决策树像侦探一样层层递进推理,通过特征分割与节点判断,将复杂问题拆解为简单的是非选择,清晰直观地呈现决策路径。04算法三:支持向量机(SVM)寻找数据间的“最优超平面”,如同寻找最宽的马路来划分两类事物。它以优雅的几何视角处理分类,在高维空间中展现强大的分类能力与泛化性。05三种算法的总结对比对比各算法的适用场景与优劣,学习如何根据数据特性与业务需求,为实际问题匹配最合适的分类模型,并探索机器学习的进阶方向。什么是分类算法?分类是一种监督学习任务,其核心是让机器从已知类别的数据中学习规则,将新数据划分到预定义的类别中——简单来说,就是让机器学会给事物“贴标签”,是人工智能实现决策判断的基础能力。垃圾邮件识别自动分析邮件内容与特征,精准区分正常通讯与广告骚扰,智能拦截垃圾信息,保障收件箱纯净。智能人脸识别提取面部生物特征进行比对,快速验证“本人”或“陌生人”身份,广泛应用于安防门禁与设备解锁。辅助疾病诊断结合医学影像与临床数据,智能分析病理特征,辅助医生判断病症风险,提升诊断效率与准确率。情感倾向分析自动解析文本情绪色彩,快速判断评论、舆情是“正面”、“负面”或“中性”,助力品牌洞察与舆情监控。分类的核心:从“经验”到“预测”分类模型通过学习带有明确标签的历史数据,挖掘特征与类别之间的潜在规律。当面对全新的未知数据时,模型能依据习得的规则,自动赋予其最可能的类别标签,从而实现从已知经验归纳到未知情况推演的智能决策过程。Part2算法一:逻辑回归“是”或“不是”的艺术从线性回归到概率建模,逻辑回归通过Sigmoid函数将输出映射至0与1之间,
成为解决二分类问题的经典基石算法。从“分数”到“概率”01计算“分数”·线性回归基础基于收入、年龄、信用历史等多维特征,构建线性组合模型,计算出一个未归一化的综合分数z,以此反映特征与结果的线性关联强度。
02映射“概率”·Sigmoid变换引入Sigmoid逻辑函数,将线性分数z非线性压缩至[0,1]区间。输出值即为事件发生的概率p,实现从“得分”到“可能性”的本质跨越。
核心洞察:输出的概率值p不仅是“是/否”的分类结果,更量化了事件发生的置信度。例如在信贷场景中,它能精准反映用户违约的可能性,为风险定价和决策提供了可量化的依据。Sigmoid函数揭秘图像呈现完美的“S”型曲线,是逻辑回归与神经网络中处理二分类问题的核心工具。它将任意实数输入压缩至0到1的区间内,天然适配概率的表达逻辑,实现从数值到可能性的平滑映射。数学特性:数值的“概率塑形”•值域约束:输出严格落在(0,1)之间,是天然的概率生成器。
•平滑渐变:连续可导,在z=0处(输出0.5)变化率达到峰值。
•单调递增:输入值越大,输出概率越接近1,反之越接近0。如何做出最终判断?设定基准阈值在二分类模型中,我们通常将0.5作为默认的概率分界点。它是一个兼顾了模型普适性的基准,也是逻辑回归等算法的默认判定标准。执行决策规则基于预测概率p进行分类判定:
•若p>0.5,判定为正类(如:通过申请);
•若p<0.5,判定为负类(如:驳回申请)。动态灵活调整阈值并非固定值,需按场景调整。如疾病筛查为减少漏诊,可将阈值降至0.3;在高风险信贷审批中,则可提高阈值以严控风险。核心洞察:阈值的选择本质上是在“假阳性”与“假阴性”错误之间做权衡,需结合业务目标的优先级与错误成本来综合设定。逻辑回归的优缺点核心优势结果直观易解释直接输出样本属于某一类别的概率值,清晰呈现模型判断依据,无需复杂的黑盒解析,便于业务理解与决策参考。训练与预测高效模型结构简单,参数规模小,梯度下降收敛速度快,能够高效处理百万级以上的大规模数据集,算力成本极低。二分类场景表现稳健作为经典的线性分类器,在金融风控、医疗筛查等二分类任务中泛化性强,对异常值具有一定的鲁棒性。应用局限原生仅支持二分类算法本质为二元判定模型,无法直接处理多分类任务。如需拓展,需依赖“一对其余”或“一对一”等策略间接实现,会增加计算复杂度。难以捕捉非线性关系模型基于线性假设,无法有效拟合特征与标签间的复杂非线性关联。面对高维、非线性特征的复杂数据时,预测精度往往不如树模型或神经网络。逻辑回归小结逻辑回归是一种通过预测概率来解决二分类问题的经典线性模型,
它以极简的数学原理为基础,兼具高效的计算性能与极强的结果可解释性,是分类任务的首选基准模型。简单易用模型结构简单,训练速度快,对数据量要求较低,无需复杂的超参数调优即可快速上手。高效稳定计算复杂度低,能处理大规模数据集;且模型具有良好的鲁棒性,在噪声数据下表现依然稳健。结果可释输出直观的概率值,回归系数直接反映特征对结果的影响方向和程度,便于业务逻辑的理解与解释。Part3算法二:决策树分支判断的思考逻辑从根节点出发,通过特征判断不断分支,在层层追问中逼近真相,
构建清晰、可解释的决策路径。一个生活场景:周末去哪儿玩?决策树算法从根节点出发,通过特征判断不断分支。STEP01·天气是首要前提若遇雨天,户外活动不便→宅家休息放松;若是晴天,解锁出门条件,进入下一步筛选。STEP02·预算划定范围预算有限时,选择低成本休闲→逛公园/城市漫步;预算充足,则可选择观影等商业娱乐。STEP03·兴趣决定结果有期待的影片上映→前往影院观影;若无心仪影片,则回归自然,享受户外的宁静时光。💡本质:决策树算法就是将这种“分而治之、层层筛选”的人类逻辑,转化为机器可执行的计算模型。决策树:分而治之的艺术决策树是一种直观的监督学习模型,其核心在于通过“分而治之”的递归策略,将复杂的分类问题拆解为一系列简单的二元或多元判断。01根节点·全局起点包含完整的原始数据集,是决策树的初始入口。所有后续的分类规则与逻辑推演,均从这一覆盖全局的视角开始逐步向下展开。02分裂·最优划分在当前节点依据信息增益最大的特征进行提问,将父集切分为若干互斥的子集。这一步骤能有效降低数据的混乱度,让子集更具区分度。03递归·层层深入对每个新生成的子集循环执行分裂操作,不断向下生长分支。这一过程持续进行,直到子集满足预设的停止条件(如纯度达标或深度限制)。04叶节点·决策终点决策树的末端节点,代表最终的分类或回归结果。每个叶节点内部的样本具有高度一致性,直接输出明确的类别标签或预测数值。核心目标:让每一个分裂出的子集尽可能「纯粹」,即子集中的样本尽可能归属于同一个类别,从而构建出逻辑清晰、解释性强的决策边界。如何提出“最好”的问题?关键问题
在色泽、根蒂、敲声等众多特征中,我们应该优先选择哪一个作为第一个问题来提问?算法的核心目标
选择一个特征进行分裂,使得划分后的子集“纯度”最高,即样本的不确定性降至最低。信息增益(ID3算法)
通过计算分裂前后的信息熵变化,目标是让信息的不确定性(熵)减少得最多,从而快速降低样本的混乱程度。信息增益比(C4.5算法)
对信息增益进行归一化改进,有效避免了算法偏向取值数量较多的特征,解决了ID3的偏置问题,使特征选择更均衡。基尼指数(CART算法)
衡量从样本中随机抽取两个样本,其类别不一致的概率,目标是让这个概率最小化,从而让子集的类别尽可能集中。💡通俗理解:就像玩“猜动物”游戏
我们会优先问“是哺乳动物吗?”而非“是白色的吗?”,因为前者能一次性排除大量无关选项,更快缩小猜测范围。这正是算法选择最优特征进行分裂的底层逻辑。西瓜案例详解这是一个典型的决策树分类模型,通过对“纹理”、“根蒂”、“触感”等特征的层层判断,形成清晰的分类路径。这种结构不仅可解释性强,还能高效处理分类问题,是机器学习中经典的监督学习算法之一。01数据集:特征与标签的结合收集西瓜的色泽、根蒂、敲声、纹理等关键属性作为输入特征,同时标记每个样本是否为“好瓜”作为目标标签,构建出用于训练和验证的结构化数据集。02构建:从根节点到叶节点的分裂以“纹理”为根节点开始:纹理模糊则直接判定为坏瓜;纹理稍糊则进一步判断“触感”;纹理清晰则依据“根蒂”细分。算法递归此过程,直到所有叶节点的类别足够“纯净”,即子集中仅包含单一类别。03价值:可解释的专家判断系统最终形成的决策树如同一位经验丰富的“鉴瓜专家”,用户只需按照树的分支逻辑回答特征问题,即可快速、准确地得到分类结果,实现了从经验到算法的转化。决策树的优缺点核心优势01.直观易懂,逻辑透明生成的树状结构完全贴合人类的决策思维模式,推理过程一目了然,无需深厚的专业背景也能轻松理解和解释。02.数据预处理成本低对数据质量要求宽容,无需进行复杂的归一化或标准化操作,能够直接处理数值型与分类型混合的异构数据。03.多场景任务适配性强算法通用性极佳,既能高效解决离散目标的分类问题,也能胜任连续数值的回归预测任务。主要局限01.易产生过拟合,泛化能力弱若决策树生长过深、分支过于茂盛,模型会过度捕捉训练数据中的随机噪声和局部特征,导致在新的未知数据上预测准确率大幅下降,出现“学太细”的问题。02.模型不稳定,对数据敏感训练数据的微小变动(如新增少量样本或特征值的轻微扰动),都可能导致生成的树结构发生巨大变化,使得模型的预测结果缺乏稳健性。决策树小结决策树是一种通过递归分裂进行分类与回归的监督学习模型,它将复杂的决策逻辑转化为直观的树状结构,是理解分类模型的基础。核心优势:直观可解释模型结构像“树状流程图”,无需复杂的数学推导即可理解;能清晰展示特征对结果的影响路径,在金融风控、医疗诊断等对可解释性要求高的领域极具价值。潜在局限:易过拟合模型容易对训练数据中的噪声过度学习,导致在新数据上表现不佳;对异常值较为敏感。通常需要通过剪枝、限制树深或结合随机森林等集成方法来优化。Part4算法三:支持向量机寻找“最宽马路”的艺术家以最大化分类间隔为核心,在高维空间中构建最优超平面,赋予模型更强的泛化能力与稳健性。一个生活场景:红蓝大战图中展示了不同分割线的效果,中间的虚线即为SVM寻找的“最优超平面”,它最大化了两类样本间的安全距离。01场景设定
桌上散落着红蓝两色的球,你的任务是画一条直线将它们精准分开。这是一个典型的二分类问题,看似简单,实则需要寻找最稳定的分割方式。02核心难题:哪条线最好?
虽然能画出无数条分割线,但随意画的线往往离某个球太近。一旦有新的球加入,或者数据存在微小扰动,这种“贴线”的分类方式就极易出错。03SVM的解决方案:最大化间隔
SVM致力于寻找那条让两类球之间间隔最大的直线。它就像在两类球之间铺出一条最宽的“安全马路”,通过最大化边界距离,赋予分类器极强的鲁棒性和泛化能力。核心思想:最大化间隔图示:两类样本点之间的最大间隔超平面
(红蓝虚线为间隔边界,实线为最优超平面)01超平面(Hyperplane)分类的决策边界。在二维空间是直线,三维空间是平面,在更高维特征空间中则表现为超平面,是划分不同类别的基础依据。02间隔(Margin)两类样本中,距离超平面最近的点(支持向量)到超平面的距离之和。它直观反映了分类边界与样本之间的“安全缓冲区”。03SVM的优化目标通过数学优化算法,寻找能让“间隔”达到最大化的那个最优超平面。这是SVM区别于传统分类器的核心特征。核心价值:极致的鲁棒性最大化间隔意味着模型拥有更强的抗干扰能力,即使面对带有噪声或微小偏差的新数据,也能保持稳定的分类表现,泛化能力更强。什么是支持向量(SupportVectors)?核心定义:在支持向量机(SVM)中,那些恰好落在“分类间隔”边界上的关键数据点被称为支持向量。它们是构建最优分类超平面的核心支柱,决定了模型的几何结构。决策的锚点它们直接决定了分类间隔的位置与最大宽度,是划分不同类别的几何基准,支撑起整个分类超平面的存在。模型的极简性模型仅由支持向量决定。其他样本点只要不跨越边界,无论如何移动都不会改变最终的决策边界,体现了模型的高效与简洁。鲁棒性保障由于模型忽略了非支持向量的微小扰动,它对噪声数据和异常值具有更强的抵抗力,在复杂分布中保持稳定的分类性能。核函数的魔法:解决非线性问题在二维平面上,红蓝样本点交错分布,无法找到一条直线将它们完全分开。这是典型的线性不可分场景,也是传统线性分类器的瓶颈所在。01.破局之道:核函数(KernelTrick)
面对低维空间的线性不可分难题,核函数是SVM的“秘密武器”,它无需显式计算高维坐标,就能在高维空间中计算样本间的相似度。02.数学本质:升维创造线性可分性
它将数据从低维空间映射到更高维的特征空间。原本在平面上纠缠的数据,在高维空间中变得稀疏离散,从而能用一个超平面完美划分。03.生活比喻:从平面到立体的跨越
就像把一张平铺的、缠绕着红蓝丝线的纸“提起来”形成三维结构。原本在二维平面无法分开的丝线,在三维空间中,一块平板(超平面)即可轻松将其隔开。核函数的魔法:解决非线性问题图示直观展示了核函数的映射效果:左侧低维空间中纠缠的数据点,经过核函数映射到右侧的高维空间后,变得线性可分。这一过程避免了直接计算高维坐标的复杂运算,是支持向量机(SVM)解决非线性分类问题的关键。核心作用:升维与解耦核函数通过非线性映射,将低维空间中无法用直线分开的数据,投射到更高维的特征空间。在这个新空间中,原本复杂的非线性边界转化为简单的线性超平面,从而实现高效的分类与回归。生活类比:折纸分离术想象一张平铺的纸上缠绕着红蓝两根绳子,无法用一根手指分开。核函数就像一只手将纸面的一角向上提起,形成三维结构。此时,原本纠缠的绳子在空间中自然分层,你只需插入一块平板(超平面),就能轻松将它们彻底分开。常见的核函数01线性核不进行特征升维,直接在原始空间计算相似度。它是计算效率最高的核函数,适用于数据本身线性可分、特征维度较高或样本量巨大的场景,是大规模数据处理的首选。02多项式核通过多项式映射将数据升维,捕捉特征间的非线性交互关系。其灵活性强,可通过调整阶数控制模型复杂度,非常适合处理低维、样本量适中且呈现多项式分布规律的数据。03高斯核(RBF)应用最广泛的核函数,能将数据隐式映射到无限维空间。它无需手动设计复杂的映射规则,即可高效处理高度复杂、不规则的非线性数据分布,是解决复杂分类问题的“万金油”。💡核心洞察:核函数决定了模型对特征的提取能力,选择时需综合考量数据的分布特性、计算成本以及对模型泛化能力的要求。支持向量机的优缺点核心优势效果强大,适配高维空间
在高维特征空间中表现优异,即使样本量较小,也能有效捕捉数据特征,构建清晰的分类边界。理论坚实,数学逻辑严谨
基于统计学习理论,拥有完善的VC维理论与最大间隔超平面支撑,模型的稳定性和鲁棒性更强。泛化能力强,抗过拟合
通过最大化几何间隔来优化模型,有效降低了过拟合的风险,对未知数据的预测表现出色。应用局限计算成本高,难以规模化
面对大规模数据集时,训练时间与内存消耗显著增加,复杂度较高,难以满足实时性要求。对参数与核函数敏感
核函数的选择及惩罚系数的设定对模型效果影响极大,缺乏通用的选择标准,需大量调参。模型解释性弱,黑盒特性
属于典型的“黑盒”模型,无法直观展示特征权重与决策逻辑,难以向业务人员解释决策原因。支持向量机小结支持向量机是一种通过最大化分类间隔来实现分类的强大监督学习模型,它借助核函数将低维空间映射至高维,从而高效解决非线性分类问题,在小样本与高维数据场景中展现出卓越的泛化能力。最大化分类间隔以几何间隔最大化为优化目标,寻找最优分类超平面,赋予模型极佳的鲁棒性和抗噪能力。核函数空间映射巧妙利用核技巧将低维不可分数据映射到高维特征空间,轻松应对复杂的非线性边界问题。经典且高效在小样本数据集上表现优异,理论基础坚实,是解决分类问题的经典且值得信赖的算法。Part5三种分类算法的对比回顾逻辑回归、决策树与随机森林的核心原理,剖析算法优劣。算法大比拼逻辑回归核心机制:基于线性模型拟合概率,通过Sigmoid函数将输出映射到0-1区间,本质是对数几率回归。特性点评:训练极快、解释性极强,是分类任务的基准模型;但仅适用于线性可分场景,表达能力有限。典型应用:金融风控(如信贷违约预测)、营销(如广告点击率预估)、医疗初筛。决策树核心机制:采用“分而治之”的递归策略,通过特征阈值分裂构建树状结构,模拟人类决策过程。特性点评:无需数据归一化,结果直观可解释;但单棵树易过拟合,对数据变化敏感,稳定性较差。典型应用:需要明确决策规则的场景,如客户流失分析、医疗辅助诊断、业务规则引擎。支持向量机(SVM)核心机制:通过核函数将低维数据映射到高维,寻找最优超平面以最大化不同类别间的几何间隔。特性点评:小样本下泛化能力极强,擅长处理高维复杂数据;但计算成本高,模型结果难以解释。典型应用:复杂分类任务,如图像识别、文本情感分析、生物信息学(基因序列分类)。谢谢!探索未知·持续前行人工智能通识:聚类算法简介主讲人:严宣辉
教授福建师大计网学院什么是聚类分析?——让数据“物以类聚”核心思想:源于生活的分类智慧基于“物以类聚,人以群分”的朴素逻辑,让算法自动学习数据间的内在联系,从而掌握对复杂信息进行“分门别类”的能力。定义:无监督的自动分组任务一种无监督学习算法,它依据数据间的“相似性度量”,将数据集中的样本自动划分成多个不相交的子集(称为“簇”),无需人工标注。特征:高内聚,低耦合理想的聚类结果应满足:同一个簇内的样本相似度极高(高内聚),而不同簇之间的样本差异显著(低耦合),以此揭示数据的自然分布结构。常见的聚类算法家族01划分式聚类(Partitioning)将数据直接划分为K个互不重叠的簇,簇间相互独立。这是最直观、应用最广泛的聚类范式。代表算法:K-Means(经典标杆)02层次聚类(Hierarchical)构建嵌套的簇层次结构,形似“树状图”,能揭示数据内在的层级关系与演化过程。代表算法:AGNES(凝聚式),DIANA(分裂式)03基于密度的聚类(Density-based)依据数据点的局部密度分布来划分簇,能有效发现任意形状的聚类结果,并识别噪声点。代表算法:DBSCAN(抗噪能力强)04基于网格的聚类(Grid-based)将数据空间量化为有限的网格单元,基于网格单元的统计信息进行聚类,处理速度极快。代表算法:STING,CLIQUE(高维数据处理)💡今日聚焦:我们将重点深入解析K-Means和层次聚类,掌握这两种最经典、最实用的算法原理及其应用场景。Part2K-Means聚类算法详解深入解析无监督学习领域的经典划分式聚类模型,从核心原理、迭代步骤到应用场景,
全方位掌握这一数据挖掘与模式识别的基础算法。K-Means的核心思想——寻找“代表性”的中心生活化理解:抱团游戏就像一群人玩抱团游戏:先随机选几位“队长”作为初始中心,大家各自找最近的队长抱团;随后,每个团重新推选最“居中”的人当新队长,重复此过程直到队伍不再变动,聚类便达到了稳定状态。名字释义:K(数量)+Means(均值)K代表我们希望将数据划分成的簇(类别)数量;Means意味着每个簇的中心(质心)是由该簇内所有数据点的平均值计算而来,是簇的“代表点”。核心迭代:分配与更新①分配:计算距离,将每个数据点划分给距离最近的簇中心;
②更新:重新计算每个簇内所有点的均值,作为新的簇中心,让中心更精准。终止信号:中心稳定当簇中心的位置在连续迭代中不再发生显著变化(或变化小于设定阈值),说明数据的归属已经稳定,算法即可停止运行。K-Means的工作流程(四步法详解)01确定与初始化确定K值:依据业务场景或肘部法等评估指标,选定所需的聚类数量。随机选点:从原始数据集中随机抽取K个样本,作为初始的簇中心点。02分配数据点计算距离:计算每个数据点到所有K个簇中心的欧氏距离。就近归类:将每个数据点划分给距离最近的簇,形成K个临时分组。03更新簇中心均值计算:对每个簇内的所有数据点,计算其特征维度的平均值。中心迁移:将计算得到的平均值作为该簇新的中心,完成中心迭代。04迭代与停止循环执行:重复执行“分配数据点”与“更新中心”的核心步骤。终止条件:当簇中心位置不再发生显著变化,或达到预设的最大迭代次数时停止。核心价值:通过无监督的迭代优化,最大化簇内相似度与簇间差异性,实现数据的自动分组与结构发现。K-Means的优缺点分析01核心优势简单高效,易于实现原理直观易懂,计算复杂度低且收敛速度快,对大规模数据集具有良好的伸缩性,是工业界处理聚类问题的首选算法之一。理论成熟,应用场景丰富作为最经典的无监督学习算法,其衍生变种众多,广泛应用于图像分割、用户画像、文档聚类及异常检测等领域。02主要局限对预设K值极度敏感必须人为指定聚类数量,缺乏统一的确定标准,不当的K值会直接导致聚类结果偏离数据真实分布。依赖初始质心的选择随机初始化可能导致算法收敛到局部最优解而非全局最优,多次运行可能得到不同的聚类结果。难以处理非凸分布数据仅擅长发现球状或凸形簇,对于环形、带状或螺旋形等复杂形状的数据集,聚类效果往往不理想。受噪声和离群点干扰大算法基于均值计算簇中心,极端异常值会显著拉偏质心位置,导致正常数据的聚类边界产生偏移。K-Means的局限性:无法处理非凸形状图示:螺旋形流形数据——K-Means难以识别的典型非凸结构01.算法的天然局限:基于距离的硬性划分K-Means通过最小化簇内距离平方和来优化,这决定了它只能收敛到凸形(如球状)的簇边界。对于非凸、带状或嵌套分布的数据,其距离度量的机制使其无法捕捉数据的真实拓扑结构。02.典型失效:螺旋流形数据的误判面对交织的螺旋数据,K-Means会因“就近划分”的原则,错误地将不同螺旋臂上的样本归为同一簇,而忽略了数据点在流形上的连续归属关系,导致聚类结果完全偏离预期。03.破局之道:选择更适配的聚类算法针对此类复杂数据,建议使用基于密度的DBSCAN(能有效识别任意形状的簇并抗噪),或基于图论的谱聚类,它们能更好地处理流形数据,还原数据的真实聚类结构。Part3层次聚类算法详解层次聚类的两种策略:凝聚与分裂01凝聚式(Agglomerative)方式:“自下而上”的聚合策略,从单个样本开始,逐级合并最相似的簇。核心:每步合并距离最近的两个簇,直至所有样本归为一簇。代表算法为AGNES。02分裂式(Divisive)方式:“自上而下”的分解策略,从整体大簇开始,逐级分裂差异最大的子簇。核心:每步将最不一致的簇分裂,直至每个样本自成一簇。代表算法为DIANA。结果呈现:树状图(Dendrogram)结果通常以树状图展示,形似“数据族谱”。它不仅呈现最终聚类结果,更清晰揭示了从微观到宏观的层级归属关系,直观反映了数据点间的相似度演变与结构层次。如何衡量簇间距离?——单链、全链与组平均在层次聚类中,簇间距离的定义是算法的核心,它直接决定了聚类树的结构与最终的簇划分结果。以下是三种最经典的计算方式:单链(SingleLinkage)定义:两簇间任意两点的最短距离(最近邻)。特点:规则宽松,易形成链式延展结构;对异常值敏感,适合发现非椭圆形状的簇。全链(CompleteLinkage)定义:两簇间任意两点的最长距离(最远邻)。特点:标准严苛,倾向生成紧凑、高密度的团状簇;能有效分离密集小簇,抗噪声能力较强。组平均(GroupAverage)定义:两簇间所有点对距离的平均值。特点:兼顾局部与整体差异,是前两者的折中方案;鲁棒性强,受极端值影响小,是最常用的方法。💡选择建议:单链适合发现细长簇,全链适合发现紧密簇,而组平均则是大多数场景下的稳健之选。层次聚类的优缺点分析核心优势无需预设簇的数量
无需人为指定K值,可通过生成的树状图动态观察并确定最佳聚类数量,避免了因参数选择不当导致的偏差。层级关系深度可视化
生成的树状谱系图不仅给出聚类结果,更清晰展示了数据点间的亲疏远近与嵌套结构,有助于理解数据内在逻辑。适配复杂非球形簇
相比K-Means,能更好地识别非凸、带状或不规则形状的自然簇,对数据分布的适应性更强。主要局限计算复杂度高,效率瓶颈明显
算法时间复杂度为O(n³),在处理大规模数据集时,其运行速度远低于K-Means等划分式算法,难以应用于实时数据分析场景。层级合并不可逆,容错性差
采用贪心策略进行合并,早期阶段的错误聚类决策无法在后续步骤中修正,且对噪声点和异常值较为敏感,容易影响全局结果。Part04聚类算法的精彩应用聚类算法的精彩应用01商业领域:客户分群与精准营销应用:基于消费习惯、浏览轨迹等行为数据,将用户自动划分为高净值、价格敏感等群体。
价值:实现千人千面的营销策略,显著提升营销转化率与ROI,降低获客成本。02科学研究:生物信息与物种分类应用:利用基因序列数据构建进化树,分析物种间的遗传距离
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 《有趣的乘法计算》教学课件
- 《重核裂变与轻核聚变》参考课件
- 小学四年级语文《黄继光》第二课时教学设计:以细节品英雄 以行动铸精神
- 2026年急救车管理制度考试题及答案
- 初中九年级心理健康教学设计:基于目标拆解的坚持力培养策略
- 小学三年级心理健康教学设计:尊重他人与尊重自己
- 初中语文九年级文言文专题教学设计:品“先忧后乐”精神悟范仲淹家国情怀-以《岳阳楼记》为核心拓展“范文正公”群文阅读
- 2026东莞市篮球协会注册裁判员理论考核试题及答案
- 2026年铁路钢筋检测试题及答案
- 2026年安全辐射防护考试题及答案
- 风湿免疫科|系统性红斑狼疮教学查房完整课件
- 2026年出租厂房安全责任告知书
- 矿山安全生产标准化管理制度
- 理解当代中国 大学英语综合教程1(拓展版) B1U1课件 Unit1 Youth on the rise
- 2024公路运营领域重大事故隐患判定标准解读学习课件
- 压路机司机三级安全教育试题
- 护理专利发明创新与应用
- 术后肺部感染的预防及护理
- 《护理规范解读》课件
- 学校1530安全教育记录
- 护理静疗质控
评论
0/150
提交评论