版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能通识§3.1机器学习的基本概念主讲人:严宣辉
教授福建师大计网学院课程导航01开篇引入什么是机器学习?通过生动的生活案例,从本质上理解其“让计算机从数据中学习”的核心思想。02机器学习与人类思维方式的关联跳出传统编程逻辑,理解机器学习基于数据的归纳与演绎思维,掌握其解决问题的独特视角。03核心概念掌握特征、标签、模型等关键术语,厘清监督学习与无监督学习两大核心任务的区别。04发展简史:从萌芽到爆发回顾机器学习的演进之路,从早期的符号主义、统计学习,到深度学习时代的爆发,理解技术发展的脉络与关键转折点。05三大基石:数据、模型与算法深入解析构成智能系统的三大支柱:数据是燃料,模型是引擎,算法是驱动逻辑,理解三者如何协同工作。PART01开篇引入:什么是机器学习?机器学习是人工智能的核心驱动力,让计算机脱离“指令式编程”的固有框架,
通过数据自我迭代与模型构建,赋予机器像人类一样“从经验中学习”的能力。📊数据驱动的智能引擎🧠自主进化的决策模型从人类学习到机器学习(MachineLearning,ML)01人类的学习逻辑我们通过经验积累来改变认知。这是一个通过观察、归纳形成对世界理解(规律)的过程,进而利用这些规律去预测未来、解决未知的新问题。02机器学习的本质这是对人类学习行为的智能模仿。计算机通过机器学习算法分析海量历史数据(即机器的“经验”),自动挖掘数据中的模式与逻辑,从而构建出能够进行预测和决策的数学“模型”。经验↔数据人类的过往经验,对应机器的历史数据输入,是模型训练的基础原料。规律↔模型人类总结的认知规律,对应机器训练出的算法模型,是实现预测的核心依据。一个生动的例子:小厨师的美食探索之旅(1/3)让我们从一个小故事“小厨师的美食探索之旅”,开启对机器学习的探索01观察与记录·数据收集🍳厨师视角:每日穿梭市场记录食材色泽、气味与价格,探店品尝并拆解风味配方,积累烹饪的“原始素材库”。
🤖ML视角:为模型采集任务相关的特征数据(如房子的面积、地段、年份等)与目标值,构建训练模型的“燃料库”。02整理与筛选·数据预处理🍳厨师视角:剔除不新鲜食材,补齐遗漏配料,清洗食材杂质,确保烹饪原料的纯净与完整。
🤖ML视角:对数据进行预处理,如清洗、去重、填补缺失值与剔除异常值等,是保障模型预测准确性的“质量安检”。一个生动的例子:小厨师的美食探索之旅(2/3)03/发现关键要素(特征工程)👨🍳厨师视角:寻找灵魂食材小厨师在烹饪中敏锐捕捉到,新鲜的香草与特定的调味料是激发食材本味、提升菜肴层次的关键所在,这是决定菜品风味的基础。🤖ML视角:核心特征提取在数据中筛选出对结果影响最大的关键属性。例如在房价预测模型中,“核心地段”与“房屋面积”就是决定预测准确性的核心特征。04/实践与调整(模型训练)👨🍳厨师视角:试错与精进反复试做,若口味不佳则分析原因,动态调整食材配比与烹饪时长,通过不断的试错与优化,最终做出令人满意的佳肴。🤖ML视角:参数迭代优化算法利用训练数据持续调整模型的内部参数,通过反复迭代优化,使模型逐渐拟合数据中的潜在规律,从而具备准确的预测能力。一个生动的例子:小厨师的美食探索之旅(3/3)05反馈与改进厨师的试错与优化邀请亲友品尝并收集真实反馈,根据口味建议调整配方与火候,反复打磨菜品细节,直到达到最佳口感。模型的评估与验证使用独立的测试数据集来检验模型性能,评估其泛化能力,并据此优化模型参数。06创新与推广招牌菜的诞生与传播在扎实的基本功上创新研发特色新菜式,推向餐厅或市场,接受更广泛食客的检验与喜爱,建立个人品牌。模型部署与实际应用将训练好的模型部署到生产环境中,处理真实场景中的未知数据,解决业务中的实际问题,创造商业价值。07与时俱进持续精进与学习紧跟美食潮流,不断学习新的烹饪技法,尝试新奇的食材组合,突破自我,保持厨艺的生命力与新鲜感。模型的更新与迭代随着数据分布的变化和业务需求的升级,持续利用新数据对模型进行重新训练或微调,确保模型始终精准有效。💡核心洞察:从厨艺修炼到模型构建,“反馈优化-落地应用-持续迭代”的闭环思维,是成就卓越的共同基石。PART02机器学习与人类思维方式的关联——归纳与演绎从海量数据中归纳共性规律,再以逻辑演绎推演出未知结论,
这两种思维的交织,构成了人工智能自我进化的底层逻辑。归纳·从数据到规律机器学习通过样本特征,自动提炼出数据背后的隐含模式与关联,让机器学会“总结经验”。演绎·从规律到结论基于已建立的模型与规则,对新的未知数据进行推理、预测与决策,实现“举一反三”。归纳推理:从特殊到一般归纳推理赋予机器“从经验中学习”的能力。它不依赖于预设的硬性规则,而是通过对大量具体样例的观察与分析,自主提炼出能够泛化到未知场景的通用规律。01.机器学习的核心范式从具体的观察或样例中总结出一般性规律的过程,也被称为“从样例中学习”。它是让AI具备自我进化能力的基础,无需人工逐条编写规则。02.核心:从有限到无限的“泛化”不仅是记忆已知的例子,更是通过对特征的归纳,提炼出适用于所有情况的通用规则。这让模型能够对从未见过的新数据做出准确判断。03.案例:自动判断西瓜好坏通过学习大量西瓜的色泽、根蒂形态、敲击声音等特征与“好瓜”标签的关联,模型最终归纳出通用规则,实现对陌生西瓜的品质预测。演绎推理:从一般到特殊核心逻辑定义演绎是从普遍成立的大前提出发,结合具体的小前提情况,推导出必然成立的具体结论的逻辑思维过程。它是一种“从一般规律到特殊结论”的严密推导方式。经典模型:逻辑三段论●大前提:所有田径运动员都需要长期高强度训练,因此拥有强壮的体魄。
●小前提:小明是校田径队的主力短跑选手,接受系统的专业训练。
●结论:由此可推,小明具备超越常人的身体素质与爆发力。应用一:专家系统早期AI的核心逻辑,将专家知识转化为“规则库(大前提)+事实库(小前提)”,通过机器自动演绎推理,广泛用于医疗诊断、故障排查等领域。应用二:自动驾驶决策感知系统识别“前方有行人(小前提)”,触发预设规则“遇行人需减速避让(大前提)”,系统立即执行减速停车指令,是典型的实时演绎推理。混合推理:归纳与演绎的结合归纳与演绎并非互斥,而是解决复杂问题的“黄金搭档”。前者从特殊经验中提炼普遍规律,后者用普遍规律指导具体实践,二者结合构成了严谨且富有创造力的推理闭环。01经典范式:法官的判案逻辑归纳:从个案到原则
研究过往类似案件,归纳出通用的责任划分标准(如“闯红灯者负主责”),完成从特殊现象到一般规律的提炼。演绎:从原则到判决
将归纳出的法律原则应用于当前案件,结合被告闯红灯的具体事实,推导出其应承担主要责任的结论,实现从一般到特殊的应用。02前沿应用:AI的智能决策生成模型:规律与创造
先归纳学习海量数据的潜在分布规律,再基于这些规律演绎生成全新的、符合逻辑与审美的逼真样本(如图像、文本)。强化学习:策略与行动
智能体通过与环境交互归纳出最优策略规律,再在具体情境中演绎策略,做出最大化收益的实时决策,实现从经验到行动的闭环。✨核心价值:归纳赋予模型“从经验中学习”的能力,演绎赋予其“解决新问题”的智慧,二者结合是实现通用智能的关键。Part3机器学习的核心概念01.定义与核心思想机器学习的一种经典定义是:利用经验来改善计算机系统自身的性能的技术。这个概念最早由汤姆·米切尔教授给出。01感知与学习从外部环境中获取原始数据,通过算法提取关键特征,完成对未知模式的初步探索与信息提取。02知识存储将学习到的规律与经验转化为可复用的模型参数,存储于系统中,形成结构化的知识体系以备调用。03决策与应用基于沉淀的知识模型,对新场景做出智能决策或预测,持续优化系统性能与用户体验。1973年,萨利斯(Saris)曾对学习系统给出以下定义:“一个能够从环境未知特征中学习信息,并将这些信息用于未来决策或控制以改进性能的系统。”这一核心思想奠定了机器学习的理论基础。汤姆·米切尔(TomMitchell)
卡内基梅隆大学教授,机器学习领域权威学者,提出了该领域的经典定义。02.核心要素解析——数据数据是驱动机器学习模型运转的“燃料”,
它的质量直接决定了模型的上限与表现。数据(Data):机器学习的基石数据是模型训练的原材料。没有高质量的数据,再复杂的算法也无法发挥作用。我们将数据分为训练集与测试集,各司其职,共同构建可靠的模型评估体系。训练样本带标签的单个数据点,是模型学习的最小单元,如一张带“猫”标签的图片。训练集样本的集合,模型在此数据集上进行参数学习与优化,是模型的“课堂”。测试集独立于训练集的数据集,用于客观评估模型的泛化能力,即“考试卷”。💡关键原则:质量与划分黄金法则:
“垃圾进,垃圾出”。数据必须准确、无偏见且具有代表性。科学划分:
经典比例为7:3或8:2,严格分离训练集与测试集,避免数据泄露。02.核心要素解析——模型模型(Model):学习的产物模型是机器学习系统从数据中提炼出的“规律”与“模式”,以数学函数或计算图的形式存在,承担着将输入数据映射为期望输出的核心功能,是智能决策的基石。模型的本质:抽象与近似
对现实世界关系的数学化表达。例如预测房价时,模型就是对面积、地段等特征与房价之间关联的精准抽象与量化。模型的表示:多样且灵活
形式不拘一格,既可以是简单的线性方程(如y=ax+b),也能是包含多层隐藏层的复杂神经网络,其复杂度随任务需求动态调整。图示:典型的多层神经网络结构,直观展示了输入层、隐藏层与输出层之间的连接关系,是处理复杂非线性问题的典型模型代表。02.核心要素解析——算法01算法Algorithm·学习的方法算法是实现智能学习的“大脑逻辑”,它定义了数据处理与参数优化的具体步骤。通过在训练数据上反复迭代,不断调整模型参数以最小化预测误差。从基础的线性回归到复杂的神经网络,算法决定了模型如何从数据中提取规律并做出决策。02训练Training·学习的过程训练是将算法付诸实践的动态过程。利用标注数据驱动模型自我进化,通过“损失函数”量化预测偏差,再借助“优化器”反向传播误差并调整参数。这是一个持续的“预测-评估-修正”闭环,直至模型收敛,具备稳定的泛化能力。流程可视化:
图示清晰展现了机器学习的核心闭环:从输入数据开始,经由计算函数生成预测输出,通过与期望输出的对比产生反馈信号,最终驱动学习算法更新模型参数,实现智能的自我优化。三大基石:数据、模型与算法决策树模型结构
直观呈现数据分类与决策的逻辑路径01数据:AI的“燃料”作为机器学习的基础,是驱动模型运转的核心燃料。高质量数据是模型发挥作用的前提,没有它,再复杂的模型也难以输出精准结果,是驱动AI学习的核心动力。02模型:AI的“大脑”模型是承载规律的核心载体,本质是实现输入特征到输出预测的数学映射结构。03算法:AI的“训练师”指导模型学习的核心规则,算法承担模型优化的核心职能,是构建模型的“训练师”。它依托梯度下降这类优化方法迭代调整模型参数,不断提升模型的准确性。04.机器学习的分类(1)监督学习(SupervisedLearning)核心定义与特点定义:利用带有明确标签的数据进行训练,模型学习输入特征与输出标签之间的映射关系。特点:训练过程如同“老师指导”,每个输入都有对应的标准答案作为反馈,学习目标明确。关键任务与算法核心任务:主要解决分类(输出离散值)与回归(输出连续值)问题。经典算法:线性回归、逻辑回归、支持向量机(SVM)、决策树、随机森林及神经网络等。广泛应用场景监督学习是目前应用最成熟的领域,涵盖:计算机视觉:图像分类、人脸识别自然语言:垃圾邮件过滤、情感分析金融领域:信贷风险评估、股票预测💡总结:监督学习是人工智能落地的基石,通过“老师指导”的方式,让模型具备强大的预测与判断能力。04.机器学习分类(2)无监督学习(UnsupervisedLearning)自主探索的本质无需人工标注的“标准答案”,模型通过分析无标签数据,自主发现数据内部的结构、模式或概率分布。如同让AI在没有老师指导的情况下,独立探索数据背后的隐藏规律。两大典型任务聚类分析:将相似特征的数据自动归为若干群组,如用户分群。
维度约简:在保留核心信息的前提下降低数据特征维度,简化计算并提升效率。算法与落地场景经典算法:K-Means、DBSCAN、PCA、关联规则挖掘。
应用领域:客户画像细分、社交网络社区发现、金融交易异常检测、电商商品推荐。核心价值:无监督学习打破了对人工标注数据的依赖,能够从海量原始数据中挖掘出未知的潜在价值,是实现数据驱动决策和智能化分析的关键基石。04.机器学习分类(3)半监督学习(Semi-supervised)结合少量有标签数据与海量无标签数据进行训练,有效解决标注成本高昂的问题。通过挖掘无标签数据中的潜在结构,显著提升模型的泛化能力,广泛应用于医疗影像分析、图像检索等场景。(4)强化学习(ReinforcementLearning)智能体通过与环境持续交互、不断试错来优化策略,以“奖励与惩罚”机制驱动学习目标。其核心是寻求长期累积奖励的最大化,是实现自主决策的关键技术,广泛应用于游戏AI、机器人控制及自动驾驶领域。强化学习典型案例:AlphaGo结合强化学习与蒙特卡洛树搜索,在围棋领域战胜人类顶尖棋手,标志着人工智能在复杂决策领域的重大突破。04.其他机器学习分类方法线性vs.非线性模型线性模型:
假设输入输出呈线性关系,模型结构简单,具备极强的可解释性,典型代表为线性回归。非线性模型:
能捕捉复杂的非线性特征与交互关系,拟合能力更强,典型代表为神经网络、决策树。概率vs.非概率模型概率模型:
对不确定性进行建模,输出结果的概率分布而非单一预测值,典型代表为朴素贝叶斯、高斯混合模型。非概率模型:
直接输出确定性的预测结果,不涉及概率分布的估计,典型代表为支持向量机(SVM)。参数化vs.非参数化参数化模型:
模型结构由固定数量的参数决定,训练过程即学习最优参数值,典型代表为线性回归、逻辑回归。非参数化模型:
参数数量不固定,随训练数据量增加而增长,灵活性更高,典型代表为K近邻(KNN)、决策树。核心价值:不同的分类方式帮助我们从数学本质、模型结构和预测机制等维度理解算法,从而在实际应用中选择最适合的模型解决特定问题。Part4机器学习的发展简史从理论奠基到技术爆发,回顾机器学习跨越半个世纪的演进之路,
探索每一个关键节点如何重塑我们对智能的认知。机器学习发展简史(1/2)艾伦·图灵被誉为“人工智能之父”,他提出的“图灵测试”为机器智能的判定设立了经典标准,是探索机器思维与智能本质的起点,也为后世机器学习的发展埋下了理论的种子。01早期萌
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 皮瓣移植术的护理
- 年产500万件电动气动工具的技改项目可行性研究报告模板-备案审批
- 2026年烟草分级竞赛题库及答案
- 2026年五大员岗位培训建筑材料题库及答案
- 2026年银行从业资格个人理财产品与服务测试试卷及答案
- 2026年渔业船员证书考试题库附参考答案(完整版)
- 新能源汽车配件及安防配件项目可行性研究报告模板-备案审批
- 【期中真题汇编】2026-2027八年级上册生物期中真题(人教版答题卡)
- 激光焊接原理及实践应用
- 服装店VIP客户的管理与维护
- 《化工设备基础》课程标准
- 架空pe管道施工方案(3篇)
- 2026年贵州省现代种业集团有限公司第二批人才招聘考试备考试题及答案详解
- 2026统考专升本英语:英语550个高频核心词
- 26.3 二次函数与一元二次方程 教学课件
- 2026-2030中国船用自动识别系统(AIS)市场投资趋势及产业运营策略规划研究报告
- 高标准农田建设项目监理服务方案投标文件(技术方案)
- 2024版登革热诊疗方案(卫健委版)课件
- 子午流注十二时辰养生
- 《激素调节》生物教学课件
- 保洁人员职业安全培训课件
评论
0/150
提交评论