人工基础导论 10_第1页
人工基础导论 10_第2页
人工基础导论 10_第3页
人工基础导论 10_第4页
人工基础导论 10_第5页
已阅读5页,还剩18页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

机器学习基础目录实践案例05机器学习概述01机器学习典型算法02模型评估与选择03机器学习前沿范式04PART01机器学习概述机器学习的定义与发展历程思想萌芽与行业寒冬(1950s-1980s)1950年图灵测试提出,为人工智能确立了早期评估标准;1956年达特茅斯会议首次定义“人工智能”术语,标志学科诞生。随后符号主义成为主流,专家系统蓬勃发展,但因知识获取成本高昂、系统可扩展性差,行业历经两次“AI寒冬”,技术发展陷入阶段性低谷。统计学习驱动的复兴(1990s-2000s)统计学习理论逐渐成为行业主流,支持向量机(SVM)、随机森林、逻辑回归等经典算法实现实用化落地,有效解决了浅层模型的分类与回归问题。这一阶段的技术积累,为机器学习从理论走向工程应用筑牢了基础,也为后续深度学习的爆发埋下了伏笔。深度学习与大模型爆发(2010年至今)大数据积累、GPU算力突破与算法创新形成共振,2012年AlexNet夺冠开启深度学习时代,CNN、RNN、Transformer等模型接连问世。2022年ChatGPT引爆生成式AI热潮,GPT-4、Claude等大模型实现多模态理解与生成,推动人工智能从感知智能迈向认知智能,全面渗透至医疗、金融、制造等核心领域。机器学习的分类样本是数据集的基本组成单位,指对一个具体研究对象的特征描述所形成的数据记录。数据集是指用于机器学习训练、测试或验证的结构化数据集合,由若干个具有相同特征的数据样本组成。特征是用于描述样本属性的可量化或可分类的指标,是机器学习模型挖掘规律的核心依据,也称为属性。数据集样本特征机器学习的术语02数据是机器学习的原材料,数据准备是将实际问题的相关信息转化为模型可学习的数据的过程,是决定模型效果的核心基础。02.数据准备问题定义是机器学习流程的起点,其本质是通过需求分析将模糊的实际问题转化为机器学习可处理的具体问题,明确机器学习任务的目标、边界、任务类型及评价标准等。0101.问题定义机器学习的基本流程(1)04模型训练是将训练集输入选定的模型,通过算法自主挖掘特征与标签的关联规律,调整模型参数,最终形成能初步预测的模型的过程,核心是让模型从数据中学习。04.模型训练模型选择是机器学习流程中的工具适配环节,其核心是根据问题类型(分类、回归、聚类等)、数据特征(特征数量、数据量、分布形态等)以及资源约束(计算成本、可解释性需求等),从算法库中挑选最适配的模型,实现选对工具做对事、用对方法解对题的目标。0303.模型选择机器学习的基本流程(2)06模型部署是将训练好的模型集成到实际应用系统中,让其能够接收新的输入数据并输出预测结果的过程。模型迭代则是在模型部署后,通过收集实际应用过程中的新数据,分析预测错误案例,重新调整数据、模型或参数,提升模型性能的持续优化过程。06.部署迭代模型评估是将测试集输入训练好的模型,通过预先定义的评价标准(如准确率)检验模型性能,判断模型是否满足实际需求,同时识别过拟合、欠拟合等问题的过程。0505.模型评估机器学习的基本流程(3)PART02机器学习典型算法核心模型形式为y=ax+b,其中a代表斜率,反映自变量对因变量的影响程度;b为截距。该模型仅适用于变量间呈现明显线性变化趋势的场景,是理解复杂回归算法的基础前提。模型形式与适用边界典型应用包括房地产价格预估(如:房价≈1.6×房屋面积)、销量预测、气温趋势分析等。作为机器学习中最基础的预测算法,它为后续学习复杂模型(如逻辑回归、神经网络)提供了重要的数学与逻辑支撑。典型应用与实践价值核心思想与优化目标核心是挖掘变量间的线性关联规律,通过最小二乘法寻找一条“最佳拟合线”,使得所有数据点到这条直线的偏差平方和达到最小,从而构建出能够反映变量间趋势的预测模型。线性回归:基础预测模型作为经典的分类算法,它通过Sigmoid函数将线性输出映射至0-1区间以表示概率,以0.5为决策边界区分正负样本。其核心价值在于将“回归计算”转化为“概率判断”,广泛应用于医疗风险预测、金融风控、垃圾邮件识别等二元决策场景。模型特性与决策逻辑逻辑回归:从数值回归到概率分类的转化核心逻辑源于“近朱者赤,近墨者黑”。无需显式训练,通过计算待预测样本与已知样本的相似度,选取最近的K个“邻居”,依据“多数表决”原则判定类别,是典型的惰性学习与非参数模型。K值过小:模型易受噪声、异常值干扰,过度拟合局部特征,泛化能力大幅下降。

K值过大:会引入相似度低的远邻样本,稀释核心近邻的判断权重,导致模型过于简单,无法捕捉数据的局部模式,引发欠拟合。算法核心思想关键参数K的权衡K近邻(KNN)算法核心解析核心特征体现为“簇内紧密、簇间疏离”。同一簇内的数据样本在特征维度上高度相似,呈现出很强的同质性;而不同簇之间的样本则差异显著,异质性特征明显,以此形成边界清晰、结构独立的聚类分组结果。遵循“物以类聚”的自然法则,属于典型的无监督学习范畴。无需预先对数据进行人工标签标注,算法可自动挖掘数据的内在分布规律,将具有相似特征的数据样本聚合为若干个独立的“簇(Cluster)”,实现数据的自动分组与结构发现。在商业领域应用广泛,典型场景为电商用户画像构建与精准营销。平台基于用户的浏览轨迹、消费习惯、购买频次等行为数据,将用户聚类为母婴、数码、美妆、家居等不同群体,从而实现个性化商品推荐、定向广告投放与精细化运营策略。01核心思想02核心特征03典型应用聚类算法(Clustering)PART03模型评估与选择0102过拟合(Overfitting)现象:模型过度捕捉训练数据的细节与噪声,导致在新数据上表现大幅下降,失去了举一反三的能力。

类比:如同学生死记硬背练习题的答案,甚至把印刷错误也一并记住,面对全新的题目时完全无法灵活运用。欠拟合(Underfitting)现象:模型未能充分挖掘数据的核心规律与特征,在训练集和测试集上的表现都不理想,学习程度不足。

类比:就像学生只记住了公式的字面写法,却没有理解公式的推导逻辑和应用场景,连基础的同类题目都无法解答。泛化能力与两大“敌人”02准确率反映模型整体预测正确的比例;精确率聚焦“预测为正的样本中实际为正的概率”,避免“误判好人”;召回率衡量“实际为正的样本被预测出的比例”,防止“漏放坏人”;F1分数则是两者的调和平均数,能综合评估模型在精准度与覆盖度上的平衡表现。四大核心评价指标TP(真正例)指实际为正类且预测正确;TN(真负例)指实际为负类且预测正确;FP(假正例)是实际负类却被误判为正类,即“误报”;FN(假负例)则是实际正类被漏判为负类,即“漏报”。这四个基础结果是计算所有评价指标的核心基石。01混淆矩阵的四种基础结果分类任务的评价指标误差类指标拟合优度指标平均绝对误差(MAE)是所有样本绝对误差的平均值,直观反映预测与真实值的平均偏离程度,对极端异常值不敏感;均方误差(MSE)为误差平方的均值,通过平方放大了极端大误差的影响,更侧重惩罚偏差较大的预测;均方根误差(RMSE)是MSE的平方根,既解决了量纲不直观的问题,又保留了对极端误差的敏感性。决定系数(R²)是衡量回归模型对数据规律解释能力的核心指标,取值范围为0到1。R²越接近1,代表模型能解释因变量中更大比例的变异,拟合效果越好;若R²趋近于0,则说明模型几乎无法捕捉数据中的有效趋势,预测结果与真实规律的契合度较低,是评估模型整体有效性的关键依据。回归任务的评价指标PART04机器学习前沿范式结合少量标注数据与海量未标注数据协同训练,有效降低对大规模标注样本的依赖,大幅削减数据标注成本。该范式在图像分类、情感分析、语音识别等领域应用广泛,能显著提升模型在小样本场景下的泛化能力与鲁棒性。半监督学习智能体通过与环境持续交互、试错探索,依据环境反馈的奖励或惩罚信号优化行为策略,以达成长期收益最大化的目标。其核心在于平衡“探索未知”与“利用已知”,已在游戏博弈、机器人自主控制、自动驾驶决策、推荐系统优化等场景实现突破性应用。强化学习将模型在源任务中学习到的知识、特征与经验,迁移复用至目标任务的训练过程,实现AI模型“举一反三”的能力。该范式有效解决小样本学习、数据稀缺场景下的模型训练难题,大幅降低训练成本与时间,是预训练大模型、跨领域适配的核心技术基础。迁移学习前沿学习范式PART05机器学习实践案例实践案例:泰坦尼克号幸存者预测01数据准备与预处理基于公开的泰坦尼克号乘客数据集,开展系统性的数据清洗工作。重点完成年龄、船票等缺失值的智能填充,对性别、舱位等类别特征进行标签编码,并对数值型特征执行标准化处理,为后续模型训练构建高质量、规范化的输入数据。02模型选型与参数调优选取K近邻(KNN)与逻辑回归两种经典机器学习模型进行对比实验。通过网格

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论