版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
高中信息技术粤教版选择性必修3第2章机器学习基础高中信息技术选择性必修3机器学习基础知识清单一、课程定位与学科素养(一)课程内容定位本清单对应高中信息技术选择性必修课程模块,聚焦于人工智能核心领域——机器学习的基础知识与初步实践。课程内容以粤教版教材“第二章机器学习基础”为核心框架,旨在帮助学生在理解机器学习基本概念、发展历程与主要类型的基础上,掌握经典算法的原理,并能运用适当的开发工具(如Python及Scikitlearn库)完成简单的模型训练与预测任务。【基础】(二)学科核心素养渗透1.信息意识:能够认识到机器学习在图像识别、自然语言处理、推荐系统等领域的广泛应用价值,敏锐感知生活中智能技术背后的数据与算法逻辑,自觉关注算法可能带来的偏见、隐私泄露等社会问题。【重要】2.计算思维:理解机器学习将实际问题转化为数据问题、将经验转化为数据模式的核心思想。掌握“数据准备—模型选择—训练评估—应用预测”这一基本的计算求解过程。能够对简单算法(如KNN)的步骤进行形式化描述。【核心】3.数字化学习与创新:能够利用在线开源平台(如JupyterNotebook)、开源框架(如Scikitlearn)和数字化学习资源,自主或协作探究不同算法的效果,体验从数据到模型的创新过程。【重要】4.信息社会责任:在享受机器学习带来的智能化便利的同时,能够辩证地思考其对就业、伦理、安全的影响,树立正确的技术观,承诺不利用算法进行违法违规活动,如数据造假、自动化攻击等。【基础】二、机器学习概述(一)机器学习的定义与基本术语1.定义:机器学习是一门涉及统计学、概率论、算法复杂度等多门学科的技术,它通过让计算机利用已有的数据(经验),得出某种模型,并利用此模型预测未来。简单来说,机器学习就是利用数据代替显式指令来教会计算机完成任务的过程。【基础】▲2.核心术语:【重要】1.3.数据(Data):原始信息的集合,是机器学习的基础。2.4.数据集(DataSet):一组样本的集合,通常分为训练集、验证集和测试集。3.5.样本/实例(Sample/Instance):数据集中的每一条记录,代表一个对象或一次事件。4.6.特征(Feature):样本的某个可测量的属性或特性。例如,在预测房价的任务中,“面积”、“卧室数量”就是特征。特征是机器学习模型的输入。【高频考点】5.7.标签/目标(Label/Target):对于监督学习而言,标签是我们试图预测的结果。例如,在房价预测中,最终的“房价”就是标签。【高频考点】6.8.特征向量(FeatureVector):将一个样本的所有特征组合在一起,形成的多维向量。例如,一个房子可以表示为[面积=120,卧室数=3]。7.9.模型(Model):机器学习算法在训练数据上学习到的结果,是对数据内在规律的一种数学抽象表示。模型可以被保存并用于对新数据进行预测。【核心】(二)机器学习的主要类型【必考】★★★根据训练数据和反馈方式的不同,机器学习主要分为以下三大类:1.监督学习(SupervisedLearning):【高频考点】1.2.定义:使用带有标签的数据进行训练,即每个训练样本都包含特征和对应的正确答案。模型通过学习特征与标签之间的映射关系,从而对未标记的数据进行预测。2.3.核心任务:1.3.4.分类(Classification):预测离散的类别标签。如:识别邮件是否为“垃圾邮件”(二分类);手写数字识别为09中的某一个(多分类)。【重要】2.4.5.回归(Regression):预测连续的数值。如:预测某地区的房价、预测明天的气温。【重要】5.6.经典算法:K近邻、决策树、朴素贝叶斯、逻辑回归、支持向量机、神经网络。7.无监督学习(UnsupervisedLearning):【高频考点】1.8.定义:使用无标签的数据进行训练,模型需要自行发现数据中的隐藏结构或模式。就像是让计算机自己去观察一堆照片,然后自己决定哪些照片长得像,把它们分成几堆。2.9.核心任务:1.3.10.聚类(Clustering):根据数据的相似性将样本划分为若干个组群(簇)。簇内部的样本相似度高,不同簇之间的样本相似度低。【重要】2.4.11.降维(DimensionalityReduction):在尽可能保留数据信息的前提下,减少特征的数目,用于数据压缩或可视化。5.12.经典算法:KMeans聚类、主成分分析(PCA)、DBSCAN。13.强化学习(ReinforcementLearning):1.14.定义:通过智能体(Agent)与环境(Environment)进行交互,根据环境反馈的奖励(Reward)或惩罚,不断学习最优策略,以获得最大累积奖励。【基础】2.15.核心要素:智能体、环境、状态、动作、奖励。3.16.经典应用:AlphaGo、自动驾驶、游戏AI。(三)机器学习一般开发流程【必考】★★一个完整的机器学习项目通常包含以下几个步骤:1.问题定义:明确业务需求,确定是分类、回归还是聚类问题,设定性能指标(如准确率)。2.数据收集:从各种数据源(数据库、文件、网络爬虫)收集与问题相关的原始数据。3.数据预处理(数据清洗):【难点、易错点】1.4.数据清洗:处理缺失值(删除或填充)、处理重复值、处理异常值(噪声)。2.5.数据变换:将非数值数据(如文本标签“红”“绿”“蓝”)转换为数值,例如使用独热编码。对数值特征进行归一化或标准化,消除量纲影响。【重要】3.6.数据集成:将来自多个数据源的数据合并到一起。4.7.数据归约:通过特征选择或降维来减少数据量,提高模型效率。8.特征工程:从原始数据中构建更能体现数据规律的新特征,或对现有特征进行组合、转换,这对模型效果至关重要。【难点、拉分点】9.模型选择与训练:根据问题类型选择合适的算法(如分类选KNN、回归选线性回归),将处理好的训练数据输入算法进行学习,得到具体的模型参数。10.模型评估与优化:使用未曾参与训练的数据(测试集)来评估模型的泛化能力。如果效果不佳,需要调整算法参数(调参)或更换算法,并重复训练和评估过程。【重要】11.模型部署与应用:将训练好的、性能达标的模型集成到实际应用系统中,对新数据进行预测。三、核心算法原理与实践(一)监督学习——K近邻(KNearestNeighbors,KNN)【高频考点】★★★1.基本原理:“物以类聚,人以群分”。对于一个待分类的新样本,算法会在训练集中找到与其在特征空间中最接近的K个样本(邻居),然后根据这K个样本的标签通过“多数投票”的方式来决定新样本的类别。【基础】2.核心三要素:【重要】1.3.K值的选择:超参数,对结果影响巨大。1.2.4.K值过小:模型过于复杂,容易受到个别噪声点的影响,导致过拟合。2.3.5.K值过大:模型过于简单,会将较远的、不相关的样本也考虑进来,导致欠拟合。通常采用交叉验证的方法来选取最优的K值。【易错点、难点】4.6.距离度量:衡量样本之间相似度的方法。1.5.7.欧氏距离(EuclideanDistance):最常用,即多维空间中的直线距离。$d=\sqrt{\sum_{i=1}^{n}(x_iy_i)^2}$【基础公式】2.6.8.曼哈顿距离(ManhattanDistance):各个坐标轴方向上的绝对距离之和。$d=\sum_{i=1}^{n}|x_iy_i|$7.9.决策规则:通常采用分类决策中的“多数表决法”,即K个邻居中哪个类别最多,新样本就被分到哪个类。也可以根据距离远近为邻居赋予不同的权重(距离越近权重越大)。10.算法优缺点:【简答题考点】1.11.优点:简单直观,易于理解和实现;无需训练,直接利用数据进行预测(属于惰性学习);特别适用于多分类问题。2.12.缺点:预测速度慢(因为需要计算新样本与所有训练样本的距离);对高维数据敏感(维度灾难);对数据的局部结构敏感,需要选择合适的距离度量。13.代码实践要点(以Scikitlearn为例):sklearn.neighborssklearn.neighborsimportKNeighborsClassifier2.15.创建模型:model=KNeighborsClassifier(n_neighbors=5)设置K=5model.fit模型:model.fit(X_train,y_train)X_train为特征,y_train为标签model.predict_pred=model.predict(X_test)sklearn.metricsmsklearn.metricsimportaccuracy_score;accuracy_score(y_test,y_pred)(二)监督学习——决策树(DecisionTree)【高频考点】★★★1.基本原理:模拟人类决策过程,通过构建一棵树形结构来进行预测。树的内部节点代表对一个特征的测试(例如“年龄是否大于30?”),分支代表测试结果,叶节点代表最终的决策结果(类别或数值)。【基础】2.核心概念:【重要】1.3.特征选择:决定在哪个节点选择哪个特征进行分裂。目标是让分裂后的子节点中的样本尽可能属于同一类别(即纯度越来越高)。2.4.纯度(Purity)/不纯度(Impurity):衡量一个节点中数据混乱程度的指标。1.3.5.信息熵(Entropy):衡量信息的不确定性。熵值越大,不确定性越大,纯度越低。$Entropy=\sum_{k=1}^{n}p_klog_2(p_k)$,其中$p_k$表示第k类样本所占的比例。【基础公式】2.4.6.基尼系数(Gini):与熵类似,用于衡量数据集的纯度。$Gini=1\sum_{k=1}^{n}p_k^2$。基尼系数越小,纯度越高。【基础公式】5.7.信息增益(InformationGain):使用熵作为不纯度度量时,划分前的不纯度减去划分后子节点不纯度的加权平均。信息增益越大,说明使用该特征进行划分所获得的“纯度提升”越大,该特征越好。8.剪枝(Pruning):【难点、易错点】1.9.目的:防止决策树过于复杂,导致过拟合。决策树如果生长得过深,会过度学习训练数据中的噪声和细节,从而失去对新数据的泛化能力。2.10.预剪枝:在树构建过程中提前停止分裂,例如限制树的最大深度、限制节点最少样本数等。3.11.后剪枝:先让树充分生长,然后自底向上将不重要的分支修剪掉。12.算法优缺点:1.13.优点:模型具有可读性,易于理解和解释;能够同时处理数值型和类别型数据。2.14.缺点:容易过拟合(需要剪枝);对数据中的小变化敏感,不稳定的数据集可能导致完全不同的树;容易偏向于选择取值较多的特征。15.集成学习思想简介:【拓展】1.16.单棵决策树效果可能有限,但将多棵决策树组合起来就能形成强大的模型。2.17.随机森林(RandomForest):通过自助采样构建多个不同的训练集,训练多棵决策树,然后综合所有树的投票结果。这是Bagging(装袋)思想的代表,能有效降低方差,防止过拟合。3.18.梯度提升树(GBDT/XGBoost):串行地构建决策树,每一棵新的树都致力于纠正前一棵树的预测错误。这是Boosting(提升)思想的代表。(三)无监督学习——KMeans聚类【高频考点】★★★1.基本原理:一种基于划分的聚类算法。它的目标是将n个样本划分到K个簇中,使得每个样本都属于离它最近的均值(簇中心)所对应的簇,并以此作为聚类的标准。【基础】2.算法步骤:【简答题考点】1.3.初始化:随机选择K个样本作为初始簇中心。2.4.分配:计算每个样本到这K个簇中心的距离,将其分配到距离最近的簇中心所在的簇。3.5.更新:对于每一个簇,重新计算该簇内所有样本的均值,作为新的簇中心。4.6.迭代:重复“分配”和“更新”步骤,直到簇中心的变化很小或达到最大迭代次数。7.核心问题——K值的选择:【高频考点、难点】1.8.问题:K值是预先指定的,但在实际应用中,通常不知道应该聚成几类。2.9.肘部法则(ElbowMethod):【重要】1.3.10.定义:通过绘制不同K值对应的损失函数(如所有样本到其所属簇中心的距离平方和,即SSE,误差平方和)的变化曲线。2.4.11.判断:随着K值的增加,SSE会减小。当K值小于真实簇数时,SSE下降幅度很大;当K值接近或超过真实簇数时,SSE下降幅度会骤减,曲线变得平缓。这个“肘部”位置对应的K值就是最佳选择。12.算法优缺点:1.13.优点:原理简单,易于实现;对于处理大数据集,该算法具有可扩展性和高效性。2.14.缺点:需要预先指定K值;对初始簇中心的选择敏感,不同初始化可能导致不同结果;对噪声和离群点敏感;只能发现球状簇。四、模型评估与性能度量(一)数据集划分【必考】★★1.训练集:用于训练模型,让模型学习数据中的规律。2.验证集:用于模型选择和调参,评估不同模型或参数组合的性能。3.测试集:用于评估最终模型的泛化能力,即模型在完全未见过的数据上的表现。测试集绝对不能参与训练过程。4.交叉验证(CrossValidation):一种评估模型泛化能力的统计学方法,可以有效避免过拟合和欠拟合。最常用的是K折交叉验证,将数据集分成K份,每次用K1份作为训练集,剩下1份作为验证集,轮流进行K次训练和验证,最终取K次验证结果的平均值。【重要】(二)分类任务评估指标【高频考点】★★★假设对于二分类问题,将两个类别分别称为正类(Positive)和负类(Negative)。1.混淆矩阵(ConfusionMatrix):【基础】1.2.TP(真正例):实际为正,预测为正。2.3.TN(真负例):实际为负,预测为负。3.4.FP(假正例):实际为负,但错误地预测为正(误报)。4.5.FN(假负例):实际为正,但错误地预测为负(漏报)。6.核心指标:【必考计算题】1.7.准确率(Accuracy):预测正确的样本数占总样本数的比例。$Accuracy=\frac{TP+TN}{TP+TN+FP+FN}$1.2.8.局限性:在样本不平衡时(如99个正例,1个负例),模型即使全部预测为正,准确率也高达99%,但此时模型毫无意义。3.9.精确率(Precision):在所有被预测为正类的样本中,实际也为正类的比例。$Precision=\frac{TP}{TP+FP}$。衡量的是模型“找得准不准”。【重要】4.10.召回率(Recall):在所有实际为正类的样本中,被正确预测为正类的比例。$Recall=\frac{TP}{TP+FN}$。衡量的是模型“找得全不全”。【重要】5.11.F1分数(F1Score):精确率和召回率的调和平均值,综合反映了模型的性能。$F1=\frac{2PrecisionRecall}{Precision+Recall}$【重要】(三)回归任务评估指标1.均方误差(MSE):预测值与真实值之差的平方的平均值。$MSE=\frac{1}{n}\sum_{i=1}^{n}(y_i\hat{y}_i)^2$【基础公式】2.平均绝对误差(MAE):预测值与真实值之差的绝对值的平均值。$MAE=\frac{1}{n}\sum_{i=1}^{n}|y_i\hat{y}_i|$【基础公式】3.决定系数(Rsquared):表示模型能够解释的数据变异性的比例,取值范围通常在0到1之间,越接近1,模型拟合效果越好。(四)欠拟合与过拟合【必考、难点】★★★1.欠拟合(Underfitting):【基础】1.2.定义:模型在训练集上表现不佳,未能捕捉到数据的基本规律。2.3.原因:模型过于简单,特征太少,训练不足。3.4.解决方法:增加模型复杂度(如增加决策树深度)、增加特征、减少正则化参数、延长训练时间。5.过拟合(Overfitting):【基础】1.6.定义:模型在训练集上表现极好,但在测试集上表现很差。模型“死记硬背”了训练数据中的噪声和细节,丧失了泛化能力。【高频考点】2.7.原因:模型过于复杂,数据量太少,特征过多,训练过度。3.8.解决方法:【重要】1.4.9.增加训练数据量。2.5.10.降低模型复杂度(如减少决策树深度、增加KNN中的K值)。3.6.11.进行特征选择,减少冗余特征。4.7.12.加入正则化项(如L1、L2正则化),限制模型参数的大小。5.8.13.对于集成模型,采用交叉验证和早停法。五、算法综合对比与项目实践指引(一)算法适用场景速查表(知识结构化)1.K近邻(KNN):适用于低维空间、样本数量适中的分类与回归问题。典型应用:手写数字识别(小型数据集)、推荐系统(找相似用户/物品)。2.决策树:适用于需要解释性的分类与回归问题。典型应用:信用风险评估、医疗诊断辅助、用户流失分析。3.朴素贝叶斯:适用于特征条件独立假设较强的文本分类问题。典型应用:垃圾邮件过滤、情感分析。4.KMeans聚类:适用于无标签数据的探索性分析,发现潜在群组。典型应用:客户分群、图像分割、文档聚类。5.线性回归:适用于特征与目标之间存在线性关系的回归预测问题。典型应用:商品销量预测、房价预测。(二)项目实践全流程案例分析(以“鸢尾花分类”为例)1.导入数据:从Scikitlearn库中加载经典的Iris数据集,包含150个样本,4个特征(花萼长宽、花瓣长宽),3种标签(山鸢尾、变色鸢尾、维吉尼亚鸢尾)。【基础】2.探索与预处理:查看数据基本信息,检查缺失值。由于特征量纲不同(如花萼长(cm)和花瓣宽(cm)),进行标准化处理,使每个特征均值为0,标准差为1,这对KNN算法尤为重要。【重要】3.划分数据集:将数据集的70%作为训练集,30%作为测试集,确保数据划分时各类别比例均衡(分层采样)。【重要】model.fit型:选择KNN分类器,设置初始K=3。使用训练集进行训练:model.fit(X
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 模拟出国面试题及答案
- 2026年美术教师资格证考试试题及答案
- 新县纪委监委公开遴选公务员笔试试题及答案解析
- 2025年音乐继续教育考试试题及答案
- 《初级经济法基础》劳动合同法律制度试题及答案
- 2026中国医疗卫生市场供需考察现状分析评估投资布局规划研究报告
- 2026年《安全生产法》应知知识考试题及答案
- 2026中国非血管支架临床应用拓展与医生教育体系报告
- 2026中国自动驾驶感知系统技术路线与商业化落地前景研判报告
- 2026燃气设施行业市场现状供需分析及投资评估规划分析研究报告
- 2026-2030中国AKT抑制剂行业市场现状分析及竞争格局与投资发展研究报告
- 2026中国民生银行私银财富经理招聘笔试备考试题及答案详解
- 建筑行业工程质量检测与监管方案
- 药品质量风险管理规程培训
- 外墙面保温砂浆施工监理实施细则
- 机械设备安装工岗位技能培训教材
- 肺部健康防护指南
- 2025神介学苑历年考核真题及答案全收录
- 2026年民间借贷合同纠纷法律问题研究
- 2025版肉毒中毒诊治急诊专家共识课件
- JJF 2376-2026 智能网联汽车自动泊车性能 计量测试规范
评论
0/150
提交评论