版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
课堂设计一、基本信息课次第4讲课次学时数2学时主题机器学习方法二、设计方案课堂目标(一)知识目标能阐述机器学习的概念和主要任务;能描述kNN分类和kMeans聚类的基本思想、主要超参数和计算过程;能简述kNN分类和kMeans聚类的适用条件和优缺点。(二)能力目标能对比分析分类与聚类的区别和联系;能分析超参数对kNN分类、kMeans聚类方法的影响;能针对具体问题判定任务类别:是分类还是聚类,并能正确选择kNN或kMeans方法进行求解。(三)素质目标能提升科学的问题分解和性能评价的思维习惯,增强树立应用机器学习方法解决军事问题的意识。教学重难点(一)教学重点分类与聚类的定义、kNN分类方法、kMeans聚类方法。(二)教学难点分类和聚类的性能评价教学设计思路(一)教学内容组织1.机器学习概念及分类2.分类方法-kNN3.聚类方法-kMeans(二)教学方法策略1.教学思路与方法采用启发式教学方法,通过讲解人类学习过程,引出并分析机器学习过程。采用研讨式教学方法,对给定问题由学生进行研讨辨析分类和聚类的区别、联系,及分类;由学生对kNN分类、kMean聚类方法的优缺点等进行研讨、分析、归纳和总结;以交互式方式让学生参与kMeans计算过程,促进学生对算法过程的深入理解。采用案例式教学方法,通过SAR军事装甲车辆识别(分类)讲解kNN方法,通过军事文本聚类需求讲解kMeans方法;以问题链牵引,层层深入对方法目标、距离度量、特征表示等进行启发思考、逐层分析。2.课程思政设计(1)科学思维:启发学生树立递进分解问题、定量分析问题的科学思维。(2)精武强军精神:通过kNN技术识别SAR目标的应用,启发学生树立利用智能技术提升军事作战效能。3.军事特色通过军事案例分析和研讨,树立应用智能方法解决军事问题的意识。教学资源1.头歌(EduCoder)平台在线资源2.《人工智能技术及其军事应用》在线课程——教案主页内容组织与过程设计备注课堂导入人的学习通常是先根据经验归纳规律,再依据规律给出解决新问题的方法。其中,经验可以是多次经历某事的过程。与人类似,机器的学习通常基于许多历史数据训练出一个计算机程序,再利用所训练的计算机程序对新的数据进行预测。在此,计算机程序也被称为模型,而训练模型的历史数据,则类似于人学习的经验,指导模型归纳学习规律,最终所学规律会使模型对某类任务的性能得到提升。理论讲授一、机器学习概念及分类教学目标1:能阐述机器学习的概念和分类,能对比分析分类与聚类的区别和联系,能辨识一个问题是分类问题,还是聚类问题。(一)机器学习概念为了给机器学习一个更正式的定义,我们引用全球机器学习之父、卡内基梅隆大学(单击)计算机学院院长TomMitchell,在《机器学习》一书中的定义:“对于某类任务T和性能度量P,(单击)如果一个计算机程序在T上以P衡量的性能随着经验E而自我完善,那么我们称这个计算机程序在从经验E学习。”通俗来说,机器学习就是研究计算机程序随着经验积累自动提高性能的学问。机器学习运用与人的学习运用类似,人的学习运用需要先总结规律,再利用规律解决新问题,机器学习运用则需要先根据历史数据训练模型,再利用模型对新的数据进行预测。(二)机器学习分类机器学习就是机器模仿人进行学习,所以搞清楚人的学习分类,就可以理解机器学习的分类。人的学习大致可以分为有人指导学习和无人指导学习。比如我们从小学到大学的教育就是在老师的指导下进行的学习,这种有人指导的学习可以极大地提高学习的效率;而抗战时期,我军没有条件开设学校,很多指挥员都是在战争中学习战争,从战争中总结经验,这种学习就是无人指导的学习。机器学习中,对应有人指导和无人指导的学习,可以分为有监督学习和无监督学习。有监督学习是指有期望输出条件下的学习,其训练数据包括成对的输入与输出数据。模型训练好后,给定一个输入则模型会产生一个明确的预期输出。无监督学习是指无期望输出条件下的学习,其训练数据仅包括输入数据,没有输出数据。模型训练好后,通常会为输入数据生成潜在的规律,但是输出是无法预期的。有监督学习很清楚自己想要什么,有着非常明确的期望输出。依据期望输出的数值类型,有监督学习主要包括回归和分类两大任务。其中,回归任务的期望输出是连续的数值,如预测房价、气温等;而分类任务的期望输出则是离散的数值,如预测动物的类别、人的性别等。无监督学习,顾名思义,就是不受监督指导的学习。该学习方式没有期望输出进行指导,直接通过自我认知、自我归纳进行学习。与有监督学习最大的区别是,模型的训练数据不再提供期望输出信息。这也使得无监督学习通常以数据间的差异度或相似度来进行自我学习。聚类就是无监督学习的典型任务。(三)分类与聚类任务讨论:你如何理解分类与聚类?两者有何区别?有何联系?问题:将花生和绿豆分开,是一个分类任务还是聚类任务?分类:基于数据(对象)的特征或属性将其划分到预定义的类别中的过程。机器学习中,分类是一种有监督学习,基于有标签数据集进行训练,用于对新的、未见数据的的类别预测。聚类:基于数据点之间相似度将数据集进行分组(grouping)的过程。聚类是一种无监督学习,基于无标签数据点,发现数据内部规模或模式的方法。讨论:你如何理解分类与聚类?两者有何区别?有何联系?分类(Classification):如果我们已有一批标记好的种子,即一部分花生已经被标记为“花生”,一部分绿豆被标记为“绿豆”,基于这些已知标记的种子来训练一个模型,以便对新的未标记种子进行预测(判断它是花生还是绿豆),那么这个问题就是一个分类问题。聚类(Clustering):如果我们没有预先标记,而是有一堆混在一起的种子,我们希望通过分析种子的大小、颜色、形状等属性,将它们自动分成几组,并且假设这些组能合理地对应到花生和绿豆这两类,那么这就是一个聚类问题。因此,决定这是分类问题还是聚类问题的关键在于是否有预定义的类别标签。如果有标签,就是分类;如果没有,而是需要自动发现类别,那就是聚类。二、分类方法-kNN教学目标2:能描述kNN分类的基本思想和主要过程,能分析超参数k对分类的影响,能简述kNN方法的适用条件和优缺点。(一)kNN分类方法假设已有一堆人工标记好类别的SAR目标图像,那么现在给你一幅SAR目标图像,你如何判断它属于何种类别呢?kNN(k-NearestNeighbor),称k最邻近,是由Cover和Hart于1968年提出的一种分类算法。所谓k最近邻,就是k个最近的邻居的意思,说的是每个样本都可以用它最接近的k个邻近值来代表。基本思路:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。该方法在决策上只依据最邻近的一个或者几个样本的类别来决定待分样本所属的类别。那么,我们如何对给定的SAR目标图像(称X)判定其类别呢?问题1:如何找到离X最近的一个或多个样本呢?问题2:如何度量X与一个样本的远近呢?(距离度量)问题3:用什么去表示X或一个样本用于计算远近呢?(特征表示)(1)特征表示:将图像像素矩阵按行拉成向量进行表示。(2)距离度量:采用欧式(或余弦)距离对两个样本计算距离。你还知道哪些距离度量?请课后查找1~2种距离度量,并描述之。(3)距离计算、排序、找最小。基于K-最近邻的SAR目标图像识别流程1-构建训练样本集的图像点矩阵M每个样本图片对应矩阵一行(128*128列)2-构建所有训练样本对应的类别向量C3-构建待分类样本的图像点向量V4-计算V与M每行数据之间的欧几里得距离5-排序确定最邻近的k个样本6-最邻近k个样本中出现次数最多的类别为目标识别结果(二)超参数k分析假设二维空间中有两类样本,如下图,请问当k=3时,红色样本属于哪类?当k=9时,又属于哪类?(你能得出哪些结论?你又有何疑问?)不同的k值会产生不同的分类结果。如果选择较小的k值,相当于用较小邻域中的训练实例进行预测,若邻近的实例恰好是噪声,那么预测就会出错,k值减小意味着整体模型变得复杂,容易发生过拟合;如果选择较大的k值,相当于用较大邻域中的训练实例进行预测,k值增大意味着模型变得简单;当k等于样本实例数N时,模型过于简单,只是对数据进行了统计,没有实际意义。如何选择超参数k呢?经验选择让分类误差做小。即将数据集拆分为训练集、验证集,执行模型训练和验证。通过选取不同的k,可以在验证集上获得模型性能的不同估计值,取验证性能最佳时对应的参数k作为模型超参数。(三)优缺点分析请根据以上内容,分析kNN方法的优缺点,并总结适用性!优点:①简单直观,易于实现;②不需要产生额外的数据来描述规则,它的规则就是训练数据(样本)本身并不是要求数据的一致性问题,即可以存在噪音;③在类别决策时,只与极少量的相邻样本有关。因此,采用这种方法可以较好地避免样本数量的不平衡问题。④直接利用了样本之间的关系,减少了类别特征选择不当对分类结果造成的不利影响,可以最大程度地减少分类过程中的误差项。缺点:①分类速度慢最近邻分类器是基于实例学习的懒惰学习方法,因为它是根据所给训练样本构造的分类器,是将所有训练样本首先存储起来,当要进行分类时,就临时进行计算处理。需要计算待分样本与训练样本库中每一个样本的相似度,才能求得与其最近的K个样本。对于高维样本或样本集规模较大的情况,其时间和空间复杂度较高,时间代价为O(mn),其中m为向量空间模型空间特征维数,n为训练样本集大小。②样本库容量依赖性较强对KNN算法在实际应用中的限制较大:有不少类别无法提供足够的训练样本,使得KNN算法所需要的相对均匀的特征空间条件无法得到满足,使得识别的误差较大。③样本的距离是根据样本的所有特征(属性)计算的。在这些特征中,有些特征与分类是强相关的,有些特征与分类是弱相关的,还有一些特征(可能是大部分)与分类不相关。这样,如果在计算相似度的时候,按所有特征作用相同来计算样本相似度就会误导分类过程。④必须指定K值,K值选择不当则分类精度不能保证。三、聚类方法-kMeans教学目标3:能描述kMeans聚类的基本思想和主要过程,能分析超参数k对聚类的影响,能简述kMeans方法的适用条件和优缺点。(一)聚类的标准聚类不同于分类,到底要聚成几个结果(簇)?怎样才算是一个好的聚类结果呢?好的聚类应该:高的簇内相似性,低的簇间相似性。高的簇内相似性,低的簇间相似性——具体如何去度量这个标准(准则)呢?度量这个标准涉及哪些内容?问题1:如何度量簇内(簇间)相似性?问题2:如何度量一个样本X与另一个样本Y的相似性呢?(距离度量)问题3:用什么去表示样本X或样本Y用于计算相似性呢?(特征表示)聚类结果的好坏取决于:聚类方法采用的相似度(距离)度量方法以及该方法的具体实现。包括:相似度通常用距离函数来表示;对不同类型的变量,距离函数的定义通常是不同的;根据实际的应用和数据的语义,在计算距离的时候,不同的变量有不同的权值相联系。聚类方法的好坏还取决于:该方法是能发现某些还是所有的隐含模式。(二)kMeans聚类方法kMeans算法,也被称为k-平均或k-均值,是一种得到最广泛使用的聚类算法。算法过程:1、随机地选择k个对象,每个对象初始地代表了一个簇的平均值或中心;2、对剩余的每个对象根据其与各个簇中心的距离,将它赋给最近的簇;3、重新计算每个簇的平均值;4、过程2和3不断重复,直到准则函数收敛。假设给定9个数据点,假设期望聚类的类别个数为2,对应坐标信息如图。假设选择P1作为类C1的质心,P2作为类C2的质心,请完成:执行迭代过程:第一次迭代,计算所有数据点到类C1和类C2的距离,根据距离将数据点划分到类C1或类C2中,在此P1距离类C1最近,P2至P9距离类C2最近,由此得到了所有数据点的类别归属,然后计算各类数据点的均值作为新的质心,计算得到类C1=(0.00,0.00),类C2=(6.38,5.00),此时质心相对初始质心发生了改变,故继续循环。第二次迭代,计算所有数据点到类C1和类C2的距离,根据距离将数据点划分到类C1或类C2类中,此时P1、P2、P3距离类C1最近,P4至P9距离类C2最近,由此得到所有数据点的类别归属,然后计算各类数据点的均值作为新的质心,计算得到类C1=(1.67,0.67),类C2=(7.67,6.33),此时质心相对初始质心发生了改变,故继续循环。第三次迭代,计算所有数据点到类C1和类C2的距离,根据距离将数据点划分到类C1或类C2类中,此时P1至P4距离类C1最近,P5至P9距离类C2最近,由此得到所有数据点的类别归属,然后计算各类数据点的均值作为新的质心,计算得到类C1=(2.25,1.00),类C2=(8.40,7.20),此时质心相对初始质心发生了改变,故继续循环。第四次迭代,计算所有数据点到类C1和类C2的距离,根据距离将数据点划分到类C1或类C2类中,在此P1至P4距离类C1最近,P5至P9距离类C2最近,由此得到了所有数据点的类别归属,然后计算各类数据点的均值作为新的质心,计算得到类C1=(2.25,1.00),类C2=(8.40,7.20),此时质心相对前一次迭代未发生改变,故终止循环。至此,kMeans聚类算法结束,得到数据点的两类划分。在kMeans算法前,我们讨论了一个好的聚类的评判准则:高的簇内相似性,低的簇间相似性。那么,kMeans算法的评判准则(准则函数)是什么?能不能用数学形式化表示呢?kMeans的准则函数——最小均方误差MSE其中,,是的质心,是类别(簇)的个数。关于这个度量,请大家思考:问题1:这个准则函数度量的是什么?高的簇内相似性,低的簇间相似性?问题2:在这个准则函数的学习目标条件下,我们要求解的是啥?问题3:你如何理解这个准则函数?kMeans一定能聚类出评判准则要求的结果(簇)吗?如图所示:由于聚类初始点的不同,导致聚类结果不是期望的4个类簇。当然,kMeans对于非凸类簇或非均匀类簇的分布都不具有适应性。(三)优缺点分析请根据以上内容,分析kMean方法的优缺点,并总结适用性!优点:①原理比较简单,实现也是很容易,收敛速度快;②聚类效果较优,算法的可解释度比较强。缺点:①K值的选取不好把握;②对于不是凸的数据集比较难收敛;③如果各隐含类别的数据不平衡,比如各隐含类别的数据量严重失衡,或者各隐含类别的方差不同,则聚类效果不佳;=4\*GB3④采用迭代方法,得到的结果只是局部最优;=5\*GB3⑤对噪音和异常点比较的敏感。(四)军事文本聚类案例现在有一堆军事武器相关的介绍文档,期望将这些文档归类放置,请问如何实现这一需要呢?案例数据来自于环球军事网,主要涉及各类武器的文本简介,包括8个类别,共430个文档。期望将这些文档聚类为飞行器、舰船舰艇、枪械与单兵、坦克装甲车、火炮、导弹武器、太空装备和爆炸物8个类簇。以上数据通过网络爬虫获取得到,存储于txt文档中,每个文档对应一个武器的文本简介。由于聚类算法无法直接处理文本数据,故采用文本预处理技术将每个文档内容转化为一个向量。具体实现时,先采用结巴中文分词器,对文本进行分词获得文档词;再通过TF-IDF对文档词进行向量化表示;最后,为了简化表示和可视化,通过T-SNE算法将特征降维至2维。这样每个文档就可以用2维平面上的一个点来表示,点与点之间的距离远近表达了文档和文档之间的相似程度,两点距离越近表示对应两个文档越相似。文档预处理结束后,采用kMeans算法进行聚类。设置类别个数为8,最大迭代次数为100。可以得到如图所示的聚类结果。图中,不同颜色的点表示不同的类簇。由图可以发现,数据点被归为8个类,且类内数据点相对聚集,类间数据点相对远离。此时,我们对每个类的所有文本内容进行词云显示,得到8个类的词云图,见下图。由图可以发现,第1个类包含AK、56毫米等词,表示枪械与单兵;第2个类别包含大黄蜂、幻影等词,表示飞行器;第4个类包含BMP、车顶水平等词,表示坦克装甲车辆;第6个类包含USS、CV、CVN等词,表示舰船舰艇;第8个类包含东风、烈火等词,表示导弹武器。上述结果表明,虽然在聚类的过程中没有使用到预先了解的内容标签,但是kMeans算法聚类后各个文档实际上按照一定的主题聚在了一起。(五)超参数k分析kMeans算法需要预设类别个数k,当k设置为6或10时,结果如图。由图可以发现,各类之间仍具有较好的类聚性。此时,如何来决定聚类6个类别好?还是聚类10个类别好?从聚类效果来说,我们期望聚类后,同类数据点之间距离越近越好,不同类数据点之间距离越远越好。如何定量地评价不同聚类结果的好坏呢?下面介绍一种评价指标——轮廓系数。针对第个数据点,对应轮廓系数定义为如下公式:其中,簇内距离表示第个数据点与其所在簇内其他数据点的平均距离,该值越小,说明该数据点与同类数据的距离越小,同类数据聚类越紧凑。簇间距离表示第个数据点与其最近的簇内数据点的平均距离,该值越大,说明该数据点距离与其最近的簇越远,不同类簇分离得越远,不同类数据之间的分布越分散。如图4,有A、B、C三个簇,簇A中数据点到簇B内数据点的平均距离,小于其到簇C内数据点的平均距离为,故等于。聚类总的轮廓系数定义为所有N个数据点的轮廓系数和平均:轮廓系数综合考虑了簇内距离和簇间距离对聚类效果进行评价。轮廓系数数值范围在-1到1之间,数值越大表明聚类结果越好,数值越小表明聚类结果越差。当为0时,轮廓系数数值为-1。此时不同的簇无法分开。当为0时,轮廓系数数值为1。此时簇退化为一个点。根据轮廓系数评价指标,对从2到18不同的值进行kMeans聚类,计算每种聚类结果的轮廓系数。具体结果如图8,从图8可以发现,当时,轮廓系数最大,表明此时聚类结果最佳。同时,还可以发现较的轮廓系数要大,观察图7可以发现,时的分类结果相比较的结果,同类数据点相对更加聚集,不同类数据点在类边界上具有明显的可分性。上述结果表明,通过轮廓系数的对比,可以选择最佳的聚类参数。小结机器学习:有监督学习、无监督学习分类:kNN,近邻思想聚类:kMeans,高的簇内相似性,低的簇间相似性。回顾人的学习过程,引出授课内容。高阶性:引入权威定义并解释机器学习概念。重点:以类比的形式来引出有监督学习和无监督学习。思政:启发对人学习过程的总结和归纳。讲述基础知识。挑战性:以研讨的方式,启发学生思考。可以视情穿插相关案例帮助学习辨别分类和聚类。总结:可以让学生总结分类和聚类的区别和
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 电大可行性研究报告
- 整车及汽车零部件试验试制中心技术提升改造项目可行性研究报告
- 2026届新疆维吾尔自治区乌鲁木齐市高三第二次调研生物试卷含解析
- 卒中中心建设管理指导2026
- 蛋白质翻译后修饰与心肌缺血再灌注损伤2026
- 2026防疫招聘面试题库及答案
- 2026国网财务类面试题及答案
- 2026会议应急面试题目及答案
- 2026接待办面试题及答案
- 《法学基础理论》全套教学课件
- 高处作业吊篮专项施工方案完整版本
- 国家电网公司施工项目部标准化管理手册
- 污废水处理工考试试题及答案
- 玻璃钢船舶结构检验规范汇编
- 2025年管理学基础知识试题及答案
- 风电吊装安全培训课件
- 小升初语文试卷及答案人教版2025年
- 护理教改课题申报书范本
- 两癌筛查工作总结汇报
- 2025重庆忠县机关事业单位临聘4人备考考试题库附答案解析
- 2025云南地质工程勘察设计研究院有限公司招聘12人考试参考题库附答案解析
评论
0/150
提交评论