机器学习Python实战教学教案_第1页
机器学习Python实战教学教案_第2页
机器学习Python实战教学教案_第3页
机器学习Python实战教学教案_第4页
机器学习Python实战教学教案_第5页
已阅读5页,还剩85页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

章节名称第1章概述装订线授课安排装订线授课时数2授课时间1-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的了解机器学习领域的术语教学重点机器学习中的分类与回归教学难点有监督学习与无监督学习;模型的泛化、过拟合与欠拟合☆教学过程与内容:构造情境,引出机器学习概念(1)教师根据课件,讲述机器学习的诞生与发展。在计算机系统中,经验通常以数据的形式存在。为了能够自动地从经验中提取出学习算法,需要获得过去大量的邮件实例作为数据。从实例数据中学习出垃圾邮件的模型,以此作为判断的依据。(2)教师根据课件,介绍机器学习概述。机器学习(MachineLearning)是计算机程序随着经验积累自动提高性能或系统自我改进的过程,即通过经验提高性能的某类程序。机器学习通常需要一定的算法,依据特定的指令序列,将输入变换得到输出,然而,对于现实中的很多任务,我们并没有确定的算法,我们希望计算机自动地为学习任务提取相应的算法。(3)教师根据课件,介绍机器学习所研究的主要内容。机器学习所研究的主要内容,是如何在计算机上从数据中产生模型的算法,即学习算法。机器学习是研究学习算法的学问,机器学习的过程是从大量数据中自动地寻找有用模型的过程。本课程内容比较抽象,理解上有一定难度,鼓励学生要敢于面对困难,要有战胜困难的勇气与智慧。(4)明确学习目标。要求学生了解机器学习中的分类与回归要求学生理解有监督学习与无监督学习要求学生理解模型的泛化、过拟合与欠拟合进行重点知识的讲解教师根据课件,讲解机器学习的基本术语。机器学习的方法试图从数据中寻找特定的模型,这种从数据中学得模型的过程称为学习(Learning)或训练(Training)。如果希望预测的结果是离散值,此类学习任务称为分类(Classification);如果希望预测的结果是连续值,此类学习任务称为回归(Regression)。教师根据课件,讲解有监督学习与无监督学习。依据训练数据是否拥有标记信息,机器学习任务可大致划分为监督学习(SupervisedLearning)和无监督学习(UnsupervisedLearning)两大类。教师根据课件,讲解模型的泛化、过拟合与欠拟合。学习得到的模型适用于新样本的能力称为泛化(Generalization)能力。过拟合:对于一个假设,当存在其他的假设对训练样例的拟合比它差,但事实上在包含训练集合以外的实例的整个分布上表现得却更好时,说这个假设过度拟合训练样例;在模型在训练集上表现的非常优秀,可以有效的区分每一个样本。但是在测试集上则表现的十分糟糕。欠拟合,是指学习器对训练样本的一般性质尚未学好;所训练的模型在训练集中表现的就很差,既准确度很低。三、归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。提问讲解的知识点,对存在问题进行讲解。带领学生回顾机器学习的应用场景;有监督学习与无监督学习、分类、回归、泛化、过拟合与欠拟合的。(2)布置随堂练习,检查学生掌握情况。给学生布置随堂练习,检测学生的掌握程度,并对学生出现的问题进行解决。(3)课后记:学生一开始对大量的概念比较模糊,后期逐个接触后慢慢理解。

章节名称第2章基于Python语言的环境配置装订线授课安排装订线授课时数2授课时间1-2授课方法讲授+课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握Python程序的运行方式了解程序开发流程及编写方法教学重点掌握基本库的安装和使用教学难点配置开发环境☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了机器学习的相关概念,本节课介绍Python环境配置、集成开发环境、程序开发与编写。本次课的内容需要同学们积极动手,遇到问题多进行交流和讨论,促进学生进一步思考。(3)明确学习目标。Python的下载和安装JupyterNotebook的安装与使用方法一些必需库的安装及功能简介scikit-learn——Python机器学习库进行重点知识的讲解教师根据课件,演示安装Python解释器。教师根据教材内容,以Windows系统为例演示安装python解释器。教师根据课件,讲解Python程序的运行方式。Python程序的运行方式有两种分别为交互式和文件式。交互式指Python解释器逐行接收Python代码并批量即时响应;文件式也称批量式,指先将Python代码保存在文件中,再启动Python解释器批量解释代码。教师根据课件,演示如何运行Python程序。教师根据教材内容1.3.3中的示例代码,演示Python代码的运行。教师根据课件,介绍JupyterNotebook的安装与使用方法。教师根据教材内容,以Windows系统为例演示如何下载安装和使用JupyterNotebook。教师根据课件,介绍一些必需库的安装及功能简介。教师根据课件介绍NumPy库、SciPy库、Pandas库、Matplotlib库的使用。教师根据课件,介绍scikit-learn——Python机器学习库。scikit-learn是一个由第三方志愿者维护的、不断改进的机器学习库;scikit-learn是一个建立在NumPy、SciPy和Matplotlib模块之上的,主要用Python语言开发的开源机器学习模块。归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)课后记:只要遵循教师演示的步骤,学生都能完成开发环境的搭建。(上机练习)上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机一:请按照以下要求开始上机课:要求如下:掌握JupyterNotebook的安装与使用掌握程序开发流程掌握程序编写的基本方法

章节名称第3章K最近邻算法装订线授课安排装订线授课时数2授课时间2-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的K最近邻算法的原理与用法教学重点K最近邻算法处理多元分类任务、用于回归分析教学难点使用K最近邻算法进行建模;使用模型对新样本的分类进行预测☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了Python环境配置、集成开发环境、程序开发与编写,本节课介绍K最近邻算法。(3)明确学习目标。K最近邻算法的原理K最近邻算法的用法K最近邻算法项目实战进行重点知识的讲解教师根据课件,介绍最近邻算法的原理。KNN(K-NearestNeighbor)法即K最邻近法,最初由Cover和Hart于1968年提出,是一个理论上比较成熟的方法,也是最简单的机器学习算法之一。该方法的思路非常简单直观:如果一个样本在特征空间中的K个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。该方法在定类决策上只依据最邻近的一个或者几个样本的类别来决定待分样本所属的类别。K最近邻算法是分类算法比较基础的算法,它易于理解。核心思想就是距离的比较,离谁越近,就被归类于谁。该原理如“近朱者赤,近墨者黑”,晋朝文学家和哲学家傅玄在《太子少傅箴》中指出:“近朱者赤,近墨者黑;声和则响清,形正则影直。”告诉人们一个人生活在好的环境里受到好的影响,生活在坏的环境里也会受到坏的影响,强调环境对人的影响。教师根据课件,讲解K最近邻算法的用法。K最近邻的核心数学知识,就是距离的计算和权重的计算。我们把需要预测的点作为中心点,然后和它周围的一定半径内的已知点计算距离,挑选前k个点,进行投票。再k个点中,哪个类别的点多,该预测点就被判定属于哪一类。这就是k最近邻分类中k的意思。k值的确定可以通过设置不同的k值,然后比较不同k值对应的最后的分类的正确率来确定。K最近邻算法在分类任务中的应用K最近邻算法处理多元分类任务K最近邻算法用于回归分析教师根据课件,演示如K最近邻算法项目实战——酒的分类。对数据集进行分析生成训练数据集和测试数据集使用K最近邻算法进行建模使用模型对新样本的分类进行预测归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)布置课后习题(4)课后记:学生对机器学习第一个算法模型KNN理解还比较能接受。

章节名称第3章K最近邻算法装订线授课安排装订线授课时数2授课时间2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的K最近邻算法的原理与用法教学重点K最近邻算法处理多元分类任务、用于回归分析教学难点使用K最近邻算法进行建模;使用模型对新样本的分类进行预测☆教学过程与内容:教师演示教师根据课件,演示如K最近邻算法项目实战——酒的分类。对数据集进行分析生成训练数据集和测试数据集使用K最近邻算法进行建模使用模型对新样本的分类进行预测KNN的分类思想生动形象的说明了客观环境对人的影响是很大的,特别是对青少年,所以不仅注重环境选择,更注意一定环境中人的交往。上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机:使用K最近邻算法进行酒的分类请按照以下要求开始上机课:从sklearn的datasets模块载入酒的数据集打印酒的数据集中的简短描述红酒数据集中的键:dict_keys(['data','target','target_names','DESCR','feature_names'])将数据集拆分为训练数据集和测试数据集X_trainshape:(133,13)X_testshape:(45,13)y_trainshape:(133,)y_testshape:(45,)导入KNN分类模型fromsklearn.neighborsimportKNeighborsClassifier指定模型的n_neighbors参数值为1knn=KNeighborsClassifier(n_neighbors=1)用模型对数据进行拟合knn.fit(X_train,y_train)打印模型的得分测试数据集得分:0.76输入新的数据点;使用.predict进行预测预测新红酒的分类为:['class_2']归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)检测学生随堂练习掌握情况。(3)布置课后习题(4)课后记:机器学习算法的设计模式与之前的程序设计模式有些不一样,学生一开始需要慢慢适应。

章节名称第4章广义线性模型装订线授课安排装订线授课时数2授课时间3-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握线性模型的基本原理与用法教学重点掌握线性模型的基本概念教学难点使用线性模型进行建模;使用模型对新样本的分类进行预测☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了K最近邻算法的原理与用法,本节课介绍线性模型。对线性方程组的研究,中国比欧洲至少早1500年,记载在公元初《九章算术》方程章中。激发学生的爱国之情与自豪感,勉励他们树立为国家、为人民努力奋斗的远大理想。(3)明确学习目标。线性模型的基本概念最基本的线性模型——线性回归进行重点知识的讲解教师根据课件,介绍线性模型的基本概念。4.1.1线性模型的一般公式4.1.2线性模型的图形表示4.1.3线性模型的特点教师根据课件,讲解最基本的线性模型——线性回归。线性回归的基本原理回归的目的就是进行连续值的预测:回归之所以能预测是因为他通过历史数据,摸透了“套路”,然后通过这个套路来预测未来的结果。在二维空间中绘制两个变量之间的关系——图象是直线,这样的两个变量之间的关系就是“线性关系”,如果图象不是直线,就是“非线性关系”。回归算法是一种有监督学习算法,用来建立自变量X和观测变量Y之间的映射关系,如果观测变量是离散的,则称其为分类Classification;如果观测变量是连续的,则称其为回归Regression。线性回归模型试图学得一个线性模型以尽可能准确地预测实值X的输出标记Y。在这个模型中,因变量Y是连续的,自变量X可以是连续或离散的。LinearRegression线性回归的基本思想:寻找直线/平面/超平面,使得输入数据的残差最小线性回归算法:最终的线性回归的结果为:归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)课后记:学生对数学公式之类的接受比较困难,但是通过具体实例可以让学生理解算法原理,比较容易学习算法模型。章节名称第4章广义线性模型装订线授课安排装订线授课时数2授课时间3-2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握线性模型的基本原理与用法教学重点掌握线性模型的基本概念教学难点使用线性模型进行建模;使用模型对新样本的分类进行预测☆教学过程与内容:实例学习:连锁店消暑饮料的送货量预测我们通过“连锁店消暑饮料的送货量预测”的实例来学习在连续值预测方面应用最广泛的线性回归算法,以及一些用途广泛的扩展算法。场景描述:连锁便利店的店面面积都不大,没有大量储存货品的能力,针对连锁店来说,如果能精确计算出每天的补货量,特别是对一些季节性强的货品进行统一配送,将有利于节约能源和提高店面使用率。分析:想要对夏季冷饮类货品进行精确配送,这就要较好地预测第二天每个连锁店的销售量,这个预测要依据以往的销售情况,冷饮类货品的销售量与气温,当地常住人口,店面交通便捷程度等因素都有较大关系。获取数据:考虑气温,当地常住人口,店面交通情况因素,通过以往销售数据的记录,整理得到表中的数据。绘制图像:数据有规律性趋势,随着气温升高销售量逐步增大,在电子表格中对“趋势线”添加方程𝐲=〖𝒌_𝟏𝒙〗_𝟏+〖𝒌_𝟐𝒙〗_𝟐+〖𝒌_𝟑𝒙〗_𝟑+𝒃(Y表示销售量,𝒙_𝟏、𝒙_𝟐、𝒙_𝟑代表公交站点数,气温和常驻人口)模型分析:模型只要用以往销售记录中的y和[𝒙_𝟏,𝒙_𝟐,𝒙_𝟑]数据计算出𝝎和𝒃,之后就可以通过给定新的[𝒙_𝟏,𝒙_𝟐,𝒙_𝟑]计算销售量。由于方程建立在著名的线性方程𝐲=𝝎𝑿+𝒃的基础上,这个方法被称为“线性回归”,同线性方程一样,线性回归中𝝎也被称权重矩阵,𝒃被称为偏置值。线性回归就是说通过学习到的线性模型来与猜测新的样本的输出值,站位科学角度和事实角度,对事实进行分析论证。教师根据课件,演示线性回归。对数据集进行分析生成训练数据集和测试数据集使用线性回归进行建模算出线性回归方程上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机:使用线性回归算法求解方程线性回归模型的预测线归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)课后记:通过列举生活实例加深学生对线性模型的理解,结合程序代码的实现帮助学生学习模型算法。

章节名称第4章广义线性模型装订线授课安排装订线授课时数2授课时间4-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握岭回归、套索回归的基本原理与用法教学重点L1、L2正则化的线性模型教学难点岭回归、套索回归的参数调节☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了线性回归算法的原理与用法,本节课介绍岭回归、套索回归模型。机器学习算法针对特定数据所训练出来的模型并非是十全十美的,再加上数据本身的复杂性,误差不可避免。说到误差,就必须考虑其来源:模型误差=偏差(Bias)+方差(Variance)+数据本身的误差。学习中出现错误问题是不可避免的,鼓励学生自主发现问题、分析问题和解决问题。(3)明确学习目标。使用L2正则化的线性模型——岭回归使用L1正则化的线性模型——套索回归进行重点知识的讲解教师根据课件,介绍使用L2正则化的线性模型——岭回归模型的基本原理。-岭回归是一种用于共线性数据分析的有偏估计回归方法,是一种改良的最小二乘估计法;-通过放弃最小二乘法的无偏性,以损失部分信息、降低精度为代价从而获得更符合实际、更可靠的回归系数,对病态数据(这样的数据中某个元素的微小变动会导致计算结果误差很大)的拟合效果比最小二乘法好。-岭回归通过在代价函数后面加上一个对参数的约束项(回归系数向量的l2范数与一个常数α的乘积,称作L2正则化)来防止过拟合。教师根据课件,讲解使用L1正则化的线性模型——套索回归。-Lasso(Leastabsoluteshrinkageandselectionoperator)方法是以缩小变量集(降阶)为思想的压缩估计方法。它通过构造一个惩罚函数,可以将变量的系数进行压缩并使某些回归系数变为0,进而达到变量选择的目的。-在数学表达上,Lasso类似于岭回归,也是在代价函数基础上增加了一个惩罚项的线性模型,区别在于Lasso的正则项为系数向量的l1范数与一个常数α的乘积(称作L1正则化)-Lasso是可以估计稀疏系数的线性模型,尤其适用于减少给定解决方案依赖的特征数量的场合。如果数据的特征过多,而其中只有一小部分是真正重要的,此时选择Lasso比较合适。教师根据课件,演示套索回归和岭回归的对比。归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)课后记:通过不同类型的线性模型的对比加深学生对模型的理解,结合图示帮助学生理解模型参数对模型拟合效果的区别。

章节名称第4章广义线性模型装订线授课安排装订线授课时数2授课时间4-2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握岭回归、套索回归的基本原理与用法教学重点L1、L2正则化的线性模型教学难点岭回归、套索回归的参数调节☆教学过程与内容:上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。选择学生感兴趣的实际问题,吸引学生积极参与,引导学生的正确价值取向。形式:单独完成上机:使用线性回归算法进行房价预测要求如下:1.导入boston数据集fromsklearn.datasetsimportload_bostonboston=load_boston()X=boston['data']#数据样本y=boston['target']#目标变量2.将数据集划分为训练集和测试集fromsklearn.model_selectionimporttrain_test_splitX_train,X_test,y_train,y_test=train_test_split(X,y,random_state=8)3.使用线性回归算法进行建模并训练模型fromsklearn.linear_modelimportLinearRegressionreg=LinearRegression()#建立线性回归模型对象reg.fit(X_train,y_train)#训练模型4.测试模型进行数据预测和评分#预测测试集结果y_pred=reg.predict(X_test)print("测试集得分:{:.2f}".format(reg.score(X_test,y_test)))测试集得分:0.725.绘制折线图对比预测值和真实值归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)检测学生随堂练习掌握情况,布置课后练习(3)课后记:在学习过两个典型的机器学习模型后,学生已经了解模型的编程模式,并尝试应用到实际应用中。

章节名称第5章朴素贝叶斯装订线授课安排装订线授课时数2授课时间5-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握贝努利、高斯、多项式朴素贝叶斯的基本原理与用法教学重点朴素贝叶斯算法的三种不同方法教学难点使用高斯朴素贝叶斯进行建模☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了岭回归、套索回归的基本原理与用法,本节课介绍贝努利、高斯、多项式朴素贝叶斯模型。朴素贝叶斯分类器(NaiveBayesClassifier或NBC)发源于古典数学理论,有着坚实的数学基础,以及稳定的分类效率。朴素贝叶斯算法假设了数据集属性之间是相互独立的,因此算法的逻辑性十分简单,并且算法较为稳定,当数据呈现不同的特点时,朴素贝叶斯的分类性能不会有太大的差异。相对于其他精心设计的更复杂的分类算法,朴素贝叶斯分类算法是学习效率和分类效果较好的分类器之一。朴素贝叶斯算法在文字识别,图像识别方向有着较为重要的作用。可以将未知的一种文字或图像,根据其已有的分类规则来进行分类,最终达到分类的目的。考虑学生的认知规律和接受特点,将算法模型与现实生活中的朴素贝叶斯算法进行应用,如文本分类,垃圾邮件的分类,信用评估,钓鱼网站检测等等。引导学生将这些思路与方法用来分析和解决现实社会中的问题,触发对人生的思考。(3)明确学习目标。朴素贝叶斯算法的三种不同方法使用高斯朴素贝叶斯进行建模进行重点知识的讲解教师根据课件,介绍朴素贝叶斯基本概念。教师根据课件,讲解朴素贝叶斯算法的不同方法。贝努利朴素贝叶斯在伯努利模型中,每个特征的取值是布尔型的,即true和false,或者1和0。如果样本特征是二元离散值或者很稀疏的多元离散值,使用BernoulliNB高斯朴素贝叶斯高斯分布就是正态分布,GaussianNB就是先验为高斯分布的朴素贝叶斯如果样本特征的分布大部分是连续值,使用GaussianNB会比较好多项式朴素贝叶斯如果如果样本特征的分大部分是多元离散值,使用MultinomialNB比较合适教师根据课件,演示朴素贝叶斯实战。对数据集进行分析使用高斯朴素贝叶斯进行建模高斯朴素贝叶斯的学习曲线归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)课后记:给学生讲解原理的时候尽量简化数学公式,通过举例和图示化的方式帮助学生理解各种模型的特点和区别。

章节名称第5章朴素贝叶斯装订线授课安排装订线授课时数2授课时间5-2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握贝努利、高斯、多项式朴素贝叶斯的基本原理与用法教学重点朴素贝叶斯算法的三种不同方法教学难点使用高斯朴素贝叶斯进行建模☆教学过程与内容:教师根据课件,演示朴素贝叶斯实战:对数据集进行分析使用高斯朴素贝叶斯进行建模高斯朴素贝叶斯的学习曲线通过肿瘤良恶性判断,引导学生管理好自身健康,注重自身调节要素,使学习过程更为紧凑和流畅,以便将来投身国家建设。上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机:使用朴素贝叶斯判断肿瘤是良性还是恶性要求如下:1.导入威斯康辛乳腺肿瘤数据集#导入威斯康辛乳腺肿瘤数据集fromsklearn.datasetsimportload_breast_cancercancer=load_breast_cancer()#打印数据集键值print(cancer.keys())2.将数据集划分为训练集和测试集fromsklearn.model_selectionimporttrain_test_split#将数据集的数值和分类目标赋值给X和yX,y=cancer.data,cancer.target#使用数据集拆分工具拆分为训练集和测试集X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=8)#打印训练集和测试集的数据形态print('训练集数据形态:',X_train.shape)print('测试集数据形态:',X_test.shape)3.使用高斯朴素贝叶斯进行建模fromsklearn.naive_bayesimportGaussianNBgnb=GaussianNB()gnb.fit(X_train,y_train)#打印模型评分print('训练集得分:{:.3f}'.format(gnb.score(X_train,y_train)))print('测试集得分:{:.3f}'.format(gnb.score(X_test,y_test)))训练集得分:0.948测试集得分:0.9374.测试模型进行数据预测和评分#打印模型预测的分类和真实的分类print('模型预测的分类是:{}'.format(gnb.predict([X[312]])))print('样本的正确分类是:',y[312])模型预测的分类是:[1]样本的正确分类是:15.绘制高斯朴素贝叶斯的学习曲线归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)检测学生随堂练习掌握情况。(3)课后记:学生在熟悉了机器学习算法模型建模的模式后,可以在老师的演示讲解后,课下自行完成模型算法和测试。

章节名称第6章决策树与随机森林装订线授课安排装订线授课时数2授课时间6-1授课方法讲授+课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握决策树与随机森林的原理和使用教学重点决策树与随机森林的原理和构造教学难点决策树与随机森林的优势和不足☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了贝努利、高斯、多项式朴素贝叶斯模型的基本原理与用法,本节课介绍决策树与随机森林的原理和构造。决策树易于理解和实现,人们在在学习过程中不需要使用者了解很多的背景知识,这同时是它的能够直接体现数据的特点,只要通过解释后都有能力去理解决策树所表达的意义。通过具体实例的演示,学生既可以掌握相关技能,也能培育职业精神与职业素养。(3)明确学习目标。决策树与随机森林的原理和构造决策树与随机森林的优势和不足进行重点知识的讲解教师根据课件,介绍决策树的基本原理。分类决策树是一种描述对象分类的树形结构。树中的节点为了两类:内部节点和叶节点,内部节点表示了一个特征,叶节点表示了最后输出的类标志。有趣的是,与其他分类模型算法不同的是,决策树既不是寻找超平面对其进行逼近,也不是使用先验后验概率对其进行预测,决策树在分类的过程中所使用的是最大化样本子集特征纯度的策略进行分类,这样就不需要任何领域知识/参数设定。当然决策树模型也会有欠拟合或过拟合的担忧,那么我们其实在决策树模型中就将关注点放在了以下几点:策略:最优化目标函数/目标值是什么?策略:如何避免过拟合?算法:我们依据最优化目标采取的算法是什么?算法:我们如何生成一个决策树,并防止其过拟合?1.决策树生成过程是一个递归的过程2.在递归过程中会导致递归返回的情形有三种:-2.1当前节点包含的样本子集都是同一类,无需划分,直接以当前类作为叶节点的决策结果。-2.2当前节点属性级为空集,或所有样本在所有属性上都取值相同,无法划分,直接按照少数服从多数来作为当前叶节点的决策结果,这是利用当前节点的后验分布。-2.3当前节点的样本子集为空集,无法划分,只能以其父节点中的样本子集中的样本最多类来表示。把父节点的样本分布当作当前节点的先验分布。教师根据课件,讲解随机森林的构造方法。随机森林是集成学习的一个子类,它依靠于决策树的投票选择来决定最后的分类结果。随机森林中有许多的分类树。我们要将一个输入样本进行分类,我们需要将输入样本输入到每棵树中进行分类。打个形象的比喻:森林中召开会议,讨论某个动物到底是老鼠还是松鼠,每棵树都要独立地发表自己对这个问题的看法,也就是每棵树都要投票。该动物到底是老鼠还是松鼠,要依据投票情况来确定,获得票数最多的类别就是森林的分类结果。随机森林是一个可做能够回归和分类。它具备处理大数据的特性,而且它有助于估计或变量是非常重要的基础数据建模。参数说明:最主要的两个参数是n_estimators和max_features。n_estimators:表示森林里树的个数。理论上是越大越好。但是伴随着就是计算时间的增长。但是并不是取得越大就会越好,预测效果最好的将会出现在合理的树个数。max_features:随机选择特征集合的子集合,并用来分割节点。子集合的个数越少,方差就会减少的越快,但同时偏差就会增加的越快。根据较好的实践经验。如果是回归问题则:max_features=n_features,如果是分类问题则max_features=sqrt(n_features)。如果想获取较好的结果,必须将max_depth=None,同时min_sample_split=1。同时还要记得进行cross_validated(交叉验证),除此之外记得在randomforest中,bootstrap=True。但在extra-trees中,bootstrap=False。(3)教师根据课件,演示信用卡审批系统的决策树。归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)课后记:决策树模型可以进行可视化,使得学生对该模型的算法比较容易理解。

章节名称第6章决策树与随机森林装订线授课安排装订线授课时数2授课时间6-2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的掌握决策树与随机森林的原理和使用教学重点决策树与随机森林的原理和构造教学难点决策树与随机森林的优势和不足☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。本节课介绍决策树与随机森林的应用。引导学生在学习过程中接受积极向上、爱国敬业的精神,树立正确的价值观与人生观。(3)明确学习目标。决策树与随机森林的优势和不足进行重点知识的讲解教师根据课件,介绍决策树与随机森林的优势和不足。随机森林的本质属于机器学习的一大分支——集成学习(EnsembleLearning)方法。它有如下几个特点:在当前所有算法中,具有极好的准确率能够有效地运行在大数据集上能够处理具有高维特征的输入样本,而且不需要降维能够评估各个特征在分类问题上的重要性在生成过程中,能够获取到内部生成误差的一种无偏估计对于缺失值问题也能够获得很好得结果上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机:使用酒的数据集演示决策树的构建(选取数据集样本的前两个特征)#导入tree模型和数据集加载工具fromsklearnimporttree,datasets#导入数据集拆分工具fromsklearn.model_selectionimporttrain_test_splitwine=datasets.load_wine()#只选取数据集的前两个特征X=wine.data[:,:2]y=wine.target#将数据集拆分成训练集和测试集X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=8)设定决策树分类器最大深度加大深度试试看结果会有什么变化#设定决策树最大深度为3clf2=tree.DecisionTreeClassifier(max_depth=3)#重新拟合数据clf2.fit(X_train,y_train)绘制图形看看分类器的表现归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)检测学生随堂练习掌握情况。(3)课后记:通过一个可视化的树形图演示决策树的工作过程,使学生可以直观的看到决策树的原理,加深理解。

章节名称第6章决策树与随机森林装订线授课安排装订线授课时数2授课时间7-1授课方法讲授+课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的随机森林实例教学重点决策树算法教学难点建模☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了决策树与随机森林的原理和构造,本节课介绍随机森林实例。设计学生积极参与的教学情境,引导学生自主思考和主动实践,从而获得知识与技能,培养良好的职业素质,树立正确的理想信念。(3)明确学习目标。决策树算法进行重点知识的讲解教师根据课件,演示数据集的准备。将美国人口普查数据导入,查看'年龄','单位性质','学历','性别','周工作时长','职业','收入'这几项特征值,根据特征判断年收入阶层。教师根据课件,演示用get_dummies处理数据。使用get_dummies将文本数据转化为数值对比样本原始特征和虚拟变量特征把各列分配给特征向量X和分类标签y教师根据课件,演示用决策树建模并做出预测。将数据集拆分为训练集和测试集用最大深度为5的随机森林拟合数据把Mr.Z的数据输入,并用模型对他的收入进行预测上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机:使用随机森林判断年收入阶层要求如下:1.导入成年人口统计数据集'adult.csv'importpandasaspddata=pd.read_csv('adult.csv',header=None,index_col=False,names=['年龄','单位性质','权重','学历','受教育时长','婚姻状况','职业','家庭情况','种族','性别','资产所得','资产损失','周工作时长','原籍','收入'])#为了方便展示,我们选取其中一部分数据data_lite=data[['年龄','单位性质','学历','性别','周工作时长','职业','收入']]2.用get_dummies处理数据,将文本数据转化为数值#使用get_dummies将文本数据转化为数值data_dummies=pd.get_dummies(data_lite)#对比样本原始特征和虚拟变量特征print('样本原始特征:\n',list(data_lite.columns),'\n')print('虚拟变量特征:\n',list(data_dummies.columns))3.将数据集划分为训练集和测试集4.用决策树建模并做出预测fromsklearn.model_selectionimporttrain_test_splitfromsklearnimporttree#将数据集拆分为训练集和测试集X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=0)#用最大深度为5的随机森林拟合数据go_dating_tree=tree.DecisionTreeClassifier(max_depth=5)go_dating_tree.fit(X_train,y_train)print('模型得分:{:.2f}'.format(go_dating_tree.score(X_test,y_test)))模型得分:0.80#将Mr.Z的数据输入给模型Mr_Z=[[37,40,0,0,0,0,0,0,1,0,0,0,0,0,0,0,0,0,0,0,0,0,0,1,0,0,0,0,1,0,1,0,0,0,0,0,0,0,0,0,0,0,0,0]]#使用模型做出预测dating_dec=go_dating_tree.predict(Mr_Z)ifdating_dec==1:print("大胆去追求真爱吧,这哥们月薪过5万了!")else:print("不用去了,不满足你的要求")5.用随机森林建模并做出预测fromsklearn.ensembleimportRandomForestClassifiergo_dating_forest=RandomForestClassifier(n_estimators=20,max_depth=7,random_state=0)go_dating_forest.fit(X_train,y_train)go_dating_forest.score(X_test,y_test)go_dating_forest.predict(Mr_Z)array([0],dtype=uint8)归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)检测学生随堂练习掌握情况,布置课后作业。(3)课后记:学生对决策树和随机森林的理解情况不错,部分同学对常规代码还有待加强,有些关键字记不住。

章节名称第7章支持向量机SVM装订线授课安排装订线授课时数2授课时间7-2授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的支持向量机SVM基本概念教学重点支持向量机SVM基本原理教学难点支持向量机SVM的核函数☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了随机森林实例,本节课介绍支持向量机SVM基本概念。要坚持价值性和知识性相统一,即在帮助学生掌握知识的同时,实现价值观引导;(3)明确学习目标。支持向量机SVM的原理支持向量机SVM的核函数进行重点知识的讲解教师根据课件,介绍支持向量机SVM的原理。支持向量机(supportvectormachines,SVM)是一种二分类模型,它的基本模型是定义在特征空间上的间隔最大的线性分类器,间隔最大使它有别于感知机;SVM还包括核技巧,这使它成为实质上的非线性分类器。SVM的的学习策略就是间隔最大化,可形式化为一个求解凸二次规划的问题,也等价于正则化的合页损失函数的最小化问题。SVM的的学习算法就是求解凸二次规划的最优化算法。SVM学习的基本想法是求解能够正确划分训练数据集并且几何间隔最大的分离超平面。对于线性可分的数据集来说,这样的超平面有无穷多个(即感知机),但是几何间隔最大的分离超平面却是唯一的。教师根据课件,介绍支持向量机SVM的核函数。对于输入空间中的非线性分类问题,可以通过非线性变换将它转化为某个维特征空间中的线性分类问题,在高维特征空间中学习线性支持向量机。由于在线性支持向量机学习的对偶问题里,目标函数和分类决策函数都只涉及实例和实例之间的内积,所以不需要显式地指定非线性变换,而是用核函数替换当中的内积。核函数表示,通过一个非线性转换后的两个实例间的内积。SVC(C=1000,cache_size=200,class_weight=None,coef0=0.0,decision_function_shape='ovr',degree=3,gamma='auto_deprecated',kernel='linear',max_iter=-1,probability=False,random_state=None,shrinking=True,tol=0.001,verbose=False)参数C:SVC的惩罚参数。C越大,即对分错样本的惩罚程度越大,因此在训练样本中准确率越高,但是泛化能力降低,也就是对测试数据的分类准确率降低。相反,减小C的话,容许训练样本中有一些误分类错误样本,泛化能力强。对于训练样本带有噪声的情况,一般采用后者,把训练样本集中错误分类的样本作为噪声。kernel:核函数,默认是rbf,可以是‘linear’线性,‘poly’多项式,‘rbf’高斯,‘sigmoid’,‘precomputed’核矩阵。degree:多项式poly函数的维度,默认是3,选择其他核函数时会被忽略。gamma:‘rbf’,‘poly’和‘sigmoid’的核函数参数。默认是’auto’,代表其值为样本特征数的倒数,即1/n_features。coef0:核函数的常数项。对于‘poly’和‘sigmoid’有用。cache_size:核函数cache缓存大小,默认为200。class_weight:类别的权重,字典形式传递,给每个类别分别设置不同的惩罚参数C为weight*C。decision_function_shape:‘ovo’(OneVsOne),‘ovr’(OneVsRest)orNone,多分类时需要进行选择的两种不同策略。max_iter:最大迭代次数。-1为无限制。probability:是否采用概率估计,默认为False。shrinking:是否采用shrinkingheuristic收缩启发式方法,默认为truetol:停止训练的误差值大小,默认为1e-3verbose:是否允许冗余输出教师分别演示线性内核和高斯内核的分类图归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)课后记:支持向量机的算法公式比较复杂,结合图形演示帮助学生理解向量机的分类原理,将原本抽象的概念可视化。

章节名称第7章支持向量机SVM装订线授课安排装订线授课时数2授课时间8-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的SVM的核函数与参数选择教学重点SVM的核函数与参数选择教学难点支持向量机的gamma、C参数调节☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了支持向量机SVM基本概念,本节课介绍SVM的核函数与参数选择。引导学生将这些思路与方法用来分析和解决现实社会中的问题,触发对人生的思考。(3)明确学习目标。SVM的核函数与参数选择支持向量机的gamma、C参数调节进行重点知识的讲解教师根据课件,介绍不同核函数的SVM对比。常见的核函数有:线性核函数、多项式核函数、高斯核函数教师根据课件,介绍支持SVM的核函数选择。选择核函数的一般原则是依据数据量:当数据量很大的时候,可以选择复杂一点的模型,因为大数据量可以减低复杂模型引起的过拟合风险。如果数据量较小,则应该首先考虑选择简单的线性的核函数,若发现欠拟合,再逐步增加多项式核函数,纠正欠拟合。更进一步来说,也可以根据样本量和特征量的比例,尝试使用不同的核函数,其规律如图所示:教师分别演示不同核函数的SVM对比分类图教师根据课件分别演示支持向量机的gamma、C参数调节其中有两个重要的参数,即C(惩罚系数)和gamma,gamma越大,支持向量越少,gamma越小,支持向量越多。而支持向量的个数影响训练和预测的速度。C越高,容易过拟合。C越小,容易欠拟合。归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)布置随堂练习,检测学生掌握情况。(3)课后记:支持向量机的内核和参数选择结合图形演示帮助学生理解不同内核的分类原理,将原本抽象的概念可视化。

章节名称第7章支持向量机SVM装订线授课安排装订线授课时数2授课时间8-2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的SVM的核函数与参数选择教学重点SVM的核函数与参数选择教学难点支持向量机的gamma、C参数调节☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了SVM的核函数与参数选择,本节课介绍SVM实例。设计与学生既有知识结构、生活经验以及社会现实之间的关联的案例,激发学生的学习兴趣。(3)明确学习目标。SVM算法——波士顿房价回归分析进行重点知识的讲解教师根据课件,演示数据集的准备。将波士顿房价数据集导入,查看特征值,根据特征预测波士顿房价。教师根据课件,演示用SVR进行建模。导入支持向量机回归模型分别测试linear核函数和rbf核函数教师根据课件,演示对数据集进行预处理。查看数据集中各个特征的数量级用StandardScaler类可用于特征的标准差标准化处理教师根据课件,演示用经过预处理后的数据重新训练模型。用经过预处理后的数据重新训练模型进一步调整RBF内核的SVR模型参数上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机:使用SVM回归分析波士顿房价要求如下:1.导入波士顿房价数据集2.使用SVR进行建模值3.对数据集进行预处理4.用经过预处理后的数据重新训练模型5.进一步调整RBF内核的SVR模型参数归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)检测学生随堂练习掌握情况,布置课后作业。(3)课后记:支持向量机SVM在分类和回归上的应用都给予了具体实例引导学生分析模型特征,学生对应用场景有了一定的理解。

章节名称第8章神经网络装订线授课安排装订线授课时数2授课时间9-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的了解神经网络的原理及使用教学重点掌握MLP神经网络的参数设置教学难点利用神经网络辨认手写数字☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了SVM的基本原理与用法,本节课介绍神经网络的原理及使用。GeoffreyHinton,被称为“神经网络之父”、“深度学习鼻祖”,他曾获得爱丁堡大学人工智能的博士学位,并且为多伦多大学的特聘教授。在2012年,Hinton还获得了加拿大基廉奖(KillamPrizes,有“加拿大诺贝尔奖”之称的国家最高科学奖)。2013年,Hinton加入谷歌并带领一个AI团队,他将神经网络带入到研究与应用的热潮,将“深度学习”从边缘课题变成了谷歌等互联网巨头仰赖的核心技术,并将HintonBackPropagation(反向传播)算法应用到神经网络与深度学习。(3)明确学习目标。神经网络的原理及使用神经网络的参数设置进行重点知识的讲解教师根据课件,介绍神经网络的原理。神经网络是由一个个的被称为“神经元”的基本单元构成,一个简单的神经网络的结构如下图所示:其中一个神经元的输出是另一个神经元的输入,+1项表示的是偏置项。上图是含有一个隐含层的神经网络模型,L1层称为输入层,L2层称为隐含层,L3层称为输出层。教师根据课件,讲解神经网络中的激活函数。在神经网络中,激活函数的作用是能够给神经网络加入一些非线性因素,使得神经网络可以更好地解决较为复杂的问题。激活函数有:sigmoid函数,tanh函数,Relu函数,softmax函数。(3)教师根据课件,演示神经网络的参数设置。主要参数说明:hidden_layer_sizes:例如hidden_layer_sizes=(50,50),表示有两层隐藏层,第一层隐藏层有50个神经元,第二层也有50个神经元。activation:激活函数,{‘identity’,‘logistic’,‘tanh’,‘relu’},默认relusolver:{‘lbfgs’,‘sgd’,‘adam’},默认adam,权重优化的求解器alpha:float,可选的,默认0.0001,L2惩罚(正则化项)参数归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)课后记:神经网络是深度学习的入门概念,目前只需要学生有个基本了解,能使用MLP模型简单调参。

章节名称第8章神经网络装订线授课安排装订线授课时数2授课时间9-2授课方法讲授+课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的了解神经网络的原理及使用教学重点掌握MLP神经网络的参数设置教学难点利用神经网络辨认手写数字☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了神经网络的原理及使用,本节课介绍用于手写数字识别的数据集,掌握神经网络辨认手写数字的原理,最后搭建神经网络模型。。Hinton教授是机器学习的开创者,使得计算机可以独立想出程序、自己解决问题。特别重要的是,他还从中开辟了机器学习的一个子领域,即所谓的“深度学习”,也就是让那些机器像一个蹒跚学步的孩子一样,模仿大脑的神经网络形式。他笑着表示:“我对我自己的数据有一种里根式的笃信。”而正是GeoffreyHinton对自己的工作成果不可动摇的信念,促使他从学术生涯多年的不得志走到了当前最热门的AI前沿。(3)明确学习目标。利用神经网络辨认手写数字进行重点知识的讲解教师根据课件,演示手写数字识别的数据集的准备。手写数字识别属于图像识别的一种。计算机识别手写体图片最大的难度是手写体与印刷字体不同,不同人的手写体风格迥异,大小不一。但是数字手写体识别最大的特点是它的类别只有10个种类,这也使得手写数字识别成为了相对简单的图像识别任务。Mnist数据集是一个包含数字0~9的手写体图片数据集,图片已归一化为以手写数字为中心的28*28规格的图片。MNIST由训练集与测试集两个部分组成,训练集中有60000个手写体图片和对应的标签,而测试集中有1万个手写体图片及对应标签。教师根据课件,介绍神经网络辨认手写数字的原理。在人工智能领域,单纯用数字表达分类存在一个容易混淆的问题,容易将“分类”误解成为“程度”,而很多情况下,不同的分类之间根本没有数量的关系,所以应当让分类在不同的“维度”中,以确保它们不相关,因此需要利用“独热码”(onehot)来指示不同的分类。独热码是只有一个元素是1,其余元素都为0的向量,用独热码表达分类时,向量中元素的个数与需要表达的分类数应该一致。我们知道这个手写数字图片是由28*28个像素点构成的矩阵,也就是说他是28*28的矩阵,一共784个元素,出于辨认笔记的问题对神经网络复杂程度的要求并不高,为了进一步减少计算量,可以将二维矩阵拉伸变为一维的向量,那么可将其拉伸成一个784*1的矩阵,为了方便计算把该矩阵转置,变为1*784的矩阵,下面的问题就来了我们的输出要是1*10的独热码形式,怎么变化可以得到?如9这个手写数字的数据是1*784的矩阵,通过了两次变换得到了最后的1*10的独热码。我们看看他是怎么变化的,首先成了一个784*32的矩阵,变为1*32,然后再乘以32*10的矩阵,就会得到1*10的矩阵了。教师根据课件,演示神经网络实例——手写识别。上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机:使用神经网络训练手写数字识别模型要求如下:1.加载MNIST手写数字数据集2.训练MLP神经网络3.使用模型进行数字识别三、归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)检测学生随堂练习掌握情况,布置课后作业。(3)课后记:通过一个图像识别的简单例子来理解神经网络的原理和使用,使学生易于接受比较抽象的概念。

章节名称第9章数据预处理、降维、特征提取及聚类装订线授课安排装订线授课时数2授课时间10-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的了解数据预处理、降维的原理及使用教学重点掌握几种常见的数据预处理工具教学难点PCA主成分分析用于数据降维☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了神经网络的基本原理与用法,本节课介绍预处理、降维的原理及使用。

在许多领域的研究与应用中,往往需要对反映事物的多个变量进行大量的观测,收集大量数据以便进行分析寻找规律。如果分别对每个指标进行分析,分析往往是孤立的,而不是综合的。盲目减少指标会损失很多信息,容易产生错误的结论。因此需要找到一个合理的方法,在减少需要分析的指标同时,尽量减少原指标包含信息的损失,以达到对所收集数据进行全面分析的目的。引导学生将这些思路与方法用来分析和解决现实社会中的问题,自主思考和主动实践。(3)明确学习目标。数据预处理工具的原理及使用PCA主成分分析用于数据降维进行重点知识的讲解教师根据课件,介绍数据预处理的原理。9.1.1使用StandardScaler进行数据预处理StandardScaler类是一个用来将数据进行归一化和标准化的类。将数据按其属性(按列进行)减去平均值和缩放到单位方差来标准化特征。得到的结果是,对于每个属性/每列来说所有数据都聚集在0附近,标准差为1,使得新的X数据集方差为1,均值为0适用于:如果数据的分布本身就服从正态分布,就可以用这个方法。9.1.2使用MinMaxScaler进行数据预处理将每个元素(特征,feature)转换成给定范围的值。MinMaxScaler有一个重要参数"feature_range",控制数据压缩到的范围,默认是[0,1]。适用于数据在一个范围内分布的情况,在不涉及距离度量、协方差计算、数据不符合正太分布的时候,可以使用MinMaxScaler。9.1.3使用RobustScaler进行数据预处理若数据中存在很大的异常值,可能会影响特征的平均值和方差,影响标准化结果。在此种情况下,使用中位数和四分位数间距进行缩放会更有效。9.1.4使用Normalizer进行数据预处理normalize提供了一个快速有简单的方式在一个单向量上来实现这正则化的功能。正则化有l1,l2等。正则化是将样本在向量空间模型上的一个转换,经常被使用在分类与聚类中。教师根据课件,讲解PCA主成分分析原理。PCA是一种无监督降维算法,它是最常用的降维算法之一,可以很好地解决因变量太多而复杂性、计算量增大的弊端。PCA主要通过把数据从高维映射到低维来降低特征维度。PCA将n维输入数据缩减为r维,其中r<n。简单地说,PCA实质上是一个基变换,使得变换后的数据有最大的方差,也就是通过对坐标轴的旋转和坐标原点的平移使得其中一个轴(主轴)与数据点之间的方差最小,坐标转换后去掉高方差的正交轴,得到降维数据集。(3)教师根据课件,演示对数据降维以便于进行可视化。使用主成分绘制热度图分析原始特征与PCA主成分之间的关系归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)课后记:主成分分析作为基础的数学分析方法,其实际应用十分广泛,比如人口统计学、数量地理学、分子动力学模拟、数学建模、数理分析等学科中均有应用,通过原理分析让学生理解应用场景。

章节名称第9章数据预处理、降维、特征提取及聚类装订线授课安排装订线授课时数2授课时间10-2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的了解数据预处理、降维的原理及使用教学重点通过数据预处理提高模型准确率教学难点对数据降维以便于进行可视化☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了预处理、降维的原理及使用,本节课介绍通过数据预处理提高模型准确率,对数据降维以便于进行可视化。

1846年,Bracais提出的旋转多元正态椭球到“主坐标”上,使得新变量之间相互独立。[2]皮尔逊(Pearson)(1901)、霍特林(Hotelling)(1933)都对主成分的发展做出了贡献,霍特林的推导模式被视为主成分模型的成熟标志。主成分分析被广泛应用于区域经济发展评价,服装标准制定,满意度测评,模式识别,图像压缩等许多领域。引导学生立足专业和相关研究进展,树立奉献社会的人生理想。(3)明确学习目标。数据预处理工具的原理及使用PCA主成分分析用于数据降维上机练习上机练习主要针对本章中需要重点掌握的知识点,以及在程序中容易出错的内容进行练习,通过上机练习可以考察同学对知识点的掌握情况,对本章知识掌握程度。形式:单独完成上机1:通过数据预处理提高模型准确率要求如下:1.导入红酒数据集2.导入MLP神经网络,设定MLP设计网络的参数3.使用MLP拟合数据,打印模型得分4.使用MinMaxScaler进行数据预处理5.重新训练模型,打印模型分数上机2:对数据降维以便于进行可视化要求如下:1.导入红酒数据集2.对红酒数据集进行预处理3.导入PCA,设置主成分数量为2以便我们进行可视化4.打印主成分提取后的数据形态5.将经过PCA降维的数据可视化6.使用主成分绘制热度图归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)课后记:通过实例操作使学生体会数据预处理对模型准确率的作用,学生也能使用PCA降维使多维数据进行可视化。

章节名称第9章数据预处理、降维、特征提取及聚类装订线授课安排装订线授课时数2授课时间11-1授课方法讲授授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的了解特征提取、聚类算法的原理及使用教学重点掌握几种常用的聚类算法教学难点NMF非负矩阵分解用于特征提取☆教学过程与内容:回顾上节课内容,继续讲解本课时的知识(1)教师对学生们的疑问进行统一答疑。(2)回顾总结上节课内容,继续介绍本课时的内容。上机课介绍了预处理、降维的原理及使用,本节课介绍特征提取、聚类算法的原理及使用。

聚类分析起源于分类学,在古老的分类学中,人们主要依靠经验和专业知识来实现分类,很少利用数学工具进行定量的分类。随着人类科学技术的发展,对分类的要求越来越高,以致有时仅凭经验和专业知识难以确切地进行分类,于是人们逐渐地把数学工具引用到了分类学中,形成了数值分类学,之后又将多元分析的技术引入到数值分类学形成了聚类分析。本次课的内容涉及图像处理,难度较大,鼓励学生要敢于面对困难,要有破解专业难、战胜困难的勇气与智慧。(3)明确学习目标。特征提取的原理及使用K均值聚类算法进行重点知识的讲解教师根据课件,介绍特征提取的原理。在机器学习、模式识别和图像处理中,特征提取从初始的一组测量数据开始,并建立旨在提供信息和非冗余的派生值(特征),从而促进后续的学习和泛化步骤,并且在某些情况下带来更好的可解释性。特征提取与降维有关。特征的好坏对泛化能力有至关重要的影响。PCA是非常常用的数据降维方法。它的基本思想是从一组特征中计算出一组按照重要性的大小从大到小依次排列的新特征,它们是原有特征的线性组合,并且新特征之间不相关,我们计算出原有特征在新特征上的映射值即为新的降维后的样本。也就是说PCA的目标是用一组正交向量来对原特征进行变换得到新特征,新特征是原有特征的线性组合。非负矩阵分解用于特征提取基本思想:给定一个非负矩阵V,NMF能够找到一个非负矩阵W和一个非负矩阵H,使得矩阵W和H的乘积近似等于矩阵V中的值。NMF能够广泛应用于图像分析、文本挖掘和语音处理等领域。教师根据课件,讲解聚类算法原理。k均值聚类算法(k-meansclusteringalgorithm)是一种迭代求解的聚类分析算法,其步骤是,预将数据分为K组,则随机选取K个对象作为初始的聚类中心,然后计算每个对象与各个种子聚类中心之间的距离,把每个对象分配给距离它最近的聚类中心。凝聚聚类(agglomerativeclustering)指的是许多基于相同原则构建的聚类算法,这一原则是:算法首先声明每个点是自己的簇,然后合并两个最相似的簇,直到满足某种停止准则为止。scikit-learn中实现的停止准则是簇的个数,因此相似的簇被合并,直到仅剩下指定个数的簇。DBSCAN是一种基于密度的聚类算法,这类密度聚类算法一般假定类别可以通过样本分布的紧密程度决定。同一类别的样本,他们之间的紧密相连的,也就是说,在该类别任意样本周围不远处一定有同类别的样本存在。通过将紧密相连的样本划为一类,这样就得到了一个聚类类别。通过将所有各组紧密相连的样本划为各个不同的类别,则我们就得到了最终的所有聚类类别结果。(3)教师根据课件,演示特征提取、聚类算法的原理。PCA主成分分析法用于特征提取使用K均值来对数据进行聚类归纳总结,布置课后作业(1)回顾上课前的学习目标,对本节课知识点进行总结。(2)课后记:聚类的用途是很广泛的。在商业上,聚类可以帮助市场分析人员从消费者数据库中区分出不同的消费群体来,并且概括出每一类消费者的消费模式或者说习惯,通过引入一些实用场景帮忙学生理解聚类。

章节名称第9章数据预处理、降维、特征提取及聚类装订线授课安排装订线授课时数2授课时间11-2授课方法课内实训授课教具Python3.7及后续版本、PyCharm、Jupyter教学目的了解特征提取、聚类算法的原理及使用教学重点掌握特征提取的原理及使用教学难点K均值聚类算法☆教学过程与内容:回顾上

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论