版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第一章机器学习基础知识第1章机器学习基础知识第2章数据预处理第3章基于线性回归的交通车流量预测第4章基于KNN算法的二手车价格预测第5章基于随机森林算法的共享单车租赁数量预测第6章基于k均值聚类算法的信用卡客户划分第7章基于逻辑回归的信用卡异常行为检测第8章基于支持向量机的路面状况分类第9章基于朴素贝叶斯算法的店铺评论分类第10章基于多层感知机的相册分类第11章智慧电商:基于多模型融合实现商品销量预测第12章智慧风控:基于多模型融合实现电信客户流失预警全套可编辑PPT课件目
录人工智能、机器学习与深度学习的关系机器学习的定义机器学习的主要任务机器学习的学习方式机器学习的三要素0102030405人工智能、机器学习与深度学习的关系01人工智能、机器学习与深度学习的关系机器学习是通过对数据分析、学习与训练,使计算机系统能自主预测和决策的技术。深度学习是通过构建多层神经网络,让计算机系统能够自动对大量数据进行学习和处理。深度学习是机器学习的进一步发展,机器学习和深度学习是人工智能技术的重要组成部分。01机器学习的定义02机器学习的定义机器学习指的是计算机通过对数据、事实或自身经验的自动分析和综合获取知识的过程。机器学习一般通过归纳、一般化、类比等基本方法探索人类的认识规律和学习过程,建立各种能通过经验自动改进的算法,使计算机具有自动学习特定知识和技能的能力,是使计算机具有智能的根本途径。02机器学习的主要任务03机器学习的主要任务03分类是找出一组数据对象的共同特点并按照分类模式将其划分为不同的类,其目的是通过分类模型将数据项映射到某个给定的类别。分类回归反映的是数据属性值在时间上的特征,产生一个将数据项映射到一个预测值变量的函数,发现变量或属性值间的依赖关系,其主要研究问题包括数据序列的趋势特征、数据序列的预测以及数据间的关系等。回归聚类是把一组数据按照相似性和差异性分为几个类别,其目的是使得属于同一类别的数据间的相似性尽可能大、不同类别中的数据间的相似性尽可能小。聚类机器学习的学习方式04机器学习的学习方式04监督学习监督学习是机器学习中常见且较容易使用的方法之一,指的是机器使用标记良好的训练数据进行训练,因此模型可以在使用数据集训练的基础上预测输出。无监督学习无监督学习是指模型使用未标记的数据集进行训练,并允许在没有任何外部监督的情况下对数据采取行动。无监督学习常用于处理聚类问题。半监督学习半监督学习是监督学习与无监督学习相结合的一种学习方法。半监督学习使用大量无标签数据和少部分有标签数据来进行机器学习。强化学习强化学习受到行为心理学的启发,其主要关注智能体如何在环境中采取不同的行动,以最大限度地提高累积奖励。机器学习的三要素05机器学习的三要素机器学习的三个要素是数据、模型和算法。在机器学习的过程中,三个要素相互作用,不断优化,使得机器能够不断学习和进步。05数据是机器学习的基础模型是对数据进行拟合和预测的工具算法是实现模型的方法和技术数据算法模型机器学习的三要素数据集通常由一条条数据(每一行)样本组成,样本由描述其各个维度信息的特征及目标值标签(或无)组成。数据通常有数值型、文本型、图像型等类型数据,这些数据在机器学习中常常被划分为有标注数据和无标注数据两种。05数据机器学习的三要素有标注数据指的是每一个数据X,都有一个对应的标签Y;无标注数据指的是数据集中只有数据X,没有标签Y05数据XY[1,1,1]0[0,1,1]1[1,0,1]2[1,1,0]3机器学习的三要素在有监督学习(数据拥有标签Y)中,数据集通常会被分为训练集、验证集、测试集(按6
:
2
:
2的比例)三部分或者训练集、测试集(按8
:
2的比例)两部分,数据集的具体划分可按照实际情况来进行。05数据训练集用于训练模型的样本集合。可以比喻成学生的课本,用于给学生学习、掌握课本内容的知识。验证集用于验证模型性能的样本集合。可以比喻成学生的作业,用于检验学生的学习情况、进步快慢等,需要根据情况进行调整。测试集用于测试最后得到的模型的性能。可以比喻成学生的考试,用于考查学生的整体能力。机器学习的三要素一个好的模型需要经过训练才能得到最终的结果,而这个训练的过程就需要依靠某些方法来让模型变得更好,而这里的方法指的就是算法。机器学习的主要算法可分分类算法、回归算法、聚类算法三种。常见的机器学习算法有朴素贝叶斯分类、逻辑回归、决策树、随机森林、支持向量机、K-最近邻、K-均值聚类等。05算法机器学习的三要素模型指的是将数据输入算法中进行训练后得到的结果,可概括为数据+算法=模型。模型的效果:假设y=f(x)是一个已经训练好的模型,把数据(对应其中的x)输入进去,得到输出结果(对应其中的y),这个输出结果可能是一个数值(回归),也可能是一个标签(分类),这就是模型需要达到的效果。05模型感谢观看!第二章数据预处理目
录数据的定义与类别数据预处理技术数据标准化技术数据编码技术01020304数据的定义与类别01数据的定义与类别数据是指对客观事件进行记录并可以鉴别的符号,是对客观事物的性质、状态以及相互关系等进行记载的物理符号或物理符号的组合,它是一种可识别的、抽象的符号。01数据的定义我今天买了12瓶饮料“12瓶”实际上指的是对“饮料”这一个客观事物状态进行记录的一个符号数据的定义与类别数据指的不仅是狭义上的数字,还可以是具有一定意义的文字、字母、数字符号的组合等。生活中常见的图像、视频、音频、文本等都属于数据。数据也是客观事物的属性、数量、位置及其相互关系的抽象表示。01数据的定义数据的定义与类别在计算机科学与技术的领域中,数据是指一切能够输入计算机且能被计算机程序处理的符号总称。数据是指可用于输入计算机并进行处理的数字、字母、符号和各种模拟量。这些数据在计算机系统中都以二进制的信号单元0、1表示,所以通常需要将如文本、图像等非数值型的数据转换成数值型。01数据的定义数据的定义与类别数据分类在收集、处理和应用数据过程中非常重要。根据不同的数据类别进行分类可以更好地组织、管理、分析和应用数据。01数据的类别按照字段分类按照数据结构类型分类常见的数据分类方式数据的定义与类别01数据的类别按照字段分类用于描述性的字段,如个人姓名、家庭住址、文章等。这一类的数据是非量化的一个值,即该数据不可以直接运用在运算中。例如“芒种,是夏季的第三个节气。”这一段文字就是一种文本类数据文本类数据用于描述事件发生的时间,如“2023年1月1日”文本可以转换成为时间类数据“2023/1/1”,该数据是可以直接进行运算的。时间类数据用于描述量化属性或用于编码的一种数据,如交易金额、额度、商品数量、积分数、客户评分等都属于量化属性,是日常计算指标的核心字段。数值类数据数据的定义与类别01数据的类别按照数据结构类型分类指由统一的结构来进行逻辑表示和存储的数据。这类数据遵守相同的数据格式与数据长度规范,可以通过关系型数据库进行存储和管理。结构化数据指没有预定义数据模型、数据结构不完整或者不规则,不可以直接用数据库逻辑来表现的一种数据。在日常生活中常见的图像、文本、音频、视频等均属于非结构化数据。非结构化数据指介于结构化与非结构化数据之间的一种数据,是一种包含相关标记,以相关标记对字段进行分层分隔语义元素的一类数据,半结构化数据也被称为自描述结构。半结构化数据数据预处理技术02数据预处理技术数据和特征决定机器学习的上限,模型和算法只是逼近该上限,凸显出数据预处理的必要性。在实际业务中,从各种渠道获取的初始数据大多是“脏”数据。02“脏”数据定义:对实际业务无意义、格式非法、编码不规范、业务逻辑模糊的数据。成因:数据重复录入、共同处理等不规范操作而产生的混乱、无效数据。特点:低质量的数据,存在着一系列问题。影响:导致输出不正确,甚至误导性的结果。类型:错误数据、重复数据、缺失数据等问题解决办法:数据预处理。数据预处理技术02指不为空的属性值错误。如异常值(某个产品价格为1到100元,统计中出现200元的值);格式错误(某种格式的数据被记为另一种格式,如将文字录成日期格式)错误数据1指同一条数据在数据集中多次出现,如数据表中存在两条甚至多条如[姓名:A,座位号:01]的数据。重复数据2指数据表中属性值缺失或者是包含无效值。成因:系统问题、人为问题等。缺失数据3原始数据存在的问题数据预处理技术数据预处理指的是在数据集用于模型训练前,使用一定的方法对数据进行处理,以便把数据变换成适用于机器学习模型训练的格式或形式,常用的数据预处理方法有删除法、插补法等。02删除法指将含有错误值、重复值或者缺失值的记录直接进行删除,在删除过程中通常直接删除存在问题的某一行或某一列数据。插补法是用于处理缺失数据和错误数据的一种常用方法,该方法常常使用数据中的均值、中位数或众数填充或替换空值、错误部分数据。数据标准化技术03数据标准化技术定义:数据标准化指通过数学变换方式,将原始数据按照一定的比例进行转换,使之落入小的特定区间内(如0~1或-1~1)。目的:消除不同变量之间性质、量纲、数量级等特征属性的差异,将其转化为一个无量纲的相对数值(标准化数值),使各指标的数值都处于同一个数量级上,便于不同单位或数量级的指标进行综合分析和比较。常见方法:min-max标准化、z-score标准化。03数据标准化技术03min-max标准化z-score标准化也称为最小-最大标准化,是对原始数据的线性变换。该标准化可以将数据值映射到[0,1]。计算公式:新数据=(原数据-最小值)/(最大值-最小值)。是基于原始数据的均值和标准差对数据进行标准化的方法。处理后的数据符合标准正态分布(即均值为0,标准差为1)。计算公式:新数据=(原数据-均值)/标准差。数据编码技术04数据编码技术数据编码指的是将一个字符串类型的数据转换成数值类型。常见的数据编码技术有标签编码和独热编码。04标签编码(labelencoding)指用标签进行编码,将原始特征值编码为自定义的数字标签完成量化编码过程。如:有红、黄、蓝三种类别的颜色,可以编码为红=1、黄=2、蓝=3。0102标签编码独热编码(one-hot编码)用于将离散的分类标签转换为二进制向量。该方法主要是采用N位状态寄存器来对N个状态进行编码,每个状态都有其独立的寄存器位,并且在任意时候只有一位有效。独热编码季节独热编码春(1,0,0,0)夏(0,1,0,0)秋(0,0,1,0)冬(0,0,0,1)感谢观看!第三章基于线性回归的交通车流量预测目
录线性回归的定义回归模型评估指标0102线性回归的定义01线性回归的定义机器学习的大多数任务通常都与预测有关。当我们想预测一个数值时,就会涉及回归问题。如预测价格(预测商品价格、股票价格等)、预测天气状况(预测降雨量、是否下雨等)、预测需求(预测商品销量、工厂生产量等)等。01通过数理统计中的回归分析来确定各种因素与预测结果的定量关系线性回归的定义回归问题可以理解为给定数据集D,通过建模建立自变量和因变的关系构造出一条近似反映真实数据分布规律的曲线,以此对因变量进行预测,回归也被称为拟合。根据自变量和因变量之间的关系类型,分为线性回归和非线性回归分析。01线性回归:拟合出直线非线性回归:拟合出曲线线性回归的定义在回归分析中,只包括一个自变量和一个因变量,且二者的关系可用一条直线近似表示,这种回归分析称为一元线性回归分析;若包括两个或两个以上的自变量,且因变量和自变量之间是线性关系,则称为多元线性回归分析。01线性回归的定义01类型含义公式一元线性回归模型反映一个变量对目标变量的数学关系多元线性回归模型以多个变量来决定另一个变量的方程非线性回归模型因变量Y与自变量X之间的关系不存在线性关系X表示特征值(自变量);Y为预测值(因变量);β为权重(weight),它决定每个特征对最终预测值的影响效果;ε为偏置(bias)或偏移量(offset),相当于一元线性回归模型中的b,可以增强模型的精准表达能力,使其能够拟合更多的模型回归模型评估指标02回归模型评估指标在机器学习领域中,为了检验训练好的模型性能,通常需要对模型进行评估。不同类型的模型所使用的评估方法也会有所差异,只有选择与问题相匹配的评估方法,才能快速发现模型选择或训练过程中出现的问题,从而对模型进行优化。在回归任务中,对于训练好的回归模型的常用评估指标有平均绝对误差(meanabsoluteerror,MAE)、均方误差(meansquareerror,MSE)、均方根误差和决定系数R2等02回归模型评估指标假设实际值为[1.3,2.2]、预测值为[1.1,2.3]02评估指标含义公式均方误差(MSE)又叫L2范数损失,通过计算真实值和预测值差值的平方和的均值衡量平均绝对误差(MAE)又叫L1范数损失,通过计算真实值和预测值差值的绝对值的均值衡量均方根误差(RMSE)表示预测值和真实值差值的样本标准差xi为真实值,yi为预测值,m为个数;均方误差、平均绝对误差、均方根误差评估指标的值的范围都为[0,+∞],值越大,说明预测模型效果越差;值越小,说明预测模型效果越好。回归模型评估指标在sklearn工具包中,决定系数R2评估指标可以通过score()函数来实现,其返回值为决定系数R2,该指标表示决定系数反映了因变量Y的波动,有多少百分比能被自变量X的波动所描述。该参数可以用来判断统计模型对数据的拟合能力。02公式:SSE是残差平方和,表示预测值和实际值对应点的误差的平方和;SST是总离差平方和,表示实际值和均值之差的平方和。决定系数R2指标的范围为0到1,其数值大小反映了回归贡献的相对程度,是最常用的评价回归模型优劣程度的指标。在通常情况下,对于训练数据集,R2取值范围为[0,1];对于测试集合,R2的值有可能为负值。一般而言,R2的值越接近1,模型效果越好;R2的值越接近0,效果越差。感谢观看!第四章基于KNN算法的二手车价格预测目
录KNN算法的定义KNN算法实现流程KNN算法的优缺点010203KNN算法的定义01KNN算法的定义KNN(K-nearestneighbor)也被称为K-近邻算法,是目前机器学习领域中最简单的算法之一,既可用于分类任务也可用于回归任务。KNN算法,即给定一个训练数据集,对新的输入实例,在训练数据集中找到与该实例最邻近的K个实例。使用KNN算法处理分类任务时,如果K个实例的多数属于某个类,就把该输入实例分类到这个类中;使用KNN算法处理回归任务时,输入实例的预测值就是K个实例的平均值。01KNN算法的定义图中的正方形表示第一类、深色圆点表示第二类、浅色圆点表示新的实例(未分类的样本)。当我们进行分类时,如果K=3,则新实例属于深色圆点类别;当我们进行回归时,如果K=3,则新实例预测值为最近3个实例的平均值。01KNN算法实现流程02KNN算法实现流程KNN算法的指导思想是“近朱者赤,近墨者黑”,它通过你的“邻居”来推断出你的类别或者预测你的值。首先计算待分类样本与已知类别的训练样本之间的距离,找到距离与待分类样本数据最近的K个邻居;再根据这些邻居所属的类别来判断待分类样本数据的类别。如果用空间内两个点的距离来度量,距离越大,表示两个点越不相似;距离越小,表示两个点越相似。02KNN算法实现流程KNN算法实现回归预测任务时的基本流程:02计算已知数据集中的点与当前点之间的距离1选取与当前点距离最小的K个点3返回前K个点的平均值,以此作为回归预测的结果5按照距离递增的顺序进行排序2确定前K个点并计算K个点的平均值4KNN算法实现流程02距离的计算方法计算方法含义二维公式(例:A(x1,y1)、B(x2,y2))欧式距离计算两点之间最短距离的方法曼哈顿距离两点在南北方向上的距离加上在东西方向上的距离线段a代表的是欧式距离;线段b、c、d代表的是曼哈顿距离。欧式距离和曼哈顿距离的计算方法不仅可以应用在二维数据中,同样也可以应用于三维、多维数据中KNN算法实现流程02K值的选取构建KNN算法模型的一个核心要素是K值的选择,K值的选取对模型的准确率至关重要。K值的选择通常取决于数据集的实际情况。如果K值太小,分类结果易受噪声点影响,模型过于复杂,会发生过拟合而忽略数据的真实分布;如果K值太大,模型将过于简单而忽略训练数据实例中的大量有用信息。在应用中,一般会先取一个较小的K值,然后再慢慢进行调整。KNN算法实现流程02K值的选取例:正方形和六边形是训练数据点,而五角星则是需要分类或者回归预测的数据。假如K=3,在离五角星最近的3个数据点中:(1)有2个六边形,1个正方形;(2)使用KNN算法进行分类时,应该把五角星分到六边形这一组;使用KNN进行回归预测时,应该把2个六边形、1个正方形进行相加,然后求平均值,即可得到预测结果。KNN算法实现流程02K值的选取例:正方形和六边形是训练数据点,而五角星则是需要分类或者回归预测的数据。假如K=5,在离五角星最近的5个数据点中:(1)有2个六边形,3个正方形;(2)使用KNN算法进行分类时,应该把五角星分到正方形这一组;使用KNN算法进行回归预测时,应该把2个六边形、3个正方形进行相加,然后求平均值,即可得到预测结果。KNN算法的优缺点03KNN算法的优缺点03KNN算法的优点01KNN算法通过选取K个邻近值来判断分类,对异常值有较高的容忍度,对噪声数据的容忍能力较强,即噪声数据对分类算法效果影响不大。0203KNN算法不需要复杂的训练过程,新样本数据可直接加入样本数据集而不必进行重新训练。KNN算法的分类过程直接利用了样本之间的关系,因此降低了因类别特征的不当选择对分类结果造成的影响,可以最大程度地降低分类过程中的误差项。KNN算法的优缺点03KNN算法的缺点计算量较大,速度慢成因:每一个待分类的样本均需要计算出它到所有已知样本的距离后,才能求得该样本的K个邻居。解决方法:对样本数据预处理,先对已知样本点进行裁剪,去除对分类作用不大的样本。成因:随机选定的K值可能会导致分类错误或误差较大。解决方法:通常需要多次选择K值以达到最佳分类效果。样本数量不均衡时,数量多的类别会靠“数量优势”霸占K个近邻,哪怕待测样本其实和数量少的类别更相似,KNN也会因“少数服从多数”把它错分到数量多的类,导致分类不准。分类准确率对K值依赖很大样本不均衡时容易分类误判感谢观看!第五章基于随机森林算法的共享单车租赁数量预测目
录集成学习的概念随机森林算法介绍0102集成学习的概念01集成学习的概念集成学习(ensemblelearning)是一种机器学习框架,是将多个弱学习器(或者称为基学习器)集成为强学习器的方法。弱学习器是指单独训练时性能比较弱的学习器,例如逻辑回归、SVM、线性回归等。集成学习是通过将多个弱学习器集成起来,使得整个模型的性能得到提升。01总的来说集成学习是将多个单一的模型组合起来,从而达到提高模型整体性能的一种方法集成学习的概念集成学习方法:Bagging、Boosting和Stacking方法。Boosting和Bagging方法通常使用同一种基学习器(baselearner)进行集成,因此被称为同质集成方法;Stacking方法通常基于多个不同的基学习器进行集成,因此被称为异质集成方法。01Bagging同质集成方法Boosting异质集成方法Stacking随机森林算法介绍02随机森林算法介绍随机森林(randomforest,RF)算法是由Breiman在2001年提出的,它是以决策树为基本单位的一种集成学习算法,通过Bagging方法实现。02决策树概念Bagging方法随机森林算法实现流程随机森林算法介绍决策树概念02决策树由RossQuinlan于1986年提出,是一种基于树形结构的分类器。决策树的基本原理和思想是通过对样本特征的逐层划分,从而将样本划分成不同的类别。在决策树算法中,每个节点(根节点和子节点)代表一个属性,每个分支代表该属性的一个取值,每个叶子节点代表一个类别。随机森林算法介绍决策树概念02决策树的构建过程是一个递归过程,从根节点开始,通过不断地选择最优的划分属性,将样本递归地划分成若干子集,直到所有子集都属于同一类别或达到预设的停止条件为止。外貌特征:黑白相间,有黑眼圈食物特点:吃竹子大熊猫+=随机森林算法介绍Bagging方法02Bagging方法也被称为装袋法,是一种典型的并行集成算法,是由Breiman在1996年提出的一种集成学习方法,Bagging方法是最早的、也是当前最简单的集成方法之一。Bagging训练流程组合策略:回归任务:采用简单平均法分类任务:采用简单投票法(遵循少数服从多数的原则,将基学习器的投票结果作为强学习器的最终分类结果)随机森林算法介绍随机森林算法实现流程02随机森林算法是结合决策树和Bagging方法的一种集成方法,其主要思想是通过随机选择样本和特征的方式,构建多个决策树,然后将它们组合起来形成一个强分类器或回归器。不仅可以应用于分类任务中,也可以应用于回归任务中。具体来说,在构建每个决策树的过程中,随机森林算法会从训练集中随机选择一定数量的样本,同时也会从所有特征中随机选择一部分特征,然后使用这些样本和特征来构建决策树。这样可以避免过拟合,提高模型的泛化能力。随机森林算法介绍随机森林算法实现流程02随机森林模型结构图随机森林算法介绍随机森林算法实现流程0201能够有效处理数据噪声、异常值、缺失值和数据不平衡等问题,以及处理高维度和大规模数据集的能力,具有较好的泛化能力及灵活性优点02模型结构复杂、结果难以解释以及参数的设置和调优比较困难,需要较大的计算资源和存储空间、需要比较丰富的经验和技巧缺点感谢观看!第六章基于k均值聚类算法的信用卡客户划分目
录聚类的概念k均值聚类算法实现流程聚类数量选择方法:手肘法聚类任务评估指标01020304聚类的概念01聚类的概念聚类是一种无监督学习方法,将数据集中相似的数据点分组,并将分组后的数据点形成簇(cluster),簇代表一组相似的数据点,不同的簇之间的数据点差异较大。聚类可以帮助我们发现数据集中的隐藏规律和结构,进而进行数据的分类、降维和异常检测等任务。聚类是数据挖掘和机器学习领域中的一种重要技术,被广泛应用于商业、医疗、社交网络等领域。01聚类的概念01聚类分类学习类型无监督学习有监督学习标签依赖不需要已知的标签或类别信息来进行学习和预测需要已知的标签或类别信息来进行学习和预测学习目标将相似的数据聚到一起,成为一个类对现有的数据集以及所属标签进行学习,然后对未知数据进行预测,确认其所属分类核心逻辑不关注标签,只做相似性分组先学标签规律,再做未知数据分类预测k均值聚类算法实现流程02k均值聚类算法实现流程聚类算法:K-Means、层次聚类、密度聚类等;这些算法的原理和实现方法都不同,但它们的目标都是将数据点分组,形成簇。02k均值聚类算法也被称为K-Means算法,核心思想:假设把数据聚成K个簇(类别),每个簇都会有一个中心(也叫质心)。在开始进行聚类时,会随机从数据中选择K个数据点作为初始聚类中心,某个样本如果离第i个质心是距离最近的,那么这个样本就划分到第i个簇。k均值聚类算法实现流程02在随机初始化K个聚类中心时,需要从数据集中随机选择K个数据点并以此作为初始聚类中心。聚类中心不一定是数据集中的点,也可以是虚拟的点。第一步:随机初始化K个聚类中心对于每个数据点,需要计算它与每个聚类中心之间的距离(欧几里得距离或曼哈顿距离等距离度量方法),然后将数据点划分到距离最近的聚类中心所在的簇中。第二步:计算每个数据点到每个聚类中心的距离,并根据距离划分数据点k均值聚类算法实现流程02在重新计算每个簇的聚类中心时,可以采用两种方法:一种是将簇内所有数据点的均值作为新的聚类中心;另一种是将簇内距离聚类中心最近的数据点作为新的聚类中心。这个过程将会重复执行,直到聚类结束。第三步:重新计算每个簇的聚类中心在迭代优化的过程中,需要重复执行第二步~第三步,直到聚类中心不再改变,即达到稳定状态。最终,就可以得到K个簇,每个簇包含一些距离较近的数据点。第四步:确定最终聚类结果聚类数量选择方法:手肘法03聚类数量选择方法:手肘法手肘法(elbowmethod):在聚类数量不断增加的过程中,随着聚类数量的增加,SSE(误差平方和,即每个数据点与其所属簇的聚类中心之间的距离平方和)或WCSS(簇内平方和,即每个簇内数据点与该簇聚类中心之间距离平方和的总和)会逐渐减小,但随着聚类数量继续增加,SSE或WCSS下降的速度会减缓。使用手肘法选择聚类数量的关键是找到SSE或WCSS下降速度变缓的拐点,即手肘点。03聚类数量选择方法:手肘法例:图中在聚类个数为3时的拐点即为比较合适的聚类数量。03聚类任务评估指标04聚类任务评估指标聚类评估指标是用来衡量聚类算法性能和效果的工具。其中,轮廓系数和兰德系数是两个常用的评估指标。04轮廓系数衡量维度:轮廓系数是一种度量聚类结果紧密度和分离度的指标。计算逻辑:对于每个数据点,轮廓系数计算该点到所属簇内其他数据点的平均距离(即簇内距离)和该点到最近簇内其他簇的平均距离(即簇间距离),并将两者的差值除以两者中的最大值。评估标准:轮廓系数越接近1表示聚类效果越好,越接近0表示聚类效果越差。聚类任务评估指标聚类评估指标是用来衡量聚类算法性能和效果的工具。其中,轮廓系数和兰德系数是两个常用的评估指标。04兰德系数衡量维度:兰德系数是一种度量聚类结果与真实标签吻合程度的指标。计算逻辑:兰德系数基于数据点之间的相似性(或距离),将数据点分为不同的簇,并与真实标签进行比较。兰德系数计算所有数据点之间相同簇分配的比例和不同簇分配的比例,将其相加得到一个总体分数。评估标准:分数越高表示聚类结果与真实标签越吻合,分数越低表示聚类结果与真实标签越不吻合。通常情况下,兰德系数的取值范围为[-1,1],取值越接近1,表示聚类效果越好;取值越接近-1,表示聚类效果越差;取值接近0,表示聚类结果和真实标签之间的相似度较低。感谢观看!第七章基于逻辑回归的信用卡异常行为检测目
录逻辑回归算法定义逻辑回归算法定义K折交叉验证法010203逻辑回归算法定义01逻辑回归算法定义逻辑回归(logisticregression)算法也称作Logistic回归分析算法,是一种广义线性回归,虽然逻辑回归算法带着回归两个字,但它并不是一种回归算法,而是一种分类算法。逻辑回归算法是基于多元线性回归的一种算法,是一种线性分类器。01逻辑回归与线性回归具有相似之处:线性回归采用线性表达式来输出预测值;逻辑回归通过在线性回归的基础上添加非线性变换,输出离散值来解决分类问题。逻辑回归算法原理02逻辑回归算法原理逻辑回归算法既可以用于进行二分类,也可以用于多分类。二分类问题是比较常用的、也更加容易解释,所以在实际问题中,比较常用的是二分类的逻辑回归。02逻辑回归二分类算法原理逻辑回归多分类算法原理逻辑回归算法原理逻辑回归算法在实现二分类任务时,通常将线性回归的结果输入Sigmoid函数中,将其转换为概率值,把线性回归的预测结果从一个无限区间值映射为(0,1)的两个候选结果。Sigmoid函数是一种常用于二分类问题的激活函数,它可以将任意实数映射到0到1之间,可以被看作是一种将实数转化为概率值的函数,可以使用σ来进行表示。逻辑回归二分类算法的表达式为:02逻辑回归二分类算法原理逻辑回归算法原理假设有三角形(标签为0)和圆形(标签为1)两种类别,如果输入一个新的数据(大一点的圆形),逻辑回归算法首先会通过线性回归算法计算出一个输出为(-∞,+∞)的预测值,然后再将这个预测值输入给Sigmoid函数(图中的S形图像)中将其映射成为一个0到1之间的数值,如果数值大于0.5,则归为1类;如果数值小于0.5,则归为0类。02逻辑回归二分类算法原理逻辑回归算法原理逻辑回归实现多分类任务的算法:一对多法和Softmax法02逻辑回归多分类算法原理一对多法指的是对K(K指的是分类个数)分类,训练时依次把某个类别的样本归为一类,其他剩余的样本归为另一类,得到K个分类器;预测时分别用K个分类器进行预测,选择结果最大的作为分类的结果。逻辑回归算法原理逻辑回归实现多分类任务的算法:一对多法和Softmax法02逻辑回归多分类算法原理Softmax法指的是使用Softmax函数将一个向量映射为另一个向量,使得输出向量中的所有元素均在0到1之间,并且所有元素的和为1。Softmax函数与逻辑回归二分类算法中使用的Sigmoid函数类似,它们的主要区别在于输入和输出的维度不同,以及应用的场景不同。Softmax函数通常用于多分类任务,输出为样本属于每个类别的概率分布。K折交叉验证法03K折交叉验证法数据集划分:训练集、测试集、验证集。测试集:在完成模型训练之后,用来测试模型泛化能力的数据集。验证集:在训练过程中用于检验模型的训练情况,从而确定合适的超参数;使用目的是选择合适的模型参数。03划分数据集的方式通常是在固定数据集之后进行随机划分的,会导致数据集的利用率比较低,也会受到随机划分的影响。K折交叉验证法能够避免由于数据集划分不合理而导致的问题。K折交叉验证法K折交叉验证法的主要用途:03进行模型评估选择合适的模型参数K折指的是将训练集划分成为K个子集并执行K次训练12K折交叉验证法3折交叉验证法示例:具体过程是先将训练集划分为3个子集,每次将其中1个子集作为验证集,剩下2个子集作为训练集,对模型进行训练和验证,一共进行3次,最后将3次的训练结果求平均值,即可得到验证后的结果。03感谢观看!第八章基于支持向量机的路面状况分类目
录支持向量机算法定义支持向量机算法原理图像及其特征010203支持向量机算法定义01支持向量机算法定义支持向量机(supportvectormachine,SVM)算法是一种监督学习算法,用来进行分类或者回归,在深度学习被提出之前,一直是公认的、最优秀的分类算法,直至现在,支持向量机算法的使用率仍居高不下。支持向量机算法是由超平面定义的一种二分类模型,即能够将不同类别的样本在样本空间分隔的超平面。(给定标记好的训练数据,SVM算法输出一个最佳分隔超平面,用来对新样本进行分类)01支持向量机算法定义01图中可以看出,分别使用了最近邻KNN、决策树、随机森林和支持向量机SVM四种分类算法进行分类的效果,其中SVM的分类效果一直是比较好的。支持向量机算法定义01例:中国有南北方之称,科学家根据各地的年降雨、温度等因素,进行一系列的推算,最终决定以“秦岭-淮河”为中国南北边界线,从此人们就能根据“秦岭-淮河”知道是南、是北了。各种气候因素相当于SVM的训练数据“秦岭-淮河”这条最佳的南北分界线,相当于SVM算法找到的最佳分类超平面支持向量机算法原理02支持向量机算法原理支持向量机算法既可以用于分类任务中,也可以用于回归任务中,其基本原理是将数据映射到高维空间中,找到一个超平面,使得不同类别的数据被分隔开来,同时最大化所有数据点到超平面的距离,这些离超平面最近的数据点被称为支持向量。02支持向量机算法原理支持向量机算法的最终目的是用训练数据集的间隔最大化找到一个最优分离超平面02超平面假设有5个男生和5个女生的身高、体重数据,将它们绘制成散点图将已知的点划分为圆形和“十”字形两个部分,其中相接的部分直线就是支持向量机算法中的超平面。支持向量机算法原理支持向量机算法的最终目的是用训练数据集的间隔最大化找到一个最优分离超平面02超平面加入头发长度的数据时,输入数据变成了三维此时需要一个二维平面,才能把数据分成两个部分。当我们的数据点集为N维的时(意味着有N个特征),需要一个N-1维的平面才可以把数据分成两个部分。支持向量机算法原理在使用支持向量机算法进行分类或者回归的过程中,超平面的选择可以有多个02超平面的选择随意画出三条可以正确划分男性和女性数据的直线,这些直线都是可以作为超平面的,因此超平面不是唯一的。支持向量机算法原理在使用支持向量机算法进行分类或者回归的过程中,超平面的选择可以有多个02超平面的选择最佳的超平面选择:在固定超平面的方向(图中为直线的斜率)且不会错误分类样本的时候移动超平面(图中为上下移动直线),此时会在超平面的两侧找到两个极限位置(越过该位置就会分错数据),如图所示,在两条虚线中心(到两虚线的距离相同)的实线就为该方向的最佳分类超平面。其中两条虚线的垂直距离就是这个超平面的最大分类间距(margin)。支持向量机算法原理实际生活中,我们碰到的数据集大多是线性不可分的,需要对数据进行转换。事实上,低维平面内不可分的数据放在一个高维空间中就有可能变得可分。理论上任意的数据样本都能够找到一个合适的映射,使得这些在低维空间不能划分的样本到高维空间中之后能够线性可分,而这个映射就是核函数。02核函数图像及其特征03图像及其特征图像是指由像素组成的二维或三维数据,可以是数字图像、模拟图像或计算机生成的图像。数字图像是一种特殊的图像,它是由数字表示的图像,通常以像素矩阵的形式存储在计算机中。03图像及其特征数字图像由二维元素组成,每一个元素具有一个特定的位置和幅值,这些元素就称为像素。像素(pixel)是picture和element这两个字母的缩写,是用来计算数字图像的一种单位,是组成数字图像的最小单位,比如对一幅标有1024像素×768像素的图像而言,这幅图像的长边有1024个像素,宽边有768个像素,1024×768=786432,即这是一幅具有近80万像素的图像。03数字图像图像及其特征在日常生活中,我们通常看到的彩色图像中的每一个像素都是用三个字节来表示的,其中每个字节对应着R(红色)、G(绿色)、B(蓝色)分量的亮度。灰度图像则是将亮度值量化为0~255共256个级别,每个像素是只有一个采样颜色的图像;0表示纯黑色,255表示纯白色,中间的数字从小到大表示由黑到白的过渡色。灰度化处理就是将一幅彩色的图像转化为灰度图像的过程。03灰度图像图像及其特征在机器学习中,通常会对图像进行处理并提取相应的特征之后再输入模型中,这样不仅能够减少运算量,也可以达到提高模型性能的目的。常见的图像特征:颜色特征、形状特征和纹理特征等。图像特征的提取方法:常用的纹理特征提取方法——灰度共生矩阵。03图像特征提取方法图像及其特征灰度共生矩阵(gray-levelco-occurrencematrix,GLCM)是一种基于灰度图像的特征提取方法,其基本思想是统计图像中像素灰度值之间的空间关系。通过计算灰度共生矩阵中的特征参数,如对比度、相关性、能量、熵、逆差矩等,可以有效地描述图像的纹理信息。03图像特征提取方法常用的特征参数二阶矩对比度相关性熵逆差矩图像及其特征03图像特征提取方法二阶矩二阶矩也被称为能量(energy),表示的是灰度共生矩阵中所有元素的平方和。其反映了图像灰度分布的均匀程度和纹理粗细度。二阶矩越大,表示图像的纹理越粗糙,越复杂;二阶矩越小,表示图像的纹理越细。对比度对比度(contrast)反映了图像的清晰度和纹理沟纹深浅的程度。纹理的沟纹深,其对比度大,效果清晰;反之,对比度小,则沟纹浅,效果模糊。图像及其特征03图像特征提取方法相关性相关性(correlation)表示灰度共生矩阵中像素之间的线性相关程度。相关性越大,表示图像的纹理越趋向于线性。熵熵(entropy)表示灰度共生矩阵中像素对的不确定性程度。熵越大,表示图像的纹理越复杂,纹理不均匀;熵越小,表示图像的纹理越简单,纹理比较均匀。逆差矩逆差矩(inversedifferencemoment)反映了图像纹理局部特征变化的情况。当逆差矩越大,表示图像的纹理越均匀;反之,逆差矩越小,表示图像纹理越不均匀。感谢观看!第九章基于朴素贝叶斯算法的店铺评论分类目
录朴素贝叶斯算法概述朴素贝叶斯算法原理文本分类数据预处理流程010203朴素贝叶斯算法概述01朴素贝叶斯算法概述朴素贝叶斯算法(naivebayesmodel)是一种基于贝叶斯定理与特征条件独立假设的分类方法。它在假设数据特征之间相互独立的条件下,使用已知的数据概率来对未知的数据进行分类。01以水果分类为例,假设一个水果的颜色、形状、和大小三个特征分别是红色、圆形、直径4cm。当我们使用朴素贝叶斯算法判断该水果是不是苹果时,首先会假设这三个特征互相独立、没有依赖关系,然后再计算该水果是不是苹果的概率。朴素贝叶斯算法原理02朴素贝叶斯算法原理贝叶斯定理是18世纪英国数学家托马斯·贝叶斯(ThomasBayes)提出的重要概率论理论。贝叶斯定理的公式如下:02贝叶斯定理P(B|A)表示在已知特征A的情况下,事件B发生的概率,也称为后验概率;P(B|A)表示在已知事件B发生的情况下,特征A出现的概率,也称为似然度;P(B)表示事件B的先验概率,指在考虑特征A之前,事件B发生的概率;P(A)表示特征A的先验概率,指在考虑事件B之前,特征A出现的概率。朴素贝叶斯算法原理例:已知某工厂生产次品的概率为10%,同时该工厂停电的概率为1%,停电时生产次品的概率为90%,那么当该工厂生产了次品的时候,停电的概率有多大?02贝叶斯定理在该例中,首先定义事件的概率,即设P(次品)表示生产次品的概率,即P(次品)=10%;设P(停电)表示工厂停电的概率,即P(停电)=1%;P(次品|停电)表示停电时生产次品的概率,即P(次品|停电)=90%;而该工厂生产次品时,停电的概率用P(停电|次品)表示,通过贝叶斯公式计算,停电的概率为:朴素贝叶斯算法原理在许多情况下,特征与特征之间可能存在关联性,例如通过温度、湿度、气压等特征判断是否是晴天,如果温度高,湿度就可能小,他们之间是存在关联性的。在这种多特征、多类别的场景下,如果直接从有限的样本中估计类别的概率往往会比较困难。02朴素贝叶斯算法原理朴素贝叶斯算法采用了“特征条件独立性假设”,即假设样本中的各个特征之间都是相互独立的、互不关联的,忽略特征之间的关联性,使计算概率的过程更加简单。朴素贝叶斯算法还需要估计先验概率和条件概率,并利用贝叶斯定理计算后验概率,朴素贝叶斯算法通常表现出很好的分类效果。朴素贝叶斯算法原理例:朴素贝叶斯算法实现文本分类(判断是否为篮球运动)表中文本特征是文字形式的,计算机很难进行计算,通常会通过一些文本预处理的方式将文本特征转成向量形式。如词频特征矩阵将文本特征中重复的词去掉得到词频列表如[突破,扣篮,罚球,唱歌,跳舞],接着再转为词频特征02朴素贝叶斯算法原理文本特征类别突破;扣篮True罚球;扣篮True唱歌;跳舞False朴素贝叶斯算法原理如果现在有[突破,罚球]这两个特征,那么使用朴素贝叶斯算法去判断该数据是否是篮球运动时,会得出以下公式。02朴素贝叶斯算法原理属于篮球运动的概率为不属于篮球运动的概率为所以最后将拥有[突破,罚球]特征的文本分为属于篮球运动这一类型。文本分类数据预处理流程03文本分类数据预处理流程文本分类数据预处理是文本分类中比较重要且关键的过程,文本分类数据预处理的好坏直接影响着分类的效果。文本分类数据预处理可以帮助我们从原始文本分类数据中提取有用信息并去除无用信息,而不同的任务常常需要使用不同的预处理步骤和方法,来对文本分类数据进行预处理,为后续模型训练和分析打下基础。03常见的文本分类数据预处理步骤:文本分类数据预处理流程03常见的文本分类数据预处理步骤:01分词将文本拆分成一个个单独的单词或词组,以方便后续处理02去除停用词将一些常见的,但是对分析用处不大的、无意义的字词或者标点符号从文本中去除03文本特征提取从文本中提取有用的信息并将其作为模型的输入特征04文本向量化将文本转换为向量形式文本分类数据预处理流程分词是实现文本分类的第一个步骤,指将一段文本按照一定的规则或算法进行切分,切分成一个个具有实际含义的词汇单位。在英文中,单词之间以空格作为自然分界符;而在汉语中,词没有一个形式上的分界符。也就是说,相比于英文,中文没有词与词之间的分界符(如空格)。因此分词是处理中文文本的首要步骤。03分词文本分类数据预处理流程对于中文进行分词可以使用jieba库。jieba分词库是一个优秀的Python第三方中文分词库,常常用于对中文文本进行分词。jieba分词库的分词原理是利用中文词库来确定汉字之间的关联概率,并将概率大的汉字组成词组,形成最终的分词结果。jieba分词库支持3种分词模式:精确模式、全模式、搜索引擎模式。03分词文本分类数据预处理流程03分词分词模式简介特点切分结果精确模式对语句进行最精确的切分不存在冗余数据,能够完整地把文本按照中文词库的标准完成拆分,比较适合文本分析全模式将语句中所有可能是词的词语都切分出来分词速度很快,但是会存在冗余数据搜索引擎模式在精确模式的基础上,对长词再次进行切分提高召回率,适合用于搜索引擎分词例:“冰墩墩是2022年北京冬季奥运会的吉祥物”文本分类数据预处理流程停用词是指在文本分析中被忽略的一些常见词语,例如“的”“了”“是”等。这些词在文本中出现的频率非常高,但通常不携带太多的语义信息,因此这些词在文本分类中通常可以被忽略。忽略这些词可以减少文本数据量,提高文本处理效率,同时可以避免这些无意义的词对文本分类的影响。03去除停用词文本分类数据预处理流程停用词通常包括语气助词、连词、代词、介词、冠词、副词等一些无实际意义的词语。在文本分类中,常常使用停用词表来忽略这些词语。停用词表可以是自己预定义的,也可以是根据具体的文本数据集来自动生成的。目前常用的中文停用词表:03去除停用词百度停用词表哈工大停用词表中文停用词表文本分类数据预处理流程文本特征是指用于描述文本的属性或特性,可以用于文本分类、情感分析、实体识别等任务。常见的文本特征提取包括词频(TF)、TF-IDF值等。词频特征是一种比较简单文本特征,它指的是文本中每个词出现的次数。因为每个文本一般都是由单词所组成的,而每个单词出现的次数在一定程度上又可以从侧面反映该文章的内容。例:love这个词出现的比较多,则可以猜测很大可能属于情感类的文章。在处理文本类的信息时,词频特征是非常重要的信息之一。03文本特征提取文本分类数据预处理流程词频特征简单易于理解,能够从宏观角度捕获文本信息,但是词频特征往往会受到停止词汇的影响(即停用词),例如“的”“,”等,他们出现次数往往较多,容易影响文本的分析效果,所以在处理文本类型的数据时常常包含去停用词这一部分操作。03文本特征提取文本分类数据预处理流程原因:计算机系统内部以二进制来表示、存储和处理数据信息,即0、1两种运算数字。在自然界中,能够获取到信息非常丰富、种类非常多,例如数值、字符、图像、音频等,而数值型的数据很容易够转成二进制的表示形式,但像字符类型(文本)的这种数据,计算机很难对其进行运算、存储等。解决办法:需要将词汇转化为计算机可识别的数值形式,即文本向量化。03文本向量化感谢观看!第十章基于多层感知机的相册分类目
录感知机算法多层感知机算法图像增广010203感知机算法01感知机算法感知机算法最早是由美国学者FrankRosenblatt受到生物神经细胞的启发于1957年提出的一种机器学习模型,它是一种二分类的线性分类模型,是神经网络和支持向量机的基础。感知机算法只有一个输入层xi和一个输出层y,它的学习能力非常有限,只能处理线性问题,很难解决复杂的非线性问题。01感知机算法感知机算法是一种最简单的前馈神经网络,其结构与生物的神经细胞结构类似。感知机算法是一个单个神经元的生物神经网络,它的输入可以有多个,并且每一个输入都会有一个权重,通过让输入xi与权重wi相乘进行加权,然后进行求和得出一个值,如果这个值大于阈值θ,则输出y=1;如果小于这个阈值则输出y=0,其中0和1分别表示类别。01多层感知机算法02多层感知机算法多层感知机(multiLayerperceptron,MLP)算法是一种前馈神经网络,是由感知机模型推广而来。多层感知机算法是指由多个感知机组成的多层次的人工神经网络。它克服了感知机不能对线性不可分数据进行识别的弱点。02组成:多层感知机算法通常由一个输入层、多个隐藏层和一个输出层组成,是神经网络中的一种。规则:每一个圆圈表示一个神经元的节点,每一层神经元只接受来自前一层神经元的输入(前一层可能是输入层也可能是隐藏层),后面的层对前面层没有信号反馈。输入模式经过各层的顺序传播,最后在输出层上得到输出。图像增广03图像增广图像增广也可以称为数据增强,是一种通过让有限的数据产生更多的等价数据来人工扩展训练数据集的技术,通常用在图像数据的处理上。在数据集不足的情况下,对训练图像进行一系列的随机变化之后,生成相似但不同的训练样本,从而扩大训练集的规模。应用图像增广的原因除了数据量少之外,还可以随机改变训练样本以减少模型对某些属性的依赖,从而提高模型的泛化能力。03图像增广的概念图像增广图像增广的方法相当于在数据集上增加视角、位置方面的偏差,进而增强模型在这些方面的鲁棒性,从而提高测试精度。03图像增广的常用方法图像增广的常用方法:图像缩放图像平移图像旋转图像翻转图像增广图像缩放是对数字图像的尺寸进行调整的过程,可以理解为对图像进行拉伸或压缩的操作。这是一种非平凡的过程,需要在处理效率以及结果的平滑度和清晰度上做一个权衡。当图像的尺寸缩小后,它的平滑度将会增强。03图像增广的常用方法图像增广图像平移是将一幅图像中的所有像素点都按照给定的偏移量在水平方向(沿x轴方向)或垂直方向(沿y轴方向)移动,也就是说将图像所有的像素坐标,分别加上指定的水平偏移量和垂直偏移量,是图像几何变换中较为简单的一种变换。03图像增广的常用方法图像增广图像旋转是指图像以某一点为中心旋转一定的角度,形成一幅新的图像的过程。图像的旋转变换一般以图像中心为旋转中心,图像旋转后不会变形,但其垂直对称轴和水平对称轴都会发生改变,其大小也一般会发生改变。03图像增广的常用方法图像增广图像翻转包括水平翻转、垂直翻转和水平垂直翻转3种类型,在图像翻转过程中,翻转只改变图像的方向,并不改变图像的大小,并且不是任意改变方向。03图像增广的常用方法垂直翻转是指以图像的垂直中轴线为坐标旋转180°,翻转之后原图像的左半部分变到右边,右半部分变到左边水平翻转是指以图像的平行中轴线为坐标旋转180°,翻转之后将原图像的上半部分变到下边,下半部分变到上边水平垂直翻转是指水平翻转和垂直翻转同时进行的操作感谢观看!第十一章智慧电商:基于多模型融合实现商品销量预测目
录Stacking算法概述Stacking算法流程GBDT算法概述GBDT算法原理01020304Stacking算法概述01Stacking算法概述集成学习是一种结合多个模型的预测结果,以得到比任何一个模型都更优、效果更好的预测结果的方法,作为集成学习三大类中的Stacking算法,通常基于多个不同的基学习器进行集成,因此又被称为异质集成方法。Stacking算法被广泛应用于各种领域,如金融、医疗、推荐系统等。在这些领域,Stacking算法已经成为一个强有力的工具,能够提高预测准确性和稳定性。01Stacking算法概述Stacking算法是由Wolpert于1992年提出的一种分层模型的集成框架。其基本思想是先使用第一层初级学习器在原始数据上进行训练,接着根据每个初级学习器的输出结果来创建一个新的数据集,最后将新的数据集输入元学习器中进行训练,并将其输出作为集成学习后的最终预测结果。01Stacking算法流程02Stacking算法流程对于一个问题来说,通常可以采用不同类型的学习器,如线性回归、逻辑回归、支持向量机等算法构建的学习器,来解决学习问题。这些学习器通常能够学习到问题的一部分,但并不能学习到问题全部。Stacking集成方法的思想可以概括为:如果某个初级学习器错误地学习了特征空间的某个区域,那么元学习器通过结合其他初级学习器的学习行为,可以适当纠正这种错误。02Stacking算法流程Stacking集成方法的基本算法流程:02假设原始数据集D={(x1,y1),(x2,y2),…,(xn,yn)},将原始数据集D分为原始训练集Dtrain和原始测试集Dtest两部分,其中原始训练集Dtrain用于训练初级学习器,原始测试集Dtest用于测试元学习器。(1)选择并构建多个初级学习器,例如构建逻辑回归、支持向量机、KNN学习器等。(2)对于初级学习器1,利用K折交叉验证的方法,在K-1折上训练初级学习器,并在第K折上进行验证,最终得到K个预测结果,将其组合为集合P1,作为初级学习器1的最终预测结果。(3)Stacking算法流程Stacking集成方法的基本算法流程:02对于初级学习器{2,3,…,m},重复步骤(2)的操作,得到预测结果集合P2,…,Pm。(4)将m个初级学习器的预测结果拼接为新数据集P={P1,P2,…,Pm},作为元学习器的训练集数据并进行训练,从而得到Stacking的最终模型。(5)最后将测试集Dtest输入Stacking模型中进行测试与评估。(6)Stacking算法流程02(1)集成强学习器的优势,以达到较高的分类准确率;(2)不需要太多的参数调整和特征筛选工作;(3)利于工程实践、数学理论知识较少、容易理解、模型可扩展性高、对训练数据利用更充分。优点(1)需要构建多个初级学习器模型,计算量往往较大、模型容易过拟合;(2)类似黑箱模型的特性,模型的可解释性较弱。缺点GBDT算法概述03GBDT算法概述GBDT算法是gradientboostingdecisiontree(梯度提升决策树)的缩写,最早由Friedman于2001年提出,属于有监督学习中的一种算法。GBDT算法是一种迭代的决策树算法,是集成学习中Boosting方法的成员之一。03GBDT算法概述Boosting方法在训练基学习器时采用的是串行的方式,其基本思路是将基学习器进行层层叠加,其中每一层基学习器在训练的时候,会对前一层基学习器分错的样本,根据其学习误差调整训练集的权重,给予更高的权重,最后根据各层学习器结果的加权得到最终模型。03GBDT算法原理04GBDT算法原理GBDT算法是一种不断进行迭代的决策树算法,既可以用于解决分类问题也可以用于解决回归问题,采用决策树作为基学习器。GBDT算法的主要流程:04初始化第一个基学习器,该基学习器是一个只有根节点的决策树建立M个基学习器,计算出损失函数的负梯度在当前模型的值,将它们作为残差的估计创建一颗回归树CART来拟合这个残差在拟合后的树的叶子节点找到一个尽可能的减小损失的值并更新学习器GBDT算法原理例:假设有一组数据集为编号、年龄、体重、身高4列。其中,年龄、体重作为特征(输入变量),身高作为目标变量特征,即需要预测的值。04编号年龄/岁体重/kg身高/m15201.127301.3321701.7430601.852565?GBDT算法原理GBDT算法步骤:04(1)初始化损失函数式子如下。其中,式子中的yi为目标变量。损失函数选择为平方损失函数,然后直接对式子进行求导并另导数等于零,求c的值,即c的值为编号1~编号4的身高均值。身高初始化学习器的结果如下。GBDT算法原理GBDT算法步骤:04(2)建立M颗分类回归树,m=1,2,3,…,M,进行迭代训练。a.计算负梯度,由于选择的损失函数为平方损失函数,所以负梯度就是残差,其式子如下:编号年龄/岁体重/kg身高/m1520-0.3752730-0.175321700.225430600.3251520-0.375表格为使用身高-初始化学习器的结果c得出的结果构成新的数据集GBDT算法原理GBDT算法步骤:04(2)建立M颗分类回归树,m=1,2,3,…,M,进行迭代训练。b.对于i=1,2,3,…,N利用CART拟合数据(xi,rm,i),得到第m棵回归树,其对应的叶子节点区域为Rm,j,其中j=1,2,3,…,Jm,且J
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 中江县卫生健康系统事业单位 2026年第二批医疗卫生辅助岗招募(17人)考前冲刺密卷附参考答案详解(A卷)
- 2026浙江杭州桐庐县科协招聘编外工作人员1人笔试题库(名师系列)附答案详解
- 2026广西壮族自治区经济社会技术发展研究所招聘编外聘用人员3人模拟试卷含答案详解(达标题)
- 2026浙江舟山市普陀区沈家门街道社区卫生服务中心编外招聘1人(影像技师)模拟试卷及参考答案详解(突破训练)
- 2026内蒙古锡林郭勒盟二连浩特市引进中小学校长2人模拟试卷及参考答案详解【轻巧夺冠】
- 2026河北要素交易集团有限公司及子企业招聘12人笔试题库标准卷附答案详解
- 三年级(上)语文1-8单元课内阅读专项2026
- 触电急救试题及答案
- 香肠派对游戏相关试题及答案解析
- 上海营养师专业试题及对应答案
- 太原理工大学《大学物理A》2025 - 2026学年第一学期期末试卷(A卷)
- DBJT 15-20-2016 建筑基坑工程技术规程
- 近年国内电解铝行业重大事故案例
- ICU进修汇报医学知识讲解讲义
- 洗手间6s管理制度
- 养老院章程范本2016
- DB52T 1283-2018 精准扶贫 农村“组组通”硬化路建设与管理养护规范
- 车厢维修合同范本
- CSAE标准-汽车整车气动声学风洞风噪试验-车内风噪测量方法编制说明
- (高清版)JTG 3810-2017 公路工程建设项目造价文件管理导则
- 英语48个国际音标课件(单词带声、附有声国际音标图)
评论
0/150
提交评论