机器学习基础与应用 课件 第1-7章 机器学习基础知识 -基于逻辑回归的信用卡异常行为检测_第1页
机器学习基础与应用 课件 第1-7章 机器学习基础知识 -基于逻辑回归的信用卡异常行为检测_第2页
机器学习基础与应用 课件 第1-7章 机器学习基础知识 -基于逻辑回归的信用卡异常行为检测_第3页
机器学习基础与应用 课件 第1-7章 机器学习基础知识 -基于逻辑回归的信用卡异常行为检测_第4页
机器学习基础与应用 课件 第1-7章 机器学习基础知识 -基于逻辑回归的信用卡异常行为检测_第5页
已阅读5页,还剩105页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第一章机器学习基础知识目

录人工智能、机器学习与深度学习的关系机器学习的定义机器学习的主要任务机器学习的学习方式机器学习的三要素0102030405人工智能、机器学习与深度学习的关系01人工智能、机器学习与深度学习的关系机器学习是通过对数据分析、学习与训练,使计算机系统能自主预测和决策的技术。深度学习是通过构建多层神经网络,让计算机系统能够自动对大量数据进行学习和处理。深度学习是机器学习的进一步发展,机器学习和深度学习是人工智能技术的重要组成部分。01机器学习的定义02机器学习的定义机器学习指的是计算机通过对数据、事实或自身经验的自动分析和综合获取知识的过程。机器学习一般通过归纳、一般化、类比等基本方法探索人类的认识规律和学习过程,建立各种能通过经验自动改进的算法,使计算机具有自动学习特定知识和技能的能力,是使计算机具有智能的根本途径。02机器学习的主要任务03机器学习的主要任务03分类是找出一组数据对象的共同特点并按照分类模式将其划分为不同的类,其目的是通过分类模型将数据项映射到某个给定的类别。分类回归反映的是数据属性值在时间上的特征,产生一个将数据项映射到一个预测值变量的函数,发现变量或属性值间的依赖关系,其主要研究问题包括数据序列的趋势特征、数据序列的预测以及数据间的关系等。回归聚类是把一组数据按照相似性和差异性分为几个类别,其目的是使得属于同一类别的数据间的相似性尽可能大、不同类别中的数据间的相似性尽可能小。聚类机器学习的学习方式04机器学习的学习方式04监督学习监督学习是机器学习中常见且较容易使用的方法之一,指的是机器使用标记良好的训练数据进行训练,因此模型可以在使用数据集训练的基础上预测输出。无监督学习无监督学习是指模型使用未标记的数据集进行训练,并允许在没有任何外部监督的情况下对数据采取行动。无监督学习常用于处理聚类问题。半监督学习半监督学习是监督学习与无监督学习相结合的一种学习方法。半监督学习使用大量无标签数据和少部分有标签数据来进行机器学习。强化学习强化学习受到行为心理学的启发,其主要关注智能体如何在环境中采取不同的行动,以最大限度地提高累积奖励。机器学习的三要素05机器学习的三要素机器学习的三个要素是数据、模型和算法。在机器学习的过程中,三个要素相互作用,不断优化,使得机器能够不断学习和进步。05数据是机器学习的基础模型是对数据进行拟合和预测的工具算法是实现模型的方法和技术数据算法模型机器学习的三要素数据集通常由一条条数据(每一行)样本组成,样本由描述其各个维度信息的特征及目标值标签(或无)组成。数据通常有数值型、文本型、图像型等类型数据,这些数据在机器学习中常常被划分为有标注数据和无标注数据两种。05数据机器学习的三要素有标注数据指的是每一个数据X,都有一个对应的标签Y;无标注数据指的是数据集中只有数据X,没有标签Y05数据XY[1,1,1]0[0,1,1]1[1,0,1]2[1,1,0]3机器学习的三要素在有监督学习(数据拥有标签Y)中,数据集通常会被分为训练集、验证集、测试集(按6

:

2

:

2的比例)三部分或者训练集、测试集(按8

:

2的比例)两部分,数据集的具体划分可按照实际情况来进行。05数据训练集用于训练模型的样本集合。可以比喻成学生的课本,用于给学生学习、掌握课本内容的知识。验证集用于验证模型性能的样本集合。可以比喻成学生的作业,用于检验学生的学习情况、进步快慢等,需要根据情况进行调整。测试集用于测试最后得到的模型的性能。可以比喻成学生的考试,用于考查学生的整体能力。机器学习的三要素一个好的模型需要经过训练才能得到最终的结果,而这个训练的过程就需要依靠某些方法来让模型变得更好,而这里的方法指的就是算法。机器学习的主要算法可分分类算法、回归算法、聚类算法三种。常见的机器学习算法有朴素贝叶斯分类、逻辑回归、决策树、随机森林、支持向量机、K-最近邻、K-均值聚类等。05算法机器学习的三要素模型指的是将数据输入算法中进行训练后得到的结果,可概括为数据+算法=模型。模型的效果:假设y=f(x)是一个已经训练好的模型,把数据(对应其中的x)输入进去,得到输出结果(对应其中的y),这个输出结果可能是一个数值(回归),也可能是一个标签(分类),这就是模型需要达到的效果。05模型感谢观看!第二章数据预处理目

录数据的定义与类别数据预处理技术数据标准化技术数据编码技术01020304数据的定义与类别01数据的定义与类别数据是指对客观事件进行记录并可以鉴别的符号,是对客观事物的性质、状态以及相互关系等进行记载的物理符号或物理符号的组合,它是一种可识别的、抽象的符号。01数据的定义我今天买了12瓶饮料“12瓶”实际上指的是对“饮料”这一个客观事物状态进行记录的一个符号数据的定义与类别数据指的不仅是狭义上的数字,还可以是具有一定意义的文字、字母、数字符号的组合等。生活中常见的图像、视频、音频、文本等都属于数据。数据也是客观事物的属性、数量、位置及其相互关系的抽象表示。01数据的定义数据的定义与类别在计算机科学与技术的领域中,数据是指一切能够输入计算机且能被计算机程序处理的符号总称。数据是指可用于输入计算机并进行处理的数字、字母、符号和各种模拟量。这些数据在计算机系统中都以二进制的信号单元0、1表示,所以通常需要将如文本、图像等非数值型的数据转换成数值型。01数据的定义数据的定义与类别数据分类在收集、处理和应用数据过程中非常重要。根据不同的数据类别进行分类可以更好地组织、管理、分析和应用数据。01数据的类别按照字段分类按照数据结构类型分类常见的数据分类方式数据的定义与类别01数据的类别按照字段分类用于描述性的字段,如个人姓名、家庭住址、文章等。这一类的数据是非量化的一个值,即该数据不可以直接运用在运算中。例如“芒种,是夏季的第三个节气。”这一段文字就是一种文本类数据文本类数据用于描述事件发生的时间,如“2023年1月1日”文本可以转换成为时间类数据“2023/1/1”,该数据是可以直接进行运算的。时间类数据用于描述量化属性或用于编码的一种数据,如交易金额、额度、商品数量、积分数、客户评分等都属于量化属性,是日常计算指标的核心字段。数值类数据数据的定义与类别01数据的类别按照数据结构类型分类指由统一的结构来进行逻辑表示和存储的数据。这类数据遵守相同的数据格式与数据长度规范,可以通过关系型数据库进行存储和管理。结构化数据指没有预定义数据模型、数据结构不完整或者不规则,不可以直接用数据库逻辑来表现的一种数据。在日常生活中常见的图像、文本、音频、视频等均属于非结构化数据。非结构化数据指介于结构化与非结构化数据之间的一种数据,是一种包含相关标记,以相关标记对字段进行分层分隔语义元素的一类数据,半结构化数据也被称为自描述结构。半结构化数据数据预处理技术02数据预处理技术数据和特征决定机器学习的上限,模型和算法只是逼近该上限,凸显出数据预处理的必要性。在实际业务中,从各种渠道获取的初始数据大多是“脏”数据。02“脏”数据定义:对实际业务无意义、格式非法、编码不规范、业务逻辑模糊的数据。成因:数据重复录入、共同处理等不规范操作而产生的混乱、无效数据。特点:低质量的数据,存在着一系列问题。影响:导致输出不正确,甚至误导性的结果。类型:错误数据、重复数据、缺失数据等问题解决办法:数据预处理。数据预处理技术02指不为空的属性值错误。如异常值(某个产品价格为1到100元,统计中出现200元的值);格式错误(某种格式的数据被记为另一种格式,如将文字录成日期格式)错误数据1指同一条数据在数据集中多次出现,如数据表中存在两条甚至多条如[姓名:A,座位号:01]的数据。重复数据2指数据表中属性值缺失或者是包含无效值。成因:系统问题、人为问题等。缺失数据3原始数据存在的问题数据预处理技术数据预处理指的是在数据集用于模型训练前,使用一定的方法对数据进行处理,以便把数据变换成适用于机器学习模型训练的格式或形式,常用的数据预处理方法有删除法、插补法等。02删除法指将含有错误值、重复值或者缺失值的记录直接进行删除,在删除过程中通常直接删除存在问题的某一行或某一列数据。插补法是用于处理缺失数据和错误数据的一种常用方法,该方法常常使用数据中的均值、中位数或众数填充或替换空值、错误部分数据。数据标准化技术03数据标准化技术定义:数据标准化指通过数学变换方式,将原始数据按照一定的比例进行转换,使之落入小的特定区间内(如0~1或-1~1)。目的:消除不同变量之间性质、量纲、数量级等特征属性的差异,将其转化为一个无量纲的相对数值(标准化数值),使各指标的数值都处于同一个数量级上,便于不同单位或数量级的指标进行综合分析和比较。常见方法:min-max标准化、z-score标准化。03数据标准化技术03min-max标准化z-score标准化也称为最小-最大标准化,是对原始数据的线性变换。该标准化可以将数据值映射到[0,1]。计算公式:新数据=(原数据-最小值)/(最大值-最小值)。是基于原始数据的均值和标准差对数据进行标准化的方法。处理后的数据符合标准正态分布(即均值为0,标准差为1)。计算公式:新数据=(原数据-均值)/标准差。数据编码技术04数据编码技术数据编码指的是将一个字符串类型的数据转换成数值类型。常见的数据编码技术有标签编码和独热编码。04标签编码(labelencoding)指用标签进行编码,将原始特征值编码为自定义的数字标签完成量化编码过程。如:有红、黄、蓝三种类别的颜色,可以编码为红=1、黄=2、蓝=3。0102标签编码独热编码(one-hot编码)用于将离散的分类标签转换为二进制向量。该方法主要是采用N位状态寄存器来对N个状态进行编码,每个状态都有其独立的寄存器位,并且在任意时候只有一位有效。独热编码季节独热编码春(1,0,0,0)夏(0,1,0,0)秋(0,0,1,0)冬(0,0,0,1)感谢观看!第三章基于线性回归的交通车流量预测目

录线性回归的定义回归模型评估指标0102线性回归的定义01线性回归的定义机器学习的大多数任务通常都与预测有关。当我们想预测一个数值时,就会涉及回归问题。如预测价格(预测商品价格、股票价格等)、预测天气状况(预测降雨量、是否下雨等)、预测需求(预测商品销量、工厂生产量等)等。01通过数理统计中的回归分析来确定各种因素与预测结果的定量关系线性回归的定义回归问题可以理解为给定数据集D,通过建模建立自变量和因变的关系构造出一条近似反映真实数据分布规律的曲线,以此对因变量进行预测,回归也被称为拟合。根据自变量和因变量之间的关系类型,分为线性回归和非线性回归分析。01线性回归:拟合出直线非线性回归:拟合出曲线线性回归的定义在回归分析中,只包括一个自变量和一个因变量,且二者的关系可用一条直线近似表示,这种回归分析称为一元线性回归分析;若包括两个或两个以上的自变量,且因变量和自变量之间是线性关系,则称为多元线性回归分析。01线性回归的定义01类型含义公式一元线性回归模型反映一个变量对目标变量的数学关系多元线性回归模型以多个变量来决定另一个变量的方程非线性回归模型因变量Y与自变量X之间的关系不存在线性关系X表示特征值(自变量);Y为预测值(因变量);β为权重(weight),它决定每个特征对最终预测值的影响效果;ε为偏置(bias)或偏移量(offset),相当于一元线性回归模型中的b,可以增强模型的精准表达能力,使其能够拟合更多的模型回归模型评估指标02回归模型评估指标在机器学习领域中,为了检验训练好的模型性能,通常需要对模型进行评估。不同类型的模型所使用的评估方法也会有所差异,只有选择与问题相匹配的评估方法,才能快速发现模型选择或训练过程中出现的问题,从而对模型进行优化。在回归任务中,对于训练好的回归模型的常用评估指标有平均绝对误差(meanabsoluteerror,MAE)、均方误差(meansquareerror,MSE)、均方根误差和决定系数R2等02回归模型评估指标假设实际值为[1.3,2.2]、预测值为[1.1,2.3]02评估指标含义公式均方误差(MSE)又叫L2范数损失,通过计算真实值和预测值差值的平方和的均值衡量平均绝对误差(MAE)又叫L1范数损失,通过计算真实值和预测值差值的绝对值的均值衡量均方根误差(RMSE)表示预测值和真实值差值的样本标准差xi为真实值,yi为预测值,m为个数;均方误差、平均绝对误差、均方根误差评估指标的值的范围都为[0,+∞],值越大,说明预测模型效果越差;值越小,说明预测模型效果越好。回归模型评估指标在sklearn工具包中,决定系数R2评估指标可以通过score()函数来实现,其返回值为决定系数R2,该指标表示决定系数反映了因变量Y的波动,有多少百分比能被自变量X的波动所描述。该参数可以用来判断统计模型对数据的拟合能力。02公式:SSE是残差平方和,表示预测值和实际值对应点的误差的平方和;SST是总离差平方和,表示实际值和均值之差的平方和。决定系数R2指标的范围为0到1,其数值大小反映了回归贡献的相对程度,是最常用的评价回归模型优劣程度的指标。在通常情况下,对于训练数据集,R2取值范围为[0,1];对于测试集合,R2的值有可能为负值。一般而言,R2的值越接近1,模型效果越好;R2的值越接近0,效果越差。感谢观看!第四章基于KNN算法的二手车价格预测目

录KNN算法的定义KNN算法实现流程KNN算法的优缺点010203KNN算法的定义01KNN算法的定义KNN(K-nearestneighbor)也被称为K-近邻算法,是目前机器学习领域中最简单的算法之一,既可用于分类任务也可用于回归任务。KNN算法,即给定一个训练数据集,对新的输入实例,在训练数据集中找到与该实例最邻近的K个实例。使用KNN算法处理分类任务时,如果K个实例的多数属于某个类,就把该输入实例分类到这个类中;使用KNN算法处理回归任务时,输入实例的预测值就是K个实例的平均值。01KNN算法的定义图中的正方形表示第一类、深色圆点表示第二类、浅色圆点表示新的实例(未分类的样本)。当我们进行分类时,如果K=3,则新实例属于深色圆点类别;当我们进行回归时,如果K=3,则新实例预测值为最近3个实例的平均值。01KNN算法实现流程02KNN算法实现流程KNN算法的指导思想是“近朱者赤,近墨者黑”,它通过你的“邻居”来推断出你的类别或者预测你的值。首先计算待分类样本与已知类别的训练样本之间的距离,找到距离与待分类样本数据最近的K个邻居;再根据这些邻居所属的类别来判断待分类样本数据的类别。如果用空间内两个点的距离来度量,距离越大,表示两个点越不相似;距离越小,表示两个点越相似。02KNN算法实现流程KNN算法实现回归预测任务时的基本流程:02计算已知数据集中的点与当前点之间的距离1选取与当前点距离最小的K个点3返回前K个点的平均值,以此作为回归预测的结果5按照距离递增的顺序进行排序2确定前K个点并计算K个点的平均值4KNN算法实现流程02距离的计算方法计算方法含义二维公式(例:A(x1,y1)、B(x2,y2))欧式距离计算两点之间最短距离的方法曼哈顿距离两点在南北方向上的距离加上在东西方向上的距离线段a代表的是欧式距离;线段b、c、d代表的是曼哈顿距离。欧式距离和曼哈顿距离的计算方法不仅可以应用在二维数据中,同样也可以应用于三维、多维数据中KNN算法实现流程02K值的选取构建KNN算法模型的一个核心要素是K值的选择,K值的选取对模型的准确率至关重要。K值的选择通常取决于数据集的实际情况。如果K值太小,分类结果易受噪声点影响,模型过于复杂,会发生过拟合而忽略数据的真实分布;如果K值太大,模型将过于简单而忽略训练数据实例中的大量有用信息。在应用中,一般会先取一个较小的K值,然后再慢慢进行调整。KNN算法实现流程02K值的选取例:正方形和六边形是训练数据点,而五角星则是需要分类或者回归预测的数据。假如K=3,在离五角星最近的3个数据点中:(1)有2个六边形,1个正方形;(2)使用KNN算法进行分类时,应该把五角星分到六边形这一组;使用KNN进行回归预测时,应该把2个六边形、1个正方形进行相加,然后求平均值,即可得到预测结果。KNN算法实现流程02K值的选取例:正方形和六边形是训练数据点,而五角星则是需要分类或者回归预测的数据。假如K=5,在离五角星最近的5个数据点中:(1)有2个六边形,3个正方形;(2)使用KNN算法进行分类时,应该把五角星分到正方形这一组;使用KNN算法进行回归预测时,应该把2个六边形、3个正方形进行相加,然后求平均值,即可得到预测结果。KNN算法的优缺点03KNN算法的优缺点03KNN算法的优点01KNN算法通过选取K个邻近值来判断分类,对异常值有较高的容忍度,对噪声数据的容忍能力较强,即噪声数据对分类算法效果影响不大。0203KNN算法不需要复杂的训练过程,新样本数据可直接加入样本数据集而不必进行重新训练。KNN算法的分类过程直接利用了样本之间的关系,因此降低了因类别特征的不当选择对分类结果造成的影响,可以最大程度地降低分类过程中的误差项。KNN算法的优缺点03KNN算法的缺点计算量较大,速度慢成因:每一个待分类的样本均需要计算出它到所有已知样本的距离后,才能求得该样本的K个邻居。解决方法:对样本数据预处理,先对已知样本点进行裁剪,去除对分类作用不大的样本。成因:随机选定的K值可能会导致分类错误或误差较大。解决方法:通常需要多次选择K值以达到最佳分类效果。样本数量不均衡时,数量多的类别会靠“数量优势”霸占K个近邻,哪怕待测样本其实和数量少的类别更相似,KNN也会因“少数服从多数”把它错分到数量多的类,导致分类不准。分类准确率对K值依赖很大样本不均衡时容易分类误判感谢观看!第五章基于随机森林算法的共享单车租赁数量预测目

录集成学习的概念随机森林算法介绍0102集成学习的概念01集成学习的概念集成学习(ensemblelearning)是一种机器学习框架,是将多个弱学习器(或者称为基学习器)集成为强学习器的方法。弱学习器是指单独训练时性能比较弱的学习器,例如逻辑回归、SVM、线性回归等。集成学习是通过将多个弱学习器集成起来,使得整个模型的性能得到提升。01总的来说集成学习是将多个单一的模型组合起来,从而达到提高模型整体性能的一种方法集成学习的概念集成学习方法:Bagging、Boosting和Stacking方法。Boosting和Bagging方法通常使用同一种基学习器(baselearner)进行集成,因此被称为同质集成方法;Stacking方法通常基于多个不同的基学习器进行集成,因此被称为异质集成方法。01Bagging同质集成方法Boosting异质集成方法Stacking随机森林算法介绍02随机森林算法介绍随机森林(randomforest,RF)算法是由Breiman在2001年提出的,它是以决策树为基本单位的一种集成学习算法,通过Bagging方法实现。02决策树概念Bagging方法随机森林算法实现流程随机森林算法介绍决策树概念02决策树由RossQuinlan于1986年提出,是一种基于树形结构的分类器。决策树的基本原理和思想是通过对样本特征的逐层划分,从而将样本划分成不同的类别。在决策树算法中,每个节点(根节点和子节点)代表一个属性,每个分支代表该属性的一个取值,每个叶子节点代表一个类别。随机森林算法介绍决策树概念02决策树的构建过程是一个递归过程,从根节点开始,通过不断地选择最优的划分属性,将样本递归地划分成若干子集,直到所有子集都属于同一类别或达到预设的停止条件为止。外貌特征:黑白相间,有黑眼圈食物特点:吃竹子大熊猫+=随机森林算法介绍Bagging方法02Bagging方法也被称为装袋法,是一种典型的并行集成算法,是由Breiman在1996年提出的一种集成学习方法,Bagging方法是最早的、也是当前最简单的集成方法之一。Bagging训练流程组合策略:回归任务:采用简单平均法分类任务:采用简单投票法(遵循少数服从多数的原则,将基学习器的投票结果作为强学习器的最终分类结果)随机森林算法介绍随机森林算法实现流程02随机森林算法是结合决策树和Bagging方法的一种集成方法,其主要思想是通过随机选择样本和特征的方式,构建多个决策树,然后将它们组合起来形成一个强分类器或回归器。不仅可以应用于分类任务中,也可以应用于回归任务中。具体来说,在构建每个决策树的过程中,随机森林算法会从训练集中随机选择一定数量的样本,同时也会从所有特征中随机选择一部分特征,然后使用这些样本和特征来构建决策树。这样可以避免过拟合,提高模型的泛化能力。随机森林算法介绍随机森林算法实现流程02随机森林模型结构图随机森林算法介绍随机森林算法实现流程0201能够有效处理数据噪声、异常值、缺失值和数据不平衡等问题,以及处理高维度和大规模数据集的能力,具有较好的泛化能力及灵活性优点02模型结构复杂、结果难以解释以及参数的设置和调优比较困难,需要较大的计算资源和存储空间、需要比较丰富的经验和技巧缺点感谢观看!第六章基于k均值聚类算法的信用卡客户划分目

录聚类的概念k均值聚类算法实现流程聚类数量选择方法:手肘法聚类任务评估指标01020304聚类的概念01聚类的概念聚类是一种无监督学习方法,将数据集中相似的数据点分组,并将分组后的数据点形成簇(cluster),簇代表一组相似的数据点,不同的簇之间的数据点差异较大。聚类可以帮助我们发现数据集中的隐藏规律和结构,进而进行数据的分类、降维和异常检测等任务。聚类是数据挖掘和机器学习领域中的一种重要技术,被广泛应用于商业、医疗、社交网络等领域。01聚类的概念01聚类分类学习类型无监督学习有监督学习标签依赖不需要已知的标签或类别信息来进行学习和预测需要已知的标签或类别信息来进行学习和预测学习目标将相似的数据聚到一起,成为一个类对现有的数据集以及所属标签进行学习,然后对未知数据进行预测,确认其所属分类核心逻辑不关注标签,只做相似性分组先学标签规律,再做未知数据分类预测k均值聚类算法实现流程02k均值聚类算法实现流程聚类算法:K-Means、层次聚类、密度聚类等;这些算法的原理和实现方法都不同,但它们的目标都是将数据点分组,形成簇。02k均值聚类算法也被称为K-Means算法,核心思想:假设把数据聚成K个簇(类别),每个簇都会有一个中心(也叫质心)。在开始进行聚类时,会随机从数据中选择K个数据点作为初始聚类中心,某个样本如果离第i个质心是距离最近的,那么这个样本就划分到第i个簇。k均值聚类算法实现流程02在随机初始化K个聚类中心时,需要从数据集中随机选择K个数据点并以此作为初始聚类中心。聚类中心不一定是数据集中的点,也可以是虚拟的点。第一步:随机初始化K个聚类中心对于每个数据点,需要计算它与每个聚类中心之间的距离(欧几里得距离或曼哈顿距离等距离度量方法),然后将数据点划分到距离最近的聚类中心所在的簇中。第二步:计算每个数据点到每个聚类中心的距离,并根据距离划分数据点k均值聚类算法实现流程02在重新计算每个簇的聚类中心时,可以采用两种方法:一种是将簇内所有数据点的均值作为新的聚类中心;另一种是将簇内距离聚类中心最近的数据点作为新的聚类中心。这个过程将会重复执行,直到聚类结束。第三步:重新计算每个簇的聚类中心在迭代优化的过程中,需要重复执行第二步~第三步,直到聚类中心不再改变,即达到稳定状态。最终,就可以得到K个簇,每个簇包含一些距离较近的数据点。第四步:确定最终聚类结果聚类数量选择方法:手肘法03聚类数量选择方法:手肘法手肘法(elbowmethod):在聚类数量不断增加的过程中,随着聚类数量的增加,SSE(误差平方和,即每个数据点与其所属簇的聚类中心之间的距离平方和)或WCSS(簇内平方和,即每个簇内数据点与该簇聚类中心之间距离平方和的总和)会逐渐减小,但随着聚类数量继续增加,SSE或WCSS下降的速度会减缓。使用手肘法选择聚类数量的关键是找到SSE或WCSS下降速度变缓的拐点,即手肘点。03聚类数量选择方法:手肘法例:图中在聚类个数为3时的拐点即为比较合适的聚类数量。03聚类任务评估指标04聚类任务评估指标聚类评估指标是用来衡量聚类算法性能和效果的工具。其中,轮廓系数和兰德系数是两个常用的评估指标。04轮廓系数衡量维度:轮廓系数是一种度量聚类结果紧密度和分离度的指标。计算逻辑:对于每个数据点,轮廓系数计算该点到所属簇内其他数据点的平均距离(即簇内距离)和该点到最近簇内其他簇的平均距离(即簇间距离),并将两者的差值除以两者中的最大值。评估标准:轮廓系数越接近1表示聚类效果越好,越接近0表示聚类效果越差。聚类任务评估指标聚类评估指标是用来衡量聚类算法性能和效果的工具。其中,轮廓系数和兰德系数是两个常用的评估指标。04兰德系数衡量维度:兰德系数是一种度量聚类结果与真实标签吻合程度的指标。计算逻辑:兰德系数基于数据点之间的相似性(或距离),将数据点分为不同的簇,并与真实标签进行比较。兰德系数计算所有数据点之间相同簇分配的比例和不同簇分配的比例,将其相加得到一个总体分数。评估标准:分数越高表示聚类结果与真实标签越吻合,分数越低表示聚类结果与真实标签越不吻合。通常情况下,兰德系数的取值范围为[-1,1],取值越接近1,表示聚类效果越好;取值越接近-1,表示聚类效果越差;取值接近0,表示聚类结果和真实标签之间的相似度较低。感谢观看!第七章基于逻辑回归的信用卡异常行为检测目

录逻辑回归算法定义逻辑回归算法定义K折交叉验证法010203逻辑回归算法定义01逻辑回归算法定义逻辑回归(logisticregression)算法也称作Logistic回归分析算法,是一种广义线性回归,虽然逻辑回归算法带着回归两个字,但它并不是一种回归算法,而是一种分类算法。逻辑回归算法是基于多元线性回归的一种算法,是一种线性分类器。01逻辑回归与线性回归具有相似之处:线性回归采用线性表达式来输出预测值;逻辑回归通过在线性回归的基础上添加非线性变换,输出离散值来解决分类问题。逻辑

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论