统计学中对不平衡数据的处理方法分析_第1页
统计学中对不平衡数据的处理方法分析_第2页
统计学中对不平衡数据的处理方法分析_第3页
统计学中对不平衡数据的处理方法分析_第4页
统计学中对不平衡数据的处理方法分析_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

目录

1引言....................................................4

1.1研究的背景和意义..............................................4

1.1.1研究背景................................................5

1.1.2研究意义..............................错误!未定义书签。

1.2国内外研究现状................................................1

1.2.1国内研究状况............................................1

L2.2国外研究状况.............................................2

1.2.3研究发展趋势...........................................2

1.3研究思路及方法..............................错误!未定义书签.

1.3.1研究思路................................................7

1.3.2研究方法................................................3

2不平衡数据的概述.......................................4

2.1相关概念界定...................................................4

2.1.1不平数据4

2.1.2数据挖掘.................................................4

2.1.3统计学..................................................4

2.2统计学与数据挖掘的关系.......................................4

3不平衡数据处理方法发展现状..............................5

3.1不平衡数据处理方法数据层面的发展现状..........................5

3.2不平衡数据处理方法算法层面的发展现状.........................7

3.3不平衡数据处理方法评价指标层面的发展现状....................12

4不平衡数据处理方法中存在的问题.........................16

4.1数据层面......................................................16

4.2算法层面.....................................................16

4.3评价指标层面.................................................16

5对策建议..................................................17

5.1训练集重构....................................................17

5.2分类方法的改进................................................17

5.3优化评估方法..................................................17

6结论......................................................19

参考文献.............................................................20

致谢..................................................................21

统计学中对不平衡数据的处理方法分析

摘要:统计学中的不平衡数据也称为数据偏斜,是指数据集中的某一类或多类样

本数量远大于其他类的样本数量,出现样本类别极不均衡的状况,严重影响模型

分类。模型分类准确度会因为不平衡数据而导致无法达到预期效果。机器学习过

程中往往不能有效地识别不平衡数据中的小类样本,容易导致准确度降低甚至失

效,因此,解决不平衡分类问题是机器学习的研究重点之一。本文对不平衡数据

的分类方法进行了研究,不仅从数据方面和算法方面的方法经行分析,还将从评

价指标方面进行分析,分别对目前存在的各种解决不平衡数据分类问题的方法进

行介绍及比较。

关键词:不平衡数据;数据集;数据偏斜;分类方法

Analysisofthetreatmentofunbalanced

datainStatistics

Absrtact:Unbalanceddatainstatistics,alsoknownasdataskew,referstoth

efactthatthenumberofsamplesofoneormorecategoriesinthedatase

tisfarlargerthanthatofothercategories,resultinginextremelyunbalance

dsamplecategories,whichseriouslyaffectsthemodelclassification.Theaccu

racyofmodelclassificationcannotachievetheexpectedresultsbecauseof

unbalanceddata.Intheprocessofmachinelearning,itisoftenunabletoeff

ectivelyidentifythesmallsamplesintheunbalanceddata,whichiseasytor

educetheaccuracyorevenfailure.Therefore,tosolvetheproblemofunbal

ancedclassificationisoneoftheresearchfocusesofmachinelearning.Inthi

spaper,theclassificationmethodsofunbalanceddataarestudied.Notonly

themethodsofdataandalgorithmareanalyzed,butalsotheevaluationind

exesareanalyzed.Theexistingmethodstosolvetheproblemofunbalanced

dataclassificationareintroducedandcompared.

Keywords:Unbalanceddata;Dateset;Dateskew;classificationmethod

1引言

1.1研究的背景和意义

1.1.1研究背景

怎么有效处理不平衡数据集是研究工作的重点,在平常生活中,数据类别不

平衡十分常见。数据的不平衡问题一般指数据中某些类别的样本占比例的大多数,

某些类别只有的样本只占较少或非常少的比例。通常这种情况中,普通的分类器

会倾向被大类样本所影响而忽略掉小类样本。机器学习模型时常常对小类样本的

识别率不能令人满意。举个例子,一个贷款公司的信用研究,其中借款逾期有

20人,而按时还款的人有1980,按照这份数据建立一个模型,并对模型进行了

内部验证,得到的结果正确率达到99%,是否说明了此模型的性能相当卓越?其

实不然,是因为1个贷款逾期情况都发现不了才出现的所谓99%的准确率。在这

个例子我们可以看出,这是由于这些算法在面对极不平衡的数据集时,仍然假设

各类数据分布平衡,从而以此得出数据总体分类准确率。数据集按照类别种类数

量,分类问题分为二类不平衡数据分类问题和多类不平衡数据分类问题.本文则

重点分析在现实生活中更为常见的二类不平衡数据分类问题。比如整个社会治安

的数据中,守法公民占极大部分,相比较的犯罪分子确是极少数的;又譬如吸烟

人群都知道吸烟的危害,但是真正意义上做到戒烟的又占极少数等等。

1.1.2研究意义

数据挖掘是指通过在庞大的数据量中得到所需要的有价值的信息。比如,快

递公司可以通过分析收件地址及快递员的派件路径等来给对设置营业点及安排

工作人数等等。总而言之,有效的数据挖掘能够提升企业的利润,也能够为企业

甄别欺骗诈骗等未知因素降低损失或规避风险,甚至能够帮助企业控制成本识别

潜在客户和预测市场态势。

1.2国内外研究现状

1.2.1国外研究状况

国外方面,在十七届人工智能国际会议中,国际人工智能学会对不平衡分类

问题进行了第一次讨论。会议指出当前已有的不平衡数据中所用到的评价指标所

存在的问题和缺点,并提出改良的方法。学者们在参加国际机器学习会议乂在

2003年继续讨论了关于不平衡分类问题,一致讨论出更完善的一种模型评价指

标:受试者工作特征曲线,这种评价指标对不平衡分类问题的评估具有显著的效

果。不仅如此,此次会议中,Drummod[l]提出欠采样方法比过采样方法更有效

的观点。Chawla⑵也比较了决策树结构、采样技术和概率估计对不平衡数据的影

响。Hulse和Estabrooks⑶⑷在采样技术对不平衡分类问题应用的研究。

1.2.2国内研究状况

早期,周志华⑸和刘胥影⑹的研究结果表明采样方法确实能对不平衡数据

集进行有效处理。后来,叶志飞⑺等人也研究了有关不平衡分类的问题。处理

不平衡数据的方法大致分为两类。一是在数据层面上,通过多种采样方法在数据

的预处理阶段平衡数据集来降低过程中偏斜类分布的影响。欧阳源遵⑻在2014

年时提出了SVM-IMSA,这是一种根据混合采样方法的非平衡数据集学习算法,

该算法的基分类算法为SVM,改进了随机欠采样法和SMOTF以处理数据不平衡

分类问题。翟璐[9]在2016年发表的论文中将SMOTE方法和随机欠采样方法结合

成一种新的混合采样方法,其研究的成果表明,相比较单采样方法,性能得到了

一定程度的提升。总而言之,不管是混合采样方法或是欠采样方法、过采样方法,

最终目的都是为了将不平衡数据集的类别分布变为平衡平衡。

第二类,在算法层面上,不断有更多的学者们尝试通过将集成学习算法和混合采

样方法结合以后再运用到不平衡分类问题中。Qian[10]等人在2014年时进行了

有关的研究,并通过不同的不平衡数据集进行了效果的检验。于2017年,Ren[ll]

等人改进了SMOTE过采样方法并提出了ASMOTE方法。Galar[12]等人再44组数

据集中运用了22种不平衡数据的处理方法,最后得到的结果为:RUSBoost.

UnderBagging和SMOTEBagging算法相对于其他算法更优秀,Galar等人总结了不

同模型在处理不平衡分类问题上的差异。

1.2.3研究发展趋势

对数据集中的数据偏斜问题的研究非常必要,近年来,机器学习和数据挖掘

的挑战之一就包括数据偏斜的问题,也就是不平衡数据分类问题。现在这种问题

普遍存在于欺诈检测、实时竞价、航空安全、信息安全、电子商务及文本分类等

众多领域。因为不平衡分类的问题十分重要也十分普遍,这就使得学术界的研究

热点之一就包括不平衡分类问题。

1.3研究思路及方法

1.3.1研究思路

第一部分为引言。讲数据不平衡研究背景、研究的意义。还有国内外学者对

数据不平衡研究现状。

第二部分为概念界定。

第三部分为现状。数据不平衡处理方法应用现状,各个领域方面进行描述。

第四部分为存在的问题。数据不平衡存在的问题与原因,通过表象的问题找

到问题存在的原因。

第五部分为对策建议。不平衡数据应用对策C包括重构数据集方面、改进分

类方法、优化评估方法。

第六部分为总结。

1.3.2研究方法

文献研究法。通过查阅各类文献,收集和整理与不平衡数据相关的相关理论

知识,了解当前不平衡数据在国内外有关研究的现状和重点,为不平衡数据研究

和分析做好理论依据。

描述性研究法。通过对实际案例中的一些现象、规律、理论进行叙述,

陈述和分析其中不平衡数据涉及到的三个层面:数据层面、算法层面和评

价指标层面,并对相关理论进行整理和归纳总结。

2不平衡数据概述

2.1相关概念界定

2.1.1不平衡数据

机器学习的首要目标当然还是准确率,但机器学习在为了得到最大的准确率

的同时,都是在基于假设数据平衡的理想状况的基础上。举个例子,在二类不平

衡数据分类问题中,大类样本和小类样本若出现50:1甚至1000:1时都为不平

数据。不平衡数据的学习即需要在分布不均匀的数据集中学习到有用的信息。

2.1.2数据挖掘

通常,数据挖掘就是通过关联规则、偏差检测、分类和预测、时序模式、聚

类分析等方式来实现的,对决策者提取数据集中有效的信息时提供帮助,发现数

据间存在的某种关联,并利用这些数据蕴含的规律而做出决策。数据挖掘的任务

按照目标可以分为聚类、关联规则分析、分类和回归。

2.1.3统计学

统计学是收集、分析、整理及描述数据的科学,通过这些手段来推测观察对

象的本质。统计学应用在众多领域,其中就包括不平衡数据的领域中。发现事物

的规律,进行预测、监督,以实现系统良性运行,在不平衡数据中有很大的意义。

2.2统计学与不平衡数据的关系

数据挖掘与统计学两者在面对不平衡数据时的任务基本一致:在庞大的数据

中寻找和探索模式或结构。数据挖掘是从数量极为庞大的数据中取得有效信息。

它是涉及识别工程、网络工程、人工智能及信息检索等的学科。统计学对此可以

解释为通过计算机对杂乱无序旦数量庞大的数据的自动探索性分析。然而统计分

析与数据挖掘还是存在非常大的差别,数据挖掘的目标是处理庞大无序的数据;

而统计学更加注重的是定量数据。

3不平衡数据处理方法发展现状

3.1不平衡数据处理方法数据层面发展现状

(1)欠采样法

欠采样法是通过剔除过多的大类样本来因为它降低了训练样本量,所以有助

于减少时间、存储开销。欠采样法的有个无法避免的缺点是就是抛弃了很多反例,

其中被删除的反例恰恰有隐含重要信息的可能性,这会导致平衡的模型产生偏差。

(2)过采样方法

与欠采样法相反,过采样方法实现数据平衡的手段则是以增加不平衡数据集

中的小类样本的数量。在过采样方法中最具代表性的时随机过采样方法(random

over-samplingmethod),即在处理不平衡数据时事先设置好预期能达到的大类

样本与小类样本数量的比例,然后开始随机复制小类样本直到大类样本与小类样

本达到平衡。过采样法对比于欠采样法,明显的优势就是不会丢失数据集中的有

效信息,但缺点就是简单的随机复制小类样本的数量也无法产生新的有效信息,

这也很可能导致模型过拟合而失去价值。与随机欠采样方法不同的是,会增加模

型训练的时间。针对随机过采样方法的缺点。

(3)SMOTE方法

合成少数类过采样技术即SynthpticMinorityOvprsampling,缩写为SMOTF,

这是一种基于随机过采样方法的改进方法。SMOTE的基本原理可以解释为在平

面直角坐标系表示为,在坐标系中找出小类样本及其临近样本,在这两点之'可的

的直线距离中随机产生新的样本点,以此来增加小类样本的数量,平衡不平衡数

据集。SMOTE法是通过统计学中的K最邻近算法来实现的,即KNN

(k-NearestNeightbor),最直观的含义即K个最邻近的邻居。如图1,

图(1)SMOTE算法原理

假设红色三角形为小类样本,蓝色圆形为大类样本,而方框中的红色三角形则为

SMOTE法展开的出发点m,那么图中的其他k个红色三角形都为这个初始点的

最邻近值,如图2选中初始点m及其随机一个最邻近值,在它们之间的直线距

离之间随机选中一点就是人工合成的新的样本点。不断的通过这种方式生成新样

本点以达到数据类别平衡就是SMOTE法。

图2-SM0TE算法原理

(4)混合采样方法

由于过采样法和欠采样法都各有优点和缺点,单一使用某种方法都有可能对

模型产生不利影响,比如模型过拟合,或丢失重要数据从而导致的模型产生偏差,

为了减小单一使用单一使用过采样法或欠采样法带来的不利影响,结合两种采样

方法同时使用有可能可以取得更好的效果。混合采样方法实质上为了达到增加数

据集中少数类样本同时减少多数类样本的目的,以此降低不平衡的程度。随着时

间推移,越来越多的采样方法被提出,混合采样方法越来越多组合方式,无论采

用什么样的组合,都是为了让数据集在不平衡的情况下更能呈现出让人满意的结

果。可以看出,无论是过采样方法或是欠采样方法,混合采样方法,它们最终目

的都为了使大类数据和小类数据变得更加平衡,减小不平衡数据集所造成的影响。

(5)集成学习算法

某种程度上,集成学习算法属于混合不平衡类别的一种分类方法,集成学习

算法是基于统计学习理论上的一种机器学习算法,是通过构建结合多个分类模型

器完成模型训练。面对平衡数据时,其基本思路就是将集成学习方法与处理不平

衡数据的方法相结合,直到分类模型达到能处理不平衡数据的需求。集成学习可

以用于分类问题集成,回归问题集成,特征选取集成,异常点检测集成等等,使

用集成学习方法能有效地提高分类模型的性能。

3.2不平衡数据处理方法算法层面发展现状

在数据挖掘领域发展的过程中,有很多其他领域学科的理论知汉在数据挖掘

中被应用。数据挖掘结合了多种技术,如信息检索、高性能计算机、可视化和统

计学方法等领域知识,正因为如此,数据挖掘算法种类越来越多,其最具代表性

的包括统计学方法、聚类、关联规则分析、分类和回归等。

(1)统计学方法

数据挖掘涉及的科学领域和技术很多,如统计技术。统计学研究数据的收集、

分析、解释和表示。数据挖掘与统计学具有天然联系。统计技术对数据集进行挖

掘的基本思路为,假定一个一个概率分布模型,比如二项分布、偏态分布或正态

分布,根据不同的模型来采取不同的方式开展数据挖掘工作。统计模型可以是数

据挖掘任务的结果,而数据挖掘任务也可以建立在统计模型之上。常用的统计学

方法有朴素贝叶斯分类方法、回归分析、方差分析等方法。朴素贝叶斯分类方法

基于贝叶斯定理,朴素贝叶斯分类算法的优势在于其有着坚实的数学基础,以及

稳定的分类效率。在用于大型数据库时具有较高的速度,朴素贝叶斯分类假定一

个属性对分类的影响独立于其它属性的值。朴素贝叶斯模型中所需估计的参数相

对较少,且对缺失数据不太敏感,算法也比较简单。在一定程度上,朴素贝叶斯

模型与其他分类方法相比具有更低的误差率。

统计学中的回归分析,即对所收集的数据进行分析,找出其中隐含的关联,

即因变量和有影响因素的自变量或回归变量,分析因变量与自变量之间相关的具

体形式。举个例子,身高与体重是否存在关联?现随机抽取10人,获得他们的

身高体重,身高单位(单位:cm)分别为159,174,181,178,166,183,176,

176,175,170,对应的体重(单位:kg)分别为49,55,74,71,55,71,63,

70,66,50,如图3所示,假设原假设H0:身高体重间没有相关性。

身高X体重y

15949

17455

18174

17871

16655

18371

17663

17670

17566

17050

图3-身高体重

其回归结果如图4所示,

回归结果

SIUJIARYOUTFIT

_____________®归一计_____________

MultipleR«.893102675

RSquare0.797632387]-I

AdjustedRSquare0.768722728

标准误差4.252598943

现三组9

方至分析

_________________________dfSSMSFSignificanceF

回归分析1498.9633712~498.963371227.590515290.00118277

残拉7126.592184418.08459777

总计8625.5555556

____________________Coefficient,标准混至tStatP-valueLouer95%Upper95%下限93.伏上限93.0%

Intercept___________-121.00601235.20758644-3.4369300550.010882403-204.2587248-37.75329928-204.2587248-37.75329928

XVariable1:.0606212420.2019205015.252667M50.001132770.5S31551291.538087S560.5831551291.538087356

图4.身高体重的回归结果

由此可以得出其中的关联:y=-121.006012+1.060621242,即身高x每在增加

1cm,体重则可能增加1.06kg,其中的rsquare与multipler展示了身高体重之

间的相关性,significanceF即为p值,l-p<a(0.05),表示为应拒绝原假设,

身高体重之间存在关联。为利用回归分析用数学模型来表现两者间的具体关系,

决策者可以根据这些关系以进行预测或指导决策。在数据挖掘中回归分析应用的

例子还很多,例如,回归分析可用来估计出降雨概率;可以预测出矿脉中埋藏的

矿藏数量;可以以明星代言来预测商品销售量。统计方法中的方差分析一可用于

检验回归直线模型的准确性和自变量对最终回归的影响,在数据挖掘过程中经常

使用到方差分析。

(2)机器学习方法

机器学习方法包括聚类、关联规则分析、分类和回归等方法。

聚类是指对没有类别进行分类时,依照样本近似度进行分类的方法。与分类

模型训练的差别在于,聚类模型可以通过算法未知类别的样本进行分类,在进行

聚类时,我们可以不关心甚至不知道样本的类别是什么,只需要实现样本中相似

的类别聚集。聚类是一种非监督学习的算法。

关联规则挖掘是数据挖掘中的一个很重要的工具,它是从数据背后发现事物

之间可能存在的关联或者联系。下面举一个例子,假如某个商店的老板希望对顾

客的购物习惯有更加深入的了解,如:“哪些商品可能会被同时购买于同一次消

费中?”也许她会发现购买了熟食的顾客大多同时都会在此次购物中对饮料进

行消费,这便可以得出其中蕴含的关联规则“熟食一饮料”,这条关联规贝J中,

熟食被称为规则的前项,饮料则称为后项°通过对熟食进行某些促销活动如买几

送一或打折,同时在能让顾客接受的范围内提高饮料的价格,在这条关联规则的

影响下,售出饮料时便有可能使得商店利润得到提升。由此可以得出,关联规则

分析的任务是寻找蕴含在庞大数据集中的某些潜在关联。

分类作为一种分析方法,常用于预测式数据挖掘。这种方法区别于聚类在于

需要对数据集中的样本进行人工标注类别和预先训练分类器。由此可知,分类的

过程包括训练和预测两个步骤,一是将样本数据进行预处理,即人工标注类别,

二是构造和训练一个分类函数,使得该分类模型能够按需求准确的将数据集中的

样本映射在各个类别中。

回归就是通过历史的数据以推测观察事物未来的趋势,把两个或以上的对象

以具体的函数形式表示出来,回归分析的作用包括检验其相关性或是否存在线性

关系及线性关系之间的拟合度等等。回归分析应用在很多领域如经济学、环境学、

心理学等等,其中在经济学中就可以用丁解籽.市场市场营销效果、品牌偏好和销

售额等等。

(3)Bagging算法

Bagging即套袋法,可译为自主整合法。Baggng算法的核心思路是以自助采

样获得训练集中的不同子集。自助采样是通过对原始数据集有放回地随机采样,

从而生成与原始数据集相同容量大小的一个新的样本集。Bagging属于最早的一

种集成学习算法,既最简单就可以实现,同时还拥有较好的效果的算法之一。

Bagging算法能够实现降低过拟合的程度,Bagging算法能够适应较强而复杂的模

型。Bagging算法的基本步骤是:

1)对数据集进行有放回地抽取样本。在进行n次有放回的抽取后,从中获得k

个数据集作为训练集。(n次抽取得到的所有数据集之间不交叉,相互独立)

2)每个训练集中都产生一个模型,进行了n轮,k个训练集产生了n个模型。

3)对分类问题:把步骤2所产生的k个模型采用投票的方式得到分类结果,得

到的所有分类结果具有相同的重要性;关于回归,则计算产生的模型的均值作为

结果。

(4)随机森林算法

随机森林作为一种十分常见的机器学习算法,优势在于随机森林算法可以处

理数量庞大的输入变数,面对多种资料时仍然能够产生高效的分类器,而且在数

据出现噪声时,甚至出现很大量的噪声,随机森林算法仍然能维持一定的准确度。

随机森林算法还可以用来进行分类和回归任务。为了解释什么是随机森林算法,

首先要解释其中的决策树,决策树一般在遇到问题时按照其特征一分为二,即选

取特征对数据集进行划分。对特征不断细化和深入,就如同树枝分叉,当分枝的

进行得越深入,就意味着所需要提的问题数也逐渐简化。当到了无法细分或问题

可以得到解决时,决策树的分枝便结束了。举个例子,现在提出问题:今天能不

能吃肉?首先肉的特征进行细分,肉好不好吃?好吃就进行下一步,不好吃就不

吃,第二步则是肉价今天贵不贵,便宜就下一步,贵就不吃,再下一步肉和鱼哪

个好?肉好就下一步,一直细分到无法细分时结束分枝。随机森林的字面意思就

可以理解为由很多决策树构成。随机森林的工作原理是从整个数据集中有放回的

抽取数据,由抽取得到的众多子数据集构成决策树,所有决策树构造完成时都输

出一个结果,最后对所有的输出结果进行投票,将得到高票数的预测目标作为随

机森林算法的预测结果。举个例子,A要决定在国庆节时去广州的哪一家餐厅。

A问B关于餐厅的一些问题,如价格、菜品、菜系、交通和停车问题等等。B基

于自己的评价,会给A一些经验,建议A可以去哪些餐厅。之后,A又问了很多

在广州生活过的同伴如CDEF等,提出和问题都不完全相同,各个同伴们也推荐

了自己去过的一些。最后A选择了推荐次数最多的餐厅,这就是典型的随机森林

算法。随机森林算法也有不可避免的缺点,比如决策树过多时,训练成本和时间

较局。

(5)Boosting

Boosting也称为增强学习或提升法,是一种重要的集成学习技术,Boosting

将分类器分类为两者,一种称为弱学习器,即分类效果与随机分类相差无几;与

之对比的称为强学习器,强学习器的分类效果可以接近准确结果。其思想是首先

赋予一个样本权重,一般初始时默认权重为均匀的,以这个样本训练一个弱学习

器对该样本进行分类,得到误差率以后,根据误差率改变权重,一般是误差大的

权重越小,所以要进行加权,然后再次训练,第一.次训练得到的分类器再次在误

差大的区域进行加权,多次训练以后最终得到的强分类器就是前面所有弱分类器

对误差加权训练得到的结果。

(6)AdaBoost

是英文"AdaptiveBoosting"(自适应增强)的缩写,是Boosting的改进方法,

Boosting在训练过程中无法回避两个问题,一是如何调整每轮训练中的样本权重,

二是如何把所有得出的弱分类器组合成一个强分类器。Adaboost就解决了这两

个问题,一是提高前一轮训练中样本误差的权重,降低样本识别正确的权重,这

样可以使得下一轮的训练中,弱分类器能够更容易识别到错误的样本;二是加大

误差率较小的分类器在投票中的权重,降低误差率大的分类器的权重。

3.3不平衡数据处理方法评价指标层面发展现状

二类不平衡数据分类问题中,对于分类模型而言,对数据集中的样本分类结

果只有四种如图5所示:

结果应该为负例而实际分类模型也判断为负例,这种情况称为真阳性(True

Positive,TP),是对样本预测正确的结果:

结果应该为负例而实际分类模型却判断为正例,这种情况称为假阴性(False

Negative,FN),是对样本预测错误的结果;

结果应该为正例而实际上分类器判断也判断为正例,这种情况称为真男性

(TrueNegative,TN),是对样本预测正确的结果;

结果应该为正例而分类模型却判断为负例,这种情况称为假阳性(False

Positive,FP)是对样本预测错误的结果。

n=100PredictedNo:PredictedYes:

ActualNo

5010

60

ActualYes

535

40

图5-评价指标混淆矩阵

(1)准确率

准确率(Accuracy,Acc)也称为识别率,表示模型预测结果的准确度,却预

测正确的样本数除以总样本数:

Acc=(TP+TN)/(TP+TN+FN+FN)

准确率用于评价模型对样本的正确率,即真阴性和真阳性占在整体分类的占

比。虽然准确率反映了分类模型对总样本的判别效果,但有时对不平衡数据的判

别没有意义。比如,收集的电话自动拦截功能对骚扰电话的判断。假设一个月内

接到200个电话而其中包含10个骚扰电话,如果模型认为所有电话都不是骚扰

电话,那么准确率将高达95%。这个高达95%的拦截准确率确实基于一个骚扰电

话也无法拦截的情况下实现的。由此看来,分类模型的评价指标需要体现出分类

器在不平衡数据集中对小类样本的识别能力。

(2)精确率

精确率(Precision)也叫查准率,用于评价真阳性样本的分类准确率,表示被

预测为正样本的样本中有多少是真的正样本。

Precision二TP/(TP+FP)

(3)召回率

召回率(Recall,Rec)又称查全率,表示分类正确的正样本占总的分类正确

样本的比例:

Recall=TP/(TP+FN)

召回率体现了分类模型对正类样本的识别能力,召回率越高,说明模型对正

类样本的识别能力越强。举一个召回率的应用场景,以贷款逾期率为例,对比信

用良好的客户,贷款公司更在意发生贷款逾期的客户,因此不希望漏掉所有发生

贷款逾期的客户。由于过分把发生贷款逾期的客户当成信用良好的客户,在往后

的经营也许产生的违约成本可能远超过信用良好的客户偿还的借贷利息金额,造

成严重偿失。召回率越高,则代表有越高的概率预测预测到实际发生贷款逾期的

客户。召回率和精确率通常二者不可兼得,类似于跷跷板的两头。实际运用中通

常会根据研究目的确认是召回率优先(宁可错杀不可放过)、还是精确率优先(绝

对不能认错)。

(4)F值

F值即Fl-score,介于0与1之间,是查准率和查全率的调和平均数:

Fl=(2*recall*precision)/(recall+precision)

一般情况下,F值越大,说明分类模型越稳健。

(5)ROC曲线全称为receiveroperatingcharacteristiccurve,即受试者工作特征

曲线,ROC曲线表示为曲线上的各点在同一刺激下得到不同的判定结果,从而计

算出一系列敏感性和特异性,以假正例率FalsePositiveRate(FPR)为横坐标、

以真正例率TruePositiveRate(TPR)作为纵坐标绘制成曲线,

ROC曲线的横轴是假正例率(FPR),公式为:

FRR=FP/(FP+TN)

纵轴是真正例率(TPR)即召回率Rec,公式为:

TPR=TP/(TP+FN)

AUC(AreaunderCurve):可以理解为Roc曲线卜.与坐标轴围起来的面积,介

于0.1和1之间,一般情况下roc曲线都围绕y=x这条直线,所以通常情况下会

处于0.5至1之间。AUC值越大,表示当前分类算法越有可能将正样本排在负样

本前面,从而能够更好地分类。通常情况下的AUC值判别标准为0.5-07效果

不理想,处于0.7-0.85时效果才能达到一般水平,介于0.85-0.95时表示效果很

好,到达0.9-1表示效果优越,但一般很难实现。如图6所示,ROC曲线的AUC

值已经接近1了,此时则表示为模型的性能十分优越。

Na

SE

dO

H

图6-ROC曲线

(6)PR曲线就是以查准率precision和查全率recall两个变量为坐标的图,如图

7所示。查准率和查全率都反映出模型在不平衡数据中小类样本分类的效果。PR

曲线来评价不平衡分类问题,PR曲线以查准率为纵坐标,查全率为横坐标。PR

曲线与ROC曲线不同,左下角面积越大来表示模型分类效果越好.

10

图7-PR曲线

两种曲线对评价模型的区别在于RP曲线对正例样本更敏感,若出现正例样

本极少而负样本占比多数的比例失衡时,PR曲线的评价效果更有效。当决策者

更加注重对假阳性的测量而不是假阴性时,也应该用P-R曲线去评价分类模型。

4数据不平衡处理方法中存在的问题

4.1数据层面

不平衡数据集中的数据层面的两种主流处理方法,过采样法和欠采样法,这

两种采样方法虽然是仍然是高效的方法,但都各自存在缺陷,过采样随机复制小

类样本,这些小类样本本身只是被重复的复制出来,实际上并没有产生新的样本

特征,有可能导致模型过拟合;而欠采样法的随机删除大类样本使类别达到平衡

又有可能导致重要的信息被剔除。

4.2算法层面

在算法层面,才面对庞大的不平衡数据集时,分类算法分类效率不能得到保

证,大多分类算法比较复杂,训练分类器时会产生较大的成本,且数据集出现噪

声或数据丢失时会对分类器产生较大影响。如决策树,在出现缺失数据时处理过

程较为困难,且训练成本比较高昂。

4.3评价指标层面

在模型的评价指标方面,传统的评价指标比如准确率的效果就比较不好,无

法或不够客观的对模型的效果进行评价,而查全率和查准率又显得不够直观。

5对策建议

5.1数据层面

在对不平衡数据进行处理时,最常用也最容易实现的两种方法就是过采样法

和欠采样法:,即对不平衡数据集中的小类样本进行复制,以及对不平衡数据集

中的大类样本进行删除。无论是欠采样法或是过采样法,都是为了使数据集趋于

平衡状态。针对过采样法,可以使用SMOTE法来增加小类样本,SMOTE法是在

小类样本及其邻近点直线之间随机生成新的小类样本,这种方法很好的规避了生

成重复样本导致过拟合的情况;基于欠采样法的缺点,我们可以改变统计学中一

些常用的抽样方法来降低使用欠采样法带来的不利影响,非随机抽样也称为判断

抽样,我们可以通过自己的主观判断来进行对数据的预处理,例如在不平衡数据

中,我们可以将数据集的大类样本认为分为两类,首先挑选出一类明显含有重要

信息或有效信息的数据,而剩下的第二类则可以标记被不含核心内容的数据,加

以区分后,只在第一类大类样本中进行删减数据,这么做可以有效保留机器学习

所需的大部分有效样本数据不会丢失。我们还可以使用结合两种采样方式同时进

行对不平衡数据集进行处理,混合采样可以有效的降低两种采样方法带来的不利

影响。

5.2算法层面

统计学中的朴素贝叶斯分类法很好的解决了上述问题,朴素贝叶斯分类法起

源于古典的数学理论,在对不平衡数据的分类中有非常高的稳定性,对于大量的

数据进行处理时,朴素贝叶斯分类法可以将一整个数据集分批增量的训练,处理

多分类任务。朴素贝叶斯分类法最大的优势在于其对数据缺失不太敏感,即使出

现数据缺失时,仍能保持较好的性能。逻辑回归是在分类的过程中使用的,计算

量小且计算速度快,,而线性回归在数据挖掘中回归过程使用有十分大的优势,

不仅实现简单,而且容易计算。

5.3评价指标层面

常用的评估方法,例如查准率、查全率和F1测试值,在面对不平衡数据时

不能做出准确的评估。若使用ROC曲线作为评价指标,则能够非常直观的观察

模型分类效果,ROC曲线可准确反映某分析方法特异性和敏感性的关系。ROC曲

线注重模型整体的效果,若出现正例与负例失衡时,可以使用PR曲线,与ROC

曲线不同,ROC曲线的计算方式使用的假正率与查全率,而PR曲线使用查准率

与查全率表示PR曲线的两个指标都聚焦于正例,因此在正例过少而出现的失衡

时,PR曲线具有对模型更好的评价效果。

6结论

在数据挖掘和机器学习所应用的许多领域之中,普遍存在都存在数据不平衡

问题。比如,在用评级、故障诊断、异常检测、人脸识别、医学诊断、电子邮件

等应用中,都会不可避免地遇到数据类别不平衡问题,不平衡数据存在工作中的

方方面面,计对不平衡数据的处理方法也不断更新和改进,在面对数据层面、算

法层面和评价指标层面,针对其中的难点,本文阐述了其中的处理方法,而统计

学在其中的运用也起到了很大的作用,在未来,统计学方法在不平衡数据的处理

中也会有更多更高效的技术。通过在不平衡数据的处理方法中结合统计学知识,

可以非常有效的提升各类采样法的效果,而在算法层面也可以优化朴素贝叶斯分

类法达到十分好的效果,提高分类效果的同时也有效的降低了训练成本。

参考文献:

[1]DrummondC,HolteRC.C4.5,ClassImbalance,andCostSensitivity:Why

Under-SamplingbeatsOvcrSampling[J].ProceedingsoftheICMLWorkshoponLearning

fromImbakmcedDatasetsII,2003:1~8.

[2]ChawlaNV.C4.5ancimba

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论