基于距离的孤立点检测算法及其在纳税行为分析中的应用_第1页
基于距离的孤立点检测算法及其在纳税行为分析中的应用_第2页
基于距离的孤立点检测算法及其在纳税行为分析中的应用_第3页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于距离的孤立点检测算法及其在纳税行为分析中的应用

0重建点检测算法孤立点是指数据集中不符合数据特征和一般模型的数据对象。这可能是由测量或执行错误造成的。许多挖掘算法可以最小化孤立点对搜索结果的影响,或在挖掘过程中排除孤立点。然而,有时孤立点是非常重要的信息。如果仅列出相邻的点,则可能会丢失重要的信息,也就是说,相邻的点本身是非常重要的。因此,孤立点检测是数据处理的一个重要方向,因为在某些应用中研究孤点的异常行为可以发现隐藏在数据集中的更有价值的知识。目前,检测孤立点的应用广泛用于许多领域。例如,欺诈检测和窃取信用卡的人的购买行为可能不同于普通的卡烟稀少的人,因此可以通过注意不同的操作变化来检测盗窃行为。此外,对于入侵检测、生态系统监控、公共卫生和医疗等领域也可以应用。孤立点检测有多种算法,目前常用的算法主要有基于统计、基于距离、基于密度、基于偏离、基于聚类、基于神经网络、面向时间序列以及高维数据孤立点检测等.本文在基于距离方法的基础上给出了基于距离和的算法,并将该算法应用于纳税行为分析.1基于距离和孤立点检测算法1.1设计参数p部分对象定义1在数据集S中,o是一个孤立点,仅当S中至少有p部分对象与o的距离大于d.换句话说,如果o在d范围内有不多于M个邻居,则o是一个带参数p和d的DB(p,d)孤立点.这里M=n(1-p),n为数据对象的个数.1.2美国法上不同度量方法的介绍在基于距离的孤立点定义中,一个关键的问题是对象间的距离如何定义.在数据集中,每个数据对象由多个属性值描述,属性的类型主要包括连续属性、分类属性、时间属性等,不同的属性类型有不同的量度方法.基于距离的检测算法中一般讨论的是连续类型数据的距离量度,其中最常用的距离是绝对距离和欧氏距离.绝对距离又称曼哈顿距离,其定义如下:dij=∑k=1m|xik−xjk|.(1)dij=∑k=1m|xik-xjk|.(1)其中m是数据对象的属性的个数,xij表示第i个对象第j个属性的值.而欧氏距离为:dij=∑k=1m(xik−xjk)2−−−−−−−−−−−−√(2)dij=∑k=1m(xik-xjk)2(2)至于使用哪种距离量度方法,要看具体的应用领域,而不同的量度方法可能会对结果产生影响.1.3基于devi的算法基于距离和的孤立点检测的思想是,首先计算数据集中对象两两之间的距离,然后累计每个对象与其他对象的距离,设M为用户期望的孤立点个数,则距离之和最大的M个对象即为孤立点.定义2xi和xj是数据集X中的两个对象,n为数据集的对象数,m为对象的维(属性)数,dij为xi和xj之间的距离,则X的距离矩阵R定义为R=⎡⎣⎢⎢⎢⎢d11d21⋮dn1d12d22⋮dn2⋯⋯⋮⋯d1nd2n⋮dnn⎤⎦⎥⎥⎥⎥.(3)R=[d11d12⋯d1nd21d22⋯d2n⋮⋮⋮⋮dn1dn2⋯dnn].(3)定义3xi是数据集中第i个数据对象,xi的偏离度Devi定义为Devi=∑j=1ndij(4)Devi=∑j=1ndij(4)即Devi为矩阵R中第i行的和.由定义1~3,不难看出,Devi越大,对象i与其他的对象距离越远,其为孤立点的可能性越大.若M为用户期望得到的孤立点个数,则偏离度最大的M个对象即为孤立点.为检测基于距离和的孤立点,算法将需要n2次的数据对象间的距离计算,当n很大时,这几乎变得不可能.为此,本文使用了基于随机抽样的近似计算.数据库和数据挖掘中大量使用了均匀抽样技术,即从N个对象中随机取出n个对象.为得到均匀的抽样结果,本文采用CURE聚类算法中使用的抽样算法,其基本思想是:先将数据集中前n条记录放到一个抽样数据集中,从第n+1条记录开始,做以下操作,设当前处理的是第t条记录,u是一个随机产生的数(u∈[0,t-1]),若u<n,则把抽样数据集中的第u条记录替换为数据集中第t条记录;若u≥n,则不进行替换操作.可以证明算法可以得到均匀的抽样结果.该算法如下:2该算法用于分析纳税行为2.1标准化的纳税人本实验所用数据为某市地税局2007年纳税数据,考虑到数据的实际情况,本实验按以下要求选取数据和对数据进行标准化:1)选取税率为0.08的税种.2)实缴税金大于100(xsjsj>1000).3)营业收入在1000~100000之间的纳税人.下面是对选取的数据进行标准化:营业收入:yyysr=yyysr/1000,则该值的取值范围为1<yyysr<100,精度为0.1.实缴税金:xsjsj=xsjsj/1000,则该值的范围为0<xsjsj<80,精度为0.1.经过标准化整理后的数据对象数目为5691条.2.2常税率计算是否可以得到的税收根据综合分析,我们选取的值为30,距离采用欧氏距离,进行了孤立点检测实验,挖掘出了30条异常数据即孤立点(限于篇幅不再全部列举).我们通过分析可以发现孤立点数据中存在三种典型的孤立点类别,分别是:1)孤立点数据的实缴税金金额远远大于按正常税率计算应该得到的税金,甚至大于营业收入,这种数据明显不合理,所以应该是真正的“噪声”,可能是由于输入错误导致的垃圾数据,对于这类孤立点,我们可以直接将其从数据源中清除,不必进行进一步的分析.例如表1中的数据.2)孤立点数据的实缴税金金额大于按正常税率计算应该得到的税金,这类孤立点可能是由于纳税人进行补缴以前漏交的税金的原因所致,这类数据也有可能是由于录入错误所致,所以我们要对这类数据进行进一步的研究与分析,发现数据异常的原因.此类数据如表2.3)孤立点数据的实缴税金金额小大于按正常税率计算应该得到的税金孤立点数据,这类数据对我们来说,是最重要的数据.产生这类数据的原因很有可能是由于纳税人偷税、漏税所致,所以对于此类数据,我们应该予以高度重视,进行详细地、深入地调查与分析,找出异常的原

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论