付费下载
下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
函数数据的研究与应用
一、函数数据分析的发展在当前的数据分析和过程中,检测到的数据是截面数据或块数据,但在分析过程中,会发现这些数据在每个时间点都有值。如果值时间太长,这些数据点将显示出数据空间的函数特征。时间点取得越密集,数据的函数性特征就越明显,如股票指数。此时,用一些传统的数据分析方法对这样的数据进行分析,并不能取得很好的效果,相反,如果把这些数据以函数数据的形式进行分析,会取得很好的结果。函数数据(FunctionalData,FD)的概念,最早见于加拿大统计学家J.O.Ramsay于1982年发表的论文WhentheDataareFunctions,此后,J.O.Ramsay和C.J.Dalzell于1991年发表的论文SomeToolsforFunctionalDataAnalysis(withDiscussion),正式地提出了函数数据分析(FunctionalDataAnalysis,FDA)的概念。此外,J.O.Ramsay和B.W.Silverman于1997年出版了FunctionalDataAnalysis,书中全面阐述了函数数据的基本特征及其统计分析的方法、思想,极大地推动了函数数据分析这一领域的发展;后来,J.O.Ramsay和B.W.Silverman于2002年出版了AppliedFunctionalDataAnalysis:MethodsandCaseStudies,书中对于函数数据进行了实证领域的应用,开拓了函数数据分析在实际中的应用。但是,从目前的情况看来,函数数据分析还是一个新生事物,其研究尚处在一个起步阶段,国内对此方面的研究基本还是一片空白,目前可查的文献仅有严明义的《函数性数据的统计分析:思想、方法和应用》,严明义《生活质量的综合评价:基于数据函数性特征的方法》。关于函数数据聚类分类问题国外许多学者进行了研究,例如WenceslaoGonzálezManteiga等详细分析了函数数据的统计方法问题,包括点估计、因子分析及函数数据曲线分类问题;JuanAntonioCuesta-Albertos等提出了一种均匀修正的函数数据K均值聚类方法,并在实证分析中得到了良好的结果,具有很强的鲁棒性;SophieDabo-Niang等分析了一种基于函数模型比较结果的函数数据层次聚类方法,并将其应用于雷达声波数据的聚类分析中,取得很好的效果;M.Escabias等提出了一种基于部分最小平方(PLS)的logit回归模型,并将其运用于多元函数数据的分类问题中。着眼于函数数据分析在包括经济领域等各个领域的广阔的应用前景,本文也从聚类分析方面对函数数据的分析进行探讨,提出了一种全新的函数数据聚类分析方法。二、函数数据的基本特征(一)坐标体系的构成函数数据,顾名思义,数据是以函数的形式出现的,其最大的特征就是函数性。它具有一般函数所具有的所有特征,可以对其进行函数分析。在坐标体系中,每一个样本的数据都表征为一条函数图像,可能光滑,也可能不光滑。样本在每一个属性上的取值都是关于某个自变量的一个函数,也就是说,样本在属性上的取值不再像传统的多元统计分析中处理的数据都是样本在属性上的离散取值,而表征为一个带有过程性的数据。例如,某一地区的降雨量数据,随着时间点设置的越细,数据也变得越来越稠密,在坐标系中就表示为一条关于时间t的函数。(二)构成函数的定义面板数据是在时间序列上取多个截面,然后在这些截面上每个样本分别对每个属性进行取值,即对于每一个属性来说,样本是在有限个时间点上进行取值,取得的数据是离散型数据;而函数数据是样本在时间轴上的每一个点都对属性进行取值,任意一个样本在属性上的取值都是关于时间t的函数,它是一个连续型数据,具有过程性。可以说,函数数据是面板数据连续化后的结果。(三)离散数据的平滑通常来说,人们无法直接获得函数数据,所能获得的只是观测到一个个的离散样本点,因此,在进行函数数据分析之前,首要的工作是将观测到的一个个离散的样本点进行函数拟合,从而获得函数型数据。常用的拟合方法是平滑法(smoothing)和插值法(interpolation)。如果观测到的离散值没有观测误差,是精确值,那么拟合的过程就叫做插值,如果观测到的离散值具有观测误差,且需要消除这些观测误差,那么拟合的过程就叫做平滑。常用的平滑方法有:线性平滑法、基函数平滑法、核函数平滑法。利用这两种方法拟合后的函数表达式是连续的。通常来说,人们所获得的观测值大多是有观测误差的,因此在将离散数据转化为函数形式时,需要对数据进行光滑处理,常用基函数的方法来处理。常用的基函数有傅立叶基(Fourierbasis)、B-样条基(B-splinebasis)、多项式基(Polynomialbasis)、小波基(Waveletbases)和伯恩斯坦基(Bernstein)等等。三、基于函数的区间聚类方法在传统的多元统计分析理论中,聚类分析的基本思想是基于比较样本点在数据空间中的疏密程度进行的。常用的聚类方法的核心都是通过计算出样品之间的距离来进行聚类的。对于两个二维的函数数据样本点i和j,它们之间的欧拉距离可以定义为:Dij=(xi(t)-xj(t))2+(yi(t)-yj(t))2其中样本i的数据取值为(xi(t),yi(t)),样本j的数据取值为(xj(t),yj(t))。从上面这个距离表达式,可以发现,由于聚类的数据是函数数据,使得两个样品之间的距离也是一个关于自变量t的函数,它的大小将随着t的变化而变化,是动态的,这就使得我们无法准确地判断样品间距的大小,给聚类带来了极大的困难。可以说,因为函数数据特有的函数性,使得传统的聚类方法在分析函数数据时不再有效,也很难获得很好的聚类结果。因此,针对函数数据的出现,有必要改变传统聚类方法的着眼点,充分利用函数数据特有的性质,提出一种新的适合函数数据的聚类分析方法。基于上述问题的存在,以及考虑到函数数据强烈的函数特征,本文提出了一种基于函数特征分析的函数数据的区间聚类方法。该方法通过分析数据的函数特征,对数据进行求导,从而将函数数据进行区间划分,然后再在每一个划分好的区间上,对样品进行导数分析,将具有相同函数特征的数据区间聚成一类,从而达到聚类的目的。基本思想如下所示:(以下说明均以一维数据为例)(一)函数的单调性以及聚类分析的方法对于一个拟合好的函数数据,就可以进行函数特征分析,求解其一阶导数和二阶导数,从而确定出数据图像的极值点和拐点,并利用极值点和拐点将函数数据进行区间划分,这样就保证了每一个划分好的区间都是单调的。由于一阶导数表示了数据的变化速度的大小,因此,可以根据数据变化速度的大小来进行聚类,比如,把数据值不断增加的区间聚成一类,而把数据值不断减小的区间聚成一类,转化为函数语言就是,根据函数的单调性进行聚类分析,把单调增加的区间聚为一类,把单调减少的区间聚为一类。进一步地,如果根据一阶导数得到的聚类个数太少,对区间的划分过粗,可以在已经聚类好的单调区间,求出函数的二阶导数,也就是数据值变化的加速度,可以根据加速度进一步地对已经聚在一起的单调区间内的数据进行划分聚类,比如可以把加速度大于0的数据区间聚为一类,把加速度小于0的数据区间聚为一类。(二)区间划分的基本过程在多个样品的情况下,每个样品数据都是一个关于自变量t的函数,其区间聚类的方法是在单个样品的区间聚类基础上产生的。但是,这里将数据进行区间划分的方法与单个样品的区间划分方法有所区别,具体方法是:首先利用求解导数得到每个样本各自的区间划分临界点,然后将所有样品单独进行区间划分的临界点按从小到大的顺序排列起来,利用排列好的临界点依次将自变量的定义域进行区间划分,这样就相当于在全局上对数据进行区间划分,可以保证每一个区间内的样品数据都是单调的,再利用数据的变化速度即函数单调性在每一个区间上对样品进行聚类。当样品数目较多时,仅仅根据一阶导数的特征得到的区间聚类结果中的每一个类中的样品个数可能会比较多,那么,进一步地,对于每一个区间,可以求出每一个函数数据的二阶导数,根据数据变化的加速度在每一个区间对样品进行更细地聚类,这样就可以得到每一个区间内的样品数据的聚类结果。四、数据处理与聚类分析为了更加清晰地说明上述方法的基本思想,这里选择了中国中部六省1980~2005年间的就业人口的数据来进行分析,数据如表1所示。因为所获得的数据是离散的,所以首先需要将离散化数据转化为函数形式。由于统计数据和实际具有一定的误差,因此本文采用基函数光滑法来进行数据修匀和拟合,将数据中的观测误差尽可能地消除掉,并且通过控制基函数的个数来使得拟合后的函数尽可能地光滑,减小波动性。本文选择多项式基函数拟合的方法来对数据进行拟合,利用Origin软件编写程序和分析,得到如下数据拟合图,如图1所示。接着,对这些拟合后的函数进行函数特征分析,由于这里样本数仅仅有6个,因此,在进行函数特征分析时只需进行一阶导数即单调性分析。利用Origin软件进行分析,可以求它们的一阶导数,得到它们各自的极值点和拐点,从而确定函数数据的划分区间。具体结果如表2所示。根据如上的函数特征分析结果,可以得到每一个函数的区间划分临界点,将这些临界点按从小到大的顺序依次排列起来,利用这些排序后的临界点对六个函数进行区间划分,得到的划分区间为:[1980,1995)、[1995,1996.3)、[1996.3,2001.1)、[2001.1,2002.5)和[2002.5,2005]。这样,就可以分别在五个区间中根据一阶导数特征对样品进行聚类,得到的结果如表3所示。这样,通过对离散数据的拟合得到样品数据的函数表达式,再经过对函数表达式的函数特征分析,就得到了不同的区间上样品聚类的结果。从整体上来看,聚类结果较好地反映了实际问题。由于中部六省具有相似的社会发展背景,经济状况都处于全国的中游水平,这些宏观背景必然决定了它们在不同年份的就业人口具有很强大的相似性,这就导致每一区间上得到的聚类个数较少。此外,从整个函数图像上看,虽然各个省的就业人员数目在一些年份是减少的,但总的趋势是不断增加的,一方面是人口增加的结果,另一方面也是省域经济的快速发展,就业岗位和机会大大增加的结果。五、结论及问题的提出函数数据作为目前数据分析中出现的一种新型数据,具有很强的实际分析意义和很好的实用性。在实际生活中,有很多函数型数据,比如股价指数、每一年的降雨量等等。可以说,函数数据极大地充实了数据分析这一领域,而函数数据分析这一课题的出现对于更好地分析和解决实际问题提供了更加有力的工具。本文仅从聚类分析这一个角度探讨了函数数据的聚类分析问题。由于函数数据的特有特征,无法按照传统的方法对其进行聚类,因此,本文在分析函数数据时改变了传统聚类方法的着眼点,通过深入分析函数数据的函数特征,在求解导数的基础上提出了一种基于导数分析的函数数据区间聚类方法,并且根据函数数据的性质,区别了单个样品的聚类和多个样品的聚类。同时,本文利用中部
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年江苏省高中物理上册第6章同步练习题题库试卷
- 传统康复方法测试题及答案分享
- 2025-2026学年山东省临沂市平邑县数学三下期末预测试题含答案
- 2026中幼林抚育自查报告(3篇)
- Java岗面试题及标准答案分享
- 收样员考核试题及参考答案
- 下一年小升初各科试题及答案解析
- 高中阶段烯烃炔烃练习题及参考答案
- 封装与测试练习题及答案呈现
- 护理经络穴位测试题与答案
- 江苏省徐州市2026年重点学校高一入学语文分班考试试题及答案
- 八上数学必背公式
- 2025长沙一中高一入学语文分班考试真题含答案
- 文物建筑勘查设计取费标准(2026现行完整版|官方试行+地方实操)
- 新版2026年高考物理(广东卷)真题详细解读及评析
- 2025年公共卫生监督执法技能竞赛(学校与生活饮用水卫生监督)备考题库含答案大庆
- 2026年江苏省初级注册安全工程师考试真题及答案
- 石油化工仪表自动化工程师考试试卷及答案
- 养老院财务管理内控制度
- GB/T 47319-2026公众气象灾害防御行为指南雷电
- 安装安全应急预案(3篇)
评论
0/150
提交评论