版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于股指期货时间序列数据的预测原理和结构概述基于股指期货时间序列数据的预测是综合集成预测模型的一部分,这部分的预测结果为最后非线性集成的输入变量之一。金融数据的预测都是从历史数据开始,股指期货也不例外。通过对股指期货历史时间序列数据进行分析预测,可以得到基于历史规律的预测结果,这也是部分以往量化交易预测研究的方向,认为“市场能够包含一切信息”,所以从期指数据本身出发进行预测并构建交易策略。本文对于以往的金融数据预测方法分析之后,认为采取分解-聚类的方法进行预测能够得到更好的预测结果。基于时间序列数据的预测模型基本原理基于时间序列数据进行预估模型构建就是通过对历史时间序列数据的拟合来预估其价格的未来变动,而金融类时间序列又是充满噪声的、混沌的且非线性非稳定性,其噪声指的是“历史并不总是重演”,那些没有被获知的消息就组成投资者所认为的噪声序列,混沌则指的是其时间序列在短时间内看是不确定变化的,长期看是确定进行的[20]。随着时间的迁移,金融类时间序列数据的统计分类排布情况也在不断变化,因而具有非线性非稳定性[20]。所以为了能够更好的对其时间序列数据进行特征提取,本文可以理解这一特征提取过程为信号分解,因此用信号处理的办法对历史的股指期货数据进行多维度的拆分,将时间序列中的频率波动高和频率波动低的时间序列分解出来,使得每一个时间序列分量都具有其规律性和线性特征,便于后续的预测。但是原始数据在不断分解的过程中,会形成动态的时间序列,从而引发“维度灾难”问题,为了解决这个情况,本文使用降维方法对原来分解出的高纬度解构数据进行维度降低,这其实就是一个特征提取的过程,即抽取部分可以涵盖大多数原始数据信息的指标,并且指标之间不存在相关性。数据处理之后开始思考如何进行预测,基于距离的聚类是对时间序列进行模式识别最常用的方法,因此通过类别聚集将金融数据集划分为多个类别,可以有助于本文更好的拟合其变化规律和变化形式。所以针对以上分析,本文采用滑动窗口技术来截取金融数据的历史数据集,再将期指数据进行经验模态分解,和主成分分析降维来提取特征,因此这前面的部分都是从原始数据中提取输入特征,前后顺序为动态取数、经验模态分解和降低维度,是一种非线性特征提取过程,提取后的输入特征将输入集成自适应仿射传播(AAP)聚类算法,将所有的数据都看作是聚类中心,通过一种自适应自动取调节结构参数,并且在迭代中不断收敛,获得最优聚类中心和聚类集。获得聚类中心和聚集类之后,则可以使用NKNN即嵌套式回归预测,将测试点先分类,再与类内数据进行相似计算,得到最终预测结果。基于时间序列数据的预测模型基本结构FtsEMD-PCA-AAP-NKNN模型以股指的时间序列为输入数据,其主要处理流程如图所示,包括利用EMD分解序列,本征模态函数及趋势项的主成分分析、预测建模三个处理阶段,最终获得高精度的股指期货预测值。图STYLEREF1\s2SEQ图\*ARABIC\s11FtsEMD-PCA-AAP-NKNN模型FtsEMD-PCA-AAP-NKNN模型在预测过程中,首先引入期指数据作为EMD的分解分量,因而分解得到的预测时间序列数据IMF可以包含长期数据信息也包含短期数据信息,以对长短期时间序列数据的预测建模,来解决原始时间序列预测中的非平稳非线性无法被预测的难题。当然,EMD存在一定问题,随着时间推移新数据不断进入,最后部分EMD分解的结果是一直在变化的,也是不稳定的,会影响时间序列数据的鲁棒性和预测精度,因此本章采用滑动窗口技术截取其时间序列数据,再输入到经验模态分解模型中进行不同频率数据提取。接下来采用PCA对于量进行降维,由于采用滑动窗口技术截取数据,形成动态的时间序列,随着时间窗口的移动,数据量会越来越大,从而出现“维度灾难”问题,本章通过对多维度数据进行维度降低,来减少信息冗余对数据分析带来的影响。因而在预测输入之前,使用主成分分析PCA来降低高维度的分解数据,且分成了彼此不相关的主成分作为特征输入到预测模型中。预测模型输入通过上述方式处理之后,则可以使用聚类的方法进行回归预测。本章采用的是改进的聚类预测方法,即先通过集成自适应仿射传播(AAP)聚类算法,将所有的数据都看作是聚类中心,通过一种自适应自动取调节结构参数,并且在迭代中不断收敛,获得最优聚类中心和聚类集。获得聚类中心和聚集类之后,则可以使用NKNN即嵌套式回归预测,将测试点先分类,再与类内数据进行相似计算,得到最终预测结果。 通过这一流程首先处理了金融时间序列数据预测过程中的非线性和非平稳性问题,再通过改进的聚类回归预测,得到预测结果。在后续的实证过程中,为了防止过拟合,使用10折交叉检验的方式进行测试,以获取更具说明性的模型。这一流程以及输入数据总体上解决了期指市场时间序列数据非线性非平稳性特点。基于时间序列数据的预测模型算法FtsEMD分解经验模态分解(empiricalmodedecomposition,EMD)是由美国国家宇航局的华裔科学家Nordene.Huang博士于1998年提出的一种新的处理非平稳信号的方法[67]。为了说明EMD算法在分解处理时间序列数据上的优越性,本文对EMD分解、傅里叶变换和小波分析进行对比,如表2-1所示。傅里叶变换和小波分析的基础都是基函数,小波则引入了移动窗口,EMD则是在非线性非平稳性的时间序列数据上的分解具有明显的优越性[67]。表STYLEREF1\s2SEQ表\*ARABIC\s11EMD分解、傅里叶变换和小波分析的对比EMD分解傅里叶变换小波分析基础适应性基函数基函数频率局部差值全局卷积区域卷积特征提取是否离散序列:否连续序列:是信号特征非线性非平稳线性平稳线性、非平稳经验模态分解(EMD)方法的是通过特征时间尺度来识别信号中所内含的所有振动模态(IntrinsicOscillatoryMode)[67]。为了从原始信号中分解出内模函数,经验模态分解方法,过程如下:图STYLEREF1\s2SEQ图\*ARABIC\s12EMD分解过程流程图这样,经过EMD方法就将初始数据x(t)分解成为IMF序列以及剩余随机波动项的线性加和:x(t)=i=0NCi(t)+rn(t) (STYLEREF1\s2SEQ(\*ARABIC\s1但是EMD分解本身存在一定缺陷,随着时间推移新数据不断进入,最右端分解的结果是不断更新的,也是不稳定的,会影响时间序列数据的鲁棒性和预测精度,因此本章采用滑动窗口技术截取历史时间序列数据,因而整个分解过程即为FtsEMD。滑动窗口算法在一个特定大小的字符串或数组上进行操作,而不在整个字符串和数组上操作,这样就降低了问题的复杂度,从而也达到降低了循环的嵌套深度。滑动:说明这个窗口是移动的,也就是移动是按照一定方向来的。窗口:窗口大小并不是固定的,可以不断扩容直到满足一定的条件;也可以不断缩小,直到找到一个满足条件的最小窗口;当然也可以是固定大小。如图2-3所示,设定滑动窗口(window)大小为3,当滑动窗口每次划过数组时,计算当前滑动窗口中元素的和,得到结果res。本章使用滑动窗口对金融时间序列数据提取的时候,框架如下:第一步:设定窗口宽度w,并获取数据流(样本点,样本进入跨动窗口的时间);第二步:将窗口内的数据保存在一个变量中,并不断向右滑动来保存当前窗口的值;第三步:当窗口滑动到最右端时终止滑动[59]。图STYLEREF1\s2SEQ图\*ARABIC\s13滑动时间窗示例主成分分析降维本章采用滑动窗口技术截取历史时间序列,形成动态变化的数据,随着时间窗口的向右变动,数据量也会随之增加,进而引发“维度灾难”,为了躲开“维度灾难”,本章将多维度的数据进行维度降低,减少信息冗余对数据分析带来的影响。因此本章在这里采用主成分分析来降低前面所分解出的时间序列数据的数据维度,并将PCA降维输出的特征作为预测模型的输入。PCA是1901年由卡尔皮尔逊发明的,作为力学中主轴定理的类比;后来被独立开发,并于20世纪30年代由哈罗德霍特林命名。主成分分析主要用作探索性数据分析和预测模型的工具,经常被用于想象种群之间的遗传距离和亲缘关系[68]。PCA通过数据协方差(或者相关性)矩阵的特征值分解或者数据矩阵的奇异值分解来完成,其实就是将高维数据空间中的一组多元数据集投影到低纬度成像,仅仅使用前几个主成分来实现该过程,从而有效降低数据维度[68]。PCA降维过程如下:假设高维数据矩阵D,对D进行标准化变换得到矩阵ZZ=z11⋯z1n⋮⋱⋮zm1⋯zmn=normalization(D)T 对Z矩阵进行奇异值分解Z=UWT (STYLEREF1\s2SEQ(\*ARABIC\s13)其中U、W都是正交矩阵,对角化Z,因此可得到数据转换矩阵YY=ZTU (STYLEREF1\s2SEQ(\*ARABIC\s14)矩阵Y的即为分解出的主成分[68]。时间序列聚类本章采用集成自适应仿射传播(AAP)聚类算法,AAP算法是一种改进的仿射传播算法,具有自适应性的快速聚类方法。该算法基础将每一个数据都认为是一个类别的中心,通过一种自适应自动取调节结构参数,并且在迭代中不断收敛,获得最优类别聚集中心和聚类集合的方法[69]。AP聚类算法输入数据为每个样本之间的相似度以及相似度的中值。因此算法初始输入为相似度矩阵SN∗Nd(i,j)=xi1−xj12+xi2−xj22+⋯+xiN其中,d(i,j)大于等于0,当d(i,j)=0时,样本点与自身的欧氏为0,di,j=d(j,i)相似度S(i,j)=−i−j2偏向参数pmAP算法为了尽快找到类别聚集的中心点,引入了吸引度矩阵和归属度矩阵,其意义在于聚类中心会更大程度的吸引和聚类中心距离更近的点,且该点也对聚类中心有着更大的归属感,因此某个点对其他样本的总吸引力大意味着可能是聚类中心,反之则不是[69]。所以AP算法就在相似度矩阵上进行遍历搜索,并迭代循环。吸引度归属度计算如下:Ri,e←Si,e−maxj≠eAi,j+Si,j (STYLEREF1\s2A(i,e)←min0,R(e,e)+k≠i,emax(0,R(k,e)) (STYLEREF1\s2SEQ(\*ARABIC\s17)图STYLEREF1\s2SEQ图\*ARABIC\s14聚类中心竞争过程图AP算法聚类过程如下:图STYLEREF1\s2SEQ图\*ARABIC\s15AP聚类流程图自适应仿射传播聚类(AAP)则包括:自适应阻尼,自适应逃离和自适应扫描。自适应阻尼则是用于阻尼因子的调整以用于消除震荡;自适应阻尼失败的话就使用自适应逃离降低偏向参数,最后使用自适应扫描选获得最好的类别聚集测算结果。其具体步骤如下:设定阻尼因子初始值;进行AP迭代循环;判断迭代是否震荡,若发生震荡,则检查阻尼因子(阻尼因子值<0.85,以一个步幅增大阻尼因子;阻尼因子值≥0.85,以一个步幅减小偏向参数),若不发生震荡,则继续2);继续w次迭代,进行步骤3);样本点分配并输出聚类结果[69]。图2-6展示了AAP自动消除震荡的过程。图STYLEREF1\s2SEQ图\*ARABIC\s16AAP自动消除震荡流程图图2-7展示了AAP自适应扫描的过程。图STYLEREF1\s2SEQ图\*ARABIC\s17AAP自适应扫描流程图在得到的n个类别聚集结果中,为了得到最佳的结果,引入Silhouette指标Sil(x∗)=mind(x∗,Ci)−a(x∗)/maxa(x其中d(x∗,Silavg=meant=1NSil(x∗) (STYLEREF1\s2SEQ(\*ARABIC\s1这个值越大表示聚类质量越好,因此可以使用这个方法提取最优聚类个数和聚类中心。NKNN回归NKNN是一种改进的KNN算法,能够改进KNN的一部分缺陷。即KNN在处理大规模样本的时候,算法速度很慢,效率低下,且样本类别不平等的时候数据量大的类别会影响算法的预估准确度。因此本章使用NKNN即嵌套式k-近邻算法进行预测。NKNN是基于APP聚类的,即NKNN的特征输入为前面AAP聚类生成的最优类别聚集的结果。NKNN是两层聚类过程。第一层得到被试数据与AAP各个类别聚集中心数据的相似数值,找到最
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年河南住院医师-河南住院医师口腔科历年参考题库含答案解析
- 2026年河北外国语学院高职单招笔试职业技能测验试题库含答案解析3套试卷
- 2026年江西服装学院高职单招笔试综合素质试题库含答案解析3套试卷
- 2026年大学试题(大学选修课)-《时间简史》导读历年参考题库含答案解析
- 2026临床医学期末复习-口腔科学(本临床)历年题库含答案详解
- 编辑笔试试题及答案
- 专科转诊试题及答案
- 解析地球质量试题并给出答案
- 窗台砌体施工技术规范
- 住院患者跌倒风险评估及预防1
- 人音版(2024)一年级上册音乐全册教案
- 口腔科标准预防规范
- 统编版(2024)八年级上册道德与法治全册知识点考点提纲填空练习版(含答案)
- 儿童营养需求的调节与膳食指导
- 2025年河北物流集团招聘笔试参考题库含答案解析
- TD/T 1042-2013土地整治工程施工监理规范
- JG/T 161-2016无粘结预应力钢绞线
- 恋爱合同书(2025年版)
- JTG-T B05-2004 公路项目安全性评价指南
- 教学课件:《食品安全学》
- DL∕T 1700-2017 隔离开关及接地开关状态检修导则
评论
0/150
提交评论