版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
融合多源行业时序数据的股价趋势预测研究目录TOC\o"1-3"\h\u12880融合多源行业时序数据的股价趋势预测研究 1151751.1问题背景 159821.2行业联动与轮动现象分析 2176821.2.1时间序列相似性度量 2167001.2.2行业指数联动与轮动效应分析 570061.3融合多源行业时序数据的股价趋势预测模型设计 11178601.3.1任务及相关符号定义 11281911.3.2模型总体框架结构 11185841.3.3时序特征抽取模块 1581911.3.4交互特征抽取模块 172571.4实验与结果分析 1954491.4.1研究对象 19111951.4.2数据集划分 21171421.4.3对比实验与参数设置 21123521.4.4实验结果分析 23182671.5小结 26问题背景大多数基于金融时序数据的预测模型都是对股票本身的历史行情数据进行建模,而没有考虑其他影响因素。这是从技术分析方法的“历史会重演”的假设出发,认为个股的股价反映了市场上的所有信息,股价波动只和自身历史表现有关。然而实际的股票市场中,尤其是在中国股票市场这样一个发展时间尚短,监管机制不太成熟的市场中,国家政策、媒体新闻、上市公司财务状况、机构操纵等因素都是影响股价大幅波动的原因。一方面,国家宏观经济政策的调整会给不同的行业带来不同的发展机遇。特别是对那些处于同一产业链上下游的相关行业,下游行业的逐渐发展壮大加大了对上游供给侧行业的需求,从而带动了上游行业发展。例如房地产行业的持续升温会带动建材、钢铁等行业的活跃。这种由于政策经济环境改变以及行业间不同的盈利周期造成的行业发展规律也被称为行业轮动(SectorRotation)现象。由此可见,掌握行业轮动规律对于预测行业行情以及个股股价趋势变化是极为重要的。如果投资者能够准确把握行业轮动的规律,就能够在每一轮行情中找到合适的投资对象以及恰当的买入时机,从而获得超越市场的超额收益。除上述轮动现象以外,股票市场中也时常会出现个股与个股之间、个股与行业之间、行业与行业之间甚至市场与市场之间价格的同向变动,即人们常说的股票价格“同涨同跌”现象。这种现象也被称之为联动(Co-movement或者Synchronization)现象。这一方面是由于具有相似基本情况的股票或行业受到相同的市场冲击造成了股价同涨同跌;另一方面是由行为金融学中常提到的投资者“羊群效应”造成的。当某只股票领涨大盘时,投资者相信与该股相关的股票也会联动上涨,于是纷纷杀入该板块,造成整个板块的整体上扬。相反,当某只股票领跌大盘时,投资者们又相信该股相关的股票也会联动下跌,于是纷纷抛售,造成该板块的整体下跌。对股价联动现象的研究最早是Lucus[116]在商业周期理论中提出来的,他认为各宏观经济变量如失业率、GDP增长率、通胀率之间存在共同变动的趋势,这种关系被称为联动性。通过上述对股票市场上联动、轮动的定义和成因分析之后,我们可以看到个股股价的波动不只是和自身的历史价格有关,还和市场整体经济环境以及相关个股或行业的表现有关。不管是政府部门、金融研究机构还是个人投资者,都希望能够及时最好是提前掌握股市中的动态行情,发现下一个投资风口,从而合理配置资产、规避金融风险并辅助投资决策。但利用联动和轮动现象进行行情预测的研究却很少,因此本章节的主要任务就是构建深度学习模型充分利用行业轮动和联动信息对个股股价趋势进行预测。本章节将首先采用动态时间弯曲(DTW)算法衡量中国股票市场中各行业指数之间的相关性,定性分析行业之间轮动和联动现象,解释利用行业轮动与联动效应进行股价趋势预测的合理性;其次依据第三章提出的多源信息融合研究框架选择合适的神经网络结构来构建股价预测模型;最后在上述研究的基础上,融合多源行业时序数据,对个股股价趋势进行预测研究,并分析各种对比模型的试验结果,得出适合当前背景下的模型的最优结构。行业联动与轮动现象分析由4.1小节关于联动和轮动效应的定义我们可知,具有联动或轮动关系的时间序列在形态上一定具有相似性。因此我们可以通过衡量不同时间序列之间在形态上的相似程度来发现它们之间存在的联动或轮动关系。时间序列相似性度量一般意义上两个时间序列“相似”指的是:距离最近且形状相似。欧氏距离(Euclideandistance)是衡量距离最常用的指标。给定两个等长时间序列X={x1,D(4-1)给定如图4-1所示的三个时间序列,我们很容易判断出序列X和Y最为相似,但是由欧氏距离计算出的结果却是序列X和Z最为相似。图4-1时间序列相似性示意图从上述计算结果来看,我们发现欧氏距离在衡量时间序列相似性方面存在无法辨别形状相似性的缺陷,也不能反映趋势动态变化幅度的相似性。因此Berndt和Clifford[117]于1994年提出了动态时间弯曲(DynamicTimeWarping,DTW)距离作为衡量时间序列相似性的度量。DTW实际上是依然是计算欧式距离,但是它摆脱了欧氏距离计算中点必须一一对应带来的匹配缺陷,通过以最小代价来弯曲时间轴使得时间序列数据实现“一对多”的匹配,允许时间序列在时间轴上存在一定的位移,并且对时间序列的振幅变化也有较强的识别作用。正是由于DTW这一出色的特质,使得DTW在语音识别领域有着广泛的应用,因为一个音节,它可能拖的很长或很短,听起来都是同一个词的发音,但是在同一时刻的对应关系却不一定相同。利用DTW计算两个时间序列相似性过程可被描述为算法4-1。算法4-1:动态时间弯曲算法(DynamicTimeWarping,DTW)输入:时间序列X=x0,x1,……xm−1和时间序列Y输出:如图4-2中所示的时间序列X与Y的最佳匹配路径W={w1,wStep1:构造一个m×n的代价矩阵Dmn,其中矩阵元素di,j表示xi和yj两个点之间的欧式距离d(xi(1)边界条件,w1=D(0,0)且wK(2)连续性,如果已经确定路径元素wk−1=D(a',b'(3)单调性,如果已经确定路径元素wk−1=D(a',b'Step2:初始化累计距离:γStep3:根据递推公式计算最小累计距离γm−1,n−1:γStep4:回溯求出路径W中所有的匹配点对:根据每步上一步最佳局部路径,由匹配点对(m−1,n−1)向前回溯一直到点0,0。最终最小累计距离γm−1,n−1即为我们所求的两个时间序列X与Y的相似性度量,然后通过回溯可以找到记录最佳匹配路径的W图4-2时间序列X、Y最佳匹配路径行业指数联动与轮动效应分析申银万国证券研究所统计发布的28个一级行业指数是金融领域常用的行业指数之一,因此本章节选择此行业指数作为研究对象分析行业之间的轮动与联动效应。行业信息与行业指数统计学特征如表4-1所示。为了更详实地反映各行业指数的数据分布特征,表4-1中描述性统计数据是以行业指数的日收盘指数计算。2014年申万公司重新修订了行业分类标准,从原来的一级行业中拆分出了更多的细分行业,为了保持数据的一致性,我们选择以行业指数建立的最晚时间为研究起始时间。数据集时间跨度为2014-02-21至2020-06-19,所有研究数据均来源于聚宽数据平台。样本本身所包含的数据即为数值型数据,可以直接用于计算。但从表4-1中可以看出不同行业指数之间的绝对值差异非常大,直接进行计算不利于DTW算法识别两时间序列之间涨跌幅一致但绝对值相差较大的相似性。为了消除不同行业绝对值差异,我们对各行业状态的特征值进行了对数变换。对数变换是时间序列数据预处理的常见操作之一,不会改变行业指数的相对大小,同时也不会使得各行业间差距太大,尽可能的保留了各行业的独特性质。对28个一级行业两两之间进行DTW距离计算,最终结果如图4-3所示。表4-1申万一级行业信息列表行业名称均值标准差中位数最大值峰度偏度农林牧渔I306667931604953-0.060-0.183采掘I3062663303261721.1812.666化工I2890551294250150.1690.554钢铁I2519612243552320.9281.834有色金属I3400655337460310.6960.771电子元器件I3092788309252570.577-0.020家用电器I588617995765107770.262-0.247食品饮料I1080659258923333641.4781.851纺织服装I2586801228556040.724-0.159轻工制造I2728666270754060.6110.387医药生物I795118127764133930.8610.747公用事业I2500636236551861.1711.666交通运输I2615608261553981.1222.759房地产I430483743007480-0.0480.803商业贸易I41681035411492071.3132.959餐饮旅游I594019235648156121.9124.727综合I2632706243254420.7000.200建筑材料I54951276543887220.3380.083建筑装饰I2584710248653770.7971.107电气设备I527813505172104811.0291.329国防军工I1404392136132071.5513.837计算机I467111724624103401.0273.367传媒I102038792526601.3172.119通信I2487518250848450.6832.267银行I328348733474268-1.2671.355非银金融I182538818392982-0.1900.534汽车I4564898464478680.214-0.170机械设备I1396339140130031.3083.501图4-3A股市场一级行业指数序列之间DTW距离展示图4-3中颜色越深代表两个行业的指数形态越不相似。从与其他行业之间的相似性角度来看,这28个行业可以粗略地分为以下三个类别:第一类是由食品饮料和家用电器行业组成,我们可以看出它们明显区别于其他行业,仅与个别行业具有相似性,而与大部分行业的指数形态都不太相似。第二类由农林牧渔、电子元器件、医药生物、餐饮旅游、建筑装饰、银行和非银金融行业组成。相较于第一类来说,它们与其他行业的相似性有所增强,且与第一类行业的相似度最大。从行业的生产内容来看,第一类和第二类行业大多是与人们日常生活如衣、食、住、行、娱乐、医药、理财和保险紧密相关的产业。第三类是其余行业,它们的共同特点是除了和第一类、第二类行业的指数形态不相似以外,和其他多个行业的指数形态都具有相似性,且相似程度各不相同,比较复杂难以发现统一的规律。从生产内容上来看,第三类行业大多以制造业为主。以上三类行业指数的时间序列如图4-4至图4-6所示:图4-4第一类行业指数序列图4-5第二类行业指数序列图4-6第三类行业指数序列从以上各行业的指数波动曲线图可以看出三类行业指数在2016年至2019年以及2019年至2020年两个时间段的变化趋势有明显不同。第一类行业在两个时间段内均基本保持上升趋势,且上升幅度较大;第二类行业在2016至2019年时间段内指数基本持平但在2018年略有下降,在2019年至2020年时间段内呈大幅上升趋势;第三类行业在2016年至2018年时间段内呈明显的下降趋势,在2019年至2020年时间段内呈小幅上升趋势。从以上行业指数波动曲线图可以看出采用行业指数形态相似性来寻找与该行业具有联动效应行业的合理性。但是与其他行业具有联动效应只能说明该行业所受的市场影响因素可能与其他行业相似。只有当这种联动效应具有一定时滞性或两个行业之间存在轮动效应才会对行业指数的预测有明显的指导意义。第一类和第二类行业与其他行业的联动较少,且行业指数之间形态较为相似。所以我们选择情况较为复杂的第三类行业进行分析,以观察两个行业指数之间是否存在明显的时滞性或轮动效应。以钢铁行业为例,图4-7至图4-10按DTW距离从小到大排序分别展示了与钢铁行业最为相似的四个行业指数,分别是:建筑装饰行业、交通运输行业、有色金属行业和公用事业行业。为了更清晰地展示,图中采用的是行业月度收盘指数,图中的虚线为它们与钢铁行业指数的动态时间匹配路径。图4-7建筑装饰行业指数与钢铁行业指数动态时间匹配路径图4-8交通运输行业指数与钢铁行业指数动态时间匹配路径图4-9有色金属行业指数与钢铁行业指数动态时间匹配路径图4-10公用事业行业指数与钢铁行业指数动态时间匹配路径从上述图中我们可以看到,这4个行业与钢铁行业之间均存在不同程度的联动和轮动效应,尤其是在行业指数的趋势发生重要转折的地方。可以看出在行业指数第一次由上升趋势转变为下降趋势的重要节点处,建筑装饰、有色金属和公用事业行业均先于钢铁行业发生转折。在此之后两行业的指数变化趋势呈明显的跟随和联动态势。什么原因可能会造成这种行业间的明显的轮动效应呢?从行业生产内容方面来看,建筑装饰行业是建筑业四大行业之一,按照最新《国家经济行业分类》,建筑装饰行业可划分为公装、住宅、幕墙三大细分行业,钢材是其主要原材料之一。公用事业服务于城市生产、流通和居民生活的各项事业,包括城市自来水、电力、煤气、供热和公共交通等事业。它和交通运输行业作为基建行业同样对钢材有很大的需求量。由此可见,建筑装饰、交通运输和公用事业行业作为钢铁行业的下游行业对钢铁的需求量的变化可直接影响钢铁行业的股价涨跌。从产品供给角度来说,它们对钢铁行业指数的趋势变化具有拉动作用的推理是合理的。通过以上对股票市场上行业指数之间形态相似性的研究,定性分析了产生行业之间的轮动与联动现象的可能原因,说明了行业指数的波动和其他相关行业的指数的波动密切相关。这对于预测个股股价趋势来说具有重要意义,因为在同一行业内,个股之间的基本面情况相似,受到市场环境冲击时的反应也类似,因此行业指数基本反映了该行业内个股尤其是市值较大、流通较好的个股的波动情况,因此,采用与目标个股所在行业相关的行业指数数据作为额外的输入数据对预测目标个股股价趋势预测是具有重要参考价值的。融合多源行业时序数据的股价趋势预测模型设计任务及相关符号定义由于轮动效应在不同行业之间引起行情变化的时间间隔一般较长,因此本章节是对个股的周收盘价趋势进行预测研究。与第三章的定义一致,股价趋势预测是一项二分类任务,在此我们对本章节所涉及的相关概念进行一一解释,以便下文理解和阅读。时间节点t:每周的最后一个交易日记为一个时间节点t;目标个股i:模型要预测涨跌的个股i;个股状态pcti:在每个时间节点t处表示个股行业状态Cti:在每个时间节点t处表示行业样本:个股在时间段[t−l+1,t]内,由=1\*GB3①个股状态pcti、全行业状态Cti构成的序列数据与=2\*GB3②样本标签Lti组成的数组,记为一条样本,l为时间间隔;样本标签Lti:目标个股i在时间节点t+1处相对于时间节点t处的涨跌情况,记为Lti。如式4-2所述,如果时间节点t+1的个股收盘价高于时间t的收盘价,则样本标记为[0,1],否则记为[1,0],pctLti输入数据xi(t):目标个股i在时间节点t处的输入数据即为目标个股i在时间段[t−l+1,t]内按时间顺序排列的个股与全行业状态矩阵,如式4-3所示,x(4-3)任务定义:模型通过分析目标个股i在当前时间节点t处的输入数据xi(t)来预测该个股在下一个时间节点模型总体框架结构在模型设计方面遵循第三章提出的多源信息融合的研究框架与神经网络结构选择的基本原则。为更好地预测个股变化趋势,本章节将根据输入数据自身特性分别从数据层、特征层和决策层三个阶段为模型选择具体的合适的深度学习方法。需要强调的是,虽然人为地将趋势预测模型分为了三个阶段,但实际上深度学习模型是一个端到端的计算方式,这三个阶段信息融合过程中所涉及的参数都将在同一模型中得到训练和学习。接下来将详细介绍本章节所提出的预测模型的总体框架和预测原理。融合多源行业时序数据来预测目标个股趋势的过程如图4-11所示。图4-11模型总体结构框图模型总体分为三个部分,以下分别介绍这三个部分的主要内容。(1)数据层对于任何一个目标个股来说,它的模型输入数据包含了该个股历史行情数据以及自A股市场上全部行业的行情数据。显然这带来的一个重要的问题就是:对于不同行业的目标个股来说,其余行业对目标个股的影响视不相同的,模型如何明确要预测的是哪一个行业的个股并针对性地预测出该个股的涨跌趋势结果呢?为解决这个问题,我们为模型引入了“行业变量”和“相关性参数矩阵”以此来引导模型要预测的目标个股属于哪一个行业,解决了相关行业数据相同的问题。如图4-12所示,“目标个股所属行业类别变量Vi”为one-hot编码的1×n向量,“行业相关性系数矩阵”为n×n的参数矩阵,n图4-12行业系数调节模块图4-12展示了行业时序数据的具体融合过程,可分为以下三个步骤:1×n的“行业类别向量”与n×n“相关性系数矩阵”进行矩阵相乘操作得到目标行业与其他行业的相关性参数向量,向量维度为1×n。将1×n相关性参数向量沿时间轴方向上进行复制,形成与全行业时序数据Ci(t)同维度的相关系数矩阵将全行业时序数据Ci(t)与相关系数矩阵“行业类别向量”的涵义与目前流行的Transformer模型中的“位置编码”(PositionalEncodingorPositionalEmbedding)有异曲同工之妙。不同的是,Transformer模型中与“位置编码”相乘的参数矩阵是由确定的函数生成的固定参数,是不能被模型训练的。而本模型中的“相关性系数矩阵”则是会随着模型训练而被不断更新。在理想情况下,经过足量数据的训练,相关性参数矩阵会越来越接近真实股票市场中行业之间的相关性强度大小。(2)特征抽取层以金融时序数据为输入进行股价预测都是基于“时序数据的波动蕴含规律”这一前提进行的,因此模型的主要任务就是学习这种波动规律。这样在给定一个时间序列的情况下,模型才能根据以往学到的规律来判断下一时间节点该序列的波动方向。基于深度学习模型的股价涨跌预测的研究中,对金融时序数据进行时序特征抽取并拟合其与股价涨跌的关系是目前研究中最常见到的方法。在此我们也将沿用这一做法,选择合适的模型对时序数据进行特征抽取。在众多深度学习模型中,循环神经网络类模型由于自身独特的算法特点而在时间序列预测领域中占据主导地位。狭义的循环神经网络指的是RNN,其具体结构与预测原理已在3.2.2小结进行了详细介绍。它最先是在自然语言处理领域发展起来的。语言的表现方式如句子、语音本质上是序列依赖的数据,即后面的数据和前面的数据是有关系的。这和时间序列的特点类似,也正是因为循环神经网络在处理序列化输入方面有其独特之处,因此循环神经网络被广泛地用于抽取时间序列的“时序特征”上。时序特征这一概念并没有明确的定义,更多的是表示序列输入数据之间的依赖关系。与自然语言处理领域的序列具有前后依赖关系不同的是,金融时序数据是沿时间轴单向进行的,只存在时间靠前的数据对后面的数据有影响,反过来则没有。所以在“时序特征”抽取方面不存在双向循环神经网络。LSTM是对传统循环神经网络RNN的改进,通过设置3个门变量来控制前一时刻的状态有多少能够传递给当前时刻,从而缓解了传统RNN由于序列长度增加而出现的梯度消失现象,目前时间序列数据的预测问题研究中应用最为广泛的是LSTM及其混合模型。GRU是对LSTM模型的简化,它们的具体结构及特征抽取原理将在4.3.3小节进行详细介绍,我们将会看到LSTM的单元结构复杂,参数量较多,又因为是序列依赖的计算方式,所以无法实现并行计算,使得模型训练时间较长。GRU与LSTM相比,保留了“门控信息流动”的原理,但是简化了输出门,使得参数量大为减少。有研究表明在序列任务上,GRU与LSTM的表现相当。虽然目前研究中应用最多的是LSTM模型,但是本章节的模型输入序列的长度并不大,而在较短的时间序列上LSTM模型是否表现的比RNN以及GRU更好尚未可知,因此在对比实验中将分别对这3种循环神经网络结构进行试验,以确定在此情况下表现最好的结构。以上探讨的模型学习重点是抽取输入特征在一段时间的变化规律,即抽取“时序特征”,但却忽略了对不同行业时序数据的组合特征的挖掘,这对模型预测来说是一种极大的信息浪费。Guo[118]等人在对推荐系统中用户点击率进行预估研究时,通过分析用户app下载情况的数据,发现用户在用餐时间里喜欢下载美食类的app,这说明“app类别”和“时间戳”这两个的特征组合对用户喜好有更强的指示作用。这一现象同样适用于解释股票的特征组合效应,技术专家们也是综合对多个技术指标的变动和分析来判断股价的涨跌趋势。同理,多个行业与个股的时序数据的组合特征可能对趋势预测有更强的指示作用,例如如果与目标个股所属行业同处一个产业链上下游的相关行业,指数在最近几周均呈现出下降趋势,那目标个股接下来最有可能的也是呈现下降趋势。人工构建组合特征是件费时费力的事情,因此这一部分我们将采用基于因子分解机的神经网络(DeepFM)模型增强对输入数据的挖掘程度,自动化地学习不同时间序列特征的组合特征对目标个股股价趋势的影响。DeepFM原理与计算过程将在4.3.3小节部分进行详细介绍。(3)决策层在模型完成了对输入数据的多级融合,抽取了“时序特征”以及“组合特征”这两种抽象特征之后,决策层融合阶段的目标是:综合多种抽象特征完成对目标个股股价涨跌的预测输出。如图4-11所示,在这一阶段,模型将两类特征向量拼接起来,传递给三层全连接神经网络,经过非线性映射之后得到表示股价涨跌的概率,这里全连接网络用到的激活函数为relu。至此,我们将模型各阶段所采用的神经网络结构确定了下来。在接下来的小节,将要详细介绍特征抽取部分的技术细节,展示模型是如何实现对目标个股股价涨跌的预测的。时序特征抽取模块输入数据xi(1)长短期记忆神经网络从对第三章节RNN算法原理的详细介绍中,可以看出RNN可以通过传递部分历史信息来辅助当前节点的预测,但同时也带来了更大的技术挑战——长期依赖(long-termdependencies)问题。例如当前预测位置和相关信息之间的间隔逐渐增大时,相关信息需要经过逐步计算才能传递到当前预测位置,那么循环神经网络就有可能会丧失学习到距离如此远距离的信息的能力。在复杂的情况下,有时有用的信息的间隔有大有小,长短不一,循环神经网络的性能也会受到限制。长短期记忆网络(longshort-termmemory,LSTM)就是为了解决这个问题而设计的。LSTM结构最早是由SeppHochreiter和JurgenSchmidhuber[119]于1997年提出的,它是一种特殊的循环体结构。如图4-13所示,与RNN循环体结构不同,LSTM是一种拥有三个特殊的“门”结构。这三个“门”分别是“遗忘门”、“输入门”和“输出门”。“门”结构实际是向量对应位置相乘之后经过sigmoid函数激活的操作。之所以将该结构叫做“门”是因为经过sigmoid函数激活之后的输出值会介于0到1之间,它可以选择性地让当前时刻的信息量有多少可以通过这个结构。这个作用就像“门”一样,当“门”完全打开时(sigmoid函数输出为1),当前时刻的信息可以全部通过;当“门”完全关闭时(sigmoid函数输出为0),当前信息完全无法通过。图4-13LSTM神经网络结构图每个LSTM单元包含两个重要的隐藏状态:记忆单元ct和输出状态ht。LSTM单元通过三个“门”来控制隐藏状态的更新。其中遗忘门ft决定了前一个记忆单元ct−1的值以多大概率被当前记忆单元ct保留,由于遗忘门的控制,记忆单元ct可以保存很久很久之前的信息;输入门it决定哪些输入值应该被传递给当前记忆单元ct,可以避免当前无关紧要的内容进入记忆单元;输出门o(4-4)f(4-5)o(4-6)z(4-7)c(4-8)h(4-9)其中,xt是当前时间的输入,sigmoid和tanh是非线性激活函数,⨀表示对应元素相乘,Wi,Wf,Wo,Wz,Ui,Uf,Uo,Uz(2)门控循环单元神经网络LSTM内部结构复杂、参数众多,这常常导致模型的训练时间较长,因此2014年Cho等人将LSTM的结构进行了简化,提出了一种新的门控循环单元(GatedRecurrentUnit,GRU)网络。具体结构图和计算过程如图4-14所示,与LSTM相比而言,GRU只有两个“门”结构:“输入门”和“遗忘门”;且单元结构内将记忆单元和隐藏状态进行了合并,简化了算法结构。图4-14GRU神经网络结构图上述计算过程可解释为以下公式:i(4-10)f(4-11)(4-12)c(4-13)(4-14)综上所述,无论采用哪一种循环神经网络结构对输入数据进行特征抽取,该时序特征抽取模块都可输出同维度的向量,代表了全行业收盘指数及个股收盘价在时间段内[t−l+1,t]的波动情况对当前目标个股收盘价在下一个时间节点t+1处涨跌的影响。交互特征抽取模块正如我们之前所提到的,除了时序特征会对当前个股股价涨跌造成影响以外,不同时序数据之间的组合特征也有可能包含对目标个股股价的涨跌情况具有预测作用。因此我们采用了DeepFM模型对不同行业的时序数据组合特征进行抽取。DeepFM模块首先利用因子分解模型对多源时序数据特征进行低阶(一阶和二阶)特征组合得到FFM,其次利用深度神经网络进行高阶特征组合得到FDNN,最后对两部分结果相加并激活得到F(4-15)这样做的优势是利用了不同阶的组合特征,丰富了特征挖掘程度,有利于提高预测准确率。具体的计算过程如图4-15所示。图4-15DeepFM模块结构图DeepFM模型的因子分解(FM)部分是为了学习特征之间的1阶组合和2阶组合作用,我们可以用公式4-16表示因子分解机的计算过程:F(4-16)公式4-16中fi为输入数据中状态向量Tt或It的第i维特征,fi,wi∈R,第一部分i=0dwifi为特征的一阶组合,wiF(4-17)如果重复fi的值将fi变成与Vi同维度的向量FiF(4-18)其中Vj1⨀Fj1表示Vj1和DeepFM中DNN部分学习的是特征之间的高阶组合特征,将FM部分生成的embedding作为DNN部分的输入,记为a0a(4-19)第l层隐藏层的输出记为al+1a(4-20)Wl,bl为第F(4-21)H为隐藏层的层数。实验与结果分析研究对象4.3小节中对模型输入数据进行了详细介绍,为了使模型充分学习行业间的相关性,以便后续对比模型学习到的“行业相关性系数矩阵”与DTW算法计算而来的相关系数,从而证实模型的学习能力和可解释性,研究对象必须含有每个行业的个股。因此我们对各行业内个股按照近5年的日均市值与日均流通股成交金额从大到小进行排序,每个行业各筛选出5只个股作为研究对象,并且保证个股上市时间在2014-02-21之前。最终本章节的研究个股对象如表4-2所示。数据采集按个股周收盘价记,最终采集到有效数据共计45360条,包含140支个股,324个有效交易日,数据集时间跨度为2014-02-21至2020-06-19。样本本身所包含的数据即为数值型数据,可直接用于计算。但个股股价与行业指数绝对值非常大,直接用于计算容易引起梯度爆炸,非常不利于模型收敛,影响训练过程及预测结果。因此在在输入模型之前,与4.2.2小节的处理方式相同,将输入数据分别进行对数变换,缩小输入特征绝对值。表4-2第四章节研究对象汇总表行业名称代表性个股农林牧渔I牧原股份、海大集团、新希望、生物股份、圣农发展采掘I陕西煤业、中国石油、美锦能源、山西焦煤、海油工程化工I万华化学、中国巨石、中国石化、浙江龙盛、金发科技钢铁I宝钢股份、包钢股份、华菱钢铁、河钢股份、方大特钢有色金属I紫金矿业、天齐锂业、洛阳钼业、山东黄金、南山铝业电子元器件I京东方A、立讯精密、三安光电、歌尔股份、紫光国微家用电器I三花智控、新宝股份、四川长虹、深康佳A、海信家电食品饮料I贵州茅台、五粮液、伊利股份、泸州老窖、海天味业纺织服装I星期六、海澜之家、森马服饰、朗姿股份、际华集团轻工制造I太阳纸业、索菲亚、中顺洁柔、晨鸣纸业、山鹰国际医药生物I山东药玻、普洛药业、亿帆医药、我武生物、安科生物公用事业I联美控股、晋控电力、上海电力、国网信通、梅雁吉祥交通运输I上海机场、中远海控、上港集团、白云机场、宁波港房地产I万科A、绿地控股、张江高科、中南建设、新湖中宝商业贸易I永辉超市、苏宁易购、百联股份、王府井、豫园股份餐饮旅游I中国中免、宋城演艺、中青旅、峨眉山A、桂林旅游综合I华测检测、中国宝安、东方集团、中信国安、泰达股份建筑材料I东方雨虹、北新建材、旗滨集团、冀东水泥、伟星新材建筑装饰I中国建筑、中国中铁、中国铁建、葛洲坝、中国中冶电气设备I隆基股份、汇川技术、国电南瑞、阳光电源、特变电工国防军工I航发动力、中国重工、中航西飞、中航机电、中国卫星计算机I中国长城、浪潮信息、同方股份、华宇软件、广电运通传媒I掌趣科技、上海钢联、人民网、省广集团、电广传媒通信I中兴通讯、中国联通、中天科技、亨通光电、烽火通信银行I招商银行、兴业银行、平安银行、民生银行、宁波银行非银金融I中国平安、中信证券、中国太保、招商证券、中国人寿汽车I比亚迪、潍柴动力、福耀玻璃、上汽集团、华域汽车机械设备I三一重工、中联重科、中国中车、恒立液压、徐工机械数据集划分一般进行分类训练的深度学习模型可将数据集随机打乱划分训练集、验证集和测试集。但由本研究中的行业行情数据是时序数据,不能按照常用方式随机打乱顺序进行划分,否则就会出现利用未来的数据训练而预测过去的数据的情况。因此我们将数据按时间顺序排列,然后再按照10:2:1的比例划分数据集。划分后各数据集的情况如表4-3所示,可以看到训练集正负样本比例分布均衡,并且三个数据集的正负样本比例相差不大基本一致,这可以保证我们训练的模型不会对预测结果进行有偏预测。表4-3数据集分布情况时间跨度正样本比例负样本比例训练集2014-02-21至2018-12-310.54300.4570验证集2019-01-01至2019-12-310.55950.4405测试集2020-01-01至2020-06-190.53730.4627对比实验与参数设置LSTM模型是目前采用金融时序数据进行股价趋势预测的研究中最常用到的深度学习模型,本文将LSTM模型作为本研究的baseline。但是由于本研究背景下的时序数据序列长度并不算长,而LSTM则是在处理较长的输入序列任务上表现地比一般RNN更好。所以在此处我需要将另外两种常见的循环神经网络结构RNN和GRU同样作为baseline,验证究竟哪种循环神经网络在输入序列长度较短的情况下表现更加良好。本章节所提出的行业指数趋势预测模型与以往研究不同的主要是在特征抽取模块,增加了不同来源的数据的交互特征抽取。因此我们在上述三个baseline的基础上为模型分别添加DeepFM结构来验证增加对同一时间节点处不同特征之间的交互特征是否有助于提高模型的预测准确率。除此之外,Baseline和baseline+DeepFM模型在数据层和决策层的模型结构是一样的。对于深度学习模型的求解过程来说,模型是利用随机梯度下降原理通过在反向传播过程中不断更新参数的操作,实现在解的空间里不断搜索最优解,模型不能保证可以找到全局最优解,很有可能陷入局部最优而停止搜索。为此学者们开发了多种优化方法如Adam,RMSprop等,来防止模型在训练过程中陷入局部最优解而停止迭代。此外,文献《AllYouNeedIsaGoodInit》[120]中强调了参数初始化对于深度学习模型的重要性,良好的初始化参数可以帮助模型更快更好地找到全局最优解。因此可以将在4.2.2小节中得到的行业间DTW距离作为这里的“相关性系数矩阵”的初始化参数。但是由DTW算法得到的数值表示的是两个行业指数之间的最小累积欧式距离,这表示两个行业之间越不相似,DTW距离越大,正好和我们的“相关性”的定义相反。所以我们决定对DTW算法得到的行业间DTW距离矩阵先进行y=e−x变换,其中x为我们计算的DTW距离,y为变换之后的相关性系数。这样经过变换之后上述对比模型总结如表4-4所示:表4-4对比模型总结表对比模型解释RNN循环神经网络LSTM长短期记忆循环神经网络GRU门控单元循环神经网络RFM循环神经网络+深度因子分解机模型LFM长短期记忆循环神经网络+深度因子分解机模型GFM门控单元循环神经网络+深度因子分解机模型RFM/LFM/GFM+init在选定上述最优模型的基础上改变“相关性参数矩阵”的初始化方式最重要的一点是,本章节考虑到了股票市场上相关行业之间的联动和轮动效应对目标个股股价趋势的预测价值。因此将在两种策略下分别进行了上述几组对比实验。其中策略1代表输入数据中只包含目标个股的历史收盘价数据,策略2代表输入数据在策略1输入数据的基础上增加全部行业的历史指数作为输入数据。模型整体依据各部分的功能可分为5个模块:输入、时序特征抽取模块、多源时序数据交互特征抽取模块、非线性映射以及输出。各部分所采用的结构和细节如表4-5所示。表中所列的对比模型共享数据级融合和决策级融合的结构及具体参数。表4-45对比模型结构与参数模型组成部分深度学习结构层数输出维度数据层输入1--29×8特征抽取层时序特征抽取RNN或LSTM或GRU129时序数据交互特征抽取DeepFM136决策层非线性映射FC364,32,16输出--21输入时间序列的长度为8,代表了8周28个行业指数的周收盘数据实验结果分析在测试集上各对比模型的表现如表4-6所示。由于策略1的输入数据只包含目标个股的历史收盘价格,因此无法进行增加DeepFM后的对比实验。表4-6不同输入条件与模型的测试集预测结果模型平均ACC平均MCC策略1:输入数据只包含目标行业的历史收盘指数数据RNN0.58240.1702LSTM0.57070.1689GRU0.59130.1793策略2:输入数据包含全部行业的历史收盘指数数据RNN0.62160.2224LSTM0.61540.1850GRU0.63190.2596RFM0.63740.2051LFM0.62640.1875GFM0.66840.3029GFM+init0.67530.3096从上述对比实验的结果中我们可以看出:Baseline模型RNN、LSTM和GRU在策略2下的表现均相应地一致地高于其在策略1下的表现,在预测准确率方面策略2下的三种模型分别高于其在策略1下的模型3.92%、4.47%和4.06%。这再次说明了在股票市场上,各行业之间是相互影响的。增加相关行业的历史指数信息有助于提高对个股股价涨跌的预测准确率。GRU模型在两种输入策略下的表现均一致地高于RNN和LSTM模型。让人惊讶的是LSTM在两种策略下均表现最差,甚至不如RNN的表现。这说明了在处理较短的时间序列任务上,LSTM并没有发挥出模型的优势。这可能是由于当输入数据的时间序列较短时,不易出现梯度消失问题,因此LSTM无法发挥模型优势,反而因为参数量巨大而增加了模型的复杂程度,尤其是在当前数据量远达不到百万级别时,使得模型容易在训练集上过度拟合而在测试集上表现较差。而GRU则调和了模型复杂度和参数量的问题,在模型非线性拟合能力上要强于RNN,而又比LSTM结构简单参数量小,因此表现最为良好。三种baseline模型RNN、LSTM和GRU在增加了DeepFM模块对时序数据之间的交互特征抽取之后,其表现均一致地高于baseline模型,在baseline的基础上分别提高了1.58%、1.10%和3.65%。其中GRU与DeepFM的组合模型对预测准确率的提升最为显著。这说明了在抽取了输入数据时序特征的基础上,增加对时序数据的组合特征的抽取确实可以挖掘出更多有价值的信息,有助于提高模型的预测准确率。并且GRU与DeepFM联用在本研究背景下(输入时序数据的序列长度较短)再次表现出了远超RNN和LSTM的效果。至此,我们确定了在本章节任务下,预测效果最好的模型结构为GRU+DeepFM(GFM)。因此在此基础上我们又对该模型的“相关性参数矩阵”进行了人工初始化,即利用处理后的DTW距离矩阵作为初始化参数,重新对该模型进行了训练。结果显示在模型结构不变的基础上优化参数初始化仍可以提高0.69%的预测准确率。说明了利用先验知识指导模型训练,可帮助深度学习模型寻找全局最优解。一直以来,深度学习模型非线性拟合能力的不可解释特性就深受人们诟病。在本研究模型中,“行业相关性系数矩阵”在预测原理上是有一定的可解释特性的,那么究竟模型学习到的行业之间的相关性系数和利用可解释性强的DTW算法所计算出来的行业之间的相关性之间是否存在一致的规律呢?为此,我们将GFM模型训练结束后的“行业相关性参数矩阵”取出来进行了可视化的展示,如图4-16所示,图中颜色越深代表两个行业之间的相关性越大。与图4-3不同的是,这个相关性矩阵不是对称的,应以
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 仓储部门岗位权责管理制度
- 北京市海淀区教师进修学校附属实验学校教育集团教师招聘笔试备考题库及答案详解
- 2026年枣庄市山亭区工会人员招聘笔试参考题库及答案详解
- 2026宁夏吴忠审计局聘请专业人员1名辅助审计工作笔试模拟试题及答案详解
- 2026年福建厦门市财政审核中心招聘财政专才3人笔试备考试题及答案详解
- 2026河北地矿中地建设有限公司下半年第二批次招聘8人考试模拟试题及答案详解
- 2025年和田地区和田市工会人员招聘笔试试题及答案详解
- 2026浙江空港公务航空有限公司招聘2人考试参考题库及答案详解
- 跨境数字海关进出口商品归类争议线上跨国专家会商机制-基于世界海关组织归类意见数据库规范分析
- 2025年上海市虹口区街道办人员招聘考试试题及答案详解
- 2025北京市交通发展年度报告
- 信用卡部培训大纲
- 代建公司代建管理制度
- T/CSWSL 007-2019饲料原料酵母水解物
- 滚针美容治疗技术解析
- 儿童自闭症康复中心项目商业计划书
- 莱州市月季产业发展规划(2018-2022年)
- 2025黑龙江七台河辰能生物质发电有限公司招聘笔试参考题库附带答案详解
- 《毛泽东思想和中国特色社会主义理论体系概论》附有答案
- 兰州市文职辅警招聘考试真题
- 田英章毛笔楷书2500字(简体版)
评论
0/150
提交评论