版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
研究导读得益于数据科学在线社区日益成熟,机器学习和大数据的学习门槛逐渐降低,全球的爱好者都可以通过在线平台参与编程训练和竞赛项目,和顶尖团队进行较量和探讨。agle正是影响力较大的平台之一囊括了超过0项竞赛5万个数据库和0万组代码美国白宫斯坦福大学北京大学微软谷歌等机构和企业都曾在age发布竞赛征集解决方案。量化投资和机器学习大数据关系紧密多家量化投资机构也在agle平台发起挑战竞赛,发布方不乏Wnt、oSgma等知名对冲基金,也包含Jaetree、Optier等头部做市商。项目内容大多是基于资产历史行情、新闻数据或匿名特征,预测未来收益率或波动率。下表整理了age平台量化投资相关竞赛。2年1月,国内量化私募九坤投资也上线agle竞赛,受到市场关注,3支队伍参赛,最终前0名队伍获得0万美奖金。图表:ggle平台量化投资相关竞赛发布时间发布机构竞赛描述 网址15年10月Wtn 利用股票T2至T日中行情等数据,ts:/www.kl.cm/cmetitios/te-it-stckm预测T日中至T+2日收益率 kcllge16年12月ToSima 利用资产匿名特征,预测价格 ts:/www.kl.cm/cmetitios/twosimfiaciali/8年9月ToSima 利用新闻数据,预测股票价格 ts:/www.kl.cm/cmetitios/twosimfiaciaews20年11月JneStrt 利用股票匿名特征,制定交易策略ts:/www.kl.cm/cmetitios/jaestrtmk-eictin1年6月Otivr 利用股票订单簿数据,预测未来分钟波动率21年11月rsech 利用数字货币行情数据。预测未来5分钟的残差收益率2年1月九坤投资 利用股票匿名特征,预测收益率,最大化C值2年4月日本交易所集团利用股票行情、财报等数据,预测未来收益率排序,最大化多空组夏普比率
ts:/www.kl.cm/cmetitios/otiver-lizdvltilit-ricti/ts:/www.kl.cm/cmetitios/gsachcrtfcsti/ts:/www.kl.cm/cmetitios/uiqutmkticti/ts:/www.kl.cm/cmetitios/jpxtk-stckexcaepeiction资料来源:Kgle,本文的主题“抄作业九坤agle量化大赛高手云集高分队伍是否有经验值得借鉴?我们梳理了部分高分队伍公布的解决方案,提炼出有共性的四个方向——特征工程、损失函数、交叉验证和模型集成,并应用于中证0指数增强策略的改进。结果显示,改进策略相比基线策略有稳定提升回测期21年至2年内年化超额收益从%提升至%信息比率从/4提升至测试的改进技巧中神经网络引入均值因子CCC损失、模型集成提升作用较显著。图表:部分测试模型回测绩效年化收益年化波动夏普
最大回Camr
年化超额
年化跟踪信息比超额收益最大超额收益
相对基准月年化双边换gb
率 率 率 撤
率 益
误差 率 回基线策略..%.% .62.%.%.% .61.%.32 .% .9% .38.34 .% .2% .26.%.7%.07 .%.47 .%.8.6
比率 胜率 手率nf+n_wc+gb .%.% .70.% .38nf+n_wc+g_cv.%.% .70.% .38.%.%.2%.3%.73.3%.5%.82.79.% .1.% .1.68注:回测期--4至22--0,基准为中证50指数资料来源:朝阳永续Win,图表:基于九坤gge量化大赛的改进策略超额收益表现0%0%
改进策略超额收益最大回撤(右轴) 基线超额收益最大回撤(右轴
基线超额收益最大回撤基线超额收益最大回撤(右轴)基线累计超额收益改进策略累计超额收益基线累计超额收益5%0% 0%0% 5%0% 0%0% % 10% 5%20% 1%010-4010-4010-4020-4020-4030-4030-4040-4040-4050-4050-4060-4060-4070-4070-4080-4080-4090-4090-4000-4000-4010-4010-4020-4020-4注:回测期0-14至0-230,基准为中证50指数;展示的改进策略为nf+n_ccc+xb:朝阳永续, Win,九坤ale量化大赛高分方案解析九坤age量化大赛的具体任务为基于给定的A股匿名特征采用机器学习或深度学习算法预测股票未来短期收益评价指标为预测收益和真实收益的C值均属于典型监督学习问题。大赛提供的训练数据超过8G每条样本为一只股票在一个交易日的数据包含如下字段:tmed:时间,为有序数据。nestmet_d:股票。. [f_:f_9]:0个匿名特征。. target:预测目标,股票未来一段时间的收益率,但未公布具体区间。图表:九坤gle量化大赛排名靠前案排名模型架构训练数据特征工程损失函数交叉验证其他15GBM+5TaNet的平tin和0个官方提供的特征RSEKld均splemntl_trin合并0个按timeid求平均的特征SEPgGoTimSeies后的400行TimSiesSlit25GBM的平均tin和0个官方提供的特征RSEPgdKldAEP、特征中性化、PCA并没35个不同随机数种子splemntl_trin所数据tin和0个按timeid求平均的特征0个特征的均值、标准差及分位数使某些特征随机变为0stKK=10,0,0)有起到作用特征裁剪按timid分组取平均的5Tsfme(6层,最长度5)的平均1个NN(4层)splemntl_trin所数据timid>9的tin和对序列随机掩码QatileTnsfomrSEVlitinPgdKld特征、按相关性找出来的特征、本筛选和加权、GB、P、DCNN效果不如TnsfomrTt取对数并剔除离群值splemntl_trin所有数据71个GBMtin的所有数据从大的特征池中产生90多特征TimSiesSlit80个GBM+0个NN+1个自制模型的加权平均0个官方提供的特征每个timid平均的特征其他特征1个NN(2层)6个官方提供的特征1个构造的A股市场“停牌”特征注:GBM为igGBM的缩写,NN为神经网络的缩写资料来源:Kgle,比赛于2年1月开始7月公布最终成绩部分排名靠前队伍公开了解决方案如上表。我们从众多方案中提炼具有共性的技巧,从特征工程、损失函数、交叉验证和模型集成四个方向展开介绍。特征工程特征工程是模型搭建前的数据预处理和新特征构造工作,特征工程的质量一定程度上决定了预测结果的好坏。数据预处理主要包括缺失值填充、异常值剔除和标准化;新特征的构造则依赖投资者的经验和对市场的理解。原始特征可能无法很好反映样本和潜在问题的关系,通过引入对原始特征处理和组合后的新特征,或可提升模型训练效果。九坤量化大赛中,原始数据进行了预处理和匿名处理,无法基于因子含义构造新特征,这给特征构造增加了困难。我们发现多数高分队伍都进行了新特征的构造,仅有少数方案只使用原始的0维特征第8名队伍都提到了构“按照时间D取平均的均值因子,他们指出均值因子的引入对于模型效果有显著提升。具体而言假设f0为某个因子在每个交易日对全部股票的f0求均值即得到该交易日股票的均值因子fmen0该交易日全部股票的fmen0取值相同在交易日间有差异,反映f0因子整体分布的时变特性这一操作在传统机器学习中似乎不常见构造一个全股票取值相同的因子也略显反常,但在九坤量化大赛中有效。关于均值因子的有效性和背后的含义,我们猜想:与其他领域的预测问题相比,股票收益率预测有其特殊性——未来表现不仅和股票本身特征相关,还与市场整体环境(如宏观状态、市场风格等)相关,规律存在时变特性,因此有必要引入特征刻画市场环境变化。均值因子反映原始因子整体分布的时变特性,是市场环境的一种简单表达,可能具备一定信息量。损失函数损失函数决定了模型的优化方向,损失函数的选择取决于评价指标、下游任务等因素。九坤量化大赛的最终评价指标为预测收益和真实收益的erson相关系数即C值衡量预测值和真实值的线性相关程度,部分高分队伍直接采用C值的相反数作为损失函数:𝑖1 𝑛𝑖−‾)(ˆ𝑖−𝑖1 𝐶𝑦,ˆ)=√𝑛𝑦−‾2√𝑛(ˆ−ˆ)2𝑖=1𝑖 𝑖1𝑖均方误差ME是回归任务中常用的损失函数之一衡量预测值和真实值间的距离对偏真实值的预测给予较大惩罚。部分高分队伍也采用ME或RMS(MSE的平方根)作为损失函数:𝑀𝐸(𝑦,ˆ)=1∑𝑛𝑦−ˆ2𝑛𝑖1 𝑖 𝑖总结C和ME作为损失函数的优缺点:C衡量预测值和真实值的相关性。优点是和比赛最终的评价指标直接挂钩,也是量化机构都会考察的指标不受量纲影响从而在模型间可比缺点是非凸不保证收敛可导致训练不稳定。ME衡量预测值和真实值的距离。优点是易于计算和求导,具有凸性从而保证收敛,在数据噪声较小的情况下可作为C的替代。缺点是受数据量纲影响。九坤量化大赛的讨论区里,有选手提出使用一致性相关系数CCC(concordancecorelationcoefficient作为C和ME的融合同时考虑相关性和距离CCC由Lrence-ueiLin在9年于ometrs发表的论文Acoordancecorrelationcoffcettoevauatereproducblty中提出:𝐶𝐶𝐶=
2𝑦𝑥𝑦𝜎2+𝜎2+𝜇−𝜇)
2 1)𝑥 𝑦 𝑥 𝑦andit和chuer在2019年于arXv平台发布的论文Themny--mnymppngbtweenthecocordacecorreatoncoeffcentandthemansquareerror推导了其等价形式:𝐶𝐶𝐶=
2𝑦𝑀𝐸+
(2)观察CCC的定义,()式分子中的y代表x和y的earson相关系数,即;(式母包含M。直观来看,分子考虑两组数据的相关性,分母对两组数据均值的偏离度进行了惩罚实际使用中可以取CCC的相反数作为损失函数尽管高分队伍未使用CCC损失,我们仍可以从讨论区中获得启发。交叉验证交叉验证主要用于选择模型超参数。最简单的方式是单次验证,即选择固定比例的训练集和验证集常用的方式是K折交叉验证将原始数据分成K份每次使用-1份训练模型,使用剩余1份评价模型,对K次评价取平均作为该组超参数的整体评价。但K折的缺点是可能使用未来信息,第、7名队伍均提到该问题,并提出使用时序交叉验证。我们《人工智能对抗过拟合从时序交叉验证谈起(8--中介绍过该方法。时序交叉验证将原始数据按时间顺序划分为K份,第i次验证时,使用1至i份训练模型第1份评价模型,避免未来信息,使用数据量约是K折交叉验证的一半。总的来看,时序交叉验证的优点是无未来信息,且使用数据量少时间开销低,缺点是可能存在欠拟合风险。图表:K折交叉验证示意图 图表:时序交叉验证示意图: :模型集成模型集成可以看成机器学习“免费的午餐完美训练单个模型难度很大模型集成通过融合多个子模型实现取长补短为比赛中多数高分队伍采用第7名集成了多种不同类型的子模型如决策树类模型和神经网络模型第3名集成了多个同类型的子型尽管投票法takng等模型集成方法层出不穷比赛中仍主要采用最简单的等权法高分队伍使用决策树类模型和神经网络模型作为子模型,两者有各自优势,集成能起到互补效果。决策树类模型对于数据的要求相对较低,对异常值、缺失值和特征间数量级不敏感,是在实操中较常用的一类模型。神经网络一般要求数据数量级一致、不能有缺失值,但可以通过批量训练将多个截面的信息一并地输入到模型中,自动构造出有效的新特征。除上述四项外高分队伍在模型架构上亦有可取之处如第1名采用aNe第3名采用rafome,但模型本身不是本研究关注的重点,故不作进一步测试。有少数队伍采用了独特的训练技巧如第3名使某些特征随机变为第5名对预测目标取对数对特征做分位数转换(未指明转换成何种分布,上述个性化处理也不在后文讨论之列。方法本研究在现有周频中证0指增模型基础引入九坤量化大赛中的技巧测试改进效果全部测试模型如下表。图表:全部测试模
机器学习模型 特征 损失函数 交叉验证基线gb全连接神经网络GBst2个因子2个因子加权mse加权mse单次验证,仅调迭代次数单次验证,仅调迭代次数nfeg_e特征工程全连接神经网络GBst2个因子+422个因子+42个均值因子个均值因子加权mse加权mse单次验证,仅调迭代次数单次验证,仅调迭代次数nmenwmse(基线nicnwicnccnwc损失函数全连接神经网全连接神经网全连接神经网全连接神经网全连接神经网全连接神经网络2个因子2个因子2个因子2个因子2个因子2个因子mse加权ic加权ccc加权ccc单次验证,仅调迭代次单次验证,仅调迭代次单次验证,仅调迭代次单次验证,仅调迭代次单次验证,仅调迭代次单次验证,仅调迭代次数g_cv交叉验证GBst2个因子加权mse5折时序交叉验证,调迭代次数及GBost超参数+gbnw+xbnf+n_wc+gbnf+n_wc+g_cv模型集成%*+%*gb%*n_ccc+5%*xb%*nfe+2%*n_wccc+5%*gb%*nfe+2%*n_wccc+5%*gcv资料来源:基线模型为全连接神经网络()和XGost(xg,特征为2个常规的基本面和量价因子标签为未来0个交易日收益率在截面上的排序损失函数为加权ms(mse以截面上个股收益率排序进行衰减加权。交叉验证方法为单次验证,以226个交易日为训练集2个交易日为验证集220.5个交易日为测试集相当于约半年滚动训练一次。交叉验证配合早停,仅用于确定模型的迭代次数,其余超参数均为固定值。下面介绍四个方向的改进技巧:特征工程:除原始2个因子外,增加2个均值因子。针对每个原始因子,首先进行去极值其次在截面上将因子转换为标准差等于1的分布避免因子间量纲差异的影响;随后对截面上全部股票求均值;最后整体乘以,突出原始因子作用,弱化均值因子影响。整体乘以1对模型的影响将在后文讨论。损失函数测试MCCC三类损失函数每类损失又分为等权和加权两种情况。其中加权CCC定义为:1 1𝜇𝑥=𝑁∑𝑖𝑖,𝜇𝑦=𝑁∑𝑖𝑖𝑁 𝑁𝜎2=1∑𝑤(𝑥
−𝜇2,𝜎2=1∑𝑤𝑦
−𝜇)2𝑥 𝑁
𝑖 𝑖 𝑁
𝑦
𝑖 𝑖 𝑦𝑁1∑𝑤𝑥𝑦
−𝜇𝜇𝑊𝑒𝑔h𝑡𝑒𝑑_𝐶𝐶𝐶=𝑁
𝑁
𝑖
𝑥𝑦𝑥 𝜎2+𝜎2+𝑥
2𝑥−𝜇𝑦)XGost不便于自定义此类损失函数,故测试仅针对全连接神经网络。交叉验证:采用5折时序交叉验证结合网格搜索,确定XGost学习率和最大树深。神经网络训练时间开销大,故测试仅针对XGost。同样受限于时间开销,本文未测试K折交叉验证,网格搜索颗粒度也较粗。超参数搜索方式的优化有待进一步研究。估值lf_tmcfptmd12市净率市盈率TT)净经营性现金流TT)近估值lf_tmcfptmd12市净率市盈率TT)净经营性现金流TT)近2日股息率预期cnpsgcno_gcnpg一致预期EPS(F1)近3日增长率一致预期ROEFY近3日增长一致预期归母净利润(F1近3日增长率反转tdtmep_trtunm近5日区间收益率近1日区间收益率近3日收益率以换手率指数衰减加权波动率st_mvst_mivfffcto_m收益率近1日标准差成交量近1日标准差残差收益率(收益率对万得全A、市值、BP因子收益率回归)近1日标准差换手率trmsttr_mias_tu_m换手率近1日均值换手率近1日标准差换手率近1日均值近4日均值日间技术st_t1dstvl_0dsttr_0dcrrt_closecrrt_pncrrt_ighcrrtlowcrrt_vapcrrt_vlcrrt_tuncrvl_clsecrvl_oencrvl_ihcrvl_lowcrvl_vwap收益率近0日标准差成交量近0日标准差换手率近0日标准差收益率和收盘价近0日相关系数收益率和开盘价近0日相关系数收益率和最高价近0日相关系数收益率和最低价近0日相关系数收益率和均价近0日相关系数收益率和成交量近0日相关系数收益率和换手率近0日相关系数成交量和收盘价近0日相关系数成交量和开盘价近0日相关系数成交量和最高价近0日相关系数成交量和最低价近0日相关系数成交量和均价近0日相关系数日内技术loihvwapclosekmidklenkmid2kpk2klowklo2ksftksf2lo/ihvwa/closeclosoe/pniglo/pnclosoe/ihlow)ig-et(p,clos)/onig-et(p,clos)/(ighlow)lesspn,cls)low/oenlesspn,cls)low/(iglow)*clos-ighlow/en*clos-ighlow/iglo)资料来源:朝阳永续Win,9选股因子、模型构建方法及网络结构如下列图表。具体细节可参考华泰金工研报《人工智能:图神经网络选股的进阶之路(--。图表:选股模型使用的2个因子类别 名称 计算方式图表:选股模型构建方法步骤参数参数值构建股票池股票池全A股;剔除上市未满3个交易日个股,剔除ST、*ST、退市整理期个股;每个季末截面期,在未停牌个股中,筛选过去1年日均成交额和日均总市值均名前%个股构建数据集特标T日2个基本面和量价因子T+11日相对于T+1日vwap收益率因子预处理特征5倍AD缩尾;zscoe标准化;缺失值填为;不做中性化标签剔除缺失值;截面排序数标准化训练流程测试集完整区间训练、验证、测试集划分特殊处理100~222训练集5*6个交易日,验证集2*2个交易日,测试集6个交易日;如第1期训练集229~0805,验证集202~0031,测试集100~2171;第2期训练集002~2066,验证集200~0171,测试集101~2213剔除训练集、验证集最后0个交易日样本,防止信息泄露设置模型网络结构全连接神经网络(全连接神经网络隐单元损失函tchsize学习率优化器早停次基准为加权mse测试ms、ic或ccc,采用等权或根据收益率衰减加每个交易日的全体股票视作一个tch.01设置模型模型GBst(XGBot)损失函学习率最大迭代次数加权.05交叉验证测试.、.5、.100早停次数最大树深行列采样比例3交叉验证测试、、.8构建组合基准中证0指数优化目标最大化预期收益组合仓位1个股权重下限0个股偏离权重约束%,%]行业偏离权重约束%,%]风格偏离标准差约风格因子调仓周期单次调仓单边换手率上限%,%]对数流通市值(预处理:5倍AD缩尾,scoe标准化)每5个交易日成分股权重约束无回测单边费交易价.02vwap特殊处理停牌不买入卖出一字板涨停不买入一字板跌停不卖出其余可交易股票重新分配权重资料来源:图表:网络结构:结果全部测试模型因子评价指标及回测绩效如下列图表。核心结论如下:特征工程引入的均值因子对神经网络有提升,但削弱了XGost。损失函数中,E表现不突出;C损失单因子测试表现好,但指增组合回测表现差;CCC损失在单因子测试表现一般,但指增组合回测表现较好;加权均优于等权。交叉验证调参改进不显著考虑到时间开销大性价比并不高算力有限前提下使经验超参数即可。模型集成提升较稳定,神经网络类和决策树类模型有互补效果。图表:全部测试模型合成因子评价指标回测期4至)C均
RanIC加权
加权
加权 加权op组精Btm
op组年Btm组年多空对冲年基准收值 均值 均
均值ICIR
ICIR基线
确率 精确
化收益
化收益
化收益率益率.%.%.%.%.0.%.%.%8.%.%.%gb.%.%.%.%.2.%.%.%0.%.%.%特征工程nfe.%.%.%.%.1.%.%.%8.%.%.%g_e.%.%.%.%.2.%.%.%1.%.%.%损失函数nme.%.%.%.%.81.02.64.89.%.%.%9.%.%.%nwmse(基线).%.%.%.%.0.%.%.%8.%.%.%nic.%.%.%.%.4.%.%.%9.%.%.%nwic.%.%.%.%.8.%.%.%9.%.%.%ncc.%.%.%.%.5.%.%.%0.%.%.%nwc.%.%.%.%.9.%.%.%9.%.%.%交叉验证g_cv.%.%.%.%.1.%.%.%9.%.%.%模型集成+gb.%.%.%.%.83.02.66.91.%.%.%1.%.%.%nw+xb.%.%.%.%.0.%.%.%0.%.%.%nf+n_wc+gb.%.%.%.%.83.00.68.91.%.%.%1.%.%.%nf+n_wc+g_cv.%.%.%.%.0.%.%.%1.%.%.%资料来源:朝阳永续Win,图表:全部测试模型回测绩(回测期4至,基准中证0指数)年化收益年化波动夏普
最大回Camr
年化超额
年化跟踪信息比超额收益最大超额收益
相对基准月年化双边换gb
率 率 率 撤
率 益
误差 率 回基线..%.% .62.%.%.% .61.%.32.34.%.%.6.07.%.7%.38.9%.2%.%.%
比率 胜率 手率nfeg_enmenwmse(基线nicnwicnccnwcg_cv
.%.% .66.% .36.92.04.%.%.44.4%.8.92.04.%.%.44.4%.8%.%.%.2.07.88.%.2.07.88.%.%.%.%.6%.8%.19.8%.9%.5%.8%.8%.1%.%.%.%.9%.2%.%.%.% .62.% .32.%.% .42.% .19.%.% .43.% .20.%.% .59.% .31.%.% .66.% .36
.67损失函数.1.38.%..%.% .60.%.33.%.7.23.4%.20.5%.%+gb .%.% .65.% .35nw+xb .%.% .67.% .37nf+n_wc+gb .%.% .70.% .38nf+n_wc+g_cv.%.% .70.% .38.%.9%.1%.2%.3%.53.3%.2%.3%.5%.62.% .0.% .0.% .1.% .1.%.62.73.%.%.8
.% .8.% .6.% .4.% .8.% .2.% .1.% .5.% .2资料来源:朝阳永续Win,特征工程对比引入均值因子前后的表现。神经网络无论在op组收益,还是在指增组合年化超额收益、信息比率方面,均有显著提升。但XGost在上述指标均有较大削弱。原因可能是XGost对均值因子的“过度”使用,具体将在后文探讨。图表:特征工测试模型合成因子评价标(回测期4至)C均RanIC均加权C
加权RaIC
加权 加
op组精Btm组精op组年化收Btm组年化多空对冲年化
基准收值 值
均值ICIR
ICIRRanICIR 确基线
确率 益
收益
收益率 益率..%.%.%.%.0.%.%.%8.%.%.%gb.%.%.%.%.2.%.%.%0.%.%.%nfe.%g_e.%.%.%.%.%.0.44.91.% .% .%8.%1.%.%.%.%.%.%.72.62.%.%资料来源:朝阳永续Win,图表:特征工程测试模型回测绩效(回期4至,基准为中证0指数)年化收
年化波
夏普
最大
Camr比年化超额收益年化跟踪
信息比超额收益最大回超额收益Camr比相对基准月胜年化双边换手gb
率 率 率 撤 率
率 差 率 基线..% .% .62.%.% .% .61.%.32.34.%.%.9% .38.2% .26.%.7%.07.47.%.%.8.6
率 率 率nfe .% .% .66.% .36g_e .% .% .48.% .26.%.4%.8%.44.%.%.04.% .8.% .6.%.67.92资料来源:朝阳永续Win,图表:特征工程测试模型超额收益表现回测期4至,基准为中证0指数)0%
nfe xg_fe n xgb0%0%0%04010-4020-4020-4030-4030-4040-4040-4050-4050-4060-4060-4070-4070-4080-4080-4090-4090-4000-4000-4010-4010-4020-4020-4:朝阳永续, Win,损失函数对比神经网络模型M、C、CCC三类损失函数,以及等权和多头加权两种方式的表现。单因子测试结果可概括为种瓜得瓜种豆得豆”C损失下的C均值和RankIC均值较高,加权C损失下的加权C均值和加权RankIC均值较高。多头加权损失的op组收益均高于对应的等权损失。但单因子测试和指增组合测试存在错位加权C损失的单因子多头收益和对冲收益均高其余损失但指增组合表现却低于除等权C损失外的其余损失CCC损失的单因子表现算突出,但从指增组合表现看,无论是等权和加权,均优于对应的ME和C损失。加CCC损失的年化超额收益和信息比率较出色。图表:损失函数测试模型合成因子评价标(回测期4至)C均
加权C加权
加权 加权op组精Btm组op组年化Btm组年多空对冲年化
基准收值均值均值均值ICIRRanICIRICIRRanICIR确率精确率收益率化收益率收益率益率nme.%.%.%.%.81.02.64.89.%.%.%9.%.%.%nwmse(基线).%.%.%.%.0.%.%.%8.%.%.%nic.%.%.%.%.4.%.%.%9.%.%.%nwic.%.%.%.%.8.%.%.%9.%.%.%ncc.%.%.%.%.5.%.%.%0.%.%.%nwc.%.%.%.%.9.%.%.%9.%.%.%资料来源:朝阳永续Win,图表:损失函数测试模型回测绩效(回期4至,基准为中证0指数)年化收益
年化波动
年化超额
年化跟
超额收
超额收
相对基准年化双边率 率夏普比率最大回撤Camr比
收益
误差信息比
最大回撤Camr比
月胜
换手率nme.%.%.56.%.30.%.8%.19.%.88.%.4nwmse(基线).%.%.62.%.32.%.9%.38.%.07.%.8nic.%.%.42.%.19.9%.5%.21.%.42.%.2nwic.%.%.43.%.20.2%.8%.40.%.70.%.1ncc.%.%.59.%.31.%.8%.30.6%.76.%.5nwc.%.%.66.%.36.%.1%.53.8%.57.%.2资料来源:朝阳永续Win,图表:损失函数测试模型超额收益表现回测期4至,基准为中证0指数)nwse nmse nwc n nic nwccc nccc0%0%0%0%010-40010-4010-4020-4020-4030-4030-4040-4040-4050-4050-4060-4060-4070-4070-4080-4080-4090-4090-4000-4000-4010-4010-4020-4020-4:朝阳永续, Win,交叉验证对比XGost模型时序交叉验证调参的表现调参后的模型仅在指增组合超额收益回撤比指标上有显著提升其余重要指标反而略有削弱但交叉验证调参的时间开(近9小时)远高于不调参(近5分钟,在算力有限情况下性价比不高。需要说明的是,本文采用网格搜索的调参方法效率较低,从而导致调参颗粒度较粗糙。基于贝叶斯优化的调参方法可以提升搜索效率,有待进一步测试。图表:交叉验证测试模型合成因子评价标(回测期4至)C均RanIC
加权
加权RaIC
加权 加
op组精Btm组精op组年化收Btm组年化多空对冲年化
基准收..%.%gb .%g_cv.%
值 均值
均值ICIR.4
ICIRRanICIR 确率.2.81.%.%
确率 益率.%
收益率
收益
益率.%.%.%.%0.%.%.%0.%9.%.%.%.%.%.%.%.%图表:交叉验证测试模型回测绩效(回期4至,基准为中证0指数)年化收
年化波
夏普
最大
Camr比年化超额收益年化跟踪
信息比超额收益最大回超额收益Camr比相对基准月胜年化双边换手率率率撤率率差率撤率率率gb .%.%.61.%.34.%.2%.26.7%.47.%.6g_cv .%.%.60.%.33.%.5%.20.4%.23.%.7资料来源:朝阳永续Win,图表:交叉验证测试模型超额收益表现回测期4至,基准为中证0指数)0%
xg_cv xgb0%0%0%010-4010-4010-4020-4020-4030-4030-4040-4040-4050-4050-4060-4060-4070-4070-4080-4080-4090-4090-4000-4000-4010-4010-4020-4020-4:朝阳永续, Win,模型集成对比模型集成后的表现各集成模型在单因子加权RankC均值多空收益指增组合年超额收益、信息比率上均有显著提升。并且子模型为改进模型(后3组)的表现优于子型为原始模(xg对比前述特征工程损失函数交叉验证的技巧模型集成带来的提升幅度更大且效应更稳定。图表:模型集成测试模型合成因子评价标(回测期4至)C均
RanIC加权
加权
加权 加权op组精Btm
op组年Btm组年多空对冲年基准收值 均值 均
均值ICIR
ICIR基线
确率 精确
化收益
化收益
化收益率益率.%.%.%.%.0.%.%.%8.%.%.%gb.%.%.%.%.2.%.%.%0.%.%.%模型集成+gb.%.%.%.%.83.02.66.91.%.%.%1.%.%.%nw+xb.%.%.%.%.0.%.%.%0.%.%.%nf+n_wc+gb.%.%.%.%.83.00.68.91.%.%.%1.%.%.%nf+n_wc+g_cv.%.%.%.%.0.%.%.%1.%.%.%资料来源:朝阳永续Win,图表:模型集成测试模型回测绩效(回期4至,基准为中证0指数)年化收益年化波动夏普
最大回Camr
年化超额
年化跟踪信息比超额收益最大超额收益
相对基准月年化双边换gb
率 率 率 撤
率 益
误差 率 回基线..%.% .62.%.%.% .61.%.32 .% .9% .38.34 .% .2% .26.%.7%.07 .%.47 .%.8.6
比率 胜率 手率+gb .%.% .65.% .35nw+xb .%.% .67.% .37nf+n_wc+gb .%.% .70.% .38nf+n_wc+g_cv.%.% .70.% .38.%.9%.1%.2%.3%.53.3%.2%.3%.5%.62.% .0.% .0.% .1.% .1.%.62.73.%.%.8资料来源:朝阳永续Win,图表:模型集成测试模型超额收益表现回测期4至,基准为中证0指数)n+xgb nwccc+xgb nf+n_wccc+xgbnfnf+n_wccc+xg_cv xgb0%0%0%0%0%010-40010-4010-4020-4020-4030-4030-4040-4040-4050-4050-4060-4060-4070-4070-4080-4080-4090-4090-4000-4000-4010-4010-4020-4020-4:朝阳永续, Win,讨论均值因子在神经网络和XGBoost间的差异,兼谈如何使用弱因子特征工程引入均值因子提升神经网络表现但削弱Xost表现要弄清此中原因相于用线性的人脑理解非线性模型的工作机理,难度颇大,我们尝试从下列角度分析。首先,我们提出一个假设:均值因子属于弱因子,有用,但比重不宜过大。前文提到,均值因子是对市场环境的刻画,有一定信息量;高分队伍的实践也表明该因子有效。但我们同时观察到,比赛中第、2名未使用全部0个匿名特征构建均值因子,而是筛选C前0个特征构建均值因子从数量上比重不高模型对均值因子的使用是有限度的并且从理论上分析,选股模型应侧重于个股信息的挖掘,市场环境信息只起到辅助作用。其次考察Gost模型的特征重要性计算各期特征重要性均值部分结果如下表在引入均值因子的xg_fe模型中,重要性最高的特征为_f_men,即_f的均值因子。重要性排名前0的特征中,均值因子占据4位。Boost模型全部均值因子重要性之和占比,接近一半水平,比重较高。图表:gb_e模型各期特征重要性均值前0的特征排序 因子 gb g_e1lfman-.3%2crvl_ih.7%.1%3lf.1%.5%4_tm.2%.4%5trm.1%.1%6st_mman-.1%7ep_trtunm.1%.9%8ep_trtunmmen-.8%9vwapclose.9%.8%cno_men-.7%资料来源:朝阳永续Win,再次,测试均值因子缩放系数的影响。预处理环节,我们对均值因子整体乘以,突出原始因子作用,弱化均值因子影响。需要说明的是,从两类模型的原理看,特征的相对量级对神经网络有效对XGost影响不大我们进一步测试均值因子缩放系数为-4和1时的表现以验证上述猜想。结果如下表所示,当缩放系数为,即不对均值因子做缩放处理时,神经网络和Gost均表现较差。随着缩放系数的降低神经网络有显著提升在系数为1时已能战胜原始模型;Gost变化不大,都不能战胜原始模型。由此可见,神经网络主动降低均值因子值有一定效果,但对XGost不起作用。图表:均值因缩放系数测试模型合成子评价指标(回测期4至)C均RanIC
加权C加权
加权 加权op组精Btm组op组年
Btm
多空对冲年基准收ggb.%.%.%.%.%.%.68.80.%.%.%0.%7.%1.%6.%.%.% .%.% .%.% .%.% .%.3.%.%.%.%.%.%.%.%.71.78.%.%.%.%.%.%.%.%.%.%.%8.%8.%8.%0.%.%.% .%.% .%.% .%.% .%.3.65.%.%.%.%.%.%n .%nfsal=e-4 .%nfsal=.01 .%.2.%.2.%.%
均值 均值
均值ICIR
ICIRRanICIR
确率 精确率
收益率年化收益
化收益
益率.%.%.%.%.%.%g__cle=1e4.%.%g__cle=0.1 .%g__cle=1 .%资料来源:朝阳永续Win,
.%.%.%.%.%图表:均值因缩放系数测试模型回测效(回测期4至,基准为中证0指数)年化收
年化波夏普比最大
Camr年化超额收益年化跟踪误信息
超额收益最大超额收益Camr相对基准月
年化双边换益率动率率撤比率率差率回撤比率率手率.%.%.62.%.32.%.9%.38.%.07.%.8nfsal=e-4.%.%.66.%.36.%.4%.44.%.08.%.1nfsal=.01.%.%.66.%.36.%.4%.44.%.04.%.8nfsal=1.2%.%.32.%.14.5%.8%.11.%.36.%.1gb.%.%.61.%.34.%.2%.26.7%.47.%.6g__cle=1e4.%.%.46.%.25.%.7%.55.%.74.%.9g__cle=0.1.%.%.48.%.26.%.8%.67.%.92.%.6g__cle=1.%.%.48.%.27.%.6%.62.%.03.%.8资料来源:朝阳永续Win,最后,从理论角度分析两类模型训练过程。XGost对特征进行随机采样,在采样的候选特征中寻找最优划分方式并非从全部特征中搜索Boost引入均值因子这类弱因子后,原始特征被采样到的概率下降,可能被排除在候选特征外,导致模型预测效果下降。神经网络不涉及特征采样操作,因此可以通过缩小取值的方式,在合理限度内使用弱因子。SE和IC损失函数的差异,兼谈因子合成和组合优化的目标错配问题本文另一个“反直观”的结论是C和加权C作为损失函数,单因子测试表现较好,但增组合表现较差,弱于ME和CCC损失。这也是因子投资长期存在的痛点,难度同样颇大,我们尝试做如下分析。一个不会出错的回答是:单因子测试和策略回测有差异,其背后是因子合成和组合优化两步的目标错配。该问题早已为研究者关注,常用的样本多头加权,正是针对指数增强多头组合在因子合成这步进行的修(尽管未必是最佳解决方法使因子合成的目标尽可向组合优化的现实场景靠拢。然而这并不能解答本文遇到的问题即使是加权C损失在分0层多头收益高于加权ME和加权CCC的情况下(%,高于%和%,指增组合超额收益仍然大幅落后(%,低于%和%,这又如何解释?容易想到的解释是分0层还不够细随着A股市场的扩容指增选股数量在股票池的占比进一步减小,选股更加向头部集中。目前行业里常见的做法是分0层测试,结果如下图加权C多头端收益仍然优于加权ME和加权CCC。看来问题不在于评价指标是分0层还是0层。图表:部分测试模型合成因子分0层回测年化收益率nwse nwc nwccc0%0%0%0%1%2%3%4%5%1 2 3 4 5 6 7 8 9 0123456789:朝阳永续, Win,可否考察加权C超额收益低于加权ME的交易日,从个案出发寻找线索?我们统计加权ME相比加权C近0日超额收益差距最大的交易日为5年1月9日由于预测区间为未来0个交易日,前推0日为5年1月5日。我们对比该截面日下,各模型的预测值和真实值,如下图所示。左图加权ME模型的C值为1低于右图加权C模型的C值但观察预测(横轴排名靠前的样(红点为前5名这些点在左图对应的纵坐标也较大表明真实收益高,但在右图的纵坐标不算高。这些预测值靠前的股票有大概率会被选中,且分配较高权重该截面日股票池有17只有效样本即使分0层测试由于分层组合收益通常为等权重计算这些点也会被淹没在op组的0多只股票中但恰恰是这些样本很大程度上右了策略的收益。图表:nnwme模型预测值和真实值对比(5截面日) 图表:nnwic模型预测值和真实值对(5截面日)C=.1 C=.6真实值(未来日收益排序标准化)真实值(未来日收益排序标准化).0.5)1.0)1.5)2.0)0.4) 0.2) .0 .2 .4 .6ms预测值
.0真实值(未来
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- vf期末复习资料:第十六章
- 骨盆前倾测试题目及对应答案
- 网络资源测验试题与详细答案
- 关于阿米巴痢疾的试题及答案分享
- 2025年5月住院医师规范化培训《核医学科》复习题与参考答案
- 小学英语三年级上册Unit 2‘My School Things’单元总结与探索课教案
- 小学三年级数学《三位数加减估算:真实问题中的近似策略》导学案
- 初中九年级英语上册第一单元话题三SectionA听说课教案
- 高职工业自动化技术专业三年级《智能传感器检定与维护》项目式教学设计
- 小学五年级数学《求小数的近似数》单元整体教学设计
- 建筑工程管理专业中级职称理论考试题及答案(2026年)
- 2026湖北黄石市阳新县事业单位统一招聘107人笔试参考题库及答案详解
- ESG可持续发展管理程序(Environmet环境模块)
- 针刺伤预防与处理(中华护理学会团体标准)
- 管道光缆工程作业指导书
- DBJ43-T 315-2016 现浇混凝土保温免拆模板复合体系应用技术规程
- 免疫力与神经退行性病变:免疫应答与帕金森病、多系统萎缩的关系
- 接受证据清单
- 团员组织关系转接介绍信(样表)
- 语文课程与教学论课件
- GB/T 6913-2023锅炉用水和冷却水分析方法磷酸盐的测定
评论
0/150
提交评论