银河金工组合优化系列报告:基于深度学习预测与强化学习优化的指数增强策略_第1页
银河金工组合优化系列报告:基于深度学习预测与强化学习优化的指数增强策略_第2页
银河金工组合优化系列报告:基于深度学习预测与强化学习优化的指数增强策略_第3页
银河金工组合优化系列报告:基于深度学习预测与强化学习优化的指数增强策略_第4页
银河金工组合优化系列报告:基于深度学习预测与强化学习优化的指数增强策略_第5页
已阅读5页,还剩27页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

目录Catalog一、基于深度学习预测+强化学习优化的策略框架 3(一)指数增强框架:从静态因子到动态决策 3(二)总体策略框架与流程图 3二、强化学习优化:动态决策资产配置权重 4(一)强化学习优化:从静态配权到动态决策 4(二)指数增强问题的马尔科夫过程表述 4(三)PPO模型:稳定更新连续权重策略 7(四)PPO模型:训练与筛选 10(五)Banach不动点迭代:让目标权重与组合价值自洽 12(六)一个生活化例子:每周买菜预算与组合调仓 12三、强化学习有效性检验 13(一)Pipeline筛选结果模型:回测结果分析 13(二)消融组结果对比 16四、模型应用实例:指数增强策略 19(一)指数增强组合优化框架 19(二)沪深300指数增强策略 20(三)科创50指数增强策略 22(四)回测结果对比:强化学习VS凸优化 24五、风险提示 29六、附录 29(一)可调参数列表 29(二)状态空间变量列表 30图1:总体策略框架与流程图

一、基于深度学习预测+强化学习优化的策略框架(一)指数增强框架:从静态因子到动态决策传统因子选股与指数增强方法一般遵循因子挖掘、因子打分、组合优化的框架,其优势在于逻辑清晰、可解释性较强,但在权益市场中,当面临风格切换、因子交易拥挤等情况时,仅采用静态因子可能面临因子失效问题,甚至可能导致更大幅度的回撤。在前篇报告《时序截面三层深度学习模型预测收益风险信号》中,我们构建了TimeEncoder-GraphSAGE-MLP三重特征提取模型,对Sharpe比率、最大回撤等多个收益风险指标进行了预测,形成未来收益风险的预测信号,并通过回测验证了信号在投资实践中的有效性。本报告将在深度学习预测收益风险信号的基础上,进一步将静态决策转化为动态决策问题,将前篇报告中“信号预测+组合优化”指数增强框架拓展为“深度学习预测+强化学习优化”两层决策体系。其中,第二层由PPO模型承担,目标是在给定约束条件、当前仓位、市场状态等条件下,将预测信号转化为可执行的动态权重,并通过Banach不动点迭代对输出权重进行微调,以平滑交易成本对组合规模的影响。本框架的核心优势在于以最基础的K线数据作为输入值,可一键实现收益风险信号预测和个股权重决策,为投资实践提供有效参考。(二)总体策略框架与流程图从整体逻辑看,本文将指数增强问题拆分为连续衔接的八个环节:原始数据输入、数据清洗与标签构造、K线衍生特征工程、时序编码、截面图网络聚合、多标签预测、强化学习组合优化、回测执行与评估。其中,深度学习部分以K线数据通过滑动窗口构建特征工程TimeEncoder-GraphSAGE-MLP三重特征提取模型,在时间维度上通过TimeEncoder提取趋势和波动模式,在截面维度上通过GraphSAGE模型识别股票间的联动关系,并最终通过MLP模型对超额收益、Sharpe比率、最大回撤等多个收益风险指标进行了预测,形成未来收益风险的预测信号。训练完成后,系统进一步根据验证集RankIC进行质量筛选,避免低质量预测直接进入后续组合优化。

强化学习部分则把组合管理视为一个序列决策问题,将预测信号、约束条件、已有持仓以及交易成本共同纳入状态空间,使组合权重的调整不再是单次静态求解,而是面向长期路径表现的连续决策;而在定义奖励函数时,我们采用了包含预测信号、超额收益、换手与跟踪误差惩罚等多项在内的综合惩罚。在PPO模型给出个股配置权重预测结果后,我们加入了Banach不动点迭代模块,以更真实地刻画交易成本,并尽量降低交易成本对组合规模的损耗。二、强化学习优化:动态决策资产配置权重指数增强策略的组合构建是一个多约束的优化问题。对于成分股数量较多、基准权重动态变化、调仓成本与跟踪误差约束同时存在的指数增强产品而言,组合权重具有明显的路径依赖特征:上一期持仓会影响本期换手率,本期主动偏离会影响下一期跟踪误差,而交易成本会直接影响净值结果。因此,本报告将组合优化表述为一个带有基准约束的序列决策问题,并采用近端策略优化算法(PPO,ProximalPolicyOptimizatioTh)与BaThach自融资投影相结合的方式生成组合目标权重。强化学习的引入,使得组合权重的生成方式由“单期求解”提升为“动态策略学习”。组合优化问题天然具备状态、动作、转移与奖励四个核心要素,这为强化学习提供了较为完整的应用场景。我们用离散时间动态指数跟踪框架,将指数跟踪与再平衡问题表述为多期优化问题,并通过PPO与Banach不动点迭代实现对高维状态和非线性交易成本的统一处理。(一)强化学习优化:从静态配权到动态决策传统单期优化通常以当期预测值或因子得分为核心输入,在给定基准权重的基础上,对主动权重进行一次性调整。该类方法的优点是结构清晰、求解快速,但其隐含前提是:当期最优即能够代表跨期最优,且调仓成本可以通过简化惩罚项加以近似处理。对于现实中的指数增强组合,这一隐含假设并不完全成立。首先,达到收益风险最优不仅与当期横截面排序有关,还受到历史持仓路径影响。其次,实际交易成本与成交金额、成交股数等不是简单的线性关系,假设固定的交易费率并不符合现实。最后,跟踪误差控制具有跨期属性,单期优化难以识别这种路径依赖,例如,若组合在某一期为了追逐短期信号大幅偏离基准,下一期可能面临较高的换手和跟踪误差回归成本;若过度压制换手率,组合又可能无法及时利用新信号。基于以上问题,我们引入强化学习模型动态配置个股权重。强化学习的优势在于,它不局限于“某一时点的最优权重”,而是学习一个策略函数:在给定信号、持仓、基准和风险状态下,应如何调整组合权重。用公式可表达为𝑡𝜋𝜃:↦𝑎𝑡, =𝛷(𝑎𝑡,𝑤𝑏,𝒞𝑡)𝑡𝑡其中,𝑠𝑡为组合状态;𝑎𝑡为策略网络输出的连续动作,在指数增强策略中即为个股配置权重;𝑤𝑏为当期基准权重,𝐶𝑡表示可投资股票集合、持仓数量、行业风格约束、交易成本约束等组合状态与约束条件,𝛷(⋅)则代表从动作到可交易权重的映射。𝑡强化学习的输入值来自于前序深度学习预测模块的输出值。报告《时序截面三层深度学习模型预测收益风险信号》中,我们已经验证了深度学习模型输出的Sharpe比率和最大回撤信号预测效果可观,且在指数增强策略中能有效获取超额收益、控制回撤,因此我们将此作为强化学习模型的输入值,这样强化学习的输入值更具有前瞻性,使模型在训练过程中较少受到历史数据的噪声影响。将预测值作为状态核心变量,相当于先用前序模型完成“信息提纯”,再由强化学习完成“权重映射”,从而形成“预测—决策”两层分工。(二)指数增强问题的马尔科夫过程表述在强化学习框架下,指数增强组合优化可表达为马尔可夫决策过程(MarkovDecisionProcess,MDP):ℳ=(𝒮,𝒜,𝑃,𝑟,𝛾)其中,𝒮表示状态空间,𝒜表示动作空间,𝑃(𝑠𝑡+1|𝑠𝑡,𝑎𝑡)表示市场状态转移机制,𝑟𝑡=𝑟(𝑠𝑡,𝑎𝑡)为奖励函数,𝛾∈(0,1)为未来奖励折现因子。对应到指数增强任务,状态空间描述“个股未来收益风险预测与组合约束”,动作描述“主动权重调整方向与幅度”,奖励描述“调仓是否大幅偏离约束限制、是否实现更高的超额收益与风险收益平衡”。这样,一方面组合管理目标能够通过奖励函数显式表达,另一方面,强化学习优化器作为“预测—组合”的连接层,可避免把预测误差直接放大为组合偏离。状态空间:收益风险、持仓位置、交易约束与市场环境状态空间包括当前收益信号、当前风险信号、当前基准权重、当前主动偏离,叠加回溯窗口(lookback ow)内收益信号均值、风险信号均值、个股收益均值与波动,以及部分组合特征与市场环境特征。𝑡𝑠𝑡=[𝑓𝑡,𝑧𝑡,𝑤𝑏,𝑑𝑡−1,𝑓𝑡−𝐿:𝑡−1,𝑧𝑡−𝐿:𝑡−1,𝑟𝑡−𝐿:𝑡−1,𝜎(𝑟𝑡−𝐿:𝑡−1),𝑚𝑡]𝑡𝑡𝑑𝑡−1=𝑤𝑡−1−𝑤𝑏𝑡其中,𝑓𝑡表示收益信号alpha_factor,本报告中一般定义为深度学习模型的alpha预测结果与Sharpe比率预测结果(标准化后)之和,即𝑎𝑙𝑝ℎ𝑎_𝑓𝑎𝑐𝑡𝑜𝑟=𝑎𝑙𝑝ℎ𝑎_𝑧+𝑠ℎ𝑎𝑟𝑝𝑒_𝑧当alpha模型未训练或预测质量不足时,alpha_factor可自动回退为sharpe_z,以避免低质量alpha对后续强化学习的污染。𝑧𝑡表示风险信号,在当前框架中即等于最大回撤的深度学习预𝑡测值max_drawdown_z。𝑤𝑏为基准权重;𝑡1为上一期组合相对基准的主动偏离;𝐿为回溯窗口长𝑟𝑡−𝐿:𝑡−1和𝜎(𝑟𝑡−𝐿:𝑡−1)分别为个股在回溯窗口内的收益均值与波动。组合与市场特征𝑚𝑡包含组合当𝑡前的总资产𝑉𝑡、收益与风险暴露𝑑⊤𝑓𝑡和𝑑⊤𝑧𝑡、换手率𝑇𝑂𝑡−1、跟踪误差𝑇𝐸𝑡−1、个股平均权重𝐴𝑐𝑡𝑖𝑣𝑒𝐶𝑛𝑡𝑡、𝑡−1 𝑡−1组合超额收益𝑟𝑝−𝑟𝑏等,并加入权益市场收益特征𝑟𝑏、𝑟𝑏 ,和𝜎(𝑟𝑏 )帮助强化学习模型学习当𝑡 𝑡前市场牛熊。

𝑡 𝑡−𝐿:𝑡−1

𝑡−𝐿:𝑡−1𝑚𝑡=[𝑉𝑡,𝑑⊤𝑓𝑡,𝑑⊤𝑧𝑡,𝑇𝑂𝑡−1,𝑇𝐸𝑡−1,𝐴𝑐𝑡𝑖𝑣𝑒𝐶𝑛𝑡𝑡,max(𝑓𝑡),min(𝑓𝑡),𝑚𝑒𝑎𝑛(𝑓𝑡),𝑚𝑒𝑎𝑛(𝑧𝑡),𝑡−1

𝑡−1

𝑟𝑏,𝑟𝑏 ,𝜎(𝑟𝑏 ),𝑟𝑝−𝑟𝑏]𝑡𝑡−𝐿:𝑡−1 𝑡−𝐿:𝑡−1𝑡 𝑡𝑡状态设计的经济含义包括三方面:收益风险预测信号𝑓𝑡和𝑧𝑡反映“机会和风险在哪里”;基准权重与组合偏离𝑤𝑏与𝑑𝑡−1反映“当前组合偏离基准的幅度”;换手率、跟踪误差、指数收益和组合超额等特征反应“调整持仓权重可能带来的成本与风险代价”。𝑡动作空间:从连续动作到可执行目标权重PPO模型是一种结合策略网络决策(Actor)和价值函数评估(Critic)的强化学习架构,其中Actor负责输出动作分布,Critic负责估计状态价值。但与凸优化结果不同,PPO的Actor网络输出结果并不是组合权重,而是每只股票的连续动作打分。代码中Actor网络采用多层MLP结构,输入值为前文定义的状态空间𝑠𝑡,隐藏层维度为(256,256,128),每层包含线性变换、层归一化(LayerNorm)与非线性激活;输出结果经3∗𝑡𝑎𝑛ℎ(缩放后作为正态分布均值。𝜇𝜃(𝑠𝑡)=3·tanh(𝑔𝜃(𝑠𝑡)), =𝑒𝑥𝑝(log𝜎)𝜃𝑎𝑡∼𝒩(𝜇𝜃(𝑠𝑡),𝑑𝑖𝑎𝑔(𝜎2))𝜃如上所示,𝑡为输入值状态空间,𝜃(为Actor网络,𝜇𝜃𝑡)为Actor网络输出结果经缩放后的𝜃正态分布均值;𝜎𝜃为正态分布标准差。最终输出的动作向量𝑎𝑡在𝒩(𝜇𝜃(𝑠𝑡),𝑑𝑖𝑎𝑔(𝜎2))的正态分布中随机生成,由于随着训练步数增加𝜎𝜃的值逐渐下降,最终输出的动作向量将无限趋近于正态分布均值。𝜃动作向量经过Clip裁剪与Softmax函数激活后形成主动目标权重。为提高主动权重分布的区分度,当前代码将动作裁剪在[-5,5]区间,并使用较低的温度参数(Softmaxemperature,本策略取值为𝜏=0.5),使高动作分数股票获得更明显的主动配置权重。𝑤𝑎𝑐𝑡=𝑒𝑥𝑝(𝑎𝑖,𝑡/𝜏)⋅𝟏𝑖∈𝒰𝑡

𝑎=

,−5,5) 𝜏=0.5𝑖,𝑡

∑𝑗∈𝒰𝑡𝑒𝑥𝑝(𝑎𝑗,𝑡/𝜏)

𝑖,𝑡

𝑖,𝑡最后,主动目标权重与基准权重按照主动比例加权,经归一化后得到最终目标权重。以𝜌表示主动比例参数active_share,则目标权重可以写为:𝑤𝑡𝑎𝑟=𝑁𝑜𝑟𝑚((1−𝜌)𝑤𝑏+𝜌𝑤𝑎𝑐𝑡), 𝜌∈[0,𝑡 𝑡 𝑡其中𝑤𝑏为基准权重,𝑤𝑎𝑐𝑡为主动目标权重,𝑁𝑜𝑟𝑚(⋅)表示归一化,确保权重非负且和为1。代码𝑡 𝑡还引入了持仓数量约束,默认最多持有当期成分股数量的40%,即保留权重最大的若干股票后重新归一化。这样可以在增强策略中保留一定主动暴露空间,避免组合过度接近基准而难以产生超额。奖励函数设计:把指数增强目标翻译成可学习信号我们将奖励拆分为实际超额收益、收益信号排名暴露、高风险暴露惩罚、跟踪误差惩罚、换手惩罚和可选集中度惩罚,使得模型在控制跟踪误差和换手率的同时,尽量在可控的风险水平下获得更高的超额收益。奖励函数𝑟𝑡可表达为𝑟𝑡=𝜆𝑒𝑥𝑐𝑒𝑠𝑠⋅𝐸𝑅𝑡+𝜆𝑓𝑎𝑐𝑡𝑜𝑟⋅𝐹𝑅𝑡+𝑅𝑃𝑡+𝑇𝐸𝑃𝑡+𝑇𝑂𝑃𝑡+𝐶𝑃𝑡其中各子项定义如下:𝐸𝑅𝑡表示实际超额收益直接衡量组合是否跑赢基准,奖励正超额收益。𝐸𝑅𝑡=𝑟𝑝−𝑟𝑏=𝑤⊤𝑅𝑡−𝑟𝑏𝑡 𝑡 𝑡 𝑡𝐹𝑅𝑡为是收益信号排名暴露,鼓励组合超配高排名股票、低配低排名股票。设𝑟𝑎𝑛𝑘𝑝𝑐𝑡(𝑓𝑡)为主信号的截面百分位排名,则:𝑡𝐹𝑅𝑡=(𝑤𝑡−𝑤𝑏)⊤𝑟𝑎𝑛𝑘𝑝𝑐𝑡(𝑓𝑡)𝑡𝑅𝑃𝑡为风险惩罚,若𝑧𝑡的方向被处理为“值越大风险越低”,那么当组合主动偏离在𝑧𝑡上的暴露为负时,意味着组合相对基准更偏向高风险股票,需要受到惩罚:𝑡𝐴𝑢𝑥𝐸𝑥𝑝𝑡=(𝑤𝑡−𝑤𝑏)⊤𝑧𝑡𝑡𝑅𝑃𝑡=−𝜆𝑎𝑢𝑥⋅max(0,−𝐴𝑢𝑥𝐸𝑥𝑝𝑡)𝑇𝐸𝑃𝑡为跟踪误差惩罚,只在超过目标阈值后触发,这为组合保留必要的主动偏离空间:𝑇𝐸𝑡=‖𝑤𝑡−𝑤𝑏‖𝑡2𝑇𝐸𝑃𝑡=−𝜆𝑡𝑟𝑎𝑐𝑘𝑖𝑛𝑔⋅

2[max(0,𝑇𝐸𝑡−𝑇𝐸𝑡𝑎𝑟𝑔𝑒𝑡)]2𝑇𝐸 +𝑇𝐸 +换手惩罚𝑇𝑂𝑃𝑡用于降低交易频率,避免策略过度追逐噪声信号:𝑁=−𝜆𝑡𝑢𝑟𝑛𝑜𝑣𝑒𝑟⋅∑ |𝑤𝑖,𝑡−𝑤𝑖,𝑡−1|𝑖=1集中度惩罚𝐶𝑃𝑡是可选项,例如当需要控制组合前5大重仓股集中度不能超过阈值𝑤𝑡𝑎𝑟𝑔𝑒𝑡时,集中度惩罚可定义为5 2𝐶𝑃𝑡=−𝜆𝑐𝑜𝑛𝑐𝑒𝑛𝑡𝑟𝑎𝑡𝑖𝑜𝑛[max(∑𝑤𝑖,𝑡−𝑤𝑡𝑎𝑟𝑔𝑒𝑡,0)]𝑖=1(三)PPO模型:稳定更新连续权重策略Actor网络和Critic网络Actor网络和Critic网络都是多层MLP本报告中,Actor和Critic均以状态向量𝑡为输入,其中Actor网络输出动作分布均值𝜇𝜃(𝑡,动作分布的对数标准差为独立可学习参数,训练中会同步迭代更新;Critic网络结合多层全连接、层归一化与非线性激活完成特征学习,最终输出当前状态对应的长期期望价值,为策略优化提供评估依据。在反向传播阶段,Actor与Critic的所有参数会被同时联合更新,由同一个优化器统一迭代。PPO的核心优势在于通过裁剪替代目标函数(ClippedSurrogateObjective)限制新旧策略的偏离幅度,从而避免策略更新幅度过大导致训练震荡。下文中我们将从损失函数的定义详细解PPO的优势所在。损失函数PPO模型的整体损失函数由策略损失(ActorLoss)、价值函数损失(CriticLoss)和熵正则项(EThtropyLoss)组成:ℒ(𝜃,𝜙)=−𝐿𝐶𝐿𝐼𝑃(𝜃)+𝑐

1 2⋅(𝑉(𝑠)−𝑅)−

⋅ℋ(𝜋(⋅|𝑠))𝑣2

𝜙𝑡 𝑡

𝜃 𝑡其中,𝐿𝐼𝑃(𝜃为Actor损失,即更新策略带来的偏离幅度;𝑐⋅1(𝑉(𝑠)−𝑅)2为Critic损失,𝑣2𝜙𝑡 𝑡其中𝑐𝑣为价值函数损失权重;−𝑐𝑒⋅ℋ(𝜋𝜃(⋅|𝑠𝑡))为熵奖励,𝑐𝑒为熵系数。Actor损失在训练过程中,Actor网络的损失函数可表达为𝐿𝐶𝐿𝐼𝑃(𝜃)=𝔼[min[𝑟(𝜃)𝐴,𝑐𝑙𝑖𝑝(𝑟(𝜃),1−𝜖,1+𝜖)𝐴]] 𝑟(𝜃)=𝜋𝜃(𝑎𝑡|𝑠𝑡)𝑡 𝑡 𝑡 𝑡

𝑡

𝜋𝜃

(𝑎𝑡|𝑠𝑡)其中,𝐴𝑡为优势函数估计,𝜖为裁剪系数,𝜋𝜃(𝑎𝑡|𝑠𝑡)是当前新策略选择动作𝑎𝑡的概率。当新策略相对于旧策略变化𝑟𝑡(𝜃)过大时,clip项会限制目标函数的更新幅度在[1−𝜖,1+𝜖]范围内,从而提升训练稳定性。对目标函数更新幅度的裁剪正是PPO核心优势的体现。优势函数使用广义优势估计GAE(GeneralizedAdvantageEstimation),其核心思想是在偏差与方差之间进行平衡:𝛾为折现因子,𝜆是平衡偏差和方差的超参数,较大的𝜆更接近用完整轨迹回报估计优势,偏差较低、方差较高;较小的𝜆更接近一步时序差分误差,方差较低、偏差较高。优势函数𝐴𝑡的计算公式为∞𝐴𝑡=∑ (𝛾𝜆)𝑙𝛿𝑡+𝑙=+𝛾𝜆𝛿𝑡+1+(𝛾𝜆)2𝛿𝑡+2+⋯𝑙=0其中𝑡为一步时序差分误差(emporalDifferenceError,TDError),刻画了在当前状态𝑠𝑡执行动作𝑎𝑡后所得到的奖励(包括当前的即时奖励与下一时刻状态价值的现值与当前状态价值的差值。换而言之,TDError衡量执行当前动作带来的组合价值改善的期望值。在本模型中可表示为𝛿𝑡=𝑟𝑡+𝛾𝑉(𝑠𝑡+1)⋅(1−Ι𝑡{𝑡≥𝑇})−𝑉(𝑠𝑡)公式中𝑟𝑡为前文所定义的奖励函数,Ι𝑡{𝑡≥𝑇}是判断回合是否已到达终止时间𝑇,𝑉(𝑠𝑡)是状态价值,折现因子𝛾衡量对未来组合价值的关注度。值得注意的是,这里的𝑉(𝑠𝑡)表示在进行反向传播更新PPO模型参数前,用旧的Critic网络计算出的Value值;而𝑉𝜙(𝑠𝑡)表示训练过程中经过一批batch更新参数后、新的Critic网络计算出的alue值。将未来的TDError贴现求和即可得到优势函数,其代表了长期价值的边际改善。在指数增强策略中,优势函数刻画了单次调仓动作对指数增强核心目标(包括超额收益、风险控制、跟踪误差与换手率约束等)的边际贡献。Critic损失Critic损失是组合长期真实价值的MSE损失,其中𝑉𝜙(𝑠𝑡)是参数更新后预测的状态价值;𝑅𝑡是参数更新前的状态真实价值,即Critic函数的监督学习目标,公式可表示为𝑡=𝐴𝑡+𝑉(𝑡)。在PPO模型训练过程中,在反向传播更新参数前,首先需要根据当前状态𝑡以更新前的Actor网络产生动作、并以更新前的Critic网络计算对应alue,这样即可得到每一调仓日的TDError。TDError贴现求和得到GAE的值𝐴𝑡,将GAE与对应时间的状态价值𝑉(𝑠𝑡)相加,即为PPO参数更新前该时点带优势修正的长期状态真实价值。因此我们采用MSE方法计算Critic损失,目的也是使得Critic网络尽可能拟合长期真实回报。熵正则项熵正则项(EThtropy)用于衡量Actor网络输出的动作分布的不确定性,可鼓励Actor网络保持探索,防止过早收敛到次优策略。在公式ℋ(𝜃|𝑡)中,𝜃(⋅|𝑡为Actor网络在状态空间𝑡下输出的动作正态分布,ℋ(·)为熵的计算公式。具体而言,前文中我们已说明PPO模型输出的动作服从正态分布,即𝜃𝑎𝑡∼𝒩(𝜇𝜃(𝑠𝑡),𝑑𝑖𝑎𝑔(𝜎2))𝜃则对于当期组合中第i个股票,其熵值为1 1() (2) (

(2)𝐻𝑑=2ln(2𝜋∙𝑒∙𝑑𝑖𝑎𝑔𝜎𝜃)=2[ln2𝜋

+1+2ln(𝑑𝑖𝑎𝑔𝜎𝜃)]总熵值为各股票熵值之和:𝑁 𝑁ℋ(𝜋(⋅|𝑠))=∑𝐻(𝑑)=𝑁(ln(2𝜋)+1)+∑ln(𝑑𝑖𝑎𝑔(𝜎2))𝜃 𝑡

𝑖=1

𝑖

𝑖=1

𝜃𝑖熵越大,说明动作越分散,探索性越强;熵越小,说明动作越集中,Actor网络倾向于输出确定性的最优仓位。加入熵正则项可以奖励训练初期随机探索,降低过拟合的风险。损失计算与反向传播PPO模型从获取状态、计算价值到反向传播更新参数的流程如下图所示。图2:PPO模型反向传播流程图国银河证券研究院(四)PPO模型:训练与筛选与前篇报告中深度学习模型的训练一致,本报告的PPO模型同样采用逐年滚动训练的方法,每年年初采用最近4年的数据重新进行模型训练,并使用训练好的模型预测当年的个股配置权重。具体训练参数设置如下:训练集与测试集对于沪深300,我们采用最近4年的数据为训练集,其中最近2-4年的数据用于纯训练,最近1年的数据为验证集;未来1年的数据为测试集。例如,如果我们需要训练预测2026年权重的模型,则2022-2024年数据为训练集,2025年数据为验证集;2026年数据为测试集,用于生成回测配置权重。对于科创50,我们采用最近3年的数据为训练集,其中最近2-3年的数据用于纯训练,最近1年的数据为验证集;未来1年的数据为测试集。模型质量诊断采用双窗口+双门槛机制,具体而言:首先,将1年的验证集平均划分为两个窗口,分别在两个窗口内计算平均奖励和回测累计超额收益率。其次,在每个窗口内判断平均奖励是否大于0.02、累计超额收益是否大于8%。在代码中,我们设置平均奖励大于0.02得1分、累计超额收益大于8%得1分,单窗口综合得分最高为2分,验证集累计综合得分最高为4分。最后,如果整个验证集综合得分大于等于2分,则模型通过质量诊断。重试机制与权重预测对于一个模型的训练,目前我们设置5个随机数种子区间、每个种子区间内最多重训练3次,并对候选模型生成的权重结果进行加权集成,平滑预测结果。具体步骤如下:随机数种子区间内重试:我们设置5个随机数种子区间之间的间隔较大、同一区间内产生的种子间隔较小,这样可以实现“粗粒度探索+细粒度搜索”效果。在同一随机数种子区间内,我们最多用不同的种子尝试3次,如果在一次训练中模型综合得分达到2分,则提前结束该轮训练并保存模型结果;如果已达到最大尝试次数3次仍没有模型综合得分达到2分,则进入下一区间的训练,该轮不保存模型结果。在重试过程中,最多产生5个候选模型及对应权重。候选模型权重加权集成:对重试过程产生的N个候选模型(N≤5),我们采用Softmax加权集成计算最终回测权重。首先根据验证集累计超额收益(即两个窗口的累计超额收益之和)Softmax权重,用公式可表达为exp(𝑟𝑖/𝜏)∑𝑤𝑖=𝑁∑𝑗=1

exp(𝑟𝑖/𝜏)其中𝑟𝑖为第𝑖个候选模型的验证集累计超额收益;𝜏为温度参数,默认值为0.05。这样,候选模型在验证集的累计超额收益越高、在最终集成权重中的占比越高。最终回测权重即可表达为𝑁𝑊𝑏𝑎𝑐𝑘𝑡𝑒𝑠𝑡=∑𝑤𝑖∙𝑊𝑖𝑖=1其中𝑤𝑖为Softmax权重,𝑊𝑖为第𝑖个候选模型预测的个股配置权重,𝑊𝑏𝑎𝑐𝑘𝑡𝑒𝑠𝑡为最终回测时我们采用的个股配置权重。图3:PPO模型重训练与预测权重流程图国银河证券研究院回退机制:如果15次训练没有任何一个模型综合得分达到2分,导致没有可用的模型结果,权重计算将回退到Alpha因子值加权。与报告《时序截面三层深度学习模型预测收益风险信号》一Alpha因子即为深度学习模型预测的标准化后的Sharpe比率信号。在剔除因子负值后,按照因子值正比计算个股权重。(五)BaThach不动点迭代:让目标权重与组合价值自洽BaThach迭代的主要目的是平滑调仓过程中组合总规模的变化。PPO模型生成目标权重后,还需要将其转化为调仓后的持仓价值。若不考虑自融资约束,直接令新持仓价值等于目标权重乘以旧组合价值,加入交易成本后可能产生资金不自洽问题。因此我们引入BaThach仓后组合规模”视为未知量,通过迭代求解使组合价值、目标权重与成本函数相互一致。当前代码中,Banach模块的核心方程为:𝑁𝑖,𝑡𝑉(𝑘+1)=𝑉−−𝑐⋅𝑉(𝑘)⋅=∑ |𝑤𝑡𝑎𝑟−𝑤𝑖,𝑡−1|𝑖,𝑡𝑖=1其中,𝑉−为调仓前组合价值;𝑉(𝑘)和𝑉(𝑘+1)分别为第𝑘次迭代后、第𝑘+1次迭代后组合价值;𝑐为近似换手成本率,𝑇𝑂𝑡为组合换手率。令𝑉(𝑘)=𝑉(𝑘+1),则求解结果是𝑉(𝑘)=𝑉−/(1+𝑐⋅𝑇𝑂𝑡);采用迭代求解数值结果更具有鲁棒性,可避免分母为0。在强化学习模型的训练过程中,默认交易成本为0。Banach迭代的目的是保证“目标权重—组合规模—持仓价值”之间的自洽,如果成本不为0,那么强化学习模型会学习到交易成本对权重的影响,导致出现强化学习训练阶段扣一次、回测阶段再扣一次的双重成本问题,因此训练阶段设置成本𝑐=0,在回测阶段统一扣除真实佣金、滑点和市场冲击等成本。这样,在训练阶段Banach方程会退化为纯自融资投影:𝑁𝑖,𝑡𝑉∗=𝑉−, 𝑞𝑖,𝑡=𝑤𝑡𝑎𝑟⋅𝑉∗, ∑ 𝑞𝑖,𝑡=𝑉∗𝑖,𝑡𝑖=1𝑖,𝑡其中𝑉∗=𝑉−表示由于换手成本为0,调仓前后组合价值不变;每只个股𝑖的价值𝑞𝑖,𝑡即为权重𝑤𝑡𝑎𝑟𝑖,𝑡乘组合价值𝑉∗。(六)一个生活化例子:每周买菜预算与组合调仓我们可以用“每周买菜”理解强化学习组合优化。假设一个家庭每周都有固定预算,需要决定蔬菜、肉类、水果和主食各买多少。状态包括冰箱剩余库存、近期菜价、家人偏好和上周是否有浪费;动作是本周各类食材买多少;约束是总花费不能超过预算;奖励则来自营养均衡、花费合理和浪费较少。对应到指数增强策略,冰箱库存相当于上一期持仓,菜价和家人偏好相当于市场状态与预测信号,预算约束相当于组合权重和为100%的自融资约束,营养与浪费则对应超额收益、风险和换手成本。强化学习的目标不仅仅是学会“这周买最便宜的菜”,还应通过多周经验逐渐学会什么时候多买、什么时候少买,什么时候虽然某种食材看起来便宜但不宜过度集中,等等。图4:PPO+Banach自融资投影:从预测信号到组合权重的闭环国银河证券研究院三、强化学习有效性检验本章以科创50为样本,对强化学习组合优化环节进行示例性消融实验。实验保持深度学习预测信号、基准权重与价格数据输入一致,仅对强化学习奖励函数中的关键约束项进行移除或保留,对比不同设定下的累计调仓期超额收益、平均奖励、跟踪误差、换手率、主动持股比例及权重集中度等指标。消融组共包括6组:完整奖励函数、去Alpha信号、去风险惩罚、去实际超额收益、去跟踪误差/换手约束,并额外保留pipeline筛选结果模型作为最终策略表现的参照。其中,完整奖励函数组和pipeline筛选结果的奖励函数是一致的,但为了节约训练时间,二者在参数设置上存在差异,例如完整奖励函数组只训练30轮,而pipeline筛选模型训练120轮;但轻量化的参数设置不影响消融实验的结论。此外,本章中pipeline筛选模型与下一章中科创50增强策略所采用的PPO模型也并不完全相同。下一章中采用的PPO模型与前文的训练方法一致,是每年滚动训练、根据验证集表现筛选与加权集合的结果;本章中的pipeline筛选模型并未进行滚动训练等处理,但相比其他轻量化参数的消融组而言,仍具有更精细的参数设置,包括训练轮次更多等等。消融实验的目的是验证以下两点:一是通过强化学习配置个股是否改善了组合的长期表现,二是奖励函数中的各项约束是否具有不可替代的作用。(一)PipeliThe筛选结果模型:回测结果分析首先,对于pipeline最终筛选结果,我们从各期奖励、超额收益、换手率、跟踪误差等角度详细拆解策略的表现。在奖励方面,由图5可见单期奖励存在一定波动,部分调仓期奖励为负,说明强化学习优化并不是每一期都获得正向奖励,而是在多期序列中追求累计收益—风险约束下的整体最优。同时,对比奖励与单期收益,奖励为负时并不一定导致单期超额收益也为负,同样说明强化学习的目标是整体最优权重,长期来看pipeline筛选结果相对科创50获得累计超额收益72.41%,表明组合层面的超额收益具有较强的累积性。从散点图也可以得到相同的结论7可见,单期奖励与单期超额收益之间整体呈现正相关,但奖励与超额收益正负相反的情况也并不罕见;但图8从长期来看,累计奖励与累计超额收益率呈现显著正相关关系,表明强化学习的目标是长期的组合表现。图5:科创50强化学习调诊断:期奖励 图6:科创50强化学习调诊断:额收益0.102021-07-302021-10-292021-07-302021-10-292022-01-282022-04-292022-07-292022-10-312023-01-312023-04-282023-07-312023-10-312024-01-312024-04-302024-07-312024-10-312025-01-272025-04-302025-07-312025-10-312026-01-302026-04-30

15%10%-%

单期超额收益率 累计超额收益

80%60%40%20%0%2021-07-302021-11-302022-03-312022-07-292022-11-302021-07-302021-11-302022-03-312022-07-292022-11-302023-03-312023-07-312023-11-302024-03-292024-07-312024-11-292025-03-312025-07-312025-11-282026-03-31图7:科创50强化学习:期奖励单期超额收益的相性 图8:科创50强化学习:计奖励累计超额收益的相性14%12%10%单期超额收益率单期超额收益率-%-%-%

-0.1 -0.05 0 0.05 0.1 单期奖励

80%70%累计超额收益率60%累计超额收益率50%40%30%20%10%-0%

-0.2 0 0.2 0.4 0.6 累计奖励我们在强化学习中主要通过奖励函数对跟踪误差和换手率进行软约束,从结果来看,每一期跟踪误差均高于10%,平均跟踪误差为17.60%;每一期换手率均高于20%,平均换手率为35.24%。换手率周期性地在每年1月底调仓日出现最高点,说明我们每年重新训练一次深度学习模型确实影响了配置结果。图9:科创50强化学习调诊断:踪误差 图10:科创50强化学习调诊断:手率30%25%20%15%2021/7/302021/10/292021/7/302021/10/292022/1/282022/4/292022/7/292022/10/312023/1/312023/4/282023/7/312023/10/312024/1/312024/4/302024/7/312024/10/312025/1/272025/4/302025/7/312025/10/312026/1/302026/4/30

80%70%60%50%40%30%20%10%2021/8/31 2022/8/31 2023/8/31 2024/8/31 2025/8/31从主动权重与信号的散点关系看,无论是收益信号还是风险信号与主动权重的线性相关系均不显著。这一结果说明,有别于传统选股因子按排序打分结果线性配置权重,强化学习优化结果综合考虑了Alpha机会、风险暴露、仓位限制和交易约束等因素的影响,因此映射关系非线性恰恰表明强化学习是一个统一的多因素动态决策框架。图11:科创50强化学习主权重与益信号的相关性 图12:科创50强化学习主权重与险信号的相关性进一步观察组合权重配置情况,由图13可见,策略的主动持股比例整体保持在较高水平,说明组合相对于科创50基准具有明确的主动管理特征。同时,前5大重仓股权重和第一大重仓股权重整体仍分别处于50%、20%上下的区间,与报告《时序截面三层深度学习模型预测收益风险信号》中凸优化的硬约束条件一致,说明强化学习优化结果处于正常可控范围,未出现长期极端集中于少数股票的情形。从每一期收益/风险信号与主动权重的相关性来看,相关性具有明显时变特征,部分调仓期相关性为负,同样说明强化学习会根据不同调仓期的信号结构和约束条件动态调整配置逻辑,这也是前面图11和图12中在整个回测区间计算相关系数不显著的原因。此外,相对而言收益信号与主动权重的相关性波动更剧烈,相邻两期相关性正负号改变的情况更多;风险信号与主动权重的相关性更稳定,连续多期相关性正负号一致的情况更多。图13:科创50强化学习实性测算组合偏离与集中度 图14:科创50强化学习实性测算每期信号与配置的关系数主动权重 前5大重仓股权重之和 第一大重仓股权重80%60%40%20%0%2021/7/30 2022/7/30 2023/7/30 2024/7/30 2025/7/30更进一步,由图15可见,当奖励与主动偏离的幅度相匹配时,更容易产生正向超额收益。图16列出了科创50在2026-05-29一期超配权重前10与低配权重前10的股票。图15:科创50强化学习实性测算跟踪误差、超额收与奖励 图16:科创50强化学习实性测算主动偏离程度最高个股盛科通信中无人机和辉光电九号公司-西部超导传音控股天合光能大全能源晶晨股份芯联集成

-4% -2% 0% 2%

6% 8% 10%(二)消融组结果对比消融实验结果显示,在回测期内,pipeline筛选结果的累计超额收益并不是最高的,其超额收益达到72.41%;而完整reward组的累计超额收益达到83.76%。但从后文跟踪误差、换手率等指标的结果对比,我们仍可发现pipeline筛选结果在经过更多轮训练后,是一个相对更优的模型。相比之下,其他4个消融组的累计超额收益表现均出现不同程度的下降,其中去除实际超额收益项后回测期内累计超额收益最低5.85%,说明实际超额收益是奖励函数中的关键组成部分。去除alpha信号、去除风险惩罚与去除TE/换手约束三个组的累计超额收益分别为24.36%26.45%和27.18%,均显著低于完整reward组的表现,说明这三项也对组合优化具有正向贡献。图1750RLpipeline筛选结果 完整reward 去alpha信号 去风险惩罚 去实际超额收益 去TE/换手约束100%80%60%40%20%0%-0%从核心指标对比可以看到,pipeline筛选结果虽然在累计超额收益上略低于完整reward组,但平均奖励显著高于其他5组。其中,pipeline筛选结果的平均换手率显著低于其他5组、主动权重显著高于其他5组,跟踪误差与完整reward5大重仓股集中度均在40-50%区间,整体相差不大。这说明pipeline筛选结果的决策更偏主动管理,且能把权重集中于未来表现较好的个股,在提高主动权重的同时降低换手对组合资产的损耗。相比之下,完整reward组的主动程度略低,但平均奖励仍显著高于其他4组,且最终超额收益高于pipeline筛选结果,体现出基础奖励函数本身具备有效性。值得注意的是,去实际超额收益组虽然平均reward排在第三位,但累计超额收益最低,说明在本策略框架下,不能仅以训练过程中的平均reward作为模型优劣判断标准,这也是我们在验证集筛选模型时采用平均奖励与累计超额收益双门槛的原因。图18:科创50强化学习消实验指对比:累计超额收益 图19:科创50强化学习消实验指对比:平均奖励90%80%70%60%50%40%30%20%10%

16%14%12%10%8%6%4%2%0% 图20:科创50强化学习消实验指对比:平均跟踪误差 图21:科创50强化学习消实验指对比:平均换手率20%18%16%14%12%10%

60%50%40%30%20%10%0% 图22:科创50强化学习消实验指对比:平均主动权重 图23:科创50强化学习消实验指对比:持仓权重和45%43%41%39%37%35%33%31%29%27%25%

55%50%45%40%35%30% 由如下散点图可见,pipeline筛选结果位于右上方,说明其在承担较高主动偏离时,有效将主动权重配置在具有超额收益的个股上,因此表现出较高的跟踪误差,同时获得较高的累计超额收益。完整reward组的跟踪误差也较高,但主动偏离相对较低、集中度较高,说明其超额更多来自于超配个别股票,因而换手率高于pipeline筛选结果。但去TE/换手约束组虽然具有同样的跟踪误差与主动偏离特征,其累计超额收益却远低于完整reward组,说明以纯粹的收益风险特征作为奖励函数并不能使组合配置结果达到最优,这也证明了本报告奖励函数设计的完备性。相对而言,去Alpha信号组和去风险惩罚组超额表现较弱更多来自于主动偏离的不足;去实际超额收益组在主动权重上与其他四组相近,但跟踪误差相对偏高,且最终累计超额收益最低,可能源于模型将主动权重错配给表现较弱的个股,表明缺失关键奖励项后,模型容易在错误方向上放大主动风险。图24:科创50强化学习消融实验:跟踪误差、超额收益与主动权重的关系四、模型应用实例:指数增强策略在报告《时序截面三层深度学习模型预测收益风险信号》中,我们将深度学习预测的收益风险信号应用于指数增强策略,通过凸优化叠加硬约束和软惩罚项进行个股权重计算,验证了深度学习预测信号可以在获得超额收益的同时有效实现回撤控制。后文中,我们将再次将深度学习预测信号应用于指数增强策略,但个股权重计算由本文的强化学习模型完成,把“深度学习预测+强化学习配置”的框架再次应用于沪深300、科创50等主流宽基指数,检验强化学习模型相比传统凸优化方法是否具有优势。(一)指数增强组合优化框架本报告中沪深300和科创50指数增强策略均遵循统一的框架进行信号预测、组合优化与回测。具体而言,以指数成分股为基础股票池,获取股票与指数的日线/小时线数据输入深度学习模型,逐年进行模型训练,并预测未来一年的Sharpe比率、最大回撤信号;在组合构建时,采用滚动训练PPO模型预测个股配置权重,并用Banach不动点迭代方法微调权重结果、平滑交易成本,并按照下一交易日收盘价将目标权重换算为持仓股数、生成买卖订单,最终进行回测净值计算与业绩评价。以沪深300为例,指数增强策略流程图如下。图25:沪深300指数增强策略回测流程图国银河证券研究院(二)沪深300指数增强策略沪深300增强策略的原始数据取值区间为2019年1月1日至2026年5月29日,采用小时线数据,每年重新训练一次模型。其中深度学习共训练2020-2025年6个模型,除2020年模型由于数据不足仅采用2019-2020两年数据进行训练以外,其他模型均为滚动最近三年数据训练;强化学习除2020、2021年模型由于数据不足缩减训练集规模以外,其他模型均为滚动最近四年数据训练。回测区间为20207312026529日,每月最后一个交易日调仓,股票单边交易成本0.05%。图26:沪深300指数增强策略回测净值与超额收益1.61.41.210.82020/7/312020/9/302020/7/312020/9/302020/11/302021/1/312021/3/312021/5/312021/7/312021/9/302021/11/302022/1/312022/3/312022/5/312022/7/312022/9/302022/11/302023/1/312023/3/312023/5/312023/7/312023/9/302023/11/302024/1/312024/3/312024/5/312024/7/312024/9/302024/11/302025/1/312025/3/312025/5/312025/7/312025/9/302025/11/302026/1/312026/3/31

沪深300指数增强策略 沪深300 超额收益(右轴)

1.41.31.21.110.92020年7月31日至2026年5月29日,沪深300指数增强策略回测累计收益率为32.20%,年化收益率为5.11%,相比沪深300指数实现年化超额收益4.26%;策略Sharpe比率和Calmar比率分别为0.3691、0.1691,最大回撤为-30.23%;策略超额收益的Sharpe比率和Calmar比率分别1.12280.5094,最大回撤为-8.36%。同时,从策略与沪深300指数的最大回撤对比来看,在回测区间内增强策略的最大回撤始终没有超过指数本身。图27:沪深300指数增强策略回撤表现表1:沪深300指数增强策略回测业绩指标对比组合名称累计收益率年化收益率年化波动率Sharpe比率alar最大回撤月度胜率沪深300指数增强策略32.20%5.11%17.80%0.36910.1691-%55.71%沪深3004.20%0.74%17.83%0.13030.0162-%50.00%超额收益26.31%4.26%3.78%1.12280.5094-%60.00%从分年度业绩表现来看,策略在2025年以来表现略弱于指数,可能源于近两年市场风格、牛熊趋势变化较大,强化学习模型在前一年验证集上表现较优反而在测试集上泛化能力不足;2020-2024年间均跑赢沪深300,且在整个回测区间内最大回撤均小于指数,表明“深度学习预测+强化学习优化”的框架能够实现增强的效果。表2:沪深300指数增强策略回测分年度业绩表现组合名称年份年化收益率年化波动率Sharpe比率alar最大回撤策略换手率沪深300指数增强策略202040.07%16.30%2.16916.6166-%276.43%202110.39%17.53%0.65170.8703-%626.32%2022-%20.46%-0.9063-0.7430-%637.96%2023-%13.74%-0.3167-0.2625-%647.84%202417.19%22.50%0.81601.2201-%689.48%202512.68%14.72%0.88521.1978-%633.84%20267.22%15.53%0.52580.8712-%379.97%沪深300202028.76%16.61%1.61914.9544-%-2021-%18.59%-0.2050-0.2961-%-2022-%20.41%-1.1416-0.7736-%-2023-%13.50%-0.8643-0.5494-%-202415.33%21.39%0.77271.0645-%-202518.37%15.26%1.18221.7513-%-202615.73%15.93%0.99622.0223-%-2121图28:沪深300指数增强策略基准比:分年度年化收率 图29:沪深300指数增强策略基准比:分年度Sharpe比率50%40%30%20%10%-0%-0%-0%

沪深300指数增强策略 沪深3002020 2021 2022 2023 2024 2025 2026

沪深300指数增强策略 沪深3002020 2021 2022 2023 2024 2025 2026(三)科创50指数增强策略科创50增强策略的原始数据取值区间为2019年12月31日至2026年5月29日,采用小时线数据,每年重新训练一次模型。其中,深度学习模型共训练2021-2025年5个模型,强化学习模型共训练2021-2025年5个模型,除2021年模型由于数据不足仅采用2020-2021两年数据进行训练以外,其他模型均为滚动最近三年数据训练。回测区间为2021年7月30日至2026年5月29日,每月最后一个交易日调仓,股票单边交易成本0.05%。2021年7月30日至2026年5月29日,科创50指数增强策略回测累计收益率为91.85%化收益率为15.09%,相比科创50指数实现年化超额收益12.52%Sharpe比率和Calmar比率分别为0.6055、0.2806,最大回撤为-53.80%;策略超额收益的Sharpe比率和Calmar比率分别为1.34301.3565,最大回撤为-9.23%。同时,在回测区间增强策略的最大回撤均低于指数本身,表明“深度学习预测+强化学习优化”框架对科创50指数可有效实现捕捉超额收益、同时控制风险的效果。图30:科创50指数增强策略回测净值与超额收益2.21.71.20.72021/7/302021/9/302021/7/302021/9/302021/11/302022/1/312022/3/312022/5/312022/7/312022/9/302022/11/302023/1/312023/3/312023/5/312023/7/312023/9/302023/11/302024/1/312024/3/312024/5/312024/7/312024/9/302024/11/302025/1/312025/3/312025/5/312025/7/312025/9/302025/11/302026/1/312026/3/31

科创50指数增强策略 科创50 超额收益(右轴)

1.91.81.71.61.51.41.31.21.110.922图31:科创50指数增强策略回撤表现表3:科创50指数增强策略回测业绩指标对比组合名称累计收益率年化收益率年化波动率Sharpe比率alar最大回撤月度胜率科创50指数增强策略91.85%15.09%31.03%0.60550.2806-%48.28%科创5010.06%2.09%30.28%0.21680.0349-%41.38%超额收益72.79%12.52%9.10%1.34301.3565-%60.34%从分年度业绩表现来看,除2022年科创50增强策略相对指数无显著超额外,其他年份均跑赢指数,尤其2024年以来超额收益明显。一方面可能源于数据量增加后模型训练效果改善,另一方面2024年以来模型的验证集与测试集总体趋势一致,或对回测效果也有影响。表4:科创50指数增强策略回测分年度业绩表现组合名称年份年化收益率年化波动率Sharpe比率alar最大回撤策略换手率科创50指数增强策略20210.05%22.19%0.11270.0034-%434.94%2022-%28.03%-1.2543-0.7811-%786.51%2023-%20.07%-0.2978-0.2933-%695.72%202439.03%42.81%0.97361.8305-%690.01%202554.60%29.06%1.64483.0416-%677.79%2026164.69%37.57%2.78068.3575-%282.68%科创502021-%21.22%-1.3849-1.5078-%-2022-%27.37%-1.2933-0.8547-%-2023-%20.26%-0.5119-0.4005-%-202416.79%40.38%0.57590.6845-%-202537.48%29.80%1.21702.0840-%-2026101.74%37.18%2.07325.2810-%-图32:科创50指数增强策与基准比:分年度年化收率 图33:科创50指数增强策与基准比:分年度Sharpe比率200%

科创50指数增强策略 科创50

3.00

科创50指数增强策略 科创50150% 2.00100% 1.0050% 0.000% -1.00-0%

2021 2022 2023 2024 2025 2026

-2.00

2021 2022 2023 2024 2025 2026(四)回测结果对比:强化学习VS凸优化为进一步检验强化学习模型的效果,我们将前文两个指数增强的回测结果与报告《时序截面三层深度学习模型预测收益风险信号》中凸优化回测结果进行对比。沪深300指数增强策略下图为沪深300指数增强策略分别采用强化学习、凸优化方法计算权重的回测结果,红线为强化学习结果相对凸优化结果的超额收益。由图可知,直至2023年上半年,强化学习方法回测结果优于凸优化;而2023年下半年以来强化学习方法跑输,尤其在2025年6-9月跑输幅度较大。但从回撤表现来看,强化学习方法在整个回测区间内相较于凸优化更进一步缩减了组合回撤的幅度。图34:沪深300指数增强策略回测净值对比:强化学习VS凸优化1.61.51.41.31.21.110.92020/7/312020/9/302020/7/312020/9/302020/11/302021/1/312021/3/312021/5/312021/7/312021/9/302021/11/302022/1/312022/3/312022/5/312022/7/312022/9/302022/11/302023/1/312023/3/312023/5/312023/7/312023/9/302023/11/302024/1/312024/3/312024/5/312024/7/312024/9/302024/11/302025/1/312025/3/312025/5/312025/7/312025/9/302025/11/302026/1/312026/3/31

沪深300指数增强策略(强化学习) 沪深300指数增强策略(凸优化) 强化学习VS凸优化

1.21.151.11.0510.950.90.85图35:沪深300指数增强策略回撤表现:凸优化图36:沪深300指数增强策略回撤表现:强化学习表5:沪深300指数增强策略回测业绩指标对比:强化学习VS凸优化组合名称累计收益率年化收益率年化波动率Sharpe比率alar最大回撤月度胜率沪深300指数增强策略(强化学习)32.20%5.11%17.80%0.36910.1691-%55.71%超额收益(强化学习)26.31%4.26%3.78%1.12280.5094-%60.00%沪深300指数增强策略(凸优化)57.73%8.48%17.68%0.54900.2724-%51.43%超额收益(凸优化)50.38%7.56%4.22%1.75021.9213-%72.86%科创50指数增强策略下图为科创50指数增强策略分别采用强化学习、凸优化方法计算权重的回测结果,红线为强化学习结果相对凸优化结果的超额收益。由图可知,2022年强化学习结果表现弱于凸优化,2025年强化学习结果没有显著跑赢凸优化,其他年份强化学习结果均显著跑赢。从回撤表现来看,强化学习结果在2024年之前回撤幅度没有表现出显著优势,自2024年以来组合回撤幅度较凸优化有明显缩减。图37:科创50指数增强策略回测净值对比:强化学习VS凸优化2.221.81.61.41.210.80.62021/7/302021/9/302021/7/302021/9/302021/11/302022/1/312022/3/312022/5/312022/7/312022/9/302022/11/302023/1/312023/3/312023/5/312023/7/312023/9/302023/11/302024/1/312024/3/312024/5/312024/7/312024/9/302024/11/302025/1/312025/3/312025/5/312025/7/312025/9/302025/11/302026/1/312026/3/31

科创50指数增强策略(强化学习) 科创50指数增强策略(凸优化) 强化学习VS凸优化

1.41.351.31.251.21.151.11.0510.95图38:科创50指数增强策略回撤表现:凸优化图39:科创50指数增强策略回撤表现:强化学习26表6:科创50指数增强策略回测业绩指标对比:强化学习VS凸优化组合名称累计收益率年化收益率年化波动率Sharpe比率alar最大回撤月度胜率科创50指数增强策略(强化学习)91.85%15.09%31.03%0.60550.2806-%48.28%超额收益(强化学习)72.79%12.52%9.10%1.34301.3565-%60.34%科创50指数增强策略(凸优化)41.17%7.72%30.03%0.39490.1419-%41.38%超额收益(凸优化)31.10%5.24%6.01%0.88130.6909-%53.45%强化学习结果超额来源对于科创50增强策略,强化学习结果相对凸优化的超额收益一定程度来源于重配未来表现较优的个股。由下图可见,强化学习预测的权重结果呈现显著的右偏长尾分布,极个别个股可获得很高的权重。例如,科创50增强策略如果采用凸优化方法,个股最高配置权重为16%;而采用强化学习方法最高权重可超过30%。图40:沪深300指数增强策略重分:凸优化 图41:沪深300指数增强策略重分:强化学习 图42:科创50指数增强策权重分:凸优化 图43:科创50指数增强策权重分:强化学习 与此同时,获得超配的个股在未来一个月内确实表现较优。下图列出了整个回测区间内,强化学习相对凸优化超配幅度最高的前20只个股,可以发现强化学习相对凸优化的超配权重可达到20%以上,且重配在寒武纪、固德威等表现突出的个股;其他个股即使在未来一个月没有跑赢科创50,也没有出现大幅跑输的情况,这一方面也从侧面验证了深度学习预测信号确实能有效筛选未来具备超额潜力的个股,但同时也是强化学习对这些个股的重配使增强策略的表现更上一层楼。图44:科创50指数增强策略强化学习超配幅度最高的前20只个股及未来一月超额收益25%20%15%10%

超配权重 超额收益0% 相对科创50超额收益

70%60%50%40%30%20%10%0%-0%-0%反之,沪深300增强策略采用强化学习时表现较弱,或与强化学习结果的集中度偏低有关。计算各调仓期权重结果的HHI指数,可发现沪深300与科创50增强策略权重的集中度表现是相反的:沪深300增强策略采用凸优化时集中度更高,而科创50增强策略采用强化学习时集中度更高。沪深300增强采用强化学习时表现较弱,或与其成分股较多、权重可调整空间较小也有关系;此外,在模型诊断中,我们统一采用累计超额收益超过8%为诊断标准,这一标准或对沪深300有些严苛。因此,沪深300增强策略的强化学习结果表现差强人意并非说明强化学习模型没有意义,未来我们可调整参数设置,进一步优化策略表现。图45300HHI凸优化 强化学习2020/7/312020/9/302020/7/312020/9/302020/11/302021/1/292021/3/312021/5/312021/7/302021/9/302021/11/302022/1/282022/3/312022/5/312022/7/292022/9/302022/11/302023/1/312023/3/312023/5/312023/7/312023/9/282023/11/302024/1/312024/3/292024/5/312024/7/312024/9/302024/11/292025/1/272025/3/312025/5/302025/7/312025/9/302025/11/282026/1/302026/3/312026/5/29图4650HHI凸优化 强化学习0.10五、风险提示报告结论基于历史价格信息和统计规律,但二级市场受各种即时性政策影响易出现统计规律之外的走势,所以报告结论有可能无法正确预测市场发展,报告阅读者需审慎参考报告结论。基金历史收益不代表未来业绩表现,文中观点仅供参考,不构成投资建议。表7:可调参数列表

六、附录(一)可调参数列表类型参数名称默认取值用途Banachaxer50Banach不动点最大迭代次数,防止死循环tol1E-12Banach不动点迭代收敛阈值,小于该值停止迭代turnover_cost_rate0RL内部模拟调仓费率,回测统一扣费建议置0避免双重扣减PPOaxligt0.4单期最大持仓个股占成分股比例batch_size64单eohii-bthliion0.2PPOentropy_coef0.05熵正则权重,鼓励动作探索、避免早熟收敛epochs4同一份buffer重复训练轮数gaelaba0.95GAEgamma0.99奖励折扣因子,控制远期回报权重lr3E-04Adamaxgaom0.5梯度裁剪最大L2范数,抑制梯度爆炸value_coef0.5价值损失在总损失中的权重系数steps

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论