版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
目录一、简介 1二、从景气度研究到盈利预测 1三、产业链分析:以煤炭行业为例 23.1煤炭行业 2三、盈利预测模型 5指标预处理 5指标筛选 5即时预测模型 7四、模型对比与改进 9模型结果对比 9引入预期数据改进净利预测 10引入短期模型适应结构变化 五、大模型增强盈利预测 13特征工程 14大模型预测 15六、景气度指数结果及应用 17景气度指数构建结果 18景气度指数应用 19七、结论 24风险分析 25图目录图景气度到股价的传导路径 2图煤炭行业产业链 3图煤炭行业下游需求 3图景气指数解释度 10图景气指数MSE 10图景气指数绝对方向准确率 10图景气指数边际方向准确率 10图预期营收同比的预测效果较差 图预期净利同比的预测效果良好 图扩展窗口与滚动窗口 12图加入短期模型后适应结构变化 12图独立预测输出schema 16图校正预测输出schema 17图煤炭行业景气指数 18图钢铁行业景气指数 18图石油石化行业景气指数 18图建材行业景气指数 18图基础化工行业景气指数 19图有色金属行业景气指数 19图煤炭行业景气指数 19图行业指数择时表现 21图超额指数择时表现 22图因子分层净值图 22图行业轮动净值表现 23表目录表煤炭行业各维度指标 4表三类模型效果对比 9表最佳模型与一致预期评估指标差值 表大模型衍生指标解释力较好 14表加入衍生指标后模型表现变化 15表大模型独立预测结果 16表大模型校正预测结果 17表煤炭营收5月截面调整贡献情况 20表轮动策略绩效 23表轮动策略分年度表现 23一、简介流动性和市场情绪等多重因素影响,本文不直接以市场收益作为预测目标,而是引入盈利预测作为连接中观产业情况与行业指数表现的中间环节,构建了一套系统性的行业景气分析框架。我们以煤炭、钢铁、石油石化、基础化工、建材和有色金属六个周期行业为研究对象,首先结合产业链逻辑对供给、需求、价格、库存及宏观指标进行定性筛选,再从预测能力等维度开展定量筛选。在此基础上,分别构建动态因子模型、Factor-Bridge和Factor-MIDAS三类模型进行盈利预测,并进一步引入分析师一致预期数据、短期模型和大模型进行增强。最终,本文基于盈利预测结果构建行业景气度指数,并将其应用于行业择时与多行业轮动,形成“产业景气—盈利预测—行业配置”的完整研究框架。二、从景气度研究到盈利预测股票价格变动受到盈利水平、估值变化、市场流动性及投资者情绪等多重因素共同影响,短期价格波动中往往包含较多交易噪声。相比之下,行业景气度的变化通常会通过收入与利润的扩张或收缩,持续影响行业的中长期盈利能力与配置价值。因此,开展行业景气度研究,不仅有助于对产业基本面分析进行量化验证,也能够为中长期行业配置提供参考依据。在此基础上,本文认为有必要在景气度研究框架中引入财务指标作为中间变量。具体而言,行业景气度首先通过影响企业经营活动与盈利能力,反映在相关财务指标的变化之中,并进一步传导至股票价格。一方面,财务指标能够较为集中地反映需求、价格、销量及成本变化对企业经营成果的综合影响,从而为行业景气度提供可观测且具备跨行业可比性的代理表征;另一方面,将财务指标作为景气度与股价之间的中间变量,有助于降低市场情绪、估值波动等其他维度因素的干扰,进而提升景气度判断的解释力与可靠性。通过上述分析,我们将景气度研究的中间目标锚定为盈利预测。对于周期行业而言,其景气度和股价表现具有明显的顺周期波动特征,且其相关产业链指标披露更为丰富,是开展中观景气研究的理想标的。因此,本文选取钢铁、煤炭、建材、有色金属、石油石化、基础化工等6个周期行业,通过梳理行业逻辑进行指标初筛,并进一步使用量化方法开展盈利预测和景气度指数的构建。金融工程深度报告图1:景气度到股价的传导路径信建投证券三、产业链分析:以煤炭行业为例煤炭行业煤炭产业链整体可划分为上游资源开采、中游洗选加工、以及下游需求三大环节。从产品结构看,煤矿开采出的原煤经洗选加工后,主要形成动力煤和炼焦煤两大核心品种。其中,动力煤主要用于火力发电与供热,在我国产量及需求占比超5%。从定价机制看,我国煤炭自给率长期维持在90%以上,进口更多承担边际调节功能,因此煤炭价格主要由国内供需决定。作为典型资源型行业,煤炭成本受矿区地质条件和资源禀赋影响较大,开采成本相对刚性,年度波动通常有限。在成本端相对稳定的背景下,煤价波动成为驱动行业利润和板块超额收益的核心变量。基于这些产业链特征,本文从下述维度选取了共计123个行业中观指标及相关宏观指标作为煤炭行业指标库,以供后续建模使用。金融工程深度报告图2:煤炭行业产业链信建投证券供给与需求供给端主要反映煤炭生产强度。原煤产量可直接刻画煤矿开采环节,动力煤和炼焦煤则分别对应最重要的两类商品煤品种。本文选取原煤、动力煤、炼焦煤、无烟煤等产品产量作为供给端核心指标。需求端以火力发电为核心,占比过五成。其他主要需求来自钢铁、建材和化工行业。因此,本文选取火力发电量、钢材产量、钢材价格、水泥产量、化工产品价格指数等指标刻画下游需求。11.90%8.47%9.52%56.08%11.90%8.47%9.52%56.08%14.02%电力 钢铁 建材 化工 其他创资此外,我国煤炭资源主要集中于山西、陕西、内蒙古等西北地区,而消费中心集中在华东、华南地区,形成“西煤东调、北煤南运”的运输格局。煤炭通常经大秦线、神朔黄线等铁路运至北方港口,再通过海运输送金融工程深度报告至南方终端。黄骅港、秦皇岛港、曹妃甸港和京唐港构成环渤海核心下水港,其中黄骅港2025年吞吐量占北方港口煤炭下水量约30%。因此,我们选取这四大港的港口吞吐量、铁路调入量等指标。同时,铁路和港口运输量也能够反映产地供给与终端采购活跃度,因此本文进一步选取大秦线煤炭运量、重点港口煤炭运量等指标。同时,动力煤、炼焦煤、无烟煤等主要品种的进出口数量、金额和均价也纳入跟踪。成本与价格原材料成本和产品价格是影响利润的关键变量。由于我国煤炭自给率较高,成本端主要受人力、资源税和开采条件等难以跟踪的因素影响,本文仅选取原煤产量、进口量和进口均价等少量指标进行监测。产品价格方面,动力煤是煤炭行业的核心品种,5500K动力煤是国内常用基准规格。本文选取环渤海动力煤(Q5500K)综合平均价格指数作为核心价格指标。国内动力煤实行“长协+现货”的双轨定价机制,长协价格中枢相对稳定,现货价格则更能反映市场供需变化。环渤海动力煤价格指数兼顾长协与现货口径,能够在稳定性和灵敏度之间取得平衡。与此同时,本文也选取秦皇岛港动力煤(Q5500K)平仓价作为市场价格参考,并通过出口均价、出厂价、主要港口平均价等指标补充刻画其他煤炭品种价格。库存库存是供需关系的缓冲变量。环渤海港口群是国内煤炭海运的重要集散中心,其库存水平直接影响动力煤宏观环境煤炭作为资源品行业,与宏观经济环境高度相关。增长维度上,本文选取制造业PMI及相关分项、工业增加值同比等指标;通胀维度上,选取PPI及相关分项指标。其他本文还纳入国家统计局发布的采矿业、煤炭开采和洗选业固定资产投资完成额,以及规模以上工业企业财务指标,包括煤炭开采和洗选业、电力热力生产和供应业的营业收入、营业成本、利润总额、产成品存货和亏损企业数等。尽管此类指标与行业投资标的存在一定口径差异,但其为月频发布,仍具有较高参考价值。表1:煤炭行业各维度指标维度分类指标供给产品产量产品进口原煤、动力煤、炼焦煤、无烟煤产量等煤炭进口金额、均价、数量等下游需求火力发电量、钢材产量、水泥产量等需求港口指标港口吞吐量、调入量等产品运输大秦线煤炭运量、重点港口煤炭运量等价格产品价格环渤海动力煤综合平均价格、秦皇岛动力煤平仓价等金融工程深度报告港口库存 黄骅港、秦皇岛港、曹甸港京唐场存等库存终端库存 重点电厂煤炭库存量、本钢焦炭用天等增长 制造业PMI及分、工增加同比等宏观通胀 PPI、PPIRM等工业企业财务 煤炭开采和洗选业:营收入利润额等其他投资 固定资产投资完成额:矿业煤炭采和选业等三、盈利预测模型在进行产业链梳理后,本文对每个行业分别构建了对应的指标池,通过定性筛选的方式保证入模指标与行业逻辑相一致。接下来,我们则进一步运用量化方法对指标进行筛选,并最终构建盈利预测模型。如前文所述,本文在行业景气度研究框架中引入盈利预测作为核心中间目标。考虑到单季度盈利增速容易受到偶发因素扰动,指标波动相对较大,本文采用平滑性更强的TTM同比增速作为景气度代理变量。基于此,选取四类财务变量作为行业景气度的代理指标,分别为ROE_TTM同比增速、净利润TTM同比增速、营业收入TTM同比增速和毛利润TTM同比增速。在由个股财务指标合成行业层面财务代理变量时,本文采用整体法进行构建,同时要求同比计算所涉及的前后两期样本池保持可比。后续的指标筛选、盈利预测及模型分析,均围绕上述财务代理变量展开。指标预处理鉴于宏观数据中存在较多噪声,本文首先对各项指标进行统一预处理,以提高不同频率、不同口径指标之间的可比性。具体预处理方法如下:频率对齐:将各底层指标统一采样至月度频率。对于高频流量类指标,如港口吞吐量,先计算滚动一个月均值,再采样至月度。缺失值填充1月未发布或个别月份缺报的情况;对于因发布滞后导致的尾部缺失值,则予以保留,并由后续模型进行估计。春节效应调整:对于受春节扰动较大的流量类指标,采用比例因子法调整。即根据历年1、2月实际工作日或开工天数,将观测值折算至可比天数口径。异常值处理:采用去极值,以降低极端观测值对模型估计的影响。计算同比或同比差分:同比是市场常用观察口径,既能一定程度缓解季节效应,也有助于提升序列平稳性,更适合用于后续景气度建模。指标筛选为及时捕捉行业运行逻辑与景气驱动因素的变化,本文分别于每年4月、8月和10月末,即一季报、中报和三季报披露截止后,基于最新可得的景气度代理变量,对行业中观指标重新进行评分与筛选,并据此更新模型。其余月份则沿用最近一期的指标筛选结果及模型参数。金融工程深度报告指标筛选主要包括三个步骤。首先从解释性,评价各行业指标与景气度代理之间的相关性以及指标的预测能力;其次,结合数据频率和序列长度设置惩罚项,得到综合得分;最后剔除非平稳及过度冗余的指标,并选取得分靠前的指标进入模型。此外,由于本文涉及混频数据建模,指标筛选过程中需要统一预测指标与财务代理变量的数据频率。若采用线性插值或前向填充等方式将季频财务代理变量升频,会引入人为制造的信息偏差。因此在筛选阶段,本文将高频预测指标采样至与财务代理一致的季度频率,并采用与后续模型设定一致的12期滚动平均方法进行近似。解释性解释性评价方面,本文主要采用𝑅2和t检验两种方法。𝑅2回归模型的𝑅2用于反映指标对财务景气变量的解释度,回归系数符号则用于判断指标与景气度代理变量之间的作用方向。一般而言,𝑅2越高,说明该指标对景气度代理的解释能力和相关性越强。在此基础上,本文进一步通过如下方法构建t检验,衡量候选指标的增量预测信息。针对每一个候选预测指标𝑥𝑖,𝑡,分别估计包含该指标以及目标变量滞后项𝑦𝑡−1的单变量回归:𝑦𝑡=𝛼+𝛽𝑖𝑥𝑖,𝑡+𝜙1𝑦𝑡−1+𝜀𝑡随后,根据候选指标系数𝛽𝑖所对应的t统计量绝对值∣𝑡𝛽𝑖∣对各指标进行排序。绝对t统计量越大,说明该指标在控制目标变量自身信息后具有越强的预测信息,因此在变量筛选中具有更高的优先级。惩罚项根据两个解释力指标,我们取综合排名前一百的指标赋予基础评分。在初步解释力评分的基础上,本文进一步引入数据频率与发布时效、序列长度两类惩罚项,以提升入选指标的实时可得性。首先,考虑数据频率与发布延迟。多数月频数据存在不同程度的发布滞后,除PMI等少数指标外,许多月频指标在当月末尚未发布,从而在样本尾部形成缺失,降低模型可利用的信息量。因此,本文对当月末不可得的月频指标扣除2分。其次,考虑指标的序列长度。本文模型训练样本始于2010年1月1日。若指标序列在样本前端存在缺失,则前端缺失比例每增加1%,相应扣除0.2分,即每增加5%扣1分。同时,为保证模型训练样本具有足够长度,并提高参数估计的稳定性,本文剔除起始时间晚于2015年1月1日的指标。综合打分与兜底处理在综合考虑解释力得分与惩罚项后,本文按照最终得分选取10或20个指标,具体数量在超参数调优阶段确认。为避免过度信息冗余或重复指标,新增指标与已入选指标的相关系数不高于0.95,超过阈值则按得分顺序递补,同时剔除ADFP0.1的非平稳指标。模型训练后进一步检验预测稳定性。若出现模型发散,则将ADF筛选阈值收紧至0.05,并重新进行指标筛选和模型训练。若仍然发散,则回退至上一期运行稳定的模型,以降低趋势性指标或短期数据扰动对预测结果金融工程深度报告的影响。即时预测模型即时预测是指在目标变量尚未正式披露前,利用已发布的高频或同步指标,对当期尚不可见的低频变量进行实时估计。由于行业财务指标通常为季度频率披露,且存在披露滞后,而中观指标多为月频发布,因此可以采用即时预测模型进行盈利预测。本文构建了动态因子模型(DFM)、Factor-Bridge、Factor-Midas三类常用模型进行预测,并对其预测效果进行比较。动态因子模型供给、需求、价格、库存和宏观环境等指标可能分别从不同侧面反映同一轮行业景气周期。动态因子模型通过少数不可观测的公共因子提取这些共同信息,从而在压缩高维指标的同时,保留行业景气变化的主要方向。之间的关系,即不同指标对行业景气因子的敏感度存在差异;状态方程则描述公共因子自身的动态演化过程,可以理解为一种兼具降维功能和时间动态结构的建模方法。其基本形式可表示为:𝑋𝑡=Λ𝐹𝑡+𝜀𝑡𝐹𝑡=𝐴1𝐹𝑡−1+⋯+𝐴𝑝𝐹𝑡−𝑝+𝑣𝑡其中,𝑋𝑡表示月度中观指标向量,𝐹𝑡为不可观测的公共因子,Λ为因子载荷矩阵,刻画各指标对公共因子的敏感度;𝜀𝑡为观测误差项。状态方程中,𝐴1,…,𝐴𝑝描述公共因子的动态演化特征,𝑣𝑡为状态扰动项。本文将筛选后的行业中观指标与景气度代理变量共同纳入DFM共性景气信息,并进一步映射至季度财务景气代理变量。每月末,本文基于当期可得数据更新模型输入,得到对尚未披露财务景气变量的即时预测结果,最终形成月频行业景气度预测序列。需要说明的是,TTM1212月滚动指标”。参考加拿大央行对低频TTM个不可观测的月度同比贡献项聚合而成。具体而言,令𝑦𝑇𝑇𝑀表示在季度末月份𝑡观测到的TTM同比财务指标,𝑦𝑀表示不可观测的月度潜在增长,则𝑡 𝑡有:𝑦𝑇𝑇𝑀≈
111∑𝑦𝑀
+𝑒, 𝑡∈𝒯𝑡
𝑗=0
𝑡−𝑗 𝑡 𝑄其中𝒯𝑄={3,6,9,...}表示季度末披露月份。进一步地,不可观测的月度潜在增长由潜在公共因子𝐹𝑡驱动,即:𝑦𝑀=𝜆′𝐹+𝑢,则观测方程为:𝑡 𝑡 𝑡金融工程深度报告𝑦𝑇𝑇𝑀≈
111∑𝑦𝑀
+
1= ∑𝜆
+𝜂=
1𝜆′(𝐹+
+⋯+
)+𝜂𝑡
𝑗=0
𝑡
𝑡
𝑗=0
𝑡
𝑡 12
𝑡−1
𝑡−11 𝑡模型(Bridge是一类常用的即时预测模型,其基本思路是将高频指标聚合为与低频目标变量一致的口径,并通过回归模型预测低频变量。传统桥模型通常需要借助AR模型等方法将尚未发布的指标填充到季度末。本文采用Factor-Bridge模型,即先利用DFM从月度中观指标中提取公共因子,再将该因子作为桥回归的解释变量,用于预测景气代理变量。相比直接使用大量中观指标回归,该方法一方面能够压缩变量维度,减少参数估计数量并降低过拟合风险;另一方面,DFM的状态空间形式能够处理样本尾部缺失,满足即时预测场景下的信息更新需求。与前文混频DFM不同,Factor-Bridge不将财务景气代理变量直接纳入DFM,而是将其作为第二阶段回归目标。因此,该模型本质上是“两阶段”方法:第一阶段提取中观公共景气因子,第二阶段将公共因子映射至财务景气变量。第一阶段DFM可表示为:𝑋𝑡=Λ𝐹𝑡+𝜀𝑡,𝐹𝑡=𝐴1𝐹𝑡−1+⋯+𝐴𝑝𝐹𝑡−𝑝+𝑣𝑡第二阶段桥回归为:𝑦𝑇𝑇𝑀=𝛼+𝛽′̅()+𝜀𝑡 𝑡 𝑡其中̅()=1
,为月度因子聚合项。𝑡
𝑗
𝑡−𝑗模型MIDAS聚合至低频口径不同,S一般的MIDAS模型通常通过重新对齐不同指标的发布滞后来处理样本尾部数据不齐整问题。本文在MIDAS框架中进一步引入DFM,构建Factor-MIDAS模型。具体而言,本文首先利用DFM从月度中观指标中提取公共因子,并借助DFM原始月度频率纳入MIDAS回归,用于预测季度披露的TTM财务景气代理变量。与Factor-Bridge不同,Factor-MIDAS不预先将月度因子聚合,而是让模型通过滞后多项式自动学习不同月份因子对目标变量的影响权重。其回归形式可表示为:𝑦𝑇𝑇𝑀=𝛼+𝛽′Γ𝐿,)ˆ +𝜀𝑡 𝑡−ℎ𝑛 𝑡其中预测步长ℎ𝑛Γ(𝐿,𝜃)为滞后多项式,本文采𝑚用指数Almon多项式:Γ(𝐿,=∑𝑀 𝛾(𝑚,𝜃)𝐿𝑚。通过引入多项式,模型对估计系数进行简约参数化𝑚本量较少的情况下有助于减少过拟合风险。另外,在即时预测过程中,不同预测步长ℎ𝑛对应的信息集和样本尾部缺失结构不同,Factor-MIDAS通常针对不同预测步长ℎ𝑛分别估计模型,这类方法被称为直接预测。四、模型对比与改进模型结果对比接下来,我们就使用前文所述三种模型来构建景气度指数。首先用2010年至2014年的少量数据进行超参数调优,然后自2015年起采用滚动预测输出各期结果。效果评估方面,本文采用季度末序列的回归R²、MSE和两种方向准确率作为评价指标。其中,方向准确率进一步分为绝对方向和边际变化方向:绝对方向要求预测值与指标值符号一致,边际方向则要求预测值的变化方向与指标值的变化方向一致。表2:三类模型效果对比模型R2标准化MSE绝对准确率边际准确率DFM76.53%28.60%85.74%69.03%Factor-Bridge57.31%49.62%79.81%69.41%Factor-MIDAS50.05%58.98%77.69%64.58%从上表可以看出,Factor-Bridge和Factor-MIDAS两类回归模型的整体表现较为接近,而在各评价指DM在𝑅2MSE等指标上均明显优于acto-Bdge和actoMIA,说明其拟合效果更好、预测误差更小。相比之下,两类两阶段回归模型表现较为接近,表明两阶段回归方法的预测提升有限。由于接下来我们取预测效果较好的DFM模型结果进行分析。从行业维度看,煤炭、建材、钢铁行业的拟合效果较好;从财务代理维度看,营收同比和毛利同比的拟合效果较好,ROE次之,净利同比的拟合效果相对较弱。针对净利润同比预测难度较高这一现象,主要原因可归纳为以下两点:其一,营业收入和毛利主要映射主营业务的经营状况,受非经常性损益的干扰较少;而净利润同比不仅取决于中观产业周期,还受费用、税收、资产减值和投资收益等多重复杂因素影响。其二,净利润同比易受“基数效应”扰动,指标自身的波动性更强,在预测中容易产生较大偏差。图4:DFM景气指数解释度 图5:DFM景气指数MSEROE同比 营收同比净利同比毛利同比 ROE同比 营收同比净利同比毛利同比基础化工59.7%89.3%51.8%81.0%基础化工43.8%12.7%65.1%19.3%建材91.7%88.0%76.9%89.6%建材8.6%12.5%23.9%10.7%煤炭94.4%85.6%56.2%87.3%煤炭6.9%14.9%61.9%14.0%有色金属75.2%68.8%52.4%89.4%有色金属26.8%40.7%71.0%12.3%石油石化55.5%94.4%59.7%86.6%石油石化51.4%7.0%54.6%14.3%钢铁87.6%96.6%38.9%80.1%钢铁12.8%4.0%75.0%22.2%从预测方向准确率看,煤炭、有色、建材和钢铁行业的景气度指数能够较好捕捉行业景气状态及其边际变化。图6:DFM景气指数绝对方向准确率 图7:DFM景气指数边际方向准确率ROE同比 营收同比净利同比毛利同比 ROE同比 营收同比净利同比毛利同比基础化工71.1%84.4%71.1%86.7%基础化工63.6%75.0%63.6%59.1%建材91.1%88.9%84.4%93.3%建材72.7%77.3%72.7%68.2%煤炭95.6%93.3%75.6%95.6%煤炭70.5%72.7%65.9%79.5%有色金属82.2%93.3%77.8%88.9%有色金属77.3%65.9%50.0%81.8%石油石化82.2%91.1%71.1%88.9%石油石化59.1%81.8%56.8%77.3%钢铁95.6%93.3%75.6%86.7%钢铁79.5%75.0%56.8%54.5%基于前文所述方法构建的景气指数整体表现良好,但仍存在两方面问题:一是对净利润的预测效果较弱;二是部分景气指数在前期具有较好的拟合效果,但在后期出现较为明显的偏离。后文我们将针对这两个问题进行优化。分析师一致预期数据沉淀了行业研究员丰富的专业经验,且蕴含了中观行业数据之外的增量信息,因而对预测,跨频度拆解至季度数据的方法论尚无统一标准;二是样本覆盖率相对有限,且近年来全市场的覆盖度呈TTM313月底4241231年的历史数据;随后依据该权重占比将年度一致预期数据拆解至各季度;最后结合已披露的财务实值计算出预期的营收与净利同比。下图展示了预期同比与DFM模型预测值的对比结果。观察可知,预期营收同比的预测能力较弱,且调整幅度过高,其预测表现逊于我们构建的DFM模型。相反,预期净利同比在大多数时段内展现出极强的预测能力,而DFM模型在净利同比的预测上则往往伴随较大的偏差。其中,预期净利同比在钢铁和基础化工行业的表现尤为优异。图8:预期营收同比的预测效果较差 图9:预期净利同比的预测效果良好,朝阳永 ,朝阳永由此可以预见,分析师预期数据将对净利同比的预测形成有效补充。因此,我们引入预期净利同比数据作为外部特征输入,以观察模型对净利同比的预测精度是否获得提升,以及模型表现能否超越分析师预期数据本身。表3:最佳模型与一致预期评估指标差值行业R2差值标准化MSE差值绝对准确率差值边际准确率差值钢铁-0.65%-0.38%0.00%0.00%煤炭+0.28%-11.51%+4.44%+2.27%石油石化+1.01%-33.35%+6.67%+9.09%基础化工-24.84%+44.13%-24.44%-9.09%建材+3.35%-12.71%+15.56%0.00%有色金属+49.08%-110.16%+2.22%0.00%,朝阳永致预期数据与产业链数据相结合,有助于提升净利润预测的准确性。其主要考虑是,在样本量有限的情况下,尽可能充分利用历史信息,以提高参数估计的稳定性,这也是即时预金融工程深度报告测中较为常见的处理方式。从结果来看,该方法对多数预测目标取得了较好的拟合效果。然而,仍有部分景气指数在样本后期出现了明显偏离。本文认为,这一现象可能与结构变化有关。如图所示,当结构相对稳定时,扩展窗口能够利用更多样本,参数估计会更加稳定;而当行业逻辑、盈利驱动因素等发生变化时,早期数据可能已无法很好刻画当前结构,此时扩展窗口容易受到历史模式拖累,滚动窗口反而因更贴近新的结构而具有更强的适应性。因此,我们引入基于滚动窗口训练的短期模型,以改善结构变化下的预测效果。具体而言,我们同时训练扩展窗口模型和滚动窗口模型,分别称为长期模型和短期模型。当连续3个季度长期模型的MSE均高于短期模型时,认为近期结构可能发生变化,引入短期模型,并根据历史MSE对两者预测值加权组合;相反,当连续3个季度短期模型的MSE均高于长期模型时,则认为短期结构变化的影响有所减弱或短期模型已不再具有增量预测价值,则退出短期模型。图10:扩展窗口与滚动窗口信建投证券图11:加入短期模型后适应结构变化,朝阳永金融工程深度报告以石油石化行业的ROE景气度为例,长期模型在2023年前拟合效果较好,在2023年后出现频繁偏离。引入短期模型后,预测效果有所改善,𝑅2提升18%,边际方向准确率提升2%。五、大模型增强盈利预测在前文中,我们提出了以盈利预测为中间目标的景气度研究方法,首先采用回归𝑅2和t检验方法,从中观及宏观指标库中筛选预测变量,随后分别构建了DFM、Factor-Bridge、Factor-Midas三类模型,对行业盈利进行预测。然而我们建模过程中意识到使用中观指标进行行业盈利预测面临以下困难。第一,有效样本量较少。财务数据通常以季度频率披露,可用于建模的时间序列样本较少。同时,不同行业所适用的中观指标存在较大差异,难以将多个行业合并开展截面建模。因此,行业盈利预测通常不适合使用复杂机器学习模型。此外,当行业基本面逻辑发生显著变化时,新兴需求或驱动因素的相关指标往往缺乏足够长的历史数据,使模型难以充分学习其与行业盈利之间的关系,从而进一步限制了模型对行业结构性变化的刻画能力。第二,非线性关系难以得到充分建模。前文采用的指标筛选方法与预测模型均以线性方法为主,因而入选指标多集中于需求、价格等影响方向相对明确的维度,对库存、供给等作用机制更为复杂的变量关注不足。事实上,此类指标同样包含重要的景气信息。例如,库存周期通常可划分为主动补库、被动补库、主动去库和被动去库四个阶段,其中主动补库与被动去库均可能对应行业景气上行,但二者所处的供需环境及传导机制存在显著差异。线性方法和模型较难准确识别此类复杂关系。前文中我们尝试引入一致预期数据改进净利润预测,一致预期反映了行业分析师的整体判断。然而,如前文所述,一致预期数据仍存在预测区间不匹配、预测目标类型有限以及覆盖标的有限等问题。尽管一致预期数据没能覆盖本文涉及的全部预测实验,但其背后的研究思路仍具有启发意义:专业分析师能够在有限样本下整合多维信息,并识别变量间潜在的非线性关系。基于此,本文进一步引入大模型开展行业景气度研究,以模拟分析师的信息整合与逻辑判断过程。目前,大模型在金融领域的应用已得到较为广泛的研究,相关场景包括自动化因子挖掘、多智能体投研团队构建以及文本类数据处理等,部分研究已取得较好的实践效果。针对本文所关注的研究场景,即以盈利预测为中间目标开展行业景气度研究,我们认为大模型主要可以从以下三个方面发挥作用。指标选取与特征扩充:中观指标数量较多、结构复杂,且不同指标与行业盈利之间的关联程度存在明大模型还可以结合已有指标的经济含义,构造具有明确产业逻辑和较强解释力的衍生指标,例如库容比、库销比、量价组合、供需缺口及产品价差等。该环节的主要价值在于提高指标筛选与构造效率,其结果也具有较强的确定性和可验证性。大模型预测:输入中观数据后,也可以直接要求大模型判断行业的盈利状况及其变化趋势。在此基础上,还可以进一步检验大模型是否能对线性模型的预测结果进行校正。该方法本质上是让大模型承担主观研究的角色,对多维信息进行综合归纳,并尝试捕捉传统线性模型难以充分刻画的复杂关系。文本数据处理:除结构化中观数据外,政策、新闻、研报、财报等文本数据同样包含大量与行业景气金融工程深度报告度和盈利变化相关的信息。大模型可以将文本数据转化为可用于建模的结构化信号,进一步拓展行业盈利预测的信息来源。受篇幅所限,本文主要对前两种应用方式展开尝试。5.1特征工程前文已基于各行业的产业逻辑,分别构建了相应的中观及宏观指标库。在此基础上,大模型可进一步结合行业经营特征及盈利传导机制开展特征工程,对原始指标应用加减乘除、差分、计算相关性等算子进行组合,包括但不限于构造同一产品的量价组合、库销比、供需缺口以及上下游产品价差等指标,以挖掘原始指标中未A×B销量’这类口径不一致的组合”,发布延迟取最大滞后以保证数据可得性等。前文已基于各行业的产业逻辑,分别构建了相应的中观及宏观指标库。在此基础上,大模型进一步结合行业经营特征与盈利传导机制开展特征工程,通过加减乘除、相关性计算等算子对原始指标进行组合与变换,包括构造同一产品的量价组合、库销比、供需缺口以及上下游产品价差等衍生指标,以挖掘原始指标中未被直接刻画的信息。同时施加必要的边界约束,例如避免构造“产品A价格×产品B销量”等缺乏明确经济含义的组合;对于涉及多个基础指标的衍生指标,则以各指标中最长的发布滞后作为整体滞后期,以确保数据可得性。以煤炭行业为例,大模型基于原始指标进一步构造了“秦皇岛港库存/30日日均吞吐”和“动力煤消费量×秦皇岛动力煤平仓价”等46个衍生指标。其中,前者通过将港口库存与实际周转能力相结合,用于刻画库存相对于吞吐水平的压力;后者则将消费量与市场价格进行组合,以综合反映动力煤市场的量价变化。根据不同行业的指标基础及产业特征,大模型分别生成了约30-60个衍生指标。为检验新增指标的解释能力,本文统计了各期𝑅2和t统计值排名前10的指标中,大模型衍生指标的平均入选数量,结果如下表所示。表4:大模型衍生指标解释力较好R2top10中个数T-stattop10中个数基础化工2.021.37建材3.242.07煤炭3.542.95有色金属1.653.18石油石化1.702.23钢铁1.422.74平均2.262.42,朝阳永结果表明,大模型生成的部分衍生指标具有较好的解释能力。在𝑅2排名前10的指标中,衍生指标平均占2.26个;在t统计值排名前10的指标中,衍生指标平均占2.42个。总体来看,大模型能够依据行业经营机制对原始指标进行有效组合,在一定程度上补充原始指标体系未能直接反映的信息。我们每期按照与原始指标池相同的筛选标准,从衍生指标池中选取5个指标额外纳入模型。加入大模型生成的衍生指标后,模型整体表现有一定程度的改善,且不同行业之间存在一定差异:建材、煤炭和钢铁三个行金融工程深度报告业的平均𝑅2达到88%-90%左右,石油石化的𝑅2也达到85.12%,而有色金属和基础化工的平均𝑅2仅为74.11%和77.98%。通过进一步比较加入衍生指标前后的模型表现可以发现,衍生指标对原本拟合效果较弱的行业,改善主要体现在拟合精度上,即提升𝑅2并降低MSE。其中,有色金属行业的拟合优度提升2.36%,标准化MSE下降3.1%。相比之下,对于原本拟合效果较好的行业,衍生指标的贡献更多体现在方向判断准确率的提升上。由此可见,大模型衍生指标对不同行业的作用机制存在一定差异:对于原模型解释能力相对不足的行业,其主要作用是补充有效信息、改善拟合效果;对于原模型已具有较高拟合能力的行业,则更多体现为对边际预测信息的补充,从而提升方向判断的准确性。表5:加入衍生指标后模型表现变化行业R2差值标准化MSE差值绝对准确率差值边际准确率差值建材-0.45%0.40%1.11%2.27%煤炭-0.11%-0.46%0.00%0.00%钢铁1.30%-1.77%-1.11%0.00%石油石化-1.86%2.08%-3.33%1.70%有色金属2.36%-3.10%-1.11%1.14%基础化工1.03%-1.01%0.00%-2.84%平均0.38%-0.65%-0.74%0.38%,朝阳永大模型预测接下来我们尝试使用大模型进行盈利预测。如前文所述,在有限样本条件下,基于线性筛选方法构建的预测模型通常依赖价格、需求等影响方向相对明确的指标。为弥补统计模型在行业逻辑整合和复杂情景识别方面的不足,本文引入大模型,对行业盈利变化进行判断,从而形成对线性模型的补充。大模型独立预测我们首先检验大模型对行业盈利的独立预测能力。如果大模型预测值较为稳定和准确,则可将其与线性模型预测值直接结合,甚至能直接替代线性模型。本文采用DeepSeek-V4-Flash模型,并将温度参数设置为0,以尽可能保证模型输出结果的稳定性。为降低未来信息泄露风险,架构遵守时间匿名化原则:即输入中不直接暴露真实日期,而是采用[T,T-1,T-2,…]的相对时间标识,以避免大模型调用预训练中包含的历史事件记忆或外部知识进行作弊。大模型输入信息主要包含以下四个模块:任务说明行业逻辑:提供行业层面的稳定先验逻辑,例如煤炭行业中“煤炭分为动力煤和炼焦煤两条需求主线:动力煤受电力和供热需求驱动,炼焦煤跟随钢铁生产链条”、“煤炭成本端相对刚性,产品价格变化通常是利润弹性的最重要变量”等。该部分主要用于为大模型提供相对稳定的行业分析框架。指标数据:包括目标标签历史和中观指标数据。目标标签部分输入最近4个已披露季度的历史序列及相关说明,同时加入前一个季度末的预测值,作为连续预测时的参考。中观指标部分将月度数据预处金融工程深度报告12个月均值,用于反映长期趋势;相对上季度末12个月均值的变化,用于衡量趋势的边际变化;本季度指标已披露月份数,用于反映数据披露完整度,模型可以基于披露情况判断单个指标可信度的强弱。类别摘要3个月平均变化等信息。该模块用于帮助大模型先从行业维度把握主要变化。输出包含以下内容,其中predicted_change_pct_point为预测值。考虑到直接要求模型预测绝对水平的难度较大,本文将预测目标设定为相对于前一期已披露真实值的变化幅度。同时,模型还需输出对行业当前经济状态的判断以及判断证据。图12:独立预测输出schema信建投证券结果表明,大模型虽然具备一定的预测能力,但整体表现要弱于线性模型。大模型独立预测仅在少数实验中取得更优。例如在有色金属行业的营收预测中,大模型的𝑅2较线性模型提高6.4%,标准化MSE降低7.4%;在基础化工行业的ROE预测中,大模型预测值的绝对准确率和边际准确率分别较线性模型提高4.4%和4.5%。表6:大模型独立预测结果R2标准化MSE绝对准确率边际准确率大模型独立预测74.00%38.02%86.67%68.47%与线性模型差值-9.91%+20.40%-2.87%-3.88%,朝阳永大模型校正预测前一小节的结果表明,大模型独立预测尚未达到可直接应用的有效性要求,但其展现出一定的分析和预测能力。基于此,本文进一步调整大模型的功能定位,将其由独立预测器转化为线性模型的纠偏模块。在该框架下,线性模型被视为预测的强先验,其结果在多数情况下具有较高的参考价值,但所使用的信息通常集中于需求、价格等影响方向相对明确的指标。大模型的主要任务并非重新进行独立预测,而是重点识别供给、库存、宏观环境等其他维度是否出现显著背离或遗漏信号,并判断这些证据是否可能导致线性模型的预测方向或预测水平发生偏离。本模块整体沿用前一小节的分析框架,并根据校正任务进行相应微调。在输入端,新增线性模型的预测结果及相关信息,使大模型能够在线性模型预测的基础上进行审查与判断;在输出端,则由原先的独立预测转变为判断线性模型是否存在方向性错误或水平偏差,并在认为有必要时给出修正后的预测结果。图13:校正预测输出schema信建投证券最终结果表明,经大模型校正后的预测表现优于其独立预测,但整体表现仍劣于线性模型,仅在绝对准确率一项上有小幅提升。从具体案例看,部分行业和财务指标仍表现出一定的校正效果。例如化工毛利景气的𝑅2提升2.52%,边际准确率提升2.27%;钢铁营收景气在未牺牲精度的情况下,绝对准确率和边际准确率提升2.22%和6.82%。上述结果表明,相较于要求大模型直接进行独立预测,将其定位为线性模型的校正模块,在已有预测结果的基础上识别潜在偏差并进行审查和修正,是更为适配的任务设定。尽管校正预测在部分案例中能够带来局部改善,但整体仍未超过线性模型,说明其效果的稳定性和普适性仍有待提升。总体而言,将大模型作为传统线性模型的校正模块是更具应用潜力的方向,后续可在此基础上开展进一步优化校正机制的研究。表7:大模型校正预测结果R2标准化MSE绝对准确率边际准确率大模型校正预测82.74%21.33%90.46%71.40%与线性模型差值-1.17%+3.70%+0.93%-0.95%,朝阳永六、景气度指数结果及应用景气度指数构建结果下图展示了每月滚动预测得到的各行业景气度指数,各模型均纳入了大模型生成的衍生指标。其中营收、ROE、毛利景气指数为DFM模型;钢铁、基础化工行业的净利景气指数取一致预期净利同比数据,其他行业的净利景气指数为结合分析师预期数据后的最佳模型。图14:煤炭行业景气指数 图15:钢铁行业景气指数,朝阳永 ,朝阳永图16:石油石化行业景气指数 图17:建材行业景气指数,朝阳永 ,朝阳永图18:基础化工行业景气指数 图19:有色金属行业景气指数,朝阳永 ,朝阳永景气度指数应用行业景气状态判断景气度指数最基础的应用,是识别行业当前所处的景气状态,并判断其未来可能的变化方向。以2026年5月末的截面为例,煤炭行业的4项景气度指数均呈现“绝对水平偏低、边际趋势向上”的特征,表明行业景气度可能正处于筑底修复阶段,未来具备进一步回升的潜力。不过,各指数仍处于0以下,说明煤炭行业尚未完全走出景气底部,后续修复的持续性和强度仍有待进一步观察。图20:煤炭行业景气指数,朝阳永除用于判断行业景气状态外,本文构建的即时预测模型还具备一定的可解释性。具体来说,对于Bridge和MIDAS两类回归模型,可以通过模型载荷近似衡量各项指标对预测结果的贡献;对于动态因子模型(DFM),则可利用其内生的“news”分解功能,识别新数据发布后不同信息对预测值修正的边际调整贡献。以煤炭行业营业收入预测为例,在2026年5月末的截面下,模型预测值为-6.76%,较4月末的-7.14%调整表8:煤炭营收5月截面调整贡献情况指标调整贡献前值新值中国:PPI:黑色金属冶炼及压延加工业:当月同比-0.58%-2.50-1.10中国:制造业PMI-0.32%50.3050.00中国化工产品价格指数0.28%4916.004916.00中国:PPI:当月同比0.27%0.502.80期货结算价(活跃合约):焦炭0.24%1901.001901.00中国:PPIRM:燃料、动力类0.21%96.20104.40海运煤炭运价指数OCFI:综合0.11%1282.861282.86中国:制造业PMI:主要原材料购进价格0.09%63.7060.50中国:万寨港:平仓价(含税):无烟洗小块(A13%,V5-9%,S≤1%,Q≥6500)0.08%1270.001270.00衍生:制造业PMI生产-原材料库存-0.05%3.702.20,朝阳永“超预期”信息如何进一步影响最终预测结果。同时,我们还可以结合入模指标𝑅2和t值,从统计意义上考察所关心指标对预测目标的解释性。此外,由于DFM模型采用卡尔曼滤波框架,还可以进一步追溯各指标在历史各时点对当前预测值的贡献。综合这些信息,我们可以从多个维度理解模型预测结果,并进一步单行业择时景气度的水平及其变化是市场判断行业运行状态与未来收益趋势的重要依据。基于这一逻辑,本文围绕4类景气度指数,分别构建绝对水平、季度变化、月度变化和稳健水平4类算子,共计形成16个因子。第一类为orig因子:取当月景气度指数的原始值,用于刻画行业所处的景气水平,判断其处于高景气或低金融工程深度报告景气状态。第二类为qoq因子:计算景气度指数相较上个季度末的差分,用于衡量行业景气度的季度边际变化。第三类为因子:计算景气度指数相较三个月前的差分,用于刻画短期景气变化。第四类为mtv9因子:计算景气度指数过去9个月的均值与标准差之比,以衡量景气水平的稳定性。为消除市场整体走势对行业收益的影响,本文通过做多行业指数、做空中证全指的方式构建行业超额收益指数,并分别检验各类因子在行业指数和行业超额指数上的择时效果。16个因子中,共有6个因子在行业指数择时中取得平均为正的超额收益,12个因子在超额指数择时中取得了平均为正的超额。其中,ROE_qoq因子的表现较为突出:在行业指数择时中,其平均超额年化收益达到2.91%,6个行业42.36%4个行业取得正超额。总体来看,多数因子能在超额指数择时中战胜基准,即能够较好地捕捉行业相对于全市场的强弱变化,表明景气度指标对行业超额收益具有一定的解释力和择时价值。此外,qoq和diff3类因子在行业指数择时
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2027届四川省青神中学物理高一第一学期期中联考试题含解析
- 云南省曲靖市沾益区第四中学2027届高三物理第一学期期中质量检测试题含解析
- 江西省上饶市横峰中学、铅山一中、余干一中2027届高三上物理期中联考模拟试题含解析
- 2027届江苏省泰兴市第三高级中学物理高二第一学期期中学业质量监测试题含解析
- ISO 12219-112025 道路车辆内部空气 第11部分车辆用非金属材料表征用有机排放物的热解吸分析标准立项发展报告
- 四川省泸州市泸县一中2027届高二上物理期中预测试题含解析
- 高中数学必修一第三章单元综合检测试题(含解析)人教A版
- 2026年冬阴功汤的调味技巧
- 2026年乌鲁木齐市资格考试试卷及答案
- 2026年北京技能资格考试试卷及答案
- 《保健艾灸师》专项测试题附答案
- 部编版小学六年级语文上册第三单元集体备课记录表
- 第3讲“运动图像”的分类研究
- 教科版四年级英语上册(广州版)全册课件【完整版】
- 国家审计报告
- 企业班组安全管理标准化通用规范
- GB/T 17421.2-2016机床检验通则第2部分:数控轴线的定位精度和重复定位精度的确定
- 部编人教版六年级道德与法治上册全册教学课件
- 泄漏电流能力验证终期报告
- ISO15189质量体系同济医院检验科ISO15189体系文件-质量手册
- 24度锥接头设计
评论
0/150
提交评论