BetaAgent:交易风险因子挖掘和评估系统_第1页
BetaAgent:交易风险因子挖掘和评估系统_第2页
BetaAgent:交易风险因子挖掘和评估系统_第3页
BetaAgent:交易风险因子挖掘和评估系统_第4页
BetaAgent:交易风险因子挖掘和评估系统_第5页
已阅读5页,还剩26页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

内容目录一、引言 5交易风险因子挖掘评估系统的定位 5风险因子构建方式对比 5Agent驱动的工作流范式 6内容安排 6二、OpenAIAgents使用指南 7核心概念详解 7Agent智能体 7Runner执行 7Tools工具 8Handoffs交接 8Guardrails护栏 8Sessions会话记忆 9主要功能 9Functiontool:让Agent调用自定义工具 9WebSearchTool:让Agent上网查资料 10CodeInterpreterTool:让Agent执行代码 10Handoff模式:多Agent协作 11Agent-as-Tool模式:更灵活的协作 12Guardrails:给Agent装上安全护栏 13Sessions:Agent的记忆管理 14金融场景案例 15多Agent协作投研工作流程 15多Agent协作因子构建评估流程 16多Agent协作组合构建评估流程 17三、BetaAgent介绍 三大核心Agent 18IdeaAgent 19FactorAgent 19EvalAgent 20算子库设计 20因子评估框架 21增量解释力评估 21长期t显著性检验 22信息独立性(VIF) 22因子稳定性与衰减 22风险型IC形态 22因子池冗余性 22四、结果对比 BetaAgent生成的风险因子总览 23因子表现评估 25组合层面的提升 27五、总结 六、参考文献 七、风险提示 图表目录图1:风险因子构建方式对比 6图2:Agent示例 7图3:Runner示例 8图4:Tools工具类型对比 8图5:Functiontool应用示例 9图6:WebSearchTool应用示例 10图7:CodeInterpreterTool应用示例 11图8:Handoff模式应用示例 12图9:Agent-as-Tool模式应用示例 13图10:Guardrails应用示例 14图11:Sessions应用示例 15图12:多Agent协作投研工作流程 16图13:多Agent协作因子构建评估流程 16图14:多Agent协作组合构建评估流程 17图15:BetaAgent风险因子挖掘评估框架 18图16:BetaAgent流程图 19图17:高频一元算子列表 20图18:高频二元算子列表 21图19:日频算子列表 21图20:BetaAgent生成风险因子表现对比 23图21:BetaAgent生成风险因子与基准风险因子体系的相关性 23图22:BetaAgent生成风险因子的相关性矩阵 25图23:资金流路径震荡与成交量集中度共振风险RankIC 25图24:收益偏度残差持续性风险因子RankIC 25图25:资金流-收益路径震荡背离风险RankIC 26图26:日内非对称波动率风险RankIC 26图27:资金流量价相关性背离风险RankIC 26图28:三重微观结构风险叠加因子RankIC 26图29:日内收益偏度-峰度交互风险RankIC 26图30:成交量-收益路径震荡背离风险因子RankIC 26图31:资金流方向强度与成交量波动综合风险RankIC 26图32:开盘冲击吸收风险RankIC 26图33:BetaAgent相对基准风险因子体系的增量贡献 27图34:BetaAgent相对基准风险因子体系的增量贡献(分年度) 27图35:指数增强组合绩效总览 28图36:沪深300指数增强组合表现 28图37:沪深300指数增强组合(BetaAgent)表现 28图38:沪深300指数增强组合分年度表现 28图39:沪深300指数增强组合(BetaAgent)分年度表现 28图40:中证500指数增强组合表现 28图41:中证500指数增强组合(BetaAgent)表现 28图42:中证500指数增强组合分年度表现 29图43:中证500指数增强组合(BetaAgent)分年度表现 29图44:中证1000指数增强组合表现 29图45:中证1000指数增强组合(BetaAgent)表现 29图46:中证1000指数增强组合分年度表现 29图47:中证1000指数增强组合(BetaAgent)分年度表现 29一、引言交易风险因子挖掘评估系统的定位风险因子与Alpha多因子风险模型框架,该模型将股票收益率分解为国家因子、行业因子、风格因子与特质收益四部分,通过截面面是在组合优化中约束控制组合的风险暴露。风险因子追求暴露稳定性、信息独立性、统计显著性以及经济可解释性;相比之下,Alpha信号追求短期预测能力,可以非线性、高换手、甚至无需直观的经济解释。简言之,风险因子是对收益来源的结构化理解,Alpha信号是对未来收益的预测工具。风险因子在组合优化环节中扮演不可替代的角色。若风险因子对系统性风险暴露的刻画不够精细,组合可能将承担未被识别的系统性风险。在业绩归因环节,风险因子的作用同样关键,通常需要借助风险模型将组合收益拆解到各个因子维度。如果某些系统性风险来源未被纳入模型,它们将被错误地归入特质收益项,导致归因结果失真。新风险因子的发现意味着对收益来源更精细的理解,每一个独立的新因子都相当于在风险模型坐标系中增加了一个维度。CNE6是中国A股市场最广泛应用的多因子风险模型之一。CNE6的绝大多数风格因子基于日频数据构建,希望捕捉中长期的风险。然而,短期的交易类风险指标并未被纳入体系,例如订单流不平衡、波动率聚集、流动性冲击、交易拥挤度等,这些信息蕴含在分钟级别的高频行情和主动买卖资金流数据中,但现有风险因子体系并未设计相应的聚合算子来提取这些微观结构特征。传统风险因子研究的流程(文献阅读→假设构思→代码实现→回测验证→因子筛选)高度依赖个人经验,研究周期较长。每一步的人工参与都可能构成瓶颈:研究员的认知偏见限制了假设空间,手工coding引入重复劳动,评估标准的主观性使产出难以横向比较。自动挖掘系统将研究周期大幅缩短,且具有三个方面的优势。首先同样基于交易微观结构的假设,使得因子具有逻辑性和可解释性;丰富的日内与日间算子库一定程度上扩展了探索空间;研究经验的系统化沉淀,每次试验的假设、代码、指标和反馈被结构化记录,形成可查询的研究记忆以指导后续探索。风险因子构建方式对比人工构建是最传统的风险因子生产方式。研究员基于经济学直觉手工设计因子表达式,优势在于可解释性强——每个变量和操作均有明确的经济学含义,与现有理论体系兼容性高。劣势在于产出速度慢、假设空间受思维定式限制、难以探索高维非线性组合。遗传规划(GeneticProgramming,GP)通过选择、交叉、变异等遗传操作在庞大的表达式空间中搜索最优因子公式。GP的优势在于搜索空间较大,但缺陷同样显著:易产生过拟合——可能找到训练期内优异但样本外失效的表达式;缺乏经济解释——生成的表达式高度非直观,可解释性较低;后期筛选成本高——批量产生大量候选因子,绝大多数可能在统计检验中表现不佳。以LSTM、Transformer、GNN为代表的深度学习方法被广泛应用于Alpha生成领域。其核心优势是表达能力极强。但在风险因子挖掘场景下面临根本性障碍:可解释性较差——黑箱特性使模型输出的因子无法用于业绩归因;因子性质不稳定——当模型重新训练时,生成的因子与先前的因子无法对应。Agent驱动方法将LLM的经济学知识与代码生成能力形成自动化研究闭环。与上述三种方法相比,它在四个维度实现差异化:LLM经济学和市GP和深度学习的纯数据驱动,LLM可为每个因子提供经济直觉;代码自动生成消除人工coding评估→反馈的完整闭环;Trace记忆确保失败经验的系统化沉淀——主动避免重复已知失败模式并动态调整搜索方向。下表从五个维度对四种方法进行系统比较:图1:风险因子构建方式对比比较维度人工构建遗传规划(GP)深度学习Agent驱动方法可解释性高,经济逻辑清晰中,难以与经济理论建立关联低,黑箱模型高,LLM提供经济机制解释搜索空间窄,受限于研究员认知边界宽,覆盖所有基础算子组合宽,可逼近任意复杂函数宽,LLM可提出假设组合过拟合风险低,经济逻辑提供正则化约束较高,易捕捉局部模式高,模型复杂度高中,评估体系提供多层防护产出效率低,单个因子需数日到数周中,可批量生成,但筛选成本高中,训练耗时高,单轮批次数分钟完成失败经验沉淀较弱,记录零散无,不保留结构性失败信息无,不区分失败原因强,系统结构化记录天风证券研究所Agent驱动方法在保持高可解释性的同时显著扩展了搜索空间并提升了产出效率,既继承人工构建在经济逻辑上的严谨性,又具备接近GP和深度学习的自动化程度。Agent驱动的工作流范式多Agent协作将复杂任务进行拆解,构建多个专业化角色,每个角色由独立Agent承担,通过标准化接口协同工作。这种分工的价值在于专业化解耦,每个Agent只需关注有限任务范围,其系统提示词高度聚焦特定角色的行为准则,使得LLM在每个环节上的推理质量更高、输出更稳定可控。多个Agent之间可支持Handoff,即允许Agent在处理完所负责的工作后将控制权动态移交给更专业的Agent并携带完整上下文。另外,也支持Agent在工作过程中指派多个Sub-Agent完成各项细分工作并反馈给Agent。多样化可自定义的构建方式极大地提升了我们工作流编排的灵活性。在BetaAgent中,IdeaAgentLLM基于市场微观结构知识与实验过程中的经验及反思生成新的因子构建想法与逻辑;FactorAgent将因子构建的思路转化为可实现的代码,接入数据库计算因子值;EvalAgent对因子值进行多项指标的分年度计算与评估,生成评估报告改进建议等均会写入Trace,作为长期记忆。下一轮迭代时Trace中重要信息会传递回IdeaAgent,形成带记忆功能的闭环,使系统通过持续改进逐步构造出高质量的风险因子。Agent工作流编排通过OpenAIAgentsSDK进行,AgentsSDK是OpenAI提供的编排框架,管理"谁来做、怎么做、先后顺序"。相较于Codex等智能体应用,其优势在于工作流各流程以及Agent间的协作方式均可自定义,过程完全精确可控,更适合自定义工作流的搭建。而智能体应用更偏向于在对话框中完成一些通用性的任务,处理过程通常难以自定义,且相对不可控。内容安排本文的的内容安排如下:第二章介绍OpenAIAgentsSDK的核心概念和基本功能,为快速入门的使用指南,同时也提供一些场景案例可供参考。第三章介绍BetaAgent整体架构,从三大核心Agent到之间的流程编排,再到算子库与评估方案的设计以及记忆管理。第四章分析BetaAgent给出的风险因子,以及在现有的风险因子体系下的增量贡献,对比测试多种指数增强策略上带来的提升。第五章总结。二、AgentsSDK使用指南OpenAIAgentsSDKAgent框架,通过它可以快速构建能够自主AgentLangGra等,OpenAIAgentsSDK是更易于上手的。本章关于概念和功能的介绍主要参考[1],[1是OpenAIAgentsSDK的官方说明文档。核心概念详解在Python环境中,openai-agents可直接通过pip进行安装,在配置好APIKey后即可使用。Agent智能体Agent是SDK的最基本单元。它是一个配置了大模型、指令、工具、护栏和交接选项的"数字员工"。图2:Agent示例天风证券研究所其中,name是Agent的标识名,instructionsAgent的系统提示词,定义Agent的行为准则,modelAgentLLM模型,toolsAgent可调用的工具列表,handoffs定义AgentAgent,input_guardrailsoutput_guardrails分别为输入和输出校验规则,output_type是结构化输出类型。Runner执行Runner是Agent工作流的"导演"。不需要写循环来处理"Agent调用工具→获取结果→继续推理"这个反复过程,Runner自动进行管理。图3:Runner示例天风证券研究所其中,result对象包含的重要信息包括result.final_output(字符串形式的最终答案el.lasage.am(最后处理请求的gent名el.ointlis(完整对话历史,erruptions(是否有中断。Tools工具Tools让Agent从聊天机器人升级为能做事的助手。下面是SDK支持的一些工具,可参考[1]:图4:Tools工具类型对比工具类型代表运行环境适用场景HostedToolsWebSearchTool,CodeInterpreterTool,FileSearchToolOpenAI服务器通用能力,零配置FunctionTools用@function_tool装饰的Python函数本地进程连接内部系统、自定义逻辑LocalRuntimeToolsComputerTool,ShellTool,ApplyPatchTool本地或容器文件操作、命令执行AgentsasToolsAgent.as_tool()SDK内部多Agent协作CodexToolcodex_tool()Codex沙箱代码生成、文件编辑https://openai.github.io/openai-agents-pythonHandoffs交接Handoff是AgentsSDK的核心特性,它让一个Agent可以把任务转交给另一个更专业的Agent。例如量化场景中,研究类型的Agent将研究成果与结论转交给代码工程类型的Agent,由后者负责工程落地与实现。这种设计使得各Agent的上下文互不干扰,让每个Agent更专注于自己的方向。Guardrails护栏Guardrails是Agent系统的"安全气囊"。它在输入到达Agent之前、或输出返回用户之前,执行校验和拦截。InputGuardrails:拦截恶意输入、越权请求、注入攻击。OutputGuardrailsToolGuardrails:校验工具调用的参数和返回值。Sessions会话记忆Session解决"Agent如何记住之前的对话"这个问题。SDK内置了多种Session实现:SQLiteSession:本地开发,默认选择。RedisSession:分布式部署,多实例共享。SQLAlchemySession:企业已有数据库。MongoDBSession:文档数据库场景。OpenAIConversationsSession:历史存OpenAI服务器。主要功能Functiontool:让Agent调用自定义工具FunctionTool是最常用、最灵活的工具类型之一。它可以把任何Python函数变成Agent可调用的能力。读取写入本地文件,本地执行代码,访问本地终端等操作均可由FunctionTool来实现。图5:Functiontool应用示例天风证券研究所首先,@function_tool装饰器会自动读取函数的类型注解和docstring注释,生成工具描述。Agent根据描述决定什么时候调用这个工具。另外,函数参数的类型会被严格校验,如果Agent传了错误的数据类型,SDK会自动拦截并返回错误让Agent重试。WebSearchTool:让Agent上网查资料WebSearchTool是OpenAI托管的工具,让Agent能实时搜索互联网。它运行在OpenAI的服务器上,不需要配置搜索引擎API。图6:WebSearchTool应用示例天风证券研究所其中,WebSearchTool的参数search_context_size为搜索结果给模型的上下文量。Agent基于指令在网络上搜索相关内容,并反馈结果。CodeInterpreterTool:让Agent执行代码CodeInterpreterTool让Agent在安全的沙箱环境中执行Python代码。它预装了numpy、pandas、matplotlib等常用库,非常适合数据分析场景。CodeInterpreterTool的核心价值有三个方面:首先是安全隔离,代码在OpenAI的远程沙箱中运行,不会访问本地文件系统;其次有预装库,包括pandas、numpy、matplotlib、scipy等,无需安装;另外能够自动可视化,Agent可以生成图表并嵌入到回答中。对于本地运行各项需求,也可以使用Function自行编写设置代码执行环境来实现。图7:CodeInterpreterTool应用示例天风证券研究所Handoff模式:多Agent协作HandoffAgentsSDKAgent像一个团队一样协作。例如下面这个智能客服分流系统。其工作原理如下:用户输入进入triage_agent。triage_agentLLM判断问题类型。SDK控制权转交给后续Agent,如账单类型问题则交付给billing_agent;如技术问题则交付给technique_agent。后续Agent基于完整上下文回答问题,并将答案返回给用户。图8:Handoff模式应用示例天风证券研究所Agent-as-Tool模式:更灵活的协作Handoff的缺点是控制权完全转移,也就是说分流Agent一旦把任务交出去,就不再参与后续过程。如果希望一个主Agent始终保持控制、协调多个专家子Agent的工作,应该用Agent-as-Tool模式。Agent-as-ToolHandoff模式,其控制权完全在主Agent,统一调度分配任务给子gege-a-Toladff模式适合对话路由与专业领域切换场景。在下面例子中,定义了两个专家Agent分别配备了天气查询分析和空气质量查询分析的工具。主Agent会依据指令将任务分派给各专家Agent,收到结果反馈后,进行综合评估并输出。图9:Agent-as-Tool模式应用示例天风证券研究所Guardrails:给Agent装上安全护栏Guardrails确保Agent在安全的边界内运行。它是生产环境部署的必备组件。例如我们可以设置输入护栏拦截非金融类查询,同样也可以为输出设置护栏。图10:Guardrails应用示例天风证券研究所Sessions:Agent的记忆管理没有记忆的话,Agent每轮对话都会从零开始,Sessions解决了这个问题。Runner在每次运行前,自动从session中取出历史对话,将历史和新输入一起发给Agent,运行结束后将历史对话存回session。图11:Sessions应用示例天风证券研究所金融场景案例本小节给出三个多Agent协作的应用案例,包括投研工作、因子研究、组合研究方面。多Agent协作相比于程序化工作流有以下几个优势:更适合处理非结构化、变化快的研究任务程序化工作流依赖预先写好的规则、字段和分支,适合数据格式稳定、逻辑明确的任务;一旦遇到研报、公告、新闻、会议纪要或需求描述等非结构化信息,就需要人工重新定义规则。Agent能理解自然语言目标,主动拆解研究问题、提取关键信息,并根据上下文选择数据、工具和分析路径。能够形成“计划—执行—检查—修正”的闭环传统程序通常按既定流程一次执行:输入数据、运行模型、输出结果。若中间出现缺失数Agent协作工作流则可以将任务分配给不同角色,各Agent共享阶段性结果并相互校验,使流程能够根据实际反馈调整,而不只是机械执行固定脚本。Agent最终仍应由研究人员审核关键假设、风险约束和上线决策。多Agent协作投研工作流程工作流由综合分析Agent作为研究负责人统一编排。用户描述研究问题、证券代码及研究区间后,负责人会将任务拆分为四条专业研究线:宏观Agent负责宏观数据与政策信息,公AgentAgent评Agent则检索公告、新闻与市场情绪AgentAgent基于Agent收到各专家结论,对事实、推断和情景进行区分,并识别不同证据之间的冲突或一致性,形成包含结论摘要、宏观环境、基本面、量化分析、新闻舆情、风险清单和后续跟踪指标的研究报告。该流程不依赖单一模型直接给出结论,而是通过专业分工和交叉核验提高研究覆盖度与可追溯性。图12:多Agent协作投研工作流程天风证券研究所多Agent协作因子构建评估流程工作流用于因子构建与测试。首先,FactorAgent根据因子定义读取数据库的相应字段、日期范围和缺失情况,并生成包含compute_factor的因子程序,同时声明所需字段与因子方向。在提交候选程序前,Agent必须调用数据检查和候选验证工具;主流程还会独立执行未来函数检查、索引对齐、有限值及有效样本量检查。若程序不符合语法、安全或数据规则,系统会将错误反馈给FactorAgent,要求其修正后重新生成,未通过校验的代码不能进入回测。因子计算完成后,本地引擎确定性地产出RankIC换手率和回撤等结果;EalgetReotget则汇总程序、校验结论和评估指标,输出可复现的中文报告。图13:多Agent协作因子构建评估流程天风证券研究所多Agent协作组合构建评估流程工作流以因子、基准权重、风险暴露和组合约束为输入,由四类Agent与本地引擎调用共同完成。首先,PortfolioAgent检查输入数据、基准覆盖范围和约束可行性,并形成求解前计划,调用本地优化器计算最终权重,并执行权重和、个股偏离、基准成分占比及换手约束等硬性诊断。组合生成后,BacktestAgent调用本地回测模块进行回测,并计AttributionAgent读取回测结果并调用数据库进行业绩归因,解释收益来源。最后,由ReportAgent汇总回测结果与归因结论,生成完整组合评估报告。BacktestAgent或AttributionAgent认为结果不达标,将调整风险约束参数,并由PortfolioAgent重新进行组合优化。图14:多Agent协作组合构建评估流程天风证券研究所三、BetaAgent介绍BetaAgent是一个面向AAgent协作,将风险因子研究流程拆解为假设生成、因子代码实现、统计评估、反馈反思和迭代探索,目标是发现能够为现有Barra风格因子与行业因子提供增量解释力的新型风险暴露。BetaAgent3个Agent的设计架构和思路借鉴参考[2]。BetaAgent关注交易风险因子,而并非短期Alpha选股信号。系统更看重暴露稳定性、风险补偿、信息独立性、跨期稳健性和对横截面收益分散的解释能力。BetaAgent将这一流程自动化,同时保留必要的统计约束。BetaAgent自动提出具有经济机制的风险因子假设,并自动生成可运行的向量化Python因子代码,然后按需基于分钟量价数据和资金流数据生成日频的风险因子值。接下来,使用评估候选因子的表现与增量贡献以及信息Trace三大核心Agent系统由三个主要Agent协同运行:deaget例如流动性脆弱性、量价耦合、日内尾部风险、时段结构不平衡、交易拥挤和风险状态变化等。FactorAgent:将假设转化为因子计算代码。代码必须向量化、可执行、无未来函数,并通过本地数据校验。EvalAgent:基于多项评估框架和分年度结果做最终接受/拒绝判断,并给出下一轮改进建议。图15:BetaAgent风险因子挖掘评估框架Tang,Z.etal.《AlphaAgent:LLM-DrivenAlphaMiningwithRegularizedExplorationtoCounteractAlphaDecay图16:BetaAgent流程图天风证券研究所IdeaAgentIdeaAgent是系统的研究大脑,负责从历史探索记录中提炼规律、基于市场微观结构知识提出具有经济机制的风险因子假设。它的关键设计一方面在于systemprompt的构建,另一方面在于其读取精简版的上下文记忆,而非完整Trace。完整Trace随试验次数增长而膨胀,若全部喂入上下文窗口,将导致token成本激增且噪声干扰决策,这里通过BetaTrace.get_compact_summary()获取一份紧凑研究记忆。紧凑记忆的结构经过精心编排,包含以下维度1)累计统计——试验总数、接受数、拒(2闸门通过率各筛选闸门的通过比例,以及最常见的拒绝闸门名称;(3)已接受因子池摘要——池中因子的质量得分、t值、|t|>2占比、IC分析、与Barra4)Nea-mis因子——仅差一个闸门即通过的失败样例,附带其失败原因和改进方向,这些案例是系统最有价值的负面知识5)D-n-eeat——deaget在相同方向上浪费探索预算6)下一轮探索方向建议。IdeaAgentJSON,包括字段:name(中文展示名description(因子构造逻辑描述、rationale(经济机制论证、data_variables(所需数据变量列表、expected_direction(预期暴露方向。Systemprompt鼓励IdeaAgent优先探索中等复杂FactorAgentacrget承担将假设转化为可执行代码的核心职责。其工作流程分为四个阶段1)(如TS_MEANZSCORECORR)2)生成符合严格规范的cmefaco(df)(3)在本地数据(4)若自校验失败,自动重试修复代码最多3次,每次将错误信息反馈给FactorAgent作为修正依据,仍失败则跳过当trial。FactorAgent的代码生成受到其prompt中严格的约束,这些约束确保生成的代码可在沙箱中安全执行。这些约束不是建议而是硬性规则,FactorAgent的提示词模板中以负面示例形式强化记忆。通过调用本地数据库,主要有包括日频量价行情数据、分钟频量价行情数据、分钟频资金流向数据,来计算因子值。EvalAgentEvalAgentEvaluator输出多项评估结果和分年度指标,EvalAgent分析并给出接受/拒绝决策与改进建议。其输出是一个结构化JSON,包括字段:decision(布尔值、rvations(对统计现象的观察描述、evaluation(逐项评估结论、suggestions(下一轮改进建议。EvalAgent的决策具有辅助性质,它为闭环提供自然语言层面的解释和改进方向,主要考察增量解释力、长期t显著性、信息独立性、Barra相关、暴露稳定性、风险型IC形态等多项指标与分年度的表现。若任一项为False,系统将强制拒绝,并将失败的闸门名称写入反馈的suggestions字段。算子库设计因子算子库是BetaAgent的探索空间基础,包含三个层次:高频一元算子、高频二元算子和日频算子。所有高频算子以NumPy向量化方式在每只股票的日内数据上进行计算,可选计算的时间段,日频算子则在日频面板上操作。日内特征的计算可通过如下形式进行计算,其中A,B是字段,op是算子名:HF_UNARY(df,time=None,name=None)HF_BINARY(df,time=None,name=None)图17:高频一元算子列表类别算子名功能说明数量基础统计mean,sum,std,skew,kurt,median,max,min,range,quantile序列的基本描述统计10时序形态slope1,rank,arg_max,arg_min,first_last_diff趋势、位置与端点差异5波动偏度realized_vol,realized_skew,realized_kurt基于收益率的波动与分布形态3条件聚合downside_vol,upside_vol,positive_share,above_median_share条件子集上的选择性聚合4路径震荡abs_path_length,abs_sum价格路径的累积变动2连续极值up_streak,down_streak,max_drawdown,max_runup连续涨跌与极值回撤/回升4离散度mad,iqr中位数绝对偏差与四分位距2分布形态与变体entropy,gini,top_share_3,top_share_5,jump_count_2,jump_count_3,tail_share_80信息熵、集中度、跳跃计数与尾部占比7天风证券研究所图18:高频二元算子列表类别算子名功能说明数量基础关系corr,cov,slope,intercept,r2,rel_vol,euc_dist线性关系与距离度量7条件关系downside_corr,upside_corr仅在a<0或a>0的子集上计算相关2时移关系lead_corrcorr(a[:-1b[1:]),ab1尾部关系tail_corr_80,tail_corr_90仅对|a|前20%/10%的极值bar计算相关2天风证券研究所19类别算子名功能说明数量截面标准化/排序RANK,ZSCORE,DEMEAN,SCALE,QUANTILE,TOP,BOTTOM,MEAN,STD,SKEW,KURT,FILLNA,WINSORIZE,MAD_ZSCORE,CLIP,CS_REGRESSION_RESIDUAL横截面标准化、winsorize、去均值、正交化16时序滚动TS_MEAN,TS_STD,TS_SUM,TS_MAX,TS_MIN,TS_RANK,TS_ARGMAX,TS_ARGMIN,TS_COUNT,TS_AVEDEV,TS_ZSCORE,TS_SKEW,TS_KURT,TS_FILLNA,TS_PERSISTENCE滚动窗口统计与持久度15差分/滞后DELAY,DELTA,RET时移与一阶差分3时序关系/回归CORR,COV,BETA,SLOPE,TS_REGRESSION_RESIDUAL滚动相关、回归系数与残差5条件算子EVERY,ANY,WHERE/IF条件判断与选择4元素级ABS,LOG,EXP,SIGN,SIGNEDPOWER,EQUAL,MAX,MIN,FMAX,FMIN,CROSS逐元素数学运算11平滑类WMA,EMA,SMA,EMA_CN,DECAY_LINEAR,PRODUCT,MA,SUM,COUNT,LLV,HHV加权/指数/衰减移动平均12安全运算+桥接SAFE_DIV,LOG1P,HF_UNARY,HF_BINARY除零保护、高频桥接4天风证券研究所因子评估框架BetaAgent对于计算好的因子值在多个维度进行评估。增量解释力评估我们对比基准风险体系下以及加入新增风险因子后的𝑅2与调整后𝑅2Beta杠杆、盈利能力、盈利质量、盈利波动、投资质量、长期反转共16个风险因子以及申万一级行业因子。通过将未来一日收益率对风险因子体系进行回归完成计算。𝑎𝑑𝑗𝒂𝒅𝒋分析加入新的风险因子后带来的增量解释力𝛥𝑅2和𝛥𝑅2以及分年度的提升我们希望新的风险因子具有增量贡献且在各种环境下持续稳定,设定𝜟𝑹𝟐>𝟎且𝜟𝑹𝟐 >𝟎.𝟎𝟓%为评估标准。如果全区间总体指标满足条件且70以上年份的分年度指标同样满足条件则通过该项评估。𝑎𝑑𝑗𝒂𝒅𝒋长期t显著性检验考虑新增风险因子加入基准风险因子体系后,回归的t统计量。较优的风险因子需要统计t显著性1每日截面回归候选因子系数的|>2天(2)每日截面|均值。三项指标均需满足整体门槛,且分年度检验确保跨年度稳健。设定|𝒕|均值大于2且|𝒕|>𝟐的天数占比大于50为评估标准。如果全区间总体指标满足条件且70以上年份的分年度指标同样满足条件,则通过该项评估。信息独立性(VIF)候选因子的信息独立性通过方差膨胀因子(VarianceInflationFactor,度量。在截面上将候选因子对风格因子和行业因子做辅助回归,然后计算VIF,VIF的计算公式为VIF=1/(1𝑅2)𝑅2为上述辅助回归的决定系数。通常使用岭回归替代标准OLS以避免多重共线性导致的问题。VIF接近1表明候选因子与已有因子几乎不共线;VIF超过5表明候选因子可能只是已有风格暴露的线性复制。此外,还计算候选因子与16个风险因子的平均截面Pearson相关,若最大绝对值超过0.50则直接拒绝,作为VIF检验的补充防线。设定𝑽𝑰𝑭<𝟓且与16个风险因子相关系数绝对值小于0.50为评估标准。如果全区间总体指标满足条件且70以上年份的分年度指标同样满足条件,则通过该项评估。因子稳定性与衰减风险因子的核心特征之一是稳定性,因子值应在相邻交易日之间保持较高的自相关性,以体现持续性风险暴露而非噪声。系统计算1到5阶自相关:𝐿𝑘=crr(𝑡,𝑡−𝑘),𝑘=,2,,,.𝑡日的横截面值向量,corr采用Spearman秩相关。重点关注三个指标:阶自相关反映短期持续性,阶自相关反映中期稳定性,衰(𝐿1−𝐿5𝐿(短期稳定𝐿(中期仍有记忆)和温和衰减。设定𝑳𝟏≥𝟎.𝟗𝟎,𝑳𝟓≥𝟎.𝟕𝟎,𝑳𝟏−𝑳𝟓≤𝟎.𝟐𝟎为评估标准。如果全区间总体指标满足条件且70以上年份的分年度指标同样满足条件,则通过该项评估。风险型IC形态风险因子与lpa信号在ICla信号追求RakC均值持续(或负理想形态满足三个条件1)RakC绝对值的均值尽量高,说明因子能解释横截面收益的分散程度2RakCla(3分年度RakIC均值可能在正负之间切换。使用未来5日收益率计算RankIC。设定RankIC绝对值的均值大于0.08,RankIC均值的绝对值小于0.03为评估标准。如果全区间总体指标满足条件,则通过该项评估。因子池冗余性已接受因子池的去冗余流程在候选因子通过全部硬门槛后启动。计算拟接受因子与池内每个已有因子的平均绝对截面相关(按日截面求Spearman相关系数,再对所有交易日取平均绝对值。基于相关阈值0.80和综合质量分的决策逻辑如下:若拟接受因子与已接受因子池的相关性均小于0.80,直接写入因子池;若与某已接受因子的相关系数大于0.80,则对比拟接受因子与已接受因子的表现,若拟接受因子的综合表现更好,则在因子池中将该因子替换入池,否则拒绝拟接受因子。四、结果对比BetaAgent生成的风险因子总览通过多轮迭代,最终我们生成了10个风险因子,包括资金流路径震荡与成交量集中度共振风险、收益偏度残差持续性风险因子、资金流-收益路径震荡背离风险、日内非对称波动率风险、资金流量价相关性背离风险、三重微观结构风险叠加因子、日内收益偏度-峰度交互风险、成交量-收益路径震荡背离风险因子、资金流方向强度与成交量波动综合风险、开盘冲击吸收风险。从不同的角度实现交易类风险因子的构造。下面是10个风险因子的表现对比。图20:BetaAgent生成风险因子表现对比...8.41%0%-2.610.57%85.03%95.61%1.1959.85%3.04%0.26%0.28开盘冲击吸收风险9.48%0%-1.92.56%96.91%99.47%1.4859.27%3.180.32%0.34%资金流方向强度与成交量波动综合风险8.62%2%-2.4%6.5392.63%99.16%1.2855.83%2.92%0.24%0.26成交量-收益路径震荡背离风险因子9.18%5%-2.123%494.67%98.90%1.1855.68%2.83%0.26%0.28日内收益偏度-峰度交互风险8.79%2%-2.335%494.75%99.10%1.3859.85%3.150.32%0.34%三重微观结构风险叠加因子9.70%2%2.0%7.1790.91%98.08%1.4358.16%2.94%0.26%0.27资金流量价相关性背离风险8.95%6%-1.67%5.393.11%98.48%1.1255.24%2.77%0.24%0.26日内非对称波动率风险11.99%%00.59.08%82.39%91.47%1.5866.89%3.720.42%0.43%资金流-收益路径震荡背离风险9.37%4%1.82.28%97.15%99.42%1.3157.77%2.75%0.22%0.24收益偏度残差持续性风险因子8.32%8%2.47%5.492.81%98.28%1.3458.35%2.95%0.26%0.28资金流路径震荡与成交量集中度共振风险|RankIC|均值RankIC均值自相关衰减5阶自相关1阶自相关VIF|t|>2占比|t|均值增量调整后R^2增量R^2因子名深圳米筐RQData所有风险因子均满足设定的评估标准。下面是因子与基准风险因子体系的相关性:图21:BetaAgent生成风险因子与基准风险因子体系的相关性Barra风险因子资金流路径震荡与成交量集中度共振风险收益偏度残差持续性风险因子资金流-收益路径震荡背离风险日内非对称波动率风险资金流量价相关性背离风险三重微观结构风险叠加因子日内收益偏度-峰度交互风险成交量-收益路径震荡背离风险因子资金流方向强度与成交量波动综合风险开盘冲击吸收风险流动性(Liquidity)-30.17%-11.25%-38.19%-1.77%1.74%10.84%16.31%4.32%5.55%3.48%杠杆(Leverage)4.36%-3.86%12.80%0.27%-17.27%1.70%-3.52%2.79%8.24%2.56%盈利变动性(EarningsVar)-1.77%-9.18%-12.38%-10.39%-13.89%-9.20%4.75%0.31%17.09%1.02%盈利质量(EarningsQuality)-2.72%3.00%1.79%0.32%-19.41%-4.14%5.64%2.15%16.43%2.97%盈利能力(Profitability)5.18%-5.16%-6.62%2.88%28.02%14.46%-7.35%-5.13%-20.34%-7.28%投资质量(InvestmentQuality)-2.62%7.79%8.37%4.87%-20.33%-4.11%6.91%1.80%16.55%1.44%账面市值比(Book-to-Price)3.73%9.68%37.45%7.15%-14.00%-5.77%-8.20%3.59%-2.80%4.43%盈利收益率(EarningsYield)5.64%7.68%29.44%11.30%11.99%6.65%-12.52%-1.98%-17.99%0.30%长期反转(LongtermReversal)-6.12%7.16%5.74%-2.55%-16.32%-11.05%3.86%4.12%14.89%5.53%成长(Growth)5.40%-8.87%-3.42%-2.63%18.85%9.65%-9.49%-2.16%-17.79%-3.27%动量(Momentum)2.61%-16.77%-20.60%-7.98%5.20%25.68%-3.36%0.37%-9.23%-1.24%中盘股(MidCap)-3.43%-15.23%3.70%1.62%10.73%16.14%-10.66%0.08%-18.28%-0.18%市值(Size)25.70%-27.62%8.96%0.00%13.57%34.94%-23.72%0.14%-28.93%0.36%Beta-4.68%-13.05%-28.40%-9.38%27.61%4.32%-2.01%-4.76%-24.09%-3.04%残差波动率(ResidualVol)-27.68%-26.53%-42.82%-15.65%-3.78%14.76%13.03%15.14%17.11%16.64%股息率(DividendYield)7.63%0.00%28.52%9.87%9.62%6.15%-11.69%1.31%-15.26%3.59%深圳米筐RQData与基准体系相比,相关性均在较低的范围内。能够在一定程度上提供增量信息。下面简要介绍因子的构造方式与原理。资金流路径震荡与成交量集中度共振风险因子逻辑:成交量Gini因子定义:计算日内成交量的Gini系数和主买占比的路径震荡,分别去极值与截面标准化后相乘,30日指数移动平均后截面标准化,最后对成交额秩回归取残差。收益偏度残差持续性风险因子因子逻辑:剔除规模与波动率后的日内收益偏度残差反映了纯粹的收益分布不对称风险。因子定义:日内已实现偏度分别对成交额秩与已实现波动率回归取残差,然后进行截面标准化,90日指数移动平均后截面标准化。资金流-收益路径震荡背离风险因子逻辑:主动买入资金流路径频繁震荡,但收益路径相对平缓,表明多空博弈剧烈而价格传导阻滞,微观结构阻碍较高。一旦某方流动性枯竭,易引发单边的价格修正风险。因子定义:分别计算日内主动买入资金流路径震荡与收益率路径震荡,两者去极值截面标准化后相减,120日指数移动平均后分别对成交额秩与已实现波动率回归取残差,残差进行截面标准化处理。日内非对称波动率风险因子逻辑:日内上行波动与下行波动的不对称性。非对称波动暴露了个股对负面冲击的天然脆弱性,高下行波动暴露意味着下行时风险显著较高。因子定义:分别计算日内上行和下行波动率,两者截面标准化后相减,60日指数移动平均后进行截面标准化。资金流量价相关性背离风险因子逻辑:主动买入占比与收益的相关性,和成交量与收益的相关性发生背离,说明量价驱动力出现结构性断层,意味着当前价格缺乏坚实交易支撑,易在流动性抽离时发生价格突变风险。因子定义:分别计算主买占比与收益率的相关性以及成交量与收益率的相关性,两者相减后,40日指数移动平均后进行截面标准化。三重微观结构风险叠加因子因子逻辑:资金流方向失衡、成交量日内分布不均与价格发现失效三重异象叠加。绝对值越大说明资金流方向偏离、成交量日内分布异变、价格发现效率低下三者同时存在的微观结构风险越高。因子定义:分别计算三个高频特征,主买占比均值偏离,成交量的变异系数,以及成交量对收盘价的未解释方差比例,三者相乘后进行去极值与截面标准化,60日指数移动平均后进行截面标准化。日内收益偏度-峰度交互风险因子逻辑:偏度与峰度交互刻画收益分布尾部形态的复合特征,高偏度意味着更高的收益不对称性叠加高峰度意味着更高的尾部风险。对成交额正交后平滑,剥离规模驱动的分布形态差异。因子定义:计算日收益率的偏度以及峰度,两者截面标准化后合成,对成交额秩回归,60日指数移动平均后进行截面标准化。成交量-收益路径震荡背离风险因子因子逻辑:收益路径震荡与成交量路径震荡之差刻画价格震荡相对成交活跃度的偏离。对其做60日时序标准化,突出相对历史均值的异常背离,再平滑得到稳定暴露。异常背离说明微观定价效率较差。因子定义:分别计算收益率路径震荡与成交量路径震荡,两者截面标准化后相减,然后在60日窗口期上进行时序zscore标准化,再次截面标准化后,在60日窗口上做指数移动平均。资金流方向强度与成交量波动综合风险因子逻辑:主买占比对0.5的绝对偏离度量买卖方向失衡强度;成交量CV度量日内量波动。两者乘积刻画方向一边倒且量波动剧烈的综合微观结构风险。因子值越大,代表资金流方向失衡与成交量不稳定的叠加风险越高。因子定义:计算主买比率均值与0.5偏离的绝对值,另计算成交量的变异系数,相乘后截面标准化,然后clip到-3到3之间,60日窗口上做指数移动平均。开盘冲击吸收风险因子逻辑:早盘成交占比加权的早盘已实现波动,度量开盘阶段冲击强度。为避免与全日残差波动高度共线,对全日RV做时序回归取残差,得到相对独立的开盘冲击吸收风险暴露。高暴露代表个股在开盘阶段经历剧烈波动并大量消耗流动性,后续日内及次日的不确定性和尾部风险上升。因子定义:计算开盘半小时成交占比与开盘已实现波动率,两者相乘在40日窗口上做指数移动平均,对已实现波动率做60日窗口的时序回归取残差,残差进行截面标准化。因子表现评估对于BetaAgent生成的10个风险因子,首先关注其相关性矩阵。图22:BetaAgent生成风险因子的相关性矩阵因子名资金流路径震荡与成交量集中度共振风险收益偏度残差持续性风险因子资金流-收益路径震荡背离风险日内非对称波动率风险资金流量价相关性背离风险三重微观结构风险叠加因子日内收益偏度-峰度交互风险成交量-收益路径震荡背离风险因子资金流方向强度与成交量波动综合风险开盘冲击吸收风险资金流路径震荡与成交量集中度共振风险100.00%-16.00%11.32%-21.94%20.43%-23.31%-34.82%-1.60%-41.68%-9.26%收益偏度残差持续性风险因子-16.00%100.00%37.76%59.54%-19.25%1.15%53.50%4.15%14.94%12.16%资金流-收益路径震荡背离风险11.32%37.76%100.00%20.70%-9.37%-4.04%-7.53%20.08%-6.46%33.40%日内非对称波动率风险-21.94%59.54%20.70%100.00%-17.65%18.60%51.54%1.32%11.24%-6.87%资金流量价相关性背离风险20.43%-19.25%-9.37%-17.65%100.00%-8.24%-36.56%-20.65%-58.74%-16.05%三重微观结构风险叠加因子-23.31%1.15%-4.04%18.60%-8.24%100.00%20.02%8.90%-1.51%7.76%日内收益偏度-峰度交互风险-34.82%53.50%-7.53%51.54%-36.56%20.02%100.00%5.04%42.73%-1.97%成交量-收益路径震荡背离风险因子-1.60%4.15%20.08%1.32%-20.65%8.90%5.04%100.00%5.49%48.52%资金流方向强度与成交量波动综合风险-41.68%14.94%-6.46%11.24%-58.74%-1.51%42.73%5.49%100.00%8.74%开盘冲击吸收风险-9.26%12.16%33.40%-6.87%-16.05%7.76%-1.97%48.52%8.74%100.00%深圳米筐RQData因子值之间的相关性均在限制内。下面分别列出各因子的RankIC表现:图23:资流路径荡与交量集度共风险IC 图24:收偏度残持续风险因子IC深圳米筐RQData 深圳米筐RQData图25:资流收益路震荡离风险IC 图26:日非对称动率险IC深圳米筐RQData 深圳米筐RQData图27:资流量价关性离风险IC 图28:三微观结风险加因子IC深圳米筐RQData 深圳米筐RQData图29:日收益偏峰度交风险IC 图30:成量收益路震荡离风因子IC深圳米筐RQData 深圳米筐RQData图31:资流方向度与交量波综合险IC 图32:开冲击吸风险IC深圳米筐RQData 深圳米筐RQData10个因子的IC均呈现风险因子的形态。接下来评估基准风险因子体系在引入10个新增因子后的增量。从图中可以看出BetaAgent生成因子相对基准风险因子体系能够带来持续稳定的增量解释力。图33:BetaAgent相对基准风险因子体系的增量贡献深圳米筐RQData图34:BetaAgent相对基准风险因子体系的增量贡献(分年度)深圳米筐RQData组合层面的提升为测试组合层面的增益,我们对沪深300、中证500、中证1000进行不同风险因子体系下的指数增强对比。基准风险因子体系包括前文介绍的16个风险因子;新的体系在16个风BetaAgent1016个中长期风险因子和10个短期交易风险因子。Alpha信号使用前期报告中的GSM合成因子。指数增强组合的风控设定如下:沪深300指增组合成分股下限80,个股偏离上限1业偏离上限20.3500指增组合成分股下限个股偏离上限0.8,行业偏离上限,中长期风险因子偏离上限0.3倍标准差;中证指增组合成分股下限80,个股偏离上限0.5,行业偏离上限2,中长期风险因子偏离0.30.1倍标准差。所有组合周频调仓,即按照每周最后一个交易日给出持仓,下周第一个交易日以vwap价格进行交易,周度单边换手限制10。回测剔除涨跌停、ST以及ST*股票,费用设置为双边千三。回测时间为反映近年来表现,故设定20210101-20260717。下面是各指增组合的对比。图35:指数增强组合绩效总览策略名称年化收益率年化换手率超额年化收益率超额年化波动率信息比率超额最大回撤超额卡玛比率沪深300指数增强3.36%11.196.86%5.12%1.348.13%0.84沪深300指数增强(BetaAgent)2.97%11.196.45%4.66%1.385.46%1.18中证500指数增强11.86%11.478.82%5.98%1.479.45%0.93中证500指数增强(BetaAgent)11.35%11.438.32%5.51%1.517.53%1.11中证1000指数增强14.90%11.5412.80%5.68%2.257.87%1.63中证1000指数增强(BetaAgent)15.67%11.5713.56%5.49%2.476.78%2.00深圳米筐RQData图36:沪深300指数增组合现 图37:沪深300指数增组合表现深圳米筐RQData 深圳米筐RQData图38:沪深300指数增组合年度表现 图39:沪深300指数增组合分年表现年份超额年化收益率年份超额年化收益率超额年化波动率信息比率超额最大回撤20218.00%4.92%1.63-4.99%202213.52%5.74%2.35-3.35%20236.35%4.27%1.49-2.47%20242.33%5.30%0.44-5.20%20250.85%5.02%0.17-8.13%202615.02%6.42%2.34-3.12%整体6.86%5.22%1.31-8.13%年份超额年化收益率超额年化波动率信息比率超额最大回撤202112.13%4.84%2.50-4.19%202211.92%4.77%2.50-2.81%20233.50%3.91%0.89-2.17%2024-0.32%4.66%-0.07-5.46%20253.96%4.57%0.87-5.38%202610.67%6.28%1.70-3.42%整体6.45%4.76%1.36-5.46%深圳米筐RQData 深圳米筐RQData在加入短期交易类风险因子后,整体上沪深300指增超额的最大回撤显著缓解,超额衰减幅度较小。但2026年以来,在沪深300指增上的增益有限。图40:中证500指数增组合现 图41:中证500指数增组合表现深圳米筐RQData 深圳米筐RQData图42:中证500指数增组合年度表现 图43:中证500指数增组合分年表现年份超额年化收益率年份超额年化收益率超额年化波动率信息比率超额最大回撤202113.27%6.20%2.14-3.17%202219.20%5.15%3.73-1.72%20237.71%4.31%1.79-1.90%20241.50%6.93%0.22-7.47%202

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论