版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
分析师:吴俊鹏分析师:马普凡—DeepSeek冲击波2025年2月19日核心观点●DeepSeek模型开源加快通用和行业大语言模型的研发。随着DeepSeek-R1模型的发布,DeepSeek在国内外引发了广泛的关注。其采用了多种技术,包括MoE架构下采用更多的专家数量,同时增加了共同专家;还采用MLA技术降低了KV存储;特别是在大规模模型上使用量化模型技术等多种方法,帮其降低训练成本;同时在R1模型采用了冷启动的方式。文中还给出了其它主流通用大语言模型训练成本的对比结果。DeepSeek模型开源和较详细的技术文档的公开发布,加快了通用大模型的研发,特别是行业大模型的研发也在加快。●AI技术的发展促进量化投资方法的选代.头部机构加快引入大语言模型。随着AI技术的发展,对金融投资领域也有深刻影响,从CAPM模型后来的Smartbeta,数据也从传统的财务因子增加到另类因子,方法从简单的趋势策略到采用深度学习,金融大语言模型也应用到量化投资领域。量化投资的各个方面比如选股、资产配置、风险估计、算法交易等,部有新的机器学习算法应用其中。此外学术研究中比如资产定价也逐步将不同的机器学习方法纳入其中。国外多家投行已将金融大模型嵌入其相关技术平台,提高平台更新迭代速度,方便客户能够及时更新自己的量化策略等。同时数据金融服务商也在推出自己的金融大模型,同时提供相应的API接口(比如事件信号模块、自然语言处理模块等),方便量化投资策略进行调用。吴俊鹏马普凡●金融大模型技术路线和模型坪测标准数据集。在金融领域,行业大模型主要包括4个金融PLM模型和4个金融LLM模型。FinPLMs采用的技术包括持续预训练、行业知识预训练、混合多领域预训练。FinLLMs采用的技术包括1:LLM混合多领域预训练和提示工程、比如BloombergGPT就是采用该技术;2:LLM指令微调和提示工程,比如PIXIU和FinGPT等。对于金融大模型的评价,大致有六个分类任务:情绪分析、文本分类、命名实体识别、问答、股价变动预测和文本摘要生成。还有高级测试基准任务,分别是关系提取、事件检测、金融中的因果关系检测、数值推理、结构识别、多模态数据、翻译和市场预测。国内也有相应的开源的中文金融资讯数据集,比如FinCorpus,其中包括上市公司公告、金融资讯新闻、金融试题等共计60G高质量数据:此外,还有中文金融领域知识评估数据集FinancelQ,重点评估大语言模型在金融场景下的知识和推理能力。FinancelQ函盖了10个金融大类及36个金融小类,主要涵盖了注册会计师、税务师、经济师、银行从业资格、基金从业资格、证券从业资格、期货从业资格、保险从业资格、理财规划师几大权威金融领域考试。●风险提示:报告内容中涉及模型、数据集等相关内容,仅作参考说明,不作为其它评判参考标准等。报告结论基于历史价格信息和统计规律,但二级市场受各种即时性政策影响易出现统计规律之外的走势,所以报告结论有可能无法正确预测市场风险,报告阅读者需审慎参考报告结论。请务必阅读正文最后的中国银河证券股份有限公司免责声明。中国银河证券|CGS中国银河证券|CGS目录 4二、AI的发展 6(一)AI的发展 6(二)量化投资技术发展 7三、AI大模型在金融机构应用情况 8 (二)数据金融服务商 (二)金融大模型评价基准 (三)金融大模型介绍 杭州深度求索人工智能基础技术研究有限公司DeepSeek成立于2023年,并于2023年11月LanguageModelswithLongterTowardsUltimateExpert资料来源:deepseek,中国舰河证券研究院在前述稠密模型之后,2024年01月11日DeepSeek又发布了混合专家架构MoE(Mixture-通常设置为8~16个);DeepSeekMoE在“RoutedExpert"的基础上,增加了“SharedExpert” (详见《DeepSeekMoE:TowardsUltimateExpertSpecializationinMixture-of-ExpertsLanguageModels)图2)。从下图中可以看到,DeepSeekMoE专家模型在与LLaMA7B模型的表现接近,而激活参数更少(仅约40%左右)。请务必阅读正文最后的中国银河证券股份有限公司免责声明。请务必阅读正文最后的中国银河证券股份有限公司免责声资料来源:DamaiDai等(2024DeepSeekMoE技术文档中国舰河证券研究院LatentAttention(MLA)技资料来源:DeepSeek-AI(2024DeepSeek-V3技术文档中国银河证券研究院557.6万美元(H800租赁价格2美元/GPU小时)。据DorothyNeufeld在visualcapitalist网年模型所属公司训练成本(美元)Megatron-TuringNLG5中国银河证券|CGS金融工程·专题报告请务必阅读正文最后的中国银河证券股份有限公司免责声表3:模型API收费情况DeepSeek与OpenAI收费对比(美元)百万tokens愉入价格《缓存命中)百万tokens输入价格(缓存未命中)下面第二部分先简要回颐一下AI的发展情况,之后说明AI技术在量化投资的发展路径。(一)AI的发展所谓人工智能是一整套系统用于研究人类智能、环境感知等,进而如何反馈并执行操作等。应用领域也十分广泛,比如自然语言处理、图像识别、语音处理等等。其实现依赖于机器学习等算法的不断发展。机器学习按照所处理数据类型的不同可以分成有监督学习、无监督学习和强化学习等。常见的监督学习主要是分类和回归,包括朴素贝叶斯、判断分析、k近邻、决策树等,还有集成学习等;而无监督学习比如聚类、降维、因子分析等。神经网络在监督和非监督学习中都可以使用。强化学习简单来讲通过不断尝试,根据奖惩机制不断优化。而所谓深度学习是由多层神关于神经网络的发展山下隆义和zomi酱给出相近的区分阶段。第一阶段(1940~1970)神经网络的发展始于20世纪40年代,1943年心理学家WarrenMeCulloch和数学家WalterPitts通过对神经元建模,称为M-P模型。该模型神经元接收到多个输入信号后,根据这些信号的强度和方向进行加权求和,当超过某个阀值时,神经元会被激活并输Minsky等指出感知器无法解决线性不可分的问题。第二阶段(1980~2000)Rumelhart等在20世纪80年代误差反向传播算法,通过设置多层感第三阶段(2000~2015)Hinton和Bengio等(2006)提出将预训练和自编码器与深度神经网络相结合的办法;FrankSeide等(2011)的研究成果在语音识别基准测试中取得了绝对优势;Krizhevsky等(2012)提出在卷积神经网络中引入ReLU激活函数,在图像识别中取得很好的效果。同时随着硬件厂商比如英伟达等对于GPU相关产品的不断迭代升级,也提升了训练效率。第四阶段(2015~现在)Transformer(2017)、Bert(2018)自然语言处理模型提出,GPT.CLIP、LLaMA、deepseek等大语言模型快速发展。除了通用语言大模型外,涉及不同行业的垂直(专有、行业)大模型也在不断推出。请务必阅读正文最后的中国银河证券股份有限公司免责声(二)量化投资技术发展AI技术的发展对金融投资领域也有深刻影响。这里进一步综述分析以金融行业大模型(FinLLM)为引擎,AI对于金融投资行业的影响。Increasingvolume,variety,velocityandveracIncreasingvolume,variety,velocityandveracAnalystarmymuJ-variateregression.ldornicalionofnovelportsharbours/roadscombinod inlormationtrompromastars().fowinformafionfrommtechniquesonpubicorcompottivopostioningi DovokopmentandexecutionoftrmachinesmodolsanddocidowhichtosophisticatedmodelsinpubicyavailablestrucAlgo.Quart,ardDiscatioraryTradegxchangos,macodatafMcmertum,TrendFolowing.Oreactiontimes,alaroeufisafionintroconteortThemachinedevelopsinterventonbasedondenttymarketregimegrossexposures,takepiosingpositionsandmIncreasinguseofadvanced中国银河证券|CGS金融工程·专题报告请务必阅读正文最后的中国银河证券股份有限公司免责声量化投资方法也取得的长足的发展,从CAPM模型到上世纪90年代的FM因子模型,到后来的Smartbeta,数据也从传统的财务因子增加到另类因子、舆情因子等;方法从简单的趋势策略、统计套利、高频交易,到采用深度学习比如采用LSTM、CNN进行时间序列预测和多因子选股等。随着大模型技术的快速发展,金融LLM也在应用到金融投资领域。EkaterinaSirotyukz从AI技术和数据复杂程度给出AI在金融领域的分类应用(图3)。在第三部分,进一步给出各类型机构使用AI大模型的情况,最后再介绍一下比较典型的金融摩根士丹利摩根士丹利利用人工智能来塑造金融服务的未来。2023年3月14日,摩根斯坦利宣布其财富管理部门将GPT-4嵌入到其工作流程中,超过98%的顾问团队使用摩根斯坦利内部聊天机器人AI④MorganStanleyAssistant进行信息检索。摩根士丹利采用一个评估框架根据实际使用案例衡量模型的性能,并在每个步骤中提供专家反馈,指导改进。摩根士丹利公司AI产品和策略负责人DavidWu说“我们从能够回答7000个问题到现在能够有效地回答来自10万个文档的任何问题”。在A1⑩MorganStanleyAssistant之后,2024年6月26日,进一步推出新摩根断坦利金融中包括由Whisper和GPT-4支持的会议纪要工具AI@MorganStanleyDebrief。2024年10月23日、摩根斯坦利研究部门发布AskResearchGPT.这是一个生成式AI助手,满足投资银行、销售和交易及研究人员的需求。它基于其研究部门每年发表超70,000份研究报告,中国银河证券|CGS金融工程·专题报告请务必阅读正文最后的中国银河证券股份有限公司免责声为符合金融行业严格的合规标准,摩根士丹利将质控纳入其报告评价框架。每天采用一套回归近期J.P.摩根已为机构投资者推出一套新的股票指数QuestIndexGPT,其使用GPT4大语言模型对特定主题生成相关的关键字。该模块嵌入之前的Quest框架之内。在2024年5月相应机构对于高盛。2023年3月据CNBC采访GoldmanSachs首席信息宫MarcoArgenti说,公司软件工程师已经采用生威式AI工具进行代码编写。BlackRock在AI领域深耕多年,包括预测分析、模式识别、机器学习等多个领域。在2018年启动AI实验室,由RachelSchutt和StephenBoyd共同基于大语言模型通用聊天机器人需要许多专题有关的大量数据输入用于训练,使其能够执行广资任务,例如预测公司盈利电话会后的市场反应。图中利用一个在2024年第一季度进行的随机选取的500个公司盈利电话会议预测市场反应,并将其模型结果与最新的GPT模型进行了比较。BlackRockSystematic行。目前其也迁移到微软的Azure,方便模型更快的更新送代。(二)数据金融服务商金融工程·专题报告2023年3月,彭博在arxiv上贴出关于BloombergGPT模型的详细介绍。BloombergGPT-50b基座模型为BLOOM-50b。与通用大模型和小型垂直(专有)大模型不同,BloombergGPT将二者结合起来。基于Bloomberg40多年积累的高质量金融行业数据,将其加入通用知识中,训练的数据共计约7000亿token。3172836351其中金融行业专有知识tokens占比为51.27%。其调练共使用了512张40GBA100显卡。请务必阅读正文最后的中国银河证券股份有限公司免责声对于数据金融终端Eikon,LSEG给出如何使用ChatGPT与Eikon数据进行交互。Factset也将AI技术与其平台相结合起来。请务必阅读正文最后的中国银河证券股份有限公司免责声金融工程·专题报告AttheintersectionofAl-poweredtwithasimplequery,suthestrategicwithpurposandagentsthattakeontheburdenofyourarduous-yetesseFactset'sAIsolutionsin-hocurateddatapackages此外,2024年11月12日,S&PGlobal宣布在S&PCapit四、金融大模型言模型。请务必阅读正文最后的中国银河证券股份有限公司免责声中国银河证券|CGS金融工程·专题报告LearniogFinBERT-19Pre-trainedLanguageModels(PLMModels(LLMs))。4个FinPLMs包括FinBERT-19[A[Yangetal.2023c]和FinGPT[Wangetal.2023]是基于LLaMA或其它开源模型,BloombergGPT[Wuetal.,2023]是基于BFinPLMFinPLM/modelsineover110MpaFinLLM(modelsize:over7BparomeA.Domain-SpecificPre-training/Fine-tuningC.Mied-DomoinLLMwFinancialFinPretrainingFinonclalNoweightuodortejieJB.Mixed-DomainPre-training/Fine-tuniD.InstructionFine-tunedLLMwithWeightupdoteNoweiahtuedoteFinLLMFngmocering技术包括1:LLM混合多领域预训练和提示工程(Mixed-DomainLLMwithPrompt请务必阅读正文最后的中国银河证券股份有限公司免责声SA)、文本分类(TextClassifica问答(QuestionAnswering(QA)、股价变动预测(StockMovement1情绪分析,即对新闻、微博等内容进行情绪分析,采用的数据集包括Fina (FPB)和FiQASA数据集。FPB数据集包含4845篇英文金融新闻文章,由相关专家为每个句子进行情感标注(积极、消极或中立)。FiQA-SA数据集包含1173条来自新闻标题和微博帖子,情此外,金融数据供应商会提供相应的数据。比如Bloomberg将奥情与对于标的相关联,对于个股提供新闻量、新闻情绪、社交平台量(推特发文数量)和社交舆情(推特情绪)等数据。同样国内的数据供应商对于新闻也会进一步给出标签,比如wind互联网财经舆情数据中,对每条新闻给出关联的相关地区、相关公司、相关行业以及市场情绪等(其它详细相关舆情数据见报告《【银河证券】金融工程-深度报告:大数据系列(4)资讯数据分析》)。2文本分类,文本分类是将给定文本根据其内容分类按预设标签进行分类。在金融相关内同中除了情感信息外,通常包含多个维度信息,比如价格方向或利率走向等。FLUE数据集其中一个包括用于文本分类的黄金新闻标题数据集,该数据集包含11412条FedNLP数据集包含来源于各种联邦公开市场委员会(FOMC)材料的文档。根据后续美联储给出一个FOMC文档集合,标注为“鸽派”,“磨派”或“中立”,反映了FOMC材料中传达的主要情感。Banking77数据集包含13083个样本,涵盖与银行客户服务查询相关的77相关项目,该数3命名实体识别(NamedEntityRecognition,NER)在从非结构化文本中提取信息并将其分类为预定义的命名实体,如位置(LOC)、组织(ORG)和人物(PER)。对于金融领域的NER任务,FLUE基准中包括了FIN数据集。该数据集融贷款协议,用于信用风险评估。此外,还有FiNER-139的金融NER数据集,该数据集来源干美国SEC139篇XBRL中的110万句子。该数据集设计用于实体提取和数值推理任务,根据句子中的数值输入数据(如“2480万”)预测对应的XBRL标签(比如“现金及现金等价物”)。4问答(QA)是从非结构化的文档集合中检素或生成问题答案。FiQA-QA[Mai早期的金融QA数据集。FinQA[Chen等人,2021]是一个单轮混合QA数据集,包含8281个问题答案对,来源于标普500指数成分股的年报,由专家进行标注。ConvFinQA[Chen等人,2FinQA的扩展,是一个多轮对话混合QA数据集,包含3892个对话(其中有14115个问题)。5股价变动预测(SMP)基于历史价格和相关文本数据预测下一天的价格走势,需要将时间序列问题与文本信息中的时间依赖性结合起来。FinMA模型首次包括SMP任务,对三个数据集进行了测试(StockNet.CIKM18和BigData22)。StockNet500指数中88只股票历史价格数据和Twitter数据(2014年~2016年),该任务被设定为二分类问题,价格变动高于0.55%被标记为上涨(表示为1),而低于-0.5%的变动被标记为下跌《表示为0)。CIKM18[Wu等。2018]利用47只标准善尔500指数成分股2017年历史价格和Twitter数据。BigData22[Soun等,2022]选取了50只美国市场股票的数据(2019年至2020年)。6文本摘要生成(Summ)InvestLM大模型首次包括摘要任务,对ECTSum数据集进行了测中国银河证券|CGS金融工程·专题报告请务必阅读正文最后的中国银河证券股份有限公司免责声试。ECTSum[Mukherjee等,2022]包含2425对文档摘要对,数据来自Reuters,包含电话会议记录(ECTs)和要点总结。MultiLing2019[El-Hai,2019].包含3,863对数据,从伦敦证券交易所JeanLee等(2024)还进一步总结了8个高级测试基准任务,分别是关系提取(Relation国内Duxiaoman开源60G高质量中文金融资讯数据集:Duxiaoman-DI/FinCorpus,包括:1上市公司公告announcement_data.jsonl20G;2金融资讯/新闻fin_news_data.jsonl30G;4金融试题fin_exam.jsonl370M;FinancelQ是一个专注于金融领域的中文评估数据集,重识和推理能力。FinanceIQ函盖了10个金融大类及36个金融小类,主要涵盖了注册会计师(CPA)、理财规划师几大权威金融领域考试。为了进一步提高评估的复杂性,FinancelQ选取了中的《金融数学》科目。总计7173个单项选择题。FinancelQ证势从业保险从业资格在其开源数据的同时,对不同的底座模型进行了测试评分。按照注册会计师、银行从业资格、证券从业资格、基金从业资格、保险从业资格、经济师、税务师、期货从业资格、理财规划师、精算师等类别分别测试,测试的基座模型包括XuanYuanQwen-7B.ErnieBot-Turbo(0-shot).Chine(三)金融大模型介绍度小满轩辕模型2023年5月21日,度小满AI-Lab开源了轩辕-176B大模型,它是在BLOOM-176B的基础上针对中文通用领域和金融领域进行了针对性的预训练与微调。是国内首个开源的千亿级中文对话大模型。采用了思维链+过程奖励+强化学习训练范式。[3/11/2024]开源XuanYuan-6B.XuanYuan-13B.XuanYuan2-70B系列模型[1/19/2023]开源XuanYuan-13B-Chat模型[9/22/2023]开源XuanYuan-70BBase模型19/22/2023鲁开源中文金融领域知识评基于现有的大型语言模型(LLM)并对其进行微方案。虽然BloombergGPT在金融特定能力方面非常出色,但它需要大量计算资源。BloombergGPT使用财务数据和通用数据的混合来培训LLM,成本约为300万美元(1.3millionGPUhours,来源:FinGPT技术文档)。FinGPT可以快速微调以纳入新数据(成本大幅下降,每次微调不到300美元)。PIXIU能貅是基于LLaMA模型指令微调的金融大语言模型。它还包含136K数据样本的指令数据,以及一个涵盖5个任务FIT和9个数据集的评估基准FLARE。在FLARE评估框架下,给出请务必阅读正文最后的中国银河证券股份有限公司免责声金融工程·专题报告其给出了3个微调模型:FinMA-7B、FinMA-30B和FinMA-7B-full(基座模型为LLaMA7B和30B,前两个微调数据仅包括NLPtasks)。由于计算资源的限制,模型参数数量为30B,FinMA-30B模型并未采用全部数据进行微调。五、结语通用大模型特别是行业大模型的研发也面临着一些问题。首先就是数据的问题,通用大模型更多的依靠一些公开的数据,而行业大模型在训练中对应的行业数据更为重要,比如金融大模型,高质量的训练数据对于大模型训练的好环至关重要。其次,数据的清洗和标注更多需要依赖专家,而这必然面临的一些成本的问题。第三,对于行业大模型来说,面临的一些私有数据和隐私数据的问题。用和金融数据结合在一起重新训练),无论从训练角度还是数据质量来说对于机构都会是巨大的成报告内容中涉及模型、数据集等相关内容,仅作参考说明,不作为其它评判参考标准等。报告请务必阅读正文最后的中国银河证券股份有限公司免责声ASurveyofLargeLanguageModelsinFinaBloombergGPT:ALargeLanguageModelforFinance,ShijieWu,OzanIrsoy,StevenLu,VadimDabravolski,MarkDredze,SebastianGehrmann,PrabhanjanKambadur,DavidRosenberg,GideonMann,arXiv:2303.DeepSeekLLM:ScalingOpen-SourceLanAl,arXiv:2401.02954(2DeepSeekMoE:TowardsUItimateExpertLanguageModels,DamaiDai,ChengqiDeng.ChenggangZhao,R.X.Xu,HuazuoGaoChen,JiashiLi,WangdingZeng,XingkaiYu,Y.Wu,ZhendaXie.Y.K.Li,PanpanHuang,FuliLuo,ChongRuan,ZhifangSui,WenfengLiang,arXiv:2DeepSeek-R1:IncentivizingRLearning.DeepSeek-Al.arXiv:2501.129DeepSeek-V2:AStrong.Economical,andEfficientModel,DeepSeek-AI,arXiv:2405.0443DeepSeekV3TechnicalReport,DeepSeek-Al,arXiv:2412.19437(2024)FinGPT:Open-SourceFinancialLargeLanguageModels,HongyangYang,Xiao-YangLiu,ChristinaDanWang,arXiv:2306.060Kimik1.5:SealingReinforcementLearningFinance,QianqianXie,WeiguangHan,XiaoZhang,YLopez-Lira,JiminHuang,arXiv:2306.05443XuanYuan
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 小学英语教资面试语法专项易错题及解析
- 2026年职业病防治业务知识考试题库及答案
- 2026年产业链供应链现代化专题公需科目题库
- 铁路行车事故案例分析考试题库
- 水产养殖技术指南-含水质管理和投喂方法
- 2026年心血管专业理论考核试题及答案
- 电工电子技术核心内容精简版(国开课程)
- 2026年消防员试题(附参考答案)
- 炭素煅烧工岗前规章制度考核试卷含答案
- 2026实木儿童家具安全标准与品牌信任度构建分析
- 市政道路路面铣刨施工方案
- 脓毒症的早期识别与重症护理干预
- 2026国网天津市电力公司高校毕业生提前批招聘(约450人)笔试备考题库浓缩500题及答案详解一套
- 电影与幸福感(北京师范大学)学习通测试及答案
- 中药饮片鉴别知识培训课件
- 航海模型培训课件
- JGJ162-2025《建筑施工模板安全技术规范》
- T-CSTM 00901-2023 手持式X射线荧光光谱仪校准规范
- 药店内审报告范文
- 医院培训课件:《恶性黑色素瘤》
- 借款用小车顶账协议书范本
评论
0/150
提交评论