CN119473568A 预训练模型中参数的更新和预训练模型的数据处理方法 (阿里巴巴达摩院(杭州)科技有限公司)_第1页
CN119473568A 预训练模型中参数的更新和预训练模型的数据处理方法 (阿里巴巴达摩院(杭州)科技有限公司)_第2页
CN119473568A 预训练模型中参数的更新和预训练模型的数据处理方法 (阿里巴巴达摩院(杭州)科技有限公司)_第3页
CN119473568A 预训练模型中参数的更新和预训练模型的数据处理方法 (阿里巴巴达摩院(杭州)科技有限公司)_第4页
CN119473568A 预训练模型中参数的更新和预训练模型的数据处理方法 (阿里巴巴达摩院(杭州)科技有限公司)_第5页
已阅读5页,还剩77页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

司预训练模型中参数的更新和预训练模型的本发明公开了一种预训练模型中参数的更络的参数用于表征调优模块对特征数据的影响2络的数据流,所述初始旁路网络的参数用于表征所述调优模块对所述特征数据的影响情基于所述初始旁路网络的权重,对所述第一垂直调优基于所述初始旁路网络的权重,对所述第二垂直调优征数据和所述第二水平调优模块对应的调整后的所述特征数据二者之间,进行加权求和,将所述第二层主干网络确定为所述第一层主干网络,且将调用所述第二垂直调优模块,对所述第一特征数据3基于所述初始旁路网络的权重,对所述第二垂直调优征数据和所述第二水平调优模块对应的调整后的所述特征数据二者之间,进行加权求和,得到转换后的第二特征数据,直至所述第二层主干网络为所述主干网络中的最后一层网基于转换后的所述特征数据更新所述初始旁路网络的参数,得到所述目标旁路网络,调用预训练模型的主干网络至少对所述文本生成信息进行分析,输出文本特征数据,调用目标旁路网络对所述文本特征数据进行在更新所述初始旁路网络的参数的过程中,所述初始基于所述目标旁路网络的权重,对所述第一垂直调优模块调4将转换后的所述文本特征数据作为所述预训练模型中最后一个解调用预训练模型中的主干网络至少对所述多模态信息进行分析处理,得到特征数据,基于所述预训练模型中输出层对转换后的所述特征数据进后端服务端,用于调用预训练模型中的主干网络至少对所述多模态信息进行分析处5[0004]本发明实施例提供了一种预训练模型中参数的更新和预训练模型的数据处理方6为对初始旁路网络的参数进行更新后得到,初始旁路网络为基于至少一调优模块构建得7[0017]图1是根据本发明实施例的一种预训练模型中参数的更新方法的应用场景的示意[0034]图16是根据本发明实施例的一种预训练模型中参数的更新方法的电子设备的框员在没有做出创造性劳动前提下所获得的所有其他实施例,都应当属于本发明保护的范8模态预训练模型(multi_modalpre_traini使得大模型可以应用于不同的任务中。例如,大模型可以广泛应用于自然语言处理[0043]参数高效的迁移学习方法(Parameter_efficientTransferLearning,简称为9附图的流程图示出的步骤可以在诸如一组计算机可执行指令的计算机系统中执行,并且,图1是根据本发明实施例的一种预训练模型中参数的更新方法的应用场景的示意图,在如型中参数的更新方法。图2是根据本发明实施例的一种预训练模型中参数的更新方法的流[0064]在本发明上述步骤S202提供的技术方案中,可以从初始主干网络中获取主干网理网络(VisionTransformer,简称为ViT)、卷积神经网络(ConvolutionalNeural[0081]作为一种可选的实施方式,调用初始旁路网络中的调优模块对特征数据进行调干网络对应的第一垂直调优模块,对主干网络的第零层主干网络输出的特征数据进行调整后的特征数据和第一水平调优模块对应的调整后的特征数据。基于初始旁路网络权重,对第一垂直调优模块对应的调整后的特征数据和第一水平调优模块对应的调整后的特征层主干网络为主干网络中最后一层网络,则可以将第一特征数据作为初始旁路网络的输络是否为主干网络中的最后一层网络,如果第一层主干网络为主干网络的最后一层网络,[0096]其中,可以用于表征第一层水平调优模块对应的调整后的特征数据,可以用于表征第l层的旁路网络的输出,Res_Tuner(xl)可以用于表征第l层水平调征初始旁路网络的权重。理结果二者之间的差异值,基于二者之间的差异值可以对初始旁路网络的参数进行调整,体限制。差异值可以用于表征处理结果和处理结果对应的真实处理结果二者之间的差异,[0106]在该实施例中,初始旁路网络和主干网络之间可以通过残差连接的方式进行连[0108]由于将调优模块嵌入在主干网络构建的初始主干网络在调优模块反向传播训练调优模块之间的连接方式和调优模块的组成部件做到了减少模型的训练过程中的资源消耗的技术效果,解决了模型的训练过程资源消耗多、[0114]本发明实施例针对人工智能生成内容(ArtificialIntelligenceGenerated实施例的一种预训练模型的数据处理方法的流程图,如图3所示,该方法可以包括以下步[0116]在本发明上述步骤S302提供的技术方案中,当生成式交互界面接收到询问信息自主干网络中该层输出的特征数据和初始旁路网络中上一层的输出,两者进行加权求和,来自中间层或解码层的输出的文本特征数据和目标旁路网络中上一层转换的文本特征数可以获取第一解码层输出的文本特征数据,且对第一解码层输出的文本特征数据进行转平调优模块和垂直调优模块的加权求和结果输出给生成式任务网络中进行相应结果的输来自中间层或解码层的输出的文本特征数据和目标旁路网络中上一层转换的文本特征数可以获取第一解码层输出的文本特征数据,且对第一解码层输出的文本特征数据进行转整后的文本特征数据和第一水平调优模块调整后的文本特征数据二者之间进行加权求和第二水平调优模块调整后的文本特征数据和第二垂直调优模块调整后的文本特征数据进三水平调优模块调整后的文本特征数据和第三垂直调优模块调整后的文本特征数据进行将转换后的文本特征数据作为预训练模型作为预训练模型中最后一个解码层的输出数据,[0153]在本发明上述步骤S404提供的技术方案中,可以从主干网络中[0157]可选地,预训练模型可以为基于条件预训练的转换器模型(ChatConditional拟现实设备所构成的硬件环境中。控制VR设备或AR设备执行定位信息对应的人机交互操为对初始旁路网络的参数进行更新后得到,初始旁路网络为基于至少一调优模块构建得法可以包括图5所示实施例的方法,以控制VR设备或AR设备执行定位信息对应的人机交互系统中获取用户的实时位置与运动信息,并计算出用户头部在虚拟三维空间中的三维坐[0173]图6是根据本发明实施例的一种预训练模型的数据处理结果的示意图,如图6所[0175]根据本发明实施例,还提供了一种可以应用于人工智能生成内容(Artificial[0183]在本发明上述步骤S708提供的技术方案中,预训练模型对多模[0188]在该实施例中,可以基于预训练模型中的输出层对转换后的特[0197]后端服务端804,用于调用预训练模型中的主干网络至少对多模态信息进行分析端服务端804可以调用预训练模型中的主干网络至少对多模态信息进行分析处理,得到特[0203]作为一种可选的实施例,图8(b)是根据本发明实施例的一种调[0205]下面对本发明实施例提出的一种基于预训练模型的参数和内存的高效调优方法练过程中主干模型的参数被冻结;另一部分是可训练的初始旁路网络(又可以称为旁路结主干网络完全独立的新调优模块,可以将不同的调优模块(Res_Tuner)进行组合设计构建[0215]其中,可以用于表征第一层水平调优模块对应的调整后的特征数据,可以用于表征第l层的旁路网络的输出,Res_Tuner(xl)可以用于表征第l层水平调征初始旁路网络的权重。[0223]每一个相应主干网络的解码层上均对应一个水平调优模块和一个垂直调优模调优模块的加权求和结果输出给生成式任务网络中进行相应结果的输出,以得到目标数后的特征数据二者之间进行加权求和得到的特征数据输入至与第二解码层对应的第二垂第二水平调优模块调整后的特征数据和第二垂直调优模块调整后的特征数据进行加权求[0235]根据本发明实施例,还提供了一种用于实施上述图2所示的预训练模型中参数的对应于实施例1中的步骤S202至步骤S206,三个单元与对应的步骤所实现的实例和应用场[0241]根据本发明实施例,还提供了另一种用于实施上述图3所示的预训练模型的数据[0249]根据本发明实施例,还提供了另一种用于实施上述图4所示的预训练模型的数据1306对应于实施例1中的步骤S402至步骤S406,三个单元与对应的步骤所实现的实例和应[0255]根据本发明实施例,还提供了另一种用于实施上述图5所示的预训练模型的数据第三生成单元1408对应于实施例1中的步骤S702至步骤S708,四个单元与对应的步骤所实主干网络完全独立的目标旁路网络(新调优模块),从而使得在初始旁路网络训练过程中,参数的更新方法和装置对应的程序指令/模块,处理器通过运行存储在存储器内的软件程[0269]处理器可以通过传输装置调用存储器存储的信息及应对第一垂直调优模块对应的调整后的特征数据和第一水平调优模块对应的调整后的特征主干网络中的最后一层网络,调用与主干网络中第二层主干网络对应的第二垂直调优模调优模块对应的调整后的第一特征数据和第二水平调优模块对应的调整后的特征数据二干网络为主干网络中的最后一层网络;基于转换后的特征数据更新初始旁路网络的参数,用与第一垂直调优模块关联的第一水平调优模块对第一解码层输出的文本特征数据进行对第一垂直调优模块调整后的文本特征数据和第一水平调优模块调整后的文本特征数据到了减少模型的训练过程中的资源消耗的技术效果,解决了模型的训练过程资源消耗多、[0287]本领域普通技术人员可以理解上述实施例的各种方法中的全部或部分步骤是可计算机可读存储介质可以用于保存上述实施例一所提供预训练模型中参数的更新方法所可以通过传输装置调用存储器存储的信息及应用到了减少模型的训练过程中的资源消耗的技术效果,解决了模型的训练过程资源消耗多、[0295]图16是根据本发明实施例的一种预训练模型中参数的更新方法的电子设备的框[0296]如图16所示,设备1600包括计算单元1601,其可以根据存储在只读存储器(ReadOnlyMemory,简称为ROM)1602中的计算机程序或者从存储单元1608加载到随机访问存储通过诸如因特网的计算机网络和/或各种电信网络与其他设备[0298]计算单元1601可以是各种具有处理和计算能力的通用和/或专用处理组件。计算单元1601的一些示例包括但不限于中央处理单元(CentralProcessingUnit,简称为CPU)、图形处理单元(GraphicProcessingUnit,简称为GPU)、各种专用的人工智能(ArtificialIntelligence,简称为AI)计算芯片、各种运行机器学习模型算法的计算单的部分或者全部可以经由ROM1602和/或通信单元16010而被载入和/或安装到设备1600过其他任何适当的方式(例如,借助于固件)而被配置为执行预训练模型中参数的更新方SpecificStandardParts,简称为ASSP)、芯片上系统的系统(SystemOnChip,简称为

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论