CN117764815B 模型训练方法、视频预测方法、装置、设备及存储介质 (上海人工智能创新中心)_第1页
CN117764815B 模型训练方法、视频预测方法、装置、设备及存储介质 (上海人工智能创新中心)_第2页
CN117764815B 模型训练方法、视频预测方法、装置、设备及存储介质 (上海人工智能创新中心)_第3页
CN117764815B 模型训练方法、视频预测方法、装置、设备及存储介质 (上海人工智能创新中心)_第4页
CN117764815B 模型训练方法、视频预测方法、装置、设备及存储介质 (上海人工智能创新中心)_第5页
已阅读5页,还剩38页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

目标车辆采集到的初始视频帧和/或初始视频帧文;利用初始视频帧和/或初始视频帧对应的目型可以根据既有画面和基于自然语言的控制文2利用目标车辆采集到的初始视频帧和/或所述初始视频帧的场景描述元数据,确定所利用所述初始视频帧和/或所述初始视频帧对应的目标车辆的轨迹数据,确定所述目将至少一个所述初始视频帧的图像编码和对应的控制文本的文本编码输入Stable根据所述损失函数值确定中间模型,并利用注意力机制更新所述中利用多个所述初始视频帧的图像编码和对应的控制文本的文本编码训练所述待训练在所述中间模型中的Transformer模型的空间注意力模块、交叉注意力模块和前向反其中,所述预设时序推理模块中包括因果时序注意力子模块和解耦空间注意力子模块,所述因果时序注意力子模块用于基于注意力机制对所述Transformer模型的输入量进2.根据权利要求1所述的方法,其特征在于,所述因果将多个所述初始视频帧的图像编码和对应的控制文本的文本编码输入所述待训练模通过所述待训练模型对所述加噪视频帧的图像编码进行降噪处理,得到降噪视频帧,其中,所述利用多个所述初始视频帧的图像编码和对应的控利用多个所述初始视频帧的图像编码和对应的目标控制文本的文本编码训练所述待35.根据权利要求1所述的方法,其特征在于,所述视频预后还包括预设多层神经网络,所述预设多层神经网络用于根据所述Transformer模型输出将所述至少一个条件视频帧的编码和目标控制文本的编码输入预场景上下文确定模块,用于利用目标车辆采集到的初始视频帧和/或所述初始视频帧车辆移动指令确定模块,用于利用所述初始视频帧和/或所述初始视频帧对应的目标模型确定模块,用于利用所述初始视频帧和对应的控制文本训练初损失函数值确定单元,用于将至少一个所述初始视频帧的模型更新单元,用于根据所述损失函数值确定中间模型,并利用模型确定单元,用于利用多个所述初始视频帧的图像编码和对应的控制所述利用注意力机制更新所述中间模型使之能够处理时序信息,基于注意力机制对所述Transformer模型的输入量进行加权处理,所述解耦空间注意力子模块用于对所述因果时序注意力子模块的输出量的空间注意力进行解条件信息获取模块,用于获取至少一个条件视频帧、目预测视频确定模块,用于将所述至少一个条件视频帧的编码和目标4一所述的模型训练方法得到,所述目标控制文本包括所述目标场景上下文和/或所述目标所述存储器存储有可被所述至少一个处理器执行的计算机程序,所述述至少一个处理器执行,以使所述至少一个处理器能够执行权利要求1_5中任一项所述的5[0002]近些年,自动驾驶领域中的场景生成获得了广泛的研究关注。可以利用NeRF渲染视频,神经场扩散模型NeuralField_LDM和条件生成模型BEVGen可以利用鸟瞰分割地[0006]利用目标车辆采集到的初始视频帧和/或所述初始视频帧的场景描述元数据,确[0007]利用所述初始视频帧和/或所述初始视频帧对应的目标车辆的轨迹数据,确定所所述目标场景上下文为所述条件视频帧对应的当前场景的场[0011]将所述至少一个条件视频帧的编码和目标控制文本的编码输入预设视频预测模[0013]场景上下文确定模块,用于利用目标车辆采集到的初始视频帧和/或所述初始视6[0014]车辆移动指令确定模块,用于利用所述初始视频帧和/或所述初始视频帧对应的面所述的模型训练方法得到,所述目标控制文本包括所述目标场景上下文和/或所述目标有计算机指令,计算机指令用于使处理器执行时实现上述第一方面的模型训练方法,和/[0024]本发明提供的模型训练方案,利用目标车辆采集到的初始视频帧和/或所述初始用上述技术方案,利用初始视频帧和/或初始视频帧的数据,实现了对无标注大规模数据7员在没有做出创造性劳动前提下所获得的所有其他实施例,都应当属于本发明保护的范的数据在适当情况下可以互换,以便这里描述的本发明的实施例能够以除了在这里图示或其它步骤或单元。[0042]图1为本发明实施例一提供了一种模型训练方法的流程图,本实施例可适用于训8[0044]S101、利用目标车辆采集到的初始视频帧和/或所述初始视频帧的场景描述元数语言模型如BLIP_2(图生文模型)和根据视频光流进行相机行为分类的模型分别自动生成述元数据的初始视频帧,可以使用自然语言模型如GPT(GenerativePre_TrainedVQVAE的解码器可以转化为符合控制文本描述的[0049]本发明实施例提供的模型训练方法,利用目标车辆采集到的初始视频帧和/或所文本包括所述场景上下文和所述车辆移动指令,所述视频预测模型用于输出预测视频帧。9[0051]具体的,可以对初始模型进行两阶段的训练。图3为一种第一阶段模型训练示意可以在中间模型中引入注意力机制处理时序信息,如在中间模型包含的Transformer模型制条件c以及当前的加噪步骤数t来预测加噪过程中,在原图(即初始视频帧)中加入的噪[0056]具体的,可以利用傅里叶编码层将轨迹数据中的轨迹数值编码为高维轨迹编多次训练,最后得到的视频预测模型可以根据给定的初始帧(初始视频帧)和目标控制文[0058]图4为本发明实施例二提供的一种模型训练方法的流程图,本发明实施例的技术力子模块用于基于注意力机制对所述Transformer模型的输入量进行加权处理,所述解耦[0064]S203、将至少一个初始视频帧的图像编码和对应的目标文本编码输入Stable模块,所述因果时序注意力子模块用于基于注意力机制对所述Transformer模型的输入量块、交叉注意力模块和前向反馈神经网络之前均增加预设时序推理模块(Temporal征输入量视为T个特征(每个特征维度为H*W)进行处理。图6为一种因果时序注意力子模块的功能通过注意力机制实现,其可以将因果时序注意力W*T)和W个特征(每个特征维度为H*T)进行处待训练模型的损失函数值Lva的确定方式可以为:述预设多层神经网络用于根据所述Transformer模型输出的特征图生成所述预测视频帧对型的预测效果与其他预测模型的效果对比如下表1效果评估对比表[0085]针对视频预测模型中的时序推理模块和长时序交互机制,可以在OpenDV_2K的评何重复的视频。CLIPSIM指标为生成的预测帧与给定的初始帧对应特征的相似度平均值,CLIPSIM指标可以用于衡量生成的预测视频与给定的初始帧的一致性。时序推理模块和长时序交互机制的消融实验的结果如下表2消融实验[0089]为衡量视频预测模型根据车辆轨迹生成的预测视频与给可控性实验结果信息表中记作ActionPredictionError(动作预测误差)。根据车辆轨迹生成的预测视频与给定的车辆轨迹的一致性的实验结果信息如下表3可控性实验结果信息[0093]为衡量视频预测模型特征提取的有效性,可以利用端到端自动驾驶规划模型在NuScenes数据集上的指标与本视频预测模型进行对比,对比结果如表4特征提取有效性实[0096]其中,ST_P3*和UniAD*表示ST_P3和UniAD使用了环视的视频预测模型中预设多层神经网络输出的预测轨迹与轨迹真值之间的欧氏距离。FDE使用七十分之一的待学习参数量,就可取得相对较好的效果,且只需要在NVIDIATesla[0099]图8为本发明实施例三提供了一种视频预测方法的流程图,本实施例可适用于生[0102]在本实施例中,当前车辆的目标移动指令可以理解为当实施例技术方案通过将条件视频帧的编码和对应的包含实际需求的目标控制文本的编码[0108]场景上下文确定模块,用于利用目标车辆采集到的初始视频帧和/或所述初始视[0109]车辆移动指令确定模块,用于利用所述初始视频帧和/或所述初始视频帧对应的力子模块用于基于注意力机制对所述Transformer模型的输入量进行加权处理,所述解耦空间注意力子模块用于对所述因果时序注意力子模块的输出量的空间注意力进果时序注意力子模块和所述解耦空间注意力子模块中最后的述预设多层神经网络用于根据所述Transformer模型输出的特征图生成所述预测视频帧对[0123]本发明实施例所提供的模型训练装置可执行本发明任意实施例所提供的模型训所述的模型训练方法得到,所述目标控制文本包括所述目标场景上下文和/或所述目标移[0129]本发明实施例所提供的视频预测装置可执行本发明任意实施例所提供的视频预被至少一个处理器执行的计算机程序,处理器61可以根据存储在只读存储器(ROM)62中的计算机程序或者从存储单元68加载到随机访问存储器(RAM)63中的计算机程序,来执行各如因特网的计算机网络和/或各种电信网络与其他设[0134]处理器61可以是各种具有处理和计算能力的通用和/或专用处理组件。处理器61机程序可在包括至少一个可编程处理器的可编程系统上执行和/或解释,该可编程处理器[0137]用于实施本发明的方法的计算机程序可以采用一个或多个编程语言的任何组合机器上执行且部分地在远程机器上执行或完全在远程机器或服务[0138]上述提供的计算机设备可用于执行上述任意实施例提供的模型训练方法和/或,[0141]利用目标车辆采集到的初始视频帧和/或所述初始视频帧的场景描述元数据,确[0142]利用所述初始视频帧和/或所述初始视频帧对应的目标车辆的轨迹数据,确定所[0145]获取至少一个条件视频帧,并利用条件视频帧和/或所述条件视频帧的场景描述[0146]利用所述条件视频帧和/或所述条件视频帧对应的当前车辆的轨迹数据,确定所[0147]将所述至少一个条件视频帧的编码和目标控制文本的编码输入预设视频预测模[0149]上述提

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论