CN117351387B 视频对话及模型训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第1页
CN117351387B 视频对话及模型训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第2页
CN117351387B 视频对话及模型训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第3页
CN117351387B 视频对话及模型训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第4页
CN117351387B 视频对话及模型训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第5页
已阅读5页,还剩39页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

BootstrappingLanguage-ImagePreArithmeticOperationsDoforTemp本公开提供了一种视频对话及模型训练方时空处理,以获得所述目标视频的目标视频表2采用可调整的线性层,对所述查询处理后的视频表征进行映射处理采用视频对话模型中的运算时序模块,对所述初始视频表征进行时空所述采用视频对话模型中的运算时序模块,对所述初始视频表征进行时采用所述上下文生成模块,对所述初始视频表征进行上下文表征提取采用所述四则运算模块,对所述初始视频表征和所述上下文表征进行四则运算处理,采用所述特征提取模块,对所述四则运算后的表征进行特征提取处采用所述区域变换模块,对所述特征提取后的表征进行区域采用视频对话模型中的大型语言模型,对所述视频嵌入和所述文本嵌入进行对话处采用所述运算时序模块,对所述初始视频表征进行时空处理,以3采用可调整的线性层,对所述查询处理后的视频表征进行映射处理所述采用所述运算时序模块,对所述初始视频表征进行时空处理,采用所述上下文生成模块,对所述初始视频表征进行上下文表征提取采用所述四则运算模块,对所述初始视频表征和所述上下文表征进行四则运算处理,采用所述特征提取模块,对所述四则运算后的表征进行特征提取处采用所述区域变换模块,对所述特征提取后的表征进行区域采用所述大型语言模型,对所述视频嵌入和所述文本嵌入进行对话处处理模块,用于对所述初始视频表征进行时空处理,以获得所述目4采用可调整的线性层,对所述查询处理后的视频表征进行映射处理采用视频对话模型中的运算时序模块,对所述初始视频表征进行时空采用所述上下文生成模块,对所述初始视频表征进行上下文表征提取采用所述四则运算模块,对所述初始视频表征和所述上下文表征进行四则运算处理,采用所述特征提取模块,对所述四则运算后的表征进行特征提取处采用所述区域变换模块,对所述特征提取后的表征进行区域采用视频对话模型中的大型语言模型,对所述视频嵌入和所述文本嵌入进行对话处采用可调整的线性层,对所述查询处理后的视频表征进行映射处理5采用所述上下文生成模块,对所述初始视频表征进行上下文表征提取采用所述四则运算模块,对所述初始视频表征和所述上下文表征进行四则运算处理,采用所述特征提取模块,对所述四则运算后的表征进行特征提取处采用所述区域变换模块,对所述特征提取后的表征进行区域采用所述大型语言模型,对所述视频嵌入和所述文本嵌入进行对话处所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被6预训练的大型语言模型(LargeLanguageModel,LLM),结合图像编码器和其他可学习模7机程序在被处理器执行时实现根据上述任一方面的任一项[0013]应当理解,本部分所描述的内容并非旨在标识本公开的实施例的关键或重要特[0022]图8是用来实现本公开实施例的视频对话方法或视频对话模型的训练方法的电子8所述视频嵌入的维度与所述问题文本的文本嵌入的维编码器例如为视觉Transformer(VisionTransformer,ViT)模型。ViT模型是一种基于表征可以表征目标视频中的平均性质(如图像9[0049]图文多模态对话大模型具体可以是大型语言和视觉助手(LargeLanguageand[0052]以LLaVA模型为例,LLaVA模型对应的LLM可以具体选择为StableVicuna。的ViT块,在这两个ViT块之间额外引入运算时序模块(ArithmeticTemporalModule,[0055]ViT模型(第1个ViT块)的输入是目标视频,第i个ViT块的输出模块。特征提取模块可以包括二维卷积(Conv2D)模块,区域变换模块可以包括重组询嵌入的最终值。冻住不变的原始查询嵌入和新增查询嵌入组成目标查询嵌入,作为行处理,得到QFormer模型的输出表征,该输出表征经过线性层处理后,得到视频嵌入[0070]在训练阶段,QFormer模型的模型参数保持不变(冻住),而调整线性层的模型参[0072]LLaVA模型是一种图文多模态模型,即可以针对图像和文本进行理解。本实施例于视频嵌入和文本嵌入生成答案文本,从而将图像和文本的理解迁移到视频和文本的理述视频嵌入的维度与所述问题文本的文本嵌入的[0092]如图3所示,查询器可以具体是查询Transformer(QueryingTransformer,视频表征和目标视频表征相加后的视频表征转换为[0105]图5是根据本公开第三实施例的示意图,本实施例提供了一种视频对话模型的训所述视频嵌入的维度与问题样本的文本嵌入的维[0113]基于视频样本和问题样本获得预测答案的过程可以类似上述视频对话过程中获[0149]提取模块601用于对目标视频进行表征提取处理,以获得所述目标视频的初始视[0159]一些实施例中,所述转换模块603进一步用于:对所述目标视频表征进行查询处语言模型的参数在所述视频对话模型的训练过程中[0169]图7是根据本公开第五实施例的示意图。本实施例提供一种视频对话模型的训练[0170]提取模块701用于对视频样本进行表征提取处理,以获得所述视频样本的初始视度相同;生成模块704用于对所述视频嵌入和所述文本嵌入进行对话处理,以获得预测答802中的计算机程序或者从存储单元808加载到随机访问存储器(RAM)803中的计算机程序,通过诸如因特网的计算机网络和/或各种电信网络与其他设备交换信息801执行时,可以执行上文描述的视频对话模型的训练方法或视频对话方法的一个或多个程序可在包括至少一个可编程处理器的可编程系统上执行和/或解释,该可编程处理器可[0197]用于实施本公开的方法的程序代码可以采用一个或多个编程语言的任何组合来理器或控制器,使得程序代码当由处理器或控制器执行时使流程图和/或框图中所规定的包部分地在机器上执行且部分地在远程机器上执行或完全在远程机器或服务器面或者该网络浏览器来与此处描述的系统和技术的实施方式交互)、或者包括这种后台部字数据通信(例如,通信网络)来将系统的部件相互连接。通信网络的示例包括:局域网过通信网络进行交互。通过在相应的计算机上运行并且彼此具有客户端_服务器关系的计云主机,是云计算服务体系中的一项主机产品,以解决了传统物理主机与VPS服务("如,本发公开中记载的各步

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论