CN117544832B 用于生成视频的方法、装置、设备和介质 (北京有竹居网络技术有限公司)_第1页
CN117544832B 用于生成视频的方法、装置、设备和介质 (北京有竹居网络技术有限公司)_第2页
CN117544832B 用于生成视频的方法、装置、设备和介质 (北京有竹居网络技术有限公司)_第3页
CN117544832B 用于生成视频的方法、装置、设备和介质 (北京有竹居网络技术有限公司)_第4页
CN117544832B 用于生成视频的方法、装置、设备和介质 (北京有竹居网络技术有限公司)_第5页
已阅读5页,还剩41页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

二参考图像可以作为引导数据来确定视频中故2从参考视频中的多个参考图像中确定第一参考图像和第确定所述参考视频的第一参考特征,所述第一参考特征包括确定所述参考视频的第二参考特征,所述第二参考特征包括所述第二参考图像特征在所述第二参考特征中的第二位置对应于所述第二参考图像在所述2.根据权利要求1所述的方法,其中所述第一参考特征和所述第二参考特征是利用所确定所述第一参考图像包括:将位于所述参考视频的头部的参确定所述第二参考图像包括:从位于所述参考视频的尾部的预4.根据权利要求1所述的方法,其中所述第二参考特征的维度等于所述第一参考特征分别针对所述第一参考特征和所述第二参考特征执行噪声处理以生成所述参考视频链接所述第一噪声参考特征和所述第二噪声参考特征以生成所述参考视频的噪声参7.根据权利要求2所述的方法,进一步包括:根据获取的所述生成模型来生成目标视根据所述生成模型,接收用于生成所述目标视频的第一图像以根据所述生成模型中的所述扩散模型,基于所述第一图像38.根据权利要求2所述的方法,进一步包括:根据获取的所述生成模型来生成目标视根据所述生成模型,接收用于生成所述目标视频的第一图像、根据所述生成模型中的所述扩散模型,基于所述第一图像、所述根据所述编码器模型,基于所述第一图像和所述第二图像来生成所述述第二特征中的与所述第二图像相对应的部分将所述目标视频的结束图像设置为另一目标根据所述生成模型,接收用于生成所述另一目标视频的第二图像、以根据所述生成模型,基于所述另一目标视频的第一图像和第二图14.根据权利要求13所述的方法,进一步包括:连接所述目标视频和所述另一目标视4第一编码模块,被配置用于确定所述参考视频的第一参第二编码模块,被配置用于确定所述参考视频的第二参所述第一参考图像特征在所述第二参考特征中的第一位置对应于所述第一参考图像在所至少一个存储器,所述至少一个存储器被耦合到所述至少一个行时使所述处理器实现根据权利要求1至14中任一项5计算机程序在被处理器执行时使处理器实现根6[0013]图5示出了根据本公开的一些实现方式的确定参考视频的参考特征的过程的框[0015]图7示出了根据本公开的一些实现方式的在生成目标视频的过程的扩散模型的操技术方案来获取上述关联关系。7[0032]参见图1描述一种生成方式,该图1示出了根据一种生成视频的技术方案的框图视频在合成具有复杂场景和复杂运动的视频方面表现出卓越的视[0037]根据本公开的一个示例实现方式,首帧图像指令可以设置视频生成的场景(并建8[0042]根据本公开的一个示例实现方式,可以基于目前已知的和/或将在未来开发的多9可以作为视频的开始图像,并且第二参考图像214可以作为引导数据来确定视频中故事的成模型220。具体地,可以利用编码器模型410来确定参考视频230的第一参考特征412(例征包括第一参考图像的第一参考图像特征和第二参考图像的第二参考图像214)的第二参考图像特征放置在第一参考特征412的最后一个位置(也即,位置[0060]根据本公开的一个示例实现方式,可以基于目前已知的和/或将在未来开发多种噪声特征Z_t中的一部分噪声,以便形成相对于噪声特征Z_t而言较为清洁的噪声特征Z_420来连接第一参考特征和第二参考特征以生成参考视频的参考特征,可以针对参考特征重建特征和参考特征之间的差异来构造损失函数,继而利用该损失函数来更新扩散模型[0063]根据本公开的一个示例实现方式,可以采用2DUNet(U型网络)来实现扩散模其中1D卷积层沿着时间维度在2D卷积层之后,1D注意力层沿着时间维度位于2D注意层之fe其中条件cimage然后与[0066]可以不断地利用大量参考视频来以迭代方式更新扩散模型430,直到满足预期的[0069]根据本公开的一个示例实现方式,可以基于目前已知和/或将在未来开发的多种[0076]应当理解,由于扩散模型430已经是基于上述损失函数来训练的,此时扩散模型[0083]根据本公开的一个示例实现方式,可以按照预定比例来确定不考虑第二图像614[0084]根据本公开的一个示例实现方式,第二图像是指定目标视频的结束图像的图视频的框图800。如图8所示,输入数据810可以包括第一图像812、第二图像814以及文本的内容为“Apolarbeariswalkingontheicesurface(一只北极熊正在冰面上行[0085]图9示出了根据本公开的一些实现方式的基于输入数据来生成目标视频的框图标视频920的首帧对应于第一图像912、末帧对应于第二图像914,并且视频的内容为“apolarbeariswalkingontheicesurface,fireworksareburstingopen,anbearwalkingontheicesurfacegraduallystandsupandwaves(一只北极熊正在极熊逐渐卧倒并且睡着了)”。此时,后续生成的新视频将以目标视频1020中的结束图像频生成架构PixelDance,该架构结合了首帧和末帧的图像指令以及文本指导。可以基于[0099]根据本公开的一个示例实现方式,第二参考特征的维度等于第一参考特征的维[0117]根据本公开的一个示例实现方式,第二参考特征的维度等于第一参考特征的维第一参考特征和第二参考特征执行噪声处理以生成参考视频的第一噪声参考特征和第二[0132]通信单元1340实现通过通信介质与其他计算设备进行通信。附加地,计算设备据处理装置的处理单元执行时,产生了实现流程图和/或框图中的一个或多个方框中规定令的计算机可读介质则包括一个制造品,其包括实现流程图和/或框图中的一个或多个方令实现流程图和/或框图中的一个或多个方框

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论