版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
202410939073.02024.07.15训练数据包括视频数据和对应视频数据的交互像隐层特征和对应帧的交互信息进行特征转换视频生成模型;采用视频生成模型处理输入数了现有视频生成技术无法进行实时交互调整的2获取训练数据,所述训练数据包括视频数据和对应所述视根据所述图像隐层特征和对应帧的所述交互信息进行特征转根据所述重建低分辨率图像进行图像超分辨率处理,得到预生成图在训练所述低分辨率图像重建模型的过程中获取每一将所述图像隐层特征和对应帧数的所述交互信息导入所述可交互的视频生成模型的将所述目标图像隐层特征导入训练完成的所述低分辨率图像重建模将所述重建低分辨率图像导入所述超分辨率模型进行超分辨率处理,将对应所述低分辨率图像的所述交互信息导入所述交将所述图像隐层特征导入所述转换解码器,通过所述转换解码3将对应帧数的所述低分辨率图像导入所述图像重建编码器进行图像将所述目标隐层特征导入所述图像重建解码器进行图像重建解码,得45[0023]将所述图像隐层特征和对应帧数的所述交互信息导入所述可交互的视频生成模根据所述重建低分辨率图像进行图像超分辨率处[0029]将对应所述低分辨率图像的所述交互信息导入所述交互信息编码器进行交互编藏特征和所述图像隐层特征生成对应图像帧层特征和对应帧的所述交互信息进行特征转换处理,得到第一帧图像和目标图像隐层特到目标视频。本申请通过上述方法解决了现有视频生成技术无法进行实时交互调整的问6[0039]图2为本申请一种实时可交互的视频生成方法中训练低分辨率图像重建模型和图[0040]图3为本申请一种实时可交互的视频生成方法中训练可交互的视频生成模型的数[0046]目前生成视频的现有技术有公开号为CN114598926A的现有实施例一、名称为《GeneratingLongVideosofDynamicScenes》的论文一和名称为《VideoDiffusion(1)随机采样时序噪声,将时序噪声经过映射网络输入类似StyleGAN2和Style7[0053]参见图1可知,本实施例提供一种实时可交互的视频生成方法,所述生成方法包长越长越好,不低于10分钟,没有具体的限制。视频分辨率为常见分辨率即可,如360P、辨率的比例根据所述视频数据的帧图像的尺寸确定;对所述低分辨率图像进行裁剪处理,8采样后的低分辨率图像xL的长和宽是原始分辨率图像x的若视频帧图像为720P或1080P,则降采样比例为4,即降采样后的低分辨率图像xL的IT不同的交互方式下都能获得连续的交互信息用于训复杂交互方式对其采集的原始数据进行处理的过程不包含在此实施例的数据预处理过程9[0062]图2为本申请一种实时可交互的视频生成方法中训练低分辨率图像重建模型和图[0069]图像超分辨率模型S可以处理输入的低分辨率图像,获得与低分辨率图像内容相证图像超分辨率模型S输出的重建图像与真实的原始分辨率图像具有相同率模型S输出的重建图像的清晰度接近真实图像。图像辨别器可以优化超分辨率生成模型[0073]图像辨别器DS用于判断输入的图像为真实的原始分辨率图像或是重建的原始分[0076]图3为本申请一种实时可交互的视频生成方法中训练可交互的视频生成模型的数I的输入也可以是多种形式。[0085]上述不同的视频任务分为:(1)离线任务。给定一组已知的交互操作信息I=可以仅使用第t帧对应的交互操作信息,也可以使用第t帧及其前后若干帧对应交互信息,[0088]Transformer编码器_解码器MV结构就是常用的Transformer模型,这里不再做具体解释。Transformer编码器M器MDv使用编码器MEv的输出作为输入,同时使用上一帧生成的图像的隐层特征2-1作为输入。将生成的上一帧图像输入图像编码器EM即可获得2-1。Transformer解码器MDv的作用解码器DM生成当前帧图像再经由图像超分辨率模型述视频辨别器为所述可交互的视频生成模型中用于调整所述预生成视频的清晰度逐渐接数对所述可交互的视频生成模型中各个组件进行参数调整的步骤包括通过所述重建损失[0090]具体的,在本实施例中,为训练可交互的视频生成模型的交互信息编码器EI、分辨率相同的生成视频计算生成视频与真实视频的重建损失重建损失函数是以Transformer编码器_解码器MV,辨别器损失函数LV同时用于优化交互信息编码器EI、成视频的预生成第一帧图像的具体方案为将所述重建低分辨率图像输入完成训练的所述1帧图像帧的图像隐层特征和交互信息输入所述可交互的视频生成模型的转换器中,得到[0098](1)生成初始帧的隐层特征z0。生成方法有两种:①在预训练图像重建模型过程[0099](2)将初始帧的隐层特征z0以及第一帧对应的交互操作信息I1的隐层特征输入码器DM,获得重建的低分辨率图像础:将础输入图像超分辨率模型S,获得生成的原始分辨EM,获得前一帧图像t-1的隐层编码2-1;将2-1以及当前帧对应的交互操作信息It的隐层[0104](2)将原始分辨率512×512的视频降采样至分辨率256×256;从分辨率512×512[0105](3)使用降采样后的分辨率为256×256的帧图像作为输入数据和监督数据,训练[0106](4)使用降采样后的分辨率为256×256的帧图像作为输入数据,使用原始分辨率[0107](5)使用VQVAE的编码器从上一帧生成图像中提取隐层特征(初始帧的隐层特征从入预训练的SwinIR图像超分辨率模型,获得原始分辨率512x[0110]①可以将交互信息编码器和Transformer编码器一解码器的运算过程放置在一个[0114]⑤最终的视频输出过程放置在一个进程中,其输入队列[0118](2)从预训练VQVAE获得的图像隐层特征的先验分布中采样获取初始帧的隐层特征,将初始帧的隐层特征及生成第一帧图像所对应的交互操作信息输入Transformer编码获得上一帧图像的隐层特征,再结合生成当前帧图像所对应的交互信息操作,依次经过[0124]数据预处理模块2,所述数据预处理模块2被配置为对所交互的视频生成模型中具有训练完成的所述低分辨率图像重建模型和所述图像超分辨率练和所述图像超分辨率模型;所述视频生成模块
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026银川市唐徕中学北校区临聘教师3人考试备考试题及答案详解
- it主管述职报告十篇
- 中国人民解放军第五七一八工厂基建技术员招聘考试参考题库及答案详解
- 2026年六安市皖西卫生职业学院附属医院(市二院)就业见习人员招募考试备考试题及答案详解
- 2026昆明市五华区社会保险中心招聘公益性岗位人员1人考试备考题库及答案详解
- 2026兴化市昭阳街道基层公益性岗位招聘2人考试备考试题及答案详解
- 2026年吉安市吉州区卫生健康委员会面向社会公开招聘短期编外工作人员的考试备考题库及答案详解
- 2026下半年海南事业单位联考三亚市卫生健康委员会招聘公立医院人员13人考试备考试题及答案详解
- 2026年8月鹭江创新实验室工程实验技术人员招聘12人考试备考题库及答案详解
- 招聘若干名!大通县朔山中学2026年秋季学期公开招聘教师考试备考试题及答案详解
- 物业电工应急预案
- 2025年及未来5年中国动漫品牌授权市场前景预测及未来发展趋势报告
- 项目管理成果汇报
- 猪肉储备管理办法辽宁
- GJB573B-2020引信及引信零部件环境与性能试验方法
- 2024海康威视无线全向麦音箱DS-UAC-VS3操作手册
- GB 21256-2025粗钢生产主要工序单位产品能源消耗限额
- 丝印油墨管理制度
- 墩柱及系梁专项施工方案
- 企业管理的基本知识
- SELFJECTOR 使用说明书三菱运行手册
评论
0/150
提交评论