CN119444349A 一种虚拟试衣方法及装置 (青岛三态比特科技有限公司)_第1页
CN119444349A 一种虚拟试衣方法及装置 (青岛三态比特科技有限公司)_第2页
CN119444349A 一种虚拟试衣方法及装置 (青岛三态比特科技有限公司)_第3页
CN119444349A 一种虚拟试衣方法及装置 (青岛三态比特科技有限公司)_第4页
CN119444349A 一种虚拟试衣方法及装置 (青岛三态比特科技有限公司)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

过多目标多模态虚拟试衣模型实现多目标个性块通过多模态特征融合模块(MFF)和多参考目标纹理特征提取模块(MRSTF)实现多模态条件特征过MM_VTON模型从纯噪声中逐渐生成去噪后的虚多模态学习,提高了虚拟试衣的真实感和准确2S1:利用文本大模型GPT_4V和CogVLM以所需的格式描述模特的穿着作为文本提示词,使用开源词汇检测模型凸显每个目标服装主体的关键提示词,采用SAM模型在现有的模特S2:通过建立MM_VTON模型用于实现多目标个性化的虚拟S3:将所述数据样本对输入MM_VTON模型中进行多模态特S4:通过位置特征编码模块实现所述多模态特征编码S5:设计MM_VTON模型总损失函数Lenc来对一步的提高MM_VTON模型的局部纹理特征提取和保留全局需要试穿的多目标服装样式图与相应的文本提示词并保S13:将生成的文本提示词输入到开源词汇检测模型中生成与每个目标服装主体相关首先,利用多模态特征融合模块对输入的文本提示词与服装图像进然后,采用多参考目标纹理特征提取模块从编码后的关键3接下来,设计并行的多模态注意力层来处理文本和图像特征的自最后,利用多目标交叉注意力机制进行交叉注意力的计算,并引入4.根据权利要求1所述的一种虚拟试衣方法,其特征在于,步骤S2中所述的并行去噪保留原始SDXL模型中负责一般特征提取的网络架构且令其在不同条件编码分支之间首先,利用预训练的CLIP文本编码器对输入的文本提示词采用精然后,使用预训练的图像编码器提取服装图像最后,使用感知重采样器对多模态条件嵌入特征进行下采特征交错学习注意力模块中的多参考目标纹然后,利用文本编码器CLIP对包含关键提示词的文本实query最后,利用文本查询损失L来分别监督服装编码器以提高query7.根据权利要求1所述的一种虚拟试衣方法,其特征在4的模特服装图,需要试穿的多目标服装样式图与相应的文本提示词进行MM_VTON模型的推S73:基于MFILA模块使用多模态注意力机制对文本特征与图像特征进行对齐与融合,在所述处理器上运行的计算机程序,所述处理器运行所述计算机程序时实现上述基于MM_5购物方式由于缺乏实际的试穿体验,导致消费者难以准确判断服装的合身度和风格效果,据集出发,利用多模态模型GPT_4V和CogVLM以所需的格式描述模特的穿着作为文本提示[0008]S2:通过建立MM_VTON模型(Multi_subject,multi_modal_VirtualTry_on)用于需要试穿的多目标服装样式图与相应的文本提示词并保6文本提示词作为条件,利用MM_VTON模型从纯噪声中逐渐估计得到去噪版本的虚拟试衣结[0017]S13:将生成的文本提示词输入到开放词汇检测模型中生成与每个目标服装主体示词和多目标参考图像中提取特定风格的特征,将不同风格的特征在通道维度进行拼接,[0024]本发明设计的并行去噪UNet模块保留原始SDXL模型中负责一般特征提取的网络[0025]可选地,步骤S3中所述的基于多模态特征交错学习注意力模块(MFILA)中的多模[0027]可选地,步骤S3中所述的基于多模态特征交错学习注意力模块(MFILA)中的多参7queryquery8高了系统的鲁棒性和图像的清晰度,从而为服装行业带来了成本效益和市场竞争力的提显文本提示词中每个目标服装主体的关键提示词,并采用SAM模型在现有的模特图像上生像构建出一系列具有文本描述的目标模特图像Ia与来自Ib的所有参考目标服装之间的对应9[0055](2)用户在系统中手动上传需要进行虚拟试衣的模特服装图,需要试穿的多目标[0056](3)建立MM_VTON模型(Multi_subject,multi_modal_VirtualTry_on)用于实现多目标个性化的虚拟试衣。该模型主要由多模态特征交错学习注意力模块(MFILA)与并行到所需的模特图像中,为此,本发明基于多模态学习的思想,将多模态融合特征引入MM_[0058](4)所述MM_VTON模型中实现多模态条件特征编码的多模态特征交错学习注意力征融合模块(MFF)和多参考目标纹理特征提取模块(MRSTF)两部分,其中MFF将多模态数据映射到潜在特征空间中,MRSTF利用一个创新的服装编码器模块将多目标的条件信息进行的CLIP文本编码器与词汇检测模型对用户输入的提示词T进行文本提示词的编码与文本实如下:i表示输入的多模态条件特征编码,其对应的不同目标特征的键和值矩阵彼此UNet的键和值特征沿着l维拼接为并使mq用查询z进行后续的注意力与多目标交叉注意力(MS_CA)mq[0078]本发明利用这种多模态条件嵌入的方式以替代稳定扩散模型中原始文本嵌入方装图像和文本查询作为输入,并将每个Transformer块的交叉注意层输出的特征作为服装[0087]MM_VTON模型与传统的稳定扩散模型性质相同,均为条件化的潜在空间概率扩散合MFILA模块的注意力特征注入有利于更稳定的生成高质量的虚拟试衣效果。在训练过程输入的关于试穿服装参考图像的文本指令T,MM_VTON旨在无缝地跟随T以合成照片般逼真

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论