CN119478587A 一种基于CLIP损失与感知损失的扩散模型LoRA微调优化方法及系统 (南京信息工程大学)_第1页
CN119478587A 一种基于CLIP损失与感知损失的扩散模型LoRA微调优化方法及系统 (南京信息工程大学)_第2页
CN119478587A 一种基于CLIP损失与感知损失的扩散模型LoRA微调优化方法及系统 (南京信息工程大学)_第3页
CN119478587A 一种基于CLIP损失与感知损失的扩散模型LoRA微调优化方法及系统 (南京信息工程大学)_第4页
CN119478587A 一种基于CLIP损失与感知损失的扩散模型LoRA微调优化方法及系统 (南京信息工程大学)_第5页
已阅读5页,还剩22页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于CLIP损失与感知损失的扩散模型本发明提出了一种基于CLIP损失与感知损损失计算中间图像与目标图像在特征空间的差2步骤2,随机采样时间步t,利用CLIP模型计算去噪后的中间,前时间步,t表示从到窗口中所有能采样到的时间步;表示在当前采样步,,,其中T表示稳定扩散模型中最大的时间步长;fimg表示对图像进行CLIP编码后的向量后的目标微调图像xo,之后再对压缩后的目标微调图像xo进行加噪t-1步得到噪声图像3调图像对应的文本text经过CLIP编码变成文本向量Ttext,然后将Ttext和噪声图像xt输入,。步骤2.3.1,使用损失公式LCUP=wfe"fimg-fiexll对文本向量Ttext和图像向量I进,对权重值进行调整;4,,通过计算带噪原尺寸图像R-1和目标微调图像X0在感知模型中各层次之间的差异值来指步骤3.3.2,将原尺寸带噪目标图像R-1和目标微调图像X0一起输入特征提取网络,10.一种根据权利要求1~9任一项所述的方法实现的基于CLIP损失与感知损失的稳定压缩过的目标微调图像xo加噪t步后,使用和LoRA合并后的稳定扩散模型预测第t步的噪感知损失计算模块,用于:首先将目标微调图像X0和已经去除第t步噪声的带噪图像56层,但是大部分微调技术仍然面临计算资源需求高,训练后保存的模型参数量大等问题。[0005]发明目的:本发明提出了一种基于CLIP损失与感知损失的扩散模型LoRA(Low_7用如下公式计算常规损失标准差std,:口内平均损失值;当常规稳定扩散模型损失在k步内标准差std,小于等于阈值θ时,判定常[0017]在本发明中,分别对于CLIP损失和感知损失进行了损失计算公式的改进,在该损失公式下CLIP损失和感知损失能够自适应调整权重。在CLIP损失中,该改进可以帮助CLIP损失在介入总损失时防止因为采样到的加噪步数过大,导致语义和加噪后的图像差异度过大致使模型训练出现不稳定情况。在感知损失下,该改进有助于让感知损失自动调整各层所以在本发明中针对CLIP模型设计了一个损失函数以适应稳定扩散模型中不同程度的带fe"fimg-fiexll8[0021]其中T表示稳定扩散模型中最大的时间步长,默认为1000;fimg表示对图像进行到压缩后的目标微调图像xo,之后再对压缩后的目标微调图像xo进行加噪t-1步得到噪声xt-1再加一步噪声得到噪声图像xt,同时保留第t步随机采样的高斯噪声Et用于MSE(MeanSquaredErrorLoss)逐像素点计算目标微调图像对应的文本text经过CLIP编码变成文本向量Ttext,然后将Ttext和噪声图像型中通过线性的数据采样调度方式预定义好的一组参数β中的第t个9CLIP损失计算之前先将带噪图像it-1经过VAE模型的解码器将尺寸还原,得到带噪原尺寸,在去噪过程中的LoRA旁路参数直接参与了对噪声的预测,因此将CLIP损失引入到梯度[0043]步骤3.1,考虑到传统[0046]其中Lperc表示感知损失的总损失值,表示每一层卷积网络对图像的特征提[0048]步骤3.3,使用感知损失Lperc对带噪原尺寸图像R-1和目标微调图像X0计算感知损失,通过计算带噪原尺寸图像R-1和目标微调图像X0死神经元,目的是为了防止过拟合现象的出现;特征提取网络VGG16的输入通道被调整为能够有效引导模型捕捉细节与语义特征,进一步提高生成图像的整体质量和文本对齐效练过程中能够更好地将图像与文本进行对齐,使得生成的图像更加符合文本提示的描述。[0065]下面结合附图和具体实施方式对本发明做更进一步的具体说明,本发明的上述[0070]本发明实施例提供了一种基于CLIP损失与感知损失的扩散模型LoRA微调优化方[0071]经过编码器处理后,图像被压缩为潜在特征矩阵Z,这是一个高度浓缩的潜在表[0073]图2展示了模型预测噪声的整体流程,详细说明了潜在特征向量Z与文本信息T如征向量Z与文本信息T共同输入到U_Net网络中进行处理。U_Net网络的架构包括编码器[0077]图3展示了本发明中提出的两个额外损失项的计算流程。具体而言,首先将包含[0082]图4展示了本发明提出的LoRA微调方法与传统LoRA微调方法及常规扩散模型的对佩戴墨镜等饰品的多样化特征。在相同的生成种子和提示文本条件下,本发明优化后的[0083]本发明提供了一种基于

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论