CN120219553A 基于文本调整与视觉反馈的针织产品图像生成方法及装置_第1页
CN120219553A 基于文本调整与视觉反馈的针织产品图像生成方法及装置_第2页
CN120219553A 基于文本调整与视觉反馈的针织产品图像生成方法及装置_第3页
CN120219553A 基于文本调整与视觉反馈的针织产品图像生成方法及装置_第4页
CN120219553A 基于文本调整与视觉反馈的针织产品图像生成方法及装置_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

(71)申请人华侨大学地址362000福建省泉州市丰泽区城东城华北路269号申请人信泰(福建)科技有限公司厦门理工学院(72)发明人曾焕强徐思伟朱建清施一帆蔡磊龚鑫荣陈婧许金泰许剑飞章水德(74)专利代理机构厦门市首创君合专利事务所有限公司35204专利代理师李艾华GO6NGO6N3/096(2023.01)(54)发明名称基于文本调整与视觉反馈的针织产品图像生成方法及装置一种基于文本调整与视觉反馈的针织产品图像生成方法及装置,涉及计算机视觉领域,包括:构建对输入文本进行调节的语言模型;将接收到的用户输入的针织相关文本输入经训练的语言模型,获得对用户输入文本进行自适应调整后的文本;将自适应调整后的文本输入经训练的文生图模型,生成对应的图像;对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是否吻合,将格式化文本和生成的图像输入大型视觉语言模型进行视觉问答,获得得不符合预期,最小化文本自注意力矩阵和交叉注意力相似性矩阵的距离优化潜在噪声变量,再次模型将接收到的用户输入的针织相关文本输入经训练的,获得对用户输入的针织相关文本进行自适应调整后的文本diffusion,生成对应的图像对自适应调整后的文本格式化为判断生成的图像与通过最小化文本自注意力矩阵和交叉注意力相似性2S102,将接收到的用户输入的针织相关文本输入经训练的所述语言模型,获得对用户S103,将自适应调整后的文本输入经训练的文生图模型Stablediffusion,生成对应S104,对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是否吻2.根据权利要求1所述的基于文本调整与视觉反馈的针织产品图像生成方法,其特征将改进后的文本y输入文生图模型Stablediffsion,生成图像;通过奖励函数r(x,y)练语言模型生成改进后的文本y的条件概率;β表示超参数;T表示生成文本y的总步数;exp()表示指数函数;基于所述奖励信号来扩展使用前向-后向平衡目标来优化GFlowNet,损失函数如下:3其中,L(x,y;θ)表示总体损失函数,用于衡量初始模型在生成文本y时的性能;L(x,yo+;θ)表示每一步的局部损失函数,用来评估在生成文本到t+1步时的性能;F₀(v,|x,yo₋)表示流函数在第t步的值;F₀(y₄lx,yo)表示流函数在第t+1步的值;P,(y+Ix,y0;θ)表示前向策略在第t+1步的条件概率;r(x,y)表示奖励函数在第t步的值;r(x,y02+1)表示奖励函数在第t+1步的值;θ表示语言模型的参数;Y02+1表示生成到第t+1步的文本;Y表示第t步生成的词;yH表示第t+1步生成的词;最小化上述损失函数,更新生成流网络GFlowNet的前向策略P和流函数F。,同时更新语言模型的参数。3.根据权利要求2所述的基于文本调整与视觉反馈的针织产品图像生成方法,其特征在于,更新生成流网络GFlowNet的前向策略PF和流函数F。,同时更新语言模型的参数之引入流重新激活机制,所述激活机制每M步周期性地重置GFlowNet流函数的最后一层;最终,基于生成流网络GFlowNet调节的语言模型学习生成与奖励成比例的文本。4.根据权利要求1所述的基于文本调整与视觉反馈的针织产品图像生成方法,其特征在于,将自适应调整后的文本输入经训练的文生图模型Stablediffusion,生成对应的图I=Sd(prompt);其中,prompt表示自适应调整后的文本;Sd表示经训练的文生图模型Stablediffusion;I表示生成的图像。5.根据权利要求1所述的基于文本调整与视觉反馈的针织产品图像生成方法,其特征在于,对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是否吻合的文本,将格式化文本和生成的图像输入大型视觉语言模型进行视觉问答,获得得分,具体包对自适应调整后的文本,使用语言模型产生格式化文本判断生成的图像与自适应调整后的文本是否吻合的文本;将生成的图像和格式化文本被输入大型视觉语言模型,计算视觉问答得分,如下:其中,VQA表示视觉问答的得分,用于衡量生成图像和文本之间的对齐程度的指标;I表示生成的图像;text表示格式化文本;P表示视觉问答输出“Yes”的概率,“Yes”表示图像符合文本的内容时视觉问答输出的答案。6.根据权利要求1所述的基于文本调整与视觉反馈的针织产品图像生成方法,其特征在于,若得分符合预期,输出针织产品图像;若得分不符合预期,通过最小化文本自注意力4其中,T“,)表示文本编码器的第1层和第h个头中,第i个标记对第j个标记的自注意力对所有层和头的自注意力矩阵进行平均,并去除对特殊标记的注意力权重,然后进行中的第a个查询向量为q“∈RH.D。;其中,a=1,…,N。,N表示交叉注意力层中查询向量的其中,q()表示在交叉注意力层第1层中的第a个查询向量;k(“)表示交叉注意力层1的5第i个标记的键向量;W(,ʰ)表示在交叉注意力层1和头h中的预训练权重矩阵;Ω表示q“通过最小化交叉注意力图的相似矩阵S和文本自注意力矩阵T之间的距离来优化潜在噪声Z,具体通过最小化以下损失函数来实现:通过上述过程实现文本嵌入的语法关系有效转移到交叉注意力中,使得再次生成的图7.根据权利要求1所述的基于文本调整与视觉反馈的针织产品图像生成方法,其特征68.一种基于文本调整与视觉反馈的针织产品图像生成装置,其特征在于,包括:文本微调语言模型构建模块,用于构建基于生成流网络GFlowNet的对输入文本进行调节的语言模型;文本自适应调整模块,用于将接收到的用户输入的针织相关文本输入经训练的所述语言模型,获得对用户输入的针织相关文本进行自适应调整后的文本;diffusion,生成对应的图像;得分获取模块,用于对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是否吻合的文本,将格式化文本和生成的图像输入大型视觉语言模型进行视觉问潜在噪声变量优化模块,用于判断若得分符合预期,输出针织产品图像;若得分不符合预期,通过最小化文本自注意力矩阵和交叉注意力相似性矩阵的距离优化潜在噪声变量,优化Stablediffusion再次生成图像。7技术领域[0001]本发明涉计算机视觉领域,特别涉及一种基于文本调整与视觉反馈的针织产品图像生成方法及装置。背景技术[0002]针织产品在现代服装设计和生产中占据重要地位,其复杂的纹理和多样的材质特性使得图像生成成为一项具有挑战性的任务。传统的针织产品图像生成方法主要依赖于人工设计或基于固定模板的渲染技术,这些方法在处理复杂的纹理细节和动态变化时存在显著局限性。例如,现有技术往往无法准确捕捉针织纹理的细微变化,导致生成的图像缺乏真实感和细节表现力。[0003]此外,针织产品的图像生成需要适应不同的输入条件,如产品描述、材质参数和用户需求等,然而,用户输入的文本往往具有局限性,难以满足多样化的需求,导致用户体验不佳。同时,现有方法在用户输入描述针织的文本时,往往无法生成和文本描述相吻合的图[0004]综上所述,现有针织产品图像生成技术在纹理细节、输入适应性和文本图像一致性等方面存在显著不足。发明内容[0005]本发明的目的在于提供一种基于文本调整与视觉反馈的针织产品图像生成方法及装置,通过动态调整输入文本及优化图像生成模型,显著提升针织产品图像的生成质量和用户体验。[0007]一方面,一种基于文本调整与视觉反馈的针织产品图像生成方法,其特征在于,包[0008]S101,构建基于生成流网络GFlowNet的对输入文本进行调节的语言模型;[0009]S102,将接收到的用户输入的针织相关文本输入经训练的所述语言模型,获得对用户输入的针织相关文本进行自适应调整后的文本;[0010]S103,将自适应调整后的文本输入经训练的文生图模型Stablediffusion,生成对应的图像;[0011]S104,对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是否吻合的文本,将格式化文本和生成的图像输入大型视觉语言模型进行视觉问答,获得得[0012]S105,若得分符合预期,输出针织产品图像;若得分不符合预期,通过最小化文本自注意力矩阵和交叉注意力相似性矩阵的距离优化潜在噪声变量,优化Stablediffusion再次生成图像。[0013]优选的,基于生成流网络GFlowNet的对输入文本进行调节的语言模型的训练过8[0014]使用预训练的语言模型作为初始模型P(y|x);其中,x表示初始针织文本,y表示根据初始文本x生成改进后的文本y,P₆表示预训练的语言模型;[0015]初始化生成流网络GFlowNet的前向策略P,和流函数F₀;[0016]将改进后的文本y输入文生图模型Stablediffsion,生成图像;通过奖励函数[0018]其中,E表示期望值;i表示根据文本x通过文本到图像的扩散模型P₄(·|x)生成的图像;i,表示根据文本y通过文本到图像的扩散模型P₄(ly)生成的图像;P₄(|x)和P₄(|y)表示文本到图像的扩散模型;ras(i,i)表示美学奖励;re(x,i)表示相关性奖励;[0021]其中,r(x,yo)表示生成到第t步的文本片段Yo2的奖励值;Yo表示生成到第t步的文本片段;Pπr(yo₂|x)表示预训练的语言模型生成文本片段Yo的条件概率;Pre(y|x)表示预训练语言模型生成改进后的文本y的条件概率;β表示超参数;T表示生成文本y的总步[0022]基于所述奖励信号来扩展使用前向-后向平衡目标来优化GFlowNet,损失函数如[0024]其中,L(x,y;θ)表示总体损失函数,用于衡量初始模型在生成文本y时的性能;L(x,y01+1;θ)表示每一步的局部损失函数,用来评估在生成文本到t+1步时的性能;F₀(ylx,yo₁-1)表示流函数在第t步的值;F₀(y+Ix,yo)表示流函数在第t+1步的值;P(y+Ix,yo₂;0)表示前向策略在第t+1步的条件概率;r(x,yo)表示奖励函数在第t步的值;r(x,y02+1)表示奖励函数在第t+1[0025]最小化上述损失函数,更新生成流网络GFlowNet的前向策略P和流函数F,同时更新语言模型的参数。9本自注意力矩阵和交叉注意力相似性矩阵的距离优化潜在噪声变量,优化Stable[0040]其中,T)表示文本编码器的第1层和第h个头中,第i个标记对第j个标记的自注键向量;e⑨)表示第1层第j个标记的键向量;W(预训练权重;[0047]其中,q(表示在交叉注意力层第1层中的第a个查询向量;k(')表示交叉注意力层1的第i个标记的键向量;W(,h)表示在交叉注意力层1和头h中的预训练权重矩阵;Ω表示[0050]其中,A表示平均注意力矩阵,L表示满足查询序列长度为256时的交叉注意力层11j个标记的键向量之间的相似性;C.表示第i个和第k个标记的键向量之间的相似性;A;表示交叉注意力矩阵中第a个查询向量对第i个标记的键向量的注意力权重;A;表示交叉注意力矩阵中第a个查询向量对第j个标记的键向量的注意力权重;N.表示交叉注意力层中查询向量的长度;[0054]通过最小化交叉注意力图的相似矩阵S和文本自注意力矩阵T之间的距离来优化潜在噪声Z,具体通过最小化以下损失函数来实现:[0056]其中,L(z,)表示损失函数;Pi表示权重系数;T,表示文本自注意力矩阵T的元素,表示第i个和第j个标记之间的自注意力权重;Y表示指数;S,(z)表示交叉注意力相似性矩阵中的元素;[0057]通过梯度下降优化潜在噪声Z1,如下:[0059]其中,α表示学习率;表示潜在噪声变量;V₂L(z,)表示损失函数L(z,)对Z的梯度,用于更新潜在噪声变量;z,表示通过梯度下降更新后的潜在噪声变量;[0060]通过上述过程实现文本嵌入的语法关系有效转移到交叉注意力中,使得再次生成的图像和文本语义保持对齐。[0061]优选的,优化Stablediffusion再次生成图像之后,还包括:返回S104,重新获得[0063]文本微调语言模型构建模块,用于构建基于生成流网络GFlowNet的对输入文本进行调节的语言模型;[0064]文本自适应调整模块,用于将接收到的用户输入的针织相关文本输入经训练的所述语言模型,获得对用户输入的针织相关文本进行自适应调整后的文本;[0065]图像生成模块,用于将自适应调整后的文本输入经训练的文生图模型Stablediffusion,生成对应的图像;[0066]得分获取模块,用于对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是否吻合的文本,将格式化文本和生成的图像输入大型视觉语言模型进行视觉[0067]潜在噪声变量优化模块,用于判断若得分符合预期,输出针织产品图像;若得分不符合预期,通过最小化文本自注意力矩阵和交叉注意力相似性矩阵的距离优化潜在噪声变[0069](1)本发明通过基于GFlowNet的语言模型微调,使得语言模型能够对用户输入的文本进行自适应调整,使调整后的文本能够准确、多角度地描述针织产品的特征,为生成模型生成图像提供有力保障;[0070](2)本发明通过大型视觉语言模型视觉反馈,对图像生成模型进行优化,使得生成的图像和输入的文本语义保持一致,确保图像和文本对齐,生成和文本一致的高质量的针织图像。附图说明[0071]图1为本发明实施例提供的基于文本调整与视觉反馈的针织产品图像生成方法的流程图;[0072]图2为本发明实施例提供的基于文本调整与视觉反馈的针织产品图像生成方法的详细流程示意图;[0073]图3为本发明实施例提供的基于文本调整与视觉反馈的针织产品图像生成装置的结构框图;[0074]图4为本发明实施例提供的电子设备的硬件结构示意图。具体实施方式[0075]下面结合具体实施例,进一步阐述本发明。应理解,这些实施例仅用于说明而不用于限制本发明的范围。此外应理解,在阅读了本发明讲授的内容之后,本领域技术人员可以对本发明作各种改动或修改,这些等价形式同样落于本申请所附权利要求书所限定的范围。[0076]参见图1和图2所示,本实施例一种基于文本调整与视觉反馈的针织产品图像生成[0077]一种基于文本调整与视觉反馈的针织产品图像生成方法,其特征在于,包括:[0078]S101,构建基于生成流网络GFlowNet的对输入文本进行调节的语言模型。[0079]需要说明的是,此处的语言模型指只具备语言处理能力,主要用于文本生成任务的语言模型。[0080]使用预训练的语言模型作为初始模型P₀(y|x);其中,x表示初始针织文本,y表示根据初始文本x生成改进后的文本y(此处的改进后的文本y指训练过程中每一步得到的文本),P。表示预训练的语言模型。该语言模型已经在大规模文本数据上训练,具备理解和生成自然语言的能力。在此基础上通过GFlowNet微调语言模型,把文本自适应这个问题重新定义为概率推断,即用概率的方法来预测如何调整文本。使用预训练的语言模型P₀(y|x)作为初始策略。初始化GFlowNet的前向策略P和流函数F。输入初始文本x,预训练的语言模型生成改进后的文本y。将改进后的文本y输入文生图模型Stablediffsion,生成图像。[0081]需要说明的是,此处文生图模型Stablediffsion只用于生成图像,输入文本进来,输出图像出去。这一部分可以看做是对生成文本部分的优化,因此在这里生成图像,通过将奖励函数作为损失函数的一部分进行优化,调整语言模型参数,使生成的文本能够获得更高的奖励值,从而使得语言模型能够学习如何调整初始文本。[0082]通过奖励函数r(x,y)计算奖励,其中奖励函数定义如下:[0088]上述处理使得能够在每一步引入奖励函数分解得到的逐步的奖励信号来扩展使[0090]其中,L(x,y;θ)表示总体损失函数,用于衡量初始模型在生成文本y时的性能;L(x,y0+1;θ)表示每一步的局部损失函数,用来评估在生成文本到t+1步时的性能;F₀(y,lx,yo₁-1)表示流函数在第t步的值;F(y+Ix,yo₁)表示流函数在第t+1步的值;P₆(y|x,yo;θ)表示前向策略在第[0091]通过最小化上述损失函数,更新生成流网络GFlow[0092]S102,将接收到的用户输入的针织相关文本输入经训练的所述语言模型,获得对[0093]S103,将自适应调整后的文本输入经训练的文生图模型Stablediffusion,生成输入的文本进行自适应调整。调整后的文本输入预训练的文生图模型S像。[0098]S104,对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是[0102]需要说明的是,本实施例的大型视觉语言模型可以为LVLM,结合[0107]其中,T“)表示文本编码器的第1层和第h个头中,第i个标记对第j个标记的自注[0108]为了得到最终的文本自注意力矩阵T²,b),对所有层和头的自注意力矩阵进行平注意力矩阵T’的元素;表示对第n行中从第2个元1的第i个标记的键向量;W()表示在交叉注意力层1和头h中的预训练权重矩阵;Ω表示记和第j个标记的键向量之间的相似性;Ck表示第i个和第k个标记的键向量之间的相似[0123]通过最小化交叉注意力图的相似矩阵S和文本自注意力矩阵T之间的距离来优化[0131]参见图3所示,本发明还公开了一种基于文本调整与视觉反馈的针织产品图像生[0132]文本微调语言模型构建模块301,用于构建基于生成流网络GFlowNet的对输入文[0133]文本自适应调整模块302,用于将接收到的用户输入的针织相关文本输入经训练的所述语言模型,获得对用户输入的针织相关文本进行自适应调整后的文本;[0134]图像生成模块303,用于将自适应调整后的文本输入经训练的文生图模型Stablediffusion,生成对应的图像;[0135]得分获取模块304,用于对自适应调整后的文本格式化为判断生成的图像与自适应调整后的文本是否吻合的文本,将格式化文本和生成的图像输入大型视觉语言模型进行[0136]潜在噪声变量优化模块305,用于判断若得分符合预期,输出针织产品图像;若得分不符合预期,通过最小化文本自注意力矩阵和交叉注意力相似性矩阵的距离优化潜在噪[0137]一种基于文本调整与视觉反馈的针织产品图像生成装置各模块的具体实现同一种基于文本调整与视觉反馈的针织产品图像生成方法,本实施例不再重复说明。[0138]图4所示为本发明实施例提供的电子设备的硬件结构示意图。如图4所示,本实施例的电子设备包括:处理器401以及存储器402;其中存储器402,用于存储计算机执行指令;处理器401,用于执行存储器存储的计算机执行指令,以实现上述实施例中电子设备所执行的各个步骤。具体可以参见前述方法实施例中的相关描述。[0139]可选地,存储器402既可以是独[0140]当存储器402独立设置时,该电子设备还包括总线403,用于连接存储器402和处理[0141]本发明实施例还提供一种计算机存储介质,计算机存储介质中存储有计算机执行指令,当处理器401执行计算机执行指令时,实现如上的方法。[0142]本发明实施例还提供一种计算机程序产品,包括计算机程序,计算机程序被处理[0143]在本发明所提供的实施例中,应该理解到,所揭露的设备和方法,可以通过其它的逻辑功能划分,实际实现时可以有另外的划分方式,例如多个模块可以结合或者可以集成到另一个系统,或一些特征可以忽略,或不执行。另一点,所显示或讨论的相互之间的耦合或直接耦合或通信连接可以是通过一些接口,装置或模块的间接耦合或通信连接,可以是[0144]作为分离部件说明的模块可以是或者也可以不是物理上分开的,作为模块显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部模块来实现本实施例方案。[0145]另外,在本发明各个实施例中的各功能模块可以集成在一个处理单元中,也可以是各个模块单独物理存在,也可以两个或两个以上模块集成在一个单元中。上述模块形成的单元既可以采用硬件的形式实现,也可以采用硬件加软件功能单元的形式实现。[0146]上述以软件功能模块的形式实现的集成的模块,可以存储在一个计算机可读取存储介质中。上述软件功能模块存储在一个存储介质中,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)或处理器401执行本申请各个实施例方法的部分步骤。[0147]应理解,上述处理器401可以是中央处理单元(CentralProcessingUnit,简称CPU),还可以是其他通用处理器、数字信号处理器(DigitalSignalProcessor,简称DSP)、专用集成电路(ApplicationSpecificIntegratedCircuit,简称ASIC)等。通用处理器可以是微处理器或者该处理器401也可以是任何常规的处理器401等。结合发明所公开的方法的步骤可以直接体现为硬件的处理器401执行完成,或者用处理器401中的硬件及软件模块组合执行完成。[0148]存储器402可能包含高速RAM存储器,也可能还包括非易失性存储NVM,例如至少一[0149]总线403可以是工业标准体系结构(IndustryStandardArchitecture,简称ISA)、外部设备互连(PeripheralComponentInterconnect,简称PCI)总线或扩

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论