2024AI人工智能应用课程06:Stable Diffusion⼯业级AI⽣图软件_第1页
2024AI人工智能应用课程06:Stable Diffusion⼯业级AI⽣图软件_第2页
2024AI人工智能应用课程06:Stable Diffusion⼯业级AI⽣图软件_第3页
2024AI人工智能应用课程06:Stable Diffusion⼯业级AI⽣图软件_第4页
2024AI人工智能应用课程06:Stable Diffusion⼯业级AI⽣图软件_第5页
已阅读5页,还剩55页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《StableDiffusion⼯业级AI⽣图软件》1.硬件要求建议使⽤以上的硬盘空间。需要⽤架构,推荐使N卡。(⽬前已经有了对A卡的相关⽀持,但运算的速度依旧明显慢于N卡,参⻅:对显存的要求⽐较⾼,低于4G的显存基本上跑不动,8G以上运⾏的顺利⼀点。推荐配置30系列以上,8G显存以上。过度使⽤,显卡会有损坏的⻛险。Install·过度使⽤,显卡会有损坏的⻛险。进图⽚⽣成时主流显卡速度对⽐:2.环境部署1. ⼿可以参考的官⽅部署·的完整环境占⽤空间极⼤,能达到需要联⽹下载安装⼤量的依赖,在境内的⽹络环境下下载很慢,请⾃带科学上⽹⼯具。安装安装AddPythontoPATHwin+r安装在下载安装包并安装。win+r下载的仓库按下

输⼊⾏窗⼝。运⾏:gitclone/AUTOMATIC1111/stable-diffusion-webui.git请把代码中的替换为⾃⼰想下载的⽬录。装配模型可在如上下载标注有的模型,有模型才能作画。下载的模型放⼊下载后models/Stable-diffusion⽬录。使⽤双击运⾏webui-user.bat。脚本会⾃动下载依赖,等待⼀段时间(可能很⻓),程序会输出⼀:7860/的地址,在浏览器中输⼊这个链接开即可。详细可参⻅模型使⽤。win+r更新按下win+r

输⼊⾏窗⼝。运⾏:git请把代码中的:替换为⾃⼰下载仓库的⽬录。整合包:推荐链接提取码觉得⿇烦的同学可以使⽤整合包,解压即⽤。⽐如独⽴研究员的空间下经常更新整合包。秋叶的启动器也⾮常好⽤,将启动器复制到下载仓库的⽬录下即可,更新管理会更⽅便。打开启动器后,可⼀键启动:如果有其他需求,可以在⾼级选项中调整配置。显存优化根据显卡实际显存选择,不要超过当前显卡显存。不过并不是指定了显存优化量就⼀定不会超显存,在出图时如果启动了过多的优化项(如⾼清修复、⼈脸修复、过⼤模型)时,依然有超出显存导致出图失败的⼏率。能极⼤地改善了内存消耗和速度,建议开启。准备⼯作完毕后,点击⼀待浏览器⾃后说明启动成功如果报错提⽰:的更新⽐较频繁,请根据需求在版本管理⽬录下更新:同样地,也请注意插件的更新:mac部署环境对于硬件要求是M1,M2芯⽚以上参考下⾯的⽂章/p/6095777233.关于插件推荐两个下载模型的⽹址:https://huggingface.co/可配置⼤的扩展选项卡下,可以安装插件:点击加载⾃后,⽬即可安装。安装完毕后,需要重新启动⽤⼾界⾯:界⾯讲解PP模型:Chilloutmix-Ni,这个是对整个出图效果影响最⼤的选项。采样⽅法(Sampler):DDIM(因为快)采样迭代步数(Steps):10(DDIM10与20差别不⼤)正向描述(我要什么):realistic,(ultrahighres:1.3),girl,headportrait反向描述(我不要什么):(worstquality,lowquality:1.4),随机种⼦(seed):3248848644模型的VAE(SDVAE):vae-ft-mse-840000-ema-pruned.safetenso有些vae是内置在⼤模型中的,有些需要⾃⼰下载。我会给⼤家推荐⼀个⽐较好的模型。(画⾯不好看的主要因为没有设置VAE,可以理解为美颜⽽且有很多种的美颜效果供选择)⽂⽣图最简流程选择需要使⽤的模型(底模),这是对⽣成结果影响最⼤的因素,主要体现在画⾯⻛格上。在第⼀个框中填⼊提⽰词⽣成的东西进⾏⽂字描述在第⼆个框中填⼊负⾯提⽰词⽣成的东西进⾏⽂字描述选择采样⽅法、采样次数、图⽚尺⼨等参数。采样器/采样⽅法)选择使⽤哪种采样器。可以以较少的步数产⽣很⼤的多样性,不同的步数可能有不同的结果。采样器都会产⽣图像。相关的采样器通常具有不错的效果,但耗时也会相应增加。是最简单、最快的a更多样,不同步数可以⽣产出不同的图⽚。但是太⾼效果不会更好。才能获得好的结果,适合在重绘时候使⽤。的衍⽣,它们使⽤⼀种相关但稍有不同的⽅法(平均过去的⼏个步骤以提⾼准确性)。⼤可以得到稳定结果的衍⽣,可以更好地处理神经⽹络结构中的奇异性。是⼀种神奇的⽅⼀步运两次去噪,它的速度⼤的两倍,⽣图效果也⾮常好。但是如果你在进⾏调试提⽰词的实验,这个采样器可能会有点慢了。效果较好且速度⾮常快,对平⾯、卡通的表现较好,推荐使⽤。16.SamplingSteps(采样步数)StableDiffusion的⼯作⽅式是从以随机⾼斯噪声起步,向符合提⽰的图像⼀步步降噪接近。随着步数增多,可以得到对⽬标更⼩、更精确的图像。但增加步数也会增加⽣成图像所需的时间。增加步数的边际收益递减,取决于采样器。⼀般开到20~30。18.不同采样步数与采样器之间的关系:19.提⽰词相关性)图像与你的提⽰的匹配程度。增加这个值将导致图像更接近你的提⽰,但它也在⼀定程度上降低了图像质量。可以⽤更多的采样步骤来抵消。过⾼体现为粗犷的线条和过锐化的图像。⼀。与采样器之间的关系:⽣成批次每次⽣成图像的组数。⼀次运⾏⽣成图像的数量为批次*批次数量。每批数量同时⽣成多少个图像。增加这个值可以提⾼性能,但也需要更多的显存。⼤的。尺⼨指定图像的⻓宽。出图尺⼨太宽时,图中可能会出现多个主体。之上的尺⼨可能会出现不理想的结果,推荐使⽤⼩尺⼨分辨率⾼清修复。种⼦种⼦决定模型在⽣成图⽚算法起点的初始值。理论上,在应⽤完全相同参数(如、、、的情况下,⽣产的图⽚应当完全相同。⾼清修复fix来启⽤。默认情况下,⽂⽣图在⾼分辨率下会⽣成⾮常混沌的图像。如果使⽤⾼清修复,会型⾸先按照指定的尺⼨⽣成⼀张图⽚,然后通过放⼤算法将图⽚分辨率扩⼤,以实现⾼清⼤图效果。最终尺⼨为(原分辨率*。放⼤在许多情况下效果不错,但重绘幅度⼩后就不甚理想。、以下的重绘幅度有较好⽀持。表⽰在进⾏这⼀步时计算的步数。字⾯翻译是降噪强度,表现为最后⽣成图⽚对原始输⼊图像内容的变化程度。该值越⾼,放⼤后图像就⽐放⼤前图像差别越⼤意味着修正原图,⾼就和原图就没有⼤的相关性了。⼀和原图基本上⽆以下就是稍微改⼀些。实际执⾏中,具体的执⾏*。⾯部修复修复画⾯中⼈物的⾯部,但是⾮写实⻛格的⼈物开启⾯部修复可能导致⾯部崩坏。点击“⽣成”提⽰词提⽰词所做的⼯作是缩⼩模型出图的解空间,即缩⼩⽣成内容时在模型数据⾥的检索范围,⽽⾮直接指定作画结果。提⽰词的效果也受模型的影响,有些模型对⾃然语⾔做特化训练,有些模型对单词标签对特化训练,那么对不同的提⽰词语⾔⻛格的反应就不同。提⽰词内容提⽰词中可以填写以下内容:⾃然语⾔可以使⽤描述物体的句⼦作为提⽰词。⼤多数情况下英⽂有效,也可以使⽤中⽂复杂的语法。单词标签可以使⽤逗号隔开的单词作为提⽰词。⼀般使⽤普通常⻅的单词。单词的⻛格要和图像的整体⻛格搭配,否则会出现混杂的⻛格或噪点。避免出现拼写错误。可参考|、颜⽂�������)表情符号也是可以使⽤并且⾮只有⼀的确切含义,可以参考,在构图上有影响。�1.�� 数据的模型来说,可以使⽤西式颜⽂字在⼀定程度上控制出图的表情。于使如::-)微笑:-(不悦;-)使眼⾊:-D开⼼:-P吐⾆头:-C很悲伤:-O惊讶张⼤⼝:-/怀疑提⽰词语法根据⾃⼰想画的内容写出提⽰词,多个提⽰词之间使⽤英⽂半⻆,如:⼀般⽽⾔,概念性的、⼤范围的、⻛格化的关键词写在前⾯,叙述画⾯是描述细节的关键词,⼤致顺序如:画⾯画⾯质量提⽰词画⾯主题内容⻛格相关艺术家其他细节)不过在模型中,每个词语本⾝⾃带的权重可能有所不同,如果模型训练集中较多地出现某种关键词,我们在提⽰词中只输⼊⼀个词就能极⼤地影响画⾯,反之如果模型训练集中较少地出现某种关键词,我们在提⽰词中可能输⼊很多个相关词汇都对画⾯的影响效果有限。提⽰词的顺序很重动漫⼀词就相对泛化,⼀动漫的画⻛。措辞越不抽象越好,尽可能避免留下解释空间的措辞。可以使⽤括号⼈⼯修改提⽰词的权重,⽅法如:将权重提倍将权重提倍*将权重降低⾄将权重提倍在提⽰词中使⽤字⾯字符))n=(n:)(n)=(n:)n=(n:)n=(n:)n=(n:)n=(n:。在不同的步数⽣成不⼀样的内容,譬如在某阶段后,绘制的主体由男⼈变成⼥⼈。语法为:后,将to处的提⽰词添加到提⽰[from::when]在指定数量的step后从提⽰中删除from处的提⽰词[from:to:when]在指定数量的step后将from处的提⽰词替换为to处的提⽰词将继续在之前的图像上计算将继续在之前的图像上计算a步之后提⽰词将被替换为它例如a在⼀开始,读⼊的提⽰词为will⼜例如,对于提⼜例如,对于提⽰词为:fantasylandscapewitha[mountain:lake:0.25]and[anoak:ainin⼀开始。提⽰词为withain步后,提⽰词为withainin步后,提⽰词为withainin步后,提⽰词为withain步后,提⽰词为withaandachristmastreeinbackgroundmasterful提⽰词还可以轮转,譬如ina在第⼀步时,提⽰词为ina在第⼆步时,提⽰词为ina在第三步时,提⽰词为inafield,以此类推。实际上,程序是将输⼊的形式传⼊模型进⾏计算的:awithain即。⼀个单词可能对应⼀⼀。提⽰词模板可参考|中优秀作品的提⽰词作为模板。类似的⽹站还有:|词图绘画资料管理⽹站标签超市标签超市魔咒百科词典魔咒百科词典词汇加速器魔导书魔导书魔导书鳖哲法典鳖哲法典|Controlnet允许通过线稿、动作识别、深度信息等对⽣成的图像进⾏控制。请注意,在使⽤的路径同步基本流程启⽤指预处理器,它将对输⼊的图像进⾏预处理。如果图像已经符合预处理后的结果,。譬如,图中导⼊需要的⻣选择即可。中调整的权重类似。⽤来控制图像⽣主导⽣成,这点与[:]语法类似。表⽰启动反⾊模式,如果输⼊的图⽚是⽩⾊背景,开启它。表⽰将输⼊的⾊中使⽤格式。如果输⼊的图是法线贴图,开启它。表⽰开启低显存优化,需要配合启动参数。表⽰⽆提⽰词模式,需要在设置中启⽤的引导。中请选择想要使⽤解析模型,应该与输⼊以为空,但模型不能为空。可⽤预处理/模型⽤于识别输⼊图像的边缘信息。⽤于识别输⼊图像的深度信息。⽤于识别输⼊图像的边缘信息,但边缘更柔和。⽤于识别输⼊图像的边缘信息,⼀种轻量级的边缘检测。它对横平竖直的线条⾮常敏感,因此更适⽤于于室内图的⽣成。⽤于识别输⼊图像的法线信息。⽤于识别输⼊图像的动作信息。插件可以⾃⾏修改姿势,导出到⽂⽣图或图⽣图。将输⼊图像作为线稿识别。如果线稿是⽩⾊背景,务必勾选识别输⼊图像的线稿,然后再将它作为线稿⽣成图像。识别输⼊图像各区域分别是什么类型的物品,再⽤此构图信息⽣成图像。如果想绘制⼀规范的图像,可以使⽤以下⾊表绘制。color_coding_semantic_segmentation_classes-Google表格合成的设置下,可以调整可的数量。模式下,结果会将输⼊的信息合并⽣成图像:8.模型讲解模型下载AIAI>>wiki|-模型安装下载模型后需要将之放置在指定的⽬录下,请注意,不同类型的模型应该拖放到不同的⽬录下。模型的类型可以通过StableDiffusion法术解析检测。⼤模型放模型⼀些⼤使⽤或models\VAE⽬录,然后在webui的设置栏⽬选择。模型放⽬录模型放⽬录模型使⽤⼤界⾯的左上⻆选择使⽤。⼀些模型会有触发词,即在提⽰词内输⼊相应的单词才会⽣效。//模型对⼈模型上附加使⽤界⾯启⽤下选择模型,并可调整权重。权重越⼤,该的影响也越⼤。不建议权重过⼤(否则很容易出现扭曲的结果。模型混合使⽤可以起到叠加效果,譬如⼀个控制⾯配合⼀个控制画⻛就可以⽣成具有特定画⻛的特定⼈物。因此可以使⽤多个专注于不同⽅⾯优化的Lora,分别调整权重,结合出⾃⼰想要实现的效果。模型是⼀模型的改进。LoCon模型也⼀种LORA模型的改进,泛化能⼒更强。对⼈物、画⻛都有调整效果的模型。在提⽰词中加⼊对应的关键词即可。⼤键词与⽂件名相同,譬如⼀个名为为的模型,触发它的关键词检索“SomeCharacter”。模型训练环境搭建以训练⾯板。therepositorytoexploitlinuxthetrainingtoIttheforkinthefollowinglink需要保证设备拥有Python3.10.6及git环境。⾸⾏命令,并回答。然后可以关闭该窗⼝。启动⼀窗⼝,在需要克隆该仓库的路径下,执⾏以下命令:11346在执⾏“accelerateconfig”后,它将询问⼀30系、40系显卡可选择安装CUDNN:环境更新如果需要更新仓库,请执⾏以下命令:界⾯启动在Powershell中执⾏:11.\gui.ps1双击gui.bat也可以。弹出以下界⾯后,直接访问URL即可。训练流程模型训练主要有三种结果⽋拟合,效果好,过拟合。⽋拟合模型完全没有从数据集中学习到经验,对各种输⼊都得出差距很⼤的结果。效果好模型不仅对训练集中的输⼊⾃训练集中的输⼊也有接近的效果。过拟合:模型只训练集中的输⼊有⾮常⾮常接近的结果,对不来⾃训练集中的输⼊给出差距很⼤的结果。准备训练集图⽚尽可能⾼清,⻛格统⼀但内容形式多样(譬如动作多样、服装多样)。样本数量可能影响到拟合结果。譬如让⼀个⼈学习英语,只给他⼏条例句去看,他可能什么都没学会【⽋拟合】譬如让⼀个⼈学习英语,只给他⼏条例句去看,他可能什么都没学会【⽋拟合】;给了它⼏⼗亿条例句去看,他可能只会根据别⼈说的话查字典⼀样回话,如果字典⾥没有就完全不会说了【过拟合】图⽚裁剪将训练集裁剪为多个尺⼨相同的图⽚。可以在SDwebui界⾯中⾃动裁剪,也可以⼿动裁切。⼀般使⽤的图⽚尺⼨⼨,尺⼨越⼤占⽤显存越⾼会越好。图⽚打标关键词⽣⻚⾯下打标:也可以在sdwebui的⻚⾯下打标:⽐较这⼏种不同的打标器的效果,在同⼀输⼊下:【本义:⼀个在铁匠铺⾥打铁的男铁匠】打标对图⽚的描述越准越好,如果条件允许,尝试⼈⼯打标。⽣成出的关键词中,我们需要把与训练⽬标强相关的关键词划为⼀个统⼀的特征表述。以为例,假如我们的训练对象就是⼀个男性⼤胡⼦,那么他必然始终携带着男⼈、胡⼦⽤⼀个词总结这个⻆⾊,例如⽤”Smith“替代”1boy,facialhair",整条句⼦将变为:以此类推,我们需要为⽬标绑定什么要素,就将它从关键词中删去。⽽类似于动作、背景这种与对象绑定关系不紧密,在⽇后⽣成图期间需要改变的,就保留在关键词中。⼀些具有同组关系的图⽚可以利⽤有三张图,分别是全图、背景、前景,那么我可以如此处理:正则化训练集中的每张图⽚通常能被分解为两⼤部分:“训练⽬标+其他要素”,依然以Smith为例:其中,”铁匠铺、打铁、铁匠“都是模型中已有的内容,称为“先验知识”。我们需要将这部分知识为指明,省去重新学习这部分内容的时间明确学习的⽬正则化通过降低模型的复杂性提⾼泛化能⼒。模型越复杂,模型的泛化能⼒越差,要达到相同的泛化能⼒,越复杂的模型需要的样本数量就越多,为了提⾼模型的泛化能⼒,需要正则化来限制模型复杂度。相对应,图⽚数量也要⼀集的情况和训练⽬的的不同来调整。同⼀张图⽚不允许在训练集和正则化中同时出现。⽂件路径组织在训练前,我们需要⽤特定的⽅式组织⽂件路径:譬如,训练⽬标是⼀群⼥孩,其中有⼀位名为sls的⼥孩好⼀位名为cpc的⼥孩,那么⽂件路径应该为:⽬录下放置的是训练集,命名规则是训练次数标识符类别表⽰的对象,她是⼀个⼥孩(类别),这个⽂次⽬录下放置的是正则化内容。命名规则是训练次数类别表⽰⽂件夹下的图⽚都是⼀个⼥孩,不重复使⽤数据。*需要⽇后补充训练参数在kohyawebui界⾯训练时,ckpt与lora训练⽅法类似。底模它表明我们此次训练将以哪个模型为基础进⾏训练。这个模型需要根据⾃⼰的需求选择。如果很明确⾃⼰的⽬标是属于某⼀⼤类下的分⽀,那么可以⽤接近这⼀⼤类的模型进⾏训练。譬如想训练⼀个⼆次元⻆⾊,那么可以使⽤⼆次元的底模(如进⾏训练。如果⾃⼰的像训练的⽬标需要⽐的泛化性,可以使模型,因为它包含的⼈物、物品、⻛最⼤resolution⽤于指定当前输⼊训练集图⽚的分辨率,请与⽂件夹内的保持⼀致。如果尺⼨不⼀会被裁切。在深度学习中,程序通过不断地将数据集在神经⽹络中往复传递来更新⽹络中的权重,以此建⽴对的增加,模型将从⽋拟合(右⼀,表⽰即便是来⾃于数据集中的输⼊,模型也很难达到它应该有的结果,类似于⾥在深度学习中,程序通过不断地将数据集在神经⽹络中往复传递来更新⽹络中的权重,以此建⽴对的增加,模型将从⽋拟合(右⼀,表⽰即便是来⾃于数据集中的输⼊,模型也很难达到它应该有的结果,类似于⾥的题都做不对的差⽣变为过拟合(左⼀,表⽰模型对于来⾃于数据集中的输⼊,总能精确地达到对应的对结果,但是如果输⼊⼀旦有些许偏差,⽐如输⼊⼀些不是训练集中的输⼊,那结果就会很差,类似于只会做题库⾥的题的书呆⼦。我们希望能达到中间的效果,即对训练集输出相对准确的结果,⼜对不在训练集⾥的输⼊也有较好的表现。这种特征就叫泛化。集,使⽤的都可能有所不同。因此,我们需要不少于⼀个才能建⽴起较好的拟合关系,当然也不能太多。对于不同的数据表⽰训练时的批量⼤⼩,也就是⼀次训练中选取的样本数量。这个参数对性能有⼀定要求,如果性能⾜在理论上会提⾼模型的准确性。如果数据集样本量较⼩可以等于样本数量,即把所有数据集⼀起输⼊⽹络进⾏训练,这样做的效果也很好但是如果样本量较⼤,这肯定让设备吃不消,因此需要减太⼩,那么意味着在⼀个Epoch中迭代的次数也会减⼩,训练时权重的调整速度变慢,为了抵消这种影响,还得提⾼epoch才能有更好的效果。所以BatchSize与Epoch参数⼆者是相辅相成的,他们⼆者的关系就好⽐⼀次刷多少题和总共刷多少次题。合适的batchsize应该让GPU正好满载运⾏。NN保存⼀次学习率指的是⼀次迭代(即输⼊⼀个样本对它学习,并⽤此次学习的经验调整神经⽹络)的步⻓。这个值越⼤,表明⼀次学习对模型的影响越⼤。为了让学习循序渐进,学习率不应该太⾼在训练中反复总结⼀达到⾜够低。瞎操作瞎操作”。学习率太低,容易出现局部最优解,类似于⼀个开⻋稀⾥糊涂地开完全程,⻋技很菜习率太⾼,容易使得模型不收敛,找不到解,类似于⼀个开⻋完全不会开⻋学习率调度器是⼀种⽤于动态调整学习率的技术,它可以在训练过程中根据模型的表现⾃动调整学习率,以提⾼模型的训练效果和泛化能⼒。通常,学习率在训练开始时设置为⽐较⾼⼀次训练中学得更多更快⾃适应学习率。恒定,学习率不变。恒定预热。学习率在开始会增⼤⼀点,然后退回原学习率不变。使⽤余弦函数来调整学习率,使其在训练过程中逐渐降低。常被称为余弦退⽕。余弦退⽕的基础上每过⼏个周期将进⾏⼀次重启,该值在选择后可以设定。线性。学习率线性下降。使⽤多项式函数来调整学习率。学习率预热⽐。⽤设定的学例如,假设我们在训练神经⽹络时设置了⼀。⽤设定的学例如,假设我们在训练神经⽹络时设置了⼀⽐的在训练神经⽹络时,我们需要在反向传播中逐步更新模型的权重参数。优化器的作⽤就是根据当前模型计算结果与⽬标的偏差,不断引导模型调整权重,使得偏差不断逼近最⼩。是推荐使⽤的优化器。⼀种常⽤的梯度下降算法,被⼴泛应⽤于神经⽹络模型的优化中。它结合了动量梯度下降和⾃适应学习率⽅法的优点,既可以加快收敛速度,⼜可以避免学习率调整不当导致的振荡和陷⼊局部最优解。并且对于不同的参数有不同的学习率,更加适⽤于⾼维度的参数空间。算法的改进⽅案,对惩罚项参数进⾏控制,能更好地控制模型的复杂度,防⽌模型过拟合,提⾼泛化性能。⽤,略微加快训练速度。⾃算法的改进⽅案,降低了显存占⽤1。⾃适应优化器,⽐梯度下降⽅法更加稳定有效、使⽤时请将学习率设置。⾃相⽐左右的加。⼀种常⽤的优化算法,基于梯度下降⽅法进⾏优化,通过引⼊动量的概念加速收敛速度。⽤,略微加快训练速度。j.TextEncoder与Unet机器不能直接识别⼈类的语⾔是⼀种⽤于将⽂本数据转换为机器可读形式的模型或算法。对于输⼊的⼀串提⽰词,程序会将它们分解为⼀个个标记输⼊⼀个通常代表着⼀个特征),这样⼀句话就能被转为⼀4Unet是⼀种⽤于图像分割的深度学习模型,它的作⽤是将图像分割为多个不同的构成部分。经过训练后,它可以来填充图像中缺失或损坏的部分,或者对灰度草图进⾏着⾊。5改进添加了额外训练TextEncoder6,在本⽂使改进添加了额外训练TextEncoder6,在本⽂使⽤的仓库中就沿⽤了这种改进。k.NetworkRank(Dimension)表⽰神经⽹络的维度,维度越⼤,模型的表达能⼒如果训,但还是要根据具体的训练⽬标来定,如果⽬标⽐较简单,就完全不需要太⾼。在神经⽹络中,每在神经⽹络中,每⼀层都由许多个神经元节点构成,它们纵横交错构成了⼀N维空间。维度越⼤,代表模型中就越多的神经元节点可以处理各种要素。当然,这也意味着模型⼤,也可能变得更容易过拟合,它可能需要更多的、更准确的数据集,更⼤⼤,也可能变得更容易过拟合,它可能需要更多的、更准确的数据集,更⼤的迭代次数。l.Network对模型过拟合的惩罚权重。它表⽰对模型在训练时出现完全拟合(即输出结果与样本⼀致)的权重,适当提⾼它可以增加模型的泛化能⼒(当然也不能太⾼)。⽬1参考。从学霸的答案从学霸的答案⾥获得参考)。举⼀个通俗的例⼦,⼀个学⽣在抄学霸的作业,为了不与学霸的结果完全相同,他需要对每个答案做⼀些⼩⼩的改动。对⽼师⽽⾔,⼀个完全照抄答案的学⽣约等于⼀个只会抄不会想的学⽣,⽽能稍作修改的学⽣说明还有对题⽬思考理解的能⼒。所以我们要稍微地“惩罚”那些只会照抄的学⽣,引导学⽣⾃⼰思考。因此这个值不能太低(完全不惩罚照抄),也不能太⾼(太⼤的惩罚让学渣完全不能Dropout是在深度学习中⼀种防⽌过拟合的技术,在训练中,可能模型会反复计算某些节点,随着训练的进⾏,这可能导致错误的路径依赖,即模型会变得总是依赖这些节点解决问题,就像某个学⽣碰巧刷到了⼏道解题⽅法相似的题⽬,就误认为所有的题⽬都要⽤这种解题⽅法。Dropout的解决⽅法是随机关闭某些神经元,迫使模型在训练时减少神经元之间的依赖关系,从⽽让神经⽹络的泛化能⼒更强。当然,在实际使⽤模型的时候,Dropout是关闭的。在训练中,我们也可以随机将⼀些训练集的标记n就剔除⼀些标记中,我们可以指定剔除⼏成的标记。中,模型得出的图⽚在亮度上总是很平均,亮的场景不够亮,暗的场景不够暗,⽽且⽤传统的训练⽅法也⽆7。⼀般输。通过NoiseOffset,我们可以让图像在亮和暗上的表现更加明显(右图)。xformersXformers是⼀个⽤于加快图像⽣成速度并减少显存占⽤的库。梯度检查点是⼀种在训练模型时减少显存占⽤的⽅法,但是会增加训练时⻓。它避免在训练期间⼀次计算所有权重,⽽是逐步计算权重,从⽽减少训练所需的显存量。关闭它不会影响模型的准确性,但打开它后我们可以使⽤更⼤。间实际上可能会更快。间实际上可能会更快。虽然单次训练的时⻓可能增加了我们单次训练的时⻓,但如果我们增⼤shufflecaption打开它,可以让训练时训练集的标签被打乱(Shuffle,洗牌)。如输⼊"铁匠铺,⼯⼈,打铁",可能被转换为”铁匠铺,打铁,⼯⼈“或”⼯⼈,铁匠铺,打铁“。这种操作通常⽤于增强模型对于不同⽂本顺序的鲁棒性,从⽽提⾼模型的泛化能⼒。打乱操作可以多次进⾏,从⽽更⼤程度地增加数据的随机性。在每⼀中,输⼊4在每⼀中,输⼊4会被当做排除集。会将4⾏打乱后,打标中的每⼀在⾜后,都将成为触发词。⽐较⻓,那么可以扩充⼀次输⼊。Clip是⼀个转换提⽰词为Token形式的神经⽹络,是模型理解⽂字的源头。它开启与否与底模有关。譬如,⼀些模型在第⼀层的神经⽹络将输⼊读取,传输给下⼀层⽹⼿阶段

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论