版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
StableDiffusionAI绘画实例教程1第1章StableDiffusion概述2
第2章StableDiffusion模型3
第3章
提示词工程4第4章StableDiffusion文生图5
第5章StableDiffusion图生图6
第6章ControlNet与热门扩展插件7
第7章AI绘画实践应用01第1章StableDiffusion概述目录CONTENTS11.1StableDiffusion简介21.2StableDiffusion应用领域31.3StableDiffusion的安装41.4StableDiffusion界面简介51.5
使用StableDiffusion生成一张图像61.6
本章小结1.1StableDiffusion简介StableDiffusion于2022年8月22日由StabilityAI正式发布,它基于慕尼黑路德维希马克西米利安大学CompVis小组的研究成果,结合了Transformer架构与扩散模型,是一种基于深度学习技术的模型,能够依据文本描述生成详细图像,即人们常说的“文生图”。当用户在文本框中输入一些文本提示词时,该模型能够生成与文本内容相匹配的图像作为输出。例如,打开StableDiffusion,在提示词文本框中仅仅输入“adog,(一只狗,)”这样简单的提示词,单击“生成”按钮后,软件即可生成图1-1所示的小狗图像。1.1StableDiffusion简介StableDiffusion3.5包括三个主要版本:
(1)Large版本:参数量为80亿,支持生成1百万像素及以上的高清图像,适合专业设计师或有高级绘画需求的用户。
(2)LargeTurbo版本:参数量与Large相近但做了精简,分辨率几乎和Large相同,生成速度更快,适合对生成速度要求高的用户。
(3)Medium版本:该版本于2024年10月29日发布,参数量为25亿,支持生成0.25百万像素到2百万像素的图像,适合计算机配置较低的用户。1.2.1艺术与设计领域(1)绘画与插画(2)平面设计1.2StableDiffusion应用领域1.2.2广告与营销领域(1)广告创意生成(2)社交媒体营销1.2StableDiffusion应用领域1.2.3游戏开发领域(1)游戏场景设计(2)角色与道具设计1.2StableDiffusion应用领域1.2.4影视与动画领域(1)影视前期概念设计(2)动画制作辅助1.2StableDiffusion应用领域1.2.5建筑设计领域(1)建筑风格探索(2)室内设计参考1.2StableDiffusion应用领域1.3StableDiffusion的安装1.3.1本地安装
首先需要检查自己的计算机配置是否符合安装条件。1.3.1.1安装流程1.3.1.2一键安装1.3.2云服务器部署1.4StableDiffusionWebUI界面简介
(1)模型选择区。用户可在模型选择区选择不同的StableDiffusion大模型以及外挂VAE模型。
(2)提示词编辑区。提示词编辑区主要有“文生图”、“图生图”选项卡共10来个之多,以及提示词及反向词输入文本框等,用户可选择相应的选项卡,进行适当的操作。
(3)参数调整区。参数调整区主要包含图像生成过程中所需调整的各项参数,如采样方法、迭代步数、图像尺寸、提示词引导系数等。
(4)图像预览与生成区。图像预览与生成区主要包括“生成”按钮和图像预览窗口,用户在执行完前述操作后,可通过单击“生成”按钮得到最终图像,并在图像预览区域实时预览所生成的图像。1.5使用StableDiffusion生成一张图像(1)选择大模型。
在“StableDiffusion模型”下拉菜单中选择“写实/majicmixRealistic_v7.safetensors[7c819b6d13]”大模型。(2)输入提示词。
在“提示词”文本框中输入“abeautifulbird”。(3)参数设置。
在参数面板中,设置“采样方法(Sampler)”为“DPM++2MKarras”,“迭代步数(Steps)”为30,“宽度”为512,“高度”为512。(4)生成图像。
单击“生成”按钮,生成小鸟图像。1.6本章小结
本章主要介绍了StableDiffusion的基本知识、主要应用领域、两种常用的安装方法、主要操作界面,最后通过一个实例,简要介绍了利用StableDiffusion进行AI绘画的基本流程。感谢观看02第2章StableDiffusion模型目录CONTENTS12.1StableDiffusion大模型下载2
2.2StableDiffusion中的模型种类3
2.3StableDiffusion大模型介绍42.4本章小结2.1StableDiffusion大模型下载2.1.1使用绘世启动器下载大模型2.1.2在第三方模型网站下载大模型2.2StableDiffusion中的模型种类在StableDiffusion中,目前共有5种不同类型的模型,分别为Checkpoint、Embedding、Hypernetwork、Lora和VAE。根据模型功能,可将这5种模型分为以下三大类:(1)基础底模型。基础底模型就是大模型,又称为主模型或底模,Checkpoint模型就属于此类。StableDiffusion主要是基于它来生成各种图像。(2)辅助模型。辅助模型是建立在大模型基础上的,它可以对大模型进行微调,不能单独使用。辅助模型包括Embedding、Hypernetwork和Lora这三种模型。(3)美化模型。美化模型,顾名思义就是用来对模型进行美化的,是更细节化的处理方式,如优化图片色调或添加滤镜效果等。VAE模型属于此类。2.2StableDiffusion中的模型种类2.2.1Checkpoint大模型:生成基本图像在StableDiffusion中,Checkpoint是指那些经过训练以生成高质量、多样性和创新性图像为目的的深度学习模型,这些模型通常由大型训练数据集和复杂的神经网络结构组成,能够生成各种风格和类型的图像。Checkpoint的中文意思是“检查点”,之所以如此命名,是因为在模型训练到关键位置时,会将其存档,如此可方便后续的调用和回滚操作。Checkpoint大模型在StableDiffusion中起着至关重要的作用,利用不同类型的大模型,可以生成各式各样不同风格的图像。除了能以输入提示词的方式直接生成图像外,大模型还可以通过反推提示词的方式实现以图生图的功能。StableDiffusion生成的图像质量好不好,归根结底就在于用户的Checkpoint大模型选用得好不好,因此用户要选择合适的大模型去生图。即使完全相同的提示词,如果选用的大模型不相同,那么生成的图像风格差异将会很大。2.2StableDiffusion中的模型种类2.2.1Checkpoint大模型:生成基本图像2.2StableDiffusion中的模型种类2.2.2Embedding模型:微调图像虽然Checkpoint大模型包含大量的数据信息,但其动辄几个G字节的文件包使其使用起来不够轻便。很多时候,用户只需一个能体现人物特征的模型来使用,但如果每次都要对整个神经网络的参数进行微调,操作起来未免过于烦琐,此时,Embedding模型便可派上用场。例如,如果想避免图像中出现人物手部画错、脸部变形等问题,就可以调用Embedding模型来解决。Embedding模型普遍都非常小,有的只有几十K字节,因为它本身并没有存储很多信息,只是将所需的元素信息提取出来进行标注。需注意的是,Embedding模型也有一定的局限性,由于它没有改变主模型的权重参数,因此它很难教会主模型去绘制没有见过的图像内容,也很难改变图像的整体风格,而是通常用来固定人物角色或画面内容的特征。著名的“EastNegative”就是一种Embedding模型,它可以有效提升画面的精细度,可以避免模糊、灰色调、手部画错、面部扭曲等问题,图2-13所示为使用“EastNegative”模型前后的效果对比。2.2StableDiffusion中的模型种类2.2.2Embedding模型:微调图像2.2StableDiffusion中的模型种类2.2.3Hypernetwork模型:转换风格Hypernetwork(又称Hypernetworks)的中文名为超网络,是一种神经网络架构,它可以动态生成神经网络的参数权重,简言之,它可以生成神经网络。Hypernetwork模型的功能与Embedding、Lora类似,都是对StableDiffusion生成的图像进行针对性调整,但Hypernetwork模型的应用领域较窄,主要用于画风转换,而且训练难度很大,目前在很大程度上已被后出现的Lora所替代,用户也可将Hypernetwork模型理解为低配版的Lora。图2-15所示为经Hypernetwork模型转换前后的图像对比。2.2StableDiffusion中的模型种类2.2.4LoRA模型:固定画风LoRA的全称为Low-RankAdaptationofLargeLanguageModels(大型语言模型的低阶适应),LoRA取的就是Low-RankAdaptation这几个单词的开头。LoRA最初应用于大型语言模型,由于其直接对大模型进行微调时,不仅成本高,而且速度慢,再加上大模型体积庞大,因此性价比很低。LoRA通过冻结原始大模型,并在外部创建一个小型插件来进行微调,从而避免了直接修改原始大模型,这种方法不仅成本低而且速度快,另外插件式的特点使它非常易于使用。LoRA在绘画大模型上表现非常出色,固定画风或人物样式的能力非常强大。只要是图片上的特征,LoRA都可以提取并训练,其作用包括对人物脸部特征进行复刻、生成某一特定风格的图像、固定动作特征等,因此,LoRA的应用范围逐渐扩大,并迅速成为一种流行的AI绘画技术。在LoRA模型的提示词中,可以对其权重值进行设置。需注意的是,LoRA模型的权重值尽量不要超过1,否则容易导致很差的生图效果。大部分单个LoRA模型的权重值设置为0.6~0.9时,便能够提高出图质量。如果只想有一点点V模型的元素或风格,则权重值设置为0.3~0.6即可。图2-16所示为应用LoRA模型的前后对比图。2.2StableDiffusion中的模型种类2.2.4LoRA模型:固定画风2.2StableDiffusion中的模型种类2.2.5VAE模型:修复图像VAE(VariationalAuto-Encoder,变分自编码器)是一种生成模型,是自编码器(Autoencoder)的一种变体。它主要由编码器(Encoder)和解码器(Decoder)两部分构成。作为Checkpoint大模型的一部分,VAE模型并不像前面介绍的几种模型那样可以很好地控制图像内容,它主要是对大模型生成的图像进行修复。图2-19所示为应用VAE模型的前后对比图。从图2中可看出,使用VAE之后,画面就像是加了调色滤镜一样,整体的色彩饱和度更高,光影层次感更强。2.3StableDiffusion大模型介绍2.3.1基础大模型基础大模型通常具有广泛的适用性和强大的AI绘画性能,适合初学者和需要快速获取结果的用户使用。使用最普遍的基础大模型是SD系列,如SD-v1-5、SD-v2(分别对应1.5和2.0版本)、SDXL等,这些都是StableDiffusion自带的大模型。如果用户想自己训练大模型,SD系列也是一个很好的起点,因为它们涵盖了各种绘画风格。2.3StableDiffusion大模型介绍2.3.2二次元模型二次元模型可以提供可爱和卡通化的绘图效果,以下是几种常用的二次元模型。(1)Anything系列。Anything系列是一个以二次元漫画风格为主的大模型,该系列有多个版本,包括Anything-V3.5、Anything-V4.0、Anything-V4.5和Anything-V5.0等,每个版本下还有各种变形版本和精简版本。需注意的是,Anything系列出图效果好,并且对提示词的要求不太高,但风格较为单一。(2)Counterfeit系列。Counterfeit系列是一种明亮、清晰的动漫风格模型,图像的色彩饱和度高,而且人物角色更加形象。(3)Mix系列。Mix系列是一种二次元混合模型,融合了多个二次元模型,实际使用效果不错,给人一种优雅、精致的感觉,而且对提示词的要求不高。(4)Niji-动漫二次元模型。Niji-动漫二次元模型广泛应用于二次元创作领域,包括插画、漫画、游戏角色设计、虚拟偶像等。该模型具有风格统一、人物可爱和风格多样性等特点。2.3StableDiffusion大模型介绍2.3.3写实类模型写实类模型能提供更加细腻和逼真的细节,常用的写实类模型:(1)OnlyRealistic系列。OnlyRealistic系列模型是StableDiffusion中的一类超高清真人写实模型,它基于东方美学创建,开发者希望该模型能在美学与现实主义之间取得平衡。该系列模型能够生成高度逼真的人物形象,在人物面部细节等方面都有很好的表现,可以很好地还原各种人物特征和场景细节,使生成的图像仿佛是真实拍摄的照片,效果如图2-24(a)所示。(2)majicMIX系列。MajicMIX系列模型是StableDiffusion中的一类重要模型,它由Prompthero开发维护,可根据输入的文本提示生成新的图像,其子系列主要包括majicMIXrealistic(麦橘写实)、majicMIXlux(麦橘奇幻)、majicMIXsombre(麦橘唯美)、majicMIXfantasy(麦橘幻想)和majicMIXreverie(麦橘梦幻)等。其中的majicMIXrealistic(麦橘写实)模型生成的图像具有真实度高、光影感强、适应性广等特点,深受广大用户欢迎,如图2-24(b)所示。2.3StableDiffusion大模型介绍2.3.42.5D数绘模型2.5D数绘模型采用了一种独特的视觉表现形式,可将二维图像的细腻与三维图像的立体感完美融合。这种模型以简洁明了的线条和色彩构建出层次丰富、空间感强烈的画面,呈现出极强的视觉冲击力。2.5D数绘模型在游戏、动画、插画等AI绘画领域都有广泛的应用,为用户提供了全新的创作思路和表达方式。以下介绍两种常用的2.5D数绘模型。(1)RevAnimated系列。RevAnimated系列模型为东方审美2.5D风格,比平面图像更具立体感,比立体图像更扁平化,介于真实与虚幻之间,出图效果亦真亦幻,能够呈现出生动且具有情感的艺术形象,使得图像的细节更加精细,效果如图2-25(a)所示。(2)元气动漫系列。元气动漫_2D_2.5D系列模型用于生成2D或2.5D风格的动漫图像,它结合了2D和2.5D的特点,既保留了2D动漫的简洁线条和鲜明色彩等传统风格,又融入了2.5D的立体感和空间感,使生成的图像更加生动、富有层次,在人物塑造、场景搭建等方面更具表现力,效果如图2-25(b)所示。2.3StableDiffusion大模型介绍2.3.5特定风格模型两种常用的特定风格模型。(1)SHMILY系列。SHMILY系列模型一般以生成具有独特情感氛围和艺术风格的图像为主,其图像带有浪漫、温馨、梦幻等情感色彩,同时融合了多种动漫、插画等艺术风格元素,使生成的画面富有想象力和艺术感染力,效果如图2-26(a)所示。(2)X潮玩系列。X潮玩系列模型是专门用于生成具有潮玩风格图像的模型,该系列模型能够精准地捕捉潮玩的独特风格,将潮流文化与玩具设计元素相融合,生成色彩鲜艳、造型夸张、富有创意的潮玩形象,具有强烈的时代感和吸引力,效果如图2-26(b)所示。2.4本章小结
本章主要介绍了StableDiffusion中的模型,包括大模型下载的两种途径;Checkpoint、Embedding、Hypernetwork、Lora和VAE这5种模型的特征及应用;最常用的几类大模型如基础大模型、二次元模型、写实类模型、2.5D数绘模型和特定风格模型。感谢观看03第3章
提示词工程目录CONTENTS13.1提示词用法2
3.2提示词语法33.3提示词反推技巧43.4提示词矩阵53.5本章小结3.1提示词用法3.1.1提示词类型
(1)正向提示词(Prompt)
正向提示词又称为提示词,是用户输入的用于引导大模型生成符合期望的图像内容的文字描述。它是告诉模型“要生成什么样的图像”的关键指令。正向提示词直接决定了生成图像的大致方向和特征,准确详细的提示词能使生成的图像更加符合用户的期望。
(2)反向提示词(NegativePrompt)
反向提示词又称为反向词,是与正向提示词相对应的一种指令。它主要用于告诉模型不希望在生成的图像中出现哪些内容。通过使用反向提示词,可以对生成图像的质量和内容进行更加精细的控制,以避免生成不符合预期的、有瑕疵的或者不想要的元素。
反向提示词通常包含的内容有以下几方面:①与图像质量相关的。②不想要的物体或元素。③不适当的风格或表现形式。3.1提示词用法3.1.2提示词构成元素
(1)单词标签(wordtags)。
单词标签即在提示词输入框中输入一个个独立的英文单词。
(2)自然语言(naturallanguage)。
自然语言即人们日常交流时所使用的语言,在AI绘画中,用户可使用描述完整的句子来作为提示词。
(3)Emoji字符和颜文字。Emoji字符和颜文字是用于表达情感和意图的字符,由于其字符简洁且易于理解,因此也可以作为提示词的一种。
(4)标点符号(punctuation)。StableDiffusion中用到的标点符号主要有:逗号(,)、大括号{}、圆括号()、方括号[]和冒号(:)。
①逗号:逗号用于分隔两个或多个词语或句子。
②大括号{},圆括号(),方括号[]:主要用来调节提示词的权重,具体用法参见3.2.1节。
③冒号:冒号用于表示后面的语句是前面语句的扩展或补充,如(tree:1.5)表示tree的权重是1.5。3.1提示词用法
3.1.3提示词输入规则
在StableDiffusion中,提示词输入需要注意以下规则:
(1)尽量使用英文提示词。
(2)不需要严格遵循英文语法,以关键词组的形式输入,使用英文逗号分割。
(3)除特定语法外,大部分情况下字母大小写和断行不会对画面内容产生影响。
(4)提示词输入有75个token的限制,这里的75个token并非指75个英文单词,是否超标可参考提示词文本框的提示。
(5)提示词并非越多越好,过多的提示词可能会导致AI模型理解时的语义冲突。3.1提示词用法3.1.4提示词套用公式
提示词书写公式,即“主体+场景+风格+细节+(正向情感)-(反向元素)”:(1)主体:明确图像的核心对象,比如是人物、动物、物体还是建筑等。例如“一个穿着华丽连衣裙的少女”。(2)场景:描述主体所处的环境,像“站在铺满花瓣的花园小径上”。(3)风格:指定图像的艺术风格,例如“画面风格是印象派油画”。(4)细节:增添能让图像更生动的细节,如“少女手中拿着一把蕾丝边的阳伞,阳伞上有精致的花朵图案”。(5)正向情感:如果想要营造特定的情感氛围,可以添加这部分,比如“面带微笑,充满喜悦的氛围”等。(6)反向元素:考虑不希望出现的元素,用负号表示,如“背景中的电线杆和现代设施”。
需注意的是,这个公式只是一个参考框架,实际使用时可以根据具体需求灵活调整和组合。3.1提示词用法图3-1提示词示例效果3.2提示词语法3.2.1强调关键词语法
提示词的权重与其先后顺序有关,越靠前的提示词,其影响程度越大。通常用户会先描述整体画风,再描述局部画面,最后控制光影效果。然而,如果不对提示词中的个别元素进行控制,只是简单地堆砌关键词,权重效果通常并不明显,因此,需要使用语法来更加精细地控制图像的输出效果。
强调关键词就是StableDiffusion中一种非常重要的语法格式。通过使用特定的语法结构,如圆括号()、方括号[]和大括号{},可以调整关键词的权重,从而影响AI在生成图像时对特定元素的重视程度,具体使用如下:(1)圆括号():使用圆括号时,表示将括号内的提示词权重乘以1.1。(2)方括号[]:使用方括号时,表示将括号内的提示词权重除以1.1。(3)大括号{}:使用大括号时,表示将括号内的提示词权重乘以1.05,不过大括号较少使用。
圆括号有两种表达方式:一种是直接在关键词外加上圆括号,如(chinesestyle),表示该关键词权重提升为原来的1.1倍;另一种是在圆括号内直接写上权重提升系数,如(chinesestyle:1.1),表示的也是该关键词权重提升为原来的1.1倍。而方括号和大括号的表达方式只有一种,即直接加上相应括号,如[chinesestyle]或{chinesestyle}。3.2提示词语法3.2提示词语法3.2.2分步绘制语法
分步绘制又称为渐变绘制,该语法的原理是通过参数来控制整个图像生成过程中用于维持特定关键词的步数占比。
语法格式为[from:to:when],使用when来控制画面中不同元素的融合比例。When小于1时,表示A关键词在迭代总步数中所占的百分比;When大于1时,则表示在前面多少步时作为A渲染,之后则作为B渲染。
例如,[desert:forest:0.2],表示前面20%的步骤画沙漠,后面80%步骤画森林。3.2提示词语法3.2.3融合语法
融合语法会将提示词中的前后元素特征关联起来,最终呈现出融合图像的特征。它通过将不同的关键词以特定的方式组合在一起,从而实现更复杂的图像效果。
融合语法的格式为:AANDB,注意AND必须大写。也可写为A|B,即表示两个元素会交替出现,达到融合的效果。融合语法也支持加权,如(A:1.3)|(B:1.2),加权时无须考虑两个元素之间的权重之和是否等于100%。3.2提示词语法3.2.4打断语法AI模型在运行过程中,有时会出现前后某些关键词相互影响的情况,这种现象被称为“污染”,打断语法则可以减少这种“污染”。打断语法指的是用BREAK(打断)断开前后提示词之间的关系,从而在一定程度上减少提示词之间相互干扰的情况。添加了打断语法后,AI模型会将前后断开的内容视为两段话来理解。
打断语法的格式:提示词1BREAK提示词2。图3-5(a)中提示词为“agirl,blackponytail,standingposture,whiteshirt,redtie,bluejeans,”,会发现,红色领带被蓝色裤子“污染”成了黑色。图3-5(b)中提示词为“agirl,blackponytail,standingposture,whiteshirt,redtieBREAKbluejeans,”可看到,在“BREAK”打断语法的帮助下,“污染”问题得到了解决。3.2提示词语法3.2.5交替绘制语法
交替绘制语法也可以实现关键词融合的效果,使用该语法后,AI模型将在多个关键词之间进行交替运算并绘制图像。
交替绘制语法的语法结构为[A|B|…]。
使用交替绘制语法绘制图像时,系统每次只能理解单独的关键词,而不是将前后关键词一起理解,因此,最终效果只能融合视觉特征,而无法针对颜色等信息进行融合。通常情况下,交替绘制语法多用于绘制奇幻、魔幻等风格的图像。
图3-6为使用交替绘制语法“[chicken|duckling]”生成的“小鸡和小鸭的混合生物”。3.3提示词反推技巧3.3.1使用CLIP反推提示词CLIP反推提示词是根据用户在图生图页面中上传的图片,使用自然语言来描述图片信息。由于CLIP已经学习了大量的图像和文本,因此可以生成相对准确的文本描述。
整体来看,CLIP喜欢反推自然语言风格的长句子提示词,这种提示词对AI的控制力度较差,但是大体的画面内容基本一致,只是风格变换较大。
图3-7所示为使用CLIP反推提示词前后效果图对比。3.3提示词反推技巧3.3.2使用DeepBooru反推提示词DeepBooru更擅长用单个关键词堆砌的方式,反推出的提示词相对来说会更完整,但出图效果有待优化。具体操作步骤如下:
(1)用“DeepBooru反推”反推提示词。进入“图生图”页面,上传图3-10(a)所示的原图,单击“生成”按钮下方的“DeepBooru反推”按钮,即可反推出原图的提示词。
(2)生成新图像。将以上反推出的提示词复制到“文生图”页面的提示词输入框中,设置生成参数,单击“生成”按钮,生成的图像效果如图3-10(b)所示。3.3提示词反推技巧3.3.3使用WD1.4标签器反推提示词WD1.4标签器(Tagger)是一款优秀的提示词反推插件,其精准度比DeepBooru更高,操作步骤如下:
(1)用“WD1.4标签器”反推提示词。单击“WD1.4标签器”选项卡,进入其页面,上传图3-12(a)所示的原始图像,单击图片下方的“反推图像”按钮,Tagger将自动反推提示词,并显示在右侧的标签文本框中。
(2)生成新图像。单击“发送到文生图”按钮,在“文生图”页面,系统会在提示词文本框中自动填入反推出来的提示词,参数设置与3.3.1中相同,单击“生成”按钮,即可生成相应的图像,效果如图3-12(b)所示。3.4提示词矩阵
有些情况下,一些模型在利用某些特定提示词时表现出色,然而在更换模型后,这些提示词可能就无法使用;还有些情况下,删除某些看似无用的提示词后,图像的呈现效果会变得异常,但用户又不清楚问题出在何处。此时,用户就可使用提示词矩阵(Promptmatrix)来深入探究其原因。
提示词矩阵(Promptmatrix)用于比较不同提示词交替使用时对于图片生成效果的影响,提示词之间以“|”作为分割点,可以让软件自动生成不同提示词组合的结果。在提示词矩阵(Promptmatrix)中,前面的提示词会被用在每一张图上,而后面被“|”分割的两个提示词,则会被当成提示词矩阵(Promptmatrix),交错添加在最终生成图上。3.4提示词矩阵
例如,给定提示词“acat|whitehair|blackeyes(一只猫|白毛|黑眼珠)”,会生成四种可能的组合,即“acat”“acat,whitehair”“acat,blackeyes”“acat,whitehair,blackeyes”,并以此顺序生成四张图片,如图3-14所示。通过这种工具,用户就可以快速对比不同提示词组合对生成图片的影响,帮助找到最符合预期的提示词搭配。3.5本章小结
本章介绍了StableDiffusion中提示词的用法。首先介绍了提示词类型、构成元素、输入规则和套用公式;接着介绍了提示词语法,包括强调关键词语法、分步绘制语法、融合语法、打断语法和交替绘制语法;然后介绍了提示词反推的三种工具:CLIP、DeepBooru和WD1.4标签器;最后介绍了提示词矩阵的应用。感谢观看04第4章StableDiffusion文生图目录CONTENTS14.1StableDiffusion常用采样方法2
4.2StableDiffusion文生图基本参数3
4.3文生图实例44.4本章小结4.1StableDiffusion常用采样方法
采样方法(Sampler)是对图片执行去噪,每种采样方法对图片的去噪方式不同,随之生成的图像风格也就不同。StableDiffusion中提供了30多种采样方法,以下简要总结常见采样方法的特点:(1)速度快:Euler系列、LMS系列、DPM++2M、DPMfast、DPM++2MKarras、DDIM系列。(2)质量高:Heun、PLMS、DPM++系列。(3)标签(tag)利用率高:DPM2系列、Euler系列。(4)动画风:LMS系列、Euler系列、UniPC。(5)写实风:DPM2系列、DPM++系列。
采样方法为StableDiffusion生成模型提供了更加真实、可靠的随机采样功能,从而可以生成更加逼真的图像效果。StableDiffusion中最常用的采样方法有3种,分别为Eulera、DPM++2MKarras和DDIM,以下将分别进行介绍。4.1StableDiffusion常用采样方法4.1.1Eulera采样方法Eulera是一种基于欧拉插值技术的采样方法,其中a代表“原始”,强调这种方法在保持原始数据的完整性和真实性方面具有优势。Eulera的采样生成速度最快,但在生成高细节图像并增加迭代步数时,会产生不可控的突变,如人物脸部扭曲、细节扭曲等。Eulera采样方法适合生成ICON(图标)、二次元图像或小场景的画面。
图4-1即为利用Eulera采样方法生成。本例中,大模型为“二次元/niji-动漫二次元_3.0.safetensors”;提示词为“agirl,snowwhite(一个女孩,白雪),”;采样方法为“Eulera”;“迭代步数”为30;图像“宽度”为768,“高度”为512,其他参数采用默认值。图4-1Eulera采样方法生成效果4.1StableDiffusion常用采样方法4.1.2DPM++2MKarras采样方法DPM++2MKarras采样方法可以生成高质量图像,适合生成写实人像或刻画复杂场景,而且迭代步数越高,细节刻画效果越好。使用DPM++2MKarras采样方法生成图片时,不仅生成速度快,而且出图效果好,因此得到广泛应用。
图4-2所示即为利用DPM++2MKarras采样方法所生成。本例中,大模型为“万享XL_超写实摄影V8.2_V8.2.safetensors”;提示词为“achinesegirlinawhitedress,autumn,(一个穿着白色衣裙的中国女孩,秋季),”;反向词选择“经典反向提示词”;采样方法为“DPM++2MKarras”;“迭代步数”为30;图像“宽度”为768,“高度”为512;启用“AfterDetailer”进行人物脸部修复,模型选择“mediapipe_face_full”;其他参数采用默认值。图4-2DPM++2MKarras采样方法生成效果4.1StableDiffusion常用采样方法4.1.3DDIM采样方法DDIM是一种官方采样方法,它使用去噪后的图像来近似最终图像,并利用噪声预测器估计的噪声来近似图像方向(内容或结构)。DDIM旨在通过引入噪声来增加图像的真实感和细节,同时保持图像的整体结构和纹理。DDIM比其他采样方法具有更高的效率,而且随着迭代步数的增加,可以叠加生成更多的细节。
图4-3为利用DDIM采样方法所生成。本例中,大模型为“写实/majicmixRealistic_v7.safetensors[7c819b6d13]”;提示词为“lake,mountain,tree,(湖,山,树),”;反向词为“经典反向提示词”;采样方法为“DDIM”;“迭代步数”为30;图像“宽度”为768,“高度”为512;其他参数采用默认值。图4-3DDIM采样方法生成效果4.2StableDiffusion文生图基本参数4.2.1迭代步数(Steps)
“迭代步数(Steps)”指输出画面需要的步数,其作用可以理解为控制生成图像的精细程度,其数值越高,生成的图像细节越丰富越精细,与之相应地,图像生成时间也随之增加;反之亦然。
一般而言,“迭代步数(Steps)”数值设置在18~30即可达到较好的图像效果。如果数值设置得过低,可能会导致图像生成不完整,关键细节无法呈现;而过高的“迭代步数(Steps)”则会大幅增加图像的生成时间,因此可根据实际情况选择适当的“迭代步数(Steps)”。4.2StableDiffusion文生图基本参数4.2.2高分辨率修复(Hires.fix)
“高分辨率修复(Hires.fix)”是指首先以较小的分辨率生成初步图像,接着放大图像,达到在不更改构图的情况下提升图像细节效果的目的。对于显存较小的显卡,可使用该功能。
“高分辨率修复(Hires.fix)”的主要设置参数如下:
(1)放大算法。StableDiffusion提供了二十多种放大算法,其中最常用的是“R-ESRGAN4x+Anime6B”放大算法,这是一种基于超分辨率技术的图像增强算法,主要用于提高图像的质量和清晰度。
(2)放大倍数。“放大倍数”指的是图像被放大的比例。StableDiffusion会依据用户设置的“宽度”和“高度”尺寸,并按照“放大倍数”进行等比例放大。4.2StableDiffusion文生图基本参数
(3)高分迭代步数。“高分迭代步数”指的是在提高图像分辨率时,算法需要迭代的次数。如果设置为0,则将使用与“迭代步数(Steps)”相同的值。通常情况下,建议将其设置为0或尽量小于“迭代步数(Steps)”的值。
(4)重绘幅度。“重绘幅度”指的是在进行图像生成时,需要添加的噪声程度。该值为0时,不进行任何重绘操作;该值为1时,将会生成与原图完全不相关的图像。通常在重绘幅度为0.5时,会对图像的颜色和光影产生显著影响;而在重绘幅度为0.75时,甚至会改变图像的结构和人物姿态。系统默认的重绘幅度值为0.7,一般采用默认值。4.2StableDiffusion文生图基本参数
图4-5为高分辨率修复前后的图像效果对比图,图4-5(a)为高分辨率修复前的效果,图4-5(b)为高分辨率修复后的效果,本例中,放大算法为“R-ESRGAN4x+Anime6B”,“放大倍数”为2,“高分迭代步数”为0,“重绘幅度”为0。4.2StableDiffusion文生图基本参数4.2.3图像尺寸
图像尺寸即分辨率,是指图像宽度和高度的像素数量。该数值越高,图像细节表现就越细腻,视觉效果也就越好。
系统默认的“宽度”和“高度”尺寸均为512,通常情况下,对于8GB显存的显卡,图像尺寸尽量设置为512×512,因为太小的画面无法描绘好,太大的画面则会“爆显存”,即画面数据量超过了显存容量,导致画面出现错误甚至出现系统崩溃等情况。而对于8GB以上显存的显卡,则可以适当调高分辨率。
在“宽度”后有一个“Off”按钮,单击该按钮后,会弹出一个下拉框,其中列出了宽高比,如1:1、2:3、3:4、4:5、9:16等,用户可根据需要设置相应的宽高比,如图4-6所示。图4-6宽高比设置4.2StableDiffusion文生图基本参数4.2.4出图批次StableDiffusion中的“出图批次”设置包括“总批次数”和“单批数量”两个选项。“总批次数”就是显卡在绘制多张图像时,按照一张接一张的顺序进行绘制,“总批次数”最大可设置为6;“单批数量”就是显卡同时绘制多张图像,绘画效果通常比较差。
如果计算机显卡配置比较高,可使用“单批数量”方式出图,速度会更快,同时也能保证一定的画面效果;否则,就增加“总批次数”,每一批只生成一张图片,这样在硬件资源有限的情况下,可以让AI尽量画好每张图。4.2StableDiffusion文生图基本参数
图4-7为“总批次数”为2,“单批数量”为1的生成效果;图4-8为“总批次数”为1,“单批数量”为2的生成效果。通过比较可看出,“单批数量”为2时,同批次中图片差异较小,同时出图效果也较差。图4-7“总批次数”为2、“单批数量”为1的生成效果图4-8“总批次数”为1、“单批数量”为2的生成效果4.2StableDiffusion文生图基本参数4.2.5提示词引导系数(CFGScale)
“提示词引导系数(CFGScale)”主要用来调节提示词对AI绘画效果的引导程度,其参数范围为0~30,数值较高时,绘制的图片会比较符合提示词的要求。该参数值建议设置为7~12范围内,过低的参数值会导致图像的色彩饱和度降低;而过高的参数值则会产生粗糙的线条或过度锐化的图像细节,甚至可能导致图像严重失真。系统默认值为7。
图4-9为提示词引导系数(CFGScale)分别为2.0、7.0、20.0时的生图效果。4.2StableDiffusion文生图基本参数4.2.6随机数种子(Seed)
在StableDiffusion中,“随机数种子(Seed)”可理解为每个图像的唯一编码,它能够帮助用户复制和调整生成的图像效果。用户在绘图时,若发现有合适的图像,就可以复制并锁定图像的随机数种子,让后续生成的图像更加符合自己的需求。
“随机数种子(Seed)”默认值为-1,表示随机生成图像效果。单击“生成”时,每次生成的图像都会随机生成一个新的种子,单击“随机数种子(Seed)”下方的绿色小按钮,系统即可自动将当前选中图像的随机数种子填入左侧的文本框中,如图4-10所示。4.2StableDiffusion文生图基本参数图4-11(a)为用二次元大模型生成的一幅图片,将其种子数固定后,对其进行“高分辨率修复(Hires.fix)”放大,“放大倍数”为2,并启用
“AfterDetailer”的面部修复功能后,得到
图4-11(b)所示效果。4.3文生图实例(1)确定大模型。
在“StableDiffusion模型”下拉菜单中选择一个写实风格的大模型“写实/TWing_shadow光影摄影V20.safetensors[e8ff1e8128]”。
(2)输入提示词。
在“提示词”文本框中输入英文提示词“nohumans,whitelilies,leaf,whiteceramicvase,stilllife,painting,watercolor,”;反向词选择为“经典反向提示词”。(3)参数设置。
在参数面板中,选择“采样方法”为“DPM++2MKarras”,设置“迭代步数(Steps)”为30,“宽度”为512,“高度”为768。
(4)生成并放大图像。
单击“生成”按钮,即可生成相应图像。接着展开“高分辨率修复”选项区,设置“放大算法”为Latent,“放大倍数”为2,其他参数默认,再次单击“生成”按钮,即可生成一幅唯美高清的静物图像。4.4本章小结
本章首先介绍了StableDiffusion中最常用的三种采样方法:Eulera、DPM++2MKarras和DDIM;接着介绍了StableDiffusion文生图常用参数,如迭代步数(Steps)、高分辨率修复(Hires.fix)、图像尺寸、出图批次、提示词引导系数(CFGScale)、随机数种子(Seed)等的含义及应用;最后通过一个实例练习,介绍如何应用文生图功能完成一幅基本的AI绘画作品。感谢观看05第5章StableDiffusion图生图目录CONTENTS15.1图生图概述2
5.2图生图主要模式3
5.3图生图实例45.4本章小结5.1图生图概述5.1.1图生图界面StableDiffusion的图生图功能允许用户输入一张图片,并通过添加文本描述的方法输出修改后的新图片。可以将图生图简单理解为文生图的升级版。在文生图模式下,StableDiffusion全部使用文字描述生成图片;而在图生图模式下,StableDiffusion使用“提示词+参考图”共同生成图片。
打开StableDiffusion软件,单击“图生图”标签,即可进入“图生图”模式,如图5-1所示。5.1图生图概述5.1.2缩放模式
当用户上传的参考图尺寸与设置的新图尺寸不一致时,可以通过“缩放模式”来选择图片处理模式,以使出图效果更加合理。4种缩放模式:(1)“仅调整大小”模式。(2)“裁剪后缩放”模式。(3)“缩放后填充空白”模式。(4)“调整大小(潜空间放大)”模式。图5-3转换前的图片5.1图生图概述5.1.3“重绘幅度”参数
“重绘幅度”参数主要用于控制在图生图过程中重新绘制图像时的强度,较小的参数值会生成较为柔和、逐渐变化的图像效果;而较大的参数值则会产生变化更加强烈的图像效果。
当重绘幅度值低于0.5时,新图比较接近于原图;当重绘幅度值超过0.7时,AI的自由创作力度就会变大。因此,用户可根据实际需要调整“重绘幅度”数值,以达到预想的特定效果。5.1图生图概述5.1.4图生图应用
图生图常见的使用场景有:动漫转真人或真人转动漫;人物换装、换脸、换背景;线稿转动漫;宠物转动漫等。图5-6为动漫转真人的生成效果。5.2图生图主要模式5.2.1“图生图”模式
打开StableDiffusion软件,单击“图生图”标签,系统默认打开的是下方“生成”面板中的“图生图”选项卡,用户即可利用“图生图”模式进行AI绘画,其操作步骤主要如下:(1)上传参考图。
选择“图生图”选项卡,二级选项卡也选择“图生图”,拖曳一张图片,将其上传到图像放置区。(2)选择大模型。(3)输入提示词。(4)设置参数。(5)生成图像。
由上可知,基本的“图生图”操作步骤与“文生图”大致相同,区别仅在于“图生图”需要上传一张参考图片。5.2图生图主要模式5.2.2“涂鸦”模式
“涂鸦”是一种较为高级的图生图方法,用户可以使用“涂鸦”模式,在涂抹区域按照指定的提示词生成自己想要的部分图像,从而更加自由地创作和定制图像。
应用“涂鸦”模式前后的效果对比如图5-11所示,本例主要是通过“涂鸦”模式为图中的年轻女子添加了一副眼镜。5.2图生图主要模式
使用“涂鸦”模式进行局部绘图的步骤:(1)上传图片。在“图生图”页面中单击“涂鸦”选项卡,单击中间区域,上传一张原图。(2)进行涂鸦。
上传图片后,在“涂鸦”页面右侧即出现五个小按钮,可以对涂鸦过程进行控制,其中最常用的就是“使用画笔”和“选择画笔颜色”两个按钮。本例中设置画笔颜色为黑色,并设置好画笔粗细,然后即可用鼠标在图片相应位置进行涂抹。(3)选择大模型,输入提示词。(4)设置参数。(5)生成图像。5.2图生图主要模式5.2.3“局部重绘”模式
“局部重绘”能够针对图像的局部区域进行重新绘制,从而生成各种创意性的图像效果。“局部重绘”模式可以应用到许多场景,例如,只修改图像中的人物脸部特征,从而实现人脸交换或面部修改等操作。5.2图生图主要模式
使用“局部重绘”模式给人物换脸的操作步骤:
(1)上传图片。在“图生图”页面中单击“局部重绘”选项卡,单击中间区域,上传一张原图。
(2)进行局部重绘。
上传图片后,在“局部重绘”页面右侧即出现四个小按钮,可以对局部重绘过程进行控制,单击“使用画笔”按钮,设置好画笔粗细,然后即可用鼠标在人物面部进行涂抹,创建相应的蒙版区域。
(3)选择大模型,输入提示词。(4)设置参数。(5)生成图像。5.2图生图主要模式5.2.4“涂鸦重绘”模式
“涂鸦重绘”其实就是“涂鸦+局部重绘”的结合体,它可使用户在不改变整张图片的情况下,实现更精准地对多个元素进行修改的效果。例如,使用该模式可以更换人物头发的颜色。5.2图生图主要模式用“涂鸦重绘”更换头发颜色的操作方法:(1)上传图片。
进入“图生图”页面,切换至“涂鸦重绘”选项卡,单击中间区域,上传一张原图。(2)进行涂鸦重绘。
上传图片后,在“涂鸦重绘”页面右侧即出现五个小按钮,可以对“涂鸦重绘”过程进行控制。单击“选择画笔颜色”按钮,设置画笔颜色;单击“使用画笔”按钮,设置好画笔粗细;然后即可用鼠标在人物头发区域进行涂抹,创建相应的棕色蒙版区域,效果如图所示。(3)选择模型,输入提示词。
(4)设置参数。
在参数面板中设置“蒙版透明度”为60,“重绘区域”为“仅蒙版区域”,其余参数采用默认值。
(5)生成图像。5.2图生图主要模式5.2.5“上传重绘蒙版”模式在“上传重绘蒙版”模式,用户可以用Photoshop等图像处理软件绘制好蒙版,上传以后即可进行重绘,如此操作将比“涂鸦重绘”模式更加精准和便捷。使用该模式可以很方便地更换图片中的某些元素或背景,如产品图片的背景等。5.2图生图主要模式
使用“上传重绘蒙版”模式更换产品背景的操作方法:
(1)上传图片。在“图生图”页面中切换至“上传重绘蒙版”选项卡,在中间图像区域分别上传一张原图和一张蒙版图,如图5-19所示。
(2)参数设置。
在页面下方的“蒙版模式”选项区中,确保选中“重绘蒙版内容”单选按钮,需要注意的是,“上传重绘蒙版”和“局部重绘”模式不同,“上传重绘蒙版”中的白色区域代表重绘区域,黑色区域保持原样,因此此处务必要选中“重绘蒙版内容”单选按钮。(3)选择模型,输入提示词。(4)生成图像。5.2图生图主要模式5.2.6“批量处理”模式
“批量处理”的功能是能够同时处理多张上传的蒙版并重绘图像。在使用该模式时,用户需要先设置好输入目录、输出目录等路径,如图5-20所示。批量处理工作原理与“上传重绘蒙版”模式基本相同。
需要注意的是,输入目录、输出目录等路径中不能有任何中文或者特殊字符,否则软件会出现报错情况,并且所有原图和蒙版的文件名称需要保持一致。
当用户设置好参数之后,即可一次性重绘多张图片,能够极大地提高局部重绘的效率。5.3图生图实例
本节将利用“涂鸦重绘”模式,完成对模特上衣颜色的更换。具体操作步骤如下:
(1)“涂鸦重绘”。
单击“涂鸦重绘”选项卡,在图片区域上传模特图,调整“选择画笔颜色”为橙色,单击“使用画笔”工具,调整画笔粗细,然后用画笔涂抹模特上衣区域。
(2)参数设置。在参数面板中,设置“蒙版边缘模糊度”为2;选择“重绘区域”为“仅蒙版区域”,“采样方法”默认,“迭代次数”为30,单击“从图生图自动检测图像尺寸”按钮,得到图像尺寸,“宽度”为512,“高度”为768,其余参数默认。
(3)输入提示词。
(4)生成新图像。5.4本章小结
本章全面介绍StableDiffusion中的图生图功能。主要包括图生图的界面基本构成;4种缩放模式“仅调整大小”“裁剪后缩放”“缩放后填充空白”和“调整大小(潜空间放大)”之间的区别;图生图的操作步骤;图生图中的“涂鸦”模式、“局部重绘”模式、“涂鸦重绘”模式以及“上传重绘蒙版”模式的具体应用;最后以“涂鸦重绘”模式为例,介绍了模特换装效果的实现。感谢观看06第6章ControlNet与热门扩展插件目录CONTENTS16.1ControlNet插件概述2
6.2常用的ControlNet控制类型3
6.3StableDiffusion扩展插件46.4本章小结6.1ControlNet插件概述ControlNet是一种基于StableDiffusion的扩展插件,它通过对AI生成图像的准确控制,可以让生成的AI作品更加生动、逼真和富有感染力。
简单来说,在ControlNet出现之前,用户利用AI绘图时,是无法准确预测AI会生成什么图像的,整个过程完全像开盲盒一样;而ControlNet出现之后,用户便可以通过各种ControlNet模型准确控制AI生成的图像,如可以上传线稿让AI填充颜色并渲染、控制人物的姿势等,因此,ControlNet已成为StableDiffusion的必备插件之一。6.1ControlNet插件概述
展开ControlNet插件后,会发现ControlNet的插件界面主要包括以下几大部分:1.ControlNet单元
“ControlNet单元”是指在使用ControlNet时可同时启用的一个个独立控制模块。每个“ControlNet单元”都可以独立地选择不同的控制类型、上传参考图片、配置预处理器和模型等参数,继而从参考图片中提取不同的特征信息,如人物姿势、线条结构、画面深度等,并以此来控制生成图片的相应效果。多个“ControlNet单元”可以同时参与图片的绘制,共同影响最终生成的图像结果。6.1ControlNet插件概述2.控制类型(ControlType)
在ControlNet中,“控制类型(ControlType)”是指用于引导图像生成的不同模式,每种控制类型从参考图像中提取特定类型的信息来对生成的图像施加相应的控制。ControlNet中提供了20余种控制类型,如Canny(硬边缘)、Depth(深度)、OpenPose(姿态)等,如图6-3所示。6.1ControlNet插件概述3.预处理器(PreProcessor)
“预处理器(PreProcessor)”是ControlNet中的一个关键组件,它的功能是对输入的参考图像进行预处理,提取出特定类型的信息。这些信息将作为后续生成图像的引导条件。不同的控制类型(如Canny边缘检测、深度检测等)会有与之对应的预处理器。4.模型(Model)
在ControlNet中,“模型(Model)”是核心部分,它基于预处理器提取的信息来生成图像。6.1ControlNet插件概述5.其他参数
在ControlNet中,除了以上4个主要组成部分外,还有一些其他参数,如控制权重、引导介入时机、引导终止时机等。这些参数共同作用,用以生成用户所期望的图像效果,其主要参数介绍如下:(1)控制权重:该参数代表使用ControlNet生成图像时ControlNet模型的影响程度,权重越高,其影响越大,权重值通常设置为0.6~1.1。(2)引导介入时机和引导终止时机:这两个参数用以控制ControlNet对图像生成的影响程度。默认情况下,引导介入时机为0,引导终止时机为1,表示ControlNet将从开始生成时就起作用,并将影响整个生成过程,直至结束。
(3)控制模式:控制模型下有三个单选按钮,分别为:“均衡”、“更偏向提示词”、“更偏向ControlNet”,其表示在图像生成过程中,图像效果是更偏向提示词还是更偏向ControlNet或者二者均衡,默认为均衡模式。
(4)缩放模式:缩放模式下有三个单选按钮,分别为:“仅调整大小”、“裁剪后缩放”、“缩放后填充空白”,该参数主要用以控制生成图像的画面缩放模式,默认为裁剪后缩放,一般保持默认即可,它将会自动适配图片。6.2常用的ControlNet控制类型6.2.1Canny(硬边缘)
“Canny(硬边缘)”控制类型用于识别图像的边缘信息,从而提取出图像中的线条。用户可通过“Canny(硬边缘)”将上传的图片转换为线稿,然后根据关键词生成与上传图片具有相同构图的新画面。使用“Canny(硬边缘)”控制类型的前后效果对比如图6-6所示。6.2常用的ControlNet控制类型
使用“Canny(硬边缘)”控制类型的操作方法。
(1)确定大模型和提示词。
(2)启用ControlNet并上传参考图片。
展开ControlNet选项区,在“ControlNet单元0”选项卡中的图片位置单击,上传图6-6(a)所示图片,并勾选“启用”、“完美像素模式”和“允许预览”三个复选框。
(3)选择控制类型、预处理器和模型。
在ControlNet选项区下方,选中“Canny(硬边缘)”单选按钮,系统会自动选择“Canny”作为预处理器,在“模型”列表中选择与“Canny(硬边缘)”配套的模型“control_v11p_sd15_canny_fp16[b18e0966]”,该模型可以识别并提取图像中的边缘特征并输送到新的图像中。
(4)生成线稿图。
(5)生成新图像。
保持默认参数设置,单击“生成”按钮,即可生成相应的新图,会发现生成的人物姿态构图与原图基本一致,效果如图6-6(b)所示。6.2常用的ControlNet控制类型6.2常用的ControlNet控制类型6.2.2SoftEdge(软边缘)
“SoftEdge(软边缘)”与“Canny(硬边缘)”的作用类似,都是进行图像边缘检测,只是使用“Canny(硬边缘)”模型的效果类似于用铅笔进行边缘提取,而“SoftEdge(软边缘)”模型则类似于用毛笔进行边缘提取。由此可知,使用“SoftEdge(软边缘)”提取出的边缘将更加柔和且细节更加丰富。6.2常用的ControlNet控制类型6.2.3Lineart(线稿)
“Lineart(线稿)”主要应用于线稿生成和线稿上色。与“Canny(硬边缘)”相比,“Lineart(线稿)”对边缘轮廓的提取更加清晰、有力。总体来说,“Lineart(线稿)”对边缘轮廓的提取效果要比“Canny(硬边缘)”和“SoftEdge(软边缘)”更加优秀。6.2常用的ControlNet控制类型6.2.4Scribble/Sketch(涂鸦/草图)
“Scribble/Sketch(涂鸦/草图)”具有根据涂鸦或草图绘制精美图像效果的能力。该功能对于那些没有手绘基础或缺乏绘画天赋的用户而言,无疑是一个巨大的福音。
“Scribble/Sketch(涂鸦/草图)”检测生成的预处理图像就像蜡笔涂鸦的线稿,在控图效果上更加自由。使用“Scribble/Sketch(涂鸦/草图)”模型的生图效果如图6-17所示。6.2常用的ControlNet控制类型
使用“Scribble/Sketch(涂鸦/草图)”模型实现涂鸦绘画的操作方法。(1)确定大模型和提示词。(2)启用ControlNet并上传参考图片。(3)选择控制类型、预处理器和模型。(4)生成涂鸦图。(5)生成新图像。6.2常用的ControlNet控制类型6.2.5MLSD(直线)
“MLSD(直线)”可以提取图像中的直线边缘,被广泛应用于需要提取物体线性几何边界的领域,如建筑设计、室内设计和路桥设计等。需要注意的是,“MLSD(直线)”模型只适用于对直线的检测,无法识别和捕捉曲线,因此可能会忽略曲面中的人物、动物等元素。应用“MLSD(直线)”的前后对比效果图如图6-20所示。6.2常用的ControlNet控制类型6.2.6Depth(深度)
“Depth(深度)”模型主要用来解决图像中元素前后关系的问题。具体来说,在具有空间感和透视效果的图像中,利用“Depth(深度)”模型可以提取深度特征,这些深度特征在处理具有透视关系图像时可以提升准确性,帮助用户完成图像分割、目标检测、3D重建等任务。“Depth(深度)”模型使用前后的效果对比如图6-23所示。6.2常用的ControlNet控制类型6.2.7NormalMap(法线贴图)
“NormalMap(法线贴图)”可以从原图中提取三维物体的法线向量,从而使绘制的新图与原图的光影效果完全相同。由于“NormalMap(法线贴图)”可以实现在不改变物体真实结构的基础上反映光影分布的效果,因此被广泛应用于计算机图形学、动画渲染和游戏制作等领域。图6-27所示为应用“NormalMap(法线贴图)”前后效果对比图。6.2常用的ControlNet控制类型6.2.8OpenPose(姿态)
“OpenPose(姿态)”主要用于控制人物的肢体动作和表情特征。它可以通过使用“OpenPose(姿态)”模型检测人体关键点(如头部、肩部、手部等)的位置,这对于复制人体姿势非常有用,并且不掺杂服装、发型和背景等无关细节。
“OpenPose(姿态)”模型能更准确地识别并确定姿势,使多张图片中人物生成的姿势基本一致,因此它在许多场景中都得到了广泛的应用,如AI肖像、产品展示的AI模特、多人像照片、简单的多视图等。6.2常用的ControlNet控制类型
使用“OpenPose(姿态)”检测人物姿态的操作方法。(1)确定大模型和提示词。(2)启用ControlNet并上传参考图片。
展开ControlNet选项区,在“ControlNet单元0”选项卡中的图片位置单击,上传图6-31(a)所示图片,并勾选“启用”、“完美像素模式”、“允许预览”和“上传独立的控制图像”四个复选框。(3)选择控制类型、预处理器和模型。
在ControlNet选项区下方的“控制类型”中选中“OpenPose(姿态)”单选按钮,系统会自动选择“o
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 工程监理资料员全真模拟冲刺题库卷含完整答案
- 产后康复护理达标检测卷含完整答案
- 多学科协作在导尿护理中的应用
- 儿科沟通技巧
- 北大护理专业:护理实践中的自然疗法
- 呼吸困难的识别与处理
- 中医护理的领导力培养
- 护理安全与护理技术
- 护理用药安全指南
- 幼儿园活动教育方案设计
- 主播签约合同保底协议
- 2026国家能源集团新能源院校园招聘备考考试题库附答案解析
- 高血压糖尿病患者随访表
- 工作汇报核心技巧
- 中小学学校教学常规管理细则(2025修订版)
- DB35∕T 1036-2023 10kV及以下电力用户业扩工程技术规范
- 合格分包方管理制度
- 安全培训矩阵管理制度
- cnc操机员考试试题及答案
- 办公耗材采购配送服务项目方案投标文件(技术方案)
- 股票市场的隐秘科学
评论
0/150
提交评论