版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
02第2章StableDiffusion模型目录CONTENTS12.1StableDiffusion大模型下载2
2.2StableDiffusion中的模型种类3
2.3StableDiffusion大模型介绍42.4本章小结2.1StableDiffusion大模型下载2.1.1使用绘世启动器下载大模型2.1.2在第三方模型网站下载大模型2.2StableDiffusion中的模型种类在StableDiffusion中,目前共有5种不同类型的模型,分别为Checkpoint、Embedding、Hypernetwork、Lora和VAE。根据模型功能,可将这5种模型分为以下三大类:(1)基础底模型。基础底模型就是大模型,又称为主模型或底模,Checkpoint模型就属于此类。StableDiffusion主要是基于它来生成各种图像。(2)辅助模型。辅助模型是建立在大模型基础上的,它可以对大模型进行微调,不能单独使用。辅助模型包括Embedding、Hypernetwork和Lora这三种模型。(3)美化模型。美化模型,顾名思义就是用来对模型进行美化的,是更细节化的处理方式,如优化图片色调或添加滤镜效果等。VAE模型属于此类。2.2StableDiffusion中的模型种类2.2.1Checkpoint大模型:生成基本图像在StableDiffusion中,Checkpoint是指那些经过训练以生成高质量、多样性和创新性图像为目的的深度学习模型,这些模型通常由大型训练数据集和复杂的神经网络结构组成,能够生成各种风格和类型的图像。Checkpoint的中文意思是“检查点”,之所以如此命名,是因为在模型训练到关键位置时,会将其存档,如此可方便后续的调用和回滚操作。Checkpoint大模型在StableDiffusion中起着至关重要的作用,利用不同类型的大模型,可以生成各式各样不同风格的图像。除了能以输入提示词的方式直接生成图像外,大模型还可以通过反推提示词的方式实现以图生图的功能。StableDiffusion生成的图像质量好不好,归根结底就在于用户的Checkpoint大模型选用得好不好,因此用户要选择合适的大模型去生图。即使完全相同的提示词,如果选用的大模型不相同,那么生成的图像风格差异将会很大。2.2StableDiffusion中的模型种类2.2.1Checkpoint大模型:生成基本图像2.2StableDiffusion中的模型种类2.2.2Embedding模型:微调图像虽然Checkpoint大模型包含大量的数据信息,但其动辄几个G字节的文件包使其使用起来不够轻便。很多时候,用户只需一个能体现人物特征的模型来使用,但如果每次都要对整个神经网络的参数进行微调,操作起来未免过于烦琐,此时,Embedding模型便可派上用场。例如,如果想避免图像中出现人物手部画错、脸部变形等问题,就可以调用Embedding模型来解决。Embedding模型普遍都非常小,有的只有几十K字节,因为它本身并没有存储很多信息,只是将所需的元素信息提取出来进行标注。需注意的是,Embedding模型也有一定的局限性,由于它没有改变主模型的权重参数,因此它很难教会主模型去绘制没有见过的图像内容,也很难改变图像的整体风格,而是通常用来固定人物角色或画面内容的特征。著名的“EastNegative”就是一种Embedding模型,它可以有效提升画面的精细度,可以避免模糊、灰色调、手部画错、面部扭曲等问题,图2-13所示为使用“EastNegative”模型前后的效果对比。2.2StableDiffusion中的模型种类2.2.2Embedding模型:微调图像2.2StableDiffusion中的模型种类2.2.3Hypernetwork模型:转换风格Hypernetwork(又称Hypernetworks)的中文名为超网络,是一种神经网络架构,它可以动态生成神经网络的参数权重,简言之,它可以生成神经网络。Hypernetwork模型的功能与Embedding、Lora类似,都是对StableDiffusion生成的图像进行针对性调整,但Hypernetwork模型的应用领域较窄,主要用于画风转换,而且训练难度很大,目前在很大程度上已被后出现的Lora所替代,用户也可将Hypernetwork模型理解为低配版的Lora。图2-15所示为经Hypernetwork模型转换前后的图像对比。2.2StableDiffusion中的模型种类2.2.4LoRA模型:固定画风LoRA的全称为Low-RankAdaptationofLargeLanguageModels(大型语言模型的低阶适应),LoRA取的就是Low-RankAdaptation这几个单词的开头。LoRA最初应用于大型语言模型,由于其直接对大模型进行微调时,不仅成本高,而且速度慢,再加上大模型体积庞大,因此性价比很低。LoRA通过冻结原始大模型,并在外部创建一个小型插件来进行微调,从而避免了直接修改原始大模型,这种方法不仅成本低而且速度快,另外插件式的特点使它非常易于使用。LoRA在绘画大模型上表现非常出色,固定画风或人物样式的能力非常强大。只要是图片上的特征,LoRA都可以提取并训练,其作用包括对人物脸部特征进行复刻、生成某一特定风格的图像、固定动作特征等,因此,LoRA的应用范围逐渐扩大,并迅速成为一种流行的AI绘画技术。在LoRA模型的提示词中,可以对其权重值进行设置。需注意的是,LoRA模型的权重值尽量不要超过1,否则容易导致很差的生图效果。大部分单个LoRA模型的权重值设置为0.6~0.9时,便能够提高出图质量。如果只想有一点点V模型的元素或风格,则权重值设置为0.3~0.6即可。图2-16所示为应用LoRA模型的前后对比图。2.2StableDiffusion中的模型种类2.2.4LoRA模型:固定画风2.2StableDiffusion中的模型种类2.2.5VAE模型:修复图像VAE(VariationalAuto-Encoder,变分自编码器)是一种生成模型,是自编码器(Autoencoder)的一种变体。它主要由编码器(Encoder)和解码器(Decoder)两部分构成。作为Checkpoint大模型的一部分,VAE模型并不像前面介绍的几种模型那样可以很好地控制图像内容,它主要是对大模型生成的图像进行修复。图2-19所示为应用VAE模型的前后对比图。从图2中可看出,使用VAE之后,画面就像是加了调色滤镜一样,整体的色彩饱和度更高,光影层次感更强。2.3StableDiffusion大模型介绍2.3.1基础大模型基础大模型通常具有广泛的适用性和强大的AI绘画性能,适合初学者和需要快速获取结果的用户使用。使用最普遍的基础大模型是SD系列,如SD-v1-5、SD-v2(分别对应1.5和2.0版本)、SDXL等,这些都是StableDiffusion自带的大模型。如果用户想自己训练大模型,SD系列也是一个很好的起点,因为它们涵盖了各种绘画风格。2.3StableDiffusion大模型介绍2.3.2二次元模型二次元模型可以提供可爱和卡通化的绘图效果,以下是几种常用的二次元模型。(1)Anything系列。Anything系列是一个以二次元漫画风格为主的大模型,该系列有多个版本,包括Anything-V3.5、Anything-V4.0、Anything-V4.5和Anything-V5.0等,每个版本下还有各种变形版本和精简版本。需注意的是,Anything系列出图效果好,并且对提示词的要求不太高,但风格较为单一。(2)Counterfeit系列。Counterfeit系列是一种明亮、清晰的动漫风格模型,图像的色彩饱和度高,而且人物角色更加形象。(3)Mix系列。Mix系列是一种二次元混合模型,融合了多个二次元模型,实际使用效果不错,给人一种优雅、精致的感觉,而且对提示词的要求不高。(4)Niji-动漫二次元模型。Niji-动漫二次元模型广泛应用于二次元创作领域,包括插画、漫画、游戏角色设计、虚拟偶像等。该模型具有风格统一、人物可爱和风格多样性等特点。2.3StableDiffusion大模型介绍2.3.3写实类模型写实类模型能提供更加细腻和逼真的细节,常用的写实类模型:(1)OnlyRealistic系列。OnlyRealistic系列模型是StableDiffusion中的一类超高清真人写实模型,它基于东方美学创建,开发者希望该模型能在美学与现实主义之间取得平衡。该系列模型能够生成高度逼真的人物形象,在人物面部细节等方面都有很好的表现,可以很好地还原各种人物特征和场景细节,使生成的图像仿佛是真实拍摄的照片,效果如图2-24(a)所示。(2)majicMIX系列。MajicMIX系列模型是StableDiffusion中的一类重要模型,它由Prompthero开发维护,可根据输入的文本提示生成新的图像,其子系列主要包括majicMIXrealistic(麦橘写实)、majicMIXlux(麦橘奇幻)、majicMIXsombre(麦橘唯美)、majicMIXfantasy(麦橘幻想)和majicMIXreverie(麦橘梦幻)等。其中的majicMIXrealistic(麦橘写实)模型生成的图像具有真实度高、光影感强、适应性广等特点,深受广大用户欢迎,如图2-24(b)所示。2.3StableDiffusion大模型介绍2.3.42.5D数绘模型2.5D数绘模型采用了一种独特的视觉表现形式,可将二维图像的细腻与三维图像的立体感完美融合。这种模型以简洁明了的线条和色彩构建出层次丰富、空间感强烈的画面,呈现出极强的视觉冲击力。2.5D数绘模型在游戏、动画、插画等AI绘画领域都有广泛的应用,为用户提供了全新的创作思路和表达方式。以下介绍两种常用的2.5D数绘模型。(1)RevAnimated系列。RevAnimated系列模型为东方审美2.5D风格,比平面图像更具立体感,比立体图像更扁平化,介于真实与虚幻之间,出图效果亦真亦幻,能够呈现出生动且具有情感的艺术形象,使得图像的细节更加精细,效果如图2-25(a)所示。(2)元气动漫系列。元气动漫_2D_2.5D系列模型用于生成2D或2.5D风格的动漫图像,它结合了2D和2.5D的特点,既保留了2D动漫的简洁线条和鲜明色彩等传统风格,又融入了2.5D的立体感和空间感,使生成的图像更加生动、富有层次,在人物塑造、场景搭建等方面更具表现力,效果如图2-25(b)所示。2.3StableDiffusion大模型介绍2.3.5特定风格模型两种常用的特定风格模型。(1)SHMILY系列。SHMILY系列模型一般以生成具有独特情感氛围和艺术风格的图像为主,其图像带有浪漫、温馨、梦幻等情感色彩,同时融合了多种动漫、插画等艺术风格元素,使生成的画面富有想象力和艺术感染力,效果如图2-26(a)所示。(2)X潮玩系列。X潮玩系列模型是专门用于生成具有潮玩风格图像的模型
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 中职护理:护理文书书写规范
- 异位妊娠术前护理对改善预后的作用研究
- 护理专业核心知识详解
- 护理中医护理学
- 护理妇产科护理学进展
- 护理工作职业素养:汇报与培养
- 北大护理专业:社区护理与公共卫生
- 英语小达人:英语绘本阅读难点攻克指南
- 护理伦理与患者权利保护
- 护理医学基础:护理法律法规与患者权益
- 2026年教师专用教育公共基础知识试题及答案
- GA/T 1215-2025中小学与幼儿园周边道路交通组织设计与交通设施设置规范
- 2026年四川省成都市中考语文真题(试题+答案)
- 2025年食品安全事故应急处置全流程培训
- 2026年淡水养殖高级水产工程师答辩题库
- 探秘南海IODP349基底玄武岩中钙质碳酸盐岩脉:岩石学与地球化学的深度剖析
- 上市公司收购方案
- 矿山安全教育培训课直播课件
- GB/T 14233.2-2025医用输液、输血、注射器具检验方法第2部分:生物学试验方法
- 2025年基本公共卫生服务项目(慢阻肺健康管理)培训试题(附答案)
- 供应商资质与实力评估体系模板
评论
0/150
提交评论