版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
多模态大模型技术
学习目标知识目标
了解多模态大模型的基本概念及架构。
掌握多模态大模型的预训练与微调。
掌握多模态大模型的推理与生成。技能目标
能够完成多模态大模型的部署。
能够使用多模态大模型进行图文生成。情景引入:AI交互的新挑战用户与AI的交互形式正在发生深刻演变:从早期的纯文本指令,逐步升级为“文本+图像+语音+视频”的混合信息输入形式,对AI的理解能力提出了更高要求。旧模型困境基于Transformer的纯文本模型,虽能厘清“地点+景观+等级”等多层次文本关联,但对视觉信息却“视而不见”。新挑战出现用户需求变得更立体:上传一张“玄武湖日落”的照片,要求推荐能拍摄同款湖景的“亲子房”。模型短板暴露旧模型仅识别“玄武湖、亲子房”等文本关键词,却无法捕捉照片中的“日落光影”等视觉特征,最终导致推荐失败。💡核心痛点:现有单一模态模型无法融合理解跨模态信息,无法形成完整、精准的用户需求画像。多模态大模型的诞生面对传统单一模态模型在处理复杂现实信息时的局限性,多模态大模型(MLLM)应运而生。它试图打破文本、图像、音频、视频之间的信息壁垒,通过融合多种模态信息,为更全面、更智能的AI应用提供技术支撑。解决方案引入多模态大模型(MLLM),将文本、图像、音频、视频等多种类型的数据进行统一建模与处理,以此打破传统单一模态AI的能力边界,为复杂场景提供通用的智能解决方案。核心能力不仅能精准识别图像、视频中的视觉特征,还能将这些非文本信息与用户的文本需求进行深度关联与理解,真正实现了“看、听、读”的多维度并行处理与交互。02多模态大模型预训练与微调01多模态大模型概述03多模态推理与生成什么是多模态大模型?传统大语言模型(LLM)的局限多模态大模型(MLLM)的突破核心处理对象:仅聚焦于文本数据,处理维度单一。擅长任务:文本生成、情感分析、机器翻译等纯文本类任务。能力边界:无法直接理解、处理图片、音频、视频等非文本信息。定义:能够同时接收、处理并理解文本、图像、音频、视频等多种不同模态信息的AI模型。核心能力:实现跨模态的语义关联与任务协同,打破信息孤岛。具备更贴近人类感知与认知习惯的综合信息处理能力。多模态大模型不仅可以理解文本内容,还能够识别图像、声音,甚至领会视频中的动作与场景。凭借这种跨模态的理解能力,模型能够根据指令执行复杂任务,并输出文本、视频、图像和音频等不同模态的信息。核心概念:模态表示模态表示是指将原始异构的模态数据如音频、文本和图像等信息通过多模态大模型编码器转换为机器可理解的统一特征向量。这一操作在多模态大模型的训练和应用阶段广泛使用,是多模态大模型感知不同模态的基础。核心概念:模态对齐
模态对齐主要是指借助多模态大模型的对比学习、注意力机制等技术手段,先达成不同模态数据在维度上的统一,再开展语义层面的匹配,从而使它们能够在同一语义空间中进行对比与操作。模态对齐主要应用于多模态大模型的训练阶段,通过大量数据集的训练将模态信息与其文本描述信息实现语义关联。两大核心架构概览统一嵌入解码器架构📌方式:将不同模态转换为维度一致的嵌入向量,与文本嵌入拼接成统一序列后输入解码器进行处理。✨特点:架构简洁,易于扩展,对各类新模态的兼容性强,复用性高。🎯适用场景:图像内容描述、跨模态检索、多模态摘要等基础与通用型任务。跨模态注意力架构📌方式:将视觉或其他模态的特征向量作为外部特征库,在解码器生成文本的过程中,通过注意力机制动态查询和调用关联的视觉细节信息。✨特点:实现文本与视觉信息的细粒度交互,信息匹配更精准,推理能力更强。🎯适用场景:视觉问答(VQA)、图像局部细节描述、复杂场景下的推理与决策等任务。为平衡通用场景的兼容性与复杂任务的精细度,业界形成了两种极具代表性的核心架构,分别是统一嵌入解码器架构和跨模态注意力架构。统一嵌入解码器架构详解统一嵌入解码器架构类似LLM中处理文本的方式,使用模态编码器和输入投影器将不同模态数据转换为嵌入向量,然后和文本嵌入向量拼接在一起,输入大模型的解码器中,实现多模态信息的统一建模与生成。将图像分割成图像块,通过线性层转换为嵌入向量,并添加位置编码。使用视觉Transformer(ViT)进一步提取全局语义特征,使每个图像块嵌入向量融合全图信息。01.模态编码器基于预训练的Transformer解码器,深度融合对齐后的多模态特征(图像+文本)。通过掩码自注意力机制、前馈神经网络、残差连接与归一化以及N个子层迭代,输出统一的多模态特征向量,用于后续生成任务。03.解码器对图像编码器输出的嵌入向量进行模态对齐(将视觉特征转换为与文本语义匹配的向量表达)和维度对齐(调整向量维度以匹配文本嵌入维度),实现跨模态语义对应。02.输入投影器统一嵌入解码器架构组件:模态编码器功能:负责将图像分割成多个图像块,并将每个图像块编码为图像块嵌入向量,功能上类似于文本处理中的分词器与嵌入层。常用模型:视觉Transformer(ViT)。图像分块将图像分割成固定尺寸的小块(如16×16像素),类似文本分词。01线性层将每个图像块的像素值线性映射为固定维度的嵌入向量。02位置编码为每个图像块嵌入添加位置信息,保留空间结构。03Transformer编码器通过多层编码器,让每个图像块嵌入融合全图语义,输出全局感知的嵌入向量。04统一嵌入解码器架构组件:输入投影器输入投影器将图像块嵌入向量转换为与文本语义对齐、维度一致的特征向量,以便与文本嵌入拼接后输入解码器。其核心工作包括模态对齐和维度对齐。模态对齐:通过预训练模型,将图像块嵌入向量中的视觉特征转换为与文本语义匹配的向量表达,实现“图像内容”与“文本描述”的语义对应。维度对齐:若对齐后的向量维度与文本嵌入不一致(如图像1024维vs文本768维),则通过线性变换调整维度,使其与文本嵌入完全一致,便于后续拼接处理。统一嵌入解码器架构组件:解码器功能:对经过输入投影器对齐后的多模态特征向量,以及经过位置编码后的指令文本嵌入向量进行深度融合。通过多个子层迭代,持续深化两者的语义关联,最终输出能够充分整合视觉细节与指令文本需求的模态信息。结构:由N个结构一致的子层堆叠而成的,每个子层包含掩码自注意力机制和前馈神经网络层等,且均配置残差连接与归一化操作以保障稳定性。经过N层迭代后,输出兼具视觉具象性与文本逻辑性的统一多模态特征向量,可直接用于后续多模态生成任务。N个子层迭代作为“信息门卫”,通过掩码限制模型访问当前位置之后的多模态信息,确保生成过程遵循自回归逻辑,保证输出顺序合理。掩码自注意力机制对融合后的多模态特征进行非线性变换,增强模型对图像细节与文本语义之间复杂关联的表达能力。前馈神经网络层起“稳定器”作用,稳定特征传递过程,避免信息被稀释,保障训练稳定性。残差连接与归一化跨模态注意力架构详解该架构前期处理流程与统一嵌入解码器架构基本一致,即“模态编码器->输入投影器”。其最大的特色在于视觉与文本的融合方式,实现了更深层的动态交互。在模态融合阶段,不直接拼接特征向量,避免了静态拼接导致的视觉与文本信息关联性减弱的问题,保留了各自特征的独立性。核心差异:拒绝静态拼接让文本嵌入向量与视觉特征进行直接、实时的动态语义交互,精准匹配图文元素,最终实现元素级的语义对齐。交互机制:动态语义对齐将经过对齐处理的图像特征向量,作为关键外部信息接入解码器的交叉注意力层(Cross-AttentionLayer),以此建立两者间的联系。融合方式:引入交叉注意力层010203交叉注意力层的工作流程01文本处理输入的指令文本经过分词、嵌入层和位置编码后,生成文本嵌入向量,然后通过解码器的自注意力层,从而得到文本的中间特征向量。02跨模态交互在解码器的交叉自注意力层中,以文本嵌入向量作为Query,以对齐后的图像特征向量作为Key和Value,通过注意力权重计算,让文本特征动态地“吸收”图像中最为相关的视觉信息,实现跨模态融合。03迭代与输出融合后的特征再经过前馈神经网络和残差连接与归一化,进入下一层Transformer解码器重复上述过程,直至输出最终模态信息。两大架构对比维度统一嵌入解码器架构跨模态注意力架构输入融合方式图像块嵌入向量与文本嵌入向量在输入层拼接成单序列输入解码器图像块嵌入向量经编码器处理后,在解码器每个编码器自注意力层中动态融入交互粒度粗粒度,依赖解码器对“图像+文本”拼接序列的全局隐式理解细粒度,生成每个文本嵌入向量时动态关注图像局部特征架构复杂度低,复用纯文本输入层设计中,需修改解码器注意力机制支持跨模态交互应用场景图像描述、图文检索等不需要精准关联的通用场景视觉问答、图像细节描述等需要精准匹配图像局部特征与文本语义的场景主流模型MiniGPT-4豆包、通义千问02多模态大模型预训练与微调01多模态大模型概述03多模态推理与生成训练体系:预训练+微调多模态大模型的训练是一个针对文本、图像和音频等异构数据设计的递进式学习过程,其核心目标是使模型逐步具备“跨模态语义理解→特定任务执行→人类偏好适配”的完整能力。相较于单模态大模型,多模态大模型需突破模态的异构性问题,通常采用预训练和微调两个阶段构成闭环训练体系。训练体系预训练阶段专注于构建通用多模态能力,使模型在大规模多模态数据上学习跨模态语义关联,奠定基础理解能力微调阶段则聚焦于具体任务的适配,将通用能力转换为解决特定多模态任务的能力,并依据人类对模型输出的偏好判断,优化模型行为,确保输出符合人类价值观与实际需求。预训练:构建通用跨模态能力目的:让大模型在大规模、多样化的多模态数据上,学习跨模态语义关联和通用特征表示,为后续的任务处理打下坚实基础。核心:实现多模态数据对齐,建立视觉、文本等不同信息间的语义联系。例如,让模型看到猫的图像能自然关联到“猫”的文本描述。核心:多模态数据对齐这是预训练的基石。目标是消除不同模态数据间的语义鸿沟,让模型在视觉、语音、文本等异构数据间建立精准映射,理解不同形式的数据指的是同一事物。要素一:高质量数据集如同烹饪的“原料”,直接决定了模型能力的上限。我们需要海量、语义精准对齐且覆盖广泛现实场景的多模态数据,以确保模型学习到全面的通用知识。要素二:针对性训练方法如同精湛的“工艺”,负责将数据的潜在价值转化为模型的真实能力。通过精心设计的算法和训练策略,最大化挖掘数据集中的对齐信息,将其高效内化为模型理解世界的通用特征。预训练数据集预训练的数据集指的是大规模跨模态配对数据,是构建跨模态语义映射的基石,连接不同模态信息的“桥梁”。数据类型由大规模跨模态配对数据组成,旨在将不同模态(如视觉与语言)的信息进行对齐,为模型提供基础的训练素材。核心作用构建“模态A—模态B”的精准对应关系,让模型在海量样本中学习并达成跨模态间的深层语义映射与理解。关键要素以常见的图文模型数据为例,每条样本需包含:
•image_id:数据唯一标识
•image_path:图像资源的存储路径
•text:对应图像的语义描述示例(JSON格式):{
"image_id":"000001",
"image_path":"path/to/images/000001.jpg",
"text":"一只白色的猫咪"
}核心预训练方法:对比学习(CLIP模型)对比语言-图像预训练(ContrastiveLanguage–ImagePretraining,CLIP)是当前主流的基于对比学习的模型,它主要包含文本编码器、图像编码器和线性投影器这3个组件。总体的预训练过程主要涵盖数据特征提取、相似度计算和参数优化这3个阶段。文本编码器用于编码自然语言文本信息,将文本描述转化为高维的语义特征向量,精准捕捉文本中的含义与意图,为后续与图像特征匹配打下基础。图像编码器用于编码图像的视觉信息,从原始像素数据中提取关键特征,如物体形状、颜色、场景等,生成图像对应的视觉特征向量,实现视觉内容的量化表达。线性投影器作为跨模态对齐的关键连接层,负责将来自文本编码器和图像编码器的不同维度的特征向量,统一映射到同一个高维特征空间中,让文本与图像特征具备直接计算相似度的条件。CLIP工作流程:数据特征提取文本编码器对数据集中的N个文本信息进行编码,将每个文本转换为一个固定长度的特征向量且维度为n,并输出特征矩阵T=[T1,T2,T3,…,Tn];针对N个图像信息,通过图像编码器将其转换为维度为n的特征向量,并输出特征矩阵I=[I1,I2,I3,…,In]。CLIP工作流程:相似度计算将每一个图像特征向量与每一个文本特征向量进行组合,生成N×N个特征对。随后,运用余弦相似度公式计算所有样本的特征相似度,进而计算语义相似度。余弦相似度计算用于衡量两个特征向量的方向一致性,计算所得的值越接近1,语义越相似;值越接近-1,语义差异越大。经过计算后,把N个完全匹配的文本图像对标记为正样本,其余不匹配的文本图像对标记为负样本。CLIP工作流程:参数优化CLIP在这一阶段使用核心损失函数——信息噪声对比估计(InfoNCE)。该函数通过定义明确的优化方向,引导模型不断调整参数以学习图文对之间的匹配关系,从而实现将匹配的图文对“拉近”、不匹配的图文对“推远”的最终目的。优化目标•最大化正样本相似度:让模型学会将匹配的图文对在向量空间中拉得更近。•最小化负样本相似度:让模型学会将不匹配的图文对在向量空间中推得更远。训练过程•利用InfoNCE损失函数计算每轮训练的损失值。•若正样本分数远高于负样本,损失值小,模型表现好。•若分数接近,损失值大,模型反向传播调整投影器参数。最终效果经过大量图文数据的训练,模型最终能准确判断图文匹配关系。在相似度矩阵中,匹配图文对所在的对角线数值最大,其他不匹配对数值最小,从而清晰地区分匹配与不匹配的内容。微调:从通用到好用的关键桥梁预训练模型虽具备强大的零样本泛化能力,但在医疗、工业等专业细分领域往往缺乏特定知识,难以直接解决行业痛点,因此需要进行针对性的微调优化,以实现从“通用”到“好用”的跨越。核心方法指令微调是目前将通用模型适配特定任务的主流技术手段。定义利用包含指令、多模态输入及多模态输出的数据集,通过反向传播机制来更新模型参数,使模型能够根据跨模态输入和指令生成符合预期的输出结果。核心目的推动模型能力从单纯的“能理解”通用语义,升级为“会干活”的实用工具,以适配并更好地服务于各类垂直领域的具体应用。💡关键价值:微调是连接通用大模型与行业落地场景的关键桥梁,让AI真正具备解决实际问题的能力。多模态vs单模态指令微调多模态指令微调与单模态的核心差异主要体现在数据层面,包括数据集构建方式和处理流程;但二者在底层微调技术上存在共性,可复用多种高效微调方案。单模态大模型依赖纯文本形式的指令、输入输出数据集;而多模态大模型的数据集使用文本指令、多模态输入、多模态输出的复合形式,以此支撑图像、文本等跨模态交互。01核心差异:数据集构成预处理后的多模态数据需要进行模态对齐,以实现跨模态数据的语义一致性;而单模态大模型无须进行模态对齐步骤,经过预处理后可直接进入特征提取与模型训练阶段。02核心差异:数据处理流程二者均能够采用LoRA、前缀微调等参数高效微调技术,从而实现模型对目标任务的精准适配。03技术共性:参数高效微调010203多模态指令微调实现:数据集构建核心数据格式:包含“文本指令+多模态输入+多模态输出”的结构化三元组。📝Instruction表示文本指令,明确模型需执行的任务要求,包括任务类型、内容规范、格式限制等。🖼️Input表示多模态输入信息,指向待处理图像的存储位置,主要包含图像路径image_path和图像语义标注信息image_desc。✅Output表示多模态输出,是模型完成任务后应生成的目标文本,是任务的标准答案或期望结果,用于衡量模型生成内容与任务要求的匹配度。多模态指令微调实现:微调方法选择在微调方法选择上,需结合多模态融合特性,采用LoRA、前缀微调等参数高效微调技术,冻结编码器,主要针对输入投影器和Transformer解码器等关键模块进行优化。多模态大模型指令微调遵循“特征提取、模态对齐、输出”的端到端逻辑,具体流程如下:特征提取:图像经视觉编码器提取通用视觉特征,该模块参数固定,不参与微调。模态对齐:输入投影器将视觉特征与文本嵌入对齐并融合,形成统一特征向量。输出与优化:Transformer解码器根据融合特征输出文本。若输出与标准答案语义差异较大,则计算损失,并通过反向传播优化输入投影器及解码器中各层(自注意力、前馈网络、残差连接与归一化)的参数。02多模态大模型预训练与微调01多模态大模型概述03多模态推理与生成多模态推理与生成的关系多模态推理是指模型结合文本指令,对图像、视频和语音等多模态输入的语义进行跨模态解析、关联与逻辑推导,最终输出文本形式的理解结果的过程。多模态生成是指模型基于文本指令,将文本语义转换为图像、音频和视频等多模态内容的过程。两者关系:先理解,再创造。生成以推理为基础。模型需要先具备“理解”多模态信息的能力,才能根据指令进行“创造”,实现高质量的多模态内容生成。
多模态推理:核心问题模态对齐核心定义:将文本描述中的抽象概念精准地映射并关联到图像或视频中的具体物理区域。典型场景:“请在图中找出‘红色的汽车’并框选它。”要求模型理解“红色”、“汽车”的语义,并与视觉像素特征进行匹配。跨模态逻辑建模核心定义:融合来自文本、图像、视频等多种模态的信息,进行逻辑推演以得出结论。典型场景:“结合‘暴雨天气’的文字描述和‘道路严重积水’的画面,判断是否适合出行?”模型需推理出“不适合驾车出行”的逻辑结论。多模态推理应用:视觉问答视觉问答作为多模态推理的典型应用,旨在打通视觉感知与语言理解的壁垒。其核心逻辑是将图像中的视觉特征与文本问题的语义特征深度融合,让AI模型像人类一样“看图说话”并准确回答。核心目标让模型具备跨模态的理解与推理能力,同时深度解析图像中的视觉细节(如物体、场景、特征)与文本形式的问题,并基于对两者的综合理解,生成精准、匹配的文本答案。应用案例:医疗健康输入:医生上传患者的肺部CT影像,并提问:“图中是否存在结节病灶?”输出:模型分析后回答:“右肺上叶存在直径约8mm的类圆形结节病灶”。核心价值在医疗、安防、教育等领域,为专业人员提
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 建筑材料展参展事宜确认函3篇
- 环保意识守护我们的地球家园-小学主题班会课件
- 远离校园欺凌共筑友善师生关系小学主题班会课件
- 银行风险管理师业务风险管理水平绩效考评表
- 优化家庭学校联动育人体系指南
- 银行零售业务数字化转型路径与实践手册
- 立德树人构建和谐校园文化之旅小学主题班会课件
- 守护成长环境护航幸福童年小学主题班会课件
- 2026年酒店管理师高级综合考核模拟试卷与答案
- 2026年公需科目城市排水防涝知识考核试题及完整答案
- 2026年新教材八年级上册历史全册必背知识点考点提纲
- 2026年湖北专升本汉语言文学专业(现代汉语中国古代文学)题库附答案
- 2026年四川省拟任县处级领导干部理论(任职资格考试)全真模拟试题及答案
- SD22推土机使用说明书完整版
- 2026潍坊第二人民医院招聘(3人)建设笔试备考试题及答案解析
- 湖北省荆州市松滋市2025-2026学年上学期八年级物理期末试题(含答案)
- 社区食堂规范运营制度范本
- 2026年深圳市离婚协议书规范范本
- GB/T 21873-2025橡胶密封件给、排水管及污水管道用接口密封圈材料规范
- 神经内科疾病康复与治疗
- 公共资源交易数据的价值与应用分析
评论
0/150
提交评论