版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第十一章
大语言模型协同分析主讲人:陈宇飞PatternRecognitionandDataMining模式识别与数据挖掘目录Contents大模型训练与适应模式LargeLanguageModelTrainingandAdoptingModes大语言模型的交互知识发现InteractiveKnowledgeDiscoveryofLargeLanguageModels多模态数据的交互式知识发现InteractiveKnowledgeDiscoveryfromMultimodalData大小模型协同挖掘Large-SmallModelSynergyMining01020304大模型训练与适应模式01LargeLanguageModelTrainingandAdoptingModes大模型训练与适应模式
数据基础:大模型的预训练数据需要从以下几个方面考量:数据来源与多样性、数据清洗与预处理、数据积累的影响。预训练方法:预训练对模型有着至关重要的影响,而这些影响通常体现在以下几个方面:预训练方法、预训练模型架构、预训练策略。大模型预训练模式数据来源与多样性:在大模型的训练中,数据的多样性至关重要。如果一个语言模型只学习了科技文章,那么它在处理诗歌或小说时可能会遇到困难。因此,模型需要接触各种类型的文本,这样它才能学会理解和生成各种风格的文本。数据的来源可以包括社交媒体、新闻文章、科学文献、技术文档等,这些都为模型的学习提供了丰富的背景和上下文。大模型训练与适应模式
数据积累数据清洗与预处理:在数据积累的过程中,数据清洗、标注和预处理等工程化手段显得尤为重要。数据清洗的目的是去除噪声和不相关的信息,以确保模型训练所用数据的质量。标注则是为无标签数据添加标签,使其能够用于有监督学习。预处理包括文本的标准化、分词、去除停用词等步骤,这些都为模型的训练打下了坚实的基础。大模型训练与适应模式
数据积累数据积累的影响:高质量的数据积累不仅能提高模型的学习效率,还能显著提升其最终性能。大模型在训练过程中,通过不断接触和学习来自不同领域和格式的数据,逐渐形成对世界的理解。这种理解不仅体现在语言的使用上,还反映在模型对复杂任务的处理能力上。大模型训练与适应模式
数据积累大模型的架构通常基于深度神经网络,如Transformer、BERT等。这些架构能够处理序列数据,解决了传统RNN的梯度消失问题,使模型能够更好地理解和生成语言。Transformer架构通过自注意力机制,使模型能够捕捉长距离的依赖关系,这对于理解复杂语言结构至关重要。大模型训练与适应模式
预训练模型架构在预训练阶段,大模型在大量无标签数据上进行无监督学习。通过分析这些数据,模型能够学习到语言的统计模式和语义信息。这一过程使模型能够捕捉到语言的通用特征,为后续的任务打下基础。例如,模型可以学习到词与词之间的关系、句子的结构以及上下文的含义。预训练的目标是让模型具备一定的语言理解能力,使其能够在面对具体任务时,快速适应并做出合理的响应。预训练通常使用大规模的文本数据集,模型通过自监督的方式进行学习,利用上下文信息来预测下一个词或填补缺失的词。大模型训练与适应模式
预训练涉及方法大模型训练与适应模式
预训练涉及方法
(1)无监督学习的挑战:预训练阶段的无监督学习面临着诸多挑战。首先,模型需要从大量未标注的数据中学习,这意味着它必须能够识别和利用数据中的潜在模式。其次,由于数据集的多样性,模型需要具备足够的灵活性,以适应不同的语言使用场景和风格。此外,模型还需要能够处理数据中的噪声和不一致性,以避免在学习过程中产生错误的推断。
(2)自监督学习的过程:在自监督学习中,模型通过预测数据中的缺失部分或隐藏信息来学习。例如,模型可能会被训练来预测句子中被遮蔽的单词,或者通过上下文来生成连贯的句子。这种方法使模型能够在没有明确标签的情况下,学习语言的结构和语义。大模型训练与适应模式
预训练策略预训练策略包括多种方法,如掩码语言模型(MLM)、下一句预测(NSP)等。掩码语言模型通过随机遮蔽句子中的单词,并让模型预测这些单词,从而学习上下文信息。下一句预测则要求模型预测给定句子的下一句,这有助于模型学习句子之间的关系。大语言模型的交互知识发现02InteractiveKnowledgeDiscoveryofLargeLanguageModels大语言模型的交互知识发现大语言模型有三种主流架构:
解码器(Decoder-Only)架构、编码器(Encoder-Only)架构、编码器–解码器(Encoder-Decoder)架构,每种架构在设计上有其独特的功能侧重和适用场景。架构类型解码器架构(Decoder-Only)编码器架构(Encoder-Only)编码器–解码器架构(Encoder-Decoder)适用任务开放式对话与内容生成长文本写作/创意生成代码生成与编程助手角色扮演与多轮交互文本分类(主题/意图等)命名实体识别(NER)情感分析/观点抽取语义匹配与检索(向量表示)机器翻译文本摘要问答/信息抽取式生成纠错、改写与风格转换核心机制自回归生成(从左到右预测下一个Token)双向编码理解(利用全上下文建模语义表示)编码理解+解码生成(先理解,再生成;序列到序列)主流架构大语言模型的交互知识发现提示文本(prompt)分词器tokenembedding位置编码decoder多头自注意力层前馈神经网络归一化层输出层解码器架构的核心机制是自回归生成,不仅能利用已生成的上下文进行连贯推理与续写,还能根据提示灵活控制生成方向,从而更适配开放式的生成类任务。解码器应用场景任务问答系统基于提示输入生成答案,从而帮助发现隐含知识知识推理模型通过已有信息的生成过程,推理知识间的隐含联系知识生成利用模型生成数据集或揭示隐含模式,协助知识发现任务解码器架构大语言模型的交互知识发现这段代码演示了如何用HuggingFaceTransformers调用一个解码器式语言模型(Decoder-Only)来完成“给定提示词→续写生成”的基本流程。解码器-案例研究大语言模型的交互知识发现编码器的核心机制是:双向编码理解,即利用全上下文建模语义表示,它会同时关注输入序列的前后信息,通过全局上下文融合得到更精确、稳健的语义表征,从而更擅长对文本进行理解与判别。编码器应用场景任务主题建模使用编码器进行文本表示学习,并结合聚类方法,发现文本集合中的潜在主题知识补全编码现有知识图谱中的实体和关系,通过模型的嵌入表示发现可能缺失的链接知识可视化使用降维方法(如t-SNE、UMAP)对嵌入进行可视化,揭示数据分布特性输入文本分词器tokenembedding位置编码Encoder
xN多头自注意力层前馈神经网络归一化层上下文向量/特征表示自定义输出编码器架构大语言模型的交互知识发现这段代码演示了如何用HuggingFaceTransformers的快速调用一个编码器式语言模型(Encoder-Only,BERT系列)来完成“输入文本→输出情感类别的基本流程。编码器-案例研究大语言模型的交互知识发现编码器-解码器应用场景任务跨语言知识发现通过跨语言翻译任务,发掘和传播不同语言体系中的知识知识改写与生成通过理解输入语义,生成多样化的文本形式,探索不同表达方式中的隐含知识检索增强知识发现结合外部知识库,通过检索相关信息,生成更加准确和全面的答案输入编码器状态解码器输出输入编码器–解码器架构的核心机制是先编码理解、再解码生成,不仅能通过编码器对输入进行全局语义建模与信息压缩,还能由解码器在跨注意力的引导下逐步生成目标序列,从而更适配序列到序列任务。编码器-解码器架构编码器-解码器案例研究这段代码演示了如何用HuggingFaceTransformers的pipeline调用一个编码器–解码器模型(Encoder-Decoder,T5系列)来完成“输入一段原文→自动生成摘要”的基本流程。大语言模型的交互知识发现大语言模型的交互知识发现自然语言理解从词法→句法→语义→上下文建模的流程:句子切分为词元并进行基本标注(词法分析)识别词元之间的结构关系(句法分析)推理句子表达的真实含义(语义分析)通过上下文信息形成可用于续写、翻译等下游任务的语义表示大语言模型通常借助Transformer的自注意力机制在同一框架下隐式完成这些步骤,实现对句子深层意义的理解与生成。大语言模型的工作机制大语言模型的交互知识发现尽管LLM可通过预训练或检索获取专业知识,但往往成本高、且难与模型内部知识无缝融合,尤其在医疗、教育、法律、金融等领域更为突出。因此,研究者提出知识注入框架,将外部结构化知识高效融入模型,以提升其在下游任务中的表现,尤其适用于低资源场景。大语言模型的知识注入大语言模型的交互知识发现类型方式例子显式知识注入将知识库或知识图谱中的结构化知识整合到语言模型中附加知识嵌入或知识图谱节点嵌入隐式知识注入调整预训练或微调过程,使模型隐式地学习到领域知识领域特定的语料库进行继续预训练常见实现方法具体做法优势知识图谱/知识库嵌入将实体/关系向量与文本表示融合,或把结构化知识转为可读提示更强一致性与可解释性事实/规则注入把任务相关事实、约束或业务规则加入提示/解码约束/外部模块降低幻觉、提升可控领域继续预训练用领域语料再训练,让模型掌握术语、写作风格与常见模式更懂专业语境领域微调/指令微调用标注数据或指令数据对齐任务目标(分类、抽取、问答等)更贴合下游任务检索增强(RAG)推理时检索外部文档作为上下文,再进行生成与引用更时效、可追溯知识注入策略大语言模型的交互知识发现选用百度百科的“高血压”词条模拟专用知识库,并基于LangChain开发框架,实现一种简单的RAG医疗交互问答应用示例环境准备和本地数据加载知识库构建,生成嵌入通过LangChain实现RAG定义会话记忆历史对话记录与当前输入融合新问题向量化检索知识+新问题注入到Prompt中多轮对话设计知识注入案例大语言模型的交互知识发现选用百度百科的“高血压”词条模拟专用知识库,并基于LangChain开发框架,实现一种简单的RAG医疗交互问答应用示例环境准备和本地数据加载知识库构建,生成嵌入通过LangChain实现RAG定义会话记忆历史对话记录与当前输入融合新问题向量化检索知识+新问题注入到Prompt中多轮对话设计①定义会话记忆,用于跟踪用户的多轮对话历史。②每次接收到用户的新问题后,将历史对话记录与当前输入问题融合,生成一个新的独立问题。③将新问题向量化后用于检索知识库,获取最相关的文档内容。④检索到的知识和生成的新问题被注入到提示输入(Prompt)中,传递给大语言模型进行推理和回答生成,⑤多轮对话过程中,为避免历史对话过长导致模型输入超出限制,设计了对话历史压缩策略。将历史问题与回答进行提取和精简,压缩为更简洁的上下文信息,从而生成更具针对性的独立查询问题。知识注入案例多模态数据的交互式知识发现03InteractiveKnowledgeDiscoveryfromMultimodalData由不同类型、不同来源的数据构成的集合称为多模态数据(multimodaldata),其组成可以包括结构化文本、视频数据、音频数据、3D点云信息、图像数据、知识图谱等。多模态大模型(multimodallargelanguagemodel,MLLM)在处理数据时主要考虑模态对齐和模态融合。多模态数据的交互式知识发现多模态数据的处理与集成模态对齐基本思路:将不同类型数据(如视觉和文本)的特征表示映射到一个共同的语义空间。主要方法:①基于对比学习的方法–通过对比学习,最大化匹配对之间的相似度,减少非匹配对之间的相似度。②引入额外训练任务的方法–给模型安排一些特别的“学习任务”,让它能更好地理解不同模态之间的关系模态融合基本思路:直接将来自不同模态(如文本、图像、声音等)的信息或特征整合成一种统一的表示。主要方法:①早期融合–在模型刚提取出特征后,便进行融合。②中期融合–在特征提取与初步处理后,再对进行融合。③后期融合–先让各模态独立处理得到预测结果,再通过加权平均、投票机制等决策策略融合得出最终输出。模态编码器:将各个模态数据转换为相关的特征编码。输入映射器:将不同模态的编码特征与文本特征空间对齐,以实现跨模态信息的融合与交互。LLM骨干网络:学习数据特征,理解语义,学习如何进行推理。输出映射器:将LLM骨干网络的输出转换为模态生成器可理解的特征。模态生成器:根据特征信息生成特定模态的输出。多模态数据的交互式知识发现多模态大模型的基本架构多模态数据的交互式知识发现多模态大模型的基本架构实例:CLIP(contrastivelanguage-imagepre-training)编码器结构主要包括图像编码器和文本编码器两部分。①图像编码器:通常基于卷积神经网络或视觉Transformer等架构。②文本编码器:一般基于Transformer架构。实现跨模态理解的核心:基于对比学习实现跨模态特征对齐。例如,对于一幅特定的图像及其对应的文本描述,输入映射器会通过不断调整映射参数,实现对正样本(匹配的图像–文本对)的准确识别和区分,同时也能够有效地将负样本(不匹配的图像–文本对)排除在外。在不同领域的应用①基于自然语言的图像分类:在自然语言的提示下进行零样本分类。②跨模态检索:通过文本查询图像,或者通过图像查询相关的文本。③多模态数据清洗:为图像生成更高质量、更匹配的文字描述。RadfordA,KimJW,HallacyC,etal.Learningtransferablevisualmodelsfromnaturallanguagesupervision[C]//Internationalconferenceonmachinelearning.PmLR,2021:8748-8763.多模态数据的交互式知识发现应用案例:多模态大模型在医学领域的应用LLaVA(languageandvisionassistant)是一种能够将语言与视觉深度融合的多模态大模型,主要包括视觉模块(包括视觉编码器和线性投影层)和语言模块(即语言模型)两个主要结构。
LiuH,LiC,WuQ,etal.Visualinstructiontuning[J].Advancesinneuralinformationprocessingsystems,2023,36:34892-34916.多模态数据的交互式知识发现应用案例:多模态大模型在医学领域的应用LLaVA在医学领域的应用之一——LLaVA-Med,采取了LLaVA微调的策略,以适应相应的专业场景,增强在该领域的针对性与准确性。微调流程:①第一阶段:生物医学概念特征对齐。从数据集中筛选图像与文本对,并转化为简单的指令示例。此阶段训练时,固定视觉编码器和语言模块权重,仅调整投影矩阵,使生物医学图像概念与文字表示对应。②第二阶段:端到端指令调整。挑选特定成像方式的图像文本对,利用GPT-4生成多轮问答数据。此阶段训练时,固定视觉编码器权重,更新投影层和语言模块权重,以提升对生物医学图像问题的理解与回答能力。LLaVA-Med辅助疾病诊断可以同时向LLaVA-Med输入患者的腹腔切面CT扫描影像和该患者的病历信息,要求模型“在CT扫描的横切面上描述胰腺肿瘤,重点描述其形状、位置、密度和边缘”。模型得到数据和指令输入后,输出对胰腺肿瘤的描述性语义信息,如肿瘤边界“清晰”、密度“不均匀”、位置“在胰头”等。这些高级语义知识随后被输入到分类模型,用于辅助下游的医学诊断工作。大小模型协同挖掘04Large-SmallModelSynergyMining分层模型架构将大模型和小模型组合成一个分层的结构,
通过不同层级的协作,使系统能够高效处理复杂任务。大模型负责广泛的知识理解与初步处理,而小模型则在特定领域或任务上做更精细、更精准的推理和处理。首先,大模型会被用于处理输入的广泛内容,当任务的初步理解完成后,小模型会被调用来实施更精细的任务处理。一个典型的应用实例是谷歌的T5模型与领域特化的小模型的结合。它首先对问题进行通用的语义理解和意图分析,遇到医学、法律等专业领域问题时,自动调用对应的领域特化小模型,确保回答的专业性与准确性。大小模型协同挖掘大小模型的设计原理混合专家架构是一种通过组合多个小模型来处理复杂任务的架构设计。混合专家架构的工作流程通常是由大模型来处理任务的初步分析,然后根据任务的具体要求选择适合的小模型进行深入推理。大模型不仅仅是任务调度的核心,它还负责在某些复杂任务下并行运行多个小模型,将各个小模型的结果整合,生成最终的回答。GPT虽擅长处理通用语言任务,但在高度专业化领域存在局限,因此让GPT先按需调用特定领域的小型专家模型,再根据小模型的初步回答生成最终回答。大小模型的协同不仅可以处理广泛的语言生成任务,还能在特定领域内表现得更加专
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 开封市高级中学2026-2027学年高二上学期9月阶段检测语文试卷(含答案)
- 2025-2026年四川省护士资格考试专业实务模拟试题
- 2025-2026年食品安全知识冲刺练习
- 防腐绝缘层电火花检测记录
- 广东大湾区一模-2026届高三-2026年1月-地理-试题
- 【7道第一次月考】安徽省芜湖市无为市2025-2026学年七年级上学期10月月考道德与法治试题(含解析)
- 四川省广安市岳池中学2026-2027学年九年级上学期收心质量检测语文试题 (含答案)
- 医院疫苗处方培训考试试题及答案
- 湖南省长郡中学2026-2027年高二上开学考试英语试卷(含解析无听力音频含听力原文)
- 测量观察资源配置管理办法
- 甲状腺癌系统性治疗ASCO指南解读总结2026
- 网球场施工组织设计
- 2025年医院后勤管理人员招聘考试题库(含答案)
- 2026年秋新人教版部编本六年级上册语文教学工作计划
- 2026年新教材人教版九年级上册英语Unit 1 The Changing World 教案
- 信创数据库采购项目需求及评分标准需求说明
- GB/T 470-2026锌锭
- 管理经济学(第14版) 课件 第16章 政府对企业的监管
- 《传感器与检测技术》课件 第十一章 辐射与波式传感器
- 2026高考全国二指导卷语文(全国二卷02)(全解全析)
- 江苏省惠隆资产管理有限公司招聘笔试题库2026
评论
0/150
提交评论