版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第十一章
大语言模型协同分析PatternRecognitionandDataMining模式识别与数据挖掘目录Contents大模型训练与适应模式LargeLanguageModelTrainingandAdoptingModes大语言模型的交互知识发现InteractiveKnowledgeDiscoveryofLargeLanguageModels多模态数据的交互式知识发现InteractiveKnowledgeDiscoveryfromMultimodalData大小模型协同挖掘Large-SmallModelSynergyMining01020304大模型训练与适应模式01LargeLanguageModelTrainingandAdoptingModes大模型训练与适应模式
数据基础:大模型的预训练数据需要从以下几个方面考量:数据来源与多样性、数据清洗与预处理、数据积累的影响。预训练方法:预训练对模型有着至关重要的影响,而这些影响通常体现在以下几个方面:预训练方法、预训练模型架构、预训练策略。大模型预训练模式数据来源与多样性:在大模型的训练中,数据的多样性至关重要。如果一个语言模型只学习了科技文章,那么它在处理诗歌或小说时可能会遇到困难。因此,模型需要接触各种类型的文本,这样它才能学会理解和生成各种风格的文本。数据的来源可以包括社交媒体、新闻文章、科学文献、技术文档等,这些都为模型的学习提供了丰富的背景和上下文。大模型训练与适应模式
数据积累数据清洗与预处理:在数据积累的过程中,数据清洗、标注和预处理等工程化手段显得尤为重要。数据清洗的目的是去除噪声和不相关的信息,以确保模型训练所用数据的质量。标注则是为无标签数据添加标签,使其能够用于有监督学习。预处理包括文本的标准化、分词、去除停用词等步骤,这些都为模型的训练打下了坚实的基础。大模型训练与适应模式
数据积累数据积累的影响:高质量的数据积累不仅能提高模型的学习效率,还能显著提升其最终性能。大模型在训练过程中,通过不断接触和学习来自不同领域和格式的数据,逐渐形成对世界的理解。这种理解不仅体现在语言的使用上,还反映在模型对复杂任务的处理能力上。大模型训练与适应模式
数据积累大模型的架构通常基于深度神经网络,如Transformer、BERT等。这些架构能够处理序列数据,解决了传统RNN的梯度消失问题,使模型能够更好地理解和生成语言。Transformer架构通过自注意力机制,使模型能够捕捉长距离的依赖关系,这对于理解复杂语言结构至关重要。大模型训练与适应模式
预训练模型架构在预训练阶段,大模型在大量无标签数据上进行无监督学习。通过分析这些数据,模型能够学习到语言的统计模式和语义信息。这一过程使模型能够捕捉到语言的通用特征,为后续的任务打下基础。例如,模型可以学习到词与词之间的关系、句子的结构以及上下文的含义。预训练的目标是让模型具备一定的语言理解能力,使其能够在面对具体任务时,快速适应并做出合理的响应。预训练通常使用大规模的文本数据集,模型通过自监督的方式进行学习,利用上下文信息来预测下一个词或填补缺失的词。大模型训练与适应模式
预训练涉及方法大模型训练与适应模式
预训练涉及方法
(1)无监督学习的挑战:预训练阶段的无监督学习面临着诸多挑战。首先,模型需要从大量未标注的数据中学习,这意味着它必须能够识别和利用数据中的潜在模式。其次,由于数据集的多样性,模型需要具备足够的灵活性,以适应不同的语言使用场景和风格。此外,模型还需要能够处理数据中的噪声和不一致性,以避免在学习过程中产生错误的推断。
(2)自监督学习的过程:在自监督学习中,模型通过预测数据中的缺失部分或隐藏信息来学习。例如,模型可能会被训练来预测句子中被遮蔽的单词,或者通过上下文来生成连贯的句子。这种方法使模型能够在没有明确标签的情况下,学习语言的结构和语义。大模型训练与适应模式
预训练策略预训练策略包括多种方法,如掩码语言模型(MLM)、下一句预测(NSP)等。掩码语言模型通过随机遮蔽句子中的单词,并让模型预测这些单词,从而学习上下文信息。下一句预测则要求模型预测给定句子的下一句,这有助于模型学习句子之间的关系。大语言模型的交互知识发现02InteractiveKnowledgeDiscoveryofLargeLanguageModels大语言模型的交互知识发现大语言模型有三种主流架构:
解码器(Decoder-Only)架构、编码器(Encoder-Only)架构、编码器–解码器(Encoder-Decoder)架构,每种架构在设计上有其独特的功能侧重和适用场景。架构类型解码器架构(Decoder-Only)编码器架构(Encoder-Only)编码器–解码器架构(Encoder-Decoder)适用任务开放式对话与内容生成长文本写作/创意生成代码生成与编程助手角色扮演与多轮交互文本分类(主题/意图等)命名实体识别(NER)情感分析/观点抽取语义匹配与检索(向量表示)机器翻译文本摘要问答/信息抽取式生成纠错、改写与风格转换核心机制自回归生成(从左到右预测下一个Token)双向编码理解(利用全上下文建模语义表示)编码理解+解码生成(先理解,再生成;序列到序列)主流架构大语言模型的交互知识发现提示文本(prompt)分词器tokenembedding位置编码decoder多头自注意力层前馈神经网络归一化层输出层解码器架构的核心机制是自回归生成,不仅能利用已生成的上下文进行连贯推理与续写,还能根据提示灵活控制生成方向,从而更适配开放式的生成类任务。解码器应用场景任务问答系统基于提示输入生成答案,从而帮助发现隐含知识知识推理模型通过已有信息的生成过程,推理知识间的隐含联系知识生成利用模型生成数据集或揭示隐含模式,协助知识发现任务解码器架构大语言模型的交互知识发现这段代码演示了如何用HuggingFaceTransformers调用一个解码器式语言模型(Decoder-Only)来完成“给定提示词→续写生成”的基本流程。解码器-案例研究大语言模型的交互知识发现编码器的核心机制是:双向编码理解,即利用全上下文建模语义表示,它会同时关注输入序列的前后信息,通过全局上下文融合得到更精确、稳健的语义表征,从而更擅长对文本进行理解与判别。编码器应用场景任务主题建模使用编码器进行文本表示学习,并结合聚类方法,发现文本集合中的潜在主题知识补全编码现有知识图谱中的实体和关系,通过模型的嵌入表示发现可能缺失的链接知识可视化使用降维方法(如t-SNE、UMAP)对嵌入进行可视化,揭示数据分布特性输入文本分词器tokenembedding位置编码Encoder
xN多头自注意力层前馈神经网络归一化层上下文向量/特征表示自定义输出编码器架构大语言模型的交互知识发现这段代码演示了如何用HuggingFaceTransformers的快速调用一个编码器式语言模型(Encoder-Only,BERT系列)来完成“输入文本→输出情感类别的基本流程。编码器-案例研究大语言模型的交互知识发现编码器-解码器应用场景任务跨语言知识发现通过跨语言翻译任务,发掘和传播不同语言体系中的知识知识改写与生成通过理解输入语义,生成多样化的文本形式,探索不同表达方式中的隐含知识检索增强知识发现结合外部知识库,通过检索相关信息,生成更加准确和全面的答案输入编码器状态解码器输出输入编码器–解码器架构的核心机制是先编码理解、再解码生成,不仅能通过编码器对输入进行全局语义建模与信息压缩,还能由解码器在跨注意力的引导下逐步生成目标序列,从而更适配序列到序列任务。编码器-解码器架构编码器-解码器案例研究这段代码演示了如何用HuggingFaceTransformers的pipeline调用一个编码器–解码器模型(Encoder-Decoder,T5系列)来完成“输入一段原文→自动生成摘要”的基本流程。大语言模型的交互知识发现大语言模型的交互知识发现自然语言理解从词法→句法→语义→上下文建模的流程:句子切分为词元并进行基本标注(词法分析)识别词元之间的结构关系(句法分析)推理句子表达的真实含义(语义分析)通过上下文信息形成可用于续写、翻译等下游任务的语义表示大语言模型通常借助Transformer的自注意力机制在同一框架下隐式完成这些步骤,实现对句子深层意义的理解与生成。大语言模型的工作机制大语言模型的交互知识发现尽管LLM可通过预训练或检索获取专业知识,但往往成本高、且难与模型内部知识无缝融合,尤其在医疗、教育、法律、金融等领域更为突出。因此,研究者提出知识注入框架,将外部结构化知识高效融入模型,以提升其在下游任务中的表现,尤其适用于低资源场景。大语言模型的知识注入大语言模型的交互知识发现类型方式例子显式知识注入将知识库或知识图谱中的结构化知识整合到语言模型中附加知识嵌入或知识图谱节点嵌入隐式知识注入调整预训练或微调过程,使模型隐式地学习到领域知识领域特定的语料库进行继续预训练常见实现方法具体做法优势知识图谱/知识库嵌入将实体/关系向量与文本表示融合,或把结构化知识转为可读提示更强一致性与可解释性事实/规则注入把任务相关事实、约束或业务规则加入提示/解码约束/外部模块降低幻觉、提升可控领域继续预训练用领域语料再训练,让模型掌握术语、写作风格与常见模式更懂专业语境领域微调/指令微调用标注数据或指令数据对齐任务目标(分类、抽取、问答等)更贴合下游任务检索增强(RAG)推理时检索外部文档作为上下文,再进行生成与引用更时效、可追溯知识注入策略大语言模型的交互知识发现选用百度百科的“高血压”词条模拟专用知识库,并基于LangChain开发框架,实现一种简单的RAG医疗交互问答应用示例环境准备和本地数据加载知识库构建,生成嵌入通过LangChain实现RAG定义会话记忆历史对话记录与当前输入融合新问题向量化检索知识+新问题注入到Prompt中多轮对话设计知识注入案例大语言模型的交互知识发现选用百度百科的“高血压”词条模拟专用知识库,并基于LangChain开发框架,实现一种简单的RAG医疗交互问答应用示例环境准备和本地数据加载知识库构建,生成嵌入通过LangChain实现RAG定义会话记忆历史对话记录与当前输入融合新问题向量化检索知识+新问题注入到Prompt中多轮对话设计①定义会话记忆,用于跟踪用户的多轮对话历史。②每次接收到用户的新问题后,将历史对话记录与当前输入问题融合,生成一个新的独立问题。③将新问题向量化后用于检索知识库,获取最相关的文档内容。④检索到的知识和生成的新问题被注入到提示输入(Prompt)中,传递给大语言模型进行推理和回答生成,⑤多轮对话过程中,为避免历史对话过长导致模型输入超出限制,设计了对话历史压缩策略。将历史问题与回答进行提取和精简,压缩为更简洁的上下文信息,从而生成更具针对性的独立查询问题。知识注入案例多模态数据的交互式知识发现03InteractiveKnowledgeDiscoveryfromMultimodalData由不同类型、不同来源的数据构成的集合称为多模态数据(multimodaldata),其组成可以包括结构化文本、视频数据、音频数据、3D点云信息、图像数据、知识图谱等。多模态大模型(multimodallargelanguagemodel,MLLM)在处理数据时主要考虑模态对齐和模态融合。多模态数据的交互式知识发现多模态数据的处理与集成模态对齐基本思路:将不同类型数据(如视觉和文本)的特征表示映射到一个共同的语义空间。主要方法:①基于对比学习的方法–通过对比学习,最大化匹配对之间的相似度,减少非匹配对之间的相似度。②引入额外训练任务的方法–给模型安排一些特别的“学习任务”,让它能更好地理解不同模态之间的关系模态融合基本思路:直接将来自不同模态(如文本、图像、声音等)的信息或特征整合成一种统一的表示。主要方法:①早期融合–在模型刚提取出特征后,便进行融合。②中期融合–在特征提取与初步处理后,再对进行融合。③后期融合–先让各模态独立处理得到预测结果,再通过加权平均、投票机制等决策策略融合得出最终输出。模态编码器:将各个模态数据转换为相关的特征编码。输入映射器:将不同模态的编码特征与文本特征空间对齐,以实现跨模态信息的融合与交互。LLM骨干网络:学习数据特征,理解语义,学习如何进行推理。输出映射器:将LLM骨干网络的输出转换为模态生成器可理解的特征。模态生成器:根据特征信息生成特定模态的输出。多模态数据的交互式知识发现多模态大模型的基本架构多模态数据的交互式知识发现多模态大模型的基本架构实例:CLIP(contrastivelanguage-imagepre-training)编码器结构主要包括图像编码器和文本编码器两部分。①图像编码器:通常基于卷积神经网络或视觉Transformer等架构。②文本编码器:一般基于Transformer架构。实现跨模态理解的核心:基于对比学习实现跨模态特征对齐。例如,对于一幅特定的图像及其对应的文本描述,输入映射器会通过不断调整映射参数,实现对正样本(匹配的图像–文本对)的准确识别和区分,同时也能够有效地将负样本(不匹配的图像–文本对)排除在外。在不同领域的应用①基于自然语言的图像分类:在自然语言的提示下进行零样本分类。②跨模态检索:通过文本查询图像,或者通过图像查询相关的文本。③多模态数据清洗:为图像生成更高质量、更匹配的文字描述。RadfordA,KimJW,HallacyC,etal.Learningtransferablevisualmodelsfromnaturallanguagesupervision[C]//Internationalconferenceonmachinelearning.PmLR,2021:8748-8763.多模态数据的交互式知识发现应用案例:多模态大模型在医学领域的应用LLaVA(languageandvisionassistant)是一种能够将语言与视觉深度融合的多模态大模型,主要包括视觉模块(包括视觉编码器和线性投影层)和语言模块(即语言模型)两个主要结构。
LiuH,LiC,WuQ,etal.Visualinstructiontuning[J].Advancesinneuralinformationprocessingsystems,2023,36:34892-34916.多模态数据的交互式知识发现应用案例:多模态大模型在医学领域的应用LLaVA在医学领域的应用之一——LLaVA-Med,采取了LLaVA微调的策略,以适应相应的专业场景,增强在该领域的针对性与准确性。微调流程:①第一阶段:生物医学概念特征对齐。从数据集中筛选图像与文本对,并转化为简单的指令示例。此阶段训练时,固定视觉编码器和语言模块权重,仅调整投影矩阵,使生物医学图像概念与文字表示对应。②第二阶段:端到端指令调整。挑选特定成像方式的图像文本对,利用GPT-4生成多轮问答数据。此阶段训练时,固定视觉编码器权重,更新投影层和语言模块权重,以提升对生物医学图像问题的理解与回答能力。LLaVA-Med辅助疾病诊断可以同时向LLaVA-Med输入患者的腹腔切面CT扫描影像和该患者的病历信息,要求模型“在CT扫描的横切面上描述胰腺肿瘤,重点描述其形状、位置、密度和边缘”。模型得到数据和指令输入后,输出对胰腺肿瘤的描述性语义信息,如肿瘤边界“清晰”、密度“不均匀”、位置“在胰头”等。这些高级语义知识随后被输入到分类模型,用于辅助下游的医学诊断工作。大小模型协同挖掘04Large-SmallModelSynergyMining分层模型架构将大模型和小模型组合成一个分层的结构,
通过不同层级的协作,使系统能够高效处理复杂任务。大模型负责广泛的知识理解与初步处理,而小模型则在特定领域或任务上做更精细、更精准的推理和处理。首先,大模型会被用于处理输入的广泛内容,当任务的初步理解完成后,小模型会被调用来实施更精细的任务处理。一个典型的应用实例是谷歌的T5模型与领域特化的小模型的结合。它首先对问题进行通用的语义理解和意图分析,遇到医学、法律等专业领域问题时,自动调用对应的领域特化小模型,确保回答的专业性与准确性。大小模型协同挖掘大小模型的设计原理混合专家架构是一种通过组合多个小模型来处理复杂任务的架构设计。混合专家架构的工作流程通常是由大模型来处理任务的初步分析,然后根据任务的具体要求选择适合的小模型进行深入推理。大模型不仅仅是任务调度的核心,它还负责在某些复杂任务下并行运行多个小模型,将各个小模型的结果整合,生成最终的回答。GPT虽擅长处理通用语言任务,但在高度专业化领域存在局限,因此让GPT先按需调用特定领域的小型专家模型,再根据小模型的初步回答生成最终回答。大小模型的协同不仅可以处理广泛的语言生成任务,还能在特定领域内表现得更加专业。大小模型协同挖掘大小模型的设计原理大模型与小模型的多轮交互是通过多个步骤完成的,在每一轮交互中,大模型为小模型提供高层次的引导信息,而小模型则对这些信息进行精细化处理并做出进一步的推理。这种模式类似于人类专家与专业助理之间的合作:专家拥有广泛的领域知识,能够快速把握全局,但在处理具体问题时,往往需要借助专门的工具或助理来深入分析细节。例如,在生物医学研究中,大模型通过整合科研文献构建疾病、基因与药物的宏观关联网络,识别研究热点与趋势。在此基础上,小模型针对关键文献开展深入的文本挖掘与数据分析,实现宏观洞察与微观验证的有机结合。大小模型协同挖掘协同挖掘策略与技术实现大模型与小模型的另一种重要的合作方式是大模型为小模型提供反馈循环。小模型通常专注于具体问题的初步分析,得出初步的结论或发现,但由于小模型的领域局限性,它往往无法提供足够广泛的背景知识来验证或扩展这些初步发现。而大模型的广泛知识库和强大的推理能力在这一过程中起到了关键作用。在医疗研究中,反馈循环至关重要。小模型可首先分析电子健康记录,发现生活习惯与疾病的初步关联,但这些关联可能仅是统计相关性,缺乏医学背景验证。此时,将这些关联反馈给大模型,利用其广泛的医学知识库,结合生物学、流行病学等领域,验证这些发现的准确性。大小模型协同挖掘协同挖掘策略与技术实现智谱清言是生成式AI助手,可在工作、学习和日常生活中为用户解答各类问题,完成各种任务,其中口腔医生助手是一个通过大模型与小模型协作机制来提升其服务质量的典型案例。小模型搭建:训练分别检测多种牙齿问题的多个小模型。接口设计:设计访问不同小模型的接口规范和调度规则。智能体搭建:设计与口腔医学紧密相关的提示词,根据用户的提问调度小模型,小模型返回检测结果后,智能体依预设提示词生成检测报告。智谱清言通过大模型与小模型的合作,有效地将通用知识与专业领域的深度知识结合在一起,提供了一个强大的智能服务平台。大小模型协同挖掘大小模型在复杂系统中的应用案例第十二章
结构模式识别PatternRecognitionandDataMining模式识别与数据挖掘目录Contents结构模式识别的起源与发展历程结构模式识别相关定义概述DefinitionsinStructuralPatternRecognition图结构嵌入GraphEmbedding图核函数GraphKernels01020304图神经网络05OriginandDevelopmentofStructuralPatternRecognitionGraphNeuralNetworks结构模式识别的起源与发展历程01OriginandDevelopmentofStructuralPatternRecognition统计模式识别结构模式识别的起源现实生活中存在的数据,不总是整齐的向量数据5251.5870.982932.1480.988965.76130.514752.7150.49…………基于特征向量表示,适用于规则数据结构模式识别基于结构化描述,适用于关系数据?传统算法无法直接处理图数据节点数不固定结构不规则社交网络分子结构交通网络结构模式识别的发展历程20世纪80年代2000年左右2015年左右相似度≈0.85√图结构嵌入(GraphEmbedding)图核函数(GraphKernels)图神经网络(GraphNeuralNetworks)核心思想:将图数据由高维结构空间映射至低维向量空间目标:让传统算法能处理图数据核心思想:无需显式映射,直接在高维希尔伯特空间计算图的相似度目标:避免嵌入过程中的信息损失核心思想:将深度学习推广至图数据,让模型自动学习特征目标:构建端到端的统一学习框架结构模式识别相关定义概述02DefinitionsinStructuralPatternRecognition图结构数据形式化定义图G(V,E)V是节点集合(实体:如人、原子、城市)E是边集合(关系:如朋友、化学键、航线)
常见分类按节点分类:属性图(带属性的节点)非属性图(不带属性的节点)按边分类:有向图(边有方向)无向图(边无方向)按边的特征:带权图(边上有权重)无权图(边无权重)
图上的学习任务根据节点的属性、边的信息以及已知的节点标签,预测未知标签节点的类别例如:遗传交互网络中发现功能模块、在金融交易网络中发现欺诈用户组有毒无毒节点分类社团检测例如:社交网络中,通过用户的社交关系和属性信息来预测用户的兴趣或行为发现图中紧密连接的节点群组,是对图结构的无监督聚类图分类预测整个图的属性,目标是使用一组带标签的训练数据来学习从图结构数据到标签的映射例如:利用分子图结构来预测分子的抗癌活性、溶解性或毒性图结构嵌入03GraphEmbedding图结构嵌入图结构数据向量空间
映射函数
核心挑战传统模式识别算法主要针对欧氏空间中维度固定的规则向量数据设计图结构数据的节点数量不固定,节点间缺乏直接的对应关系传统模式识别算法无法直接用于图数据图嵌入将高维稀疏图数据转化为低维稠密向量捕获图的拓扑结构和节点关系经典算法基于原型选择的不相似度嵌入算法基于代数图理论提出的多项式图嵌入算法基于深层次信息的熵嵌入算法基于不相似度的图嵌入方法
计算图嵌入示例基于深层次信息的熵嵌入算法核心挑战原型图的选择与编辑距离的计算需要复杂的优化过程,难以处理大型图或图集合核心步骤计算中心节点:选择具有最小最短路径长度方差的顶点得到扩展子图:由中心节点出发,扩展一定层级基于深层次信息的熵嵌入将图分解为不同层次的子图结构,并计算这些子结构的熵信息
图核函数04GraphKernels图核函数核心挑战图嵌入方法将图结构由高维结构空间映射到低维空间时,可能会损失关键结构信息,导致线性不可分问题图核方法在高维空间中直接分析与处理图结构数据的解决方案能直接体现图结构数据在高维希尔伯特空间中的结构信息
相似度分数0.87经典核方法
图核函数R卷积理论(R-convolutionFramework,Haussler,1999)将图分解为子结构,通过计算两个图之间共享的同构子结构来定义图核函数①将图分解为子结构②判断子结构是否同构
③计算同构子结构对数共享的子结构越多,图就越相似图核函数
基于游走(walk)的图核函数基于路径(path)的图核函数基于子树(subtree)或子图(subgraph)的图核函数Weisfeiler-Lehman图核(WL图核)WL图核基于不相似度的图嵌入(dissimilaritygraphembedding)在迭代过程中不断地为每个根节点聚合其邻近节点的标签信息,进而为该根节点生成更高层次的抽象表示核心步骤多集标签确定:为图中的每一个节点确定一个多集标签。该多集由节点的邻域中所有节点的标签组成对多集进行排序:将多集中的元素按升序排序,并将它们连接成一个字符串。在字符串前加上节点本身的标签作为前缀标签压缩:使用哈希函数将每个字符串映射到一个压缩标签得到新标签:为图中的所有节点设置新的标签经过多轮迭代后,通过计算任意两个图结构间共享的相同节点标签对数,进而得到WL图核图神经网络04GraphNeuralNetworks图神经网络核心挑战:克服图核方法的局限性计算开销大:图核方法需要计算和存储一个N×N的核矩阵,难以扩展到大规模数据集非端到端学习:特征提取(核矩阵的计算)与下游任务(SVM分类)是分离的,无法协同优化解决方案:图神经网络核心思想:将深度学习(特别是卷积神经网络CNN)从欧式空间数据推广到非欧式的图结构数据CNN:在规则的像素网格上,用一个卷积核来聚合邻域像素信息,提取局部特征GNN:在不规则的图数据上,每个节点通过聚合其邻居节点的信息来更新自己的特征表示谱域图卷积神经网络空域图卷积神经网络谱域图卷积神经网络核心思路利用图信号处理理论,将图信号变换到谱域,在谱域中进行卷积操作,再逆变换到原始空间
2.计算简化(切比雪夫多项式网络)方法:使用切比雪夫多项式来近似谱域中的滤波器,避免了直接进行特征分解
3.再次简化(图卷积网络,GCN)方法:进一步简化,将切比雪夫多项式限制在一阶,并使用重归一化技巧意义:奠定了现代图卷积网络的基础,高效且易于实现
谱域方法通过一系列数学简化,从理论走向实用,其演化逐渐接近直接在空域上操作的空域方法空域图卷积神经网络基于空间策略的图卷积神经网络(DGCNN)排序池化(sortpooling)层,将无序的节点特征转换为固定大小的有序表示,使得传统的CNN能够应用于图分类任务利用图卷积层提取节点的局部子结构特征利用SortPooling层,根据局部子结构特征对节点进行排序,将无序的节点特征转换为固定大小的有序表示应用传统的1D卷积和全连接层进行图分类空域图卷积神经网络低回溯空间对齐图卷积神经网络(BASGNN)将任意大小的图转换为固定大小的无回溯对齐网格结构,并在此网格结构上定义新的空域图卷积操作核心步骤低回溯网格结构构造/输入层:通过该层将每个任意大小的图转换为固定大小的低回溯对齐网格结构低回溯空间图卷积层:该层由两个并行的堆叠图卷积网络组成,In-BASGNN网络和Out-BASGNN网络,分别关注和聚合入邻接顶点和出邻接顶点的特征传统一维CNN层:接收低回溯空间图卷积层的输出,并在这些对齐的网格结构上执行传统的一维卷积操作
减少了信息丢失,并在理论上弥合了传统CNN与空域GNN之间的差距小结与讨论图嵌入(GraphEmbedding)图核函数(GraphKernels)图神经网络(GraphNeuralNetworks)核心思想将图映射为低维向量直接在高维空间度量图相似度直接在图结构上进行端到端学习信息损失存在信息损失理论上无损失,但依赖子结构选择可学习,表达能力强计算范式两阶段两阶段端到端特征工程手动设计嵌入方法手动设计子结构自动学习特征适用场景中小型图,结合传统机器学习算法中小型图,适用于结构信息比较关键的图各类规模的图小结与讨论本章探讨了结构模式识别的核心——图数据分析我们沿着历史的足迹,见证了解决这一问题的三次重要尝试:图嵌入(GraphEmbedding):一座连接图与传统机器学习的桥梁,但代价是信息损失图核函数(GraphKernels):一种在结构空间直接比较图的精巧工具,但扩展性差,依赖手动设计图神经网络(GraphNeuralNetworks):当前最强大的端到端图学习框架,实现了特征的自动学习核心脉络:这三种方法的演进,体现了模式识别从“手动设计特征”到“模型自动学习”的深刻转变延伸思考与讨论图结构数据和传统的向量数据,最根本的不同是什么?图核函数的基本原理是什么?为什么它能避免图嵌入带来的信息损失?图神经网络(特别是空域GNN))的核心思想与CNN有何异同?回顾三大方法,你认为它们分别适用于什么样的应用场景?第十三章
复杂数据挖掘PatternRecognitionandDataMining模式识别与数据挖掘目录Contents引言Introduction时序数据挖掘Time
Series
Data
Mining流式数据挖掘Streaming
Data
Mining图数据挖掘Graph
Data
Mining01020304小结与讨论SummaryandDiscussion05复杂数据定义:复杂数据是指那些无法用传统的、静态的二维关系表(即简单的行列表格)有效表示和处理的数据集合。特性:具有异构性、时变性、非线性结构或无限流式的特征,打破了传统数据挖掘中“数据点是独立同分布(I.I.D.)”的基本假设。数据挖掘新挑战传统数据挖掘主要针对多媒体和结构化数据,然而现实世界中充斥着更加复杂的数据类型:时序数据(TimeSeries):股市波动、心电信号、气候变化。流式数据(StreamData):实时交通监控、网络日志、高频交易。图数据(GraphData):社交网络、交通路网、生物分子结构。核心挑战:数据的异构性、时变性、无限性以及复杂的关联结构。引言:复杂数据的世界时序数据挖掘02Time
Series
Data
Mining时间序列数据的来源与规模日常生活中的时序数据时序数据无处不在:股价波动、气候变化、心电信号、用户行为等,承载丰富动态信息。规模爆炸式增长随互联网、物联网、工业数字化发展,来自数字媒介、传感器、监控设备的海量数据每日产生,累计达到PB级别,推动“有效处理与深入挖掘”成为关键问题时序分析的关键特性一维数据分布特性时间序列分析最显著特点在于其“一维的数据分布特性”,任何任务都必须考虑这一点,不能当作无序数据处理。现实数据的典型困难由于数据来源多样,常遇到长度不一、采样频率不同、含噪声的时间序列;因此分析时不仅要看数值,更要处理时间结构与尺度差异。形式转换/统一为了有效地借鉴其他领域的数据挖掘方法,如何标准化并转换时序数据的形式成为一个重要议题同一个信号进行相同采样点数N,不同采样频率采样后的plot图像时间序列的统一表示按时间t_i升序排列的三元组序列其中𝑋𝑖Xi表示𝑡𝑖ti时刻变量值,𝑌𝑖Yi表示标签值。一般意义的时间序列常用(𝑥𝑖,𝑡𝑖),但为了适配涉及的多种任务,扩展为(𝑥𝑖,𝑡𝑖,yi)标签扩展与多变量yi可表示插补任务中的缺省标签、分类任务中的类别标签、异常检测中的异常标签等,使统一表示能覆盖不同任务。当一个时间点记录温度、湿度、压力等多个传感器数据时,教材用
𝑋X(以及
𝑌Y)表示多变量变量值(以及标签值),便于统一建模时间序列介绍图:时序列分解(原始数据、趋势项、周期项、残差项)
时间序列子序列按时间t_i升序排列的三元组序列S是T的一个长度为m的子序列;因此T也可视为保持有序性的子序列集合。便于在更长尺度上做分类、聚类等任务。标签扩展与多变量子序列之间是否重叠、是否等长,在不同任务中有不同定义;子序列与分段图:庆阳年月平均图时序数据相似性欧氏距离的局限性(EuclideanDistance)传统的欧氏距离要求两个序列长度相等,且对应时间点严格对齐。问题1:相位偏移(PhaseShift):两个形状相似但发生时间略有错位的波形,欧氏距离会很大。问题2:长度不一:无法直接计算不同长度序列的距离。问题3:频率扭曲:语速快慢不同,但内容相同的语音信号。图左:欧氏距离硬性对齐(误差大)图右:DTW弹性对齐(匹配波峰波谷)DTW算法核心思想:核心目标动态时间规整(DTW)可以动态自适应地对齐不同时间序列,更准确地说,DTW可找到Tx与Ty的一种对应关系。不同时间序列可能因采样频率不同,在频域/时域上发生伸缩或弯曲,因此需要对齐后再计算距离(如MSE/MAE/欧式距离)。DTW对齐关系:索引对与三条约束约束1:覆盖性(不遗漏)每个变量值至少应包含在某个索引对中,确保没有遗漏。约束2:边界性(首尾对齐)对应关系必须包含起点(1,1)与终点(M,N),且首尾元素索引对可有多个。约束3:单调性(时间顺序不反转)
索引对应遵循单调原则,不允许时间顺序“反向匹配”。DTW算法DTW:把对齐看成“走格子”的最短路径DTW距离定义为:所有合法对应关系中“总距离最小”的那一个。因此可抽象为走格子:
起点(1,1)>终点(M,N)每一步只能向上、向右、右上走。每个格子的代价是两点间度量
可以用平方差(对应MSE)或绝对差(对应MAE)等。动态规划递推用dp表示到(i,j)的最小累计代价,通过三种前驱取min得到。求得dp[M,N]即DTW度量值;路径本身就是对应矩阵。DTW算法DTW效果与应用提示DTW的优势来自“良好的对齐性质”,在时序预测、时序分类中常表现良好。在语音的孤立词识别任务中,DTW至今仍广泛应用。
计算代价:经典DP时间复杂度为O(MN)工程优化:限制对齐窗口、剪枝、下界加速等(用于检索/批量匹配)。图:同一词语在两个不同人身上的音频信号符号化目的:三元组定义中,每个时间点的变量值X都可以对应一个确定的标签Y,这种离散表示不仅支持划分子序列,也能支持基于字符串匹配的模式挖掘。但很多时候X是连续实数:若要用“字符串算法/离散结构”(哈希、后缀结构、模式发现等),需要先把实值离散化为符号。SAX是典型的时间序列符号化方法:先降维(PAA),再用阈值区间映射到字母表。时间序列符号化图:Rawtimeseries→PAA→SAX
PAA分段聚合近似:给定长度为,选择一个较小的整数按段数w作为目标长度,把原序列按时间顺序划分成划分为w个子序列段。每段用平均值代表,实现降维(通常w<<n)因此,PAA的本质是:用w个“段均值”去近似表示原来的n个点。直观效果:保留整体轮廓/趋势,平滑局部噪声参数含义:w控制压缩率与细节保留的权衡;w小更快更粗,w大更细但开销更高。作用:为SAX的离散化做准备(先降维再映射符号)。PAA算法SAX:离散化与字母表:SAX一般会先把原始序列归一化,再进行离散化;归一化后PAA序列可视为服从正态分布的设定基础。按“等概率”原则,把数值范围切成m份(字母表大小为m),阈值取正态分布的m分位数。如·示例(m=3):阈值约为-0.43与0.43(对应三分位),从而形成a/b/c三个区间映射。字母表更大时仍按相同方法用分位数划分。SAX算法为什么要从时域到频域:DFT与DWT是信号处理的重要分析工具,目标都是把数据从时域转换到频域,以便更好分析处理时序,但转换细节与应用场景不同。频域视角能帮助我们:
1.看周期性/主频成分2.做去噪、压缩与特征提取3.分析平稳/非平稳差异时间序列频域表示同一信号在时域表现为随时间变化的波形,在频域表现为不同频率成分的谱线(通过FFT从时域转换到频域)。DFT离散傅里叶变换:基本思想:DFT/FFT把离散信号表示为一组离散频率的正弦/余弦(或复指数)基函数的线性组合;局限性:不适合处理非平稳信号,因为它默认分析窗口内统计性质不变。DWT离散小波变换:基本思想:DWT是多分辨率分析方法,用小波函数分解信号,能同时提供时间与频率上的局部化信息。缺点:运算量很大;只有数值解,没有解析解。DFT/DWT算法DFT更偏“全局频谱”、平稳信号;DWT偏“多尺度局部”、非平稳信号。输出类型+粒度划分:时序任务可按输出分为:连续输出与离散输出。同时要考虑任务粒度(granularity):从细到粗“点
→
子序列
→
序列”。越细粒度越强调即时性与流式处理;越粗粒度越强调语义与上下文理解。越细粒度越强调即时性与流式处理;越粗粒度越强调语义与上下文理解。右图给出典型任务分布:预测、插补、异常、变点等;离散细粒度常对应二分类,粗粒度常对应多分类。时间序列任务压缩/插补/预测:压缩:把原始时序变成更紧凑表示以节省存储;区别在于必须适应流式新增数据——新增点应能“直接压缩并合并”,不应频繁解压重压。一些典型思路如利用时间戳差分、异或计算或区间估计等降低存储占用。插补:真实采集会出现缺失值(传感器失效、传输错误等),缺失既可能发生在点级也可能发生在子序列级。例如点级插补可视作上采样,不仅补缺省值,非均匀采样下还要把变间距序列补成等间距序列。预测:利用历史序列预测未来时间点或未来窗口;压缩与插补也可视作特殊预测。预测的应用意义:金融风险评估、气象趋势周期分析、交通规划、电力网络稳定维护等。三个基础连续任务把时序变成“可迁移”的高维向量:深度学习带来新视角:时序任务中重要方向之一是表征学习(representationlearning)。目标:通过预训练任务,让网络输出的高维向量经全连接层即可适配多种任务,并获得一致良好表现预训练任务选择:预测是基础性任务,因此常用作预训练目标类比图像“掩码重建”,对完整序列随机加mask并恢复(把插补作为预训练任务)也是可选方案大规模预训练可能带来跨数据集泛化能力。理想表征在空间中会自然形成不同聚类,从而支持分类/聚类/异常检测等任务。表征学习三种表征模式:三种典型表征:按点(point-wise)、按片(patch-wise)、下采样(down-sampling)计算方式:把按固定模式收集到的实值向量与权重矩阵相乘得到表征(教材以矩阵
多变量序列需要考虑“变量间如何融合”:1.通道相关(channel-dependent):不同变量的表征再经变量间权重矩阵聚合;2.通道独立(channel-independent):不显式做变量间聚合。表征学习表征学习与压缩有关联——当能把数据集压缩为一组表征向量及其还原网络,意味着抓住了分析所需关键信息;这种“压缩”不仅是数据量减少,更是特征本质的捕获。异常vs变点:离散任务强调语义捕捉:标签往往来自领域专家对关键时序特征的标注,具有现实意义。异常:某个观测值(点)或一系列观测值(子序列)明显偏离一般分布;异常检测旨在识别不符合预期模式的数据点/子序列,用于故障、欺诈、市场异常预警等。变点:前后序列出现明确状态变化的转折点;常用“平稳性”刻画——均值/方差等统计量相对稳定为平稳,显著变化则为非平稳。离散型任务AR/MA/ARIMA经典统计模型:AR(p):用过去p个观测回归预测当前值(自回归,预测值会进入后续预测)MA(q):用过去q个误差项(噪声)构建预测,起到平滑噪声作用。RIMA(p,m,q):在AR与MA之间加入
差分阶数m以处理非平稳序列;(p,m,q)为三类超参数。长期预测:分解
→
直接映射:将序列分解为趋势项+季节项等成分;分解后的成分做从历史窗到未来窗的直接映射(可线性或用网络),避免逐步自回归带来的累积误差。长期预测:分解
→
直接映射:核心递推:
判为变点并重置。阈值
𝜃θ:过大易阈值
𝜃θ:过大易漏检,过小易误报。漏检,过小易误报。离散型任务流式数据挖掘03Streaming
Data
Mining深入探索动态、实时、海量数据流的分析技术什么是流式数据挖掘流式数据挖掘是指在动态、连续生成的海量数据流中,实时提取有价值信息的过程。定义与静态数据集不同,它必须在数据不断变化时迅速识别模式、趋势或异常。核心要求实时性(Real-time):数据到达即处理,无延迟。增量学习(Incremental):模型逐步更新,而非全量重训。一次性处理(One-pass):数据流转瞬即逝,无法回溯。流式挖掘特色高实时性必须在数据到达瞬间做出分析与决策,延迟可能导致信息价值归零。资源受限数据无限而内存有限,无法存储所有历史数据,需依赖摘要结构。动态变化数据分布随时间变化(概念漂移),模型需具备自适应能力。流式数据与时间序列数据尽管两者都涉及“时间”维度,但处理方式和目标有本质区别。流式数据常带有噪声、缺失值,且到达顺序不可预测。关键区别点:数据是否完整?是否允许延迟?是否可以回溯访问?特性时间序列挖掘(TimeSeries)流式数据挖掘(DataStreams)数据状态静态、已预先收集完整动态、无限增长、实时到达访问方式可多次随机访问、回溯通常只能单次扫描(One-pass)时效性允许一定延迟,离线分析要求极高,需实时决策算法重点全量数据的深度分析高效更新、摘要提取、鲁棒性背景案例:高频交易(HFT)毫秒级的竞争在金融市场,延迟几毫秒可能意味着巨大的损失。高频交易依赖于捕捉极短时间内的价格微小波动。流式挖掘彻底改变了金融交易方式,是技术发展的重要动力。传统模式失效:传统的“存储-再分析”模式太慢。流式挖掘优势:数据到达即处理,实时预测趋势,自动执行买卖。挑战一:实时性与时效性案例:网络游戏监控游戏服务器每秒接收数百万用户行为(移动、攻击)。技术难点:如何在数据生成瞬间完成复杂的逻辑分析?需求:必须实时监控以优化体验并防止作弊。后果:几秒的延迟会导致作弊行为未被拦截,严重破坏游戏公平性。挑战二:内存限制技术难点:如何在资源受限情况下完成规模化数据处理与分析?案例:社交媒体分析(Twitter/Weibo)流式数据是“无穷”的,每秒都有成千上万条新内容。困境:内存有限,无法永久存储所有推文。策略:必须设计适应性算法,利用有限内存处理无限数据流。方法:滑动窗口(SlidingWindow)或摘要结构(Sketch)。挑战三:不确定性与噪声技术难点:
算法必须具备强鲁棒性,能自动清洗噪声并填补缺失案例:智慧城市交通监控遍布全城的传感器收集实时路况数据。问题:设备故障、网络延迟导致数据缺失或错误。风险:依赖缺陷数据可能导致误判拥堵,发出错误调度指令。挑战四:模型更新(概念漂移)技术难点:
如何在保证准确性的同时实现低成本的频繁更新?案例:电商推荐系统用户的购物偏好随季节、潮流不断变化。静态模型缺陷:仅基于过去的数据训练,推荐可能已过时。流式需求:模型需随新数据到达而动态更新,捕捉最新的用户兴趣。处理方式:滑动窗口模型只关注最近一段时间的数据,旧数据从窗口移出,新数据加入。解决问题:内存限制。保证算法始终处理最新数据。固定窗口:大小固定(如最近1小时)。自适应窗口:根据波动调整。波动剧烈时缩短窗口提高敏感度;平稳时延长窗口降低计算成本。处理方式:倾斜时间窗口赋予不同时间段不同权重近期数据:权重高,精度高(关注当下爆发点)。远期数据:权重低,精度低(仅保留长期趋势概要)。应用:微博热搜
快速捕捉突发新闻的热度上升,同时保留历史热点的衰退轨迹。处理方式:基于摘要的数据结构核心思想在内存极小的情况下,通过特定的数据结构保存数据的“草图”(Sketch),而非原始数据。典型代表:布隆过滤器应用:垃圾邮件过滤能极快地检查某邮件是否在黑名单中,占用空间极小。虽有极低误判率,但换取了极高的效率。流式挖掘典型算法流式聚类实时对数据进行分类,捕捉群体模式变化。
CluStream,DenStream频繁模式挖掘识别高频出现的项集(如关联商品)。
LossyCounting,FP-Stream异常检测迅速识别欺诈、入侵等偏离正常模式的事件。
kNN流检测一、流式数据聚类与传统聚类(K-Means/DBSCAN)的区别关键技术:微簇(Micro-cluster)
不仅存储数据点,而是维护一组由于数据点聚集而成的“微型统计特征”,随新数据动态调整。传统:假设数据静态,内存可全量载入,多次迭代。流式:数据无法一次性存储,必须增量更新。一、流式数据聚类微簇(Micro-cluster)的结构微簇是CluStream的核心数据结构,它是一个五元组,包含:通过仅存储这些统计量,极大地节省了内存。中心(Center):数据点的质心。权重(Weight):包含的数据点数量。时间戳(Timestamp):最后更新时间,用于衰减历史权重。平方和与线性和:用于计算半径和密度。一、流式数据聚类核心算法:CluStreamCluStream创新性地将聚类过程分为两个阶段,平衡了实时性与准确性。第一阶段:在线(Online)实时维护微簇处理高速数据流,生成并更新微簇的统计信息(中心、权重、时间戳)。这是对数据的初步压缩。第二阶段:离线(Offline)宏聚类生成当用户请求时,基于微簇(而非原始数据)使用传统算法(如K-Means)生成最终的高层聚类结果。一、流式数据聚类核心算法:CluStream、DenStream等优缺点比较二、流式频繁模式挖掘应用场景挑战:内存有限,不能像Apriori算法那样多次扫描数据库。电商推荐:实时发现“啤酒+尿布”式的关联购买。网络安全:识别频繁出现的攻击特征序列。IoT监控:发现传感器读数的频繁异常组合。二、流式频繁模式挖掘核心算法:FP-StreamFP-Stream结合了FP树数据结构与滑动窗口技术。紧凑存储:FP树高效压缩存储频繁项集,减少内存。模式衰减(Decay):引入衰减因子,旧的频繁模式权重随时间降低,确保关注近期趋势。批量更新:仅处理窗口内的新数据,动态裁剪树结构。二、流式频繁模式挖掘核心算法:有LossyCounting、FP-Stream等算法比较三、流式异常检测识别“与众不同”的数据在连续数据流中,实时发现偏离正常模式的点。难点:概念漂移(正常的定义可能会随时间改变)。网络安全:DDoS攻击流量监测。金融反欺诈:信用卡盗刷实时拦截。工业预测:机器故障前的振动异常。三、流式异常检测常用的流式异常检测算法三、流式异常检测k近邻流异常检测算法(1)局部密度假设:通过评估新数据点与其k个最近邻的相对距离来判断其是否为异常。(2)基于邻居的异常评分:算法维护一个动态的邻居集,通过计算新数据点与其k个邻近点的距离,获得一个异常评分。(3)滑动窗口机制:在流式数据场景中,算法使用滑动窗口的方式,实时更新邻居集合,以便适应数据流的变化。随着新数据的到来,旧的数据点被逐步移除,确保邻居集合始终保持最新。图数据挖掘04Graph
Data
Mining图数据挖掘概述什么是图数据?图数据是一种用于描述实体间关系的半结构化数据类型。核心价值:揭示复杂网络中的潜在模式,如影响力用户、最优路径、关键功能模块等。•节点(Node/Vertex):表示实体(如用户、基因、路由器)。•边(Edge):表示实体之间的关系(如关注、相互作用、连接)。•图数据挖掘三大核心1.节点分析度量节点的重要性,揭示其在网络中的地位(如KOL、核心服务器)。2.路径分析理解节点间的连通性、最短路径及传播效率(如导航、病毒传播)。3.社区发现识别关系紧密的节点群体,发现潜在的兴趣组或功能模块。一、节点分析目的识别和理解图中具有特殊地位的节点。这些关键节点往往对系统的稳定性和效率有显著影响。典型应用场景•社交网络:识别影响力强的用户(信息传播核心)。•互联网/电信:识别核心服务器或路由器(流量管理)。•生物网络:识别关键基因或蛋白质(疾病靶点)。节点重要性度量如何衡量一个节点在网络中有多“重要”?我们将学习三种最经典的方法:度中心性DegreeCentrality"谁的朋友最多?"接近中心性ClosenessCentrality"谁能最快联系到所有人?"PageRank网页排序算法"谁被重要的人关注?"度中心性(Degree
Centrality)最简单直观的度量,衡量节点的直接连接数。其中deg(v)是连接边数,N-1用于归一化。物理意义无向图公式:•社交网络:活跃度、受欢迎程度。•无向图:网络的“枢纽”。•局限性:仅关注局部连接,忽略全局位置和边权重。有向图中的度中心性意义:“受关注度”或“声望”。例如:微博大V,被很多人关注。意义:“活跃度”或“传播力”。例如:信息转发者,发出很多链接。入度中心性(In-degree)出度中心性(Out-degree)接近中心性(ClosenessCentrality)衡量节点到其他所有节点的平均最短距离。反映了节点在网络中的“中心”位置及传播效率。值越大,越接近中心,传播越快。应用场景•物流/交通:寻找最佳配送中心或
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 选择性必修3 第4单元 第11课 创新思维要善于联想
- 2026年油库防火防爆培训试题(附答案)
- 具身智能+智慧农业机器人种植管理方案
- 2025年绿色家居市场品牌策略研究及可行性报告
- 线上健身房服务消费者品牌忠诚度评价报告2025
- 雨污管网建设项目顶管专项施工方案 - 计算书
- 球员违规处罚实施细则
- 八年级下册英语外研版Module 1过关测试含答案
- 门诊医生个人述职报告(3篇)
- 2026秋小学人教版一年级上册数学《第三单元三 认识立体图形》测试卷附参考答案
- 四川蜀道铁路投资集团有限责任公司2026年秋季校园招聘笔试备考题库及答案详解
- 2026年静脉治疗理论试题及答案
- 2026年乡镇副镇长公开选拔面试试题附答案
- 《技术学科知识与教学能力》(高级中学)全套备考核心资料(含真题解析)
- 2026年秋季七年级生物上册苏教版教学计划
- JJG 688-2025 汽车排放气体测试仪检定规程
- 化工园区公共管廊钢结构工程竣工验收报告
- 收费站机电维护知识讲座
- 非遗文化创意产品设计 课件全套 第1-5章 概述- 非遗文创产品设计案例解析
- 新概念英语第二册+Lesson+4+An+exciting+trip+讲义
- 初中奥数28条知识点总结
评论
0/150
提交评论