模式识别与数据挖掘 课件 第9、10章-频繁模式挖掘、专家先验驱动交互_第1页
模式识别与数据挖掘 课件 第9、10章-频繁模式挖掘、专家先验驱动交互_第2页
模式识别与数据挖掘 课件 第9、10章-频繁模式挖掘、专家先验驱动交互_第3页
模式识别与数据挖掘 课件 第9、10章-频繁模式挖掘、专家先验驱动交互_第4页
模式识别与数据挖掘 课件 第9、10章-频繁模式挖掘、专家先验驱动交互_第5页
已阅读5页,还剩70页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第九章

频繁模式挖掘主讲人:某某某PatternRecognitionandDataMining模式识别与数据挖掘目录Contents引言Introduction基本概念BasicConceptsApriori算法AprioriAlgorithmEclat算法EclatAlgorithm01020304关联规则发现DiscoveryofAssociationRules小结与讨论SummaryandDiscussion0607FP-Growth算法FP-GrowthAlgorithm05引言Introduction01引言频繁模式挖掘频繁模式挖掘是数据挖掘的一项重要任务,旨在从大规模数据集中识别出频繁出现的模式、项集、子序列或结构。这些模式可以反映数据中隐含的关联关系,有助于企业和研究人员更好地理解数据特性和发现价值洞见,为精准决策提供数据支撑。经典案例20世纪90年代的美国沃尔玛超市,在某些特定情况下“啤酒”与“尿布”两件看上去毫无关系的商品会经常出现在同一张购物清单中。后续调查发现,这种现象出现在年轻的父亲身上,他们在超市里购买尿布时,为了犒劳自己,往往顺手还会购买啤酒。把啤酒和尿布摆放在更靠近的货架上,这一简单的调整居然让啤酒的销量大幅增长。基本概念02BasicConcepts每条游记对应一个事务,包含不同用户到某个旅游城市的游玩景点集合。这个数据集共包含6条游记,涵盖a,b,c,d,e这5个景点,每个景点对应一个项。项集对应一个或者多个景点的组合,由于该数据集共包含5个不同景点,可产生25=32种项集,例如{a,b,c,e}是一个项集,但它没有对应数据集中任何一个事务。基本概念基础术语定义事务数据集:事务数据集是一个包含多个事务(Transaction)的集合,用字母D表示,每个事务由若干个项组成,可形式化表示为D={t1,t2,...,tn},其中ti

表示第i个事务。项与项集:项(Item)指的是在某个事务中的单个元素,项集(Itemset)是项的集合。本章用小写字母a,b,c等表示项,用X表示项集。将包含k个元素的项集称为k项集。示

例基本概念支持度:项集X的支持度sup(X)是指包含项集X的事务在数据库D中的比例,其数学表达式为:其中,|D|是数据库中的总事务数,|{ti∈D:X⊆ti}|是包含项集X的事务数。频繁项集:指在数据库中满足最小支持度阈值min_sup的项集,其中min_sup是用户设定的参数。旅游场景数据中,如果设置最小支持度阈值min_sup=3,通过观察发现,项集{a}的出现频率为4,超过了最小阈值,因此它是一个频繁项集。类似地,项集{b},{c},{a,b}的出现频率也都大于或等于3。因此在该案例下,频繁项集为{a},{b},{c},{a,b}。示

例基础术语定义基本概念关联规则:数据挖掘中一种用来发现数据项间有趣关系的方法,它从频繁项集中推导出规则,用于描述在一组事务中某些项的出现如何影响其他项的出现。形式上,关联规则表示为X⇒Y,我们称关联规则左侧项集X为先决条件,右侧项集Y为相应的关联结果。基础术语定义置信度:关联规则使用置信度(confidence)来衡量规则的可靠性。置信度是指在事务包含项集X的条件下,同时包含项集Y的条件概率,即:关联规则“雷峰塔⇒飞来峰”的置信度为3/4=0.75,说明雷峰塔与飞来峰比较适合成为联票的景点组合。频繁项集和关联规则均是在大规模数据集中寻找某种关联关系的任务。示

例Apriori算法03AprioriAlgorithmApriori算法Apriori算法是数据挖掘中最经典的频繁项集挖掘算法之一,由拉凯什·阿格拉沃尔(RakeshAgrawal)和拉马克里希南·斯里坎特(RamakrishnanSrikant)于1994年在IBMAlmaden研究中心提出,专门用于发现事务数据中的频繁项集和关联规则。算法思想项集剪枝:在每一轮迭代中,Apriori算法都会扫描整个数据库的所有事务,并统计每个候选项集的支持度。对于那些支持度大于或等于设定的最小支持度阈值min_sup的项集,它们将被保留为频繁项集,否则就会被剪枝

。逐层搜索:Apriori算法采用逐层搜索的方式,即从第一层的所有1项集开始,逐步生成第二层、第三层等包含更多元素的项集,而且每一层是基于前一层的频繁项集扩展生成候选项集。扩展项集:在每一轮迭代中,算法将根据上一层保留的候选项集来生成更大的候选项集。扩展规则是对于两个k项集,如果它们的前k−1个元素是一样的,则这两个集合可以合并成一个k+1项集。Apriori算法算法流程对数据库D的所有事务进行第一轮扫描,计算每一项出现的次数并生成候选项集C1。已知最小支持度计数min_sup=2,将候选项集C1中所有支持度计数⩾2的候选项筛选出,生成频繁项集L1。由于在C1中所有候选项的支持度计数均不小于最小支持度min_sup,因此在生成L1时没有候选项集被删除。Apriori算法算法流程示例Apriori算法算法流程示例将频繁1项集L1与自身连接,生成候选2项集C2。再次扫描数据集D中所有事务,对候选2项集C2中所有项集进行计数。将候选项集C2中所有支持度计数⩾2的候选项筛选出,生成频繁2项集L2,包含6个符合条件的项集。Apriori算法算法流程示例将频繁2项集L2与自身连接,同时,由于所有频繁项集的非空子集必须是频繁的,因此将不符合条件的项进行剪枝,最终生成候选3项集C3。再次扫描数据集D中所有事务,对候选3项集C3中所有项进行计数。将候选项集C3中所有支持度计数⩾2的候选项筛选出,生成频繁3项集L3,其中仅有一个项集符合条件。L3只有一个频繁项集,无法再继续扩展生成更多的候选项集,算法结束。Apriori算法算法流程示例该数据集共有:5个频繁1项集{a},{b},{c},{d},{e},6个频繁2项集{a,b},{a,c},{a,d},{b,c},{b,d},{b,e},1个频繁3项集{a,b,d}。Eclat

算法04EclatAlgorithmEclat算法为减少数据库的扫描和计算代价,Eclat算法提出了全新的数据模型和候选项集生成方式,它使用垂直数据格式,直接维护每个项集与其对应的事务ID集合的关联关系,通过深度优先搜索与交集运算来便捷地生成频繁项集,其核心优势是只需扫描一次数据库,因此可以大大降低统计候选项集出现次数的计算代价。算法思想深度优先搜索:与Apriori算法的广度优先搜索不同,Eclat采用深度优先搜索策略来遍历项集的所有可能性。这种搜索方式可以快速地深入到频繁项集的层次结构中,缩减不必要的搜索空间。另外,由于深度优先搜索是逐步构建频繁项集的,不需要同时存储所有可能的项集组合,因此可以减少内存的占用。垂直数据格式:Eclat算法使用的是垂直数据格式,每个项集被表示为一个事务ID列表。这种垂直数据布局的优势在于,通过集合操作(如交集运算),可以快速计算频繁项集的支持度,而无须多次扫描数据库。Eclat算法算法流程Eclat算法算法流程示例将数据集D表示成垂直格式,筛选出支持度计数⩾2的部分。Eclat算法算法流程示例从第一项{a}开始,首先将它的TID列表与项集{b}的TID列表进行交集运算,生成2项集{a,b}:{t1,t2,t3},它的支持度为3,超过最小支持度计数,因此是频繁项集。根据深度优先搜索策略,我们继续对频繁2项集{a,b}进行扩展,与频繁项集{c}进行交集运算,得到{a,b,c}:{t3}不为频繁项集。回溯至节点项{a,b},与{d}做交集运算,生成频繁3项集{a,b,d}:{t1,t3}。将{a,b,d}与{e}求交集,为空集。回溯至{a,b}。同理,生成3项集{a,b,e}:{t4},由于{a,b,e}不满足最小支持度计数,因此不为频繁项集。{a,b}节点下所有频繁项集已找出,回溯至{a}。Eclat算法算法流程示例{a}与{c}取交集,生成频繁2项集{a,c}:{t3,t6}。继续将{a,c}分别与{d}、{e}做交集运算,得出{a,c,d}:{t3}、{a,c,e}:{},均不为频繁项集。同理得出{a,d}:{t1,t3}为频繁2项集,而{a,d,e}为空集;{a,d}:{t4}同样不为频繁项集。Eclat算法算法流程示例回溯至根节点,同理可以找出{b}、{c}、{d}下的频繁项:{b,c}:{t2,t3}、{b,d}:{t1,t3},以及{b,e}:{t4,t5}。综上,在最小支持度计数为2的情况下,该数据集共有5个频繁1项集,6个频繁2项集和1个频繁3项集。且与Apriori算法相比,Eclat算法避免了对原数据集的重复多次扫描,在数据量较小的情况下更加高效。FP-Growth算法05FP-GrowthAlgorithmFP-Growth算法①ACMSIGMOD被认为是数据管理领域最顶级的国际学术会议。FP树的结构FP树(frequentpatterntree,频繁模式树)是一种用于存储频繁项集的数据结构,它是一种树状的结构,由节点和边组成。FP树的每个节点包含一个项和一个计数,表示该项在数据集中出现的次数。同时,每个节点预留一个指针空间,用于形成后面提到的链表结构。FP-Growth(frequentpatterngrowth,频繁模式增长)算法是一种比Apriori和Eclat算法更为高效的频繁项集挖掘方法,它是由韩家炜(JiaweiHan)等人在2000年的ACMSIGMOD①论文中首次提出的。FP-Growth是一个在磁盘I/O、内存使用和计算代价方面均有优势的算法,它设计了巧妙的数据结构,无论多少数据,只需要扫描两次数据集,且避免了频繁的集合交集操作,因此很大程度地提升了挖掘效率。每个事务的项会按照出现频率进行排序(通常采用降序排序),然后对应一条从根节点到叶节点的路径,其中的每个项对应一个节点。FP-Growth算法①ACMSIGMOD被认为是数据管理领域最顶级的国际学术会议。FP树的结构FP树的频繁项集挖掘算法还需要项头表(headertable)来配合执行,利用它为挖掘频繁项集提供有效的导航工具。项头表里面记录了所有的频繁1项集出现的次数,它们按照支持度降序排列。项头表中的每一项包含三个元素:项的名称,支持度计数,以及一个指向FP树中该项第一个节点的指针。FP树的构建FP树的构建只需要对数据集进行两次扫描。第一次扫描统计每个项的出现频率,并将频繁项按照支持度降序排列。第二次扫描将事务插入到FP树中。每个事务中的项按照频繁项的顺序进行排序,并过滤掉不频繁的项。最后,将排序后的事务插入到FP树中,相同的项会共享节点,从而实现数据的压缩。FP-Growth算法对数据集D进行一次扫描,对每一项的出现频次进行计数,并根据频次大小降序排列。构建FP树,创建树的根节点,记为null。从数据集D的第一个事务开始扫描,第一个事务为{a,b,d},按照排列好的顺序,依次链接,即b链接到null上,a链接到b上,d链接到a上,并更新每一个节点的计数。同时,创建项头表,将FP树上的节点链接到项头表相应项的头节点上,以便对树的遍历。扫描至第二个事务{b,c},先按顺序依次链接。由于已存在b链接到null节点,则直接将已有b节点计数更新为2,再将c更新为已有b节点新的子树,并将计数记为1。将c节点链接至项头表的相应头节点上。FP树的构建示例FP-Growth算法扫描至{b,a,c,d},同理按顺序依次链接。更新b节点计数更新为3,a节点计数更新为2,再将c更新为已有a节点新的子树,将d更新为c节点新的子树,并分别将计数记为1。由于在前两步中已存在c,d两个节点,这一步新添加的两个节点可通过与之前对应的节点相链接从而链接上项头表。扫描至{b,a,e},更新b节点计数更新为4,a节点计数更新为3,再将e更新为a节点新的子树,计数记为1。将新添加的e同样链接到项头表的相应头节点上。FP树的构建示例FP-Growth算法扫描至{b,e},更新b节点计数更新为5,再将e更新为b节点新的子树,计数记为1。将新添加的e链接到上一个e节点,即a节点到子树e。扫描至{a,c},将a链接到null上,c链接到a上,并更新每一个节点的计数。同时,更新该节点与项头表之间的链接。FP树的构建示例FP-Growth算法FP-Growth算法思想在建立FP树之后,可以通过FP-Growth算法来快速寻找数据集包含的频繁项集。它从项头表中的最后一项开始搜索,沿着该项在项头表中的指针,遍历FP树中所有该项的节点。对于每一个频繁项X,通过它的前缀路径,即通过反向查找项的父节点到根节点的路径,找到它的条件模式基。统计条件模式基中每个项的支持度计数,筛选出频繁项,然后按照支持度计数降序排列。条件模式基是以项X为目标项的所有前缀项的集合,可以把它看作是一个子数据库。通过这些前缀项,构建项X的条件FP树。对于条件FP树,递归地执行与主FP树相同的操作,挖掘频繁项集。每次递归得到的结果组合起来形成更大的频繁项集。通过将项X与从条件FP树挖掘到的频繁项集进行组合,生成新的频繁项集。当递归完成时,所有频繁项集会被组合和输出。FP-Growth算法算法流程示例首先写出以e结尾的条件模式基,null到e的通路有2条,分别经过{b,a}和{b},而两个节点的e计数均为1,则条件模式基为{b,a:1},{b:1}。因此,产生1个频繁模式{b,e:2}。FP-Growth算法算法流程示例以d结尾的条件模式基,null到d的通路有2条,分别经过{b,a}和{b,a,c},而两个节点的d计数均为1,则条件模式基为{b,a:1},{b,a,c:1}。因此,产生3个频繁模式{b,d:2},{a,d:2},{b,a,d:2}。FP-Growth算法算法流程示例以c结尾的条件模式基,null到c的通路有3条,分别经过{b,a},{b}和{a},而三个节点的c计数均为1,则条件模式基为{b,a:1},{b:1},{b,a:1}。因此,产生2个频繁模式{b,c:2},{a,c:2}。FP-Growth算法算法流程示例以a结尾的条件模式基,null的子树不计入数据,null到a的通路有1条,即经过{b},其节点计数为3,则条件模式基为{b:3}。因此,产生1个频繁模式{b,a:3}。FP-Growth算法算法流程示例在FP-Growth算法下,频繁1项集在构建FP树前即可知有5个,其余频繁项集通过对FP树的挖掘可知共7个,即在最小支持度计数为2的条件下,该数据集共12个频繁项集。关联规则发现06DiscoveryofAssociationRules关联规则发现关联规则发现是数据挖掘中的一项重要技术,主要用于发现大数据集中不同项之间的关联关系。这些关系通常以“如果……那么……”的形式表示,称为关联规则。实现关联规则发现的过程通常包括两个主要步骤。Step1:发现频繁项集在关联规则发现的初始阶段,首要任务是通过设定支持度阈值识别数据集中的频繁项集。为了有效发现频繁项集,常用的算法包括Apriori算法、FP-Growth算法、Eclat算法等。主要步骤Step2:生成关联规则在识别出频繁项集之后,下一步通过设定置信度与提升度阈值进行筛选,从这些频繁项集中提取出具体的关联规则。关联规则通常以“如果……那么……”的逻辑形式表达,其中“如果”部分称为前件(antecedent),“那么”部分称为后件(consequent)。关联规则发现指标定义公式意义置信度(Confidence)在前件出现的情况下,后件也出现的条件概率衡量规则的准确率提升度(Lift)后件在前件出现时的条件概率与后件在整个数据集中出现的无条件概率之比衡量规则的有效性(是否优于随机猜测)评估指标小结与讨论07SummaryandDiscussion小结与讨论算法对比总结

感谢聆听汇报人:某某某Thankyouforlistening第十章

专家先验驱动交互主讲人:陈宇飞PatternRecognitionandDataMining模式识别与数据挖掘目录Contents模型可解释性ModelInterpretability先验知识表示方法PriorKnowledgeRepresentation先验知识融入策略PriorKnowledgeIntegration模型评估指标ModelEvaluationMetrics01020304应用案例:医学管状分割模型的先验知识融入ApplicationCase05模型可解释性01ModelInterpretability模型可解释性深度学习的成功与可解释性的挑战神经网络的错误预测示例。左列是从ImageNet数据集中随机抽取的三张图片,右列是使用了“最小失真”[1]算法得到的图像,中列是左右两列图像的差别。使用AlexNet预测,左列均能得到正确的结果,而右列均被预测为“咖啡壶”。[1]CSzegedy.“Intriguingpropertiesofneuralnetworks”.In:arXivpreprintarXiv:1312.6199(2013).模型可解释性可解释性的重要性随着深度学习等复杂模型在关键领域的广泛应用,其内部决策过程的“黑箱”特性已引发日益增长的关注。模型可解释性不仅是学术研究的焦点,更是连接技术能力与实际需求的核心桥梁。它在提升系统可靠性、满足伦理与法律要求、以及支持科学发现等方面,均具有不可替代的价值。1.提升系统可靠性在自动驾驶、医疗等高可靠场景中,模型故障可能造成严重后果。可解释性帮助工程师理解模型决策逻辑,从而识别风险、定位问题,构建更安全的智能系统。2.满足伦理与法律要求算法公平性已成为社会关注焦点。模型可能继承数据偏见,在信贷、招聘等领域导致歧视结果。GDPR等法规要求自动化决策具备透明度,可解释性技术有助于检测偏差、满足合规要求。3.支持科学发现在生物、天文等科研领域,深度学习能揭示复杂数据模式。可解释性方法可将模型决策转化为可理解的机制描述,促进科学假设的形成与验证。模型可解释性可解释性的分类模型可解释性可从多个视角系统分类,以全面理解其方法与应用,包括模型属性、解释范围、解释形式与网络结构:模型属性:区分内在可解释性与事后解释,关注模型是否自带透明度;解释范围:区隔局部与全局解释,明确解释针对单次预测还是整体行为;解释形式:涵盖显式/隐式及不同类型输出(如规则、归因、示例);网络结构:聚焦深度网络的表示特性与层次作用,剖析内部机制。模型可解释性模型属性视角从模型属性角度,机器学习模型的可解释性可分为内在可解释性和事后可解释性两类,其区别在于模型自身是否易于理解,以及是否需要借助外部解释工具进行分析。内在可解释性指模型结构本身具有透明性,例如线性回归、逻辑回归、决策树等,可直接理解其决策依据。线性模型:通过特征权重直观反映各特征对预测的影响大小和方向。决策树:结构直观展示从根节点到叶节点的决策路径,便于理解特征如何参与分类或回归。这类模型无需额外解释工具,其自身结构已具备较强的可读性。内在可解释性事后可解释性针对无法直观理解的“黑箱”模型(如深度神经网络、集成方法等),可通过与模型无关的方法进行解释;线性代理模型(LIME):通过局部扰动拟合线性模型,解释单一样本的预测依据。决策树转换:将复杂模型转化为决策树结构(如DeepRED),提供可视化决策路径。规则提取:从模型中提取简洁的逻辑规则,解释其决策过程。这些方法可在不改变原模型的前提下,帮助我们理解其内部行为与决策逻辑。模型可解释性解释范围视角另一种常见的可解释性分类方式基于解释的覆盖范围,分为局部可解释性和全局可解释性。它们分别从微观和宏观的角度帮助我们理解模型的决策过程。局部可解释性局部可解释性关注单一样本的预测结果,旨在解释模型对特定输入为何做出某一预测。它不分析模型整体结构,而是将模型视为“黑箱”,分析特定数据点的特征对当前预测的影响。例如,LIME方法通过局部扰动构建简单模型,解释该样本附近哪些特征最为关键。这类方法特别适用于复杂模型和实际应用场景,如在医疗诊断中分析某位病患被预测为某种疾病的原因。全局可解释性旨在理解模型在整个数据集上的行为模式,包括特征的整体重要性、交互作用及决策逻辑。它通常需要借助模型结构或全局分析方法,如特征重要性分析、部分依赖图等。全局可解释性有助于评估模型的整体性能、公平性与一致性,如在金融风控中分析模型如何综合不同风险因素做出决策。局部与全局可解释性分别从具体和整体视角解释模型,并无严格界限。全局可解释性模型可解释性解释形式视角解释方法可根据其解释能力与复杂度的递进关系进行分类,从最直观的示例到最严密的逻辑规则,层层深入。这一递进框架有助于我们从不同层面理解模型的决策过程。模型可解释性网络结构视角深度神经网络通常具有层级化的组织结构,这为理解其内部表示与决策机制提供了结构化的分析视角。层的作用深度网络的不同层往往学习不同层级的特征,例如从边缘、纹理到语义概念。部分中间层学到的特征表示具有可迁移性,可应用于其他任务,体现了其学习到的知识的通用性,也为理解网络层级功能提供了依据。个体单元的作用单个神经元或卷积滤波器常对应于特定的视觉特征或模式。通过可视化其最大激活输入,可直观理解该单元所响应的特征,如边缘、纹理或物体部件,从而解释其在识别过程中的作用。表示向量的作用网络中高维表示向量可对应到人类可理解的概念。例如,概念激活向量(CAVs)等方法能够将向量方向与语义概念关联,揭示网络如何基于概念进行决策,从而增强对表示空间的理解。模型可解释性交互式知识发现与意义随着可解释性研究的深入,我们不再满足于被动理解模型,更希望通过人机交互,将用户认知与模型逻辑相结合,共同推进复杂问题的规律探索与知识拓展。交互式知识发现由此兴起。其核心在于,通过动态交互将模型生成的解释与用户领域知识融合,实现更高效的知识发现。相比传统被动分析,这一过程强调人类与系统的协同参与:用户可实时调整输入、探索中间特征或修改参数,观察结果变化,从而深入理解模型行为、发现潜在规律,并为模型优化提供直接反馈。因此,交互式知识发现既是消解“黑箱”的关键手段,也是推动人工智能与科学研究深度融合的重要工具。其主要意义体现在以下几个方面:提高模型透明度发现潜在偏差与错误优化模型性能适应复杂任务需求先验知识表示方法02PriorKnowledgeRepresentation先验知识表示方法知识与先验知识知识:一般来说,知识的含义很难定义。在知识的产生过程中,它首先作为有用的信息出现,随后得到验证。人们使用大脑的统计处理能力或通过咨询受信任的权威机构来验证有关世界的信息,实证研究或科学实验给出了明确的验证形式。、知识的形式化:关于知识在机器学习中的使用,其一个重要方面是它的形式化。形式化的程度取决于知识是否已被表示为书面形式,写作的结构如何,以及所使用的语言的正式程度和严格程度。先验知识:如果知识是预先存在并且独立于学习算法的,那么它可以称为先验知识。此外,这种先验知识可以通过形式表示来提供,这些表示以外部的方式存在,与学习问题和通常的训练数据分开。先验知识表示方法先验知识来源科学知识我们将科学、技术、工程和数学学科归入科学知识。这些知识通常可通过科学实验明确地形式化和验证。例如:·

物理学的普遍定律·

基因序列的生物分子描述·

材料形成的生产过程世界知识世界知识是指日常生活中几乎每个人都知道的事实,因此也可以称为一般知识。世界知识可以是直观的,并通过人类在周围世界中的推理来隐含地验证。例如:·鸟有羽毛会飞的事实·语言的语法和语义专家知识专家知识是由特定专家组持有的知识。在专家社区中,它也可以称为常识。专家知识需要通过一组经验丰富的专家进行隐式验证,从而验证其内容的正确性。例如:·

工程师的经验·

医生的领域知识先验知识表示方法先验知识表示方法先验知识的表示方法主要包括以下七种[2]:1.代数方程代数方程将知识表示为由变量或常量组成的数学表达式的相等或不相等关系。方程可用于描述一般函数或将变量约束为可行集,因此有时也称之为代数约束。2.仿真结果仿真结果描述了计算机仿真的数值结果,它是对真实过程行为的近似模拟。仿真引擎通常使用数值方法来求解数学模型,并为特定情况的参数生成结果,该结果即为最终的知识表示。3.空间不变性空间不变性描述了在几何变换下不会改变的属性。如果几何对象在此类转换下保持不变,则它具有对称性。如果函数的参数对称变换具有相同的结果,则可以将其称为不变性。[2]VonRuedenL,MayerS,BeckhK,etal.Informedmachinelearning–ataxonomyandsurveyofintegratingpriorknowledgeintolearningsystems[J].IEEETransactionsonKnowledgeandDataEngineering,2021,35(1):614-633.先验知识表示方法先验知识表示方法4.逻辑规则逻辑提供了一种将有关事实和依赖关系的知识形式化的方法,并允许将普通语言语句转换为形式化逻辑规则。逻辑规则也称为逻辑约束或逻辑语句。5.知识图谱在图论中,图的形式为(V,E)。其中V是顶点集,而E表示边集。在知识图谱中,一般规定顶点用于描述概念,而边描述它们之间的(抽象)关系。在普通加权图中,边的值量化了节点之间的关系。6.概率关系概率关系的核心概念是随机变量X来自可以根据基础概率分布P(X)进行抽取的样本x。先验知识可以是对随机变量的条件独立性或相关结构的假设,甚至是对联合概率分布的完整描述。7.人工反馈人类反馈是指通过用户和机器之间的直接接口转换知识的技术。典型的模式包括键盘、鼠标和触摸屏,其次是语音和计算机视觉,例如用于运动捕捉的跟踪设备。先验知识的表示方法主要包括以下七种:先验知识融入策略03PriorKnowledgeIntegration先验知识融入策略先验知识可融入的阶段训练数据阶段假设集阶段学习算法阶段最终假设阶段先验知识融入的阶段先验知识融入策略(1)代数方程的融入先验知识来源科学知识:物理学、生物学、工程学中的定律,如运动学方程、密度关系等专家知识:变量有效范围、单调性约束等直觉知识融入策略数据阶段:数据生成、清理与验证模型阶段:假设集定义、特征构造训练阶段:损失函数设计、正则化约束推理阶段:结果验证与后处理校正应用案例:肿瘤体积预测

先验知识融入策略(2)仿真结果的融入先验知识来源自然科学:流体与热力学、材料科学、生命科学工程应用:力学与机器人学、自动驾驶融入策略数据阶段:扩展有限标注数据模型阶段:提供结构性指引、特征筛选训练阶段:软约束形式、混合损失函数设计推理阶段:输出验证与后处理校正应用案例:血流动力学预测先验知识CFD模拟:计算流体力学模拟不同狭窄程度下的血流融入策略利用流体仿真生成大量血流分布数据,补充真实测量;设计关注分叉区域的特征提取模块;定义混合损失函数;通过后处理优化提升预测合理性先验知识融入策略(3)空间不变性的融入先验知识来源世界知识:图像中局部或全局像素相关性,物体识别中的旋转无关性科学知识:物理学诺特定理,对称性对应守恒量融入策略数据阶段:几何变换增强(旋转、平移、缩放)模型阶段:CNN、空间变换网络STN、多尺度特征提取训练阶段:几何一致性损失函数、空间注意力机制推理阶段:多视角验证、旋转/翻转对比分析应用案例:脑肿瘤分割融入策略数据增强:随机旋转、平移、缩放生成多样化样本STN对齐:将不同形态肿瘤归一化到特定空间表示一致性损失:0°和90°影像预测结果在旋转恢复后保持一致先验知识融入策略(4)逻辑规则的融入先验知识来源世界知识:用逻辑规则表示对象属性与关系语言学:情感分析规则、词序列标注规则融入策略数据阶段:数据清理、异常检测、合成数据生成模型阶段:知识图谱嵌入、因果推断网络训练阶段:逻辑一致性损失、对抗样本生成指导推理阶段:预测结果一致性检查、后处理校正应用案例:多模态肺癌诊断

先验知识融入策略(5)知识图谱的融入先验知识来源世界知识:视觉实体关系、词语语义关系(词网)科学知识:基因-蛋白质相互作用、疾病分类系统(ICD)融入策略数据阶段:精确标注、语义一致合成数据模型阶段:图卷积网络GCN、图注意力网络GAT训练阶段:图谱一致性损失、路径推理监督推理阶段:调整分类置信度、生成多模态报告应用案例:肿瘤诊断系统

先验知识融入策略(6)概率关系的融入先验知识来源专家知识:实体关联性、独立性信念(如驾驶员特征与风险)科学知识:基因相互作用网络、基因本体相关性融入策略数据阶段:条件概率分布生成样本模型阶段:条件独立性假设、联合概率分布训练阶段:贝叶斯方法、变分推断、概率图模型推理阶段:概率推断提升可解释性应用案例:VAE预测治疗反应

先验知识融入策略(7)人为反馈的融入先验知识来源文本文档知识:主题专家撰写的文档、指南和手册中的隐性知识代理行为知识:专家在特定任务中的决策过程和策略选择数据模式知识:专家对数据层次结构和内在规律的理解融入策略数据阶段:数据增强、质量控制、标签修正模型阶段:假设约束、特征引导、避免过拟合训练阶段:加权损失,提高训练效率和准确度推理阶段:专家审核模型预测结果,提供不确定情况建议应用实例物体识别:用户通过笔画提供物体边界的纠正性反馈游戏AI:专家用户在Atari游戏中为代理提供口头指令医学诊断:医生标注关键区域、修正诊断结果模型评估指标04ModelEvaluationMetrics模型评估指标(1)准确性评估指标基础准确性评估指标精度(Accuracy):正确预测样本占总样本的比例,适用于平衡数据集召回率(Recall):识别出所有正类样本的能力

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论