版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
数据溯源研究综述
1数据源总结1.1数据溯源和追踪数据起源是一个新兴的研究领域,起源于20世纪90年代,并从“数据公用事业”翻译而来。最初,一些文献被称为数据编年史和数据档案。在那之后,许多文献被称为数据起源,以具有跟踪和再现数据的意义。在本文中,我们被称为数据来源,即回归函数的含义,并从应用的角度强调跟踪过程和方法。目前,数据溯源还没有公认的定义,因应用领域不同而定义各异.Simmhanetal将数据溯源定义为从源数据到数据产品的衍生过程信息;Bunemanetal在数据库领域将其定义为“数据及其在数据库间运动的起源”;Lanter在GIS中将其定义为:数据溯源是对目标数据衍生前的原始数据以及演变过程的描述;Greenwood等人对Lanter的定义进行拓展,认为数据溯源是一种元数据,用来记录工作流演变过程、标注信息以及实验过程等信息.在其它一些领域中还有其它一些叫法:如数据族系(DataLineage)、数据系谱(DataPedigree)、数据来源(DataOrigin)、数据世系等.戴超凡等将数据溯源定义为记录原始数据在整个生命周期内(从产生、传播到消亡)的演变信息和演变处理内容.我们认为,DataProvenance应该翻译成“数据溯源”,强调的是一种溯本追源的技术,根据追踪路径重现数据的历史状态和演变过程,实现数据历史档案的追溯.1.2数据溯源技术国内关于数据溯源研究较少.戴超凡比较系统地研究了数据仓库系统中数据溯源追踪技术;刘喜平等总结了目前计算数据溯源的主要方法和应用;李亚子研究了数据溯源追踪标注模式与描述模型,引入了数据溯源的7W模型;王黎维等研究了对象代理数据库的科学工作流服务框架中的数据跟踪模型,并提出了一种双向指针机制的数据追踪方法.李秀美研究了数据溯源本身特有的安全需求以及广播的加密方案,构建了新的数据溯源安全模型.戴超凡等全面系统地做了数据溯源的综述,介绍了数据溯源的基础研究和开放环境下两个典型的形式化模型.国外已经有很多大学和研究机构将数据溯源作为研究课题,引起很多专家学者的高度关注,我们将在下面详述.ZhuoweiBaoetal开发了一种紧密而有效的可达性标签方案用于解答有关运行在规定说明的工作流溯源的质疑.这种标签方案在某种意义上来讲是最优的,因为它使用对数长度、在线时间运行并能回答任何常规时间中可达性问题.WenchaoZhouetal提出了ExSpan(可扩展的溯源感知的网络系统)设计与应用,ExSpan是在分布式环境中能有效进行网络溯源的通用、可扩展框架平台,并为网络溯源存储定义了一种分布式模型,用数据溯源的理念来解释网络中存在的各种状态,并提供了一种多功能网络机制.GrigorisKarvounarakisetal提出了一种基于元组、半环溯源的ProQL(forProvenanceQueryLanguage)语言,能够解决溯源存储、维护和查询等相关问题.国外对数据溯源的发展越来越重视,有多个国际会议以此为会议主题.比如:WorkshoponDataProvenanceandAnnotation(WDPA),WorkshopontheTheoryandPracticeofProvenance(TaPP),InternationalProvenanceandAnnotationWorkshop(IOAW)等.近年来,有一些研究者对数据溯源进行了综述,现将相关的综述与本文的区别描述如下:刘喜平等着重分析了数据起源计算的两种方法:查询反演法和标注法,强调了两种方法的实现,比较了两种方法的特点;然而,并没有提到其它的计算方法,也没有提出新的思维方式.本文在介绍数据溯源计算方法时,比较了反向查询法和标注法的优缺点,针对标注法需要额外的存储开销,提出标注内容列存储的思想.还提到以下几种数据溯源方法:通用的数据追踪方法,双向指针追踪法,利用图论思想和专用查询语言追踪法,以位向量存储定位等方法.Yogesh的综述中提出了四个数据溯源分类标准,认为数据溯源是元数据的一种,用于跟踪数据演变的过程,强调数据溯源在科学领域和商业领域的重要性.戴超凡的综述中,只介绍了两种比较典型的模型,即开放的数据起源模型OPM和Provenir模型.而本文涵盖了此两种模型外还介绍了另外5种模型,系统全面的介绍了近年来数据溯源的各种模型,而且,提出了一种异构数据的数据溯源模型图,比较符合当今数据所具有的异构、分布等特点.数据世系管理技术研究综述中将数据世系主要分为模式级和实例级演化过程,以模式级和实例级数据世系的表示、查询为主线综述了数据世系的发展历程,并提出四个热点研究方向分别是:数据空间中的数据世系、不确定数据的世系管理、工作流世系管理、数据世系的挖掘和可视化.而本文以数据溯源模型为主,综述了近年来比较典型的模型,提出了异构数据的模型图.在介绍热点方向时认为数据溯源的安全问题以及统一业界标准也属于数据溯源的研究热点方向.本文第一节对数据溯源进行概述.第二节讨论了数据溯源模型,在前人研究的基础上提出了异构数据的数据溯源模型.第三节分析了数据溯源的计算方法并提出了使用列存储节省存储空间的思想.第四节阐述数据溯源的应用,并对每个方向的应用加以实例说明.第五节介绍数据溯源的研究热点和应用方向.最后对数据溯源技术的未来发展进行展望.2数据源模型2.1数据溯源信息的整合与存储建立一个有效的数据模型是数据溯源技术关键所在,根据模型可以初步确定数据溯源的大体步骤,以及数据溯源的基本思路.戴超凡从数据溯源信息管理的角度出发,提出了一种数据溯源模型,但是并没有考虑数据的异构性,随着数据规模的日益庞大以及数据结构的逐渐复杂,不考虑数据的异构特点将很难适合时代的需要,因此,上文提出的数据溯源模型只适合同构的数据溯源情形,并不适合于复杂数据.我们在此基础上提出了异构数据的数据溯源概念,考虑到数据的异构分布的特性,在原有模型上加入异构分层的三维模型.我们采用以横轴表示时间(t)、纵轴表示过程(p),z轴表示数据的异构分布特性.将数据溯源信息保存到不同的数据库中,形成携带溯源信息的异构数据库(如:Access,SQLServer、Oracle等),通过数据库接口(ODBC、JDBC等)以及数据转换工具汇聚成统一的目标数据库.此时,目标数据库携带了数据溯源信息.这个过程的逆过程所经历的路径能够实现数据溯源的各种操作(如:数据追踪、信息评估、过程重现等),从而,完成数据溯源的任务.表示了异构数据的溯源模型.这种模型由以下几个部分组成:获取信息部分、信息存储部分、异构数据处理部分.信息获取:数据溯源的实现过程中,溯源信息是关键,它记录了数据如何能追踪历史的重要信息,根据这些信息可以追踪数据的历史档案,重现数据的演变过程.然而,“溯源信息如何获取?记录哪些内容?”等问题一直没有统一的答案.早期的研究往往只考虑某个数据项的来源,并不关注整个数据从哪里来,这样只能追踪局部数据的历史根源,而达不到整个数据溯源的目的.除此之外,还把标注信息当作元数据一起保存于数据库中以供查询,这样往往难以管理.随着数据量的增大和研究的深入,Buneman等人逐渐改进和完善这种模式,提出why和where型provenance,后来又分出howprovenance等.然而,这种分类并不适合其它工作流领域,于是,Sudha等人提出一个7W模型,这种模型包括:who、when、where、how、which、what、why七个部分的内容.此模型虽然详细且非常周全,但是需要一定的存储开销.信息存储:刘喜平介绍了两种数据溯源存储方法:一种是基于RDBMS存储方案,此方案是基于关系型数据,通过扩充属性的方式来存储溯源信息,即将溯源信息直接存储在关系数据库的二维表中.另一种是基于树型文档存储方案.树型存储方案是将元组、属性、溯源信息作为树的结点来存储,对于带有标注的源数据需要在原树型结构中增加一个子结点(provenance结点)用来表示信息的来源.并对每个带标注的源数据都需添加一个href属性,将其链接到源数据结点.要实现数据溯源,溯源信息的存储非常关键.因为溯源信息需要存储空间来存储,存储方式对数据溯源的性能起着关键性的作用.异构数据处理部分:随着时间的推移和应用的需要,将产生各种各样异构的数据源(比如:Access、SQLServer、Oracle等等).这种异构数据源如何实现数据溯源呢?这是业界一直想解决的一个重点和难点问题.应用程序想要操作不同类型的数据库只需要调用数据库访问接口(ODBC、JDBC等)支持的函数,动态地链接到驱动程序上即可.再通过数据转换工具形成统一的目标数据库.数据溯源信息通过这种途径就能传递到目标数据库中.2.2流溯源信息模型目前,数据溯源模型主要有流溯源信息模型、时间-值中心溯源模型、四维溯源模型、开放的数据溯源模型、Provenir数据溯源模型、数据溯源安全模型,PrInt数据溯源模型等,这些模型都建立在不同领域、不同行业.2008年5月王黎维等人发表的《集成对象代理数据库的科学工作流服务框架中的数据跟踪》中提出了一种部分物化中间数据模型,GrigorisKarvounarakisetal提供了一个高层次的图形工具开发模型来检索数据,而无需知道它的物理细节.下面简单介绍一下几种模型.1.流溯源信息模型由6个相关实体构成,主要包括流实体(变化事件实体、元数据实体和查询输入实体)和查询实体(变化事件实体、接收查询输入实体,包括元数据实体).实体间关系密切,通过这种密切的关系可以根据数据的溯源时间来推断数据溯源.4.1数据库中数据溯源追踪追溯数据溯源的源头可以从研究数据库、数据仓库开始.1991年,Lanter等人开发的LIP系统,用于管理GIS数据的信息演变,可以称之为数据溯源的开山鼻祖.数据库应用中采取的追踪方法主要是注释法和反向查询法.因为两种方法各有其优势,注释法管理简单,DBNotes系统是其典型的代表;而反向查询法追踪简单,典型的系统有Trio和Panda.所以经常采用两种方法相结合的方式进行数据溯源的追踪.但是,数据库中倾向于采用反向查询进行跟踪.文献首次提出利用反向查询进行数据跟踪的观点.提出建立函数用反向查询方式进行数据库系统中的数据溯源追踪,但是,他们的方法只局限在一个DBMS中,如果在多个DBMS中就无法实现数据溯源追踪.论述了如何在关系数据库中计算数据溯源的方法,从而解决了来自不同数据源的数据溯源问题.提出当数据在多个数据库之间传播处理时,由于源数据库和目标数据库之间不存在任何关联,无法实现跨数据库的追踪查询.因此,单个DBMS中的数据溯源方法将无法在多数据库中使用.为了解决在不同DBMS中数据转换问题,Cui等人通过深入调查研究,提出了形式化的跟踪法则,通过定义一系列转换属性,并根据这些属性提出了一种新的追踪方法.Grigorisetal开发了一种查询语言(ProQL),为基于元组溯源———半环溯源采取最普通的形式,提出支持查询语言对数据源的存储、处理和索引方案,可以解决增量维护、信任评估、关键字搜索以及数据库查询概率回答等问题.下面对数据溯源在数据库应用中几种典型的系统做一下简单的介绍:1.查询检索或处理变换DBNotes系统是非常典型的采用注释方式存储和管理的数据溯源系统.系统为每个数据项都赋予了一个全局标识(ID),在查询检索或处理演变过程时,该系统提供了三种传播注释信息策略,以供用户进行选择.但系统的不足之处在于两个方面的问题:1、等价查询可能会得出不同的结果.2、不能实现非查询类操作,比如统计、求和等方面.2.rio相关模型斯坦福大学研究的Trio系统非常具有代表性,此系统采用关系表描述及存储.Trio是一个综合管理系统,实现了对传统的关系数据库管理系统加入数据溯源的管理.将数据、转换、溯源有机的结合在一起.该模型支持基于SQL的查询语言TriQL,是对关系模型的扩展,广泛应用于科学数据、信息抽取、数据集成等领域.3.无缝合并数据溯源Panda系统目前正处于开发阶段,还没有投入到实用过程中,目标是整合基于数据和基于过程的两种类型数据溯源,希望实现一个通用的获取数据溯源、存储、查询于一体,方便灵活、可配置各种应用的开源系统.无缝合并基于数据和过程的溯源,为用户提供一个全方位的从细粒度到粗粒度的数据溯源模型,开发一种通用语言用于查询和分析溯源信息.4.2数据溯源信息工作流的概念溯源于办公自动化领域.根据一系列规则,把资料、文档、信息以及任务在参与者之间传递,以达到某种目的.科学工作流是用来自动化科学研究过程的,而科研过程由一系列研究步骤组成,用来描述和控制科学实验和过程的执行,它是面向e-Science,服务于科学家,为他们提供更易分析和管理的数据.科学工作流采用数据驱动模式,在数据处理过程中,前一级的数据输出成为下一级处理的数据输入.而且,科学工作流的定义与设计都是动态的,整个任务序列是不确定的,需要根据前一个任务的处理结果来确定下一个任务.科学工作流强调数据的可信度,实现数据溯源对每一步的处理过程可信度存在较高的要求,对全程数据的变化需要进行监控.早在1997年,Geo-opera系统就是数据溯源追踪在工作流中的应用.实现了在分布式环境下的数据流、转换过程和数据溯源追踪等功能.工作流中的数据溯源信息能够为用户评估数据质量、重现实验过程、挖掘潜在的数据关系等.06年和08年两届IPAW会议的主题都于工作流的数据溯源相关,数据溯源在这个领域的研究很受重视.ZhuoweiBaoetal利用框架标签为工作流溯源设计了一种紧密而有效的可达性标签方案,使用对数长度、线性时间运行、能够回答几乎所有的常规时间里的可达性查询.ManishKumaretal为科学工作流溯源提供一种高效查询图形技术.获取在工作流中数据溯源信息一般有两种方法:1.日志法,即从日志文件中获取比较简单的溯源信息,不能实现工作流程的任意修改逆流,这种方法应用不多.2.将数据溯源信息记录在工作流引擎设计中,以便进行管理.下面简单介绍国际上比较成熟的科学工作流系统.Kepler是由UCDavis、UCSantaBarbara等合作研制的,是开源的java程序系统.构建于另一个开源可视化建模系统PtolemyII之上,为科学家提供了一个方便易用的工作平台.通过记录工作流执行状态,可以重现整个操作的全过程.该系统是一个通用的自动工作流管理系统,也是一个数据溯源管理系统,能够实现工作流的创建、运行和共享一体化,在数据溯源管理方面,通过跟踪数据项以及数据聚合的历史记录,将结果反馈给用户.Kepler系统允许科学家设计科学工作流,并使用基于网格的分布式计算方法执行这些工作流.广泛应用于地理学、生物信息学、化学等科学领域.用户即使没有计算机背景,也可以使用标准组件生成工作流,或者根据需求修改现有的工作流模型.该软件集成了Matlab、R等数据分析软件.2.实验科学的立工作流系统Taverna系统由MyGrid团队创建,受OMII-UK资助.由可用服务面板、工作流图面板和高级模型浏览器三个主要部分组成.Taverna是一个开放源码的独立工作流管理系统,用于在设计和执行实验科学的工作流程和助手工具套件.Taverna系统采用SCUFL来创建科学工作流,它定义的工作流,通过控制流模型来描述各种任务之间的关系,并利用控制结构(比如条件判断、循环语句等)来处理科学研究各步骤的关系,进而跟踪、溯源、重现工作流程中各步的状态.另外,工作流映射包括资源的发现和绑定两个步骤,主要有手工和自动两种方式,大部分科学工作流系统采用注册表来保存增加的服务信息,Taverna系统采用手工方式,通过注册表保存了大量的生物信息学的Web服务描述信息.3.核心网络的连通性Triana系统是一种开源的、与平台无关的分布式问题解决型环境,用java语言实现.Triana是图形化应用环境,用户可以方便地构建一个科学工作流.用户可以通过拖动其组件形成一个结点,通过创建两个结点间的连线构建其连通性.它是一个模块化的体系结构,包括3个不同的组件:TS(TrianaService)、TCS(TrianaControllerService)、TGUI(TrianaUserInterface).通过TGUI可以访问其它运行TS的机器.TCS是一个控制指定Triana网络的服务,它可以选择自己运行或指定其它可用的TS执行.因此,一个TGUI可以控制多个Triana网络实现其分布式管理.通过Triana系统来进行数据溯源可以将分布于各个TS中的数据利用TGUI来统一分析、跟踪和管理.Triana能够将数据溯源应用于信号、文本、图片等方面的处理.4.基于数据的工作流系统该系统提供给用户一个基于Web的安全可靠、简单易用的工具,用于监视数据密集型科学实验的全过程,通过Web服务器、FTP、SRB等多种方式获取科学数据,并通过VML/SVG可视化操作界面,定制满足需求的工作流实例,提交给后台的Kelper/PtolemyII工作流引擎服务器,经过对所获取的数据调用专用的处理软件(包括NCL、Matlab、CDO等)进行综合分析,最终得到所需要的可视化结果,从而实现数据的状态重现、数据跟踪.以上的系统有一个相同的特点:实现工作流的数据溯源、重现实验过程、追踪数据的历史档案,可以集成数据分析软件实现数据的分析和挖掘.其中,Kepler系统能够实现重现整个实验过程的功能,为科学实验的错误查询、数据质量评估以及数据追踪等方面做出了巨大的贡献.Taverna系统主要通过控制流模型来定义各任务之间的关系,并利用控制结构来处理科学研究每个步骤的关系.Triana系统是一个模块化结构,由不同的组件组成,通过拖动组件形成结点,通过连线确定其关系.4.3数据溯源技术数据溯源在其它领域中应用也非常广泛,如:管理GIS数据中元数据,更加智能管理无线传感网络中的数据,更加安全地传输网络数据,能够使存储系统智能化和人性化,Wiki管理系统,开源代码版本管理.数据溯源的一个应用是如何进行视图维护与更新.视图维护与更新都是涉及到基表与视图的相互联系,即基表数据发生变化,如何修改视图?如果视图数据被用户修改,又如何定位到基表进行元组的修改?研究了如何根据数据溯源来进行视图的更新.文献研究了视图中元组的删除操作如何转换为基表中元组的删除操作.5云计算和存储环境的安全体系数据世系管理技术研究综述,提出4个热点研究方向分别是:数据空间中的数据世系、不确定数据的世系管理、工作流世系管理、数据世系的挖掘和可视化.我们认为,随着云计算和存储环境的不断发展,数据溯源的安全问题变的越来越重要;为了更好地推广数据溯源技术的应用,迫切需要建立统一的数据溯源的业界标准.5.1数据溯源的安全与方便修改数据的安全是用户使用数据的最起码要求,也是一些核心数据(涉及国家军队秘密信息)所必需考虑的安全隐患问题.数据的安全勿庸置疑,数据溯源信息本身也是数据,同样存在安全问题.由于某些领域需要数据共享才能达到目的,而且还需要实时更新和变迁,这就无法用常规的数据保护方法来确保数据的安全.数据溯源技术在很多领域已得到广泛应用,但是,数据本身的安全以及溯源数据的安全是数据溯源技术发展的前提和基础.如何解决数据溯源信息的安全与方便修改是这一领域存在的问题.5.2数据溯源的标准化目前,很多学者提出了自己的数据溯源模型和框架.但是,都存在一定的局限性,大多数溯源管理系统都是在一个独立的系统内部实现溯源管理的.但数据如何在多个、分布式系统之间转换或传播,没有形成统一的业界标准.只有存在统一的标准,数据溯源的相关系统才能形成标准的接口,以模块化的形式应用于其它领域.标准不统一严重影响了数据溯源技术的发展,所以统一标准是亟待解决的问题之一.6数据溯源安全模型本文系统地总结了数据溯源的发展及数据溯源的模型、方法和应用,介绍了数据溯源在数据库、工作流和其它方面的应用,并以举例的方式进行论述.对数据溯源的标注法和逆置函数反向查询法进行了比较,列出其各自的优缺点.针对标注法需要大量的存储空间来存储溯源信息这一缺点,提出了一种基于列存储的标注思想.本文还提出了一种异构数据的溯源模型,适用于分布式异构数据的数据追踪.数据溯源是一个新兴的领域、研究时间短,还有很多地方不够完善,第五节中的热点研究方向同样存在很多难题需要攻克,我们相信未来数据溯源技术一定会蓬勃发展.2.BowersS提出的Time-ValueCentric(TVC)模型又称时间-值中心溯源模型,是一种简单有效的溯源模型.由于过去的溯源模型无论是基于标注的还是基于过程的溯源模型都用于面向交易的系统中,并不适合高容量特定需求以及连续的医疗流.于是,提出支持医疗领域数据源特点的TVC模型专门处理医疗事件流的溯源信息.根据数据中的时间戳和流ID号来推断医疗事件的序列和原始数据的痕迹.3.四维溯源模型是由YogeshL.Simmhan等人提出.此模型将溯源看成一系列离散的活动集,这些活动发生在整个工作流生命周期中,并由四个维度(时间、空间、层和数据流分布)组成.四维溯源模型通过时间维区分标注链中处于不同活动层中的多个活动,进而通过追踪发生在不同工作流组件中的活动,捕获工作流溯源和支持工作流执行的数据溯源.4.开放的数据溯源模型OPM在首届InternationalProvenanceandAnnotationWorkshop(IPAW)会议中,与会者对数据溯源的描述产生了一些共同的观念,并提出了一种原始的数据模型.后来,南安普顿大学等组织整理了会议的主要思想并发表了题为“TheOpenProvenanceModel”文章,文中提及的模型基本形成业界信息交换标准,定义一些具体的格式和协议就能应用到实际当中.当然,还需考虑与其它模型的兼容问题,文献Hiddersetal中提出了一种将NCR模型映射到OPM模型的自动转换方法.5.Provenir数据溯源模型2008年,在由Freire和Moreau组织的第二届IPAW会议中,Sahoo等人提出了Provenir数据溯源模型,该模型使用W3C标准对模型加以逻辑描述,考虑了数据库和工作流两个领域的具体细节,从模型、存储到应用等方面形成了一个完整的体系,成为首个完整的数据溯源管理系统.用分类的方式阐明它们之间的相互关系.该模型提供对数据产生历史的元数据、原数据、修改元数据等功能,并使用物化视图的方法有效解决了数据溯源的存储问题.6.数据溯源安全模型数据溯源技术能够溯本追源,通过其起源链的记录信息来实现追源的目的,但是记录信息本身也是数据.因此,同样存在安全隐患,为了防止有人恶意篡改数据溯源中起源链的相关信息,李秀美等2010年研究了数据溯源的安全模型,利用密钥树再生成的方法并引入时间戳参数,有效地防止某人恶意篡改溯源链中的溯源记录,对数据对象在生命周期内修改行为的记录按时间先后组成溯源链,用文档来记载数据的修改行为,当进行各种操作时,文档随着数据的演变而更新其内容,通过对文档添加一些无法修改的参数比如:时间戳、加密密钥、校验和等来限制操作权限,保护溯源链的安全.7.PrInt数据溯源模型PrInt是一种支持实例级数据一体化进程的数据溯源模型.该模型主要集中解决一体化进程系统中不允许用户直接更新异构数据源而导致数据不一致的问题.由PrInt提供的再现性是基于日志记录的,并将数据溯源纳入一体化进程.以上七种模型是比较经典的模型,其中,对于前三种模型而言,流模型和时间-值模型没有明确指出对W7模式的支持,只有四维模型支持动态构建数据溯源图,能根据一系列溯源事件以及数据结点和服务结点所构成的数据流边来构建.存在的不足之处在于形成过程不直接,难于理解.后面几种模型是从不同的角度,不同层次,针对数据溯源的某种特性而建立起来的模型.随着时间的推移,数据溯源模型会越来越多,但基本上都将从如何实现溯源的目的以及其本身的安全方面着手,以上几种模型除了数据溯源安全模型是介绍溯源链本身的安全外,其它几种模型都是建立在如何实现溯本追源的基础上的,但,每种模型各具其特点,风格不尽相同.另外,还有人提出DNA双螺旋结构的数据溯源模型,利用DNA复杂结构与数据溯源进行类比,将DNA中的两条链分别代表数据序列和操作序列,连接两条链间的碱基代表关联数据和操作的属性.通过这种对应关系建立起一种DNA双螺旋结构模型.建立了数据模型之后,以下介绍数据溯源的方法.3逆置追踪数据溯源目前,数据溯源追踪的主要方法有标注法和反向查询法.除此之外,还有通用的数据追踪方法,双向指针追踪法,利用图论思想和专用查询语言追踪法,以及文献提出以位向量存储定位等方法.标注法是一种简单且有效的数据溯源方法,使用非常广泛.通过记录处理相关的信息来追溯数据的历史状态,即用标注的方式来记录原始数据的一些重要信息,如背景、作者、时间、出处等,并让标注和数据一起传播,通过查看目标数据的标注来获得数据的溯源.Sudha等人提出的7W模型,就是采用标注法,事先标记并携带溯源信息完成数据溯源的模型,被称为eager方法.采用标注法来进行数据溯源虽然简单,但存储标注信息需要额外的存储空间.反向查询法,有的文献也称逆置函数法.由于标注法并不适合细粒度数据,特别是大数据集中的数据溯源,于是,提出了逆置函数反向查询法,此方法是通过逆向查询或构造逆向函数对查询求逆,或者说根据转换过程反向推导,由结果追溯到原数据的过程.这种方法是在需要时才计算所以又叫lazzy方法.详细论述了数据库中逆置追踪数据溯源的机制.反向查询法关键是要构造出逆向函数,逆向函数构造的好与坏直接影响查询的效果以及算法的性能,与标注法相比,它比较复杂,但需要的存储空间比标注法要小.下面将标注法与查询法进行比较,列出其优缺点.标注法的优点:实现简单,容易管理,其缺点:只适合小型系统,对于大型系统而言很难为细粒度的数据提供详细的数据溯源信息,因为很细可能导致元数据比原始数据还多,需要额外的存储空间,对存储造成很大的压力,而且效率低.逆置函数反向查询法的优点:追踪比较简单,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年黑龙江省海林市高三数学下册期末考试模拟试卷附参考答案【B卷】
- 保险法律法规与合规管理考试习题集
- 农业现代化项目2025年财务预算优化可行性报告
- 2026年爆破专业试题及答案
- 2026大药房门店质量管理相关岗位业务培训考核试题及答案
- 2027届云南省保山市名校七年级数学第一学期期末综合测试模拟试题含解析
- 2026实木集成墙板在家装领域应用前景调查报告
- 2026船舶压载舱不锈钢人孔盖防腐涂层技术比较研究专刊
- 2026年山东省乳山市高二生物下册期末考试模拟检测卷及答案【新】
- 2026年北京市驾驶技能模拟测试卷及答案
- 2026秋统编版语文六年级上册第二单元综合素养测评卷(含答案)
- (2026年版)糖尿病患者合并心血管疾病诊治专家共识
- 工程挂靠协议书
- 无产权车位使用权转让协议书2026年模板
- 关于新生儿科输液泵故障的应急预案演练脚本
- 吉兰-巴雷综合征合并吞咽困难管理专家共识(2026版)
- 探索HIV-1感染者Vpr基因多态性及其临床关联:从分子特征到医学启示
- 网吧卫生管理制度及流程
- 卫浴装修公司合作协议7篇
- 韦氏-儿童智力测验量表
- 内科诊所规章制度
评论
0/150
提交评论