DB4208-T 59-2024 荆门城市大数据采集规范_第1页
DB4208-T 59-2024 荆门城市大数据采集规范_第2页
DB4208-T 59-2024 荆门城市大数据采集规范_第3页
DB4208-T 59-2024 荆门城市大数据采集规范_第4页
DB4208-T 59-2024 荆门城市大数据采集规范_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

ICS35.240代替DB4208/T59-20172024-02-01发布2024-03-01实施荆门市市场监督管理局发布IDB4208/T59—2024 Ⅱ Ⅲ 12规范性引用文件 13术语和定义 14总体架构 54.1数据采集工作流程 54.2数据采集处理架构 64.2.1数据采集系统 64.2.2消息服务 64.2.3数据交换管理中心 74.2.4任务系统 74.2.5运行与监控 74.3数据采集网络架构 74.3.1数据采集逻辑架构 74.3.2数据采集物理部署 74.4采集过程数据分析 84.4.1数据类型 84.4.2数据质量 84.4.3数据存储 95技术规范 95.1数据采集方案选择 95.1.1数据库接入方式 95.1.2文件接入方式 5.1.3API接入方式 5.1.4网页接入方式 5.1.5流式接入方式 5.1.6消息接人方式 5.2数据采集周期 5.3数据采集更新机制 5.3.1全量抽取 5.3.2增量抽取 5.4数据采集实施 5.4.1数据采集实施流程 5.4.2任务分解 5.4.3数据采集监控 16DB4208/T59—2024Ⅲ本文件按照GB/T1.1—2020《标准化工作导则第1部分:标准化文件的结构和起草规则》的规定起草。请注意本文件的某些内容可能涉及专利。本文件的发布机构不承担识别这些专利的责任。本文件代替DB4208/T59-2017,与DB4208/T59-2017相比,除文件编号按照新要求更新外,主要技术参数未发生变化。本文件由荆门市电子政务信息中心(荆门市大数据中心)提出。本文件由荆门市行政审批局归口。本文件起草单位:荆门市电子政务信息中心(荆门市大数据中心)。本文件主要起草人:胡玉荣、罗传军、肖立刚、杨金龙、刘波、田原、陆焱、王娅纷、熊士杰、陈永锋、李祥琴、游明坤、赖旭、武永成、董尚燕、张牧、吴际林、刘珊艳、余建国、方靖、庄小林。本文件于2017年5月首次发布。本文件实施应用中的疑问,可咨询荆门市行政审批局,联系电话:(0724)2376309,邮箱:690882384@;对本标准的有关修改意见建议请反馈至荆门市电子政务信息中心(荆门市大数据中心),联系电话:(0724)2376119,邮箱:282685564@IVDB4208/T59—2024党中央、国务院高度重视大数据发展。国务院《促进大数据发展行动纲要》明确指出要“建立标准规范体系,推进数据采集、政府数据开放、指标口径、分类目录、交换接口、访问接口、数据质量、数据交易、技术产品、安全保密等关键共性标准的制定和实施。”荆门市以国家大数据战略为指导,遵循“务求实效、急用先行”的原则,首次制定五个大数据标准规范。标准规范的制定,对建设荆门城市大数据中心,规范数据处理流程,满足大数据中心建设和管理的需要,促进“智慧荆门”建设具有重要意义。五个标准规范包括荆门城市大数据术语、荆门城市大数据采集规范、荆门城市大数据清洗规范、荆门城市大数据比对规范和荆门城市大数据共享规范。荆门城市大数据术语分为总论、数据采集、数据清洗、数据比对、数据共享和应用服务六大类,规定了荆门城市大数据中心建设领域的术语和定义,其余四个标准规范则规定大数据中心数据采集、清洗、比对和共享的总体框架和技术规范,涉及数据处理的整个流程:首先进行数据采集,然后通过数据整合(包括数据清洗和数据比对),将整合成功的数据装载到公共基础信息库,根据需要提供数据共享。五个标准规范的制定是荆门市电子政务信息中心(荆门市大数据中心)和全市信息行业人员的共同愿望,具有鲜明的地方特色和时代特征,填补了荆门市大数据技术应用领域的一项空白,在湖北省乃至国内具有较高的参考利用价值和指导意义。标准规范在使用过程中还需要不断完善,其中未涉及到的内容遵循相关国家标准。1GB/T-5271.17信息技术词汇第17部分:数据库术语工作计算机应用词汇信息安全技术公钥基础设施时间戳规范信息技术面向服务的体系结构(SOA)术语DB4208/T59—20242利用非结构化的流数据实现的一种无需完全下载便可以浏览数据,即一边下载一边浏览的数据组织方式。3.4中心汇聚库centerconvergencedatabase主要用于存储和管理来自源系统最新数据的数据库。其数据结构类似于源系统,数据按来源部门或业务领域进行分类,一旦新的数据进入,则旧的数据就被置换。3.5大数据中心bigdatacenter主要用于信息资源的存储和管理,可包括中心汇聚库、部门数据库、公共基础信息库等。3.6数据映射datamapping在两个不同的数据模型之间,建立彼此数据元的对应关系,最终使数据格式满足大数据中心数据标准的过程。3.7日志数据库logdatabase存储和管理数据处理信息的数据库。如清洗日志数据库,用于记录清洗过程中依次执行的各种操作和数据。3.8结构化数据structureddata数据元素之间具有统一和确定关系的数据,可以存储在数据库里,采用二维表结构逻辑表达与实现,如关系数据库的数据表。非结构化数据un-structureddata数据元素之间没有统一和确定关系的数据,其数据组织方式比结构化数据灵活,如视频、音频、图像、文本等。3.10半结构化数据semi-structureddata介于结构化数据和非结构化数据之间,一般是自描述的,数据结构和内容混合在一起的数据,如HTML文档、电子邮件等。3.11社会舆情数据publicsentimentdataDB4208/T59—20243体现社会民众在一定时间和范围内,对社会中出现的特定事件或现象发生、发展和变化过程中所持社会政治态度、信念价值观、倾向性等数据。3.12全称ExtractTransformationLoad,用来描述从数据源抽取(extract)所需的数据,经过预处理后,按照预先定义的数据仓库模型进行转换(transform),最终加载(load)到数据仓库的过程。3.13收集数据或将数据装入、存储在数据处理系统中的过程。3.14对数据进行周期性查询采集的方式。如根据数据更新频率,定期向数据源提出采集要求,当数据准备完毕则进行采集。3.15保证低延迟与稳定可靠的数据采集方式。以日志数据为例,由于分布式集群的广泛应用,数据分散存储在不同的机器上,因此需要实时汇总来自不同机器上的日志数据。3.16数据提供方和中心汇聚库之间以及数据提供方之间进行信息交换的管理系统,它是信息资源交换体系的核心部分。3.17消息服务messageservice为应用系统提供的,实现消息通信功能的运行环境和可配置的服务调用或支持。[GB/T25647-2010,附录A定义A.1.24]3.18前置机front-endsystem数据交换平台中与数据提供方进行信息交换共享的前置系统。3.19前置数据库front-enddatabase4APIDB4208/T59—20245从数据源中进行数据采集的过程,包括全量抽取和增量抽取。3.28Web服务Webservice一种应用编程接口或Web应用编程接口,通过标准的规约进行定义、并通过标准进行访问和使用。[GB/T29262-2012,定义2.57]4总体架构4.1数据采集工作流程数据采集工作流程见图1所示。数据采集工作流程数据提供方主管部门大数据中心/中心管理方开始采集通知/约定数据采集实数据采集实施准备提供采集方案通过确认采集方案提供采集方案不通过组织协调开展数据采集协调签署实施方案保密协议开展数据采集保存入库中心汇聚库入库保存日志备案日志数据库日志备案结束DB4208/T59—20246数据采集工作流程描述如下:a)主管部门向数据提供方和中心管理方发送数据采集通知,统筹协调数据采集前所涉及工作安排;b)中心管理方对已确定的待采集数据做好采集实施准备;c)中心管理方提供数据采集方案,与数据提供方在主管部门的协调下进行对接,并签署实施方案保密协议;d)中心管理方开展数据采集,将采集的数据保存至中心汇聚库,同时对本次数据采集进行日志备案,将备案内容保存至日志数据库。4.2数据采集处理架构数据采集是将数据提供方的数据通过数据交换平台采集到中心汇聚库,实现对各种政务信息资源的汇聚,数据采集处理架构见图2所示。数据受工作业务、信息化程度和安全性等多种因素的限制,形态呈多样化,如数据库、文件、网页等。实施数据采集,应在保证数据质量的前提下,提高数据采集效率,同时对整个数据采集流程进行监管。中汇库中汇库数据交换管理中心十料消釁凭运写控任务并数活采数菜集系统美集韂番数据提供方业务数据(数据库、文件、接口、消息等)韂数采发一旅台N图2数据采集处理架构数据交换平台可由数据采集系统、消息服务、数据交换管理中心、任务系统和运行与监控等部分组4.2.1数据采集系统数据交换管理中心将采集任务下发给数据采集系统后,各采集节点将确定的待采集数据抽取到前置机的共享库。数据采集系统主要处理:数据的适配与采集,适配与采集任务的调度管理、任务执行与监控,数据流监控及与消息服务的通信,中心汇聚处理。在数据采集过程中,消息服务是数据采集系统与数据交换管理中心的消息通道,实现数据交互。消息服务可由消息传输服务集群和消息代理服务组成。7DB4208/T59—20244.2.3数据交换管理中心对数据采集过程和平台运行进行管理与监控,对信息交换基础支撑和数据分拣处理中心等方面进行管理。数据交换管理中心是数据交换平台的核心。4.2.4任务系统实现多节点或多线程的采集,对任务进行分片、分布式处理操作,是数据采集系统与数据交换管理中心进行后台任务处理的支撑。可由调度计划管理、任务管理、分布式运行支撑组件、异常处理、日志处理及对外调用接口等功能组成。4.2.5运行与监控实现监控整个数据采集运行、事件报警与异常处理,包括对整个平台的监控、数据流向的监控、任务处理的监控、日志分析、事件报警与异常处理等。4.3数据采集网络架构4.3.1数据采集逻辑架构数据采集逻辑架构见图3所示,分为三个部分:a)数据采集系统:根据实际情况和需求建立多级交换中心,将数据存储在前置库。前置库由两部分组成:1)接收库:存储从大数据中心推送来的数据;2)共享库:存储从数据提供方推送来的待采集数据。b)数据交换管理中心:负责管理采集流程的创建、管理、执行与监控,通过消息服务给数据采集系统下达采集指令,实施数据采集;c)中心汇聚库:存储从数据提供方采集来的数据。共享库接收库前置机2共享库接收库共享库接收库前置机1前置机n前置库前置库前置库图3数据采集逻辑架构4.3.2数据采集物理部署为保证数据提供方的数据采集到中心汇聚库,根据安全要求与网络互通实际情况,在数据提供方或大数据中心设置前置机,依托电子政务内、外网进行数据采集,将采集的数据分布式存储在大数据中心的中心汇聚库。数据采集物理部署的网络安全应符合GDB4208/T59—20248数据采集物理部署见图4所示。中心前置机中心前置机政务内网前据大数据中心政务外网前置机数图4数据采集体系物理部署4.4采集过程数据分析待采集的数据主要来源于数据提供方和互联网上的社会舆情数据,基本覆盖拥有人口、法人、建筑物、地理、宏观经济等五大库相关政务数据资源的单位。根据业务的需要,可对数据来源进行扩充。数据来源具有独立性,扩展的类别不会影响已建设的数据分类存储和处理。数据提供方已确定的待采集数据以多种形式和类型存在,可分为结构化数据、非结构化数据和半结构化数据。从目前采集的数据分析,主要涉及结构化和非结构化数据,具体说明如下:a)结构化数据:可以用二维表结构来逻辑表达实现的数据,如Oracle、MySQL、DB2、SQLServer等数据库的数据;b)非结构化数据:不方便用二维表结构表现的数据,如文本、图片、XML、网页、报表、图像、音频、视频信息等;c)半结构化数据:介于结构化数据和非结构化数据之间的数据,数据字段数目不定,可根据实际需要进行增减,如HTML文档、电子邮件等。4.4.2数据质量在数据采集过程,为保证数据质量,宜遵循如下原则:a)完整性:数据不存在缺失,并保留历史数据等状况;b)一致性:数据遵循统一的规范,统一编码,数据集合保持统一的格式。同一指标在系统不同应用中应保证数据的一致性,同一指标数据在不同维度和不同颗粒度下应保证上下一致;c)准确性:数据记录不存在异常或错误;d)及时性:数据从开始到完成采集的延迟时间短。实时数据的采集,在网络状况良好的情况下,数据交换平台宜在5秒内完成采集;e)保密性:对待采集的数据进行加密,保证数据不被非法用户访问,只被拥有权限的用户访问。9DB4208/T59—20244.4.3数据存储数据采集过程,涉及前置库和中心汇聚库的数据存储。前置库存储在前置机上,用于存放通过数据采集系统抽取后准备入库到中心汇聚库的数据或从大数据中心推送来的数据。前置库中表和字段的创建,既可按数据来源分类进行手动增加,也可以通过Oracle或MySQL直接进行导入。根据数据来源的独立性,中心汇聚库的数据按数据提供方进行独立的分类存储和处理,从互联网这一特定的数据来源获取的社会舆情数据也作为一个单独的类别进行存储。中心汇聚库作为数据缓冲层,存储的数据均是最新数据。一旦有新的数据进入,旧的数据就会被置换,始终保持从数据采集系统采集来的最新数据,并采用数据片批次置换机制进行存储。中心汇聚库的数据,宜按照如下要求:a)在数据采集前,需先按数据提供方进行分类,再进行表和字段的创建,可以手动增加,也可以通过Oracle或MySQL直接进行导入;b)若前置库和中心汇聚库的数据库表结构存在差异,系统需对表字段和内容进行转换。若两者对同一属性的表示方式不一致,系统需提供数据内容转换。数据采集是实现信息资源共享的前提和基础,在采集数据过程应遵循“一数一源”的原则。1.1数据采集方案选择通过前期调研和梳理,确定数据提供方的待采集数据形态和提供方式。根据实际情况,确定数据采集实施方案并签定相应保密协议。数据提供方接入数据的方案可包括:数据库接入方式、文件接入方式、API接入方式、网页接入方式和消息接入方式。采用前置库与数据交换平台进行连接的方式。在此方式下,数据提供方的应用系统通过前置库中转,与大数据中心进行信息交换,数据库接入方式的业务流程见图5所示。数据库接人方式适用于满足如下条件的数据采集:a)信息化程度高、保密性强。可在数据提供方的应用系统与数据交换平台间进行物理或逻辑隔离,如公安局,宜采用物理隔离;b)配置前置机。在数据提供方或大数据中心配置连接政务内、外网的前置机,并在前置机上安装数据库管理系统和交换节点软件。DB4208/T59—2024开始链接失败链接失败链接成功提示错误提示错误保存结束图5数据库接入方式的业务流程采用文件形式与数据交换平台进行数据交换的方式。在此方式下,数据提供方将数据保存为xml、xls或xlsx、csv等格式文件,通过FTP或HTTP方式将文件发送给数据交换管理中心。对实时性要求高、数据量大的数据文件,建议尽量选择数据库接人方式,文件接入方式的业务流程见图6所示。文件接入方式适用于满足如下条件的数据采集:a)有数据但没有系统或相关数据没有进入数据库或数据采集周期性较长的情况(如按月、按季、按年报送);b)数据提供方按照约定方式和格式存储数据。提供的数据文件是格式规范、数据项和数据质量符合要求的高质量数据,并可通过FTP或HTTP方式上传到数据交换平台指定位置。1)FTP方式:大数据中心提供FTP服务,开放相应端口;2)HTTP方式:大数据中心提供相应的文件交换传输模块,实现基于Web页面的文件上报,可以对上传文件进行检查和控制。文件上传系统应提供文件上传权限管理、数据验证、上传结果查询功能。DB4208/T59—2024解析成功1.1.3API接入方式根据数据提供方提供的Restful开始文件接口区验证链接FTP包含未验证文件包括下载文件根据扩展名解析解析失败根据类型解析解析成功存储本地已解析记录不包括解析失败存储本地不能解析记录结束图6文件接入方式的业务流程API或Webservice接口快速接入数据交换平台,并由服务总线统一对外提供服务的对接方式,API接入方式的业务流程见图7所示。在此接入方式下,数据提供方需要提供明确的RestfulAPI或Webservice调用接口。Webservice适用于数据量小,保密性高的数据采集;ResfulAPI适用于数据量大的数据采集。API接入方式适用于满足如下条件的数据采集:a)信息交换频繁,与数据提供方业务处理紧密联系的应用系统;b)需要直接在线提供数据。有封装规范的RestfulAPI或Webservice调用接口,并提供详细的服务描述信息。DB4208/T59—2024保存结束图7API接入方式的业务流程利用互联网搜索引擎技术实现对相关网站的网页进行有针对性、行业性、精准性的数据抓取,并按照一定规则和筛选标准进行数据归类,形成数据库文件。网页接入方式的业务流程见图8所示。网页接入方式适用于满足如下条件的数据采集:a)信息化程度高,有专人维护的网站;b)需正确配置网页系统的参数和解析方式。开始输入待采集页面信息保存结束图8网页接入方式的业务流程DB4208/T59—2024对实时性要求较高、精确度要求较低的数据,无需等待全部数据装载完毕,接收部分数据后便进行计算处理。在此接入方式下,数据实时产生,实时计算处理;延迟短,实时性强,但数据的精确度较低。流式接入方式适用于满足如下条件的数据采集:a)海量数据需要实时分析的应用系统;b)价值低的数据进行预处理再存储,可以有效节省存储空间,有利于提高后续对数据的处理效率。数据提供方应用系统通过消息服务接口调用方式将信息直接发送给数据交换平台,或从数据交换平台获取交换信息,不用读写数据库。消息接入方式适用于满足如下条件的数据采集:a)不通过数据库或文件中转,数据提供方应用系统直接打包信息,以消息方式提供给数据需求方;b)数据量较大、效率要求较高的场合,由于直接操作在数据层,存在一定安全风险,灵活性较差;c)配置连接政务外网的前置机,在前置机上安装交换消息处理软件(消息中间件)。1.2数据采集周期根据数据采集的需要,数据采集周期可分为:a)数据一次采集:一次性将所有待采集数据(如一个完整的数据表)全部采集到中心汇聚库;b)数据实时采集:采集响应时间要保证实时性、低延迟,可按秒、分进行数据片采集;c)数据周期采集:根据数据产生的业务时间进行数据分片,统一形成周期性的数据片进行轮询数据采集,可按每周、每月、每季、每年等时间周期进行数据片采集。1.3数据采集更新机制数据采集更新机制,主要有全量抽取和增量抽取两种更新机制。全量抽取,宜按照如下要求:a)清空中心汇聚库中目标表的数据;b)将确定的待采集数据的表或视图原封不动的从数据库中抽取出来,并转换成ETL工具可识别的格式,全量导入到中心汇聚库的目标表。用于抽取自上一轮次抽取后数据库表发生变化的数据。捕获变化的数据可采用的方式有:触发器、时间戳、全表比对、数据版本和日志对比。触发器方式进行增量抽取,宜按照如下要求:a)在要抽取的表中建立基于插入、修改和删除操作的触发器;b)源表的数据发生变化,相应的触发器将变化的数据写入临时表;c)抽取线程从临时表抽取数据。时间戳方式进行增量抽取,宜按照如下要求:DB4208/T59—2024a)在源表上增加一个时间戳字段;b)更新或修改表数据时,修改时间戳字段值;c)数据抽取时,通过比较系统时间与时间戳字段值来确定抽取的数据。数据库的时间戳支持自动更新,则时间戳字段值自动更新;数据库不支持时间戳自动更新的,则要求手工更新时间戳字段值。全表比对方式全表比对进行增量抽取,逐条比较源表和目标表的记录,将新增和修改的记录读取出来。可采用MD5校验码,宜按照如下要求:a)给抽取的表建立一个结构类似的MD5临时表,临时表记录源表主键以及根据所有字段的数据计算出来的MD5校验码;b)数据抽取时,对源表和MD5临时表进行MD5校验码的比对,确定源表的数据是新增、修改还是删除,同时更新MD5校验码;c)比对结果不同,执行更新操作。若目标表不存在该主键值,执行插入操作;若目标表存在该主键值,而源表不存在,执行删除操作。数据版本进行增量抽取,宜按照如下要求:a)在表中增加版本号列来存储数据行变化,每次变化都将版本号列的数据增加1;b)使用参考表记录每次采集数据时对应的版本;c)将参考表与源表的版本号比较来判断需要采集的数据;d)采集完后将参考表对应版本号更新为与源表一致的版本号。日志比对进行增量抽取,宜按照如下要求:a)需要资源提供方打开被采集数据库的归档日志;b)扫描日志文件查看数据库表的变化情况进行实时采集。1.4数据采集实施数据交换管理中心通过消息通道向数据采集系统发送任务指令来进行采集。数据采集前,数据交换管理中心需做好数据接入的前期准备工作:a)前置库用户、角色权限等的分配、表空间的划分以及数据库类型的确认工作;b)涉及的元数据进行配置和管理;c)前置库和中心汇聚库的表及字段进行设置。数据采集实施流程见图9所示,分为采集方案选择、采集配置管理和采集调度三个阶段

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论