CN119397067A 一种基于SparkSql的GQL图数据库数据导入方法及装置 (杭州悦数科技有限公司)_第1页
CN119397067A 一种基于SparkSql的GQL图数据库数据导入方法及装置 (杭州悦数科技有限公司)_第2页
CN119397067A 一种基于SparkSql的GQL图数据库数据导入方法及装置 (杭州悦数科技有限公司)_第3页
CN119397067A 一种基于SparkSql的GQL图数据库数据导入方法及装置 (杭州悦数科技有限公司)_第4页
CN119397067A 一种基于SparkSql的GQL图数据库数据导入方法及装置 (杭州悦数科技有限公司)_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于SparkSql的GQL图数据库数据导入本申请公开了一种基于SparkSql的GQL图数映射为GQL图数据库支持的数据格式并转换成批2根据预设数据处理规则或自定义SparkSql表达式对待导入数据将预处理后的待导入数据映射为GQL图数据库支持的数据格式,并将映射后的数据转将所述GQL语句发送至图数据库服务,由图数据库服务执行GQL语2.根据权利要求1所述的基于SparkS根据所述配置文件中的配置信息与源数据系统建立连接,并读取3.根据权利要求2所述的基于Spark继承SourceConfigResolver抽象类并实现SourceConfigResolver抽象类中的继承导入工具中的DataSourceReader抽象类并实现所述DataSourceReader抽象类中4.根据权利要求1所述的基于SparkSql的GQL图将多列合并成一列;将一列根据指定分隔符拆分成多列;5.根据权利要求4所述的基于SparkSql的GQL据自定义SparkSql表达式对待导入数据进行预处理,包括:在配置文件中增加自定义SparkSql表达式的配置UDFSql,将自定义SparkSql表达式转换成优化后的物理执行任务,6.根据权利要求1所述的基于SparkSql的GQL图数据7.根据权利要求1_6中任一项所述的基于Spark3预处理模块,用于根据预设数据处理规则或自定义SparkSql表达导入模块,用于将所述GQL语句发送至图数据库服务,由图数据9.一种计算机可读存储介质,其特征在于,所述4[0001]本申请涉及图数据库和数据处理技术领域,尤其是一种基于SparkSql的GQL图数[0003]本申请的目的在于克服现有技术中数据导入过程源数据预处理缺乏灵活性的问[0007]将预处理后的待导入数据映射为GQL图数据库支持的数据格式,并将映射后的数[0014]继承SourceConfigResolver抽象类并实现SourceConfigResolver抽象类中的[0015]继承导入工具中的DataSourceReader抽象类并实现所述DataSourceReader抽象5[0022]在一些可能的实现方式中,根据自定义SparkSql表达式对待导入数据进行预处6图2是本申请实施例1的基于SparkSql的GQL图数据库数据导入方法中数据预处理图3是本申请实施例1的基于SparkSql的GQL图数据库数据导入方法中拼接列的示图4是本申请实施例1的基于SparkSql的GQL图数据库数据导入方法中拆分列的示图5是本申请实施例1的基于SparkSql的GQL图数据库数据导入方法中根据条件过图6是本申请实施例1的基于SparkSql的GQL图数据库数据导入方法中拼接常量的图7是本申请实施例1的基于SparkSql的GQL图数据库数据导入方法中指定常量作[0042]如图1所示,本申请实施例1所涉及的一种基于SparkSql的GQL图数据库数据导入文件中读取所需的信息后与源数据系统建立连接,并读取指定数据表或指定文件中的数7继承导入工具中的DataSourceReader抽象类并实现该类中的readData方法,继承SourceConfigResolver抽象类并实现该类中的getSourceConfigEntry方法进行配置解析。类中的getSourceConfigEntry方法进行配置解析,用于从配置文件中解析新数据源配置;继承导入工具中的DataSourceReader抽象类并实现所述DataSourceReader抽象类中的[0048]S200、根据预设数据处理规则或自定义SparkSql表达式对待导入数据进行预处[0049]在获取待导入数据后针对不同的业务可能需要对源数据有不同的处理需求,例按拼接符拼接成一列的需求,通过配置separate.oldField,separate.newFields,concat.sep来实现将一列按分隔符分割成多列的需1、如果预处理配置是拼接配置,则获取配置的待拼接列名和拼接之后的新的列名,对数据集中每一行数据都进行字符串拼接处理,将待拼接列的值使用指定的拼接符拼[0051]2、如果预处理配置是拆分配置,则获取配置的待拆分列名和拆分之后的新的列8试”。[0055]除了内置的预处理规则外,为了满足不同业务领域各种高效地执行。例如:自定义SparkSql表达式select*,least(col1,col2)asnew_col数据,对源数据创建一个名为exchange的数据视图(即可以理解为一个虚拟表,表名为exchange,表的数据即SparkDataframe的二维表数据然后在每一行数据中生成新的一[0065]UDFSql:select*,9成对待导入数据的预处理,若不存在自定义预处理配置,则说明用户没有配置自定义[0069]具体的,将映射后的数据转换成批量写入的GQL语句包括将映射后的数据转换成[0072]对二维表中的每一行数据进行遍历,根据源节点主键数据值查询源节点的内部[0076]writePersonsucceed,host{192.168.8.6:3820},batchsize(1892),[0079]如图8所示,本申请实施例2所涉及的一种基于SparkSql的GQL图数据库数据导入[0081]预处理模块200,用于根据预设数据处理规则或自定义SparkSql表达式对待导入[0082]转换模块300,用于将预处理后的待导入数据映射为GQL图数据库支持的数据格[0084]需要说明的是,本实施例中基于SparkSql的GQL图数据库数据导入装置的其他具[0086]本申请实施例3所涉及的一种计算机可读存储介质,所述计算机可读介质存储用于设备执行的程序代码,该程序代码包括用于执行如本申请实施例1中的任意一种实现方用于执行如本申请实施例1中的任意一种实现方式中述处理器执行时实现如本申请实施例1中的任意一种实现申请实施例1中的任意一种实现方式中方法的各个步骤可以通过处理器中的硬件的集成逻骤及逻辑框图。通用处理器可以是微处理器或者该处理器也可以是任何常规的处理器等。据处理的装置中包

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论