CN119396997A 大数据环境下的实时数据分析与可视化方法及系统 (玖领(北京)科技服务有限公司)_第1页
CN119396997A 大数据环境下的实时数据分析与可视化方法及系统 (玖领(北京)科技服务有限公司)_第2页
CN119396997A 大数据环境下的实时数据分析与可视化方法及系统 (玖领(北京)科技服务有限公司)_第3页
CN119396997A 大数据环境下的实时数据分析与可视化方法及系统 (玖领(北京)科技服务有限公司)_第4页
CN119396997A 大数据环境下的实时数据分析与可视化方法及系统 (玖领(北京)科技服务有限公司)_第5页
已阅读5页,还剩49页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大数据环境下的实时数据分析与可视化方本发明提供大数据环境下的实时数据分析2获取待处理文档,对待处理文档进行去噪和归一化处理,根据预设的文档类型判定规合的分类模型确定所述待处理文档的类型,并针对不同类型的待处理文档采用对应的预处对所述预处理后的文档进行层次化结构分析,提取文档中的结构映射包含文档内容与语义信息和结构信息的映射接收用户以自然语言方式输入的自动化处理指令,利用基于深度学习的自然语言理解模型对指令进行意图理解和语义解析,抽取指令中的语义要素,根据语义要素匹配预定义的语义理解任务库,确定与指令对应的一个或多个语义理解任务,根据语义理解任务的任务,对匹配的语义片段单元进行处理,得到目标文档,并将所述目标文档进行可视化显版面区域;使用连通域分析算法对文本区进行进一步分析,通过自适应阈值分割和形态学滤波处理提取不同粒度的文本对象;利用基于区域卷积神经网络的目标检测模型对图像区进行检测和识别,得到图像对象的位置和内容信息;使用基于表格结构分析的方法对表格将不同版面区域抽象为图模型的节点,节点属性包含不同版面区域的文档版面结构特示不同版面区域之间的逻辑关系类型;通过迭代优化的方式更新图模型直至图模型收敛;利用谱聚类算法对图模型进行节点聚类,得到聚类后的逻辑结构单元;通过拓扑排序获取结合文档逻辑结构树,提取每个逻辑结构单元的结构化特征向量表示,其中对文本类辑结构单元提取包括位置、大小和形状的几何特征和内容特征;根据预定义结构模板规则对文档逻辑结构树和结构化特征向量表示进行匹配,将满足预定义结构模板规则的结构化特征向量进行组合,形成符合文档结构规范的结构框架;构建特定领域的文档本体知识库,基于特定领域的文档本体知识库和符合文档结构规范的结构框架构建结构化文档模3利用预先训练的语义理解分析模型对所述预处理后的文档进行语义理解分析,所述语义理解分析模型对文档中的专业术语、缩略语进行归一化表示,得到文档各结构要素的语使用预先训练的语义理解分析模型对预处理后的文档进行处理,得到词语语义特征向量、采用余弦相似度计算方法,将不同的两个文档结构要素的语义特征向量映射到同一维度的向量空间中,计算两个文档结构要素的语义特征向量之间的夹角余弦值,所述夹角余弦值越小则语义相似度越高;采用欧式距离计算方法,计算所述两个文档结构要素的语义特征向量之间的欧几里得距离,所述欧几里得距离越小则语义相似度越高;使用孪生网络构建语义相似度计算模型,所述孪生网络包括两个共享参数的子网络,分别对所述两个文档结构要素的语义特征向量进行非线性变换,在顶层使用余弦相似度层计算所述两个文档结构要素的语义特征向量的孪生网络的相似使用匹配网络构建语义相似度计算模型,通过注意力机制将待匹配的文档结构要素的语义特征向量与支持集中的样本向量进行匹配,生成匹配向量并通过全连接层计算所述待匹配的文档结构要素的语义特征向量与所述支持集中的样本向量的匹配网络的相似度得似度得分,计算所述两个文档结构要素的语义相关度;遍历文档结构要素的语义特征向量计算任意两个不同文档结构要素的语义特征向量之间的语针对预处理后的文档中的专业术语和缩略语,采用领域自适应的词向量增强方法,使用领域文本语料进行对词向量模型二次训练,通过有监督的概率预测任务调整词向量模基于词语语义特征向量,使用双向循环神经网络对句子进行编码得到句子语义特征向量,所述双向循环神经网络包括长短期记忆网络LSTM和门控循环单元GRU;在对句子进行编码的过程中,分别从左到右和从右到左对句子中的词语语义特征向量进行编码;在双向循环神经网络的基础上叠加注意力机制;将双向循环神经网络的输出经过注意力加权求和,使用分层注意力模型中的全连接层将段落中的句子语义向量映射到注归一化函数对注意力空间中的向量进行归一化,得到注意力权重分布,将段落中的句子语4根据所述结构化文档模型和语义相关度,采用基于条件随机场CRF的序列标注模型,结内容与语义信息和结构信息的映射关系;计算所述结构化文档模型中不同结构要素序列将文档结构要素序列作为基于条件随机场CRF的序列标注模型的观测序列,将语义片段标签作为隐藏状态序列;计算观测序列与隐藏状态序列之间的转移特征,以及观测序列义相关度和结构要素的语义特征与语义片段标签之间的相容性;观测序列的发射特征包针对所述语义理解任务,对匹配的语义片段单元进行预处理得到词袋表示,利用潜在狄利克雷分配LDA模型通过吉布斯Gibbs采样算法估计参数得到语义片段单元的主题分布向量和主题关键词列表,将主题分布向量与关键词列表进行组合形成语义片段单元的主题表示;将词袋表示转换为深度双向编码器表示BERT模型的输入格式,通过预训练BERT模型前向传播计算得到语义片段单元中每个字词的上下文向量,提取特殊标记对应的向量并结合注意力机制和池化操作生成语义片段单元的深度语采用连接融合、注意力融合、门控融合中的任一种方式对语义片段单深度语义表示进行融合,得到语义片段单元的融合语义表示;引入领域知识库对融合语义表示的语义片段单元进行知识增强,通过构建领域实体字典、利用共现统计方式建立语义片段单元中实体与领域知识库内的标准实体之间的链接,基于所述链接,采用基于模板和机器学习的方法从语义片段单元中抽取实体属性和实体间关系得到运用基于逻辑规则和知识表示学习的推理方式利用领域知识库对片段内知识三元组种方式将知识增强后的语义信息与语义片段单元的融合语义表示进行整合,得到知识增强5后的语义片段单元表示;根据语义理解任务需求,对知识增强后的语义片段单元表示进行对知识增强后的语义片段单元表示进行主题聚合、实体聚合和关系聚合,其中主题聚合采用主题分布相似度计算知识增强后的语义片段单元表示之间的主题相似性,将主题相似性高于预设阈值的知识增强后的语义片段单元表示聚合为同一主题类;实体聚合采含实体相同性判断知识增强后的语义片段单元表示是否包含相同的实体,将包含相同实体的知识增强后的语义片段单元表示聚合为同一实体类;关系聚合采用关系类型一致性判断知识增强后的语义片段单元表示之间的关系类型是否一致,将关系类型一致的知识增强后对主题聚合结果中的每一主题分别采用语义片段单元与任务相关性打分排序方法计算每一知识增强后的语义片段单元表示与语义理解任务的相关性打分,将知识增强后的语义片段单元表示按照与任务相关性打分由高到低排序;对实体聚合结果中的每一实体类分别采用重要性评估打分排序方法计算每一知识增强后的语义片段单元表示包含的实体重要性打分,将知识增强后的语义片段单元表示按照实体重要性打分由高到低排序;对关系聚合结果中的每一关系类分别采用基于逻辑顺序关系排序方法计算知识增强后的语义片在主题聚合结果的排序结果中,利用语义片段单元表示间的相似度计算方法剔除每一主题类内相似度高于预设阈值的冗余知识增强后的语义片段单元表示;在实体聚合结果的排序结果中,利用关键词匹配方法剔除每一实体类内与实体无关的知识增强后的语义片段单元表示;在关系聚合结果的排序结果中,利用可读性和连贯性质量评估方法剔除每一关系类内可读性和连贯性低于预设质量阈值的知识增强后的语义片段单元表示,得到优化后的语义片段单元;设计符合语义理解任务要求的文档生成模板,将优化后的语义片段单元填充到文档生成模板中的相应位置,填充时将语义片段单元与模板位置进行语义相似性匹8.大数据环境下的实时数据分析与可视化系统,用于实现前述权利要求1_7中任一项机器学习相结合的分类模型确定所述待处理文档的类型,并针对不同类型的待处理文档采第二单元,用于对所述预处理后的文档进行层次化结构6的自然语言理解模型对指令进行意图理解和语义解析,抽取指令中的语义要素,根据语义要素匹配预定义的语义理解任务库,确定与指令对应的一个或多个语义理解任务,根据语其中,所述处理器被配置为调用所述存储器存储的指令,以执行程序指令被处理器执行时实现权利要求1至7中任意7[0002]随着信息化和数字化的快速发展,企业和组织积累了海量的非结构化文档数获取待处理文档,对待处理文档进行去噪和归一化处理,根据预设的文档类型判相结合的分类模型确定所述待处理文档的类型,并针对不同类型的待处理文档采用对应的索引映射包含文档内容与语义信息和结构信息的映射关接收用户以自然语言方式输入的自动化处理指令,利用基于深度学习的自然语言理解模型对指令进行意图理解和语义解析,抽取指令中的语义要素,根据语义要素匹配预定义的语义理解任务库,确定与指令对应的一个或多个语义理解任务,根据语义理解任8区的版面区域;使用连通域分析算法对文本区进行进一步分析,通过自适应阈值分割和形态学滤波处理提取不同粒度的文本对象;利用基于区域卷积神经网络的目标检测模型对图像区进行检测和识别,得到图像对象的位置和内容信息;使用基于表格结构分析的方法对将不同版面区域抽象为图模型的节点,节点属性包含不同版面区域的文档版面结性表示不同版面区域之间的逻辑关系类型;通过迭代优化的方式更新图模型直至图模型收结合文档逻辑结构树,提取每个逻辑结构单元的结构化特征向量表示,其中对文的逻辑结构单元提取包括位置、大小和形状的几何特征和内容特征;根据预定义结构规则对文档逻辑结构树和结构化特征向量表示进行匹配,将满足预定义结构模板规则的结利用预先训练的语义理解分析模型对所述预处理后的文档进行语义理解分析,所述语义理解分析模型对文档中的专业术语、缩略语进行归一化表示,得到文档各结构要素的语义特征向量,通过计算语义特征向量之间的相似度,得到不同结构要素之间的语义相关度;使用预先训练的语义理解分析模型对预处理后的文档进行处理,得到词语语义特征采用余弦相似度计算方法,将不同的两个文档结构要素的语义特征向量映射到同一维度的向量空间中,计算两个文档结构要素的语义特征向量之间的夹角余弦值,所述夹角余弦值越小则语义相似度越高;采用欧式距离计算方法,计算所述两个文档结构要素的语义特征向量之间的欧几里得距离,所述欧几里得距离越小则语义相似度越高;使用孪生网络构建语义相似度计算模型,所述孪生网络包括两个共享参数的子网络,分别对所述两个文档结构要素的语义特征向量进行非线性变换,在顶层使用余弦相似度层计算所述两个文档结构要素的语义特征向量的孪生网络的相似使用匹配网络构建语义相似度计算模型,通过注意力机制将待匹配的文档结构要素的语义特征向量与支持集中的样本向量进行匹配,生成匹配向量并通过全连接层计算所9述待匹配的文档结构要素的语义特征向量与所述支持集中的样本向量的匹配网络的相似的相似度得分,计算所述两个文档结构要素的语义相关度;遍历文档结构要素的语义特征针对预处理后的文档中的专业术语和缩略语,采用领域自适应的词向量增强方法,使用领域文本语料进行对词向量模型二次训练,通过有监督的概率预测任务调整词向基于词语语义特征向量,使用双向循环神经网络对句子进行编码得到句子语义特征向量,所述双向循环神经网络包括长短期记忆网络LSTM和门控循环单元GRU;在对句子进行编码的过程中,分别从左到右和从右到左对句子中的词语语义特征向量进行编码;在双向循环神经网络的基础上叠加注意力机制;将双向循环神经网络的输出经过注意力加权求使用分层注意力模型中的全连接层将段落中的句子语义向量映射到注意力空间,使用归一化函数对注意力空间中的向量进行归一化,得到注意力权重分布,将段落中的句根据所述结构化文档模型和语义相关度,采用基于条件随机场CRF的序列标注模含文档内容与语义信息和结构信息的映射关系;计算所述结构化文档模型中不同结构要将文档结构要素序列作为基于条件随机场CRF的序列标注模型的观测序列,将语义片段标签作为隐藏状态序列;计算观测序列与隐藏状态序列之间的转移特征,以及观测的语义相关度和结构要素的语义特征与语义片段标签之间的相容性;观测序列的针对所述语义理解任务,对匹配的语义片段单元进行预处理得到词袋表示,利用潜在狄利克雷分配LDA模型通过吉布斯Gibbs采样算法估计参数得到语义片段单元的主题分布向量和主题关键词列表,将主题分布向量与关键词列表进行组合形成语义片段单元的主题表示;将词袋表示转换为深度双向编码器表示BERT模型的输入格式,通过预训练BERT模型前向传播计算得到语义片段单元中每个字词的上下文向量,提取特殊标记对应的向量并结合注意力机制和池化操作生成语义片段单元的深度示和深度语义表示进行融合,得到语义片段单元的融合语义表示;引入领域知识库对融合语义表示的语义片段单元进行知识增强,通过构建领域实体字典、利用共现统计方式建立语义片段单元中实体与领域知识库内的标准实体之间的链接,基于所述链接,采用基于模板和机器学习的方法从语义片段单元中抽取实体属性和实体间关系得到片段内知识三元运用基于逻辑规则和知识表示学习的推理方式利用领域知识库对片段内知识三任一种方式将知识增强后的语义信息与语义片段单元的融合语义表示进行整合,得到知识增强后的语义片段单元表示;根据语义理解任务需求,对知识增强后的语义片段单元表示对知识增强后的语义片段单元表示进行主题聚合、实体聚合和关系聚合,其中主题聚合采用主题分布相似度计算知识增强后的语义片段单元表示之间的主题相似性,将主题相似性高于预设阈值的知识增强后的语义片段单元表示聚合为同一主题类;实体聚合采用包含实体相同性判断知识增强后的语义片段单元表示是否包含相同的实体,将包含相同实体的知识增强后的语义片段单元表示聚合为同一实体类;关系聚合采用关系类型一致性判断知识增强后的语义片段单元表示之间的关系类型是否一致,将关系类型一致的知识增对主题聚合结果中的每一主题分别采用语义片段单元与任务相关性打分排序方法计算每一知识增强后的语义片段单元表示与语义理解任务的相关性打分,将知识增强后的语义片段单元表示按照与任务相关性打分由高到低排序;对实体聚合结果中的每一实体类分别采用重要性评估打分排序方法计算每一知识增强后的语义片段单元表示包含的实体重要性打分,将知识增强后的语义片段单元表示按照实体重要性打分由高到低排序;对关系聚合结果中的每一关系类分别采用基于逻辑顺序关系排序方法计算知识增强后的语义片段单元表示之间的逻辑顺序,将知识增强后的语义片段单元表示按照逻辑顺序依次排列;在主题聚合结果的排序结果中,利用语义片段单元表示间的相似度计算方法剔除每一主题类内相似度高于预设阈值的冗余知识增强后的语义片段单元表示;在实体聚果的排序结果中,利用关键词匹配方法剔除每一实体类内与实体无关的知识增强后的语义片段单元表示;在关系聚合结果的排序结果中,利用可读性和连贯性质量评估方法剔除每一关系类内可读性和连贯性低于预设质量阈值的知识增强后的语义片段单元表示,得到优化后的语义片段单元;设计符合语义理解任务要求的文档生成模板,将优化后的语义片段单元填充到文档生成模板中的相应位置,填充时将语义片段单元与模板位置进行语义相似则和机器学习相结合的分类模型确定所述待处理文档的类型,并针对不同类型的待处理文档采用对应的预处理参数进行预处理,得到预处理后的文档,所述待处理文档的类型包括学习的自然语言理解模型对指令进行意图理解和语义解析,抽取指令中的语义要素,根据语义要素匹配预定义的语义理解任务库,确定与指令对应的一个或多个语义理解任务,根据语义理解任务的粒度从所述语义索引映射中匹配对应粒度的一个或多个语义片段单元;1.提高文档处理的准确性和效率:[0021]图1为本发明实施例大数据环境下的实时数据分析与可视化方法的流程示意图,学习相结合的分类模型确定所述待处理文档的类型,并针对不同类型的待处理文档采用对应的预处理参数进行预处理,得到预处理后的文档,所述待处理文档的类型包括合同、论语义索引映射包含文档内容与语义信息和结构信息的映射关S103.接收用户以自然语言方式输入的自动化处理指令,利用基于深度学习的自然语言理解模型对指令进行意图理解和语义解析,抽取指令中的语义要素,根据语义要素匹配预定义的语义理解任务库,确定与指令对应的一个或多个语义理解任务,根据语义理[0026]同时,利用预先训练的语义理解分析模型对预处理后的文档进行语义理解分析,合同双方、合同金额、履行期限等),并分析合同条款的倾向性(如对买方/卖方是否有利[0028]基于结构化文档模型和文档语义信[0029]在接收用户以自然语言方式输入的自动化处理指语言理解模型对指令进行意图理解和语义解析。该模型采用双向长短时记忆网络(Bi_[0030]例如,对于用户输入的指令"提取2022年签订的所有销售合同中的客户名称和合同金额",模型能够识别出关键语义要素:[0031]根据抽取的语义要素,系统匹配预定义的语义理解任务库,确定与指令对应的一[0032]接着,根据语义理解任务的粒度,从语义索引映射中匹配对应粒度的一个或多个时间表达式识别模型判断合同签订时间是否在201.提高了文档处理的智能化和自动化水平。通过结合规则和机器学类方法,以及基于知识增强的语义理解模型,能够准确识别不同类型的文档并进行深度语义和结构信息关联,使得系统能够根据用户的自然语言指令快速定位相关信息,实现灵活[0038]在一种可选的实施方式中,述预处理后的文区的版面区域;使用连通域分析算法对文本区进行进一步分析,通过自适应阈值分割和形态学滤波处理提取不同粒度的文本对象;利用基于区域卷积神经网络的目标检测模型对图像区进行检测和识别,得到图像对象的位置和内容信息;使用基于表格结构分析的方法对将不同版面区域抽象为图模型的节点,节点属性包含不同版面区域的文档版面结性表示不同版面区域之间的逻辑关系类型;通过迭代优化的方式更新图模型直至图模型收结合文档逻辑结构树,提取每个逻辑结构单元的结构化特征向量表示,其中对文的逻辑结构单元提取包括位置、大小和形状的几何特征和内容特征;根据预定义结构规则对文档逻辑结构树和结构化特征向量表示进行匹配,将满足预定义结构模板规则的结[0041]对于图像区,利用基于区域卷积神使用ResNet等卷积神经网络对检测到的图像对象进行特征提取和内容识别。例如,对于一[0043]对于公式区,采用基于符号分析和语法对公式图像进行符号识别,得到公式中包含的数学符号序列。然后根据数学表达式的语法c^2",可以得到一个包含加法和平方运算的[0045]下一步,将不同版面区域抽象为图模型的[0047]然后,利用谱聚类算法对优化后的图模型进行节点聚类,得到聚类后的逻辑结构单元。具体地,构建图的拉普拉斯矩阵,计算其特征向量,选取前k个特征向量组成特征矩[0048]接下来,通过拓扑排序获取聚类后的逻辑结构单元之间的层次和顺序关系,得到[0049]结合文档逻辑结构树,提取每个逻辑结配过程,将满足预定义结构模板规则的结构化特征向量进行组合,形成符合文档结构规范基于特定领域的文档本体知识库和符合文档结构规范的结构框架,构建结构化文档模型。具体地,将结构框架中的各个组成部分与本体知识库中的概念进行关联,形成语义丰富的[0055]在一种可选的实施方式中,预先训练的语义理解利用预先训练的语义理解分析模型对所述预处理后的文档进行语义理解分析,所述语义理解分析模型对文档中的专业术语、缩略语进行归一化表示,得到文档各结构要素的语义特征向量,通过计算语义特征向量之间的相似度,得到不同结构要素之间的语义相关度;使用预先训练的语义理解分析模型对预处理后的文档进行处理,得到词语语义采用余弦相似度计算方法,将不同的两个文档结构要素的语义特征向量映射到同一维度的向量空间中,计算两个文档结构要素的语义特征向量之间的夹角余弦值,所述夹角余弦值越小则语义相似度越高;采用欧式距离计算方法,计算所述两个文档结构要素的语义特征向量之间的欧几里得距离,所述欧几里得距离越小则语义相似度越高;使用孪生网络构建语义相似度计算模型,所述孪生网络包括两个共享参数的子网络,分别对所述两个文档结构要素的语义特征向量进行非线性变换,在顶层使用余弦相似度层计算所述两个文档结构要素的语义特征向量的孪生网络的相似使用匹配网络构建语义相似度计算模型,通过注意力机制将待匹配的文档结构要素的语义特征向量与支持集中的样本向量进行匹配,生成匹配向量并通过全连接层计算所述待匹配的文档结构要素的语义特征向量与所述支持集中的样本向量的匹配网络的相似的相似度得分,计算所述两个文档结构要素的语义相关度;遍历文档结构要素的语义特征向量计算任意两个不同文档结构要素的语义特征向量之间的语义量模型将文档中的词语映射为低维稠密向量,捕捉词语的语义信息。双向循环神经网络可以对上下文信息进行编码,获取句子级别的语义表示。分层注意力模型通过词级注意力和[0058]具体地,首先使用词向量模型将文档[0060]然后计算不同结构要素之间的构要素的语义特征向量映射到同一维度的向量空间,计算向量间夹角的余弦值。余弦值越[0061]同时采用欧式距离计算方法,[0062]此外,使用孪生网络构建语的结构要素与支持集中的样本进行匹配。具体地,首先将待匹配向量与支持集中每个样本向量计算注意力权重,然后对支持集进行加权求和得到匹配向量。最后通过全连接层计算[0064]基于上述多种方法得到的相似度结果,可以则最终语义相关度为0.9*0.3+0.8*0.2+0.85*1.通过多种语义相似度计算方法的综合运用,提高了语义相关度计算的准确性[0068]3.对专业术语和缩略语进行归一化处理,解决了不同表达方式导致的语义不一[0069]在一种可选的实施方式中,预先训练的语义理解针对预处理后的文档中的专业术语和缩略语,采用领域自适应的词向量增强方法,使用领域文本语料进行对词向量模型二次训练,通过有监督的概率预测任务调整词向基于词语语义特征向量,使用双向循环神经网络对句子进行编码得到句子语义特征向量,所述双向循环神经网络包括长短期记忆网络LSTM和门控循环单元GRU;在对句子进行编码的过程中,分别从左到右和从右到左对句子中的词语语义特征向量进行编码;在双向循环神经网络的基础上叠加注意力机制;将双向循环神经网络的输出经过注意力加权求使用分层注意力模型中的全连接层将段落中的句子语义向量映射到注意力空间,使用归一化函数对注意力空间中的向量进行归一化,得到注意力权重分布,将段落中的句预先训练的语义理解分析模型对预处理后的文档进行处理,得到包括词语语义特征向量、句子语义特征向量和文档语义特征向量的结构要素[0071]对于预处理后文档中的专业术语和缩略语,采用领域自适应的词向量增强方[0085]2.采用双向循环神经网络和多[0086]3.通过自适应加权的方式融合[0087]在一种可选的实施方式中,所述结构化文根据所述结构化文档模型和语义相关度,采用基于条件随机场CRF的序列标注模含文档内容与语义信息和结构信息的映射关系;计算所述结构化文档模型中不同结构要将文档结构要素序列作为基于条件随机场CRF的序列标注模型的观测序列,将语义片段标签作为隐藏状态序列;计算观测序列与隐藏状态序列之间的转移特征,以及观测的语义相关度和结构要素的语义特征与语义片段标签之间的[0088]本实施方式提供了一种基于结构化文档模型和文档语义信息建立语义索引映射模型对文档进行语义片段自动划分。具体地,将文档结构要素序列作为CRF模型的观测序[0089]转移特征包括相邻结构要素之间的语义相关度和结构要素的语义特征与语义片的主题词与"背景"语义片段标签,计算它们的语义相容程度。发射特征包括结构要素的层[0090]将这些特征通过特征函数进行组合网络",主题为"深度学习算法",情感倾向为中性等。知识特征包括语义片段单元包含的实[0093]通过以上步骤,就完成了基于结构化文档模型和文档1.提高了文档语义理解的准确性和全面性。通过结合文档[0094]2.增强了文档检索的精确性和语义相关[0095]3.为智能文档处理提供了丰富针对所述语义理解任务,对匹配的语义片段单元进行预处理得到词袋表示,利用潜在狄利克雷分配LDA模型通过吉布斯Gibbs采样算法估计参数得到语义片段单元的主题分布向量和主题关键词列表,将主题分布向量与关键词列表进行组合形成语义片段单元的主题表示;将词袋表示转换为深度双向编码器表示BERT模型的输入格式,通过预训练BERT模型前向传播计算得到语义片段单元中每个字词的上下文向量,提取特殊标记对应的向量并结合注意力机制和池化操作生成语义片段单元的深度示和深度语义表示进行融合,得到语义片段单元的融合语义表示;引入领域知识库对融合语义表示的语义片段单元进行知识增强,通过构建领域实体字典、利用共现统计方式建立语义片段单元中实体与领域知识库内的标准实体之间的链接,基于所述链接,采用基于模板和机器学习的方法从语义片段单元中抽取实体属性和实体间关系得到片段内知识三元运用基于逻辑规则和知识表示学习的推理方式利用领域知识库对片段内知识三任一种方式将知识增强后的语义信息与语义片段单元的融合语义表示进行整合,得到知识增强后的语义片段单元表示;根据语义理解任务需求,对知识增强后的语义片段单元表示词语序列,并统计每个词语的出现频次,形成词袋向量。例如,对于语义片段"今天天气晴朗,适合外出游玩",经过预处理后可得到词袋表示{"今天":1,"天气":1,"晴朗":1,"适个主题由词语的多项式分布表示。通过迭代采样,可以得到每个语义片段单元在不同主题向量[0.6,0.3,0.1],表示该语义片段单元60%概率属于主题1,30%概率属于主题2,10%概表["适合","游玩","活动"],主题3的关键词列表["今天","时间"合","游玩","活动","今天","时间","日期"]这样的[0100]与此同时,将词袋表示转换为深度双向编码器表示(模型要求输入为字/词序列,因此需要将词袋表示还原为原始文本序列,并添加特殊标记[CLS]和[SEP]。例如,转换后的输入序列为"[CLS]今天天气晴朗适合外出游玩[0101]通过预训练的BERT模型前向传播计算,可以得到文向量表示。BERT模型采用多层Transformer结构,能够捕捉词语[0102]接着,提取特殊标记[CLS]对应的向量,并结合注意力机制和池化操作,生成语义融合的方式,将主题表示向量和深度语义表示向量直接拼接在一起,得到一个更高维度的[0105]基于建立的实体链接,采用基于模板和机器学习[0106]随后,运用基于逻辑规则和知识表示学习的推理方式,利用领域知识库对片段内知识三元组进行知识推理,得到知识增强后的语义信息。例如,根据"天气晴朗"可以推理信息与语义片段单元的融合语义表示进行整合,得到知识增强后的语义片段单元表示。例如,可以将推理得到的新语义信息向量与之前的融合语义表示向量进行拼接,得到更丰富[0108]最后,根据语义理解任务需求,对知识增强后的语义片段单元表示进行聚合、排知识抽取和推理等技术,将外部知识整合到语义表示中,能够补充文本中未明确表达的隐[0112]在一种可选的实施方式中,语义理解任务需求,对知识增强后的语义片段单元表对知识增强后的语义片段单元表示进行主题聚合、实体聚合和关系聚合,其中主题聚合采用主题分布相似度计算知识增强后的语义片段单元表示之间的主题相似性,将主题相似性高于预设阈值的知识增强后的语义片段单元表示聚合为同一主题类;实体聚合采用包含实体相同性判断知识增强后的语义片段单元表示是否包含相同的实体,将包含相同实体的知识增强后的语义片段单元表示聚合为同一实体类;关系聚合采用关系类型一致性判断知识增强后的语义片段单元表示之间的关系类型是否一致,将关系类型一致的知识增对主题聚合结果中的每一主题分别采用语义片段单元与任务相关性打分排序方法计算每一知识增强后的语义片段单元表示与语义理解任务的相关性打分,将知识增强后的语义片段单元表示按照与任务相关性打分由高到低排序;对实体聚合结果中的每一实体类分别采用重要性评估打分排序方法计算每一知识增强后的语义片段单元表示包含的实体重要性打分,将知识增强后的语义片段单元表示按照实体重要性打分由高到低排序;对关系聚合结果中的每一关系类分别采用基于逻辑顺序关系排序方法计算知识增强后的语义片段单元表示之间的逻辑顺序,将知识增强后的语义片段单元表示按照逻辑顺序依次排列;在主题聚合结果的排序结果中,利用语义片段单元表示间的相似度计算方法剔除每一主题类内相似度高于预设阈值的冗余知识增强后的语义片段单元表示;在实体聚合结果的排序结果中,利用关键词匹配方法剔除每一实体类内与实体无关的知识增强后的语义片段单元

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论