CN119443236A 司法数据驱动的描述型司法知识生成方法及装置 (中国政法大学)_第1页
CN119443236A 司法数据驱动的描述型司法知识生成方法及装置 (中国政法大学)_第2页
CN119443236A 司法数据驱动的描述型司法知识生成方法及装置 (中国政法大学)_第3页
CN119443236A 司法数据驱动的描述型司法知识生成方法及装置 (中国政法大学)_第4页
CN119443236A 司法数据驱动的描述型司法知识生成方法及装置 (中国政法大学)_第5页
已阅读5页,还剩50页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

司法数据驱动的描述型司法知识生成方法本公开涉及一种司法数据驱动的描述型司本中抽取法律概念和/或法律术语,并基于法律2从法律文本中抽取法律概念和/或法律术语,并基于所述司法概念知识本体,构建并训练司法概念抽取模型,所2.根据权利要求1所述的方法,其特征在于对所述法律文本中的目标文本进行中文分词和词性标注,并确定所述计算所述目标文本的主题概率分布以及每个关键短语的主题概率分布,得到目标权计算候选短语与已选短语的相关性得分和其他候选短语根据所述相关性得分减去所述相似性得分的加权值,确定所述候选短语的目标得分,3获取训练数据集,训练所述待训练的司法概念抽取模型,得到训构建模块,用于从法律文本中抽取法律概念和/或法律4[0004]有鉴于此,本公开提出了一种司法数据驱动的描述型司[0005]根据本公开的一方面,提供了一种司法数据驱动的描述从法律文本中抽取法律概念和/或法律术语,并基于所述法律概念和/或法律术[0006]在一种可能的实现方式中所述从法律文本中抽取法律概念和/或法律术语,并基对所述候选概念集进行质量筛选,基于质量评分大于阈值的法律概念和/或法律对所述司法概念集的法律概念和/或法律术语进行同义词挖掘,得到司法同义概述司法概念知识本体是经过实体关系补全和/或[0007]在一种可能的实现方式中,从法律文本中抽取法律概念和/或法律术语的步骤包5对融合后的短语执行相似短语的过滤操作,将过滤后的短语确定为所述关键短[0009]在一种可能的实现方式中,对融合后的短语执行相似短语的过滤操作的步骤包计算候选短语与已选短语的相关性得分和其他候选短语之间的相似性得分,其[0014]根据本公开的一方面,提供了一种司法数据驱动的描述司法概念抽取模型用于生成描述型司法知识,所述描述型司法知识包括具有特定法律定[0017]包含在说明书中并且构成说明书的一部分的附图与说明书一起示出了本公开的6[0019]图2示出根据本公开一实施例的司法数据驱动的描述型司法知识的生成方法的流[0020]图3示出根据本公开一实施例的基于预训练大模型等多层级描述型司法知识抽取[0024]图7示出根据本公开一实施例的司法数据驱动的描述型司法知识的生成方法的装所说明的任何实施例不必解释为优于或好于其它实[0029]图1示出根据本公开一实施例的多元化知识体系设计与分类的示意图。如图1所的要求以及对案件是否属于受案法院管辖的判定。人民法院收到起诉人提交的起诉7[0035]庭审不规范行为,是指诉讼服务过程中出现的不依照有关法律规范进行的行8供一种司法数据驱动的描述型司法知识的生成方法。图2示出根据本公开一实施例的司法司法概念抽取模型用于生成描述型司法知识,所述描述型司法知识包括具有特定法律定[0045]在本申请中,描述型司法知识生成包含知识本体的框架生成及描述型司法知识多种自然语言处理技术从法律文本中抽取法律概念和/或法律术语,然后结合专家经验和BERT深度神经网络结构的预训练模进行分类任务调优训练,构建司法概念抽取模型,该司法概念抽取模型用于生成描述型司法知识,所述描述型司法知识包括具有特定法律定义,并在司法审判中作为裁判要素的特定词汇或短语。和交叉注意力机制(Cross_AttentionMechanism)构建端到端的神经网络结构,实现非结表示学习的方法进行语义对齐,先利用知识表示学习模型将实体和关系表示成实值向量,然后将待对齐的概念或实体通过距离来计算其相似度,例如,JE模型、MTransE模型、[0049]为便于理解,示例性描述本申请提供的描述型司法知识9N_Gram是一种基于统计语言模型的算法,其基于文本中第N个词的出现只与前面[0050]在具体操作上,N_gram技术将文本里面的内容按照字节进行大小为N的滑动窗口词性标注是语料库语言学中将语料库内单词的词性按其含义和上下文内容进行解和衡量文本数据中的语义关系。词相似度计算技术首先要将词汇或短语转化为数值词[0057]将词汇或短语转化为数值型向量的方法有很多种,其中最著名和广泛使用的是Word2Vec。Word2Vec使用神经网络通过大量的文本语料库学习单词的分布式表示。在这个表示中,每个单词都映射到一个固定长度的向量,这些向量的位置和方向反映了单词之间离较远。Word2Vec有两种主要的模型:Skip_gram和CBOW(ContinuousBagofWords)。了Word2Vec之外,其他词向量计算方法包括GlobalVectorsforWordRepresentation(GloVe)、FastText等。GloVe试图通过矩阵分解来捕捉全局的单词共现统计信息,而[0060]BERT模型采用多层双向Transformer架构作为输入端编码器和输出端解码器,是编码。最后,对经过编码得到的输入序列特征通过条件随机场(ConditionalRandom[0061]图3示出根据本公开一实施例的基于预训练大模型等多层级描述型司法知识抽取对所述候选概念集进行质量筛选,基于质量评分大于阈值的法律概念和/或法律对所述司法概念集的法律概念和/或法律术语进行同义词挖掘,得到司法同义概述司法概念知识本体是经过实体关系补全和/或[0066]在一种可能的实现方式中,从法律文本中抽取法律概念和/或法律术语的步骤可对融合后的短语执行相似短语的过滤操作,将过滤后的短语确定为所述关键短[0072]在一种可能的实现方式中,对融合后的短语执行相似短语的过滤操作的步骤包计算候选短语与已选短语的相关性得分和其他候选短语之间的相似性得分,其[0076]本申请所研究的司法概念抽取任务与通常自然语言处理中的关系词提取任务有操作,将过滤后的短语确定为所述关键短语。例如,可以采用Pycharm打开工程chinese_keyphrase_extractor模块提取出碎片化的关键词,再根据相邻的碎片化的关键词进行融权重,所述目标权重用于确定基于所述目标文本抽取得到的法律概念和/或法律术语。例[0079]示例性地,在采用chinese_keyphrase_extractor提取关键词过程中,本申请对chinese_keyphrase_exparamwith_weight:指定返回关键paramstop_word_num:允许短语中出现的停用词个数,stricted_po计算候选短语与已选短语的相关性得分和其他候选短语之间的相似性得分,其[0082]例如,可以计算候选内容与已选内容的相关性得分和候选内容之间的相似性得[0083]图5示出根据本公开一实施例的候选概念集的示意图。该候选概念集中的司法概训练的BERT模型。在本申请中,我们使用两类广泛使用的预训练模型:Chinese_L_12_H_H_768_A_12_tf预训练模型调优的模型命名为CL_12_102M_方法和对模型前面几层参数进行冻结的方法,这些方法的选择取决于具体的任务和数据F1=2*(precision*recall)/(p出的标签的覆盖率。召回率是指模型正确预测出的正样本占所有真实正样本的比例。具体来说,对于每个标签,可以将模型预测为该标签且该标签确实存在的样本数作为真正例(TruePositives,TP将模型未能预测出该标签但实际存在该标签的样本数作为假负例[{},{},{},{},{},{}][0111]图6示出根据本公开一实施例的描述型司法知识生成机理[0113]图7示出根据本公开一实施例的司法数据驱动的描述型司法知识的生成方法的装[0116]电子设备1900还可以包括一个电源组件1926被配置为执行电子设备1900的电源出(I/O)接口1958。电子设备1900可以操作基于存储在存储器1932的操作系统,例如[0119]计算机可读存储介质可以是可以保持和存储由指令执行设备使用的指令的有形[0120]这里所描述的计算机可读程序指令可以从计算机可读存储介质下载到各个计算/任意组合编写的源代码或目标代码,所述编程语言包括面向对象的编程语言—诸如处理装置的处理器执行时,产生了实现流程图和/或框图中的一个或多个方框中规定的功计算机

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论