CN116483942B 基于再注意力机制和对比损失的法律案情要素抽取方法 (湖南大学)_第1页
CN116483942B 基于再注意力机制和对比损失的法律案情要素抽取方法 (湖南大学)_第2页
CN116483942B 基于再注意力机制和对比损失的法律案情要素抽取方法 (湖南大学)_第3页
CN116483942B 基于再注意力机制和对比损失的法律案情要素抽取方法 (湖南大学)_第4页
CN116483942B 基于再注意力机制和对比损失的法律案情要素抽取方法 (湖南大学)_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于再注意力机制和对比损失的法律案情本发明公开了一种基于再注意力机制和对律文本表示精化步骤以及法律案情要素标签预步骤是使用预训练模型RoBERTa对法律文本和法签表示提取步骤是从RoBERTa的输出中得到法律用法律案情要素标签表示来去除法律文本表示以有效的识别相似的法律案情要素标签和提升2步骤1021:法律文本与法律案情要素标签联合嵌入步步骤1022:法律案情要素标签表示提取步骤步骤1023:法律文本表示精化步骤:从法律文本与法律步骤1024:将去除冗余信息的法律文本表示O输入到分类器中得到每一个法律案情要素标签的概率分布和分类器的损失Lmcs得到模型的总损失LOSS=λ是0步骤S103:将待抽取的法律案情要素的法律文本输入训练好的模型RoBERTa抽取得到2.如权利要求1所述的基于再注意力机制和对比损失的法律案情要素抽取方法,其特本进行编码,第i个法律案情要素标签文本的嵌入E'=[E,E,…,E⃞],其中ni为第i个法律案情要素标签文本的长度;表示法律案情要素标签中第ni个token,型的12层Transformer之中得到文本与标签的联合表示具体实现如公式(3)33.如权利要求1所述的基于再注意力机制和对比损失的法律案情要素抽取方法,其特从文本与标签的联合表示HeR(c+m)xd中提取出法律文本表示HTeRmxd和法律案情要素标签文本表示HleRcxd,计算过程如公式(4)所示,HleRexd表示HL是一个cxd维的i表示第i个法律案情要素标签表示,e,E"和4.如权利要求1所述的基于再注意力机制和对比损失的法律案情要素抽取方法,其特步骤10231:取得法律文本表示HTeRmxd和法律案情要素标签文本表示Hle步骤10232:将法律文本表示HT和法律案情要素标签表示HL相乘得到注意力权重AeRC*,计算过程如公式(8)所示:步骤10233:使用column_wise和row_wise的softmax()函数对注意力权重的两个维度进行归一化,然后使用row_wise和column_wise的sum()函数进行求和操作从而得到法律文本中每个token的权重aTeRm和每一个法律案情要素标签的权重aleRf;具体计算步骤4T和aL分别与法律文本表示和法律案情要素标签表示相乘得到细化后的法律文本表示TeRmxd和法律案情要素标签表示如公式(10)所示;步骤10235:使用自注意力机制selfAttention()对细化后的法律文本表示和法律案情要素标签表示进行处理,然后再次进行相乘操作得到精化后的注意力权重7eRm,如公式(11)所示;法律文本表示oeRexd,如公式(12)所示;。5.如权利要求1所述的基于再注意力机制和对比损失的法律案情要素抽取方法,其特将去除冗余信息的法律文本表示O输入到分类器中得到每一个法律案情要素标签的概率分布i,分类器的损失Lmc的计算过程如公式(13)所示:5极少。简单地将多标签文本分类算法应用于法律案情要素抽取任务中难以取得可观的表此来获得高质量的可区分的法律文本表示。基于Seq2Seq的模型也常常用于多标签文本分[0005]为解决上述问题,我们设计了一种6解决法律案情要素标签抽取任务中相似法律案情要素标签和低频法律案情要素标签抽取行两次交叉注意力得到去除冗余信息后的法律文[0020]步骤1024:将去除冗余信息的法律文本表示O输入到分类器中得到每一个法律案情要素标签的概率分布和分类器的损失Lmc:得到模型的总损失LOSS=λ[0022]步骤S103:将待抽取的法律案情要素的法律文本输入训练好的模型RoBERTa抽取行编码得到其嵌入其中m为法律文本的长度,ET的具体计算如公式案情要素标签文本进行编码,第i个法律案情要素标签文本的嵌入其中ni为第i个法律案情要素标签文本的长度;表示法律案情要素入ET进行拼接并输入到RoBERTa模型的12层Transformer之中得到文本与标签的联合表示7模型RoBERTa的嵌入层,Transformerlayers()代表预训练模型RoBERTa的12层[0030]从文本与标签的联合表示中提取出法律文本表示HTeRmxd和法律案情要素标签文本表示HleRcxd,计算过程如公式(4)所示,HleRcxd表示HL是一个cH"=He=[Hf,HE,…,H%(4)律案情要素标签集合;T代表法律文本;e,ER",ei表示第i个法律案情要素标签表示,e,E"和eneRd都经过了L2Norm()归一化处理的表示;ep表示法律文本适用的标签的表[0037]步骤10231:取得法律文本表示HTeRmxd和法律案情要素标签文本表示Hle[0038]步骤10232:将法律文本表示HT和法律案情要素标签表示HL相乘得到注意力权重计算过程如公式(8)所示:[0040]步骤10233:使用column_wise和row_wise维度进行归一化,然后使用row_wise和column_wise的sum()函数进行求和操作从而得到8法律文本中每个token的权重和每一个法律案情要素标签的权重aleRC;具体计算roweR[0047]步骤10235:使用自注意力机制selfAttention()对细化后的法律文本表示和法律案情要素标签表示进行处理,然后再次进行相乘操作得到精化后的注意力权重如公式(11)所示。[0048]T=self息的法律文本表示oeRed,如公式(12)所示。[0053]0=7·HT(12)[0055]将去除冗余信息的法律文本表示O输入到分类器中得到每一个法律案情要素标签9[0061]图1展示了基于再注意力机制和对比损失的法律案情要素抽取方法的整体流程[0065]如图1所示,本发明提供了一种基于再注意力机制和对比损失的法律案情要素抽情要素标签文本进行编码,第i个法律案情要素标签文本l'=的嵌入为E'=[E,E,.…,E⃞,],其中ni为第i个法律案情要素标签文本的长度。接下来,将每一个法律层Transformer之中得到文本与标签的联合表示具体实现如公式(3)所示:W…,EX](1)模型RoBERTa的嵌入层,TransformerLayers()代表预训练模型RoBERTa的12层[0076]从法律文本与法律案情要素标签联合嵌入步骤中得到的联合文本表示HeR(e0)xd中提取出法律案情要素标签表示HleRcxd,计算过程如公式(4)所示。此外,我们法律文本表示ereRd的计算如公式(5)所示[0083]步骤201:从法律案情要素标签表示提取步骤得到的表示中提取出法律文本表示HTeRmnxd和法律案情要素标签文本表示HleRcxd,具体计算方法如公式(7)所示:[0086]步骤202:将法律文本表示HT和法律案情要素标签表示HL相乘得到注意力权重AeR%,计算过程如公式(8)所示。[0088]步骤203:使用column_wise和row_wise的s度进行归一化,然后使用row_wise和column_wise的sum()函数进行求和操作从而得到法律文本中每个token的权重和每一个法律案情要素标签的权重aleR"。图3直观的律案情要素标签表示相乘得到细化后的法律文本表示FTeRmxd和法律案情要素标签表示leRcxd,如公式(10)所示。[0094]步骤205:使用自注意力机制selfAttent本表示和法律案情要素标签表示进行处理,然后再次进行相乘操作得到精化后的注意力权重7eRm,如公式(11)所示。[0095]T=self除冗余信息的法律文本表示oeRed,如公式(12)所示。[0099]0=7·HD(12)[0101]将法律文本表示精化步骤中得到去除冗余信息的法律文本表示O输入到分类器中得到每一个法律案情要素标签的概率分布分类器的损失Lmuc的计算过程如公式(13)所[0106]在具体的实施过程中,我们使用Pytorch深度学习框架实现了法律案情要素抽取集。还可以发现,本方法在三个领域数据集上的MaF1值都有很大的提升。值得注意的是,好的解决低频和相似法律案情要素标签抽取性能低的问题。RoBERTa基线方法的性能远超案情要素标签的抽取性能。LP_MTC方法在RoBERTa方法的基础上使用掩码机制来捕获法律相关性对提升法律

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论