CN119474250A 一种文档切分方法、装置、计算机设备及存储介质 (中国平安财产保险股份有限公司)_第1页
CN119474250A 一种文档切分方法、装置、计算机设备及存储介质 (中国平安财产保险股份有限公司)_第2页
CN119474250A 一种文档切分方法、装置、计算机设备及存储介质 (中国平安财产保险股份有限公司)_第3页
CN119474250A 一种文档切分方法、装置、计算机设备及存储介质 (中国平安财产保险股份有限公司)_第4页
CN119474250A 一种文档切分方法、装置、计算机设备及存储介质 (中国平安财产保险股份有限公司)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

层2通过训练完成的多模态标题识别大模型,对所述标题样式结果和所述提取所述标题识别结果中的标题和对应的标题层级关系,基于所述标题将所述待切分文档输入布局样式识别模型,所述布局样式识别模型包括文本识别层、通过所述文本识别层对所述待切分文档的每行文本进行定位,得到文本行定位框特通过所述样式识别层对所述文本行定位框特征进行字体样式进行将所述文本内容输入训练完成的标题文本识别大模型,其中,所述标将所述文本嵌入向量输入所述解码器,每个所述解码器包括混合注通过所述混合注意力层对所述文本嵌入向量分别进行局部注意力计算和多头注意力通过所述注意力融合层将所述文本局部注意力特征和所述文本多头注意力特征进行3将所述标题样式结果和所述标题文本结果输入所述多模态标题识别将所述样式视觉特征和所述文本语义特征输入所述跨模态对齐层进行特征通过所述结果输出层对所述文本样式融合特征进行推理预测,按照所述待切分文档的页面顺序,将所述待切分文档中所有的标题按照标题通过最小生成树算法,在所述标题有向无环图中寻找根据所述优化后的标题层级结构提取所述待切分文档的文档章根据所述文档切分结果获取每个章节文本内容,并将每个所述章节通过所述章节语义向量计算每个所述章节文本之间的章节相似度多模态校验模块,用于通过训练完成的多模态标题识别结构构建模块,用于提取所述标题识别结果中的标题和切分模块,用于根据所述文档章节结构对所述待45[0002]在信息爆炸的时代,高效地处理和利用海量数据成为各行业亟待解决的关键问题。随着人工智能技术的飞速发展,特别是自然语言处理(NLP)领域的不断进步,RAG元素的文档),传统的切分方法往往无法有效保留这些重要信息,导致格式错乱或完全丢6处理器执行所述计算机可读指令时实现如上所述的文档切分方7[0037]终端设备101可以是具有显示屏并且支持网页浏览的各种电子设备,除了笔记本(MovingPictureExpertsGroupAudioLayerIII,动态影像专家压缩标准音频层面[0039]需要说明的是,本申请实施例所提供的文档切分方法一般由服务器/终端设备执8[0052]通过样式识别层对文本行定位框特征进行字体样式进行提取,得到字体样式特文本进行定位。PSEnet算法进行文本定位,首先会预测每个文本行不同的kernel,这些kernel一般与文本行有相同的形状和中心,并且不超过文本原始行的大小。之后对这些9特征提取层,可以采用传统算法如尺度不变特征变换(SIFT,Scale_InvariantFeatureTransform)、方向梯度直方图(HOG,HistogramofOrientedGradient)、局部二值模式(LBP,LocalBinaryPatterns)等,也可以采用深度学习算法如卷积神经网络、自解码器[0067]将待切分文档转换为图片,并通过OCR(光学字符识别)技术对文档内容进行文本[0069]在一些可选的实现方式中,编码层由多个Transformer解码器(decoder)堆叠而行局部注意力计算和多头注意力计算,得到文本局部注意力特征和文本多头注意力特征;支路,将所述文本嵌入向量分别输入多头注意力支路和局部注意力支路进行注意力计算,层对标题样式结果进行视觉特征提取,视觉特征提取层采用微调过的ViT(VisionTransformer)模型进行特征提取。文本特征提取层可以采用预训练的语言模型如BERT、步骤或者其他步骤的子步骤或者阶段的至少一部分轮流或[0115]多模态校验模块303用于通过训练完成的多模态标题识别大模型,对所述标题样[0116]结构构建模块304用于提取所述标题识别结果中的标题和对应的标题层级关系,[0117]切分模块305用于根据所述文档章节结构对所述待切分文档进行切分,得到文档[0119]基于上述文档切分装置300,通过对待切分文档进行样式特征识别和标题文本识[0125]样式预测子模块,用于通过所述样式输出层对所述文本[0132]注意力计算子模块,用于通过所述解码层对所述文本嵌[0135]在本实施例的一些可选的实现方式中,所述解码层包括[0143]视觉子模块,用于通过所述视觉特征提取层对所述标题[0144]语言子模块,用于通过所述文本特征提取层对所述标题电路(ApplicationSpecificIntegratedCircuit,ASIC)、可编程门阵列(Field-[0162]所述存储器41至少包括一种类型的可读存储介质,所述可读存储介质包括闪存、41也可以是所述计算机设备4的外部存储设备,例如该计算机设备4上配备的插接式硬盘,[0163]所述处理器42在一些实施例中可以是中央处理器(CentralProcessingUnit,所述计算机设备4与其他电子设备之间建立文本结果,然后通过多模态标题识别大模型对标题样式结果和标题文本结果进行识别校文

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论