CN119474289A 文档问答方法、装置、设备及存储介质 (北京奇虎科技有限公司)_第1页
CN119474289A 文档问答方法、装置、设备及存储介质 (北京奇虎科技有限公司)_第2页
CN119474289A 文档问答方法、装置、设备及存储介质 (北京奇虎科技有限公司)_第3页
CN119474289A 文档问答方法、装置、设备及存储介质 (北京奇虎科技有限公司)_第4页
CN119474289A 文档问答方法、装置、设备及存储介质 (北京奇虎科技有限公司)_第5页
已阅读5页,还剩34页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

并从各文档分段中选取语义相关度达到预设相发明通过将提问词条和语义相关度达到预设相2接收用户输入的提问词条和文档标识信息,并获取所述文档标计算所述提问词条与各所述文档分段之间的语义相关度,将所述提问词条和所述待输入文档分段输入至预训练语言模模型基于所述目标文档分段生成所述提问词条的答通过预设向量模型获取各所述文档分段的分段词向量以及所述提问词条的提问词向根据所述向量距离确定所述提问词条与各所述文档分段之间的语若存在所述文档标识信息,则从所述预设倒排列表中确定与根据所述目标索引从所述预设倒排列表中提取出所述文档标识信息对应目标文档的通过所述目标文档分段位置对所述目标文档的文档内容进行分段通过所述文档分段位置对所述本地文档的文档内容进行分段,获基于所述本地文档标识信息和所述本地文档分段构基于预设字数确定对所述本地文档进行分段的基于自然段落和所述第二分段位置两侧文档内容之间的语义相关度对所述第二分段37.如权利要求1至6任一项所述的文档问答方通过所述训练语句样本和所述词向量对初始开源向量模型进行训练,获词条接收模块,用于接收用户输入的提问词条和文档标语义计算模块,用于计算所述提问词条与各所述文档分段之间所述文档分段中选取语义相关度达到预设相关度的待输入数据反馈模块,用于将所述提问词条和所述待输入文档分段输入至预训练语言模型,程序被处理器执行时实现如权利要求1至7任一项所述的文档问答4[0004]上述内容仅用于辅助理解本发明的技术方案,并不代表承认上述内容是现有技语言模型基于所述目标文档分段生成所述提问词条[0011]通过预设向量模型获取各所述文档分段的分段词向量以及所述提问词条的提问5[0022]根据所述目标索引从所述预设倒排列表中提取出所述文档标识信息对应目标文[0034]根据所述第一分段位置处的标点符号调整所述第一分段位置,获得第二分段位[0035]基于自然段落和所述第二分段位置两侧文档内容之间的语义相关度对所述第二[0042]若将单一自然段落拆分,则将所述第二分段位置调整至所述单一自然段落结尾[0043]根据所述第三分段位置两侧文档内容之间的语义相关度对所述第三分段位置进6[0052]根据所述两侧向量距离确定所述前一侧文档内容与所述后一侧文档内容之间的[0058]检测各所述本地文档分段中是否存在多个文档分段中的目标内容为单个句子所[0066]若未符合所述预设误差条件,则获取文档类型与所述提7[0067]在优化后预设向量模型获得的答案与用户所需答案之间的误差符合所述预设误[0068]可选地,所述根据所述优化文档对所述预设向量模型进[0069]在优化后预训练语言模型获得的答案与用户所需答案之间的误差不符合所述预模型获得的答案与用户所需答案之间的误差是否符合所述预设误从各所述文档分段中选取语义相关度达到预设相关度的待输入段输入至预训练语言模型,以使预训练语言模型基于目标文档分段生成提问词条的答案。8[0086]如图1所示,该文档问答设备可以包括:处理器1001,例如中央处理器(Central通信总线1002用于实现这些组件之间的连接通信。用户接口1003可以包括显示屏(Display)、输入单元比如键盘(Keyboard),可选用户接口1003还可以包括标准的有线接口、无线接口。网络接口1004可选的可以包括标准的有线接口、无线接口(如无线保真(Wireless_Fidelity,Wi_Fi)接口)。存储器1005可以是高速的随机存取存储器(Random[0088]如图1所示,作为一种存储介质的存储器1005中可以包括操作系统、网络通信模[0089]在图1所示的文档问答设备中,网络接口1004主要用于与网络服务器进行数据通问答设备在根据文档标识信息确定目标文档后,便可获取该目标文档对应的全部文档分9[0101]需要说明的是,上述语义相关度可用于反映提问词条与文档分段之间的相关程词向量与各分段词向量之间的向量距离确定提问词条与各文档分段之间[0124]在具体实现中,上述文档问答设备在各文档分段与提问词条之间的语义相关度[0128]在具体实现中,上述文档问答设备可从语义相关度最高的文档分段开始依次选述预训练语言模型基于所述目标文档分段生成所述提问词条的分段输入至预训练语言模型,以使预训练语言模型基于目标文档分段生成提问词条的答要判断预训练语言模型生成的答案与用户所需答案之间的精度是否符合上述预设误差条[0141]步骤S60:在优化后预设向量模型获得的答案与用户所需答案之间的误差符合所后预设向量模型获得的答案与用户所需答案之间的误差是否[0153]在具体实现中,上述文档问答设备可遍历上述预设倒排列表中的各文档标识信[0196]在具体实现中,上述文档问答设备在检测到第二分段位置将单一自然段落拆分[0197]步骤S0233:根据所述第三分段位置两侧文档内容之间的语义相关度对所述第三[0202]在具体实现中,上述文档问答设备可通过判断各第三分段位置两侧文档内容之[0214]根据所述两侧向量距离确定所述前一侧文档内容与所述后一侧文档内容之间的据两侧向量距离确定前一侧文档内容与后一侧文档你之义相关度未达到上述预设阈值时,便可判定第三分段位置两侧文档内容相关程度并不高,拆分时,可通过第二分段位置两侧文档内容之间的语义相关度对第二分段位置进行调整,所述文档问答程序被处理器执行时实现如上文所述的文档问答方并从各所述文档分段中选取语义相关度达到预设相关度[0237]数据反馈模块503,用于将所述提问词条和所述待输入文档分段输入至预训练语分段输入至预训练语言模型,以使预训练语言模型基于目标文档分段生成提问词条的答则获取所述文档标识信息对应的目标文档;根据预设文档分段策略确定目标文档分段位文档分段位置对所述本地文档的文档内容进行分段,获得所述本地文档的本地文档分段;基于所述本地文档标识信息和所述本地文档分段构[0253]作为一种实施方式,所述两侧文档内容包括前一侧文档所述词条接收模块501,还用于通过预设向量模型计算所述前一侧文档内容的第一分段词侧文档内容与所述后一侧文档内容之间的语义

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论