CN117688163B 基于指令微调和检索增强生成的在线智能问答方法及装置 (杭州有赞科技有限公司)_第1页
CN117688163B 基于指令微调和检索增强生成的在线智能问答方法及装置 (杭州有赞科技有限公司)_第2页
CN117688163B 基于指令微调和检索增强生成的在线智能问答方法及装置 (杭州有赞科技有限公司)_第3页
CN117688163B 基于指令微调和检索增强生成的在线智能问答方法及装置 (杭州有赞科技有限公司)_第4页
CN117688163B 基于指令微调和检索增强生成的在线智能问答方法及装置 (杭州有赞科技有限公司)_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

WO2021056710A1,2021.04.01基于指令微调和检索增强生成的在线智能本发明公开了基于指令微调和检索增强生文本向量与预设知识库内的数据进行检索比较应的缓存区域中召回与相似数据对应的多个目23获取用户在线提问信息,基于大规模语言模型对所述用户在线基于已训练的语义向量模型对所述用户在线提问和所述扩充的相似提问进行向量化基于两路检索召回策略将所述在线提问文本向量与预设知识库内的数据进行检索比述基于两路检索召回策略将所述在线提问文本向量与预设知识库内的数据进行检索比较,基于交叉编码器对所述用户在线提问和召回的多个目标文本块分别进行相关性计算,基于所述大规模语言模型和预设的提示词,对所述用户在从三元组训练语料中随机采样获取不同任务场景下的一个或多个正样本文本信息作在当前任务场景下,对所述语义向量模型进行训练批处理将基于所述第一负样本文本信息和所述第二负样本文本信息对所述语义向量模型进4行训练预测后理解错误的文本信息作为第三负基于文本块切分策略对所述文本语料进行文本块切分,得到若干个基于所述大规模语言模型和预设提示词对设置标记的文本块进行文本增以切分得到的若干个文本块和与所述设置标记的文本块相似的文本数据为语料数据,基于筛选策略对所述文本语料进行清洗过滤预处理,将所述文基于已训练的语义向量模型对基础语料数据库中的每个文本块进行将所述基本语料文本向量存储于预设知识库中,以用于与在线6.一种基于指令微调和检索增强生成的在线智获取模块,用于获取用户在线提问信息,基于大规模语言模5基于所述相似数据和TopK策略从对应的缓存区域中映射召回与所述相似数据对应的多个是基于文本关键词检索策略,计算在线提问文本向量与ES库中文本数据间的各文本相似重排序模块,用于基于交叉编码器对所述用户在线提问和召回的多个目用户在线提问与各目标文本块之间的相关性分数对所述召回的多个目标文本块进行重排7.一种计算机设备,包括存储器、处理器及8.一种计算机可读存储介质,其特征在于,6利用Query_Query语音相近算法计算向量间的相似度,得到相似度最高向量对应的文档内[0006]本发明实施例提供了一种基于指令微调和检索增强生成的在线智能问答方法及7[0009]基于已训练的语义向量模型对所述用户在线提问和所述扩充的相似提问进行向[0010]基于两路检索召回策略将所述在线提问文本向量与预设知识库内的数据进行检相似数据和TopK策略从对应的缓存区域中映射召回与所述相似数据对应的多个目标文本[0011]基于交叉编码器对所述用户在线提问和召回的多个目标文本块分别进行相关性的数据进行检索比较,从所述预设知识库中得到与所述在线提问文本向量相似的相似数所述用户在线提问与各目标文本块之间的相关性分数对所述召回的多个目标文本块进行提问、所述召回的多个目标文本块及所述重排序文本块进行文字润色处理和词汇归纳处8[0021]本发明实施例提供了一种基于指令微调和检索增强生成的在线智能问答方法及TopK文本块和用户问题进行润色归纳和推理总结,得到与用户提问相对应的最优在线回[0024]图1为本发明实施例提供的基于指令微调和检索增强生成的在线智能问答方法的[0025]图2为本发明实施例提供的基于指令微调和检索增强生成的在线智能问答方法的[0026]图3为本发明实施例提供的基于指令微调和检索增强生成的在线智能问答装置的9[0032]本实施例提供了一种基于指令微调和检索增强生成的在线智能问答方法,图1为人的角色,然后基于Whisper框架将对应的语音数据进行相应的文本化转换,得到文本数不同的任务场景判定若干个文本块中需要设询的上下文片段。本实施例中文本块切分策略是按512tokens一个文本块对文本语料进行切分,得到若干个文本块。其中,对于不足512tokens的文本语料不做切分,只切分超过位字符、清理非可见字符、清理标签、繁简转换等;对于高度重叠文档,采用SimHash或下的一个或多个正样本文本信息作为当前任务用户提问和正样本文本信息之外的语料数据进行负样本采样,得到第二负样本文本信息。第三负样本文本信息作为语料数据中的与用户提问不yyIx[0069]通过上述指令微调训练使得损失函数值达到最小,得到已训练的语义向量模+在线服务实时调用。[0072]本实施例在语义向量模型的训练中引入了指令微调和多索比较,从预设知识库中得到与在线提问文本向量相似的相似数据,并基于相似数据和[0077]通过上述两路检索召回策略得到与在线提问文本向量相似的相似文本向量和相[0080]本实施例基于交叉编码器对用户在线提问和两路召回的多个目标文本块分别进标文本块及重排序文本块进行文字润色处理和词汇归纳处理,大幅减少大规模语言模型的[0085]在本发明实施例所提供的基于指令微调和检索增强生成的在线智能问答方法中,获取用户在线提问信息,基于大规模语言模型对用户在线提问信息进行理解和提炼处理,各目标文本块之间的相关性分数对召回的多个目标文本块进行重排序,得到重排序文本序文本块进行文字润色处理和词汇归纳处理,得到与用户在线提问相对应的在线回答结免了大语言模型的幻觉问题和无法实时扩展企业知识的问题,实现了准确定位客户问题、3为本发明实施例提供的基于指令微调和检索增强生成的在线智能问答装置的示意性框[0093]向量化模块320,用于基于已训练的语义向量模型对用户在线提问和扩充的相似服语音对话等来自各个业务单元的非结构化人的角色,然后基于Whisper框架将对应的语音数据进行相应的文本化转换,得到文本数询的上下文片段。本实施例中文本块切分策略是按512tokens一个文本块对文本语料进行切分,得到若干个文本块。其中,对于不足512tokens的文本语料不做切分,只切分超过[0105]以切分得到的若干个文本块和与设置标记的文本块相似位字符、清理非可见字符、清理标签、繁简转换等;对于高度重叠文档,采用SimHash或下的一个或多个正样本文本信息作为当前任务用户提问和正样本文本信息之外的语料数据进行负样本采样,得到第二负样本文本信息。第三负样本文本信息作为语料数据中的与用户提问不yy[0123]通过上述指令微调训练使得损失函数值达到最小,得到已训练的语义向量模在线服务实时调用。[0125]本实施例在语义向量模型的训练中引入了指令微调和多[0126]召回模块330,用于基于两路检索召回策略将在线提问文本向量与预设知识库内[0130]通过上述两路检索召回策略得到与在线提问文本向量相似的相似文本向量和相[0132]重排序模块340,用于基于交叉编码器对用户在线提问和召回的多个目标文本块[0133]本实施例基于交叉编码器对用户在线提问和两路召回的多个目标文本块分别进标文本块及重排序文本块进行文字润色处理和词汇归纳处理,大幅减少大规模语言模型的[0138]在本发明实施例所提供的基于指令微调和检索增强生成的在线智能问答装置应用于上述基于指令微调和检索增强生成的在线智能问答方法中,获取用户在线提问信息,语境信息;基于已训练的语义向量模型对用户在线提问和扩充的相似提问进行向量化处[0139]上述基于指令微调和检索增强生成的在线智能问答方法可以实现为计算机程序可以是用于执行基于指令微调和检索增强生成[0142]该存储介质503可存储操作系统5031和计算机程序5032。该计算机程序5032被执储介质503可以为易失性的存储介质或非易失性的基于指令微调和检索增强生成的在线智能问答方法中[0147]本领域技术人员可以理解,图4中示出的计算机设备的实施例并不构成对计算机[0148]应当理解,在本发明实施例中,处理器502可以是中央处理单元(CentralProcessingUnit,CPU),该处理器502还可以是其他通用处理器、数字信号处理器微处理器或者该处理器也可以是任何常规的为易失性或非易失性的计算机可读存储介质。该计算机可读存储介质存储

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论