CN119415623A 一种用于rag的多知识粒度的文本检索方法及装置 (中国建设银行股份有限公司)_第1页
CN119415623A 一种用于rag的多知识粒度的文本检索方法及装置 (中国建设银行股份有限公司)_第2页
CN119415623A 一种用于rag的多知识粒度的文本检索方法及装置 (中国建设银行股份有限公司)_第3页
CN119415623A 一种用于rag的多知识粒度的文本检索方法及装置 (中国建设银行股份有限公司)_第4页
CN119415623A 一种用于rag的多知识粒度的文本检索方法及装置 (中国建设银行股份有限公司)_第5页
已阅读5页,还剩35页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种用于RAG的多知识粒度的文本检索方法本发明提供一种用于RAG的多知识粒度的文本检索方法及装置,将原始文本整理为JSON文2对所述JSON文件中的JSON数据进行递归字符切块处理和语义切块处将所有目标JSON文件存储至BM25数据库,和将进行递归字符切块处理针对所述关键词列表中的每个关键词,查找所述BM25数据库将所有相关性得分从大到小进行排序,将前n个所述相关性得分对应的目标文本确定将所述查询嵌入向量分别与所述向量数据库中的句子层级嵌入向量和段落层级嵌入对所有第一待选文本和所有第二待选文本进行去重处理,并利用排序基于每个所述段落和其对应的位置索引生成J对所述JSON文件中的JSON数据进行递归字符切块处理,得到多个初步对于每个所述初步文本块,创建所述初步文本块的副本,并识别所述建每个所述语义文本块在其所属段落中的第基于每个所述初步文本块和其对应的第一子索引生成目标JSO语义文本块和其对应的第二子索引生成目标J针对每个所述目标JSON文件,对所述目标JSON文件进行预处理,并3将预处理后的所述目标JSON文件和相应的所述倒排索引列表存储至BM2针对每个进行递归字符切块处理后的所述JSON文件,利用句子嵌识别每个所述高维向量相应的语义,并根据预设聚类规则按照从大到小的顺序将所有句子层级余弦相似度进行从排序后的所有句子层级余弦相似度中提取前m个句子层级余弦相似度,按照从大到小的顺序将所有段落层级余弦相似度进行从排序后的所有段落层级余弦相似度中提取前m个段落层级余弦相将所述句子层级待选文本和所述段落层级待选文本确定为处理单元,用于对所述JSON文件中的JSON数据进行递归字符切块处理和语义切块处存储单元,用于将所有目标JSON文件存储至BM25数据库,和将进查找单元,用于针对所述关键词列表中的每个关键词,查找计算单元,用于将所述查询嵌入向量分别与所述向量数据输出单元,用于对所有第一待选文本和所有第二待选文本进行去重处4分割模块,用于根据所述原始文本中的每个段落将所述第一创建模块,用于根据每个所述段落所属的章节序列第一处理模块,用于对所述JSON文件中的JSON数据进行递第二生成模块,用于基于每个所述初步文本块和其对应的第一第一存储模块,用于将预处理后的所述目标JSON文件和相应第二处理模块,用于针对每个进行递归字符切块处理后的所述J识别模块,用于识别每个所述高维向量对应的每个句子,生成第二存储模块,用于识别每个所述高维向量相应的语义,5[0001]本发明涉及数据处理技术领域,尤其涉及一种用于RAG的多知识粒度的文本检索[0010]将所有目标JSON文件存储至BM25数据库,和将进行递归字符切块处理后的所述[0013]将所有相关性得分从大到小进行排序,将前n个所述相关性得分对应的目标文本[0014]将所述查询嵌入向量分别与所述向量数据库中的句子层级嵌入向量和段落层级6并创建每个所述语义文本块在其所属段落中所述语义文本块和其对应的第二子索引生成目标JSO7段落层级余弦相似度对应的文本确定为段落层[0064]第二生成模块,用于基于每个所述初步文本块和其对应的第一子索引生成目标8[0073]基于上述本发明实施例提供的一种用于RAG的多知识粒度的文本检索方法,将原合句粒度和段粒度的语义检索策略,有效应对文本信息长度不一及不同检索目的的挑战,[0077]图3为本发明实施例提供的对JSON数据进行递归字符切块处理和语义切块处理的[0080]图6为本发明实施例提供的一种用于RAG的多知识粒度的文本检索装置的结构框9[0093]在具体实现步骤S202的过程中,按照原始文本中的段落结构将原始文本进行分[0095]在具体实现步骤S203的过程中,根据每个段落在原始文本中所属的章节序列位[0100]在具体实现步骤S204的过程中,根据每个段落与其对应的位置索引生成JSON文果有效信息仅占初步文本块(500长度)的十分之一甚至二十分之一时,后续文本向量化的于每个语义文本块和其对应的第二子索引生成[0121]下面对本发明实施例提供的文本检索方法中的第二部分:文本入库进行解释说将进行递归字符切块处理后的JSON文件存储至向量以及每个词在所有目标JSON文件中出现的频率,得到逆文档频率(inversedocument[0129]需要说明的是,计算预处理后的目标JSON文件中每个词的词频具体是根据公式[0144]步骤S404:将预处理后的目标JSON文件和相应的倒排索引列表存储至BM25数据[0145]在具体实现步骤S404的过程中,将预处理后的目标JSON文件和预处理后的目标[0147]在具体实现步骤S405的过程中,针对每个进行递归字符切块也就是图3中的初步文本块,利用句子嵌入模型(例如BGE1句子嵌入模型)对初步文本块进[0158]下面对本发明实施例提供的文本检索方法中的第三部分:检索查询进行解释说[0168]在具体实现步骤S106的过程中,按照从大到小的顺序将所有相关性得分进行排段落层级余弦相似度进行排序;从排序后的所有段落层级余弦相似度中提取前m个段落层层级待选文本和段落层级待选文本确定为第之后得到推荐文本候选集,利用排序模型(例如开源模型BGE_ReRan合句粒度和段粒度的语义检索策略,有效应对文本信息长度不一及不同检索目的的挑战,从而充分利用传统检索与语义检索的优势。此外,基于轻量级MiniCPM大模型的重排序方[0181]与上述本发明实施例提供的一种用于RAG的多知识粒度的文本检索方法相对应,[0183]处理单元602,用于对JSON文件中的JSON数据进行递归字符切块处理和语义切块[0189]计算单元607,用于将查询嵌入向量分别与向量数据库中的句子层级嵌入向量和[0207]第一存储模块,用于将预处理后的目标JSON文件和相应的倒排索引列表存储至[0211]结合图6示出的内容,余弦相似度包括句子层级余弦相似度和段落层级余弦相似[0213]第一提取模块,用于从排序后的所有句子层级余弦相似度中提取前m个句子层级[0215]第二提取模块,用于从排序后的所有段落层级余弦相似度中提取前m个段落层级[0219]

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论