版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
文本向量化模型的训练方法、文本处理方本申请提供了一种文本向量化模型的训练2对多组问答文本中的答案文本进行聚类,得到多个答案文本簇从第一问题文本所在的第一问题文本簇中,获取区别于所述第一问题从第二问题文本簇中获取至少一个问题负样本,其中,所述第二问题文本基于多个所述第一问题文本、多个所述第一问题文本分别对应的从所述多组问答文本中,查询与所述答案文本簇中每个所述答案文将查询到的所述多个问题文本组合为与所述答案文本簇对应的所述从第一问题文本所在的第一问题文本簇中,获取区别于所从所述第一问题文本簇中获取区别于所述第一问题文本的至少一个问题从第二问题文本簇中获取多个第二问题文本,以及对获取的所述多个第第一问题文本簇中的所述第一问题文本不满足相获取第二问题文本与第一问题文本之间的第一相似度,以及获取响应于所述第一相似度小于或等于第一相似6.根据权利要求1至5任一项所述的方法,其特征通过所述第一文本向量化模型对多个所述第一问题文本、多个所述第一问题3通过预先设置的损失函数,基于所述第一问题文本向量、所述正样基于所述第一损失值更新所述第一文本向量化模型的网络参数,7.根据权利要求1至5任一项所述的方法,其特征通过预先训练的第二文本向量化模型,对每个所述答案文本进行第二文本向量化处对所述第二文本向量化模型的每个网络层的网络参数进行重要性按照预设的剪枝比例和所述重要性参数,确定待剪枝网络层,以及从所述将所述剪枝后的第二文本向量化模型作为待训练的第一文本确定每个所述答案文本簇的簇内相似度,其中,所述簇内相从多个所述问题文本簇中过滤掉所述簇内相似度小于或等于簇内相似度阈值的所述基于所述文本数量大于或等于文本数量阈值的所述问题文本簇,转问题文本所在的第一问题文本簇中,获取区别于所述第一问题文本的至少一个问题正样4针对每个所述集合,对所述集合中的所述答案文本进行聚类,所述基于多个所述第一问题文本、多个所述第一问题文本分别对针对每个所述集合,基于所述集合中的多个所述第一问题文本基于第二领域的多组问答文本,对所述第一文本向量化模型进行微调通过所述第一文本向量化模型对所述第二领域的多个第一问题文多个第一问题文本分别对应的问题正样本和问题负样本分别进行所述第一文本向量化处的正样本向量和所述第二领域的问题负样本的负通过预先设置的损失函数,基于所述第二领域的第一问题文本向正样本向量和所述第二领域的负样本向量确基于所述第一低秩矩阵和所述第二低秩矩阵构建微调权重参数通过所述第二损失值更新所述微调权重参数,得到所述第二领域的第一通过第一文本向量化模型对所述多个对象问题文本进行向量获取每个所述对象问题文本簇预先关联的答案,作为响应每个所所述数据处理模块,还用于从第一问题文本所在的第一问题文本簇中5第二问题文本簇是区别于所述第一问题文本簇的任训练模块,用于基于多个所述第一问题文本、多数据处理模块,用于通过第一文本向量化模型对所述多个对象所述数据处理模块,还用于对所述多个对象问题文本向量进行聚类处理所述数据处理模块,还用于获取每个所述对象问题文本簇预先关联的每个所述对象问题文本簇中的对象问题文本处理器,用于执行所述存储器中存储的计算机可执行指令或者计算机利要求1至14任一项所述的文本向量化模型的训练方法,或实现权利要求15所述的文本处19.一种计算机可读存储介质,存储有计算机可执行指令或者计算机程序,其特征在于,所述计算机可执行指令或者计算机程序被处理器执行时实现权利要求1至14任一项所算机可执行指令或计算机程序被处理器执行时实现权利要求1至14任一项所述的文本向量67所述第二问题文本簇是区别于所述第一问题文本簇的任意一个问[0011]本申请实施例提供一种计算机程序产品,包括计算机程利用了问题文本和答案文本之间的关联性,避免了由于问题文本表述的多样性和分散性,8序的一部分,并与其他相关部分一起工作以实现预定目标,并且可以通过使用软件、硬件或单元功能的整体模块或单元的一部分。9[0020]本申请实施例中相关数据收集处理在实例应用时应该严格根据相关法律法规的面等。聚类算法根据多组问答文本中的答案文本之间的相似度将它们分组,每个组就形成一个同样本之间的相似性来学习数据表示,对比学习可以用于自然语言处理领域中的图像检调可以提升模型性能,但达到较为理想的效果单个领域内需要约5000~10000条训练数据,计算机可读存储介质及计算机程序产品,能够提升第一文本向量化模型的文本表征能力,[0037]本申请实施例提供的文本向量化模型的训练方法可以应用于各种需要进行文本理解查询意图并从索引的文档中检索出最相关的文本处理方法的第一文本向量化模型发送给终端设备200,第一文本向量化模型是服务器量化模型的训练方法和文本处理方法可以由同一个服务器实现。服务器100也可以是服务[0046]存储器130_1包括易失性存储器或非易失性存储器,也可包括易失性和非易失性[0048]操作系统131_1,包括用于处理各种基本系统服务和执行硬件相关任务的系统程机程序来实现本申请实施例提供的文本向量化模型的训练方法和文本处理方法。举例来本申请实施例提供的装置可以是采用硬件译码处理器形式的处理器,其被编程以执行本申请实施例提供的文本向量化模型的训练方法和文本处理方法,例如,硬件译码处理器形式的处理器可以采用一个或多个应用专用集成电路(ApplicationSpecificIntegrated件。关系,构建每个答案文本簇对应的问题文本簇,得到多个问题文本簇(对应下文的步骤101通过基于多个问题文本簇的簇内随机采样获取第一问题文本的问题正样本(对应下文中的步骤102通过基于多个问题文本簇的簇间过滤后随机采样获取第一问题文本的问[0059]这是为了在实际应用过程中,避免单一模型的误差在自对于词汇表中的每个单词或符号,将其转换为一个固定大小的向量,这个过程称为词嵌入高,模型能够捕捉的信息越丰富,但计算成本也越高,可以通过训练模型,如Word2Vec、据单元的查询向量与所有数据单元(包括当前处理的数据单元)的键向量分别进行点积运值向量进行加权,得到包含了不同位置的数据单元的相关性的丰富表示,即数据单元的注[0072]通过注意力编码处理,可以为序列中的每个数据单元分配权重(注意力概率分类(HierarchicalClustering)、基于密度的抗噪聚类方法(Density_BasedSpatialCalinski_Harabasz指数等)评估每个答案文本簇的簇内相似度,例如轮廓系数或[0086]在步骤1016中,将查询到的多个问题文本组合为与答案文本簇对应的问题文本数阈值对问题文本簇进行筛选(例如每个问题文本簇中的文本数量不少于6保留簇内的xt=Randomsample(c,a),qsExt(1)本簇是区别于第一问题文本簇的任意一个问题本与第一问题文本簇中的第一问题文本不满足相文本a除了第一问题文本所在的第一问题文本簇c;以外,其他的问题文本簇中共包括个问题文本,例如表示为即共有M个第二问题文本将每个第二问题文本和对应的第二答案文本表示为:{(q1,a1),(q2,a2),…,(q,a)},通过预先训练的文本向量化题文本和每个第二问题文本对应的第二答案文本分别进行文本向量化处理(具体的实施方式可以参见上文步骤1011的说明得到第一问题文本和第一答案文本的特征向量zq和zax-=Randomsample(s-,b)(3)选(过滤)后的第二问题文本的集合,表示随机采样得到的问题负样本的数量,即。文本向量化模型进行训练(对应图7中的对比学习从而得到训练后的第一文本向量化模文本的第一问题文本向量、每个问题正样本的正样本向量和每个问题负样本的负样本向BGE等对多个第一问题文本、多个第一问题文本分别对应的问题正样本和问题负样本分问题文本x对应的a个问题正样本中第i个问题正样本的正样本向量,第一问题文本x对应的b个问题负样本中第i个问题负样本的负样本向域的多个第一问题文本分别对应的问题正样本和问题负样本分别进行第一文本向量化处BGE等对第二领域的多个第一问题文本、第二领域的多个第一问题文本分别对应的问题问题文本向量、第二领域的每个问题正样本的正样本向量和每个问题负样本的负样本向二领域的正样本向量和第二领域的负样本向量的第一问题文本向量、第二领域的正样本向量和第二领域的负样本向量确定第二损[0148]在步骤403中,将剪枝后的第二文本向量化模型作为待训练的第一文本向量化模[0157]示例的,还可以通过基于字节对编码(BPE)的分词器、基于字节级字节对编码进行分词所采用的具体分词器或分词方法。分进行归一化处理,例如应用归一化函数(如softmax函数使注意力使用注意力概率分布对值向量进行加权,得到包含了不同位置的词的相关性的丰富表示,即词的注意力编码特征,将词的注意力编码特征拼接为对象问题文本的对象问题文本向量。[0163]在步骤503中,对多个对象问题文本向量进行聚类,得到至少一个对象问题文本(或称回复模版文本作为响应每个对象问题文本本作为描述文本标签。用关键词提取算法(如词频_逆文件频率统计方法(TermFrequency_InverseDocumentEmbeddings)、间隔段编码(IntervalSegmentEmbeddings)、位置编码(Position一个数据包,发送到服务器,例如软件开发工具包通过超文本传输协议请求(Hypertext[0185]示例的,还可以通过基于字节对编码(BPE)的分词器、基于字节级字节对编码进行分词所采用的具体分词器或分词方法。分进行归一化处理,例如应用归一化函数(如softmax函数使注意力使用注意力概率分布对值向量进行加权,得到包含了不同位置的词的相关性的丰富表示,即词的注意力编码特征,将词的注意力编码特征拼接为用户问题文本的用户问题文本向量。[0191]在步骤603中,对多个用户问题文本向量进行聚类,得到至少一个用户问题文本(或称回复模版文本作为响应每个用户问题文本罚判定”等根据映射表中描述文本标签和答案的映射关系(一一对应关本作为描述文本标签。键词进行频率统计,计算每个关键词在用户问题文本簇中的出现次数或频率,例如使用签预先关联的回复文本由客服统一发送相同的回复文本,以进行批量化的用户问题解[0203]为了说明本申请实施例提供的文本向量化模型的训练方法和文本处理方法的效[0204]从表1可以看出,本申请实施例提供的文本向量化模型的训练方法和文本处理方[0205]下面继续说明本申请实施例提供的文本向量化模型的训练装置133的实施为软件
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 软件著作权的转让合同9篇
- 公司劳动保护专项合同9篇
- 楼梯的细部构造教学设计中职专业课-建筑识图与构造-建筑类-土木建筑大类
- 2026汽车模具行业市场发展现状竞争分析投资评估行业规划研究报告
- 九年级英语下册 Module 3 Sport and health Unit 6 Caring for your health教学设计3 牛津深圳版
- 云南省保山市第一中学高中信息技术 什么是TCP教学设计
- 2026年河南省苏教版初中化学八年级下册第10章化学方程式课件
- 2026年福建省人教版小学英语三年级上册第4单元词汇学习课件
- 2026人工智能产业市场现状供需分析及投资评估规划分析研究报告
- 2026年山东省部编版高中英语必修第三册第9单元写作技巧课件
- 慈善基金会会员管理办法
- CJ/T 340-2016绿化种植土壤
- 碳计量管理制度
- 急诊中的泌尿系统急症处理
- GB/T 45083-2024再生资源分拣中心建设和管理规范
- 平煤神马集团化学类笔试
- 农网工程资料样表
- 中国食物成分表2018年(标准版)第6版
- 高校学生事务管理1
- IP-Guard(威盾)-3.50.0918-安装、破解、配置教程
- 毕业论文写作指导-第5章毕业论文的写作
评论
0/150
提交评论