版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
202211193810.42022.09.28与M个聚类分区的分区中心向量做相似度计算,得到M个第一相似度;根据M个第一相似度确定K在K个检索分区中选择检索分区作为目标检索分需将待查询向量与向量底库中的所有向量计算2将待查询向量分别与M个聚类分区的分区中心向量做相似度计算,得到M个第一相似一所述聚类分区的分区中心向量是根据任一所述聚类分区中包含的多个向量确定的,M为从所述K个检索分区中确定目标检索分区,所述目标检索分区中包含目标向量的概率在所述K个检索分区中选择未被选择过的检索分区作计算所述待查询向量分别与所述目标检索分区中包含的各向量若所述目标检索分区包含所述目标向量的概率值大于所述预设阈值,则终止如上操将已经选择的至少一个检索分区中所述概率值大于所述第一预设阈值的检索分区中根据已经选择的至少一个检索分区中所述概率值大于所述第一预设阈值的检索分区根据已经选择的至少一个检索分区中分别包含的各向量与所述待查询向量之间的所5.如权利要求1所述的方法,其特征在于,在按照所述K个第一相似度由高到低的顺序在所述K个检索分区中选择未被选择过的检6.如权利要求1所述的方法,其特征在于,在所述K3针对所述K个检索分区中的任一检索分区,将所述检索分区中的各向量按照向量之间计算所述待查询向量分别与所述多个检索子分区的子分区中心根据所述待查询向量与每个检索分区中的多个子分区中在排序后的K个检索分区中选择未被选择过的检索分区作为所根据所述待查询向量与每个检索分区中的多个子分区中心向量的多个第三相似度中根据所述待查询向量与每个检索分区中的多个子分区中心向量的多个第三相似度中在各所述第二相似度中,确定所述第二相似度由高到低排序在前的t个目标第二相似将所述待查询向量、所述K个第一相似度和所述t个目标第二相似将所述待查询向量、所述K个第一相似度和所述t个目将N个待查询向量形成的矩阵和所述N个待查询向量中每个待查询向量对应的所述K个第一相似度形成的矩阵输入第一预测模型,得到所述N个待查询向量对应的N个初始概率值;所述初始概率值用于表征任一待查询向量对应的K个检索分区中包含所述待查询向量针对任一待查询向量,将所述待查询向量对应的初始概率值将待查询向量分别与M个聚类分区的分区中心向量做相似度计算,得到M个第一相似一所述聚类分区的分区中心向量是根据任一所述聚类分区中包含的多个向量确定的,M为从所述K个检索分区中确定目标检索分区,所述目标检索分区中包含目标向量的概率4在所述K个检索分区中选择未被选择过的检索分区作计算所述待查询向量分别与所述目标检索分区中包含的各向量若所述目标检索分区包含所述目标向量的概率值大于所述预设阈值,则终止如上操将已经选择的至少一个检索分区中所述概率值大于所述第一预设阈值的检索分区中根据已经选择的至少一个检索分区中所述概率值大于所述第一预设阈值的检索分区根据已经选择的至少一个检索分区中分别包含的各向量与所述待查询向量之间的所按照所述K个第一相似度由高到低的顺序在所述K个检索分区中选择未被选择过的检针对所述K个检索分区中的任一检索分区,将所述检索分区中的各向量按照向量之间计算所述待查询向量分别与所述多个检索子分区的子分区中心根据所述待查询向量与每个检索分区中的多个子分区中在排序后的K个检索分区中选择未被选择过的检索分区作为所5根据所述待查询向量与每个检索分区中的多个子分区中心向量的多个第三相似度中根据所述待查询向量与每个检索分区中的多个子分区中心向量的多个第三相似度中在各所述第二相似度中,确定所述第二相似度由高到低排序在前的t个目标第二相似将所述待查询向量、所述K个第一相似度和所述t个目标第二相似在所述处理单元将所述待查询向量、所述K个第一相似度和所将N个待查询向量形成的矩阵和所述N个待查询向量中每个待查询向量对应的所述K个第一相似度形成的矩阵输入第一预测模型,得到所述N个待查询向量对应的N个初始概率值;所述初始概率值用于表征任一待查询向量对应的K个检索分区中包含所述待查询向量针对任一待查询向量,将所述待查询向量对应的初始概率值6度,将相似度由高到低进行排序的前W个相似度对应的向量作为待查询向量的查询结果返[0004]这种方法针对包含亿级乃至十亿级规模的向量的向量底一相似度;所述M个聚类分区为对向量底库中的各向量按照向量之间的相似度进行聚类得[0008]循环执行如下操作,直至确定出在所述K个检索分区中选择的目标检索分区包含[0009]在所述K个检索分区中选择未被选择过的检索分区作为目标检索分区;计算所述7应有一个分区中心向量;通过计算待查询向量与M个聚类分区的分区中心向量的第一相似[0012]在一种可能的实现方式中,基于已经选择的至少一个检索分区和所述待查询向分区中所述概率值大于所述第一预设阈值的检索分区中包含的各向量分别与所述待查询向量之间的所述第二相似度由高到低的顺序,将排序在前的W个所述第二相似度分别对应[0013]上述技术方案中,由于选择出的概率值大于第一预设阈分别与所述待查询向量之间的第二相似度由高到低的顺序排序在前的W个第二相似度分别[0014]在一种可能的实现方式中,基于已经选择的至少一个检索分区和所述待查询向落在选择的分区中的概率值不大于第一预设阈值的检索分区中可能也存在与待查询向量[0016]在一种可能的实现方式中,在所述K个检索分区中选择未被选择过的检索分区作算待查询向量与再次选择的目标检索分区中的向量之间的相似度,因此可以降低计算量,[0018]在一种可能的实现方式中,在所述K个检索分区中选择未被选择过的检索分区作8个检索分区中选择未被选择过的检索分区作为所述目每个检索分区中的多个子分区中心向量的多个第三相似度中超出第二预设阈值的所述第区中的多个子分区中心向量的多个第三相似度中的最大相似度,对所述K个检索分区进行[0021]通过多个第三相似度中超出第二预设阈值的所述第三相似度的数量或者通过多值和所述待查询向量对应的所述t个目标第二相似度输入第二预测模型,得到所述待查询向量对应的所述K个第一相似度形成的矩阵输入第一预测模型,如此第一预测模型就可以9程序产品时,使得计算机执行上述第一方面或第一方面的任一种可能的实现方式中的方[0035]上述第二方面至第五方面中任一方面可以达到的技术效果可以参照上述第一方[0042]图5b为本申请提供的一种对向量底库中的向量进行聚类后得到的M个聚类分区的[0045]图8为本申请提供的一种待查询向量与每个检索分区的分区中心向量之间的第二相似度和待查询向量与每个检索子分区的子分区中心向量的第三相[0048]图11a为本申请提供的采用硬件加速器的矩阵乘矩阵的方式进行计算后得到的任一待查询向量与M个分区中心向量的M个第一相似度的[0049]图11b为本申请提供的2个待查询向量中每个待查询向量对应的3个第一相似度形物的研发需要在亿级/十亿级的化合物底库中搜索与新型药物的活性片段或先导化合物相选取相似度由高到低排序在前的W个向量作为查询度满足预设阈值的向量达到W个,则停止计算待查询向量与向量底库中剩余的其他向量之[0062]方式1需要计算待查询向量与整个向量底库中的所有向量的相似度,虽然能够保[0064]图2提供了一种本申请实施例可以适用的系统架构示意图,该系统中包括采集设设备20和一个或多个存储设备30可通过方法等对向量底库中的大量向量按照向量之间的相似度进行聚类计算,从而得到M个聚类示出了一种可能的对向量底库中的向量进行聚类后得到的M个聚类分区的示意图,在图5b分区中的每个聚类分区的分区中心向量以及每个聚类分区中包含的各向量发送至存储设外,处理器201还可以是专用集成电路(applicationspecificintegratedcircuit,速度很快,作为运行在处理器201上的操作系统或其他正在运行中的程序的临时数据存储器。内存包括易失性存储器(volatilememory),例如,随机存储器(randomaccess等数据。硬盘包括但不限于:非易失性存储器(non_volatilememory),例如只读存储器(read_onlymemory,ROM),硬盘驱动器(harddiskdrive,HDD)或固态驱动器(solid处理器201的结构。型,本申请实施例对特征提取模型的种类不作限制。例如可以输入至卷积神经网络[0084]计算设备20对向量底库中的各向量按照向量之间的相似度进行聚类,得到M个聚将K个第一相似度分别对应的聚类分区确定为K[0089]在K个检索分区中选择未被选择过的检索分区作为目标检索分区,计算待查询向[0093]步骤602,将所述待查询向量分别与M个聚类分区的分区低排序在前的K个第一相似度,并将所述K个第一相似度分别对应的聚类分区确定为K个检[0095]在所述K个检索分区中选择未被选择过的检索分区作为目标检索分区;计算所述标检索分区,也就无需计算待查询向量与下一个目标检索分区中的各向量的第二相似度,[0102]上述技术方案中,由于选择出的概率值大于第一预设阈包含的所有向量分别与所述待查询向量之间的第二相似度由高到低的顺序排序在前的W个一个检索分区中的各向量的第二相似度由高到低排序在前的W个第二相似度分别对应的W[0106]在一种可能的实现方式中,在K个检索分区中选择目标检索分区也可以不是任意以在排序后的K个检索分区中按顺序依次选与检索分区B的分区中心向量的第一相似度为0.8,待查询向量与检索分区C的分区中心向[0109]对每个待查询向量对应的K个检索分区进行科学合理的排序,根据顺序选择目标够得出概率值大于第一预设阈值,从而可以尽快终止检索。而若先计算检索分区B的概率算待查询向量与再次选择的目标检索分区中的向量之间的相似度,因此可以降低计算量,索分区中按顺序选择未被选择过的检索分区作为目[0112]图7示出了本申请实施例提供的一种对任一检索分区划分检索子分区的示意图。个检索分区均划分出了5个检索子分区。当然不同的检索分区划分的检索子分区的数量可以参考对向量底库中的各向量进行聚类得到多个聚待查询向量与每个检索分区的分区中心向量之间的第二相似度和待查询向量与每个检索[0114]还可以根据待查询向量与每个检索分区中的多个子分区中心向量的多个第三相计算出了待查询向量与检索分区A中的5个检索子分区的子分区中心向量的5个第三相似的数量x2;计算出了待查询向量与检索分区C中的5个检索子分区的子分区中心向量的5个于待查询向量与每个检索分区中的多个子分区中心向量的多个第三相似度,对所述K个检[0116]图8中的五角星所示意的是该检索分区的分区中心向量,三角形所示意的是该检排序方法对K个检索分区的排序的影响。当按照3个第一相似度由高到低的顺序对3个检索索分区B检索分区C。图8示出了3个第一相似度(3个第一相似度分别用图8中的正方形至3[0117]当根据待查询向量与每个检索分区中的多个子分区中心向量的多个第三相似度A检索分区C。图8示出了待查询向量与每个检索分区中的5个子分区中心向量的第三相似度中的最大相似度(分别用图8中的正方形至3个该样本向量与M个聚类分区的M个第一相似度,根据M个第一相似度的大小确定K个检索分与K个检索分区的K个第一相似度和t个目标第二相似度以及标签输入预测模型,标签为该[0122]若采用单阶段模型,则步骤603中的根据各第二相似度得到概率值的方法可以进如,将各第二相似度中按照相似度由高至低排序后排序在前面的前t个第二相似度作为目乘向量的方式先计算待查询向量q1和检索分区A中各向量的各第二相似度,再在硬件加速器中采用矩阵乘向量的方式计算待查询向量q2和检索分区D中各向量的各第二相似度。因整合成多个待查询向量作为输入。整合的方式可以采用本领域技术人员所熟知的各种方[0136]对向量底库中的各向量按照向量之间的相似度进行聚类得到了M个聚类分区。每11a示出了采用硬件加速器的矩阵乘矩阵的方式进行计算后得到的任一待查询向量与M个[0138]针对任一待查询向量,根据该待查询向量与M个分区中心将第一相似度由高到低排序在前的K个第一相似度对应的聚类分区作为该待查询向量的K[0139]步骤603中的根据各第二相似度得到概率值的方法可以进一步细化,图10示例性到N个待查询向量对应的N个初始概率值;初始概率值用于表征任一待查询向量对应的K个因为第一预测模型只需针对每个待查询向量和每个待查询向量对应的3个第一相似度,计[0142]例如,为待查询向量q1和待查询向量q2分别生成2个初始概率值p11和p12,其中分区作为目标检索分区;确定待查询向量与该目标检索分区中的各向量的各第二相似度。的100个向量的100个第二相似度,将100个第二相似度中值最大的第二相似度作为目标第200个向量的200个第二相似度,将200个第二相似度中值最大的第二相似度作为目标第二[0147]由于每个待查询向量对应的目标检索分区不同,因此不同的待查询向量对应的t每个待查询向量对应的K个第一相似度形成的矩阵输入第一预测模型,如此第一预测模型[0153]例如,待查询向量q1与检索分区A、检索分区B和检索分区C的第一相似度分别为[0155]这里确定目标第二相似度的方法同前文中在目标检索分区中确定目标第二相似最大的值为目标第二相似度;将待查询向量q1对应的最终概率值p21和待查询向量q1对应新为更新概率值,返回步骤1201中的在K个检索分区中选择下一个未被选择过的检索分区[0170]步骤1307,将第一相似度最大的检索分区确定为待查询向量q1的目标检索分[0175]步骤1312,在3个检索分区中选取下一个未被选择过的检索分区作为目标检索分[0177]步骤1313,计算待查询向量q1与下一个目标检索分区中将第二相似度的最大值作为下一个目标检索分区的目标第述方法实施例中步骤还可以是由计算设备20中的处理器待查询向量分别与目标检索分区中包含的各向量之间的第二相似度;根据各第二相似度,个检索分区中概率值大于第一预设阈值的检索分区中包含的各向量分别与待查询向量之查询向量之间的第二相似度由高到低的顺序,将排序在前的W个第二相似度分别对应的向[0187]在一种可能的实现方式中,处理单元1402在K个检索分区中选择未被选择过的检[0
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 百事可乐人力资源管理技能分析
- 活动与休息护理
- 小学六年级小学家长会
- 老年白内障安全护理
- 防腐保温工程公司年中工作总结述职报告
- 物理化学(阮秀琴)第六章课件
- 《猫和老鼠》课件语文S版一年级下册课件
- 《语言学概论》课件
- 电话服务礼仪与技巧课件
- 小学四年级体育立定跳远
- 初中数学八年级上册全等三角形同步专项练习题含答案
- 2026年部编版新教材语文三年级上册全套教案设计(共八个单元含教学计划)
- 泥瓦工简单施工方案(3篇)
- 临床输血指征及适应症
- 3.3 元素 课件 2025-2026学年九年级化学人教版上册
- 畜牧师中级职称考试题库及答案
- 厂中厂安全管理培训课件
- JJF(浙) 1144-2018 交流高压试验装置校准规范
- 管理篇-电力可靠性管理基础-标注版
- 客运知识培训课件
- 寝室长的心理培训
评论
0/150
提交评论