CN119476463A 一种嵌入式具身智能视觉语言大模型知识库构建及应用方法、设备、介质及产品 (北京理工大学)_第1页
CN119476463A 一种嵌入式具身智能视觉语言大模型知识库构建及应用方法、设备、介质及产品 (北京理工大学)_第2页
CN119476463A 一种嵌入式具身智能视觉语言大模型知识库构建及应用方法、设备、介质及产品 (北京理工大学)_第3页
CN119476463A 一种嵌入式具身智能视觉语言大模型知识库构建及应用方法、设备、介质及产品 (北京理工大学)_第4页
CN119476463A 一种嵌入式具身智能视觉语言大模型知识库构建及应用方法、设备、介质及产品 (北京理工大学)_第5页
已阅读5页,还剩37页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

号一种嵌入式具身智能视觉语言大模型知识本申请公开了一种嵌入式具身智能视觉语向量和文本向量,并基于融合结果生成知识图谱,得到嵌入式具身智能视觉语言大模型知识2入式具身智能视觉语言大模型知识库构建及应构建多模态3D知识检索框架;所述多模态3D知识检索框采用图像编码器和文本编码器,分别将图像数据和文本数据编码为向融合所述图像向量和所述文本向量,并基于融合结果生成知识基于所述解析结果在所述多模态知识库中检索得到多个物体以及图将选取的多个物体与对应的图检索结果进行合并,得到2.根据权利要求1所述的嵌入式具身智能视觉语言大模型知识库构建及应用方法,其特征在于,基于所述解析结果在所述多模态知识库中检索得到多个物体以及图检索结果,基于所述解析结果在所述多模态知识库中检索得到对应物体以及图3.根据权利要求2所述的嵌入式具身智能视觉语言大模型知识库构建及应用方法,其4.根据权利要求2所述的嵌入式具身智能视觉语言大模型知识库构建及应用方法,其;5.根据权利要求1所述的嵌入式具身智能视觉语言大模型知识库构建及应用方法,其36.根据权利要求1所述的嵌入式具身智能视觉语言大模型知识库构建及应用方法,其7.根据权利要求6所述的嵌入式具身智能视觉语言大模型知识库构建及应用方法,其述的嵌入式具身智能视觉语言大模型知识库构理器执行时实现权利要求1_7中任一项所述的嵌入式具身智能视觉语言大模型知识库构建时实现权利要求1_7中任一项所述的嵌入式具身智能视觉语言大模型知识库构建及应用方4如,MSCOCO数据集通过文本描述检索Flickr图像,而电子交换系统(Electronicdata方面存在不足,通常局限于对预训练模型【如CLIP(ContrastiveLanguage_ImagePre_[0004]在计算机科学领域,另一项重要应用是检索增强生成(Retrieval_augmented[0005]视觉语言学习在基于Transformer的预训练模型和大规模图像语言数据集的推动5[0009]本申请的目的是提供一种嵌入式具身智能视觉语言大模型知识库构建及应用方基于所述解析结果在所述多模态知识库中检索得到多个物体以及图基于所述解析结果在所述多模态知识库中检索得到对应物体以及图6;式中,s(a,b)表示物体a和物体b间的相似度,表示图像的编码向量,Q表示文一项所述的嵌入式具身智能视觉语言大模型知识库构建及算机程序被处理器执行时实现上述中任一项所述的嵌入式具身智能视觉语言大模型知识处理器执行时实现上述中任一项所述的嵌入式具身智能视觉语言大模型知识库构建及应本申请提供了一种嵌入式具身智能视觉语言大模型知识库构建及应用方法、装7[0022]图1为本申请一实施例提供的一种嵌入式具身智能视觉语言大模型知识库构建及图2为本申请一实施例提供的嵌入式具身智能视觉语言大模型知识库构建及应用8[0029]步骤101:采用图像编码器和文本编码器,分别将图像数据和文本数据编码为向[0036]本申请另一个示例性的实施例中,为了提升对3D场景中了一个多模态知识库。在这一过程中,需要特别关注SenseVerse中的物体通过视觉语言模[0041]在实际应用过程中,本申请通过3D场景和文本细粒度交互的方式实现相似度确9数(normalizationconstant它用于确保整[0044]上述交互方式忽略了细粒度的对齐,对此本申请提出了细粒度的多模态交互方pp表示点的数量和片段的数量,K表示每个片段中的点数。这些片段被送入一个分词器主要用于点云任务的编码器部分,它的作用是通过模拟预训练的方式,将对比学习应用到码特征为fo(i)ER(r;d)和。r为采样数,dL为特征维度。且di,tj<dL。x,()为3D其中,a",b*互为正例。[0051]本申请另一个示例性的实施例中,步骤103中解析用户问题得到解析结果的实现经过训练以模仿在短语匹配方面表现更好的稀疏检索器的性能。已知技术中还提出了置关系。从图像中识别并提取图节点和边的实例。这样可以构建传统意义上的知Di=3DImageEncoder(e)(11)选取概率最大的特性向量作为实体对应的3D特征向量,作为其最终的特征表示。式中,fusion(*,*)表示特征合[0065]图检索中文本图是由带有文本属性的节点和边构成的图,可以形式化地表示为[0067]图检索增强生成是指给定图G上的一个特定问题q,在G中一定存在一个相关的子图结构,可以用来帮助生成更加可靠和解释性强的回答。检索前k个相关性最大的子图结[0068]使用对应名词的3D特征向量和子图实体的向量计算相似度,筛选正确的匹配空k=argmax(I·Ti)(16)s(:Q,Ih->,E⃞)-s(Q:Ein)+s(:Ein)(17)模态检索方法得到。Ej表示第j个实体的嵌入向量,实体可以是文本或其他模态表示的对量查询与目标实体之间的语义相似性。Er表示目标实体的嵌入向量,通常与特定查询相间的相似度得分,衡量图像与基础实体在特定特征空间的相似性。Ein表示基础实体的嵌[0070]由于混合检索混合了图检索和文本检索,其中包含的文IR和RAG技术在各类应用中的潜力至关重要,从网络搜索到复杂的机器人导航系统均有裨场景中多样的物体配置和复杂关系带来的挑战。个应对复杂多模态检索任务的强大解决方案、一个新的检索测评指标M3DKR测评多模态模式中,X表示文本,X表示子图,K,表示拓扑结构中的某种特定类型的子集,和条件[X,;X;X,X]下,当前时间步长的概率分布。表示用于检索的查询向gg据集包含ARKitScenes、MultiScan、3RScan等多个数据集。使用挑选其中的ScanNet、[0095]全局(Global)和细粒度(Fine_grained)表示不同级别的评估标准:排名1表示在[0104]即使是在挑战性更大的场景中,例如在ScanNet数据集上进行训练并在3RScan数据集上测试时,本申请提供的方法依然表现出明显的优势。虽然全局检索的Rank1仅为[0105]这些数据表明,本申请提供的细粒度检索方法在零样本索内容方位的准确性和丰富程度。其中,生成结果对比实验GraphTextcontent和Text[0113]这表明本申请提供的方法有效地解决了多模态语言模型在生成过程中可能出现生成答案的准确性,从而减轻了由于模型对视觉信息和提问理解的处理不足所生产的幻实验结果表明,本申请提供的方法在视觉语言多模态检索任务中平均提升了检索准确度[0115]本申请还提出了室内场景的多模态评估框架(M3DKR这个框架包含大部分常见提供了一种多模态检索泛化性方案。[0118]此外,在本申请的基础上,还可以进一步侧重于探索室内RAG(Retrieval_现一种嵌入式具身智能视觉语言大模型知识库构建该计算机程序被处理器执行时实现上述各方机程序被处理器执行时实现上述各方法实施例中通过计算机程序来指令相关的硬件来完成,所述的计算机程序可存储于一非易失性计算机本申请所提供的各实施例中所使用的对存储器、数据库或其它介质的任何引用,均可包括非易失性和易失性存储器中的至少一种。非易失性存储器可包括只读存储器(Read_取存储器(StaticRandomAccessMemory,SRAM)或动态随机存取

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论