CN118658154B 一种基于多模态协同表征的三维场景感知交互方法和系统 (浙江大学)_第1页
CN118658154B 一种基于多模态协同表征的三维场景感知交互方法和系统 (浙江大学)_第2页
CN118658154B 一种基于多模态协同表征的三维场景感知交互方法和系统 (浙江大学)_第3页
CN118658154B 一种基于多模态协同表征的三维场景感知交互方法和系统 (浙江大学)_第4页
CN118658154B 一种基于多模态协同表征的三维场景感知交互方法和系统 (浙江大学)_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于多模态协同表征的三维场景感知本发明公开了一种基于多模态协同表征的标识符连接物体点云嵌入特征和图像嵌入特征推理和通用对话能力实现通用的三维场景的感2获取三维场景点云数据、多视角深度图像数据和文本查询中提取存在物体实例的像素点特征向量,取均值作为物体实例对应该深度图像的图像特将物体标识符和文本查询分词并利用可学习的文本嵌入层获取嵌符的嵌入特征连接物体点云嵌入特征和物体图像嵌入特征,形成物体的多模态协同表征,始三维场景点云中提取每个物体对应的点云,点云中的每个点包含该点的三维坐标和RGB识符的嵌入特征连接物体点云嵌入特征和物体图像嵌入特征,形成物体的多模态协同表引入与物体实例数量相同的物体标识符,所述物体标识符用于在文本交互中指代物将物体标识符和文本查询分词并利用可学习的文本嵌入层将物体标识符嵌入特征、点云嵌入特征和图像嵌入特征按顺序排列,37.一种基于多模态协同表征的三维场景感知交互系统,用于实现权利要求1所述的方物体实例分割模块,其用于利用物体检测器从原始三维场物体联合表示模块,其用于将引入的物体标识符的嵌入语言模型,其利用根据由物体的多模态协同表征和文本查询的嵌入45[0005]为了克服现有的专家模型受限于固定的输入输出形式以及提升现有的三维多模6[0013]利用预训练的三维物体实例分割模型作为物体检测器,词所组成的序列,θ是可训练的参数,P(sf"s⃞-,se)是已知前置序列和答案序列7[0030]本发明为一种基于多模态协同表征的三维场景感知交互[0031](1)通过使用多模态协同表征,本发明模型不仅从三维点云模态中获取丰富的形[0037]步骤1,获取三维场景点云数据、多视角深度图像数据和文本查询标注作为训练[0040]步骤4,分别利用两个可学习的线性投影层将物体点云特征和物体图像特征分别[0043]步骤7,获取并整合多个三维场景下游任务数据集,形成统一的单轮对话数据格8的方式,仅保留置信度靠前的n个检测框对应的n个物体实例。根据检测得到的n个物体实[0051]3.3)对于第i个物体实例,利用其多[0052]3.4)遍历所有n个物体实例,得到所有物体的点云特征zveRX1024和图像特征zveRX1024。[0053]上述步骤4中,所述的物体点云嵌入特征和物体图像嵌入特征的一种可选的获取pp投影至语言模型的嵌入特征空间,并加上对应的位置编码向量,得到图像嵌入特征9[0068]用户:请详细描述场景中的<OBJXXX包括其外观以及其与周围物体的空间关[0076]给定输入的前置序列sprefix(包含三维场景的多模态协同表征序列和用户输入的[0078]其中,k是文本查询的目标答案序列的长度,是答案序列中的前i_1个[0081]本发明在五个三维场景数据集ScanRefer,Multi3DRefer,Scan2Cap,ScanQA和SQA3D上进行实验,其中ScanRefer和Multi3DRefer用于测试三维场景视觉定位任务,Scan2Cap用于测试三维场景密集描述生成任务,ScanQA和SQA3D用于测试三维场景问答任[0082]对比1.传统专家模型,包括ScanRefer、InstanceRefer、3DVG_Transformer、[0089]表2:本发明针对于Multi3DRefer数据集获得的三维场景多目标视觉定位的测试模型EMB_1B_4ROUGEMETEORCIDErSPICEScanQA30.2410.0833.3313.1464.8613.433D_VLP30.5334.5113.5366.9714.183D_LLM20.5039.3012.0035.7014.5069.40_LL3DA__13.5315.8876.79_SceneChat(本发明)43.2014.2618.3388.4920.7631.663.846.069.543.845.346.534.863.345.469.847.248.148.540.969.145.070.847.252.354.248.966.055.967.247.553.755.5三维点云模态中获取丰富的形状和空间信息,还能从二维图像模态中获取丰富的语义信[0099]值得注意的是,表1至表5中的所有实验结果均基于同一

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论