CN119478796A 一种基于sam 2的视频概念解释方法 (浙江大学)_第1页
CN119478796A 一种基于sam 2的视频概念解释方法 (浙江大学)_第2页
CN119478796A 一种基于sam 2的视频概念解释方法 (浙江大学)_第3页
CN119478796A 一种基于sam 2的视频概念解释方法 (浙江大学)_第4页
CN119478796A 一种基于sam 2的视频概念解释方法 (浙江大学)_第5页
已阅读5页,还剩15页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本发明公开一种基于SAM2的视频概念解释语义类别对应的提示符和语义分割数据集训练2针对所要进行的目标任务,定义若干语义类别,并获取各语将每个时空概念视为博弈中的参与者,利用视频分类模型对所述待解释视频进行分针对定义的每个语义类别,引入相应的提示符p=lp1,p2,…,pi,…,p],其中每个提示符pi对应第i个语义类别,利用每个语义类别对应的提示符和语义分割数据集训练提示生,对于包含n个时空掩码的时空概念集M=[m,m2,…,mi,…,mn],将每个时空概念视ssmi和集合的预测结果之差;3,其中的f(S)是在待解释视频中M)S所表示的时空掩码被屏蔽情况下对应的模型预测。,理器执行时实现如权利要求1_7任一项所4[0001]本发明涉及可解释性人工智能领域,尤其涉及一种基于SAM2的视频概念解释方可解释性人工智能(AminaAdadiandMohammedBbox:asurveyonexplainableartificialintelligence(xai).IEEEaccess,6:素级别或者超像素级别的解释。这其中包括利用神经网络的反向传播来评估输入特对模型分类结果的影响,还包括通过对输入像素的扰动来衡量像素扰动对于图像分类结果Concept_basedExplanations[J].2019.DOI:10.48550/arXiv.1902.03129.利用特征向量将数据集中的超像素聚类成一组概念,通过自动化地识别和利用人类可理解的概念,情况下仍然难以理解,缺乏明确的轮廓外形以及清晰的语义定义。为了更准确地定义出清晰易理解的概念信息,EAC(A.Sun,P.Ma,Y.Yuan,andS.Wang,“Explainanyconcept:Segmentanythingmeetsconcept_basedexplanation,”AdvancesinNeuralInformationProcessingSystems,vol.36,2024.)利用分割一切模型具有较高可信度与可理解性。Ji,YuWang,andJienKato.Spatial_temporalconceptbasedexplanationof3dconvnets.InProceedingsoftheIEEE/CVFConferenceonComputerVisionandPatternRecognition,pages15444–15453,2023.该方法将ACE从2D扩展到3D视频场5割数据集及提示符,利用每个语义类别对应的提示符和语义分割数据集训练提示生成模[0012]针对定义的每个语义类别,引入相应的提示符p=[p1,p2,…,p:,.…,p],其中提示符pi对应第i个语义类别,利用每个语义类别对应的提示符和语义分割数据集训练提符,逐帧提取所述待解释视频的特征,将每帧图像的提示符和特征一并输入至SAM2模[0016]将所述待解释视频中每帧图像的图像特征和对应的提示符一同输入SAM2模型,6[0020]对于包含个时空掩码的时空概念集M=[m1,m2,…,my,….,mn],将每个时空概集合ssmi和集合s的预测结果之差;[0022]基于每个时空概念mi的夏普利值,得到对所述待解释视频的预测类别给出的最[0024]Am,(s)=f(sufmy)-f(s)[0025]其中的f(S)是在待解释视频中M)S所表示的时空掩码被屏蔽情况下对应的模型[0031]根据本申请实施例的第二方面,提供一种计算机程序产品,包括计算机程序/指7效率以及解释的可靠性。本发明提出将提示生成模型应用于视频数据的提示符自动生成,从而有效避免了在使用SAM2直接生成视频掩码集合时可能出现的目标丢失问题,提升了[0048]在本申请使用的术语是仅仅出于描述特定实施例的目的,而非旨在限制本申含一个或多个相关联的列出项目的任何或所[0050]本发明的核心技术在于构建与预测结果相关的概念提示生成模型,并将其与SAM细化的物体概念,基于各语义类别分别获取相应的语义分割数据集,一实施例中可以从8特征后,通过附加的前馈层或多头注意力机制生成适合相应语义类别目标对象的提示符,示符pt。中对应第个语义类别提示符的语义掩码,能够在多帧视频中准确捕获不同语义类别的时为效用函数。对于某个时空概念mi,其边际贡献Am(s)可以定义为:模型在概念集合ssmi和集合s的预测结果之差,其中SSM)fm},即:[0065]Am,(s)=f(sufmy)-f(s)[0066]其中的f(S)是在待解释视频中M)S所表示的时空掩码被屏蔽情况下,模型的预9[0076]与前述的基于SAM2的视频概念解释方法的实施例相对应,本申请还提供了基于序/指令被处理器执行时实现如上述的基于SAM供的一种基于SAM2的视频概念解释装置所在任意具备数据处理能力的设备的一种硬件结被处理器执行时实现如上述的基于SAM2的视频概念解释方法。所述计算机可读存储介质算机可读存储介还可以既包括任

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论