CN119399702A 一种融合多模态大模型的智慧工地安全监测方法及其系统 (捷通智慧科技股份有限公司)_第1页
CN119399702A 一种融合多模态大模型的智慧工地安全监测方法及其系统 (捷通智慧科技股份有限公司)_第2页
CN119399702A 一种融合多模态大模型的智慧工地安全监测方法及其系统 (捷通智慧科技股份有限公司)_第3页
CN119399702A 一种融合多模态大模型的智慧工地安全监测方法及其系统 (捷通智慧科技股份有限公司)_第4页
CN119399702A 一种融合多模态大模型的智慧工地安全监测方法及其系统 (捷通智慧科技股份有限公司)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种融合多模态大模型的智慧工地安全监本发明公开了一种融合多模态大模型的智Nginx服务器作为静态网站服务器结合摄像头请图像识别实时处理。本发明通过详细的场景划2步骤一、基于Linux系统平台,利用Nginx服务器作为步骤三、基于CLIP视觉语言模型的少样本场景识别方法,并生成物品边界框并提取图像块,并结合物品提示文本传递至VLM预训练视觉语言模型生成2.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在3.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在4.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在目所需视觉属性的提示模板根据不同安全项目和场5.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在6.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在7.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在38.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在9.根据权利要求1所述的一种融合多模态大模型的智慧工地安全监测方法,其特征在所述视频流获取模块,用于基于Linux系统平台,利用Nginx服器结合摄像头请求视频流数据,并通过FFmpeg音视频处理框架将RTSP原视频流转为HLS格所述场景划分与安全指南模块,用于根据施工区域进行多个场景所述场景识别模块,用于利用基于CLIP视觉语言模型的少样本场景所述人员物品佩戴检测模块,用于YOLO_World目标检测所述物品属性检测模块,用于从LLM大型语言模型响应获取安全项目视觉属性,利用YOLO_World目标检测模型和VLM预训练视觉语言模型检查人员佩戴物品是否符合属性要所述深度估计模块,用于基于教师网络和学生网络方法进行少样本深度非极大值抑制NMS筛选置信度高的目标框,并分类为跌倒与未跌倒,判断作业人员是否异所述碰撞检测模块,用于基于深度估计和目标检测结果生成3D所述系统配置与优化模块,用于对视频流获取模块中的Nginx服务器进行配置文件设45[0003]虽然,现有的一些技术方案如:中国专利公开号CN112784821A公开了一种基于[0004]本发明的目的在于提供一种融合多模态大模型的智慧工地安全监测方法及其系6模型生成物品边界框并提取图像块,并结合物品提示文本传递至VLM预训练视觉语言模型高度相关;引导所述LLM大型语言模型总结安全项目所需视觉属性的提示模板根据不同安模型的训练参数根据实际监测场景和需求进取网络层数的优化,且非极大值抑制NMS的阈值根据目标检测的精度和召回率要求进行动[0013]作为本技术方案的进一步优选的:该方法在不同气候条件下具有自适应调整能7服务器结合摄像头请求视频流数据,并通过FFmpeg音视频处理框架将RTSP原视频流转为HLS格式并输出m3u8格式文件后上传至Ng用YOLO_World目标检测模型和VLM预训练视觉语言模型检查人员佩戴物品是否符合属性要所述系统配置与优化模块,用于对视频流获取模块中的Nginx服务器进行配置文8图2为本发明一种融合多模态大模型的智慧工地安全监测系统的功能模块示意图1是本发明实施例的一种融合多模态大模型的智慧工地安全监测方法的流程示9每个测试图像,计算其视觉特征向量与所有类别文本特征向量之间的余弦相似度分数,根使用验证集评估模型在场景识别任务上的性能,包括准确率、召回率等指标,根据评估结为了引导LLM大型语言模型总结安全项目所需的视觉属性,需要设计一系列提示测模型会为场景中的人员生成边界框,这些边界框定义了每个人员在图像中的位置和大设人物图像块列表为I=[I1,I2,…,IN](n为图像中人员数量物品提示文本列表为T=[T1,T2,…,Tm](m为需检测物品类别数量计算亲和;i=1,2,··,n,j=1,2,···,m,·表示向量点积,表示向量范数;;其中,pj表示第i个人是否佩戴第j个物品的预测。模型生成物品边界框并提取图像块,并结合物品提示文本传递至VLM预训练视觉语言模型具体的,利用LLM大型语言模型根据场景信息或安全需求生成安全用品的视觉属设物品图像块列表为I'=[I,I以,…,I)(n'为检测到的物品数量属性提示文本列表为(m'为物品属性类别数量计算余弦相似度s的过程;;在每个深度图上归一化为0_1,采用仿射不变性损失Laffine进行多数据集联合训练,其计;;其中,B;表示第i个检测框是否保留的判断(1表示保留,0表示抑制S和最大值若这两个区间有重叠部分,即一个长方体的最小值小于另一个长方体的最大其中,判断XOY平面投影相交可通过计算两个矩形的交集面积与并集面积之比虚拟主机的配置以及根据网络带宽和服务器性能对数据传输到1这有助于模型更快地收敛并提升识别性能。些关键词不仅与高空作业场景紧密相关,而且能够帮助模型区分高空作业与其他类似场景专业术语和上下文信息;经过微调优化的LLM大型语言模型能够生成与智慧工地安全风险引导LLM大型语言模型总结安全项目所需视觉属性的提示模板根据不同安全项目为它们有助于模型更准确地识别和安全用品相关的图像内容,为了确保从LLM大型语言模[0035]利用YOLO_World目标检测模型生成物品边界框并提取图像块时利用自适应的图估计,有标签图像集和无标签图像集的比例根据实际样本数量和场景复杂度进行合理分化,且非极大值抑制NMS的阈值根据目标检测的精度和召回率要求进行动态调整平衡检测保留最佳的检测结果,NMS的阈值直接影响模型的精度和召回率,较高的阈值可以减少误的方案。在技术层面,多模态大模型的协同运用实现了视觉信息与语言信息的无缝对接。丰富了监测维度,有效应对工地安全需求的多样性和复杂性。目标检测模型方面,YOLO_[0040]图2是本申请实施例的一种融合多模态大模型的智慧工地安全监测系统的功能模器结合摄像头请求视频流数据,并通过FFmpeg音视频处理框架将RTSP原视频流转为HLS格物品属性检测模块,用于从LLM大型语言模型响应获取安全项目视觉属性,利用YOLO_World目标检测模型和LLM大型语言模型检查人员佩戴物品是非极大值抑制NMS筛选置信度高的目标框,并分类为跌倒与未跌倒,判断作业人员是否异系统配置与优

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论