CN118535978B 一种基于多模态大模型的新闻分析方法及系统 (中国经济信息社有限公司)_第1页
CN118535978B 一种基于多模态大模型的新闻分析方法及系统 (中国经济信息社有限公司)_第2页
CN118535978B 一种基于多模态大模型的新闻分析方法及系统 (中国经济信息社有限公司)_第3页
CN118535978B 一种基于多模态大模型的新闻分析方法及系统 (中国经济信息社有限公司)_第4页
CN118535978B 一种基于多模态大模型的新闻分析方法及系统 (中国经济信息社有限公司)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于多模态大模型的新闻分析方法及本发明提供一种基于多模态大模型的新闻多模态大模型将预处理后多模态数据转换成文据多个新闻的最优相似新闻生成对应的新闻关2从指定新闻媒体平台中以多种模态的形式采集与新闻相关的数据,得到通过预构建的大数据处理平台对多个所述多模态数据进行分片处通过多模态大模型分别对多个预处理后多模态数据进行模态转换,得分别计算多个新闻的多个所述语义特征向量与所述向量数据库中的多个语义特征向分别根据多个新闻对应的最优相似新闻生成多个对应的新所述分别对多个所述新闻关系网络中多个新闻的所有所将所述嵌入层的输出与所述编码层的输入连接,将所述编码层的通过所述嵌入层获取对应的新闻关系网络中多个新闻的所有所述语通过多模态大模型对任意一个预处理后多模态数据进行模态转换,得若预处理后多模态数据为初始文本数据,按照指定字符宽度若预处理后多模态数据为初始音频数据,对所述初始音频数据若预处理后多模态数据为初始图像数据,对所述初始图3若预处理后多模态数据为初始视频数据,从所述初始视频数据中划分出背景音频数将多个所述第一短文本数据和/或多个所述第二短文本数据和/或多个所述第三短文本数据和/或多个所述第四短文本数据组合成多个短文本数据,将多个所述第一长文本数据和/或多个所述第二长文本数据和/或多个所述第三长文本数据和/或多个所述第四长文如此通过多模态大模型对所有预处理后多模态数据进行分别对多个新闻的多个所述短文本数据进行全量特征分别对多个新闻的多个所述长文本数据进行语义特征提取,将多个新闻的所述标题特征向量、多个所述第一短文本特征向量分别对多个新闻的多个所述语义特征向量进行分片处通过相似匹配算法逐一计算多个所述新闻序列中多个新闻的多个所述语义特征向量4按照预设段落参数逐一对各个所述新闻序列中多个新闻的多个第一短文本特征向量按照预设段落参数逐一对多个相似新闻的多个第一短文本特征向量和多个第二短文通过相似匹配算法逐一计算各个所述新闻序列中多个新闻对应的段落向量与对应的通过相似匹配算法逐一计算各个所述新闻序列中多个新闻对应的标题特征向量与对通过相似匹配算法逐一计算各个所述新闻序列中多个新闻对应的多个第一短文本特征向量分别与对应的相似新闻的多个第一短文本特征向量和多个第二短文本特征向量之通过加权决策算法逐一对各个所述新闻序列中多个新闻对应的所述题分数与所述正文分数进行权重计算,得到各个所述新闻序列中多个新闻对应的权重值,分别在各个所述新闻序列中根据对应的权重值对权重值所对应的新闻按照优先级进行排分别将多个新闻作为对应的最优相似新闻所在所述初始新闻数据预处理模块,用于从指定新闻媒体平台中以多种模态的通过预构建的大数据处理平台对多个所述多模态数据进行分片处特征生成模块,用于通过多模态大模型分别对多个预处理后多模态数据进行模态转特征计算模块,用于分别计算多个新闻的多个所述语义特征5主题生成模块,用于分别根据多个新闻对应的最优相似新闻生成多所述主题生成模块中,分别对多个所述新闻关系网络中多个新闻的将所述嵌入层的输出与所述编码层的输入连接,将所述编码层的通过所述嵌入层获取对应的新闻关系网络中多个新闻的所有所述语6到多个新闻对应的多个语义特征向量并存入向[0009]分别计算多个新闻的多个所述语义特征向量与所述向量数据库中的多个语义特7关系网络,分别对多个所述新闻关系网络中多个新闻的所有所述语义特征向量进行分析,[0024]随着信息化时代的到来,移动互联网媒体在网络新闻平好网络新闻热点溯源分析研判。8[0027](1)热点话题和敏感话题识别技术:主要是利用布控的关键字和语义分析识别话[0029](3)网络文本自动分析和自动摘要技术:通过利用计算机自动化处理和人工智能到多个新闻对应的多个语义特征向量并存入向[0035]分别计算多个新闻的多个所述语义特征向量与所述向量数据库中的多个语义特9[0040]基于数据提供商推送新闻数据(即外部数据源)到预构建的大数据处理平台的接ID范围(即采集ID号的区间范围)对采集到的10条新闻数据(即离线新闻数据和/或实时新数据优化处理等。数据优化处理包括对新闻数[0050]优选地,所述通过多模态大模型分别对多个预处理后多到第一图像文本数据,按照所述指定字符宽度对所述第一图像文本数据进行语义分段处[0056]将多个所述第一短文本数据和/或多个所述第二短文本数据和/或多个所述第三短文本数据和/或多个所述第四短文本数据组合成多个短文本数据,将多个所述第一长文本数据和/或多个所述第二长文本数据和/或多个所述第三长文本数据和/或多个所述第四字符宽度大于300字符且小于或等于512字符或[0063]所述音频处理单元中,通过语音转文字模型对所述初始[0068]通过BERT语义分割模型按照指定字符宽度对所述初始文本数据进行语义分段处个第二图像文本数据,将所述背景音频文本数据和多个所述第二图像文本数据进行汇总,[0070]将多个所述第一短文本数据和多个所述第四短文本数据述短文本数据和多个所述长文本数据作为交通新闻的语义[0089]分别对多个新闻的多个所述语义特征向量进行分片处理的排序算法对应按照时间顺序或ID号从大到小的顺序逐一对2个分片新闻组中的新闻进行[0094]通过相似匹配算法逐一计算多个所述新闻序列中多个新闻的多个所述语义特征的语义特征向量作为相似特征向量,得到各个所述新闻序列中多个新闻对应的相似新闻,[0095]具体地,通过相似匹配算法分别将多个新闻的多个语义[0096]应理解地,相似匹配算法包括余弦相似度(CosineSimilarity)、欧氏距离[0099]所述分别将多个新闻的多个所述语义特征向量与对应的多个所述相似特征向量[0100]按照预设段落参数逐一对各个所述新闻序列中多个新闻的多个第一短文本特征[0101]按照预设段落参数逐一对多个相似新闻的多个第一短文本特征向量和多个第二[0102]通过相似匹配算法逐一计算各个所述新闻序列中多个新闻对应的段落向量与对[0103]通过相似匹配算法逐一计算各个所述新闻序列中多个新闻对应的标题特征向量[0104]通过相似匹配算法逐一计算各个所述新闻序列中多个新闻对应的多个第一短文本特征向量分别与对应的相似新闻的多个第一短文本特征向量和多个第二短文本特征向文本的向量和相似新闻正文的所有向量([0107]通过相似匹配算法计算新闻序列中任意一个新闻对应的多个第一短文本特征向量分别与对应的相似新闻的多个第一短文本特征向量和多个第二短文本特征向量之间的[0108]通过相似匹配算法分别计算任意一个新闻对应的多个第一短文本特征向量分别与对应的相似新闻的多个第一短文本特征向量和多个第二短文本特征向量之间的相似度,将第1组有时间顺序的增量数据进行相似新闻匹配、对相似特征向量进行权值计算以及生[0114]分别将多个新闻作为对应的最优相似新闻所在所述初始[0120]通过所述嵌入层获取对应的新闻关系网络中多个新闻的依赖特征表示构建成主题文本序列,通过所述输出层将所述主题文本序列转换成新闻主[0123]按照学习时间参数定期地对一个新闻关系网络中所有新闻的语

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论