CN116633623B 一种面向物联僵尸网络的dga域名检测方法 (北京邮电大学)_第1页
CN116633623B 一种面向物联僵尸网络的dga域名检测方法 (北京邮电大学)_第2页
CN116633623B 一种面向物联僵尸网络的dga域名检测方法 (北京邮电大学)_第3页
CN116633623B 一种面向物联僵尸网络的dga域名检测方法 (北京邮电大学)_第4页
CN116633623B 一种面向物联僵尸网络的dga域名检测方法 (北京邮电大学)_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

获取物联网设备发出的DNS域名解析请求中的域所述域名检测模型是基于SmallBERT预训练模型与CNN的融合网络进行训练所得到的。本发明通过结合SmallBERT模型对域名以子词为粒度和基于CNN对域名以字符为粒度的两种特征提取能型DGA域名的检测性能,改善域名多分类任务性2步骤S1,获取DGA域名开源数据集:UMUDGA数据集和UTL_步骤S2,根据上述三类DGA家族域名,按照2:1:1比例提取步骤S3,基于深度学习框架构建SmallBERT预训练模型与CNN融合网络的域名分类器,特征串联成一个长向量作为全连接层的输入,SmallBERT层的输出和CNN子网络的输出串2.如权利要求1所述的一种面向物联僵尸网络UMUDGA数据集从所有DGA家族中选择了重要的50个,数据收集时间为2019年,而UTL_DGA22删除了重复的DGA家族并添加了新的僵尸网络家族,总共包含了76个DGA家族的域名所述的随机字符型DGA家族域名的特征为,由英文字母随机组合或者英文字母加上数所述的随机音节型DGA家族域名的特征为,由英文的元音字母和辅音字母组合成一个3.如权利要求1所述的一种面向物联僵尸网分别从UTL_DGA22数据集和UMUDGA数据集中提取出所有的随机单词型DGA家族和随机为融合数据集的样本数据打上二分类标签,合法域34.如权利要求1所述的一种面向物联僵尸网络的DGA域所述的词嵌入层使用WordPiece分词算法对域名文本进行分词,将每个单词或子词映射为一个固定长度的向量,而所述的字符嵌入层使用one_hot表示法进行域名文本的字符所述的SmallBERT采用Transformer层数为2、隐藏单元5.如权利要求1所述的一种面向物联僵尸网所述的SmallBERT网络使用AdamW优化器,初始学习率为2e_5,而所述的CNN二分类结果包括DGA域名或合法域名,多分类结果包括随机字符型4算法(DomainGenerationAlgorithm,DGA)是构建僵尸网络的命令控制信道的技术之一。DGA域名指的是通过DGA算法生成的恶意域名。僵尸网络控制者将DGA算法集成到恶意软件基于深度学习的DGA域名检测方法中,前期的方法研究中较多地采用循环神经网络为基础[0006]本发明提供一种面向物联僵尸网络的DGA域名检测方法,用以解决现有技术中对5[0009]将域名字符串输入训练好的域名检测模型中,得到域名的二[0017]本发明提供的面向物联僵尸网络的DGA域名检测方法,引入SmallBERT预训练语6的要素。以下示例性实施例中所描述的实施方式并不代表与本申请相一致的所有实施方[0030]对于DGA域名多分类问题,域名的多分类任务在先前的研究工作中没有得到非常数据显示模型在多个DGA域名类型的检测效果上具有很大的差距。该算法对于随机字符型随机字符的DGA域名的检测正确不断提高,僵尸控制者为了提高僵尸网络的隐蔽性和抗打对单词拼接型DGA域名的检测性能是一个需CNN神经网络结构则对域名的字符随机性、词法等特征有较好的捕捉能力。SmallBERT与[0033]对应地,图1是本发明提供的一种面向物联僵尸网络的DGA域名检测方法的流程[0036]由上述实施例可知,本申请可以有效利用SmallBERT预训练模型与CNN神经网络7[0045]对于将DGA家族分为三类,此前在DGA域名的多分类任务中以单个DGA家族为分类高的相似性。例如proslikefan和pykspa两个DGA家族都使用a_z英文字母随机组合生成域名,只是域名长度和所使用的顶级域名不同。针对这些特征接近的域名进行DGA家族的分随机字符型DGA家族的数量最多,包含的DGA家族有bedep、qakbot、ramdo、murofet、[0050]随机音节型DGA家族域名的特征为,由英文的元音字母和辅音字母组合成一个可8网站提供的排名列表,但是VictorLePochat等人在研究中指出Alexa等网站中基于流行取Tranco数据集中的24万条域名数据作为合法[0063]图6是本发明提供的一种面向物联僵尸网络的DGA域名分类神经网络结构示意9词或子词分配一个唯一的标识符。其算法有两个实现目标,一是将文本数据标记为尽可能够在物联网环境中应用。尺寸的卷积核和步长来提取域名文本序列中不同长度的n_g网络结构和CNN_LSTM融合结构的模型指标结果;SmallBERT_CNN融合模型对这两类DGA域[0091]此外,SmallBERT_CNN的融合模型在随机字符型DGA域名和合法域名的识别上表先的性能表现,证明了结合字词特征学习的SmallBERT_CNN神经网络模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论