版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、目录 TOC h z t 各章标题,1,一级节标题,2,二级节标题,3,三级节标题,4 HYPERLINK l _Toc262679445 摘要 PAGEREF _Toc262679445 h 我 HYPERLINK l _Toc262679446 摘要 PAGEREF _Toc262679446 h 二 HYPERLINK l _Toc262679447 1 简介 PAGEREF _Toc262679447 h 1 HYPERLINK l _Toc262679448 1.1 研究背景及意义 PAGEREF _Toc262679448 h 1 HYPERLINK l _Toc262679449
2、 1.2 国外研究现状 PAGEREF _Toc262679449 h 2 HYPERLINK l _Toc262679450 1.3 论文结构安排 PAGEREF _Toc262679450 h 3 HYPERLINK l _Toc262679451 2 入侵检测技术介绍 PAGEREF _Toc262679451 h 4 HYPERLINK l _Toc262679452 2.1 研究入侵检测的必要性 PAGEREF _Toc262679452 h 4 HYPERLINK l _Toc262679453 2.2 入侵检测相关概念 PAGEREF _Toc262679453 h 4 HYPE
3、RLINK l _Toc262679454 2.3 入侵检测系统基本原理 PAGEREF _Toc262679454 h 4 HYPERLINK l _Toc262679455 2.4 入侵检测系统的基本工作模式 PAGEREF _Toc262679455 h 5 HYPERLINK l _Toc262679456 2.5 入侵检测系统的分类 PAGEREF _Toc262679456 h 6 HYPERLINK l _Toc262679457 2.5.1 按检测技术分类 PAGEREF _Toc262679457 h 6 HYPERLINK l _Toc262679458 2.5.2 按数据
4、来源分类 PAGEREF _Toc262679458 h 7 HYPERLINK l _Toc262679459 2.6 入侵检测的当前限制和缺陷 PAGEREF _Toc262679459 h 7 HYPERLINK l _Toc262679460 2.7 基于神经网络的入侵检测技术发展 PAGEREF _Toc262679460 h 8 HYPERLINK l _Toc262679461 3 神经网络简介 PAGEREF _Toc262679461 h 9 HYPERLINK l _Toc262679462 3.1 神经网络模型 PAGEREF _Toc262679462 h 9 HYPE
5、RLINK l _Toc262679463 3.1.1 生物神经元模型 PAGEREF _Toc262679463 h 9 HYPERLINK l _Toc262679464 3.1.2 人工神经元模型 PAGEREF _Toc262679464 h 10 HYPERLINK l _Toc262679465 3.1.3 神经网络模型 PAGEREF _Toc262679465 h 12 HYPERLINK l _Toc262679466 3.1.4 神经网络如何工作 PAGEREF _Toc262679466 h 12 HYPERLINK l _Toc262679467 3.1.5 神经网络的
6、基本性质和优势 PAGEREF _Toc262679467 h 13 HYPERLINK l _Toc262679468 3.2 应用于入侵检测的神经网络 PAGEREF _Toc262679468 h 14 HYPERLINK l _Toc262679469 4 基于集成神经网络的入侵检测系统 PAGEREF _Toc262679469 h 15 HYPERLINK l _Toc262679470 4.1 系统设计 PAGEREF _Toc262679470 h 15 HYPERLINK l _Toc262679471 4.1.1 系统工作原理 PAGEREF _Toc262679471 h
7、 15 HYPERLINK l _Toc262679472 4.1.2 特征提取 PAGEREF _Toc262679472 h 15 HYPERLINK l _Toc262679473 4.2 集成神经网络算法 PAGEREF _Toc262679473 h 16 HYPERLINK l _Toc262679474 4.3 遗传算法 PAGEREF _Toc262679474 h 17 HYPERLINK l _Toc262679475 4.3.1 遗传算法的定义 PAGEREF _Toc262679475 h 17 HYPERLINK l _Toc262679476 4.3.2 遗传算法的
8、基本思想 PAGEREF _Toc262679476 h 17 HYPERLINK l _Toc262679477 4.3.3 基本遗传算法 PAGEREF _Toc262679477 h 18 HYPERLINK l _Toc262679478 4.3.4 基本遗传算法的运行参数 PAGEREF _Toc262679478 h 20 HYPERLINK l _Toc262679479 4.4.2 个人网络建设 PAGEREF _Toc262679479 h 20 HYPERLINK l _Toc262679480 4.4.3 单个网络的选择 PAGEREF _Toc262679480 h 2
9、1 HYPERLINK l _Toc262679481 4.4.4 网络综合输出 PAGEREF _Toc262679481 h 22 HYPERLINK l _Toc262679482 5 仿真实验分析 PAGEREF _Toc262679482 h 23 HYPERLINK l _Toc262679483 5.1 Matlab神经网络工具箱 PAGEREF _Toc262679483 h 23 HYPERLINK l _Toc262679484 5.2 实验数据来源 PAGEREF _Toc262679484 h 23 HYPERLINK l _Toc262679485 5.3 入侵检测数
10、据集预处理 PAGEREF _Toc262679485 h 24 HYPERLINK l _Toc262679486 5.4 模拟实验 PAGEREF _Toc262679486 h 24 HYPERLINK l _Toc262679487 5.4.1 导入数据 PAGEREF _Toc262679487 h 24 HYPERLINK l _Toc262679488 5.4.2 培训过程 PAGEREF _Toc262679488 h 25 HYPERLINK l _Toc262679489 5.5 仿真数据分析 PAGEREF _Toc262679489 h 27 HYPERLINK l _
11、Toc262679490 结论 PAGEREF _Toc262679490 h 28 HYPERLINK l _Toc262679491 参考文献 PAGEREF _Toc262679491 h 29 HYPERLINK l _Toc262679492 到 PAGEREF _Toc262679492 h 30摘要入侵检测是防火墙的合理补充。帮助系统应对网络攻击,扩展系统管理员的安全管理能力,提高信息安全基础设施的完整性。入侵检测技术是一种动态的网络检测技术,主要用于识别对计算机和网络资源的恶意使用,包括来自外部用户的入侵和外部用户的未经授权的活动。为了提高入侵检测系统的检测能力,本文在理解信息
12、安全和入侵检测概念的基础上,对神经网络模型进行分析,分别使用单个神经网络对样本进行训练,然后使用遗传算法寻找差异较大的神经网络 将研究模型集成应用到入侵检测系统中,提出相应的处理方案,得到最终结果。关键词:网络安全入侵检测神经网络集成学习遗传算法1简介信息使用比例的提高使得社会对信息真实性的要求不断提高,网络使虚假、泄露信息造成的信息危害越来越严重。比如近年来大学英语四六级考试题外泄、网络运营对股东造成的损害、“熊猫烧香”病毒导致的计算机网络大规模瘫痪等,无一不在。全国。如何在不影响网络性能的情况下对网络进行监控,并针对外部攻击、外部攻击和误操作提供实时防护,是网络安全的重要课题。1.1研究背
13、景及意义随着人类社会对互联网的需求不断增加,网络安全逐渐成为互联网和各种网络服务和应用进一步发展需要解决的关键问题。特别是1993年以来,随着Internet/Intranet技术的成熟,各种电子商务和电子政务活动日益开展,许多组织和企业建立了自己的部门网络,并与Internet连接。这些电子商务和政务应用以及企业网络中的商业机密是攻击者的目标。据统计,网络攻击手段有上千种,使得网络安全问题极为严重1 。在网络安全技术中,防火墙是第一道防线。通常它位于路由器后面,并为进出网络的连接提供安全访问控制。但是总则网络系统必须要对外开放一些应用端口,比如80、110等,这时候防火墙的不足就会充分体现出
14、来,防火墙对外界的攻击无能为力;同时,防火墙绝对不是坚不可摧的,甚至有些防火墙本身也会造成一些安全问题。信息安全的PDRR模型充分说明了检测的重要性。入侵检测是防火墙的合理补充。帮助系统应对网络攻击,扩展系统管理员的安全管理能力,提高信息安全基础设施的完整性。入侵检测技术是一种动态的网络检测技术,主要用于识别对计算机和网络资源的恶意使用,包括来自外部用户的入侵和外部用户的未经授权的活动。入侵检测系统(IDS)由入侵检测软件和硬件组成。它被认为是继防火墙之后的第二道安全门。它可以在不影响网络性能的情况下对网络进行监控,并提供对内部攻击、外部攻击和误操作的实时保护2 。入侵检测领域应用最广泛和成熟
15、的技术仍然是基于专家系统的规则检测技术。然而,随着系统安全环境,特别是网络系统安全形式的变化,传统的基于专家系统的检测技术暴露出一些局限性和不足。近年来,涌现了大量有别于传统专家系统技术的入侵检测方法,尤其是基于人工神经网络的检测技术的发展。人工神经网络是通过模拟人脑处理、存储和处理信息的机制而提出的一种智能信息处理技术。它是由大量高度互联的简单处理单元(神经元)组成的复杂网络系统。人工神经网络本质上实现了输入到输出的映射关系,其输出值由输入样本、神经元之间的互连权重和传递函数决定。神经网络具有高度的学习和自适应能力,可以通过学习识别新入侵行为特征的能力来克服基于专家系统的检测技术的局限性3
16、。1.2国外研究现状对于神经网络技术在入侵检测中的应用,前人已经做了一些研究工作。德巴尔等人。采用递归(Recurrent)BP网络,在对收集到的审计记录进行分析的基础上,对系统每个用户的行为进行建模,并结合传统的专家系统进行入侵检测。为了满足入侵检测的要求,谭对传统的多层前馈网络(MLFF)的训练算法进行了改进,并用它来对用户的各种行为特征进行建模。霍格伦德等人。提出了一种基于一维SOM(Self-Organizing Feature Map)网络判断用户行为特征的异常检测算法,并建立了原型系统。 Ghosh 和 Schwartzbard 采用基于多层感知器 (MLP) 的异常检测模型,通过
17、分析程序执行过程中的系统调用序列记录来监控特定程序的运行状态。使用数百个训练样本,他们获得了 77% 的检测概率和大约 3% 的误报概率。同时,Ghosh 等人。还进行了滥用检测技术的研究。他们的工作结果表明,基于 MLP 的滥用检测模型具有较高的误报概率,并且性能不如异常模型。此外,Ghosh 等人。采用另一种神经网络模型Elman网络,实现了77%的检测概率,零误报概率。瑞安等人。统计用户每天执行的Shell命令,使用标准BP网络训练识别形成的用户行为特征向量(由每个命令的执行次数组成)。随着网络互联环境的快速发展,基于网络流量分析的入侵检测技术越来越流行。 Cannady 和 Mahaf
18、fey 将 MLP 模型和 SOM/MLP 混合模型应用于基于网络流量的滥用检测模型。在基于 MLP 模型的入侵检测技术中,Cannady 等人。根据网络数据包的几个协议字段值(如协议类型、属性字段值、载荷长度和容量等)构造一个特征向量,提供给MLP网络进行训练和学习。训练后,测试样本集进行测试。实验结果表明,该模型可以从正常的网络流量中识别出ISS和Satan扫描、SYN Flood攻击活动等数据包。同时,Cannady 等人。提出了一种混合 SOM/MLP 模型来检测时间分散的攻击行为,例如 FTP 密码启发式。 SOM网络主要用于分析数据包中的负载能力,作为MLP网络的预处理单元,起到特
19、征降维的作用。实验结果表明,可以更好地检测单位时间内不同频率的密码启发式行为。博尼法西奥等人。首先构建网络会话的数据向量,将数据payload中的可疑特征字符串编码,与目标端口号一起构成BP网络的输入特征向量,送入神经网络进行训练。经过训练,BP网络可用于滥用入侵检测。 MIT 的 Lippmann 和 Cunningham 明确提出了一种结合关键词和神经网络进行网络入侵检测的方法,并对 Telnet 服务对话进行了相关研究。采用的方法是先选取一组关键词表,然后统计会话数据中的每个关键词,形成一个n维的输入特征向量(n为关键词个数)。之后,MLP 网络用于训练和识别。该实验可以在达到80%检测
20、概率的基础上,将虚警概率降低到每天一次左右的水平4 。神经网络具有摘要和摘 要能力,对不完整的输入信息具有一定的容错能力。并且具有高度的学习和适应能力。入侵检测领域的研究重点之一是分类算法。由于自身的原因,单一的分类算法总是存在各种缺陷,算法的泛化能力不强。 1990年夏皮尔证明了一个概念是弱可学习的,其充要条件是强可学习的。该定理表明可以将多个弱分类器集成为一个强分类器,从而为集成学习奠定理论基础。 Hansen 和 Salamon 将各种神经网络集成在一起,形成了一个集成神经网络。通过研究证明,集成神经网络可以提高系统的泛化能力。1.3论文结构安排本文共分八章,第一章为绪论,简要介绍了与本
21、课题相关的网络安全的基本概念,目前国外IDS领域的研究概况,并介绍了神经网络在网络安全领域的应用。入侵检测。第二章是入侵检测技术介绍。说明学习入侵检测的必要性,并介绍相关概念以了解入侵检测的基本原理和工作模式。它还介绍了入侵检测系统的分类,并提出了入侵检测的当前局限性和未来发展。第 3 章神经网络简介。本章首先介绍了生物神经元模型,然后引出了人工神经元模型,然后介绍了整个神经网络,并提出了神经网络在入侵检测系统中的应用。第四章是基于集成神经网络的入侵检测系统。本章首先提出系统的设计并解释其工作原理,并提出集成学习和遗传学习两个概念。然后对集成神经网络算法进行了理论分析,并对遗传算法进行了详细分
22、析。将集成学习原理与遗传算法相结合,讨论了基于遗传算法的集成神经网络检测方法。最后讨论了整个算法的思想和步骤,分析了各个网络的构建和选择,最后讨论了网络的综合输出。第五章为仿真实验分析。对实验数据进行分析,得出一些结论。最后一章结束了本文。2入侵检测技术介绍2.1研究入侵检测的必要性在网络安全技术中,防火墙是第一道防线。通常它位于路由器后面,并为进出网络的连接提供安全访问控制。但是总则网络系统必须要对外开放一些应用端口,比如80、110等,这时候防火墙的不足就会充分体现出来,防火墙对外界的攻击无能为力;同时,防火墙绝对不是坚不可摧的,甚至有些防火墙本身也会造成一些安全问题。信息安全的PDRR模
23、型充分说明了检测的重要性。入侵检测是防火墙的合理补充。帮助系统应对网络攻击,扩展系统管理员的安全管理能力,提高信息安全基础设施的完整性。入侵检测技术是一种动态的网络检测技术,主要用于识别对计算机和网络资源的恶意使用,包括来自外部用户的入侵和外部用户的未经授权的活动。入侵检测系统(IDS)由入侵检测软件和硬件组成。它被认为是继防火墙之后的第二道安全门。它可以在不影响网络性能的情况下监控网络,并提供内部攻击、外部攻击和误用的实时保护。2.2入侵检测相关概念1997 年,美国国家安全通信委员会 (NSTAC) 下属的入侵检测小组 (IDSG) 将“入侵”定义为:入侵是对信息系统的未经授权的访问,以与
24、(或)对信息系统的未经授权的访问进行交互。中的操作。 “入侵检测”的定义是: 入侵检测是识别企图入侵、正在进行的入侵或已经发生的入侵的过程。所有能够执行入侵检测任务和功能的系统都可以成为入侵检测系统,包括软件系统和软硬件结合的系统。2.3入侵检测系统的基本原理图 2-1 显示了入侵检测系统(IDS) 的基本原理。有四个主要阶段:数据收集、数据处理、数据分析和响应处理。数据数据收集数据处理数据分析响应处理入侵检测系统具有脆弱性的系统和网络攻击者包图 2-1入侵检测系统的基本原理1) 数据收集数据收集是入侵检测的基础。通过不同渠道收集的数据需要使用不同的方法进行分析。当前数据主要包括主机日志、网络
25、数据包、应用数据、防火墙日志等。2) 数据处理数据采集过程中获取的原始数据量一般非常大,而且还有噪声。为了进行全面和进一步的分析,需要从原始数据中去除冗余、噪声、格式化和规范化。3) 数据分析使用统计、智能算法等方法对初步处理的数据进行分析,检查数据是否正常或是否存在入侵。4) 响应处理当检测到入侵时,采取措施防止入侵,保存入侵证据并通知管理员。常见措施包括切断网络连接、记录日志、以电子方式或通知管理员。2.4入侵检测系统的基本工作模式入侵检测系统的基本工作模式是:1) 从系统的不同部分收集信息。2) 分析信息,尝试找出入侵活动的特征。3) 自动响应检测到的行为。4) 记录并报告测试过程的结果
26、。入侵检测系统的基本工作模式可以用图2-2所示的图形来表示。系统日记系统日记原始数据包检测原理异常入侵检测误用入侵检测报警报警并采取相应措施周期性检测实时检测图 2-2入侵检测系统的基本工作模式2.5入侵检测系统的分类入侵检测系统可以根据不同的方法进行分类。其中,根据检测技术、数据来源、架构和及时性进行分类是应用最广泛的分类方法。本文主要介绍前两种的分类方法。2.5.1按检测技术分类根据入侵检测系统采用的技术,可以分为误用入侵检测、异常入侵检测和协议分析三种。1)误用入侵检测误用入侵检测也称为基于签名的入侵检测。这种检测(基于签名的入侵检测)假设入侵者的活动可以用一个模式来表示,系统的目标是检
27、测主体的活动是否符合这些模式。它可以检查现有的入侵方法,但不能对新的入侵方法做任何事情。难点在于如何设计一种模式,既能表达“入侵”现象,又不包括正常活动。2)异常入侵检测异常入侵检测假设入侵者的活动与正常对象的活动异常。根据这个假设,建立对象的正常活动(“活动概况”),并将对象的当前活动状态与“活动概况”进行比较。当违反统计规律时,则认为该活动可能是一种“入侵”行为。异常入侵检测的挑战在于如何建立“活动档案”以及如何设计统计算法,以免将正常操作误认为是“入侵”或忽略真正的“入侵”行为。3) 协议分析协议分析是在传统模式匹配技术的基础上发展起来的一种新型入侵检测技术。它充分利用网络协议的高有序性
28、,结合高速抓包、协议分析和命令解析,快速检测出某种攻击特征的存在。该技术正逐步进入成熟应用阶段。协议分析大大减少了计算量,即使在高负载的高速网络上,也可以一一分析所有的数据包。2.5.2按数据源分类根据入侵检测数据来源的不同,入侵检测系统可分为基于网络的入侵检测系统、基于主机的入侵检测系统、混合式入侵检测系统和文件完整性检查入侵检测系统。1)基于主机的入侵检测系统基于主机的入侵检测系统(HIDS)通常安装在受保护的主机上,主要是实时连接主机的网络,分析和检查系统审计日志。当发现可疑行为和安全漏洞时,系统会提醒管理员采取措施。2)基于网络的入侵检测系统基于网络的入侵检测系统(NIDS)一般安装在
29、需要保护的网段,实时监控网段内传输的各种数据包,并对这些数据包进行分析检测。入侵或可疑事件,入侵检测系统会发出警报,甚至切断网络连接。3)混合入侵检测系统基于网络的入侵检测系统和基于主机的入侵检测系统都存在不足,仅使用其中一种的主动防御系统还不够强大。但它们的缺点是互补的。如果这两个系统能够无缝结合并部署在网络中,这将构建一个强大的三维主动防御系统。4)文件完整性检查入侵检测系统文件完整性检查 入侵检测系统检查文件自上次检查后在您的计算机上的变化情况。文件完整性检查入侵检测系统为每个文件维护一个数字摘要数据库,每次检查时,它都会重新计算文件的数字摘要并与数据库中的值进行比较,如果不同,则文件已
30、被修改,如果同样,文件没有改变5 。2.6目前入侵检测的局限性和不足入侵检测领域应用最广泛和成熟的技术仍然是基于专家系统的规则检测技术。典型的入侵检测系统,如IDES和NIDES系统,在专家系统中很好地实现了基于规则的检测概念,并在实际应用中取得了良好的效果。然而,随着系统安全环境特别是网络系统安全形式的变化,传统的基于专家系统的检测技术暴露出一些局限性和不足。首先,传统的专家检测技术需要维护一个复杂而庞大的规则库。面对不断变化的攻击方式和各种复杂的变种,规则库需要随时随地更新升级。由于专家系统检测技术完全依赖于精确的规则库匹配方法进行入侵检测,旧的检测规则库的后果可能是漏掉大量的入侵检测活动
31、。更严重的后果是给安全管理员制造虚假的安全表象,导致重大安全漏洞和隐患。其次,基于专家系统的检测方法缺乏足够的灵活性来检测已知入侵模式的变体。通常的规则推导过程是在精确匹配的基础上进行的。如果某种攻击方法的执行过程中出现了一些细微的变化,对于专家系统来说,如果没有找到相应的更新规则,就会被认为是合法的。行为,导致漏检。另一方面,如果采用更通用的检测规则,则可能会出现将合法用户行为误识别为非法行为的错误现象。进一步分析表明,专家系统的检测方法对时间分布的攻击活动是有效的,或者是多用户发起的协同攻击,也难以奏效。因为它只关注单个异常事件的发生,无法处理事件状态随时间的变化。近年来,涌现了大量有别于
32、传统专家系统技术的入侵检测方法,尤其是基于人工神经网络的检测技术的发展。2.7基于神经网络的入侵检测技术发展近年来,涌现了大量有别于传统专家系统技术的入侵检测方法,尤其是基于人工神经网络的检测技术的发展。人工神经网络是通过模拟人脑处理、存储和处理信息的机制而提出的一种智能信息处理技术。它是由大量高度互联的简单处理单元(神经元)组成的复杂网络系统。本质上,人工神经网络实现了输入到输出的映射关系,其输出值由输入样本、神经元之间的互连权重和传递函数决定。神经网络具有高度的学习和自适应能力,可以通过学习识别新的入侵行为特征的能力来克服基于专家系统的检测技术的局限性。入侵检测技术主要分为两类,即基于异常
33、的入侵检测技术和基于误用的入侵检测技术。但是,无论是单纯使用异常入侵检测技术,还是单纯使用误用入侵检测技术,检测性能的理论上限都不会超过两种技术思想结合的性能上限。从而肯定了具有学习能力的神经网络在入侵检测中的广阔应用前景。 3神经网络简介神经网络的全称是人工神经网络(ANN),是在现代神经生物学研究成果的基础上发展起来的一种模拟人脑信息处理机制的网络系统。能力,同时也具有对知识进行思考、学习和记忆的能力 6 。人工神经网络模仿人脑神经的活动,试图建立脑神经活动的数学模型。人工神经网络由于具有大规模并行处理、容错、自组织和自适应能力以及关联功能,已成为解决问题的有力工具。复杂现象起主要作用,并
34、广泛应用于许多科学领域。从控制理论的角度来看,神经网络处理非线性的能力是最有意义的;从系统识别和模式识别的角度来看,神经网络对非线性的跟踪识别能力是其最大的优势。3.1神经网络模型3.1.1生物神经元模型正常人的大脑由大约10 11到10 12 个神经元组成,它们是脑组织的基本单位。每个神经元有 102,104 个突触与其他神经元连接,形成一个复杂而灵活的神经网络。神经元由细胞体、树突和轴突组成。细胞体是神经元的生成中心,每个细胞体都有大量的树突(输入端)和轴突(输出端)。神经元之间的连接强度和功能特性,每个神经元细胞本身就是一个非线性的输入输出单元。一个神经元模型的示意图如下图 3-1 所示
35、。图 3-1 典型的生物神经元从图3-1可以看出,神经元由细胞体、树突和轴突组成。胞体是神经元包的额叶中心,它本身由细胞核、质网和高尔基体组成。细胞体一般会产生许多树突状突起,称为树突,是神经元的主要受体。细胞体还延伸出称为轴突的管状纤维组织,其上覆盖着称为髓鞘(Merlin 鞘)的较厚绝缘组织。髓鞘有规律地分成许多短节段,节段之间的部分称为Ranvier结。轴突的作用是传递信息。通常,轴突的末端被分成许多末端,它们与下一个神经元的树突形成一种称为突触的机制。前一个神经元的信息通过轴突传递到末端后,再通过突触影响后面的神经元。从生物控制论的角度来看,作为控制和信息处理的单元,神经元具有两种常规
36、的工作状态,激发和抑制。两次脉冲之间需要一个时间间隔,即不应期。由于神经元结构的可塑性,突触传递可以增强、减弱和饱和,因此细胞具有相应的学习功能、遗忘和疲劳效应(饱和效应)。随着生物控制论的发展,人们对神经元的结构和功能有了进一步的认识,神经元不仅是一个简单的双稳态逻辑元件,而且还是一个超微型的生物信息处理器或控制单元 7 。3.1.2人工神经元模型根据生物神经元的结构和功能,自1940年代以来提出了大量人工神经元模型,其中影响最大的是1943年美国心理学家McCulloch和数学家Pitts共同提出的形式化神经元模型。 MP型号。有N个神经元相互连接,每个神经元的激活状态(i=1, 2, 3
37、, ., N)取0或1,分别代表抑制和激发。每个神经元的状态受其他神经元的约束,遵循以下规则(3-1)其中是神经元 i 和神经元 j 之间突触连接的强度,或权重;神经元 i 的阈值;在这里采取阶跃函数步骤,我们有步骤(a)=式(3-1)也可以理解为神经元i的输入输出关系。 X j 是第 j 个神经元对第 i 个神经元的输入; xi 是第 i 个神经元的输出;它是第 i 个神经元的净输入。如果将阈值也视为权重,则方程(3-1)可改写为(3-2)此时, =1,即为原来的MP模型。然而,这个简单的 MP 模型没有考虑时间积分、不应期、延迟和数模转换的影响。如果考虑到这些影响,可以开发 MP 模型的许
38、多变体。它们在细节上有所不同(即并行分布式处理的思想),但有很多共性,提取这些共性可以给出一个相当摘要的模型,其数学表达式为(3-3)(3-4)(3-5)式中, ,与式(3-1)同义;- 第 i 个神经元的净输入- 第 i 个神经元的外部输入- 第 i 个神经元的激活状态 -第 i 个神经元的输出神经元的激活规则(激活函数) 神经元的输出规则(转移函数)在某些模型中,假设神经元没有部分状态,此时可以设置 f = 1(恒等映射) 。不同的系统对激活值做出不同的假设,可以是连续的也可以是离散的。如果是连续的,可以取任意实数(无界),也可以取最大值和最小值之间的数(有界);如果它是离散的,它可以取两
39、个值、三个值或一个小的有限值数集。下面的图 3-2显示了广义 MP 模型 8 。图 3-2 广义 MP 模型3.1.3神经网络模型神经网络是在对人脑思维方式研究的基础上,通过对人脑的数学简化和抽象模拟,反映人脑基本功能的并行处理连接网络。神经网络由多个相互连接的神经元组成,这些神经元是神经网络的基本处理单元。有几十种不同的神经网络模型。通常,人们对神经网络的互连结构思考较多,包括图 3-3 所示的四种典型结构,它们分别是1)前馈网络。神经元分层排列形成输入层、隐藏层和输出层,每一层只能接受上一层神经元的输入;2)反馈网络。有输入层到输出层的反馈;3) 互联网络。组合网络属于网络结构,任意两个神
40、经元之间可能存在连接;4) 混合网络。分层网络和网状网络的组合。图 3-3 四种典型的神经网络拓扑3.1.4神经网络如何工作神经网络的工作过程主要由两个阶段组成:一个是工作周期,此时每个连接的权重是固定的,计算单元的状态发生变化以达到稳定状态;另一个是学习期(适应期或设计期),此时各个计算单元的状态保持不变,可以修改各个连接的权重。前一个阶段比较快,每个单元的状态也叫短期记忆,后一个阶段慢很多,权重和连接方式也叫长时记忆。学习是神经网络最重要的能力,而学习算法是神经网络的核心问题之一。通常它也是一个强非线性系统,学习函数体现在神经网络模型中,即突触连接权重W ij可以根据学习规则随时间变化。正
41、是这种可塑性使神经网络能够适应不同的信息处理需求。神经网络的学习规律分为辅导学习和无监督学习两大类,总结如下1) 纠错规则纠错规则基于梯度下降法,无法保证全局最优解。同时需要大量的训练样本,所以收敛速度慢;组织使学生能够有效地学习。2)玻尔兹曼机器学习规则玻尔兹曼机器学习规则提供了一种学习隐藏节点的有效方法,可以学习复杂的非线性可分函数。主要缺点是学习速度太慢,因为在模拟退火过程中,当系统进入平衡状态时,“冷却”必须缓慢进行,否则容易陷入局部最小值。它基本上是梯度下降,所以要求大量的例子。3) 无导师学习规则无监督学习规则提供了一个新的选择。它采用自适应学习方法,使节点能够选择性地接收输入空间
42、中的不同特征,从而摒弃了普通神经网络学习映射函数的学习概念,提供了基于检测特征的空间活动规律的性能描述。3.1.5神经网络的基本性质和优势神经网络的基本属性主要包括:收敛性、容错性、鲁棒性和泛化性。神经网络的收敛性是指神经网络的训练算法经过有限次数的迭代后能够收敛到正确的权重或权重向量。神经网络良好的容错性保证了网络将不完整、无损、失真的输入样本还原为完整的原型。容错的研究归因于神经网络动态系统的记忆模式的吸引力领域的大小。吸引域越大,网络从部分信息中恢复所有信息的能力越大,说明网络的容错能力越大。神经网络的高鲁棒性使得网络在网络中的神经元或突触被破坏时仍然具有学习和记忆的能力,从而使网络表现
43、出高度的自组织性。经过训练的神经网络应该能够正确识别或分类不属于训练样本集的输入样本。这种现象通常被称为具有良好泛化性的神经网络。神经网络具有以下优点: 1)具有很强的鲁棒性和容错性,因为信息是分布和存储在网络的神经元中的; 2)并行处理方式,人工神经网络结构并行,网络的各个单元可以同时进行相似的处理过程,计算速度更快; 3)自学习、自组织、自适应,神经元之间的连接是多样的,各个单元之间的连接强度具有一定的可塑性,这使得神经元网络可以处理不确定或未知的系统; 4 )可以完全逼近任何复杂的非线性关系; 5)具有很强的信息综合能力,可以同时处理定量和定性信息,能很好地协调各种输入的信息关系,适合处
44、理复杂的非线性和不确定对象。神经网络以其独特的结构和处理信息的方法,在许多实际应用领域取得了显著成果9 。3.2神经网络在入侵检测中的应用神经网络技术在入侵检测领域的应用具有以下优势:1)神经网络具有摘要和摘 要能力,对不完整的输入信息具有一定的容错处理能力。在网络环境中,经常会出现信息不完整丢失或变形失真的情况。神经网络的非线性处理和泛化抽象特性非常适合处理这种情况。2)神经网络具有高度的学习和适应能力。通过对输入的正常样本和异常样本的不断训练和学习,神经网络不仅能够以较高的准确率识别出训练样本中已知的入侵行为特征,而且能够以一定的识别率识别出新的入侵行为特征和已有的入侵行为特征。可能性。入
45、侵行为的变体。这种通过学习识别新入侵行为特征的能力可以克服基于专家系统的检测技术的局限性。3)神经网络独特的并行计算和存储特性。在传统的计算技术中,计算和存储是两个完全独立的部分。在计算之前,计算组件必须从存储组件中取出要处理的指令和数据,然后进行计算,最后将计算结果返回到内存中。因此,内存和计算器之间的传输带宽被称为限制计算机性能的瓶颈。在神经网络模型中,信息的存储和信息的处理计算本质上是合二为一的。每个神经元的工作模式本质上是完全平行的。从输入到输出的计算过程本质上是权重的传递过程,而在价值传递的过程中,信息存储过程同时完成。对于入侵检测,这种并行计算模式潜在的高速计算能力意味着可以在很短
46、的时间内处理更多的检测规则或特征值,也意味着可以在更短的时间内发现入侵行为,减少可能系统损坏。目前,神经网络技术在入侵检测中的应用还存在以下缺陷和不足:1)需要解决神经网络对大容量入侵行为类型的学习能力问题。不同的神经网络类型和拓扑都具有有限的学习能力。面对现实世界环境中成千上万种不同的攻击特征,需要进一步的研究工作来实现完全识别。2)需要解决神经网络解释能力不足的问题。神经网络具有很强的训练和学习能力,可以给出判断的类别信息,但缺乏对具体事件类型的解释能力。对于入侵检测,仅仅判断当前事件是否异常往往是不够的,通常还需要获取异常事件具体类型的明确信息。在这一点上,神经网络往往不堪重负。另一方面
47、,神经网络的训练和学习能力往往是通过零件的权重连接和拓扑结构来实现和存储的。对于最终判断结果的生成,通常很难具体说明详细的判断过程,产生确定性的判断。步。3)执行速度问题。从理论上讲,神经网络具有强大的并行计算能力,但在当前计算机存储计算架构下,神经网络的并行计算潜力很难充分发挥。为了解决这个问题,可能需要设计一种特殊的神经网络计算芯片或计算机 10 。 4基于集成神经网络的入侵检测系统4.1系统设计4.1.1 系统工作原理所设计的集成神经网络入侵检测系统架构如图4-1所示。被监控网络被监控网络数据采集人机界面特征提取KPCA遗传算法集成神经网络分类引擎攻击样本库图 4-1 集成神经网络入侵检
48、测系统架构系统工作原理如下:数据采集模块捕获流经系统监控网段的所有网络数据流,并致给特征提取模块。特征提取模块通过协议分析技术提取代表网络数据流的特征向量,然后利用核主成分分析(KFCA)对特征向量进行降维,将降维的向量致给集成神经网络网络分类引擎。作为遗传算法集成神经网络分类引擎的输入向量。集成神经网络将输入向量与攻击样本库进行比较,判断是否存在入侵。如果集成神经网络认为是攻击,它会提醒用户。如果发现新的入侵行为,可以将其添加到攻击样本库中,以更新攻击样本库。4.1.2特征提取特征提取模块将数据采集模块中得到的数据划分为不同的消息类型,提取不同的检测特征并进行降维处理。在综合权衡各种攻击方式
49、后,该模型选择的入侵特征主要包括协议代码、源地址、目的地址、源端口、目的端口、标志位、数据报类型代码、数据报代码、报文头。长度、数据报长度、消息数据段容量(取前30个字节)、端口、数据报头校验和。这13个特征构成了入侵检测中的一个特征,可以用来描述网络中的攻击行为。4.2集成神经网络算法Schapire 证明,如果一个概念是弱可学习的,那么它的充要条件也是强可学习的。该定理表明,可以将多个分类器集成为一个强分类器,从而为集成学习奠定理论基础。集成学习通常分为两个步骤。首先使用单一的学习算法对样本进行单独训练,然后将单个网络的输出按照一定的方法进行整合,得到最终的结果。假设神经网络的输入xRm满
50、足分布P(x),输入x的目标输出为d(x),神经网络的输出fi(i=1, 2, N)为fi(x),每个神经网络的输出为fi(x)。权重是(i=1, 2, ., N)。集成神经网络中的每个权重 0,并且(4-1)输入 x 下的集成神经网络的输出定义为:(4-2)神经网络 i 的泛化误差 Ei 和集成神经网络的泛化误差 E 分别为:(4-3)(4-4)网络泛化误差的加权平均值为:(4-5)神经网络的差异度和集成神经网络的差异度为:(4-6)(4-7)那么集成神经网络的泛化误差为:(4-8)由式(8)可以看出,如果集成神经网络中的个体网络存在小的差异程度,即对于相同的输入,集成网络中的各个个体网络给
51、出相同或相似的输出,则综合差异度为0,网络集成的泛化误差相当于单个网络的加权平均误差,当单个网络差异较大时,集成的差异度较大,泛化误差为远小于单个网络的加权平均误差。因此,集成神经网络中各个网络之间的差异越大,集成效果越好。4.3遗传算法1975年,密歇根大学心理学、电气工程和计算机科学教授霍兰德和他的同事和学生共同研究了开创性的遗传算法理论和方法 11 。4.3.1遗传算法的定义遗传算法是一种模仿自然界生物进化思想的自适应启发式全局搜索算法。其本质是一个由复制-交换-变异算子组成的循环过程。该方法模仿生物的进化和遗传,按照生存竞争、适者生存的原则,通过复制等操作,使待解决的问题逐步逼近最优解
52、和近似最优解,交换,突变。遗传算法的提出和发展为优化搜索技术带来了新的思路和活力。4.3.2遗传算法的基本思想遗传算法从代表问题的一组潜在解决方案的群体开始,群体由一定数量的由基因编码的个体组成。每个个体本质上都是具有特征的染色体(染色体)实体。染色体是遗传物质的主要载体,即多个基因的集合体,其部分表达(即基因型)是基因的某种组合,决定了个体形态的外在表现。因此,从表型到基因型的映射,即编码,需要一开始就实现。由于模仿遗传编码的工作非常复杂,我们倾向于简化,比如二进制编码。在第一代人群产生之后,按照优胜劣汰、优胜劣汰的原则,一代又一代地进化出越来越好的近视解决方案。在每一代中,根据个体在问题域
53、中的适应度进行选择,通过自然遗传学的遗传算子进行组合交叉和变异,生成代表新解集的种群。这个过程会导致后代种群的种群,就像自然进化一样,比上一代对环境的适应能力更强,可以解码上一代种群中的最优个体,可以作为近似最优解问题 12 。对于需要优化计算的实际应用问题,求解该问题的遗传算法一般可按以下步骤构建。1)确定决策变量及其各种约束条件,即确定个体的表型X和问题的解空间;2)建立优化模型,即确定目标函数的类型(是求目标函数的最大值还是目标函数的最小值)及其数学描述形式或量化方法;3)确定代表可行解的染色体编码方式,即确定个体基因型X和遗传算法的搜索空间;4)确定解码方法,即确定个体基因型X到个体表
54、型X的对应关系或转换方法;5)确定个体适应度的量化评价方法,即确定目标函数值f(x)到个体适应度F(x)的转换规则;6) 设计遗传算子,即确定选择操作、交叉操作、变异操作等遗传算子的具体操作方法;7)确定遗传算法的相关运行参数,即确定遗传算法的M、T、Pc、Pm等参数。从以上构建步骤可以看出,运行解的编码方法和遗传算子的设计是构建遗传算法时需要考虑的两个主要问题,也是设计遗传算法时的两个关键步骤。算法。不同的优化问题需要不同的编码方法和不同运算的遗传算子,与要解决的具体问题密切相关。因此,对所解决问题的理解是遗留算法成功的关键。下图4-2为遗传算法的主要构建过程示意图。4.3.3基本遗传算法基
55、本遗传算法仅使用三个基本遗传算子:选择算子、交叉算子和变异算子。其遗传进化操作过程简单易懂。它是其他遗传算法的原型和基础。该算法提供了一个基本的框架,也具有一定的应用价值。1)染色体编码方法基本遗传算法使用固定长度的二进制符号串来表示种群中的个体,其等基因由一组二进制符号0, 1组成。初始种群中每个个体的基因值可以用均匀分布的随机数生成。例如,X=101 可以代表染色体长度为 n=14 的个体。2) 个人体能评估基本遗传算法根据与个体适应度成正比的概率来确定当前种群中每个个体被遗传到下一代种群中的概率。为了正确计算这个概率,所有个体的适应度必须为正或为零。这样,根据不同类型的问题,必须预先确定
56、目标函数值到个体适应度的转换规则,尤其是目标函数值为负时的处理方法。最优化问题描述最优化问题描述适应度F(X)个体基因型目标函数f(x)个体表现型X解码方法确定运行参数编码方法设计遗传算子确定决策对象、约束条件确定适宜度转换规则建立优化模型遗传算法第一步第四步第三步第二步第五步第七步第六步图4-2 遗传算法的构造过程3) 遗传算子基本遗传算法使用以下三个遗传算子。选择运算符使用比例选择运算符。选择用于确定通过将个体与所选个体重组或杂交产生多少后代个体。先计算适应度,再进行实际选择,根据适应度进行父个体的选择。交叉操作使用单点交叉算子。基因重组是来自父母交配群体的信息的组合,以创造新的个体。变异
57、操作使用基本位变异算子或统一变异算子。交叉后后代所经历的突变,实际上是后代基因扰动产生的小概率变化。4.3.4基本遗传算法的运行参数基础遗传学有以下4个操作参数需要提前设置。1) M:群体规模,即群体中包含的个体数量,一般取20100。2) T:遗传运算的终端进化代数,一般取100500。3) pc:交叉概率,一般取0.40.99。4) pm:变异概率,一般取0.00010.1。这四个操作参数对遗传算法的求解结果和求解效率都有一定的影响。如果种群规模太小,会影响搜索范围,从而无法得到最优解;种群规模过大,搜索时间长,搜索效率低。交叉和变异概率Pc和Pm越小,算法的开发能力越强,越容易检测到新的
58、超平面,但个体的平均适应度值波动较大;相反,Pc 和 Pm 越小,算法的开发能力越好。越强,越好的个体不容易被破坏,个体的平均适应度值是平衡的。4.4基于遗传算法的集成神经网络检测方法4.4.1算法思路和步骤这里使用的集成神经网络分为两个步骤来学习网络入侵。首先用单个神经网络分别训练样本,然后用遗传算法找到差异较大的神经网络进行整合,得到最终结果。 .4.4.2个人网络建设构建了三种不同类型的神经网络,即BP神经网络、RBF神经网络和自组织竞争人工神经网络。每种类型根据隐藏层神经元个数和学习率分为6个神经网络,共18个神经网络。神经网络,如下图4-4所示。数数 据 源BP神经网络RBF神经网络
59、自组织神经网络选择个体网络、集成输出图 4-3 神经网络集成过程4.4.3单个网络的选择首先,如上所述训练18个个体神经网络,然后通过遗传算法在中选择一个适合构成集成神经网络的子集S。在集成神经网络中,每个个体网络对应染色体中的一个bit,每个bit的值是离散的0或1。1表示神经网络参与集成,0表示神经网络不参与积分, 染色体长度为 18. , 从而将体网络的选择转化为在 18 维 0-1 空间中选择最优染色体的问题。在初始种群中生成个体的方法是先将某次攻击中的一段样本数据致到 18 个神经网络中,计算每个网络的输出,并将这些输出与验证集进行比较,从而计算出每个个体的泛化误差网络。 ,取泛化误
60、差最大的神经网络为0,其余17个神经网络为1,作为第一个染色体;取泛化误差较大的两个神经网络为0,其余16个神经网络为1,作为第二条染色体;以这种方式产生了五条染色体。初始种群中的所有其他染色体都参与了整合,即所有 18 个神经网络都是 1。将整合后的神经网络的平均误差的倒数作为遗传算法的适应度,即(4-9)式中,V为验证集,为个体网络,为个体网络相关性,个体网络相关性定义为(4-10)实验中使用的遗传算法描述如下:1)独立训练18个神经网络。称为父级的 18 个神经网络中提取六个子集。3)对于父代中的六个子集,利用遗传算法进行交叉操作,形成其下一代,即后代,也称为第一代。4)根据公式(9)计
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 小学数学六年级上册《用百分数解决问题(1)》课件
- 无线传感器网络简明教程 第4版 课件 第7章5G无线网络
- 2026年活动策划行业发展趋势报告
- 2026年智能家居:智能音响市场创新动态报告
- 2026年统计局事业编考试《统计法律法规》模拟试题及答案
- 2026年城市园林绿化养护与管理知识测试卷
- 肝囊肿疾病防治指南解读医学课件
- 围手术期护理课件
- 颈椎病中西医结合诊疗共识
- 心脑血管疾病案例分析
- 自考13635工程力学(机械)高频考点重点
- 2026新教科版四年级科学上册2.3《 呼吸的变化》课件
- 精算师考试风险管理试题汇编(带解析)
- 2026年采油工(高级技师)模拟试题(含答案)
- 广东省深圳市2026中考语文作文真题解读及范文
- 地下通道工程监理实施细则
- 12短文二篇 《答谢中书书》《与朱元思书》群文阅读公开课一等奖创新教学设计 统编版语文八年级上册
- 危险化学品无储存经营单位演练记录
- 工业人工智能导论 课件 第7-13章 群智能优化算法与生产调度- 智能机器人与应用
- 退血制度与流程规范
- 新能源车电控系统维修手册
评论
0/150
提交评论