已阅读5页,还剩54页未读, 继续免费阅读
(计算机应用技术专业论文)免疫电子邮件系统关键技术和算法研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
哈尔滨工程大学硕士学位论文 摘要 随着i n t e m e t 的迅速发展和普及,电子邮件以其方便、快捷、成本低等 特点而成为人们生活中重要的通信手段之一。但随之而生的垃圾邮件,则占 用了大量网络资源,浪费了网民的宝贵时间,造成了巨大的经济损失。因此, 研究和设计一种能够高效过滤垃圾邮件的电子邮件系统,有着重大的现实意 义。 人工免疫系统是一门新兴的科研领域,它提取、发现和应用生物免疫系 统的有效机制来解决工程和科学问题。本课题的研究目的就是要利用人工免 疫系统机制设计一个对垃圾邮件具有免疫能力的电子邮件系统,为这一领域 的应用探索一条有效的途径。 论文在综合分析传统反垃圾邮件技术的原理、优势和不足的基础上,对 生物免疫机制及其在计算机领域的应用和算法作了深入研究,提出了构建免 疫电子邮件系统的新设想,该系统具有对外界环境动态自适应以及能够及时 识别新特征邮件等优良特性,这恰好弥补了传统技术这方面的不足。 论文的创新点在于提出并设计了一个免疫电子邮件系统模型,该模型针 对邮件系统的特点定义了抗原抗体编码、设计和改进了亲和力计算方法,将 诸多免疫机制应用到模型中来,为充分体现自学习、记忆、自适应、多样性 等良好免疫特性,模型分别设计了有效的解决方案。其中对克隆选择算法进 行重点改进,保证了抗体的多样性。 论文最后针对免疫电子邮件模型进行了仿真试验,对比了算法改进前后 的实验结果,改进后算法使系统召回率有了一定程度的提高,同时虚报率也 有所下降,证明了算法改进的有效性以及免疫电子邮件系统模型的适用和合 理性。 关键词:邮件系统;垃圾邮件;免疫系统;免疫算法 堕玺鎏三堡奎兰堡圭兰垒鎏苎 a b s t r a c t w i t ht h er a p i dd e v e l o p m e n ta n dp o p u l a r i t yo fi n t e r a c t ,e - m a i lb e c o m e sa n i m p o r t a n tm e a n so fc o m m u n i c a t i o ni np e o p l e sl i v e sb e c a u s eo fi t sc o n v e n i e n t , f a s t ,l o wc o s tf e a t u r e s b u ts p a me m a i l su s eal o to fn e t w o r kr e s o u r c e s ,w a s t e v a l u a b l et i m eo fi n t e m e tr i s e r s , c a u s ee n o r n l o n se c o n o m i cl o s s e s t h e r e f o r e ,s t u d y a n dd e s i g no fah i g h e f f i c i e n c yf i l t e rf o ras p a r ee - m a i ls y s t e ma r eo fg r e a t p r a c t i c a ls i g n i f i c a n c e a r t i f i c i a li m m u n es y s t e mi sa ne m e r g i n gf i e l do fs c i e n t i f i cr e s e a r c h i tc a n e x t r a c td i s c o v e r ya n da p p l ya l le f f e c t i v em e c h a n i s mo fab i o l o g i c a li m m u n e s y s t e mt os o l v ee n g i n e e r i n ga n ds c i e n t i f i cp r o b l e m s t h ep u r p o s eo ft h et h e s i si s d e s i g n i n ga ne m a i ls y s t e mw h i c hc a nb ei m m u n et os p a me m a i l sb yu s i n g a r t i f i c i a li m m u n es y s t e mm e c h a n i s m s ,a n de x p l o r i n ga ne f f e c t i v ew a yf o rt h e a p p l i c a t i o ni nt h i sa r e a i nt h i st h e s i s b i o l o g i c a li m m u n o l o g i c a lm e c h a n i s m s ,c o m p u t e r f i e l d a p p l i c a t i o n sa n da l g o r i t h m sa r ei n d e p t hs t u d i e do nt h eb a s i so fac o m p r e h e n s i v e a n a l y s i so ft r a d i t i o n a la n t i s p a mt e c h n i q u et h e o r i e s ,s t g e n i 甜h sa n dw e a k n e s s e s a n e wi m m u n ee - m a i ls y s t e mj sp r o p o s e d t h es y s t e mh a v ee x c e l l e n tc h a r a c t e r i s t i c s s u c ha sd y n a m i ca d a p t i v et oa l le x t e r n a le n v i r o n m e n ta n dt i m e l yi d e n t i f i c a t i o n n e wm a i lf e a t u r e s ,w h i c hi sar e m e d yf o rt r a d i t i o n a ld e f i c i e n c y t h ei n n o v a t i o ni nt h i st h e s i si st h a ta ne - m a l li m m u n es y s t e mm o d e li s p r o p o s e da n dd e s i g n e d t h em o d e ld e f i n i t ea n t i g e n - a n t i b o d yc o d e sa c c o r d i n gt o m a i ls y s t e mc h a r a c t e r i s t i c s ,a n dd e s i g na n di m p r o v ea f f m i t yc a l c u l a t i o nm e t h o d m a n yi m m u n em e c h a n i s m sa r ea p p l i e dt ot h em o d e l i no r d e rt of u l l yr e f l e c tg o o d c h a r a c t e r i s t i c ss u c ha s l e a r n i n g , m e m o r y ,a d a p t i v ea n d i m m u n ed i v e r s i t y , e f f e c t i v es o l u t i o n sa g ed e s i g n e di n t h i sm o d e l c l o n es e l e c t i o na l g o r i t h mi s i m p r o v e dt oe n s u r et h ea n t i b o d yd i v e r s i t y f i n a l l y ,i nt h i st h e s i sas i m u l a t i o nt e s ti sm a d ef o ri m m u n ee m a i ls y s t e m m o d e l t h ee x p e r i m e n t a lr e s u l t sb e t w e e nb e f o r ei m p r o v i n ga n da f t e ri m p r o v i n g a r ec o m p a r e d t h ei m p r o v e da l g o r i t h m sm a k et h es y s t e mr e c a l lr a t ei n c r e a s e da n d 哈尔滨工程大学硕士学位论文 f a l s er a t ed e c r e a s e d s oi tc a np r o o ft h ei m p r o v e da l g o r i t h me f f e c t i v e n e s sa n d a p p l i c a t i o na n dr e a s o n a b i l i t yo ft h ei m m u n e e - m a i ls y s t e mm o d e l k e y w o r d s :m a i ls y s t e m ,s p a m ,i m m u n es y s t e m ,i m m u n ea l g o r i t h m 哈尔滨工程大学 学位论文原创性声明 本人郑重声明:本论文的所有工作,是在导师的指导 下,由作者本人独立完成的。有关观点、方法、数据和文 献的引用已在文中指出,并与参考文献相对应。除文中已 注明引用的内容外,本论文不包含任何其他个人或集体己 经公开发表的作品成果。对本文的研究做出重要贡献的个 人和集体,均己在文中以明确方式标明。本人完全意识到 本声明的法律结果由本人承担。 作者( 签字) : 日期:一年月“日 哈尔滨工程大学硕士学位论文 1 1 研究背景及意义 第1 章绪论 随着i n t e m e t 的迅速发展和普及,电子邮件( e m a i l ) 以其方便、快捷、 成本低等特点而成为人们日常生活中重要的通信手段之一。据最新统计显示, 电子邮件已经成为网民最经常使用的第三大网络服务“1 。但电子邮件给人们 带来极大便利的同时,也日益显示出其负面作用。据调查“t ,从2 0 0 6 年8 月 到2 0 0 6 年1 0 月,中国用户收到的垃圾邮件比例达5 8 9 8 ,用户平均每周收 到垃圾邮件数量为1 7 3 5 封,并有进一步增长的趋势。个人用户每周处理垃 圾邮件所需时间平均为9 8 3 2 分钟,而企业用户则每天要花2 2 9 5 分钟来处 理垃圾邮件。垃圾邮件每年给国民经济造成的经济损失约为1 0 4 3 1 5 亿人民 币。可见,垃圾邮件的泛滥,浪费了网民的宝贵时间,占用了大量网络资源, 造成了巨大经济损失,需要联合各方面全方位及时采取更加有利措施来遏制 垃圾邮件的发展速度。 面对垃圾邮件日益严重的现状,人们开始从法律、经济、技术等方面寻 找解决方案。 ( 1 ) 反垃圾邮件立法。目前一些国家已经有了强制性的禁止垃圾邮件的 法律,美国、韩国、日本、丹麦等国家都已经立法,对垃圾邮件发送采取严 厉的处罚措施m 。国内一些组织也都建立了相应的机构进行反垃圾邮件工作, 如中国教育科研网的c a s t ( c c e r ta n t i s p a i nt e a m ) 、中国互联网协会反 垃圾邮件中心等。2 0 0 6 年2 月2 0 日,信息产业部公布实施互联网电子邮 件服务管理办法,迈出了国内反垃圾邮件立法的重要一步。 ( 2 ) 利用经济手段防范垃圾邮件。近日,时代华纳旗下a o l 表示,将 对向a o l 用户发送大量电子邮件者收费。雅虎公司也宣布了类似的电子邮 件收费服务计划。 ( 3 ) 利用技术手段进行垃圾邮件过滤。近年来,有关垃圾邮件过滤技术 的研究逐步兴起,出现了一大批相关产品。在目前立法、经济等手段无法解 哈尔滨工程大学硕士学位论文 决垃圾邮件问题的情况下,从技术上进行垃圾邮件过滤,对防范垃圾邮件起 到了重要作用。 要解决垃圾邮件问题,必须综合利用上述手段,而对技术手段的研究则 成为了研究者关注的重点。 反垃圾邮件技术可以分成两类:“根源阻断”、“存在发现”。“根源阻断” 是指通过防止垃圾邮件的产生来减少垃圾邮件,但这种方法还没有走向实用, 即使走向实用也需要对全球的邮件系统进行全面改造。目前,主流的反垃圾 邮件技术是“存在发现”,即对已经产生的垃圾邮件进行过滤,一般通过邮件 的内容特征或者其他特征( 如行为特征) 来识别垃圾邮件。这方面的过滤技 术主要包括:黑名单和白名单、反向域名验证、关键词过滤、基于规则的过 滤技术、基于统计方法的过滤技术以及智能行为识别技术等等。这些技术在 邮件识别准确率、规则更新、对外部环境的适应性等诸多方面存在不足,国 内外许多学者为此己经做了许多研究,引入了人工智能的一些方法如神经网 络、数据挖掘、演化计算等来解决在垃圾邮件过滤中遇到的问题,但到目前 为止,仍然处于研究探索阶段。 自二十世纪四十年代以来,随着医学在生物免疫系统研究领域的发展, 人们对该系统在各方面所表现出的一些本能现象的认识与理解不断得到深化 与完善,并逐渐形成了一门较为完整的学科一生物免疫学( i m m u n o l o g y ) 。 该学科以生物机体免疫系统的组织结构和生理功能为研究主体;以免疫系统 的种系发生与个体发生,免疫细胞的起源、分化、特征与功能,淋巴细胞的 识别、活化与效应机制和机体免疫反应的调节等为研究内容;以细胞学、分 子学和生物化学等为主要研究手段,着力揭示生物机体对“自我”( s e l f ) 和 “非我”( n o n s e l f ) 抗原的识别与应答、排斥异己和维持自身耐受过程中的 奥秘。而人工免疫系统( a r t i f i c i a li m m u n es y s t e m ,a i s ) “1 作为新兴的科研 领域,以自然免疫为基础,在其提出之初就展现了巨大的潜力。它是一个跨 越多个学科的研究领域,是与生物免疫相对应的工程概念。对于工程领域来 讲,人工免疫系统领域是相对较新的领域,引起人们发展人工免疫系统极大 兴趣的不是免疫系统本身的功能,而是从中提取、发现免疫系统的有效机制 作为一种解决工程和科学问题的手段。正因为如此,生物免疫系统同样也为 建立一个具有免疫能力的邮件系统提供了一个崭新思路和有效的方法。因而 2 堕玺堡三堡盔兰堡圭兰堡笙銮 本课题的研究意义,就是要利用人工免疫系统机制达到对外部未知邮件的有 效的识别与判断。 1 2 国内外相关研究现状 1 2 1 垃圾邮件技术研究现状 由于电子邮件是一种半结构化的文本文件,包括邮件头信息和邮件正文 信息两个部分,因而对垃圾邮件的过滤也主要集中于对邮件头的结构信息和 邮件正文内容进行过滤两种方式。目前,主要研究和应用的技术有: ( 1 ) 基于i p 地址、域名、邮件地址的黑白名单 这种技术手段是最传统的方式,它通过黑名单技术对垃圾邮件进行屏蔽, 通过白名单技术对允许的邮件进行放行。黑名单和白名单都不占用计算机资 源,易于实施。但是需要手动维护i p 地址清单。 ( 2 ) b b l 技术 通常检查邮件内容中含有的u r l 链接。 ( 3 ) s m t p 通信链接速率、频度的设定 由于一个正常用户发送邮件的数量和频率远远低于垃圾邮件发送者,因 此,可以根据垃圾邮件发送具有一定时间内邮件数量和邮件连接频率都非常 大的情况,从频率和数量对垃圾发送者的连接行为进行控制。 ( 4 ) 反向域名的验证 对收到邮件的来源i p 地址采用反向d n s 查找验证真实性。如果反向 d n s 查找提供的域与邮件上的来源i p 地址相符合,该邮件被接受。如果不 符合,该邮件被拒绝。缺点是由于很多d n s 目录未被有效建立,或无法正常 建立,这种情况由这些域发送的邮件将被阻隔,造成不可接受的高误报率。 ( 5 ) 基于信头、信体、附件的内容关键词 这种技术简单有效,可以阻隔绝大多数垃圾邮件。词语过滤识别包含特 定关键字的所有邮件,比如“代办、优惠”等在垃圾邮件经常发现的词语。 垃圾邮件发送者经常将一些单词拼错,以图绕过词语过滤器,所以词语过滤 哈尔滨工程大学硕士学位论文 器应该能经常升级,加入关键字的更新。 ( 6 ) 基于贝叶斯算法的统计分析 通过与以前收到的垃圾邮件和合法邮件的相同短语和词语出现的概率进 行对比,来确定垃圾邮件的可能性。但是它的准确性依赖大量的历史数据。 ( 7 ) 基于统计的原则 采用标记权重的方式,根据对用户认为的垃圾邮件和非垃圾邮件进行统 计计算,生成过滤规则,具有学习渐进的功能,可以逐渐取得好的效果。 ( 8 ) 基于规则评分的方式 这种方式集合了人工智能技术的应用系统。代表系统为s p a m a s s a s s i n 。 对发现的每一个关键词赋予分数,分数越高,该邮件是垃圾邮件的可能性就 越高:得分超过一定值时,该邮件将被分类为垃圾邮件。它的局限性是为了 使评分有效,规则必须经常更新。 最近几年人们又从其它角度提出一些新技术m ,包括: ( 1 ) 电子邮票 因为垃圾邮件发送具有大规模发送、成本很小的行为特征,微软公司提 出了对发送邮件进行收费的解决方案。不过这种方式却对广大的正常邮件发 送者带来了新的负担,还需考虑。 ( 2 ) c h a l l e n g e r e s p o n s e 方式 挑战一应答模式是从增加垃圾邮件发送者时间成本上入手,要求每发送 一封邮件,就要求发件人回答一些问题,以此来增加发送时间。 ( 3 ) d o m a i n k e y s s e n d e r i d 这是一种基于p k i 的方式对邮件发送者进行验证,对邮件信息进行加密 保护,对收信人实现防抵赖机制。域的所有者生成公钥私钥对,私钥用于所 有发出邮件的签名。公钥通过d n s 系统发布。当授权用户发送邮件时,邮件 服务器自动产生邮件的数字签名,作为邮件头的一部分发送给接收方。 接收服务器从邮件中提取签名,从d n s 系统中获得发送域的公钥,验证 发送方的数字签名。如果没有签名或签名验证失败,接收方可以拒绝、标记 或隔离邮件。 ( 4 ) s p f 这是对s m t p 协议的一个补充,防止发件人假冒。是一种源头认证的方 4 哈尔滨工程大学硕士学位论文 式,它通过改变域名系统的数据库,接受方核实邮件实际来源是否和s p f ( s e n d e rp o l i c yf r a m e w o r k ) 注册的一致来判断邮件是否为假冒邮件。 1 2 2 人工免疫系统研究现状 一般认为,首先将免疫概念引入工程领域的是f a r m e r 等人在1 9 8 6 年发 表的一篇论文“免疫系统、自适应和机器学习”气而i s h i d a 和b e r s i n i 则在 1 9 9 0 首先借鉴免疫原理来建立算法并用于解决计算问题“”。s f o r r e s t 等人则 在1 9 9 4 年首先提出了否定选择算法“,用来生成检测器,完成了检测器的耐 受过程,并在1 9 9 7 左右开始提出计算机免疫系统的概念m m 。同时,美国著 名公司i b m 也较早地开始了对计算机免疫系统的研究,已经成功地丌发了用 于病毒防治的计算机免疫系统。t 9 9 7 年,d e a t o n 等人提出了一种基于分子的 人工免疫系统n ”,用来模仿自然免疫系统的这种能力,目的是保护计算机免 受计算机病毒和其他因素的破坏。经过长时间的研究,d a s g u p t a 于1 9 9 9 年 建立了一套计算机免疫系统“用来抵御外来入侵,保障计算机系统的安全。 同时,d a s g u p t a 及其学生一直致力于否定选择算法的研究,并应用到计算机 安全和异常检测及工业应用中。2 0 0 2 年,c a s t r o 和t i m m i s 对否定选择算法 做了一定的修改“”,把变异引进到其中。同年,k i m 和b e n t l e y 提出了动态克 隆选择算法( d y n a m i c s ) “”,主要用于网络入侵检测( n i d s ) 。2 0 0 4 年k i m 和b e n t l e y 又提出了基于免疫记忆和基因库进化的动态克隆选择方法“”。至此, 计算机免疫在理论上己日趋完善。 自2 0 0 2 年起,第一届国际人工免疫系统大会( 1 s ti n t e r n a t i o n a lc o n f e :r e n c e o na r t i f i c i a li m m u n es y s t e m s :i c a r i s 一2 0 0 2 ) 首先开始在英国召开,2 0 0 3 年9 月召开了第二届国际人工免疫系统大会( 2 n d i n t e r n a t i o n a l c o n f e r e n c e o n a r t i f i c i a li m m u n es y s t e m s :i c a r i s 一2 0 0 3 ) 。目前在国际上比较活跃的人工 免疫系统研究组织主要包括: ( 1 ) 美国n e wm e x i c o 大学计算机系s f o r r e s t 教授领导的研究组是目 前在人工免疫和网络安全方面最活跃的研究组之一。在提出否定选择算法的 同时,该研究组还在生物免疫复杂系统建模及其在计算机网络安全应用方面 进行了大量的研究工作。 哈尔滨工程大学硕士学位论文 ( 2 ) 美国m e m p h i s 大学数学系d d a s g u p t a 博士领导的智能安全系统实 验室主要基于免疫a g e n t 的角度对入侵检测进行相关研究。与此同时,该研 究组还从人工免疫系统与模糊、进化等方法相结合的角度来研究入侵检测系 统。 ( 3 ) 英国k e n t 大掣c a n t e r b u r y 分校计算机科学系j t i m m i s 博士领导的 研究组也是目前非常活跃的研究组之一。该研究组的工作主要集中在基于免 疫机制的数据挖掘、优化问题求解等方面。 ( 4 ) 英国l o n d o n 大学学院的计算机系智能系统研究组目前也在从事基 于免疫的网络入侵检测模型的研究。 ( 5 ) 日本丰桥科技大学的i s h i d a 研究组在人工免疫理论和应用方面做了 不少工作,主要集中在免疫a g e n t 和免疫网络的理论建模及应用方面。 ( 6 ) 挪威o s l o 大学学院的m a r kb u r g e s s 领导的研究组目前已模拟生物 免疫系统设计出c f e n g i n e 自主体系统,用于管理和配置计算机系统和网络。 在国内,2 0 0 2 年,武汉大学的梁意文教授利用免疫原理对大规模网络入 侵检测和预警技术进行了研究。2 0 0 3 年,中国科学技术大学研制了一个“基 于人工免疫的入侵预警系统”,该系统具有较好的未知入侵预警能力。国内的 较有影响的研究组织主要包括: ( 1 ) 中国科学技术大学王煦法教授领导的项目组,在基于人工免疫的入 侵检测、病毒识别、优化计算等方面也进行了一系列工作,是目前国内最活 跃的研究组之一。 ( 2 ) 西安交通大学焦李成教授领导的项目组借鉴免疫接种机制等进行了 一系列工作。 目前国内外影响较大的几个算法研究成果为: ( 1 ) 否定选择算法。否定选择算法是s f o r r e s t 等人基于t 细胞的产生 过程而提出的一种异常检测算法。 ( 2 ) 克隆选择算法。克隆选择算法是d ec a s t r o 等人基于克隆选择学说 提出的一种免疫学习算法。 ( 3 ) 免疫网络算法。免疫网络算法是j t i m m i s 等人基于免疫网络调节 理论提出的一种学习算法。 哈尔滨工程大学硕士学位论文 1 2 3 基于人工免疫的反垃圾邮件技术研究现状 现有的国内外反垃圾邮件产品中,采用人工免疫系统技术的尚未见到报 道和记载,仅仅有几篇国内外学者的文献从研究的角度出发,探讨了这方面 的问题。 a n d r e ws e c k e r 采用人工免疫系统进行邮件的分类,提出了a i s e c 算法 来连续地将邮件分为感兴趣和不感兴趣两类n ”。t c r r io d a 等人也采用人工免 疫的方法,以正则表达式为抗体来检测垃圾邮件n ”“。这类基于学习的算法性 能较好,但计算复杂度很高,同时也有很大的不确定性。 邓根豪的硕士论文针对目前广泛采用的贝叶斯分类器方法存在的主要不 足,即在实际的应用中,垃圾邮件的特征是不断变化的,而传统的贝叶斯邮 件过滤器往往不能反映这种变化。人工免疫系统( a i s ) 不仅具有强大的自 体非自体识别能力,其免疫学习和免疫反馈机制更是能及时灵敏的反映新特 征的变化。因此,作者将贝叶斯算法和人工免疫系统( a i s ) 相结合设计了 一种新的垃圾邮件过滤方法,重点结合贝叶斯公式,推出了自己的抗原抗体 亲和力计算公式,以此为基础,设计了一个a i s 垃圾邮件过滤仿真器,bayes 该仿真器具备了初步的抗体变异进化能力,能够识别具有新特征的垃圾邮件。 仿真器在p u lb a r e 语料上的实验结果与同一语料上的最好结果( 决策树) 相 比,在垃圾邮件的过滤能力( 召回率) 方面表现较好,在正确率方面还不尽 如人意。另外,缺少对免疫系统其他机制的支持,没有中文邮件的实验对比, 变异系数、调整系数没有给出确定的方法“”。 张成功在基于b u m e t 的克隆选择理论基础上,提出一种适用于包括文 本分类在内的模式识别问题的m c a 免疫算法,并在此基础上进行有针对性 的改进,将其应用于垃圾邮件过滤器的设计中,通过实验证明了该方法较传 统邮件过滤技术具有更好的正确识别率和自适应性1 。 张泽明等人借鉴生物免疫的多层保护机制,将人工免疫模型和多种现有 垃圾邮件过滤技术有机地结合起来,提出了一种基于人工免疫的多层垃圾邮 件过滤算法m s f a a i ,利用分层检测的思想来过滤垃圾邮件。文中给出了针 对多层过滤算法中获得性免疫层的垃圾邮件过滤测试实验,实验结果表明本 7 哈尔滨工程大学硕士学位论文 算法在垃圾邮件过滤中能得到较高的召回率、精确率和正确率文中也指出 了可以通过合理地设置各检测器层之间的与或关系来得到更好的垃圾邮件过 滤效果。“。 袁耀文等人介绍了一种基于信息免疫技术的垃圾邮件过滤系统,通过从 已知的初始邮件训练集中学习到的规律来指导后续邮件的判断,并着重对特 征元素自学子系统进行了比较详细的介绍c l 。 总之,这方面的研究还刚刚起步,还没有权威性的研究成果,处于探索 阶段。 1 3 论文研究的主要内容 围绕电子邮件系统中以阻挡垃圾邮件为目的的垃圾邮件过滤技术展开研 究。 ( 1 ) 在综合分析传统反垃圾邮件技术的原理、优势和不足的基础上,对 生物免疫机制及其在计算机领域的应用和算法进行深入研究,提出一种构建 免疫电子邮件系统的新设想,该系统具有对外界环境动态自适应以及能够及 时识别新特征邮件等优良特性,以弥补传统技术这方面的不足。 ( 2 ) 提出并设计一个免疫电子邮件系统模型,给出了该系统架构的设计 思想。该模型针对邮件系统的特点定义了抗原抗体编码、设计和改进了亲和 力计算方法,将诸多免疫机制应用到模型中来,为充分体现自学习、记忆、 自适应、多样性等良好免疫特性,模型分别设计了有效的解决方案。其中对 克隆选择算法进行重点改进,保证了抗体的多样性。 ( 3 ) 针对免疫电子邮件系统模型进行了仿真试验,分析对比算法改进前 后的实验结果,改进后算法使系统召回率有了一定程度的提高,同时虚报率 也有所下降,证明了算法改进的有效性以及免疫电子邮件系统模型的适用和 合理性。 哈尔滨工程大学硕士学位论文 第2 章反垃圾邮件技术概述 2 1 电子邮件系统原理 从电子邮件的结构出发,在邮件头、邮件体中寻找垃圾邮件的特征,是 垃圾邮件过滤的基本方法。 1 、电子邮件系统的组成 电子邮件系统由三部分组成n ,电子邮件从一个邮箱传递到另一个邮箱, 是通过一个m t a ( 邮件传送代理) 路由邮件,一个m d a ( 邮件投递代理) 投递邮件,个m u a ( 邮件用户代理) 为用户提供一个界面来完成的。 ( 1 ) 邮件传送代理 邮件传送代理( m a i lt r a n s f e ra g e n t ,m t a ) 用于在不同邮件主机之间 交换电子邮件,它是e m a i l 系统的核心。在i n t e r n c t 上传输邮件的m t a 必须 遵从s m t p 协议,一个真正实用的m t a 还需要遵从s m t p 的扩展协议 e s m t p 。 m t a 从各种来源接收邮件。在收到每个邮件时,m t a 就确定这个邮件 要路由到哪里和如何路由,如果必要的话,它重新写地址,然后把邮件交给 m d a 投递。控制i n t e m e t 邮件路由的主要机制是d n s ( 域名服务) 协议。 d n s 提供一个分布式的数据库,把域名映射到几个类型的信息,包括邮件路 由指令。大多数的m t a 还提供它们自己的机制直接控制路由,作为d n s 路 由的补充。 ( 2 ) 邮件投递代理 邮件投递代理( m a i ld e l i v e r ya g e n t ,m d a ) 用于将m t a 接收到的发 向本机的邮件分发到相应用户的邮箱。一旦m t a 收到一个邮件,处理这个 邮件,并确定了它的路由,就把它交给m d a 。m d a 负责把该邮件投递到另 一个位置,这个位置可以是另一个m d a 、一个用户的信箱或执行特殊任务 的程序。根据这次投递是成功还是产生永久或临时的故障,m d a 决定这次 9 哈尔滨工程大学硕士学位论文 事务是完成、产生一个错误返回给发信人,还是在将来重新发送。 ( 3 ) 邮件用户代理 邮件用户代理( m a i lu s e ra g e n t ,m u a ) 负责为用户提供管理邮件的 界面。这个管理通常包括查看信件、管理邮件夹、写和发送新信件,以及回 复信件和把现有的信件发送给其他用户。它通常是与信件直接打交道的唯一 程序。 m d a 、m t a 、m u a 三者之间的关系如图2 1 所示。 图2 1 电子邮件系统组成 2 、电子邮件的格式 邮件的格式在r f c 8 2 2 中加以定义。 在最高层信件是非常简单的,它含有一系列的文本,每一行以回车( c r ) 和换行( l f ) 组成。信件由信头、信件体和之间的空行组成。信头有定义的 格式,以使得m t a 、m d a 和m u a 能对它进行程序分析。 r f c 8 2 2 为信头定义了2 0 多个标准字段m ,包括d a t e 、f r o m 、t o 、c c 等一些必需的字段和非必需的字段。另外,在邮件的传输过程中,m u a 和 m t a 还会在信头中加入一些路径信息,它们合在一起构成了收到的邮件的信 头部分。一些常用关键字段的含义如下: ( 1 ) f r o m :标识原始邮件的作者1 ( 2 ) t o :标识邮件的主要接收者 ( 3 ) s u b j e c t :标识邮件的主题 ( 4 ) r e p l y t o :标识发件人希望的回复地址 ( 5 ) m e s s a g e i d :唯一的标识一个信件,传输时被包含进日志文件, 退信时也参考它。 ( 6 ) r e c e i v e d :用来标识将邮件从最初发送者到目的地进行中间转发的 s m t p 服务器。每台服务器都会在邮件头中增加一个r e c e i v e d 字段,并填充 1 0 哈尔滨工程大学硕士学位论文 关于自己的详细信息。 3 、垃圾邮件过滤实施的位置 对垃圾邮件的过滤可以针对m u a 、m t a 、m d a 三个方面来进行。 ( 1 ) 在m u a 进行邮件过滤。即在客户端实现对垃圾邮件的过滤。这 种方法一般是在m u a 提供用户设定的过滤规则来实现对垃圾邮件的过滤。 例如,m i c r o s o f to u t l o o k 提供了m u a 过滤功能,可通过域名、关键字、信 头等方面进行过滤。 ( 2 ) 在m t a 进行邮件过滤。是指在发送方m t a 和接受方m t a 进行会 话的过程中对邮件信息进行检查,对于符合过滤条件的邮件信息进行过滤处 理。例如,基于s c n d m a i l 和q r n a i l 等m t a 软件的过滤。 ( 3 ) 在m d a 进行邮件过滤。这是指m d a 在从m t a 接收邮件,在本 地或远程递交后,根据邮件过滤规则对接受到的邮件进行检查,对符合过滤 条件的邮件进行过滤处理。目前很多m d a 都支持垃圾邮件的过滤功能。例 如,p r o c m a i l 、m a i l d r o p 、c y r u s i m a p 等。 后两种方式是从邮件服务器端进行过滤。从邮件过滤技术上看,目前常 用的黑白名单技术、基于过滤规则的技术和基于邮件内容的过滤技术都使用 于用户端过滤和服务器端过滤。 2 2 邮件预处理 1 、编码与解码 由于r f c 8 2 2 格式规定邮件信息以7 位a s c i i 码的形式进行传输,因此, 非a s c i i 码的邮件( 如中文邮件) 在传输过程中必须经过编码、解码才能正 确传输和解读邮件。 目前的邮件系统基本都使用r f c 2 0 4 5 等定义的m i m e 协议,而m i m e 继续使用r f c 8 2 2 的格式,但增加了结构,并且为非a s c i i 码的邮件定义了 编码规则,m i m e 定义两种编码方式:b a s e 6 4 与q p ( q u o t e - p r i n t a b l e ) 。 ( 1 ) 邮件信头元素的编码形式 如编码后的主题“s u b j e c t ”形式为: s u b j c c t = ? g b 2 3 1 2 7 b ? s o z a t d x q y f o u l 6 r r p y 6 y u b e i l q t k 6 b x i z + c 5 2 m r c 0 s 1 i 哈尔滨工程大学硕士学位论文 s - - - - ? - - - - 则表明主题内容采用b a s e 6 4 编码,原始内容为g b :2 3 1 2 字符集。 而下面形式: s u b j e c t = h 咖2 3 1 2 7 q ? = a 1 a = a b = d c ? = = a 4 j = a e a = a 6 n = a 1 i = a 了= d a = a c 0 = b 1 = e 7 = a 9 s = a 7 9 _ a 1 a - a b = d c = b o = 从= b 则表明原始内容为g b 2 3 1 2 字符集,但编码采用了q p 编码规则。 ( 2 ) 邮件信体的编码形式 在m im e 格式中增加了c o n t e n t v r a n s f c r e n c o d i n g 字段来定义信体的编 码方案。该字段用一个值指定了编码类型,格式如下: c o n t e n t t r a n s f e r - e n c o d i n g := ”7 b i t ”8 b i f ”b i n a r y ”q u o t e d - 。p r i n t a b l e ” ”b a s e 6 4 例如:c z n t c n t - t y f i e :t e x 卿d a i n :c h a r s e t = g b 2 3 1 2 。 c o n t e n t - t r a n s f e r - e n c o d i n g :b a s e 6 4 邮件信体采用b a s e 6 4 编码,原始数据为g b 2 3 1 2 字符集内容,同时解码 后的数据也处于同一字符集g b 2 3 1 2 中。 ( 3 ) b a s e 6 4 编码规则 b a s e 6 4 编码的规则为:将信件数据每2 4 位输入并分离成4 个连续的6 位组,每组编码为b a s e 6 4 字符集中的一个字符。当结尾部分输入少于2 4 位 时,会在末尾补充一些值为0 的位,来形成完整的6 位组,用“= ”来表示数 据结尾的填充。b a s e 6 4 字符集以值o 6 3 对应“a ,z 、a 屹、o 曲、+ 、一”字 符。 ( 4 ) q u o t e d - p r i n t a b l e 编码规则 o u o t e d - p r i n t a b l 编码适用于内容多为u s a s c i i 字符集中可打印字符的 情况。经过它编码的数据不再需要邮件传输系统进行转换。如果被编码的数 据多为u s a s c i i 字符,则编码后的内容会保留那些可人为识别的部分。 2 、邮件分词 电子邮件是一种半结构化的文本数据,对于信头中的主题( s u b c a ) 信 息和信体( b o d y ) 数据,还需要分词处理,以便进一步提取邮件特征,方便 后续处理。英文信件的分词,可以依据词间空格和标点来分离,而中文邮件 的分词要复杂的多。 1 2 哈尔滨工程大学硕士学位论文 通常的中文分词方法主要分为三类m ,:第一类是基于词典的字符串匹配 分词方法,第二类是基于词的频度统计分词方法,这两类方法实用、具体, 比较容易实现:第三类方法主要基于句法、语法分析,并结合语义分析,通 过对上下文内容所提供信息的分析对词进行定界,这类方法试图让机器具有 人类的理解能力,其原理较为晦涩,一般不易实现。 1j 基于词典的字符串匹配分词方法 这种方法又叫做机械分词方法,它是按照一定的策略将待分析的汉字串 与一个充分大的机器词典中的词条进行匹配,若在词典中找到某个字符串, 则匹配成功。按照扫描方向的不同,字符串匹配分词方法可以分为正向匹配 和逆向匹配;按照不同长度优先匹配的情况,可以分为最大( 最长) 匹配和 最小( 最短) 匹配。常用的分词方法是正向最大匹配法( f o r w a r dm a x i m u m m a t c h i n g ,f m m ) 其基本思想为:设d 为词典,m a x 表示d 中的最长词条所含汉字个数, s t r 为待切分的字串。f m m 法是每次从s t r 中从左至右取长度为m a x 的子串 作为匹配字段,查找词典d 。若词典中有这样一个m a x 字词,则匹配成功, 匹配字段作为一个词被切分出来,指针后移m a x 个汉字后继续匹配;如果词 典中找不到,则匹配失败。匹配字段去掉最后一个汉字,剩下的字符作为新 的匹配字段,进行新的匹配,如此下去,直至切分到一个汉字为止,完成一 轮匹配过程。然后再按照上面的步骤进行下去,直至切分出所有的词。 本文采用正向最大匹配法进行分词处理。 f2 j 基于词频的统计方法 统计方法一般不依赖于词典,而是将原文中任意前后紧邻的两个字作为 一个词进行出现频率的统计,出现的次数越高,成为一个词的可能性也就越 大。在频率超过某个预先设定的阈值时,就将其作为一个词进行索引。这种 方法能够有效地提取出未登录词一1 。 由于垃圾邮件的制造者为了隐藏垃圾信息,会人为地插入特殊符号,比 如“代办、共产党”等来逃避正确分词,所以在分词前要删除这些空 格、一、# 等特殊符号。 在实际应用中,邮件文本中的很多词与内容无关,例如“但是”、“如果” 等。这些与内容无关的词,称作功能词( f u n c t i o nw o r d s ) 。另外,一些出现 1 3 哈尔滨工程大学硕士学位论文 频率过高的词,例如“我们”、“大家”等,对于邮件性质也没有太多的影响, 在下一步特征提取前,需要将其去除。一般将功能词和出现频率过高的词统 称为停用词( s t o pw o r d s ) 。将前面的分词结果和停用词表进行对照,去除其 中的停用词,以便于进行后面的特征选取工作。 3 、邮件特征提取 把从一封邮件中提取得到的词作为邮件的特征项,用来表征邮件的特性, 这些特征项及相关信息构成了该邮件的特征向量,u 个特征项则构成n 维特 征向量。 如果将前面预处理得到的所有词都作为特征项,势必导致计算压力大, 分类算法的代价过高,而且可能无法准确地提取邮件的特征信息,影响识别 效果。邮件特征提取就是为了提高邮件识别效率、降低计算复杂性而移除邮 件中一些对识别作用不大的特征项,为特征向量降维。 特征选取的任务就是如何将信息量小,“不重要”的词汇从特征项空间 中删除,从而减少特征项的个数。 常用的特征选取方法有:文档频率( d o c u m e n tf r e q u e n c y ,d f ) 、信息 增益( i n f o r m a t i o ng a i n ,i g ) 、互信息( m u t u a li n f o r m a t i o n ,m i ) 、丌方拟 合检验( x 2 一t e s t ,c h i ) 、术语强度( t e r ms t r e n g t h ,t s ) 等。文献 2 7 针对 英文纯文本比较研究了上述五种经典特征选取方法的优劣。实验结果表明, i g 和c h i 方法的效果最佳:d f 方法的性能同i g 和c h i 的性能大体相当, 而且d f 方法还具有实现简单、算法复杂度低等优点;t s 方法性能一般; m i 方法的性能最差。 本文将采用d f 方法进行邮件特征提取,可以有效地降低计算复杂度。 d f 方法主要考虑在训练邮件集中包含待选特征项的邮件数,即文档频 率( d f ) 。这种衡量特征项重要程度的方法基于这样一个假设:d f 较小的特 征项对识别结果的影响较小,即频率较低的词独立表达的识别信息不强。这 种方法优先取d f 较大的特征项
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年蒲江县面向社会公开招聘园区产业发展服务专员的(5人)模拟试卷及完整答案详解(必刷)
- 2026广东警官学院总务部招聘合同制人员2人备考题库附完整答案详解(必刷)
- 乐山市金口河区2026年医疗卫生辅助岗第二轮招募(2人)模拟试卷附答案详解【A卷】
- 2026年合肥长丰县公证处服务外包用人招聘模拟试卷附完整答案详解【各地真题】
- 2026年哈尔滨商业大学公开招聘科研助理、管理助理、教学助理岗位人员7人模拟试卷加答案详解
- 2026云南红河州蒙自惠源人力资源有限责任公司社会救助经办人员招聘1人笔试题库含答案详解(培优A卷)
- 2026江西南昌市公园事务中心招聘水电工岗位招聘1人模拟试卷含答案详解【培优】
- 2026(第四期)广东顺德人资企业管理有限公司招聘14人模拟试卷含答案详解
- 2026中国医学科学院阜外医院心外科医师招聘备考题库及答案详解(必刷)
- 2026年度黑龙江省科学院微生物研究所公开招聘博士科研人员1人考前冲刺试卷含答案详解(研优卷)
- 新生儿复苏操作技能考核评分标准(2025 版)中文版 逐项打分 + 合格判定细则
- 2025年广西卫生职业技术学院教职人员招聘笔试真题(含完整答案解析)
- 2026年医师定期考核试题题库中医入门试题及答案
- 山洪灾害预警识别知识
- 2025-2026学年人教版生物必修二全册综合检测练习卷(含解析)
- 2026小红书有感运动IP方案
- 天然气管线保护施工方案
- 2025届中工国际工程股份有限公司校园招聘笔试历年参考题库附带答案详解
- 城市道路桥梁安全监测预警系统操作手册
- 2026计算机二级MS Office真题模拟押题含解析
- GB/Z 114.1-2026纳米制造技术规范纳米储能第1部分:空白详细规范电化学电容器用纳米多孔活性炭
评论
0/150
提交评论