已阅读5页,还剩57页未读, 继续免费阅读
(模式识别与智能系统专业论文)基于svm的近红外光谱定性分析及其应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
浙江大学硕士学位论文 摘要 近红外光谱分析技术是一种新的化学分析方法,具有无污染、无破坏、分析 速度快、效率高、成本低及可以实现在线分析等特点,在食品、医药、化工、石 油等领域获得了空前的发展,并且其涉及的领域愈来愈广。为此,本文对近红外 光谱定性分析技术作了深入研究,具体包括以下内容: 1 通过阅读大量的中英文文献,对近红外光谱分析技术的概念、原理与应 用作了较为系统完整的阐述,对模式识别技术和定量校正方法在近红外分析中的 应用作了细致地描述。 2 本文将支持向量机( s u p p o r tv e c t o rm a c h i n e ,s v m ) 分类算法成功应用到汽 油牌号快速识别中。与其他分类算法如k 近邻法( 州) 、相似分析法( s i m c a ) 的比较结果表明,s v m 法分类的效果最好,其最大分类错误率很低,运行结果 很稳定,受样本变化、参数变化等影响很小,具有广泛的应用价值。 3 为了提高定量分析的精度,本文提出了混合偏最小二乘( p a r t i a ll e a s t s q u a r e s ,p l s ) 法。首先用s v m 法对测试样本进行分类,然后选用与待测样本性 质相近的同类部分校正集样品建模来预测待测属性值。为了克服分类错误样本的 影响,混合p l s 法包含了基于分类的局部p l s 法和基于全部训练样本集的局部 p l s 法两种算法。混合p l s 法通过比较两种局部p l s 法的输出,计算测试样本 的待测属性值。针对一批汽油样本的实验结果表明,该算法对汽油研究法辛烷值 的预测效果达到了较高的精度。 4 基于上述理论成果,针对已研制的汽油辛烷值近红外光谱分析仪,对仪 器软件进行了升级,将s v m 分类法用于汽油牌号的快速识别中,并把自己提出 的混合p l s 近红外光谱定量分析法应用于汽油辛烷值的定量预测中,提高了仪 器的性能。 关键词:近红外光谱,分类,定量校正,支持向量机,偏最d - - 乘,汽油牌号, 研究法辛烷值 浙江大学硕士学位论文i i i a b s t r a c t n e a r - i n f r a r e d ( n i r ) s p e c t r o s c o p yt e c h n o l o g yi san o v e lc h e m i s t r ya n a l y s i s m e t h o d i th a ss o m eo b v i o u sa d v a n t a g e ss u c ha s u n p o l l u t e d ,n o n d e s t r u c t i v e , f a s t s p e e d ,h i g he f f i c i e n c y , l o wc o s ta sw e l la se a s i l ya p p l i c a b l ei no n 1 i n ea n a l y s i s n i rs p e c t r o s c o p yh a sb e e ns u c c e s s f u l l ya p p l i e di nt h ef i e l d so ff o o de n g i n e e r i n g , p h a r m a c y , c h e m i c a le n g i n e e r i n g ,p e t r o l e u mi n d u s t r ye t c t h i st h e s i sf o c u s e do nt h e q u a l i t a t i v ea n a l y s i st e c h n i q u e so fn i rs p e c t r o s c o p y t h em a i nc o n t r i b u t i o n so ft h i s t h e s i sa r ea sf o l l o w s : 1 t h ep r i n c i p l e so fn i rs p e c t r o s c o p yt e c h n o l o g yi s i n t r o d u c e d ,a n dt h e nt h e a p p l i c a t i o n so fp a t t e mr e c o g n i t i o nt e c h n o l o g ya n dq u a n t i t a t i v ec a l i b r a t i o ni nn i r s p e c t r o s c o p yt e c h n o l o g ya r ep r e s e n t e d 2 s u p p o r tv e c t o rm a c h i n e ( s v m lc l a s s i f i e ri s s u c c e f u l l ya p p l i e di nf a s t r e c o g n i t i o no fg a s o l i n eb r a n d s c o m p a r e dw i t ho t h e rc l a s s i f i e r ss u c ha sk n n ( k 。n e a r e s tn e i g h b o u rm e t h o d ) ,s i m c a ( s o f ti n d e p e n d e n tm o d e l i n go fc l a s sa n a l o g y ) e x p e r i m e n t a l r e s u l t ss h o wt h a tt h es v mc l a s s i f i e rh a sl o w e r p e r c e n t a g eo f m i s c l a s s i f i c a t i o na n dm o r es t e a d yr e c o g n i t i o nr e s u l t s ,w h i c hc a nb ew i d e l yu s e di n m o s tc l a s s i f i c a t i o np r o b l e m si nv a r i o u sf i e l d s 3 t oi m p r o v et h ea c c u r a c yo fn e a r - i n f r a r e ds p e c t r a lq u a n t i t a t i v ea n a l y s i s ,an e w h y b r i dp l sa l g o r i t h mi sp r o p o s e d a nu n k n o w ns a m p l ei sf i r s tc l a s s i f i e db ya ns v m c l a s s i f i e r ,a n dt h e ns e v e r a ls i m i l a rt r a i n i n gs a m p l e so ft h es a m et y p ea r es e l e c t e dt o b u i l dt h ec a l i b r a t i o nm o d e la n d p r e d i c tt h ep r o p e r t yo ft h eu n k n o w ns a m p l e t oa v o i d t h en e g a t i v ei n f l u e n c eo fc l a s s i f i c a t i o nf a i l u r e ,t h en e w h y b r i dp l si n c l u d e sal o c a l p l sm o d e lb a s e do nt h es a m e t y p et r a i n i n gs a m p l e sa n dal o c a lp l sm o d e lb a s e do n t h et o t a lt r a i n i n gs a m p l e s i td e t e r m i n e st h ep r o p e r t yv a l u eo ft h eu n k n o w n s a m p l eb y c o m p a r i n gt h eo u t p u t so ft h et w om o d e l s f o ras e to fg a s o l i n es a m p l e s ,t h eh y b r i d p l sa c h i e v e sh i g hp r e d i c t i o na c c u r a c yo fr e s e a r c ho c t a n en u m b e r 4 b a s e do nt h ea b o v er e s e a r c hr e s u l t s ,t h es o f t w a r e o fa n i n d e p e n d e n t l y d e v e l o p e dg a s o l i n eo c t a n en u m b e rn i ra n a l y z e ri su p d a t e d t h es v mc l a s s i f i e ri s t r a n s f e r e dt oa u t o m a t i cr e c o g n i t i o no fg a s o l i n eb r a n d sa n dt h eh y b r i dp l s a l g o r i t h m i sa p p l i e di np r e d i c t i o no fr e s e a r c ho c t a n en u m b e ro fg a s o l i n e a p p l i c a t i o nr e s u l t s s h o wt h a tt h eu p d a t e da n a l y z e rp r e s e n t ss a t i s f a c t o r yp e r f o r m a n c e s k e y w o r d s :n e a ri n f r a r e ds p e c t r o s c o p y ,c l a s s i f i c a t i o n ,q u a n t i t a t i v ec a l i b r a t i o n , s u p p o r tv e c t o rm a c h i n e ,p a r t i a ll e a s ts q u a r e s ,g a s o l i n eb r a n d s ,r e s e a r c h o c t a n en u m b e r 独创性声明 本人声明所星交的学位论文是本人在导师指导下进行的研究工作及取得的 研究成果。据我所知,除了文中特别加以标注和致谢的地方外,论文中不包含其 他人已经发表或撰写过的研究成果,也不包含为获得逝鎏盘堂或其他教育机 构的学位或证书丽使用过的材料。与我一同工作的同志对本研究所做的任何贡献 均已在论文中作了明确的说明并表示谢意。 学位论文作者签名: 张魄曼签字日期: 刃诹年6 月侈日 学位论文版权使用授权书 本学位论文作者完全了解逝姿盘堂有关保留、使用学位论文的规定, 有权保留并向国家有关部门或机构送交论文的复印件和磁盘,允许论文被查阅和 借阅。本人授权逝姿基堂可以烙学位论文的全部或部分内容编入有关数据库 进行检索,可以采用影印、缩印或扫描等复制手段保存、汇编学位论文。 ( 保密的学位论文在解密后适餍本授权书) 学位论文作者签名: 苏吮曼 导师签名: 签字日期:少p 名年石月j 3 日 学位论文作者毕业后去向: 工传单位: 中船垒工7 d 牛所 通讯地址。上海事衡山路p 黑 炮焉 签字日期百,眵年6 月f ) 日 电话:秽爿一善i 羁露拿g 燃:2 0 0 0 3 ; 浙江大学硕士学位论文 v 致谢 值此论文完成之际,我衷心感谢戴连奎教授两年来对我孜孜不倦的教育和指 导。戴老师把我带入了近红外光谱分析研究的大门,不仅在学习过程中给予我悉 心的指导,而且为我提供了一个宽松、和谐的研究环境,引导我在科研工作中一 步步前进,我的每一次进步和取得的成绩都是与戴老师的教育、帮助分不开的。 戴老师不仅在科研工作中给予我最大的帮助,同时在生活中给予了我无微不至的 关怀,在此衷心表示感谢! 戴老师勤奋敬业、知识渊博、思维敏锐、治学态度严 谨、为人乐观豁达,在学习和工作上为我树立了良好的榜样。 衷心感谢中国石化集团杭州炼油厂蔡仁杰总工程师、质检中心的徐兴高处长 以及其他人员为本课题所提供的应用条件与现场数据,以及在应用本课题开发的 汽油辛烷值近红外分析仪方面所提供的帮助和支持。 衷心感谢吴铁军教授对我工作学习各方面的帮助和启迪。吴教授对待学生和 蔼可亲,语言幽默,令人如沐春风。吴教授治学态度也十分严谨,对工作总是一 丝不苟、亲历亲为,他对事业孜孜不倦的追求精神令我非常钦佩和敬仰。同时, 感谢智能所其他老师两年多来对我的学习科研工作所给予的帮助。 衷心感谢包鑫师兄、白小琴师姐,淡图南同学、郑旦师傅以及李晟、阮华和 乔西娅同学,他们是我的良师益友,在我的科研学习过程中给予了我极大的帮助 和支持,共同营造了一个和谐的学习生活环境,在此表示诚挚的谢意。 感谢两年多来与我同一寝室的陈建树、朱莉同学,她们是我的良师益友,在 学习和生活上给予我许多热心的帮助,跟她们在一起生活非常愉快。 对所有对关心和帮助过我的所有同学和朋友们表示感谢。 衷心感谢我的父亲、母亲及其他亲人,他们用自己最大的努力帮助我完成学 业,感谢他们一直以来对我的关爱和支持。 张晓曼 二零零八年六月于求是园 浙江大学硕士学位论文 第一章近红外光谱分析技术综述 摘要:现代近红外光谱技术是最引人注目的光谱技术之一,可以用来对很多有机化合物进 行定性和定量分析。本章介绍了光谱分析中的数据预处理方法、波长选取方法、模 式识别方法和定量校正方法,并给出了这些算法的一些应用实例。 关键词:近红外光谱分类定量校正 1 1 引言 在科学研究中经常需要知道物质的组成、状态和结构,常规的分析化学方法 是采用化学分析的手段研究物质的组成。二次大战后由于物理学和电子技术的发 展并被引入到化学分析中,给分析化学带来了革命性变化,发展到了仪器分析时 代。紫外一可见分光光度法、红外吸收光谱法、拉曼光谱法、核磁共振波谱法等 组成的光学分析方法成为仪器分析的一个主要内容。其中,近红外光谱分析技术 又由于它独特的优点,得到广泛应用,近年来发展很快。 近红外光( n e a ri n f r a r e d ,n i r ) 是指波长范围为7 0 0 2 5 0 0 n m ( 美国试验和材料 标准协会a s t m 规定) 的电磁波。这个光谱区由于含氢基团x h 的泛频和组频作 用,存在许多化学成分相互重叠的吸收带,包含了丰富的特征信息,并且与其它 分子团振动作用基本独立,因而适合带含氢基团的化合物的定量测定或定性分 析。此外,对于近红外光的吸收取决于样品中组分浓度和分子特性及相互作用。 不同分子由于包含不同基团而吸收不同频率的近红外光;同类分子包含相同基团 但浓度不同,从而吸收不同量的近红外光能量。因此,在近红外光的吸收光谱中 不仅包含化学组分的信息,还包含了组分浓度的信息。但由于近红外光谱的特征 谱带较宽,且相互重叠严重,使光谱的分辨比较困难,直接分析n i r 重叠的谱 峰对预测物质属性通常没有太大用处,并且由于样本混( 化) 合物高度复杂的化学 组成和样本n i r 光谱强烈的相关性,单独预测每个相关成分的待测属性非常困 难,只能对所有成分的整体属性进行预测( b l a n c o ,2 0 0 2 ) 。 化学计量学( 史永刚,2 0 0 3 ) 在光谱分析中的应用主要包括以下四个方面:( 1 ) 光谱预处理和波长筛选方法( 褚小立,2 0 0 4 ) ,目的是针对特定的样品体系,通过 对光谱的适当处理或变换,减弱以至于消除各种非目标因素对光谱的影响,尽可 能地去除无关信息变量,提高分辨率和灵敏度,从而提高校正模型的预测能力和 稳健性。( 2 ) 建立光谱定量分析模型的多元校正方法( 陆婉珍,2 0 0 7 ) ,如多元线性 第。章近红外光谱分析技术综述 回归( m u l t i v a r i a t el i n e a rr e g r e s s i o n ,m l r ) 、主成分f l 归( p r i n c i p a lc o m p o n e n t r e g r e s s i o n ,p c r ) 、偏最小二乘( p a r t i a ll e a s ts q u a r e s ,p l s ) 、人工神经网络( a r t i f i c a l n e p a ln e t w o r k ,a y n ) 和支持向量机( s u p p o r tv e c t o rm a c h i n e ,s v m ) 等,目的是建 立用于预测未知样品性质或组成的分析模型。( 3 ) 模式识别定性方泫( 边肇祺, 2 0 0 0 ) ,如线性学习机、k 最近邻法和相似分类法( s i m c a ) 等有监督的模式识别 方法,以及聚类分析法等无监督模式识别方法,目的是通过近红外光谱数据对不 同样本按某些共同的特征进行分类识别,从而发现被量测样本之间的内在联系, 获得决策性的分类信息。( 4 ) 模型传递方法( 熊宇虹,2 0 0 7 ) ,如有限脉冲响应算法 ( f i n i t ei m p u l s er e s p o n s e ,f i r ) 、直接校正算法( d i r e c ts t a n d a r d i z a t i o n ,d s ) 、分段直 接校正算法( 田高友,2 0 0 6 ) 等,目的是将在一台仪器上建立的定性或定量校正模 型可靠地移植到其它相同或类似的仪器上使用,或将在某一条件下建立的模型用 于同一台仪器另一条件采集的光谱,从而减少建模所需的时间和费用。 在光谱分析使用的这些化学计量学方法中,光谱预处理和波长选取方法是进 行定性和定量分析的基础。近红外光谱仪所采集的光谱除样品的自身信息外,还 包含了其他无关的信息和噪音,如电噪音、样品背景和杂散光等。因此,在用化 学计量学方法建立模型时,首先要对光谱进行预处理和波长选择。光谱预处理旨 在消除光谱数据无关信息和噪音;而波长选择一方面可以简化模型,更主要的是 由于不相关或非线性变量的剔除,可以得到预测能力强、稳健性好的校正模型。 常用的谱图预处理方法有数据增强变换、平滑、导数、标准正态变量变换、多元 散射校正、傅立叶变换等,近几年,小波变换、正交信号校正和净分析信号等一 些新方法正得到发展和应用;常用的波长选择方法主要有相关系数法、逐步回归 法、间隔偏最d , - 乘法( i n t e r v a lp l s ) 、遗传算法( g e n e t i ca l g o r i t h m s ,g a ) 等。褚 小立等人( 2 0 0 4 ) 较详细地综述了近红外分析中常用的光谱预处理及波长选择方 法。本章重点介绍近红外光谱分析中常用的定性与定量方法。 1 2 模式识别定性方法 在近红外光谱分析技术的实际应用中,经常遇到只需要知道样品的类别或质 量等级,并不需要知道样品中含有的组分数和含量的问题,即定性分析问题,这 时需要用到化学计量学中的模式识别方法。 模式识别是人工智能科学的一个重要分支,最早在2 0 世纪6 0 年代末就被引 入到化学领域,化学计量学的建立和发展使得模式识别技术在化学研究领域得到 了广泛的应用。按照模式识别研究者的经典定义,所谓模式指的是对某些感兴趣 的客体的定量或结构的描述,模式类是具有某些共同特征的模式的集合;而模式 浙江大学硕士学位论文 识别是研究一种计算机化的自动技术,依靠这种技术,计算机自动地把待识别的 模式分配到各自所需的模式类中去。在分析化学领域,模式对应的是化学量测数 据的变量。近红外光谱模式识别的目的和作用,就在于通过分析近红外量测数据 对不同样本按共同的特征进行分类识别,从而发现被量测样本之间的内在联系, 获得决策性的信息( 陆婉珍,2 0 0 7 ) 。基于模式识别的n i r 光谱定性分析在实际领 域中可用于产品质量控制、节约成本和提高效率,具体应用有划分类型、评定质 量等级、鉴别真伪、剔除异常样本和发现潜在新样本等等。 模式识别方法依据学习过程( 或称训练过程) 可分为有监督和无监督两大类。 1 2 1 有监督模式识别法 有监督模式识别方法指的是模式识别的学习过程是有监督的。一般是用一组 已知类别的样本作为训练集,即用已知的样本进行训练,让计算机向这些已知的 样本学习,这种求取分类的模式识别方法称为“有监督”、“有老师”的学习,其中 训练集就是老师,并由这个学习过程得到分类模型,从而对未知样本的类别进行 预测。有监督模式识别方法根据预先知道的先验类别信息( 包括类别个数、各类 别包含成员、类别划分定义及各类别的关系) ,先用覆盖大范围样本性质变化的 训练样本集建模,然后基于分类模型分析未知样本的待测属性、计算未知样本的 目标函数,根据分类准则将未知样本划分到合适的已知类别中。在用训练样本集 建立模型时,交叉检验法常用来优化模型,即确定建模所需特征变量的最佳个数。 建立分类模型后还要用独立的测试样本集( 已知样本所属类别) 检验分类效果,以 比较选取最合适的分类策略和确定最好的分类算法参数。 在近红外光谱定性分析中,基于物性的定性分析问题大都采用有监督模式识 别法。常用的有距离判别法、b a y e s 判别法,f i s h e r 判别法、线性学习机( l i n e a r l e a r n i n gm a c h i n e ,l l m ) 、线性判别分析( ( l i n e a rd i s c r i m i n a n ta n a l y s i s ,l d a ) ( 胡 兰萍,2 0 0 7 ) 、k 近邻法( k n e a r e s tn e i g h b o u rm e t h o d ,k n n ) ( t a n ,2 0 0 6 ) 、p c a 类中 心最小距离法、相似分析法( s o f ti n d e p e n d e n tm o d e l i n go f c l a s sa n a l o g y ,s i m c a ) ( b l a n c o ,2 0 0 4 ) 和支持向量机( 张录达,2 0 0 5 ) 等。下面介绍近红外光谱分析中常用 的模式识别方法。 一、p c a 类中心最小距离法 模式识别判别分析中最简单直观的方法是基于距离函数的分类法。它的核心 思想是使用一类的重心来代表这个类,计算待分类样本到各类重心的距离,归入 距离最近的类。在判别分析中可采用多种距离,常用的有马氏距离和欧式距离。 第- 章近红外光谱分析技术综述 p c a 类中心最小距离法先用p c a 处理整个训练集的吸光度矩阵提取出主元 得分,然后计算出主元空间中各类别分布中心的得分坐标。基于整个训练集的主 元负载向量计算测试样本的主元得分,与各类别中心的欧氏距离最小的类别即为 测试样本的类别。 二、 k 近邻法 如果允许类中全部样本都有资格作为类的代表的话,就是k 近邻( 州) 法。 k n n 法基本思路是找出训练样本集中与未知样本具有最小距离的k 个近邻,然 后检查它们的类别,归入比重最大的类。 k n n 法又分为一般k n n 法、k n n 相对距离法和加权k n n 相对距离法。 一般k n n 法中近邻个数k 是固定的基数;k n n 相对距离法是选取相对距离小 于相对距离阈值的所有训练样本作为近邻,k 即为所选训练样本的个数;加权 k n n 相对距离法是先根据k n n 相对距离法选出k 个近邻,计算各个类别所属 近邻总权重( 该权重与距离成递减关系) ,再选择总权重最大的类别作为测试样本 的类别。这里相对距离是指待测样本与某个样本的欧式距离相对与该待测样本与 最近邻训练样本欧式距离的比值。 k 近邻法的优点是它不要求训练集的几类样本是线性可分的,也不需要单独 的训练过程,新的已知类别的样本加入到训练集中也很容易,而且能够处理多类 问题,因此应用较为方便。该算法的主要问题是k 值的选取,由于每一类中的 样本数量和分布不尽相同,选取不同的k 值,未知样本的判别结果可能会不同, 目前k 值的选取尚无一定规律可循,只能由具体情况或由经验来确定,通常不 宜选取较小的k 值。 k 近邻法还可用作数据库搜索方法。实际上,基于模式识别的拓扑定量校正 方法的思想也源于k 近邻法。 三、s i m c a 法 s i m c a 法又称相似分析法,是瑞典化学家w o r d 于1 9 7 6 年提出的,在化学模 式识别中得到了广泛应用。s i m c a 分类方法是建立在主成分分析基础上的一种 有监督模式识别方法,其基本思路是对训练集中每一类样本的近红外光谱数据矩 阵分别进行主元分析,建立每一类的主元分析数学模型,然后在此基础上对未知 样本进行分类,即分别试探将该未知样本与各类样本数学模型进行拟合,以确定 其属于哪一类或不属于任何一类。 s i m c a 法有两个主要步骤:第一步先建立每一类的主成分分析( 陆婉珍,2 0 0 0 ) 模型;第二步以未知样本逐一去拟合各类的主成分模型,从而进行判别归类。 浙江大学硕士学位论文 对训练集中的各类,如类后,可建立其各自的主成分分析模型: x k = t k p :+ e k 式中,以为训练集第七类所有样本的近红外光谱矩阵( 刀木p ) ;刀为第七类所有样 本数;p 为波长变量数;瓦为得分矩阵( 刀木厂) ;厂为最佳主成分数,可通过交叉 验证方法确定;只为载荷矩阵( p 宰f ) ;乓为光谱残差矩阵。 s i m c a 法具体又分为最小残差法和统计距离法。s i m c a 最小残差法是选择 残差光谱范数最小的类别作为测试样本的类别;而s i m c a 统计距离法在求出测 试样本残差光谱后,再计算各个类别自身的残差光谱矩阵,用测试样本关于某类 别主元模型得分的相对距离作为判别标准f : f( 9 ) pr 、j , 瓯( g ) 2 ( 一c 一1 ) 式中s p ( g ) 2 是测试样本光谱p 匹配类别q 的残差范数;s o ( g ) 2 是类别q 自身训练 样本光谱的残差范数和;。,是训练集中类别g 包含的样本数;m 是采用的主元 个数,选取,值最小的类别作为测试样本的类别。 四、支持向量机法 支持向量机( s v m ) 法是2 0 世纪9 0 年代初由v a p n i k 等人提出的一种机器学 习方法,它是在统计学习理论( s t a t i s t i c a ll e a r n i n gt h e o r y ) 的基础上发展起来的。 支持向量机可以有效地克服神经网络方法收敛速度慢、解不稳定以及泛化能力差 的缺点,在涉及到小样本、非线性和高维数据空间的模式识别问题上表现出了许 多传统模式识别算法所不具有的优势。近年来,s v m 受到了很大重视,在模式 识别、信号处理、控制、通讯等方面得到了广泛应用。 支持向量机法的基本思想来源于线性判别的最优分类面,所谓最优分类面就 是要求分类面不但能将两类样本无错误地分开,而且要使分类间隙最大或称分类 间隔最大。通过实现最优分类面,一个直接的优点是可以提高预测能力,减低分 类错误率。2 2 节将详细介绍s v m 方法。 1 2 2 无监督模式识别法 无监督的模式识别方法是一种事先对样本的类别未知,无需训练过程的分类 识别方法。聚类分析是无监督模式识别法的代表,其主要思路是利用同类样本彼 此相似,即常说的“物以类聚”,相似的样本在多维空间中彼此的距离应小些,而 第章近红外光谱分析技术综述 不相似的样本在多维空间中彼此的距离应大些。聚类分析即为如何使相似的样本 “聚”在一起,从而达到分类的目的。聚类分析在近红外光谱定性分析中的应用十 分广泛( 刘木清,2 0 0 7 ) ,如对不同种类物品的鉴定分成正品和非正品,研究种属 分类如探索中草药亲缘关系等。此外,将聚类分析和多元校正方法相结合,有时 很有用,如研究对象变化幅度大时,某一定量对应关系往往偏离设定的模型,从 而使回归模型失效。在这种情况下,先用聚类分析方法将样本分为几大类,然后 对每一类样本建立模型,往往会得到较好的结果,局部权重回归方法就是基于这 一思想。近红外光谱定性分析常用的方法有系统聚类分析泫( 熊雪梅,2 0 0 7 ) 、k 均值聚类法、模糊k 均值聚类法( 孟宪尧,2 0 0 7 ) 及白组织神经网络( 陆婉珍,2 0 0 7 ) 。 系统聚类法和k 均值聚类法是目前聚类分析中应用最多的两种方法。模糊k 均 值聚类方法和自组织神经网络方法是今年来发展最快的聚类方法。 值得注意的是,应用聚类分析实际上是一个需要多方参与的过程,它无法脱 离所涉及领域专家的参与,聚类算法仅仅整个聚类流程中的一环而已,光靠纯粹 的数学聚类算法常常不能得到满意的分类效果。 在基于近红外光谱信息进行的模式识别中,光谱数据的预处理和特征提取是 非常关键的一步。引言介绍的光谱预处理方法,均可选用。特征变量选取的优劣 将直接影响以后的分类和识别。有时特征提取和压缩是密不可分的,一般两者同 时进行,其中最常用方法是主成分分析。通过对光谱进行主成分分析,选取特征 值较大的几个主成分得分作为特征变量参与模式识别,在尽量保留有用信息的前 提下,不仅压缩了原始光谱,而且这些变量是沿最大方差方向得到的,还起到了 特征信息提取的作用。当然,在实际应用中,对于有些特殊的分析体系,并非特 征值大的主成分就是优选的特征变量,有时需通过化学知识或优化方法再从主成 分中选取变量。如果这些光谱特征仅仅作为样本模式识别特征变量的一部分,则 需要对这些特征变量进行数据预处理诸如标准化或特征变换,以消除数据间量纲 的差异,增加变量间的可比性。 1 3 定量校正方法 定量校正也称多元校正,即在物质浓度( 或其他化学性质) 与分析仪器响应值 之间建立定量关联关系,是化学计量学的一个主要分支。近红外光谱分析法是一 种问接分析技术,它是用统计的方法在样品待测属性值和近红外光谱数据之间建 立一个关联模型( 或称校正模型,c a l i b r a t i o nm o d e l ) 。因此在对未知样品进行分析 之前需要搜集一批用于建立关联模型的训练样品( 或称校正样品,c a l i b r a t i o n s a m p l e s ) ,获得用近红外光谱仪测得的样品光谱数据x s 和用常规方法测得的属性 浙江大学硕士学位论文 数据y s 。x s 经光谱预处理后与y s 通过化学计量学方法建立校正模型,即可以预 测经预处理后的测试样本光谱x u 对应的待测属性值y u 。 测试样本 预测结果 图1 1 近红外校正模型建立流程 近红外校正模型的建立流程如图1 1 所示。其中,x s 、x u 是样本经过基线去 除、归一化等预处理后的吸光度光谱,y s 、y u 是样本的一个或多个属性值( 如汽 油的辛烷值) 。吸光度光谱计算如下:用近红外光源照射样品后由近红外光谱仪 测到的透射光谱除以无样品时照射空气测到的参考光谱计算得到传输率光谱t , 吸光度光谱a = 1 0 9 l o ( t ) 。训练样本的y s 通常用标准化学分析方法得到,这种方法 作为近红外光谱分析法的参考方法必须有很高的测量精度,才能减少带入到模型 中的误差,从而提高近红外光谱测量结果的准确性。有了一定数量和分布的训练 样本,就可以从中选取适当的样本数据建立校正模型,对待测样品的组分属性进 行预测。 近红外光谱分析中常用的多元校正方法包括:多元线性回归( u d d i n ,2 0 0 6 ) 、 主成分回归( h o w l e y ,2 0 0 6 ;k r i s h n a ,2 0 0 6 ) 、偏最d , - 乘法( m e n d e s ,2 0 0 3 ;b l a n c o , 2 0 0 4 ) 等线性校正方法,以及局部权重回归( l o c a lr e g r e s s i o n ) 、人工神经网络( h a h n , 2 0 0 4 ;s a n t o s ,2 0 0 5 ) 、支持向量机法和拓扑方法( t p ) 等非线性校正方法。其中, p l s 在近红外光谱中得到较为广泛的应用,事实上已经成为一种标准的常用方 法。此外,s v m 作为非线性校正方法的代表,也越来越多地用于近红外光谱定 量分析。 一、多元线性回归 多元线性回归方法是早期近红外光谱分析常用的定量校正方法。 设】,为校正集浓度矩阵( n * m ) ,由行个样本、m 个组分组成;x 为校正集光 谱矩阵( n * k ) ,由聆个样本、k 个波长数据点组成;b 为回归系数矩阵;e 为浓 度残差矩阵,由式 y = x b + e 曰的最小二乘解为 b :f x7 x 1 - ix 7 】, 第章近红外光谱分析技术综述 从上式可以看出,在m l r 中只要知道样品中某些组成的浓度,就可以建立 其定量模型。唯一的要求就是选择好对应于被测组分的特征吸收光谱。 n o r r i s 等( 1 9 6 8 ) 首先将多元线性回归技术用于近红外光谱的定量校正模型, 并成功地预测了谷物的多种成分。这一首创带来了近红外光谱技术的复苏,使得 近红外光谱技术开始成为实用可行的分析技术。至今m l r 仍是光谱分析中常用 的多元校正技术之一( w o o ,2 0 0 3 ) 。 李风瑞( 2 0 0 3 ) 应用近红外光谱方法对煤质在 线分析进行研究,主要进行煤中挥发分的测定,采用多元回归方法对数据进行了 分析和处理,建立了多元线性模型,该模型得出的煤中挥发分的预测值与人工化 验标准值之间的相关系数为o 9 6 。 多元线性回归的优点是计算简单,但多元线性回归也有许多缺点( 陆婉珍, 2 0 0 0 ) 。由于对方程维数的要求,参加回归的变量数不能超过校正集的样本数目。 因此,多元线性回归方法实用的变量数受到限制。此外,光谱的强度在某些波长 处往往成一定比例关系,这样产生了多元线性回归中遇到的共线问题。所谓共线 问题是指x 矩阵是不满秩,即x 中至少有一列或一行是可用其它几列或几行的 线性组合表示出来。共线问题可导致行列式值为零或接近于零,因此,无法求矩 阵的逆。再者多元线性回归使用x 矩阵建立模型,并没有考虑x 矩阵中的信息 是否与真实模型相关。如果使用的变量包含了噪音,就会导致过度拟合情况,影 响模型的预测能力。 上述缺点限制了多元线性回归方法不能使用太多的向量参与回归。因此,多 元线性回归的重要问题之一就是如何选择参加回归的变量,逐步多元线性回归就 是为了解决这个问题而发展的方法。但对应实际问题来说,并非容易,如一张光 谱包含2 0 0 0 多个变量( 波长点) ,其筛选的工作量是巨大的。实际工作中,往往 靠人工凭化学知识进行选择。一般,要建立一个可靠的多元线性回归模型也需要 大量的样品,收集样品和测量数据的工作也是比较艰巨的。 二、主成分回归 主成分回归p c r 法先对混合物光谱量测矩阵x 进行多元统计中的主成分分 解,然后选取其中的主成分来进行多元回归分析,故称之为主成分回归。 主成分回归法能够解决多元线性回归中遇到的共线问题、变量数使用限制和 一定程度上解决了噪音滤除问题( 陆婉珍,2 0 0 0 ) 。主成分回归过程分为两步:主 成分分析和多元线性回归。主成分分析的目的是将数据降维,以消除众多信息共 存中相互重叠的信息部分。方法是将原变量进行转换,使数目较少的新变量成为 原变量的线性组合,而且,新变量应最大限度地表征原变量的数据结构特征,并 不丢失信,皂, ( w e b b r o b e r t s o n ,2 0 0 5 ;j i a n g ,2 0 0 4 ) 。 浙江大学硕士学位论文 9 y o n g 等( 2 0 0 7 ) 禾1 j 用近红外光谱技术测定西红柿中的可溶固体含量、酸碱度, 采用p c r 和p l s 法建模,取得了很好的预测效果。l e u n g 等( 2 0 0 4 ) 采用p c a 和 p c r 分析在受控温度下凝胶体传播的光谱数据,p c r 模型取得了良好的预测效 果。 主成分回归技术被引入到光谱分析中,成为最常用的定量分析技术之一。光 谱数据经过主成分分析后被分成含信息的主成分和其他噪声部分,用主成分代替 原始光谱数据建立校正模型继承了原始数据的有用信息并且降低了噪声影响。 p c r 的优点是:可以使用整体量测数据( 原始光谱或部分谱数据) ,能充分利 用数据信息,使用更多的数据则能利用数据的平均效应,增加模型抗噪音干扰的 能力;通过主成分选择,可有效地滤除噪音;解决了共线问题;适用于复杂分析 体系,不需要知道干扰组分的存在就可以预测被测组分。 p c r 的缺点是:计算速度比多元线性回归慢;模型优化需要p c a ,对模型 的理解不如多元线性回归直观,较难理解;并不能保证将参与回归的主成分一定 与被测组分或性质相关。 三、偏最小二乘 偏最小二乘p l s 法由h w o l d 于1 9 7 5 年提出。它是一种类似于p c r 的光谱 定量分解技术,不过在分解过程中使用了待测属性的信息,使得显著包含待测属 性特征的光谱区有更大的权重。p l s 采用了单步分解和回归的技术,通常用于预 测时,p l s 性能要略好于p c r 或与之相当。 p l s 法在农业、食品、医药和石油化工等领域获得了广泛的应用 ( d o l e z e l h o r w a t h ,2 0 0 5 ;c h o ,2 0 0 6 ;p u r c e l l ,2 0 0 7 ;r a m o s ,2 0 0 6 ;c o z z o l i n o ,2 0 0 7 ; h e u s s e n ,2 0 0 7 ) 。王丽杰等( 2 0 0 4 ) 利用近红外( n i r ) 漫反射光谱快速测量牛奶中脂 肪、蛋白质和乳糖的含量,采用p l s 回归,建立了测量光谱与牛奶主要成分浓 度之间的校正模型,并对其预测重复性进行了研究。乐俊明等( 2 0 0 5 ) 应用近红外 光谱分析技术测定烟草化学成分,采用偏最小二乘回归法建立了近红外光谱信息 与各成分含量之间的定量校正模型,并用于对9 4 个验证样品进行预测。徐立恒 等( 2 0 0 6 ) 应用近红外光谱法测定了与茶叶品质密切相关的茶多酚、氨基酸及咖啡 碱三类化合物。用p l s 计算法建立了表示上述组分的二阶导数近红外光谱与其 含量问关系的分析模型。根据相关分析模型计算所得的组分含量的结果与用国家 标准方法测得的对应组分的含量达到一致。 p l s 的优点是:可以使用全谱或部分谱数据;数据矩阵分解和回归交互结合 为一步,得到的特征向量直接与被测组分或性质相关,而不是与数据矩阵中变化 1 0 第一章近红外光谱分析技术综述 最大的变量相关;如果选择的校正集具有代表性,p l s 模型更稳健;可以使用于 复杂的分析体系。p l s 的缺点是:计算速度较慢;模型建立过程复杂,较抽象。 m l r 、p c r 、p l s 等都是以最小二乘原则为基础的线性回归方法,其中多元 线性回归必须先提取特征再建立校正模型,而其他两种方法都是全谱方法。m l r 和p c r 、p l s 不同的地方是前者通常显式地从原始数据中选择特征变量,而后 者是对原始数据进行压缩,从中提取隐含变量。t h o m a s 等人通过对m l r 、p c r 和p l s 在定量校正应用中的比较,认为p l s 是其中最优的方法。 四、人工神经网路 以上这些基于线性回归方式的多元校正方法都是基于这样一个前提,即所研 究的体系光谱是线性加和体系。但在实际工作中,近红外光谱参数与样品含量化 学值之间普遍存在非线性,特别是当样品的组成变化范围较大时,其非线性更明 显。另外,由于体系中各组分的相互作用、仪器的噪声及基线漂移等原因,也会 引起非线性现象。尽管p l s 在一定程度上可以校正非线性因素,但如果非线性 非常严重,这些线性校正方法便不能得到理想的分析模型。针对分析体系特有的 非线性特性,需要建立非线性校正模型。 人工神经网络方法由于对非线性函数可以任意逼近而被广泛关注,很多研究 将人工神经网络引入到光谱分析中。人工神经网络是利用物理器件来模拟生物神 经网络的某些结构和功能。它产生于二十世纪4 0 年代。1 9 4 3 年,美国心理学家 w m c c u l l o c h 和数学家w p i t t s 提出了一种简单的神经元数学模型即m p 模型, 开创了人工神经元网络模型的理论研究( 庄镇泉,1 9 9 4 ) 。1 9 4 9 年h e b b 提出了神经 细胞问连接强度变化的规贝, l j ( h e b b 规则) ,指出如果两个神经元都处于兴奋( 激励) 状态,它们之间的连接强度将会得到加强。1 9 5 7 年,r o s e n b l a t t 将神经元当作一 个功能逻辑器件来看待,设计制作了三层结构的感知机,第一次将神经网络的纯 理论研究付诸工程实践,并由此掀起了神经网络研究的第一次高潮。8 0 年代中 期以后,研究进入第二次高潮,其代表是若干典型的网络拓扑及算法的诞生。神 经网络按其处理单元之问的结合方式可分为反馈式和前馈式( 侯晋,2 0 0 1 ) 。1 9 8 6 年r o m e l h a r d 和m c c l e l a n d 提出了一种多层前馈网络的误差反向传播算法,即 b p 算法( 孙增圻,1 9 9 7 ) ,证实了人工神经网络具有很强的运算能力。该算法从 后向前修正各层之间的连接权重,是应用最广泛的神经网络算法之一。除此之外 在化学领域常用的网络有h o p f i e l d 网络( 郑君里,1 9 9 2 ) 、自组织神经网络等。 人工神经网络模仿人脑处理信息,具有自学
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 塑料热合工诚信道德考核试卷含答案
- 燃料值班员岗前培训效果考核试卷含答案
- 2025年全国计算机等级考试二级C语言真题及答案
- 2025年计算机应用基础考试试卷及答案
- 2025年达梦数据库题库及答案
- 2025考核人工智能训练师四级真题精-选附答案
- 2005年中级会计资格考试《财务管理》模拟试题及答案
- 2026浙江省教师职称考试(道德与法治学科知识)历年参考题库含答案详解3卷
- 2026浙江建设工程质量检测人员考试(市政桥梁检测)历年参考题库含答案详解3卷
- 2026河南机关事业单位工勤技能岗位等级考试(土建施工人员·中级/四级)历年参考题库含答案详解2卷
- (17)义务教育劳动课程标准日常修订版(2022年版2025年修订)
- 2025年教师资格证综合素质考试题及答案
- 人教版(2024)七年级全一册信息科技第1单元《探寻互联网新世界》教案
- 车间电动三轮车安全培训课件
- 迎接新阶段追逐新梦想-2025-2026学年高一上学期新生入学开学第一课主题班会
- 腾讯研究院:工业大模型应用报告
- 环境实验室安全知识培训
- (高清版)DB33∕T 1208-2020 工型混凝土预制桩水泥土连续墙技术规程
- 中医知识与优生优育
- 异常分娩的识别及处理
- 中国椎管内分娩镇痛专家共识(2020版)
评论
0/150
提交评论