版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
Part1第7章
误差理论与数
据处理基础CONTENTS7.1测量误差及其分类
7.2最小二乘法7.3数据预处理7.4软测量与信息融合7.1.1测量误差及其分类测量误差:
任何测量的目的都是为了获得被测量的真实值。但在实际测量过程中,由于测量设备精度的限制、测量方法的不同、测量环境的影响,都会使测量结果与测量的真实值不一致。测量结果与被测量真实值之差,就是测量误差。真值:被测物体在一定的时间及空间下,所体现的真实数值。它是一个理想的概念,客观存在,但不可测量。随着科学技术的发展,测量结果的数值会不断接近真值。在实际计量和测量工作中,常常使用“约定真值”和“相对真值”的概念。约定真值:按照国际公认的单位定义,利用科技发展的最高水准复现的单位基准值,它常以法律规定或指定的形式出现。例如,在标准条件下,水的沸点是100℃,冰点是0℃。相对真值:在满足规定准确度时,用来代替真值使用的值,有时也叫实际值。测量误差相关概念误差的来源多种多样,如测量环境不理想、测量装置不够精良、测量方法不合理、测量人员专业素质不达标等,它们对测量结果的影响或大或小。1)测量环境误差任何传感器的标定都是在一定的标准环境下进行的,因此,任何测量都有一定的环境条件要求。测量环境误差是测量仪器的工作环境与规定的标准状态不一致时所造成的误差,典型的有温度、湿度、大气压力、振动、重力加速度、电磁干扰等。2)测量装置误差测量装置误差是指由于测量仪表本身不完善或测量精度不高所带来的误差,包括标准量具误差、仪器误差、附件误差。如高精度测量要求却选用了低精度的测量仪表。3)测量方法误差测量方法误差是指由于测量方法不合理或不完善所引起的误差。如用电压表测量电压时没有正确地估计电压表的内阻,或用近似公式、经验公式或简化的电路模型作为测量依据;或通过测量圆的半径来计算其周长时对"的不同近似取值可能引起的误差。4)测量人员误差测量人员误差是指由于测量人员本身的专业素质不高所引起的误差。如不良测量习惯对测量结果的分辨力不强、操作不规范或疏忽大意等引起的误差。误差来源测量误差的分类
测量误差的分类按性质的误差分类为便于对测量数据进行误差分析和处理,根据测量数据中误差的特征或性质可以将误差分为三类。1)系统误差:相同条件下,同一被测量被重复测量时,误差固定不变,或按照一定规律变化的误差。它定义为无限多次测量结果的平均值减去该被测量的真值。
系统误差的特点是大小和方向恒定不变,或按一定规律变化。恒定不变的称为恒值系统误差,在误差处理中可被修正;按一定规律变化的称为变值系统误差,在误差估计时可归结为系统不确定度。
系统误差的来源包括:测量设备的基本误差、偏离额定工作条件产生的附加误差、测量方法理论不完善带来的方法误差、以及试验人员主观原因产生的误差。2)随机误差:在相同条件下,对同一物理量作多次重复测量时,受偶然因素影响而出现的没有一定规律的测量误差。它定义为测量示值减去在重复条件下同一被测量无限多次测量的平均值。
在实际测量中,当系统误差已设法消除或减小到可以忽略的程度时,如果仍然存在测量数据不稳定的现象,则说明存在随机误差。随机误差是测量过程中许多独立的、微小的、偶然的因素引起的综合结果。引起随机误差的原因多方面的、微小的,且无法控制,一般用概率和数理统计描述和计算,它服从统计规律。
随机误差的大小表明测量结果重复一致的程度,即测量结果的分散性。通常,用精密度表示随机误差的大小。随机误差大,测量结果分散,精密度低。反之,测量结果的重复性好,精密度高。3)粗大误差:疏忽误差,测量结果明显偏离实值对应的误差。产生粗大误差的原因可能有:读数错误、记录错误、计量器具有缺陷、实验条件的突变等。粗大误差必须避免,含有粗大误差的测量数据应从测量结果中剔出。
在测量中,系统误差、随机误差和粗大误差是同时存在的,但它们对测量过程及结果的影响是不同的。同时,测量误差的划分是人为的、有条件的,不同测量场合,不同测量条件,误差之间可以互相转化。7.1.2随机误差及其估算1.随机误差的处理实践表明,随机误差有如下四个特征:单峰性:绝对值小的随机误差出现的概率大于绝对值大的随机误差出现的概率(即随机误差的分布具有单一峰值)。有界性:随机误差的绝对值是有限的。对称性:随着测量次数的增加,绝对值相等、符号相反的随机误差的出现概率将趋向于相等。抵偿性:在相同条件下,当测量次数趋于无穷大时,所有随机误差的代数和为0。上述四个特征使得当测量次数足够多时,随机误差将呈现出正态分布规律。为了确定测量的可靠性,需要计算正态分布在不同区间的概率。分布曲线下的全部面积应等于总概率(即100%)。由残余误差表示的正态分布密度函数为有
在任意区间[a,b]出现的概率为由于标准差是正态分布的特征参数,误差区间通常表示成的倍数,如。由于正态分布的对称性特点,计算概率通常取成对称区间的概率,即t------置信系数P------置信概率7.1.2随机误差及其估算7.系统误差的处理系统误差的处理原则是找出系统误差产生的根源,然后采取相应的措施尽量减小或消除系统误差。分析系统误差的产生原因一般从以下五个方面着手:1)所用测量仪表或元件本身是否准确可靠;2)测量方法是否完善;3)传感器或仪表的安装、调整、放置等是否正确合理;4)测量仪表的工作环境条件是否符合规定条件;5)测量者的操作是否正确。准则检查法就是基于一定的准则来判断测量数据中是否含有系统误差。如:①马利科夫准则是将残余误差的前后各一半分成两个组,如果前、后两组残余误差的和明显不同,则可能含有线性系统误差。②阿贝准则是检查残余误差是否偏离正态分布,若偏离,则可能存在变化的系统误差。要绝对地消除系统误差是不可能的,但可以根据系统误差产生的原因和特点(如恒定系统误差、线性系统误差、周期性系统误差或其他复杂变化的系统误差),尽量减小或消除系统误差对测量结果准确性的影响。一般的措施包括:1)消除系统误差产生的根源在测量之前,仔细检查仪表,正确调整和安装;防止外界干扰的影响;选择好观测位置消除视差;选择环境条件较稳定时进行测量和读数。2)在测量系统中采用补偿措施找出系统误差的规律,然后选用适当的测量方法来消除系统误差。如对于恒定系统误差可选用标准量替代法、测量条件交换法、反向补偿法等;对于周期性系统误差可选用半周期偶数测量法(按系统误差变化的每半个周期测量一次,每个周期测量两次,取平均值)3)实时反馈修正当杳明某种误差因素的变化对测量结果有明显的影响时,可尽量找出其影响测量结果的函数关系或近似函数关系,然后按照这种函数关系对测量结果进行实时的自动修正。4)在测量结果中进行修正对于已知的系统误差,可以用修正值对测量结果进行修正;对于变值系统误差,设法找出误差的变化规律,用修正公式或修正曲线对测量结果进行修正;对未知的系统误差,则归人随机误差一起处理。7.1.2随机误差及其估算
7.1.2随机误差及其估算5.测量误差的合成和分配误差合成定义:误差合成是指将多个单项误差(如系统误差、随机误差等)按照一定规则进行综合,以得到总误差或综合误差的过程。代数和法:当各项误差相互独立且同向时,可以直接将各单项误差的绝对值相加来估算总误差。这种方法简单直观,但忽略了误差之间的相互影响。均方根法:当各项误差服从正态分布且相互独立时,可以采用均方根法来计算总误差。即先求出各单项误差的平方和,再取平方根作为总误差的估计值。这种方法考虑了误差的统计特性,更为准确。协方差矩阵法:对于复杂的测量系统,各单项误差之间可能存在相关性。此时,可以构建协方差矩阵来描述误差之间的相关关系,并通过矩阵运算来合成总误差。这种方法适用于高精度测量和复杂系统分析。误差分配定义:误差分配是指在设计实验或测量方案时,根据各环节的精度要求和成本等因素,合理地将允许的误差限分配给各个测量环节或设备的过程。等精度分配法:当各环节的重要性相当且没有特殊精度要求时,可以将允许的误差限等比例地分配给各个环节。这种方法简单易行,但可能不是最优的分配方式。加权分配法:根据各环节对最终结果的影响程度(权重),将允许的误差限按权重进行分配。权重越大的环节分配的误差限越小,以确保整体测量的准确性。这种方法需要事先确定各环节的权重系数。优化分配法:通过数学优化方法(如最小二乘法、遗传算法等),在满足总体误差要求的条件下,寻求最佳的误差分配方案。这种方法可以得到更优的分配结果,但需要较高的计算成本和专业知识支持。11仪表精度等级的确定依据引用误差,如0.5级表代表其引用误差最大为0.5%我国的仪表等级分为0.1、0.2、0.5、1.0、1.5、7.5和5.0共七个等级12例1:检定一台满量程Am=5A,精度等级为1.5的电流表,测得在7.0A处其绝对误差Δ=0.1A,请问该电流表是否合格?解:在没有修正值的情况下,通常认为在整个测量范围内各处的最大绝对误差是一个常数。因此,根据引用误差的定义可求得:由于7.0%>1.5%,因此,该电流表已不合格,但可做精度为7.5级表使用。方法二?13误差的表示(续)基本误差:仪表在规定的标准条件(即标定条件)下所具有的引用误差(用于标识仪表精度等级)附加误差:当仪表的使用条件偏离标准条件时出现的误差(如温度、压力、频率、电源电压波动附加误差等)14例:要测量一个约80V的电压量,现有两块电压表供选用,一块量程为300V,精度等级0.5;一块量程为100V,精度等级1.0。请问选用哪一块电压表更好?解:根据最大示值相对误差的定义式,先求最大相对误差。使用300V、0.5级表时:使用100V、1.0级表时:可见,选用100V、1.0级表测量该电压时具有更小的相对误差,精度更高。由题目数据还可知,使用该表可保证测量示值落在仪表满刻度的三分之二以上。157.5.2随机误差的处理随机误差的正态分布曲线单峰性:绝对值小的随机误差出现的概率大于绝对值大的随机误差出现的概率有界性:随机误差的绝对值是有限的对称性:随着测量次数的增加,绝对值相等、符号相反的随机误差的出现概率趋于相等抵偿性:在相同条件下,当测量次数趋于无穷大时,所有随机误差的代数和为016正态分布的随机误差的数字特征标准差反映了随机误差的分布范围。标准差愈大,测量数据的分散范围就愈大。17标准差反映了随机误差的分布范围。标准差愈大,测量数据的分布范围就愈大。右图显示了不同标准差下的正态分布曲线。由图可见:
标准差越小,分布曲线就越陡峭,说明随机变量的分散性小,接近真值
,即精度高。反之,标准差越大,分布曲线越平坦,随机变量的分散性就越大,即精度低。18残余误差与标准差的估计值实际测量时真值无法知道,常用残余误差:对应标准差的估计值:19正态分布的概率计算0.674511.9627.58340.50.68270.950.95450.990.99730.9999420测量结果的两种表示21
例:有一组(10个)测量值为237.4、237.2、237.9、237.1、238.1、237.5、237.4、237.6、237.6、237.4,求测量结果。因此,测量结果可表示为:227.5.3系统误差的处理从误差根源上消除系统误差系统误差:是由测量系统本身的缺陷或测量方法的不完善造成的,
使得测量值中含有固定不变或按一定规律变化的误差特点:系统误差不具有抵偿性,也不能通过重复测量来消除,因此在处理方法上与随机误差完全不同处理原则:找出系统误差产生的根源,然后采取相应的措施尽量减小或消除系统误差。分析系统误差的产生原因一般从以下5个方面着手:所用测量仪表或元件本身是否准确可靠测量方法是否完善传感器或仪表的安装、调整、放置等是否正确合理测量仪表的工作环境条件是否符合规定条件测量者的操作是否正确。如读数时的视差、视力疲劳等都会引起系统误差23系统误差的发现与判别实验对比法通过改变产生系统误差的条件从而进行不同条件下的测量,以发现系统误差适用于:发现固定的系统误差残余误差观察法是根据测量值的残余误差的大小和符号的变化规律来判断有无变化的系统误差准则检查法马利科夫准则:将残余误差的前后各一半分成两个组,如果前、后两组残余误差的和明显不同,则可能含有线性系统误差阿贝准则:是检查残余误差是否偏离正态分布,若偏离,则可能存在变化的系统误差。其做法是:将测量值的残余误差按测量顺序排列,并计算:24然后判断,若
,则可能存变化的系统误差。
25系统误差的消除要绝对地消除系统误差是不可能的消除系统误差产生的根源在测量系统中采用补偿措施实时反馈修正在测量结果中进行修正26粗大误差的处理准则拉依达(3σ)准则通常把3σ作为极限误差。如果一组测量数据中某个测量值的残余误差的绝对值时,则可认为该值含有粗大误差,应舍弃。等精度测量结果的处理287.7.1最小二乘法由于误差的存在,为了求得一组最佳的解,通常的做法是使测量次数n大于所求未知量的个数m,然后采用最小二乘法进行计算。最小二乘法是一类用于拟合实验曲线、确定经验公式(一般近似于多元线性关系)的数学方法,在对测量结果的误差处理中得到了广泛应用。最小二乘法在误差理论中的基本含义是:利用等精度多次测定值求最可靠测量结果时,该测量结果等于当各测定值的残余误差二次方和最小时所求得的值。也就是说,如果把所有测定值都标在坐标图上,测定值与用最小二乘法拟合得出的直线或曲线(统称拟合线)上对应的点之间的残余误差二次方和最小。最小二乘法相关概念7.7.1最小二乘法设直接测量量y与m个间接测量量
的函数关系为
现对y进行n次等精度测量得到n个测量值
,其对应的估计值为
,即有对应的残余误差方程组为所以最小二乘法原理要求的条件转化为最小二乘法基本处理方法7.3.1数据清洗数据清洗主要是删除原始数据集中的无关数据、重复数据、平滑噪声数据,筛选掉与挖掘主题无关的数据,处理缺失值、异常值等。处理缺失值的方法可分为三类:删除记录、数据插补和不处理。其中常用的数据插补方法如表1所示。插补方法方法描述均值/中位数/众数插补根据属性值的类型,用该属性取值的平均数/中位数/众数进行插补使用固定值将缺失的属性值用一个常量替换最近临插补在记录中找到与缺失样本最接近的样本的该属性值插补回归方法对带有缺失值的变量,根据已有数据和与其有关的其他变量(因变量)的数据建立拟合模型来预测缺失的属性值插值法插值法是利用已知点建立合适的插值函数,未知值由对应点求出近似的函数值来代替表1常用的数据插补方法7.3.1数据清洗在数据预处理时,异常值是否剔除,需视具体情况而定,因为有些异常值可能蕴含着有用的信息。异常值处理的常用方法如表2所示。表2异常值处理的常用方法异常值处理的常用方法方法描述删除含有异常值的记录直接将含有异常值的记录删除视为缺失值将异常值视为缺失值,利用缺失值处理的方法进行处理平均值修正可用前后两个观测值的平均值修正该异常值不处理直接在具有异常值的数据集上进行挖掘建模7.3.2数据变换1.简单的函数变换:对原始数据进行某些数学函数的变换,常用的包括平方、开方、取对数、差分运算等。7.规范化:数据标准化(归一化)处理是数据挖掘的一项基础工作。不同评价指标往往具有不同的量纲,数值间的差别可能很大,不进行处理可能会影响到数据分析的结果。为了消除指标之间的量纲和取值范围差异的影响,需要进行标准化处理,将数据按照比例进行缩放,使之落入一个特定的区域,便于进行综合分析。如将工资收人属性值映射到[-1,1]或者[0,1]内。数据规范化对于基于距离的挖掘算法尤为重要。数据规范化方式有多种,最小–最大规范化。其也称为离差标准化,是对原始数据的线性变换,将数值映射到[0,1]区间。3.连续属性离散化:一些数据挖掘算法,特别是某些分类算法如ID3算法、Apriori算法等,要求数据是分类属性形式。这样,常常需要将连续属性变换成分类属性,即连续属性离散化。常用的离散化方法有等宽法、等频法和(一维)聚类分析法,(1)等宽法将属性的值域分成具有相同宽度的区间,区间的个数由数据本身的特点决定或者用户指定,类似于制作频率分布表。(2)等频法将相同数量的记录放进每个区间。以上两种方法简单、易于操作,但都需要人为地规定划分区间的个数。同时,等宽法的缺点在于它对离群点比较敏感,倾向于不均匀地把属性值分布到各个区间。有些区间包含许多数据,而另外一些区间的数据极少,这样会严重损坏所建立的决策模型。等频法虽然避免了上述问题的产生,却可能将相同的数据值分到不同的区间以满足每个区间中固定的数据个数。(3)(一维)聚类分析法(一维)聚类分析法包括两个步骤,首先将连续属性的值用聚类算法(如K-Means算法)进行聚类,然后再将聚类得到的簇进行处理,合并到一个的连续属性值做同一标记。聚类分析的离散化方法也需要用户指定簇的个数,从而决定产生的区间数。4.属性构造:在数据挖掘的过程中,为了帮助提取更有用的信息、挖掘更深层次的模式,提高挖掘结果的精度,需要利用已有的属性集构造出新的属性,并加到现有的属性集合中。经验模态分解(EmpiricalModeDecomposition,EMD)是一种将非平稳时间序列数据进行多尺度分解的方法。经验模态分解(EMD)将原信号分解成一系列的本征模态函数(IMF)。该方法能够描述信号在不同模态下的变化趋势,具有良好的自适应性。经验模态分解算法对于数据信号细节特征趋势的提取具有独特优势。因此,EMD算法被广泛应用到信号处理和图像分析等领域。在实际应用中,经验模态分解的方法存在着模态混叠等问题。在对信号进行
多尺度分解的过程中,有可能将不同尺度下的信号特征成分分解到同一模态当中。为了解决这一问题,学者们提出了很多改进经验模态分解的方法。例如在经验模态分解方法的基础上,通过在信号分解过程中不断添加白噪声来解决模态混叠问题。EMD相关概念7.3.3经验模态分解EMD7.3.3相关检验算法相关检测是实现微弱信号检测的基本方法之一。所谓相关检测就是利用信号周期性和噪声随机性的特点,通过自相关或互相关函数值的计算,从噪声中检测出微弱信号的一种技术。相关检测分为自相关检测和互相关检测。自相关检测原理框架如图1所示。
图1自相关检测原理框图互相关检测原理框架如图2所示。
图2互相关检测原理框图7.3.3数据降维(PCA)PCA方法的主要目的就是寻找到一组正交基,它们是标准正交基的线性组合,因而能够最好地表示原数据集。这种方法能对原有的高维数据进行简化,有效地找出数据中最“主要”的元素和结构,去除噪声和冗余、将原有的复杂数据降维,将复杂数据背后的简单结构提取出来。PCA降维的基本步骤利用PCA算法进行数据降维可总结为以下主要步骤:1)特征值中心化,即每一维的数据都减去该维的均值。目的是使得变换之后的每一维的均值都为0;2)计算协方差矩阵;3)计算协方差矩阵的特征向量和特征值;4)将特征向量按照降序排列,并计算贡献率,即前个特征值之和/总特征值之和;5)取前个特征向量或贡献率大于阈值(如95%)的特征向量,构成变换矩阵;6)用原数据与变换矩阵T相乘,获得降维后的数据;7.4.1
软测量一切工业生产都希望获得合格的产品,产品质量控制是生产过程中所有控制的核心。为了实现良好的质量控制,就必须对与产品质量密切相关的重要过程变量进行严格控制。到目前为止,在实际生产过程中,存在着许多因为技术或经济原因无法通过传感器进行直接测量的过程变量,如精馏塔的产品组分浓度、生物发酵罐的菌体浓度、高炉铁水中的含硅量和化学反应器中反应物浓度、转化率、催化剂活性等,但为了保证产品质量,需要对这些过程变量进行实时控制和优化控制。传统的解决方法有两种:一是采用间接的质量指标控制,如精馏塔灵敏板温度控制、温差控制等,存在的问题是难以保证最终质量指标的控制精度;二是采用在线分析仪表控制,但设备投资大、维护成本高、存在较大的滞后性,影响调节效果。为了解决这类问题,软测量技术应运而生。所谓软测量,就是依据某种最优化准则,选择与被估计变量相关的一组可测变量(称为辅助变量),构造某种以可测变量为输人、被估计变量为输出的数学模型,通过计算机软件实现对无法直接测量的重要过程变量(称为主导变量)的估计。软测量是近年来检测和过程控制领域涌现出的一种新技术,为无法或难以用传感器直接检测变量的检测与控制提供了手段,对于生产自动化以及控制产品质量具有重要意义,是目前检测技术和过程控制研究发展的重
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 婚礼进行曲教学设计初中音乐人音版七年级下册-人音版
- 任务三 电动玩具我制作(教学设计)浙教版劳动技术三年级下册
- 人教部编版八年级下道德与法治1.1公民权利的保障书教学设计
- 户用储能机柜 LSFT 火烧预测试方案编制模板
- 山东省滕州市大坞镇大坞中学初中体育《快速跑》教案
- 新教材高中政治 第一单元 探索世界与把握规律 1.1 追求智慧的学问教案(2)部编版必修4
- 三、编辑素材教学设计初中信息技术沪科版八年级下册-沪科版
- 五年级英语下册 Unit 3 Writing Home Lesson 14 Jenny Writes a Postcard教案 冀教版(三起)
- 七年级地理下册 第七章 第四节 俄罗斯教案 (新版)新人教版
- 探索秸秆手工简易制作 教案-2023-2024学年高一上学期劳动技术
- 2026新教材人教版(2024)七年级上册英语全册教案
- 环境保护概论(上篇共上下2篇)
- 2025年种子检验员职业资格考试真题及答案
- 2026年河北省单招考试一类《文化素质数学》真题附答案详解
- 《物业设备设施管理(第2版)》-第一章
- 2026年法务合同管理部业务SOP执行检查表与交付一致性核验模板(含责任矩阵、异常闭环与填写示例)
- 航空航天材料及加工成形技术
- 网络与信息安全责任制及考核制度
- 2026年甘肃高考政治真题试卷+解析及答案
- 废旧家电回收协议合同
- 2026年国企单位笔试题库及答案
评论
0/150
提交评论