数据处理与分析_第1页
数据处理与分析_第2页
数据处理与分析_第3页
数据处理与分析_第4页
数据处理与分析_第5页
已阅读5页,还剩46页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、数据处理是将调查中收集的数据转换成适合汇总制表和数据分析的形式。在数据收集之后,估计在处理数据之前的所有活动:主要包括数据编码、输入、审计、插值、异常检测和处理等。最后,生成用于进一步分析的数据库。编码是为一个问题的每个答案分配一个数字代码的过程,以便于数据输入和进一步处理。有许多具体的编码方法,包括:问卷中的预编码;数据收集后手动编码;由文本识别软件自动编码(即通过软件给一串字符分配一个代码)。2)数据输入,即将答案转换成机器可读的形式。当采用基于纸张的数据收集方法时,数据输入是在数据收集完成之后进行的(通常是在对问卷进行一些“梳理”和初步检查之后)。采用计算机辅助数据采集方法时,数据录入是

2、在数据采集的同时完成的。以下方法可以提高数据录入的效率:计算机辅助数据采集方法;纸质问卷的光电扫描;对纸质问卷进行预编码。3.审核是应用各种检查规则来识别丢失、无效或不一致的条目,这将导致数据记录中的潜在错误。审核的目的是确保从调查中获得的最终数据的完整性、一致性和有效性(包括逻辑性)。审计可以分为三类:有效性审计、一致性审计和分布审计。有效性审计和一致性审计是对单一问卷的审计;分布式审计是将全部或部分问卷数据一起审计。一般而言,审计规则的确定基于以下几个方面:对调查对象的专业知识;问卷和问题的结构;其他相关调查或数据;统计理论(如离群点检测方法)。数据收集完成后,审核失败通常按以下方式处理:

3、(1)拒绝;进行插值;设置特殊代码。有时,一个记录(或整个调查问卷)不符合多个审核规则或几个关键审核规则的要求,这使得后续处理毫无意义。在这种情况下,由于没有答案,这些记录通常可以被删除,并且可以调整被调查的每个单元的权重。大多数审计失败应该标记为插值。对于某些项目,我们可以使用特殊代码来标记被确认为审计无效的不可接受的值或无效空白。选择性审计是基于这样的想法,即只有那些“关键”审计失败,但不是所有的审计都失败,因此需要采取相应的措施。选择性审计通常适用于定量数据。在审计失败的选择性审计中,除了需要进一步处理和插值的记录的审计失败之外,受访者可能需要重新访问。审计准则,审计目标是:-更好地理解

4、数据和数据处理过程;-检查问卷;-对受访者的回访;-检测错误或缺失的数据;-删除无效记录;-需要插入的单独记录。审计标准:审计不仅有助于整理数据,而且有助于检查失败率,这对衡量当前调查的质量和改进未来调查非常有用。它可以在调查中提供有关数据处理的信息;每当你开始一项调查,你总是要对数据做一些假设,你可以在审计期间检查这些假设的合理性。例如,很明显,某些领域的审计规则过于严格,或者某些类型的审计失败过于频繁,这表明审计规则可能不合适(或者问卷可能有问题);审核应分阶段进行;审计工作应由对本次调查的主题、问卷设计和数据分析具有专业知识并具有类似调查经验的人员进行;各阶段的审核不得与其他阶段的审核相

5、冲突;应告知数据用户经审计的信息以及审计工作对调查数据的影响。插值是解决审计过程中发现的数据缺失、无效和不一致等问题的过程。插值是对审计过程中发现的所有缺失信息的记录进行补充或替换,以确保内部记录的一致性。插值方法可分为两种:随机插值和确定性插值。确定性插值,对于研究中的特定数据,只有一个可能的插值值。随机插值包含随机因素,因此插值值每次都可能不同。几种确定性插值方法如下:-推理插值;-平均插值;-比率(比率)/回归插值;-顺序热平台插值;-顺序冷平台插值;-最近邻插值。每一种确定性插值方法都对应于一种随机插值方法。当插值定量数据时,插值通过确定性方法获得,并且来自适当分布或模型的残余误差被作

6、为最终插值,其变成随机插值。与确定性插值方法相比,随机插值能更好地保持数据集的频率结构,保持更真实的可变性。除了供应商插值方法外,以下方法可以逐项插值。所谓的供应商插值方法是使用供应商来插值接收方所有缺失或不一致的数据。4.1推断插值:缺失或不一致的数据可以通过推断来确定。通常,这种推理基于问卷中其他答案的模式。以下是一些常用的插值方法。对于所有这些插值方法,最好将类似的记录分组到一个组中,这称为插值类,就像调整未回答的权重一样。4.2均值内插,用均值内插,缺失或不一致的值可以用均值内插类代替。对于缺失数据,使用平均值插值相当于使用相同的未回答权重调整同一插值类中的所有受访者。均值插值可以得到

7、更好的点估计,但由于插值类均值形成的人工“峰”,破坏了分布状态与变量之间的关系。因此,如果使用传统的抽样方差公式进行计算,最终的方差将被低估。当没有辅助信息或只有少数记录需要插值时,通常采用平均插值。4.3比率(比率)或回归插值,使用辅助信息和其他记录中的有效答案建立比率或回归模型,显示两个或更多变量之间的关系。例如,用于比率插值的模型是:其中:yi是变量y的第I个单位值;Xi是与变量y相关的变量x的第I个单位值;r是直线的斜率(即每单位变化的平均值);是模型的随机误差项,平均值为0,方差为0。此时,的插值根据以下公式计算:其中:它是变量y的第I条记录的插值;是插值类中记录的x值的平均值;是插

8、值类中记录的y值的平均值。这里,我们假设适合内插类中有效数据的比率或回归模型(即,它已经通过了所有审核)也适用于该内插类中审核失败的数据。比率和回归估计产生的插值比简单平均法产生的插值更稳定。这种方法通常被用作商业调查中的定量变量,在商业调查中,以前的数据通常可以用来预测当前的数据。前向插值是比率插值或回归插值的一种特殊情况,仅直接使用前一次调查的数据作为当前调查缺失数据的插值4.4热平台内插,使用供应商在相同内插类别中记录的信息替换类似接收方记录中缺失或不一致的数据。为了找到与接收方记录相似的供应商记录,有必要确定与需要插值的变量相关的变量,并建立插值类。然后,插补类中通过所有审核的记录集就

9、是供应商记录集,用于插补接收方的缺失数据。热平台插值可用于插值定量数据和定性数据,但通常仅使用定性变量来建立插值类。样本号。性别,年龄,婚姻状况,收入:汽车有1个年轻男子未婚70,2个年轻男子结婚100,3个年轻女子未婚50,4个年轻男子结婚70,5个年轻男子未婚90,6个年轻女子丧偶30,7个年轻男子结婚-8个年轻女子离婚45,9个年轻男子结婚。未婚中老年人中没有10名妇女丧偶,20-11名青年男子未婚,50名青年男子在中老年人中结婚。插值情况:受助人的收入是7 70,4 9 90 5 10,6 12 70,4。在顺序热平台插值方法中,数据在插值类中按一定的顺序进行处理。插值就是用这个序列来

10、插值前一个数据。如果每次都使用相同的排序和选择方法,则顺序热平台方法是一种确定性插值方法。对于随机热平台插值,供应商是从插值类中随机选择的,因此这是一种随机插值方法。供应商插值方法的优点(仅限于热平台插值和最近邻插值)是因为类似的供应商(如公司和家庭等。)具有相似的特性,插值应该相当精确。使用供应商插值可以保持数据的原始分布形式。4.5冷平台插值与热平台插值相似,不同之处在于热平台插值使用当前调查的供应商,而冷平台插值使用其他数据中的供应商。冷平台插值通常使用以前调查或人口普查的历史数据。4.6最近邻插值、最近邻插值(如hot platform插值)也基于匹配变量选择供应商记录。然而,使用这种

11、方法,目的不一定是在匹配变量中找到与接收方记录完全相同的供应商记录,而是根据匹配变量在插值类中找到与接收方记录最接近的供应商记录,即找到最接近的值。“最近”由两个观察对象之间的距离定义,两个观察对象之间的距离由辅助数据计算。4.7随机内插:任何用于定量数据的确定性内插都会因添加随机残差而变得不确定。例如,我们可以使用平均值加上随机残差进行插值:其中Y变量的第I条记录的插值是多少;是插值类的平均值;是从被调查者身上提取的残差还是某种分布的随机模型。哪些值需要插值,以及由于没有答案或答案无效而检测到的审核无效记录通常需要插值。然而,并非所有审计失败的数据都需要插值。对于记录,要插入的项目应该尽可能

12、地有限。为了确定哪些字段需要内插,我们应该遵循以下三个标准:我们应该尽可能少地更改数据项(字段),以使每个记录满足审计规则的要求;尽可能保持数据文档的原始频率结构;插值规则的确定源自相应的审计规则,而不是参考任何其他特定的规则。例如,假设调查问卷中关于被调查者的背景信息是:教育水平(大学)、婚姻状况(已婚)、性别(女性)和年龄(10岁)。显然,在这份记录中,年龄-婚姻状况、年龄和教育水平不符合审计规则。为了纠正审计失败,我们可以同时调整婚姻状况和教育水平,或者我们可以只调整年龄,而一般倾向于采用后者。上述所有插值方法都可以为每个缺失或不一致的值生成一个插值,这些方法会在一定程度上扭曲插值变量的

13、原始分布,并导致使用标准方差估计公式进行不正确的方差估计。分布失真的程度很大程度上取决于插值的数量和所使用的插值方法。虽然插值可以提高最终数据的质量,但我们应该谨慎选择合适的插值方法。插值方法是否合适取决于类型、目的、可用的辅助信息和误差的性质。审计和估算带来的风险是,它们将销毁报告的数据,并产生符合预期模型的记录,这在以后可能会被证明是不正确的。以下是插值的几个标准:通过插值获得的记录应该与未被审计的记录非常相似。这通常可以通过插入尽可能少的变量和尽可能多的原始答案数据来实现。基本假设(在实际工作中并不总是如此)是,被调查者更有可能只犯一两次错误,但不太可能犯多次错误;良好的插补将为评估留下

14、线索,并确保插补记录的内部一致性。插值过程应该是自动的、客观的、可再现的和有效的。通过插值获得的记录应满足所有审计规则;-应标记插值,插值方法和用于插值的数据也应清晰标记。应保存记录中变量的插值和非插值,以评估插值的程度和影响;-仔细选择插值方法,考虑每种插值方法的优缺点和要插值的数据类型;插值方法应减少未回答的偏差,尽可能保持不同变量之间的关系(即不应破坏数据的多元结构);-插补系统应提前考虑、提出、编程和调试;-插值系统应该能够处理各种缺失或不一致的字段;-对于供应商插值方法,插值获得的记录应尽可能与选定的供应商相似。这有利于保证插值记录中插值和非插值的组合不仅符合审计规则,而且具有多样性

15、。5)异常检测和处理,异常检测可视为一种审计,主要用于发现和确认可疑记录。应区分极值和影响值。如果记录值和采样权重的组合对估计有很大的影响,我们将这种观察值称为影响值。但极值不一定是影响值。应区分单变量异常值和多变量异常值。如果一个异常值对应于一个变量,那么观察值就是一个单变量异常值。如果一个异常值对应于两个或多个变量,我们说观察值是一个多元异常值。例如,一个人的身高为2米或体重为45公斤,这可能并不罕见,但一个身高为2米、体重仅为45公斤的人就是一个多元异常值的例子。导致异常值的原因有很多:数据中有错误(例如,数据输入错误);异常值可能来自另一个模型或分布,例如,大多数数据服从正态分布,但假

16、定的异常值可能来自指数分布;异常值的出现可能是由于数据固有的可变性。看似可疑的可能仅仅是由于数据集固有的可变性。传统上,异常值是通过测量它们与数据中心的相对距离来识别的。让它成为观察到的样本数据。m和S分别是数据集趋势和离散趋势的度量。距数据中心的相对距离定义为:如果大于预定偏差值(如d=1.96,对应概率为95%,d=2.58,对应概率为99%),则观察值被视为异常值。异常值也可以通过以下允许的间隔来确认:这里,分别是预定的下限和上限的值。如果人口是倾斜的,总和就不相等。超出该区间的观测值被视为异常值。样本均值和样本方差是测量数据集中趋势和离散度最常用的统计量。然而,他们对异常值很敏感。由于上述原因,检测异常值最常用的方法之一是四分位法。在这种方法中,中值用于测量数据的集中趋势,四分位间距用于测量数据的分散程度,因为这些统计数据对异常值更加稳健(即不太敏感)。请注意,这里提到的中位数和四分位数是用加权样本数据计算的。分别称为下四分位数间距和上四分位数间距。允许的时间间隔可以如下获得:其中,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论