数据、模型与决策课件:第一章 关于数据的基本认识_第1页
数据、模型与决策课件:第一章 关于数据的基本认识_第2页
数据、模型与决策课件:第一章 关于数据的基本认识_第3页
数据、模型与决策课件:第一章 关于数据的基本认识_第4页
数据、模型与决策课件:第一章 关于数据的基本认识_第5页
已阅读5页,还剩64页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第一章关于数据的基本认识授课目的:关于数据统计基本知识的入门要求:了解数据的基本概念、分类、获取途径和方法本章要点了解数据的意义了解数据的分类了解数据的来源本章要点联系图数据决策构建模型一手和二手分层次和类别时空维度组织方式和获取途径第一节数据的意义、分类和来源数据、模型与决策的联系从管理学的角度说,决策可以表述为:为了达到某一预定目标,在掌握充分、必要的数据的前提下,本着一定的价值评判标准,运用逻辑和数学推理的方法,对几种可能采取的方案做出合理的选择。定性决策与定量决策对有些决策问题,决策者可以根据其经验和判别力做出决断,称之为定性决策。许多管理决策问题需要决策者从描述与决策目标有关联的事物

2、和现象状态、规模、变化趋势的数值出发,按照一定的思维方式和思维方法找出方案的评价值,再进行方案的选择。数据数据,就其词义而言,指进行各种统计、计算、科学研究和技术设计等所依据的数值。在本书中,“数据”作为集合名词出现,构成数据的单个数字称为“数值”。数据(续)数据是决策“所依据的数值”,在企业管理决策中,它们表现为各种资料:存在空间企业内部资料企业外部资料资料的特征数据型资料文字型资料时间属性往期资料当期资料预测资料资料的准确性对于决策是至关重要的,从虚假的数据出发,你很难做出正确的决策。It aint so much the things we dont know that get us i

3、n trouble. Its the things we know that aint so.By Artemus Ward办事不利非因无知,实因误知。美国幽默家亚特姆斯沃德模型模型,是真实事物的人为再现,是它所代表的真实世界中对应事物的概要复制。图解模型和数学模型图解模型以图画形式浓缩决策所投入的要素之间的关系。数学模型以数学公式刻画决策所投入的要素与决策评价值之间的关系。决策作为一个过程,以数据为投入,以对不同方案的选择为产出。模型是由数据到决断这一过程赖以通行所遵循的思维方式和思维方法。管理者在决策问题面前,有些投入是其能够控制的通常是管理者组织内部的状况,另有一些投入是管理者所不能控制

4、的通常是其组织外部的环境。这就使得决策有了确定型与不确定型和随机型之分。可控制投入、不可控制投入、模型和决策产出的关系图1.1决策模型流程构建决策模型是问题的核心。各种数学模型具体结构不同,但它们都是含有代表投入因素的变量(或常量)和代表产出结果的变量,并且按特定联系法则构成的数学表达式。建模就是抓住实际决策问题的主要环节,删繁就简,提炼出投入变量,确定它们与结果变量的数理关系,用数学表达式进行表述。一旦模型建成,即可投入已知数据,经运算得出结果,据其对方案做出选择。一手数据和二手数据从数据与决策者的关系看,有一手数据和二手数据之分。如果所用数据是专门为本决策行为生成的,即是一手数据,否则即为

5、二手数据。二手数据可以是企业内部数据,也可以是外部数据。前者存在于生产记录、销售记录、采购记录、订单、合同、计划书、会计账册、财务报表、客户名录等文件中。后者可以从政府公报、官方统计、各种组织的管理记录、商业调查报告、新闻媒体消息、会展信息等载体中获取。随着信息技术的开发和应用,以计算机和网络为媒介的二手数据得到迅猛发展,乃至有人说现在已经是“海量数据”时代。人们苦恼的不再是数据的缺乏,而是面对如此超大规模的数据如何从中提取与决策有用的信息。数据的层次、类别和时空维度欲研究数据,首先得了解其存在的方式,这就是所谓数据的层次、类别和时空存在问题。例1-1某企业生产特殊用途电台。因为产品批量小、品

6、种批次多,不适合高度自动化、大规模生产作业,故而采用半自动生产线组装生产,产品质量依靠各类高精度测试仪器设备保证。在实际生产中,电台整机装配合拢后进行逐台调试,以确保各项功能达到设计要求。为了提高质量管理水平,公司人事、工程技术部门在新品生产时,都要组织专题技术培训,内容涉及电子线路基础、关键技术原理,生产中可能遇到的技术问题等。例1-1(续)为了评价专题技术培训的效果,公司从300名接受过技术培训的调试工中选取20名进行测验,每人在规定时间内调试的100台,记录他们调试过的产品合格数目。此外,还将他们有关的个人背景一并考虑在内。把这诸多内容全都录入数据文件。.例题数据例1-1.xls在书中的

7、表1.1中,每名被抽中测试的工人占据一行,每项背景资料和合格产品数占据一列,构成矩阵。在电子表格和统计运算中,我们称每一行为一个个体。“性别”、“培训课时”和“合格产品数”等考察项目,具体落实到每一个体上,其文字或数值都不尽相同,因此称每一列为一个变量。把表1.1这样的“个体变量”的数据称为多变量数据(multi-variable data)。如果管理者只对20名受试者的生产记录进行录入,就形成1条数据。这20个生产记录录入数据文件,无论是按列还是按行录入,都是一个向量。相对于前面“个体变量”的多变量数据,我们可以把单纯由20个数目字组成的数据称为单变量数据(single-variable d

8、ata)。统计学首先集中对单变量数据进行研究,厘清有关基本概念和基本原理。在单变量数据研究的基础上,再开展多变量数据的研究。数据的层次和类别在20名调试工的合格产品数和背景资料这个多变量数据中,各列数据在性质上不尽相同。这些数据显然属于不同层次。如果一个变量只是作类别的划分,那么就称其为定名变量(nominal variable),所测度的数据称为定名数据。如果一个变量不仅可以作类别划分,还可以按强弱、大小排序,那么就称其为定秩变量(ordinal variable),所测度的数据称为定秩数据。如果一个变量不仅可以按强弱、大小、多少排序,还可以精确地测度其多少,那么就称其为定标变量(metri

9、c variable),所测度的数据称为定标数据。定名数据、定秩数据、定标数据依次强化对事物属性的测度。定名数据仅区分事物的类别,定秩数据能够区分事物属性程度的差异,定标数据以等距间隔测定事物属性的差异。定秩数据界于定名数据和定标数据之间,有的时候把定秩数据和定名数据视作同一类型数据,称为质别数据(qualitative data)。相对于质别数据的称谓,定标数据也可以称为量别数据(quantitative data)。在某些情况下,也可以按特定的分界点把定标数据切割成定距数据。按数值离散与否划分的数据离散型数据连续型数据凡其数值呈现为有限个整数的,是为离散型数据(discrete data)

10、。离散型数据在数轴上体现为有限个整数点,互相不接连。对于两个离散型数值,由于最小位数到个位,可以判断它们是否相等。凡其数值可以无限细分成小数的,是为连续型数据(continuous data)。连续型数据在数轴上体现为无限多的连续点,它们可以充满数轴的某个(些)区间。对于两个连续型数值,只可以按四舍五入原则保留至某个数位,然后判断其是否大致相等。定名数据和定距数据均可判定为离散型数据。而定标数据则需要分成两种情况:凡是可计数(be counted)的,如人数、台数、企业数等,都属于离散型数据;凡是须计量(be measured)的,如重量、长度、货币金额等,都属于连续型数据。图1.2 数据层次

11、与分类之间的对应关系按所属的时空维度划分的数据截面数据时间数据如果所研究的总体由许多不同的单位组成,采集的该总体中一些单位或全部单位在同一时间的个体数值,那么所得到的数据就称为截面数据 (cross-section data)。如果研究目的是观察了解某个事物随着时间推移而发展变化的情况,按时间顺序观测记录了该事物在不同时间的某个或某些指标数值,那么所得到的数据就称为时间序列数据 (time series data)。截面数据和时间数据利用截面数据可以分析推断总体中全部个体的平均水平以及各个个体相互之间差距的大小等问题。利用时间序列数据则可以分析推断事物发展变化的趋势和规律等问题。时间数列时间数

12、列按观察变量分为时期数列和时点数列。前者记录的是不同时期内的经济学流量;后者记录的是不同时点上的经济学存量。 时间数列时间数列按时间维度可以细分,经济管理数据通常为年度数列和月份(季度)数列。前者只考察一个较长时间内观测变量的变化状况,后者不仅考察一个较长时间内观测变量的变化状况,还考察此一较长时间内观测变量相同月份(季度)的变化状况。以上所说的时间数据的观测变量指数据采集的调查项目,它们的汇总结果按时间顺序排列即形成绝对数时间数列。如果对观测变量数据进一步计算,将生成计算结果按时间顺序排列,产生新的时间数列。在经济和商务数据分析中,为深入分析一些问题,有时还需要将截面数据按时间拼接起来,或者

13、将不同观测变量的时间数据拼接起来。如持续的商务调查(business research),每次都得到一套截面数据,由于这些数据采自纵向具有连续性的样本,并且其观测变量前后保持连续,就具备了拼接的基础。商务调查称这样的纵向具有连续性的样本为panel,译为固定样组,把这样拼接得到的数列称为panel data。而在计量经济分析中,把同一时间段的不同观察变量的数据拼接起来形成的数据也称为panel data。目前对于这个词有多种译法,以纯粹按表面意思译为“面板数列”为多。本书按音译加意译的原则,称为拼纳数列,即是说它们是拼接而成的,将不同空间或时间的数据容纳在一起,用来泛指两种拼接途径得到的pan

14、el data数列。第二节数据获取的组织方式、途径和方法数据获取的组织方式普查与抽样经济管理所关注的事物、现象一般包括若干个体。这些个体具有多种属性。如果许多个体在某一关键属性上的测定数据相同,它们就可以被看成是个体的集合。组成集合的个体在其他属性上或大或小存在着差异,至少是不尽相同。个体属性数据的集合,在统计学上称为总体(population),每个数据则相应地称为总体单位(population element)。总体单位的数目称为总体规模(population size),通常用N表示。总体规模如果无限大,它就是无限总体,否则就是有限总体。普查和抽样如果获取数据的行为及于总体的所有单位,这

15、种取数的组织方式称为普查(census)。从现场获取数据时,如果获取数据的行为只及于总体中的部分单位,这种取数的组织方式称为抽样(sampling)。抽样所及总体中的部分单位的集合称为样本(sample),这些单位即是样本单位(sample element)。样本所含单位的数目称为样本容量或样本量(sample size),通常用n表示。对于有限总体,从理论上说,既可以进行普查,也可以进行抽样调查。而对于无限总体,就只能进行抽样。抽样的具体组织方式很多,按样本产生过程是否遵循随机原则划分为随机抽样(random sampling)和非随机抽样(non-random sampling)两大类。随

16、机原则所谓随机原则,是根据概率原理,按一定法则和程式从总体中抽取一部分总体单位。在每一个总体单位被抽出来之前,总体中所有单位有同等被抽取的机会。因此,随机抽样又称为概率抽样,而非随机抽样又称为非概率抽样。随机原则(续)由于随机抽样的操作特点,使得样本对于总体有充分的代表性,从而可以依据对样本数据的统计描述推断总体的数量特征,而这种推断是建立在抽样概率分布理论基础上的,确保其推断的科学性。非随机抽样调查结果尽管也具有认识总体数量特征的作用,但是不宜进行统计推断。判断抽样判断抽样( judgement sampling)是按照一定的标准有意识地在总体中选择若干合乎标准的代表单位组成样本进行调查。代

17、表单位的选取标准因统计研究的目的而异。判断抽样的调查结果也是用来说明总体,或作为总体的代表,但是其代表性如何,则取决于代表单位的选取是否合适。方便抽样随机抽样和判断抽样都需要在抽样前对总体的结构和总体单位的分布状况有个大致的了解,以便建立随机选取或根据主观判断选取样本的基础。如果不具备这种前提条件,或者在实际操作中存在困难,就只能随意地抽取总体单位,即是事先不规定被抽选的单位,在现场碰到哪个就调查哪个,这就是方便抽样(convenient sampling)。方便抽样的代表性不高,但是简便易行。数据的获取途径和方法获取数据的三个途径:调查、实验和模拟调查(survey)实验(experimen

18、t)模拟(simulation)从数据获取途径和数据获取的组织方式的关系看,调查既可以做普查,也可以做抽样;实验只能是抽样;模拟究其实质也是抽样。调查、实验和模拟调查和实验都是从事物存在、现象发生的现场获取数据,其根本区别在于,调查不对现场行为加以干预,而实验有计划、有选择地对现场行为施加影响。模拟不是从事物存在、现象发生的现场获取数据,而是依据一定的基本数据使用计算机产生大量的随机数据,帮助进行决策。获取现场数据的方法:观察法观察法是最基本的获取现场数据的方法,在自然研究和工程上最为常用。属于调查的例如观察水文气象,记录相应数据。属于实验的例如给白鼠注射药物,观察并记录其表现。社会经济管理研

19、究中也使用观察法获取数据,如观测路口的交通流量,观察顾客在商场的购买行为。获取现场数据的方法:交流法社会经济管理研究中也使用观察法获取数据,社会经济管理研究大量使用的获取数据的方法是交流法,即由调查者提出问题,由被调查者回答。交流法的优点在于,除可以获取关于现场正在发生的现象的数据外,还可以获取以前发生的事情的数据,即将发生的事情的数据和有关评价性、意向性的数据。实验设计原则实验设计所应遵循的原则是:对照原则(principle of comparison)齐同原则(principle of homogeneity)随机原则 (principle of randomness)对照原则所谓对照原则,指的是实验因素作用的辨别和测定只有在不同情况的对照中才能实现。没有对照,就不会有比较和鉴别。在设计实验时,除设置受试组外,还必须设置对照组。对照的方式有配伍对比和自身对比。配伍对比的对照组是受试组的平行组,自身对照的对照组是受试组在受试前的状态。齐同原则所谓齐同原则,指在实验中所相互比较的各组之间,除实验因素作有计划的变动外,其他因素要尽可能相对固定。只有这样,才能显示实验因素的作用。随机原则所谓随机原则,就是确保总体中每一个单位都有被选取的同等机会。对于一个总体,准备把它分成若干配伍组,哪一个总体单位被分配到哪一

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论