已阅读5页,还剩44页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
宏观经济分析与政策模拟讨论班,中国工业企业数据库与Stata简介,1、中国工业企业数据库介绍2、数据格式转换Stat-Transfer软件介绍3、Stata12介绍4、Stata操作实例,主要内容,1.数据库介绍,中国工业企业数据库来源于国家统计局。数据库的统计对象为规模以上工业企业,包括全部国有工业企业和年主营业务收入500万元及以上的非国有工业企业,与中国统计年鉴的工业部分和中国工业统计年鉴的覆盖范围一致。区别是工业企业数据库是企业层面的原始数据,而“年鉴”是按不同维度得到的加总数据。,截止2011年,数据库共收录了58万多家工业企业,占中国工业总产值的95%左右,覆盖了中国工业40多个大类、90多个中类、600多个小类,每个企业提供超过上百个变量,是目前国内最为全面和权威的企业层面数据。该数据库是我国经济学和管理学研究领域的重要资料,利用该数据库已有很多学者做出了非常有价值的研究成果。受数据取得难度的限制,拥有该数据库的研究机构在国内还并不多,因此该数据库在研究领域有广阔的应用前景。,1.数据库介绍,1.数据库介绍,数据库里的企业用“法人代码”(FRDM)作为标志。数据库覆盖的企业不会一成不变,每年都有新增企业和减少企业,绝大部分企业的资料是连续的。尽管原则上每个企业的法人代码不会改变,在极少数情况下,企业会改换企业名称或法人代码。数据库从1995年开始,最近更新到2011年。,1.数据库介绍,数据库对每个企业给出两类信息,一是企业经营成果有关的信息,包括资金流量表、资产负债表和损益表的主要信息,以及雇用员工和生产活动信息;二是对企业身份、生产经营活动内容和状态进行定性描述的信息,以代码的形式出现,在使用时需要使用参照代码表。,2.Stat-Transfer介绍,Transfer软件专用于转换不同格式的数据文件,Access数据通过Transfer软件可转换为Stata格式的数据。(1)数据转换(Transfer)选项卡(2)变量选择(Variables)选项卡(3)记录选择(Observations)选项卡(4)其他选项(Option)选项卡,在Transfer这个界面上,通过几个下拉式菜单,选择需要转换数据库的源文件和目标文件的类型、名称,点击转换(Transfer)就可实现数据间的简单转换。软件支持的数据类型包括我们常用的SAS、SPSS、STATA、S-Plus、Excel、EpiInfo等等。如果在转换数据时,只对其中的一部分观察值感兴趣,可以利用“变量选择”或者“记录选择”,进行部分数据转换。,2.Stat-Transfer介绍,在变量选择上,可选择全部变量,亦可选择部分变量,同时还可在转换中重新设置变量输出的数据类型,如浮点型(float),日期型(date),时间型(time),字符型(string)等。软件还支持优化(Optimize)功能;UseDoubles选项在转换时可将有小数位的变量设置成双精度型(double),保证数据的精度;DropConstants选项,则自动将变量值恒为常数或缺失值的变量略去,这在数据繁多时特别能体现出其优越性。,2.Stat-Transfer介绍,在记录选择上,可选择全部记录,亦可选择部分记录。这一部分的记录选取,用户可以通过条件限定来实现。如:要求Variable1的值大于300或者Variable2的值为偶数,在选项卡的文本框中输入相应的约束条件:whereVariable1300,或者whereVariable2%2=0。还可以利用软件自带的函数来实现一些较复杂的数据选取,例如,按20%比例进行简单随机抽样(wheresamp_rand(0.2),按10%比例进行系统抽样(间隔抽样)(wheresamp_syst(10)。,2.Stat-Transfer介绍,Transfer软件还提供了一些其它的功能,如在转换过程中更换变量名,自动运行变量输出类型的优化功能,设置日期时间型数据的读写格式,对缺失值的各种处理方式的设定,随机种子的产生或设定,设置文本格式文件的读取格式,Excel工作簿中工作表的选取,覆盖文件前确认提示等其它功能。,2.Stat-Transfer介绍,3.Stata12介绍,Stata软件是现今较为流行的统计计量分析软件,具有强大的数据处理和分析功能,且操作简单、使用灵活、易学易用、运行速度极快。Stata的另一个特点是它的许多高级统计模块均是编程人员用宏语言写成的程序文件(ADO文件),这些文件可以自行修改、添加和下载。安装好Stata后,点击电脑桌面上的Stata图标,即可打开Stata。此时可以看到,在最上方有一排菜单,即“FileEditDataGraphicsStatisticsUserWindowHelp”。在此之下,有五个窗口,分别为:,左上“Review”(历史窗口):记录着自启动Stata以来的命令。右上“Variables”(变量窗口):记录着Stata内存中的所有变量。右下“Properties”(性质窗口):显示当前数据文件与变量的性质中上“Results”(结果窗口):显示执行Stata命令后的输出结果。中下“Command”(命令窗口):在此窗口输入Stata命令。,3.寻求帮助与网络资源,通过多种途径可以获得Stata的帮助,主要的途径有三个:手册、Stata自带帮助和网络帮助。Stata手册是一本学习Stata使用的权威书籍,它按字母顺序排列出了Stata所有相关的命令。Stata的自带帮助系统是使用最方便,也是最常用的方法,我们可以在记住极少量基本命令的基础上,方便地运用Stata命令。,3.help和search,Stata自带帮助系统:help显示出Stata所有帮助内容的目录结构。比如想了解regress的用法,可在StataCommand中输入如下语句:helpregressStata会提供关于regress用法的详细说明,并配以例子。,3.help和search,网络帮助可以采用如下命令获得finditscat3searchscat3这两条命令等价,均为寻找绘三维立体图的命令scat3。由于scat3不是Stata内置命令,所以需要通过这两个命令搜索并下载安装后才能使用。区别:help用于查找精确的命令名,search是模糊查找,findit与search命令类似,但其可以进一步搜索网络上的信息。,3.几个主要的网站,(1)STATA公司官方网站(2)STATA资源链接,4、Stata操作与实例,4.1Stata的日志4.2do文件4.3数据导入4.4变量的生成与处理4.5数据的合并4.6数据类型转换4.7描述统计4.8画图4.9回归分析,4.1Stata的日志,log文件以后缀“.log”表示,用于记录Stata的运行结果。可点击菜单“File”“Log”“Begin”,然后输入日志(log)的文件名,并存储在指定的位置。此后,在Stata中的所有操作及其输出结果,都将被记录在此日志中,直至选择退出。如果要暂时关闭日志(不再记录输出结果),输入命令“logoff”。如果要恢复使用日志,输入命令“logon”。如果要彻底退出日志,输入命令“logclose”。如果要查看日志文件中的内容,点击存储位置上的日志文件图标即可。,4.1Stata的日志,例:(开始运行)logusingD:Econometricslogfiles20150510.log.(Stata命令).logclose(结束运行)从而20150510.log就记录了从“logusing”命令到“logclose”命令之间Stata运行的所有结果。,4.2do文件,用Stata的do文件编辑器记下做过的工作:在Stata窗口上部的工具栏中有一个小按钮,把鼠标放上去会出现“NewDo-fileEditor”,点击它就会出现do文件编辑器。在do-file文件中,用*表示注释内容,Stata在运行do-file文件时会跳过这些注释语句。,4.3将数据导入Stata,打开Stata软件后,点击DataDataEditor图标,即可打开一个类似Excel的空白表格。然后,用Excel打开文件,复制文件中的相关数据,并粘贴到DataEditor中。导入数据的另一方法是,点击菜单“File”“Import”,然后导入各种格式的数据。Stata默认的数据文件扩展名为.dta,打开stata内置的auto.dta数据库,命令:useauto注意:Stata中字母的大小写是严格区分的,因此Stata建议对于变量名一律使用小写字母。,4.3将数据导入Stata,use命令的基本语句,具体格式如下:usevarlistifinusingfilename,clearnolabel含义说明:use是打开数据的命令语句,varlist代表变量名称,if是条件语句,in是范围语句,usingfilename代表数据文件路径。(1)打开数据文件中的全部数据如果想要打开auto数据文件中的全部数据,输入命令:useautoauto.dta美国汽车产业的横截面数据(1978年),变量主要包括:price=汽车的价格,mpg=每加仑油所行驶的英里数,weight=汽车的重量,foreign表示是否是进口车,如果foreign=0代表是国产车,如果foreign=1代表是进口车。,4.3将数据导入Stata,(2)打开数据文件中的部分变量有时,并不需要将数据文件中的所有变量全部打开,因为原始数据内容丰富,含有很多变量,而研究可能只涉及其中的几个变量。所以若只打开auto文件中的make和price这两个变量,应该使用如下命令:usemakepriceusingautousemakeprice部分表示需要打开make和price两个变量,usingauto部分表示打开的数据文件路径及名称。,4.4变量生成与处理,(1)生成新变量命令格式:generatenewvar=expifexpinrange含义说明:newvar是生成的新变量,exp是由现有变量生成新变量的算术或逻辑表达式,ifexp和inrange指定对哪些观测计算新变量值。比如:gena=f314*f314(新变量a等于f314的平方)genF=f314/v210变量含义:f314固定资产净值年平均余额v210从业人员平均人数,4.4变量生成与处理,(2)对现有变量重新赋值命令格式:replaceoldvar=expifexpinrange含义说明:oldvar为现有的变量。对满足ifexp和inrange的样本,oldvar将根据表达式exp重新赋值。比如:replacev211=.ifv211=0(若工业增加值非正,令其取缺失值)replacev211=25in10(令第10个观测中v211为25)gen和replaceif常常在一起使用,4.4变量生成与处理,(3)改变变量名命令格式:renameoldvarnewvar含义说明:oldvar是原变量名,newvar是新变量名。(4)删除变量或观测dropvarlist(去掉varlist指定的变量)drop_all(去掉全部变量)dropifexp(去掉符合表达式exp的观测)dropinrange(去掉处在range指定范围内的观测),4.4变量生成与处理,(5)保留变量或观测keepvarlist(保留varlist指定的变量,其余变量去掉)keepifexp(保留符合表达式exp的观测,其余观测去掉)keepinrange(保留处在range指定范围内的观测)(6)观测排序命令格式:sortvarlistin,stable含义说明:将全部观测按指定的变量按升序排列。varlist中可以有不止一个变量。比如:sortB07v209(先将变量B07进行排序,再在同一个B07的范围内对v209从小到大进行排序),4.4变量生成与处理,(7)生成虚拟变量方法1:genvarname1if(取值为一的限制条件)replacevarname0if(取值为零的限制条件)方法2:基于类别变量生成虚拟变量命令:taboldvar,gen(newvar)比如:tabb05,gen(b05dum)b05省地县码虚拟变量的数目因已知变量的分类而异。若现存变量有两个取值,则生成两个虚拟变量。,方法3:Stata提供的xi命令能很方便地实现对类别变量生成虚拟变量。xi命令最基本的用法:xi,prefix(string)i.varnamevarname是某一分类变量,设其共有K个可能的取值;string是prefix()指定的前缀。上述指令生成了K-1个虚拟变量:stringvarname_2,stringvarname_3,stringvarname_K。其中stringvarname表示字符串string和varname的联合。如果不使用,prefix(string)选项,则默认的前缀是_I。比如:xi,prefix(_T)i.b05,4.4变量生成与处理,4.5数据的合并,数据文件的合并涉及两个数据文件:在memory中的和不在memory中的。称前者为原数据文件(themasterdata),后者为新数据文件(theusingdata)。数据文件的合并有两种情形。若新数据文件与原数据文件的变量完全一样,此时新数据文件相当于新的观测,使用append命令:appendusingfilename其中filename是新数据文件的文件名。,4.5数据的合并,若新数据文件与原数据文件对应着同样的观测,但变量不全一样,则使用merge命令:merge1:1varlistusingfilename其中filename是新数据文件的文件名,varlist是合并的依据,varlist(可以不止一个变量)取值一样的观测视为同一个观测。在合并之前,原数据文件和新数据文件都要先按照varlist排序。如果除了varlist外,原数据文件和新数据文件还有一部分变量是相同的。对这部分变量,merge命令有两个常用的选项。,4.5数据的合并,merge1:1varlistusingfilename,update将原数据文件中的缺失值替换成新数据文件中的相应值(前提是后者不缺失)。merge1:1varlistusingfilename,updatereplace将原数据文件中的变量值替换成新数据文件中的相应值(前提是两者不一样)。在这两种情形下,merge自动生成一个指示变量_merge。该变量的不同取值,代表了合并的不同情形。但一般会连续进行几次merge操作,所以在完成一次merge后应马上使用drop_merge指令将其去掉。,4.6变量类型转换,Stata通常把变量划分为三类:数值型,字符型和日期型字符型变量之间不能进行数值计算,所以如果对字符型变量进行数值计算,Stata则会提醒出现系统错误,这时必须将字符型变量转化成数值型变量,才能进行正确的计算。字符型变量转化成数值型变量命令:destringvarlist,generate(newvarlist)|replaceoptions这个命令语句中,varlist是进行数据转化的变量名称,generate(newvarlist)|replace表示生成新的变量或者替换原来的变量,options的具体内容如表2.3所示。,4.6变量类型转换,比如:destringb10,gen(B10)ignore(“”)destringb10,gen(B10)force数值型变量转化为字符型变量:tostringvarlist,generate(newvarlist)|replaceoptions,4.7描述统计,describe命令可以描述数据文件的整体,包括观测总数,变量总数,生成日期,每个变量的存储类型,标签(label)等。如果数据文件不是很大,可以直接在StataResults中显示数据,使用如下命令:listvarlistifin,options其中,varlist是变量列表(即多个变量,如变量1、变量2直至变量n),此处命令置于方括号中,说明变量列表可有可无。如果varlist省略,则默认命令作用的对象为数据库中所有变量。if和in均为可选条件。最后的options为可选项,在写命令时要置于逗号后。,4.7描述统计,summarize命令:summarizevarlistweightifin,detailsummarize可以提供varlist指定变量(可以不止一个)的如下统计量:Percentiles(分位数),Largest(四个最大的数),Smallest(四个最小的数),Mean(均值),Variance(方差),Std.Dev.(标准差),Skewness(偏度),Kurtosis(峰度).比如:sumpgweightifforeign=1,4.7描述统计,tabstat命令tabstatvarlistweightifin,stats(statname.)tabstat提供,stats(statname.)指定的统计量,可供选择的有mean,count(非缺失观测值个数),sum,max,min,range(最大值最小值),sd,var,cv(变易系数),skewness(偏度),kurtosis(峰度),median(中位数),p1(1分位数,类似地有p5,p25,p50,p75,p95。比如,想知道变量price在整个样本的均值和方差,可使用如下命令:tabstatprice,stats(meanvar),4.8画图,(1)Stata提供了非常强大的画图功能。画图与描述统计一样,都是要揭示单个变量的分布或多个变量之间的关系,只是以图形的形式更为直观。在具体画图时,可以参看Stata的GraphicsReferenceManual或使用helpgraph指令。(2)对单个变量,Stata能画如下图案:直方图histogramy(y是变量名,下同)箱线图graphboxy圆形图(饼图)graphpiey核密度函数kdensityyQQ图qnormy,(3)两个变量的散点图graphtwowayscatteryx(y对x的散点图)graphtwowaylineyx(以x为横座标,y为纵座标的点连成的折线)graphtwowayconnectedyx(以x为横座标,y为纵座标的点连成折线,但转角处特别标出)graphtwowaylfityx(y对x回归的回归直线),4.8画图,(4)一个变量的总体统计量对另一个变量(一般为分类变量)的条形图graphbar(mean)y,over(x)(y的平均值与x的关系)graphbar(median)y,over(x)(y的中位数与x的关系)(5)多个变量的散点图graphmatrixx1x2x3x4y(x1,x2,x3,x4,y两两之间的散点图),4.8画图,4.8画图,有一些通用的选项可以给图形“润色”:标题title(“string”)(string可为任意的字符串,下同)脚注note(“string”)横座标标题xtitle(“string”)纵座标标题ytitle(“string”)横座标范围xaxis(a,b)(ab为两个数字,下同)纵座标范围yaxis(a,b)插入文字text(该命令既要指定插入文字的内容,也要指定插入的位置)插入图例legend(该命令既要指定图例的内容,也要指定其位置),kdensity:绘制核密度图,命令格式:kdensityvarnameinif,options含义说明:此命令用于绘制某一变量的核密度图,即观察数据分布情况。此图横坐标为变量,纵坐标为频率,面积为累计频率。比如:kdensityprice,ytitle(“核密度”)xtitle(“价格”)twokdensitypriceifforeign=1|kdensitypriceifforeig
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- GB/T 47788-2026纺织品纺织材料加速水解及水解产物在受控堆肥条件下生物降解的试验方法
- 安全生产三莫忘原则讲解
- 医院健康电台台词
- 道路消防安全工作部署
- 纤维调施胶干燥工岗前班组考核考核试卷含答案
- 己二酸装置操作工操作规程评优考核试卷含答案
- 水供应输排工安全意识模拟考核试卷含答案
- 电力机车钳工安全行为水平考核试卷含答案
- 地震勘探工安全行为竞赛考核试卷含答案
- 中药油剂工岗中评优竞赛考核试卷含答案
- 中国制造业AI场景落地之FDE路径研究白皮书2026
- 2026年甘肃庆阳宁县直事业单位选聘24人笔试参考题库及答案详解
- 四川能投发展股份有限公司所属公司2026年员工公开招聘笔试备考试题及答案详解
- 广西玉林兴业县2026年警务辅助人员招聘考试试卷-含答案解析
- 2026年江苏职业卫生技术服务专业技术人员考试(放射卫生检测与评价)模拟题及答案
- 2026-2030中国工程爆破行业十四五发展分析及投资前景与战略规划研究报告
- 24J113-1 内隔墙-轻质条板(一)
- 2023年高考历史试题及参考答案(上海卷)
- 生产计划排产表-自动排产
- GA/T 744-2013汽车车窗玻璃遮阳膜
- 大田作物营养特性和施肥技术专家讲座
评论
0/150
提交评论