《数据采集与处理》课件-4.静态数据处理技术_第1页
《数据采集与处理》课件-4.静态数据处理技术_第2页
《数据采集与处理》课件-4.静态数据处理技术_第3页
《数据采集与处理》课件-4.静态数据处理技术_第4页
《数据采集与处理》课件-4.静态数据处理技术_第5页
已阅读5页,还剩156页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

项目四静态数据处理技术任务1常用Excel数据处理技术概述任务导入:某电商公司2023年一季度销售部门按销售渠道统计了不同平台人员的销售情况(见表4-1-1),公司领导层相对一季度情况进行分析,提出排名要求,请你帮忙解决一下。某电商公司2023年一季度销售情况任务要求:请对名单中的员工按销售额大小进行排序。一、认识Excel公式与函数Excel公式通常由“等号”、“运算符”、“单元格引用”、“函数”、“数据常量”等组成,下面列举了一些常见的公式(见表4-1-2)。(一)认识公式一、认识Excel公式与函数使用公式进行计算时,可能会因为某种原因而无法得到或显示正确结果,在单元格中返回错误值信息,如表4-1-2所示。(一)常见的公式方法1.公式编辑一、认识Excel公式与函数相对引用:当复制公式到其他单元格时,Excel保持从属单元格与引用单元格的相对位置不变,称为相对引用。(一)常见的公式方法2.单元格的引用绝对引用:当复制公式到其他单元格时,Excel保持公式所引用的单元格绝对位置不变,称为绝对引用。混合引用:当复制公式到其他单元格时,Excel仅保持所引用单元格的行或列方向之一的绝对位置不变,而另一方向位置发生变化,这种引用方式称为混合引用,可分为行绝对列相对引用和行相对列绝对引用。一、认识Excel公式与函数在公式中使用函数时,通常由表示公式开始的“=”号、函数名称、左括号、以半角逗号相间隔的参数和右括号构成。有的函数可以允许多个参数,有的函数没有参数或可以不需要参数。函数的参数,可以由数值、日期和文本等元素组成,可以使用常量、数组、单元格引用或其他函数。当使用函数作为另一个函数的参数时,称为函数的嵌套。(一)常见的公式方法3.认识函数二、常用函数介绍(一)常见数学函数1.SUM函数参数的范围是1-30个若参数均为数值,则直接返回计算结果,如SUM(10,20),将返回”30”;若参数中包含文本数字和逻辑值,则会将文本数字判断为对应的数值,将逻辑值TRUE判断为”1”,如SUM(10,20,TRUE)将返回”31”。若参数为引用的单元格或单元格区域的地址,则只计算单元格或单元格区域中为数字的参数,其他如空白单元格、文本、逻辑值或错误值都将被忽略。二、常用函数介绍(一)常见数学函数SUMIF函数用于根据指定条件对若干单元格求和。其语法格式为:=SUMIF(range,criteria,[sum_range])Range为条件区域,用于条件判断的单元格区域;Criteria是求和条件,由数字、逻辑表达式等组成的判定条件;Sum_range为实际求和区域,需要求和的单元格、区域或引用。当省略第三个参数时,则条件区域就是实际求和区域。criteria

参数中使用通配符(包括问号(?)和星号(*))。问号匹配任意单个字符;星号匹配任意一串字符。如果要查找实际的问号或星号,请在该字符前键入波形符(~)。2.SUMIF函数二、常用函数介绍(一)常见数学函数RAND函数是Excel中产生随机数的一个随机函数。返回大于等于0及小于1的均匀分布随机数。每次计算工作表时都会返回一个新的随机实数。公式“=RAND()”,表示“介于0到1之间的一个随机数(变量)”;公式“=RAND()*100”,表示“大于等于0但小于100的一个随机数(变量)”3.RAND函数二、常用函数介绍(二)常见统计函数COUNTIF函数用于求满足给定条件的数据计数。语法格式为=COUNTIF(range,criteria)练习:使用COUNTIF函数统计成绩大于90分的人数。1.COUNTIF函数二、常用函数介绍(二)常见统计函数MAX函数用于返回一组值中的最大值。参数可以是数字或者是包含数字的名称、数组或引用;逻辑值和直接键入到参数列表中代表数字的文本被计算在内;如果参数是一个数组或引用,则只使用其中的数字。数组或引用中的空白单元格、逻辑值或文本将被忽略;如果参数不包含任何数字,则MAX返回0;如果参数为错误值或为不能转换为数字的文本,将会导致错误;2.MAX函数二、常用函数介绍(二)常见统计函数MIN函数用于返回一组值中的最小值。具体用法与MAX函数类似。3.MIN函数二、常用函数介绍(二)常见统计函数RANK函数用于返回一个数值在一组数值中的排位,数字的排名是其相对于列表中其他值的大小。语法格式为:=RANK(number,ref,[order])number必填,表示要查找排名的数字;ref必填,表示需要查找的数字列表;order可选,表示指定排名方式的数字,省略或为0时表示降序,非0表示升序。4.RANK函数二、常用函数介绍(二)常见统计函数例如对上个案例成绩进行名词显示,可以用=RANK(A1,$A$1:$A$8)尝试,如图4-1-7所示,请大家解释一下该函数。4.RANK函数三、审核和检查追踪单元格作用是跟踪选定单元格内公式的引用或从属单元格。分为:追踪引用单元格和追踪从属单元格。(一)追踪引用单元格追踪引用单元格用于指示哪些单元格会影响当前所选单元格的值。方法:选择单元格,在“公式”选项卡中单击“追踪引用单元格”按钮,即可出现蓝色箭头,指明当前所选单元格引用了哪些单元格。此外,选择单元格,按【Ctrl+[】组合键,可以定位到所选单元格的引用单元格。三、审核和检查(二)追踪从属单元格追踪从属单元格用于指示哪些单元格受当前所选单元格的影响。方法:选择单元格,单击“追踪从属单元格”按钮,蓝色箭头指向受当前所选单元格影响的单元格。此外,选择单元格,按【Ctrl+]】组合键,可以定位到所选单元格的从属单元格。三、审核和检查当输入完公式并结束编辑后,并未得到计算结果而是显示公式本身?以下是两种可能的原因和解决方法。1.检查是否启用了“显示公式”模式如果用户在“公式”选项卡中单击“显示公式”按钮,则会将表格中的公式显示出来。解决方法:在“公式”选项卡中再次单击“显示公式”按钮,取消其选中状态。三、审核和检查当输入完公式并结束编辑后,并未得到计算结果而是显示公式本身?以下是两种可能的原因和解决方法。2.检查是否单元格设置了“文本”格式如果未开启“显示公式”模式,单元格中仍然是显示公式本身而不是计算结果,则可能是由于单元格设置了“文本”格式后再输入公式。解决方法:选择公式所在单元格,按【Ctrl+1】组合键,打开“设置单元格格式”对话框,在“数字”选项卡中选择“常规”选项,单击“确定”按钮,重新激活单元格中的公式,并结束编辑。三、审核和检查当公式的结果返回错误值时,应该及时查找错误原因,并修改公式以解决问题。解决方法:Excel提供了后台检查错误的功能,用户只需要单击“文件”按钮,选择“选项”选项,打开“Excel选项”对话框,选择“公式”选项卡,在“错误检查”区域勾选“允许后台错误检查”复选框,并在“错误检查规则”区域勾选相应的规则选项即可。当单元格中的公式或值出现与“错误检查规则”选项中相符的情况时,单元格左上角会显示绿色小三角。选择该单元格,在其左侧会出现感叹号形状的“错误指示器”。单击“错误指示器”下拉按钮,在列表中可以查看公式错误的原因,列表中第一个选项表示错误原因。当表格中出现错误值时,用户可以使用“错误检查”功能,手动检查错误公式。三、审核和检查请大家完成课程导入中的任务。任务要求:请对名单中的员工按销售额大小进行排序。任务2总量指标处理任务导入:某地区2020-2022年进出口总额数据(亿元)如表4-2-1所示:表4-2-1某地区2020-2022年进出口总额任务要求:1.指出上表中哪些属于总量指标?这些总量指标说明了什么问题?2.总量指标的计量单位是什么?一、总量指标的概念及作用总量指标:是反映数据采集对象在一定的时间、地点条件下的总规模和总水平的指标。总量指标一般表示现象总量,其表现形式是绝对数。总量指标的数值大小与所研究的总体范围大小有关,总体范围越大,总量指标一般也越大,反之则越小。(一)概念一、总量指标的概念及作用1.总量指标能反映某部门、单位等人、财、物的基本数据。2.总量指标是进行决策和科学管理的依据之一。3.总量指标是计算相对指标和均值的基础,这两个指标是总量指标的派生指标。(二)作用二、总量指标的分类总体单位总量总体单位总量是表示总体本身规模大小的统计指标,其计量单位由总体现象本身的特点决定。如企业数,医院数、职工人数等。2.总体标志总量总体标志总量是说明总体某种标志数值总和的统计指标,如作为工业企业总体的工业总产值、净产值、职工人数;作为医院总体的医务人员数,患者数、病床数等。总体单位总量和总体标志总量二者之间也不是绝对的,研究目的不同,在一定的情况下,也可能相互转变。(一)按反映的内容不同分类二、总量指标的分类1.时期指标时期指标是指数据采集对象在某一时期发展变化过程的量,大小与时期长短直接有关,是一个“流量”,某店铺的月销售额,工厂的年产值等。2.时点指标时点指标是指数据采集对象在某一时刻或某一时点上所处状况的量,其数值大小与时点间间隔长短无直接关系,是一个“存量”,如某商店月末的商品库存量、某地区年末的人口数、银行存款余额等。(二)按反映的数据采集对象时间状况不同分类二、总量指标的分类实物指标实物指标是指根据实物单位计量得到的总量指标,实物指标能反映产品的使用价值或现象的具体内容,如生猪存栏量,电器的销售量等。2.价值指标价值指标是指根据货币单位计量得到的总量指标,具有广泛的综合能力,如商品销售额,产品产值等。3.劳动量指标劳动量指标根据劳动量单位计量得到的总量指标,如工日、工时等。(三)按计量单位不同分类三、总量指标的取得实物单位实物单位是指根据事物的自然属性和特点而采用的自然单位、度量衡单位、复合单位、标准实物单位,如台、件、米、公里等。2.价值单位价值单位是指用货币来度量社会劳动成果或劳动消耗的计量单位,如国内生产总值、社会商品零售额、产品成本等,都是以“元”、“万元”或“亿元”等来计量的。3.劳动量单位劳动量单位是指用劳动时间表示的计量单位,如“工日”、“工时”等。(一)总量指标的计量单位三、总量指标的取得1.根据采集到的资料进行汇总,具体有手工汇总和电子计算机汇总。2.根据现象之间的数量关系进行推算。(二)总量指标的计量方法四、应用总量指标应遵循的原则(一)计算总量指标必须对指标的含义、范围做严格的确定。(二)计算实物总量指标时,要注意现象的同类性。(三)计算总量指标要有统一的计量单位。请完成课程导入的任务。任务3相对指标处理任务导入:某公司3个店铺计划完成情况如表4-3-1所示,考核其计划执行进度情况。表4-3-1某公司3个店铺计划完成情况任务要求:1.计算某公司甲乙丙三个店铺及全公司的计划执行情况并填写在上述表格中,分析一下该公司计划的进度如何?2.分析该公司三个店铺的计划完成情况如何,并提出相关改进建议。一、相对指标概述相对指标是两个有联系的统计指标的比值或比率,表明两个指标之间的相互关系或差异程度。其基本计算公式为:(一)概念一、相对指标概述1.有名数:将相对指标中的分子与分母指标的计量单位同时使用,以表明事物的密度、普遍程度和强度等。主要用来表现强度相对指标的数值。如人口密度:人/平方公里、平均每人分摊的粮食产量:千克/人。2.无名数:抽象化的、无具体文字计量单位的表现形式。包括:系数或倍数:将比的基数(分母)抽象化为1;成数:将比的基数抽象化为10;百分数:将比的基数抽象化为100;千分数:将比的基数抽象化为1000。(二)相对指标的表现形式二、相对指标的作用(一)表明社会经济现象之间的相互联系程度,认识现象之间的关系。(二)能使一些不能直接对比的事物找出共同比较的基础。三、相对指标的种类及其计算(一)计划完成程度相对指标又称计划完成率、计划完成百分比(数)。其基本计算公式为:或者或者三、相对指标的种类及其计算(一)计划完成程度相对指标例如:某企业生产某产品,上年度实际成本为520元/吨,本年度计划单位成本降低6%,实际降低7.6%,则该产品的计划完成程度怎么求?

计算结果表明该种产品单位成本实际比计划多降低了1.71%(100%-98.29%)。三、相对指标的种类及其计算(二)结构相对指标1.概念及计算公式结构相对数是根据分组法将总体划分为若干个部分,然后以各部分的数值与总体指标数值对比而计算的比重或比率,来反映总体内部构成状况的综合指标。其计算公式为:

三、相对指标的种类及其计算(二)结构相对指标2.作用(1)从静态上分析总体的构成,表明现象的性质和特征。(2)通过总体内部结构变化的分析,从动态上研究现象发展变化的趋势及其规律,如表4-3-3所示。表4-3-3某公司2018-2022年主营业务与非主营业务盈利构成情况三、相对指标的种类及其计算(二)结构相对指标2.作用(3)可以反映总体的质量或工作质量以及人力、物力、财力的利用程度。例如,人口的各种文化程度比重、中小学入学率等是从文化教育方面反映我国劳动力和人口质量;产品的合格率、废品率、商品消耗率等表明工业和商业部分的工作质量;出勤率、设备利用率、资金利用率等则是反映企业的人力、物力、财力的利用情况。(4)利用结构相对指标,有助于分清主次,确定工作重点。三、相对指标的种类及其计算(三)比例相对指标1.概念及计算公式比例相对指标是指同一总体中不同部分数量对比的相对指标,用以反映总体内各部分之间的比例关系和协调平衡状态。其计算公式为:

三、相对指标的种类及其计算(三)比例相对指标2.比例相对指标的应用(1)反映事物构成特征。比例相对数一般属于结构性比例,不仅具有反映事物各组成部分的数量比例关系的作用,也具有反映事物内部结构的作用。(2)反映事物协调平衡关系。客观现象内部各组成部分之间既密切联系又相互制约,他们存在着自身的运用规律和比例协调关系。三、相对指标的种类及其计算(四)比较相对指标1.概念及计算公式为掌握同类现象在不同条件下的差异程度,经常将不同国家、不同地区、不同部门、不同单位的同类指标进行对比,计算比较相对指标。其公式为:

比较相对指标可以是绝对数的对比,也可以是相对数或平均数的对比。三、相对指标的种类及其计算(四)比较相对指标2.作用比较相对指标可以用于不同国家、地区、单位之间的经济实力比较,也可以用于先进与落后之间的比较,还可以用于实际水平与标准水平或平均水平的比较,从而找出差距,挖掘劳动潜力,提高工作质量,促进经济发展。例:2020年A省的粮食产量为1264万吨,人均产量为314千克;B省粮食产量为1689万吨,人均粮食产量为275千克。请分别计算粮食产量和人均粮食产量的相对指标。粮食产量相对指标:A省为B省的75%或者B省为A省的1.37倍。人均粮食产量相对指标:A省为B省的1.14倍或者B省为A省的87.58%。三、相对指标的种类及其计算(五)强度相对指标1.概念及计算公式一个总量与另一个相关联的总量进行比较,用比较的结果来说明其中一个总量所代表现象的强度、力度、密度、普及程度等内容。

三、相对指标的种类及其计算(五)强度相对指标2.强度相对指标的表现形式与计量单位(1)复名数复名数,即双重计量单位,分子与分母的计量单位不同。例:某地区2021年年末人口数为100万人,该地区2021年年末拥有1200个商业网点。则:三、相对指标的种类及其计算(五)强度相对指标2.强度相对指标的表现形式与计量单位(2)无名数,即无计量单位,分子与分母的计量单位相同。一般用千分数、百分数表示。计算强度相对指标时,分子、分母可以互换位置,于是形成了正指标和逆指标之分。正指标是指数值大小与强度、密度和普遍程度成正比,逆指标则成反比。强度相对指标往往牵涉到一些人均指标,如人均国民生产总值、全国人均粮食产量、全国人均钢产量等。这些人均指标不是均值,而是强度相对指标。三、相对指标的种类及其计算(五)强度相对指标3.作用强度相对指标可以反映客观事物发展的基本概况和质量。它比总量指标更能反映经济现象发展水平和经济实力。三、相对指标的种类及其计算(六)动态相对指标动态相对指标:是指某一指标在不同时间上的不同数值的对比,表明现象发展变化的方向和程度,其表现形式为动态相对数(见动态数据处理技术)。

四、相对指标利用的原则(一)可比性原则在应用相对指标时,要注意分子、分母指标在总体范围、包含的经济内容、计算方法、计算时间、计量单位等方面具有可比性。(二)相对指标和总量指标结合应用原则相对指标说明现象发展变化的方向和程度,总量指标说明现象发展变化的绝对量,两者集合应用可以更深入地说明现象发展变化情况。(三)多种相对指标结合运用原则从不同方面不同角度说明问题的各种相对指标结合起来使用,全面说明客观事物的情况及发展规律。请大家完成课程导入中的任务。任务要求:1.计算某公司甲乙丙三个店铺及全公司的计划执行情况并填写在上述表格中,分析一下该公司计划的进度如何?2.分析该公司三个店铺的计划完成情况如何,并提出相关改进建议。任务四认知数据采集与处理工具一、常用数据采集工具(一)平台提供的数据工具(二)第三方专项数据采集工具(三)网页数据采集工具(爬虫)(四)其他数据采集工具(一)平台提供的数据工具主要包括平台的店铺后台、生意参谋(淘宝/天猫)、京东商智(京东)、数据易道(苏宁)等数据采集工具。(一)平台提供的数据工具1.生意参谋通过生意参谋,数据采集人员不仅可以采集自己店铺的各项运营数据(如流量、交易、服务、产品等数据),通过市场行情板块还能够获取到在淘宝/天猫平台的行业销售经营数据。如图所示。(一)平台提供的数据工具(一)平台提供的数据工具(一)平台提供的数据工具2.京东商智京东商智是京东为卖家提供数据服务的平台,卖家在订购京东商智之后,可以从PC端、APP、微信、手机QQ、移动端五大渠道获取店铺的流量、销量、用户、商品等数据,并能够获取整个行业及同行业中其他卖家的数据,以此来支持运营决策。同时,京东商智还支持购物车营销、用户营销等精准营销,帮助卖家提升销售,如图所示。(一)平台提供的数据工具3.数据易道

数据易道是苏宁面向外部卖家、供应商及品牌工厂等合作伙伴的官方数据分析产品平台,依托苏宁海量数据价值和大数据能力,旨在通过优质的数据产品及服务为合作伙伴提供业务数据分析和决策建议,实现合作伙伴与苏宁的商业价值共享共赢。如图所示。(二)第三方专项数据采集工具第三方专项数据采集工具,主要包括:多多情报通(多多参谋)、店侦探(淘宝/天猫)、淘数据(淘宝/京东/wish/shopee等)、逐鹿工具箱、店数据、升业绩等工具。(二)第三方专项数据采集工具1.多多情报通

多多情报通(多多参谋)是拼多多电商平台的数据工具,提供大盘走势、竞品(“竞争商品”的简称)分析、货源分析、成交高峰、物流预警、开团监控、店铺探索、深度分析活动商品信息、关键词监控等多维度的数据服务,辅助卖家的数据化运营,如图所示。(二)第三方专项数据采集工具2.店侦探

店侦探是一款专门为淘宝及天猫卖家提供数据采集、数据分析的数据工具。通过对各个店铺、宝贝运营数据进行采集分析,店侦探可以快速提供竞争对手店铺的销售数据、引流途径、广告投放、活动推广、买家购买行为等数据信息。如图所示。(二)第三方专项数据采集工具3.淘数据淘数据由阿里巴巴集团推出,主要针对淘宝、天猫等阿里电商平台的交易数据和用户行为数据进行收集和分析。如图所示。(二)第三方专项数据采集工具淘数据和生意参谋都是提供电商数据统计和分析的工具,但有以下区别:(1)数据来源不同。淘数据主要从淘宝、天猫等阿里电商平台进行数据采集和分析,而生意参谋主要从京东、苏宁、天猫、淘宝、唯品会、拼多多等多个电商平台进行数据收集和分析。(2)数据覆盖范围不同。淘数据主要关注淘宝、天猫平台的交易数据和用户行为数据,而生意参谋覆盖范围更广,不仅包括交易数据和用户行为数据,还包括流量、广告、竞争情报等数据。(3)数据处理方式不同。淘数据提供基于自然语言处理和机器学习算法的数据挖掘,可以进行一些高级的分析和预测,而生意参谋提供的更多是基于数据指标的可视化展示,通过图表和报告的方式直观地显示数据情况。(4)使用方式不同。淘数据是一款纯数据分析软件,需要用户自行对数据进行分析和解读,而生意参谋除了提供数据分析之外,还提供了一些营销策略和推广工具供商家使用,能够帮助商家更好地制定营销计划和优化营销效果。综上所述,淘数据主要关注淘宝、天猫平台数据的分析,而生意参谋是一个全维度的电商数据工具,覆盖多个电商平台数据并提供更多的营销策略和推广工具,供用户根据自身需求选择使用。(二)第三方专项数据采集工具4.逐鹿工具箱

逐鹿工具箱是一款电商多领域营销软件,提供了查排名、选款选品、主图评测、关键词挖掘、关键词市场分析、SEO优化,直通车优化,活动分析等功能,可帮助卖家全面提升店铺经营效率。(三)网页数据采集工具(爬虫)1.八爪鱼采集器

八爪鱼采集器是一款通用网页数据采集器,使用简单,可执行完全可视化操作;其功能强大,任何网站均可采集;另外,其采集的数据可导出为多种格式。八爪鱼采集器可以用来采集商品的价格、销量、评价、描述等内容。如图所示。(三)网页数据采集工具(爬虫)2.火车采集器

火车采集器是一个供各大主流内容平台系统、论坛系统等使用的多线程内容采集发布程序。其对于数据的采集可分为两部分:一是采集数据,二是发布数据。借助火车采集器可以根据采集需求在目标数据源网站采集相应数据并整理成表格或TXT格式导出。(三)网页数据采集工具(爬虫)3.后羿采集器

后羿采集器功能强大,操作简单,是为广大无编程基础的运营、销售、金融、新闻、电商和数据分析从业者,以及政府机关和学术研究等用户量身打造的一款产品。后羿采集器不仅能够进行数据的自动化采集,而且在采集过程中可以对数据进行清洗。在数据源头即可实现多种内容的过滤。通过使用后羿采集器,用户能够快速、准确地获取海量网页数据,从而彻底解决了人工收集数据所面临的各种难题,降低了获取信息的成本,提高了工作效率。如图所示。(三)网页数据采集工具(爬虫)后羿、八爪鱼和火车采集器的异同:后羿:支持跨平台,个人使用完全免费,对于大多数网站来说,只需输入网页地址,软件就会自动识别并提取相关字段信息,包括列表、表格、链接、图片等,不需配置任何采集规则,一键采取,支持自动翻页和数据导出功能,对于小白来说,非常容易学习和掌握。八爪鱼:相比较后羿采集器来说,八爪鱼采集器目前仅支持Windows平台,需要人为设置采集字段和配置规则,因此更繁琐,但也更灵活,内置了大量数据采集模板,可以轻松采集京东、天猫等热门网站,官方教程非常详细,对于小白入手来说,也非常容易掌握。火车:相比较后羿采集器和八爪鱼采集器来说,规则设置上更为灵活、智能,可以迅速抓取网页上散乱的数据,同时提供数据分析和辅助决策功能,对于日常爬取网站数据来说,是一个非常不错的软件。4.集搜客集搜客GooSeeker始于2007年,是国内最早的网络爬虫工具之一,近年来,集搜客已把互联网内容结构化和语义化技术成功推广到金融、保险、电信运营、电信设备制造、电子制造、零售、电商、旅游、教育等行业。软件通用于国内外网站,免编程,大批量抓取,可作为微博采集工具箱,采集数据一键输出至Excel表格;软件还可自动分词和情感分析、报表摘录和笔记等。软件现提供免费版、专业版、旗舰版、VIP版。(三)网页数据采集工具(爬虫)(四)其他数据采集工具1.

ScrapyScrapy是适用于Python的一个快速、高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据,也可以用于抓取非结构化数据。Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试。Scrapy吸引人的地方在于它是一个框架,任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类,如BaseSpider、sitemap爬虫等,最新版本又提供了web2.0爬虫的支持。(四)其他数据采集工具2.

Import.ioImport.io是一个网页抓取工具,它可以帮助用户从互联网上采集各种类型的数据。这个工具可以非常灵活地处理各种不同的数据类型,包括文本、图片、视频等等。使用Import.io的用户可以通过简单的拖拽操作来完成数据采集任务,并且支持自动化抓取大规模数据。优点:(1)简单易用,不需要编写代码,只需要进行简单的拖拽操作即可完成数据采集任务。

(2)可视化编辑器:Import.io提供了一个可视化编辑器,用户可以通过这个编辑器来创建自己的抓取器,并且可以对抓取器进行编辑和修改。

(3)支持多种数据源:支持从各种不同的数据源中采集数据,包括网页、API、数据库等。(4)自动化抓取:使用Import.io可以实现自动化抓取大规模数据,并且可以根据需要设置自动化任务。缺点:速度较慢,数据准确性不高、可能会存在一定程度的误差,虽然提供免费版,但是如果需要使用更加高级的功能,则需要付费。(四)其他数据采集工具3.

ApacheNutchApacheNutch是一款开源的网络爬虫软件,可以用于抓取互联网上的非结构化数据。它支持多种文件格式,包括HTML、XML、PDF、Word等,并且可以自定义抓取规则。非结构化数据是指那些没有特定格式和组织的数据,比如文本文档、邮件、音频、视频等。这些数据通常难以用传统的关系型数据库来存储和处理。(四)其他数据采集工具4.

BeautifulSoupBeautifulSoup是一款Python库,用于解析HTML和XML文档。它可以将非结构化的HTML或XML文档转换为结构化的Python对象,并且可以通过标签名、属性等方式来查找指定内容。BeautifulSoup可以与Scrapy等网络爬虫框架搭配使用,实现数据的采集和处理。(四)其他数据采集工具6.ContentgrabberContentgrabber采集机是一种高效的网络数据采集工具。它可以自动化地从任何网站上抓取和提取数据,并将其转换为结构化的格式,以便于后续处理和分析。它提供了可视化的操作界面,并支持自动生成脚本,使得即使没有编程经验的用户也能够轻松地使用它。此外,contentgrabber采集机还具有更高的效率和更好的灵活性。结构化数据也称作行数据,是由二维表结构来逻辑表达和实现的数据,严格地遵循数据格式与长度规范,主要通过关系型数据库进行存储和管理。与结构化数据相对的是不适于由数据库二维表来表现的非结构化数据,包括所有格式的办公文档、各类报表、图片和音频、视频信息等。二、常用的数据处理工具(一)SAS(二)R语言(三)SPSS(四)Python二、常用的数据处理工具(一)SASSAS的产生与发展SAS系统全称为StatisticsAnalysisSystem,最早由北卡罗来纳州立大学的两位生物统计学研究生编制,并于1976年成立了SAS软件研究所,正式推出了SAS软件。SAS是用于决策支持的大型集成信息系统,但该软件系统最早的功能限于统计分析,至今,统计分析功能也仍是它的重要组成部分和核心功能。二、常用的数据处理工具(一)SAS2.SAS的应用SAS系统是一个组合软件系统,它由多个功能模块组合而成,其基本部分是BASESAS模块。BASESAS模块是SAS系统的核心,承担着主要的数据管理任务,并管理用户使用环境,进行用户语言的处理,调用其他SAS模块和产品。也就是说,SAS系统的运行,首先必须启动BASESAS模块,它除了本身所具有数据管理、程序设计及描述统计计算功能以外,还是SAS系统的中央调度室。它除可单独存在外,也可与其他产品或模块共同构成一个完整的系统。各模块的安装及更新都可通过其安装程序非常方便地进行。二、常用的数据处理工具(一)SASSAS系统具有灵活的功能扩展接口和强大的功能模块,在BASESAS的基础上,还可以增加如下不同的模块而增加不同的功能:SAS/STAT(统计分析模块)、SAS/GRAPH(绘图模块)、SAS/QC(质量控制模块)、SAS/ETS(经济计量学和时间序列分析模块)、SAS/OR(运筹学模块)、SAS/IML(交互式矩阵程序设计语言模块)、SAS/FSP(快速数据处理的交互式菜单系统模块)、SAS/AF(交互式全屏幕软件应用系统模块)等等。二、常用的数据处理工具(一)SAS综合来看,SAS是一种商业化的数据分析软件,它提供了多种数据处理和分析功能,如数据挖掘、统计分析、预测建模等。SAS支持多种数据格式,如CSV、TXT、Excel等。SAS还提供了一套完整的数据挖掘流程,可以帮助用户方便地完成数据挖掘任务。二、常用的数据处理工具(二)R语言1.R语言产生与发展历程R语言来自S语言,是S语言的一个变种。S语言在贝尔实验室开发,著名的C语言、Unix系统也是贝尔实验室开发的。R语言提供了一系列用于数据处理、计算和绘图的工具,包括数据框、数组、向量和矩阵等数据结构,以及用于统计分析的函数,如参数和非参数假设检验、线性回归、广义线性回归、非线性回归、可加模型、树回归、混合模型、方差分析、判别、聚类、时间序列分析等。二、常用的数据处理工具(二)R语言2.R语言的应用R语言广泛的应用与统计、应用数学、计量经济、金融、生物、数据可视化以及人工智能等领域,应用前景越来越广阔。R是一种专门用于统计分析和数据可视化的编程语言和环境。它提供了丰富的数据处理和分析函数,可以进行各种高级统计分析、机器学习和数据挖掘任务。R也提供了各种绘图功能,可以生成美观和信息丰富的数据可视化图表。二、常用的数据处理工具(三)SPSSSPSS软件诞生于1968年,是一款用于统计学分析运算、数据挖掘、预测分析和决策支持任务的专业统计软件产品。SPSS最初称为“社会科学统计软件包”(StatisticalPackageforSocialScience),2002年SPSS公司将其名称改为“统计产品与解决服务方案”(StatisticalProductandServiceSolutions,SPSS)。问世50多年来,SPSS软件在医疗、商业、市场研究、教育、保险、银行等多个领域和行业得到了广泛应用,是当今最权威的统计学软件之一,有Windows和MacOS等多个操作系统版本。二、常用的数据处理工具(三)SPSSSPSS有如下一些优势:功能强大:SPSS囊括了各种成熟的统计方法和模型,为统计分析用户提供了全方位的统计学算法。兼容性好:在数据方面,不仅可以在SPSS中直接进行数据录入工作,还可以将日常工作中常用到的Excel表格数据、文本格式数据导入SPSS中进行分析,从而节省了相当大的工作量。易用性强:SPSS之所以有广大的用户群,不仅因为它是一种权威的统计学工具,提供了强大的统计功能,也因为它是一种非常简单易用的软件。扩展性高:SPSS直接和R语言进行对接,通过直接调用R语言的各种统计模块,直接实现了对最新统计方法的调用(新版本已经增加对Python的支持)。二、常用的数据处理工具(四)PythonPython是一种通用的编程语言,可以用于网络爬虫进行数据采集,也广泛用于数据处理和分析。Python有许多强大的数据处理库,如Pandas、NumPy和SciPy,可以进行各种数据操作、统计分析和机器学习任务。Python也支持各种可视化库,如Matplotlib和Seaborn,可以生成各种图表和可视化效果。二、常用的数据处理工具(五)SQLSQL(结构化查询语言)是一种用于管理和操作关系型数据库的编程语言。通过编写SQL查询语句,可以从数据库中提取、过滤和分析数据。SQL可以执行各种数据操作,如创建表、插入、更新和删除数据等。三、数据处理的主要操作软件---Excel(一)Excel软件简介Excel是微软公司出品的Office系列办公软件中的一个组件,确切的说,它是一个电子表格软件,提供了各种各样的功能,使得用户可以轻松构建、修改和管理各种数据表格,完成许多复杂的数据运算,进行数据的分析和预测并且具有强大的制作图表功能。Excel广泛应用于金融、财税、审计、行政等领域,有助于提高工作效率,实现办公自动化,是目前应用最为广泛的数据处理软件之一。三、数据处理的主要操作软件---Excel(二)Excel的功能Excel功能强大,可以执行各种计算任务,从简单的加减乘除运算到复杂的统计分析、图形展示和数据处理,其功能主要有6个部分:1.表格操作:Excel支持用户对表格中的数据进行增加、删除、修改、查找、排序、筛选等操作。2.公式操作:Excel支持用户编写公式,并通过输入文本框中的数据来计算表格中的数据。3.图表操作:Excel支持用户对表格中的数据进行数据可视化展示,包括折线图、柱状图、饼图等多种类型的图表,帮助用户更直观地分析数据。三、数据处理的主要操作软件---Excel(二)Excel的功能4.数据分析:Excel支持用户利用函数和数学公式对表格中的数据进行计算、分析和汇总,包括求和、平均值、最大值、最小值、方差等多种类型的数据分析。5.页面设置:Excel支持用户对工作表的页面进行设置,包括设置页边距、设置工作表标签等。6.宏操作:Excel支持用户编写宏,并通过运行宏来自动执行一系列的操作。

总的来说,Excel是一款功能强大的电子表格处理软件,可以用于数据处理、数据分析、图表展示等多种场景。任务4数据集中趋势处理任务导入:某企业工资数据如表4-4-1所示:表4-4-1某企业工资数据表任务要求:根据上述数据,计算出该企业工人的平均月工资水平。一、集中趋势概述集中趋势:是指一组数据向中心值靠拢的倾向和程度。一般来说,数据采集对象总体的频数分布特征一般有集中趋势。测度集中趋势就是寻找数据水平的代表值或中心值,不同类型的数据用不同的集中趋势测度值。集中趋势的测度方法有均值、众数及中位数等方法。算术平均数、调和平均数、几何平均数是根据分布数列中各单位的标志值计算而来的,称为数值平均测度数。众数和中位数等是根据分布数列中某些变量值所处的位置来确定的,称为位置集中测度值。各种集中测度值的计算方法不同,含义、应用场合也有所不同,但它们都可以作为集中趋势的代表值。二、均值均值是指在同质数据采集对象内将各单位的数量差异抽象化,用以反映采集对象一般水平的代表值。例如某单位员工的平均上网时间、学生的平均成绩81分、平均粮食产量800公斤等。(一)均值的概念二、均值1.均值是集中趋势的最常用测度值。(二)均值的特点2.均值是一组数据的均衡点所在。均值说明多数变量值集中在平均数附近,所以均值是标志值集中趋势的测度数,是反映总体变量集中倾向的代表值。3.均值体现了数据的必然性特征。从总体变量的分布情况看,多数现象的分布服从钟形分布,即不管用什么方法求得的均值,都靠近分布的中间,而不会在两头。4.均值易受极端值的影响。由于采用的是平均的方法求均值,均值易受到极值的影响,某个极端大值或极端小值都会影响均值的代表性,同时还影响其对集中趋势测度的准确性。5.均值主要用于数值型数据,不能用于分类数据和顺序数据的测度。二、均值(1)可用于同类现象在不同空间的比较。采用均值可以消除因总体的空间范围不同对数据比较分析的影响,从而得到正确的结论。(2)可用于同类现象在不同时间的比较。例如,由于各企业的工人数可能不一致,所以各单位的总产量一般是不可比的,但如果计算出各单位每个工人的平均产量,就可以进行对比了。(3)可用于数量上的推断。在数据的估计推算中,往往利用部分单位标志值计算的平均数推算总体平均数,或者以总体平均数来推算总体标志总量。(4)可用于分析现象之间的依存关系。例如,商业企业规模的大小和商品流通费用率之间存在依存关系,可以根据商品流转额来划分不同规模的商业企业,再计算各类商业企业的平均商品流通费用率,就可看出商品流转额的增减和流通费用率升降的依存关系。(三)均值的作用二、均值1.算术平均数计算简单均值与加权均值(四)均值的种类及测度(1)简单算术平均数计算均值1)简单算数平均数的计算公式2)简单算术平均数的Excel处理函数是?二、均值1.算术平均数计算简单均值与加权均值(四)均值的种类及测度(2)加权算术平均数计算均值1)加权算术平均数计算公式设一组数据,其组中值分别为:

x1,x2,…,xn相应的频数为:

f1,f2,…,fk,其计算公式如下:二、均值1.算术平均数计算简单均值与加权均值(四)均值的种类及测度(2)加权算数平均数计算均值2)加权算术平均数的Excel处理结合任务引出给出的数据,利用Excel来计算给企业工人的月平均工资。二、均值(四)均值的种类及测度第一步,在A栏及B栏后分别插入一栏,分别输入“月工资组中值x”以及“xf”,如图4-4-6所示。组中值是上下限之间的中点数值,以代表各组标志值的一般水平。组中值仅存在于组距数列分组数列中,单项式分组中不存在组中值。二、均值(四)均值的种类及测度第二步,根据组中值的计算方法,在B3到B8单元格中分别填入相应的组中值,如图4-4-7所示组中值的计算:有上下组限的情况下,组中值=(区间上限+区间下限)/2,而对于只有上限或者只有下限的情况,只有上限的组中值=上限-1/2(相邻组的组距),只有下限的组中值=下限+1/2(相邻组的组距)二、均值(四)均值的种类及测度第三步,点击单元格D3,再点击等号“=”,并点击输入“B3*C3”,如图4-4-8所示。二、均值(四)均值的种类及测度二、均值(四)均值的种类及测度二、均值(四)均值的种类及测度选中E9单元格,点击“=”,再添加“D9/C9”,点击回车,得到该企业工人月平均工资算术平均数1707.42元,如图4-4-12所示二、均值2.几何均值(四)均值的种类及测度几何均值也即是几何平均数,是n项变量值连乘积的n次方根,主要用于计算平均发展速度或平均增长率,其计算公式为:或二、均值(四)均值的种类及测度例:某地区2017-2022年国内生产总值(万元)如下表4-4-2所示,求该地区GDP的年平均发展速度。(平均发展速度表示现象逐期发展的平均速度)表4-4-2某地区2017-2022年国内生产总值(万元)二、均值(四)均值的种类及测度计算该地区GDP的年平均发展速度,Excel处理方法如下:第一步,先求出逐年发展速度(公式:发展速度=(指标报告期数值/指标基数数值)×100%)二、均值(四)均值的种类及测度计算该地区GDP的年平均发展速度,Excel处理方法如下:第二步,点击插入函数,选择统计函数GEOMEAN二、均值(四)均值的种类及测度计算该地区GDP的年平均发展速度,Excel处理方法如下:GEOMEAN函数:返回正数数组或区域的几何平均值语法结构:GEOMEAN(number1,number2,...),Number1,number2,...可用于计算平均数的1至30个参数,也可以不使用这种用逗号分隔参数的形式,而用单个数组或数组引用的形式。二、均值(四)均值的种类及测度计算该地区GDP的年平均发展速度,Excel处理方法如下:第三步,在弹出对话框中选择数值区域C4:C8二、均值(四)均值的种类及测度计算该地区GDP的年平均发展速度,Excel处理方法如下:第四步,点击确定按钮,就可以得出几何平均数123.95%,即该地区GDP在2017-2022年间的平均发展速度为123.95%。二、均值(四)均值的种类及测度计算该地区GDP的年平均发展速度,Excel处理方法如下:请大家尝试用公式法计算平均发展速度三、众数众数是数据采集对象总体中出现次数最多的数据。(一)众数的概念(二)众数的特征1.出现次数最多的变量值。2.不受极端值的影响。3.一组数据可能没有众数或有几个众数。4.众数主要用于分类数据,也可用于顺序数据和数值型数据。三、众数1.分类数据众数的确定(三)众数的确定下表4-4-3资料为某商店几种品牌饮品销售情况的频数分布比例及百分比(%)数据:上表中的众数是?三、众数2.顺序数据的众数(三)众数的确定4-4-4某地区居民对医疗状况评价的频数分布上表中的众数是?三、众数3.数值型数据众数的确定(三)众数的确定下面用Excel以来确定商品单价的众数(不考虑品牌),图4-4-18为某公司某月在各地空调的销售情况。三、众数3.数值型数据众数的确定(三)众数的确定第一步,对“单价”列升序排序;第二步,分类汇总;三、众数3.数值型数据众数的确定(三)众数的确定针对上述资料,如不考虑销售量和销售额,仅仅考虑单价的出现次数,也可以用Excel相关函数确定众数。MODE函数:返回在某一数组或数据区域中出现频率最多的数值。四、中位数中位数是将各数据采集单位特征值按一定的顺序或大小排列,居于中间位置的那个特征值就是中位数,中位数也是一个位置均值,由于处于中间位置,也用它来作为均值的代表。(一)中位数的概念四、中位数(二)中位数的特征1.中位数是排序后处于中间位置的数据2.中位数不受极端值的影响3.主要用于顺序数据的测度,也可用于数值型数据,但不能用于分类数据四、中位数(三)中位数的确定1.顺序数据的中位数表4-4-5某地区居民对医疗状况评价的频数分布中位数为?四、中位数(三)中位数的确定1.顺序数据的中位数表4-4-5某地区居民对医疗状况评价的频数分布中位数的位置为:301/2=150.5,从累计频数看,中位数在“一般”这一组别中。四、中位数(三)中位数的确定2.数值型数据的中位数①如果数据个数为奇数,则处于(n+1)/2位置的标志值是中位数。②如果数据个数为偶数,则处于n/2、(n+2)/2的两个标志值的平均数为中位数。四、中位数(三)中位数的确定2.数值型数据的中位数图4-4-24为某公司某时间在各地空调的销售情况(已排序),下面用Excel以来确定商品单价的中位数(不考虑品牌)。四、中位数(三)中位数的确定2.数值型数据的中位数图4-4-24为某公司某时间在各地空调的销售情况(已排序),下面用Excel以来确定商品单价的中位数(不考虑品牌)。MEDIAN函数:用来返回给定数值的中值针对集中趋势的测度方法,具体的知识点总结如表4-4-6所示。表4-4-6小结:数据类型与所适应的集中趋势测度值计算出该企业工人的平均月工资水平任务实施:第一步,在A栏及B栏后分别插入一栏,分别输入“月工资组中值x”以及“xf”,如图4-4-28所示计算出该企业工人的平均月工资水平任务实施:第二步,根据组中值的计算方法,在B3到B8单元格中分别填入相应的组中值计算出该企业工人的平均月工资水平任务实施:计算出该企业工人的平均月工资水平任务实施:任务5数据离中趋势处理任务导入:某企业甲、乙两个班组工人的平均日产量分别为:甲班组为8.5件/人,乙班组为11.9件/人;甲、乙两班组工人日产量的标准差分别为:甲班组σ=2.22(件),乙班:σ=2.69(件)。任务要求:试分析甲乙两班组工人平均日产量哪个代表性要强一些?一、标志变异指标概述离中趋势:是数据分布的又一特征,是指一组数据远离其中心值的程度,表明该组数据值的差异或离散状况。离中趋势常用标志变异指标来进行测度。标志变异指标:是描述数据采集对象各单位标志值差别大小程度的指标,又称标志变动度、离散程度或离中程度。如果说均值是说明总体分布的集中趋势,那么标志变异指标则是说明总体分布的离散趋势。不同类型的数据有不同的离中程度测度方法,离中趋势测度经常用到的标志变异指标有:异众比率、四分位差、极差、方差和标准差等。(一)标志变异指标的概念一、标志变异指标概述(1)反映一组数据离中程度。(2)标志变异指标是评价平均数代表性的依据。标志变异指标值越大,平均数的代表性越低;反之,平均数的代表性越高。(3)一般来说,标志变异指标值越大,总体各单位变量值分布的离散趋势越高、均衡性越低;反之,总体各单位变量值分布的离散趋势越低、均衡性越高。(二)标志变异指标的作用一、标志变异指标概述二、全距全距又称极差,是总体各单位标志的最大值和最小值之差,可用来测度数值型数据的离中程度,易受极端值的影响。其一般计算公式为:全距=最大变量值-最小变量值用符号表示为:二、全距根据原始资料和单项数列计算全距时,可直接用上述公式。但如果掌握的资料是组距数列,则全距的计算公式为:全距=最大变量值组

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论