大数据导论 第3版 Chap6 知识拓展_第1页
大数据导论 第3版 Chap6 知识拓展_第2页
大数据导论 第3版 Chap6 知识拓展_第3页
大数据导论 第3版 Chap6 知识拓展_第4页
大数据导论 第3版 Chap6 知识拓展_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

知识拓展一:FlourishFineReport来源:/sem/finereport/tt-tb?utm_source=ad&utm_medium=360tg&utm_campaign=fr-keshihua&utm_term=ss1986简单易上手,5分钟完成图表制作通过类Excel的设计器一键连接数据源,拖拽字段绑定单元格,一张报表就可以制作完成!当然,我们还有丰富的软件文档、视频教程等学习资源,无需自己摸索。免费试用自动生成图表,告别重复做表很多用户都有制作日报、周报、月报的重复性报表需求,传统软件面对这样的需求时极大的浪费人力,通过FineReport可实时展现更新的数据报表,并定期推送。免费试用动态图表,实时掌握最新数据传统Excel无法自动更新展示最新的数据,FineRoport可以实时对接业务数据库,只要后端数据发生变化,前端报表即可实时呈现免费试用酷炫效果,数据图表竟能如此好看支持制作各类复杂表格,比如折线图、饼图、柱形图、动态图表等,还可轻松实现酷炫的数据可视化效果,几乎可以迎接任何报表挑战免费试用数据分析便捷高效可以对数据报表做排序、过滤、筛选、求和、求均值、求方差、分组统计等常用计算操作,直观的发现、预警数据中所隐藏的问题免费试用支持手机图表、数据大屏等常用场景可以随时随地使用手机、平板来查看数据报表,还可集成到微信、钉钉等APP中;也可以将数据报表呈现到大屏幕上,跃然眼前免费试用海量图表/表格模板,适用各行各业拥有海量的常用表格模板,例如公司经营报表、生产报表、财务报表、销售报表、采购和物流表等,无需重复开发,即插即用免费试用知识拓展二:EXCEL清洗数据操作说明及视频发现数据问题原始表格存在重复的数据字段1数据混乱,需要将其进行分类薪资水平单位混乱且存在缺失值,需要统一单位,删除缺失值行业冗长杂乱,需要对关键词进行提取福利杂乱不一,需要对关键词进行提取要求筛选任务仅保留“大数据开发/分析”职能类别信息将“工作地点”分列为“所在城市”与“所在区”将薪酬数据分为上限和下限,并计算均值将学历和公司规划为不同等级发布时间更改为2019年将行业、福利的部分关键词进行提取将字段1数据进行分类简单处理问题使用PowerQuery实现数据的初筛选。在excel数据一栏中新建文本查询,导入数据文件。可以直接选中所有列删除重复值,选中职能类别,筛选出“大数据开发/分析”。借助PowerQuery中的拆分列,使用“-”进行拆分,可以将城市与区域进行拆分。使用PowerQuery的好处:新的技能,对大量数据比较好处理,excel不会因为数据太多卡顿。且拆分的规则可以按照字符串来计数,功能更加方便一些。不好的点在于不能直接编辑表格内的数据。处理过程的难点要点薪资拆分问题由于薪资的单位是不统一的,因此使用“-”为分隔符,将上线和下限进行分离,使用“/”为分隔符将薪资单位进行分离,用1000替代千,用10000替代万,再设立新的列,使用函数将原来的薪资上下限乘以1000或10000,达到以元为统一的单位,然后使用AVERAGE函数算出平均薪资。更改发布时间前期使用PowerQuery对数据进行筛选,原数据自动显示发布时间为2022。应将日期改为文本格式,利用替换将2022全部转换为2019年。在这里的斜体表示的是日期格式,正常体表示的是文本格式。将字段1进行提取字段1包含重复数据、工作经验、学历要求、人数需求、英语需求等。首先,使用“招”字将招聘人数和学历分隔开,前面可以使用“|”进行对应分隔。后可以使用“人”将人数与发布时间分隔开。关键词提取我这里使用比较繁琐的方法,先筛选出含有“英语”的完全对应的相关数据,再创建新的一列将数据输入,下拉到所有的行中,“普通话”与其相同。如行业、福利里面的数据,都可以使用这种方法进行创建新的一列,筛选和标注符合条件的数据。公司等级划分我参考了百度百科中对企业规模的定义,阅读相关材料后确定为特大型、大型、中型、小型、微型以及中小微型。根据公司人员的多少,设定了不同的公司规模名称。具体设置方法与4)相同。知识拓展三:标记和视觉通道来源:/q/1617298305213976视觉通道是可视化中的重要概念。可视化编码由标记和视觉通道组成。标记通常是一些抽象的几何图形元素,如点、线、面、体。视觉通道为标记提供视觉特征,包括位置、大小、形状、颜色、运动方向、色调、亮度等。感知系统接收视觉信号时,有两种基本的识别模式:类别模式:获得关于对象本身特征和位置等信息,描述对象是什么或在哪里次序模式:获得关于对象某一属性在数值上的程度信息,描述对象具体有多少对应这两种识别模式,可以划分视觉通道为定性(类别)和定量(连续、有序)两种。例如,用不同色调表现定性的类别数据,用同一颜色的不同亮度表示定量的次序数据。合理地选择视觉通道,是信息传达的前提,对数据这种抽象信息尤为重要。在数字产品的界面设计中,设计师就是在跟各种视觉通道要素打交道:决定文字、符号、图像等视觉元素的位置,选择合适的形状表示一定的含义,赋予元素特定的长度、大小、颜色,在元素之间形成各种关系,等等。视觉通道的表现力和有效性可以由这几个维度来衡量[1]:准确性,是否能够准确的表达视觉数据之间的变化

可辨认性,同一个视觉通道能够编码的分类个数,即可辨识的分类个数上限可分离性,不同视觉通道的编码对象放置到一起,是否容易分辨视觉突出,重要的信息,是否用更加突出的视觉通道进行编码对数据这类抽象信息而言,位置、长度、颜色、形状的视觉通道表现力较好,在设计时应优先选择用这些形式来映射设计对象的特征。知识拓展四:WEKA网上学习及认证来源:/doc/6797831-7014607.htmlWeka的全名是怀卡托智能分析环境(WaikatoEnvironmentforKnowledgeAnalysis),是一款免费的,非商业化(与之对应的是SPSS公司商业数据挖掘产品--Clementine)的,基于JAVA环境下开源的机器学习(machinelearning)以及数据挖掘(datamining)软件。它和它的源代码可在其官方网站下载。有趣的是,该软件的缩写WEKA也是新西兰独有的一种鸟名(新西兰秧鸡),而Weka的主要开发者同时恰好来自新西兰的怀卡托大学(TheUniversityofWaikato)。简介WEKA的全名是怀卡托智能分析环境(WaikatoEnvironmentforKnowledgeAnalysis),同时weka也是新西兰的一种鸟名,而WEKA的主要开发者来自新西兰。wekaWEKA作为一个公开的数据挖掘工作平台,集合了大量能承担数据挖掘任务的机器学习算法,包括对数据进行预处理,分类,回归、聚类、关联规则以及在新的交互式界面上的可视化。如果想自己实现数据挖掘算法的话,可以参考weka的接口文档。在weka中集成自己的算法甚至借鉴它的方法自己实现可视化工具并不是件很困难的事情。2005年8月,在第11届ACMSIGKDD国际会议上,怀卡托大学的Weka小组荣获了数据挖掘和知识探索领域的最高服务奖,Weka系统得到了广泛的认可,被誉为数据挖掘和机器学习历史上的里程碑,是现今最完备的数据挖掘工具之一(已有11年的发展历史)。Weka的每月下载次数已超过万次。2014年3月起,新西兰怀卡托大学将推出Weka免费网课,课程分为初级和高级两个部分,每个部分时长5周。初级课程将于2014年3月3日开课,高级课程于2014年4月下旬开课。课程具体内容参见怀卡托大学网站WekaMOOC。课程在优酷网站也有专辑。知识拓展五:学生作品展示技术开发说明书——PA车行图1-1PA作品1图1-2PA作品1一、作品技术说明1.数据来源,整体设计及配色原则数据来源数据来源为钉钉群中PA车行excel数据。本数据由于没有前期进行表格之间的自然连接,因此在直接tableau表外连接的过程中会出现存在NULL的问题。这样会造成仪表板中筛选器存在空值的项目。后续发现及时调整,使用表格中的自然连接方式,如图,可以避免出现空值。图3PA数据连接图整体设计主要从简洁、明了有艺术感出发设计整体的PA车行仪表板。查阅大量类似数据的参考模板,不断打磨优化排版格式,不断优化整体配色。特色设计为多值联动。共分为两种方式,一种是下拉菜单列表进行类别的筛选,一种是通过图表作为筛选器进行筛选。图1-3筛选图1图1-4筛选图2图5筛选图2每个仪表版分别设计了六个图。空白较少,基本使用文字填充。图一是销售业绩的反映图。图表中车型、厂商、颜色、客户、城市都可以作为销售业绩的筛选条件,且直观看到那种卖的最好,什么时间卖的最好等关键性因素。图二是员工业绩的反映图。图表中包括产生销售业绩最优秀的员工姓名与号码等。以及公司有的员工数量、发挥作用的员工数量、员工的佣金与其所产生的销售业绩对比等。配色原则本设计以黑色为底色,以白色为点缀,作为文本放置在仪表板中。两个PA车行仪表板的配色原则比较统一,都是采用蓝色、绿色、粉色三种颜色组合搭配出来整体视图。其他组合颜色也是偏浅色,和背景的黑色形成强烈的对比,更加突出图表的作用。2.主要技法操作过程卫星地图(难度:❤)双击city建立自动识别的经度和纬度。图1-5经纬度图在地图中选择背景层的选项,修改背景样式为卫星。图1-6地图选项图1-7样式选择之后需要修改配件的颜色、形状、标签等。结果:图1-8样式选择瀑布图(难度:❤❤)建立计算字段销售业绩。这里后边的括号是从哪个表中出来的,我们直接拖拽就好。图1-9销售业绩建立计算字段长方形高度。如图即为销售业绩的相反数。图1-10长方形高度将车辆的颜色信息放入列中,将销售业绩放入行中,并将其进行从小到大排序。图1-11行列放置将综合调整为累计汇总。图1-12累计汇总将图表类型调整为甘特条形图,如图所示将之前创建的计算字段进行拖拽。图1-13标记调整销售业绩的颜色,将正值的销售业绩和负值的销售业绩进行颜色的区分。如图所示,注意需要做渐变2阶颜色,并且将开始和结束改为相反数。图1-14颜色设置结果:图1-15瀑布图演示饼图(难度:❤)建立饼图,将客户类型放在颜色里面,将客户数量放在角度里面。图1-16标记将客户计数放两个在行中。并且进行快速表计算,都选择排序。图1-17快速表计算进行双轴。图1-18双轴将后出现的(下面的)饼图颜色等信息去掉,将颜色改为背景底色。图1-19修改背景再经过颜色调整后结果:图1-20饼图轨道图(难度:❤❤❤❤)创建计算字段销售业绩。图1-21计算字段将行列改为想要分析的数据。这里面我选择销售员的姓名与销售金额的关系。图1-22放置行列将条形图进行排序,然后将后一部分排除。使用快速表计算,计算出每个列所占的百分比。图1-23排除数据建立新的表格,如图所示。将每一个销售员所对应的销售业绩粘贴在表格上面。复制粘贴其销售业绩所占比的百分比整数为行的数量,角度需要从0开始写。分类从一开始写。图1-24创建表格连接新数据源。图1-25连接数据源创建x坐标。图1-26创建x创建y坐标。注意,这里PI()/35的35值可以根据个人的数据圆旋转进行改变。但是xy需要保持统一。图1-27创建y图1-28放置目标将其余信息如图所示放置。调整线的大小。并调整x轴和y轴的范围。图1-29标记调整文本位置以及其他设置。结果:图1-30跑道图二.管理视角总结销售业绩仪表板PA车行销售业绩仪表板主要反映了车辆信息的销售业绩、客户信息的销售业绩、年份信息的销售业绩等因素,对企业的进一步分析发展有建设性的帮助作用。本仪表板所包含的图表信息分别为:销售业绩与客户的柱状图,并以客户类型进行颜色区分;销售业绩与车辆颜色的瀑布图,正值用绿色,负值用蓝色;建立客户人数与客户城市的地图,用不同的颜色标记不同城市;销售业绩与车辆车型的树形图,越大颜色越深;每一年销售业绩以及清点订单数量的柱状双轴图,并用不同颜色进行区分。另,使用者可以通过多个筛选按钮达到整个仪表板的联动效果。图1-31筛选器1图1-32筛选器2图1-33筛选器3上图筛选按钮可以实现对客户类型、客户所处城市销售业绩等信息情况进行互动筛选。整个图表都会做出相应的变化。拖动拉环,可以筛选出一定的销售业绩区间范围的对应图表数据。饼图可以对单个销售车厂进行筛选。另外,除了salechangebyyear图表外和最上方的条形图外,所有的图表均可以如饼图一样,做到对全局筛选。使用者可以查看单个地点、客户类型、车辆信息的响应数据,也可以进行交叉查询。销售员业绩仪表板PA车行销售业绩仪表板主要反映了各个销售员的详细信息,包括其佣金信息、为公司产生的销售业绩信息、服务的客户对象信息、年份信息等。方便企业管理层多样考察销售员的综合素质。本仪表板包含的信息为:员工就职时间与姓名的散点图,颜色越深证明员工所为公司带来的价值越大;每一年员工数量与客户类型对接区域图,另建立饼图作为筛选器;建立前9名优秀员工跑道图,用不同颜色进行表示,越长代表销售业绩越高;建立佣金与销售业绩对比图,并用标签将销售员ID进行表示。图1-34筛选器集合另,与上图相同,本图也对应设置了如下图所示的筛选器对全局信息进行筛选。使用者可以调整销售员名称、ID号码、销售年份的数据,找到一个或多个年份对应一个或多个销售员的销售业绩。另外,环形图也可作为筛选器,选择客户类型。

技术开发说明书——大数据岗位图2-1大数据大屏展示一、作品技术说明1.数据来源,整体设计及配色原则数据来源本数据为个人以钉钉群中老师提供的清理前数据为模板,使用EXCEL插件PowerQuery进行数据清理所得出的数据。由于我原来对数据的处理方式导致薪资水平上下限的单位是不统一的,因此使用条件列对数据的薪资单位进行统一化处理,均为元/月。图2-2数据来源整体设计本次设计突出圆圈和黑边在整个视图中的应用,这样的设计将更加统一和和谐。本次也加大地利用了空白的价值,留白较大,充分利用了仪表板布局的作用。也有较多、多种类型的筛选器,如图所示。另外,本次通过图示按钮进行筛选条件。图2-3筛选器1图2-4筛选器2配色原则本配色原则参考tableau自带配色中的其中一个,将一个小部分的配色应用到全体逻辑。主要使用红色、蓝色、棕色、白色、黑色,以白色为大面积打底,用其他颜色作为点缀。2.主要技法操作过程盒须图(难度:❤)以公司规模为单位进行薪资平均值的区分,将公司规模放在列上,将薪资平均放在行上。图2-5行列放置将图表类型改为圆,并调整适当的大小,喜欢的颜色。图2-6标记取消分析中的聚合度量。图2-7分析在智能推荐中选择盒须图。则得出薪资与公司类型之间的上下限关系。图2-8选中智能推荐结果:图2-9箱型图棒棒糖图(难度:❤)将工作经验放在列中,将sheet计数(发布招聘信息的条数)作为行。图2-10行列放置这样会出现一个条状图,如图所示。图2-11条形图再把sheet3计数放在列中,并使用双轴,一个图调整为条形图,一个图调整为散点图。图2-12行列放置调整条形图的大小,调整点状图的大小,形成棒棒糖形状。(注意,这里默认下面的表格点会覆盖上面的线。因此,棒棒糖的糖要是下面的表格。)调整颜色。图2-13棒棒糖将sheet计数进行快速表计算,选择合计百分比,并放在标签中。图2-14快速表计算标签的位置如图,选中第二个图表,并居中放置。图2-15放置文本结果:图2-16棒棒糖图升级版棒棒糖(难度:❤)将两者相同的对象拖到列中,用发布时间做双轴。图2-17行列放置前面的图作一个线,后边的做点。颜色代表发布公司的数量,大小代表招聘人数的综合。(注意,这里的招聘人数需要改为数值类型,进行总和操作)图2-18发布时间结果:图2-19升级版棒棒糖图环形图组合(难度:❤❤)饼图做起来大家都会,环形图大家也会,但是这个是四个环形图的结合体。与前类似,需要导入四组sheet计数。其中两两为双轴。快速表计算为排序。图2-20行列放置选择饼图,将福利的有无用颜色表示,文本将sheet计数进行快速表计算其合计百分比,详情见棒棒糖图。用标签表示计数和福利。图2-21标记调整另外一个圆形的大小,使后边的饼图小于前面的饼图。调整后边的饼图颜色为白色,重复操作。综合调整八个图,奇数的图是外面的环,偶数的图是中间的圆。图2-22多图调整结果:图2-23多饼图二.管理视角总结本仪表板以较多的细节、较大的控件。主要的特色就是利用简单的颜色点缀整体,巧妙地运用了平铺布局和浮动布局的结合,营造干净、明确、清晰的页面感。整体从上往下看,首先是控制面板部分,可以实现对整个仪表板的全面筛选,可以选择的是公司类型、公司规模、所在地、所在区。其次,使用升级版棒棒糖图(自己起的名字)体现公司发布招聘人数总和、发布招聘公司数量两个指标。拖动发布时间,可以更加清晰地看到在指定时间范围内,公司招聘人数的多少。圆圈大,颜色靠近深蓝色,代表招聘岗位更多。图2-24时间轴图再次,设置了地区与大数据岗位招聘需求人数。使用堆叠图做底,并设置排序。这样,可以看到不同省份、不同地区的岗位人员需求。利用自动生成经纬度,来做地图,圆圈越大,说明需求人数越多。综上,可以看出需求最大的是上海地区。利用图形界面作为联动筛选器。原数据中,存在有无各个学科需求的数据。这里圈代表有,叉代表无。根据用户所选,这里的图将会相应进行变动。另外,此也可以用作筛选器按钮,进行单独岗位要求筛选。另有棒棒糖图,将学历要求等因素进行比例计算和区分,也能实现对全体数据的筛选联动。图2-25制作选项关于薪资范围,选择箱线图来实现。这里也设置了筛选器。根据图表数据,可以比较明显地观测到大型、中型、国企等公司薪资分布比较均匀且较高。图2-26箱线图最后是组合环形图。红色、蓝色的环形图反映了不同的公司招聘岗位所能提供的福利、所处行业占比。通过上面控制面板的筛选器筛选,更能单独分析每一个类型公司的具体提供。中国航天发展历程技术开发说明书一、作品技术说明1.数据来源中国运载火箭技术研究院Tableau社区公众号=1\*GB2⑴数据集解释①1970-2020年航天历程记录数据集包含变量发射中心、时间、有效载荷、结果、轨道、运载火箭型号、运载火箭系列图SEQ图\*ARABIC11970-2020年航天历程记录数据集②中国载人飞船神舟系列记录包含变量发射时间、编号、航天员、返回时间、航天任务图SEQ图\*ARABIC2中国载人飞船神舟系列记录数据集③长征系列火箭六大飞越数据集包含变量时间、编号、事件图SEQ图\*ARABIC3长征系列火箭六大飞越数据集2.整体设计及配色原则中国航天,星耀苍穹仪表板包括三部分。第一部分为中国五十年航天探索历程,包括轨道图、四大卫星发射中心发射次数星星图、1970-2022年发射次数梯形图;第二部分为中国载人飞行历程记录,主要包括航天员、航天任务,任务时间一些信息;第三部分为长征系列六大跨越,主要包括时间轴图和工作表的联动。配色原则采用黑色发蓝背景,展示中国航天的气魄。表颜色的字体采用淡蓝色,代表了遨游太空的蓝色。仪表板的标注字体采用白色,黑白相间,体验舒适感。标题字体采用华光行楷,字里行间之间体现中国航天的气魄。标注字体采用楷体,简洁、精干。3.操作过程圆环背景在excel中建两张工作表:point和circlePoint表包括一个link字段和point字段,point字段从0-360依次往下。图SEQ图\*ARABIC4point表Circle表包括circle字段和R字段和link字段,R是圆的半径,依据自己的图大小而定。图SEQ图\*ARABIC5circle表在tableau中将两张工作表进行内连接。创建计算字段X=COS([Point]*PI()/180)*[R]Y=SIN([Point]*PI()/180)*[R]将X、Y分别拖到列和行,分析中取消聚合度量,标记卡改为线,将circle拖到详细信息,point拖到路径,取消轴标题、网格线。时间轴线在excel中建一张工作表包含线角度、数值、内外环图SEQ图\*ARABIC6时间轴线表创建计算字段Angle=2*PI()*(INDEX()-1)*(1/WINDOW_COUNT(COUNT([数值])))R=IIF(ATTR([内外环])=0,0,SUM([数值])/WINDOW_MAX(SUM([数值])))*90X=COS([angle])*[R]Y=SIN([angle])*[R]将X、Y分别拖到列和行,分析中取消聚合度量,标记卡改为线,将线角度、内外环放到维度中,然后将线角度拖到详细信息,内外环拖到路径,X、Y的计算依据为线角度,取消轴标题、网格线。⑴圆环图①处理数据源增加Path字段,原数据填充为0,复制全部数据列,Path填充为1。②创建参数图SEQ图\*ARABIC7Radialinner参数③编辑分组轨道分组图8轨道分组结果分组图9结果分组④创建计算字段Iconif[Path]=1THENIF[结果(group)]='Failed'THEN'Failed'ELSE'Success'ENDENDnumberofdaysDATEDIFF('day',date("1970-1-10"),date("2019-7-26"))JitterCASE[轨道分组]WHEN'最近'THEN1+random()/4WHEN'近'THEN1+random()/3WHEN'中'THEN1+random()/6WHEN'远'THEN1WHEN'更远'THEN1+random()/12WHEN'极远'THEN1ENDOrbitoffsetinchartCASE[轨道分组]WHEN'最近'THEN2.2WHEN'近'THEN3.2WHEN'中'THEN5.2WHEN'远'THEN7.2WHEN'更远'THEN8.3WHEN'极远'THEN10.5ENDRadialangle(-(DATEDIFF('day',[startdate],[时间])*180/[numberofdays])*2*PI()/180)*5/6+PI()/3randomradius([Radialinner]+IIF(ATTR([Path])=0,0,avg([Orbitoffsetinchart]-[Radialinner])))*AVG([Jitter])X[randomradius]*COS(AVG([Radialangle]))Y[randomradius]*SIN(AVG([Radialangle

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论