大数据仓库与大数据挖掘课程设计_第1页
大数据仓库与大数据挖掘课程设计_第2页
大数据仓库与大数据挖掘课程设计_第3页
大数据仓库与大数据挖掘课程设计_第4页
大数据仓库与大数据挖掘课程设计_第5页
免费预览已结束,剩余14页可下载查看

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、共享知识分享快乐目录1 . 绪论 2.1.1 项目背景 2.1.2 提出问题 2.2 数据库仓库与数据集的概念介绍 2.2.1 数据仓库 2.2.2 数据集 2.3 数据仓库 3.3.1 数据仓库的设计 3.3.1.1 数据仓库的概念模型设计 3.3.1.2 数据仓库的逻辑模型设计 3.3.2 数据仓库的建立 3.3.2.1 数据仓库数据集 3.3.2.2 建立维表 4.4 .数据挖掘操作4.4.1 数据预处理4.4.1.1 描述性数据汇总 4.4.2 决策树 4.5、实验心得1.2.6、大总结 1.3.AAAAAAAA1 . 绪论1.1 项目背景在现在大数据时代,各行各业需要对商品及相关关节

2、的数据进行收集处理,尤其零售行业, 于企业对产品的市场需求进行科学合理的分析, 从而预测出将来的市场,制定出高效的决策,给企业带来经济收益。1.2 提出问题对于超市的商品的购买时期和购买数量的如何决定,才可以使销售量最大,不积压商品, 不缺货, 对不同时期季节和不同人群制定不同方案, 使企业收益最大, 通过数据挖掘对数据进行决策树分析, 关联分析, 顺序分析与决策分析等可以制定出最佳方案。2 数据库仓库与数据集的概念介绍2.1 数据仓库数据仓库是为企业所有级别的决策制定过程提供支持的所有类型数据的战略集合。它是单个数据存储,出于分析性报告和决策支持的目的而创建。 为企业提供需要业务智能来指导业

3、务流程改进和监视时间、成本、质量和控制。数据仓库是决策系统支持 ( dss ) 和联机分析应用数据源的结构化数据环境。数据仓库研究和解决从数据库中获取信息的问题。数据仓库的特征在于面向主题、集成性、稳定性和时变性。2.2 数据集数据集是指一种由数据所组成的集合。 Data set (或 dataset )是一个数据的集合, 通常以表格形式出现。 每一列代表一个特定变量。 每一行都对应于某一成员的数据集的问题。 它列出的价值观为每一个变量, 如身高和体重的一个物体或价值的随机数。 每个数值被称为数据资料。 对应于行数, 该数据集的数据可能包括一个或多个成员。3 数据仓库3.1 数据仓库的设计3.

4、1.1 数据仓库的概念模型设计概念模型的设计是整个概念模型开发过程的三阶段。 设计阶段依据概念模型分析以及分析过程中收集的任何数据, 完成星型模型和雪花型模型的设计。 如果 仅依赖ERD那只能对商品、销售、客户主题设计成如图所示的概念模型。这种 模型适合于传统的数据库设计,但不适合于数据仓库的设计。3.1.2 数据仓库的逻辑模型设计逻辑建模是数据仓库实施中的重要一环,因为它能直接反映出各个业务的需求, 同时对系统的物理实施有着重要的指导作用, 它的作用在于可以通过实体和关系勾勒出企业的数据蓝图, 数据仓库的逻辑模型设计任务主要有: 分析主题域,确定要装载到数据仓库的主题、确认粒度层次划分、确认

5、数据分割策略、关系模式的定义和记录系统定义、 确认数据抽取模型等。 逻辑模型最终设计成果包括每个主题的逻辑定义,并将相关内容记录在数据仓库的元数据中、粒度划分、数据分割策略、表划分和数据来源等。3.2 数据仓库的建立3.2.1 数据仓库数据集一般说来 , 一个数据集市是按照某一特定部门的决策支持需求而组织起来的、 针对一组主题的应用系统。 例如 , 财务部拥有自己的数据集市, 用来进行财务方面的报表和分析, 市场推广部、 销售部等也拥有各自专用的数据集市, 用来为本部门的决策支持提供辅助手段。数据集市大都采用多维数据库技术, 这种技术对数据的分析而言也许是最优的 , 但肯定不适合于大量数据的存

6、储, 因为多维数据库的数据冗余度很高。为了提高速度, 对数据集市中的数据一般都建立大量的索引。 换言之 , 数据集市中往往靠对数据的预处理来换取运行时的高速度, 当业务部门提出新的问题时, 如果不在原来设计的范围内 , 则需要数据库管理员对数据库作许多调整和优化处理。3.2.2 建立维表维是分析问题的角度,度量是要分析的问题。多维视图:用包含度量和维的表的数据结构可以创建一个多维视图,用试题和维创建的多维模型称为星型模型,星型模型生成的主要表格被称为事实表。事实表的属性值几乎都有连续值。事实表是规范化的。与维表不同不是随时间的推移变化,而是不断变大。维表 : 星型模型也具有非常小的表, 用来装

7、载描述信息 。 维表是逆规范化的。如果把维表置于第二范式中,这样的表称为雪花模型。维表包括主键,通常对应事实表的外部键。如果维表的主键不在实事表中,这个主键字便被称作退化的维。创建维表:有3 种方法:星型模型、雪花模型和星暴模型。星暴模型含有两张以上的事实表。基本有些充当维事实表。星型模型:所有信息维都放在同一个维表中。维表信息包含一个唯一的标识符( ID ) 和通过这个维表建立的所有维所需的属性。星型模型由小的维表与大的事实表组成,多称为“小表和大表”。事实表一般是标准表。雪花模型:把信息分为 3 种标准格式。产品表、类别表、子类别表。把这些信息放到一起需要一定数据的连接。雪花模型比星型模型

8、效率低,占空间少。所有的事实表都有一个与之相关的时间维表。4 .数据挖掘操作4.1 数据预处理4.1.1 描述性数据汇总对于许多数据预处理任务,希望知道关于数据的中心趋势和离中趋势特征。中心趋势度量包括均值(mear)、中位数(median)、众数(mod8和中列数( midrange) ,而数据离中趋势度量包括四分位数( quartiles ) 、四分位数极差( interquartile range, IQR )和方差( variance ) 。这些描述性统计量有助于理解数据的分布。4.2 决策树(1)读取文本数据使用变量文件节点读取定界文本数据。可以从选项板中添加变量文件节点, 方法是单

9、击源选项卡找到此节点, 或者使用收藏夹选项卡(默认情况下,其中包含此节点)。然后,双击新添加的节点以打开相应的对话框。如图 1所示。BzdI单击紧挨“导入文件”框右边以省略号“”标记的按钮,浏览到系统中的Clementine安装目录。打开目标文件目录,然后选择名为sales.xls的文件。选择从文件读取字段名,并注意已载入此对话框中的字段和值。如图 2所示。图2单击过滤选项,可以把用不到的信息给过滤掉。如图3所示。宇段口瞅瑁闾甲s,亚必sales.xIs网宁琅1*中已输人,”人已过曲入已里俞m个已做学收行徜日重 讷住时间 广空号 年号 等品目 芹晶锄r 糠人心三一一二三"J5 聚EH

10、君员消磨日加革售打祠号三序号 由岳吗 苗e翎f 辍x科q直百音铸很口且看未使用盼使露却把取消毁 星孟图3Excel,2电汕、/ a憾靠松相1弱博良支恒类型选项卡可帮助了解数据中的更多字段类型。 还可以选择读取值来查看各 个字段的实际值,具体取决于在值列中的选择。此过程称为实例化。如图4所示。P |»0 : a读取值I骞除值膏靡所有值Ellia和 同匕里号担磨担 台薪告:祟£品品A -r萦W硝倘小J?盲科喻无 无处 遛制 王弊警去 中止卷音右向、输X、输入、的、输入、缺 、检X.、©、输川.直看当前学假 宜看未曾哪字鼠独鼻波迎世驯哇解碓 |取消|度用 里,(2)添加

11、表现在已载入数据文件,可以浏览一下某些记录的值。其中一个方法就是构建 一个包含表节点的流。要将表节点添加到流中,可双击选项板中的表节点图标或 将其拖放到工作区。如图5所示。c收靠夹口国画图图图回外抗 敏痔,也 变班 底计量 均阻 根吉 登宣金后“SPSS辑i后数据漏5记录选项四字段选以口)上图形(G)建模同图5双击选项板中的某个节点后,该节点将自动与流工作区中的选定节点相连 接。此外,如果尚未连接节点,则可以使用鼠标中键将源节点与表节点相连接。 要模拟鼠标中键操作,请在使用鼠标时按下 Alt键。如图6所示。|一; 一|.EX CELT斗 Isalesle要查看表,请单击工具栏上的绿色箭头按钮执

12、行流,或者右键单击表节点,然后选择执行。如图7所示。9 1 115-记生理F«字卷训母断IT飞巾巾中KN口累于m 阍国丽而国lold闾 EM的III阊ffiDTLI?国LIJ2 D 皿2. <1 绅 s 41.融订<e 3薛, = j到彳死. F4 M4”. 3 0 3汨. 'JO.。心J It. MdQ*. H 网仃电. 叱s ill- *. 14 4llil3t , l£ 4U42k . !, M*】,. 13 血孤. It A4UI. 障 cnrjF . g 加仃由.r CSEH.whl41J 2T L tll 7T T tIJ JT 4. 

13、71;14fi 1. falflSS . HflfM IGF 戢 I.14.H fl- £16 65 6 L怕站f. 18 率 4 MD亨5事 W 1. 占伯M 1 ,川茶 打丁黑t ,帕,可 »1Q» 4 *伯咒r. - 19 鼻I 1- *19:21 JL.«OT? MMq 0亮口 K4nl /刈 WWb WIDE WM2 1口皿 WM守 W®3 GL3C2Z WW UXI2 N4Q3 Efl:D5 wm MDO? Di-Cdl UDD1 前唬HN3H+一凯 ihftRt vwe 制中? 瓦M m不经由 三工琦H必基子事。脂口 府/可口 3

14、.D. EDDD ELCHXJ S'S. $口 h睥era对 LD. £DDQ Rg 21 强 «0度1收 5.D 唯口皿 BED LL MH 1.仙上 L W 加口可。13 m 时 Q .tn . * Fti 叫 QF。15 1 33.0 . 30 0 . Bl_.J Q J W 3 DCQ Z1 LD. 3 0也 1IKXI EEk i O iDOt EM» 11 蟠 150 1fii:i «D 州例口 14, 1.« 鹏 ”E 1 WO R l.t J 00a 3M D B i营 15 Q 1号山伸 SJ. t OM 8 Ml 上

15、CL J_D._ tDH DE 口 f.1 Ei易 11 DUL ffl *飞1 UJl'N 1 Ml-fS i nwW. i.因中, rri' Tfl im: n i mrs n it* ii的中簟£ iMl'fS 1 NTiV 1 的口 /8 1 UW" 1 Nl M 一豳Q因图图画周施*» Mirii r* «iifl * ba ,恒mgm图7(3)创建分布图将分布节点添加到流,并将其与源节点相连接,然后双击该节点以编辑要显示的选项。选择商品名称作为要显示其分布的目标字段。 然后,在对话框中单击执行。如图8所示。图8最终图表

16、将有助于查看数据的“结构”。结果表明,商品300g壶瓶枣和400g 沁州黄女的最多。如图9所示。图9此外,还可以在“输出”选项卡中找到数据审核节点。如图 10所示。图10添加并执行数据审核节点,同时快速浏览所有字段的分布图和直方图。如图11所示图11(4)创建散点图现在我们来看一下有哪些因素会对商品出售 (目标变量)产生影响。作为一 名消费者,我们一定知道销售模式对销售数量有着重要的影响。所以创建一个关 于商品名称和销售模式的散点图。将散点图节点放在工作区中,并将其与源节点 相连接,然后双击该节点对其进行编辑。如图 12所示。I鼠IIL.图12在“散点图”选项卡中,选择商品名称作为 X字段,选

17、择销售模式作为 Y字段,并选择销售金额作为交叠字段。然后单击执行。如图13所示。图13此散点图清楚地显示商品在零售和特价模式下销售金额的不同。商品在特价 的销售模式下,销售金额明显高于零售模式下的销售金额。如图 14所示。旧其件曲E 0±M 3囱囤唾莉品名称v.错杂式广君rlS转士X:1:' m 舜 n f电 丁 吞匚 |:1 卫塞线 1!:ItLLu 理鼠 E»中英事 巾 r toxs -Ml!工商畲君 丁比 W“-I 耳器假邛iff 红辱山 kw米ii 8同0星利 I &中上芈 4nRE生质 一平45斤: 1 ia-H心 T:"图14(5)创建

18、直方图因很多数据不能够直接显示,所以我们要建立直方图,直方图能够很清晰的显示数据。首先,将网络节点与您工作区中的源节点相连接。如图 15所示。图15在“直方图”选项卡中,选择商品序号作为 X字段,选择销售数量作为交 叠字段。然后单击执行。如图16所示。图16此直方图能够清楚地显示不同商品销售数量的不同。由图可以看出序号为1的商品销售数量最多,序号为9的商品销售数量最少。如图17所示。*,由总且U ,9m加“/世 口士点./we 日症引序号的目上,图足 亭H京湾,碑加 (-120C*岬齿 ULiS 10TU' 新00|证卅 古自论依孔比1045, HW0志的 期*善口 u¥tt

19、.M隼sr市就 大F: 除理"病.MOj艳川 加皿工J卡图175、实验心得在本次实验中,从新建工作流一直到获得最终结果,整个流程让我对数据挖 掘中数据分析处理的基本方法有了深入的了解,特别是决策树模型应用的理解, 同时,也学会了如何使用决策树通过建模和直观化显示发现数据库中的关系(即链接)以及利用这些链接与数据中的案例组相对应关系可以通过建模可详细研究 这些组并描绘其特征,增强了运用决策树模型和聚类分析模型的能力。通过这次学习让我意识到,对于数据我们不仅要能利用统计来分析它的规律, 也要能会通过数据挖掘软件来挖掘数据当中的潜在信息, 并且利用数据挖掘所得到的有利信息更好的服务于数据使

20、用者。6、大总结坚持好一段时间, 终于把完成了任务, 通过这几次实验报告的实践操作, 我 收获很大,不但学习相关数据挖掘的知识,关于SPSS了解更多,操作也比原来熟练多了。虽然过程中有点折磨过,但当你克服了,耐心去一步一步操作,那些 烦躁的心情就会慢慢消失,还得要有耐心,认真的态度去操作,才能有结果。关联分析是一个很有用的数据挖掘模型, 能够帮助企业做很多很有用的产品组合推荐、 优惠促销组合, 同时也能指导货架摆放是否合理, 还能够找到更多的潜在客户,的确真正的把数据挖掘落到实处。 关联分析具体能用来做什么呢?可以一句话来概括:最大限度地从你口袋里面掏出更多的钱买我的产品。1 .通过关联规则,

21、推出相应的促销礼包或优惠组合套装,快速帮助提高销售额。如自行车针对不同人群,来制定有效的销售方案。2 .零售超市或商场,可以通过产品关联程度大小,指导产品合理摆放,方便顾客最购买更多其所需要的产品。 最常见的就是超市里面购买肉和购买蔬菜水果等货架会摆放得很近, 目前就是很多人会同时购买肉与蔬菜, 产品的合理摆放也是提高销售的一个关键。3 .进行相关产品推荐或者挑选相应的关联产品进行精准营销。最常见的是你在亚马逊或京东购买产品的时候, 旁边会出现购买该商品的人, 有百分之多少还会购买如下的产品, 快速帮助顾客找到其共同爱好的产品。 物以类聚, 人以群分。例如,穷人一般和穷人在一起,富人也喜欢和富

22、人在一起。还有数据挖掘的人喜欢和数据挖掘的人打交道,都离不开这些鸟道理。4 .寻找更多潜在的目标客户。 例如: 100 人里面, 购买 A 的有 60 人, 购买 B 的有 40 人,同时购买A 和 B 的有 30 人,说明 A 里面有一半的顾客会购买B ,反推而言。如果推出类似B 的产品,除了向产品 B 的用户推荐(因为新产品与B 的功能效果比较类似)之外,还可以向 A 的客户进行推荐,这样就能最大限 度地寻找更多的目标客户。决策树分析法是常用的风险分析决策方法。 该方法是一种用树形图来描述各方案在未来收益的计算。 比较以及选择的方法, 其决策是以期望值为标准的。 人们对未来可能会遇到好几种不同的情况。 每种情况均有出现的可能, 人们目前无法确知,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论