第13章-Oracle数据挖掘技术_第1页
第13章-Oracle数据挖掘技术_第2页
第13章-Oracle数据挖掘技术_第3页
第13章-Oracle数据挖掘技术_第4页
第13章-Oracle数据挖掘技术_第5页
已阅读5页,还剩53页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、,第13章 Oracle数据挖掘技术,复 习 提 问,回顾 Oralce SQL优化原则 Oralce SQL语句优化方法 引入 如何使企业能够自动快速提取隐含的模式和商机,减少风险,并构建高级商务智能应用程序? 如何帮助企业做出预测、产生新的发现并更好地应用现有数据?,复习1:Oralce SQL优化原则,目标: 减少服务器资源消耗(主要是磁盘IO); 设计方面: 尽量依赖oracle的优化器,并为其提供条件; 合适的索引,索引的双重效应,列的选择性; 编码方面: 利用索引,避免大表FULL TABLE SCAN; 合理使用临时表; 避免写过于复杂的sql,不一定非要一个sql解决问题; 在

2、不影响业务的前提下减小事务的粒度;,复习2:Oralce SQL语句优化方法,Tunning Tip的各个方面 1.不要让Oracle做得太多; 2.给优化器更明确的命令; 3.减少访问次数; 4.细节上的影响;,复习2:Oralce SQL语句优化方法,基于索引的SQL语句优化 1. IS NULL 与 IS NOT NULL 2. 联接列 3. 带通配符(%)的like语句 4. Order by语句 5. NOT 6. IN和EXISTS 7.用表连接替换EXISTS 8.用EXISTS替换DISTINCT 9.用WHERE替代ORDER BY 10.用UNION替换OR (适用于索引列

3、) 11.用IN来替换OR,一、Oracle数据挖掘概念 二、Oracle数据挖掘特点 三、Oracle数据挖掘使用方式 四、Oracle数据挖掘功能安装 五、Oracle数据挖掘应用,主要内容,一、Oracle数据挖掘概念,Oracle 数据挖掘(Oracle Data Mining,简称ODM)所提供的数据挖掘功能嵌入在Oracle 数据库中,它使应用程序开发人员和数据分析人员能够挖掘数据、查找隐藏的模式,拥有洞察力,并构建高级商务智能应用程序,提高系统运行性能。 数据挖掘(Data Mining,简称DM):一般指从大量数据中挖掘出隐含的、未知的并有潜在价值的信息的非平凡过程。数据挖掘是

4、一种决策支持过程,是利用各种分析工具在海量数据中高度自动化发现模型和数据之间关系,做出归纳性推理,从中挖掘出潜在的模式的过程。这些模型和关系可以帮助决策者调整市场策略,减少风险,做出正确的决策。 简而言之,数据挖掘的目的就是从大量的原始数据中“淘金”,就是从数据中获取知识的过程。,二、Oracle数据挖掘特点,Oracle数据挖掘功能可以最大限度地提高可扩展性,使系统资源的有效使用。其数据挖掘功能在Oracle数据库提供了以下诸多优点: (1) 无须移动和数据格式转换。目前有些数据挖掘产品需要不断从企业的数据库中将数据导出,并转化为一个专门的格式存储和挖掘。而对于Oracle数据挖掘,并不需要

5、数据的移动或格式转换。这使得整个数据挖掘过程简单、方便,节省时间。 (2) 安全性。企业的数据是由Oracle数据库的专门安全保护机制负责。针对不同需要的数据挖掘过程需要相应的数据库权限。只有具有适当权限的用户才能得到(或申请)数据挖掘模型。,二、Oracle数据挖掘特点,(3) 数据准备和管理。大多数的数据必须被净化、过滤、归一化、采样和转换,以各种方式才能挖掘。大约80%在数据挖掘项目的工作往往需要准备特定数据。Oracle数据挖掘可以自动完成数据准备管理的关键步骤。此外,Oracle数据库提供了广泛的管理工具准备和管理数据。 (4) 易于数据刷新。在Oracle数据库的挖掘过程随时访问刷

6、新的数据。Oracle数据挖掘的结果基础上可以很容易地呈现当前数据,从而最大限度地提高其时效性和针对性。 Oracle数据库分析。Oracle数据库提供了许多先进的功能分析和商业智能。可以很容易地集成Oracle数据挖掘与其他的分析功能的数据库,如统计分析和OLAP。,二、Oracle数据挖掘特点,(5) Oracle数据库分析。Oracle数据库提供了许多先进的功能分析和商业智能。可以很容易地集成Oracle数据挖掘与其他的分析功能的数据库,如统计分析和OLAP。 (6) Oracle技术集。可以利用Oracle一个较大的业务框架技术范围内整合数据挖掘智能或科学研究等各个方面。 (7) 域环

7、境。数据挖掘模型都必须建立、测试、验证、管理和部署在其相应的应用程序域环境。数据挖掘的结果可能需要进行处理后,作为特定领域的一部分计算(例如,计算估计的风险和响应概率)然后保存到永久存储库或数据仓库。使用Oracle 数据,可以在相同的环境中完成数据挖掘过程。 (8) 应用程序编程接口。提供PL/ SQL、Java API和SQL语言多种方式直接访问到Oracle数据挖掘功能库。,三、Oracle数据挖掘使用方式,Oracle 通过两种兼容的 API 访问数据库中数据挖掘功能。分别是APIODM Java API 和 ODM DBMS_DM PL/SQL API。,ODM JAVA API 应

8、用程序开发人员可以使用 ODM 的 Java API 来利用 ODM 和 Oracle 数据库的特性、可伸缩性和安全性,以便构建高级 BI 应用程序。ODM 的 Java API 所提供的对数据挖掘函数的编程控制能力使开发人员能够自动执行数据准备、模型构建和模型计分操作。对于模型构建,ODM Java API 支持“挖掘函数”的概念(例如,分类、关联或集群等)和可选的“挖掘算法设置”。Oracle 数据挖掘为所有算法设置都提供了合适的缺省值。 ODM Java API 支持与 Web 和 J2EE 应用程序的紧密集成,并确保跨平台的可移植性。与试图将数据挖掘工具转换为数据挖掘应用程序相比,OD

9、M Java API 使 Oracle 数据挖掘成为开发基于 Java 的数据挖掘应用程序的首选平台。,三、Oracle数据挖掘使用方式,ODM DBMS_DM PL/SQL API 应用程序开发人员可以使用 ODM 的 PL/SQL API,通过使用一组可以在 PL/SQL 程序块调用的 SQL 基元来创建高级 BI 应用程序。ODM 的 PL/SQL API 提供了一种大多数 Oracle 服务器开发人员和数据库管理员 (DBA) 所熟悉的语言和开发方法。 PL/SQL API 通过两个包提供给用户: DBMS_DM DMBS_DM_TRANSFORM ODM 的 PL/SQL API 支

10、持接收器工作特性 (ROC) 计算,通过尽量减小误确认率和误报错率来帮助用户选择模型。 PL/SQL API 支持跨用户模式或数据库实例以原生格式导出和导入所有受支持的模型。这样就可以建立从分析和开发环境到生产环境的“生产化”数据挖掘模型。,四、Oracle数据挖掘功能安装,下面结合Oracle11g和SQL Developer3.2开发工具,具体介绍Oracle数据挖掘功能的安装与使用过程。 ODM安装要求 1. ODM使用主要满足下列三个条件: 安装Oracle Database 12c or Oracle Database 11g Release 2软件; 安装SQL Developer

11、客户端开发工具; 安装Data Miner Repository 库(需安装在Oracle 数据库中),四、Oracle数据挖掘功能安装,2. 安装步骤 按照以下步骤完成ODM安装: (1) 步骤1 安装Oracle数据库12C或Oracle数据库11g第2版。 要使用Oracle数据挖掘,你必须连接到Oracle数据库,满足下列要求: 安装Oracle数据挖掘的选项。安装时自动安装Oracle数据库企业版的Oracle数据挖掘。 安装Oracle Text。当您安装Oracle数据库企业版,自动安装Oracle Text。 安装Oracle XML DB。 安装Oracle数据库企业版时自动

12、安装Oracle XML DB。,四、Oracle数据挖掘功能安装,(2) 步骤2 安装SQL Developer的客户端。 (3) 步骤3 安装后,Oracle示例数据挖掘库“设置Oracle数据挖掘”。 安装数据挖掘库。,四、Oracle数据挖掘功能安装,ODM安装过程 1. 概述 Oracle SQL Developer3.0以上版本中提供了Oracle数据挖掘的图形用户界面(GUI)。为了使用Oracle数据挖掘GUI执行数据挖掘,必须完成以下三个设置任务: (1) 创建一个用于数据挖掘的数据库用户帐户。 (2) 并授予该用户具有连接数据权限。 (3) 安装Oracle Data Mi

13、ner 库。,四、Oracle数据挖掘功能安装,2. 安装过程 首先需要创建一个数据挖掘的用户帐户如“dmuser”。 然后通过一个Oracle数据库客户端的软件SQL Developer执行一系列操作。创建数据挖掘用户时以sys管理员身份连接到Oracle数据库,然后创建使用该连接的数据挖掘用户。具体操作过程如下:,四、Oracle数据挖掘功能安装,(1) 打开SQL开发人员,双击sqldeveloper.exe在SQL Developer中的解压缩目录。例如,双击C: SQLDev sqldeveloper.exe,如图13-1所示。 图13-1 Sqldeveloper启动,四、Orac

14、le数据挖掘功能安装,(2) 在SQL Developer中连接“选项卡”,用鼠标右键单击“连接”,并从弹出的菜单中选择“新建连接”。如图13-2所示。 图13-2 建立数据库连接,四、Oracle数据挖掘功能安装,(3) 在下列弹出的对话框中输入下列参数,如图13-3所示。,四、Oracle数据挖掘功能安装,图13-3 参数设置,四、Oracle数据挖掘功能安装,(4) 创建一个SQL Developer 连接的Data Miner 用户。 可以在Oracle中创建此连接用户,或者通过使用SQL Developer中“连接”标签或“数据挖掘”标签完成创建。SQL Developer中连接出现

15、在两个标签。 创建一个连接的数据挖掘用户,按照下列步骤操作: 在弹出的对话框中输入以下参数值,如图13-4所示。,四、Oracle数据挖掘功能安装,图13-4 数据挖掘用户创建,四、Oracle数据挖掘功能安装,这样在左侧连接窗口显示SQL Developer中“连接”选项卡显示两个用户连接,如图135所示。 图13-5 创建dmuser用户连接状态 注意:当您激活连接SQL Developer中连接“选项卡,SQL Developer的工作表窗口会自动打开该用户的。,四、Oracle数据挖掘功能安装,(5) 安装数据挖掘库。 现在已经创建了数据挖掘用户(dmuser)帐户了,并为该用户创建一

16、个SQL Developer连接。然后,需要自动安装数据挖掘库。 操作过程只需单击Oracle数据挖掘“选项卡(类似于SQL Developer中“连接”选项卡,然后从“数据挖掘”选项卡选择dmuser连接用户。 具体操作步骤如下: 从SQL Developer菜单栏选择:select View Data Miner Data Miner Navigator, 如图13-6所示:,四、Oracle数据挖掘功能安装,图13-6 数据挖掘连接,四、Oracle数据挖掘功能安装,单击“数据挖掘”选项后左下方连接栏出现SQL Developer中“连接”项。 图13-7 Dmuser数据挖掘连接,四、

17、Oracle数据挖掘功能安装,然后开始安装数据挖掘库。 双击在dmuser(而不是管理员用户),结果弹出窗口显示“没有在数据库中安装数据挖掘库,并询问是否要安装数据挖掘库?”如图13-8所示。 图13-8 数据挖掘库安装提示,四、Oracle数据挖掘功能安装,单击“是”以启动安装过程。在“连接信息”对话框中输入SYS管理员密码。如图13-9所示。 图13-9 连接信息对话框 单击“确定”继续,在库安装设置对话框中选择数据挖掘库帐户“ODMRSYS”的默认表空间为“USERS”和临时表空间“TEMP”。如图12-10所示。 图13-10 数据挖掘库安装设置,四、Oracle数据挖掘功能安装,然后

18、出现安装数据挖掘库对话框,如图13-11所示。预选“安装演示数据”选项(用于后续Oracle数据挖掘演示用数据)。 图13-11 安装挖掘库 单击“开始”,则开始安装数据挖掘库。安装远程数据库大约需要10分钟和2分钟的本地数据库安装。滚动条提供了安装过程的进展的可视化进度,如图13-12所示。 图13-12 挖掘库安装进度 当安装完成后,单击“关闭”以关闭该对话框。 现在已经准备好执行数据挖掘与dmuser帐户。接下来就可以使用Oracle数据挖掘11g的数据挖掘功能了。,五、Oracle数据挖掘应用,ODM开发过程 Oracle数据挖掘模块的开发过程主要由以下几个部分组成。 数据提取 在开发

19、数据挖掘模块之前,客户方已经实施了一套infoplus实时数据库系统对生产设备的监控点的状态进行监控并把记录保存在数据库中,因此在开发数据挖掘模块的时候根据需要通过该软件提供的JDBC-ODBC接口从实时数据库的历史记录中提取出所需的数据。 数据清理 不完整的、含噪声的和不一致的数据是目前大型、现实世界数据库或者数据仓库中存在的共同问题。数据清理过程就是通过填写空缺的值,平滑噪声数据,识别、删除孤立点,并解决不一致的数据。,五、Oracle数据挖掘应用,数据转换 数据转换是将数据转换成适合于机器挖掘的格式。Oracle Data Mining关联规则模块所采用的算法是传统的Apriori算法,

20、是对Oracle关系数据库中一张二进制表进行处理,在其中寻找出频繁项集,并最终产生出满足设定的阀值的强关联规则。因此,在数据转换的过程中,根据所取控制点数据与该点的极限值(最大值max、最小值min和最大的增量斜率的绝对值kmax)进行比较,从而以二进制数据显示出该点在该时刻所处的状态,并把所有的经过处理、转换的控制点数据存储在Oracle关系表中。,五、Oracle数据挖掘应用,数据挖掘 在应用ODM的过程中,首先根据已经进行的工作并对挖掘所需的模式、算法、数据规格等进行定义构建数据挖掘模型。 (1)连接数据挖掘服务器(DMS)。 (2)对输入的数据进行描述,主要是针对输入数据的组织形式和规

21、格进行描述。 (3)对使用的数据挖掘模型和算法进行定义,用户可以通过Jsp页面与JavaBean连接ODM API,对相关的参数进行设定,如最小支持度、最小置信度以及最大关联长度等。 (4) 构建数据挖掘模型。 在模型构建完成之后即可以把模型提交给数据挖掘服务器进行处理。在数据挖掘服务器进行处理的过程中,可以通过调用数据挖掘任务模块来显示当前DMS所处状态。在DMS处理完成之后会显示Success状态。,五、Oracle数据挖掘应用,ODM开发案例 Oracle数据挖掘支持监督(supervised)和无监督(unsupervised)学习的数据挖掘。监督数据挖掘预测目标值根据历史数据。而无监

22、督数据挖掘用于发现未知领域或不确定目标。 ODM函数 用于监督的函数有: Classification Regression Attribute Importance 用于无监督的函数有: Clustering Association Feature Extraction Anomaly Detection (one-class classification),五、Oracle数据挖掘应用,开发实例 本节通过创建一个新的数据挖掘项目来学习ODM使用。可以利用现有的数据挖掘用户进行连接。 注:各版本的SQL Developer窗口的布局和内容可能与下面介绍的例子有所不同。 (1)要创建一个新的项

23、目,选择“数据挖掘”选项卡,然后执行以下步骤: 选择Data Miner标签,然后连接上述创建的dmuser连接,如图13-13所示。 图13-13 Dmuser连接,五、Oracle数据挖掘应用,(2)双击dmuser连接然后选择新建项目“New Project”选项,如图1314所示。 图13-14 新建项目 (3)在“Create Project”创建项目窗口中,输入“High Value”作为项目名称,然后单击“OK”确定按钮,如图13-15所示。 图13-15 建立项目名,五、Oracle数据挖掘应用,然后在新项目列表中出现下面的新建项目连接节点“High Value”,如图13-1

24、6所示。 图13-16 新建High Value项目,五、Oracle数据挖掘应用,(4)构建和运行一个分类模型 在这部分内容中,将介绍如何构建模型和预测基于性别的客户汇总数据。因此,需要指定一个分类模型。默认情况下,Oracle数据挖掘中选择一个分类模型的支持的所有算法。 这里,我们定义使用一个分类节点算法模型。然后,运行分类节点,以创建该模型。 首先,点击模型在组件面板中显示可用列表,如图1317所示。 图13-17 模型列表,五、Oracle数据挖掘应用,(5)然后,将分类节点从右侧模型面板中拖到左侧工作流程窗口中,如图13-18所示。 图13-18 运行分类节点 (6) 节点拖放到工作

25、流后。等待一会,一个“生成类”节点出现在工作流程中,如图1319所示。 图13-19 生成类节点,五、Oracle数据挖掘应用,(7)然后应指定一个或多个属性的分类器构建过程,如图13-20所示。下一步连接的数据源节点FAST_TABLE使用上述相同的方法建立分类节点。 图13-20 FAST_TABLE节点上建立分类节点,五、Oracle数据挖掘应用,(8)然后出现如图1321所示的编辑分类窗口。 图13-21 编辑分类窗口 注意: 如果一个黄色的“!”指示灯会显示在目标字段旁边。这意味着必须选择该属性。,五、Oracle数据挖掘应用,(9)在“编辑分类”窗口中,选择“CUST_GENDER

26、作为目标属性,如图1322所示。 图13-22 目标属性选择 注意: 虽然上述操作不是必需的,可以定义一个案例ID来唯一确定每个记录。这样会造成该选项未定义。如前所述,所有四个分类建模算法是默认选中的。除非事先指定,否则,它们将被自动运行。或者,您可以修改每个算法的具体设置,使用其中高级选项按钮来完成。,五、Oracle数据挖掘应用,单击高级编辑分类窗口显示“高级设置”窗口的底部,如图1323所示。 注意: 图13-23 高级设置功能 “高级设置”窗口中可以指定数据的使用(Data Usage)、算法设置(Algorithm Setting)和性能设置(Performance Settings

27、)三个分类选项。 还可以去选择(取消)该窗口中的任意算法。,五、Oracle数据挖掘应用,(10)此例选择支持向量机(Support Vector Machine,SVM)算法,并单击“算法设置”选项卡。然后,在内核功能选项,改变线性系统确定的设置,如图13-24所示。 图13-24 算法设置 注意: 需要更改此支持向量机(SVM)算法线性系统测定值的设定值,以确保用户模型透明度。透明度是指模型的能力模式传达给用户的逻辑或理由。 可以随意查看任意每种算法的选项内容,但是不要修改算法的其他默认设置。当完成查看内容后,可以单击“确定”按钮保存SVM算法设置,并关闭“高级设置”窗口。最后,在“编辑分

28、类”窗口中单击“确定”保存更改。,五、Oracle数据挖掘应用,(11)准备运行分类构建节点。 首先,选择生成类节点,并使用该工作流的“详细信息”选项卡,更改名称、性别预测。如图1325所示。 图13-25 选择生成类节点 在“属性检查模型”选项中,可以看到每个所选算法的当前状态,如图1326所示。 图13-26 属性检查选项内容,五、Oracle数据挖掘应用,在所建模型中,在“Property Inspector”属性库页面中找到“Perform Test”项中“Split for test”测试选项上,改变测试数据分割值为50,如图1327所示: 图13-27 测试数据分割值设置 使用此设

29、置表明,Oracle数据挖掘中的数据样本分割生成的建模数据和测试数据在50/50比例。,五、Oracle数据挖掘应用,在所建模型中,在“Property Inspector”属性库页面中找到“Perform Test”项中“Split for test”测试选项上,改变测试数据分割值为50,如图1327所示: 图13-27 测试数据分割值设置 使用此设置表明,Oracle数据挖掘中的数据样本分割生成的建模数据和测试数据在50/50比例。,五、Oracle数据挖掘应用,(12)现在可以构建数据模型。右键单击该“Predict Gender node”预测性别节点,并从弹出的快捷菜单中选择“RUN

30、”运行。运行之前会出现一个绿色的齿轮图标表示服务器进程运行节点上的边界,通过“工作流程作业”选项可以查看当前模型作业的构建状态。当构建完成后,状态栏会显示一个绿色的对勾。 图13-28 工作流作业构建,五、Oracle数据挖掘应用,在工作流程窗格中可以看到构建完成节点的边界为从一个绿色的齿轮转动状态转变成一个绿色的对勾,表示构建完成如图13-29所示。 图13-29 构建结点的边界,五、Oracle数据挖掘应用,一旦构建过程完成后,就可以看到出现几条有关建立使用“Property Inspector”属性库信息。例如,选择预测性别工作流程中的节点,然后在属性检查器中选择“模型”选项卡,如图13

31、30所示。 图13-30 模型状态信息 从图1330中可以看出所有四个模型都已经成功创建。性别属性都具有相同的目标(CUST_GENDER),但他们使用了不同的分类算法。而源数据根据前述50/50比例被自动分为测试数据和模型建立数据。,五、Oracle数据挖掘应用,(13)预览模型。当执行性别预测结束,表明已建成并测试了四种分类模式。然后,我们可以查看和比较不同模型结果。通过查看了某一个数据模型,可以看到作为分析所用汇总的销售数据和客户的人口统计数据它们是如何联系在一起的。这里,还可以看到的相对业绩的分类模型。在“Predict Gender”预测性别节点上单击鼠标右键并从弹出的快捷菜单中选择“Compare Test Results”比较试验结果。如图1331所示。 图13-31 比较测试结果,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论