数据挖掘基础教程SQLServer_第1页
数据挖掘基础教程SQLServer_第2页
数据挖掘基础教程SQLServer_第3页
数据挖掘基础教程SQLServer_第4页
数据挖掘基础教程SQLServer_第5页
已阅读5页,还剩108页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

-.z.数据挖掘基础教程欢迎使用MicrosoftAnalysisServices数据挖掘基础教程。MicrosoftSQLServer提供了一个用来创建和处理数据挖掘模型的集成环境。在本数据挖掘基础教程中,您将完成一个用于目标邮寄活动的方案,在此方案中您将创建三个模型,用来分析客户购买行为并确定潜在购买目标。本教程说明了MicrosoftSQLServerAnalysisServices中所包含的数据挖掘算法、挖掘模型查看器和数据挖掘工具的使用方法。虚构公司AdventureWorksCycles用于所有的示例。熟练使用数据挖掘工具后,建议您完成数据挖掘中级教程,该教程说明了预测、市场篮分析、时序、关联模型、嵌套表以及顺序分析和聚类分析的使用方法。教程方案在本教程中,您是AdventureWorksCycles的一名员工,需要根据历史购买情况来详细了解该公司的客户,然后使用这些历史数据进行可用于营销的预测。公司以前从未进行过数据挖掘,因此您必须创建一个专门用于数据挖掘的新数据库并建立几个数据挖掘模型。学习内容本教程将讲述如何创建和使用数种不同类型的数据挖掘模型。还将述如何创建挖掘模型的副本以及如何对掘模型应用筛选器。随后,您将处理新模型并使用提升图评估该模型。在该模型完成之后,将使用钻取功能从基础挖掘结构检索其他数据。在SQLServer2008中,Microsoft引入了几个新功能,可帮助您开发自定义数据挖掘模型并且更有效地使用结果。维持测试集-现在,当创建挖掘结构时,可以将挖掘结构中的数据分为定型集和测试集。挖掘模型筛选器-现在,可以将筛选器附加到挖掘模型,并在定型和测试期间应用筛选器。钻取到结构事例和结构列-现在,可以从挖掘模型中的通用模式方便地移到数据源中的可行详细信息。本教程分为以下几课:第1课:准备AnalysisServices数据库(数据挖掘基础教程)在本课程中,您将学习如何创建新的AnalysisServices数据库,添加数据源和数据源视图,以及准备将用于数据挖掘的新数据库。第2课:生成TargetedMailing结构(数据挖掘基础教程)在本课中,您将学习如何创建可用作目标邮寄方案一部分的挖掘模型结构。第3课:添加和处理模型在本课中,您将学习如何向结构中添加模型。您创建的模型是用如下算法生成的:Microsoft决策树Microsoft聚类分析MicrosoftNaiveBayes第4课:浏览TargetedMailing模型(数据挖掘基础教程)在本课中,您将学习如何使用查看器浏览和解释在每个模型中发现的内容。第5课:测试模型(数据挖掘基础教程)在本课中,您将创建*个TargetedMailing模型的副本,添加一个挖掘模型筛选器以将定型数据限制在特定客户集,然后评估该模型的可行性。第6课:创建和使用预测(数据挖掘基础教程)在本数据挖掘基础教程的最后一课中,您将使用该模型预测哪些客户最有可能购买自行车。随后,您将钻取到基础事例以获取联系信息。要求请确保已安装下列软件:MicrosoftSQLServer2008R2MicrosoftSQLServerAnalysisServicesAdventureWorksDW2008R2数据库。第1课:准备AnalysisServices数据库(数据挖掘基础教程)您是AdventureWorksCycles的一名新员工,需要使用SQLServer2008设计一个商业智能应用程序。AdventureWorksCycles希望利用您的AnalysisServices数据挖掘经验发现有关已经购买自行车的人的兴趣和可行信息。然后,他们希望您预测哪些预期客户将来最有可能购买自行车。在SQLServer中设计此应用程序时,首先根据AnalysisServices项目模板在BusinessIntelligenceDevelopmentStudio中创建SQLServerAnalysisServices项目。创建AnalysisServices项目后,再定义一个或多个数据源。然后,根据选自数据源的表和视图,定义名为“数据源视图”的元数据视图。在本课中,您将创建一个AnalysisServices项目,定义一个单个数据源,并向数据源视图添加一个表子集。本课程包括以下任务:创建AnalysisServices项目(数据挖掘基础教程)创建数据源(数据挖掘基础教程)创建数据源视图(数据挖掘基础教程)创建AnalysisServices项目(数据挖掘基础教程)每个MicrosoftSQLServerAnalysisServices项目都可为单个AnalysisServices数据库中的对象定义架构。AnalysisServices数据库包含挖掘结构和挖掘模型、联机分析处理(OLAP)多维数据集和补充对象(例如数据源和数据源视图)。在本教程中,我们将使用AdventureWorksDW2008R2数据库。默认情况下,AnalysisServices使用新项目的localhost实例。如果使用命名实例或者另一台服务器,则必须首先创建和打开该项目,然后更改实例名称。创建AnalysisServices项目打开BusinessIntelligenceDevelopmentStudio。在“文件”菜单上,指向“新建”,然后选择“项目”。确保已选中“项目类型”窗格中的“商业智能项目”。确保已选中“模板”窗格中的“AnalysisServices项目”。在“名称”框中,将新项目命名为ASDataMining2008。单击“确定”。更改存储数据挖掘对象的实例在BusinessIntelligenceDevelopmentStudio中,选择“项目”菜单中的“属性”。在“属性页”窗格左侧的“配置属性”下,单击“部署”。在“属性页”窗格右侧的“目标”下,确保“服务器”名称为localhost。如果使用的是其他实例,请键入该实例的名称。单击“确定”。创建数据源(数据挖掘基础教程)“数据源”是一种数据连接,在项目中保存和管理,并部署到MicrosoftSQLServerAnalysisServices数据库。除了其他所有必需的连接属性外,数据源还包含源数据所在的服务器和数据库的名称。重要提示数据库的名称为AdventureWorksDW2008R2。创建数据源在“解决方案资源管理器”中,右键单击“数据源”文件夹,然后选择“新建数据源”。在“欢迎使用数据源向导”页面中,单击“下一步”按钮。在“选择如何定义连接”页上,单击“新建”向AdventureWorksDW2008R2数据库中添加连接。在连接管理器中的“访问接口”列表中,选择“本机OLEDB\SQLServerNativeClient10.0”。在“服务器名称”框中,键入或选择安装了AdventureWorksDW2008R2的服务器的名称。例如,如果是在本地服务器上承载该数据库,请键入localhost。在“登录到服务器”组中,选择“使用Windows身份验证”。重要提示实施者应尽可能使用Windows身份验证,因为它提供的身份验证方法比SQLServer身份验证更加安全。而提供SQLServer身份验证只是为了向后兼容。在“选择或输入数据库名称”列表中,选择AdventureWorksDW2008R2,然后单击“确定”。单击“下一步”。在“模拟信息”页中,单击“使用服务**”,再单击“下一步”。在“完成向导”页中,请注意数据源名称默认为AdventureWorksDW2008R2。单击“完成”。此时,解决方案资源管理器的“数据源”文件夹中将出现刚创建的新数据源AdventureWorksDW2008R2。创建数据源视图(数据挖掘基础教程)数据源视图是基于数据源生成的,定义用来填充数据仓库的数据的子集。您可以使用数据源视图来修改数据的结构,使它与项目的关系更密切。通过数据源视图,可以选择与特定项目相关的表,建立表之间的关系,并添加计算列和命名视图,而不必修改原始的数据源。创建数据源视图在解决方案资源管理器中,右键单击“数据源视图”并选择“新建数据源视图”。在“欢迎使用数据源视图向导”页中,单击“下一步”。在“选择数据源”页的“关系数据源”下方,选择在上一个任务中创建的AdventureWorksDW2008R2

数据源。单击“下一步”。注意若要创建数据源,请单击“新建数据源”,启动数据源向导。在“选择表和视图”页上,选择下列对象,然后单击右箭头键,将它们包括在新数据源视图中:ProspectiveBuyer(dbo)-预期自行车购买者的表vTargetMail(dbo)-有关以前的自行车购买者的历史数据的视图单击“下一步”。在“完成向导”页上,系统默认将数据源视图命名为AdventureWorksDW2008R2。将该名称更改为TargetedMailing,然后单击“完成”。新数据源视图随即在“TargetedMailing.dsv[设计]”选项卡中打开。第2课:生成TargetedMailing结构(数据挖掘基础教程)AdventureWorksCycles的市场部希望通过向目标特定客户发送的方式来提高销售量。公司的数据库AdventureWorksDW2008R2包含一个现有客户列表和一个潜在的新客户列表。公司希望通过调查现有客户的特征来发现适用于潜在客户的模式。AdventureWorksCycles希望使用发现的模式来预测哪些潜在客户最有可能购买自己的自行车。在本课程中,您将使用“数据挖掘向导”来创建TargetedMailing结构。完成本课程中的任务之后,您将创建一个具有一个模型的挖掘结构。由于创建结构涉及到很多步骤和重要的概念,因此我们将此过程分成以下三个任务:创建目标挖掘模型结构(数据挖掘基础教程)指定数据类型和内容类型(数据挖掘基础教程)为结构指定测试数据集(数据挖掘基础教程)创建目标挖掘模型结构(数据挖掘基础教程)创建目标方案的第一步是使用BusinessIntelligenceDevelopmentStudio中的数据挖掘向导创建新的挖掘结构和决策树挖掘模型。在本任务中,您将基于Microsoft决策树算法创建初始挖掘结构。若要创建此结构,需要首先选择表和视图,然后标识将用于定型的列和将用于测试的列。创建用于目标方案的挖掘结构在解决方案资源管理器中,右键单击“挖掘结构”并选择“新建挖掘结构”启动数据挖掘向导。在“欢迎使用数据挖掘向导”页上,单击“下一步”。在“选择定义方法”页上,确保已选中“从现有关系数据库或数据仓库”,再单击“下一步”。在“创建数据挖掘结构”页的“您要使用何种数据挖掘技术?”下,选择“Microsoft决策树”。注意如果收到警告,告知无法找到数据挖掘算法,则项目属性可能配置不正确。当项目尝试从AnalysisServices服务器检索数据挖掘算法列表却找不到服务器时,就会出现此警告。默认情况下,BIDevelopmentStudio会将localhost用作服务器。如果要使用其他实例或命名实例,则必须更改项目属性。单击“下一步”。在“选择数据源视图”页上的“可用数据源视图”窗格中,选择TargetedMailing。可单击“浏览”查看数据源视图中的各表,然后单击“关闭”返回该向导。单击“下一步”。在“指定表类型”页上,选中vTargetMail的“事例”列中的复选框以将其用作事例表,然后单击“下一步”。稍后您将使用ProspectiveBuyer表进行测试,不过现在可以忽略它。在“指定定型数据”页上,您将为模型至少标识一个可预测列、一个键列以及一个输入列。选中BikeBuyer行中的“可预测”列中的复选框。注意请注意窗口底部的警告。只有在至少选中一个“输入”列和一个“可预测”列后,才能导航至下一页。单击“建议”打开“提供相关列建议”对话框。只要选中至少一个可预测属性,即可启用“建议”按钮。“提供相关列建议”对话框将列出与可预测列关联最密切的列,并按照与可预测属性的相互关系对属性进行排序。显著相关的列(置信度高于95%)将被自动选中以添加到模型中。查看建议,然后单击“取消”忽略建议。注意如果单击“确定”,所有列出的建议都将在向导中标记为输入列。如果仅同意其中的*些建议,则必须手动更改值。确认在CustomerKey行中已选中“键”列中的复选框。注意如果数据源视图中的源表表示一个键,则数据挖掘向导将自动选择该列作为模型的键。选中以下行中“输入”列中的复选框。可通过下面的方法来同时选中多个列:突出显示一系列单元格,然后在按住Ctrl的同时选中一个复选框。AgemuteDistanceEnglishEducationEnglishOccupationGenderGeographyKeyHouseOwnerFlagMaritalStatusNumberCarsOwnedNumberChildrenAtHomeRegionTotalChildrenYearlyIne在该页的最左侧的列中,选中以下行中的复选框。AddressLine1AddressLine2DateFirstPurchaseEmailAddressFirstNameLastName确保这些行仅选择了左侧列中的复选标记。这些列将添加到结构中,但不会包含在模型中。但是,模型生成后,它们将可用于钻取和测试。单击“下一步”。指定数据类型和内容类型(数据挖掘基础教程)您已经选择了要用于生成结构和为模型定型的列,现在可以对向导设置的默认数据类型和内容类型进行任何必要的更改。检查和修改每列的内容类型和数据类型在“指定列的内容和数据类型”页上,单击“检测”运行用来确定每列的默认数据类型和内容类型的算法。查看“内容类型”和“数据类型”列中的各项;如有必要,请进行更改,以确保设置与下表所示一致。通常,向导会检测数值,并分配相应的数值数据类型;但有些情况下,您可能想要将数值作为文本处理。例如,GeographyKey应作为文本处理,因为对此标识符进行数学运算是不对的。列内容类型数据类型AddressLine1DiscreteTe*tAddressLine2DiscreteTe*tAgeContinuousLongBikeBuyerDiscreteLongmuteDistanceDiscreteTe*tCustomerKeyKeyLongDateLastPurchaseContinuousDateEmailAddressDiscreteTe*tEnglishEducationDiscreteTe*tEnglishOccupationDiscreteTe*tFirstNameDiscreteTe*tGenderDiscreteTe*tGeographyKeyDiscreteTe*tHouseOwnerFlagDiscreteTe*tLastNameDiscreteTe*tMaritalStatusDiscreteTe*tNumberCarsOwnedDiscreteLongNumberChildrenAtHomeDiscreteLongRegionDiscreteTe*tTotalChildrenDiscreteLongYearlyIneContinuousDouble单击“下一步”。为结构指定测试数据集(数据挖掘基础教程)在数据挖掘向导的最后几个屏幕上,您将把数据拆分成测试集和定型集。随后您将命名您的结构并针对模型启用钻取。指定测试集在创建挖掘结构时将数据分成定型集和测试集,可以立即评估以后创建的挖掘模型的准确性。指定测试集在“创建测试集”页上,将“测试数据百分比”保留其默认值:30。对于“测试数据集中的最大事例数”,请键入1000。单击“下一步”。指定钻取可以针对模型和结构启用钻取。该窗口中的复选框针对命名模型启用钻取,并允许您从用来为模型定型的模型事例检索详细信息。如果基础挖掘结构也已经配置为允许进行钻取,则可以从模型事例和挖掘结构返回详细信息(其中包括挖掘模型中所不包含的列)。命名模型和结构并指定钻取在“完成向导”页上的“挖掘结构名称”中,键入TargetedMailing。在“挖掘模型名称”中,键入TM_Decision_Tree。选中“允许钻取”复选框。查看“预览”窗格。请注意,仅显示出那些选作“键”、“输入”或“可预测”的列。您选择的其他列(例如,AddressLine1)不能用于生成模型,但是将在基础结构中可用,您可以在处理和部署模型之后查询这些列。单击“完成”。第3课:添加和处理模型您在上一课中创建的挖掘结构包含一个基于Microsoft决策树算法的挖掘模型。为了确定目标邮寄的客户,您将创建两个附加模型,然后处理和部署这些模型。在本课中,您将创建一组挖掘模型,这些模型将提示潜在客户列表中最有可能购买产品的客户。若要完成本课程中的任务,您需要使用Microsoft聚类分析算法和MicrosoftNaiveBayes算法。本课程包含以下任务:向TargetedMailing结构中添加新模型(数据挖掘基础教程)处理TargetedMailing结构中的模型(数据挖掘基础教程)向TargetedMailing结构中添加新模型(数据挖掘基础教程)在本任务中,将使用数据挖掘设计器的“挖掘模型”选项卡定义两个附加模型。您将使用Microsoft聚类分析算法和MicrosoftNaiveBayes算法创建模型。之所以选择这两种算法,是因为它们能够预测离散值(例如,自行车购买行为)。创建聚类分析挖掘模型切换到BusinessIntelligenceDevelopmentStudio中数据挖掘设计器的“挖掘模型”选项卡。请注意,设计器显示两列,一列是挖掘结构,另一列是在前一课中创建的TM_Decision_Tree挖掘模型。右键单击“结构”列,选择“新建挖掘模型”。在“新建挖掘模型”对话框中的“模型名称”中,键入TM_Clustering。在“算法名称”中,选择“Microsoft聚类分析”。单击“确定”。新模型现在显示在数据挖掘设计器的“挖掘模型”选项卡中。此模型是用Microsoft聚类分析算法生成的,它将具有相似特征的客户进行分类并预测每个分类的自行车购买行为。虽然您可以修改新模型的列用法和属性,但在本教程中不需要对TM_Clustering模型进行任何更改。创建NaiveBayes挖掘模型在数据挖掘设计器的“挖掘模型”选项卡中,右键单击“结构”列,并选择“新建挖掘模型”。在“新建挖掘模型”对话框中的“模型名称”下,键入TM_NaiveBayes。在“算法名称”中,选择MicrosoftNaiveBayes,再单击“确定”。此时将显示一条消息,说明MicrosoftNaiveBayes算法不支持Age和YearlyIne列,这些都是连续列。单击“是”,以确认此消息并继续下面的操作。新模型将显示在数据挖掘设计器的“挖掘模型”选项卡中。虽然您可以在此选项卡中修改所有模型的列用法和属性,但在本教程中不需要对TM_NaiveBayes模型进行任何更改。处理TargetedMailing结构中的模型(数据挖掘基础教程)必须先部署AnalysisServices项目并处理挖掘结构和挖掘模型,才能浏览或使用创建的挖掘模型。“部署”是将项目发送到服务器并在该服务器上的该项目中创建任意对象。“处理”是指用关系数据源的数据填充AnalysisServices对象的步骤或一系列步骤。模型经过部署和处理后才能使用。确保与HoldoutSeed一致部署项目并处理结构和模型后,数据结构中各行将根据随机数种子随机分配给定型集和测试集。通常,随机数种子是根据数据结构的属性计算的。为了实现本教程教学目的,为确保您的结果与此处所述相同,我们将随机指派一个固定的“维持种子”:12。维持种子用来初始化随机抽样的种子,并确保以大体相同的方式对所有挖掘结构及其模型中的数据进行分区。此值不影响定型集内的事例数,而是将确保分区能够重复。设置HoldoutSeed在BusinessIntelligenceDevelopmentStudio的数据挖掘设计器中,单击“挖掘结构”选项卡或“挖掘模型”选项卡。TargetedMailingMiningStructure显示在“属性”窗格中。确保按F4可以打开“属性”窗格。确保CacheMode已设置为KeepTrainingCases。为HoldoutSeed输入12。部署并处理模型在数据挖掘设计器中,可以处理挖掘结构、与挖掘结构关联的特定挖掘模型,或者结构以及与该结构关联的所有模型。在本任务中,我们将同时处理结构和所有模型。部署项目并处理所有挖掘模型在“挖掘模型”菜单上选择“处理挖掘结构和所有模型”。如果更改了结构,系统将提示您在处理模型之前生成和部署项目。单击“是”。在“处理挖掘结构-TargetedMailing”对话框中单击“运行”。“处理进度”对话框将打开以显示有关模型处理的详细信息。模型处理可能需要一些时间,具体取决于您的计算机。模型处理完成后,在“处理进度”对话框中单击“关闭”。在“处理挖掘结构-<结构>”对话框中单击“关闭”。第4课:浏览TargetedMailing模型(数据挖掘基础教程)处理完项目中的各模型后,可以在BusinessIntelligenceDevelopmentStudio中浏览它们以查找所关注的趋势。由于挖掘模型的结果比较复杂并且原始格式的结果难以理解,因此以可视化方式调查数据通常是了解算法在数据内发现的规则和关系的最简单方法。浏览还可以帮助您了解模型的行为以及在部署之前发现哪个模型的性能最佳。您创建的每个模型都列在数据挖掘设计器的“挖掘模型查看器”选项卡中。用于在AnalysisServices中生成模型的每种算法将返回不同类型的结果。因此,AnalysisServices为每种算法提供了单独的查看器。AnalysisServices还提供了一个适用于所有模型类型的一般查看器。一般内容树查看器显示详细的模型内容信息,该信息因使用的算法不同而不同。在本课中,您将使用三个模型来查看相同的数据。每个模型类型基于不同的算法,为观察数据提供了不同角度。决策树模型告诉您影响自行车购买的各因素。聚类分析模型按照包括客户的自行车购买行为的属性和其他所选属性来对客户进行分组。NaiveBayes模型使您可以浏览不同属性之间的关系。最后,一般内容树查看器显示模型的结构并提供更加丰富的详细信息,其中包括提取的公式和模式以及群集或特定树中事例的计数。单击下列主题,浏览挖掘模型查看器。浏览决策树模型(数据挖掘基础教程)浏览聚类分析模型(数据挖掘基础教程)浏览NaiveBayes模型(数据挖掘基础教程)浏览决策树模型(数据挖掘基础教程)Microsoft决策树算法预测哪些列影响了您基于定型集内的其余列做出的自行车购买决策。Microsoft决策树查看器提供了以下选项卡,用于浏览决策树挖掘模型:决策树依赖关系网络“决策树”选项卡在“决策树”选项卡上,可以检查构成挖掘模型的所有树模型。由于本教程项目中的TargetedMailing模型仅包含单个可预测属性(BikeBuyer),所以只需查看一个树。如果存在更多树,则可以使用“树”框来选择其他树。检查决策树查看器中的TM_Decision_Tree模型会看出,在预测自行车购买行为时,年龄是最重要的因素。有趣的是,按年龄对客户进行分组之后,每个年龄节点的决策树的下一个分支都有所不同。通过浏览“决策树”选项卡,我们可以得出如下结论:没有汽车或者有一辆汽车、年龄在34到40的购买者购买自行车的可能性非常大,居住在太平洋地区、没有汽车或者有一辆汽车的更年轻的单身客户购买汽车的可能性也非常大。在“决策树”选项卡中浏览模型在“数据挖掘设计器”中,选择“挖掘模型查看器”选项卡。默认情况下,设计器将打开添加到结构中的第一个模型(在本例中为TM_Decision_Tree)。使用放大镜按钮调整树的显示大小。默认情况下,Microsoft树查看器仅显示树的前三个级别。如果树级别不到三个,则查看器仅显示现有级别。可以使用“显示级别”滑块或“默认扩展”列表查看更多级别。将“显示级别”滑到第四条。将“背景”值更改为1。通过更改“背景”设置,可以迅速查看每个节点中[BikeBuyer]的目标值为1的事例的数量。请注意,在这种特定的情况下,每个事例均表示一个客户。值1指示该客户之前购买了自行车;值0指示该客户尚未购买自行车。节点的底纹颜色越深,节点中具有目标值的事例所占的百分比越大。将光标放在标记为“全部”的节点上。将出现显示以下信息的工具提示:事例总数非自行车购买者事例的数量自行车购买者事例的数量缺少[BikeBuyer]值的事例的数量或者,将光标放在树中的任何节点上,查看从上级节点到达该节点所需的条件。还可以在“挖掘图例”中查看同样的信息。单击“Age>=38且<45由于您在创建结构和模型时启用了钻取,因此,可以从模型事例和挖掘结构中检索详细的信息,其中包括挖掘模型中所不包含的列(例如,emailAddress和FirstName)。钻取到事例数据右键单击*个节点,然后依次选择“钻取”和“仅限模型列”。每个定型事例的详细信息将以电子表格方式显示。这些详细信息来自您在生成挖掘结构时选作事例表的vTargetMail视图。右键单击*个节点,然后依次选择“钻取”和“模型和结构列”。将显示同一个电子表格,并在末尾处附加结构列。“依赖关系网络”选项卡“依赖关系网络”选项卡显示决定挖掘模型预测能力的各个属性之间的关系。依赖关系网络查看器进一步证实了我们的发现:年龄和地区是预测自行车购买行为的重要因素。在“依赖关系网络”选项卡中浏览模型单击BikeBuyer节点以确定它的依赖关系。依赖关系网络的中间节点(BikeBuyer)表示挖掘模型中的可预测属性。粉色阴影指示所有属性都会对自行车购买行为产生影响。调整“所有”滑块可确定影响最大的属性。向下滑动滑块时,将只保留对[BikeBuyer]列影响最大的属性。通过调整滑块,可以发现年龄和地区是预测个人自行车购买行为的最主要因素。浏览聚类分析模型(数据挖掘基础教程)Microsoft聚类分析算法将事例分组为包含类似特征的分类。在浏览数据、标识数据中的异常及创建预测时,这些分组十分有用。Microsoft分类查看器提供了以下选项卡,用于浏览聚类分析挖掘模型:分类关系图分类剖面图分类特征分类对比“分类关系图”选项卡“分类关系图”选项卡显示挖掘模型中的所有分类。分类之间的线条表示“接近程度”,其明暗度取决于分类之间的相似程度。每个分类的实际颜色表示分类中变量和状态的出现频率。在“分类关系图”选项卡中浏览模型使用“挖掘模型查看器”选项卡顶部的“挖掘模型”列表,可切换到TM_Clustering模型。在“查看器”列表中,选择“Microsoft分类查看器”。在“明暗度变量”框中,选择BikeBuyer。默认变量是Population(全部),但可将其更改为模型中的任意属性,以发现其包含的成员具有所需属性的分类。在“状态”框中选择1,可以浏览那些购买自行车的事例。“密度”图例描述了在“明暗度变量”和“状态”中选定的属性状态对的密度。在此示例中,明暗度最深的分类就是自行车购买者百分比最高的分类。将鼠标悬停在明暗度最深的分类上。工具提示将显示具有BikeBuyer=1属性的事例所占的百分比。选择密度最高的分类,右键单击该分类,然后选择“重命名分类”并键入Bike

Buyers

High以用作日后标识。单击“确定”。查找明暗度最浅(也就是密度最低)的分类。右键单击该分类,然后选择“重命名分类”并键入Bike

Buyers

Low。单击“确定”。单击Bike

Buyers

High分类,并将其拖到窗格的适当区域,以便清楚地查看它与其他分类的连接。选择*个分类时,将此分类连接到其他分类的线条将突出显示,以便您方便地查看此分类的所有关系。如果该分类处于未选定状态,则可以通过线条的暗度来确定关系图中所有分类之间关系的紧密程度。如果明暗度较浅或无明暗度,则表示分类的相似程度较低。使用网络左侧的滑块,可筛选掉强度较低的,找出关系最接近的分类。AdventureWorksCycles市场部可能希望将相似的分类组合在一起,以便确定提供目标的最佳方法。“分类剖面图”选项卡“分类剖面图”选项卡提供TM_Clustering模型的总体视图。“分类剖面图”选项卡对于模型中的每个分类都包含一列。第一列列出至少与一个分类关联的属性。查看器的其余部分包含每个分类的*个属性的状态分布。离散变量的分布以彩色条显示,最大条数在“直方图条”列表中显示。连续属性以菱形图显示,表示每个分类中的平均偏差和标准偏差。在“分类剖面图”选项卡中浏览模型将“直方图”条数设置为5。在我们的模型中,任意一个变量的最大状态数均为5。如果“挖掘图例”妨碍了“属性配置文件”的显示,请移开图例。选择Bike

Buyers

High列,并将其拖到Population列的右侧。选择Bike

Buyers

Low列,并将其拖到Bike

Buyers

High列的右侧。单击Bike

Buyers

High列。“变量”列按照其对该分类的重要性来进行排序。滚动浏览该列,查看BikeBuyerHigh分类的特征。例如,他们上下班路程较短的可能性较大。双击Bike

Buyers

High列中的Age单元格。“挖掘图例”显示更详细的视图,您可以看到这些客户的年龄*围,也可以看到他们的平均年龄。右键单击Bike

Buyers

Low列并选择“隐藏列”。“分类特征”选项卡使用“分类特征”选项卡,您可以更加详细地检查组成分类的特征。您可以一次浏览一个分类,而不是比较所有分类的特征(就像在“分类剖面图”选项卡中那样)。例如,如果从“分类”列表中选择Bike

Buyers

High,则可以看到此分类中的客户的特征。尽管显示方式与分类剖面图查看器不同,但查找结果却是相同的。注意除非设置了holdoutseed的初始值,否则在您每次处理模型时,结果都会有所不同。有关详细信息,请参阅HoldoutSeed元素。“分类对比”选项卡使用“分类对比”选项卡,可以浏览区分分类的特征。当您从“分类1”和“分类2”列表中各选择一个分类后,查看器会计算这两个分类之间的区别,并显示各分类最独特的属性的列表。在“分类对比”选项卡中浏览模型在“分类1”框中,选择Bike

Buyers

High。在“分类2”框中,选择Bike

Buyers

Low。单击“变量”按字母顺序排序。Bike

Buyers

Low和Bike

Buyers

High分类中的客户之间的其他一些显著差异包括年龄、汽车拥有情况、子女数量和所在地区。浏览NaiveBayes模型(数据挖掘基础教程)MicrosoftNaiveBayes算法提供了多种方法,用于显示自行车的购买和输入属性之间的交互。MicrosoftNaiveBayes查看器提供了以下选项卡,以便在浏览NaiveBayes挖掘模型时使用。依赖关系网络属性配置文件属性特征属性对比以下各部分说明如何浏览其他挖掘模型。浏览决策树模型(数据挖掘基础教程)浏览聚类分析模型(数据挖掘基础教程)依赖关系网络“依赖关系网络”选项卡的工作方式与Microsoft树查看器的“依赖关系网络”选项卡的工作方式相同。查看器中的每个节点代表一个属性,而节点之间的线条代表关系。在查看器中,您可以查看影响可预测属性BikeBuyer的状态的所有属性。在“依赖关系网络”选项卡中浏览模型使用“挖掘模型查看器”选项卡顶部的“挖掘模型”列表切换到TM_NaiveBayes模型。使用“查看器”列表切换到“MicrosoftNaiveBayes查看器”。单击BikeBuyer节点以确定它的依赖关系。粉色阴影指示所有属性都会对自行车购买行为产生影响。调整滑块可标识影响最大的属性。向下滑动滑块时,将只保留对[BikeBuyer]列影响最大的属性。通过调整滑块,可以发现影响最大的几个属性为:拥有汽车的数量、通勤距离以及子女总数。属性配置文件“属性配置文件”选项卡说明输入属性的不同状态如何影响可预测属性的结果。在“属性配置文件”选项卡中浏览模型在“可预测”框中,确认已选中BikeBuyer。如果“挖掘图例”妨碍“属性配置文件”的显示,请将它移开。在“直方图”条框中,选择5。在我们的模型中,任意一个变量的最大状态数均为5。系统会列出影响该可预测属性的状态的属性以及输入属性的每个状态的值及其在该可预测属性的每个状态中的分布。在“属性”列中,查找NumberCarsOwned。请注意,自行车购买者(标为1的列)与非自行车购买者(标为0的列)的直方图的差异。如果一个人拥有的汽车数量为0或1,则此人很有可能会购买自行车。双击自行车购买者(标为1的列)列中的NumberCarsOwned单元格。“挖掘图例”将显示一个更为详细的视图。属性特征使用“属性特征”选项卡,可以选择属性和值,以查看所选值事例中出现其他属性值的频率。在“属性特征”选项卡中浏览模型在“属性”列表中,确认已选中BikeBuyer。将“值”设置为1。在查看器中,您将看到,家中无子女、通勤距离较近和居住在北美洲地区的客户更有可能购买自行车。属性对比使用“属性对比”选项卡,可以调查自行车购买的两个离散值与其他属性值之间的关系。由于TM_NaiveBayes模型只有1和0两个状态,因此您无需对查看器进行任何更改。在查看器中,您会看到,没有汽车的人一般会购买自行车,而有两辆汽车的人一般不会购买自行车。第5课:测试模型(数据挖掘基础教程)现在您已使用目标方案定型集处理了模型,您还将针对测试集来测试模型。由于测试集内的数据已经包含了自行车购买的已知值,因此可以方便地确定模型的预测是否准确。AdventureWorksCycles市场部将使用性能最佳的模型来确定目标活动的客户。在本课中,您将首先通过对测试集进行预测来测试模型。接下来,您将针对筛选的数据子集来测试模型。AnalysisServices提供多种确定挖掘模型准确性的方法。在本课中,我们将了解一下“提升图”。验证是数据挖掘过程中的重要步骤。在将挖掘模型部署到生产环境之前,了解目标挖掘模型针对实际数据的性能很重要。本课程包含以下任务:测试提升图的准确性(数据挖掘基础教程)测试筛选后的模型(数据挖掘基础教程)测试提升图的准确性(数据挖掘基础教程)在数据挖掘设计器的“挖掘准确性图表”选项卡上,可以计算每个模型的预测准确性,还可以将每个模型的结果直接与其他模型的结果进行比较。这种比较方法称为“提升图”。通常,用提升图或分类准确性对挖掘模型的预测准确性进行度量。在本教程中,我们将只使用提升图。在本主题中,您将完成下列任务:选择输入数据选择模型、可预测列和值选择输入数据测试挖掘模型准确性的第一步是选择将用于测试的数据源。您将根据测试数据测试模型的准确性,然后将它们与外部数据一起使用。选择数据集切换到BusinessIntelligenceDevelopmentStudio中的数据挖掘设计器的“挖掘准确性图表”选项卡,并选择“输入选择”选项卡。在“选择要用于准确性图表的数据集”组框中,选择“使用挖掘结构测试事例”,以便使用您在创建挖掘结构时保留的测试数据来测试模型。选择模型、可预测列和值下一步是选择要包含在提升图中的模型、用于比较模型的可预测列以及要预测的值。注意“可预测列名称”列表中的挖掘模型列限制为用法类型设置为Predict或PredictOnly而且内容类型为Discrete或Discretized的列。显示模型的提升在数据挖掘设计器的“输入选择”选项卡上,在“选择要在提升图中显示的可预测的挖掘模型列”下选中“同步预测列和值”复选框。在“可预测列名称”列中,确认为每个模型都选择了BikeBuyer。在“显示”列中,选择每个模型。默认情况下,系统会选中挖掘结构中的所有模型。可以决定不包含*一模型,但对于本教程,请选中所有模型。在“预测值”列中,选择1。对于具有相同可预测列的每个模型,将自动填充相同的值。选择“提升图”选项卡以显示提升图。当您单击该选项卡时,便会对服务器和数据库的挖掘结构和输入表或测试数据运行预测查询。结果将绘制在图上。输入“预测值”时,提示图会绘制随机推测模型和理想模型。您创建的挖掘模型将处于这两种极限情况之间,即介于随机推测模型和精确无误的预测模型之间。与随机推测相比,任何提高均被视为“提升”。使用图例可以查找表示理想模型和随机推测模型的彩色线。您将注意到TM_Decision_Tree模型提供最大的提升,其表现优于聚类分析模型和NaiveBayes模型。测试筛选后的模型(数据挖掘基础教程)由于已经确定TM_Decision_Tree模型是最准确的,您应该在AdventureWorksCycles目标邮递活动的上下文中对该模型进行评估。AdventureWorksCycles市场部希望了解男式自行车购买者和女式自行车购买者的特征是否存在差异。这些信息将帮助他们决定使用哪些杂志进行广告宣传,以及在中推广哪些产品。在本课程中,您将创建一个按性别筛选的模型。随后,您即可以方便地创建该模型的副本,而且只需更改筛选条件即可基于不同的性别生成新模型。使用筛选器通过筛选,您可以轻松地创建基于数据子集生成的模型。筛选器只应用于该模型,而且不会更改基础数据源。事例表的筛选器首先,您将复制TM_Decision_Tree模型。复制决策树模型在BusinessIntelligenceDevelopmentStudio中,在解决方案资源管理器中选择ASDataMining2008。单击“挖掘模型”选项卡。右键单击TM_Decision_Tree模型,然后选择“新建挖掘模型”。在“模型名称”字段中,键入TM_Decision_Tree_Male。单击“确定”。然后为模型创建一个筛选器,用于根据客户的性别选择客户。创建挖掘模型的事例筛选器右键单击TM_Decision_Tree_Male挖掘模型以打开快捷菜单。-或-选择该模型。在“挖掘模型”菜单上,选择“设置模型筛选器”。在“模型筛选器”对话框的“挖掘结构列”文本框中,单击网格中的第一行。下拉列表只显示该表中列的名称。在“挖掘结构列”文本框中,选择“性别”。文本框左侧的图标会发生改变,以指示所选项是表还是列。单击“运算符”文本框,并从列表中选择等于(=)运算符。单击“值”文本框,然后键入M。单击网格中的下一行。单击“确定”关闭模型筛选器。筛选器显示在“属性”窗口中。或者,您也可以从“属性”窗口启动“模型筛选器”对话框。重复上述步骤,但这次应将模型命名为TM_Decision_Tree_Female,并在“值”文本框中键入F。现在,“挖掘模型”选项卡中会显示两个新模型。处理筛选后的模型模型经过部署和处理后才能使用。处理筛选后的模型右键单击TM_Decision_Tree_Male模型,并选择“处理挖掘结构和所有模型”单击“运行”以处理新模型。处理完成后,在两个处理窗口上单击“关闭”。评估结果查看结果并评估筛选后的模型的准确性,与您对前三个模型的操作非常相似。有关详细信息,请参阅:浏览决策树模型(数据挖掘基础教程)测试提升图的准确性(数据挖掘基础教程)浏览筛选后的模型在“数据挖掘设计器”中,选择“挖掘模型查看器”选项卡。在“挖掘模型”框中,选择TM_Decision_Tree_Male。将“显示级别”滑块滑动到3。将“背景”值更改为1。将光标置于标记为“全部”的节点上,以查看自行车购买者和非自行车购买者的数量。对TM_Decision_Tree_Female重复步骤1–5。浏览TM_Decision_Tree和按性别筛选模型的结果。与所有自行车购买者相比,男性和女性自行车购买者与未经筛选自行车购买者具有一些相同特征,但所有这三个群体也存在一些重要差异。这是非常有用的信息,AdventureWorksCycles可以利用这些信息来制定他们的营销战略。测试筛选后的模型的提升切换到BusinessIntelligenceDevelopmentStudio中的数据挖掘设计器的“挖掘准确性图表”选项卡,并选择“输入选择”选项卡。在“选择要用于准确性图表的数据集”组框中,选择“使用挖掘结构测试事例”。在数据挖掘设计器的“输入选择”选项卡上,在“选择要在提升图中显示的可预测的挖掘模型列”下选中“同步预测列和值”复选框。在“可预测列名称”列中,确认为每个模型都选择了BikeBuyer。在“显示”列中,选择每个模型。在“预测值”列中,选择1。选择“提升图”选项卡以显示提升图。您现在会注意到,所有三个决策树模型都相对于随机推测模型有了显著提升,而且效果超过了聚类分析和Naive-Bayes模型。第6课:创建和使用预测(数据挖掘基础教程)您已经定型、测试并浏览了所创建的数据挖掘模型。现在已准备好使用模型来标识AdventureWorksCycles目标活动的收件人。在本课中,您将创建查询来预测哪些客户最有可能购买自行车。还将检索预测正确的“概率”,以便您决定是否将此建议提交给市场部。在对很有可能购买自行车的客户进行标识后,您将钻取挖掘模型中事例的详细信息,以检索这些客户的**和联系信息。本课程包含以下主题:创建预测(数据挖掘基础教程)对结构数据使用钻取(数据挖掘基础教程)创建预测(数据挖掘基础教程)测试完挖掘模型的准确性并确定对这些模型满意之后,便可使用数据挖掘设计器中“挖掘模型预测”选项卡上的预测查询生成器来创建数据挖掘扩展插件(DM*)预测查询。预测查询生成器有三个视图。使用“设计”和“查询”视图,可以生成并检查查询。然后可以在“结果”视图中运行查询并查看结果。创建查询创建预测查询的第一步是选择挖掘模型和输入表。选择模型和输入表在数据挖掘设计器的“挖掘模型预测”选项卡的“挖掘模型”框中,单击“选择模型”。在“选择挖掘模型”对话框中,在树中导航到TargetedMailing结构,展开该结构,选择TM_Decision_Tree,然后单击“确定”。在“选择输入表”框中,单击“选择事例表”。在“选择表”对话框中的“数据源”列表中,选择TargetedMailing在“表/视图名称”中选择ProspectiveBuyer(dbo)表,然后单击“确定”。ProspectiveBuyer表与vTargetMail事例表非常相似。映射列选择输入表之后,预测查询生成器便会根据各列的名称在挖掘模型和输入表之间创建默认映射。结构中至少有一列必须与外部数据中的*列相匹配。重要提示用于确定模型准确性的数据必须包含一个可以映射到可预测列的列。将结构列映射到输入表列右键单击将“挖掘模型”窗口与“选择输入表”窗口连接起来的线,然后选择“修改连接”。请注意,并非每个列都映射。我们将为几个“表列”添加映射。在“表列”下方,单击BikeBuyer单元格并从下拉列表中选择ProspectiveBuyer.Unknown。这样便将可预测列[BikeBuyer]映射到一个输入表列。单击“确定”。在解决方案资源管理器中,右键单击TargetedMailing数据源视图并选择“视图设计器”。右键单击ProspectiveBuyer表标题并选择“新建命名计算”。在“列名”框中,键入calcAge。在“表达式”框中键入DATEDIFF(YYYY,[BirthDate],getdate()),然后单击“确定”。输入表没有相应的Age列。此表达式将通过输入表的BirthDate列来计算客户年龄。由于Age被标识为对预测自行车购买最有影响的列,因此它必须在模型和输入表中都存在。在数据挖掘设计器中,选择“挖掘模型预测”选项卡,并重新打开“修改连接”窗口。在“表列”下方,单击Age单元格并从下拉列表中选择ProspectiveBuyer.calcAge。单击“确定”。设计预测查询设计预测查询“挖掘模型预测”选项卡的工具栏中的第一个按钮是“切换到设计视图”/“切换到结果视图”/“切换到查询视图”按钮。单击此按钮上的向下箭头,然后选择“设计”。在“挖掘模型预测”选项卡上的网格内,单击“源”列中第一个空行中的单元格,然后选择“预测函数”。这将指定PredictProbability函数的目标列。在“预测函数”行的“字段”列中,选择PredictProbability。从“挖掘模型”窗口的上方选择[BikeBuyer],并将其拖到“条件/参数”单元格中。释放鼠标后,[TM_Decision_Tree].[BikeBuyer]会显示在“条件/参数”单元格中。单击“源”列中的下一个空行,然后选择TM_Decision_Tree。在TM_Decision_Tree行的“字段”列中,选择BikeBuyer。在TM_Decision_Tree行的“条件/参数”列中,键入=1。单击“源”列中的下一个空行,然后选择ProspectiveBuyer。在ProspectiveBuyer行的“字段”列中,选择ProspectiveBuyerKey。这会将唯一标识符添加到预测查询中,以便您可以标识谁可能购买自行车,以及谁不可能购买自行车。向网格中添加五个以上的行。对于每个行,请选择ProspectiveBuyer作为“源”,然后在“字段”单元格中添加以下列:calcAgeLastNameFirstNameAddressLine1AddressLine2最后,运行查询并浏览结果。运行查询并查看结果在“挖掘模型预测”选项卡中,选择“结果”按钮。运行查询并显示结果后,您可以查看结果。“挖掘模型预测”选项卡显示有可能购买自行车的潜在客户的联系信息。“表达式”列指示预测的正确概率。您可以使用这些结果来确定向哪些潜在客户发送电子。单击“保存”以便保存结果。对结构数据使用钻取(数据挖掘基础教程)作为其广告活动的一部分,AdventureWorksCycles将向人口统计数据中年龄在34至40岁的潜在客户发送电子。市场部决定还希望向五年以前从AdventureWorksCycles购买自行车的客户发送电子。在本课中,您将标识拥有旧自行车的客户并检索其联系信息。模型中不包括此信息,但结构中包括此信息。若要检索联系信息,您需要首先确保已对结构启用了钻取,然后使用钻取来显示拥有旧自行车的客户的**和地址。对挖掘模型启用钻取在BusinessIntelligenceDevelopmentStudio中,在数据挖掘设计器的“挖掘模型”选项卡上,右键单击TM_Decision_Tree模型并选择“属性”。在“属性”窗口中,单击AllowDrillthrough,再选择True。在“挖掘模型”选项卡中,右键单击该模型,再选择“处理模型”。查看挖掘模型的钻取数据在数据挖掘设计器中,单击“挖掘模型查看器”选项卡。从“挖掘模型”列表中选择TM_Decision_Tree模型。将“背景”值更改为1。从“查看器”列表中选择“Microsoft树查看器”,并右键单击Age>=38and<45节点。选择“钻取”,然后选择“模型和结构列”以打开“钻取”窗口。滚动到Structure.DateFirstPurchase列以查看旧自行车的购买日期。若要将数据复制到剪贴板,请右键单击表中的任意行并选择“全部复制”。恭喜您!您已经完成了数据挖掘基础教程。既然您已经熟练掌握了数据挖掘工具,我们建议您同时完成数据挖掘中级教程,中级教程将演示如何创建用于预测、市场篮分析以及顺序分析和聚类分析的模型。数据挖掘中级教程(AnalysisServices-数据挖掘)MicrosoftAnalysisServices提供用于创建和使用数据挖掘模型的集成环境。您可以方便地绑定到数据源、针对同一个数据创建和测试多个模型并部署要用于进行预测分析的模型。在数据挖掘基础教程中,您学习了如何使用BusinessIntelligenceDevelopmentStudio创建数据挖掘解决方案,而且生成了三个支持目标邮递活动的模型,这些模型可用来分析客户购买行为并确定潜在的购买目标。为了完成以下教程,您应该熟悉数据挖掘基础教程中所介绍的数据挖掘工具和挖掘模型查看器。本中级教程基于这些经验而构建,其中介绍了几个新方案(包括预测和市场篮分析)。您将学习如何创建时序模型、关联模型以及顺序分析和聚类分析模型。您还将学习如何在模型中使用嵌套表以及如何针对嵌套表创建筛选器。所有的方案都使用AdventureWorksDW2008R2数据源,但是您将为不同的方案创建不同的数据源视图。只要您是首先创建数据源,就可以按任何顺序做练习。这些课程是相互独立的,可以单独完成。课程方案在成功完成目标邮寄活动之后,系统已经要求您利用自己的数据挖掘知识来开发几个要用于进行业务规划的新模型。这包括下列类型的新模型:时序模型,用来预测产品在全世界不同地区的销售额。您将为每个地区开发单独的模型,而且还开发一个可用于进行交叉预测的通用模型。关联模型,用于分析在访问AdventureWorksCycles电子商务时所购买产品的分组。您可以基于这个市场篮模型为客户推荐产品。顺序分析和聚类分析模型,用于分析客户购买产品的顺序。您可以基于这个模型规划对设计或新产品进行的更改。神经网络模型和逻辑回归模型--执行呼叫中心数据的探索性分析。基于对基础模型的理解,您将创建一个模型以便标识可供改进呼叫中心的客户体验的可能策略。学习内容本教程将讲述如何创建和使用多种类型的数据挖掘算法。本教程还介绍了以下概念:使用嵌套表生成模型选择嵌套表键、时序键或顺序键在创建模型或进行预测时筛选嵌套表确定是否有足以支持模型的数据创建通用模型并将其应用到多个数据集本教程分为以下几课:第1课:创建中级数据挖掘解决方案(数据挖掘中级教程)在本课中,您将基于AdventureWorksDW2008R2数据库创建一个新的项目,以便支持多个新数据源视图和更多的挖掘模型。第2课:生成预测方案(数据挖掘中级教程)在本课中,您将创建一个可用作预测方案一部分的挖掘模型,还将浏览用Microsoft时序算法生成的挖掘模型。您将为每个地区生成单独的模型,而且还生成一个可用于进行交叉预测的通用模型。第3课:生成市场篮方案(数据挖掘中级教程)在本课中,您将添加一个新的数据源视图,并学习如何处理嵌套表及其键。您将基于此数据创建一个可用作市场篮方案一部分的挖掘模型。您还将浏览用Microsoft关联算法生成的挖掘模型。第4课:生成顺序分析和聚类分析方案(数据挖掘中级教程)在本课中,您将创建一个可用作顺序分析和聚类分析方案一部分的挖掘模型,还将学习如何利用通过Microsoft顺序分析和聚类分析算法生成的挖掘模型。第5课:生成神经网络模型和逻辑回归模型(数据挖掘中级教程)在本课中,您将使用Microsoft神经网络和Microsoft逻辑回归算法创建若干相关的挖掘模型。您还将学习如何使用数据源视图来基于模型浏览数据。要求请确保已安装下列软件:Microsoft

SQLServer2008R2Microsoft

SQLServer

AnalysisServices带有AdventureWorksDW2008R2数据库的SQLServer。为了增强安全性,默认情况下将不安装该示例数据库。若要安装MicrosoftSQLServer的正式数据库,第1课:创建中级数据挖掘解决方案(数据挖掘中级教程)在数据挖掘基础教程中,您创建了一个AnalysisServices项目,其中包含基于新的AdventureWorksDW2008R2数据库的简单数据挖掘解决方案。

在此教程中,您将使用BusinessIntelligenceDevelopmentStudio创建一个单独的AnalysisServices项目。您将创建一个使用AdventureWorksDW2008R2的新AnalysisServices数据源,并向该数据源添加几个新的数据源视图。本课包含以下任务:创建解决方案和数据源(数据挖掘中级教程)注意AdventureWorksDW2008R2包含了很多改进,包括支持新的datetime数据类型、地理空间数据类型和全文搜索功能。数据挖掘基础教程也进行了更新,包含了挖掘模型筛选等新功能。如果您以前使用SQLServer2005中的数据挖掘教程,建议您首先复习一下基础教程。创建解决方案和数据源(数据挖掘中级教程)每个MicrosoftSQLServerAnalysisServices项目都可为单个AnalysisServices数据库中的对象定义架构。AnalysisServices数据库包含挖掘结构和挖掘模型、联机分析处理(OLAP)多维数据集和补充对象(例如数据源和数据源视图)。使用BusinessIntelligenceDevelopmentStudio创建AnalysisServices项目时,在部署解决方案之前,解决方案将存储为本地文件。部署解决方案时,AnalysisServices会自动创建一个与项目同名的数据库。默认情况下,AnalysisServices使用新项目的localhost实例。如果您使用的是命名实例,或者您如果为默认实例指定了其他名称,则必须将项目的部署数据库属性更改为要创建数据挖掘对象的位置。数据库创建完成后,您可以使用SQLServerManagementStudio或BusinessIntelligenceDevelopmentStudio浏览它、查看模型或创建预测。可以使用分析管理对象(AMO)或通过在BusinessIntelligenceDevelopmentStudio中重新打开项目文件,继续向此数据库添加对象。您还可以创建*个项目但更改数据库名称,这使您可以重复使用现有数据库并向它添加数据挖掘对象。但是,如果这样做,则应该查看项目属性,以便指定是否将更新现有数据库或者是否将覆盖现有数据库。为本教程创建新的AnalysisServices项目打开BusinessIntelligenceDevelopmentStudio。在“文件”菜单上,指向“新建”,再单击“项目”。确保已选中“模板”窗格中的“AnalysisServices项目”。在“名称”框中,将新项目命名为DM_Intermediate。单击“确定”。更改存储数据挖掘对象的实例(可选)在BusinessIntelligenceDevelopmentStudio中,单击“项目”菜单中的“属性”。在“属性页”窗格的左侧,单击“部署”。验证“服务器”名称是否为localhost。如果使用的是其他实例,请键入该实例的名称。单击“确定”。更改项目的部署属性(可选)在解决方案资源管理器中,右键单击该项目,然后选择“属性”。-或-在BusinessIntelligenceDevelopmentStudio中,选择“项目”菜单中的“属性”。在“属性页”窗格的左侧,单击“部署”。在“选项”窗格中选择“部署模式”,将选项设置为“全部部署”以覆盖对象,或者设置为“仅部署更改”以更新对象或添加对象。创建数据源在数据挖掘基础教程中,您创建了一个用于存储AdventureWorksDW2008R2数据库连接信息的“数据源”。在本解决方案中按照相同的步骤创建AdventureWorksDW2008R2数据源。创建数据源创建数据源(数据挖掘基础教程)一个数据源可以支持多个数据源视图,每个数据源视图可以有多个表。但是,由于数据源和数据源视图部署到了您的MicrosoftSQLServerAnalysisServices数据库以及您创建的数据挖掘模型中,因此作为最佳实践,数据源视图中应该仅包括每个数据挖掘模型或模型组所需的那些表。在下一课中,您将添加数据源视图以便支持新挖掘结构和模型。市场篮以及顺序分析和聚类分析课程使用相同的数据源,但在所有其他方面,各课程彼此是独立的,可以单独完成。课程数据源视图第2课:生成预测方案(数据挖掘中级教程)各型号自行车在不同区域的月销售额报表。第3课:生成市场篮方案(数据挖掘中级教程)来自客户购买分析的数据。此数据源视图包括嵌套表。第4课:生成顺序分析和聚类分析方案(数据挖掘中级教程)来自客户购买分析的数据,通过添加序列标识符得到了增强。第5课:生成神经网络模型和逻辑回归模型(数据挖掘中级教程)来自呼叫中心的初步性能跟踪数据。第2课:生成预测方案(数据挖掘中级教程)作为AdventureWorksCycles的销售分析人员,您需要对下一年各产品的销售量做出预测。特别是,常常需要对自行车销售量的高峰期做出预测,并且需要了解旺销或滞销与区域的关系。此外,您还需要确定不同产品的销售量在一年中的不同时间是否有变化。为了找到所需的信息,在本课程中您将研究公司每月的数据,并将销售区分为三个区域:Europe、NorthAmerica和Pacific。完成本课程中的任务之后,您便能回答下列问题:不同型号自行车的销售量在一段时期内是如何相互影响的?对于上述三个区域,是否存在一种销售模式?一年中的销售旺季是什么时候?为了完成本课程中的任务,您将使用在第1课:创建中级数据挖掘解决方案(数据挖掘中级教程)中创建的AdventureWorksDW2008R2数据源。下述内容是本课中的任务。如果需要,本课程可以分两部分完成。第一部分介绍如何创建和使用时序模型的基础知识,第二部分介绍如何将SQLServer2008中的新功能用于时序模型中的交叉预测。创建简单预测模型为Forecasting添加数据源视图(数据挖掘中级教程)创建预测结构和模型(数据挖掘中级教程)修改预测结构(数据挖掘中级教程)自定义和处理预测模型(数据挖掘中级教程)浏览预测模型(数据挖掘中级教程)创建时序预测(数据挖掘中级教程)创建用于交叉预测的常规预测模型添加聚合预测模型(数据挖掘中级教程)了解时序模型中的趋势(数据挖掘中级教程)使用平均预测模型进行预测(数据挖掘中级教程)比较预测模型的预测(数据挖掘中级教程)为Forecasting添加数据源视图(数据挖掘中级教程)在本任务中,添加将用于Forecasting方案的数据源视图。预测模型要求数据包含一个可用于标识时序中的步长的列。如果计划分析多个数据序列,则所有序列的结束日期或时间步长必须相同。添加数据源视图在解决方案资源管理器中,右键单击“数据源视图”,然后选择“新建数据源视图”。在“欢迎使用数据源视图向导”页中,单击“下一步”。在“选择数据源”页中,在“关系数据源”下选择AdventureWorksDW2008R2数据源。单击“下一步”。注意如果您没有此数据源,请参阅数据挖掘基础教程中描述的创建数据源的步骤。在“选择表和视图”页上,选择表vTimeSeries(dbo),然后单击向右箭头将它添加到数据源视图中。单击“下一步”。在“完成向导”页上,系统默认将数据源视图命名为AdventureWorksDW2008R2。将此名称更改为SalesByRegion,然后单击“完成”。数据源视图设计器随即打开,并且SalesByRegion数据源视图将出现。使用数据源视图创建数据源视图之后,可以通过以下方法浏览数据:对数据进行随机抽样,或抽取前n行数据。为数据源视图中的表或列分配友好名称。查看显示数据分布的图表。使用数据透视图和数据透视表随时创建聚合。在下一个任务中,您将通过在BusinessIntelligenceDevelopmentStudio中创建一个简单的透视表来浏览时序数据。还将设置一个可选属性来处理数据中的空白。

如果您已熟悉时序模型的要求并且知道如何使用BusinessIntelligenceDevelopmentStudio生成各种数据表,则可以跳过创建预测结构和模型(数据挖掘中级教程)任务。了解时序模型的要求(数据挖掘中级教程)准备供在预测模型中使用的数据时,必须确保数据包含一个可用于标识时序中的步长的列。该列将用作KeyTime列,因此必须包含唯一的数值。如果序列在其起始位置和结束位置之外的地方存在空白,则可以使用MISSING_VALUE_SUBSTITUTION参数来填充序列。AnalysisServices提供了多个选项用来用值替换缺失数据,例如使用平均数或常量。如果计划分析多个数据序列,则必须确保所有序列的开始和结束日期相同。在本任务中,您将通过在BusinessIntelligenceDevelopmentStudio中创建一个简单的透视表来浏览时序数据。您还将了解有关查找和处理数据中空白的方法。标识预测模型的时间键在“SalesByRegion.dsv[设计]”窗格中,右键单击表vTimeSeries并选择“浏览数据”。一个新的选项卡随即打开,其标题为“浏览vTimeSeries表”。此选项卡包含4个选项卡:“表”、“透视表”、“图表”和“透视图表”。在“表”选项卡上,单击选项卡右侧的“抽样选项”按钮。请注意,在“数据浏览选项”对话框中,“抽样方法”下方的默认抽样方法使用“靠前计数”选项并抽取前5,000行。将“抽样方法”更改为“随机抽样”,并将“抽样计数”更改为1,000,然后单击“确定”。注意更改抽样选项不会影响用于数据挖掘的数据。图表和表只是用于帮助您浏览和了解数据的工具。在“表”选项卡上,查看TimeInde*和“报告日期”列中使用的数据。这两个列都是值唯一的序列;但是,您应该检查这两个列的数据类型。注意如果看不到“报告日期”列,很可能是您使用的是旧版本的AdventureWorksDW数据库。本教程要求使用AdventureWorksDW2008R2

数据库,以便充分利用SQLServer2008中新的日期和时间功能。单击“SalesByRegion.dsv[设计]”选项卡。选择“报告日期”列。“属性”窗口指示TimeInde*字段的数据类型为System.Int32,而“报告日期”字段的数据类型为System.DateTime。Microsoft时序算法不需要datetime数据类型,只是这些值必须是非重复的且有序的。因此,这两个列均可用作预测模型的时间键。但是,由于您希望使用日历日期表示销售额数据预测,因此您将使用“报告日期”列作为唯一的序列标识符。在数据源视图中设置键在SalesByRegion.dsv窗格中选择vTimeSeries表。右键单击“报告日期”列并选择“设置逻辑主键”。使用透视表检查数据序列中是否存在空白在“SalesByRegion.dsv[设计]”窗格中,右键单击表vTimeSeries并选择“浏览数据”。单击“透视表”选项卡。在“PivotTable字段列表”对话框中,选择字段Quantity和Amount,然后将

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论