《大数据分析与挖掘》课件-02大数据挖掘的实施过程_第1页
《大数据分析与挖掘》课件-02大数据挖掘的实施过程_第2页
《大数据分析与挖掘》课件-02大数据挖掘的实施过程_第3页
《大数据分析与挖掘》课件-02大数据挖掘的实施过程_第4页
《大数据分析与挖掘》课件-02大数据挖掘的实施过程_第5页
已阅读5页,还剩53页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大数据技术在企业创新背景下高校物流人才培养中的转化与应用

——02大数据挖掘的实施过程——数据挖掘5A过程模型Part

1.数据挖掘系统的典型结构数据挖掘过程数据挖掘是一个从大量数据中抽取出有价值的信息或知识以提供决策依据的过程。问题理解数据收集建立模型评价模型模型应用数据挖掘的过程模型·SPSS5A标准模型Assess、Access、Analyze、Act、Automate强调的是支持数据挖掘过程的工具应具备的功能和能力·SAS的SEMMA标准模型采样Sample,探索Explore,修正Modify,建模Model,评估Assess强调的是结合SAS公司的挖掘工具进行应用开发的方法·数据挖掘特别兴趣小组的CRISP-DMCross-IndustryStandardProcessforDataMining

从进行数据挖掘方法学的角度强调实施数据挖掘项目的方法和步骤,并独立于每种具体数据挖掘算法和数据挖掘系统。数据挖掘5A过程模型5A模型认为任何数据挖掘方法学都由5个基本元素组成Assess:正确、彻底的评价任务的需求及数据。Access:方便、快速的存取任务所涉及的数据。Analyze:适当、完备的分析技术和工具。Act:具有推荐性、有说服力的演示。Automate:为用户提供最易于使用、最方便的自动化软件。Analyze:分析工具应该具备两类分析方法和工具发现型方法和工具包括基因遗传算法、规则推导、模糊逻辑、数据可视化、聚类算法、因素分析、神经网络、决策树等。验证工具检验发现工具所产生的结果是否合理。验证方法和工具包括回归、逻辑回归、判别分析、预测建模等。理想的数据挖掘软件应该具备这两类分析方法和工具,同时应该包括下列分析特性。统计过程、范围和深度较强,应包括预测、分段、分类等。集成商业和统计图形功能、具备多种可选的2D/3D图类,能用数据定点模式显示和跟踪等。辅助分析的模版、过程导引、示范、在线帮助等,能帮助分析员快速选择和获得结果。数据、文件、中间结果管理功能。能合并和分离文件、选择数据子集、处理数据缺值、净化、改善数据完整性、支持IF-THEN-ELSE条件操作。数据转换功能。有一组完备的转换函数支持变量/特征和条件的计算,可以重复计算、编辑原来的变量/特征。可裁减的工作环境。有脚本/宏语言支持的可重复任务的自动化、批处理及其菜单按钮功能,以支持一般用户快速使用。灵活的动态输出。表结果可以转动和轮换,易于观察数据全貌和用鼠标重新组织表数据,以便于清晰的提交、观察、探索数据结果并做进一步的特殊分析。基于线性回归和ANOVA的预测性建模,具有相关性、分类分析、预测等基本分析功能。插件/模块功能。可以提供特殊的功能模块,以支持特定的分析。Act:数据挖掘软件应该提供下面的演示特性。l完好的集成图形功能,以提供专业级的演示。lOLE支持,以易于嵌入图表节省报告时间。lINTERNET特性,以易于图表的网上传输和本地察看。l演示模版特性,以节省编辑时间。l特殊查询功能,以利于快速提供附加的分析能力来响应用户的提问。l报告注解功能,以加入注解到报告中。Automate:软件应提供以下自动化功能:OLE自动化开发者的机制,允许用户在通用代码级(VB、EXCEL、ACCESS、PB等)使用软件。l内建编程语言/脚本/宏,使用户可以方便的创建自己的应用。l制作能力,能编写产生日常报告的命令行文件。数据挖掘CRISP-DM过程模型Part

2.数据挖掘CRISP-DM过程模型CRISP-DM模型是由数据仓库提供商NCR在丹麦的SEC公司,德国的汽车、航天航空、电信和咨询业公司DAIMLER-BENZAG,英国的数据挖掘系统开发商ISL(CLEMENTINE的研发商,1998年其成为SPSS的子公司)以及荷兰最大的银行、保险业公司OHRA等相关开发和应用行业的跨国公司和集团所支持(并由欧洲委员会部分支持)的一个特别兴趣小组在1997年7月到1999年4月间研究后提出的。

由于其直接动机是将数据挖掘技术转化为商业应用,所提出的过程模型均在项目中进行实际实践和验证,因此具有一定的代表性。CRISP-DM模型采用分层方法将数据挖掘生存周期分为顺序不严格及可循环的6个阶段(PHASE)和4个层次(LEVEL)。CRISP-DM模型6个阶段为:BUSINESSUNDERSTANDING(商业理解,从商业角度理解项目目标和需求、问题定义、设计初步计划)DATAUNDERSTANDING(数据理解,熟悉数据包括识别数据的质量问题、找到对数据的基本观察或假设隐含的信息来检测出感兴趣的数据子集等各种活动。)DATAPREPARATION(数据预处理,覆盖了从数据构造到最终数据集合(将要输入建模工具的数据)的所有活动,包括任务包括表、记录属性的选择以及为了适合建模工具的要求对数据进行的转换和净化。)MODELING(建模阶段,选择和应用建模技术将参数校正到优化值)EVALUATION(评价模型、考察执行步骤并确信其正确地达到了商业目标)DEPLOYMENT(扩展阶段,可以简单到只生成一份报告,或复杂到实现一个可重复的数据挖掘过程)CRISP-DM模型4个层次:阶段划分(PHASE)定义通用任务(GENERICTASK)定义专用任务(SPECIALIZEDTASK)处理实例(PROCESSINSTANCE)每个PHASE由若干GENERICTASK组成,每个GENERICTASK又需要实施若干SPECIALIZEDTASK,每个SPECIALIZEDTASK由若干PROCESSINSTANCE来完成。上两层独立于具体数据挖掘方法,即是一般数据挖掘项目均需实施的步骤(这解决了“WHATTODO?”的问题)。下两层注重解决如何完成每个阶段所要完成的任务和任务的输出所要求的必要映射活动(这用于解决“HOWTODO”的问题)。数据挖掘基本步骤Part

3.TWOCROWS数据挖掘过程模型同CRISP-DM模型的基本数据挖掘步骤:定义商业问题;建立数据挖掘仓库;分析数据;准备数据;建立模型;评价模型;模型实施。数据挖掘基本步骤1.业务理解(businessunderstanding)确定目标、明确分析需求2.数据理解(dataunderstanding)收集原始数据、描述数据、探索数据、检验数据质量3.数据准备(datapreparation)选择数据、清洗数据、构造数据、整合数据、格式化数据4.建立模型(modeling)选择建模技术、参数调优、生成测试计划、构建模型5.评估模型(evaluation)对模型进行较为全面的评价,评价结果、重审过程6.部署(deployment)分析结果应用数据分析框架业务理解数据理解数据准备建立模型理解业务背景,评估分析需求模型评估应用理解业务背景:数据分析的本质是服务于业务需求,如果没有业务理解,缺乏业务指导,会导致分析无法落地。评估业务需求:判断分析需求是否可以转换为数据分析项目,某些需求是不能有效转换为数据分析项目的,比如不符合商业逻辑、数据不足、数据质量极差等。数据收集数据清洗数据收集:抽取的数据必须能够正确反映业务需求,否则分析结论会对业务将造成误导。数据清洗:原始数据中存在数据缺失和坏数据,如果不处理会导致模型失效,因此对数据通过过滤“去噪”从而提取出有效数据数据探索数据转换选择方法、工具,建立模型建模过程评估模型结果评估分析结果应用分析模型改进探索数据:运用统计方法对数据进行探索,发现数据内部规律。数据转换:为了达到模型的输入数据要求,需要对数据进行转换,包括生成衍生变量、一致化、标准化等。建立模型:综合考虑业务需求精度、数据情况、花费成本等因素,选择最合适的模型。在实践中对于一个分析目的,往往运用多个模型,然后通过后续的模型评估,进行优化、调整,以寻求最合适的模型。建模过程评估:对模型的精度、准确性、效率和通用性进行评估。,模型结果评估:评估是否有遗漏的业务,模型结果是否回答了当初的业务问题,需要结合业务专家进行评估。结果应用:将模型应用于业务实践,才能实现数据分析的真正价值:产生商业价值和解决业务问题。模型改进:对模型应用效果的及时跟踪和反馈,以便后期的模型调整和优化。

业务理解数据理解数据准备建立模型模型评估开始是否明确需求否否数据探索结构分析分布特性特征描述……分类与回归聚类分析时序模型关联分析结构优化分析结果应用数据分析框架图例流程概要方法分类处理方法模型检验理解业务背景,评估分析需求是是否满足要求收集数据否是是建立模型贝叶斯神经网络C4.5决策树……指数平滑支持向量机灰色理论……K均值算法……FP-growth算法Apriori算法……均方根误差均方误差正概率统计…………群间差异度群内相似度业务符合度支持度置信度……均方根误差均方误差正概率统计……灰色理论遗传算法……数据清洗数据转换SVM算法KNN算法定义商业问题数据挖掘的最终目的是希望从技术和商业角度为公司建立一个能够理解和实施数据挖掘的工作环境。数据挖掘的成功,并不在于特定工具和算法的选择,而是一个合适的环境。企业所处的商业环境往往在战略上、顾客定位、数据仓库建立、市场定位、生命周期、分析技术等方面各不相同,成功的基础必须是基于对数据挖掘与商业规律良好结合的环境,建立自己的挖掘平台。业务数据库最终用户数据结构语义层终端用户查询面板商业元语数据源信息系统人员商业理解体系的核心——语义层建立数据挖掘库建立数据挖掘仓库、分析数据、选择变量构成数据预处理的核心,这三步比其它所有的步骤加在一起所花的时间和精力还多。数据准备工作大概要花去整个数据挖掘项目的50%~90%的时间和精力。是否需要建立数据库管理系统要根据要挖掘的数据量的大小、数据的复杂程度、使用方式的不同而确定构建独立数据挖掘库可以把挖掘结果回写进数据仓库,供OLAP工具展现使用。数据挖掘系统可作为独立系统存在,也可收集到数据库或数据仓库中,一般不直接在公司数据仓库进行数据挖掘的原因:1)数据仓库中数据量很大,包括许多不是目标任务相关。2)数据挖掘可能涉及数据仓库不同表,直接挖掘将影响数据访问性。3)数据挖掘需要反复进行对模型进行优化。4)数据挖掘可能需要对变量进行转化(如神经网络需要对非数值型变量进行转化),而数据仓库不支持更新操作。5)多个同步进行的数据挖掘主题需要数据仓库增加相应控制机制。6)影响数据仓库系统定期地数据刷新、对OLAP系统的支持等其它工作建立数据挖掘库的内容:数据收集(数据搜集报告(数据源属性报告))数据描述(字段/列数目;空字段(缺值)数目/百分比;字段名)选择数据(把冗余或无关的数据除去或由于资源、费用、数据使用和质量问题等限制而做出选择)数据质量评估和清理(确定数据性质影响最终模型的质量,保证数据值的正确性和一致性,处理错误和空缺值)数据合并和整合(不同源、冲突定义、重复字段进行整合和集成)构建元数据(利用元数据管理工具或自己设计元数据库为分析数据及建立模型提供辅助信息)数据加载到数据挖掘库维护数据挖掘库(定期进行数据备份;监视挖掘库的性能;维护元数据;调整硬件性能)错误与空缺值弥补方法:a.根据其它字段来推测,如通过身份证计算出客户性别b.计算非空值后代替空值数据,如平均值替代。c.使用非空值统计特征来填充空值数据,如按非空字段35%男性和65%女性比例随机赋值d.以缺值字段为预测目标、用数据挖掘技术建立预测模型、按照模型预测结果添值。e.利用以往经验、行业规则或挖掘规则进行空值填充分析数据/变量分析数据/变量是要找到对预测输出影响最大的字段、并决定是否需要增加导出字段。分析数据/变量步骤:l

选择变量(减少模型建立时间和避免错误模型,挖掘前需要去除同目标变量具有强相关性的变量和去除毫无关系的变量,以节约数据挖掘时间、避免降低其它重要变量对目标变量的影响力。)l

选择记录(a.数据规模、数据抽样的选择,可建立多种数据采样模型来优化;b.明显异常数据删除,异常数据判断必须按照实际业务逻辑和商业逻辑)l创建新变量(a.将变量利用加、减、比率等计算组合;b.变量范围的扩大与调整来获得预测变量)l转换变量(预测模型的选择决定了数据的预处理,如神经网络要求变量范围在0~1之间,数据被提交算法之前先对[0,1]外的变量进行[高、中、低]映射,转换方式会影响模型准确度)算法模型训练模型训练方法建立模型需要反复考察不同模型对具体商业问题有用。寻找模型过程中可能会得到新的启发,并可能会修改数据,甚至改变最初对问题的定义和理解预测模型的选择决定了数据的预处理工作,为了保证模型具有较好的准确度和健壮性,需要先用部分数据建立模型,然后再用剩下的数据来测试模型。有时还需要称为验证集的独立第3个数据集来评估测试集可能受模型特性的影响。训练和测试数据挖掘模型至少要把数据分成两个部分:一个用于模型训练,另一个用于模型测试。算法模型选择我们可以依据得到的模型和对模型的预期结果修改参数,再用同样的算法建立新的模型,甚至可以采用其它的算法建立模型。在数据挖掘中,不同的商业问题采用哪种模型效果更好,在没有行业经验的情况下,最好用不同的方法(参数或算法)建立几个模型,从中选择最好的。常用验证方法有简单验证、交叉验证、N-维交叉验证1)简单验证它从原始数据集合中随机拿出一定百分比的数据作为测试数据,这个百分比大概在5%~33%之间,简单验证适合在挖掘数据充沛时使用。模型建立过程中,这种简单的验证通常要执行很多次直到在测试集上的准确率不再提高为止。如训练神经网络时几乎每一个训练周期都要在测试集上运行一次。2)交叉验证交叉验证是适合数据不多、能使用全部数据的方法,避免数据特征丢失。交叉验证首先把原始数据随机平分成两份,一部分做训练集,另一部分做测试集计算错误率,再把两部分数据交换再计算一次错误率。最后再用所有的数据建立一个模型,把上面得到的两个错误率进行平均做为最后模型的错误率。3)N-维交叉验证N-维交叉验证是更通用的算法。它先把数据随机份成不相交的N份,先把其中N-1份合在一起建立模型,然后用另外的那份测试前面建立的模型;对每一份数据都重复一次这个过程,得到N个不同的错误率;最后把所有数据建立模型,模型的错误率为上面10个错误率的平均。多种算法结果的验证比较横坐标是选择客户数量占比,纵坐标是指选中大客户的比例(假定大客户在客户群体中占10%);从图中可以看出,选择10%的客户时,神经网络的正确率为90%;回归算法的正确率是85%;决策树的正确率是70%;随机抽样的正确率为10%,因此神经网络算法的效果较好。从图还可看出,随着选择客户的比例增大,算法效果逐渐下降,原因是选择客户初期,算法已经把绝大部分的大客户选择出来。从图可以充分看出,使用模型进行选择和利用随机选择,其效果相差极大。90807010%30%50%70%90%%Response神经网络回归算法决策树随机选择不同算法的的效率比较图数据挖掘模型评价模型建立之后必须评价其结果,并解释模型含义和价值,只有这样才能将模型最终应用到商业环境中。从测试集中得到的准确率只对建立模型的数据有意义。在实际应用中,随着应用数据的不同,模型的准确率肯定会变化。更重要的是准确度自身并不是选择最好模型的正确评价方法。比如,模型A可能在某些不太重要的问题上正确率高于模型B,此时我们不能简单地判断模型A比模型B好。需要进一步了解错误的类型和由此带来的相关效益/损失的多少。数据挖掘模型的评价方法(1)无序矩阵评价方法对分类问题来说,无序矩阵是理解结果非常好的工具。用无序矩阵(混淆矩阵)将预测的客户类型结果与实际的情况进行对比,不仅可说明模型预测的准确情况,也可展现模型问题所在。预测高价值客户预测非高价值客户实际高价值客户2012实际非高价值客户2028理解:80名客户中32个实际高价值客户的20个被正确预测、12个被错误预测,48个实际非高价值客户的28个被正确预测、20个被错误预测。从结果来看,模型总体准确度是60%,而且无序矩阵比简单的总体准确度是60%体现更多的信息。实际商业背景下不同预测错误所需付出的代价也不相同,需要考虑代价最小的模型(而不一定是错误率最小的模型),正确率最高的模型不一定就是实际问题中最优的模型。预测高价值客户预测非高价值客户实际高价值客户20X1012X(-10)实际非高价值客户20X(-5)28X10如果每个准确预测会带来¥10收益,高价值客户预测成非高价值客户要付出¥10的代价,非高价值客户预测成高价值客户要付出¥5代价,整个模型的价值是:(10*20)-(5*20)+(10*28)-(10*12)=¥260预测高价值客户预测非高价值客户实际高价值客户8X102(-10)实际非高价值客户32X(-5)38X10如下无序矩阵,虽然准确度降低到57.5%(46/80),但价值却升高了。(10*8)-(5*32)+(10*38)-(10*2)=¥280(2)收益表评价方法采用收益表来确定模型的最佳实施范围。针对不同的问题,收益表有两种形式:响应率变化曲线和投资回报率变化曲线。通过邮件推销商品客户响应率的变化情况。变化的比率称为lift。如随机抽取的方法选择10%的客户的响应率是10%,而通过模型选取10%的客户的响应率是30%,则lift的值为3。可以根据图中的结果,确定对客户进行推销的比例。比如规定lift值应高于2.5,则推销客户占总客户的比例可以设为15%。选择比例10%100%响应率随机选择的响应率模型选择的响应率10%30%客户响应率变化曲线收益表的另一种形式是投资回报率变化曲线(这里定义ROI利润与为此付出开销的比值)。当选取比例超过80%时,ROI变成了负数,ROI最高是在横坐标为20%时。而采用随机选择的方法,将使得ROI始终为负值。根据图来确定模型实施的范围,选择ROI指数最高的位置作为模型实施的比例,也可以规定一个ROI的取值来确定模型实施的范围。ROI选择比例10%100%随机选择的响应率模型选择的响应率投资回报率变化曲线也可以直接看利润的变化情况(利润为收入与投资的差值)。理想情况下应该按照利润表行事,但很多情况下计算利润表非常复杂。选择比例10%100%随机选择的响应率模型选择的响应率图9-22投资回报率变化曲线利润3)外部验证模型建立中隐含着各种假设可能导致模拟方法计算出来的模型准确率不能保证此模型在面对现实世界中真实的数据时能取得好的效果。经验证有效的模型并不一定是正确的模型直接在现实世界中测试模式很重要。可以先在小范围内应用模型取得测试数据,满意之后再向大范围推广,这是一种

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论