已阅读5页,还剩68页未读, 继续免费阅读
(管理科学与工程专业论文)数据挖掘技术在信用卡业务中的应用研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
a b s t r a c t a tp r e s e n t ,c h i n a sc r e d i tc a r db u s i n e s si ss u f f e r i n gf r o ma f a i r l yl o wp r o f i t m a k i n g c a p a c i t ya n ds l o wd e v e l o p m e n t t h i sc a nb em a i n l ya t t r i b u t e dt ow e a kr i s kc o n 臼r 0 1 i n g a b i l i t ya n dc r i p p l e dm a r k e td e v e l o p m e n t a lc a p a b i l i t yo ft h ec a r d i s s u i n gb a n k s e v e r yb a n kh a v ea c c u m u l a t e da l a r g en u m b e ro fc u s t o m e rt r a d er e l e v a n td a t a , b u t a l lb a n k so f i s s u e dc r e d i tc a r df a c eo n ec o m m o n p r o b l e mt h a ti st h ed a t ai sv e r y b i g ,b u tr e a l l yv a l u a b l ei n f o r m a t i o ni sf e wa m o n gt h e m h o wt or e f i n i n go u t m e a n i n g f u l k n o w l e d g e i nt h ed a t ao fc u s t o m e ro fm a g n a n i m i t y , i ti sa nu r g e n ts u b j e c t f o re v e r yc o m m e r c i a lb a n kt ol a u n c h i n gc r e d i tc a r d t h i st e x tt a k ec r e d i tr a t i n ga n dc u s t o m e rb e h a v i o r a la n a l y s i si nc r e d i tc a r da s m a i np o i n t ,u s i n gn e u r a ln e t w o r k 、c l u s t e ra n a l y s i sa n d d e c i s i o nt r e et e c h n o l o g yi nd a t a m i n i n g h a se s t a b l i s h e dc r e d i tr a t i n gm o d e lb a s e do nn e u r a ln e t w o r k a n d s e g m e n t a t i o n m o d e lb a s e do nc u s t o m e rb e h a v i o r ,t h eg o a li s p r o v i d e sv a l u a b l er e s e a r c hw a yf o r c o m m e r c i a lb a n ki no u r c o u n t r y t oe s t a b l i s h m e n ts c i e n c e p r o f i tp a t t e r n t h et a s ko ft h et e x ti sa sf o l l o w s : ( 1 ) c o m p l e t ee s t a b l i s hi n d i v i d u a lc r e d i tr a t i n gm o d e lb a s e do nn e t w a ln e t w o r k t e c h n o l o g y , t h ee s t a b l i s h i n c l u d i n g i n d i v i d u a lc r e d i t r a t i n gi n d i c a t o rs y s t e m - s d e t e r m i n a t i o n ,t h ep r e t r e a t m e n to fs a m p l e dd a t aa n dt h eb pn e u r a ln e t w o r ks t r u c t u r e d e s i g n b a s e do nt h i s ,u s es a m p l e dd a t af r o mb a n k ,c a r r i e so nt h em o d e l l i n gt ot h e e s t a b l i s h m e n ti n d i v i d u a lc r e d i tr a t i n gm o d e l ,a n dh a sa p p l i e dt h eo p t i m i z a t i o nb p a l g o r i t h mi nt h ee x p e r i m e n t t h ee x p e r i m e n t a lr e s u l ti n d i c a t e dt h a tt 1 1 i sm o d e lc o u l d m a k et h eg o o df o r e c a s tp r o g r e s s ( 2 ) b u i l dc r e d i tc a r dd a t aw a r e h o u s ec o n f o r m i t yc u s t o m e ri n f o r m a t i o nr e s o u r c e b a s e do nt h i s ,u s i n gc l u s t e ra n dd e c i s i o nt r e et w os t a g e a n a l y s i sm e t h o di nd a t am i n i n g t or e c o g n i t i o nt h ec u s t o m e rd a t a , t h e nd i v i d e dt h ec u s t o m e ri n t of o u rk i n do f d i 虢r e n t c o m m u n i t i e s :t h eh i g hq u a l i t yc u s t o m e r , t h es t a rc u s t o m e r , t h ep o p u l a c ec u s t o m e ra n d t h eh i g hr i s kc u s t o m e r , u s i n gt h ed e c i s i o nt r e et e c h n o l o g yw i t h d r e wt h ec h a r a c t e ro f e a c hc l i e n tb a s eo nt h ec l u s t e rr e s u l t c o m p l e t e sc u s t o m e r s e g m e n t a t i o nm o d e l t h i st e x tw a sa n a l y s i st h ec u s t o m e r sb a s i ci n f o r m a t i o na 1 1 dt h eh i s t o r i c a lc r e d i t i i s i t u a t i o n ,e s t a b l i s hi n d i v i d u a lc r e d i tr a t i n gm o d e lt og u a r dr i s k s i m u l t a n e o u s l y , u s e c l u s t e rm e t h o da n dd e c i s i o nt r e em e t h o d ,t w os t a g ea n a l y s i sm e t h o dt oc l a s s i f i c a t i o n m ec r e d i tc a r dc u s t o m e rd a t a , e s t a b l i s hc u s t o m e rs e g m e n t a t i o nm o d e lb a s e d o n e l l s t o m e wb e h a v i o r , p r o v i d e sp e r s o n a l i z e ds e r v i c ei nv i e wo ft h ed i f f e r e n tc u s t o m e r t y p ea n dt h ed e m a n do ft h ec u s t o m e r , e n h a n c e st h ea b i l i t yo f b a n kp r o f i t r e a l i z e st h e c r e d i tc a r db u s i n e s sp r o f i tm a x i m i z a t i o n k e yw o r d s :c r e d i tc a r d ;d a t am i n i n g ;c r e d i tr a t i n g ;c u s t o m e rs e g m e n t a t i o n i i i 数据挖掘技术在信用卡业务中的应用研究 目录 摘要工 a b s t r a c t i i 1 绪论1 1 1 论文的研究背景及意义1 1 1 1 我国信用卡业务现状1 1 1 2 数据挖掘技术的应用现状l 1 1 3 论文研究的主要意义2 1 2 论文的结构2 2 信用卡业务分析4 2 1 信用卡概述4 2 2 信用评分4 2 2 1 信用评分概述4 2 2 2 信用评分统计学方法5 2 3 客户关系管理( c r m ) 6 2 3 1 客户细分6 2 3 2 客户行为分析6 2 3 3 关系营销8 3 数据挖掘技术9 3 1 数据挖掘技术概述9 3 1 1 数据挖掘的概念和任务9 3 1 2 数据挖掘的过程1 0 3 1 3 数据挖掘方法的分类1 1 3 2 数据挖掘的主要技术1 2 3 2 1 人工神经网络技术1 2 3 2 2 决策树技术1 9 3 2 3 聚类分析技术2 3 3 3 数据挖掘技术在信用卡业务中的应用2 6 4 基于b p 神经网络的个人信用评分模型2 8 i v 北京工商大学硕士学位论文 4 1 我国信用卡业务信用评分现状2 8 4 2 基于b p 神经网络的信用评分模型2 8 4 2 1 指标体系的建立2 8 4 2 2 指标体系的标准化处理2 9 4 2 3 个人信用评分神经网络模型的构建3 2 4 3 模型仿真3 7 4 3 1 数据准备3 7 4 3 2 仿真过程3 9 4 4 模型评价4 5 5 基于客户行为的客户细分模型4 6 5 1 基于客户行为的客户细分方法4 6 5 2 信用卡客户数据仓库的构建4 7 5 2 1 数据仓库的建立4 7 5 2 2 数据预处理5 0 5 2 3 数据挖掘主题选取5 1 5 3 基于客户行为的信用卡客户细分模型5 1 5 3 1 数据分析5 1 5 3 2 客户聚类分析过程5 3 6 总结与展望6 3 参考文献6 4 在学期间发表的论文6 7 致谓 6 8 v 北京工商大学硕士学位论文 1 1 论文的研究背景及意义 1 绪论 1 1 1 我国信用卡业务现状 随着国内金融市场环境的进一步改善,自2 0 0 3 年以来,信用卡( 贷记卡) 业务出现了井喷式增长。截止到2 0 0 6 年9 月,贷记卡发卡量达到了2 6 0 0 多万张, 4 年里发卡量增长了约5 倍,加上2 1 0 0 多万张准贷记卡,信用卡累计发卡量有 4 7 0 0 多万张。信用卡消费金额也同时出现了大幅度增长,2 0 0 5 年全年达到了2 1 0 0 多亿元,年增长率超过了5 0 ,其中,贷记卡约1 6 0 0 多亿元,准贷记卡约6 0 0 多亿元,2 0 0 6 年全年信用卡消费金额超过3 0 0 0 亿元人民币。与此同时,信用卡 余额也迅速增长,截至2 0 0 6 年9 月已经超过1 8 0 亿元,与2 0 0 4 年同期相比增长 率超过了4 0 ,占个人消费贷款的比重也达到了1 0 左右。所有这些数据表明, 我国信用卡业务( 贷记卡) 迈上了快速发展的上升通道。 1 1 2 数据挖掘技术的应用现状 数据挖掘( d a t am i n i n g ) 技术从一开始就是面向应用的。由于市场份额和利 润竞争的日趋激烈,数据挖掘已经成为公司在客户生命周期的各个阶段维持竞争 力的必要工具。目前广泛使用数据挖掘技术的行业包括保险业、零售业、投资银 行、公共事业部门、电信业、能源业、游戏业和药品行业。在这些行业中解决的 典型商业问题包括【l 】:数据库营销( d a t a b a s em a r k e t i n g ) 、客户群体划分 ( c u s t o m e rs e g m e n t a t i o n c l a s s i f i c a t i o n ) 、背景分析( p r o f i l ea n a l y s i s ) 等市场 分析行为,以及客户流失性分析( c u s t o m e rc h u ma n a l y s i s ) 、客户信用记分 ( c u s t o m e rc r e d i tr a t i n g ) 、欺诈发现( f r a u dd e t e c t i o n ) 等。 数据挖掘技术还广泛应用于金融数据的分析中,这是由于在银行和金融机构 中产生的金融数据相对比较完整,便于系统化的数据分析和数据挖掘。 零售业是数据挖掘的主要应用领域,因为零售业累积了大量的销售数据,包 括顾客购买历史记录,货物进出、消费与服务记录等等。特别是随着电子商务的 数据来源:2 0 0 7 年2 月中国建设银行研究部研究报告 l 数据挖掘技术在信用卡业务中的应用研究 发展,零售数据为数据挖掘提供了丰富的数据分析资源,而零售数据挖掘有助于 识别顾客购买行为,发现顾客购买模式和趋势,改进服务质量,提高顾客忠诚度 和满意度等。 综上所述,数据挖掘主要应用在两个方面;一是发现规律;二是预测规律。 1 1 3 论文研究的主要意义 我国信用卡业务处于起步和快速发展时期,信用风险控制和管理能力还比较 弱,个人信用评价工作还相当不完善,缺乏科学统一的风险度量方法和工具,无 法准确地度量申请人风险,不能对信用额度实施有效的科学管理。同时,我国信 用卡业务由于长期以来形成的垄断经营方式,导致各发卡机构分散经营、市场意 识不强,没有建立以客户为中心的管理信息系统,所以不能掌握客户的真正需求, 导致服务水平低下。 随着我国经济的快速发展和对外资银行全面开放进程的加速,我国信用卡市 场的趋势和结构也相应发生变化。对“高风险,高回报”的信用卡业务来讲,即 能有效地控制风险,又能掌握客户的消费特征才是实现利润最大化的关键。 本文旨在研究数据挖掘技术在信用卡业务中的应用,通过对收集到的客户历 史交易记录和客户信用卡基本信息数据的分析,建立基于b p 神经网络的个人信 用评分模型和基于客户行为的客户细分模型。信用评分模型实现高效、客观、准 确地对信用卡申请者做出信用评估,使银行达到风险事前预防的能力。客户细分 模型按客户的消费行为将客户划分为不同的群,利用分类的结果,帮助金融企业 实施有效的营销策略。 1 2 论文的结构 本文共分6 个部分,结构组织如图1 1 所示,主要内容如下: 第1 部分为绪论,说明本文的研究背景和意义。 第2 部分主要对信用卡业务进行了介绍,重点介绍了信用卡业务中的信用评 分和客户行为分析,为后续的研究提供了理论基础。 第3 部分对数据挖掘技术进行了概述,介绍了数据挖掘的主要技术与方法, 以及目前数据挖掘技术在信用卡业务中的应用。 第4 部分是本文的重点,在研究了目前国内外成熟的个人信用评估指标后, 建立了适于我国的基于b p 神经网络的个人信用评分模型,并结合某商业银行的 北京工商大学硕士学位论文 数据进行实证研究。 第5 部分对基于客户行为的细分方法进行概述,建立了适用于信用卡业务的 数据仓库,并在此基础上使用数据挖掘方法对信用卡客户进行分类。 第6 部分为总结和展望,说明本文已完成的工作和进一步的工作。 图1 - 1 文章结构 数据挖掘技术在信用卡业务中的应用研究 2 信用卡业务分析 目前,我国信用卡业务领域主要包括:信用打分、欺诈探测、财务管理和客 户关系管理c r m ( c u s t o m e rr e l a t i o n s h i pm a n a g e m e n t ) 等,信用卡业务c r m 包 括客户细分、客户价值分析、客户行为分析和关系营销等。本章首先对信用卡定 义进行概述,并重点介绍了信用评分和信用卡业务c r m 中的客户行为分析。 2 1 信用卡概述 信用卡是银行或其他金融机构发给信用状况良好的人士,用于在指定的商家 购物和消费,或在指定银行机构存取现金的特定卡片,是一种特殊的信用凭证。 目前在我国信用卡主要有两种定义: ( 1 ) 我国刑法对信用卡的定义 信用卡是指由商业银行或者其他金融机构发行的具有消费、信用贷款、转账 结算、存取现金等全部功能或者部分功能的电子支付卡。 ( 2 ) 金融学、经济学关于信用卡的定义 信用卡实质是一种消费贷款,它提供一个有明确信用额度的循环信贷帐户, 借款人可以支取部分或全部额度。偿还借款时也可以全额还款或部分还款,一旦 使用余额得到偿还,则该信用额度又重新恢复使用。 在我国已发行的信用卡包括两类: ( 1 ) 准贷记卡 是指持卡人先按照银行的要求交存一定金额的备用金,当备用金不足支付时 候,可在发卡银行的信用额度内透支的信用卡。 ( 2 ) 贷记卡 是指发卡人给予持卡人一定的信用额度,持卡人可在信用额度内先消费,后 付款的信用卡。持卡人无需预先存入资金,并且银行不对卡内余额支付利息。 本文的研究对象是贷记卡。 2 2 信用评分 2 2 1 信用评分概述 信用评分指帮助贷款机构发放消费信贷的一整套决策模型及其支持技术。这 4 北京工商大学硕士学位论文, 些技术决定谁能得到贷款,以及提高放、贷款机构盈利性的操作战略。信用评分 是发放人对申请人的评估。发放人必须做出两类决策,首先,是否要给某个新的 申请者发卡:其次,如何管理现有持卡人,包括是否要给他们增加信用额度。帮 助进行第一类决策的技术称作“信用评分”,帮助进行第二类决策的技术称为 “行为分析”。 2 2 2 信用评分统计学方法 ( 1 ) 线性回归方法【2 】 将普通的线性回归方法应用于信用评分模型时可以这样描述:假设一个申请 者的违约概率p 与申请者的特征变量五,五,疋之间存在以下关系: p = w 0 + w 五+ j ,2 + + 么j ,卅+ s ( 2 1 ) 其中占是随机扰动项,w ( i 【0 ,m ) 表示申请者各特征变量的权值,利用 样本数据对p 进行估计,并进而对式2 1 中的参数w 进行估计。 线性回归分析应用于信用评分时存在明显缺陷。如式2 1 的右边取值可以从 o o n + o o ,但是等式的左边是一个概率,其取值范围只能在( 0 ,1 ) 区间内。如 果等式左边变换成p 的一个函数,可以取任意值,则模型会更有意义。l o g i s t i c 回归方法弥补了线性回归分析中的不足。 ( 2 ) l o g i s t i c 回归 假设用y 表示审批申请信用卡客户这一事件,用y = l 表示审批不通过( 通 常称为一个“差”的客户) ,y = o 表示审批通过( 通常称为一个“好”的客户) 。 其目的是利用已有的样本资料建立模型,对申请人为“差”客户( 即) ,= 1 ) 的概 率p 进行预测。 在l o g i s t i c 回归模型中,假设: l 。g ( 南 = p 0 + 届五+ + 展矗,其中p 表示y = 1 ( 即“差”客户) 的概率, ( i 1 ,k ) 是描述申请人特征的一些指标,p ( 1 p ) 称为发生比。利用已 有的样本指标对模型中的参数层( f 1 ,k ) 进行估计,对模型进行相关的统计 检验及计量经济检验后可得到一个较为稳定的、预测准确性较高的模型。模型的 数据挖掘技术在信用卡业务中的应用研究 应用流程为:一个新的申请人的相关指标数据输入模型后,对其违约发生比进行 预测。在实际使用时,通常将违约发生比通过某种线性变换转换成分数,银行可 以根据申请人的信用得分情况决定是否发放信用卡。 l o g i s t i c 回归模型克服了线性回归模型的缺陷,其等式两边的值均可取任意 值。 2 3 客户关系管理( c i 蝴) 近几年在世界范围内,随着c r m 理念认同程度的扩大和行业产品系统的日 趋成熟,c r m 在金融领域的应用实施被一些金融机构如银行等列入工作日程安 排中。银行作为经营货币这一特殊商品的金融企业,与其他企业一样,要以占有 客户为其生存与发展的基础,谁拥有了优质客户,谁就能在激烈的银行同业竞争 中处于领先地位。目前银行业在c r m 中的应用有3 】:客户细分、客户价值分析、 客户行为分析和关系营销等。 2 3 1 客户细分 客户细分( c u s t o m e rs e g m e n t a t i o n ) 是指按照一定的标准将企业的现有客户 划分为不同的客户群。客户细分是客户关系管理的核心概念之一,是实施客户关 系管理重要的工具和环节。s u z a n n ed o n n e r 4 1 认为:正确的客户细分能够有效地 降低成本,同时获得更强、更有利可图的市场渗透。通过客户细分,企业可以更 好地识别不同客户群体对企业的价值及其需求,以此指导企业的客户关系管理, 达到吸引合适客户,保持客户,建立客户忠诚的目的。目前普遍使用的客户分类 方法主要包括,基于客户统计学特征的客户细分、基于客户行为的客户细分、基 于客户生命周期的客户细分和基于客户价值的客户细分。 2 。3 2 客户行为分析 客户行为分析5 1 可细分为客户忠诚度、客户流失、客户响应度等分析。客户 忠诚度分析有助于客户关系的建立并最终提高企业的长期盈利能力;客户流失分 析可以及早发现客户流失迹象,帮助企业采取有效措施;客户响应度分析可以有 效地指导企业的销售和促销行为。 r f m 是客户行为分析的经典模型,之后在r f m 模型的基础上提出了改进的 l r f m 模型、d r f m 模型等。 ( 1 ) r f m 模型【6 】 6 北京工商大学硕士学位论文 r ( r e c e n c y ) 是指从最后一次购买到今日的时间,该时间段越短,则r 越大。 在计算时首先将要分析的客户交易资料以购买日期进行排序,以距离目前日期的 间隔分为五等分( e x a c t l ye q u a ls i z e ) 每一等分等于整个资料库的2 0 ,最接近 现在日期的2 0 的编号为【5 、2 0 4 0 的编号为 4 、4 0 6 0 的编号为 3 、 6 0 8 0 的编号为 2 】、8 0 - 一1 0 0 的编号为【1 。h u 曲e s 7 】对这五等分的直销营 销客户进行实验研究发现,r 越大的客户越有可能与企业达成新的交易。如图 2 1 所示,r 5 的顾客回应率是r 4 ( 1 2 5 ) 的2 7 9 倍,表示最近购买过产品的 顾客对公司有较高的印象,有较高的可能会再重复购买该产品。 图2 1 购买日期r 的回应率 f ( f r e q u e n c y ) 指在某一期间内购买的次数,交易次数越多的客户越有可能 与企业达成新的交易。操作方式是首先统计一段时间内客户的购买次数,接着依 次排序,次数最多的前2 0 的编号为 5 、2 0 4 0 的编号为 4 、4 0 - - - 一6 0 的 编号为 3 、6 0 - 8 0 的编号为 2 、8 0 1 0 0 的编号为 1 。 m ( m o n e t a r y ) 指在某一期间内购买的金额,m 越大,越有可能再次响应企 业的产品与服务。其计算方法是首先统计一段期间内每位客户购买产品的总金 额,接着按金额大小排序,金额最多的前2 0 编号为 5 、2 0 4 0 的编号为 4 、 4 0 - - 一6 0 的编号为 3 】、6 0 8 0 的编号为 2 、8 0 - - 1 0 0 的编号为 1 。 r f m 模型就是把这3 个变量综合起来考虑。该方法必须根据3 个不同的输 入变量分别对客户排序,客户排序后一般分为5 等份。在5 等份顶端的人分数为 5 ,下一级的人为4 依此类推。按照这种方式,每位客户都被定位在一个三维 空间里,从( 1 ,1 ,1 ) 到( 5 ,5 ,5 ) ,合计有1 2 5 个客户群。这样,企业可以 根据客户群之间消费行为的差异制定合理的销售方式来满足其需求。 ( 2 ) l r f m 8 】模型 7 4 3 2 1 o 数据挖掘技术在信用卡业务中的应用研究 l r f m 模型在传统的r f m 模型的基础上引入了客户关系长度( l ) 。客户关 系长度是指客户第一次消费时间与最后一次消费时间之间的长度,客户关系长度 越长,表明客户与企业所建立的关系越长,客户忠诚度越高。 企业用r 、f 的变化,可以推测客户消费的异动状况,根据客户流失的可能 性,列出该特征的客户,再从m ( 消费金额) 的角度来分析,就可以把重点放 在贡献度高且流失机会高的客户上,及时沟通并调整销售模式,以最有效的方式 挽回更多的商机。 ( 3 ) d r f m 9 】模型 改良式动态r f m ( 简称d r f m ) 是一种客观且具有较好识别度的方法,通 过历史资料计算产品平均销售周期、顾客平均购买频率和顾客平均购买金额。在 计算这三个指标时,d r f m 提供了购买时间长度的动态定义( p e r i o d ) ,d r f m 中各个顾客和? 名的计分方式是与总数的平均相比较,这样可以评估个体 与个体之间的差异性,充分表达出客户与客户之间的差异。在d r f m 的计算公 式中,根据r 、f 、m 这三个指标的重要性程度给予不同权重。根据顾客和这些 平均数值的差距给定分数,从而消除个人的主观性误差,以达到寻找持续性购买 客户的目的。 2 。3 3 关系营销 在关系营销曰益受到重视的情况下,众多的学者都对关系营销进行了探讨。 关系营销 1 0 1 的目的是建立与客户一对一的关系,使得企业利用此关系进行产品的 交叉销售( c r o s s s e l l i n g ) ,进而能够强化彼此之间的关系。而数据库的应用1 1 】 是推行关系营销的重要基础,企业可以使用信息技术和建立客户的资料数据库来 为客户提供个性化的产品和服务,并进而建立与客户的关系,从而提高客户的忠 诚度和获取客户的终身价值。资料库主要有两种运用方式【1 2 1 :一是用来预测客户 未来的行为模式,目前最好的方式是研究他们目前的行为模式;二是用来识别目 标客户,即利用资料库来分析客户,对客户进行归类。 北京工商大学硕士学位论文 3 数据挖掘技术 3 1 数据挖掘技术概述 伴随着科技的进步,尤其是计算机及信息产业的发展使得超量的数据充斥着 网络、电脑和生活。政府机构、科研机构和企业投入了大量的精力去搜集和存储 数据,实际上这些数据只有一部分会被用到,人们面对信息并不仅限于简单的查 询、统计等操作,而是希望对这些信息数据进行深入分析并发现其中蕴涵的知识, 这些迫切需求促使了数据挖掘技术在各行业的广泛应用。 3 1 。1 数据挖掘的概念和任务 数据挖掘( d a t am i n i n g ) 的历史很短,1 9 9 5 年在美国计算机年会( a c m ) 上其概念才被真正提出。但它的发展速度很快,加之它是多学科综合产物,所以 还没有一个完整统一的定义。目前比较常用的定义主要有: ( 1 ) b o u n s a y t h i p 和r u n s a l a 1 3j 为数据挖掘下的定义: 数据挖掘( d a t am i m n g ) 又称为数据库中知识发现,数据挖掘是从大量的、 有噪音的、纷繁复杂的数据中,通过计算机技术对数据仓库中的海量数据进行挖 掘、提炼和发现蕴含在其中、人们事先不知道、能够提高决策或管理效益的信息、 知识或规律的过程。 ( 2 ) d a v i dh a n d 、h e i k k im a n n i l a 和p a d h r a i cs m y t h t h 】为数据挖掘下的定义: 数据挖掘( d a t am i n i n g ) 就是对观测到的数据集进行分析,目的是发现未知 的关系和以数据拥有者可以理解并对其有价值的新颖方式来总结数据。 ( 3 ) 宁克俭【1 5 】从技术角度为数据挖掘下的定义: 数据挖掘( d a t am i n i n g ) 又称数据开采,就是从大量、不完整、有噪声、模 糊的和随机的数据中提取知识的过程,提取的知识表现为概念、规则、规律模式 约束等形式。这个定义包含四层含义:一是数据源必须是真实的、大量的、含噪 声的;二是发现的是用户感兴趣的知识;三是发现的知识要可以接受、可理解、 可运用;四是并不要求发现通用的定理,仅支持特定的问题发现。 ( 4 ) 周根贵【l6 】从商业应用角度为数据挖掘下的定义: 数据挖掘是一种新的商业信息处理技术,其本质类似于人脑对客观世界的反 映,从客观的事实中抽象主观的知识,然后指导客观实践。数据挖掘就是对商业 9 数据挖掘技术在信用卡业务中的应用研究 数据库中的大量业务数据进行概括、抽取、转换、分析和其它模型化处理,以此 获得商业模式和运营规律。 数据挖掘的任务【1 7 1 主要有: ( 1 ) 分类:预测学习功能的发现,此功能将一个数据项分到几个预定义类 中的一类。 ( 2 ) 聚类:一种普遍的描述性任务,寻求以确定有限的一组类别或类来描 述数据。 ( 3 ) 总结概括:一项附加的描述任务,寻找对数据集或子集的简单描述方 法。 ( 4 ) 关联建模:发现描述变量之间或者数据集或其中一部分的特征值之间 重要相关性的本地模型。 ( 5 ) 变化和偏差检测:发现数据集中最重要的变化。 3 1 2 数据挖掘的过程 数据挖掘是数据库中知识发现k d d ( k n o w l e d g ed i s c o v e r yi nd a t a b a s e s ) 的一 个阶段,整个挖掘的阶斟1 8 1 包括: ( 1 ) 数据准备阶段:一般情况下,历史数据不像试验数据那么理想,存在 很多“噪声”数据,也就是一些不符合规律的数据,所以数据准备的充分性将影 响到数据挖掘的效率和准确度以及最终模式的有效性。这个阶段包括:数据的选 择、数据的净化、数据的推测、数据的转化、数据的缩减等。 ( 2 ) 数据挖掘阶段:该阶段根据选出的样本数据以及挖掘的主题,选择相 应的数据挖掘算法并建立挖掘模型,这个阶段是数据挖掘的核心步骤,也是技术 难点所在。 ( 3 ) 评估模型阶段:在数据挖掘中得到的模式可能是没有实际意义或没有 使用价值的,不能准确反映数据的真实意义,因此在建立挖掘模型后,必须对数 据挖掘的结果进行评估,选择最优的模型,运用于实际问题。评估模型可以根据 专家经验进行评估,也可以直接用数据来检验其准确性。 ( 4 ) 解释模型和得出结论:结合专业知识对挖掘的结果进行描述和解释, 并得出结论,同时以可视化方式呈现给用户。 数据挖掘中的信息流程可描述为,将各个数据源集成为数据库,经过数据筛 1 0 北京工商大学硕士学位论文 选找到目标数据,将目标数据进行预处理,经过转换成为可以进行数据挖掘的数 据,选择合适的算法对数据进行挖掘并得到模式,经过专门的结果表述和解释, 形成使决策者能理解的知识,以便进行决策,最后把知识归入知识库,作为规则 存在,为将来的数据提供支持,主要过程如图3 1 : 卜_ 一 数据准备斗数据挖掘十 结果表示及解释一 图3 - 1 数据库中知识发现的过程 3 1 3 数据挖掘方法的分类 数据挖掘涉及的学科领域和方法很多,有多种分类法。从开采方法的角度对 这些方法进行总结分类可以粗分为:机器学习方法、数据库方法和神经网络方法。 其中机器学习方法可细分为:归纳学习方法、基于范例学习、遗传算法等;数据 库方法主要是多维数据分析或o l a p 方法;神经网络方法可细分为:前向神 经网络、自组织神经网络等。常用的几种数据挖掘技术如下: ( 1 ) 决策树 2 0 1 和规则推理( d e c i s i o nt r e e sa 1 1 dr u l ei n d u c t i o n ) : 决策树和规则推理是解决实际应用中分类问题的数据挖掘方法,决策树是代 表决策集的树型结构。大部分数据挖掘工具采用知识发现或决策树分类技术来发 现数据模式和规则,其核心是某种归纳算法。这类工具通常是对数据库的数据进 行挖掘,生产规则和决策树,然后对新数据进行分析和预测。建立决策树的过程, 实际上是不断把数据进行切分的过程,每次切分对应一个问题,也对应着一个节 点,对每次切分都要求分成的组之间的“差异”最大,各种决策树算法之间的主 要区别就是对“差异”衡量方式的区别。典型的决策树算法有分类回归树 ( c a i 订) 、i d 3 、c 4 5 等。 数据挖掘技术在信用卡业务中的应用研究 ( 2 ) 关联规则( a s s o c i a t i o nr u l e s ) : 关联规则是数据挖掘的主要技术之一,也是在无指导学习系统中挖掘本地模 式的最普通形式。关联规则的目的是发现交易数据库中不同商品( 项) 之间的联 系,通过联系找出顾客购买行为模式,如购买了某一商品对购买其他商品的影响。 发现这样的规则可以应用于商品货架设计、货存安排以及根据购买模式对用户进 行分类。 ( 3 ) 遗传算法( g e n e t i c a l g o r i t h m ) : 遗传算法是基于进化理论,并采用遗传结合、遗传变异、以及自然选择等设 计方法的优化技术。 ( 4 ) 粗集( r o u g hs e t ) : 粗集用于数据简化、数据意义评估、对象相似或差异性分析、因果关系及范 式采掘等。其基本思想是,将数据库中的属性分为条件属性和结论属性,对数据 库中的元组根据各个属性不同的属性值分成相应的子集,然后对条件属性划分的 子集与结论属性划分的子集之间的上下近似关系生成判定规则。 ( 5 ) 神经网络【2 1 】( n e u r a ln e t w o r k ) : 神经网络是一种仿照生理神经网络结构的非线性预测模型,通过学习进行模 式识别。基于神经网络的数据挖掘工具现在越来越流行,其挖掘过程是先将数据 聚类,然后分类计算权值。神经网络很适合非线性数据和含噪声数据,所以在市 场数据库的分析和建模方面应用广泛。 3 2 数据挖掘的主要技术 3 2 1 人工神经网络技术 ( 1 ) 神经元模型概述 神经元是神经网络操作的基本信息处理单位,神经元模型是神经网络的设 计基础。神经元模型由三种基本元素构成: 突触或连接链:每一个都由权值或者强度作为特征,在连到神经元k 的突触 j 上的信号x j 被乘以k 的突触权重。和人脑中的突触不同的是,人工神经元的 突触权值有一个范围,可以取正值也可以取负值。 加法器:用于将输入的信号与对应的权重相乘后进行累加,这个操作构成了 1 2 北京工商大学硕士学位论文 一个线性组合器。 激活函数【2 3 】( 又称传递函数) :用于限制神经元输出值n 的幅度。图3 - 2 是 一个典型的人工神经元的示意图。 教 携 滴鬟 蹙魑毅攮 图3 2 神经元的非线性模型 镳搬 k 同样可以用数学语言来表示上述的神经元模型,其中x x ,x 2 ,x 3 ,是输 入信号,。,比:,是神经元k 的突触权值,k 为输入信号的线性输出器的 输出,偏置为坟,传递函数为妒( ) ,y k 是神经元输出信号。用方程来描述一个神 经元k : k = _ y t = 妒( k + 钆) ( 3 1 ) ( 3 2 ) 传递函数,记为缈( v ) ,通过1 ,定义神经元输出。由于神经元采用了不同的激 活函数,因此神经元具有不同的信息处理特性。下面介绍最基本的三种传递函数 阈值函数( t h r e s h o l df u n c t i o n ) 。这种传递函数的表达式为: 妒( v ) = 1 如呆v 0 0 如呆v 0 ( 3 3 ) 数据挖掘技术在信用卡业务中的应用研究 该函数通常也称为阶跃函数,是神经元模型最简单的一类。神经元兴奋输出1 或 抑制输出0 。 分段线性函数( p i e c e w i s e l i n e a rf u n c t i o n ) 。这种传递函数的表达式为: 妒( v ) = 1 , 1 v + 一 2 l1 v ,+ i 卜v 卜i 】 0 ,v 一二 2 ( 3 4 ) s i g m o i d 函数。s i g m o i d 函数的表达式为: 卅) = 百基而 ( 3 5 ) 此种函数的图形是s 型的,在构造人工神经网络中是最常用的函数。它是严 格的递增函数,在线性和非线性行为之间显现出较好的平衡。 ( 2 ) 神经网络的结构 神经元之间不同的连接方式构成了不同的网络拓扑结构。典型的神经网络可 以用网络的输入数目、输出数目、基本节点的总数,以及节点间的组织和连接方 式来表示。按照连接的类型,神经网络通常分为两类:前馈网络和递归网络。 前馈网络 前馈网络又称为前向型神经网络,主要分为单层前馈网络和多层前馈网络。 前馈神经网络的处理过程的传播方向是从输入端传向输出端并且没有任何的回 环和反馈。一个分层的前向神经网络具有以下特点:同一层的节点之间是没有相 互联系的;在某一特定的层上节点的输出总是作为下一层节点的输入。图3 3 为 典型的多层前馈网络。 1 4 北京工商大学硕士学位论文 图3 - 3 典型的多层前馈网络 递归网络 递归网络又称为回馈型网络,所谓反馈网络是指在网络中至少含有一个反馈 回路的神经网络。图3 4 是一个典型的递归网络。 图3 4 典型的递归网络 ( 3 ) b p 神经网络 误差反向传播网络( e r r o rb a c k p r o p a g a t i o nn n ) ,即b p 网络是一种多层前 馈神经网络。在b p 神经网络算法中,可以对组成前向多层网络的各人工神经元 之间的连接权值进行不断的调整,从而使该神经网络能够将输入它的信息变换成 所期望的输出信息。b p 神经网络算法的基本过程是首先样本从输入层经各中间 层向输出层传播,输出层的各神经元获得网络的输入响应;然后按照减小目标输 出与实际输出误差的方向,从输出层开始经各中间层逐层修正各连接权值,以达 到学习目的。b p 网络具有结构简单、可操作性强、能模拟任意的非线性输入输 出关系等优点。由于这些优点,b p 神经网络在很多领域被广泛应用,主要用于: 模式识别、图形处理、系统辨识、函数拟合、优化设计和最优预测等领域。 数据挖掘技术在信用卡业务中的应用研究 b p 网络结构 b p 网络包含输入层、隐含层、输出层。同层节点之间不连接,每层节点的 输出只影响下一层节点的输入。图3 5 是一个标准的三层b p 网络结构图。 输入层隐藏层输出层 图3 5 典型的三层b p 网络 b p 网络的隐含层及输出层的每个神经元都各有一个激活函数。激活函数是 反映下层输入对上层节点刺激脉冲强度的函数,又称传递函数,一般取为 0 ,l 】 内连续取值s i
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 保险代理人变革管理考核试卷含答案
- 水环境监测员岗前应知应会考核试卷含答案
- 密码技术应用员持续改进测试考核试卷含答案
- 矿车修理工安全技能测试知识考核试卷含答案
- 不动产测绘员安全检查测试考核试卷含答案
- 2025上半年教资考试中学《综合素质》真题及参考答案
- 2025年网络工程师职业资格考试(中级)真题汇编及答案
- 2026年周口理工职业学院(周口技师学院)招聘代课教师19人考试参考题库及答案详解
- 2026年沂南县事业单位人员招聘笔试模拟试题及答案解析
- 宜春学院药学相关试题及精准答案
- GB/T 16997-2025胶粘剂主要破坏类型的表示法
- 静脉血管选择课件
- 翻车机检修安全培训课件
- 奥特曼抽奖活动方案
- 2024年10月高等教育自学考试《00051管理系统中计算机应用》试题
- 放射医学技术路线规划
- 2025年家庭医生签约服务培训大纲
- 人教版2024-2025学年七年级数学上册教学计划(及进度表)
- 空地堆场出租合同模板
- 高考语文120个重点文言实词
- 桂花雨(课件)(共23张PPT)
评论
0/150
提交评论