已阅读5页,还剩44页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
对外经济贸易大学硬士论文 摘要 由于我国加入v t o 后外资银行的进入 使得国内银行业面临的竞争压力越来越大 商业银行竞争的焦点是客户 特别是对银行贡献较大的优质客户 按照 帕累托原 理 优质客户是银行的利润之源 银行拥有了优质客户 就拥有了竞争优势 尤其 是当市场的主导力量逐渐由卖方转变为买方以后 银行必须了解现有的客户的价值 寻找目标客户 挖掘潜在客户 进行客户细分 开发出适合不同客户不同需求的新产 品 还要明确自己的优质客户 为他们提供更为个性化的服务 从而利用有限的资源 产生最大的效用 因此 本文提出了全新的国内商业银行客户细分方法 该方法的创新之处在于突 破了传统客户细分仅仅基于人口统计项进行细分的不足 研究了国内商业银行客户生 命周期价值的计算方法 提出了结合客户价值和客户生命周期价值 利用银行客户相 关信息数据 通过聚类分析来进行客户细分的方法 并建议把客户分为优质客户 重 点客户 普通客户 背叛客户和淘汰客户五类 本文最后一章对该细分方法进行了推广应用 作者采用调查问卷的方式收集了经 常使用银行的客户相关资料 利用k m e a n s 快速聚类方法进行了客户分类 分类效果 较理想 而且比单纯利用其他数据进行客户细分要更加确切细致 最后 本文还提出 了商业银行基于客户细分结果 以及针对不同客户的事件营销策略建议 本文得到的结论是 把客户生命周期价值作为细分的关键因素不仅能让商业银行 的客户细分更加具体实效 而且还能清楚地看到客户当前的需求状况 关键词 客户细分商业银行应用研究 对外经济贸易大学硕士论文 a b s t r a c t a sf o r e i g nb a n k sa r ee n t e r i n gb e c a u s eo f o u rc o u n t r y sj o i n i n gi n t ow t o t h ep r e s s u r e o u rf i n a n c i a li n d u s t r yi sf a c i n gi sb e c o m i n g b i g g e ra n db i g g e r c u s t o m e r sa r et h ef o c u so f c o m p e t i t i o nb e t w e e nb a n k s e s p e c i a l l yt h o s eh i g hq u a l i t yc u s t o m e r sw h o c a l lp r o v i d et h e b a n kw i t hb i g g e rc o n t r i b u t i o n a c c o r d i n gt ot h ep a r e n t op r i n c i p l e h i g hq u a l i t yc u s t o m e r s a r eb e g i n n i n go f p r o f i t b a n k sw h i c ho w nt h em a j o r i t yh i g hq u a l i t yc u s t o m e r so w nt h e c o m p e t i t i o na d v a n t a g e e s p e c i a l l yw h e nt h el e a d i n gp o w e r i nt h em a r k e th a sc h a n g e d g r a d u a l l yf r o mb a r g a i n e r st op u r c h a s e r s b a n k e r sm u s tu n d e r s t a n dt h ee x i s t i n gc u s t o m e r s v a l u e s e a r c hf o rt h eo b j e c tc l i e n t d i go u tp o t e n t i a lc u s t o m e r sa n dd oc u s t o m e r s e g m e n t a t i o n a n dd e v e l o pn e wp r o d u c t st of i tc u s t o m e r s n d s a tt h es a n l et i m ed e f i n e o n e so w n l l i g hq u a l i t yc u t o m e r s a n dp r o v i d et h e mw i t hm o r ei n n o v a t i v es e r v i c e s 8 0t h a t w ec a r ld e v e l o pt h eb i g g e s te f f e c tm a k i n gu s eo f l i m i t e dr e s o l l f o 嚣 s ot h i sa r t i c l ep r o v i d e s 谢mab r a n n e wc u s t o ms e g m e n t a t i o nm e t h o d n 帕i n n o v a t i o no f t h ea r t i c l ei si t sb r e a k t h r o u g hi nt h ed e f i c i e n c yi nd o m e s t i ct r a d i t i o n a ls e g m e n t a t i o nm e t h o d w h i c hb a r e l yb a s e do nv i t a ls t a t i s t i c st h e o r y a n dr e s e a r c h e di n t ot h ec a l c u l a t i o nm o d e lo f c u s t o m e rl i f e s t a g e p r o v i d ew i t han e ws e g m e n t a t i o nm o d e l w h i c hf o c u so nc u s t o m e r s l i f e s t a g ev a l u ea n dc u s t o mv a l u e s ow es u g g e s tt od i v i d ec u s t o m e r si n t of i v eg r o u p sw h i c h a r eh i g hq u a l i t y k e y c o m n l o n b e t r a y i n g a n dl o s i n gc u s t o m e r s 扬m ej b s fs e c t i o no f t h ea r t i c l e t h ew r i t e ra p p l i e dc l u s t e r i n ga n a l y z em e t h o da c t u a l l y m a k i n gu o f a n dt h ew r i t e rm a d eu s eo f q u e s t i o n n a i r e s m a k i n gu s eo f k m e a n sm e t h o d t ov a l i d a t et h es e g m e n t a t i o nm o d e l t h er e s u l ti si d e a la n dm o r ea u t h e n t i ca n de x a c tt h a n b a r e l ym a k i n gu o f o t h e rd a t a a tl a s t t h ea r t i c l ep r o v i d e dw i t hs e g m e n t a t i o nr e s u l t s a l o n g 航t he v e n t b a s e dm a r k e t i n gs t r a t e g i e sa c c o r d i n gt od i f f e r e n tc u s t o m e rg r o u p s t h ec o n c l u s i o ni s m a k i n gu s eo fc l va sa k e ye l e m e n to f s e g m e n t a t i o nc a nn o to n l y m a k es e g m e n t a t i o nm o r ee f f e c t i v e b u tc a na l s oc l e a r l yd e f i n et h ec u r r e n tn e e d so f c u s t o l n e r s k e yw o r d s c u s t o m e rs e g m e n t a t i o n c o m m e r c i a lb a n k 印p l i c a t i o n 对外经济贸易大学硕j j 论文 1 1 关于豫m 第一章绪论 c r m c u s t o m c rr e l a t i o n s h i pm a n a g e m e n t 这个名词最早是由北美提出 1 9 9 7 年 g a r t n e r g r o u p 提出了关于c p m 的成形的想法 但目前并没有权威定义 回总的来说 c p m 主要有以下两方面的含义 首先它是一种企业管理思想或商业策略 是一项通过分析 客户 了解客户 提高客户满意度来增加收入以及优化赢利的商业模式 它采用以客 户为中心的理念来有效地进行市场营销 销售 和服务 通过保留最有价值的客户 同时降低客户沟通的成本 使组织利润最大化 其次c r m 也指一套软件系统或方法 它 把企业的所有与客户相关的职能部门 市场 销售 服务 无缝地集成在一起 对客 户进行自动的有组织的管理 c r m 提出的意义在于 它提出了一种管理理念 把企业中 与客户有关的部门统一起来 极大提高了客户管理的效率 1 1 1 国内外银行隙 应用状况比较 入世以后 银行业内的竞争越来越激烈 如今银行的核心竞争力已经转变为对优 质客户的竞争和抢夺了 在新经济的规模和特征下 银行业对c p m 的普遍需求随着网络 技术的发展已逐渐形成 商业银行传统的依靠分支机构数量而形成的规模优势也难以 发挥原有的作用 未来的发展必然会从追求 规模效益 转向挖掘 客户效益 正是 在此形势之下 客户关系管理才逐渐被国外许多银行广泛地加以应用和实施 c r m 的整体情况比较 国外银行的c r m 通常被称为互动式营销中心 客户关怀中心等 是银行的战略性商 业单元 具有自己相对独立完整的发展战略 组织结构 财务预算 人员管理机制等 其组织目标是成为统一的营销和客户服务部门 为客户提供全方位的服务和支持 并 通过发挥营销功能保持和改善客户关系 提高客户满意度和忠诚度 最终提高客户的 价值和银行盈利能力 实现从 成本中心 到 利润中心 的根本性转变 国内银行的c r m 通常被称为服务热线 呼叫中心等 它们往往被视为附属于企业后 端客户服务支持的联系渠道 它们一般不具有自身相对独立的发展战略 基本上只有 王寅 启动客户关系管理引擎 t c r a d a t a 通讯 2 0 0 4 年冬季期 第l 页 粱佩佩 基于聚类分析的客户生命周期价值挖掘研究 j 海海事大学硕士论文 2 0 0 4 年6 月 第2 8 页 对外经济贸易大学硕 论文 成本付出而没有利润收益 相对企业营销部门也是各自运作 截然分开的 而且其人 员构成主要是一些技能水平较低的普通接线生 c r m 营销应用的比较 国外的c r m 是典型的 利润中心 开展了交叉销售 推进式销售 同时兼顾市场 调查 客户资料升级 电话促销 直邮等 这些功能性活动都由一个统一的长远的营 销战略目标进行引导和管理 并且高度集成 协调实旌 而国内的c i i m 一直以来都充当着 成本中心 的角色 即使开展了营销活动 也主 要局限在客户提醒 市场调查 直邮 活动通知等方面 几乎没有开展交叉销售 推 进式销售和客户关系管理等活动 处于一种低层次的各自为战的营销行为状态 而且 这些活动往往还没有充分考虑客户的需求和反应 只是按照银行的既定目标按部就班 地开展 1 1 2 我国银行开展o r m 的前景 中国的网络规模 包括固定网和移动网 以及网络用户已跃居世界第一 而且我国 呼叫中心大部分都拥有丰富的电信线路 拥有功能强大的通信和网络处理手段 可在 短时间内完成大量的电话访问 网络访问等 这就为c r m 高效快速地开展各项营销活动 提供了充足的信息通道资源 从客户群体上来看 广阔的地域分布 众多的人口 再加上经济发展的不平衡 形成了具有不同层次需求 不同购买力和不同消费方式的客户群体 商业银行的客户 关系管理应该建立在对客户进行分类的基础上 针对不同的客户群体 选择相应的沟 通媒介和方式 以推动不同层次的金融产品营销功能的实现 推动c r m 从 成本中心 向 利润中心 的转变 作者认为c r m 一定能在我国银行业结出丰硕的果实 作者认为我国银行业应当积极发展c r m 尤其是分析型c r m 因为分析型c r m 的核心 是经营分析及决策支持 它采用数据仓库 o l a p 技术分析 数据挖掘等技术 结合业 务经验 进行用户分析 业务受理分析 收益分析 客户分析等主题分析及一些专题 分析 分析型c r m 能够提高业务运作效率 分析型c r m 通常与数据仓库和数据挖掘结合 在 起 所以本文接下来对c r m 中的数据挖掘及其相关技术进行简单讨论 谭军 基于c r m 数据挖掘的点心客户细分模型分析与设计 重庆大学硕士学位论文 2 0 0 5 年 2 对外经济贸易大学硕 二论文 1 2 关于数据挖掘 1 2 1 数据挖掘的概念 数据挖掘 d a t a m i n i n g 词首次被提出于1 9 9 6 年首届国际知识发现与数据挖掘大 会上 它源于一项以人工智能为基础的数据分析技术 其重要功能是在大量数据中自 动发现潜在有用的知识 这些知识可以被表示为概念 规则 规律 模式等 从商业角度上讲 数据挖掘可以描述为提取有用信息的 数据产生 过程 是从 大量数据中挖掘出隐含的 先前未知的 对决策有潜在价值的知识和规则 并能够根 据已有的信息对未发生的行为做出结果预测 为企业经营决策 市场策划提供依据 1 2 2 数据挖掘中的常用技术 1 人工神经网络 仿照生理神经网络结构的非线形预测模型 通过学习进行模式识别 建立一个有 神经元和其间连线构成的复杂系统 通过训练集的训练 不断调整连线上的权重 从 而使训练的结果与数据相符 2 决策树 代表着决策集的树形结构 分为分类树和回归树两种 分类树对离散变量做决策 树 回归树对连续变量做决策树 一般的数据挖掘工具允许选择分裂条件和修剪规则 以及控制参数 最小节点的大小 最大树的深度等等 来限制决策树的过度生长 树 的根节点是整个数据集合空间 每个分节点是对一个单一变量的测试 3 遗传算法 基于进化理论 采用遗传结合 遗传变异 以及自然选择等设计方法的优化技术 遗传算法将问题的求解表示成 染色体 并把它们置于问题的 环境 根据适者生 存的原则 从中选择出适应环境的 染色体 进行复制 通过交叉 变异两种基因操 作产生出新的一代更适应环境的 染色体 群 这样一代一代不断进化 最好收敛于 一个最适应环境的个体上 求得问题的最优解 4 近邻算法 将数据集合中每一个记录进行分类的方法 其本质是为了决定一条记录的预测值 用户必须在历史数据库中寻找有相似属性值的记录 并把这条记录的属性值作为与未 知记录最接近的属性的预测值 5 规则推导 从统计意义上对数据中的 如果一那么 规则进行寻找和推导 其中关联规则应 张焱 欧阳一鸣 王浩 汪曦东 数据挖掘在金融领域中的应用研究 计算机 程与应用 2 0 0 4 1 8 2 0 8 2 1 1 对外经济贸易大学硕上论文 用的最广泛 关联规则是发现交易数据库中不同商品之间的联系 这些规则找出顾客 购买行为模式 如购买了某一商品对购买其他商品的影响 1 2 3 数据挖掘在分析型o r m 中的应用 数据挖掘使用各种数据分析和建模技术去发现隐藏在海量数据中的模式和关系 通过合理的资源分配减少成本 提供个性化的关系管理方式以提高客户忠诚度 以最 佳的方式对客户做出回应 提高企业的收入以及利润 这也是分析型c r m 所具有的一 些功能 数据挖掘的应用使企业在这些阶段的利润得到提升 具体体现在以下的几个 方面 1 客户的获取 传统获取客户的方法有开展大规模的广告活动 或根据所了解的目标客户群的情 况进行直销活动等 当客户数量不断增长和每位客户的细节因素增多时 进行客户分 析的复杂度也同样增大 所以利用数据挖掘技术进行客户细分可以帮助公司更有效地 完成潜在客户的筛选工作 并且获得更高的投资回报率 2 客户价值的提高 潜在客户成为企业的客户只是c r m 的第一步 企业实施c r m 很重要的一个目标是客 户和企业都可以从中获得更多的利益 利用数据挖掘技术建模 建立好各种交叉营销 情况所对应的分析模型后 就可以用它们分别对新的客户数据进行分析预测 以决定 向客户提供哪一种交叉营销产品或服务最合适 3 客户的保持 预测客户流失的建模中较为常用的数据挖掘算法c a r t c l a s s i f i c a t i o na n d r e g r e s s i o n t r e e s 分类回归树 是分类方法中决策树的一种算法 我们可以根据模型 把每个客户细分群的流失率由高到低来对这些细分群进行排序 再对高流失率的客户 群进行特征分析 可以据模型预测出潜在的流失客户 从而对潜在的流失客户做出措 施 以防止其流失 本文的研究内容是正是数据挖掘技术在分析型c r m 中的一个重要应用 客户细 分方法 1 3 关于客户细分 客户细分是指根据客户属性划分的客户集合 它是数据挖掘技术在c r m 中的一种非 常成功的应用 它结合y c p a 的理念和数据挖掘的现代化信息技术 根据强调客户对 企业贡献的帕累托原理 p a r e n t o p r i n c i p l e 企业8 0 的利润来自于2 0 的客户 银行8 0 9e m m a c h a b l o t h e i m p o r t a n c e o f m a r k e t i n g d a t a i n t e l l i g e n c e i n d e l i v e r i n g s u c c e s s f u l c g m d m r e v i e w 1 0 0 0 马辉民 卢益清 尹汉斌 基于客户份额的客户细分方法 武汉理工大学学报 2 0 0 3 年1 月 4 对外经济贸易大学颂l 论文 的利润来源于2 0 的客户 因此 银行通过建立大型的数据仓库 对银行积累的大量数 据进行综合分析 识别出在市场竞争中利润最大的客户群 确定目标市场 将客户通 过多种指标进行分类 针对不同的客户 实施不同的策略 为目标客户群提供 一对 一 的 符合客户心理的服务 有目的地提高银行利润 而这一过程也就是客户细分 的过程 1 3 1 国外银行客户细分现状 过去客户细分的研究因为受到细分理论和信息技术的双重制约 仅仅集中在对客 户身份特征的调查和简单的分析上 出现的主要方法就是基于客户的基本的人口特征 诸如性别 居住的地理区域 年龄等 来区分不同的客户群 在维度内涵和细分技术 还处于初级阶段 如今的细分方法不仅在内涵上范围更加广阔 而且在细分技术上也 引入了诸多前沿的数学与统计工具 国外各家商业银行都在积极投入研究能够预测客户行为 识别出潜在客户 以更 好地事前采取决策的细分办法 在这个阶段 以产品为导向到以市场或者以客户为导 向的市场理念的转化 为细分方法的改进提供了根本动力 不仅如此 信息技术的发 展和广泛应用 数学 统计工具的其他学科技术的融合 进一步推进了这种细分技术 的发展 诸如拟合分析 聚类分析 因素分析法等 例如 加拿大皇家银行的营销人员利用分析模型及工具 在数据仓库中进行大量 的资料分析 得出的分析结果如生命周期 风险 购买倾向 利润贡献 流失可能性 客户潜力 渠道选择等各项信息 进行客户细分 共有2 0 0 0 多种 这些客户细分信息 除了协助销售人员进行销售决策外 同时也把客户接触点提供给分行及客服中心等 进行主动或被动的客户服务时能够运用此类信息 提前掌握客户的可能意向 以提升 客户服务质量 培养客户关系 又如 美洲银行利用客户细分结果在信用卡业务的拓展方面得到了很大的成功 美洲银行在推销信用卡时 业务部门在数据仓库的细分结果中找出了2 5 万个经常有信 用卡消费 收入费定 信用度较好但又没有使用美洲银行信用卡的客户 于是向这些 客户寄去已经填好的信用卡申请表格 客户只需签名即可申请到美洲银行信用卡 并 向这些客户承诺给予一定的优惠 结果这次促销活动的回应率达2 3 美洲银行因此获 得了6 万个高贡献度的信用卡客户 1 3 2 国内银行研究现状 我国客户细分方法的研究和实践在很大程度上落后于国外 这一点不仅表现在国 内权威以及重要学术文献上相关理论探讨的缺乏 就实践环节来说 有关实际应用的 报告及过程中相关问题的讨论也非常少 可以说 国内无论是学术研究还是实践报告 对外经济贸易大学硕1 论文 中与客户细分相关的研究仍然处于初级阶段 这种研究与实践成果的滞后在一定程度 上与市场发展及发达的程度相关 理论的出现与现实问题的提出密不可分 究其实质 客户细分的根本动力来自于市场竞争 从目前的情况来看 国内商业银行还没能够科学地制定重点客户培育和保留战略 客户细分的标准和方法不科学 目标客户不明确 难以按照客户的发展潜力和需求特 点等变量来划分客户群 在准确分析和掌握客户的需求 所期望的利益 客户特性 对金融产品的使用方式 态度和偏好方面也做得不到位 致使我国一些商业银行在各 种资源方面具有许多的优势不能充分发掘和展示 在金融领域内 客户细分方法的实际应用有如下三个重要的表现 首先 细分方 法的使用仍然停留在人口统计细分 甚至是地理细分上 其原因在于市场理论贯彻的 落后 以产品为导向到以客户为导向的市场理念的转换还需要一段调整时间 其次 对于那些使用细分方法的商业银行来说 将客户细分仅仅作为一种战术策略 例如用 来解决短期内客户数量下降的问题 阻碍了细分方法的迸一步发展和完善 最后 细 分方法应用过程中影响到成功实施的各种关键因素缺乏交流和研究 尤其是在学术界 的研究中 应该更多地关注应用过程 而不是实施结果 1 3 3 客户细分常用技术 客户关系管理系统中存有大量的客户数据 客户细分需要专门的方法对这些数据 进行合理的处理 挖掘有用的客户信息 应用到客户细分中的数据挖掘技术有关联法 分类发现 聚类法等 1 关联法 关联规则的形式化定义为 设i i i i 是二迸制文字的集合 其中的元 素称为项 记d 为交易t 的集合 这里交易t 是项的集合 并且t i 对应每一个交易有 唯一的标识 如交易号 记为t i d 设x 是一个项的集合 如果x t 那么称交易t 包含 x 一个关联规则就是一个形如x j y 的蕴涵式 这里x c i y c i 并且x n y 中 每条 关联规则都包括两个重要特性 即支持度和置信度 支持度描述的是关联规则的使用 范围 置信度描述的是关联规则的可靠程度 关联规则可以从大量的客户数据中发现各种不同的关联规则 帮助进行客户分类 服务 交叉销售等 2 分类发现 分类的目的是学会一个分类函数或分类模型 也常称作分类器 该模型能把数据 库中的数据项映射到给定类别中的某一个 分类可以用于预测 预测的目的是从历史 数据记录中自动推导出给定数据的推广描述 从而能对未来数据进行预测 分类器的 o j i a w e ih a n h i c h e l i n e k a m b e r 数据挖掘概念与技术 北京 机械工业出版社 2 0 0 1 7 0 9 4 1 1 9 1 4 4 1 8 5 2 3 6 对外经济贸易大学母 l i e 文 构造需要有一个训练样本数据集作为输入 训练集由一组数据库记录或元组构成 每 个元组是一个由有关字段 又称属性或特征 值组成的特征向量 此外 训练样本还有 一个类别标记 一个具体样本的形式可为 v v v c 其中v l 表示字段值 c 表示类别 3 聚类 聚类是把一组物理或抽象对象按相似性归为若干类别 也称为 无监督分类 其 目的是使同一类别对象间的距离尽可能小 而不同类别中对象间的距离尽可能大 对 于一个很大的多维数据集 在数据空间中的数据点通常不会均匀分布 数据聚类方法 可以找出稀疏和稠密的位置 进而发现数据集的整个分布模式 本文验证分类方法正确性时采用的方法即聚类法之中的快速聚类方法 k m e a n s 作者将在第二章里详细地对聚类方法进行介绍 1 4 本文的工作 本章主要从整体的角度上介绍了c r m 系统在国内外银行的应用现状 数据挖掘的概 念 常用技术 在c r m 系统中的主要应用 以及客户细分的国内外银行应用状况 本文 的主要工作即探讨基于数据挖掘的客户细分方法 接下来将会介绍用于进行细分豹数 据挖掘工具 然后探讨国内商业银行客户生命周期的界定 提出客户生命周期价值的 模型 提出利用客户资料 计算出客户生命周期价值 把它作为细分变量 从而利用 聚类分析方法来进行客户细分的方法 并给出具体的客户细分结果群 然后针对不同 客户以及客户的不同需求 探讨事件营销的策略 下面首先介绍数据挖掘技术中用于客户细分的聚类方法 第二章进行客户细分的聚类方法 物以类聚 人以群分 战国策 齐策三 随着科技的进步 社会信息化程度越来越高 我们的日常生活中每天都产生海量 的数据 但是我们却很难从这些数据中获取有效信息 陷入了 数据丰富 知识贫乏 的困境 数据挖掘作为从数据中提取和发现知识的一种方法能够解决这个问题 而聚 类挖掘正是数据挖掘中的一种重要技术 下面我们就对这种技术进行介绍 聚类是数据挖掘中的一种主要技术 它是把一组个体按照相似性归成若干类别 即 物阱类聚 它的目的是使得属于同一类别的个体之间的距离尽可能小 而不同类 别上的个体间的距离尽可能大 聚类和分类根本不同的是 分类问题中 我们知道训 对外经济贸易大学硕士论文 练例的分类属性 而在聚类中 就需要我们在训练例中找到这个分类属性 在统计方法中 聚类称聚类分析 它是多元数据分析的三大方法之一 其它两种是 回归分析和判别分析 聚类分析问题可描述为 给定m 维空间r n 中的n 个向量 把每个 向量归属n s 聚类中的某一个 使得每个向量与其聚类中心的 距离 最小 聚类分析 问题的实质是一个全局最优问题 在这里m 可认为是样本参与聚类的属性个数 n 是样 本的个数 s 是由用户预先设定的分类数目 2 1 聚类技术介绍 聚类技术是数据挖掘算法中非常重要的一种方法 它是一种基于无监督的学习方 法 可以把数据集合按定义的相似性进行分类 聚类技术主要用于进行数据探索 并 给出数据描述 而且还可以作为数据预测 内容检索等其他方面应用的前期准备工作 2 1 1 聚类阶段 般来说 聚类技术可以分为以下几个任务阶段 1 数据表示 决定用什么模式来表示数据 这一阶段还包括特征选择和特征抽取 特征选择是指在所有的数据属性的集合中选择一个子集来代表数据 特征抽取则是由 现有的数据属性产生新的属性 2 相似度定义 定义如何表示数据的相似度 一般使用的是基于距离或基于相似 度的表示方法 3 聚类技术 通过多种聚类算法得到聚类结果 4 其他可选任务阶段 如对聚类结果的数据抽象 和评估聚类等 2 1 2 数据表示 数据表示对聚类技术来说是一个非常重要的步骤 不同的数据表示方法可能产生 不同的结果 不同的数据表示方法也适用于不同的聚类算法 数据表示中首先要考虑 的是属性的表示 客观数据中属性有如下多种类型 1 定量属性 包括连续值 离散值和区i 日q i n t e r v a l 属性 2 定性属性 又称标称或名 n o m i n a l 或范畴 c a t e g o r i c a l 属性 规范了属性表示后 有可能还需要进行属性的选择和抽取工作 属性的特征选择 张京民等 数据仓库与数据挖掘技术 北京 电子工业出版社 2 0 0 2 2 5 8 2 6 1 a l e x b e r s o n s t e p h e n s m i t h k u r t t h e a r l i n g 著 贺奇 郏岩 魏黎 蔡致远等译 构建面向c 跳的数 据挖掘应用 人民邮电出版社 对外经济贸易大学颂1 论文 不同于特征抽取 特征选择是从已有的特征中获取子集 而特征抽取是从原来的特征 中计算出新的特征 2 1 3 相似度定义 由于聚类算法是给予数据自然上的相似划法 要求得到的聚类特点是每个聚类的 内部数据尽可能的相似 而聚类之间要尽可能差异较大 国所以定义一种尺度来衡量相 似度就显得非常重要了 一般来说 有两种定义相似度的方法 第一种方法是定义数 据之问的距离 描述的是数据的差异 第二种方法是直接定义数据之间的相似度 定义距离 样本若有k 个交量 定义距离有如下几种方法 1 欧氏距离 e u c l i d e a n d i s t a n c e 采用传统的距离的概念 适合于2 3 维空间 一 e u c l 盼 x j y i 2 y 公式2 1 其中 k 表示每个样本有k 个变量 x l 表示第一个样本在第i 个变量上的取值 y i 表 示第二个样本在第i 个变量上的取值 2 m i n k o w s k i 距离 是e u c l i d e a n 距离的扩展 可以理解为n 维空间的距离 两个 样本之间的m i n k o w s k i 距离是各样本所有变量值之差绝对值的p 总合 再求p 次方根 计 算公式为 一 m i n k o w s k i x y 7 i x 一y f 9 yi 1 1 公式2 2 其中 k 表示每个样本有k 个变量 p 是任意可指定的次方 x 表示第一个样本在第i 个变量上的取值 y i 表示第二个样本在第i 个交量上的取值 3 欧氏距离平方 s q u a r e de u c l i d e a nd i s t a n c e 两个样本之间的欧氏距离平方是各 样本每个变量值之差的平方和 计算公式为 k s e u c l i d x y 2 公式2 3 其中 k 表示每个样本有k 个变量 x 表示第一个样本在第i 个变量上的取值 y 表 示第二个样本在第i 个变量上的取值 4 c h e b y e h e v 距离 两个样本之间的c h e b y c h e v 距离是各样本所有变量值之差的绝 对值中的最大值 计算公式为 c h e b y c h e v x y m a x x i y 林杰斌等 数据挖掘与0 l a p 理论实务 北京 清华大学出舨社 2 0 0 b 5 8 6 1 7 5 7 8 公式2 4 对外经济贸易大学硕士论文 其中x 表示第一个样本在第i 个变量上的取值 y 表示第二个样本在第i 个变量上的 取值 5 b l o c k 距离 两个样本之间的b l o c k 口e 离是各样本所有变量之差的绝对值总和 计算公式为 k b l o c k x y i x 一y 3 1 公式2 5 其中x 表示第一个样本在第i 个变量上的取值 y i 表示第二个样本在第i 个变量上的 取值 定义相似度的方法 距离描述的是数据的差异性 而相似度描述的是数据的相似程度 相似度和距离 的关系可以看为 s t d 1 连续变量亲疏程度的度量 除了上面的各种距离以外 还可以计算其他统计指标 例如p e a r s o n 相关系数 s o s i n e 相似度等 1 s o s i n e 相似度 它将样本各变量看作是k 维空间向量 然后计算各个向量之间 夹角的余弦 计算公式为 xi y c os i ne x y 其中 k 表示每个样本拥有k 个变量 表示第二个样本在第i 个变量上的取值 公式2 6 x i 表示第一个样本在第i 个变量上的取值 y 2 c h i s q u a r e m c a s u l e 对于顺序变量或者名义变量 可以计算一些有关相似性的 统计指标来测定样本间的亲疏程度 也可以通过以下的公式来计算 这是x2 统计量 计算公式为 c h i s q 3 p h i s q u a r e i l l e a s u r e 这个方法也可以用来测定样本间的亲疏程度 这是1 l 2 统计量 计算公式为 p h i s q x y 余建英 何旭宏编 数据统计分析与s p s s 应用 人民邮电出版社 2 0 0 3 1 2 o 公式2 7 公式如下 公式2 8 赢 对外经济贸易大学硕 论文 2 2 聚类分析算法 2 2 1 划分聚类算法 划分聚类也叫分割聚类 给定一个1 1 个对象或元组的数据库 一个分割方法构建数 据的k 个划分 每个划分表示一个聚类 并且k sl a 也就是说 它将数据划分为k 个组 同时满足如下的要求 1 每个组至少包括 个对象 2 每个对象必须属于且只属于一 个组 但是在某些模糊划分技术中第二个要求可以放宽 给定要构建的划分数目k 划分方法是由一个初始划分开始 通过优化一个评价函 数把数据划分成若干子类 因此事实上已经把聚类问题转化成了优化问题 划分聚类 方法输出的是多个互不相交的聚类集 如 k 均值算法 c l a r a 算法 c l a r a n s 算法 2 2 2 层次聚类算法 层次聚类算法就是把数据库分成多个层次 然后对不同层次的数据采用划分聚类 输出的是一棵层次化的分类树 层次的方法可以分为凝聚的和分裂的 凝聚的方法 也称为自底向上的方法 一开始将每个对象作为单独的一个组 然后相继地合并相近 的对象或组 直到所有的组合并为一个 层次的最上层 或者达到一个终止条件 分 裂的方法 也称为自顶向下的方法 一开始将所有的对象置于一个类中 在迭代的每 一步中 一个类被分裂为更小的类 直到最终每个对象在单独的一个类中 或者达到 一个终止条件 2 2 3 基于密度的聚类算法 基于密度的方法与其他方法的一个根本区别是 它不是基于各种各样距离的 而 是基于密度的 这样就能克服基于距离的算法只能发现 类圆形 的聚类的缺点 可 以发现任意形状的聚类结果 这个方法的思想就是 只要一个区域中点的密度大于某 个阀值 就把它加到与之相近的聚类中 代表算法有d b s c a n 算法 o p t i c s 算法 d e n c l u e 算法等 d b s c a n 算法是将密度足够大的那部分记录组成类 并可以在带有 噪声 的空 间数据库中发现任意形状的聚类 d b s c a n 需要由用户主观来选择参数 从而影响了 最终的聚类结果 o p t i c s 算法是一种顺序聚类的方法 它没有显式地产生一个数据集合 它为自动 和交互的聚类分析计算一个类秩序 这个秩序代表了数据的基于密度的聚类结构 d e n c l u e 是 个基于一组密度分布函数的聚类算法 该算法主要基于下面的想 对外经济贸易大学硕j 二论文 法 1 每个数据点的影响可以用一个数学函数来形式化地模拟 它描述了一个数据点 在邻域内的影响 被称为影响函数 2 数据空间的整体密度可以被模型化为所有数据 点的影响函数的总和 3 然后聚类可以通过确定密度吸引点来得到 这里的密度吸引 点是全局密度函数的局部最大 2 2 4 基于网格的聚类算法 基于网格的方法是采用了一个多分辨率的网格数据结构 它首先将数据空间划分 成为有限个单元 c e l l 的网格结构 所有的处理都是以单个的单元为对象的 这么处理 的 个突出的优点就是处理速度块 通常这是与目标数据库中记录的个数无关的 它 只是与把数据空间分成多少个单元有关 代表算法如下 s t i n g 算法是一种基于网格的多分辨率的聚类技术 它将空间区域划分成为矩形 单元 针对不同级别的分辨率 形成了一个层次结构 高层的每个单元被划分为多个 低一层的单元 关于每个网格单元属性的统计信息被事先计算和存储 c l i q u e 可以自动地发现最高维的子空间 高密度聚类存在于这些子空间中 它随 输入数据的大小线性地扩展 当数据的维数增加时具有良好的可伸缩性 w a v e c l u s t e r 是一种多分辨率的聚类算法 它首先通过在数据空间上强加一个 多维网格结构来汇总数据 然后采用一种小波变换来变换原特征空间 在变换后的空 间中找到密集区域 这种汇总信息适合于在内存中进行多分辨率小波变换使用 以及 随后的聚类分析 2 2 5 基于模型的方法 基于模型的方法试图优化给定的数据和某些数学模型之间的适应性 这样的方法 经常是基于这样的假设 数据是根据潜在的概率分布生成的 基于模型的方法主要有 两类 统计学方法和神经网络方法 概念聚类是一种统计学方法 概念聚类是机器学习中的一种聚类方法 给出一组 未标记的对象 它产生对象的一个分类模式 与传统的聚类不同 概念聚类除了确定 相似对象的分组外 还向前走了一步 为每组对象发现了特征描述 即每组对象代表 了一个概念或类 因此 概念聚类是一个两步的过程 首先进行聚类 然后给出特征 描述 在这里 聚类质量不再只是单个对象的函数 而且加入了如导出的概念描述的 简单性和一般性等因素 神经网络方法将每个类描述为一个标本 标本作为聚类的原型 不一定对应一个 特定的数据实例或对象 根据某些距离度量 新的对象可以被分配给标本与其最相似 的类 被分配给一个类的对象的属性可以根据该类的标本的属性来预测 2 对外经济贸易大学碗士论文 2 2 6 模糊聚类法 传统的聚类把每个样本严格地划分到某一类 随着模糊集理论的提出 传统聚类 被推广为模糊聚类 在模糊聚类中 每个样本不再仅属于某一类 而是以一定的隶属 度属于每一类 换句话说 通过模糊聚类分析 得到了个样本属于各个类别的不确定 性程度 即建立起了样本对于类别的不确定性的描述 这样就更能准确地反映现实世 界 基于目标函数地模糊聚类方法首先由r u s p i n i 提出 但真正有效地算法f c m 却是由 d u r m 给出的 b e z d e k 由将其进一步扩展 建立起了模糊聚类理论 从此该类模糊聚类 蓬勃发展起来 目前已经形成了庞大的体系 2 3 k m e a n s 聚类算法 本文在文章其后的模型中所运用的算法b p k m e a n s 算法 所以在接下来的小节当中 对这种算法进行详细介绍 2 3 1 k m e a n s 算法简介 k m e a n s 聚类分析也就是快速聚类分析 它是由用户指定类别数的样本资料的逐步 聚类分析 它先对数据进行初始分类 然后逐步调整 得到最终分类 k m e a n s 算法 的目标是根据输入参数k 将数据集划分成k 个簇 算法采用迭代更新的方法 在每一 轮中 依据k 个参照点将其周围的点分别组成k 个簇 而每个簇的质心 即簇中所有点的 平均值 也就是几何中心 将被作为下一轮迭代的参照点 迭代使得选取的参照点越来 越接近真实的簇质心 所以聚类效果越来越好 和层次聚类分析一样 快速聚类分析也以距离为样本间亲疏程度的标志 但是二 者的不同在于 层次聚类可以对不同的聚类类数产生一系列的聚类解 而快速聚类只 能长生固定类数的聚类解 类数需要用户事先指定 k m e a n s 算法首先随机选取k 个点作为初始聚类中心 然后计算各个样本到聚类中 心的距离 把样本归到离它最近的那个聚类中心所在的类 对调整后的新类计算新的 聚类中心 如果相邻两次的聚类中心没有任何变化 说明样本调整结束 聚类准则函 数j c 已经收敛 本算法的一个特点是在每次迭代中都要考察每个样本的分类是否正确 若不正确 就要进行调整 在全部样本调整完后 再修改聚类中心 进入下一次迭代 如果在一次迭代算法中 所有的样本被正确分类 则不会有调整 聚类中心也不会有 张焱 欧阳一鸣 王浩 汪曦东 数据挖掘在金融领域中的应用研究 计算机工程与应用 2 0 0 4 1 8 2 0 8 2 1 1 对外经济贸易丈学顶j 论文 任何变化 这标志着j c 已经收敛 因此算法结束 该算法框架如下 1 给出n 个混合样本 令i l 选取k 个初始聚类中心z j i j 1 2 3 k 2 计算每个样本与聚类中心的距离d x i z j d i l 2 3 n j 1 2 3 k 如果满足 d x i z k 1 m i n d x i z j i i 1 2 3 n n x i e w k 3 计算k 个新的聚类中心 1k z j i 1 x i j l 2 3 k j 8 公式2 9 4 判断 若z j h z j i j l 2 3 k n i i l 返回 2 否则 算法结束 从上面的算法思想和算法框架 我们不难看出 k 个初始聚类中心点的选取对聚类 结果具有较大的影响 因为在该算法中是随机的选取任意k 个点作为初始聚类中心 如 果有先验知识 可以选取具有代表性的点 在上面这个算法中 把每一个样本点分到离它最近的聚类中心所在类 这个过程 的时间复杂度为o n k d 这里的n 指的是总的样本点的个数 k 是指定的聚类数 d 是样 本点的维数 新的分类产生以后需要计算新的聚类中心 这个过程的时间复杂度为 o n d 因此这个算法所需要的总的时间复杂度为o n k d 2 3 2 初始聚类中心点的选取 在k m e a n s 和加入了聚类准则函数的k m e a n s 两个算法中 都是随机的选取k 个聚类 中心 目前初始聚类中心的选择方法有以下的一些 第一 任意选取k 个样本作为初始聚类中心 第二 凭经验选取有代表性的点作为起始聚类中心 根据个体性质 观察数据结 构 选出比较合适的代表点 第三 把全部混合样本直观地分成k 类 计算各类均值作为初始聚类中心 第四 通过 密度法 选择代表点作为初始聚类中心 所谓密度是指具有统计性 质的样本密度 例如 以每个样本为中心 以某个给定正数d 1 为半径 在特征空间里 划出一个球形邻域 计算落入该邻域里的样本数目作为该点的密度 在计算完每个样 本点的密度后 首先选取密度最大的样本作为第一个初始聚类中心 它对应着样本分 布密度的最高峰值点 然后 给定一个正数d 2 在离开第一个初始聚类中心距离d 2 之 外选择次大密度点作为第2 个代表点 这样可以避免代表点过分集中 依此类推 可以 选出k
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026Fast芯片组行业新兴技术融合与应用前景研究报告
- 2026Fast芯片组测试认证与质量管控体系研究报告
- 2026欧洲老年医疗护理服务行业供需分析及投资评估规划分析研究报告
- 伊金霍洛旗第一小学一年级数学加减法练习题
- 任城区喻屯镇第一中心小学一年级数学加减法练习题
- 2026中国新能源汽车租赁市场增长驱动与商业模式迭代报告
- 科目1考试题目及答案解析
- 仪陇县秋垭乡小学校一年级数学加减法练习题
- 2026年大学轻化工(造纸工艺基础)试题及答案
- 2026年中职工艺美术(手工艺术)试题及答案
- 污水设备调试计划方案(3篇)
- 药剂职称评审汇报
- 冬病夏治治疗呼吸系统疾病
- T/CAQI 47-2018饮用水售水机技术要求
- 《简支梁计算》课件
- GB/T 15934-2024电器附件电线组件和互连电线组件
- 仁爱科普版(2024)七年级上册英语Unit 3单元测试卷(含答案)
- 广东省揭阳市普宁市2023-2024学年八年级下学期7月期末数学试题
- 2069-3-3101-002WKB产品判定准则-外发
- YS-T 3042-2021 氰化液化学分析方法 金量的测定
- 《中外管理思想史》课件
评论
0/150
提交评论