数据挖掘论文.docx_第1页
数据挖掘论文.docx_第2页
数据挖掘论文.docx_第3页
数据挖掘论文.docx_第4页
数据挖掘论文.docx_第5页
已阅读5页,还剩4页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于数据挖掘的游戏运营分析姓名:何琦班级:计算技术学号:要:随着网络信息时代的到来,网络游戏产业应运而生。网络游戏是文化、艺术与高科技的融合,它给我们提供了一种新的休闲娱乐方式。与此同时,网络游戏产业蓬勃发展,市场进一步扩大网络游戏逐渐成为网络经济的领头羊。数据挖掘已经引起了游戏行业的极大关注,其主要原因是存在大量数据,可以广泛使用,并且迫切需要将这些数据转换成有用的信息和知识,以此来改善游戏品质,提高运营效率,为游戏运营商赢取更多用户。关键词:数据挖掘;网络游戏;运营数据1 引言 数据挖掘已经在各个行业得以充分运用,但网络游戏这块市场并没有充分开发完全。同时行之有效的处理游戏数据方法还尚未明朗。对于某款游戏,可以使用游戏运营数据对其数据进行分析与挖掘,运用数据挖掘的方法来提高游戏的品质和运营收益。而之所以选择互联网了游戏作为数据挖掘对象,一来是因为身处这个行业能够获取很多相关数据信息,其次该领域知识遍及了互联网每一个角落,不管是投资商还是开发商,或者是游戏玩家,对这些知识的渴求都已经达到了空前规模。在数据挖掘中,从游戏运营数据出发,着重使用决策树来对玩家进行分类,划分属于某个玩家的群体;运用贝叶斯分类对玩家数据源进行分析,决定该游戏更适合的人群;运用关联规则方法提高游戏商城的销售能力,获取更大收益。2 网络游戏数据概念及来源众所周知,根据Dwyer的五阶段模型,游戏玩家关系发展分为:考察期,形成期,稳定期,退化期;其简要描述如下:1、 考察期:这是用户与运营商关系的探索与实验阶段,在该阶段,玩家在测试游戏的同时又观察游戏是否值得自己继续玩下去。2、 形成期:在这一阶段,由于玩家对游戏的了解与依赖的逐渐增加,玩家开始对游戏产生一定的感情,游戏的虚拟财产也开始累加。3、 稳定期:在这个阶段,玩家已经沉迷于游戏中,对游戏有了相当的好感与依赖。玩家的消费量是最大的也是最稳定的。4、 退化期:这是发展过程中关系水平逆转的阶段。关系的退化并不一定在稳定期之后,其实任何一个时期都有可能因为各种原因退化。 如果要分析网络游戏数据,并以此进行挖掘,那么必须积累有价值的数据。首先要确认动态的数据有哪些。这自然是游戏运行过程中自然而然产生的相关数据,也就是前面所说的由玩家各种行为而产生的游戏动态数据。如果说网络游戏的面向对象是玩家,那数据分析要研究的对象也必然是玩家这个群体。由此推导,产生有价值的积累数据应该是由玩家的各种行为所产生的所有数据,而不仅仅是游戏中的常规动态数据,而其中有价值的玩家动态数据包括四类:游戏中不断变化的玩家动态数据、论坛上的玩家回帖、玩家来电求助GM、玩家消费记录。3 数据预处理 在整理游戏数据库的时候会发现,许多个元组在一些属性上没有赋予相应的值。比如对游戏数据分析希望知道每种销售商品是否通过玩家促销销售,但发现这些信息根本未记录。所以对于数据必须进行预处理。现实世界的数据库或数据仓库特点都是存在不完整、含噪音和不一致的问题。不完整数据的出现可能有多种原因。有些感兴趣的属性,如玩家数据中玩家信息,并非总是可用的。其他数据没有包含在内,可能是因为输入时认为不重要。此外,记录历史或修改的数据可能被忽略。与其它数据不一致的数据可以删除。遗漏的数据,特别是某些属性上缺少值得元组可能需要推导出来。其阶段可以分为:数据清理、数据集成、数据变换、数据规约。4 在游戏运营中的应用游戏运营商经常会相互问这样一句话:“如何提高游戏收益?”首先需要知道,玩家是游戏收入的根本,有效区分玩家类型将有助于提高营销效率。那么玩家类型有很多中,什么样的玩家会驻留游戏中?又有那些玩家将会为游戏付费?通过区分玩家类型将产生有效地针对性营销,同时将促进玩家的付费,并且成为付费用户。从而提高游戏收益。4.1信息增益当在运营过程中,经常会遇到这样的问题:推广方式那么多,到底那种方式效率高?到底什么样的用户才会选择玩这款游戏?玩家群体年龄是否会玩家选择我们的游戏?这类问题可以尝试使用决策树来解决。决策树的核心问题是选择最佳的划分标准。ID3算法运用信息熵理论,选择当前样本属性集中具有最大信息增益值的属性作为测试属性。这个属性让结果划分中的数据样本分类所需的信息量最小,同时反映划分的最小随机性或不纯性。如果使用这种信息理论方法,则使得对于一个对象分类所需的期望测试数目达到最小,并确保找到一颗简单树。4.2 对用户进行分类如何利用决策树来对玩家分类?可以通过一个案例来进行玩家的分析。首先在游戏的玩家数据库中找到所需要的关键字,经过筛选,以下三个关键字将被作为游戏玩家的分类依据:1、 玩家年龄(玩家的年龄决定了他们喜欢哪一类游戏)2、 是否学生(学生在线时间长,容易去尝试体验一款游戏)3、 所是否有过类似游戏的经验(决定游戏的接受性)4、 游戏推广来源(广告媒体投放方式其中,游戏的玩家样本数量为8,样本总数为15标号属性“玩这款游戏”有两个不同值(即,yes,no),因此有两个不同的类(m二2)。根据定义,设类C1对应于yes,而类C2对应于no。类yes有8个样本,类no有7个样本。为计算每个属性的信息增益,首先计算对给定样本分类所需的期望信息因此给定本分类所需信息增益为:然后需要计算每个属性的嫡,从“年龄”属性开始,计算每个样本中yes和no的分布。在“年龄”属性中,“=30”属性正样本数量是3,负样本数是2,“21=30”属性中正样本数量是2,负样本数量是3,“=20”属性中正样本数量为3,负样本2。那么,根据“年龄”划分,得到的期望信息为:E(年龄)=0.972在“是否学生”属性中,“yes”属性的正样本数量是6,负样本数量是2,“no”属性中正样本数是3,负样本数量是4。那么根据“是否学生”属性划分,分类期望信息为:E(是否学生)=0.892在“有格斗游戏经验”属性中“yes”属性的正样本数量是6,负样本数量是3;“no”属性的正样本数量是1,负样本数量是5,因此,根据“有格斗游戏经验”属性划分,分类期望信息为:E(有游戏经验)=0.811在“游戏推广来源”属性中,“朋友”来源的正样本数量是2,负样本数量是3;“网页”来源的正样本数量是2,负样本数量是4,;“广告”来源的正样本数量是4,负样本数量为0,因此,根据“游戏推广来源”属性划分,分类期望信息为:E(游戏推广来源)=0.691计算各属性相应的信息增益为:Gain(年龄)=I(51,52,53,54,55)=E(年龄)=0.997-0.972=0.025Gain(是否学生)=I(51,52,53,54,55)一E(是否学生)=0.997-0.892=0.105Gain(有游戏经验)=I(51,52,53,54,55)-E(有游戏验)=0.997-0.811=0.186Gain(游戏推广来源)=I(51,52,53,54,55)-E(游戏推广源)=0.997-0,691=0.306由此可以看住Gain(游戏推广来源)最大,游戏推广来源,它在属性中具有最高信息增益,以此作为根节点,并出现三个分歧,对应三个结果,以此类推生成决策树图。4.3 对玩家进行分析在游戏运营过程中,经常会遇到这样的问题:线下推广团队每天孜孜不倦地在走街串巷,让更多的玩家知道这款游戏,但面临众多玩家的数据,到底哪些才是要重点进行推广和调查的呢?这类情况可以尝试着使用贝叶斯分类进行预测玩家可能尝试这款游戏的可能性。朴素贝叶斯分类,或简单贝叶斯分类的工作过程如下1、 每个数据样本用一个n维特征向量X=X1,X2,X3,.,Xn表示,描述由属性A1,A2,.,An对样本的n个度量。2、 假定有m个类C1,C2,.,Cm。给定一个未知的数据样本X(没有类标号),分类法将预测X属于具有最高后验概率(条件X下)的类。即,朴素贝叶斯分类将未知的样本分配给Ci,当且仅当: 这样,最大化P(Ci|X)。其中P(Ci|X)最大的类Ci称为最大后验假定。根据贝叶斯定理由于P(X)对于所有类为常数,只需要P(X|Ci)P(Ci)最大即可。如果类的先验概率未知,则通常假定这些类是等概率的;即,P(C1)=P(C2)=.=P(Cm)。并据此对只P(Ci|X)最大化。否则,最大化P(X|Ci)P(Ci)。注意,类的先验概率可以用P(Ci)=si*s计算;其中,si是类C中的训练样本数,而s是训练样本总数。使用贝叶斯分类预测法,对于大量玩家数据进行筛选,优先选择较有可能称为游戏用户的玩家进行推广。5 关联规则的应用 游戏中玩家的需求在不断地变化,只有把握最准确的玩家心态,才能获得更多玩家好评,才能对游戏收益起到提高。当初,在公开测试阶段,玩家曾经反应“商城摆放混乱”想要购买商品,缺没办法在第一时间找到,降低了消费热情。通过对商城道具摆放地规划,提高了玩家的满意度。 通过关联规则apriori算法,挖掘玩家行为动向,将玩家最常购买的几件商品归类放置。游戏道具商城的商品摆放次序是一项复杂的系统工程,它涉及因素繁多,难以直接量化评估。因此在关联规则挖掘算法的基础上,提出一种评估几种商品间互相“促销”的关系方法,并根据最优化理论,定性分析同定量分析相结合,为优化道具商城的道具摆放提供了一种途径。6结论现今,数据挖掘技术已经在各个领域得以应用,并有了相当的发展。许多学者对数据挖掘的研究已经获得了相当的突破,很多行业因此获益匪浅。数据挖掘技术是目前国际上的一个研究热点,其在各个行业客户关系管理和商品销售能力上获得了巨大的成功,体现了其优越性和蓬勃地发展潜力。网络游戏作为一个新兴不久的行业,拥有着巨大的市场和庞大的潜力,但随之而来的是愈发激烈的市场竞争。一些主流的游戏运营商已经把目光投向了在传统行业中取得巨大成功的数据挖掘系统。综合应用数据挖掘技术有利于运营商对玩家进行有效地管理,并能够帮助运营商在激烈的市场竞争中更好地获取玩家资源。参考文献:1孙超.我国网络游戏产业发展策略分析D.西南财经大学,2006.2朱永春.浅析数据挖掘技术J.电脑知识与技术,2010,(12):46-48.3百度风云榜2007网络游戏行业报告(简报)R.百度.2007.4鞠伟平,邓亿瑞.基于决策树的数据挖掘方法在CRM中的应用研究J.商业经济,2007(286):19-21.5姚家奕. 数据仓库与数据挖掘技术原理及应用M.电子工业出版社2009.请设计提高关联规则挖掘算法效率的策略或方案Apriori算法:Apriori算法是关联规则挖掘中的经典算法。在算法中,使用频繁项集的先验知识,逐层搜索的迭代方法,通过扫描数据库,累计每个项的计数,并收集满足最小支持度的项,找每个Lk都需要扫描一次数据库。算法的效率随着数据量的增大,频繁项集的增多,算法的效率就非常的低。Apriori算法效率提高方案:基于抽样的方法:抽样方法的基本思想是先取给定数据D的随机样本S,然后在S而不是在D中搜索频繁项集。样本选取使得可以在内存中搜索S中的频繁项集。总共只需扫描一次S中的事务。由于搜索S中的而不是D中的频繁项集,可能丢失一些全局频繁项集。为了减少这

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论