




已阅读5页,还剩1页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
数据挖掘与统计分析的区别多元统计老师说:“数据挖掘是以统计分析为基础的,多数在采用统计分析的方法”。我有不同的观点,就写点东西出来,大家可以自己评述。我们过去曾给予数据挖掘方法智能的生命力,把它看作商务智能重要的发展方向。但统计学作为一个学科是否应该关心它的发展。我们是否应该将它看成统计的一部分?那意味作什么?最起码它表明我们应该:在我们的杂志上发表这类文章;在我们的本科课程中讲授一些这方面的内容,在我们的研究生中讲授一些相关的研究课题。我们的博士生专业课就有多元统计一课;给那些这方面较优秀的人提供一些奖励(工作,职称,奖品)。答案并不明显,在统计学的历史上就忽略了许多在其它数据处理相关领域发展的新方法。如下是一些相关领域的例子。其中带*的是那些在统计科学中萌芽,但随后绝大部分又被统计学忽略的方法领域。1模式识别*CS/工程2数据库管理CS/图书馆科学3神经网络*心理学/CS/工程4机器学习*-CS/AI5图形模型*(Beyes网)-CS/AI6遗传工程CS/工程7化学统计学*化学8数据可视化*CS/科学计算可以肯定地说,个别的统计学家已经致力于这些领域,但公平地说他们并未被我们的统计学学术圈接纳,主流的学术圈并未接纳这些,至少我没有听到哪个统计学教师钻研神经网络。既然象上面的一些从数据获取知识的课题和统计学的关系如此冷淡,我们不禁要问:什么不是统计学。如果和数据联系并不是一个课题成为统计学一部分的充分理由,那么什么才是充分的呢?到目前为止,统计学的定义好象依赖于一些工具,也就是我们在当前的研究生课程中讲授的那些东西。如下是一些例子:.概率理论.实分析.测度论.渐近理论.决策理论.马耳可夫链.遍历理论统计领域好象被定义成一族能提出如上或相关工具的问题。当然这些工具过去和将来都会很有用。就象BradEfron(BradEfron,DepartmentofStatisticsSequoiaHall390SerraMallStanfordUniversityStanford)提醒我们一样:“统计是最成功的信息科学。那些忽略了统计的人将受到惩罚,他们将在实际中自己重新发现该统计方法。”有人认为在当前数据(及其相关应用)以指数方式增长,而统计学家的数量显然赶不上这种增长的情况下,我们统计学应该将精力集中于信息科学中我们作得最好的部分,也就是基于数学的概率推断。这是一种高度保守的观点,当然它也有可能是最好的一种战略。然而,如果我们接受这一种观点,我们统计学家在信息革命浪潮中的作用肯定会逐渐消失殆尽(在这个舞台上的演员越来越少)。当然这种战略的一个很好的优点是它对我们创新的要求很少,我们只需要墨守成规就可以了。另一种观点,早在1962年就由JohnTukeyTukey(1962)提出来了,他认为统计应该关注数据分析。这个领域应该依据问题而不是工具定义,也就是那些和数据有关的问题。如果这种观点成为一种主流观点,那就要求对我们的实践和学术课题作较大的改变。首先(最重要的),我们应该跟上计算的步伐。哪里有数据,哪里就有计算。一旦我们将计算方法看成是一个基本的统计工具(而不是一种方便地实现我们现成工具的方法),那么当前许多和数据密切相关的领域将不复存在。他们将成为我们领域的一部分。认真对待计算工具而不是简单地使用统计包虽然这一点也很重要。如果计算成为我们的一个基本的研究工具,毫无疑问,我们的学生应该学习相关的计算科学知识。这将包括数值线性代数,数值和组合优化,数据结构,算法设计,机械体系,程序设计方法,数据库管理,并行体系,和程序设计等等。我们也将扩展我们的课程计划,它应该包括当前的计算机定向数据分析方法,它们大部分是在统计学科之外发展起来的。如果我们想和其它的数据相关领域争夺学术和商业的市场空间,我们的某些基本模式将不得不改变,我们将不得不调节对数学的幻想。数学(象计算)只是统计的一个工具,虽然非常重要,但并不是唯一能证实统计方法有效性的工具。数学不等价于理论,反之亦然。理论本来是创造理解力和数学,虽然这很重要,但并不是作此的唯一方法。比如,在疾病的基因理论中数学内容很少,但它却使人们更好地理解许多医学现象。我们将承认经验确认方式,虽然有一定局限性,但的确是一种确认方式。我们可能也不得不改变我们的文化。每一个参与其它数据相关领域的统计学家都被他们和统计学的文化差距所震撼。在其它的一些领域,想法比数学技术(基础)更重要。一个有启发的想法就被认为是有价值的,若有更详细的确认(理论的或经验的)人们才去讨论它的最终价值。思维方式是如果没有证明是有罪的,那就是清白的这和我们领域的思路是不一致的。过去如果一个新方法不是用数学证明是有效的,我们常常诋毁它,即使不这样,我们也不会接受它。这种思路在数据集比较小和信息噪声比较高时是合理的。特别地,我们应该改变我们诋毁那些表现很好(通常在其它领域),但却没被我们理解的方法的习惯。个人感觉,也许,现在的统计学正处在一个十字路口,我们可以决定是接受还是拒绝改变。如上所说,两种观点都极富说服力。虽然观点丰富,但谁也不能肯定哪一种战略能保持我们领域的健康发展和生命力。大多数统计学家好象认为统计学对信息科学的影响越来越小。它们也不太同意为此作些什么。站主导的观点认为我们有市场问题,我们在别的领域的顾客和同事不了解我们的价值和重要性。这也是我们的主要专业组织,美国统计协会的看法。在战略计划委员(AmstatNews-Feb.1997)会所作的五年计划报告中有一节增强我们学科的声望和健康,报告中提及“以下的内容意思是:统计学面临危机,市场的,人才的危机。”统计学可以在数据挖掘科学中发挥作用,统计学应该和数据挖掘合作,而不是将它甩给计算机科学家。有一部分统计专家认为计算机和他们争抢了市场,这个是表面现象。以我们的课程为例,老师讲得很认真,但很多人都没有统计基础,这严重影响了学生对分析过程和结果的理解。SPSS、SAS等分析软件已很优秀,但运行出来的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 大连拓展公司活动方案
- 大连湾小学书画活动方案
- 复转军人慰问活动方案
- 大型科创活动方案
- 大良公司团建活动方案
- 大班活动包饺子活动方案
- 基地教研活动方案
- 教育机构场地租赁合同补充协议范本
- 电力能源项目厂房转让及配套服务合同书
- 主题乐园主题活动策划与执行合同
- 【中学】【主题班会】护红色根脉 圆复兴梦想
- 2025年特种设备作业人员气瓶充装P证考试题库
- 《智能驾驶辅助系统ADAS》课件
- 2024年自然资源部所属单位招聘笔试真题
- 江西吉安市吉水县吉瑞招商运营有限公司招聘笔试题库2025
- 自然照护理念体位管理
- 《关税政策解析》课件
- 武汉网约车从业资格证考试题库及答案
- 铝粉交易居间协议合同
- 耐高温有机硅树脂合成及改性技术
- 竹编非遗面试题及答案
评论
0/150
提交评论