在大数据时代你需要这样思考_第1页
在大数据时代你需要这样思考_第2页
在大数据时代你需要这样思考_第3页
在大数据时代你需要这样思考_第4页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、在大数据时代,你需要这样思考数据分析微信公众号 datadw 关注你想了解的,分享你需要的。维克托 ?迈尔 ?舍恩伯格和肯尼斯?库克耶在大数据时代中告诉我们大数 据的 4V 特点,即 Volume (大量)、Velocity (高速)、Variety (多样)、Veracity真实)。相比小数据,大数据一定是复杂的。然而,复杂性对于我们来说,绝 对是一个机会而不应是一个问题。面对 大数据时代的扑面而来,如何拥抱大数 据,从思考方式的转变开始。从“基于预设的结构化数据库”到“无需预设的非关系型数据库”小数据时代, 我们对于数据的存储与检索一直依赖于分类法和索引法, 分类 和索引是一种清晰获取数据

2、的机制设计, 这种机制是以预设场域为前提的。 这 种 结构化数据库的预设场域能够卓越地展示数据的整齐排列与准确存储, 毫无疑问, 这与追求数据的精确性目标是完全一致的, 在数据稀缺与问题清晰的年代, 这种 基于预设的结构化数据库能够有效的回答人们的问题, 并且这种数据库在不同的 时间能够提供一致的结果。面对大数据, 由于数据的海量、 混杂等特征会使预设的数据库系统崩溃。 其 实,数据的纷繁杂乱才真正呈现出世界的复杂性和不确定性特征, 想要获得大 数 据的价值, 承认混乱而不是对抗或避免混乱才是一种可行的路径。 为此,伴随着 大数据的涌现, 出现了非关系型数据库, 它不需要预先设定记录结构, 而

3、且允许处 理各种各样形形色色参差不齐的数据。因为包容了结构的多样性,这些无需 预设的非关系型数据库设计能够处理和存储更多的数据, 成为大数据时代的重要 应对手 段。如微软的数据库设计专家 PatHelland 所言:“我们再也不能假装活 在一个齐整的世界里。 ”从“随机样本”到“全量数据”统计学家通过分析发现, 采样分析的精确性随着采样随机性的增加而大幅提 高,但与样本数量的增加关系不大。 这个发现对于小数据时代无疑是非常鼓舞 人 心的,随机采样获得了巨大的成功, 并成为现代社会测量领域的核心思想。 随机 样本的基础是采样的绝对随机性, 然而,如此严格意义的随机实现起来是非常困 难 的,一旦采

4、样过程存在任何偏见,分析结果将相去甚远,况且随机样本带给 我们的只能是事先预设问题的答案。 这种缺乏延展性的结果, 无疑会使我们错失 更多的问 题域。大数据时代, 数据的收集问题不再成为我们的困扰, 采集全量的数据成为现 实。全量数据带给我们视角上的宏观与高远, 这将使我们可以站在更高的层级 全 貌看待问题, 看见曾经被淹没的数据价值, 发现藏匿在整体中有趣的细节。 因为 拥有全部或几乎全部的数据, 就能使我们获得从不同的角度更细致更全面的观察 研 究数据的可能性,从而使得大数据的分析过程成为惊喜的发现过程和问题域 的拓展过程。从“数据的精确性和结果的准确性”到“数据的混杂性和结果的容错性”小

5、数据时代,由于可获得的数据量比较小,为此我们必须尽量准确的记录下 所获得的所有数据,从而引发了测量工具的优化工作;由于数据处理手段的限 制,能被我们利用的数据基本限于能适用于传统数据库的结构化数据;由于采用的是 随机采样,因此采样过程的精确度被放在重要的地位。 显然,这种对精确性的执 着是信息缺乏时代和模拟时代的产物。大数据时代,海量数据的涌现一定会增加数据的混乱性且造成结果的不准确性,如果仍然执迷的依循准确性,那么我们将无法应对这个新的时代。与数据的 混杂性可能带来的结果错误性的增加相比,由数据量的扩张带给我们的新洞察、 新趋势和新价值更有意义,因为大数据通常都用概率说话,何况大数据的处理之

6、 前 是可以对之进行数据清洗从而减少部分的错误数据。所以,与致力于避免错 误相比,对错误的包容将会带给我们更多信息。 其实,允许数据的混杂性和容许 结果的不精确性才是我们拥抱大数据的正确态度,只有让步和接受甚至欣赏不 精确性,才能看到大数据带给我们的美好前景,未来我们应当习惯这种思维。从“复杂算法”到“简单算法”算法是挖掘数据价值的工具,因此算法的研究一直以来是提升数据利用效率 的重要路径。小数据时代,在数据的限制无法突破的情形下,对数据信息和价 值 的获取渴求使得对算法的研究越来越深入,发明的算法越来越复杂。而事实表明,当数据量以指数级扩张时,原来在小数量级的数据中表现很差的简单算法,准确

7、率会大幅提高;与之相反的是,在少量数据情况下运行得最好的复杂算法, 在加 入更多数据时,其算法的优势则不在显现。为此,更多的数据比算法系统显得更 智能 更重要,大数据的简单算法比小数据的复杂算法更有效。从“为什么”到“是什么”小数据时代,由于数据可获得性和计算能力的有限性, 使得我们对于问题的 研究需要在假设的基础上进行验证,并探究“为什么”,而始于假设的分析研究 非常容易受偏见支配。大数据时代,快速发展的数据存储、数据传输、数据获取、数据处理等系列技术群,为我们对于问题的研究提供了新的视野和有价值的预测,并使我们获得 更多以往所不曾被关注的联系与动态, 探究“是什么”成为我们发现世界了解世

8、界的更便捷的途径,且不会受先验假设的偏见影响。从“因果关系”到“相关关系”小数据时代,信息的匮乏会使我们趋向于采用因果关系范式去快速理解问题 并做出决策,虽然这种因果关系可能并不存在,但这是我们理解和解释世界的 条捷径。在人类力量有限性凸显的时候,这种认知捷径往往能带给我们一种认知 上的安慰感和安全感,仿佛世界就是因果性的存在着。由于大数据时代对于数据的研究不再拘泥于对因果关系的探究,这将会使我 们完全有条件向关联、非关联等相关关系探究的转变。类似啤酒与尿布存在相关 性的经典案例不胜枚举。海量数据不断被制造与我们对于数据搜集、存储、传输、 处理能力的日益提高,是大数据时代的当下特征。基于互联网

9、、云计算等现代化 手段,对海量的数据进行统计性的搜索、比较、分析、归纳,我们会发现,原本 似乎毫不相干的事物之间存在着较高的关联度, 这是传统的因果分析、逻辑推理 调研 难以解释也无法企及的。当然,相关关系并不是大数据洞察的终结目标。 在很多情况下,一旦我们完 成了对大数据的相关关系分析,而又不再满足于仅仅“是什么”时,我们就会 继 续朝向因果关系的研究,寻求“为什么”,并且基于相关关系的分析,进一步寻 求因果关系将会大大降低其分析成本。其实,因果关系就是一种特殊的相关关系。从“审慎的决策与行动”到“快速的决策与行动”小数据时代,我们基于对社会运作情境的假设,通过收集和分析数据来验证 这种假设;通过数据的检验,原有假设不成立,意味着我们将重新开始新的假设 并重新收集和分析新的数据,直到我们的验证通过为止。因此,小数据时代,我 们的决策与行动是审慎的。大数据时代,我们不再受限于传统的思维模式和隐含的假定, 我们需要对大数据分析的工具理论,通过对大数据的分析,大数据会为我们呈现出新的深刻 洞 见和释放出巨大的价值。我们在大数据的指导下探索世界并且不再受制

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论