版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、终于有人把云计算、大数据和人工智能讲明白了! 今天跟大家讲讲云计算、大数据和人工智能。为什么讲这三个东西呢?因为这三个东西现在非常火,并且它们之间好像互相有关系:一般谈云计算的时候会提到大数据、谈人工智能的时候会提大数据、谈人工智能的时候会提云计算感觉三者之间相辅相成又不可分割。但如果是非技术的人员,就可能比较难理解这三者之间的相互关系,所以有必要解释一下。目录TOC o 1-3 h z u HYPERLINK l _Toc512697926 一、云计算最初的目标 PAGEREF _Toc512697926 h 1 HYPERLINK l _Toc512697927 二、云计算不光管资源,也要
2、管应用 PAGEREF _Toc512697927 h 9 HYPERLINK l _Toc512697928 三、大数据拥抱云计算 PAGEREF _Toc512697928 h 14 HYPERLINK l _Toc512697929 四、人工智能拥抱大数据 PAGEREF _Toc512697929 h 23一、云计算最初初的目标我们首先来说云云计算。云计计算最初的目目标是对资源源的管理,管管理的主要是是计算资源、网网络资源、存存储资源三个个方面。1管数据中心就就像配电脑什么叫计算、网网络、存储资资源?比如你要买台笔笔记本电脑,是是不是要关心心这台电脑是是什么样的CCPU?多大大的内存?
3、这这两个就被我我们称为计算算资源。这台电脑要上网网,就需要有有个可以插网网线的网口,或或者有可以连连接我们家路路由器的无线线网卡。您家家也需要到运运营商比如联联通、移动或或者电信开通通一个网络,比比如100MM的带宽。然然后会有师傅傅弄一根网线线到您家来,师师傅可能会帮帮您将您的路路由器和他们们公司的网络络连接配置好好。这样您家家的所有的电电脑、手机、平平板就都可以以通过您的路路由器上网了了。这就是网网络资源。您可能还会问硬硬盘多大?过过去的硬盘都都很小,大小小如10G之之类的;后来来即使5000G、1T、22T的硬盘也也不新鲜了。(1T是10000G),这这就是存储资资源。对于一台电脑是是这
4、个样子的的,对于一个个数据中心也也是同样的。想想象你有一个个非常非常大大的机房,里里面堆了很多多的服务器,这这些服务器也也是有CPUU、内存、硬硬盘的,也是是通过类似路路由器的设备备上网的。这这时的问题就就是:运营数数据中心的人人是怎么把这这些设备统一一的管理起来来的呢?2灵活就是想啥啥时要都有,想想要多少都行行管理的目标就是是要达到两个个方面的灵活活性。具体哪哪两个方面呢呢?举个例子来理解解:比如有个个人需要一台台很小的电脑脑,只有一个个CPU、11G内存、110G的硬盘盘、一兆的带带宽,你能给给他吗?像这这种这么小规规格的电脑,现现在随便一个个笔记本电脑脑都比这个配配置强了,家家里随便拉一
5、一个宽带都要要100M。然然而如果去一一个云计算的的平台上,他他要想要这个个资源时,只只要一点就有有了。这种情况下它就就能达到两个个方面灵活性性:时间灵活性:想想什么时候要要就什么时候候要,需要的的时候一点就就出来了;空间灵活性:想想要多少就有有多少。需要要一个太很小小的电脑,可可以满足;需需要一个特别别大的空间例例如云盘,云云盘给每个人人分配的空间间动不动就很很大很大,随随时上传随时时有空间,永永远用不完,也也是可以满足足的。空间灵活性和时时间灵活性,即即我们常说的的云计算的弹弹性。而解决决这个弹性的的问题,经历历了漫长时间间的发展。3物理设备不灵灵活第一个阶段是物物理设备时期期。这个时期期
6、客户需要一一台电脑,我我们就买一台台放在数据中中心里。物理设备当然是是越来越牛,例例如服务器,内内存动不动就就是百G内存存;例如网络络设备,一个个端口的带宽宽就能有几十十G甚至上百百G;例如存存储,在数据据中心至少是是PB级别的的(一个P是是1000个个T,一个TT是10000个G)。然而物理设备不不能做到很好好的灵活性:首先是它缺乏时时间灵活性。不能够达到想什么时候要就什么时候要。比如买台服务器、买个电脑,都要有采购的时间。如果突然用户告诉某个云厂商,说想要开台电脑,使用物理服务器,当时去采购就很难。与供应商关系好的可能需要一个星期,与供应商关系一般的就可能需要采购一个月。用户等了很久电脑才
7、到位,这时用户还要登录上去慢慢开始部署自己的应用。时间灵活性非常差。其次是它的空间间灵活性也不不行。例如上上述的用户需需要一个很小小很小的电脑脑,但现在哪哪还有这么小小型号的电脑脑?不能为了了满足用户只只要一个G的的内存是800G硬盘的,就就去买一个这这么小的机器器。但是如果果买一个大的的,又会因为为电脑大,需需要向用户多多收钱,可用用户需要用的的只有那么小小一点,所以以多付钱就很很冤。4虚拟化灵活多多了有人就想办法了了。第一个办办法就是虚拟拟化。用户不不是只要一个个很小的电脑脑么?数据中中心的物理设设备都很强大大,我可以从从物理的CPPU、内存、硬硬盘中虚拟出出一小块来给给客户,同时时也可以
8、虚拟拟出一小块来来给其他客户户。每个客户户只能看到自自己的那一小小块,但其实实每个客户用用的是整个大大的设备上的的一小块。虚拟化的技术使使得不同客户户的电脑看起起来是隔离的的。也就是我我看着好像这这块盘就是我我的,你看着着这块盘就是是你的,但实实际情况可能能我的这个110G和你的的这个10GG是落在同样样一个很大很很大的存储上上。而且如果果事先物理设设备都准备好好,虚拟化软软件虚拟出一一个电脑是非非常快的,基基本上几分钟钟就能解决。所所以在任何一一个云上要创创建一台电脑脑,一点几分分钟就出来了了,就是这个个道理。这样空间灵活性性和时间灵活活性就基本解解决了。5虚拟世界的赚赚钱与情怀在虚拟化阶段
9、,最最牛的公司是是VMwarre。它是实实现虚拟化技技术比较早的的一家公司,可可以实现计算算、网络、存存储的虚拟化化。这家公司司很牛,性能能做得非常好好,虚拟化软软件卖得也非非常好,赚了了好多的钱,后后来让EMCC(世界五百百强,存储厂厂商第一品牌牌)给收购了了。但这个世界上还还是有很多有有情怀的人的的,尤其是程程序员里面。有有情怀的人喜喜欢做什么事事情?开源。这个世界上很多多软件都是有有闭源就有开开源,源就是是源代码。也也就是说,某某个软件做的的好,所有人人都爱用,但但这个软件的的代码被我封封闭起来,只只有我公司知知道,其他人人不知道。如如果其他人想想用这个软件件,就要向我我付钱,这就就叫闭
10、源。但世界上总有一一些大牛看不不惯钱都让一一家赚了去的的情况。大牛牛们觉得,这这个技术你会会我也会;你你能开发出来来,我也能。我我开发出来就就是不收钱,把把代码拿出来来分享给大家家,全世界谁谁用都可以,所所有的人都可可以享受到好好处,这个叫叫做开源。比如最近的蒂姆姆伯纳斯李就是个非非常有情怀的的人。20117年,他因因“发明万维维网、第一个个浏览器和使使万维网得以以扩展的基本本协议和算法法”而获得22016年度度的图灵奖。图图灵奖就是计计算机界的诺诺贝尔奖。然然而他最令人人敬佩的是,他他将万维网,也也就是我们常常见的WWWW技术无偿贡贡献给全世界界免费使用。我我们现在在网网上的所有行行为都应该
11、感感谢他的功劳劳,如果他将将这个技术拿拿来收钱,应应该和比尔盖盖茨差不多有有钱。开源和闭源的例例子有很多:例如在闭源的世世界里有Wiindowss,大家用WWindowws都得给微微软付钱;开开源的世界里里面就出现了了Linuxx。比尔盖茨茨靠Winddows、OOfficee这些闭源的的软件赚了很很多钱,称为为世界首富,就就有大牛开发发了另外一种种操作系统LLinux。很很多人可能没没有听说过LLinux,很很多后台的服服务器上跑的的程序都是LLinux上上的,比如大大家享受双十十一,无论是是淘宝、京东东、考拉支撑双十一一抢购的系统统都是跑在LLinux上上的。再如有Applle就有安卓卓。
12、Applle市值很高高,但是苹果果系统的代码码我们是看不不到的。于是是就有大牛写写了安卓手机机操作系统。所所以大家可以以看到几乎所所有的其他手手机厂商,里里面都装安卓卓系统。原因因就是苹果系系统不开源,而而安卓系统大大家都可以用用。在虚拟化软件也也一样,有了了VMwarre,这个软软件非常贵。那那就有大牛写写了两个开源源的虚拟化软软件,一个叫叫做Xen,一一个叫做KVVM,如果不不做技术的,可可以不用管这这两个名字,但但是后面还是是会提到。6虚拟化的半自自动和云计算算的全自动要说虚拟化软件件解决了灵活活性问题,其其实并不全对对。因为虚拟拟化软件一般般创建一台虚虚拟的电脑,是是需要人工指指定这台
13、虚拟拟电脑放在哪哪台物理机上上的。这一过过程可能还需需要比较复杂杂的人工配置置。所以使用用VMwarre的虚拟化化软件,需要要考一个很牛牛的证书,而而能拿到这个个证书的人,薪薪资是相当高高,也可见复复杂程度。所以仅仅凭虚拟拟化软件所能能管理的物理理机的集群规规模都不是特特别大,一般般在十几台、几几十台、最多多百台这么一一个规模。这一方面会影响响时间灵活性性:虽然虚拟拟出一台电脑脑的时间很短短,但是随着着集群规模的的扩大,人工工配置的过程程越来越复杂杂,越来越耗耗时。另一方方面也影响空空间灵活性:当用户数量量多时,这点点集群规模,还还远达不到想想要多少要多多少的程度,很很可能这点资资源很快就用用
14、完了,还得得去采购。所以随着集群的的规模越来越越大,基本都都是千台起步步,动辄上万万台、甚至几几十上百万台台。如果去查查一下BATT,包括网易易、谷歌、亚亚马逊,服务务器数目都大大的吓人。这这么多机器要要靠人去选一一个位置放这这台虚拟化的的电脑并做相相应的配置,几几乎是不可能能的事情,还还是需要机器器去做这个事事情。人们发明了各种种各样的算法法来做这个事事情,算法的的名字叫做调调度(Schheduleer)。通俗俗一点说,就就是有一个调调度中心,几几千台机器都都在一个池子子里面,无论论用户需要多多少CPU、内内存、硬盘的的虚拟电脑,调调度中心会自自动在大池子子里面找一个个能够满足用用户需求的地
15、地方,把虚拟拟电脑启动起起来做好配置置,用户就直直接能用了。这这个阶段我们们称为池化或或者云化。到到了这个阶段段,才可以称称为云计算,在在这之前都只只能叫虚拟化化。7云计算的私有有与公有云计算大致分两两种:一个是是私有云,一一个是公有云云,还有人把把私有云和公公有云连接起起来称为混合合云,这里暂暂且不说这个个。私有云:把虚拟拟化和云化的的这套软件部部署在别人的的数据中心里里面。使用私私有云的用户户往往很有钱钱,自己买地地建机房、自自己买服务器器,然后让云云厂商部署在在自己这里。VVMwaree后来除了虚虚拟化,也推推出了云计算算的产品,并并且在私有云云市场赚的盆盆满钵满。公有云:把虚拟拟化和云
16、化软软件部署在云云厂商自己数数据中心里面面的,用户不不需要很大的的投入,只要要注册一个账账号,就能在在一个网页上上点一下创建建一台虚拟电电脑。例如AAWS即亚马马逊的公有云云;例如国内内的阿里云、腾腾讯云、网易易云等。亚马逊为什么要要做公有云呢呢?我们知道道亚马逊原来来是国外比较较大的一个电电商,它做电电商时也肯定定会遇到类似似双十一的场场景:在某一一个时刻大家家都冲上来买买东西。当大大家都冲上买买东西时,就就特别需要云云的时间灵活活性和空间灵灵活性。因为为它不能时刻刻准备好所有有的资源,那那样太浪费了了。但也不能能什么都不准准备,看着双双十一这么多多用户想买东东西登不上去去。所以需要要双十一
17、时,就就创建一大批批虚拟电脑来来支撑电商应应用,过了双双十一再把这这些资源都释释放掉去干别别的。因此亚亚马逊是需要要一个云平台台的。然而商用的虚拟拟化软件实在在是太贵了,亚亚马逊总不能能把自己在电电商赚的钱全全部给了虚拟拟化厂商。于于是亚马逊基基于开源的虚虚拟化技术,如如上所述的XXen或者KKVM,开发发了一套自己己的云化软件件。没想到亚亚马逊后来电电商越做越牛牛,云平台也也越做越牛。由于它的云平台台需要支撑自自己的电商应应用;而传统统的云计算厂厂商多为ITT厂商出身,几几乎没有自己己的应用,所所以亚马逊的的云平台对应应用更加友好好,迅速发展展成为云计算算的第一品牌牌,赚了很多多钱。在亚马逊
18、公布其其云计算平台台财报之前,人人们都猜测,亚亚马逊电商赚赚钱,云也赚赚钱吗?后来来一公布财报报,发现不是是一般的赚钱钱。仅仅去年年,亚马逊AAWS年营收收达122亿亿美元,运营营利润31亿亿美元。8云计算的赚钱钱与情怀公有云的第一名名亚马逊过得得很爽,第二二名Rackkspacee过得就一般般了。没办法法,这就是互互联网行业的的残酷性,多多是赢者通吃吃的模式。所所以第二名如如果不是云计计算行业的,很很多人可能都都没听过了。第二名就想,我我干不过老大大怎么办呢?开源吧。如如上所述,亚亚马逊虽然使使用了开源的的虚拟化技术术,但云化的的代码是闭源源的。很多想想做又做不了了云化平台的的公司,只能能眼
19、巴巴的看看着亚马逊挣挣大钱。Raackspaace把源代代码一公开,整整个行业就可可以一起把这这个平台越做做越好,兄弟弟们大家一起起上,和老大大拼了。于是Racksspace和和美国航空航航天局合作创创办了开源软软件OpennStackk,如上图所所示OpennStackk的架构图,不不是云计算行行业的不用弄弄懂这个图,但但能够看到三三个关键字:Compuute计算、NNetworrking网网络、Stoorage存存储。还是一一个计算、网网络、存储的的云化管理平平台。当然第二名的技技术也是非常常棒的,有了了OpenSStack之之后,果真像像Racksspace想想的一样,所所有想做云的的大
20、企业都疯疯了,你能想想象到的所有有如雷贯耳的的大型IT企企业:IBMM、惠普、戴戴尔、华为、联联想等都疯了了。原来云平台大家家都想做,看看着亚马逊和和VMwarre赚了这么么多钱,眼巴巴巴看着没办办法,想自己己做一个好像像难度还挺大大。现在好了了,有了这样样一个开源的的云平台OppenStaack,所有有的IT厂商商都加入到这这个社区中来来,对这个云云平台进行贡贡献,包装成成自己的产品品,连同自己己的硬件设备备一起卖。有有的做了私有有云,有的做做了公有云,OOpenSttack已经经成为开源云云平台的事实实标准。9IaaS,资源层面面的灵活性随着OpenSStack的的技术越来越越成熟,可以以
21、管理的规模模也越来越大大,并且可以以有多个OppenStaack集群部部署多套。比比如北京部署署一套、杭州州部署两套、广广州部署一套套,然后进行行统一的管理理。这样整个个规模就更大大了。在这个规模下,对对于普通用户户的感知来讲讲,基本能够够做到想什么么时候要就什什么什么要,想想要多少就要要多少。还是是拿云盘举例例子,每个用用户云盘都分分配了5T甚甚至更大的空空间,如果有有1亿人,那那加起来空间间多大啊。其实背后的机制制是这样的:分配你的空空间,你可能能只用了其中中很少一点,比比如说它分配配给你了5个个T,这么大大的空间仅仅仅是你看到的的,而不是真真的就给你了了,你其实只只用了50个个G,则真实
22、实给你的就是是50个G,随随着你文件的的不断上传,分分给你的空间间会越来越多多。当大家都上传,云云平台发现快快满了的时候候(例如用了了70%),会会采购更多的的服务器,扩扩充背后的资资源,这个对对用户是透明明的、看不到到的。从感觉觉上来讲,就就实现了云计计算的弹性。其其实有点像银银行,给储户户的感觉是什什么时候取钱钱都有,只要要不同时挤兑兑,银行就不不会垮。10总结到了这个阶段,云云计算基本上上实现了时间间灵活性和空空间灵活性;实现了计算算、网络、存存储资源的弹弹性。计算、网网络、存储我我们常称为基基础设施Innfrasttructuure, 因因而这个阶段段的弹性称为为资源层面的的弹性。管理
23、理资源的云平平台,我们称称为基础设施施服务,也就就是我们常听听到的IaaaS(Infraastruccture As A Serviice)。二、云计算不光光管资源,也也要管应用有了IaaS,实实现了资源层层面的弹性就就够了吗?显显然不是,还还有应用层面面的弹性。这里举个例子:比如说实现现一个电商的的应用,平时时十台机器就就够了,双十十一需要一百百台。你可能能觉得很好办办啊,有了IIaaS,新新创建九十台台机器就可以以了啊。但990台机器创创建出来是空空的,电商应应用并没有放放上去,只能能让公司的运运维人员一台台一台的弄,需需要很长时间间才能安装好好的。虽然资源层面实实现了弹性,但但没有应用层
24、层的弹性,依依然灵活性是是不够的。有有没有方法解解决这个问题题呢?人们在IaaSS平台之上又又加了一层,用用于管理资源源以上的应用用弹性的问题题,这一层通通常称为PaaaS(Pllatforrm As A Serrvice)。这一层往往比较难理解,大致分两部分:一部分笔者称为“你自己的应用自动安装”,一部分笔者称为“通用的应用不用安装”。自己的应用自动动安装:比如如电商应用是是你自己开发发的,除了你你自己,其他他人是不知道道怎么安装的的。像电商应应用,安装时时需要配置支支付宝或者微微信的账号,才才能使别人在在你的电商上上买东西时,付付的钱是打到到你的账户里里面的,除了了你,谁也不不知道。所以以
25、安装的过程程平台帮不了了忙,但能够够帮你做得自自动化,你需需要做一些工工作,将自己己的配置信息息融入到自动动化的安装过过程中方可。比比如上面的例例子,双十一一新创建出来来的90台机机器是空的,如如果能够提供供一个工具,能能够自动在这这新的90台台机器上将电电商应用安装装好,就能够够实现应用层层面的真正弹弹性。例如PPuppett、Cheff、Ansiible、CCloud Founddary都可可以干这件事事情,最新的的容器技术DDockerr能更好的干干这件事情。通用的应用不用用安装:所谓谓通用的应用用,一般指一一些复杂性比比较高,但大大家都在用的的,例如数据据库。几乎所所有的应用都都会用数
26、据库库,但数据库库软件是标准准的,虽然安安装和维护比比较复杂,但但无论谁安装装都是一样。这这样的应用可可以变成标准准的PaaSS层的应用放放在云平台的的界面上。当当用户需要一一个数据库时时,一点就出出来了,用户户就可以直接接用了。有人人问,既然谁谁安装都一个个样,那我自自己来好了,不不需要花钱在在云平台上买买。当然不是是,数据库是是一个非常难难的东西,光光Oraclle这家公司司,靠数据库库就能赚这么么多钱。买OOraclee也是要花很很多钱的。然而大多数云平平台会提供MMySQL这这样的开源数数据库,又是是开源,钱不不需要花这么么多了。但维维护这个数据据库,却需要要专门招一个个很大的团队队,
27、如果这个个数据库能够够优化到能够够支撑双十一一,也不是一一年两年能够够搞定的。比如您是一个做做单车的,当当然没必要招招一个非常大大的数据库团团队来干这件件事情,成本本太高了,应应该交给云平平台来做这件件事情,专业业的事情专业业的人来做,云云平台专门养养了几百人维维护这套系统统,您只要专专注于您的单单车应用就可可以了。要么是自动部署署,要么是不不用部署,总总的来说就是是应用层你也也要少操心,这这就是PaaaS层的重要要作用。虽说脚本的方式式能够解决自自己的应用的的部署问题,然然而不同的环环境千差万别别,一个脚本本往往在一个个环境上运行行正确,到另另一个环境就就不正确了。而容器是能更好好地解决这个
28、个问题。容器是 Conntaineer,Conntaineer另一个意意思是集装箱箱,其实容器器的思想就是是要变成软件件交付的集装装箱。集装箱箱的特点:一一是封装,二二是标准。在没有集装箱的的时代,假设设将货物从 A运到 BB,中间要经经过三个码头头、换三次船船。每次都要要将货物卸下下船来,摆得得七零八落,然然后搬上船重重新整齐摆好好。因此在没没有集装箱时时,每次换船船,船员们都都要在岸上待待几天才能走走。有了集装箱以后后,所有的货货物都打包在在一起了,并并且集装箱的的尺寸全部一一致,所以每每次换船时,一一个箱子整体体搬过去就行行了,小时级级别就能完成成,船员再也也不用上岸长长时间耽搁了了。这
29、是集装箱“封封装”、“标标准”两大特特点在生活中中的应用。那么容器如何对对应用打包呢呢?还是要学学习集装箱。首首先要有个封封闭的环境,将将货物封装起起来,让货物物之间互不干干扰、互相隔隔离,这样装装货卸货才方方便。好在 Ubunttu中的LXXC技术早就就能做到这一一点。封闭的环境主要要使用了两种种技术,一种种是看起来是是隔离的技术术,称为 NNamesppace,也也即每个 NNamesppace中的的应用看到的的是不同的 IP地址、用用户空间、程程号等。另一一种是用起来来是隔离的技技术,称为 Cgrouups,也即即明明整台机机器有很多的的 CPU、内内存,而一个个应用只能用用其中的一部部
30、分。所谓的镜像,就就是将你焊好好集装箱的那那一刻,将集集装箱的状态态保存下来,就就像孙悟空说说:“定”,集集装箱里面就就定在了那一一刻,然后将将这一刻的状状态保存成一一系列文件。这这些文件的格格式是标准的的,谁看到这这些文件都能能还原当时定定住的那个时时刻。将镜像像还原成运行行时的过程(就就是读取镜像像文件,还原原那个时刻的的过程)就是是容器运行的的过程。有了容器,使得得 PaaSS层对于用户户自身应用的的自动部署变变得快速而优优雅。三、大数据拥抱抱云计算在PaaS层中中一个复杂的的通用应用就就是大数据平平台。大数据据是如何一步步一步融入云云计算的呢?1数据不大也包包含智慧一开始这个大数数据并
31、不大。原原来才有多少少数据?现在在大家都去看看电子书,上上网看新闻了了,在我们880后小时候候,信息量没没有那么大,也也就看看书、看看看报,一个个星期的报纸纸加起来才有有多少字?如如果你不在一一个大城市,一一个普通的学学校的图书馆馆加起来也没没几个书架,是是后来随着信信息化的到来来,信息才会会越来越多。首先我们来看一一下大数据里里面的数据,就就分三种类型型,一种叫结结构化的数据据,一种叫非非结构化的数数据,还有一一种叫半结构构化的数据。结构化的数据:即有固定格格式和有限长长度的数据。例例如填的表格格就是结构化化的数据,国国籍:中华人人民共和国,民民族:汉,性性别:男,这这都叫结构化化数据。非结
32、构化的数据据:现在非结结构化的数据据越来越多,就就是不定长、无无固定格式的的数据,例如如网页,有时时候非常长,有有时候几句话话就没了;例例如语音,视视频都是非结结构化的数据据。半结构化数据:是一些XMML或者HTTML的格式式的,不从事事技术的可能能不了解,但但也没有关系系。其实数据本身不不是有用的,必必须要经过一一定的处理。例例如你每天跑跑步带个手环环收集的也是是数据,网上上这么多网页页也是数据,我我们称为Daata。数据据本身没有什什么用处,但但数据里面包包含一个很重重要的东西,叫叫做信息(IInformmationn)。数据十分杂乱,经经过梳理和清清洗,才能够够称为信息。信信息会包含很很
33、多规律,我我们需要从信信息中将规律律总结出来,称称为知识(KKnowleedge),而而知识改变命命运。信息是是很多的,但但有人看到了了信息相当于于白看,但有有人就从信息息中看到了电电商的未来,有有人看到了直直播的未来,所所以人家就牛牛了。如果你你没有从信息息中提取出知知识,天天看看朋友圈也只只能在互联网网滚滚大潮中中做个看客。有了知识,然后后利用这些知知识去应用于于实战,有的的人会做得非非常好,这个个东西叫做智智慧(Inttelliggence)。有有知识并不一一定有智慧,例例如好多学者者很有知识,已已经发生的事事情可以从各各个角度分析析得头头是道道,但一到实实干就歇菜,并并不能转化成成为智
34、慧。而而很多的创业业家之所以伟伟大,就是通通过获得的知知识应用于实实践,最后做做了很大的生生意。所以数据的应用用分这四个步步骤:数据、信信息、知识、智智慧。最终的阶段是很很多商家都想想要的。你看看我收集了这这么多的数据据,能不能基基于这些数据据来帮我做下下一步的决策策,改善我的的产品。例如如让用户看视视频的时候旁旁边弹出广告告,正好是他他想买的东西西;再如让用用户听音乐时时,另外推荐荐一些他非常常想听的其他他音乐。用户在我的应用用或者网站上上随便点点鼠鼠标,输入文文字对我来说说都是数据,我我就是要将其其中某些东西西提取出来、指指导实践、形形成智慧,让让用户陷入到到我的应用里里面不可自拔拔,上了
35、我的的网就不想离离开,手不停停地点、不停停地买。很多人说双十一一我都想断网网了,我老婆婆在上面不断断地买买买,买买了A又推荐荐B,老婆大大人说,“哎哎呀,B也是是我喜欢的啊啊,老公我要要买”。你说说这个程序怎怎么这么牛,这这么有智慧,比比我还了解我我老婆,这件件事情是怎么么做到的呢?2数据如何升华华为智慧数据的处理分几几个步骤,完完成了才最后后会有智慧。第一个步骤叫数数据的收集。首先得有数据,数据的收集有两个方式:第一个方式是拿拿,专业点的的说法叫抓取取或者爬取。例例如搜索引擎擎就是这么做做的:它把网网上的所有的的信息都下载载到它的数据据中心,然后后你一搜才能能搜出来。比比如你去搜索索的时候,
36、结结果会是一个个列表,这个个列表为什么么会在搜索引引擎的公司里里面?就是因因为他把数据据都拿下来了了,但是你一一点链接,点点出来这个网网站就不在搜搜索引擎它们们公司了。比比如说新浪有有个新闻,你你拿百度搜出出来,你不点点的时候,那那一页在百度度数据中心,一一点出来的网网页就是在新新浪的数据中中心了。第二个方式是推推送,有很多多终端可以帮帮我收集数据据。比如说小小米手环,可可以将你每天天跑步的数据据,心跳的数数据,睡眠的的数据都上传传到数据中心心里面。第二个步骤是数数据的传输。一般会通过队列方式进行,因为数据量实在是太大了,数据必须经过处理才会有用。可系统处理不过来,只好排好队,慢慢处理。第三个
37、步骤是数数据的存储。现现在数据就是是金钱,掌握握了数据就相相当于掌握了了钱。要不然然网站怎么知知道你想买什什么?就是因因为它有你历历史的交易的的数据,这个个信息可不能能给别人,十十分宝贵,所所以需要存储储下来。第四个步骤是数数据的处理和和分析。上面面存储的数据据是原始数据据,原始数据据多是杂乱无无章的,有很很多垃圾数据据在里面,因因而需要清洗洗和过滤,得得到一些高质质量的数据。对对于高质量的的数据,就可可以进行分析析,从而对数数据进行分类类,或者发现现数据之间的的相互关系,得得到知识。比如盛传的沃尔尔玛超市的啤啤酒和尿布的的故事,就是是通过对人们们的购买数据据进行分析,发发现了男人一一般买尿布
38、的的时候,会同同时购买啤酒酒,这样就发发现了啤酒和和尿布之间的的相互关系,获获得知识,然然后应用到实实践中,将啤啤酒和尿布的的柜台弄的很很近,就获得得了智慧。第五个步骤是对对于数据的检检索和挖掘。检索就是搜索,所谓外事不决问Google,内事不决问百度。内外两大搜索引擎都是将分析后的数据放入搜索引擎,因此人们想寻找信息的时候,一搜就有了。另外就是挖掘,仅仅仅搜索出来来已经不能满满足人们的要要求了,还需需要从信息中中挖掘出相互互的关系。比比如财经搜索索,当搜索某某个公司股票票的时候,该该公司的高管管是不是也应应该被挖掘出出来呢?如果果仅仅搜索出出这个公司的的股票发现涨涨的特别好,于于是你就去买买
39、了,其实其其高管发了一一个声明,对对股票十分不不利,第二天天就跌了,这这不坑害广大大股民么?所所以通过各种种算法挖掘数数据中的关系系,形成知识识库,十分重重要。3大数据时代,众众人拾柴火焰焰高当数据量很小时时,很少的几几台机器就能能解决。慢慢慢的,当数据据量越来越大大,最牛的服服务器都解决决不了问题时时,怎么办呢呢?这时就要要聚合多台机机器的力量,大大家齐心协力力一起把这个个事搞定,众众人拾柴火焰焰高。对于数据的收集集:就IoTT来讲,外面面部署这成千千上万的检测测设备,将大大量的温度、湿湿度、监控、电电力等数据统统统收集上来来;就互联网网网页的搜索索引擎来讲,需需要将整个互互联网所有的的网页
40、都下载载下来。这显显然一台机器器做不到,需需要多台机器器组成网络爬爬虫系统,每每台机器下载载一部分,同同时工作,才才能在有限的的时间内,将将海量的网页页下载完毕。对于数据的传输输:一个内存存里面的队列列肯定会被大大量的数据挤挤爆掉,于是是就产生了基基于硬盘的分分布式队列,这这样队列可以以多台机器同同时传输,随随你数据量多多大,只要我我的队列足够够多,管道足足够粗,就能能够撑得住。对于数据的存储储:一台机器器的文件系统统肯定是放不不下的,所以以需要一个很很大的分布式式文件系统来来做这件事情情,把多台机机器的硬盘打打成一块大的的文件系统。对于数据的分析析:可能需要要对大量的数数据做分解、统统计、汇
41、总,一一台机器肯定定搞不定,处处理到猴年马马月也分析不不完。于是就就有分布式计计算的方法,将将大量的数据据分成小份,每每台机器处理理一小份,多多台机器并行行处理,很快快就能算完。例例如著名的TTerasoort对1个个TB的数据据排序,相当当于10000G,如果单单机处理,怎怎么也要几个个小时,但并并行处理2009秒就完成成了。所以说什么叫做做大数据?说说白了就是一一台机器干不不完,大家一一起干。可是是随着数据量量越来越大,很很多不大的公公司都需要处处理相当多的的数据,这些些小公司没有有这么多机器器可怎么办呢呢?4大数据需要云云计算,云计计算需要大数数据说到这里,大家家想起云计算算了吧。当想想
42、要干这些活活时,需要很很多的机器一一块做,真的的是想什么时时候要就什么么时候要,想想要多少就要要多少。例如大数据分析析公司的财务务情况,可能能一周分析一一次,如果要要把这一百台台机器或者一一千台机器都都在那放着,一一周用一次非非常浪费。那那能不能需要要计算的时候候,把这一千千台机器拿出出来;不算的的时候,让这这一千台机器器去干别的事事情?谁能做这个事儿儿呢?只有云云计算,可以以为大数据的的运算提供资资源层的灵活活性。而云计计算也会部署署大数据放到到它的PaaaS平台上,作作为一个非常常非常重要的的通用应用。因因为大数据平平台能够使得得多台机器一一起干一个事事儿,这个东东西不是一般般人能开发出出
43、来的,也不不是一般人玩玩得转的,怎怎么也得雇个个几十上百号号人才能把这这个玩起来。所以说就像数据据库一样,其其实还是需要要有一帮专业业的人来玩这这个东西。现现在公有云上上基本上都会会有大数据的的解决方案了了,一个小公公司需要大数数据平台的时时候,不需要要采购一千台台机器,只要要到公有云上上一点,这一一千台机器都都出来了,并并且上面已经经部署好了的的大数据平台台,只要把数数据放进去算算就可以了。云计算需要大数数据,大数据据需要云计算算,二者就这这样结合了。四、人工智能拥拥抱大数据1机器什么时候候才能懂人心心虽说有了大数据据,人的欲望望却不能够满满足。虽说在在大数据平台台里面有搜索索引擎这个东东西
44、,想要什什么东西一搜搜就出来了。但但也存在这样样的情况:我我想要的东西西不会搜,表表达不出来,搜搜索出来的又又不是我想要要的。例如音乐软件推推荐了一首歌歌,这首歌我我没听过,当当然不知道名名字,也没法法搜。但是软软件推荐给我我,我的确喜喜欢,这就是是搜索做不到到的事情。当当人们使用这这种应用时,会会发现机器知知道我想要什什么,而不是是说当我想要要时,去机器器里面搜索。这这个机器真像像我的朋友一一样懂我,这这就有点人工工智能的意思思了。人们很早就在想想这个事情了了。最早的时时候,人们想想象,要是有有一堵墙,墙墙后面是个机机器,我给它它说话,它就就给我回应。如如果我感觉不不出它那边是是人还是机器器
45、,那它就真真的是一个人人工智能的东东西了。2让机器学会推推理怎么才能做到这这一点呢?人人们就想:我我首先要告诉诉计算机人类类的推理的能能力。你看人人重要的是什什么?人和动动物的区别在在什么?就是是能推理。要要是把我这个个推理的能力力告诉机器,让让机器根据你你的提问,推推理出相应的的回答,这样样多好?其实目前人们慢慢慢地让机器器能够做到一一些推理了,例例如证明数学学公式。这是是一个非常让让人惊喜的一一个过程,机机器竟然能够够证明数学公公式。但慢慢慢又发现其实实这个结果也也没有那么令令人惊喜。因因为大家发现现了一个问题题:数学公式式非常严谨,推推理过程也非非常严谨,而而且数学公式式很容易拿机机器来
46、进行表表达,程序也也相对容易表表达。然而人类的语言言就没这么简简单了。比如如今天晚上,你你和你女朋友友约会,你女女朋友说:如如果你早来,我我没来;你等等着,如果我我早来;你没没来,你等着着!这个机器器就比较难理理解了,但人人都懂。所以以你和女朋友友约会,是不不敢迟到的。3教给机器知识识因此,仅仅告诉诉机器严格的的推理是不够够的,还要告告诉机器一些些知识。但告告诉机器知识识这个事情,一一般人可能就就做不来了。可可能专家可以以,比如语言言领域的专家家或者财经领领域的专家。语言领域和财经经领域知识能能不能表示成成像数学公式式一样稍微严严格点呢?例例如语言专家家可能会总结结出主谓宾定定状补这些语语法规
47、则,主主语后面一定定是谓语,谓谓语后面一定定是宾语,将将这些总结出出来,并严格格表达出来不不久行了吗?后来发现这个不不行,太难总总结了,语言言表达千变万万化。就拿主主谓宾的例子子,很多时候候在口语里面面就省略了谓谓语,别人问问:你谁啊?我回答:我我刘超。但你你不能规定在在语音语义识识别时,要求求对着机器说说标准的书面面语,这样还还是不够智能能,就像罗永永浩在一次演演讲中说的那那样,每次对对着手机,用用书面语说:请帮我呼叫叫某某某,这这是一件很尴尴尬的事情。人工智能这个阶阶段叫做专家家系统。专家家系统不易成成功,一方面面是知识比较较难总结,另另一方面总结结出来的知识识难以教给计计算机。因为为你自
48、己还迷迷迷糊糊,觉觉得似乎有规规律,就是说说不出来,又又怎么能够通通过编程教给给计算机呢?4算了,教不会会你自己学吧吧于是人们想到:机器是和人人完全不一样样的物种,干干脆让机器自自己学习好了了。机器怎么学习呢呢?既然机器器的统计能力力这么强,基基于统计学习习,一定能从从大量的数字字中发现一定定的规律。其实在娱乐圈有有很好的一个个例子,可见见一般:有一位网友统计计了知名歌手手在大陆发行行的 9 张张专辑中 1117 首歌歌曲的歌词,同同一词语在一一首歌出现只只算一次,形形容词、名词词和动词的前前十名如下表表所示(词语语后面的数字字是出现的次次数):如果我们随便写写一串数字,然然后按照数位位依次在
49、形容容词、名词和和动词中取出出一个词,连连在一起会怎怎么样呢?例如取圆周率 3.14115926,对对应的词语是是:坚强,路路,飞,自由由,雨,埋,迷迷惘。稍微连连接和润色一一下:坚强的孩子,依然前行在路上上,张开翅膀飞向自自由,让雨水埋葬他的的迷惘。是不是有点感觉觉了?当然,真真正基于统计计的学习算法法比这个简单单的统计复杂杂得多。然而统计学习比比较容易理解解简单的相关关性:例如一一个词和另一一个词总是一一起出现,两两个词应该有有关系;而无无法表达复杂杂的相关性。并并且统计方法法的公式往往往非常复杂,为为了简化计算算,常常做出出各种独立性性的假设,来来降低公式的的计算难度,然然而现实生活活中
50、,具有独独立性的事件件是相对较少少的。5模拟大脑的工工作方式于是人类开始从从机器的世界界,反思人类类的世界是怎怎么工作的。人类的脑子里面面不是存储着着大量的规则则,也不是记记录着大量的的统计数据,而而是通过神经经元的触发实实现的,每个个神经元有从从其它神经元元的输入,当当接收到输入入时,会产生生一个输出来来刺激其它神神经元。于是是大量的神经经元相互反应应,最终形成成各种输出的的结果。例如当人们看到到美女瞳孔会会放大,绝不不是大脑根据据身材比例进进行规则判断断,也不是将将人生中看过过的所有的美美女都统计一一遍,而是神神经元从视网网膜触发到大大脑再回到瞳瞳孔。在这个个过程中,其其实很难总结结出每个
51、神经经元对最终的的结果起到了了哪些作用,反反正就是起作作用了。于是人们开始用用一个数学单单元模拟神经经元。这个神经元有输输入,有输出出,输入和输输出之间通过过一个公式来来表示,输入入根据重要程程度不同(权权重),影响响着输出。于是将n个神经经元通过像一一张神经网络络一样连接在在一起。n这这个数字可以以很大很大,所所有的神经元元可以分成很很多列,每一一列很多个排排列起来。每每个神经元对对于输入的权权重可以都不不相同,从而而每个神经元元的公式也不不相同。当人人们从这张网网络中输入一一个东西的时时候,希望输输出一个对人人类来讲正确确的结果。例如上面的例子子,输入一个个写着2的图图片,输出的的列表里面
52、第第二个数字最最大,其实从从机器来讲,它它既不知道输输入的这个图图片写的是22,也不知道道输出的这一一系列数字的的意义,没关关系,人知道道意义就可以以了。正如对对于神经元来来说,他们既既不知道视网网膜看到的是是美女,也不不知道瞳孔放放大是为了看看的清楚,反反正看到美女女,瞳孔放大大了,就可以以了。对于任何一张神神经网络,谁谁也不敢保证证输入是2,输输出一定是第第二个数字最最大,要保证证这个结果,需需要训练和学学习。毕竟看看到美女而瞳瞳孔放大也是是人类很多年年进化的结果果。学习的过过程就是,输输入大量的图图片,如果结结果不是想要要的结果,则则进行调整。如何调整呢?就就是每个神经经元的每个权权重都
53、向目标标进行微调,由由于神经元和和权重实在是是太多了,所所以整张网络络产生的结果果很难表现出出非此即彼的的结果,而是是向着结果微微微地进步,最最终能够达到到目标结果。当然,这些调整整的策略还是是非常有技巧巧的,需要算算法的高手来来仔细的调整整。正如人类类见到美女,瞳瞳孔一开始没没有放大到能能看清楚,于于是美女跟别别人跑了,下下次学习的结结果是瞳孔放放大一点点,而而不是放大鼻鼻孔。6没道理但做得得到听起来也没有那那么有道理,但但的确能做到到,就是这么么任性!神经网络的普遍遍性定理是这这样说的,假假设某个人给给你某种复杂杂奇特的函数数,f(x):不管这个函数是是什么样的,总总会确保有个个神经网络能能够对任何可可能的输入xx,其值f(x)(或者者某个能够准准确的近似)是是神经网络的的输出。如果在函数代表表着规律,也也意味着这个个规律无论多多么奇妙,多多么不能理解解,都是能通通过大量的神神经元,通过过大量权重的的调整,表示示出来的。7人工智能的经经济学解释这让我想到了经经济学,于是是比较容易理理解了。我们把每个神经经元当成社会会中
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 科技园区新建工业锅炉控制系统生产厂房项目可行性研究报告
- 北京市丰台区第二中学教育集团2025-2026学年度第二学期期末练习八年级英语(文字版含答案)
- 2026 年秋季开学 安全游戏课堂 规避玩耍小风险
- 德宏州农业项目可行性研究报告
- 2026年施工废水排放管理模拟试卷及答案
- 2026年皮肤科规培结业考试试题(含答案)
- 2026年国企工程部主任竞聘笔试试题(含答案)
- 2026年殡葬服务管理员职业理论考核试卷及答案
- 《移动终端安全管理平台技术要求》
- Unit 5 Off to space Section 3 Expressing and communicating ideas Writing 知识点详解讲义(自学预习)2026-2027学年沪教版英语七年级上册
- 2026-2030中国橡胶轮胎行业盈利态势及需求潜力预测报告
- 2025年内蒙古自治区公开遴选公务员考试(综合试卷)试题及答案
- 履带吊课件教学课件
- 警犬上课课件
- 2025广西壮族自治区药用植物园招聘高层次人才21人笔试模拟试题及答案解析
- 1688运营培训课件
- 环卫保洁员安全知识与防护培训
- DB31/T 1035-2017绿化有机覆盖物应用技术规范
- 五星级酒店服务员培训
- 风电机组安全作业规范
- 水质 7种青霉素的测定 高效液相色谱-串联质谱法
评论
0/150
提交评论