版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能初步机器学习作为实现人工智能的基础需要极其广泛的知识技术体系:包括脑神经科学,生命科学,社会管理学,数学,计算机科学,心理学等等。文中对于人工智能功能及适用范围的预测极为准确简练,人工智能没有必要变得和人一样,至少处理大规模数据上相较于人类来说有过之而无不及。既然如此,机器学习的优势在哪里?回归作者首先便给出数据挖掘中大规模数据分析式的学习,在处理数据时将其抽象为数据组,通过比对数据组间的异同来生成各个参量间联系“紧密程度”的回归线方程进而达到给定部分参数预测剩余参数的概率或评估历史数据。但是这里涉及的问题无疑是数据量的多少,如果无法建立起庞大的数据库来支撑,那么预测精度可想而知。但是如果拥有海量的数据,那么学习的“应变”,“应用”能力则会急速下降。举个简单的例子,很多人批判中国教育体制刻板,是纯粹的灌输,学生没法应用到变式当中,因为变式中存在着干扰项,变量之间的关系没有那么显而易见。机器学习本身也是这样,他并不理解这组数据的意义(人类真的可以吗)只能通过大量的历史数据间的关系,不断修正自身与实际情况的差距,提高拟合度。但是问题出现了,事件间关系的复杂性难以想象,有很多干扰实际结果的噪声,如果机器对样本拟合度过高,那么实际上这些噪声的影响也被其计入了两个事件的内在关系中,那么预测结果的偏差就将很大程度上依赖于所给预测环境的噪声与历史噪声之间的拟合程度了。这样的学习功能显然不是我们需要的。书中给出数据挖掘的应用集中体现在医学上,比如妇产问题。因为孕妇各式各样的身体原因和胎儿的状态,妇产医生需要判断何时该用剖腹产或顺产等等手段来接生,而这些判断都基于人的估计不可避免的会出现因环境或记忆等原因产生的误差,甚至还有因此而产生的焦虑也会扰乱医生的判断。因此一份包含9714名早期孕妇的数据库被用于试验来预测不同手段的风险是多少。这份数据中每个个体都有215项的参数来关联各种解决方案,包括母子产前身体状况,所做检查,产后健康指标等等,从而得出一张关系表,用来预测之后的妇产问题该如何选取才能降低风险。但是以此来看,数据以早期历史数据为“学习资料”其对医疗水平发展如此迅猛的现今社会必然是靠不住的。那么如何令机器学习“跟得上时代”呢?旧数据和新数据之间的权重又该如何分配呢?这的确是个奇怪的问题,毕竟我们无法将人类的医疗水平进展“告诉”电脑。但是,如果我们把时间也当做一维数据添加进去呢?将时间的变化看做和其他n维变量一样,创建n+1维空间或许就能看到更多信息了,虽然机器并不懂得人类的医疗水平具体如何发展,但是他已经知道了医学水平产生的成果(医疗记录)的变化曲线,这样的数据对他做初步预测已经足够了。分类当然这时基于医生较为负责,完整的记录下了数据,并详细的分好了类,但是往往有时不是这样的。大量的数据被叠在一起,没有任何分类,想要从中找出应对危机的解决办法简直难上加难。所以,机器学习又要挺身而出了。这种对没有分类,没有指定类别的数据进行学习称为无监督学习,无监督学习关键点就在于如何进行类的划分。不同数据间存在存在相似性的划在一起,比如:ODDODD这是一个简单的只有二维数据的类型,很明显我们可以将其分为3类,但是这对机器来说是一项庞大的计算工程(对人也一样。。。),分为同一组的点集成为聚类。首先机器需要确定划分几个分类,比如上述点集可以是3个,当然也可以是1个。这里简单说明一下k-均值算法。Aljjorilhiri丄»Chwkdai;ipointeaslhe和佃]ceniroid^(clustercensers|irefill:hr吃出dJjpoinlXlI)dtr4^^mputedi^Unccfhun\io说xhwflirtiid.自必ign*ioihclo^l.cenu^id心“oiffltroidreprt^nls計cluMer&erldfiirre<mipuiethecentnoid^usm号thtcurrenLclusiernatimkrsliips8untHiIIk山中pingcriterionis.met这里如果给定三个类,那么随机取三个点作为初始聚类中心,计算各数据点点距离各聚类中心的距离,取最近的归为其一类,这时可以计算这一类点的聚类中心然后将初始聚类中心转移至重新计算得到的聚类中心,然后重复计算各点到聚类中心的距离„„不断重复上述过程直到误差平方和达到最小,这样一般简单的分类就可以做到了。直到误差平方和达到最小,这样一般简单的分类就可以做到了。当然,按我的理解一般情况我们是知道数据的大致规模结构的,那么我们也可以增加设定一组半径来减少运算量。看到这里可能有人会说,这这„„我一秒钟就能把他们分出来啊,用得着计算机吗?但是是否想过如果给你的是一个一个坐标点而不是画在坐标系里,如果数据不止二维而是十几维甚至像医院病例那样两百多维的话就必须要借助计算机帮忙了(甚至有时候我们连其计算结果的准确性都无法做出直观判断)。混合数据处理好吧,说到这里不免有些疑问,以上算法全都以点为基础,建立向量场,计算距离。但是现实中很多数据并不是数据,比如产妇的人种,产妇的饮食等等,各种类型数据混合在一起输入电脑,如何分类呢?这的确是一项很复杂的问题,但是正如我们的人一样--任何的信息输入包括视觉听觉等等都被转变成脉冲信号传到大脑,机器学习时同样是将各种不同的数据都转化为数字信息进而计算距离实现的。比如简单来说,19岁离20岁比10岁离20岁近,衣服和裤子的距离比衣服和书的距离近。当然这里的近不是指实际上的相近,而是根据某些特定情况(依照所研究问题)人为给定一个距离标准。实际上我们可以将一些实在难以判断距离关系的属性细化为若干可以量化的信息,提升数据的维度进而计算距离,比如在病例中使用手机,这一项当然可以细化为手机打电话造成的辐射量是多少德,因使用手机分神而致死的概率,使用手机的心理孤僻的致死率等等这些和健康有关的参数,而和其相比的当然就有使用电脑等。当细化为这些数据时,有时我们可以有偏重的强调某一项,提高其权重,进而达到我们期望的分类结果。如果对象是一句话呢?比如医生的一句评价:此病人已然病入膏肓,无需手术徒增伤痛。如果是我们来看能够清楚的理解其中的含义,但是对于计算机来说则根本无法理解。于是也产生了一种新的人工智能技术:自然语言处理。自然语言处理当然首先需要庞大的语言数据库,当然英国有网站收录了从1980年至今的几乎所有英国文学作品词汇句式及日常用语搭配。有了数据库,我们就可以找到数据间的联系。随后就是对句子语法结构的分析,可能在动词后的是名词或者种种,这里便涉及到分词的概念。进行合理的分词是计算机获取自然语言信息的关键。比如:他背着爸爸和哥哥出去了。这绝对是一个典型例子,因为不仅涉及到分词而且还包括语音歧义。他|背着|爸爸|和|哥哥|出去了。他|背着|爸爸和哥哥|出去了。不同的分词所有的意义差别很大。首先对于这个句子,我们需要查询字典,判断所有分词组合,为他|背着|爸爸|和|哥哥|出去|了。这时就像谓词逻辑一样,'和'单独出现时可连接左右两个对象‘爸爸',‘哥哥',‘了'可单独定义为完成时,机器可以为其添加一个时间概念。但是,并不仅仅有次一种分法,显然对于计算机和字典来说‘背',‘着'可以完全是两个分词,理解为两个动词连用(因为‘着'的属性中有V的成分),这时如何判断到底是连用还是分开呢?我们可以采用贝叶斯网络来确定,这个稍后会说。当然这仅仅是根据每一个单词前的一个单词来确定的,也就是说这样的分词是无法做到将其分为:他|背着|爸爸|(和|哥哥)出去了。实际上现在除非加入针对某一个句子的处理方法,单靠分词和前后连贯的语义还无法理解到这一层意思,这时如果我们将连接词的‘和'的连接对象设为前后两个名词内就可能出现‘和'(他,哥哥)这样的组合逻辑了。当然这里出现了‘和'(他,哥哥)这样的连接,如果我们将其看做一个谓词符号表示‘他和哥哥',表达两个元素之间的一种关系,并没有实际的对错。同样,我们可以设定一个函数符号,比如‘爸爸',爸爸(他)就表示一个新的对象,而这个对象是‘他'的映射。有了这些我们就可以创造一套简单的自然语言处理系统了~首先我们分好词:他|背着|爸爸|和|哥哥|出去|了。这里可能会检索出很多种逻辑,通过贝叶斯我们可以简单确定一种最佳选择。如‘和'(爸爸,哥哥),背着(他,和(爸爸,哥哥)‘且'出去(他),‘了'添加完成语态。每一个分词就相当于一个标示符,当然可以有一定优先级比如:‘和'的优先级可以高一些,如果分词分出‘和'那么优先匹配‘和'的对象。这样有时能够节省很大的运算量,某些情况下,也能提高准确性。回到之前的医疗服务,假如一个医生写到:病人死于脑淤血。分词后病人|死于|脑淤血'死于'(x),x如果为数字,一般为日期,如果为汉字,可能是死因。所以此处电脑可将此数据归档为:xxx号病人•死因(脑淤血)。贝叶斯很神奇的一项机器学习能力:识别人的自然语言,这为人机交互提供了极其广阔的前景,但是正如之前所说,机器列举了所有可能的谓词逻辑,但是哪一项才最恰当呢?当然,这里就
讲到了贝叶斯网络的神奇之处。首先反观人类自身的判断决策,从某一方面来说,人的决策一方面基于历史经验,比如自己以前听见‘他背着父亲和哥哥出去了'的意思一般都是‘背着|爸爸|(他和|哥哥)出去了'这样的理解,所以经验判断来说概率很大。但是另一方面又基于当前语境,比如前一句是‘他和哥哥吵架'那么当前判断‘他|背着|(爸爸|和|哥哥)出去了'这样的理解更为靠谱,那么计算机是否也能这样呢?当然贝叶斯公式之前的理解可能只是直接解决逆向概率的问题,但是后来对其各项的深入理解已经使其成为机器学习不可或缺的环节。(p(b/a)称为最大似然度,p(a)为先验概率)可以通过一个简单的例子来说明。现在有人输入一个单词,但是因为某些原因输入为'timr'当然这不是一个单词(至少没几个人认识)。现在我要推断那个人到底想输什么。我们不能确切知道他想什么,但是可以推算出最可能的选择。首先我们筛选出可能输入的单词tim**(简单起见)随后得到两个反馈:time,timer。我们猜测可能的单词为事件a,他输入的单词为事件b,当然他输入了单词timr已经是不变的事实了,不管我们猜什么他都不会因此而变成对的。所以p(b)为常数,而p(a/b)可以直接从字面意思理解,在他输入了timr的情况下,我们猜测的单词可能出现的概率,也就是我们猜的单词是他所希望的单词的概率。那么再看最大似然度p(b/a),在我们猜的某个单词,比如time出现时,timr出现的概率,换句话说就是他想打time却打成timr的概率,这就是最大似然度。而p(a)先验概率则为time出现的概率,比如过去的输入数据中,出现time的概率。因为p(b)为常数,所以此时P(a|b)*P(a)*P(b|a)。现在我们对比两个选择timer和time。首先是p(b/a),考虑到键盘上'e'和'r'极其靠近,所以两者均有可能,但是timr是4个字符,而timer是5个字符,如果考虑到人码字时出错的可能,打错更有可能,漏打或多打可能性较低,所以time可能性更大,而p(a)则更明显,time出现次数明显多于timer,所以我们预测他想打time的可能性更大。这样的推测同样可以用于逻辑判断上,方法大同小异,比如将系统检索出的各种谓词逻辑列为a1,a2,a3…之后根据贝叶斯公式计算那种发生的可能性更大。但是我们不难理解,所谓的最大似然度在很多情况下同样是统计概率,是为机器提供了一个当前的猜测环境,比如打字时用qwe还是9键盘,在两种不同环境中,最大似然度的计算结果可能截然不同。说到现在,终于可以稍稍放心的将病人的病例交给计算机进行分类统计了。未来发展机器学习依然只是依据表面上的概率统计来进行推测的,可能和人进行的学习有着极大的差别,但是如果我们不断将学习的对象细化,最后达到和人所理解的最基本的定理一致时,机器学习是否就不再仅仅是一种统计意义了呢?如果说这种学习和人的学习有着本质差异,那么能否说概率统计,拟合曲线这些方法本身就是一种独特的学习方法,而两种手段各有优势,并没有所谓的孰优孰劣?发展人工智能很多时候同样是为了认识我们人类自身。我觉得,按照生物的发展,遗传算法很能体现我们自身的前进的足迹,仅仅一个目标,或者甚至并没有目标,活着本身如果并不是目标,仅仅只是因为活着我们才到了现在。这一切如果仅仅是因为最初某一个轻微的扰动而造成的大量点集在四种基本力作用下的变化状态的话,那么研究人工智能的未来是否意味着人类对于自身存在的质疑呢?亦或许这永远不可能,因为无所谓意义,粒子可以不断微分,宇宙可能有界却无边。但是如果某一天,人类发现了最小粒子,发现了宇宙的最外层,发现这个世界的信息量有限时,人工智能的研究是否会走得够远,帮助我们找到灵魂,找到上帝,让这一切重新有新的解释呢?或者干脆变为硅基生命本身,去承认灵魂的载体不具有神圣性?(记得在halo中舰载人工智能的创造全都需要以活人为基础)最后一个想法:如果人工智能在未来已经变得极其复杂,那么我们又该如何界定什么是人,什么是机器人?后文是一些哲学类的思考我觉得人工智能的出现其实也牵扯到一个人格认同的问题,如果人工智能逐渐发展到与真实的人难以分辨的时候,若人与人工智能有差别的话,我觉得也只能是人对于自己存在的体认,人们对于人格本性这个问题所采取的一个视角就是,我们不能通过身体的存在来认同自己,尽管我们的身体或其结构经常会改变,但有些关于我们的东西却不会改变,这就是人格认同。我们的举止、行动、相貌和身体特征只是表现了我们的自我,并没有构成我们的自我。我们的身体,尽管对于我们现在的生存是至关重要的,却不是我们所是的。或许一个人的人格就是一个不能约化的、终极的、不可分析的自我。我们说,不是我们拥有一个自我,而是我们就是自我。尽管我们对他人的人格认同是通过他们身体的特征和行为的模式但我们知道,我们的自我或者是通过内在直观的自我意识,或者是通过自身经历。现在体现出的自我,即我们各种经历的主体和中心,是思想、记忆、情感和理智的承载者。但是我们是如何达成这
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 化工过滤工安全生产规范水平考核试卷含答案
- 继电器调整工操作水平竞赛考核试卷含答案
- 动物检疫检验员岗前复试考核试卷含答案
- 坯布缝接工岗位实操知识实践考核试卷含答案
- 二手工程机械评估师岗位操作测试考核试卷含答案
- 插花花艺师岗前工作规范考核试卷含答案
- 电池测试工岗前诚信道德考核试卷含答案
- 2026能源供给行业市场发展分析供需及投资环保商业化规划方案报告
- 2026金属激光切割材料市场供应需求组合及行业股权投资规划
- 2026中国化工物流行业兼并收购典型案例解析报告
- 高考生物500个判断题集锦含逐题解析
- 热成像技术教学课件
- 曲臂登高车安全培训课件
- 人工智能通识导论 课件 王万良 第1-9章 人工智能概论-连接主义:人工神经网络
- GB/T 45898.1-2025医用气体管道系统终端第1部分:用于压缩医用气体和真空的终端
- 服务期间与其他单位部门综合协调方案
- 鸿蒙应用开发案例实战(ArkTS版)(AI助学)(微课版) 课件全套 项目1-7 初探HarmonyOS开发 个性化设置应用 - 融会贯通 七彩天气App开发之旅
- 小学生劳动最光荣课件下载
- 高钾血症疑难病例讨论
- 河南省开封市五校2024-2025学年高二上学期11月期中联考数学试题
- 消防安全教育培训记录
评论
0/150
提交评论