关于人工智能无人车的研究案例_第1页
关于人工智能无人车的研究案例_第2页
关于人工智能无人车的研究案例_第3页
关于人工智能无人车的研究案例_第4页
关于人工智能无人车的研究案例_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

有关人工智能无人车的研究案例清华大学自动化系系统工程研究所副专家李力作为第一作者以及林懿伦,郑南宁,王飞跃,刘跃虎,曹东璞,王坤峰,黄武陵等发表了一篇有关人工智能测试和无人车测试的英文论文《Artificialintelligencetest:acasestudyofintelligentvehicles》,集中探讨了人工智能应用领域中有关智能性的测试和设计办法。文章认为,智能性测试和机器学习的过程类似,两者犹如一种硬币的两面,“终身测试”将是一场持久战。文章最后还提出了虚实结合的平行测试办法。1.概述本篇文章重要是讲述在人工智能应用领域对智能性的测试,基于场景和任务的测试体系的描述,以及介绍了如何设计智能性测试中基于仿真的测试及其测试指标,并在智能车这一典型人工智能领域举例阐明。2.无人驾驶和人工智能人工智能(AI)普通是指机器体现出来的和人类类似的智能。现如今,人工智能已经极大的变化了我们的生活,大到自动驾驶汽车,小到扫地机器人,都是人工智能的应用领域。我们坚信,人工智能将会在将来的内进一步的变化我们生活涉及健康,教育,娱乐,安全等各个领域。在享有人工智能的带来的多个便利的同时,也带来某些疑问:如何确保人工智能机器按照人类设计的思路来对的运行?无人驾驶车辆与否会在某些极端环境中失控照成事故?厨房机器人与否会把房子点燃?基于以上,我们迫切的需要对人工智能的可靠性进行规范的测试和衡量。为了回答以上问题,我们需要思考一下人工智能的定义:维基百科对于人工智能的定义:机器所呈现出来的智能;我们对其进行扩展,给出的定义:人工智能是指机器(在同样的任务中)体现出(和人类似的、或同样的、甚至是超出人类的)智能,明斯基(Minsky1968)对人工智能给出过类似的定义“[AI]isthescienceofmakingmachinescapableofperformingtasksthatwouldrequireintelligenceifdoneby[humans]”。明斯基的定义更加重视对完毕任务的所需要的智能(因素导向),而本文的定义则更加倾向于所完毕的任务所体现的智能(成果导向)。同时必须注意到的是,为测试智能性所选择的任务也是有特定针对性的,不同的任务测试不同方面的智能性,例如,一种文盲可能能成为一种较好的司机,但是一种眼盲的饱学之士却无法开车。图灵测试是迄今为止我们所知的最早的针对智能性的测试。图灵测试是图灵对于人工智能的睿智思考,其核心思想是:规定计算机在没有直接物理接触的状况下,尽量把自己伪装成人类回答人类的询问。但是,图灵测试在无人车智能性测试方面也无法全盘套用。当今,智能性测试有越来越多的应用领域,那么我们终究应当用何种办法来测试智能性呢?我们所提出的基于任务的智能性测试办法又有哪些优越性呢?接下来,我们将会列举智能性测试的难点,以及我们提出测试办法如何解决这些难点,以及如何更加好的设计基于“任务”的测试用例。3.无人驾驶智能的设计和测试3.1.智能性测试的困境3.1.1.任务的定义/描述第一种困境是如何来更加好的定义智能性测试中的任务:图灵测试中最大的短板就是任务的描述。需要指出的是,当今的无人驾驶车辆智能测试和中文屋等早期图灵测试已有了很大差别:其一,早期图灵测试并未明确的规定测试任务以及何种答案能够视为对的,这造成某些试图通过图灵测试的机器经常采用摸棱两可的方式来试图避免直接回答。而当今的无人驾驶车辆智能测试都对任务进行了明确的界定;其二,早期图灵测试有人来鉴定测试成果,而为了检查无人驾驶车辆的识别算法与否通过多个可能场景的测试,我们必须使用机器来协助鉴定数以万记的测试任务与否通过。总之,我们需要建立一系列的能够量化的测试任务,这是智能性测试最根本的基础。3.1.2.任务的验证第二个困境是:如何确保被测智能机器在所碰到的全部场景中体现出其行为的一致性。因此需要确保任务测试的枚举性/覆盖性。通俗的讲,我们能够把任务看作是对智能机器测试的输入,如果完毕该任务,输出“是”,反之输出“否”。对于某些相对简朴的智能性测试,通过枚举全部可能的任务组合,我们能够穷尽量的交通场景。如果车辆能通过全部这些场景,则车辆将足够智能。但由于任务空间的时空持续性,枚举是不可能完毕的。因此,必须依赖虚拟采样测试来加大如何合理采样,在减少场景生成复杂度的同时,提高测试覆盖性成为测试的核心技术。通过统计受试车辆和其它车辆的轨迹,我们能够定量刻画车辆的智能水平(驾驶性能)。3.1.3.仿真测试的设计为了在有限的时间和财力内尽量解决任务覆盖问题,现在的研究者多采用仿真测试来弥补实地测试的局限性[4]。由此出发,研究者进一步研究了以下诸多衍生问题:1)如何确保虚拟测试中虚拟物行为的真实性;2)如何确保虚拟测试中虚拟物体现的丰富性;3)如何确保虚拟测试中场景和任务的覆盖性;4)如何实现虚拟测试中机器鉴定的对的性。例如在仿真测试方面,现在的无人驾驶车辆研究者考虑了如何从现实采集的2D图像数据中提取物体的3D属性,并在3D引擎中重新渲染并产生新的2D虚拟测试数据。而另外某些研究者则考虑了如何基于生成式对抗网络来直接从2D实测图像数据来生成新的2D虚拟测试数据。再者,测试原则的设定也是研究者探讨的热点之一。对于驾驶这类典型的多目的问题,如何评价不同算法的优劣并设计适应不同顾客规定的测试原则尚有很大的难度。3.1.4.测试指标的设定测试指标的设定的办法有几个,第一种是规定智能机器做出类似人的行为体现。这种办法里首先需要拟定人在完毕该任务时会如何体现,然后再根据智能机器在完毕该任务的过程中的体现和人的体现的区别来做鉴定。第二种测试指标设定方式是规定智能机器有最佳的体现。例如,在设计针对围棋的人工智能机器时,我们规定其能够始终胜利,而不是像一种人类选手的方式去下棋。对于这一类目的相对简朴的状况下,这种方式更加适宜。在智能车测试中,目的往往比较复杂,不能像围棋同样以赢得棋局为目的,需要考虑行驶安全性,速度,燃油效率等其它复杂的因素。以不同的因素为目的会造成完全不同的设计。例如在,的中国无人车将来挑战赛中,智能车通过设定的10个特定场景任务的时间被作为评价指标之一,如果发生了碰撞,压线,闯红灯,也会扣去对应的分数。当人的感受被纳入考察因素的时候,考虑到每个人对于同一件事物的感受都会有一定的区别,测试指标的设定会变的更加艰难。3.2.智能车的智能性测试我们这里以智能车的智能性测试为例,来阐明我们的观点:3.3.1.智能性测试中测试任务的设定传统的无人驾驶车辆智能测试重要分为两大流派:场景测试流派和功效测试流派。1)场景测试往往是指处在特定时空中的测试系统。例如,交通场景普通指的是由众多交通参加者和特定道路环境共同构成的交通系统。如果受试车辆能够自主行驶通过该交通系统,则称为通过该特定场景的驾驶测试。例如DARPA年无人车挑战赛便选用了212公里的沙漠道路作为测试场景(其实也是选择了沙漠作为测试场景,但是“全军覆没”,相比之下,则是一段光辉岁月)(GrandChallenge)。DARPA年无人车挑战赛则选用了96公里的都市道路作为测试场景(UrbanChallenge)。2)功效测试功效测试更加侧重无人驾驶的单项或多项功效实现。根据人类智能的功效归类方式,可将驾驶智能划分成信息感知、分析决策、动作执行等较为概括的三大类能力。例如途径规划就属于分析决策类的单项智能。该定义方式强调的是实现这些单项智能的办法和技术上的共性。但由于不能与具体的交通场景以及无人驾驶测试任务联系起来,在衡量无人驾驶的智能水平方面有所局限性。功效测试的隐含假设是,如果无人驾驶通过某种功效的一次或几次测试,那么,后来需要使用该功效时也能够顺利执行。这一假设看似合乎逻辑,但事实证明,也过于乐观。另外,现在的功效测试还存在其它问题:单一功效测试较多,综合测试涉及较少,无法检查多项功效之间的协同配合能力缺少完备、公平、公开的Benchmark集。我们认为,无人驾驶车辆的智能能够用广义的语义网络来定义。语义网络是一种采用网络形式表达人类知识的办法,如今已在人工智能领域中得到了比较广泛的应用。语义网络用有向图来体现复杂的概念及其之间的互有关系。图中的顶点表达概念,而边则表达这些概念间的语义关系。针对无人驾驶智能的广义语义网络分为场景、任务、单项能力和综合能力四类节点。其中任务将场景和能力打通并连接起来,应当是无人驾驶智能研究的核心,参见下图。场景一词源于戏剧,是指在一定的时间、空间(重要是空间)内发生的一定的任务行动或因人物关系所构成的具体人事片段。在系统学研究中,场景多被定义为处在特定时空中的特定系统。交通场景普通指的是由众多交通参加者和特定道路环境共同构成的特定交通系统。任务原指交派的工作。驾驶任务既能够指跟驰、换道、停车等某类普通性的驾驶工作,亦可指特定环境中的某项特定驾驶工作。如果受试车辆能够自主行驶完毕某项特定任务,则称为通过该特定任务的驾驶测试。相对于驾驶场景而言,驾驶任务更为具体,时空范畴更为明确。一种特定的驾驶场景普通包含多个驾驶任务。近两年,中国智能车将来挑战赛注意到了任务测试的重要性,精心设计了任务库,测试无人驾驶车辆的特定能力。但是,这里还存在一种问题:通过测试任务,仍然不能阐明被测系统含有了无人驾驶智能和驾驶能力。驾驶能力普通指的是完毕某种特定驾驶行为的能力。完毕一种特定的驾驶任务普通需要受试车辆含有多个驾驶能力。不同于场景和任务,每项驾驶能力能够被量化评定。进一步将各个能力进行汇总,即可定量评定整个无人驾驶车辆的驾驶能力。在图1所示的语义网络中,沿着场景、任务直到能力之间的正向连接,我们能够从驾驶场景中梳理出具体驾驶能力,将能够量化的驾驶能力指标进行细分和原则化,方便建立完备的测试体系。而沿着从能力、任务直到场景之间的反向连接,我们能够根据功效测试需求,自动产生合理的驾驶任务乃至驾驶场景,解决测试配套的驾驶环境自动设计问题。待驾驶场景拟定之后,便能够自动化虚拟生成配套驾驶环境,用于无人驾驶智能的仿真测试和实路测试。3.3.2.智能性测试中测试场景的生成基于图1,场景测试位于该语义网络的左端,而功效测试位于该语义网络的右端。我们提出的无人驾驶智能体系,事实上是将已有的两种无人驾驶智能定义方式融为一体,相辅相成。基于上述定义,我们能够进一步生成特定的测试场景。生成测试场景,第一种要考虑的因素是,如何拟定场景中所含有的任务,并拟定这一系列任务的出现和需要完毕的时间—空间位置。下图2描述了一种非常简朴场景中,受试车辆A的若干不同任务在任务时空图中是如何排布的。受试车辆需要在每个任务需要完毕的截止时间和截止空间前完毕该任务。同时下图3描述了从抽象的测试场景到具体测试实例的转换过程。每个场景中的任务数目和时空排列决定了该测试场景的难易程度。任务数据越多越难,需要同时解决的任务数量越多越难。3.3.3.智能车智能性测试框架在传统汽车测试开发中我们经常使用V字型开发办法。以下图所示,在这种办法中,人们在开发阶段就定义了对应级别的测试用例。V模型的第一阶段是整体需求确认阶段,在该阶段与整体需求对应的测试用例也会提前定义。第二阶段,第三阶段分别是系统级别(High-Level-Design)以及子系统级别(Low-Level-Design)的设计和对应测试用力的书写。在这两个阶段系统的功效会被分解细化,软件中的多个类,以及类间关系会被定义。同时,也需要在这两个阶段书写同样级别的测试用例。第四阶段是模块设计,在这个阶段,子系统会进一步分解成为小的模块,对应的对于模块的测试用例也会在这个阶段定义完毕。如果把我们提出的测试办法和V模型一一对应,就能得到以下的Λ-V模型:不停学习新示例,举一反三,逐步完善任务描述。V模型对于传统汽车研发这一类系统性和可推导性比较强的系统工程有较好的效果,但是由于我们需要在具体的编程之前就设计好全部的测试用例,这使得该模型在较为复杂的人工智能系统开发中很难直接套用。我们认为,在开发智能系统过程中,机器学习和测试犹如一种硬币的两面,智能性测试应当和机器学习有着类似的流程。在平行学习的框架下,首先要解决的问题是如何获取新的数据用来学习,该阶段我们称为描述性学习阶段;在第二阶段,会从第一阶段中提取特定的数据有针对性的进行学习,从而获得“小知识”,该阶段我们称为特定数据学习阶段;第三阶段是预测性学习阶段,在该阶段,会把前两阶段得来的数据和知识一一对应,这种联系也会被统计下来。最后,全部的新数据会在第三阶段已有联系的基础上找到对应的“小知识”。与这类似的,如图6(b)所示,智能车的智能性测试也有着类似的流程。第一阶段是创立新的测试任务。在这个过程中,在场景中的测试任务都会被逐步分解成为细化的功效。第二阶段是在第一阶段创立的测试任务中选用有挑战性的部分(测试取样)。最后一种阶段是测试的执行,也就是在前两个阶段创立的任务中观察智能车的体现。在这个阶段,我们需要从测试成果中得到两类关联信息,第一类是车辆智能性和其在我们搭建的测试环境中的体现的关联,这种关联对于我们在新的测试任务中取样有很大的协助;第二种关联是测试本身和测试环境的关联,我们需要从不同的测试环境中学习到如何更加好的创立测试任务。我们提出了以上的智能性测试框架是基于下列考虑:1)如果不进行测试,我们无法预知智能车的行为体现。因此,在没有测试之前,我们也无法确认哪些测试任务更加的含有挑战性。因此我们需要通过不停的测试,取样,执行,分析这样一种循环来达成最优的测试效果。2)测试本身就是一种自我标定的自循环过程,我们必须根据测试成果来鉴定车辆的智能性。3)如果测试要覆盖全部的智能车的功效所需要的资源是巨大无比的,因此,我们需要某些更优的办法和工具来缩短这个过程。3.3.平行测试3.3.1.传统虚拟仿真现在诸多研究人员都把更多的精力放在视觉领域的虚拟仿真,固然,也有人开始注意到驾驶员行为的重要性。在视觉领域的仿真中,有下列几个图像注入方式:1.采集真实的2D数据,然后基于该数据建立3D模型,再在此3D模型的基础上上投影成2D的图像注入智能车的感知系统;2.使用对抗式网络生成新的2D模型注入;3.基于以上两种办法尽量多的图像注入。3.3.2.平行测试办法我们这里提出一种新型的虚实结合的智能车平行测试办法。如图7所示,车辆智能性测试能够分为三步:测试环境,测试规划和测试执行。同样,我们在虚拟世界里也能够建立一一映射的测试流程。1)首先在真实环境下建立有多个交通元素(十字路口,交通灯)的场景,对应的在虚拟空间内,根据不同的测试目的,能够把该场景细分成不同的任务,功效团,单个功效;2)基于这种分解模式,能够建立对应的测试计划来有针对性的测试不同的功效。例如假设我们要测试交通标示识别和变道这两个功效团,很容易发现,交通标示识别重要性没有那么高,而测试变道能更加好的提高车辆的可靠性。在测算了场景中包含的任务,以及任务中包含的功效团之后,我们能选出包含更多的变道的任务来在真实环境中进行测试,而包含更多交通标志识别的任务能够在仿真环境中进行测试;3)一旦制订了在真实和虚拟环境中的测试计划,按照计划执行之后对测试成果可信度以及功效重要性进行加权就能得到对应的加权分数。同时,在真实环境中得到的测试数据又能注入仿真环境,通过这种方式,仿真环境能够不停更新加强。真实环境和虚拟环境中的测试是异步的,我们能够在真实环境进行某一项测试的同时,在虚拟环境中进行多项测试。和传动的仿真测试环境相比,平行测试体系有以下两个不同。1.平行的虚拟环境不仅仅是真实环境的一一映射,同时也和真实环境在状态上存在交互,真实环境会影响虚拟环境,虚拟环境也会影响真实环境,这样就形成了一种自我不停增强系统;2.平行系统是一种自我学习的系统,某些在虚拟环境中的核心元素是数据驱动型,这使得平行系统比那些基于随机模型的系统要更加自动化,可信度也更高。3.3.3.平行测试实际应用在江苏省常熟市,这样一种平行测试系统已经建立起来,并且较好的支持了中国智能车将来挑战赛。如图8所示,我们先在虚拟环境中找到最具挑战性的测试任务然后再在真实环境中进行测试。4.1.伦理道德问题涉及图灵在内的大部分研究者都认为人能够按照自己的经验做出对的的决定,而智能机器也应当和人类同样来完毕这些决定,因此我们的工作就简化成为在智能测试中去判断智能机器与否完毕了和人类同样的决定。但是在某些状况下,哪怕是人类也很难拟定什么是对的的,例如出名的铁轨问题:你是一辆刹车失灵的火车司机,在你前面的铁轨上有5个人被绑在轨道上,你能够选择切换到另外轨道,另外那条轨道上只有1个人绑在铁轨上,那么请问你会选择撞死5个人还是切换轨道撞死1个人?对于这个问题本文中不做更多的讨论,即使是人类,在这个问题上都很难做出“对的的”决定,更何况智能机器?因此在本文中我们不去讨论这些问题,我们也不会为伦理问题设立智能性测试。4.2.测试成果的自动实时分析图灵测试和现在诸多新的智能测试的区别在于,图灵测试用人来做鉴定,而新的智能测试使用的是机器来做鉴定。之因此这样做的因素在于我们清晰的定义了任务,同时诸多状况下没有机器的协助人很难完毕对的的鉴定。以智能车测试为例,为了节省成本,我们往往在某一条测试路线上设立了多个测试任务,车辆需要不停歇的完毕多个测试任务。例如在中国智能车将来挑战赛中就设立了14个测试任务,分别是U-Turn,通过T字型路口,通过十字路口,避让作业车,隧道,停止标志,避让行人,右转,乡村道路,避让自行车,施工区域,限速,停车。车辆需要持续通过这些任务点,为了能够自动测评,我们需要使用V2X设备连接车辆上的传感器和数据中心,上传车辆数据到数据中心来完毕自动测评。青岛慧拓智能机器有限公司联合清华大学一起开发了自动测评系统并成功应用于本次比赛中。如图10所示,左边展示的是正在比赛中的5辆车的实时轨迹和实时排名,右边屏幕里是实时的视频回传数据,展示着裁判车数据,比赛车辆数据,以及场边摄像头数据。这些数据通过V2X或者4G的方式传回数据中心。在-的比赛中,比赛由裁判来人工打分,这种方式比较主观,也非常耗时。在比赛中,大部分的任务能够通过回传过来的数据实现自动打分。我们同样能够通过深度学习的方式用视觉的方式来检查车辆与否有压线,来实现自动打分,如图11所示。4.3.驾驶员在环测试按照上文中说到,我们最后的目的是让机器替代人来评价智能性测试成果。但是现在阶段,这种状况却难以完全实现。首先,测试任务的描述需要由人类专家来完毕。全部的任务描述都是使用人类语言,现在也并没有一种计算机语言能够更加好的完毕该任务。机器的智能水平往往受限于它的设计者,因此我们最后总是还是需要用人类的智慧来在衡量测试成果的基础上提高机器的智能性水平。另首先,人类专家能够按照自己的经验更加好的协助机器设计那些极限的测试任务。最后,人类是智能性测试的最后决策者,往往由机器做出的判断还要由人类来检查。就像在中国智能车将来挑战赛中视频回传系统就是方便人类专家随时能够监督智能车的体现,这能够让人类和自动打分系统同时以对方的判断为基础改善自己的评判能力。4.4.用测试来进行智能水平分级SAE把汽车自动化水平分为从无自动化到完全自动化六个级别,但是在该分级体系中并没有给出明确的需要完毕的任务。现在有更多人认为,只有明确了分级系统中的测试任务,才干更加好的对汽车智能性水平进行分级。智能机器在特定的领域越来越智能,甚至在某些领域(例如围棋领域的阿法狗,射击领域的TopGun)已经超出了人类。可能在将来的某一天,机器能够取代人成为智能性水平的最后定义者。4.5.可释性测试犹如图灵测试同样,我们现在更多的关注智能机器的外在体现多于机器内部的运行机制。如果某智能机器通过了全部的测试任务,我们就承认了其在该领域的智能性。但是我们很难懂得如何的外在体现是最优的。当今的智能机器越来越复杂,我们很难完全搞懂其内部的算法(例如复杂的深度学习算法),这就类似于一种“黑盒子”。并且我们基于传统可释性逻辑制造出来的机器很难和这种“黑盒子”媲美,距今为止,极少有人能找出一种“内外兼修”的测试办法,这将是将来一种很重要的研究方向。4.6.智能性测试在智能机器软件开发中的必要性鉴

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论