版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
ArtificialIntelligence人工智能的典型研究领域第2单元新一代信息技术导论(人工智能+AIGC应用+技术融合)(微课版)(第2版)2.1自然语言处理2.2计算机视觉语音识别与语音合成2.3专家系统2.42.5自动驾驶2.6综合实践2.1.1自然语言处理的定义自然语言处理是指让机器接收用户输入的自然语言,并通过算法和模型进行加工、计算等系列操作,以模拟人类对自然语言的理解,并返回用户期望的结果。自然语言处理研究的目的是通过各种理论和方法来实现人与机器之间的自然语言有效通信。复杂性交互性多模态性智能性依赖性动态性2.1.2自然语言处理的发展自然语言处理的发展可以追溯到20世纪50年代。1954年,美国乔治城大学和IBM公司合作研发的机器翻译系统,基于一个仅包含250个词语和6条语法规则的词典,翻译了预先精心挑选的约60个俄语句子。20世纪60年代,一些较为成功的自然语言处理系统开始出现,如ELIZA人机对话系统,尽管它并没有真正理解文本内容,但它通过关键词匹配和预先设定的脚本可以模拟出与人类对话的效果。20世纪70年代,自然语言处理的主流是基于规则的范式,其重点研究方向是概念依存理论和框架语义学等深层语义表示。20世纪80年代,是自然语言处理领域基于规则方法与统计方法交织发展的时期。20世纪90年代,随着统计机器学习方法的兴起,自然语言处理领域发生了一场范式转变。21世纪最初十年,是自然语言处理从“统计革命”迈向“神经网络曙光”的承上启下时期。2.1.3自然语言处理的核心技术1.词法分析词法分析的核心任务是将原始的字符序列转换为有意义的、计算机可处理的词汇单元,并赋予这些单元基本的语法和语义信息。完成这项核心任务,需要借助分词、词性标注、命名实体识别、词形还原与词干提取等操作。分词是指将连续的文本切分成独立的词语,这项操作主要针对的是中文等没有天然空格分隔的语言,其核心难题是如何避免文本切分后产生歧义。解决这些歧义一般可以采用以下方法。1.分词基于词典的匹配方法。基于统计的方法。基于深度学习的方法。2.1.3自然语言处理的核心技术词性标注的目的是为分词后的每一个词语标注一个正确的词性,它需要避免出现兼类词歧义的情况,即同一个词在不同上下文中可能具有不同的词性。词性标注的方法有以下3种。2.词性标注基于规则的方法01基于统计的方法02基于深度学习的方法032.1.3自然语言处理的核心技术命名实体识别用于识别文本中人名、地名、机构名等具有特定意义的实体,这项任务面临的是实体种类繁多、命名形式多样化、新旧实体不断涌现等挑战。早期,命名实体识别采用的是基于词典和规则的识别方法,后来采用基于统计的识别方法,再后来便是利用Bi-LSTM+CRF模型,使用深度学习的技术来进行识别。目前主流的方法是利用BERT等预训练模型来进行命名实体识别,这类模型强大的上下文理解能力,能够极大地提升命名实体识别的效率。3.命名实体识别2.1.3自然语言处理的核心技术词形还原与词干提取的目的是将词语的屈折形式或派生形式归并到其基本形式,这项任务主要针对的是英语等屈折语,通过词汇归一化来减少特征维度,提升模型泛化能力。4.词形还原与词干提取1、词形还原2、词干提取。01词形还原是指基于词典和语法规则返回词的正确的字典形式,如将“was”还原为“be”,将“better”还原为“good”等。02词干提取是指基于启发式规则返回词的词干,如从“running”
中提取词干“run”,从“flies”中提取词干“fly”等。2.1.3自然语言处理的核心技术2.句法分析词法分析是“识字”,句法分析则是“学语法”。句法分析能够让机器从识别孤立的单词跨越到理解单词是如何组合成一个结构严谨的句子的,这是消除歧义、理解句子核心意义的重要技术。句法分析的主要产出是句法树,这主要涉及以下两种理论体系。1.句法树01成分句法分析理论02依存句法分析理论2.1.3自然语言处理的核心技术句法分析的方法也经历了从基于规则的方法到基于统计的方法,再到基于深度学习的方法的演进。2.基本方法基于规则的方法01基于统计的方法02基于深度学习的方法032.1.3自然语言处理的核心技术语义分析的目的是理解语言单位所表达的真实含义,其重要性远超词法分析和句法分析,因为它直接关系到机器能否真正“智能”地与人进行交互。语义分析是一个多层次任务,其原理可以通过以下任务进行说明。3.语义分析词汇级语义分析任务01篇章级语义分析任务0302句子级语义分析任务2.1.3自然语言处理的核心技术文本生成就是让机器“创造”语言,让机器根据特定的输入内容自动创造出连贯、有意义且符合人类语言习惯的文本。文本生成有以下几类方法。4.文本生成基于规则的方法基于统计的方法基于深度学习的方法基于预训练语言模型的方法12342.1.4自然语言处理的应用这里主要介绍自然语言处理在机器翻译、情感分析、信息检索、自动摘要和问答系统中的应用情况。机器翻译能够基于自然语言处理技术分析语句并理解语境,捕捉语言间的细微差异,从而提升翻译的准确性。1、机器翻译情感分析能够利用自然语言处理技术进行分词、词性标注和语义角色识别等操作,解析文本中的情感倾向。2、情感分析信息检索是用户根据需要,采取一定的方法,借助检索工具查询和获取信息的方法和手段。3、信息检索自动摘要是自然语言处理的一个具体应用,这一技术对提炼新闻报道、学术论文、自媒体文章、法律文档等十分有用。4、自动摘要问答系统是一种智能化的信息交互工具,它能够通过分析用户的问题自动、准确地解答用户的各种疑问,常用于智能客服、医疗诊断辅助等场景。5、问答系统2.1自然语言处理2.2计算机视觉语音识别与语音合成2.3专家系统2.42.5自动驾驶2.6综合实践2.2.1计算机视觉的定义计算机视觉是使用计算机及相关设备对生物视觉进行模拟的一种技术,该技术能够通过处理采集的图片或视频数据来实现对相应场景的多维理解。计算机视觉也是人工智能的一个重要研究领域,它涉及计算机科学、信号分析与处理、几何光学、应用数学、统计学、神经生理学等多个学科的知识。按处理方式的不同,计算机视觉有二维计算机视觉和三维计算机视觉之分。二维计算机视觉专注于从二维图像中提取信息,如边缘检测、形状分析、纹理识别等,这种技术适用于对静态图像或视频帧的处理。1、二维计算机视觉三维计算机视觉主要处理三维空间中的数据,涉及立体视觉、深度感知、三维重建等,这种技术在机器人导航、自动驾驶等领域有着广泛应用。2、三维计算机视觉2.2.2计算机视觉的发展20世纪60年代至70年代,计算机视觉的概念开始形成。研究者们尝试通过简单的几何模型来理解图像中的对象,这一阶段的代表是1966年麻省理工学院的“夏季视觉项目”,它标志着计算机视觉领域探索的正式开始。20世纪80年代,随着数字图像处理技术的发展,计算机视觉逐步建立起自己的理论基础。戴维·C.马尔(DavidC.Marr)提出的视觉计算理论成为这一时期的里程碑。20世纪90年代至21世纪初,计算机视觉技术从实验室走向更为广泛的实际应用场景。技术上的核心进展在于特征工程的成熟,如尺度不变特征变换等稳健的特征向量被提出,使得物体识别与匹配的可靠性得到大幅提升。2.2.2计算机视觉的发展21世纪的前两个十年,大数据与强大算力的诞生与发展,促使了以深度学习,尤其是卷积神经网络为核心的技术革命。当前,计算机视觉处于与自然语言处理、机器人等技术深度融合的阶段,推动着多模态感知与认知智能的研究。未来,计算机视觉的研究重点将不再局限于提升模型精度与效率,而是更加侧重于应对小样本学习、模型可解释性、具身智能等挑战,以增强视觉系统在开放、复杂环境中的适应与推理能力。2.2.3计算机视觉的基本任务计算机视觉的基本任务构成了该领域的技术核心,它们从简单到复杂,从粗略到精细,共同使机器能够“看到”并“理解”视觉世界。下面介绍计算机视觉中基本且常见的4类任务。1.图像分类图像分类是计算机视觉技术能够成功应用于各个领域的基石,是计算机视觉需要解决的根本的、核心的问题,即“这张图片是什么?”,它赋予了机器“看到”并“理解”视觉世界的基本能力。许多更复杂的计算机视觉任务都可以被视为在图像分类基础上进行的扩展和深化。图像分类本质上是模式识别和统计决策问题,其核心思想是从图像中提取出能够代表不同类别的区分性特征,然后根据这些特征利用一个学习到的模型来判断图像属于各个类别的可能性,最后选择概率最高的类别作为输出。2.2.3计算机视觉的基本任务2.目标检测目标检测的任务是回答一个比图像分类更为复杂的问题,即“图像中有什么物体?它们在哪里?”,它需要同时完成识别和定位两大任务,且通常会用边界框来标定物体的位置。目前,目标检测主要可分为“两阶段”目标检测和“单阶段”目标检测两种理论体系。“两阶段”目标检测。“单阶段”目标检测。2.2.3计算机视觉的基本任务3.语义分割语义分割的核心思想是为每一个像素分配一个类别标签,然后将输入的图像转换为一个同样大小的分割图谱,其原理大致如下。使用编码器提取特征,通常使用在图像分类任务中预训练过的卷积神经网络,通过一系列卷积层和池化层,使特征图的空间尺寸逐渐缩小,但通道数增加,让每个像素在深层特征图中都包含其周围一个大区域的上下文,从而准确预测其类别。使用解码器恢复空间细节,将编码器中对应层的高分辨率的浅层特征图与解码器中的深层特征图进行通道拼接。这样,解码器在恢复图像尺寸时,既能利用深层的语义信息,又能复用浅层的精确定位信息,从而实现高精度的边界分割。2.2.3计算机视觉的基本任务4.实例分割实例分割的任务是回答一个复合性问题,即“图像中的每一个物体实例是什么?它们的具体像素级轮廓是什么?”,它需要同时完成目标检测和语义分割两个任务,其重要性体现在它提供了视觉理解最丰富、最精细的物体级信息,是连接感知与行动的关键。实例分割主要有自上而下的实例分割和自下而上的实例分割两种方法。自上而下的实例分割自上而下的实例分割的核心思路是“先找对象,再抠轮廓”。自下而上的实例分割自下而上的实例分割的核心思路是“先分类像素,再聚类成实例”。2.2.4计算机视觉的应用1、自动驾驶5、无人机应用2、人脸识别4、安防监控3、医学影像分析6、增强现实和虚拟现实7、智能拍照与图像处理计算机视觉在自动驾驶领域扮演着至关重要的角色,它能识别道路、车辆、行人、红绿灯、路标等相关信息,以确保车辆安全行驶。计算机视觉技术可以自动分析医学影像,如X光片、计算机体层成像影像、核磁共振影像、B超影像等,从而辅助医生进行诊断,
提高诊断的效率和准确率。无人机利用计算机视觉技术可以进行目标检测、跟踪、自主导航和精确制导等,在电力巡检、农作物分析等场景中发挥着重要作用。智能手机中的自动曝光、自动白平衡、自动对焦等功能都离不开计算机视觉的算法支持。借助计算机视觉,人脸识别技术可以提取和比对面部特征,广泛应用于身份验证和安全监控等方面,其识别准确率已经高于人眼的识别准确率。安防摄像头结合计算机视觉算法,可用于实时监控、事件检测和警报系统,以提高安全性。在计算机视觉技术的协助下,AR和VR能够实现物体追踪和交互功能,为用户提供更为沉浸式的体验。2.1自然语言处理2.2计算机视觉语音识别与语音合成2.3专家系统2.42.5自动驾驶2.6综合实践2.3.1语音识别与语音合成的定义1.语音识别的定义与特征语音识别是一种将人类的语音信号自动转换为机器可读的文本的技术。语音识别具有以下特征。对数据的高度依赖性环境的强鲁棒性跨学科性计算的实时性2.3.1语音识别与语音合成的定义2.语音合成的定义与特征语音合成是一种将文本转换为人类可理解的语音信号的技术,其目的是让机器“说人话”,以实现从文本到声音的转换。它具有以下特征。高度的可控性和灵活性卓越的自然度和表现力2.3.2语音识别与语音合成的发展语音技术的发展可以追溯到20世纪中期,且语音合成的研究早于语音识别。1939年,美国贝尔实验室的霍默·达德利(HomerDudley)展示了其研制的第一个电子语音合成器“Voder”。20世纪60年代,规则合成方法成为主流语音合成方法,如约翰·拉里·凯利(JohnLarryKelly)使用IBM704计算机合成了歌曲《DaisyBell》。语音识别的研究则始于20世纪50年代。1952年,贝尔实验室研发的Audrey系统能够识别单个说话人说出的数字0~9,这是首个功能性的语音识别系统。20世纪70年代,隐马尔可夫模型被引入语音识别,它能够对语音信号的时间序列进行统计建模,同时取代了简单的模式匹配,并为后续语音识别的发展奠定了坚实的数学基础。在语音合成方面,20世纪80年代,线性预测编码和共振峰合成等技术得到了广泛应用,它们能够以较低的比特率合成人类可懂的语音。20世纪90年代,基于拼接的单元选择合成方法能够从一个庞大的预录语音库中选取合适的语音单元(如音素、音节)进行拼接,显著提升了合成语音的自然度。2.3.2语音识别与语音合成的发展21世纪10年代,深度学习彻底改变了语音识别与语音合成技术。微软、IBM及杰弗里·辛顿团队的研究表明,深度神经网络在声学建模上显著优于传统的“高斯混合模型-隐马尔可夫模型”框架,语音识别的错误率因此得到大幅下降,这使得智能助手的语音交互体验变得可行。语音合成也在2016年左右迎来突破,DeepMind提出的WaveNet和百度提出的DeepVoice等模型能够直接生成原始音频波形,合成语音的自然度首次逼近真人,这标志着“神经语音合成”时代的到来。21世纪20年代至今,是语音识别技术的“大规模预训练模型”时代,语音识别技术展示出强大的多语种、鲁棒性语音识别能力。语音合成则朝着高度自然、富有表现力的方向发展,能够精确控制韵律、情感和说话人风格。语音识别与语音合成的边界正在变得模糊,语音识别与语音合成与自然语言处理和计算机视觉的深度融合,成为多模态交互系统的核心,共同推动人工智能的进步与发展。2.3.3语音识别与语音合成的核心技术1.语音识别的核心技术机器学习是让机器能像人类一样,通过观察大量的数据和训练来发现事物规律,以获得某种分析问题、解决问题的能力。机器学习的主要特点如下。解码与输出语言模型处理声学模型处理特征提取前端信号处理2.3.3语音识别与语音合成的核心技术2.语音合成的核心技术文本分析与前端处理声码器声学模型2.3.4语音识别与语音合成的应用0102030405实时字幕与转写服务智能客服与交互式语音应答智能语音助手音频内容创作与有声化发音学习与口语评测2.1自然语言处理2.2计算机视觉语音识别与语音合成2.3专家系统2.42.5自动驾驶2.6综合实践2.4.1专家系统的定义专家系统是一种模拟人类专家知识和推理能力的人工智能程序,它采用知识表示和知识推理技术来模拟通常由领域专家才能解决的复杂问题,因此它能辅助人类专家进行工作。处理不确定性透明性高效性03专业性0201042.4.2专家系统的发展专家系统始于20世纪60年代,这一时期的里程碑事件是美国斯坦福大学开发的DENDRAL系统,它被公认为世界上第一个专家系统。该系统的任务是根据质谱数据推断有机化合物的分子结构,它的出现证明了将人类专家的知识固化并存储为知识库后加以利用的操作是完全可以实现的。20世纪70年代至80年代,专家系统进入成熟与繁荣期,这一时期涌现出了一批经典的系统,其中最具代表性的是用于诊断细菌感染的MYCIN系统。该系统确立了专家系统经典的“知识库+推理机”体系结构,并且首创了“置信度因子”来处理不确定性信息,同时还能向用户解释自己的推理过程,这极大地增强了系统的可信度。20世纪80年代末至90年代,研究人员不再依赖于规则,而是转而探索混合智能系统,如结合基于案例的推理(直接参考过去的相似案例)和利用事物深层原理进行推理,使系统变得更加强大和灵活。进入21世纪,专家系统与机器学习、自然语言处理和大数据分析等技术实现了深度融合。2.4.3专家系统的基本构成一个经典的专家系统,其基本构成包括知识库、推理机、综合数据库、解释器、人机界面等模块,如图所示。2.4.4专家系统的应用010305教育培训金融分析客户服务020406医疗诊断法律咨询能源管理07工业制造08农业生产2.1自然语言处理2.2计算机视觉语音识别与语音合成2.3专家系统2.42.5自动驾驶2.6综合实践2.5.1自动驾驶的定义自动驾驶是指通过搭载先进传感器、控制器、执行器等装置,并融合现代通信与网络技术,使车辆具备环境感知、智能决策和自主控制的能力,能够自动、安全、高效地完成行驶任务的技术体系。自动驾驶系统具有以下5个显著特征。规则依赖性算法高鲁棒性技术融合性安全至上性高时效性2.5.2自动驾驶的发展早在20世纪70年代,对自动驾驶的概念便已萌芽。当时的研究集中于在结构化道路上实现简单的路径跟踪,如通过摄像头识别车道线来完成基础的车道保持。这一阶段的系统完全依赖于预设规则,智能水平极为有限。20世纪90年代至21世纪初,对自动驾驶的研究在高校和机构实验室中逐步深入。美国国防部高级研究计划局在2004年至2007年举办的3届无人车挑战赛成为关键催化剂,参赛车辆开始深度融合激光雷达、全球定位系统与初步的环境感知算法,以应对复杂多变的非结构化环境,证明了自动驾驶在极端场景下的技术可行性,从而为后续的自动驾驶技术发展奠定了坚实的基础。21世纪10年代,深度学习的突破为自动驾驶注入了革新动力。2012年,AlexNet在图像分类任务上的成功使其很快就被迁移到自动驾驶的物体检测与识别中。与此同时,产业力量开始主导自动驾驶的发展,以Waymo为代表的科技公司开始推行“多传感器融合+高精度地图”的技术路径,而特斯拉则开创了以视觉为主、依靠大规模真实道路数据驱动的技术路径。自动驾驶技术从此由实验室大步迈向真实道路测试,高精度地图与传感器融合技术也在此过程中日趋成熟。2.5.2自动驾驶的发展21世纪20年代,自动驾驶进入了以商业化落地和规模化应用为标志的新阶段。Waymo、百度Apollo等公司或平台开始在特定城市区域提供移除安全员的具有4级驾驶自动化系统的出租车服务。与此同时,自动驾驶技术的发展也从单纯的“单车智能”拓展至“车路协同”,通过车辆与道路基础设施的信息交互来弥补单车感知的盲区,以共同构建更高阶的安全体系。未来,自动驾驶的终极目标是实现全场景、全气候适应的5级完全自动驾驶,这不仅依赖于算法和硬件的进步,更需要在法律法规、社会伦理和公众接受度等软性层面取得突破。2.5.3自动驾驶的基本原理自动驾驶的基本原理遵循“感知—决策—执行”这一典型分层架构,这与人类驾驶员的“眼睛、耳朵—大脑—手脚”工作模式高度相似。1.感知层感知层是自动驾驶的“眼睛”和“耳朵”,负责实时、精准地感知车辆周围的动静态环境,其主要原理如下。多传感器融合01计算机视觉技术应用02高精度定位032.5.3自动驾驶的基本原理2.决策层决策层是自动驾驶的“大脑”,负责根据感知信息进行驾驶行为决策和路径规划,其主要原理如下。路径规划0203不确定性处理01行为决策2.5.3自动驾驶的基本原理3.执行层执行层是自动驾驶的“手脚”,负责将决策层生成的规划轨迹转化为具体的车辆动作,其主要原理如下。纵向控制010203横向控制整车协调2.5.4自动驾驶的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 三峡复习课件
- IC工艺技术1引言和硅衬底
- 2026年施工升降机操作工考核试卷及完整答案
- 三年级数学年、月、日课件
- 文物影响评估实施细则
- 景区地下管网标识布设方案
- 2026中国叶黄素酯生产工艺优化与成本控制策略研究
- 民法全考点题库及答案梳理
- 七年级历史承上启下的魏晋南北朝文化
- 2026浅层地震行业市场供需研究与发展前景规划
- 2026年纪检监察综合业务考试题库含答案
- 2026氢燃料电池行业市场需求增长分析及产业链发展策略研究报告
- 2026年新闻记者职业资格考试试卷及答案(共十七套)
- 泸州航空发展投资集团有限公司下属四川焜仑投资管理有限公司2026年第二次社会公开招聘笔试备考题库及答案详解
- GJB3165A-2020航空承力件用高温合金热轧和锻制棒材规范
- 肾透明细胞癌疾病病理、症状表现、影像学表现及分期
- DB63T 2338-2024 国家公园珍稀濒危野生植物监测技术规范
- 妊娠合并子宫肌瘤护理查房
- 新庄湾联合站工艺设计(说明书、计算书)
- 经鼻内镜鼻窦手术配合
- 肺大疱(心胸外科)
评论
0/150
提交评论