《人工智能技术及应用》课件-第12章感知单元-视觉和语音_第1页
《人工智能技术及应用》课件-第12章感知单元-视觉和语音_第2页
《人工智能技术及应用》课件-第12章感知单元-视觉和语音_第3页
《人工智能技术及应用》课件-第12章感知单元-视觉和语音_第4页
《人工智能技术及应用》课件-第12章感知单元-视觉和语音_第5页
已阅读5页,还剩27页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

时间:2020-9-8感知单元——视觉和语音第12章语音识别计算机视觉任务计算机视觉基础理解12.112.212.3计算机视觉概念1计算机视觉应用212.1计算机视觉基础理解计算机视觉概念1计算机视觉是一门关于如何运用照相机和计算机来获取我们所需的,被拍摄对象的数据与信息的学问。形象地说,就是给计算机安装上眼睛(照相机)和大脑(算法),让计算机能够感知环境,是一门研究如何让机器“看”的科学。概念计算机视觉应用2深度学习的最新进展极大地推动了这些最先进的视觉识别系统的发展。研究计算机视觉已经衍生出了一大批快速成长的、有实际作用的应用,例如:(1)控制过程,比如,一个工业机器人

;(2)导航,例如,通过自主汽车或移动机器人;(3)事件检测,如,对视频监控和人数统计

;(4)组织信息,例如,对于图像和图像序列的索引数据库;(5)造型,如,医学图像分析系统或地形模型;(6)交互,例如,当输入到一个装置,用于计算机与人的交互;(7)识别,例如,在制造业产品缺陷检测;(8)监测:用于监测可疑行为的监视摄像头遍布于各大公共场所中。图像分类12.2.1目标检测12.2.212.2计算机视觉任务目标跟踪12.2.3语义分割12.2.4实例分割12.2.5给定一组各自被标记为单一类别的图像,对一组新的测试图像的类别进行预测,并测量预测的准确性结果,这就是图像分类问题。图像分类1步骤分解概念1.输入是由N个图像组成的训练集,共有K个类别,每个图像都被标记为其中一个类别。2.然后,使用该训练集训练一个分类器,来学习每个类别的外部特征。3.最后,预测一组新图像的类标签,评估分类器的性能,我们用分类器预测的类别标签与其真实的类别标签进行比较。图像分类1目前较为流行的图像分类架构是卷积神经网络(CNN)——将图像送入网络,然后网络对图像数据进行分类。图像分类1AlexNET结构:该网络架构除了一些最大池化层外,还包含7个隐藏层,前几层是卷积层,最后两层是全连接层。在每个隐藏层内,激活函数为线性的,要比逻辑单元的训练速度更快、性能更好图像分类147.图像分类11.图像分类-AlexNet:

/aistudio/projectdetail/56397目标检测2识别图像中的目标这一任务,通常会涉及到为各个对象输出边界框和标签。这不同于分类/定位任务——对很多对象进行分类和定位,而不仅仅是对个主体对象进行分类和定位。在对象检测中,你只有2个对象分类类别,即对象边界框和非对象边界框。例如,在汽车检测中,你必须使用边界框检测所给定图像中的所有汽车。目标检测2如果使用图像分类和定位图像这样的滑动窗口技术,则需要将卷积神经网络应用于图像上的很多不同物体上。由于卷积神经网络会将图像中的每个物体识别为对象或背景,因此需要在大量的位置和规模上使用卷积神经网络,但是这需要很大的计算量!为了解决这一问题,我们引入一个新的模型——基于区域的卷积神经网络(R-CNN):案例R-CNN的第一个升级版本是FastR-CNN,通过使用了2次增强,大大提了检测速度:目标检测2刚刚提到的FastR-CNN的运行速度要比R-CNN快的多,因为在一幅图像上它只能训练一个CNN。但是,择性搜索算法生成区域提议仍然要花费大量时间。FasterR-CNN是基于深度学习目标检测的一个典型案例:该算法用一个快速神经网络代替了运算速度很慢的选择性搜索算法:通过插入区域提议网络(RPN),来预测来自特征的建议。RPN决定查看“哪里”,这样可以减少整个推理过程的计算量:目标检测2FasterR-CNN的速度和准确度更高FasterR-CNN可能不是最简单或最快速的目标检测方法,但仍然是性能最好的方法之一。目标检测248.目标检测12.基于FasterRCNN的螺丝螺母的检测:

/aistudio/projectdetail/122275目标跟踪3定义:在第一帧中给定待跟踪目标的情况下,对目标进行特征提取,对感兴趣区域进行分析;然后在后续图像中找到相似的特征和感兴趣区域,并对目标在下一帧中的位置进行预测。目标跟踪3都使用第一帧中给定的边界框进行初始化,以获取对象的映射。而对于新的帧,对其进行剪切并传输最后一帧中的感兴趣区域,该感兴趣区域是以目标对象为中心。最后,通过SNet和GNet,分类器得到两个预测热映射,而跟踪器根据是否存在干扰信息,来决定使用哪张热映射生成的跟踪结果。全卷积网络跟踪器(FCNT)目标跟踪3多域卷积神经网络(MDNet)可分为两个部分:即K个特定目标分支层和共享层:每个分支包含一个具有softmax损失的二进制分类层,用于区分每个域中的对象和背景;共享层与所有域共享,以保证通用表示。目标跟踪3近年来,深度学习研究人员尝试使用了不同的方法来适应视觉跟踪任务的特征,并且已经探索了很多方法:(1)应用到诸如循环神经网络(RNN)和深度信念网络(DBN)等其他网络模型;(2)设计网络结构来适应视频处理和端到端学习,优化流程、结构和参数;(3)将深度学习与传统的计算机视觉或其他领域的方法(如语言处理和语音识别)相结合。视频49.目标跟踪语义分割4计算机视觉的核心是分割,它将整个图像分成一个个像素组,然后对其进行标记和分类。语义分割4由于在原始图像分辨率上进行卷积运算非常昂贵,全卷积网络(FCN)

在网络内部使用了下采样和上采样:下采样层被称为条纹卷积(stripedconvolution);而上采样层被称为反卷积(transposedconvolution)。语义分割4尽管采用了上采样和下采样层,但由于池化期间的信息丢失,FCN会生成比较粗糙的分割映射。SegNet是一种比FCN(使用最大池化和编码解码框架)更高效的内存架构。在SegNet解码技术中,从更高分辨率的特征映射中引入了shortcut/skipconnections,以改善上采样和下采样后的粗糙分割映射。语义分割450.语义分割13.基于PaddlePaddle的图像语义分割ICNet实现:

/aistudio/projectdetail/124368实例分割5实例分割是在像素级识别对象轮廓的任务。与类似的计算机视觉任务相比,这是最困难的视觉任务之一。区别:语义分割:将气球和背景分离出来。实例分割:在这些位置的图像中有7个不同的气球,在像素层面给出属于每个气球的像素。实例分割5MaskR-CNN通过向FasterR-CNN添加一个分支来进行像素级分割,该分支输出一个二进制掩码,该掩码表示给定像素是否为目标对象的一部分:该分支是基于卷积神经网络特征映射的全卷积网络。将给定的卷积神经网络特征映射作为输入,输出为一个矩阵,其中像素属于该对象的所有位置用1表示,其他位置则用0表示,这就是二进制掩码。实例分割5当在原始FasterR-CNN架构上运行且没有做任何修改时,感兴趣池化区域(RoIPool)

选择的特征映射区域或原始图像的区域稍微错开。由于图像分割具有像素级特性,这与边界框不同,自然会导致结果不准确。MasR-CNN通过调整

RoIPool来解决这个问题,使用感兴趣区域对齐(Roialign)方法使其变的更精确。本质上,RoIlign使用双线性插值来避免舍入误差,这会导致检测和分割不准确。实例分割551.实例分割14.经典实例分割模型MaskRCNN:/aistudio/projectdetail/122273语音识别基础理解1语音识别系统212.3语音识别语音识别基础理解1(1)定义:语音识别(AutomaticSpeechRecognition,ASR):利用计算机实现从语音到文字自动转换的任务。(2)语音识别技术=早期基于信号处理和模式识别+机器学习+深度学习+数值分析+高性能计算+自然语言处理(3)语音识别关联领域=自然语言理解+自然语言生成+语音合成语音识别系统2语音识别系统构建总体包括两个部分:训练和识别。语音识别系统2语音识别技术中的关键问题:(1)语音特征抽取:

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论