版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第六章边缘智能技术《物联网技术概论》12课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七3课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七4一、边缘智能技术概述1.1边缘智能的产生动机和优势边缘智能在更加靠近用户和数据源头的网络边缘侧这一位置训练和部署深度学习模型,从而改善AI应用的性能、成本和隐私性。一、边缘智能技术概述1.1边缘智能的产生动机和优势Gartner:Theedgewilleatthecloud(边缘计算正在吃到云计算)。IDC:40%的数据将在边缘侧进行存储、处理和分析。边缘智能的三大功能:①边缘数据采集、存储和分发。②边缘数据的实时分析。③边缘设备的智能控制。边缘侧业务不敢传:涉及数据安全与保密不需传:本地化、实时性不能传:网络延迟、功耗、计算量、协议适配云端业务非实时、大数据量的业务需要进行纵向和横向对比分析的业务需要和业务系统进行集成的业务需要进行全局优化的业务5一、边缘智能技术概述1.1边缘智能的产生动机和优势6体系架构一、边缘智能技术概述1.1边缘智能的产生动机和优势边缘智能已经在许多应用领域有了优异的表现,如图所展示的边缘智能在实时视频分析中的应用,实时视频分析在智能工厂、智慧社区、无人驾驶等场景中都是不可或缺的关键环节,借助边缘智能实时视频分析可以更加智能、更加高效。在实时视频分析服务的应用过程中,智能手机、智能摄像头等资源受限的终端设备在捕获视频数据之后,若无法支撑人工智能服务高额的资源消耗,智能终端可以仅执行数据压缩、图像分割等预处理,然后将数据传输至边缘节点处理。边缘智能应用——实时视频分析7一、边缘智能技术概述1.1边缘智能的产生动机和优势边缘智能应用——无人驾驶8一、边缘智能技术概述1.1边缘智能的产生动机和优势边缘智能应用——无人驾驶910一、边缘智能技术概述1.2边缘智能的范围与评级第一级——云-边缘联合推理和云训练:在云中训练DNN模型,但以边缘-云合作的方式推理DNN模型。第二级——边缘内协同推理和云训练:在云中训练DNN模型,但在边缘推理DNN模型。第三级——设备上推理和云训练:在云中训练DNN模型,但完全在本地设备上进行DNN推理。第四级——云-边缘协同训练和推理:以云-边缘协同的方式训练和推理DNN模型。第五级——全边缘:训练和推理DNN模型全部在边缘上实现。第六级——全设备:训练和推理DNN模型全部在设备上实现。11课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七12资源受限资源共享资源异构资源和作业调度延迟精度能耗隐私案例智能家居工业物联网智慧城市
二、边缘智能主要挑战13如何用有限的计算资源,保障响应延迟,获取尽可能高的精度数据来源红外传感器摄像头边缘智能设备嵌入式设备典型场景实时测人脸识别计算速度慢数据来源摄像头边缘智能设备嵌入式设备典型场景树莓派图像识别内存空间小网络带宽窄数据来源:用户上传图片边缘智能设备:智能手机典型场景:移动端图像风格迁移应用二、边缘智能主要挑战
2.1资源受限14离线实时多语言语音转写多模型并行多应用并行笔记本电脑多应用并行负载提交行为、资源需求多样化作业运行时间短(几秒到几分钟)如何寻找最优的资源共享/作业调度方案2.2资源共享
二、边缘智能主要挑战15并发边缘端性能高度差异化
VS模型训练/数据处理高度同步的需求P#0P#1P#2P#3机器学习模型同步训练分布式机器学习训练进度异构边缘设备设备性能差异大同步处理要求高100个并发组件:63.39%请求响应延迟大于1秒并发组件延迟:1%可能性>1秒,99%<50毫秒推荐系统/搜索引擎并发组件1秒50毫秒二、边缘智能主要挑战2.3资源异构
16资源受限资源共享资源异构模型训练速度慢运行负载变化快边缘处理难协同数据密集负载分析模型精度感知冗余数据移除负载自动适应调度参数优化边缘节点粒度数据处理同步循环迭代智能适配长尾延迟迭代同步单个作业多个作业集群规模二、边缘智能主要挑战2.4资源和作业调度
边缘训练延迟很大程度上决定了模型的收敛速率,因延迟较高无法及时获得需要的数据或是梯度,可能会导致训练的模型无法收敛或所需时间太多。边缘推断对实时性要求比较高的程序而言对,如果输出延迟较高则可能会导致输出结果没有任何意义。例如:在智能交通中,需要智能车在行驶过程中对路况进行实时的判断,这对边缘推断的延迟提出了极高的要求,而如果将智能车的数据传送至云计算中心进行推断虽然能保证精度,但将产生极高的延迟,这显然是不现实的,存在巨大的安全隐患。二、边缘智能主要挑战2.5延迟
精度反映了深度神经网络的性能,一般来说高精度就意味着更先进的硬件设备,更复杂计算,这通常会消耗更多资源,产生更多时延,应用需在精度与资源消耗、时延之间进行权衡。以智能交通为例,智能车在行驶过程中必须对路况进行准确的判断才能保证智能车行驶准确无误,而如何在精度与计算资源之间进行权衡是目前一个重要的挑战。二、边缘智能主要挑战2.6精度
在边缘端进行传输、训练、推断会消耗大量能源。例如在智慧城市中,数以百万计的各种设备同时产生数据,传输数据和处理数据,这对于能源(如电能)的消耗是十分巨大的。特别是想深度神经网络的训练这种计算密集型任务,其消耗的能耗将远远超过上传图片这种简单任务。因此,如何降低边缘智能的能耗也是一个巨大的挑战。二、边缘智能主要挑战2.7能耗
边缘训练方面,为保护隐私一般选择在终端设备中进行一定的预处理,降低数据隐私敏感性后再传输出去。例如联邦学习技术让边缘设备在本地训练原始数据,并通过聚合本地计算的更新在服务器上训练共享模型。边缘推断方面,智慧医疗中病人的病历信息通常具有极强的隐私性,如何智能化使用病人身份信息、化验结果、症状描述等各种数据进行智能化诊疗,同时对病人的隐私数据进行保护,是智慧医疗需解决的关键问题。二、边缘智能主要挑战2.8隐私
1.智能家居越来越多的家庭物联网设备(如温湿度传感器、安防系统、照明系统)实时监控家庭内部状态,接受外部控制命令并最终完成对家居环境的调控,不断提升家居安全性、便利性、舒适性。面临挑战设备数量大,产生数据多家庭数据隐私保护设备结构差异大,管理难二、边缘智能主要挑战2.9案例
2.工业物联网工业互联网是机器、计算机和人员使用业务转型所取得的先进的数据分析成果来实现智能化的工业操作。Chen等人用边缘计算技术对薄膜壁焊接的工业级机器人系统做优化,设计了物理资源-边缘-云的架构,该系统比基于云计算的传统系统实时性更好,可节省883.38Kbps的带宽,满足了工业级产品的需求。面临挑战对于工业实时控制及边缘设备安全隐私的要求较高产生的数据需要本地化处理成本要求高二、边缘智能主要挑战2.9案例
3.智慧城市阿里云提出了“城市大脑”的概念,利用城市的数据资源来智能管理城市建设,如:交通疏导、道路照明、事故处理等。Alphabet旗下城市创新部门SidewalkLabs建造名为Quayside的高科技新区,并希望该智慧城市项目能够成为全球可持续和互联城市的典范。面临挑战数据复杂多样,处理难度大二、边缘智能主要挑战
2.9案例24课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七三、边缘智能使能技术3.1联邦学习联邦学习(Federatedlearning)的概念最早由谷歌提出,它是一种机器学习设定,其中许多客户端(例如移动设备或大型组织)在中央服务器的协调下共同训练模型,同时保持训练数据的去中心化及分散性。联邦学习概念:25三、边缘智能使能技术3.1联邦学习联邦学习概念:聚合模型更新更新全局模型本地训练模型上传模型更新挑选部分合适的终端下载完整模型谷歌键盘Gboard的完整语言模型(嵌入10K个单词)
√√√可行本地多次迭代削减通讯轮数26三、边缘智能使能技术3.1联邦学习
联邦学习定义:27三、边缘智能使能技术3.1联邦学习(1)横向联邦学习横向联邦学习,或基于样本的联邦学习,适用于数据集特征空间相同但样本空间不同的场景。例如,两个地区银行可能拥有与其各自地区截然不同的用户组,它们的用户交集非常小。然而,它们的业务非常相似,因此特征空间是相同的。联邦学习分类:28三、边缘智能使能技术3.1联邦学习(2)纵向联邦学习纵向联邦学习,或基于特征的联邦学习,适用于两个数据集的用户重叠较多而用户特征重叠较少的场景。例如,考虑同一城市两家不同的公司:一家是银行,另一家是电子商务公司。他们的用户集可能包含该地区的大多数居民,因此,它们的用户空间的交集很大。但是由于银行记录了用户的收支行为和信用评级,电子商务保留了用户的浏览和购买历史,所以两者的特征空间有很大的不同。联邦学习分类:29三、边缘智能使能技术3.1联邦学习(3)联邦迁移学习联邦迁移学习适用于两个数据集不仅在样本上不同,而且在特征空间上也不同的场景。例如,考虑两个机构:一个是位于中国的银行,一个是位于美国的电商公司。由于地域限制,两个机构的用户群体有一个小交集。另一方面,由于业务不同,双方的特征空间只有一小部分重叠。在这种情况下,迁移学习技术可以应用于为联邦下的整个样本和特征空间提供解决方案。联邦学习分类:30三、边缘智能使能技术3.1联邦学习联邦学习分类:
跨孤岛跨设备例子医疗机构手机端应用节点数量1~1001~1010节点状态节点几乎稳定运行大部分节点不在线主要瓶颈计算瓶颈和通信瓶颈Wifi速度,设备不在线场景横向/纵向横向另外联邦学习还可以分为跨设备、跨孤岛两大类:(1)跨设备:如Gboard键盘预测(2)跨孤岛:如医疗数据联邦学习31三、边缘智能使能技术3.1联邦学习(1)横向联邦学习①参与者局部计算训练梯度;用加密、差分隐私或秘密共享技术屏蔽选择的梯度,并将屏蔽结果发送到服务器。②服务器进行安全聚合,不学习任何参与者的信息。③服务器将聚合的结果返回给参与者。④参与者使用解密后的梯度更新各自的模型。联邦学习系统架构:32三、边缘智能使能技术3.1联邦学习(2)纵向联邦学习第一步:加密实体对齐第二步:加密模型训练①合作者C创建加密对,并将公钥发送给A和B。②A和B加密并交换梯度和损失计算的中间结果。③甲和乙分别计算加密梯度和添加额外的掩码。b也计算加密损失。甲和乙向丙发送加密值。④丙解密并将解密的梯度和损失发送回甲和乙。甲和乙取消梯度屏蔽并相应地更新模型参数。联邦学习系统架构:33三、边缘智能使能技术3.1联邦学习联邦学习应用:金融领域34三、边缘智能使能技术3.1联邦学习联邦学习应用:城市管理35三、边缘智能使能技术3.2现有框架36三、边缘智能使能技术3.2现有框架考虑右面的图像集合。此图像中有各种类别,猫、骆驼、鹿、大象等。我们的任务是将这些图像分类到相应的类(或类别)中。卷积神经网络(CNN)对于此类图像分类任务非常有效。所以我们需要去实现这个模型,但是如果你开始从头开始编写CNN,那么获得工作模型将是几天后(甚至是几周),而这就是深度学习框架真正改变了这尴尬的局面。深度学习框架是一种界面、库或工具,它使我们在无需深入了解底层算法的细节的情况下,能够更容易、更快速地构建深度学习模型。深度学习框架利用预先构建和优化好的组件集合定义模型,为模型的实现提供了一种清晰而简洁的方法。利用恰当的框架来快速构建模型,而无需编写数百行代码,一个良好的深度学习框架具备以下关键特征:1.
针对性能进行了优化2.
易于理解和编码3.
良好的社区支持4.
并行化进程以减少计算5.
自动计算渐变37三、边缘智能使能技术框架发布时间维护组织底层语言接口语言Caffe2013-9BVLCC++C++/Python/MatlabTensorflow2015-9GoogleC++/PythonC++/Python/Java等Python2017-1FacebookC/C++/PythonPythonMxnet2015-5DMLCC++C++/Python/Julia/R等Keras2015-3GooglePythonPythonPaddlepaddle2016-8BaiduC++/PythonC++/PythonCntk2014-7MicrosoftC++C++/Python/C#/.NET/JavaMatconvnet2014-2VLFeatC/MatlabMatlabDeeplearning4j2013-9EclipseC/C++/CudaJava/ScalarChainer2015-4PreferrednetworksPython/CPythonLasagne/Theano2014-9LasagneC/PythonPythonDarknet2013-9JosephRedmonCC3.2现有框架38三、边缘智能使能技术官网:/Github:/tensorflow/tensorflow由GoogleBrain开发。提供了从预处理到数据建模的各种API由Python,C++和CUDA编写,可以在几乎所有平台上运行——Linux,Windows,macOS,iOS和Android。具有强大的集群支持,也可以与CPU,GPU和TPU一起使用。API已在Python中广泛使用,完全处于稳定版本中。其他语言的API仍在开发中,不是稳定的版本,在使用时没有API向后兼容性,如C++,Javascript,Java和Go语言等。某些语言甚至将其用作第三方软件包——Haskell,C#,R,Julia,Scala,Ruby,MATLAB。应用:GoogleTeachableMachine(无代码ML训练平台),Ranbrain(搜索引擎优化),DeepSpeech(语音翻译),Nsynth(用于制作音乐),Uber,DeliveryHero,Ruangguru,Hepsiburada,9GAG,Channel.io。Tensorflow:3.2现有框架39三、边缘智能使能技术3.2现有框架官网:/Github:/pytorch/pytorch由Facebook的人工智能研究实验室开发,深度学习框架,构建在Torch库之上。主要是为了研究和生产部署而开发的,与Linux,Windows,macOS,Android和iOS兼容。通过使用TorchServe,PyTorch提升了部署模型的速度,十分便捷。TorchScript在图模式功能的转换中提供了灵活性。有活跃的计算机视觉、NLP以及强化学习技术开发社区。API:主要用于Python,但也具有C++接口。应用:NVIDIA,Apple,RobinHood,Lyft,FordMotorCompanyPyTorch:40三、边缘智能使能技术3.2现有框架/Github:/BVLC/caffe由加利福尼亚大学伯克利分校开发,最早的深度学习框架之一,支持各种用于图像分割和分类的体系结构,需要进行编译安装。用C++编写,与Linux,Windows,macOS兼容。可在CPU上运行,但可通过GPU加速获得更好的性能。因其速度和行业部署而广受欢迎,使用NVIDIAGPU可以处理多达6000万张图像。Caffe拥有适当的文档说明和活跃的开发人员社区,以支持创业公司和研究工作。API:Python和Matlab应用:CaffeOnSpark(来自Yahoo的合资企业,集成了ApacheSpark),Caffe2(Facebook开发),SnapInc.,CadenceDesignSystems,QualcommCaffe:41三、边缘智能使能技术3.2现有框架官网:mxnet.ioGithub:/dmlc/mxnet由ApacheSoftwareFoundation开发,开源深度学习框架,旨在实现高可伸缩性并受各种编程语言的支持。MXNet用多种语言编写——C++,Python,Java,Scala,Julia,R,Javascript,Perl,Go和Wolfram语言,与Windows,macOS,Linux兼容。快速的模型训练,轻巧且性能高,可以在智能设备上运行。允许命令式编程和符号式编程组合在一起,从而使其高效、灵活、可移植。API:GluonPythonAPI,被Scala,Julia,R,Java,Perl,Clojure支持应用程序–AWS(作为DL框架),华纳兄弟娱乐集团公司,ElbitSystemsofAmerica,KwaiMXNet:42三、边缘智能使能技术3.2现有框架官网:/Github:/chainer由PreferredNetworks与Intel,Nvidia,IBM和Microsoft合资开发,基于Numpy和CuPy库完全内置Python的跨平台深度学习框架。其动态计算图可以通过api轻易获得,此功能称为边运行边定义方法。具有4个扩展库——ChainerRL(用于强化学习),ChainerCV(用于计算机视觉),ChainerMN(用于多GPU使用),ChainerUI(用于管理和可视化)。API:Python应用:PaintsChainer(自动着色),JPMorganChase,NovuLLC,FacebookADP,MadStreetDen。Chainer:43三、边缘智能使能技术3.2现有框架官网:/Github:/deeplearning4j/deeplearning4j由Eclipse开发,为java和jvm编写的开源深度学习库,支持各种深度学习模型。支持Linux,Windows,macOS,iOS和Android。最重要的特点是支持分布式,可以在Spark和Hadoop上运行,支持分布式CPU和GPU运行为商业环境,而非研究所设计的,因此更加贴近某些生产环境。API:支持所有基于JVM的语言Java,Scala,Clojure,Kotlin。应用:网络安全,欺诈检测,异常检测。被使用于RapidMinerandWeka,U.S.Bank,Livongo,ThermoFisherScientific,NovoDynamicsInc。DeepLearning4j:44三、边缘智能使能技术3.2现有框架官网:keras.ioGithub:/fchollet/keras由FrancisChollet开发,用Python编写的跨平台神经网络库。在Tensorflow之上构建的高级API,是Kaggle中使用最广泛的深度学习框架,最好在GPU和TPU上运行。Keras模型可以轻松地部署到Web,iOS和Android上。以其快速的计算,用户友好性和易于使用而著称。Keras拥有活跃的社区,处于不断发展中。API:Python。应用:已被NASA,CERN,NIH和LHC,LockheedMartin,福特汽车公司等科学组织使用。Keras:4546课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七四、边缘智能关键训练算法智能终端边缘智能环境下模型训练方式47四、边缘智能关键训练算法边缘智能环境下模型训练解决思路48四、边缘智能关键训练算法跟传统的人工智能一样,边缘端的模型训练也需要大量的特征数据来训练AI模型。如何以较小的训练损失、较低的通信开销、较好的收敛性更安全的隐私保护来进行AI模型的分布式训练就显得尤为重要。目前,面向边缘智能的模型训练优化技术主要包括:聚合频率控制梯度压缩DNN划分知识迁移学习Gossip训练用于边云协作的知识蒸馏元学习……49四、边缘智能关键训练算法4.1聚合频率控制该方法着重于DNN模型训练过程中通信开销的优化。在边缘计算环境下的深度学习模型训练中,一种普遍采用的方法(如联合学习)是先在本地训练分布式模型,然后集中聚合更新。在这种情况下,更新聚合频率的控制显著地影响通信开销。因此,应该仔细地控制聚合过程,包括聚合内容和聚合频率。50四、边缘智能关键训练算法4.1聚合频率控制Gaia系统:Gaia系统用于地理分布式DNN模型训练,和近似同步并行(ApproximateSynchronousParallel,ASP)模型一同使用。Gaia的基本思想是将数据中心内的通信与数据中心之间的通信解耦,为每个数据中心启用不同的通信和一致性模型。为此,开发了ASP模型来动态消除数据中心之间不重要的通信,其中聚合频率由预设的显著性阈值控制。然而,Gaia关注的是容量不受限制的地理分布式数据中心,这使得它通常不适用于容量高度受限的边缘计算节点。51四、边缘智能关键训练算法4.1聚合频率控制更新聚合协议FedCS:更新聚合协议FedCS可以在容量有限的边缘计算环境中实现联邦学习,以允许集中式服务器聚合尽可能多的客户端更新,并加速机器学习模型的性能改进。52四、边缘智能关键训练算法4.2梯度压缩为了减少分散训练带来的通信开销,梯度压缩是压缩模型更新(即梯度信息)的另一种直观方法。为此,我们提倡梯度量化和梯度稀疏化。梯度量化通过将梯度向量的每个元素量化为有限位低精度值来执行梯度向量的有损压缩,梯度稀疏化通过传输部分梯度向量来减少通信开销。53四、边缘智能关键训练算法4.2梯度压缩分布式SGD中99.9%的梯度交换是冗余的,深度梯度压缩(DeepGradientCompression,DGC)可以被用来大大降低通信带宽,对大范围的CNN和RNN进行270-600倍的梯度压缩而不损失精度。为了在压缩过程中保持精度,DGC采用了四种方法:动量校正、局部梯度剪裁、动量因子掩蔽和热身训练。54四、边缘智能关键训练算法4.3DNN拆分DNN拆分的目的是保护隐私。DNN拆分通过传输部分处理过的数据而不是传输原始数据来保护用户隐私。为了实现基于边缘训练的隐私保护DNN模型,在终端设备和边缘服务器之间进行DNN拆分。这是因为DNN模型可以在两个连续的层之间进行内部拆分而不会损失精度,其中两个分区部署在不同的位置。55四、边缘智能关键训练算法4.3DNN拆分在应用DNN拆分技术进行隐私保护时,还可以处理DNN巨大的计算量。边缘计算通常涉及大量设备,因此采用并行化方法来管理DNN计算。DNN并行训练包括数据并行和模型并行两种。然而,数据并行可能带来很大的通信开销,而模型并行往往导致计算资源的严重利用不足。56四、边缘智能关键训练算法4.3DNN拆分流水线并行将多个小批量同时注入到系统中,以确保计算资源的高效并发使用。PipeDream系统基于流水线并行设计,支持流水线训练,并自动确定如何在可用的计算节点上系统地分割给定模型。PipeDream在减少通信开销和有效利用计算资源方面具有优势。57四、边缘智能关键训练算法4.3DNN拆分移动端超大规模联合学习资源受限的移动端设备产业级的深度学习模型协同训练10亿移动终端用户、20亿候选商品、200MB应用APP运行内存上限ChaoyueNiu,FanWu,etal.,“Billion-ScaleFederatedLearningonMobileClients:ASubmodelDesignwithTunablePrivacy,”ACMMobiCom2020.58四、边缘智能关键训练算法4.3DNN拆分联邦学习框架不可行淘宝完整的深度兴趣网络推荐模型(嵌入全部20亿个商品标识)×××
开销无法承担!聚合模型更新更新全局模型本地训练模型上传模型更新挑选部分合适的终端下载完整模型59四、边缘智能关键训练算法4.3DNN拆分完整特征空间某个终端的本地数据涉及的特征空间某个终端的本地数据所有终端的数据特征对应的子模型本地训练完整模型完整模型更新本地训练子模型更新消除冗余!子模型基于特征的模型切分60四、边缘智能关键训练算法4.3DNN拆分联邦子模型学习数据+模型并行每个手机淘宝终端的深度兴趣网络子模型(嵌入本地300个商品标识)聚合子模型更新更新全局模型本地训练子模型上传子模型更新挑选部分合适的终端下载子模型√√√
61四、边缘智能关键训练算法4.4知识迁移学习知识迁移学习,与DNN拆分技术密切相关。在迁移学习中,为了降低DNN模型在边缘设备上的训练能耗,我们首先在一个基础数据集上训练一个基础网络(教师网络),然后重新利用学习到的特征,将它们转移到第二个目标网络(学生网络)上,在目标数据集上进行训练。如果特性是通用的(即适用于基本任务和目标任务),而不是特定于基本任务,则此过程将趋于有效。这种转变涉及一个从一般性到特殊性的过程。62四、边缘智能关键训练算法4.4知识迁移学习在机器学习的经典监督学习场景中,如果要针对一些任务和域A训练一个模型,我们会假设被提供了针对同一个域和任务的标签数据。可以在图中清楚地看到这一点,其中我们的模型A在训练数据和测试数据中的域和任务都是一样的同源、独立同分布两个基本假设标注足够多的训练样本63四、边缘智能关键训练算法4.4知识迁移学习我们有时在一个感兴趣的领域中有一个分类任务,但是在另一个感兴趣的领域中我们只有足够的训练数据,后者的数据可能在不同的特征空间中或者遵循不同的数据分布。64四、边缘智能关键训练算法4.4知识迁移学习图像分类HP新闻Lenovo
新闻新闻网页分类65四、边缘智能关键训练算法4.4知识迁移学习66四、边缘智能关键训练算法4.4知识迁移学习
67四、边缘智能关键训练算法4.4知识迁移学习从模拟中学习
应用68四、边缘智能关键训练算法4.4知识迁移学习另一个需从模拟中学习的领域:机器人在实际的机器人上训练模型是非常缓慢和昂贵的从模拟中学习并且将知识迁移到现实世界的机器人上应用69四、边缘智能关键训练算法4.5Gossip训练GoSGD(GossipStochasticGradientDescent)采用异步和分散的方式训练DNN模型。GoSGD管理一组独立的节点,每个节点承载一个DNN模型,并迭代进行两个步骤:梯度更新和混合更新。具体地,每个节点在梯度更新步骤中本地更新其承载的DNN模型,然后在混合更新步骤中与随机选择的另一个节点共享其信息。重复上述步骤,直到所有DNN模型都达到一致。70四、边缘智能关键训练算法4.6用于边云协作的知识蒸馏为什么要知识蒸馏?人工智能模型训练过程需要很高的计算能力。每个边缘物联网设备上可用的本地数据样本的数量通常是有限的。因此,建立创新的边缘云协作,以提高边缘学习性能,是非常重要的。从云端下载预先训练过的人工智能模型参数,可以帮助edge设备应对由于功率有限和训练样本稀缺而带来的挑战。然而,模型参数的直接传输可能会导致通信开销与模型大小成比例。为了缓解这种通信低效问题,知识蒸馏(KD)方法被提出,并广泛应用于边缘云协作模型训练过程,特别是DNN训练。71四、边缘智能关键训练算法4.6用于边云协作的知识蒸馏KD侧重于在训练有素的教师神经网络的基础上训练一个学生神经网络,学生神经网络模型大小被压缩,结构更简单。KD的关键思想是在学生神经网络的损失函数中添加一个蒸馏正则化器,这个额外的正则化器由交叉熵表示,以测量教师和学生之间的知识差距。72四、边缘智能关键训练算法4.7元学习元学习通过开发新的工具,利用最新的神经体系结构的强大功能,再次成为小样本快速学习的一种有前景的解决方案。与传统的迁移学习不同,元学习通过利用相关任务的先前经验来明确优化学习能力,这使得只使用这些任务中的少数样本能快速地学习看不见的任务。73四、边缘智能关键训练算法4.7元学习目前的元学习算法可以大致分为三类:(1)基于梯度的方法:使用梯度下降使用训练样本来适应模型参数;(2)基于模型的方法:学习参数化预测器,如递归网络,以估计模型参数;(3)基于度量学习的方法:在embeddings上学习基于距离的预测规则。7475课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七五、边缘智能关键推理算法边缘智能环境下模型推理方式在线推断由“端云”模式向“端边云”协同推断转变76五、边缘智能关键推理算法模型压缩模型分割模型早退边缘缓存输入过滤模型选择支持多租户应用程序特定优化……在深度学习模型的部署(即模型推理)阶段,边缘端设备可能会遇到模型过大、模型推理计算时间过长以及计算消耗能源较多等问题。为了在算力和能耗均受限的边缘或终端设备实现低延迟和高效能的模型推理,现有的优化技术主要包括:77五、边缘智能关键推理算法5.1模型压缩从线性代数的角度对神经网络进行压缩,在尽量小的影响精度的情况下减少神经网络的内存限制,允许边缘设备运行深度学习模型。奇异值分解正则多元分解78五、边缘智能关键推理算法5.1模型压缩模型压缩方法优化了延迟、能量、隐私和内存占用这四个指标。压缩技术:权值剪枝数据量化紧凑架构设计……对于给定的DNN,应根据需要选择压缩技术的组合,即适应应用程序驱动的系统性能(如准确性、延迟和能量)和跨平台的不同资源可用性(如存储和处理能力)。79五、边缘智能关键推理算法5.2模型分割为了减轻边缘智能应用在终端设备上的执行压力,一个直观的想法是模型分割,将计算密集的部分卸载到边缘服务器或附近的移动设备上,获得更好的模型推理性能。模型分割主要考虑延迟、能量和隐私问题。80五、边缘智能关键推理算法5.3模型早退高精度的DNN模型通常具有深层结构。在终端设备上执行这样的DNN模型需要消耗大量的资源。为了加速模型推理,模型早退方法利用早期层的输出数据得到分类结果,即利用部分DNN模型完成推理过程。延迟是模型早退的优化目标。可以通过在特定层位置添加出口分支来修改标准DNN模型结构。每个出口分支都是一个出口点,与标准DNN模型共享部分DNN层。输入数据可以在这些不同的早退点进行分类。途中即是一个五个输出点的模型。81五、边缘智能关键推理算法5.4边缘缓存边缘缓存是一种用于加速DNN模型推理的新方法,即通过缓存DNN推理结果来优化延迟问题。边缘缓存的核心思想是在网络边缘对图像分类预测等任务结果进行缓存和重用,减少边缘智能应用的查询延迟。下图是语义缓存技术的基本过程,如果移动设备的请求命中了存储在边缘服务器中的缓存结果,则边缘服务器将返回对应结果,否则,请求将以全精度模型传输到云数据中心进行推理。8283输入过滤直接对模型的输入进行优化。例如在视频分析中,一段视频中可能有大量的输入帧没有想要分析的目标对象,而在推断时如果将这些帧都输入进模型参与计算则会产生大量无意义的计算,因此需要对输入进行过滤,减少送入模型进行推理的数据量,从而加速模型推理。输入过滤的关键思想是去除输入数据中对推断结果不会产生影响的帧,避免推断过程中的冗余计算。输入过滤的常见方法包括:跳过背景帧对比参考帧轻量模型识别目标挑选变化较大帧建立时空模型五、边缘智能关键推理算法5.5输入过滤五、边缘智能关键推理算法5.6模型选择预先训练好一批DNN模型,在应用过程中根据不同的需求选择使用特定的DNN模型。下图使用机器学习算法来解决模型自动选择问题,其中边缘设备和DNN模型的特征是上下文,预先训练的DNN模型根据行为历史和用户的QoE(QualityofExperience)反馈在线选择。84五、边缘智能关键推理算法5.7支持多租户一个终端或边缘设备通常同时运行多个DNN应用程序。例如,用于互联网车辆的高级驾驶员辅助系统(ADAS)同时运行用于车辆检测、行人检测、交通标志识别和车道线检测的DNN程序。在这种情况下,多个DNN应用程序将争夺有限的资源。如果没有多租户的支持,即并发应用程序的资源分配和任务调度,全局效率会大大降低。对多租户的支持侧重于优化能源和内存占用。85五、边缘智能关键推理算法5.8应用程序特定优化可以利用特定于应用程序的优化来进一步优化边缘智能应用程序的性能,即精度、延迟、能量和内存占用。例如,对于基于视频的应用程序,可以灵活地调整帧率和分辨率两个旋钮,以减少资源需求。然而,由于此类资源敏感旋钮也会降低推理精度,因此自然会产生成本-精度的权衡。这就要求调整视频帧速率和分辨率时,在资源成本和推理精度之间取得很好的平衡。86五、边缘智能关键推理算法5.9总结技术亮点模型压缩权重修剪和量化,减少存储和计算量模型分割计算卸载到边缘服务器或移动设备面向延迟和能量优化模型早退部分DNNs模型推理精度感知边缘缓存快速响应并重用之前相同任务的结果输入过滤检测输入之间的差异,避免大量计算模型选择面向输入优化精度感知支持多租户调度多个DNN任务应用程序特定优化针对特定的DNN应用程序优化节约资源8788课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七六、边缘智能发展愿景6.1编程和软件平台边缘智能即服务(EIaaS)将成为一个普遍的范式,具有强大边缘人工智能功能的EI平台将被开发和部署。这与公共云提供的机器学习即服务(MLaaS)有本质上的不同。本质上,MLaaS属于云智能,它侧重于选择合适的服务器配置和机器学习框架,以一种成本效益的方式在云中训练模型。而与之形成鲜明对比的是,EIaaS更多关注的是如何在资源受限和隐私敏感的边缘计算环境中进行模型训练和推理。89六、边缘智能发展愿景6.1编程和软件平台要充分发挥EI服务的潜力,有几个关键的挑战需要克服。EI平台应该是异构兼容的。未来有很多分散的EI服务提供商/供应商,需要制定通用的开放标准,使用户可以随时随地在异构EI平台上享受无缝、顺畅的服务。目前存在有许多可用的人工智能编程框架(例如Tensorflow、Torch和Caffe等)。在未来,应该支持不同编程框架训练的边缘人工智能模型跨异构分布的边缘节点的可移植性。有许多专门为边缘设备设计的编程框架(例如TensorFlowLite、Caffe2、CoreML和MXNet等),然而,实证测量表明,没有一个框架能够在所有指标上超越其他框架。一个在更多指标上有效执行的框架在未来是可以预期的。轻量级虚拟化和计算技术(如容器和函数计算)应该得到进一步的研究,以便在资源受限的边缘环境中实现高效的EI服务放置和迁移。90六、边缘智能发展愿景6.2资源友好型边缘人工智能模型设计许多现有的人工智能模型,如CNN和LSTM,最初是为计算机视觉和自然语言处理等应用而设计的。大多数基于深度学习的人工智能模型都是资源密集型的,这意味着由丰富的硬件资源(如GPU、FPGA、TPU)支撑的强大计算能力是这些AI模型性能提升的重要因素。因此有许多研究利用模型压缩技术(例如,权重剪枝)来调整AI模型的大小,使其对边缘部署更具资源友好性。除此之外,还可以推广资源感知边缘人工智能模型设计。不必利用现有的资源密集型人工智能模型,而是可以利用AutoML思想和神经架构搜索(NAS)技术来设计资源高效的边缘人工智能模型,以适应底层边缘设备和服务器的硬件资源约束。例如,可以采用强化学习、遗传算法和贝叶斯优化等方法,通过考虑硬件资源对性能指标的限制(执行延迟、能量开销等)的影响来实现。91六、边缘智能发展愿景6.3计算感知网络技术对于未来的5G网络,超可靠低延迟通信(Ultra-ReliableLow-LatencyCommunication,URLLC)已经被定义为要求低延迟和高可靠性的任务关键应用场景。因此,将5GURLLC能力与边缘计算相结合,以提供超可靠的低延迟EI(URLL-EI)服务将是有希望的。5G还将采用软件定义网络、网络功能虚拟化等先进技术,实现对网络资源的灵活控制,支持计算密集型人工智能应用中不同边缘节点的按需互联。另一方面,自主组网机制的设计对于在动态异构网络共存(如LTE/5G/WiFi/LoRa)下实现高效的EI服务提供非常重要,允许新添加的边缘节点和设备以即插即用的方式进行自我配置。此外,计算感知通信技术也开始引起人们的注意,例如梯度编码可以缓解分布式学习中的散乱效应,以及用于分布式随机梯度下降的空中计算,对于边缘AI模型训练加速非常有用。92六、边缘智能发展愿景6.4各种DNN性能指标的权衡设计对于具有特定任务的边缘智能应用程序,通常有一系列DNN候选模型能够完成任务。然而,软件开发人员很难为EI应用选择合适的DNN模型,因为top-k精度或平均精度等标准性能指标不能反映DNN模型推理在边缘设备上的运行性能。例如,在EI应用程序部署阶段,除了准确性之外,推理速度和资源使用也是关键的度量标准。我们需要探索这些指标之间的权衡,并确定影响它们的因素。93六、边缘智能发展愿景6.5智能服务和资源管理由于边缘计算的分布式特性,提供EI功能的边缘设备和节点分散在不同的地理位置和区域。不同的边缘设备和节点可以运行不同的人工智能模型并部署不同的特定人工智能任务。因此,设计有效的服务发现协议,使得用户能够及时地识别和定位相关的EI服务提供商,以满足他们的需求,是非常重要的。此外,为了充分利用边缘节点和设备之间分散的资源,将复杂的边缘人工智能模型划分为若干个子任务,并在边缘节点和设备之间有效地卸载这些任务,以便协同执行也是必不可少的。对于许多EI应用场景(例如,智能城市),服务环境是高度动态的,很难准确预测未来事件。因此,它需要杰出的在线边缘资源编排和供应能力,以持续适应大规模的EI任务。异构计算、通信和缓存资源分配的实时联合优化以及为不同任务需求定制的高维系统参数配置(例如,选择适当的模型训练和推理技术)至关重要。为了解决算法设计的复杂性,一个新兴的研究方向是利用深度强化学习等人工智能技术,以数据驱动的自学习方式适应高效的资源分配策略。94六、边缘智能发展愿景6.6安全和隐私问题轻量级和分布式的安全机制设计对于确保用户认证和访问控制、模型和数据完整性以及EI的相互平台验证至关重要。在考虑可信边缘节点与恶意边缘节点共存的情况下,研究新的安全路由方案和可信网络拓扑对于EI服务的交付有重要意义。联邦学习是一种对隐私友好的分布式数据训练的可行范式,使得原始数据集保存在其生成的设备/节点中,并且共享边缘AI模型参数。利用差分私密性、同态加密和安全多方计算等工具来设计保护隐私的AI模型参数共享方案。95六、边缘智能发展愿景6.7激励和商业模式对于EI服务,用户可以是服务消费者,同时也是数据生成器。在这种情况下,需要一种新的智能定价方案来分解用户的服务消费及其数据贡献的价值。作为分散协作的一种手段,具有智能合约的区块链可以通过在分散的边缘服务器上运行而集成到EI服务中。在EI生态系统中,如何根据成员的工作证明,灵活地定价,合理地分配收入,是一个值得研究的问题。为边缘智能设计资源友好的轻量级区块链共识协议。9697课程提纲边缘智能关键训练算法四边缘智能主要挑战二边缘智能技术概述一边缘智能使能技术三边缘智能关键推理算法五边缘智能发展愿景六本章小结七边缘智能概述相关概念:边缘智能概念、整体架构、应用场景边缘智能主要挑战面临挑战:资源受限、资源共享、资源异构、资源调度边缘智能使能技术相关技术:网络、隔离技术、体系结构、边缘操作系统、算法执行框架、数据处理平台、安全和隐私技术架构:智能服务、业务Frabric、联接计算Frabric、边缘计算节点ECN98本章小结边缘智能关键训练算法相关概念:边缘智能模型训练、去中心化训练隐私保护:DNN分割、联邦学习通信优化:聚合控制优化、梯度压缩、迁移学习边缘智能关键推理算法优化角度:模型、系统、模型最佳选择模型优化:输入过滤、模型压缩、模型分割、提前退出系统优化:边缘缓存、多模型并行、多模型流水线边缘智能前沿技术挑战编程模型:应用/服务可分割、数据可分布、资源可分布面临挑战:碎片化向规模化发展、产业链协同、供给与需求匹配99本章小结第七章物联网交互技术《物联网技术概论》语音交互二物联网交互技术基础一101课程提纲手势交互三虚拟现实与增强现实交互四机器人交互五本章小结六语音交互二物联网交互技术基础一102课程提纲手势交互三虚拟现实与增强现实交互四机器人交互五本章小结六一、物联网交互技术基础1.1人机交互的基本概念与发展1.2物联网环境下的人机交互技术1.3多模态交互技术的需求与挑战一、物联网交互技术基础1.1人机交互的基本概念与发展1.2物联网环境下的人机交互技术1.3多模态交互技术的需求与挑战1.1人机交互的基本概念与发展人机交互的基本定义与核心内涵人机交互的核心特征与关键构成人机交互技术的评价维度人机交互技术的发展历程与趋势一、物联网交互技术基础一、物联网交互技术基础人机交互的基本定义与核心内涵基本定义:融合计算机科学、心理学、设计学与人因工程学的交叉学科核心内涵:优化交互过程以匹配人类认知特征,全面提升交互效率、系统可用性与用户体验一、物联网交互技术基础构成要素核心定义与作用典型示例交互主体(用户)决定交互设计方向(基于生理/认知/习惯/目标)个体用户、群体用户交互媒介(接口)连接人与系统的软硬件载体,承担信息的输入/输出键盘、触摸屏、语音模块、眼动仪交互环境(语境)约束媒介的选择范围,塑造用户的期望与体验感知物理空间、任务上下文、社会文化背景人机交互的核心特征与关键构成以用户体验为导向的四大核心特征双向交互性:人与系统信息双向传递,打破单一的指令输出与接收实时响应性:操作后系统快速有效反馈,显著降低用户等待成本操作自然性:契合认知与生理特征,降低学习成本与认知负荷场景适配性:动态调整交互模式,灵活适配多样化环境与任务需求一、物联网交互技术基础经典基础现代进阶前沿延伸核心可用性指标决定交互系统的实用价值与核心质量物联网场景指标适配全域感知与多终端互联的现代场景用户体验与包容性强调主观情感体验与人文关怀有效性高效性易学性容错性用户体验度可访问性泛在性低功耗性多设备协同性人机交互技术的评价维度一、物联网交互技术基础阶段时间交互方式核心特征代表性系统/设备机械交互时代1940s–1960s打孔卡、开关、电报机效率低、专业性强、无反馈机制ENIAC、EDVAC命令行交互时代1960s–1970s命令行界面依赖文本指令,容错性差,学习成本高UNIX、PDP-1图形用户界面时代1980s–1990s图形界面可视化、直接操纵、所见即所得Macintosh、Windows自然与多模态交互时代2000年至今语音、手势、触控、眼动等自然化、多通道融合、智能感知iPhone、Android、VR/AR设备人机交互技术的评价维度的发展历程与趋势人机交互的发展历程:人机交互的三维度演进:意图理解智能化:大模型驱动,从被动响应转向主动预判用户需求交互方式自然化:多模态融合,语音视觉触觉协同降低操作门槛场景体验无缝化:跨设备协同,交互状态随场景切换平滑延续一、物联网交互技术基础1.1人机交互的基本概念与发展1.2物联网环境下的人机交互技术1.3多模态交互技术的需求与挑战1.2物联网环境下的人机交互技术物联网环境下人机交互技术的核心内涵物联网环境下人机交互技术的关键特征物联网环境下人机交互技术体系物联网环境下人机交互技术的典型应用场景一、物联网交互技术基础一、物联网交互技术基础物联网环境下人机交互技术的核心内涵从单一设备到“人–机–物–环境”的四元协同核心架构:通过传感器、边缘计算、无线通信与AI技术,实现信息的双向、实时与情境感知协同。传统交互对比物联网交互的三大突破“物”的角色蜕变:物理对象不再是被动的操作对象,而是具备感知、反馈与决策能力的交互节点“环境”的主动参与:光照、温湿度、位置、噪声等环境参数成为交互上下文的重要组成部分,驱动系统自适应调整交互边界的消融:交互不依赖固定界面,而是泛化至空间、时间与行为维度,形成无处不在、按需触发的交互体验一、物联网交互技术基础特征维度核心定义技术逻辑与目标泛在性交互不受时空限制支持语音、手势等自然方式,实现“万物互联”的本质要求。低功耗与轻量化极低资源占用适配终端微小体积与有限算力,确保交互不成为系统瓶颈。多设备协同性跨端一致性手机、智能面板、可穿戴设备间状态同步,提供连贯体验。场景感知自适应环境动态响应结合多源传感器,随环境变化(如噪音)自动调整交互策略。低侵入性无感交互体验通过行为识别等隐式感知,实现“按需响应”与操作减负。物联网环境下人机交互技术的关键特征一、物联网交互技术基础交互模态典型技术与核心应用物联网适配优势视觉交互人脸识别、二维码/RFID、手势识别非接触式:满足高卫生要求,适配移动/不便手动场景,无需额外携带终端听觉交互语音控制、声场感知交互、语音反馈远距离与并行:彻底解放双手,极大地满足移动场景与多任务处理需求触觉交互触控屏/按键、力反馈、生理信号采集贴身与隐蔽:依托可穿戴设备,干扰低,且能结合生理特征提供个性化服务环境感知位置感知、温湿度/光线状态感知、动作捕捉场景触发与无感:依托全域传感器自动响应,大幅降低主动操作负担多模态融合视觉+听觉+触觉+环境感知的综合协同互补与高可靠:弥补单一模态局限,适应复杂场景(如智能家居/工业远控)物联网环境下人机交互技术体系一、物联网交互技术基础应用领域核心交互形态与技术支撑带来的角色与范式重构🏭智能制造AR可视化+多源数据协同:设备叠加状态、手势语音远控、触觉反馈预警操作员从“执行者”升级为监督者与决策者🏙️智慧城市隐式服务+显式控制:环境感知照明、人脸导览、智能预判表单摆脱主动发起,构建“城市懂你”的无感服务范式🚗智慧交通多模态融合+V2X协同:舱内疲劳干预、车路云动态协同、MaaS平台统合打破应用壁垒,实现“一次交互、全程无忧”🏥智慧医疗连续监测+触觉感知:穿戴设备云端预警、手术机器人精准力反馈、非接触式看护具备共情能力,从“疾病治疗”转向预见性健康管理🌾智慧农业虚实融合+自主决策:AR一眼知田、无人机AI处方、牲畜穿戴设备监测农户从“体力劳动者”转型为数据分析师与指挥官物联网环境下人机交互的典型应用场景一、物联网交互技术基础1.1人机交互的基本概念与发展1.2物联网环境下的人机交互技术1.3多模态交互技术的需求与挑战1.3多模态交互技术的需求与挑战多模态交互技术的核心定义与核心特征多模态交互技术的核心需求多模态交互技术的核心挑战一、物联网交互技术基础一、物联网交互技术基础模态互补性交互自然性场景自适应性智能容错性技术内涵:利用多通道信息的冗余性与互相补偿机制突破环境限制。典型场景:在强噪声车间自动由语音切换为手势;在暗光环境由视觉识别切换为红外感知。技术内涵:系统基于环境上下文(光照、噪声、用户当前状态)进行动态评估。典型场景:具备强大的跨域泛化能力,为不同场景匹配当下最优的交互模态组合。技术内涵:支持用户以最接近人际沟通的方式下达指令。典型场景:融合自然语言、身体姿态进行操作,大幅降低认知负荷与学习成本。技术内涵:依靠多模态数据的交叉验证与上下文逻辑推理来修正偏差。典型场景:精准容忍单一通道的输入误差,自动还原并直达用户的真实意图。多模态交互技术的核心定义与关键特征多模态交互是融合视、听、触等两种及以上感知模态,构建多通道捕获解析+多通道协同呈现双向闭环的技术体系一、物联网交互技术基础自然交互人机适配全域泛在跨端流转高精融合规模生态回归本能的拟人化体验:支持“说、看、指、触”协同,告别生硬的编码指令。人机交互的核心特征与关键构成“技术适配人”的包容性:为老年群体(语音+大字)与视障/残障群体(触觉/肌电)提供模态的自由组合。零挫败感设计:以极低的学习成本和高容错机制,确保任务不因微小偏差而中断。全天候泛在响应:从静止居家、高速通勤到极端工业环境,交互能力始终在线。无缝跨端协同:打破硬件壁垒,在手机、车机、公共屏与穿戴设备间实现上下文状态无缝迁移。沉浸式“在场感”:在VR/AR与数字孪生场景中,深度融合视、听、触、温等多重感官体验。突破融合瓶颈:在特征层与决策层实现异构数据(语音/图像/触觉)的高精度语义对齐。边缘轻量化部署:克服终端算力与功耗限制,依托模型压缩与云边协同实现低延迟、低能耗的实时交互。打破协议孤岛:建立统一的模态描述规范与数据交换标准,推动技术从“样板工程”走向“规模复制”。多模态交互技术的核心需求一、物联网交互技术基础挑战维度核心痛点具体表现与技术瓶颈技术与算法层异构数据融合与理解语音、图像、触觉特征维度差异巨大,跨模态语义对齐精度不足,且在复杂干扰下鲁棒性较弱算力与实时的博弈深度模型的高计算开销与物联网边缘设备极低的功耗、延迟要求之间存在难以调和的矛盾场景与工程层泛化能力与场景成本实验室模型在真实工厂、医院等环境出现“水土不服”,跨场景应用需高昂的定制化调优成本协同标准与硬件瓶颈厂商协议孤岛导致跨设备同步困难,且高精度传感器成本过高,限制了消费级终端的体验上限安全与生态层隐私威胁与责任黑箱全息生理与行为数据的采集面临泄露风险,且AI决策的“不可解释性”导致误操作时的责任界定困难产业碎片化现状缺乏统一的技术架构、数据格式与评估标准,阻碍了行业形成规模效应,导致互操作性差多模态交互技术的核心挑战语音交互二物联网交互技术基础一121课程提纲手势交互三虚拟现实与增强现实交互四机器人交互五本章小结六二、语音交互2.1语音交互技术概述2.2基于音频信号的语音交互2.3基于视觉图像的无声语音交互2.4多模态融合语音交互二、语音交互2.1语音交互技术概述2.2基于音频信号的语音交互2.3基于视觉图像的无声语音交互2.4多模态融合语音交互2.1语音交互技术概述语音交互的基本定义与特征语音交互发展历程语音交互关键技术二、语音交互语音交互的基本定义与特征基本定义:语音交互技术概念:以人类语音为主要信息载体,实现人与计算机系统之间信息输入、处理与反馈的一类人机交互技术核心内涵:“理解”:从连续、变化且易受干扰的语音信号中准确提取有效信息“服务”:结合具体场景,把语音信息映射为可执行的控制指令或服务请求二、语音交互语音交互的基本定义与特征核心特征:自然性与直观性:允许用户以日常自然语言完成信息输入、指令下达与设备控制等操作实时性:能够在极短时间内完成语音采集、信号预处理、语音识别、语义理解等关键流程,并及时给出明确反馈环境适应性与鲁棒性:具备噪声抑制、回声消除以及声源定位与分离等关键能力场景依赖性:与具体应用场景深度绑定,结合场景特点进行针对性设计与优化二、语音交互二、语音交互语音按钮多设备协同终端化与多模态第一阶段第二阶段第三阶段第四阶段引入统计学习支持连续语音与自然指令交互语音处理向终端边缘侧下沉与视觉、触觉等方式融合形成多模态交互体系深度学习与云计算逐渐成熟,与语义理解、设备控制等深度融合支持多轮对话与跨设备联动灵活性与适应性较弱限于语义理解能力,难以实现跨场景的复杂协同以固定指令与规则匹配为主依赖人工预设具备初步的场景感知与智能服务能力从单一输入接口升级为系统感知、理解与决策的重要组成部分智能交互语音交互发展历程语音交互关键技术二、语音交互语音感知与信号获取模块:功能:采集语音信号,并转换为系统可处理的数字信号核心意义:语音感知质量直接决定了语音交互系统的性能上限语音识别与特征建模模块:功能:将连续变化的语音波形转换为离散的文本序列核心意义:为后续语义理解模块提供准确的基础输入。二、语音交互语音交互关键技术语义理解与意图解析模块:功能:判断用户的交互意图,并提取关键参数和上下文信息核心意义:语音交互由感知层向认知层过渡语音识别与特征建模模块:功能:维护交互上下文,协调多轮对话流程,并根据规则或学习策略选择合适的系统响应方式核心意义:维护交互上下文,协调多轮对话流程二、语音交互语音交互关键技术语音生成与交互反馈模块:功能:将系统生成的响应内容转换为自然语音输出,通过扬声器等设备反馈给用户核心意义:增强系统亲和力和可接受性二、语音交互2.1语音交互技术概述2.2基于音频信号的语音交互2.3基于视觉图像的无声语音交互2.4多模态融合语音交互2.2基于音频信号的语音交互音频语音交互基本定义与流程音频语音交互关键技术音频语音交互典型应用场景二、语音交互二、语音交互音频语音交互基本定义与流程定义:采集分析语音信号,理解语言内容并完成反馈处理流程:语音输入阶段:通过麦克风采集用户语音,并完成数字化表示语音转文字阶段:将连续变化的音频信号转换为文本形式文本处理阶段:完成语义分析和交互意图理解文字转语音阶段:依据文字生成语音响应音频输出阶段:将结果反馈给用户,形成完整的交互闭环二、语音交互音频语音交互关键技术语音信号的采集与数字化表示:语音采集:麦克风采集空气中的声波,采集到的模拟语音信号需要经过模数转换(A/D转换),才能被数字系统识别处理模数转换:采样:对连续模拟信号在时间维度上进行离散化量化:将采样值映射为有限数字量二、语音交互语音信号预处理技术:功能:原始音频往往包含环境噪声、回声以及大量非语音成分,通过语音预处理对信号质量进行优化主要操作:背景噪声抑制:降低环境噪声干扰,提升信噪比回声消除:针对扬声器与麦克风共存的物联网设备,消除播放音频产生的回声语音增强:进一步改善语音质量,使语音特征更加突出语音端点检测:定位有效语音片段,减少无效数据处理音频语音交互关键技术二、语音交互基于音频特征的语音理解技术:音频特征提取:将复杂冗余的原始波形转换为结构化、低冗余且具有判别力的特征形式,使其更适合计算机建模学习提取方法:短时分析法:将语音信号分割为多个短时间窗口,对每个窗口分别进行信号分析,从而获得语音的局部特征音频语音交互关键技术二、语音交互智能家居车载与智能座舱工业与生产环境用户可通过语音方式完成灯光开关、空调调节、家电控制及信息查询等操作,避免频繁的触控和界面切换对语音交互的实时性和易用性要求较高,需要在家庭噪声背景下保持稳定识别能力驾驶员驾驶过程中不宜进行复杂的手动操作,语音交互可用于导航设置、媒体控制等功能,实现免手操作对语音系统在噪声、回声和远场条件下的鲁棒性提出了较高要求用于设备控制、状态查询和作业辅助等环节。操作人员可通过语音方式完成设备启停、参数查询或流程确认需与工业物联网系统深度集成,同时具备较强的抗噪声能力和指令识别准确性音频语音交互典型应用场景二、语音交互2.1语音交互技术概述2.2基于音频信号的语音交互2.3基于视觉图像的无声语音交互2.4多模态融合语音交互2.3基于视觉图像的无声语音交互视觉语音交互基本定义与流程视觉语音交互关键技术视觉语音交互典型应用场景二、语音交互二、语音交互定义:以视觉信息作为主要感知来源,主要通过分析说话者面部,尤其是唇部及相关区域,推断语音内容或交互意图视觉语音交互基本定义与流程基本原理:语音形成依赖于嘴唇、下巴及面部肌肉等发声相关器官的协同运动,即使在完全不发声或仅进行耳语的情况下,唇部形态及其时序变化仍然与语音内容保持一定对应关系二、语音交互处理流程:采集:摄像头拍摄面部图像序列。预处理:去噪、灰度化等,消除环境干扰。定位:通过面部关键点定位唇部区域,提取能反映唇部运动状态的视觉特征理解:语音内容推断模型完成对用户表达内容的识别与理解反馈:生成相应文本输出,或向用户提供直观的语音反馈视觉语音交互基本定义与流程二、语音交互视觉信息采集:采用普通RGB摄像头以25~60帧每秒(fps)的帧率连续采集面部视频序列,分辨率一般不低于256×256像素以保证唇部细节可分辨原始图像序列首先经过人脸检测与定位模块。主流检测器包括RetinaFace以及YOLO-Face系列等,这些模型能在毫秒级时间内输出人脸边界框和初步姿态估计视觉语音交互关键技术二、语音交互唇部区域建模:面部关键点检测:对每帧图像逐帧运行检测算法,精准定位面部关键点坐标,为唇部区域提取奠定基础唇部区域初步定位:从面部关键点中筛选提取唇部关键点,结合唇部形态,计算其最小外接矩形或凸包,快速框定唇部范围、排除周边干扰视觉语音交互关键技术二、语音交互唇部区域建模:唇部区域姿态对齐:应用仿射变换技术,将唇部区域对齐至标准姿态,实现正面朝向与尺度归一化,修正姿态偏差唇部区域预处理与标准化:裁剪对齐后的唇部区域,调整至固定尺寸,同时执行灰度化、直方图均衡化、去噪等预处理提升图像质量视觉语音交互关键技术二、语音交互视觉特征表示:将唇部图像序列转换为视觉特征表示传统手工特征:通过人工设计的算法提取唇部相关特征几何特征:直接计算唇部关键参数获得,包括唇部高度h、宽度w、周长、面积、开口率等静态参数,以及上唇与下唇的相对位移向量等动态参数视觉语音交互关键技术二、语音交互视觉特征表示:将唇部图像序列转换为视觉特征表示传统手工特征:通过人工设计的算法提取唇部相关特征外观特征:对唇部区域通过离散余弦变换等算法进行特征提取,实现唇部外观信息的有效表征。形状参数特征:采用主动形状模型等经典模型,将唇部轮廓参数化为少量面部动画参数主成分系数,实现唇部形状特征的简洁表示视觉语音交互关键技术二、语音交互视觉特征表示:将唇部图像序列转换为视觉特征表示深度学习自动特征:采用端到端架构或前端-后端分离架构进行视觉特征自动提取三维卷积网络:对连续多帧唇部图像进行时空卷积操作,同时捕捉唇部的空间形态特征和时间运动特征视觉语音交互关键技术二、语音交互视觉特征表示:将唇部图像序列转换为视觉特征表示深度学习自动特征:采用端到端架构或前端-后端分离架构进行视觉特征自动提取Transformer系列模型:例如VALLR采用视频Transformer对16帧面部区域图像进行编码,可直接预测音素序列,简化了特征提取与解码流程混合特征提取:
将唇部关键点轨迹作为额外输入特征,与唇部图像像素特征进行融合视觉语音交互关键技术二、语音交互医疗诊疗工业车间智慧办公空间患者身份信息、病情描述及医疗决策等敏感内容
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026下半年广东潮州饶平县卫健系统事业单位招聘206人易考易错模拟试题(共500题)试卷后附参考答案
- 2026下半年安徽合肥肥西县事业单位招聘46人(第二批)易考易错模拟试题(共500题)试卷后附参考答案
- 年度护士长工作计划
- 活动10 自己动手包书皮教学设计小学劳动北师大版一年级-北师大版
- 辽宁省大连市高中数学 第三章 不等式 3.1 不等式的性质教学设计 新人教B版必修5
- 2026下半年四川遂宁蓬溪县事业单位考试招聘工作人员69人易考易错模拟试题(共500题)试卷后附参考答案
- 2026下半年四川省自贡荣县事业单位考试聘用110人易考易错模拟试题(共500题)试卷后附参考答案
- 2026下半年四川广元剑阁县委组织部人社局考试招聘事业单位工作人员易考易错模拟试题(共500题)试卷后附参考答案
- 2026下半年内蒙古事业单位联考易考易错模拟试题(共500题)试卷后附参考答案
- 2026上海崇明工程质量检测限公司招聘5人易考易错模拟试题(共500题)试卷后附参考答案
- (2026秋新版)北师大版六年级数学上册全册教案
- 国家职业技能标准申报表
- 《论语译注》-杨伯峻译注-中华书局
- GB/T 6682-2008分析实验室用水规格和试验方法
- GB/T 19886-2005声学隔声罩和隔声间噪声控制指南
- GB/T 15065-2009电线电缆用黑色聚乙烯塑料
- 农业生物环境工程第 温室设施环境调节与控制1
- 化学品安全技术说明书MSDS(液氨)
- 《建设项目全过程造价咨询规程》2017年1月18日
- 52206马工程组织行为学课件
- 中医药翻译的技巧精讲18张课件
评论
0/150
提交评论