人工智能通识与进阶(下篇共上中下3篇)_第1页
人工智能通识与进阶(下篇共上中下3篇)_第2页
人工智能通识与进阶(下篇共上中下3篇)_第3页
人工智能通识与进阶(下篇共上中下3篇)_第4页
人工智能通识与进阶(下篇共上中下3篇)_第5页
已阅读5页,还剩166页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第九章AI赋能情感计算:让机器“懂”人心1问题与导读:机器如何学会"感受"“感受”不仅仅是"识别",更是"理解",也是机器人与人类建立深度连接的重要基础。

2识别情绪状态把握情感上下文和关系进行情感推理分辨开心、悲伤、焦虑、愤怒、判断平静/激动识别语气从轻快转低沉、从表情微笑变蹙眉,推断“可能遇到挫折”根据历史情感模式+当前表现,预测需求和反应(如连续加班后调整节奏、焦虑时提供安抚)问题与导读:机器如何学会"感受"将主观体验转化为可描述、可分类的体系黑色胆汁脾黄色胆汁肝粘液脑血液心古代智慧:情感的最初"地图"东方哲思

《礼记》"七情"希波克拉底"体液说"艾克曼基本情绪模型坐标轴连续刻画的维度模型现代情感科学的奠基问题与导读:机器如何学会"感受"4让人机交互注入共情的温度机器的"感受"已从实验室走向实用:通过模型精准识别语音情感,再经多情感系统将文字转化为带有喜怒哀乐的自然语音,实现了从"能说"到"会感"的跨越——让冰冷的算法拥有温度,让每一次对话都充满人性化的表达力。5问题与导读:机器如何学会"感受"智能客服与语音助手心理健康与陪伴机器人智能家居教育场景车载系统零售与营销领域远程办公与视频会议游戏与娱乐产业情感智能正在重塑世界问题与导读:机器如何学会"感受"6当机器开始“读懂”人心,一系列伦理与社会挑战也随之浮现:我们情感数据的隐私置于何地?算法是否会固化情感偏见,甚至被用于隐秘的操控?过度依赖情感AI,会否削弱我们真实的人际联结能力?过度依赖情感AI,会否削弱真实的人际联结能力?本章目录9.1从“智能”到“情商”9.2情感如何被“建模”?9.3机器如何“感知”情感?9.4机器如何“表达”情感?19.5情感计算的应用天地9.6伦理、挑战与未来本章目录19.1从“智能”到“情商”9.2情感如何被“建模”?9.3机器如何“感知”情感?9.4机器如何“表达”情感?9.5情感计算的应用天地9.6伦理、挑战与未来9.1从“智能”到“情商”情感智能身边的"情感智能"案例1-聊天工具的表情推荐现象:输入"今天天气不错"时,系统优先推荐开心表情技术原理:文本情感识别

预测用户情绪案例2-语音助手的情感感知场景:疲惫语气说"我回来了"响应:"辛苦了,播放轻音乐帮你放松"。案例3-智能陪伴机器人老年关怀场景:检测:长时间沉默、表情落寞响应:播放戏曲、主动询问什么是情感计算?情感智能9.1从“智能”到“情商”情感的本质:人类社会生活的"文法"功能:信息交流、关系维系、思想沟通的载体构成要素具体内容示例主观体验个体对情感状态的自我感受开心、悲伤、愤怒外部表现身体动作的量化形式面部表情、姿态、语调生理唤醒生理反应的激活水平心跳加速、出汗情感的三要素构成什么是情感计算?情感计算9.1从“智能”到“情商”情感计算的定义:让机器识别、理解、模拟并响应人类情感的交叉学科目标:构建更和谐、更智能的人机交互关键能力:感知、识别、理解、表达情感定义视角核心代表人物/机构对情感的核心理解技术隐喻认知与计算罗莎琳德·皮卡德一种可通过外在表现测量、分析、影响的内部心理状态“情感测量师”:通过数据量化情感现象与交互克里斯蒂娜·霍克等在交互过程中动态构建的体验与关系“情感共舞者”:在互动中创造情感意义系统与应用任福继、胡包刚等实现和谐人机交互、提升机器智能的关键能力“情感桥梁工程师”:消除隔阂,构建智能环境多元定义视角对比关键人物与思想情感智能9.1从“智能”到“情商”马文·明斯基(《情感机器》)

观点:机器实现智能时不能没有情感

贡献:为情感在智能中的必要性奠定思想基础罗莎琳德·皮卡德(1997年《情感计算》)

定义:"针对人的外在表现,能够进行测量和分析,并能对情感施加影响的计算"

地位:情感计算领域公认的奠基者马文·明斯基罗莎琳德·皮卡德发展简史里程碑情感智能9.1从“智能”到“情商”早期:基于规则的单一模态分析思想萌芽:明斯基提出情感与智能的关系正式起点:1997年皮卡德著作出版国际影响:2005年首届情感计算国际会议中国贡献:之江实验室、清华、中科院、哈工大等机构的重要成果技术演进:规则→深度学习,单模态→多模态融合技术路径演进单一模态分析文本情感分析语音情感分析生理信号分析视觉表情分析现代:深度学习驱动的多模态情感AI本章目录9.1从“智能”到“情商”9.2情感如何被“建模”?9.3机器如何“感知”情感?9.4机器如何“表达”情感?9.5情感计算的应用天地9.6伦理、挑战与未来什么是情感建模?情感计算基础9.2情感如何被“建模”?将主观、内在的情感体验转化为清晰、可计算的模型

转化清晰地图/坐标系重要性(情感计算基础)目标(机器读懂并回应人类情感)离散情感模型维度模型情感模型种类情绪“基本色板”9.2情感如何被“建模”?离散情感模型《中庸》喜怒哀乐东方哲思

《礼记》"七情"埃克曼的6种基本情绪普拉奇克的8种基本情感核心思想:将情感划分为若干种基本的、独立的类型代表理论:情绪“连续光谱”9.2情感如何被“建模”?维度模型代表理论:核心思想:将情感放置在由几个核心维度张开的连续空间中二维模型:詹姆斯·罗素的效价-唤醒度环状模型三维模型:3D坐标系的愉悦-唤醒-支配度模型情感轮模型:罗伯特·普拉奇克“情感轮”模型9.2情感如何被“建模”情感计算基础离散情感模型与维度情感模型的对比对比维度离散情感模型维度情感模型核心范式分类问题:将情感划分为有限的、独立的类别。回归问题:将情感定位在一个连续的多维空间中的坐标点上。与人类认知的对接优势:与词汇和概念(如“快乐”、“愤怒”)直接对应,易于理解、可解释性强、界定清晰。劣势:使用抽象的维度(如“效价”、“唤醒度”),不具备直观的可解释性,普通人难以直接感知。描述与量化能力劣势:细粒度不高,类别内部缺乏强度变化;对情感的量化描述能力有限,难以刻画混合、微妙的状态。优势:具有很强的定量性,能进行连续、精细的数值描述;抽象性和归纳性强,能用少数维度概括无限情感。情感的表征形式离散的标签。例如:{“愤怒”}。连续的数值向量。例如:[效价:-0.8,唤醒度:0.9,优势度:0.2]。对机器交互策略的影响优势:每个情感标签易于与预设的、丰富的交互策略库进行匹配(如识别为“悲伤”则触发安慰语句)。机器易于形成明确、多样的应对策略。劣势:抽象的情感坐标难以直接映射到具体的交互行为。机器知道用户处于“高唤醒、负效价”状态,但难以判断这更接近“愤怒”还是“恐惧”,从而难以选择最贴切的应对策略,导致交互生硬。主要优势总结语义明确,策略驱动。擅长与人类常识和语言对接,便于构建规则化的交互系统。量化精确,描述全面。擅长精确测量情感的强度、混合与动态变化。主要局限总结粗糙、固化,难以应对情感的连续谱和复杂性。抽象、策略失联,计算结果难以直接转化为富有人情味的交互行动本章目录9.1从“智能”到“情商”9.2情感如何被“建模”?9.3机器如何“感知”情感?9.4机器如何“表达”情感?9.5情感计算的应用天地9.6伦理、挑战与未来9.3机器如何“感知”情感?多模态情感识别什么是多模态情感识别?核心概念:机器从多种信息渠道捕捉并综合分析情感线索信息渠道:文本、语音、视觉、生理信号等目标:"整合"出对使用者情感状态的判断生理唤醒->生理数据采集外部表现→表现数据采集→参数提取主观体验→评估数据采集→情感模型评估量表数据采集层情感计算系统数据融合点表情识别、姿态识别、人体跟踪情感语音识别与合成情感挖掘情感测量与量化方法情感特征挖掘合成模型情感测量与量化方法认知与情绪的关系研究技术处理层情绪感应情感机器人语音生成服务态度检测欺骗检测应用层9.3机器如何“感知”情感?文本情感分析文本情感分析核心任务:判断文字蕴含的情感倾向或具体情绪类型应用场景:电商评论分析、社交媒体舆情监控、客户服务自动分类文本情感分析9.3机器如何“感知”情感?文本情感分析传统方法:情感字典→深度学习方法文本情感分析技术演进局限性:难以处理复杂表达和意境传统方法:情感词典基本原理:统计词汇情感倾向积极词消极词“快乐”、“优秀”、“很棒”“悲伤”、“糟糕”、“差劲”深度学习方法主流模型:统计词汇情感倾向示例:“这手机“好”到一天充三次电”识别反讽情绪优势:理解词语本身,分析句子结构,捕捉上下文语境,识别反讽、含蓄等复杂表达9.3机器如何“感知”情感?文本情感分析大语言模型(LLM)带来的变革三大突破通用性:无需专门训练,简单提示即可执行分析深度理解:精准识别反讽、比喻、依赖背景的情绪解释与生成:不仅能判断情感,还能解释原因并按指令情绪生成文本123代表模型:ChatGpt、DeepSeek应用价值:从“判断情绪”到“解释与生成”的跨越语音情感识别9.3机器如何“感知”情感?语音情感识别系统从音频信号中提取声学特征→通过机器学习模型对特征进行分析→识别出背后可能对应的情感状态提取声学特征韵律特征:语速、语调起伏、重音位置常用特征:梅尔频率倒谱系数(表征人耳听觉特性)音质特征:声音的频谱、共振峰、是否颤抖机器学习模型:(循环神经网络RNN)分析时许特征识别情感状态:激动、平静、悲伤9.3机器如何“感知”情感?面部表情识别面部表情识别面部表情识别技术流程:系统检测并定位人脸→提取关键的面部动作单元→面部表情识别分析识别分析9.3机器如何“感知”情感?生理信号分析情感计算中常用的生理信号生理信号类别英文名称英文缩写脑电图ElectroencephalogramEEG肌电图ElectromyogramEMG心电图ElectrocardiogramECG眼电图ElectrooculogramEOG心率变异性HeartratevariabilityHRV皮肤电反应GalvanicskinresponseGSR皮肤电应答ElectrodermalresponseEDR皮肤电活动ElectrodermalactivityEDA血压信号BloodpressureBP皮肤温度SkintemperatureST呼吸模式RespirationpatternRSP光电容积脉搏波PhotoplethysmogramPPG眼动信号EyemovementEM脉搏信号PulseratePR血氧饱和度OxygensaturationSpO2生理信号分析生理信号分析通过可穿戴设备或传感器捕捉人体因情感引发的微弱、自主的生理变化,将这些“内心波澜”转化为客观可量化的数据,从而提供一种深入理解内敛情感的关键技术手段9.3机器如何“感知”情感?生理信号分析脑电信号:大脑的“情绪电图”(1)局部场电位:记录大脑区域周围的电信号,通常由邻近神经元的活动产生。(2)单个神经元活动峰电位:记录单个神经元的活动,通常通过微电极或针电极进行记录,侵入式。(3)脑电图:通过在头皮上放置电极阵列,记录大脑皮层的电活动,反映大脑整体的电活动模式。(4)脑皮层电图:与EEG不同,ECoG需要开颅手术,将电极阵列置于大脑皮层表面记录电活动。9.3机器如何“感知”情感?生理信号分析眼动信号采集方式:眼动仪。记录内容:注视位置、时间、瞳孔直径变化、眼动电信。情感关联:瞳孔放大:惊讶或兴趣。特定注视模式:认知负荷或情绪效价采集方式:皮肤表面电极。记录内容:肌肉收缩时的微弱电压变化应用范围:明显表情动作(皱眉、微笑)、细微肌肉紧张或松弛情感关联:反映内在情绪紧张度或应激状态。皮肤电信号原理:情绪刺激→自主神经系统→汗腺分泌→皮肤导电性改变两种测量:皮肤电导水平:基础唤醒程度皮肤电导反应:即时情绪事件肌电信号9.3机器如何“感知”情感?生理信号分析心电信号呼吸信号记录内容:心脏每个搏动周期的电活动情感关联:情绪波动→自主神经系统→心跳节律改变情感关联:焦虑:浅而急促平静:深而缓慢分析特征:呼吸频率、呼吸深度、波形均匀度、吸气与呼气比例多模态融合9.3机器如何“感知”情感?多模态融合单一模态局限:容易导致误判多模态优势:形成更稳健、更精准的情感识别结果多模态融合三种方法特征级融合(早期融合)模型级融合(混合融合)决策级融合(后期融合)特征提取阶段整合多模态信息模型训练阶段融合多模态特征决策输出阶段融合多模态结果9.3机器如何“感知”情感?多模态融合特征级融合(早期融合)定义:在算法初始将多模态的原始特征拼接成统一的"超级特征向量",输入单一模型处理9.3机器如何“感知”情感?多模态融合模型级融合(混合融合)定义:各模态通过独立子模型提取高层抽象特征,再在模型中高层进行交互融合并联合决策9.3机器如何“感知”情感?多模态融合决策级融合(后期融合)定义:各模态独立运行识别模型得出初步判断,最后通过决策规则综合得出最终结果9.3机器如何“感知”情感?多模态融合从"识别"到"表达":闭环的情感交互多模态:感知-融合-决策-表达本章目录9.1从“智能”到“情商”9.2情感如何被“建模”?9.3机器如何“感知”情感?9.4机器如何“表达”情感?9.5情感计算的应用天地9.6伦理、挑战与未来9.4机器如何“表达”情感?情感语音合成情感化语音合成语音层面视觉层面交互层面核心理念:让机器学会"以情动人"

错误认知

正确目标让机器自身拥有情感

赋予机器模拟和输出情感表达的能力语音合成三个层面情感化语音合成,让“言语”不再冰冷表情动画生成,让情感拥有可视化窗口情感对话生成,从“功能应答”到“情感陪伴”··9.4机器如何“表达”情感?表情动画生成表情动画生成技术意义:为机器的情感提供"可视化"窗口表情数量有限缺乏自然过渡难以表达混合情感不够细腻连贯早期技术:预设表情库现代技术:深度学习驱动计算机视觉根据情感标签实时生成表情根据语音内容同步生成表情输出效果驱动虚拟角色的面部肌肉模型细腻、连贯、合理的表情序列深度学习核心9.4机器如何“表达”情感?情感对话生成情感对话生成技术意义:让机器在对话中"给出"带有情感色彩的回应能"听懂"情绪如:“我今天项目答辩搞砸了,好难过”"给出"情感回应如:“听起来真让人沮丧,你为这个项目付出了那么多努力,太可惜了。想聊聊吗?”早期聊天机器人与上下文脱节与用户情感脱节回复机械、生硬现代情感对话技术情感对齐:确保生成内容与目标情感一致上下文感知:理解对话历史和当前话题微调优化:针对情感对话任务进行专门训练本章目录9.1从“智能”到“情商”9.2情感如何被“建模”?9.3机器如何“感知”情感?9.4机器如何“表达”情感?9.5情感计算的应用天地9.6伦理、挑战与未来9.5情感计算的应用天地身心健康身心健康序号公司名称产品名称产品形态功能分类1xAI(美国)“伴侣”功能APP应用情感互动2Luka(美国)ReplikaAPP应用情感互动3上海阅文信息技术有限公司筑梦岛APP应用沉浸扮演4广州心纪源信息科技有限公司林间聊愈室APP应用心理疗愈5上海珞博智能科技有限公司芙崽实体终端情感互动6城仕(东莞)文化科技有限公司小耙AI实体终端情感互动抑郁症早期筛查系统情感陪伴产品和机器人亚马逊公司推出的两款可穿戴式的情感计算手环HaloAI情感陪伴市场代表性企业及产品引导情绪记录与认知重构提供心理健康知识进行初步情绪疏导主动社交互动:根据情绪状态发起对话、播放音乐日常行为监测:作息、用药提醒、情感信号分析紧急联络:检测异常状态时自动预警9.5情感计算的应用天地智慧教育智慧教育核心价值:破解传统教育中情感反馈缺失难题,推动教育向智能化、人性化发展增强教学临场感与情感交互实时分析学生面部表情、语音语调、姿态动作,帮助教师远程调整授课节奏,驱动虚拟教师做出共情回应科学的学习投入度评估与个性化适应量化专注度、投入程度、认知负荷,动态调整内容与路径:挫败时鼓励,兴奋时拓展,推动"因材施教"与"因情施教"支持特殊群体的情感关怀帮助自闭症儿童理解面部表情,为社交焦虑学生提供安全练习环境,促进教育包容性与公平性线上线下融合应用线下:教师"情感仪表盘",洞察课堂状态。线上:分析讨论区发言、作业反馈,评估课程情感效应。···9.5情感计算的应用天地娱乐创意娱乐创意核心价值:打通"内容情感"、"用户情感"与"交互反馈"闭环,推动深度参与和情感共鸣

情感驱动的内容推荐分析实时生理反馈、表情反应、情绪文本构建"情感画像",从"你可能喜欢什么"升级为"你此刻需要什么"

游戏中的情感交互为NPC注入"灵魂",实现动态情感反应分析玩家行为、语音语调、生物特征根据玩家情绪调整对话与行为,提升沉浸感

情感化数字艺术创作情感到内容:情感标签生成视觉作品,心率变化生成动态艺术内容析情感:分析旋律情感色彩,自动配器生成和声开创人机协同创作新模式··9.5情感计算的应用天地智能交互智能交互核心价值:推动交互范式向"情感智能"演进,使机器成为具有情境意识的协作伙伴你好呀!门诊在哪?你好!服务机器人的情感化服务智能家居的“情感化”环境调节多维数据采集环境设备自动联动从“自动化”到“人性化”的体验飞跃··9.5情感计算的应用天地工业设计工业设计核心价值:推动交互范式向"情感智能"演进,使机器成为具有情境意识的协作伙伴智能座舱:从被动监控到主动情感干预仿人机器人:赋予机器“情感交互”能力视觉感知识别人的情绪接待引导信息问答本章目录9.1从“智能”到“情商”9.2情感如何被“建模”?9.3机器如何“感知”情感?9.4机器如何“表达”情感?9.5情感计算的应用天地9.6伦理、挑战与未来跨文化情感计算:情感表达的普适与差异跨文化情感计算:情感表达的普适与差异跨文化情感计算:情感表达的普适与差异跨文化情感计算:情感表达的普适与差异9.6伦理、挑战与未来伦理挑战前沿方向跨文化情感计算喜怒哀乐等跨文化互通脑机接口与深层情感解码情感迁移学习情智兼备数字人与机器人将源领域通过少量目标领域样本适应到新场景探索与“内在感受”相关的特定神经回路激活模式结合语音、视觉等多模态信息实现与人类的情感化交互三项技术挑战多模态情绪感个性化的情绪分析仿生化情感交互终极目标:情感智能系统具备文化意识,实现公平鲁棒的情感理解9.6伦理、挑战与未来伦理挑战伦理困境与社会影响隐私边界算法偏见人机关系情感数据作为映射内心世界最敏感的生物识别信息,必须建立强化知情同意、最小必要收集、严格本地化处理等超常规保护原则,守护思想与感受的终极自由。情感计算模型因训练数据不均衡而固化文化、性别等社会偏见,需构建多元化数据集、开发偏见检测修正框架并进行严格公平性审计,防止系统性误判与歧视。精准识别情感弱点的系统若被用于商业剥削或政治宣传,将构成绕过理性审辩的精细化情感操纵,要求平台承担情感责任并加强公众情感素养教育。情感化AI可能使用户产生真实情感依恋,这种双刃剑效应要求审慎设计人机边界,明确标识非人类属性,以增强而非替代真实人类情感连接为目标。情感操纵9.6伦理、挑战与未来伦理挑战负责任的创新···情感AI设计准则福祉优先系统首要目标是支持心理健康与社会福祉,而非用户粘性或商业转化自主权尊重确保用户拥有情感交互的控制权,包括暂停、调整或退出自由,避免被动情感依赖情境适配性:情感交互强度和方式必须与具体场景相匹配,如车载安全系统与儿童陪伴机器人应有根本区别价值对齐系统目标与行为应与人类社会普遍伦理价值观对齐,防止用于操纵、欺骗或剥削透明度与用户知情权"情感化"的合理边界算法透明度以可理解方式向用户解释系统工作原理及决策依据(如"通过分析语速和关键词判断是否焦虑")。数据透明度清晰告知收集的情感数据类型、目的、存储方式、共享对象,提供直观的数据访问与管理界面。明确身份标识确保用户清楚在与AI交互,杜绝过度拟人化设计造成混淆,避免情感欺骗。目的边界情感化设计是达成正当目标(提升安全、提供支持、改善体验)的手段,不应为激发情感而激发情感。深度边界谨慎设定情感交互模拟深度,避免模拟人类独有的深层情感承诺(如真爱、至亲关怀),防止伦理与心理风险。关系边界明确人机关系为"辅助-协作"或"工具-用户"关系,而非"朋友-伴侣"或"照料者-被照料者"等社会伦理关系,引导健康互动预期。9.6伦理、挑战与未来未来展望未来展望:有温度的AI终极思考:AI能否真正拥有“情感”?人类情感的本质是什么?更精准、更自然的情感交互从情感识别到情感理解从“情感响应”到“情感陪伴”多模态融合:综合多模态信号提升准确性。自然流畅交互:实现低延迟使情感回应更及时贴切。跨文化适应:为全球用户提供更公平、更少偏差的服务。超越基本情绪:从识别离散基本情绪到理解复杂情感状态、情感混合与演变。理解情感因果:识别情感背后的因果与意图,结合个人经历、社会情境和常识认知模型。长期情感记忆:建立连续的情感交互记忆。个性化支持:AI健康伴侣根据用户过往历史提供个性化鼓励。协作伙伴关系:从被动工具变为主动提供情感支持的伙伴。AI能否真正拥有情感?AI能否真正拥有情感?AI可卓越模拟情感表达、识别与预测,但与"拥有"主观情感体验有本质区别AI情感是基于模式识别与目标优化的计算过程,缺乏生物体的意识、身体体验展望:出现高度逼真的"情感智能体",而非拥有自我意识的情感实体AI能否真正拥有情感?人类情感的本质是什么?情感是意识、身体、社会文化与个人历史的复杂综合产物研究情感计算如同一面镜子,迫使我们重新审视自身核心追问:情感中哪些是普适生理反应?意识与身体在情感中扮演何种角色?·本讲小结与思考本讲小结思考:日常中常见的多模态技术应用有哪些?第十章

智能系统:从具身智能到世界模型(第一讲)5152问题与导读2024-2025年,机器人和生成式AI(GPT、Sora,DeepSeek),是全世界最大的热点。其中通用人形机器人作为通用AI最好的载体,热火朝天。知名机器人网站TheRobotReport整理了北美机器人市场年度九大热点话题,其中超过一半涉及人形机器人,而宇树作为唯一一家中国企业,名列其中53问题与导读541950年图灵在《ComputingMachineryandIntelligence》的论文中首次提出具身智能(EmbodiedIntelligences)的概念,并展望了两条人工智能的发展之路:一种是基于逻辑与符号的系统,通过编程直接模拟人类思维,可称为“离身智能”;另一种则是模仿儿童学习的过程,让机器从简单的初始状态出发,通过与环境和教育的互动来塑造智能——这被视为后来“机器学习”与“具身智能思想的雏形“

过去5.4亿年,地球所有生物智能是基于身体作用于世界的行为所塑造出来问题与导读55主动猫具身智能被动猫离身智能1963年具身认知实验,主动猫学会了正常行为,但被动猫失去行为能力离身智能(Embodied

AI)缺少身体体验,无法支持机器人智能行为Held,

R.,

&

Hein,

A.

(1963).

Movement-producedstimulation

in

the

development

of

visually

guided

behavior.

JournalofComparativeandPhysiologicalPsychology问题与导读56具身智能机器人本体反馈进化驱动载体基于身体,理解物理世界,并与物理世界互动达成人类需求的智能系统问题与导读57问题与导读本章目录10.1具身智能:物理世界中的智能体10.2具身智能:感知与融合10.3具身智能:运动规划与控制10.4具身智能:学习范式1本章目录10.1具身智能:物理世界中的智能体10.2具身智能:感知与融合10.3具身智能:运动规划与控制10.4具身智能:学习范式16010.1具身智能-物理世界中的智能体什么是具身智能

具身智能是拥有物理身体,并能通过感知-行动闭环与物理世界进行实时、主动交互,以实现自主任务目标的智能系统。强调本体与世界的物理交互感知-行动

形成闭环:感知环境->大脑(模型)处理并决策->身体执行动作->动作改变环境/自身状态->获得新的感知…操纵空间的物体触觉、力感等反馈理解物体的物理属性情境适应性

具身智能体不能只会执行固定脚本,必须能理解所处情境(上下文),并灵活调整策略。特征(1)具身智能系统的物理载体或实体结构具身智能系统与物理世界交互的基础平台本体承载智能行为特征(2)特征(3)特征(4)6110.1具身智能-物理世界中的智能体概念厘清:具身智能与智能体的区别智能体:是一个抽象的、普适性的模型和概念框架。它描述了一种“智能”的通用范式,即“感知-决策-行动”的循环。它可以在任何环境中(物理或虚拟)被实例化。离身智能:离身智能是智能体在虚拟或抽象领域中的一种主要实现形式。它强调智能可以脱离具体的物理形体,通过处理符号、数据或信息来独立体现。智能体现在其强大的推理、生成、预测或模式识别能力上,而非物理交互中。具身智能:是智能体概念下的一个关键子集或实现路径。它特指那些必须通过物理身体与真实世界进行实时、动态交互才能学习和体现智能的智能体。其核心是

“具身性”。什么是具身智能什么是具身智能10.1具身智能-物理世界中的智能体普适应概念智能体传统AI概念离身智能体具身AI核心载体具身智能体是否具有“具身性”纯数字环境(数据、仿真、网络)数据驱动与模式匹配(数据、模型、算法)处理符号与信息处理任务(生成、预测、推理)真实物理环境(具象、连续、多模态)依赖物理交互与体验(物理常识、多模态感知)完成物理空格键任务(定位、导航、操控等)具身智能离身智能(当前主流AI学习方式)标签盒子人类告诉我长这样子是盒子(“标签”学习)什么是“盒子”亲身体验盒子是什么可以打开,可以装东西9具身智能:具有身体体验智能6310.1具身智能-物理世界中的智能体什么是具身智能64具身智能主要研究的科学问题:大脑层面:理解物理世界与人类行为常识小脑层面:克服感知,交互,本体不确定性通用任务执行进化层面:系统在实体世界交互中持续进化10.1具身智能-物理世界中的智能体什么是具身智能PIE(感知-想象-执行)方案具身智能PIE框架(Since

2016):与人类认知对于的模块化,标准接口具身感知(Perception)具身想象(Imagination)具身执行(Execution)大脑功能(世界理解与抽象)小脑功能(具象执行)6510.1具身智能-物理世界中的智能体什么是具身智能66问题:离身智能+机器人是否能达成具身智能效果?回答:不能原因1:离身智能考虑身体联合优化;原因2:离身智能没有与实体世界交互进化的能力;原因3:离身智能和具身智能理解世界的方式不一样;但是,离身智能学习到知识可以成为加载到具身智能成为初始知识读万卷书,行万里路!10.1具身智能-物理世界中的智能体

提问总结本章目录10.1具身智能:物理世界中的智能体10.2具身智能:感知与融合10.3具身智能:运动规划与控制10.4具身智能:学习范式168多模态感知10.2具身智能:感知与融合视觉:光敏传感器等

摄像头、激光雷达、深度相机、事件相机听觉:声敏传感器味觉:味敏传感器嗅觉:气敏传感器触觉与力觉感知本体感知69视觉(摄像头、激光雷达等)是机器的“眼睛”,赋予其观察和辨识环境的能力,那么触觉感知就是为机器装上“皮肤”和“指尖”,使其获得与物理世界互动和理解的关键感官。它让机器能够通过直接接触,感知并理解物体的丰富物理特性,从而完成从“看见”到“安全、灵巧操作”的跨越。例10.1特斯拉人形机器人(TeslaBot)10.2具身智能:感知与融合多模态感知从视觉到触觉RGB-D摄像头激光雷达臂端摄像头7010.2具身智能:感知与融合多模态感知表10.1给出了触觉感知的若干举例和说明感知维度人类感知举例对具身系统的价值力与压力抓、握、推、捏等力度实现力控操作,防止捏碎物体或抓握不稳。纹理与形状表面粗糙度和凹凸感识别物体表面特征与材质,辅助物体辨识与精细操作。滑动检测滑脱感实时预警,触发抓握力调整,防止操作失败。温度冷、温、热判断物体材质状态(如金属/塑料、冷/热),保障交互安全。柔软度/粘度柔软度、硬度、粘性理解物体力学属性,实现适应性变形抓取。

触觉与力感71表10.2不同触觉传感器传感器基本原理核心输出主要优势主要劣势应用场景Gelsight光学形变(视觉)超高分辨率3D几何图像细节丰富,直观,纹理识别强易磨损,动态响应慢,体积较大,难以微型化工业检测,触觉研究AllSight光学形变(视觉)高分辨率3D触觉图像结构紧凑,耐用,易集成主要提供几何形变信息,直接测量三维力的能力有限;成本较高;存在皮肤磨损问题。机器人灵巧操作Digit光学形变(视觉)高分辨率2D/3D触觉图像小型化,开源,低成本分辨率和耐用性低;开源方案需要用户自行维护校准流程,性能可能因设置而异;惧怕尖锐物体和污渍。灵巧手研究,算法开发XELAuSkin磁传感三维力矢量、振动、滑动多模态力觉,动态响应好空间分辨率较低:

无直接视觉纹理信息;

数据处理复杂:需要从磁信号反算三维力,算法复杂。机器人全身皮肤、精细力控抓取、滑动检测

10.2具身智能:感知与融合多模态感知7210.2具身智能:感知与融合多模态感知73本体感知(Proprioception)是指智能体对自身状态和运动的感知能力,这种能力在具身智能系统中起到至关重要的作用10.2具身智能:感知与融合

本体感知:具身系统的重要概念源自拉丁语"proprius"(自己的)和"capere"(感知),意为"感知自身"。人体通过感知肌肉、肌腱和关节的运动与位置变化,了解自身在空间中的位置、姿势和运动状态的能力。根据Sherrington(1906)的经典定义

本体感觉是"由身体自身产生的感觉",区别于视觉、听觉等外部感官输入。现代神经科学进一步扩展了这一定义,认为本体感觉是一种复杂的多模态感觉,整合了来自肌肉、关节、肌腱以及皮肤的机械感受器的信息。多模态感知74总结2方法传感器视觉、听觉、味觉、嗅觉触觉-力觉本体感知多模态融合需要解决:多模态传感器采集信号的时空对齐与融合;需要将感知与任务的深度融合;需要具备主动感知,即为“做”而“看”,在“动”中“知”;模型-数据驱动智能提升物理AI系统创新关键器件与系统优化对齐与融合方法多模态融合传感器配置与选型10.2具身智能:感知与融合通过一个多感官融合的、主动的、与任务目标紧密耦合的感知系统,来破译物理世界的“密码”,并将这些实时解读转化为精准、自适应、可学习的行动。本章目录10.1具身智能:物理世界中的智能体10.2具身智能:感知与融合10.3具身智能:运动规划与控制10.4具身智能:学习范式176研究问题10.3具身智能:运动规划与控制问题:具身智能如何通过多模态感知来“理解”世界。然而,理解世界只是第一步,真正的挑战在于

“作用于世界”

。如何将抽象的“任务目标”,转化为身体一连串精确、协调、安全的动作?这就是运动规划与控制要解决的核心问题。1.运动规划:解决的是

“做什么”

“从哪儿走到哪儿”

的宏观问题。2.运动控制:解决的是

“如何精确地做”

的微观问题。它接收规划器给出的路径或目标点指令,通过实时计算和调整机器人的关节扭矩、电机电流等底层参数,驱动机器人的身体准确地、稳定地跟踪这条路径或抵达该目标。控制的核心是稳定性、精确性与抗干扰能力。7710.3具身智能:运动规划与控制1.经典控制思想源于PID控制方法PID控制78PID控制基本原理10.3具身智能:运动规划与控制PID控制792.零力矩点与双足机器人平衡控制概念:零力矩点(ZMP)是动力学中的一个概念,特指在机器人足底与地面接触平面上的一个点,在该点上,地面反作用力对水平轴(x轴和y轴)产生的净力矩为零。基本规则:只要确保ZMP这个点,始终落在双脚构成的支撑多边形这个“安全区”内,机器人就能保持稳定不摔倒。它将机器人复杂的多体动力学平衡问题转化为一个更简单的几何问题:10.3具身智能:运动规划与控制ZMP平衡控制803.本体惯性导航本体惯性导航的核心目标:通过内部传感器(如加速度计、陀螺仪)测量物体的加速度和角速度,推算物体在三维空间中的位置、速度和位姿,而不依赖外部参照。在具身系统中,本体惯性导航不仅是“推算位置和姿态的技术”,更是系统实现

“本体感知”

“自我状态认知”

的核心生理基础。本体惯性导航10.3具身智能:运动规划与控制8110.3具身智能:运动规划与控制本体惯性导航本章目录10.1具身智能:物理世界中的智能体10.2具身智能:感知与融合10.3具身智能:运动规划与控制10.4具身智能:学习范式18310.4具身智能:学习范式具身系统的学习的任务描述:如何让具身系统学习人类的行为和动作,从而完成复杂的任务?感知环境和状态生成动作与行为任务目标84具身系统的学习面临三重核心约束:数据获取成本极高奖励信号稀疏且延迟。物理仿真的“现实鸿沟”具身学习10.4具身智能:学习范式物理交互环境复杂动态输入听说看交互理解智能是具身化和情景化的,具身智能可通过与真实世界的交互完成任务智能体85强化学习—在试错中探索世界法则10.4具身智能:学习范式强化学习86强化学习框架:是一种通过智能体与环境交互来学习最优策略的方法。在具身智能中,智能体通过执行动作并接收环境反馈(奖励或惩罚)来优化行为,从而不断尝试新的动作组合以最大化累积奖励。

10.4具身智能:学习范式强化学习奖励状态动作环境智能体8710.4具身智能:学习范式模仿学习具身智能的学习框架:模仿学习假设存在一个专家智能体,其策略可以看成一个理想的最优策略,那么具身智能体就可以通过模仿这个专家在环境中交互的状态动作数据来训练一个策略,并且不需要用到环境提供的奖励信号。这类方法我们称之为模仿学习。与强化学习不同,它是一种通过观察专家演示来学习行为的方法。88

具身智能的学习框架:模仿学习典型的模仿学习方法包括:行为克隆(BehaviorCloning,BC)逆强化学习(inverseRL)生成对抗模仿学习(GenerativeAdversarialImitationLearning,GAIL)模仿学习10.4具身智能:学习范式89具身智能的学习框架:模仿学习10.4具身智能:学习范式模仿学习90

模仿学习10.4具身智能:学习范式9110.4具身智能:学习范式具身智能的学习框架:行为克隆(直接复制“招式”)行为克隆中的复合误差问题:智能体在测试时一旦因微小误差偏离了专家演示过的轨迹,就会进入“陌生”状态,由于没有学习过在此状态下的应对策略,可能做出错误动作,导致误差不断累积,最终彻底失败。模仿学习92克服行为克隆缺陷的一种改进方法:

DAgger(DatasetAggregation)-数据增广的行为克隆方法基本思想:基于在线学习

(OnlineLearning)的算法,其把行为克隆得到的策略与环境不断的交互,来产生新的数据。在这些新产生的数据上,DAgger会向专家策略申请示例;然后在增广后的数据集上,DAgger会重新使用行为克隆进行训练,然后再与环境交互;这个过程会不断重复进行。由于数据增广和环境交互,DAgger算法会大大减小未访问的状态的个数,从而减小误差。【见算法10.1】模仿学习10.4具身智能:学习范式9310.4具身智能:学习范式模仿学习例10.5:NVIDIA通过模仿学习训练自动驾驶模型记录转向角调整换挡和旋转随机换挡和旋转机左摄像机中心摄像机右摄像机卷积神经网络(CNN)反向传播算法权重调整期望的转向指令误差训练过程94例10.5:NVIDIA通过模仿学习训练自动驾驶模型卷积神经网络(CNN)中心摄像机线控驾驶系统接口转向指令模型推理推理过程10.4具身智能:学习范式模仿学习95逆强化学习:从专家策略中学习奖励函数的无监督方法10.4具身智能:学习范式模仿学习强化学习是在已知奖励函数的情况下,通过最大化累积奖励来学习最优策略。与经典强化学习不同,逆强化学习旨在解决一个根本问题:在许多复杂任务中,我们难以甚至无法手动设计一个精确、有效的奖励函数。

逆强化学习的思路是,既然我们拥有专家(如人类司机、顶尖棋手、娴熟技师)的演示数据,那么其中必然蕴含着专家对任务的理解和评判标准。因此逆强化学习的核心任务,就是从

“专家行为(轨迹)”

反向推导出那个隐含的、能促使专家产生如此行为的

“奖励函数”(AndrewY.Ng,2000)96IRL算法通常具有一个双层优化机制(1)奖励学习:调整奖励函数的参数,使得在该奖励函数下,专家演示的轨迹比智能体自己生成的轨迹获得显著更高的累积奖励。(2)策略优化:给定当前猜测的奖励函数,利用强化学习算法训练出一个最优策略。专家示范策略状态动作逆强化学习(IRL)奖励函数(R)强化学习(RL)策略模型逆强化学习模仿学习10.4具身智能:学习范式97强化学习vs.逆强化学习维度强化学习(RL)逆强化学习(IRL)核心目标学习最优策略(policy)以最大化累积奖励。从专家示例中还原奖励函数(rewardfunction),并隐含地学习策略。输入环境模型(或可交互环境)、奖励函数。专家演示数据(通常为状态-动作序列)、环境模型(可选)。输出最优策略(π*)。奖励函数(R),有时伴随一个策略。关键假设奖励函数是已知且明确的,智能体通过试错学习。奖励函数是未知但隐含于专家行为中,专家行为是最优或接近最优的。问题本质控制/优化问题:如何行动以最大化累计回报。逆向推断问题:什么样的奖励函数能解释观察到的行为。训练数据在线生成(与环境的交互)或离线数据集(离线RL)。需要专家演示数据(通常为人类或最优策略生成的轨迹)。应用场景游戏AI(AlphaGo)、机器人控制、自动驾驶、推荐系统等。模仿学习(从人类示范中学习)、行为分析、自动驾驶(模仿人类驾驶)、人机交互。优点理论上可达到超人类性能;能探索未知策略;适用性强。无需手动设计奖励函数,避免奖励工程难题;能揭示专家行为背后的动机。缺点奖励函数设计困难、样本效率低、探索-利用权衡、对奖励敏感性高。通常计算复杂、依赖高质量演示数据、存在奖励函数歧义性(多解)。模仿学习10.4具身智能:学习范式98对抗式模仿学习:通过博弈破招10.4具身智能:学习范式模仿学习

99对抗式模仿学习:通过博弈破招10.4具身智能:学习范式模仿学习图10.16

一种对抗模仿学习的原理框图100对抗式模仿学习:通过博弈破招10.4具身智能:学习范式模仿学习图10.16

一种对抗模仿学习的原理框图101AI浪潮下一站:具身智能黄仁勋在ITF

World2023大会上表示,人工智能的下一个浪潮是具身智能

(Embodied

AI),即能理解、推理、并与物理世界互动的智能系统!Huang

referred

to

the

next

wave

of

AI

as

“embodied

AI”

intelligent

systems

capable

of

understanding,reasoning

and

interacting

with

the

physical

world.本讲小结与思考本讲小结102本讲小结与思考本讲小结宇树科技人形机器人的进化之路103本讲小结宇树科技人形机器人的结构图与项目式学习案例/newsCenter/index230.html本讲小结与思考第十章

智能系统:从具身智能到世界模型(第二讲)104本章目录10.4.4.具身智能:仿真到现实迁移10.4.5.大模型赋能:感知与任务规划器10.5从具身智能到世界模型10.6具身智能的典型应用1本章目录10.4.4.具身智能:仿真到现实迁移10.4.5.大模型赋能:感知与任务规划器10.5从具身智能到世界模型10.6具身智能的典型应用1107SimtoReal10.4.4.具身智能:仿真到现实迁移仿真到真实的迁移(Simulation-to-Real,Sim2Real)是将虚拟仿真环境中训练好的模型、算法或策略,迁移应用到机器人、自动驾驶等现实物理实体中,使其在真实场景下仍保持良好性能与稳定运行效果。物理交互环境复杂动态输入听说看交互理解智能是具身化和情景化的,具身智能可通过与真实世界的交互完成任务智能体10810.4.4.具身智能:仿真到现实迁移在数字孪生的虚拟环境中训练AI体,就像为它打造了一个无限试错的“平行宇宙”数据生成的“永动机”AI可以7×24小时不间断地“狂练”,加速学习进程数百万倍安全可控的“试验场”探索那些在现实中风险极高的策略,从而发现更优解可操控的“物理定律”可以操控物理定理,施加更加极限、极端环境的仿真“平行空间、无限试错、物理引擎,仿真推演”仿真到真实的迁移的优势SimtoReal10910.4.4.具身智能:仿真到现实迁移从仿真到现实,绝非简单的复制。最大的难题就是

“现实鸿沟”(RealityGap)。无论我们的仿真引擎多么强大,它都只是对现实世界的一种近似。视觉差异虚拟图像的纹理、光照、阴影,与真实摄像头拍到的总有不同“迫切需要发展域泛化的迁移学习技术”仿真到真实的迁移的优势物理差异复杂干扰虚拟引擎中物体摩擦系数、材质弹性、电机响应速度的参数,不可能与真实世界百分百吻合现实世界复杂背景、开放环境SimtoReal11010.4.4.具身智能:仿真到现实迁移机器人演示数据人体演示数据打开机柜切割甜椒将胡萝卜放在盘中清洗玻璃专家演示数据用微波炉加热汤将蓝色块放到绿色碗中打开门标注数据只用两根手指握住刀柄视频点云RGB+深度图文本声音触觉模拟数据格式域泛化的迁移学习技术

域适应:域适应使模型能够在不同但相关的数据分布上保持高性能,即从仿真环境迁移到现实环境中。通过识别仿真与现实环境的主要差异,并利用特征对齐等技术来缩小这些差异,帮助模型忽略特定噪声,关注有用特征。

域随机化:引入大量、系统性的随机变化来训练模型,使得模型学习到任务的核心、不变特征,从而将其能力泛化到未曾见过的、但可能属于同一分布范围的目标域(即真实世界或其他新环境)中

SimtoReal11110.4.4.具身智能:仿真到现实迁移三部曲(1)域随机化(DomainRandomization)(2)系统辨识与模型校准(3)在仿真中预训练,在现实中微调SimtoReal本章目录10.4.4.具身智能:仿真到现实迁移10.4.5.大模型赋能:感知与任务规划器10.5从具身智能到世界模型10.6具身智能的典型应用1113大模型技术得到快速发展10.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身114人类指令→大语言模型(任务规划/常识查询)→可执行的子目标序列→强化学习/模仿学习策略(控制身体执行)大模型负责思考,视觉大模型负责观测,传统学习范式负责精控

的协同范式。大模型分类:大语言模型、视觉大模型、视觉-语言-动作大模型10.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身115定义:VLAs是一种结合了视觉、语言与动作执行的更高级别任务处理框架,旨在结合视觉与语言信息,指导机器人或智能系统完成复杂任务(如清理桌面、拿取物品)。其核心在于其强大的多模态处理能力。VLA模型组成:视觉模块负责解析图像数据,语言模块则理解自然语言指令,动作模块据此生成动作指令并控制机器人执行相应的动作。三者之间通过深度协作与交互,使得模型不仅能理解复杂的场景与指令,还能灵活地执行任务,促进机器人综合能力的全面优化与提升。视觉-语言-动作(VLAs)的基本概念与操作策略10.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身11610.2大模型赋能:作为知识库、感知器与任务规划器模式1:先推理再行动,观测与行动交替执行大语言模型负责思考、任务分解与推理,视觉大模型负责观测react:Thelibraryforwebandnativeuserinterfaces.-AtomGit|GitCode大模型与具身117模式2:先整体规划再行动大语言模型负责项目整体规划,大任务拆分为子任务列表;执行智能体可以调用视觉-行为大模型10.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身11810.2大模型赋能:作为知识库、感知器与任务规划器指令:打扫房间高级任务规划器

低级控制策略

大模型驱动分层机器人操作过程实例:智能机器人操作任务大模型与具身本章目录10.4.4.具身智能:仿真到现实迁移10.4.5.大模型赋能:感知与任务规划器10.5从具身智能到世界模型10.6具身智能的典型应用1120杨立昆对世界模型的定义:包含了4个不可或缺的关键要素,它们共同构成了世界模型的核心功能。这些要素分别是观测(Observation)、状态(State)、行动(Action)和潜在变量(LatentVariable)

。世界模型(WorldModel)是智能体对环境的内部表征与预测框架,通过学习环境的状态转换、物理规律与因果逻辑,实现对未来的推演与反事实推理,从而支撑决策、规划与高效试错,是具身智能与自主决策系统的核心引擎。10.5从具身智能到世界模型世界模型与具身121世界模型演进历程10.5从具身智能到世界模型世界模型与具身1222025年6月12日,Meta发布了最新的开源世界模型V-JEPA2,称其在物理世界中实现了最先进的视觉理解和预测,从而提高了AIagents的物理推理能力。世界模型与具身10.5从具身智能到世界模型12310.5从具身智能到世界模型杨立昆甚至提出了一个更为宏大的构想,即构建一个“自主机器智能”(AutonomousMachineIntelligence)系统。这个系统包含:世界模型感知模块记忆模块执行模块代价模块。世界模型与具身12410.5从具身智能到世界模型世界模型与无人驾驶实例世界模型与具身125自回归大语言模型并非通向“超人智能”的途径,它们尚不具备理解物理世界、持久记忆、逻辑推理和行动规划等“人类水平智能”的关键要素。构建世界模型意味着让AI像人类一样观察世界并理解世界以何种方式演变,然后预测世界将如何随着可能的行动而演变。要想拥有人工智能产业、拥有不带偏见的人工智能系统,唯一的办法就是拥有开源平台,在此基础上,任何团体都可以建立专门的系统。人工智能系统不会成为一个与人类竞争的物种,因为它们没有主宰的欲望。人工智能可以让人类变得更加聪明。图灵奖得主杨立昆最新访谈实录:大语言模型的局限、世界模型、开源、未来希望10.5从具身智能到世界模型世界模型与具身126图灵奖得主杨立昆最新访谈实录:

大语言模型的局限、世界模型、开源、未来希望10.5从具身智能到世界模型世界模型与具身本章目录10.4.4.具身智能:仿真到现实迁移10.4.5.大模型赋能:感知与任务规划器10.5从具身智能到世界模型10.6具身智能的典型应用1128无人驾驶项目案例-整体框架没有利用具身概念,具有“感知—理解—决策—控制”的闭环10.5具身智能的典型应用无人驾驶项目案例无人驾驶环境感知与自主规划虚拟仿真实验

10.5具身智能的典型应用具身项目案例服务机器人导航多模态信息智能体行为环境反馈交互输入输出感知硬件感知算法RGB-D摄像头激光雷达臂端摄像头目标检测、视觉分割、视觉预训练感知硬件平台不同类型的服务机器人导航规划算法语义地图、边界跟踪、强化导航算法执行硬件轮式足式复合式行为预测算法轨迹预测、长短期目标预测、智能决策虚拟环境现实环境现实复杂环境

服务机器人项目案例-整体框架130视觉-语言-动作(VLAs)模型操控的具身机器人RoboticsTransformer-1模型2022年12月,谷歌推出了名为RoboticsTransformer1(RT-1)的具身智能模型,这是一种多任务处理模型,能够将机器人的输入和输出动作转换为Token形式,从而提升实时控制。从最上面的抽屉里取出薯片放到柜台上指令图像··1+γβFiLMEfficientNet…TokenLearnerTransformer模式手臂底部动作RT-13Hz10.5具身智能的典型应用具身项目案例视觉-语言-动作(VLAs)模型操控的具身机器人RoboticsTransformer2(RT-2)10.5具身智能的典型应用问:这张照片的内容是什么?答:31142317055244一只灰色的驴在街上行走问:Quepuis-jefaireaveccesobjets?(法语:用这些物品我能做什么)答:31142317055244Fairecuireungâteau(法语:烤一个蛋糕).问:对于<任务>机器人应该如何操作?答:132114128525156

互联网级别的视觉问答+机器人动作数据问:对于<任务>机器人应该如何操作?答:…ViT大语言模型LLM答:132114128525156

逆标记化机器人动作描述用于机器人控制的视觉-语言-动作模型把草莓放到正确位置捡起快要掉下的袋子捡起不一样的东西闭环机器人控制协同微调部署RT2视觉TransformerRT-2在模型设计上进行了重大创新,它将机器人的动作编码成一种独特的文本标记语言,这种创新性的表示方式使得RT-2能够利用互联网级别的庞大视觉-语言数据集进行训练。具身项目案例13210.5具身智能的典型应用视觉-动作-语言模型-谷歌PaLM-E2023年,谷歌与柏林工业大学联合开发了一个新的视觉-语言-动作模型,称为为PaLM-E,其模型参数达到562B(Driess,D.,etal2023)。可以把PaLM-E想象成一个拥有“视觉”、“语言”和“动作规划”能力的通用大脑。其核心突破在于:将机器人“看”(视觉)、“想”(语言推理)和“做”(动作)这三项原本分离的能力,融合在一个统一的模型中,可以称之为“具身多模态视觉-语言-动作模型”。具身项目案例133大语言模型(PaLM)遥操作视觉问答,图像描述.......控制答:先抓住黄色积木并且:..PaLM-E:具身多模态模型给定:<嵌入>......<图片>问:如何抓住黄色积木?

答:先抓住黄色积木任务与动作规划人:把抽屉里的绿色玉米片拿给我。具身智能体:①.走到抽提前②.打开上面的抽屉。从抽屉里拿出绿色的玉米片。我看见了<图片>③.从抽屉中抓取玉米片,并把它放在台面上给定:<图片>,问题:图里有什么,并用表情符号回答。描述一下:<图片>,问题:一只狗在犬展览会上跳过障碍纯语言任务这是一个关于具身自然语言的俳句:自然语言模型是自然语言的未来桌面操控给定:<嵌入>问:如何抓取蓝色积木?答:先抓住黄色积木放到桌面上,再抓取蓝色积木给定:<图片>任务:把不同颜色的物体拖到各个角落。步骤1:把绿色星形推到左下角步骤2:把绿色圆形推到绿色星形旁边问:迈阿密海滩毗邻的是哪个海洋?答:大西洋问:372×18等于多少?答:6696在机器人传感器上数据训练的语言模型可用于指导机器人的行动10.5具身智能的典型应用具身项目案例134/video/BV1As4y157vp?t=14.3泳池清洁机器人|2023【WYBOT】_哔哩哔哩_bilibili10.5具身智能的典型应用谷歌5620亿参数多模态模型PaLM-E:机器人视觉语言通用模型|2023【Google】_哔哩哔哩_bilibili视觉-动作-语言模型-谷歌PaLM-E的应用实例演示谷歌发布多模态模型PaLM-E,能同时识别图片和文字,指示机器人迭代完成复杂任务!_哔哩哔哩_bilibili具身项目案例135思考:

简述“仿真到现实迁移”对于具身智能系统研发的原理和好处。思考:简述杨立琨的世界模型和关键要素,并画出信息处理流程图。思考:当拥有世界模型的具身智能机器人普及,将对劳动力市场、人机关系和社会伦理产生何种冲击?思考:通过搜索引擎进行调研,使用ROS(机器人操作系统)

和一台简单的机器人套件(如TurtleBot),尝试实现一个“跟随人脸移动”或“避开障碍到达目标点”的完整闭环项目,亲身感受从感知、规划到控制的完整流程。思考:

通过搜索引擎,进一步了解谷歌公司的RT-1和RT-2的具身机器人项目,并对比分析两个项目,阐述其在技术上演进。思考题调研与学习总结:

具身系统(本体+大脑):感知-理解-规划-控制-执行-预测第十一章

智能计算系统架构与开发136137智能音箱/智能语音助手你问“今天天气怎么样?”系统为什么能听懂、理解并回答?问题与导读:一个智能应用,是怎样来到我们手中的?电商推荐系统你刚浏览过商品,平台为什么很快就推来“更懂你”的推荐?这些智能服务,背后真的只是一个“模型”吗?本章目录11.1从模型到系统:AI应用为什么需要架构11.2智能计算架构基础:AI靠什么跑起来11.3AI应用开发全流程:从数据到部署11.4开发闭环与案例总结1本章目录11.1从模型到系统:AI应用为什么需要架构11.2智能计算架构基础:AI靠什么跑起来11.3AI应用开发全流程:从数据到部署11.4开发闭环与案例总结114011.1从模型到系统:AI应用为什么需要架构系统观从“能用”到“能做”:AI应用背后不只是一个模型用户看到的“前台功能”听懂并回答商品推荐真正支撑这些功能的,是一整套后台系统!14111.1从模型到系统:AI应用为什么需要架构案例收集与标注植物图片形成高质量数据集选择合适算法与实现方式学习叶形、花瓣等特征模型训练与调优不断提升识别准确率封装为APP并发布让用户可以真正使用根据错误继续迭代把识别问题送回开发端分阶段构建,而不是“一次完成”【案例】校园植物识别APP:一个AI应用是怎样逐步形成的?142AI应用的形成阶段分成两种状态:开发态与运行态11.1

从模型到系统:AI应用为什么需要架构核心概念开发态定义:人工智能应用从数据源出发,经过数据处理、知识提炼、模型构建、训练调优,最终生成可部署应用的过程。核心关注:从“数据”到“应用”的生成。本质:把能力“做出来”运行态定义:人工智能应用被部署并实际投入使用后,通过推理服务处理真实输入、输出结果并为用户提供价值的过程。核心关注:把“模型能力”转化为“服务能力”。本质:把能力“用起来”143【案例】智能语音助手开发全流程11.1

从模型到系统:AI应用为什么需要架构案例144为什么说AI应用开发是一项系统工程?11.1

从模型到系统:AI应用为什么需要架构总结智能语音助手嘈杂环境下仍要“听得清、答得准”电商推荐系统既要懂用户偏好,也要兼顾业务约束自动驾驶等复杂系统需要在动态环境中做出安全决策AI应用开发不是单一算法的堆砌,而是覆盖“数据—算法—模型—系统”的综合性系统工程,需要各个阶段多种软硬件资源的支持。本章目录11.1从模型到系统:AI应用为什么需要架构11.2智能计算架构基础:AI靠什么跑起来11.3AI应用开发全流程:从数据到部署11.4开发闭环与案例总结114611.2智能计算架构基础:AI靠什么跑起来智能计算硬件架构:支撑AI应用落地的技术底座•计算决定“能不能高效算”•存储决定“能不能持续供数”•通信决定“多设备能不能协同”技术底座14711.2智能计算架构基础:AI靠什么跑起来计算发生在哪里:云计算与边缘计算高效计算边缘计算(EdgeComputing)把计算能力下沉到靠近数据源的位置,如手机、智能音箱、自动驾驶汽车或工厂设备。优势:响应更快、隐私更好、网络带宽压力更小。一句话理解:云更擅长“重型处理”,边更擅长“实时响应”。云计算(CloudComputing)像一个集中的“超级大脑”,大量数据与复杂计算任务通过网络送到远端数据中心,由大规模服务器集群统一处理。优势:算力强、资源弹性大,适合模型训练和重型分析任务。14811.2智能计算架构基础:AI靠什么跑起来现代AI通常采用“云边协同”高效计算云端模型训练数据分析参数更新边缘设备本地推理实时交互就近响应训练需要大算力和大规模数据,适合放在云端推理;更强调低延迟与本地响应,适合发生在边缘端;云边协同兼顾“强算力”和“快响应”。11.2智能计算架构基础:AI靠什么跑起来高效计算CPU:全能“管家”擅长逻辑控制、任务调度、数据预处理通用性强,能够处理复杂多变的指令面对大规模并行矩阵

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论