智能驾驶与人机交互 课件全套 第1-11 章概述 - -智能驾驶人机交互系统迭代_第1页
智能驾驶与人机交互 课件全套 第1-11 章概述 - -智能驾驶人机交互系统迭代_第2页
智能驾驶与人机交互 课件全套 第1-11 章概述 - -智能驾驶人机交互系统迭代_第3页
智能驾驶与人机交互 课件全套 第1-11 章概述 - -智能驾驶人机交互系统迭代_第4页
智能驾驶与人机交互 课件全套 第1-11 章概述 - -智能驾驶人机交互系统迭代_第5页
已阅读5页,还剩134页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

智能驾驶与人机交互

第1章

概述

智能驾驶教学团队案例导入:长安UNI-T汽车人机交互1汽车人机交互发展历程2汽车人机交互安全性要求3汽车人机交互演变与趋势案例导入长安UNI-T是首款搭载国产AI芯片的智能汽车,通过多模态交互实现主动化服务。发布时间:2020年6月21日。核心配置:搭载地平线征程二代车规级AI芯片(J2),AI算力5TOPS。交互系统:UNILife车载智能交互系统。主要功能:疲劳驾驶检测与干预、视线亮屏、高速下道分心提醒、FACEID无感登录、全语音交互(车载微信)、遥控代客泊车、自适应巡航等。案例导入UNI-T的设计遵循“第一性原理”,回归问题本质进行场景开发。第一性原理:打破知识桎梏,回归事物本源思考,不照搬经验。设计方法:深挖用户痛点(57个场景需求,30多场头脑风暴)。注意力识别开发流程:研究→建立测试环境→采集真实数据→多模态记录→分析归纳→策略验证。早期技术与CAN总线无线电、磁带、CAN总线等早期技术奠定了汽车交互的物理与通信基础。1924年:第一台车载收音机(听觉交互开端)。1965年:车载磁带播放器(个性化娱乐开端)。1991年:奔驰W140搭载CAN总线,实现ECU间数据通信。CAN功能:车窗/车门/后视镜自动调节、车辆状态显示、OBD诊断。液晶、触摸与HUD液晶显示、触摸屏和抬头显示大幅提升了信息呈现与操作便捷性。液晶显示(LCD)推动电子仪表盘取代机械仪表。2012年特斯拉ModelS搭载17英寸触摸屏,取消物理按键。2014年Navdy推出集导航、语音、手势于一体的后装HUD。导航、互联与传感器GPS、CarPlay及多模态传感器进一步拓宽了交互场景。定位导航:从“Iter-Auto”滚动地图到GPS民用化(2006年)。CarPlay/AndroidAuto(2014年)实现手机与车机深度互联。传感器(MEMS)与多模态交互:理想L7融合语音、手势、触控。芯片、软件与云计算AI芯片、软件框架(Qt/Unity)和车云技术使座舱具备强大计算与智能化能力。芯片从CPU→GPU→SoC→AI加速器;小米SU7搭载骁龙8295(30TOPS)。软件:Qt用于仪表/中控界面,Unity用于3D沉浸式体验。云计算:特斯拉FSD基于百万辆车云端深度学习。社会变迁与座舱演进社会美学演变(机械→技术→认知→智能)推动座舱从机械式到智能化发展。美学阶段:机械美学(被动交互)→技术美学(协同)→认知美学(单一主动)→智能美学(主动交互)。座舱三阶段:机械式(无集成)→电子化(低集成)→智能座舱(高度集成)。未来趋势:“第三生活空间”,以乘客为中心,完全自动化。驾驶员行为分析驾驶员行为分操作、意图和模式三个层次;描述性模型从静态角度分类行为。驾驶员行为三层次:操作(短时控制)、意图(稳定目的)、

模式(场景+个性)。描述性模型:任务分析模型(Hackman/McKnight)、

层级模型(Rasmussen/Michon/GADGET/ECOM)、

Trait模型(因子/统计)。功能性驾驶员行为模型功能性模型深入认知层面,包括自适应控制、计划行为理论、信息处理和动机模型。自适应控制:伺服控制(转向)和信息流控制(跟驰)。TPB模型:外生变量→行为意向→驾驶行为。信息处理:多重资源模型、工作负荷模型、有限能力模型。动机模型:风险平衡、零风险、风险规避、安全边界。驾驶员心理分析驾驶员心理状态受个性、情绪、认知负荷和反应时间综合影响。个性(外向/神经质/尽责性)和即时情绪(愤怒/焦虑)显著影响驾驶行为。认知负荷过高延长反应时间;即时反馈可改善驾驶表现。适度应激提升警觉,过度应激降低判断力。驾驶员心理分析驾驶经验、风险意识、态度动机和社会责任共同塑造安全驾驶行为。经验丰富者风险感知更强,形成“经验→风险意识→更安全”的正反馈。内在动机(兴趣/价值观)比外在动机(奖励/惩罚)更稳定。社会责任感强的驾驶员更遵守法规,更愿采取公益行为。机械式座舱1980年代前,座舱以机械操作为主,功能单一,交互被动。转向盘(1894年出现)、三点式安全带(1955年发明)。温度控制:从发动机暖风到冷暖一体空调。音乐娱乐:车载收音机、磁带播放器。电子化座舱1980年代至2015年,液晶屏、电子仪表、CD/MP3、倒车雷达等逐步普及。彩色液晶屏(1987年丰田皇冠)、带功能键的转向盘(1994年宝马)。音乐娱乐:CD→MP3→iPod→CarPlay。倒车雷达(1982年丰田)、流媒体后视镜(2014年日产)。智能座舱2015年至今,多传感器、多联屏、AI交互成为主流,未来向“第三生活空间”发展。透明A柱(哪吒U)、智能转向盘(健康监测)、3D仪表(LG)、分区空调(大众ID.6)。智能座椅(多场景模式)、影院模式(宝马悬浮式巨幕)、AR眼镜(蔚来)。谢谢大家!

36/36智能驾驶与人机交互

第2章

面向智能驾驶的人机交互设计

智能驾驶教学团队案例导入:多模态疲劳驾驶检测与缓解1智能驾驶人机交互设计原则2智能驾驶人机交互技术类型3智能驾驶人机交互安全性标准疲劳驾驶检测疲劳驾驶占重特大事故约40%,DMS已成为法规要求和车型标配。现状:提前预警可避免近90%交通事故;2023年国内DMS装配率7.7%。法规:工信部《准入管理指南》和欧盟《通用安全法规》明确要求。疲劳判断四大类:主观评价(KSS)、生理特征、驾驶特征、身体特征(主流)。疲劳驾驶检测基于身体特征(眼部和嘴部)的视觉方案是当前最实用的疲劳检测手段。眼部:睁闭眼检测(CNN模型/关键点),嘴部:打哈欠检测(宽高比或时序网络)。辅助:人脸朝向、人脸质量、性别年龄。PERCLOS(P80):f>0.15视为疲劳。疲劳驾驶检测与缓解疲劳检测需结合算法与策略,缓解方法包括身体、视觉和教育三类刺激。检测流程:图像→基础检测→特征提取→疲劳策略→分级输出(轻度/中度/重度)。缓解方法:转向盘振动/语音/香氛(身体),减速带/标线(视觉),交通教育(提醒)。多模态交互设计原则多模态交互需遵循减少注意转移、关键信息优先、易学习、及时反馈、易发现性五大原则。减少注意转移::单手操作,非接触式。关键信息优先:高频操作区设于易触区域。易学习:操控习惯一致。及时反馈:延时>2s须显示“正在响应”。易发现:无遮挡,亮度适中。多模态交互模态视觉(HUD/仪表)、听觉(语音识别)、触觉(指纹/振动/触屏)是主要交互通道。视觉:HUD三种路线(C-HUD淘汰,W-HUD量产,AR-HUD主流)。听觉:语音识别流程(特征→声学→语言→解码)。触觉:指纹识别、转向盘/座椅振动反馈、中控触摸屏。多模态交互模态嗅觉(智能香氛)和手势(3D识别)进一步丰富交互方式,但面临精度、长尾和算力挑战。嗅觉:奔驰2009年引入香氛系统,现用于缓解疲劳、营造氛围。手势:宝马7系首推,3D摄像头/多目融合检测。三大挑战:精度不足(如“眼睛小被误判为睡觉”)、长尾问题、算力不足。文化因素与人机交互文化因素(左右舵、赛车、复古、女性、红色文化、东方美学)深刻影响座舱设计。左右舵受历史交通习惯影响。赛车文化:法拉利F1方向盘集成换档拨片。女性主义:Galloway、道奇LaFemme、日系女性友好设计。红色文化:红旗CA72(宫灯尾灯、五面红旗)。东方美学:吉利博瑞(拱桥弧线)、比亚迪汉(龙颜、苍穹灰)。感性需求与马斯洛层次感性需求源于“感性工程”,将马斯洛需求层次映射到座舱功能设计。生理需求::自适应照明、HUD、音响、座椅加热/通风、空气净化。安全需求:智能远光、声音警示、触觉反馈、空气质量监测。感性需求与马斯洛层次归属、尊重和自我实现需求通过娱乐系统、语音助手、豪华内饰和个性化交互实现。归属需求:特斯拉娱乐系统、OnStar服务、NOMI等语音助手。尊重需求:宾利/保时捷内饰、劳斯莱斯Bespoke音响、林肯香氛。自我实现:理想L9五屏交互、4D沉浸影音、“千人千面”。人机共情人机共情使机器理解并回应人类情感,包含情感识别、适应性响应和互动式反馈。三方面:摄像头/传感器监测表情、语音、生理信号;根据情绪调节环境;虚拟助手主动交流。案例:奔驰MBUX虚拟助理、滑铁卢大学声音调节研究。人机共情共情技术可提升体验、增强安全、促进信任,但面临多模态融合、个体差异、数据质量等挑战。共情技术存在自主性降低、情感欺骗、行动力降低等伦理风险,需通过道德规范、用户参与等路径治理。三大意义:个性化环境调节、实时安全干预、建立情感连接。五大挑战:外生变量→行为意向→驾驶行为。信息处理:数据融合延迟、表达方式差异、训练数据不足、实时性要求、精度受干扰。伦理风险:过度依赖导致自主性下降,单向情感交流造成虚假亲密感,减少道德判断。治理路径:道德规范(避免偏见)、用户参与(包容性设计)、多方引导(教育/社会合作)、提升判断(品格教育)。隐私安全:数据加密(AES)、访问控制、匿名化。六大交互技术语音、手势、头部追踪、虚拟现实、智能助理、情感识别构成了人机交互核心能力体系。语音:双手不离方向盘。手势:不触碰按钮。头部追踪:调整后视镜/车灯,提醒分心。虚拟现实:实时导航信息。智能助理:问答推荐。情感识别:调节音乐/座椅/照明。驾驶员心理分析安全性评价包括视觉、认知和肢体分心,主要指标有车速保持、车道保持和视线偏移。三种分心:视觉(视线离开)、认知(注意力转移)、肢体(手离方向盘)。车速保持:SpDev=Σ|Vt‑V0|。车道保持:LDSD=sqrt((1/T)Σ(dt‑davg)²)。安全性评价指标与交互模态优化视线偏移(扫视总时间、最长扫视时间)和功能限制是关键指标;触屏、按键、手势、语音各有优劣。扫视总时间≤20s,单次≤2s(AAM标准)。触屏劣势:盲操作<5%,扫视时间长;优化变量:操作步数、位移量、图标面积(≥700mm²)、水平转角(≥7°)。按键:功能键安全,导向键分心大。语音:视觉分心少,但认知有下限。谢谢大家!

36/36智能驾驶与人机交互

第3章

智能驾驶人机交互系统架构设计

智能驾驶教学团队案例导入:智能驾驶语音识别技术架构1智能驾驶人机交互系统架构设计2智能驾驶人机交互系统功能开发3智能驾驶人机交互系统开发流程案例导入以“小安,你好!”唤醒词为例,展示从音频到解码的完整语音识别技术流程。流程:音频→Fbank特征(40维+差分)→CNN‑DNN声学模型(9分类)→Viterbi解码。建模单元:8个音素+sil(静音/噪声)。解码网络:唤醒词状态序列+垃圾吸收网络(filler)实现拒识。系统架构总览端侧架构分为硬件平台、系统层、框架层和应用层,支持多传感器和AI推理。硬件:智能交互单元(AI芯片)、通信(GSM/GPS/WiFi)、网关(ETH/CAN/LIN)。系统层:Hypervisor+BSP虚拟化,AutoSAR标准(传统+Adaptive)。框架层:SOA模块化(情绪/行为/疲劳感知),场景开发平台。应用层:用户直接体验的场景。典型架构方案地平线Halo和斑马智行AliOS分别展示了独立芯片方案和操作系统级融合方案。Halo:硬件→HAL→AndroidFramework→Antares策略中心→应用,云端提供OTA/账号/个性化。斑马智行:基于AliOS的三核融合(仪表/车机/AI),系统级Fusion打通。车端子域与多模态融合车端分为交互娱乐域(IVI/AVN)和交互感知域(DMS/OMS),多模态融合提升体验。娱乐域:车云结合与智能应用。感知域:透明A柱、AR‑HUD、手势/语音控制。多模态融合示例:语音+视觉(多模命令词),语音+手势/视线(车窗控制),毫米波+视觉(活体检测)。V2X与车云结合V2X(车/车、车/设施、车/人、车/云)和云端服务为人机交互提供内容支撑。-感知类功能(手势/语音/疲劳)本地离线运行。-云端提供内容服务:音乐推荐、广播、呼叫等。-华为车云框架:车辆管理(配置/OTA/影子模式)+连接管理(认证/通信)+智能体套件(分析/画像)。OTA技术OTA(远程无线升级)分为FOTA(固件)和SOTA(软件),需兼顾安全、鲁棒性和速度。FOTA:完整固件镜像,涉及整车控制器。SOTA:增量升级,主要用于娱乐系统。架构:管理平台→升级服务→任务调度→文件服务→车端(T‑BOX→OTAManager→UpdateAgent→ECU)。关键考量:加密/校验/安全启动、断点续传/回滚、并行刷写。隐私保护与法律我国已建立《汽车数据安全管理若干规定》《数据安全法》《准入管理意见》等法规体系。规定:默认不收集、车内处理、告知触发条件。数据安全法:强调数据安全与行业并重。准入意见:五部分(总体、数据网络、OTA、产品管理、保障),要求境内存储、安全评估。开发流程与团队分工场景开发分7步,涉及OEM、Tier1、算法公司等多方协作。7步:场景定义→UE/UI→平台搭建→开发→测试→部署→维护。团队:数据、标注、算法、工程、测试。分工示例:OEM定义功能,Tier1提供硬件,算法公司提供模型,车机软件集成。开发工具链UI/UE(Qt/Unity)、算法(艾迪/BML)、软件(AIExpress)、场景(Antares)四大平台协同加速开发。UI/UE:Unity、Unreal、KANZI、Qt。算法平台:华为八爪鱼、地平线艾迪(Data/Label/Model/Issue)、百度BML。软件平台:AIExpress(XStream+XProto)。场景平台:Antares、仙豆MO.Life、飞鱼智云。谢谢大家!

36/36智能驾驶与人机交互

第4章

智能驾驶人机交互系统硬件基础

智能驾驶教学团队案例导入:基于地平线征程芯片的硬件接入设计1车规级芯片2车载传声器3车载摄像头4基于芯片的硬件设计J3芯片规格与能力地平线J3(征程三代)是车规级AI芯片,支持多路摄像头和语音接入。CPU:4核A53,1.2GHz;BPU算力5TOPS。存储:DDR4/LPDDR4最大4GB。视频:3个MIPICSIRX(1×4lane+2×2lane),支持4096×2160@30fps。接口:I2S/SPI/I2C/UART/RGMII/SDIO。根据功能场景可灵活组合不同摄像头,如DMS+IMS+车外双目等。典型组合1:200万主驾DMS+200万副驾IMS+200万车外双目(疲劳/人脸/拍照)。组合2:200万DMS+600万IMS(高分辨率精细识别)。组合3:200万DMS+200万IMS+200万后排IMS+200万DVR(后排检测/行车记录)。一体机与ECU硬件设计硬件设计分一体机(AI子板或Chip‑on‑board)和ECU(分体机)两种方案,各有优劣。一体机:集成度高,但结构受限;ECU:独立灵活,兼容性好,但成本较高。一体机通过板对板连接器或PCB共享;ECU通过以太网/USB/CAN与车机通信。ECU方案需新增MCU、以太网PHY、CAN收发器。一体机与ECU硬件设计硬件设计分一体机(AI子板或Chip‑on‑board)和ECU(分体机)两种方案,各有优劣。一体机:集成度高,但结构受限;ECU:独立灵活,兼容性好,但成本较高。一体机通过板对板连接器或PCB共享;ECU通过以太网/USB/CAN与车机通信。ECU方案需新增MCU、以太网PHY、CAN收发器。车规级芯片与AI性能车规级芯片标准远高于消费级,AI真实性能取决于TOPS、利用率和算法效率。车规级要求:温度‑40~155℃,出错率0,寿命15年。AI性能公式:真实性能=TOPS×利用率×每TOPS有效数据处理。常见xPU:TPU、NPU、BPU(地平线)、DPU等。GPU与SoCGPU适合大规模并行计算,SoC将CPU/GPU/DSP等集成于单芯片,是车载计算趋势。CPUvsGPU:CPU延迟优先,GPU吞吐优先。SoC:基于IP设计模式,软硬件协同,可靠性高。高通骁龙845集成GPU、DSP、Modem等。车载传声器与阵列传声器指向性(全向/心形等)和阵列安装方式(集中/分布式)影响语音增强效果。常用指向性:全向、心形、超心形、偶极子。安装规则:远离空调出风口;集中式安装在顶灯/车机,分布式利于多音区。单指向性可提升驾驶员与乘客语音分离度。车载摄像头类型与安装座舱摄像头包括DMS、OMS、MICam、DVR、ULCam、CMS等,各有位置和FOV要求。DMSCam(A柱/转向柱):IR/RGB,VFOV35°~45°,用于疲劳/视线。OMSCam(顶灯):RGB/TOF,VFOV>80°,用于前排交互。转向柱安装优势:距离人脸50~70cm,仰视避免眼皮遮挡,抗强光。谢谢大家!

36/36智能驾驶与人机交互

第5章

智能驾驶人机交互系统算法基础

智能驾驶教学团队案例导入:面向智能驾驶的VarGNet网络结构设计1人机交互系统中的深度学习基础2人机交互系统中的机器视觉算法基础3人机交互系统中的语音识别算法基础4人机交互系统中的大语言模型基础VarGNet轻量化网络VarGNet通过组卷积固定通道数、减少层间特征图,实现高效边缘端部署。组卷积参数量为标准卷积的1/g。VarGNet设计:平衡计算强度+减少中间特征映射。在ImageNet上1.0x模型top1=74.04%,优于MobileNetv1。CNN基础CNN由卷积层、激活函数、池化层、全连接层构成,LeNet‑5是经典结构。卷积:打破知识桎梏,回归事物本源思考,不照搬经验。ReLU解决梯度消失,池化降低特征尺寸。全连接层整合特征,Softmax输出概率。训练与压缩模型训练需前向+反向传播,压缩技术(量化、剪枝、知识蒸馏)适配边缘端。训练:小批量随机梯度下降,调参技巧(激活函数、学习率、防止过拟合)。压缩:硬件(GPU/FPGA/ASIC)、框架(推理引擎)、算法(轻量化、剪枝、量化)。量化:PTQ(后量化)和QAT(量化感知训练)。图像分类模型ResNet、DenseNet、MobileNet等模型各具特色,满足不同精度/效率需求。ResNet:残差块解决深层难训练。DenseNet:稠密块,特征重用,参数少。MobileNet:深度可分离卷积,计算量仅常规1/8~1/9。图像分类模型ResNet、DenseNet、MobileNet等模型各具特色,满足不同精度/效率需求。ResNet:残差块解决深层难训练。DenseNet:稠密块,特征重用,参数少。MobileNet:深度可分离卷积,计算量仅常规1/8~1/9。深度学习概述AI>ML>DL传统ML:人工设计特征→提取→分类器预测。DL:端到端训练,特征提取与分类联合优化。深度学习三要素:神经网络模型、损失函数、优化方式(反向传播+梯度下降)。CNN基础LeNet-5:卷积→池化→激活→全连接→输出。局部感知:每个神经元仅连接输入图像一块区域。权值共享:卷积核权重被整张特征图共享。卷积计算:5×5图像经3×3卷积核(stride=1)得3×3特征图,对应元素相乘累加。CNN基础激活函数:引入非线性。Sigmoid(易梯度消失)、ReLU(解决梯度消失,计算简单)。池化层:降低特征图尺寸。MaxPooling、MeanPooling、GlobalAveragePooling。BN层:使每层输入均值为0方差1,加速收敛,缓解梯度消失,具正则化效果。损失函数:分类用交叉熵,回归用MSE/SmoothL1。损失=平均训练误差+正则化项(L1/L2)。分类模型训练与模型压缩训练:前向传播(计算图)+反向传播(链式法则)。采用小批量随机梯度下降(MBSGD),batchsize、epoch、iteration。调参技巧:隐层用ReLU、学习率衰减、防止过拟合(数据增强/Dropout/正则化/早停)。模型压缩:轻量化结构(MobileNet深度可分离卷积)、知识蒸馏(教师-学生)、剪枝(非结构化/结构化)、量化(FP32→INT8)。分类经典模型VGG:多个3×3小卷积核替代大卷积核,减少参数量。ResNet:残差块(快捷连接),解决退化问题,可达152层。DenseNet:稠密块,每层输入来自前面所有层输出,加强特征复用。GoogLeNet:Inception模块,1×1卷积降维,多分支并行提取不同尺度特征。MobileNet:深度可分离卷积(Depthwise+Pointwise),计算量减少8~9倍。V2引入线性瓶颈层和反转残差块。目标检测FasterRCNN:RPN生成Anchor候选框,ROIPooling缩放,全连接层输出分类和回归。YOLO系列:端到端,划分网格预测BBox和置信度。v2加入BN/Anchor/多尺度;v3加入ResNet/FPN/多logistic分类。FCOS:Anchor-Free,逐像素预测到GT四边距离(l,t,r,b)。FPN解决重叠框歧义,Center-ness抑制低质量框。。图像分割语义分割:像素级分类;实例分割:区分不同个体;全景分割:实例+背景。FCN:全卷积+反卷积上采样,端到端分割。MaskRCNN:FasterRCNN加Mask分支,ROIAlign替代ROIPooling。DeepLab:空洞卷积扩大感受野,ASPP模块,V3+编解码结构。PSPNet:金字塔池化模块融合局部和全局上下文。关键点检测、OCR与3D检测关键点检测:回归目标点、heatmap、heatmap+offsets。应用:车轮接地点检测生成车辆3D框。OCR:文本检测(CTPN/CRAFT/EAST)+文字识别。3D目标检测:输出中心点/长宽高/航向角/速度。评测AP_3D、AP_BEV、PKL。数据集:KITTI、nuScenes、WaymoOpen。点云检测:VoxelNet(体素特征编码VFE)、PointNet(顺序不变性)。图像检测:FCOS3D(Anchor-Free,逐像素预测)。多模态融合:早期融合(区域/点云级别)、中间融合(特征层)、后期融合(结果融合)。语音识别框架语音识别由声学模型、语言模型和解码器组成,基于贝叶斯公式最大化后验概率。贝叶斯公式:Ŵ=argmaxP(O|W)·P(W)。声学模型:GMM‑HMM→DNN‑HMM(CNN/LSTM)。语言模型:N‑gram(平滑)→神经网络(FNN/RNN/LSTM)。端到端与大模型端到端模型(CTC、Attention、Transformer)简化传统链路,大模型(LLM)具备涌现能力。CTC:引入blank解决长度不匹配。Attention:Encoder‑Decoder+注意力机制。Transformer:完全自注意力,摒弃RNN。LLM训练:预训练→指令微调→对齐(RLHF)。多模态大模型ViT统一图像与文本架构,CLIP实现图文对齐,LLaVA将视觉编码器与LLM结合。ViT:图像切patch→线性投影→TransformerEncoder。CLIP:4亿图文对对比学习,zero‑shot能力强。LLaVA:视觉编码器(CLIPViT)+投影层+LLM,两阶段训练(对齐+微调)。谢谢大家!

36/36智能驾驶与人机交互

第6章

智能驾驶人机交互系统数据基础

智能驾驶教学团队案例导入:FatigueView疲劳驾驶数据采集与标注1人机交互数据采集2人机交互数据标注疲劳数据采集通过模拟驾驶环境采集疲劳数据,避免实车安全风险,同时采用表演+模拟两种方案。模拟环境:驾驶软件+转向盘+显示屏。录制设备:5个位置(A柱/转向管柱/内后视镜/正上/正前)×2种摄像头(IR/RGB),帧同步。表演采集:基于真实疲劳特征(打哈欠/缓慢眨眼/揉眼睛)制定脚本。模拟采集:持续4小时录制真实疲劳状态。疲劳数据标注眼睛状态分睁闭眼分类和17点关键点标注;疲劳动作标注起止点。睁闭眼分类:闭合、睁开、微睁眯眼、向下看、遮挡、忽略。关键点:0~7眼睑轮廓,8~16虹膜/瞳孔;闭眼时8~16标在左上角。动作标注:打哈欠、伸懒腰、揉眼睛、其他手部动作等明确定义起止帧。疲劳事件标注与采集文档疲劳事件标注描述大段时间内的疲劳等级,采集文档确保数据质量和可追溯性。事件属性:正常、轻度、中度、重度、完全睡着、不在驾驶。采集文档内容:数据用途、采集工具、具体需求、注意事项、修订记录。记录表格:日期、人员ID、性别、年龄、车型、光照、配饰等。标注工具与平台标注工具分离线(SuperAnnotate/精灵/Praat)和在线(曼孚/Playment/倍赛),各有适用场景。离线:本地操作,适合小规模。在线:多人协作,流程规范。高校倾向免费稳定,企业关注数据安全和性价比。标注体系建设通过流程管理(启动→规划→执行→收尾)、人员管理(操作员/组长/管理员)和质量控制(准确率≥99%)实现标准化。流程五阶段:启动(计划/预算)→规划(试标/培训)→执行(标注/验收)→监控→收尾。人员比例:标注:质检≈5:1。质量指标:准确率≥99%,图片准确率≥95%。谢谢大家!

36/36智能驾驶与人机交互

第7章

智能驾驶人机交互算法开发

智能驾驶教学团队案例导入:汽车驾驶中的安全带感知1视觉交互算法开发2语音交互算法开发3多模交互算法开发安全带感知案例视觉方案可检测卡扣传感器无法发现的误系行为(系肚子、放背后等)。流程:全图检测(人脸/人手/人体)→策略锁定目标→ROI切割→分类模型(Normal/Wrong/No)。安全带属刚性物体,适合分类模型。安全带感知案例利用地平线艾迪平台(AIDI‑Data/Label/Model)进行训练、测试和发版管理。模型选择:VarGNet(适配J2)测试方式:推荐通过模型管理系统发起评测任务(可追溯)。策略:多帧综合判断(如20帧内>15帧Normal>0.9则判定系安全带)。视觉交互通用流程视觉交互以通用感知为基础,通过场景拆解实现特定功能(视线/手势/行为/情绪)。五步:明确场景→算法拆解→模型选择→训练→测试发版。算法拆解示例:全图检测→人脸/人手/人体→关键点→分类/策略。视线估计视线估计通过3D眼球模型、2D特征或深度学习实现,用于分心监测。传统方法:3D模型(需标定)、2D特征(瞳孔/反光点)、表观特征。深度学习方法:输入人眼/人脸/两者,CNN回归视线。算法流程:人脸对齐→归一化→CNN预测视线角度。手势识别手势识别分2D(静态/动态分类)和3D(深度图/单目/多目重建)两条技术路线。2D:静态(比心/点赞)和动态(右划),流程简单。3D:深度图(TOF)、单目(回归关键点或参数模型)、多目(拟合或端到端)。策略手势:根据重建结果定义手势(如点赞判断手指弯曲角度)。行为识别行为识别通过检测人脸、人手和时序分析实现,点摇头需连续两次有效判定。打电话:检测人脸+人手→ROI→分类;难点:光照/遮挡/特殊姿势。抽烟:类似,难点烟小、棒状物干扰。点/摇头:定义(1.5s内≥2次,Δa≥10°),采用双流(TSN)或骨骼点时序网络。情绪识别情绪建模分离散情绪(Ekman六种/Plutchik轮)、连续空间(VA/VAD)和面部动作单元(AU)。离散:Ekman(快乐/悲伤/愤怒/惊讶/恐惧/厌恶)。连续:二维或三维空间表示。AU:FACS编码,AU0~AU5等。情绪识别情绪识别采用基于AU检测或基于人脸+关键点序列的双流方法。基于AU:AU数值→隐含层→全连接→Softmax。双流:空间网络(人脸图片)+时序网络(关键点序列)后融合。座舱挑战:大角度、遮挡、光照不均等。语音前端语音前端通过预处理、AEC、BF、BSS、NS、AGC、SZD、VAD等模块提升语音质量。AEC(回声消除):自适应滤波,抑制15~25dB。BF(波束形成):空间滤波增强期望方向。BSS(盲源分离):不需方位信息,分离多声源。NS(噪声抑制):稳态/非稳态噪声处理。语音后端ASR含数据扩充、特征提取、声学模型(DFSMN)、语言模型(TCN)和解码;NLU解析领域、意图、槽位。ASR:Fbank特征,DFSMN声学,TCN语言模型(两级缓存)。NLU:领域分类→意图分类→槽位填充(TCN‑CRF),多任务模型。多模语音与多模态大模型多模语音融合唇语解决单模痛点;多模态大模型以LLM为核心,RAG增强准确性。多模命令词:唇部+语音→多模声学模型,高噪声漏报降70%。多模语音分离:唇部引导cIRM掩码,UNet网络。大模型:Agent(规划/记忆/工具)+RAG(检索生成)。谢谢大家!

36/36智能驾驶与人机交互

第8章

智能驾驶人机交互软件开发

智能驾驶教学团队案例导入:驾驶中打电话识别与主动降音1人机交互感知软件开发框架2人机交互感知软件开发流程3人机交互感知软件开发工具案例——打电话识别开发打电话场景开发分五步:定义→设计→开发→验证→发布,模型需编译为二进制。场景定义:何种行为视为打电话。设计:细化动作(微信电话/大角度/反手等)。开发:采集数据→训练模型→工具链编译(hbdk)→二进制管理平台→集成。案例——打电话识别开发通过定义消息、节点、合入Pipeline和序列化完成模型集成。消息:ExpModelInfo(三类得分)和ExpModelMsg(track_id映射)。节点:ExpModelModule继承DMSModule,实现Init→Predict→后处理→Publish。合入:在JSONPipeline中添加CameraModule、FaceHandDetectModule、ExpModelModule。感知软件开发框架框架提供跨SoC/进程间/线程间通信,VIO视频接入(SIF→ISP→IPU)和ALSA语音接入。跨SoC通信:物理层(SDIO/SPI/USB)→数据链路层→传输层→应用层。VIO:SIF(传感器接口)→ISP(图像信号处理)→IPU(图像处理单元)→DDR。ALSA:LibraryAPI→Core→SoCCore→Driver。模型集成框架集成框架基于发布订阅、Protobuf序列化和节点(Module)机制,实现解耦和高效计算。发布订阅:松耦合,主题(topic)通信。消息序列化:Protobuf(高效、跨平台)。节点:独立模块,通过Subscriber/Publisher交互。集成流程:定义Module→定义Message→Init→Process→编译插件包→部署。模型集成框架集成框架基于发布订阅、Protobuf序列化和节点(Module)机制,实现解耦和高效计算。发布订阅:松耦合,主题(topic)通信。消息序列化:Protobuf(高效、跨平台)。节点:独立模块,通过Subscriber/Publisher交互。集成流程:定义Module→定义Message→Init→Process→编译插件包→部署。算法工具链工具链是算法与芯片的桥梁,通过模型量化、图优化和编译,使模型在芯片上高效运行。模型量化:PTQ(训练后量化)和QAT(量化感知训练),将FP32模型转为INT8。模型图优化:算子融合、层合并。模型编译:将模型转换为推理芯片可识别的指令与数据,需合理设计各层特征图尺寸。模型压缩方法:知识蒸馏(KD)、轻量化模型架构、剪枝(结构化/非结构化)、量化。算法工具链工具链是算法与芯片的桥梁,通过模型量化、图优化和编译,使模型在芯片上高效运行。模型编译:将模型转换为推理芯片可识别的指令与数据,需合理设计各层特征图尺寸。模型压缩方法:知识蒸馏(KD)、轻量化模型架构、剪枝(结构化/非结构化)、量化。地平线流程性能验证性能验证方面有静态分析和动态分析两种策略精度验证谢谢大家!

36/36智能驾驶与人机交互

第9章

智能驾驶人机交互应用开发

智能驾驶教学团队案例导入:驾驶员抽烟识别及交互应用1智能驾驶人机交互应用类型2人机交互应用开发框架3人机交互应用开发规则抽烟场景开发案例通过事件监听、冲突处理和交互反馈完成抽烟车窗调节场景。事件监听:registerSmokeEventListener(主驾/副驾)。冲突处理:资源引用计数,按优先级排队。交互反馈:弹窗+TTS播报,5秒内不取消则开窗+空气净化。应用类型与软硬件方案多传感器(DMS/IMS/RMS/MIC/解锁摄像头)配合AIBoard和APBoard,Antares提供感知服务。硬件:AIBoard(感知)+APBoard(场景应用)。软件:感知软件(J3)→序列化→Antares(系统服务)→App。数据流:感知输出→序列化→设备适配→服务注册→OTA管理→感知能力开放→云端对接。Antares框架分层Antares分物理层、HAL、组件层、业务层、对外API和AI应用,组件化设计解耦。物理层:SDIO/USB/SPI(一体机)或以太网(分体机)。HAL:HBService(诊断/通信)。组件层:功能组件(基础)+业务组件(具体)。业务层:内置/自定义场景。对外API:感知结果、FaceID。通信与数据处理内部通过HBService(TCP/IP)和Binder通信,云端通过TCP/IP;数据中转站统一格式分发。内部通信:HBService+Antares→Binder对外。云端通信:FaceID、场景配置、语音资源。数据处理:多平台数据接入→格式转换→数据队列→解析分发(高频队列+丢帧,低频直接分发)。组件化与感知组件组件按业务/功能/AOP划分,感知组件通过Native→JNI→Java队列解析proto数据。组件分类:打包组件(壳)、业务组件、功能组件。感知组件:Native层分类消息类型,Java层ArrayBlockingQueue管理,解析后分发。示例:疲劳等级解析→onFatigueLevel回调。FaceID与工程模式FaceID端云一体化用于账户/座椅/起动;工程模式提供诊断、升级、视线标定等功能。FaceID流程:视频(1s,25fps)→活体检测→人脸优选→注册/识别。工程模式:芯片诊断(Efuse/温度/功耗)、上下电诊断、OTA升级、视线标定(精度提升2°)。对外输出与冲突处理AntaresManager通过Binder连接池提供Core/DMS/FaceID/Speech接口;冲突处理采用状态管理和资源引用计数。Binder连接池:一个Service管理所有AIDL,queryBinder返回对应Binder。冲突处理:场景状态(RUNNING/WAITING/COMPLETE),按优先级排队,公共资源引用计数。谢谢大家!

36/36智能驾驶与人机交互

第10章

智能驾驶人机交互系统测试

智能驾驶教学团队案例导入:驾驶员抽烟感知及交互测试1人机交互系统测试流程2人机交互系统测试标准3人机交互测试工具抽烟测试案例抽烟感知测试分四步:构建测试集→算法回灌→实车体验→badcase对齐。测试集:正样本+专项负样本+自然驾驶。回灌:回灌→评测→badcase分析→报告。实车:发现未知badcase。对齐:量化badcase分布,确定优先级和解决计划。视觉测试标准视觉测试覆盖光照(7类)、车控和模特三个维度,构建三类测试集。光照:普通、阳光直射、侧光、暗光、弱光、复杂、夜晚开灯。正样本集:每个座位≥500动作,输出Recall。自然驾驶集:≥300小时,输出Fpphr。专项负样本:≥200/类,共28类常见干扰(摸嘴/喝吸管/棒状物等)。视觉测试标准与指标评测指标包括Recall、Fpphr、Accuracy、1‑offAccuracy和Precision。Recall(召回率)=TP/(TP+FN),查全率。Fpphr=FP/总时长,目标≤0.01(100小时1次误报)。Accuracy=(TP+TN)/(TP+TN+FP+FN)。1‑offAccuracy:年龄误差在±1区间。语音测试

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论