版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
智能驾驶与人机交互
第5章
智能驾驶人机交互系统算法基础
案例导入:面向智能驾驶的VarGNet网络结构设计1人机交互系统中的深度学习基础2人机交互系统中的机器视觉算法基础3人机交互系统中的语音识别算法基础4人机交互系统中的大语言模型基础VarGNet轻量化网络VarGNet通过组卷积固定通道数、减少层间特征图,实现高效边缘端部署。组卷积参数量为标准卷积的1/g。VarGNet设计:平衡计算强度+减少中间特征映射。在ImageNet上1.0x模型top1=74.04%,优于MobileNetv1。CNN基础CNN由卷积层、激活函数、池化层、全连接层构成,LeNet‑5是经典结构。卷积:打破知识桎梏,回归事物本源思考,不照搬经验。ReLU解决梯度消失,池化降低特征尺寸。全连接层整合特征,Softmax输出概率。训练与压缩模型训练需前向+反向传播,压缩技术(量化、剪枝、知识蒸馏)适配边缘端。训练:小批量随机梯度下降,调参技巧(激活函数、学习率、防止过拟合)。压缩:硬件(GPU/FPGA/ASIC)、框架(推理引擎)、算法(轻量化、剪枝、量化)。量化:PTQ(后量化)和QAT(量化感知训练)。图像分类模型ResNet、DenseNet、MobileNet等模型各具特色,满足不同精度/效率需求。ResNet:残差块解决深层难训练。DenseNet:稠密块,特征重用,参数少。MobileNet:深度可分离卷积,计算量仅常规1/8~1/9。图像分类模型ResNet、DenseNet、MobileNet等模型各具特色,满足不同精度/效率需求。ResNet:残差块解决深层难训练。DenseNet:稠密块,特征重用,参数少。MobileNet:深度可分离卷积,计算量仅常规1/8~1/9。深度学习概述AI>ML>DL传统ML:人工设计特征→提取→分类器预测。DL:端到端训练,特征提取与分类联合优化。深度学习三要素:神经网络模型、损失函数、优化方式(反向传播+梯度下降)。CNN基础LeNet-5:卷积→池化→激活→全连接→输出。局部感知:每个神经元仅连接输入图像一块区域。权值共享:卷积核权重被整张特征图共享。卷积计算:5×5图像经3×3卷积核(stride=1)得3×3特征图,对应元素相乘累加。CNN基础激活函数:引入非线性。Sigmoid(易梯度消失)、ReLU(解决梯度消失,计算简单)。池化层:降低特征图尺寸。MaxPooling、MeanPooling、GlobalAveragePooling。BN层:使每层输入均值为0方差1,加速收敛,缓解梯度消失,具正则化效果。损失函数:分类用交叉熵,回归用MSE/SmoothL1。损失=平均训练误差+正则化项(L1/L2)。分类模型训练与模型压缩训练:前向传播(计算图)+反向传播(链式法则)。采用小批量随机梯度下降(MBSGD),batchsize、epoch、iteration。调参技巧:隐层用ReLU、学习率衰减、防止过拟合(数据增强/Dropout/正则化/早停)。模型压缩:轻量化结构(MobileNet深度可分离卷积)、知识蒸馏(教师-学生)、剪枝(非结构化/结构化)、量化(FP32→INT8)。分类经典模型VGG:多个3×3小卷积核替代大卷积核,减少参数量。ResNet:残差块(快捷连接),解决退化问题,可达152层。DenseNet:稠密块,每层输入来自前面所有层输出,加强特征复用。GoogLeNet:Inception模块,1×1卷积降维,多分支并行提取不同尺度特征。MobileNet:深度可分离卷积(Depthwise+Pointwise),计算量减少8~9倍。V2引入线性瓶颈层和反转残差块。目标检测FasterRCNN:RPN生成Anchor候选框,ROIPooling缩放,全连接层输出分类和回归。YOLO系列:端到端,划分网格预测BBox和置信度。v2加入BN/Anchor/多尺度;v3加入ResNet/FPN/多logistic分类。FCOS:Anchor-Free,逐像素预测到GT四边距离(l,t,r,b)。FPN解决重叠框歧义,Center-ness抑制低质量框。。图像分割语义分割:像素级分类;实例分割:区分不同个体;全景分割:实例+背景。FCN:全卷积+反卷积上采样,端到端分割。MaskRCNN:FasterRCNN加Mask分支,ROIAlign替代ROIPooling。DeepLab:空洞卷积扩大感受野,ASPP模块,V3+编解码结构。PSPNet:金字塔池化模块融合局部和全局上下文。关键点检测、OCR与3D检测关键点检测:回归目标点、heatmap、heatmap+offsets。应用:车轮接地点检测生成车辆3D框。OCR:文本检测(CTPN/CRAFT/EAST)+文字识别。3D目标检测:输出中心点/长宽高/航向角/速度。评测AP_3D、AP_BEV、PKL。数据集:KITTI、nuScenes、WaymoOpen。点云检测:VoxelNet(体素特征编码VFE)、PointNet(顺序不变性)。图像检测:FCOS3D(Anchor-Free,逐像素预测)。多模态融合:早期融合(区域/点云级别)、中间融合(特征层)、后期融合(结果融合)。语音识别框架语音识别由声学模型、语言模型和解码器组成,基于贝叶斯公式最大化后验概率。贝叶斯公式:Ŵ=argmaxP(O|W)·P(W)。声学模型:GMM‑HMM→DNN‑HMM(CNN/LSTM)。语言模型:N‑gram(平滑)→神经网络(FNN/RNN/LSTM)。端到端与大模型端到端模型(CTC、Attention、Transformer)简化传统链路,大模型(LLM)具备涌现能力。CTC:引入blank解决长度不匹配。Attention:Encoder‑Decoder+注意力机制。Transformer:完全自注意力,摒弃RNN。LLM训练:预训练→指令微调→对齐(RLHF)。多模态大模型ViT统一图像与文本架构,CLIP实现图文对齐,LL
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 新一代信息技术行业办公自动化指南
- 中小学教育发展“十五五”规划(2026-2030年)
- 人工智能在机器学习中的实践指南
- 网络安全漏洞扫描与风险评估手册
- 美的发现和谐的造诣-小学主题班会课件
- 深度解析数据科学分析指南
- 银行信贷风险评估员信用评价KPI考核表
- 勤奋刻苦小学者,小学主题班会课件
- 涉及2026年7月份合同付款安排的通知函(6篇范文)
- 园区安保巡逻路线规划方案
- 防灾减灾安全知识普及课件
- 《JBT 7052-2024六氟化硫高压电气设备用橡胶密封件技术规范》专题研究报告
- 体重管理门诊工作制度
- 2026年低碳技术与城市可持续发展
- 建筑材料检测送检指南(机电类)
- 平台防腐施工方案(3篇)
- 北京市第四中学2026届高一数学第二学期期末联考试题含解析
- 2025年国控私募基金招聘笔试题库及答案汇编
- 2025年消防员历年面试题及答案
- 闲鱼培训教学课件
- 天津博迈科海洋工程有限公司临港海洋重工建造基地一期工程环境影响补充报告简本
评论
0/150
提交评论