版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
硕士研究生人工智能专业情感计算技术教学设计
一、课程概述
本课程面向人工智能专业硕士研究生二年级开设,属于专业方向核心选修课,共计32学时,其中理论讲授16学时,实验实践16学时。课程定位于在学生已具备机器学习、深度学习、信号处理等前置知识基础上,系统构建情感计算(AffectiveComputing)领域的完整知识体系。课程内容涵盖情感计算的理论源流、情感建模的心理学与认知科学基础、单模态与多模态情感识别的前沿算法、情感合成与人机情感交互技术,以及贯穿全程的技术伦理与价值反思。课程旨在培养学生在情感计算这一交叉学科领域从事高水平学术研究或复杂工程创新的核心素养与批判性思维,使其能够精准识别科学问题、独立设计实验方案、严谨评估模型效能,并深刻理解技术对社会的情感重塑力量。
二、教学目标
(一)知识与技能目标
1.系统阐述情感计算的定义、学科边界与发展演进脉络,准确复述Picard经典定义及其当代延伸。【基础】
2.深刻辨析离散情感模型、维度情感模型与成分情感模型的数学表征、计算适配场景及根本性局限,并能够针对具体任务完成理论选型。【非常重要】【高频考点】
3.熟练实施基于面部图像、语音信号、外周生理信号及文本模态的情感特征提取工程,掌握OpenFace、Librosa、BioSPPy、HuggingFace等工具栈的核心调用与参数调优。【重要】
4.独立构建基于卷积神经网络、循环神经网络及Transformer架构的单模态情感识别模型,完成从数据加载、训练验证到性能评估的全流程代码实现。【非常重要】
5.深入掌握特征层、决策层、模型层多模态融合的核心范式,具备在给定数据集上设计并验证新型融合策略的算法创新能力。【难点】【热点】
6.概要描述情感合成主流技术路线及情感对话系统的基本架构,形成对人机情感交互闭环的整体认知。
7.精准识别情感计算全生命周期中的隐私泄露、算法偏见、知情同意缺失等伦理风险,能够依据公平性、可解释性、问责制等原则撰写伦理自评报告。【热点】
(二)过程与方法目标
1.通过顶会论文(如ACII、IEEETAFFC、CVPR)的精读与复现,掌握前沿文献的批判性研读方法与学术贡献判断准则。
2.在小组项目式学习中,经历“真实场景问题定义—公开数据集遴选或轻量化采集—基线模型建立—创新点引入—消融实验与鲁棒性分析—伦理审查—海报展示”的完整科研闭环。
3.运用对比分析思维,系统比较不同模态、不同融合架构、不同评价指标在相同任务上的性能差异与归因解释。
4.采用角色扮演与辩论赛等形式,沉浸式体验技术开发者、终端用户、监管机构等多方利益相关者在情感计算应用落地中的价值冲突与协商。
(三)情感态度与价值观目标
1.树立“科技向善”的情感计算发展观,拒绝技术万能论与情感简化论,在算法设计中主动融入对人类情感复杂性与文化异质性的尊重。
2.激发对情感智能前沿领域的学术敬畏与探索热忱,形成以解决真实世界情感困境(如孤独症辅助、数字药物、职场倦怠干预)为使命的研究志趣。
3.养成严谨诚实的学术伦理习惯,在数据标注、实验记录、结果报告中恪守客观性原则,不刻意美化指标、不回避失败案例。
三、教学重点与难点
(一)教学重点
1.情感计算核心技术体系的完整构建:包括基于FACS的面部动作单元识别、语音声学特征与韵律特征映射、生理信号时频域特征提取、文本情感分析预训练模型微调。【非常重要】
2.深度学习时代情感识别模型的算法原理与实现范式:以ResNet、LSTM、Transformer为代表的骨干网络如何适配情感任务的特殊性(类间模糊性、个体差异性、环境非受控性)。【重要】【高频考点】
3.多模态融合方法论:从朴素拼接至协同注意力、跨模态Transformer、对比学习对齐等高级融合机制的演进逻辑与适用边界。【难点】【热点】
(二)教学难点
1.情感标注的“金标准”悖论:自报告、专家编码、生理反应三者间本体论冲突,如何在不完备监督信号下训练有效模型。
2.非受控环境下的鲁棒识别问题:大角度姿态、面部遮挡、环境噪声、信道失配、个体基线漂移等因素对特征分布的严重扭曲及相应解耦策略。
3.生理信号情感解码的特异性困境:皮电、心率、脑电等信号易受运动、觉醒度、药物等非情感因素污染,情感与生理反应并非一一映射。
4.可解释性与黑箱模型的对立:临床或心理干预场景要求模型输出具备因果可解释性,而端到端深度网络难以提供符合人类认知归因的逻辑链。
5.情感计算公平性的量化度量:如何定义并测量不同人口属性分组(种族、性别、年龄、语言)间的性能差异,并设计再平衡算法。
四、教学方法与手段
本课程全面践行“以学生为中心、以问题为纽带、以创新为指向”的研究型教学理念,构建“理论精讲—论文工坊—代码轮转—伦理辩论—项目驱动”五维一体教学模式。
1.启发式精讲:教师以“核心概念辨析—经典工作局限性—前沿工作突破点”三元结构组织每一讲,频繁设置认知冲突点,例如追问“如果维度模型更连续,为何业界仍广泛使用离散标签?”“自注意力机制是否完全优于循环结构?”以此激发高阶思维。
2.论文工坊(PaperWorkshop):每两周围绕一个子领域(如微表情识别、跨语料库语音情感、生理信号自监督学习),安排一组学生进行15分钟顶会论文领读,重点剖析动机、方法与实验缺陷,教师进行5分钟深度追问与升华。
3.代码轮转(CodeRotation):实验课采用“填空式脚手架—魔改式挑战—开源贡献式创新”三级任务,学生需在JupyterLab环境中迭代代码并提交Git仓库,教师通过Gitiles审阅并嵌入行内注释。
4.伦理法庭(EthicsMootCourt):设置情感计算商业化落地争议性案例,学生分组扮演原告、被告、专家证人、陪审团,在模拟法庭辩论中内化伦理原则。
5.混合式支持:依托学校CanvasLMS平台,发布每讲预习自测题、拓展阅读包(含经典论文与代码仓库链接)、实时互动词云及匿名困难投票。
五、教学资源与环境
(一)物理环境
授课地点为学校智慧教室B201,配备86寸4K交互智能平板、360度吊麦拾音系统及分组研讨投屏器,支持多屏互动与板书实时OCR。实验环节在人工智能学院高性能计算中心进行,单节点配置双路IntelXeonGold6330CPU、四块NVIDIAA5000GPU,学生可通过JupyterHub多用户实例并发访问,每人分配5GB持久化存储空间。
(二)软件与数据生态
1.基础环境:Ubuntu22.04LTS,Python3.10,CUDA11.8,PyTorch2.1.0(主框架),TensorFlow2.13.0(对照实验)。
2.专用工具库:OpenFace2.0(面部特征点与AU提取)、Librosa0.10.1(音频分析)、BioSPPy0.8.0(生理信号处理)、MNE-Python1.5.0(脑电)、HuggingFaceTransformers4.35.0(文本与多模态)。
3.核心数据集(提供部分子集或预处理版本):
1.4.面部:CK+,FER2013,Aff-Wild2,SAMM(微表情)。
2.5.语音:RAVDESS,EMO-DB,CASIA,IEMOCAP。
3.6.生理:DEAP,MAHNOB-HCI,AMIGOS。
4.7.多模态:CMU-MOSI,CMU-MOSEI,CH-SIMS(中文)。
5.8.文本:GoEmotions,SemEval-2018Task1,情感树库SST-5。
9.参考资源:
1.10.主教材:PicardRW.AffectiveComputing.MITPress,1997.(精读第1-3章)
2.11.核心参考:CalvoRA,D'MelloS,GratchJ,etal.TheOxfordHandbookofAffectiveComputing.OxfordUniversityPress,2015.(选读第4、7、12、22章)
3.12.前沿文献:近三年IEEETransactionsonAffectiveComputing、ACII会议、CVPR/ICCV情感分析专题、ACL情感计算相关长文。
六、教学实施过程
(本环节为核心教学单元,对应第3至第10周,共16学时理论、8学时实验,合计24学时。以下按主题模块递进展开,详尽罗列每一知识要点、师生活动设计、重要度标记及时间配置。)
(一)模块一:情感计算学科源流与理论地基(2学时理论,1学时实验)
1.第一学时:学科边界与情感模型批判
(1)锚点导入(10分钟):教师首先展示1997年MIT媒体实验室Picard团队原型系统——通过皮肤电导传感器监测用户计算机焦虑水平的照片与论文节选,随即展示2024年苹果公司关于“通过可穿戴设备推断情绪状态以推送自适应音乐”的专利纠纷报道。提出三个贯穿课程的核心悖论:【基础】
[1]情感若为私有体验,机器通过外部信号推断是否属于“读心”?
[2]情感计算追求的是预测人类自我报告还是预测客观生理指标?
[3]当机器情感识别准确率超过人类观察者一致性时,应以谁为黄金标准?
学生使用学习通发表至少20字见解,生成词云,教师抽取典型观点进行简评,明确情感计算的学科边界并非模拟或拥有情感,而是建立从可测量信号到情感状态的映射函数。
(2)离散情感模型深度解析(20分钟):教师系统回顾Ekman六基本情感及其跨文化研究,引出面部动作编码系统。重点剖析行动单元的组合逻辑,演示AU1+2+4构成惊讶,AU6+12构成真实喜悦。强调FACS虽是【重要】标注工具,但其情感分类标签的普适性近年来遭受跨文化心理学及神经科学强力挑战,例如俾格米人无法识别恐惧面孔。进而引出现代情感计算学界对基本情感模型的修正——增加轻蔑、尴尬等扩展集,或采用连续维度完全替代。此处插入选择题:对于人机交互中细微的恼怒程度分级,应优先选择离散模型还是维度模型?正确率低于70%则组织邻座互讲。
(3)维度情感模型数学表征(20分钟):教师引入效价-唤醒度二维坐标系,演示如何将具体情感状态映射为平面点(如愤怒:负效价、高唤醒度;悲伤:负效价、低唤醒度)。进一步讲解PAD三维模型(愉悦-激活-优势),重点推导优势度在交互场景中的意义(控制感)。教师手写推导从离散标签集到连续值回归的转换损失函数——平均绝对误差与一致性相关系数CCC,强调CCC同时惩罚均值偏移与相关性降低,是【高频考点】。为加深理解,教师现场执行Python代码片段,构造两组伪情感序列,计算并对比皮尔逊相关系数与CCC的数值差异,学生直观看到即使趋势一致但数值尺度不同时CCC显著降低。
(4)成分理论与多模态启发(10分钟):介绍Scherer情感成分理论,情感由认知评价、生理反应、表达行为、主观感受与行为倾向五成分同步耦合而成。教师提出关键推论:既然情感是多成分的,不同传感器捕捉的恰是不同成分——摄像头捕捉表达行为,皮电/心率捕捉生理反应,文本捕捉认知评价。因此多模态融合不是冗余信号的叠加,而是对情感本体的不同侧面采样。【非常重要】【热点】
(5)实验衔接:布置课后预习任务,要求学生观看一段5分钟情感对话视频(选自电影《她》片段),尝试分别用离散标签、VA坐标、成分列表三种方式描述主角情感状态,下节课前5分钟随机提问。
2.第二学时:情感标注不可通约性与评价指标精讲
(1)情感标注困境沉浸式体验(25分钟):教师展示同一段30秒真实客服投诉录音,并提供三种标注结果——标注员A依据面部表情标注愤怒、标注员B依据语音语调标注中性、顾客事后自评标注挫败。组织2分钟小组讨论:若你是算法工程师,应采用谁为标准?各组陈述理由。教师升华:情感不存在客观真值,标注是特定理论视角下的操作化定义。当前解决方案路径有三:【难点】
[1]众包标注求平均,以分布代替硬标签(软标签回归)。
[2]多标注者噪声建模,同时学习样本真实标签与标注者偏差。
[3]彻底放弃监督学习,转向自监督学习从信号本身学习表征,不依赖标签。
教师指出,第[3]条是近年情感计算顶级会议最【热点】方向,为后续自监督学习模块埋下伏笔。
(2)评价指标严谨辨析(20分钟):教师以混淆矩阵为起点,逐层展开。
[1]分类任务:面对情感类别极度不平衡(如真实对话中中性占70%,愤怒仅5%),准确率完全失效。宏平均F1-score给予小类同等权重,是更诚实指标。教师展示同一模型在相同数据上准确率92%、宏F1仅63%的真实案例,令学生深刻震惊。
[2]回归任务:除CCC外,可考虑可解释的均方根误差。教师额外补充情感识别特定指标——情感一致性误差,既考虑数值误差也考虑序关系错误。
[3]序数分类:引入二次加权卡帕,惩罚相距更远的错误等级。
此部分为【重要】且【高频考点】,教师要求学生现场完成一道计算题:给定5个样本的预测概率与真实离散标签,手工计算准确率与宏F1。
(3)实验课衔接(预留45分钟实验):学生登录JupyterHub,加载FER2013测试集子集,运行教师提供的ResNet18预训练模型,输出混淆矩阵,识别最易混淆的情感对,并在讨论区提交100字原因分析。教师全程在线答疑,重点关注学生是否能够将混淆原因(如恐惧与惊讶共享AU1+2)与理论知识关联。
(二)模块二:单模态情感识别技术纵深(6学时理论,4学时实验)
1.子模块一:面部表情识别(2学时理论,1.5学时实验)
(1)传统特征工程回溯(15分钟):教师以时间线展示从几何特征(特征点距离、曲率)到外观特征(LBP、Gabor小波)再到学习特征(卷积神经网络)的演进。强调2009年Viola-Jones框架在实时人脸检测上的里程碑意义。随即在JupyterNotebook中实时运行LBP+SVM全流程,在CK+数据集上获得约82%准确率,作为深度模型的性能基线。【基础】
(2)深度卷积网络革新(30分钟):教师以AlexNet为起点,重点剖析ResNet残差学习为何能有效训练152层网络,并展示在表情识别任务上,ResNet50较VGG16错误率降低近40%。详细讲解感受野与情感关键区域(眼部、嘴部)的对应关系——深层神经元能编码更大范围的面部肌肉组合。【非常重要】
[1]注意力机制在表情识别中的革命性应用:教师演示SENet模块如何自动学习为不同通道特征图加权,使模型更关注眼眶和嘴角区域。进而推广到CBAM同时关注空间与通道。
[2]现场编程实战(15分钟):教师发布一个“破损”的ResNet18训练脚本,其中数据增强部分缺失,要求学生补写随机水平翻转、随机擦除、色彩抖动三行代码。学生提交后,教师选取两份典型代码对比,强调随机擦除对模拟面部遮挡、提升泛化性的特殊价值。【重要】
(3)微表情识别专题(20分钟):微表情持续1/25至1/3秒,是【热点】且极具挑战领域。教师播放高速摄像机记录的诱导微表情片段,绝大多数学生无法肉眼察觉。讲解基于光流法的特征提取——通过计算相邻帧像素运动矢量场,放大微小平移。进一步介绍3D-CNN同时编码时空特征。指出数据集规模(CASMEII仅255个样本)是根本瓶颈,引出迁移学习(在大规模宏表情数据集预训练,在微表情数据微调)及小样本元学习。【难点】
(4)实验环节(1.5学时):学生分组完成两项任务。
[1]基础任务:在FER2013验证集上,分别训练教师提供的基线CNN与加入SE模块的CNN,提交两组准确率曲线对比图,并撰写50字结论。
[2]挑战任务:尝试使用SimCLR框架在无标签人脸数据集上进行对比预训练,再在FER2013上进行微调,验证自监督预训练对标注数据需求量的降低程度。此任务为学有余力者设置。
2.子模块二:语音情感识别(1.5学时理论,1学时实验)
(1)语音情感编码原理(20分钟):教师从语音产生机制切入,区分声道振动源(声带)与声道滤波器(口腔、鼻腔)。由此解释基频F0对应声带振动快慢,映射唤醒度;能量(振幅)映射强度;共振峰频率F1-F3反映舌头位置与嘴形,与特定情感音色相关。现场使用Praat软件可视化愤怒与悲伤语谱图,学生清晰看到愤怒语句高频能量显著集中。【基础】
(2)MFCC特征提取与演进(20分钟):教师分步讲解预加重、分帧、加窗、FFT、梅尔滤波器组、对数运算、DCT七步,阐明梅尔刻度模仿人耳低频敏感特性。强调MFCC是【重要】且【高频考点】特征,但仅捕捉谱包络,丢失激励源信息。因此现代语音情感识别常将MFCC与基频、抖动、闪烁等韵律特征拼接。
(3)时序建模LSTM与Transformer(30分钟):
[1]教师手绘LSTM单元门结构,结合语音情感渐变特性阐释遗忘门的关键作用——使模型保留愤怒情绪的累积效应。【重要】
[2]引出Transformer自注意力并行训练优势,在IEMOCAP上Wav2vec2.0微调模型超越LSTM基线约8%WA。但教师设置批判性思考环节:自注意力全局感受野是否永远优于循环局部归纳偏置?对于短语音片段(<3秒),LSTM仍具参数量效率优势。【热点】
(4)跨语料库泛化难题(15分钟):展示模型在德语EMO-DB训练,在汉语CASIA测试准确率从84%骤降至39%。归因于语言、文化、录音环境、通道特性四重失配。简要介绍三种应对思路:【难点】
[1]对抗域适应:特征提取器欺骗域分类器,学习域不变特征。
[2]归一化技术:实例归一化消除全局统计偏移。
[3]多任务学习:主任务情感识别,辅任务语种识别(反向传播时梯度反转)。
(5)实验环节(1学时):学生使用Librosa从RAVDESS音频提取40维MFCC,构建LSTM五分类模型。教师提供基线代码,学生需自主调整LSTM层数、隐藏层维度及dropout率,寻找最优参数。提交最佳验证损失及对应超参数组合。
3.子模块三:生理信号情感识别(1.5学时理论,0.5学时实验)
(1)情感相关外周生理信号谱系(20分钟):教师逐一介绍皮肤电反应(情感唤醒度的金标准,但不能区分效价)、心率及心率变异性(迷走神经张力与情绪调节)、呼吸频率(急促多与愤怒/恐惧相关)、肌电(皱眉肌活动反映负效价)。强调脑电信号时间分辨率毫秒级,前额叶Alpha波不对称性与趋近/回避动机强烈相关。【重要】
(2)信号处理流水线(25分钟):以DEAP数据集中皮电信号为例,教师现场演示:
[1]去噪:低通滤波截止频率0.5Hz,去除高频噪声。
[2]分解:cvxEDA算法将皮电分解为相位成分与张力成分。
[3]特征提取:计算相位成分的均值、峰值个数、上升时间半衰减时间。
同时展示心电R波检测算法(Pan-Tompkins),计算RR间期,进而导出时域SDNN、频域LF/HF比值。学生直观体会生理信号处理的繁琐与易错,理解为何深度端到端方法仍难以完全替代人工特征。【难点】
(3)端到端与自监督探索(15分钟):教师介绍使用1D-CNN直接处理原始心电波形,但需要海量标注数据。进而引出对比预测编码在生理信号上的应用——通过预测未来隐状态学习强大表征,在下游情感分类任务中仅需少量标签即可达到良好性能。【热点】
(4)伦理强化环节(5分钟):播放新闻片段:某企业未经员工同意在工牌中集成皮电传感器,依据紧张程度进行隐性绩效评估。组织简短辩论:生理信号的生物识别属性是否应受特殊法律保护?学生不记名投票,结果显示90%以上支持严格监管。教师总结:情感计算从业者应推动“知情同意+数据最小化+目的限制”三大原则在生理数据采集中落地。【非常重要】
4.子模块四:文本情感分析(1学时理论)
(1)从词汇到上下文(20分钟):教师对比SentiWordNet词级情感强度赋值与Word2Vec静态词向量,前者忽略句法结构,后者缺乏情感判别性。以“这部电影野心勃勃,但最终迷失在自我重复中”为例,单纯正向词“野心勃勃”掩盖了整体批评意图。由此引出双向LSTM捕捉上下文,但仍难以处理长距离依赖与否定范围。【重要】
(2)预训练语言模型革命(20分钟):讲解BERT通过掩码语言模型与下一句预测在大规模语料预训练,微调时仅需增加简单分类层。展示HuggingFace库加载情感分析pipeline的极简代码。进一步介绍RoBERTa、DeBERTa等优化变体。指出GPT系列在零样本情感分类上的潜力,但存在情感概念漂移问题。【高频考点】
(3)细粒度与多语言(10分钟):简要介绍基于方面级情感分析,针对“价格便宜但质量一般”识别出价格正面、质量负面两个观点。及跨语言零样本迁移——利用高资源语言微调,在低资源语言测试。呼应语音跨语料库挑战。
(4)课内实践(10分钟):学生以学习通分组形式,使用Blob与BERT-base-Chinese分别处理10条商品评论,对比二者在讽刺评论上的失误案例,截图上传讨论区。
(三)模块三:多模态情感计算——融合的艺术与科学(4学时理论,2学时实验)
1.第一学时:融合范式层次论
(1)认知冲突导入(10分钟):教师展示仅使用音频、仅使用视频、使用音视频融合的三种情感识别准确率柱状图。引人深思的是,融合并非总是优于最优单模态。提问:何时融合产生负效益?学生猜测答案:当模态间存在语义冲突、时间错位或某一模态信噪比极低时。从而引出融合时机与权重分配是需精细设计的科学问题。【非常重要】
(2)特征层融合(15分钟):最简单形式——对齐后拼接。以CMU-MOSI数据集为例,文本特征维度768,视觉特征维度35,语音特征维度74,拼接后877维。教师演示使用PCA降维消除冗余。强调特征层融合前提:模态严格时间对齐且缺失值已填充。优点:端到端可微,交互早;缺点:模态间异质性造成维度灾难,模型易过拟合。【基础】
(3)决策层融合(15分钟):各模态独立训练,预测阶段加权平均。教师导出最优权重可通过网格搜索或元学习求解。以RAVDESS音视频融合为例,固定音频模型,改变视频权重从0到1,绘制准确率变化曲线,发现最优权重在0.6附近。优点:鲁棒性强,某模态缺失仍能工作;缺点:无法捕捉模态间相关特征(如看到微笑同时听到笑声,这种联合效应被割裂)。【基础】
(4)模型层融合(20分钟):教师重点讲解。
[1]基于注意力机制:以文本特征为查询,与视觉特征计算注意力权重,实现用文本语义引导视觉关注区域。展示多头注意力输出拼接后的情感分类头。【重要】
[2]基于张量融合:计算各模态特征外积,生成高阶交互特征张量,但维度爆炸。讲解低秩张量分解作为近似解法。【难点】
[3]基于循环一致学习:引入循环一致性损失,约束从视觉特征重构语音特征应尽可能保真,反之亦然,强制模态对齐。【热点】
2.第二学时:前沿多模态架构精讲与复现
(1)MulT定向成对注意力(25分钟):教师以MulT论文原始架构图为核心,细致讲解如何为每对模态分支构建定向成对Transformer。以视觉→听觉分支为例,视觉序列作为Query,听觉序列作为Key/Value,实现从听觉中检索与当前视觉内容相关的信息。叠加位置嵌入以处理模态间异步性。在IEMOCAP数据集上,MulT将CCC从0.70提升至0.76。现场拆解MulT开源代码核心模块,指导学生阅读positional_embedding与crossmodal_attention部分。【热点】【非常重要】
(2)异质模态鸿沟与对比学习(15分钟):针对文本与生理信号这种异质模态,直接交互困难。教师引入CLIP思想:构建双编码器,通过对比损失拉近匹配情感-模态对的嵌入距离,推远不匹配对。展示在DEAP生理+文本描述数据上,对比学习方法显著提升零样本情感分类能力。【重要】
(3)缺失模态鲁棒性(10分钟):介绍基于知识蒸馏的多模态补全策略——训练期间使用完整双模态数据训练教师网络,测试时当某一模态缺失,学生网络仅凭单模态模仿教师输出。在CMU-MOSI上模拟文本缺失,相比直接丢弃模态,F1提升12个百分点。【热点】
(4)实验环节(2学时连上):小组攻关任务。
[1]基线复现:每组领取CMU-MOSI情感二分类任务,运行教师提供的特征拼接模型,记录测试集准确率与F1。
[2]策略修改:各组在以下方向中择一进行魔改,限45分钟:实施决策层加权融合并搜索最优权重;在任意两个模态间插入单头协同注意力;实现低秩张量融合层(秩R=5)。
[3]成果展示:后30分钟各组轮流汇报(每组2分钟),展示修改后性能增益或损失。教师逐组点评,将成功经验共享至班级仓库。此环节将理论落至代码,学生普遍反映对多模态融合理解深化。
3.第三学时:情感计算闭环与合成技术概览
(1)情感合成技术速览(20分钟):教师展示情感语音合成——以Tacotron2为基,在编码器端注入情感one-hot向量或情感嵌入,控制合成语音的基频与时长轮廓。及面部动画生成——输入语音或文本,驱动三维顶点移动以匹配情绪。现场播放英伟达Audio2Face实时演示,学生体验仅改变语音语调即可实时改变数字人表情。【基础】
(2)人机情感交互回路(15分钟):构建完整感知-理解-决策-表达循环。以孤独症儿童社交训练机器人QTrobot为例,机器人感知儿童注视时长与面部表情,推断其兴趣程度,决策是继续当前话题还是切换至儿童更偏爱的内容,并通过语音情感与眼神接触进行反馈。【热点】
(3)课程思政与伦理强化(15分钟):教师再次回归伦理主线。展示2023年斯坦福大学研究:主流情感识别API对黑人面孔的负性情绪识别率显著高于白人面孔,且开发者并未在技术文档中披露此偏差。学生小组讨论3分钟:作为开发团队,应如何在产品设计阶段预防此类偏差?各组产出关键词:多元化测试集、人口统计学分组评估、差异化阈值、可解释性报告。教师提炼为“公平性设计”四维度。【非常重要】
(四)模块四:项目开题与学术规范(1学时理论)
1.项目目标与范围发布(10分钟):教师正式发布本课程终结性大作业——小组情感计算创新项目。任务自选场景,鼓励与导师科研课题或既往实习经历结合。必须包含要素:
[1]明确的问题定义:例如“面向在线大班课的学生投入度非接触式估计”或“基于多模态信号的驾驶员路怒倾向早期预警”。
[2]数据集:首选公开数据集,如无可用数据可自行采集(需附伦理审查说明),规模不少于200样本。
[3]核心算法:至少包含一种单模态识别模型,并尝试多模态融合,鼓励创新模块设计。
[4]实验分析:必须包含消融实验、鲁棒性分析或公平性审计之一。
[5]伦理清单:回答是否获得知情同意、是否匿名化、是否存在误用风险、是否进行公平性评估等8个问题。
2.评价量规详解(10分钟):教师展示评分细则表(非表格,口语化描述)。创新性(30%)强调问题新颖性或算法组合独特性;技术难度(30%)考量模态数量、融合复杂度、模型前沿性;完成度(25%)指代码可运行、结果可复现、海报逻辑清晰;伦理反思(15%)审视野心与应对策略。
3.组队与开题报告要求(5分钟):4人一组,需异质性背景(鼓励计算机、自动化、心理、设计等交叉)。第9周提交开题报告(PDF,含问题陈述、可行性分析、基线实验初步结果)。教师提供历年优秀选题范例。
4.互动答疑(15分钟):学生现场提问,集中澄清数据集版权、算力配额、组员冲突解决机制等事宜。
七、教学评价与反馈
(一)形成性评价构成
1.随堂应答与微辩论参与度(10%):基于学习通自动记录,累计主动发言、投票、提交词云次数,突出过程激励。
2.编程任务单元作
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026网约车项目面试题及答案
- 2026袭医事件面试题及答案
- 2026小建筑会计面试题及答案
- 职工思想动态调研报告2026(3篇)
- (2026年)医疗技术咨询服务合同
- 2026-2031年中国活动设备行业市场调查研究及发展前景预测报告
- 2025-2026学年河北省保定市安新县四年级数学下学期期中教学质量检测试题(含答案解析)
- 北京门头沟区事业单位招聘笔试真题2025
- 金昌市托育综合服务中心招聘聘任制工作人员笔试真题2025
- 邛崃市教育系统招聘笔试真题2025
- 2026年自来水公司客户综合运维招聘考试笔试试题(含答案)
- 2026心肺复苏理论考试试题及答案
- 24J113-1 内隔墙-轻质条板(一)
- 精神病学(医学高级):儿童少年期精神障碍试题及答案五
- 产品合格证标签卡模板
- 三年级下册数学计算题300道及答案
- JGT366-2012 外墙保温用锚栓
- 抗震支吊架采购及安装工程合同
- JJF 1427-2013微机电(MEMS)线加速度计校准规范
- GB/T 2918-2018塑料试样状态调节和试验的标准环境
- GB/T 21709.9-2008针灸技术操作规范第9部分:穴位贴敷
评论
0/150
提交评论