机器学习方法及应用(第二版)课后习题及答案 袁景凌 第1-9章_第1页
机器学习方法及应用(第二版)课后习题及答案 袁景凌 第1-9章_第2页
机器学习方法及应用(第二版)课后习题及答案 袁景凌 第1-9章_第3页
机器学习方法及应用(第二版)课后习题及答案 袁景凌 第1-9章_第4页
机器学习方法及应用(第二版)课后习题及答案 袁景凌 第1-9章_第5页
已阅读5页,还剩32页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《机器学习方法及应用(第二版)》

课后习题参考答案

第1章习题参考答案

1.什么是学习和机器学习?为什么要研究机器学习?

答:学习是人类与动物通过经验、观察、练习不断改进行为、提高判断与决

策能力的过程,本质是从数据和反馈中提炼规律、降低不确定性、增强泛化。

机器学习是人工智能的核心分支,研究如何让计算机不用显式编程,就能从

大量数据中自动学习模型与规则,并对未知样本做出预测、分类或决策。它把“人

工总结规则’’变成"算法自动拟合分布",更适配复杂、高维、动态场景。

为什么研究机器学习:

现实问题往往规则模糊、变量海量、变化极快,传统程序难以穷举。机器学

习能高效挖掘隐藏模式、自动迭代优化,在图像语音、自然语言、自动驾驶、科

学计算、金融风控、医疗诊断等领域显著提升效率与精度。长远看,它是实现感

知、推理、自适应通用智能的关键技术,也是赋能产业、加速科研突破的基础工

具。

2.请简述人工智能、机器学习和深度学习三者之间的关系。

答:从学科谱系看,三者呈严格嵌套递进关系。人工智能(AI)是顶层广义

学科范畴,旨在构建具备感知、推理、决策、自适应等类人智能行为的计算系统,

涵盖符号逻辑、知识工程、进化计算、机器人学与数据驱动方法等多元范式。

机器学习(ML)是人工智能的核心子域与主流实现路径,以统计学习理论

与优化方法为基础,研究如何使有限观测数据驱动模型自动泛化,解决分类、回

归、密度估计与序列预测等任务,弱化人工规则强编码依赖。

深度学习(DL)特指机器学习中基于深度堆叠非线性变换的表征学习分支,

依托多层神经网络架构实现端到端高阶抽象特征自动提取,大幅降低传统特征工

程约束,在复杂高维信号建模中具备显著容量优势。

三者关系严谨归纳为:AIDMLoDL,体现范式从规则演绎到数据归纳、

再到深度表征涌现的学术演进脉络。

3.学习策略通常有哪几种形式?

答:机器学习范式依据监督信息来源与优化准则,可划分为监督学习、无监

督学习、半监督学习与强化学习四大经典策略。从统计学习理论视角审视,所有

策略的核心收敛目标均为最小化期望风险,即模型在全概率分布上的全局泛化误

差。

然而由于真实分布不可知,算法首先直接拟合可观测数据・,最小化经验风险

(EmpiricalRisk),即训练集平均损失。单纯追求经验风险极小易导致过拟合,

模型过度记忆噪声而泛化失效。为此,学习策略普遍引入结构风险最小化

(StructuralRiskMinimization,SRM)准则。

结构风险通过在经验风险后追加刻画模型复杂度的正则化罚项,兼顾拟合能

力与泛化边界。例如监督学习SVM的间隔最大化、L1/L2正则,无监督聚类的

密度约束,均是SRM的具体体现。不同学习策略差异仅在于监督信号形式与数

据组织结构,底层收敛逻辑统一为:在控制结构复杂度前提下压制经验误差,从

而逼近真实期望风险最优解。

4.如何理解参数与超参数?

答:在机器学习建膜体系中,参数(Parameters)与超参数(Hyperparameters)

是两类层级严格区分、优化机制迥异的核心变量,共同决定模型容量与泛化性能。

参数为模型内部兀学习变量,是算法训练的直接求解对象。其核心作用是拟

合数据分布规律,无需人工预先设定,由损失函数结合优化器(梯度下降等)自

动迭代更新收敛。例如线性回归的权重系数、神经网络的连接权重与偏置项,均

通过最小化经验风险习得,直接承载模型表征能力。

超参数为模型外部预设配置变量,用于约束搜索空间、调控训练动态与正则

强度,不可由训练过程自动求解,需人工先验设定或外层策略调优。例如学习率、

正则化系数、网络层数、树深度等,其本质服务于结构风险最小化,通过限制模

型复杂度规避过拟合。

二者核心层级差异:参数是“模型学出来的规律”,超参数是“人为定好的

学习规则”;参数优化依托梯度反向传播,超参数调优依赖网格搜索、贝叶斯优

化等外层验证策略。

5.试分析监督学习、无监督学习和强化学习的关系与异同,并举例说明。

答:监督学习、无监督学习与强化学习是机器学习三大经典范式,其核心差

异在于监督信号形态与反馈延迟机制,共同构成从静态拟合到动态决策的方法论

谱系。

监督学习基于独立同分布标注数据(X,Y),旨在学习从输入到输出的确定性

映射,通过最小化经验误差实现预测泛化。典型任务如分类(图像识别)、回归

(房价预测),反馈即时且静态。

无监督学习仅利用无标签观测数据X,依据相似度、密度或隐变量结构挖掘

内在分布规律,不引入外部先验标签。典型任务如聚类(用户分群)、降维(PCA

特征压缩),侧重数据表征与探索。

强化学习建模智能体与环境的序贯交互马尔可夫决策过程,通过最大化长期

累积奖赏回报优化策略,监督信号稀疏、延迟且试错驱动。典型任务如博弈对抗

(AlphaGo)>机器人控制。

异同归纳:三者均依赖数据统计泛化;区别在于监督学习拟合静态映射,无

监督学习解构固有结构,强化学习优化动态行为序列。

6.试辨析判别模型和生成模型的联系与区别。

答:在统计学习框架下,判别模型与生成模型是监督学习中两类底层建模范

式,其核心分歧在于概率建模粒度与决策逻辑。

判别模型直接对后验概率P(Y|X)进行参数化拟合或学习确定性判别边

界。它不显式刻画输入数据的边缘分布,专注优化类别区分超平面,训练目标聚

焦条件风险最小化。代表算法包括逻辑回归、SVM、深度CNN,优势在于分类

边界锐利、泛化效率高,适配高维复杂判别任务。

生成模型则首先建模联合概率分布P(X,Y)=P(XIY)P(Y),通过贝叶斯推理

间接求得后验,即P(YIX)=P(X,Y)/P(X)O它致力于还原数据生成机理与密度流

形,具备完备概率解释,代表算法有朴素贝叶斯、隐马尔可夫模型、GAN与VAE,

优势在于可采样生成新样本、抗噪声先验嵌入能力强。

二者根本区别:判别模型学习决策边界,是判别聚焦式;生成模型学习数据

分布,是生成机理式。实践中前者判别精度常占优,后者表征与创作能力独特。

7.试从一个角度简述机器学习系统的基本结构,并说明各部分的作用。

答:从工程实现视角审视,经典监督学习系统呈五阶段链式流水线结构,各

模块串行耦合、逐级抽象,完成从原始信号到决策输出的泛化映射。

(1)原始数据(RawDataAcquisition)

系统输入基底,为未经归一化的高维观测信号(像素、波形、文本字符)。

其承载全域信息但含大量冗余噪声,分布无序,无法直接建模。

(2)特征提取(FeatureExtraction)

人工先验驱动的信息筛选层。依据领域知识易J除无关维度,统订关键物理量,

将原始高维传感数据映射为低维语义向量,降维去噪、保留判别内核。

(3)特征转换(FeatureTransfonnation)

数值空间优化正则层。通过标准化、正交化、核映射等变换,解耦特征相关

性、缩放梯度敏感区间,规整流形边界,极大提升后端模型收敛稳定性与泛化裕

度。

(4)预测器(Prediclor/ModelInference)

核心假设拟合模块。输入规整特征向量,依据习得参数计算条件概率或打分

函数,输出对未知样本的类别判决或回归估值,实现经验风险最小化推理。

(5)结果评估(ResultEvaluation)

闭环反馈校验层。通过损失函数与泛化指标量化预测偏差,反向指导特征取

舍、超参调优与结构更新,完成系统闭环迭代优化。

原始数据——►数据预处理--特征提取——-特征转换--------预测----------结果

特征处理浅层学习

8.通过网络查找资料,详细介绍一个深度学习典型应用。

答:医学影像智能诊断是深度学习在医疗领域的成熟应用,以卷积神经网络

(CNN)为核心技术,实现对CT、MRkX光等医学影像的病灶自动检测、分

割与分类,辅助临床诊断。

技术架构:以U-Net.ResNet等CNN模型为基础,构建端到端诊断系统。

原始医学影像经预处理(归一化、去噪、增强)后,通过多层卷积与池化提取病

灶纹理、形态、边界等深层特征,再经全连接层输出病灶类别与概率。3DCNN

可处理三维影像,实现肿瘤、血管等结构的精准分割。

核心流程:①数据层:构建标注数据集,涵盖正常与病变影像;②模型层:

迁移学习预训练模型,适配小样本医疗数据,提升泛化能力;③推理层:实时处

理影像,输出病灶位置、类型及置信度;④评估层:以准确率、AUC、漏诊率为

指标优化模型。

应用价值:肺部结节筛查中,U-Net模型准确率达97.3%,较传统CAD系

统漏诊率降低62%;糖尿病视网膜病变诊断中,ResNct50模型AUC达0.92。

该应用可提升早期疾病检出率,缩短诊断时间,缓解医疗资源短缺,推动精准医

疗发展。

9.请列举出你生活和学习中遇到的机器学习系统安全问题。

答:在日常交互与学术实验中,机器学习系统普遍暴露数据、模型、推理三

层安全脆弱性,具体可归纳四类典型风险。

训练数据投毒与隐私泄露日常推荐与校园考勤依赖用户行为画像,恶意样本

混入训练集即可诱导标签偏移;同时人脸、轨迹等高维特征易通过模型记忆反向

还原,引发成员推断与原始数据复刻泄露。

对抗样本规避与物理世界鲁棒缺陷手机解锁、门禁人脸核验易受微小噪声扰

动生成对抗贴纸,肉眼不可辨却可精准绕过分类边界;自动驾驶路标污渍、光影

畸变亦可触发致命误判,体现梯度敏感性安全缺陷。

模型权重窃取与知识产权侵权学术预训练开源模型与课堂实训微调权重,可

通过查询API置信度分数进行模型萃取与超参复刻,导致科研成果与商用底座

结构性盗用。

后门植入与偏见决策安全数据集隐蔽触发器嵌入后,正常输入表现合规,特

定水印激活恶意输出;同时招生、信贷模型继承数据固有偏见,引发算法歧视与

决策不可信安全事故。

10.机器学习系统的安全属性有哪些?淡淡你对它们的理解。

答:由全国信息安全标准化技术委员会等部门发布的《人工智能安全标准化

白皮书(2019版)》中给出了人工智能的安全属性,这些基本安全属性同样适用于

机器学习系统。下面做简单介绍。

(1)保密性(Confidentiality):确保机器学习系统在生命周期任一环节(如

采集、训练、推断等),算法模型和数据不被泄漏给未授权者。如防范模型窃取

攻击。

(2)完整性(Integrity):确保机器学习系统在生命周期任一环节(如采集、

训练、推断等),算法模型、数据、基础设施和产品应用不被植入、篡改、替换

和伪造。如防范对抗样本攻击、数据投毒攻击。

(3)可用性(Availability):确保对机器学习算法模型、数据、基础设施、

产品应用等的使用不会被不合理拒绝。可用性包括可恢复性,即系统在事件发生

后迅速恢复运行状态的能力。

(4)可控性(Controllability):是指对机潜学习系统资产的控制能力,防止

机器学习系统被有意或无意的滥用。可控性包括可验证性(verifiability),可预

测性(predictability),可验证性是指机器学习系统应留存记录,能够对算法模型

或系统的有效性进行测试验证。

(5)鲁棒性(Robustness):指机器学习系统面对非正常干扰或输入的健壮

性。对机器学习系统而言,鲁棒性主要用于描述机器学习系统在受到外部干扰或

处于恶劣环境条件等情况下维持其性能水平的能力。鲁棒性要求人

(6)透明性(Transparency):提供了对机器学习系统的功能、组件和过程的

可见性。透明性并不一定要求公开其算法源代码或数据,而是根据机器学习应用

的安全级别不同,透明性可有不同的实现级别和表现程度。透明性通常包括可解

释性(Explicabilily)>可追溯性(Traceability),让用户了解机器学习系统中的

决策过程和因果关系。可解释性是指在机器学习应用场景下,算法特征空间和语

义空间的映射关系,使得算法能够实现站在人的角度理解机器。

(7)公平性(Fairness):指机器学习系统在开发过程中应当建立多样化的设

计团队,采取多种措施确保数据真正具有代表性,能够代表多元化的人群,避免

机器学习系统出现偏见、歧视性结果。

(8)隐私(Privacy):按照目的明确、选择同意、最少够用、公开透明、主

体参与等个人信息保护原则,保护公民的个人信息。

11.对于一个三分类问题,数据集的真实标签和模型的预测标签见表l-3o分别

计算模型的准确率、错误率、精确率、召回率和F1值。

表数据集的真实标签和模型的预测标签

数据集的真实标签模型的预测标签

112223333122233312

答:请先回顾124节评价指标相关内容。

已知样本总数N=9o

1.混淆矩阵

真实'预测123

111C

2021

3112

・正确预测数:1+2+2=5

2.准确率与错误率

•准确率=10.5556

・错误率=1-准确率=[比0.4444

3•每个类别的精确率、召回率与F1值

类别1

•TPi=1,FPi=1(预测为1但真实为3的样本),FM=1(真实为1但预测为2

的样本)

•精确率马=击=0.目

•召回率Hi=±=0.5

・FL=2x龊=0.5

类别2

・TP2=2,FP2=2(预测为2但真实为1和3的样本各一个),FN2=1(真实为2

但预测为3的样本)

•精确率B=/=0.5

•召回率=言=1%0.6667

・Fl2=2x然I=”0.5714

类别3

・TR=2,FR=1(预测为3但真实为2的样本),FN3=2(真实为3但预测为1

和2的样本各一个)

・精确率R=X系T1=J彳70.6667

•召回率斤3=弟=0.5

4

-

•GLFC=24xX0逐.5=7x0.5714

第8章习题参考答案

i.强化学习的核心机制是什么?

答:强化学习是面向序贯决策的自适应学习范式,其核心机制建立在智能体

与环境持续交互、试错反馈迭代、长期回报优化三者之上,区别于静态监督拟合

与无监督结构挖掘。

首先,系统将动态交互抽象为状态感知、动作执行、即时奖励评估与状态迁

移的闭环流程。智能体依据当前状态选择行为,式境响应后给HI即时奖惩并更新

态势,以此形成时序经验轨迹。

其次,学习不以瞬时对错为目标,而是权衡短期收益与长期累积价值,通过

延迟稀疏反馈修正行为偏好。智能体不依赖固定标签,仅通过试错中优劣轨迹对

比,逐步弱化低效动作、强化高回报策略。

最后,核心收敛依赖探索与利用平衡:既尝试未知行为规避局部最优,又复

用高置信经验稳定性能。通过价值估值或直接策略迭代,最终习得具备环境鲁棒

性的稳态决策映射,实现动态不确定性下的自主优化控制。

2.马尔可夫决策过程包含哪几个模型要素?分别是什么含义?

答:强化学习任务通常用马尔可夫决策过程(MarkovDecisionProcess,MDP)

来描述。马尔可夫决策过程是在环境中模拟智能体的随机性策略与回报的数学

模型,且环境的状态具有马尔可夫性质。马尔可夫决策过程被用于机器学习中强

化学习问题的建模。通过使用动态规划、随机采样等方法,马尔可夫决策过程可

以求解使回报最大化的智能体策略,并在自动控制、推荐系统等主题中得到应用。

马尔可夫决策过程包含五个模型要素,给定一个马尔可夫决策过程模型M=

<S,凡P,R,Y>

♦,是所有可能的状态(State)的有限集合;

♦4是所有可能的动作(Action)的有限集合;

♦W是一个状态的转移概率矩阵,妆,=叫又+i=si%=s,4=a];

♦灾是奖励(Reward)函数,=E[/?C+1|SC=s,At=a];

♦y是奖励衰减因子,ye[0,1],该因素会在后面的长期回报中涉及。

3.试推导马尔可夫决策过程的两个价值函数。

答:参见教材公式(8-1)〜(8-9)。

4.强化学习、监督学习和无监督学习的区别是什么?强化学习的应用场景有哪

些?

答:三者本质区别在于监督信号形态、反馈延迟机制及优化目标。监督学习

依赖独立同分布人工标注数据,旨在静态拟合确定性输入输出映射,反馈即时完

备;无监督学习仅利用无标签观测,依据密度相似度挖掘固有聚类流形结构,无

外部奖惩引导;强化学习建模马尔可夫序贯交互,依靠稀疏延迟回报试错迭代,

追求长期累积效用最大化,侧重动态行为控制而非静态数据重构。

在应用场景维度,强化学习天然适配动态博弈、资源调度、自适应决策三大

高维复杂领域。工业层面用于机器人精密操控、智能制造自适应排产;博弈推演

层面支撑人机对抗、集群多智能体协同攻防;商业运筹层面优化大规模广告竞价、

算力负载均衡与库存动态补货;前沿探索则赋能大语言模型人类偏好对齐

(RLHF)、核聚变稳态约束与自动驾驶极限规划,解决传统范式难以建模的长

周期、高随机、强依赖序列决策难题。

5.使用Q.Learning算法来运行井字游戏(也就是Tic-Tae-Toe)o

答:下面给出基于Q-Learning的井字棋(Tic-Tac-Toe)算法实现思路。

一、算法核心定位

Q-Learning是一种离线策略(Off-Policy)、基于价值的经典强化学习算法,

无需预先标注数据,仅通过智能体与环境不断对局试错,迭代更新状态・动作

价值表(Q・Table),最终习得最优对局策略。将其应用于井字棋,核心是让智

能体自主探索落子规律,掌握攻防博弈、抢先制胜与堵截对手的决策逻辑,适配

井字棋有限离散状态、规则极简、胜负明确的博弈特性。

二、环境与状态空间建模

首先完成井字棋标准化建模,构建可交互的马尔可夫决策过程(MDP)。棋

盘为3x3九宫格,定义三种格子状态:空位置(0)、智能体棋子(1)、对手

棋子(2)。全局有限离散状态空间包含所有合法棋盘布局,剔除无效重复状态

后规模可控,便于Q-Table存储检索。

明确对局规则与终止判定:横向、纵向、对角线三子连线即获胜:棋盘填满

无连线为平局;任意一方落子违规(重复落子)直接判负。每一步交互闭环为:

观测当前棋盘状态一选择合法落子动作一环境更新棋盘一反馈即时奖励一进入

下一状态。

三、Q-Table初始化与超参数设定

Q-Table是算法核心存储载体,为二维键值矩阵:行索引为所有合法棋盘状

态,列索引为9个棋盘落子位置,单元格数值代表该状态下选择对应落子的长

期期望价值。初始时所有Q值统一置0,无任何先验博弈经验,完全依赖后续

试错更新。

设定三大关键超参数:学习率a(通常0.1-0.5),控制新经验对旧价值的

修正幅度;折扣因子?(通常0.9-0.99),权衡即时奖励与未来长期制胜收益;

探索率£(c-greedy策略,初始0.9逐步衰减),平衡随机探索新落子与复用最

优经验,避免局部最优策略。

四、奖励函数精细设计(收敛关键)

奖励函数引导智能体博弈偏好,极简且梯度明确:非法重复落子,给予大额

负奖励,杜绝违规操作;普通无胜负合法落子,给予微小零趋近奖励,不干扰长

期决策;成功堵截对手必胜连线,给予小额正奖励,强化防守意识;本局直接获

胜,给予大额正奖励;本局落败,给予大额负奖励。稀疏差异化奖励适配短周期

对局,加速策略收敛。

五、决策选择与Q值迭代更新

对局每一步采用"greedy策略选动作:以8概率随机选择合法空位置,探

索未知博弈路径;以1-£概率选取当前状态Q值最大的合法落子,复用最优经

验。

执行落子后套用经典Q-Learning更新公式修正价值:新Q值=旧Q值

+学习率x[即时奖励+折扣因子x下一状态最大Q值-旧Q值]。若对局

终止,直接截断未来价值项,仅用本局胜负奖励更新,精准复盘单局决策优劣。

六、训练收敛与实战推演

启动大规模迭代对局,前期智能体随机落子失误较多,随迭代轮数增加、8

逐步衰减,探索减少、利用增强,Q-Table持续拟合最优价值:优先抢占中心、

角部关键点位,预判对手三连威胁主动堵截,构建自身双杀必胜格局。收敛后保

存Q-Table,实战中无需迭代,直接查表输出最优落子,人类玩家难以轻易取胜,

完美实现从零博弈习得强攻防策略。

6.一幢10层的大楼有5架电梯。每一层都有两个呼叫按钮表示有人要上下楼,

除了顶层和底层只有一个呼叫按钮。当一架电梯到达并且有人进入电梯时,他们

按动想要到达楼层对应的数字按钮。每一架电梯存储数字并且上升或下降,停在

要求的每一层。计算系统的状态和动作空间,然后对这个系统描述一个合适的强

化学习器。你需要决定一个你认为最合适的奖赏函数和描述学习的方法。

答:

一、问题背景与系统约束建模

本系统为典型大规模多智能体序贯资源调度MDP:一栋10层楼宇配置5

部独立轿厢电梯;每层设上行、下行外部召唤按钮(底/顶层仅单向);轿厢内

部提供目标楼层选层按钮。系统核心动态耦合包含三类异步事件:厅外随机呼梯

到达、轿厢逐站启停开关门、乘客出入流变化。优化目标并非单梯最短路径,而

是在强抢占、高并发、随机泊松到达下最小化全局通行时延、能耗与拥堵概率。

二、状态空间(SlateSpace)严谨刻画

状态必须完备马尔可夫、可数值嵌入,主要向量维度包含:

1.每梯物理状态:当前楼层精确位置、运行方向(上/下/驻停)、

剩余载重、开关门延时计数;

2.分配任务队列:每梯内部目标停靠集合、已绑定厅外召唤驻留序列;

3.全局未接请求:各层上行/下行等待队列长度、已等待最大时延;

4.流量时空特征:时段归一化入流率、底层上行峰值、顶层下行峰值概

率分布。

状态空间离散组合虽大,但可通过栅格编码、嵌入网络降维表征,避免查表

爆炸。

三、动作空间(ActionSpace)规范定义

不采用原始启停微操,RL决策定义为高层分配与换向驻停动作:对每一个

新发厅外召唤,动作集合为5选1指派至某轿厢;同时对在役轿厢允许有限安

全换向/优先跳停策略约束。动作施加必须硬约束安全规则:不可反向穿越载

客、不可跳过己确认内呼、超载重强制直驶,将非法动作屏蔽于掩码,大幅降低

无效探索。

四、奖赏函数(Reward)工程正则化设计(收敛核心)

采用稠密整形+终端稀疏耦合,保证安全优先、时延驱动、能耗抑制:

1.安全硬惩罚:违规换向、超载开门、冲突抢层给予大额负奖赏;

2.等待时延代价:每步对所有未接等待队列施加负时延积分,倒逼快速

响应;

3.启停能耗正则:无谓频繁启停、空载长距行驶给予小负奖赏,平滑震

荡;

4.回合终端稀疏回报:全局平均等待时延下降、最大滞留尾响降低、拥

堵率下降给予正终奖。

该奖赏可梯度分解、可解释、不稀疏难传,适合长序列调度。

五、合适强化学习器与学习方法论证

系统高维连续状态、离散大动作、多智能耦合、非平稳流量,因此优先采用

集中式评分分布式执行的DuelingDQN/PPO掩码约束架构:

输入用多层MLP/CNN嵌入时空状态;输出加合法动作掩码屏蔽非法指派;

价俏分支评估长期拥堵累积优势,策略分支平滑调度随机性。训练采用多讲程并

行环境采样、经验回放去相关、目标网络稳估值,并引入流量迁移泛化:早高峰

/平峰/晚高峰分段预微调,实现在线增量适配,最终习得动态分区候梯、反向

插空分流、峰值优先底层保通的稳态调度策略,显著优于传统固定就近贪心算法。

第9章习题参考答案

i.当将自注意力模型作为一个神经层使用时,分析它和卷积层以及循环层在建

模长距离依赖关系的效率和计算复杂度方面的差异。

答:在深度序列建模中,自注意力(Self-Attention)、卷积(CNN)与循环

(RNN)三类神经层对长距离依赖的捕捉能力与计算代价存在根本性架构差异,

直接决定模型的感受野、梯度流通与时空复杂度上限。

首先从长依赖建模效率对比:循环层通过时序递推链式传递信息,理论感受

野无限,但长序列梯度极易指数衰减,必须逐步迭代才能关联首尾,长依赖建模

低效且脆弱;卷积层依靠局部滑动窗口堆叠深层扩张感受野,依赖多层叠加间接

捕获远距离关联,远距离交互弱、归纳偏置强,缺乏动态权重适配;自注意力通

过直接计算全局两两位置相似度,一步建立全序列长依赖关联,动态生成权重不

受距离约束,梯度直通无衰减,是三者中长依赖建模最高效、最直接的范式。

其次从计算复杂度严谨分析:设序列长度为n、隐维为d,循环层时序计算

复杂度为O(nd2),无法并行推理、时序延迟高;标准一维卷积复杂度约O(knd2)

(k为卷积核尺寸),长依赖需增大k加深网络,代价线性攀升;自注意力原

生复杂度为严格平方级O(n2d),短序列优势显著,超长序列则算力显存开销激

增。

综上学术定论:循环层时序串行、梯度脆弱、低并行;卷积层局部归纳、间

接扩野、中等算力:自注意力全局直达、动态适配、高效长依赖但平方复杂度昂

贵,三者分别适配短时序稳态、局部纹理特征与超长语义关联三大场景。

2.请尝试使用预训练模型完成一个图像处理或自然语言处理任务。

答:基于ResNet50预训练模型的医学X光肺炎影像分类。

本任务旨在利用迁移学习解决小样本高维医学图像判别难题,核心遵循特征

提取一微调适配一泛化推理三阶范式。

首先,载入在ImageNet海量自然图像上收敛完备的ResNet50预训练权重。

该深层残差网络已习得通用边缘、纹理、形态层级视觉基底特征,具备极强先验

归纳偏置。输入医学影像经归一化、随机裁剪增强与维度对齐预处理。

其次,采用冻结骨干十微调顶层策略。移除原生千类Softmax输出层,自

适应接入双层瓶颈分类头,将全局平均池化特征映射为正常/病毒性肺炎二分

类概率。冻结底层残差模块保留通用纹理,仅以极小学习率更新高层语义与分类

权重,高效拟合病灶模糊斑片专属分布,规避过演合与灾难性遗忘。

最终测试推理,模型精准定位肺野透光异常区域,AUROC指标显著优于从

零训练CNN,验证预训练在高门槛专业视觉任务中降参、提速、提泛化的核心

优势。

3.试分析ChatGPT的关键核心技术有哪些?

答:ChatGPT之所以具备强对话理解、长文本生成、多意图遵循与安全可控

能力,是一套从基座预训练、指令对齐、人类偏好强化到系统工程的完整技术栈

协同结果,其关键核心技术可分为四层严谨递进结构。

第一,大规模自回归Transformer基座预训练。ChatGPT沿用GPT系列

Decoder-only架构,采用因果掩码单向自注意力,严格保证生成时序不泄露未

来信息;通过海量高质量通用文本进行自监督语言建模预测,习得句法依存、语

义推理.、世界常识、文本风格与长程上下文关联,形成极强通用先验与高维分布

建模能力。

第二,高质量多任务指令监督微调(SFT)o在原生预训练基础上,人工构

造覆盖问答、改写、摘要、推理、创作等多样指令样本,继续低学习率微调,把

预训练补全范式平滑迁移为可跟随用户意图、格式约束与角色设定的对话范式,

显著提升输出有用性、连贯性与对齐度。

第三,基于人类反馈的强化学习对齐(RLHF)。先训练奖励模型拟合多人

偏好排序,精准量化诚实、无害、简洁、拒绝越界等价值维度;再以PPO约束

策略迭代,在不破坏通用能力前提下压制幻觉、恶意诱导、冗长发散与不当推理,

实现能力、安全与可控三者权衡。

第四,数据治理、大批次训练吞吐与可控解码工程。依靠精密去重过滤、动

态分桶、混合精度、梯度累积稳定超大规模训练;推理端通过温度、Top-P、重

复惩罚截断采样,动态平衡确定性与多样性,保障交互流畅低延迟。

4.试分析大模型的优点与缺陷,并举例说明。

答:大语言模型依托超大规模参数、海量文本预训练与涌现能力,展现出强

大通用智能潜力,同时存在架构原生短板与安全局限。

核心优势:其一,强通用表征与零/少样本泛化,基座预训练习得跨领域语

法、常识、逻辑先验,无需大量微调即可完成翻译、代码生成、数理推理等异构

任务,如GPT-4无需专项训练即可解析复杂物理应用题。其二,长上下文语义

连贯与人机意图对齐,依托全局自注意力精准捕捉长程依赖,经指令微猬与

RLHF后,可精准遵循复杂角色扮演、格式约束与多轮纠错指令。其三,降低开

发门槛,作为基座支撑知识库问答、智能客服等轻量化下游应用,减少定制化特

征工程成本。

固有缺陷:首先,事实幻觉与逻辑不自治,模型仅统计拟合字符分布而非认

知真理,易编造虚假文献、篡改数据,如捏造不存在的法律判例。其次,输入偏

见与安全失控,继承训练数据歧视性偏差,易被Prompt诱导生成恶意代码、极

端言论。最后,算力开销大且不可解释,千亿参数训练推理能耗极高,黑盒输出

难以溯源决策路径,医疗、金融等高可信场景落地受限。

第二章课后习题答案

1.试解释决策树学习算法。举例计算表2-2中信息墉和信息增益。

答:决策树学习是一种基于树结构的归纳学习方法,通过从根结点开始,选

择最优属性对样本进行划分,递归构建决策树,月于分类或回归任务。其关键在

于选择划分属性,常用准则有信息增益(ID3)、增益率(C4.5)和基尼指数(CART)。

以表2-2西瓜数据集为例:

•根结点信息端:Ent(D)=0.998

•属性“色泽”的信息增益:Ga山(。,色泽)=0.109

•属性“纹理”的信息增益最大,为0.381,因此被选为根结点的划分属性。

2.编程实现ID3算法,并根据表2-2中所绐训练数据,利用ID3算法生成

决策树。

答:Python实现可使用ski巳arn.tree.D巳cisionTreeClassifier模块生成

决策树算法:

fromsklearn.treeimportDecisionTreeClassifier

fromsklearn.model_selectionimporttrain_test_split

fromsklearn.metricsimportaccuracyscore

importpandasaspd

#假设已将表2-2数据读入DataFramc,特征列名列表featurjcols,目

标列‘好瓜’

#将目标列映射为数值:'是'->1,'否'->0

df['好瓜']二df['好瓜是':1,'否':0})

#对离散特征进行独热编码

X=pd.get_dummies(df[feature_cols])

y=df「好瓜']

Xtrain,Xtest,ytrain,ytest=traintest_split(X,y,

tcst_size=0.2,random_state=42)

model=DecisionTreeClassifier(criterion=,entropy,)#ID3使用信

息增益

model,fit(Xtrain,ytrain)

y_pred=model.predict(X_test)

print(〃准确率:〃,accuracy_score(y_test,y_pred))

基于表2-2的西瓜数据集,ID3算法生成的决策树根结点为“纹理”,后续

依次选择“根蒂”“色泽”等属性进行划分,最终得到一棵完整决策树(详见如

图2-9)o

3.试析决策树与随机森林的区别与联系。

答:

联系:

•随机森林是以决策树为基学习器的集成学习算法;

•两者均可用于分类与回归任务。

区别:

•单棵决策树容易过拟合,随机森林通过多棵树集成(投票/平均)降低过

拟合;

・随机森林引入样本随机抽样(Bootstrap)和特征随机选择,增强泛化能

力;

•决策树模型简单、可解释性强,随机森林通常精度更高但可解释性较弱。

4.利用python实现随机森林算法。

答:Python实现可使用sklearn.ensemble.RandomForestClassifier模块

生成随机森林算法:

fromsklearn.ensembleimportRandomForestClassifier

fromsklearn.model_selectionimporttrain_test_split

fromsklearn.metricsimportaccuracy_score

X_train,X_test,y_train,y_test=train_test_split(X,y,

test_size=O.2,randomstate=42)

model=RandomForestClassifier(n_cstimators=100,random_state=42)

model.fit(X_train,y_train)

y_pred=model,predict(X_test)

print(〃准确率:〃,accuracy一score(y_test,ypred))

5.当预测样本分布不均匀、维度大且特征缺失的情况下,应该采用哪种算

法。

答:推荐使用随机森林。原因如下:

•随机森林对高维数据具有较好的鲁棒性,能通过特征随机选择降低维度影

响;

•对缺失值有一定容忍能力,可借助袋外数据(00B)进行估计;

•在样本分布不均匀时,通过Bootstrap抽样和集成投票机制,能有效缓解

类别不平衡问题;

•具有抗过拟合能力,泛化性能较好。

第三章课后习题答案

1.神经元j接收10、-20、4和-2,神经元j的突触权值分别为。8、0.2、-1.0

和。这里假设神经元的阈值为计算下列两种情况下神经元的输出:

-0.90oj

(1)激活函数为线性函数"⑴)=%

1,如果vNO

(2)激活函数为阈值函数@(切=

0,如果vvo

答:根据描述神经元k的公式可知:

3

{WkjXj=(-10*0.8)+(-20*0.2)+(4*-1.0)*(-2*-0.9)=-11.2

;=i

(1):

yk=sQk+")=取=-1L2

(2):

yk=8(以+瓦)=o

2.考虑如图3・32所示的单神经元感知器网络,该网络的判定边界为附十。二0。

证明:该判定边界如果是一个向量空间就必须满足如下10个条件。

(1)要求两个向量空间之和仍然是一个向量空间。令pl和p2分别是判定边界

上的两个向量,满足:Wpl=0,Wp2=0

将上述两个等式相加,有:W(pl+p2)=0

由此可以看出这两个向量之和也在判定边界上。

(2)交换性pl+p2=p2+pl满足;

(3)结合性(pl+p2)+p3=pl+(p2+p3)满足;

(4)由于W0=0,所以零向量在判定边界上。

(5)如果p在判定边界上,那么-p也必须在判定边界上。如果p在判定边界

上,那么

Wp=0

在该式两边同时乘以-L可得:W(-p)=0

(6)如果对判定边界上的任意p,ap也在判定边界上,其中a是标量;

(7)对判定边界上的任意p,lp=p(1是标量);

(8)对任意二个标量a和b,以及判定边界上的任意p,a(bp)=(ab)p;

(9)(a+b)p=ap+bp;前提同(8)

(10)对任意标量a,以及判定边界上的任意p.q,a(p+q)=ap+aq

所以该感知机的判定边界是一个向量空间。

3.单层感知器只适用于一组线性可分的模式。如果两个模式是线性可分的它

们一定是线性无关的吗?

答:不是。这是两个没有任何关联的概念。比如,考虑如图8-21的两输入感知

机。假设现在希望区分如下两个向量:

0.51「15

P,=0,5P2=1.5

如果将权值和偏置值分别设定为wll=l,W12=1和b=-2,那么其判定边

界如图8-22所示。显然,这两个向量是线性可分的,但是,由于p2=3pl,他们

之间并不是线性无关的。

输入对称硬极限神经元

Wp+b=O

图8-21两输入感知机图8-22判定边界

4.基于反向传播的概念,求一个能更新图3-33中所示的递归网络的权值M和W2

的算法。

答:第一步是定义性能指数。如同多层网络,我们使用均方误差

户(x)=(MA)-。⑷/=­))2

使用最速下降法进行权值更新:

a

△孙=-a□—户(X)

*owi

这些导数可计算如下:

y—f'M=晓~(“A)-a(A))2=2(r(A)-a(^))|"

owiowiLJ

因此,需要计算的关键项是

3a(k)

a孙

要计算这些项,首先需要写出网络方程

a(k+1)=purelin(wxp(k)+w2a(k))=wxp(k)+w2a(k)

两边对网络权值求导数得:

羽+D=p(A)+七

dW।1'3wi

3a(k+1)/,、2a(k)

—\------J-a{k)+w

2dw

dw2

(注意我们必须考虑到a(k)本身是M和w?的函数的事实)最速下降法中更

新权值时使用这两个递归方程来计算导数。方程用

率@=0,醇=0

dw)dw2

初始化,这是由于初始条件不是权值的函数。

要说明此过程,先假定a(0)=0。第一次网络更新为

a(1)=wlp(0)+w2a(0)=w]p(0)

第一个导数为:

3a⑴/。。(0)z\Ha⑴仆Ha(0)

2nXnwn

就=p(0)+叼3叫=P(°),dW2=芯°)+23啊=°

第一次权值的更新为

△=-a□—F(x)=-a2(r(1)-a(1))

*3叫IW}]

△wj=-2a(£(1)-a(l))I-p(0)I

△w2=-2a(=0

这个算法属于动态反向传播类型,其中梯度是用不同的方程计算的。

5.一个全连接的前向网络具有10个源结点,两个隐层,其中一个隐层有4个神

经元,另一个隐层有3个神经元,1个输出神经元,构造这个网络的结构图。

答:

输入层隐含层1隐含层2输出层

6.增大权值是否能够使BP学习变慢。

答:训练时学习新样本有遗忘旧样本的趋势。增大权值不一定能够使BP学习

变慢。

7.(思考题)字符分类。任务是对数字0至9分类,有十类且每个目标向量应该是这十个向

量中的一个。。用<0,0,0,0,0,0,0,0,0>表示,1用0,0,0,0,0,0,0,

0>表示,第1分量为1,其余为0。2至9的表示类推。要学习的数字显示在图3-24中,

每个数字由9x7的网格表示,灰色像素代表0,黑色像素代表1。

图3-34训练数据

答:选择BP网络结构为63-6-9o9*7个输入结点,对应BP网络的映射。9个输

出结点对应10种分类。测试结果表明:除了8以为,所有被测的数字都能够被

正确地识别。对于数字8,神经网路地第6个结点的输出值为0.53,第8个结点

的输出值为0.4L表明第8个样本是模糊的,可能是数字6,也可能是数字8,

但也不完全确信是两者之一。

第五章课后习题答案

1.考虑用于线性可分模式的超平面,它的式为:

wTx+/?=0

其中W表示权值向量,b为阀值,X为输入向量,如果对输入模式集满足附

加的条件

min|wTx;+/?|=1

»=1.2...JV

则称(\v,b)为超平面的规范对。证明规范对的要求导致两类分离边界的距离为

2

向.

答:线性可分模式的超平面可用线性方程表示如下

wTx+b=0

样本空间中任意点x到超平面卬0+。二°的距离为

\wTx+b\

Y----------

l|w||

对于样本集{(3力),(%2,、2),…,(如,加)},%={-1,+1},则有

(wTXi+b>+1,-4-1

lwTXi+b<+1,%=-1

每个支持向量到超平面的距离为

l|w||

由于满足

min|wTx+Z?|=1

i=12…,Nt

1

d=----

l|w||

那么,两类分离边界的距离为2d,即

2

IM

2.在不可分类模式的背景下判断下列陈述:错分意味着模式的不可分性,但相反

则未必为真。

答:该陈述有误,模式错分并不代表着不可分,部分是由模型学习效果差所致,

而不可分一定会产生错分结果。

3.在数据空间中最优超平面的位置是由被选为支持向量的数据点决定。加果数

据有噪声,第一反应也许是质疑分离边界对噪声的健壮性,但最优超平面的详细

研究发现分离边界对•噪声实际上是健壮的,讨论①种健壮性的理论基础。

答:SVM本身对噪声具有一定的鲁棒性,但是当噪声率低于一定水平的噪声对SVM

没有太大影响,而随着噪声率的不断增加,分类器的识别率会降低。所以是有条

件的。

4.用于求解XOR问题的多项式学习机使用的内积核定义为K(x/i)=(l+

解XOR问题的指数p的最小值时多少?假定p为正整数,比最小值大的p

会出现什么结果?

答:最小值为2,值数p越大,映射的维度越高,计算量就会越大。当p过大时,

由于学习复杂性也会过高,易出现“过拟合现象。

5.(思考题)内积核是在训练W个样本集「上定义的,它产生N、N矩

阵:

K={KRa

其中匾二K(如乙)。由于它的所有元素的值为正,矩阵K是正的。利用相似变换

其中人为对角的特征矩阵,而Q为相应特征向量构成的矩阵。利用K的特征值和

特征向量个构造内积核KQj/j)的展开式,你可以从这个表达式得出什么结论。

答:

参考点:若一个核函数可隐式地计算被映射到N维空间的两个向量的内积,那

么该核函数就可以表示成N个核函数的一个线性组合。

6.思考题。两层感知器的内积核定义为

r

=tanh(^oxA;+川)

探讨对常数片和用的那些值不满足Mercer定理的条件。

答:

参考点:Mercer定理指任何半正定的函数都可以作为核函数。所谓半正定的函

数f(xi,xj),是指拥有训练数据集合(xl,x2,...xn),我们定义一个矩阵的元素

aij=f(xi,xj),这个矩阵式n*n的,如果这个矩阵是半正定的,那么f(xi:xj)

就称为半正定的函数。这个mercer定理不是核函数必要条件,只是一个充分条

件,即还有不满足mercer定理的函数也可以是核函数。

7.(思考题)在这一章中我们利用支持向量机进行二分类,讨论支持向量机如

何解决M类模式识别的问题(M>2)o

答:可以通过多个SVM的组合来解决多分类问题。

8.(思考题)关于下列任务比较支持向量机和利用反向传播算法训练的多层感

知器的优点和局限:

1)模式识别

2)非线性回归

答:

支持向量机的优点:

(1)有严格的数学理论支持,可解释性强;

(2)能找出对任务至关重要的关键样本(即:支持向量);

(3)采用核技巧之后,可以处理非线性分类/回归任务;

(4)最终决策函数只由少数的支持向量所确定,计算的复杂性取决于支持向量

的数目,而不是样本空间的维数,这在某种意义上避免了“维数灾难”;

(5)SVM是一个凸优化问题,求得的解一定是全局最优而不是局部最优。

支持向量机的局限:

(1)当特征维度远远大于样本量时,效果会比较差;

(2)当样本量很大时,使用非线性核函数会导致计算效率低下;

(3)支持向量机目前只适合小批量样本的任务,无法适应百万甚至上亿样本的

任务。

多层感知器的优点:

(1)能够自适应、自主学习。这是BP算法的根本以及其优势所在,BP算法根据

预设的参数更新规则,不断地调整神经网络中的参数,以达到最符合期望的输出。

(2)拥有较强的非线性映射能力,实现任何复杂非线性映射的功能。

(3)严谨的推导过程。误差的反向传播过程,采用的是已经非常成熟的链式法

测,其推导过程严谨且科学。

(4)较强的泛化能力,即在BP算法训练结束之后,BP算法可以利用从原来知

识中学到的知识解决新的问题。

多层感知器的局限:

(1)由于BP神经网络中的参数众多,每次都需要更新数量较多的阈值和权值,

故会导致收敛速度过慢;

(2)网络中隐含层节点个数尚无明确的公式;

(3)从数学角度看,BP算法是一种速度较快的梯度下降算法,容易陷入局部最

小值。

第4章

1.在实际运用中降维算法应该如何确定最终的特征维度?

答:在实际应用中,确定降维后的最终特征维度通常不是靠直觉,而是通过数

据驱动的定量分析与下游任务的反馈共同决定的。

一、解释方差占比:这是处理主成分分析时最常月的指标。它衡量了每一个主成

分所保留的原始数据信息的比例。累计贡献率法:计算前k个主成分的累计

解释方差占比。通常会选择使累计贡献率达到80%、90%或95%的最小k值。

手肘图:将各主成分的特征值按从大到小排列并绘制折线图。寻找图形中的

肘部,即特征值下降速度明显放缓的点,该点之前的维度通常被认为是主要

的特征。

二、内部结构保持度:对于非线性降维,更关注数据流形结构的保持。最大似然

估计:通过分析样本点与其邻域的距离分布,估算数据集的内在维度。重构

误差:对于自编照器,可以观察不同瓶颈层维度下的重构损失。当增加维度

不再显著降低损失时,当前的维度即为饱和维度。

三、下游任务表现:这是最具实践意义的方法。降维最终是为模型服务的,因此

应通过实验来验证:交叉验证:将k作为一个超参数,通过交叉验证观察其

在分类或回归任务上的表现。计算开销平衡:在某些实时处理场景中,维度

的确定需要权衡模型精度与推理延迟。如果增加10个维度只提升了0.1%的

精度但增加了20%的耗时,通常会选择更低的维度。

2.试用PCA算法对Iris数据集降维,并与LDA算法比较,思考两个算法的异同。

答:PCA的降维效果:PCA是一种无监督算法。它不关心样本属于哪一类莺尾花,

而是寻找数据方差最大的方向。结果观察:在降维后的2维空间中,山莺尾通常

会被分得很开,但另外两类之间可能会有一定的重叠。核心逻辑:试图保留原始

数据中波动最剧烈的信息。

LDA的降维效果:LDA是一种有监督算法。它利用了Iris数据集的标签信

息。结果观察:降维后的三类花卉聚集度更高,类别间的边界更加清晰。核心

逻辑:目标是类内距离最小,类间距离最大。它专门寻找那些能最好区分不同

品种的投影方向。

相同点:线性变换:两者本质上都是通过矩陆相乘将高维特征线性投影到低

维空间。降维目的:都在试图解决“维度灾难”问题,减少特征冗余。计算方式:

最终都可以转化为求解特征值和特征向量的问题。

小同点(本质区别);关注点小同:PCA认为方差大就是信息量大,它可能在

降维过程中保留了噪声较大的方向;而LDA认为区分度好就是特征好,如果某特

征方差很大但对分类没贡献,LDA会果断舍弃。维度限制:对于Iris数据集(3

个类别),LDA降维后的维度不能超过3-1=2维,而PCA则可以降至1至1)3

维中的任意维度。数据分布假设:LDA假设数据服从高斯分布,且各类别方差相

等(同方差性)。如果数据分布极不规范,LDA的效果可能不如PCA稳健。

3、对高维数据降维之前应先进行“中心化”,常见的方法是将协方差矩阵XXT

转化为XHlxl其中H=「小(这里的电矩阵),试分析其效果。

答:中心化矩阵H是线性代数中的一个投影矩阵。作用是将数据投影到与全1向

量正交的子空间中。效果:对于数据矩阵X,计算XH相当于让每个样本点都减去

全体样本的算术平均值。使用Z7/7Z/7/,强制数据中心与坐标原点重合,这样提取

出的特征向量能真正反映数据分布方差最大的方向,而非受坐标系偏置的影响。

将协方差矩阵

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论