版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能素养导论第6章人工智能的数据表示目录01人工智能中的数据02数据与向量表示03文本表示04多媒体表示章节导图6.1.1数据与人工智能数据驱动范式:以深度学习为例通过喂入海量标注数据,现代AI模型能够自动学习适用于特定任务的特征和映射关系。数据不仅是算法开发的原材料,更是决定系统性能上限与应用边界的关键因素。6.1.1数据与人工智能AI项目中的数据处理流程AI项目中的数据处理主要包括三个阶段:数据收集、数据清洗、数据建模。6.1.1数据与人工智能数据处理阶段一:数据收集目标:获取足够且合规的数据公开数据集:如ImageNet、Kaggle等平台提供的标准数据网络爬虫:从互联网上自动抓取文本、图片等信息6.1.1数据与人工智能数据处理阶段一:数据收集目标:获取足够且合规的数据传感器采集:物联网设备、摄像头、麦克风等硬件收集人工标注:通过众包平台让人类为数据打上标签6.1.1数据与人工智能数据处理阶段二:数据清理目标:处理缺失、重复、异常和格式不一致问题均值填充:用平均值填补缺失数据删除重复:去除完全相同的重复记录格式统一:将不同来源的数据格式标准化异常检测:识别并处理偏离正常范围的异常值6.1.1数据与人工智能驱动智能模型能力跃迁的核心要素AI时代的数据需求已从“量的积累”转向“质的提升”与“多样性的融合”。数据规模、质量与多样性共同构成了AI系统能力跃迁的基础支撑。AI系统能力跃迁数据规模数据质量数据多样性6.1.1数据与人工智能核心要素1:数据规模(DataScale)数据规模直接影响知识覆盖的广度和深度。大模型的发展路径表明,大规模数据能支撑模型在复杂环境下的泛化能力与鲁棒性。科学研究已从“小样本”范式转向“海量数据”范式。常见底座模型细节概览6.1.1数据与人工智能核心要素2:数据质量
数据质量影响模型推理和决策的科学性。高质量数据是学习有效规律的基础,其准确性、代表性与无偏性至关重要。错误标注或样本分布不均会带来“错误信号”或“分布偏差”。高质量医学对话摘要6.1.2数据类型数据类型分类三大数据类型:结构化、半结构化、非结构化数据类型是数据分析、数据管理和数据科学的基础。T结构化数据{}半结构化数据♫非结构化数据6.1.2数据类型结构化数据详解有严格组织形式,常以表格方式存储数据库表(关系型):如MySQL,通过行(记录)和列(字段)组成,支持SQL查询。电子表格与CSV文件:如Excel、CSV,以二维表格形式保存,便于跨平台传输。sql数据6.1.2数据类型半结构化数据详解具有一定组织形式,包含标签或标记描述层级和属性JSON:使用键值对和嵌套结构XML:使用标签层级YAML:简洁易读JSON示例{"name":"AI","type":"Technology"}XML示例<data><name>AI</name><type>Technology</type></data>YAML示例name:AItype:Technology6.1.2数据类型非结构化数据详解没有固定的组织形式,内容丰富多样类型:文本(自然语言)、图像、音频、视频等特点:语义复杂、格式多变,难以直接用传统数据库存储和查询AI应用:深度学习(如CNN、Transformer)的崛起,使得处理非结构化数据成为现代AI的核心能力6.1.2数据类型三种数据类型综合对比同一信息的三种不同表示方式对比维度结构化数据半结构化数据非结构化数据组织形式严格的行列二维表树状、图状或键值对无固定格式,自由灵活存储方式关系型数据库(如MySQL)NoSQL数据库、JSON/XML文件文件系统、对象存储(如S3)处理难度低(易于SQL查询和统计)中(需特定解析器提取)高(依赖AI和深度学习模型)典型应用财务报表、人事档案API数据传输、系统配置文件人脸识别、智能客服、自动驾驶6.2数值与向量表示标量、向量与矩阵基础标量(Scalar)0维25单一数值,只有大小没有方向。
示例:温度25℃向量(Vector)1维xyz一维数组,包含大小和方向。
示例:空间坐标[x,y,z]矩阵(Matrix)2维102451038二维表格,由行和列组成。
示例:灰度图像的像素矩阵标量、向量和矩阵是数学中表示数据的基本单位为数学建模、数据分析和算法设计提供了强大的工具和框架。6.2数值与向量表示什么是特征向量?特征向量:描述对象属性的一组数值在AI中,任何可以量化的对象(图片、文本、用户)都可以用特征向量表示。它是矩阵作用下的一个特殊向量,揭示了线性变换在特定方向上的“不变性”,其缩放因子称为特征值。图片0.80.20.5...文本0.10.90.3...用户2510.7...6.2数值与向量表示特征向量在AI中的核心应用特征向量是将复杂数据映射到数值空间的核心工具。自然语言处理:词嵌入模型利用特征向量捕捉语义联系。图像处理:刻画边缘、纹理等视觉信息。6.2数值与向量表示特征标准化与归一化标准化和归一化用于转换数据,确保模型更好地处理不同尺度的特征。使各特征处于同一数量级,避免某特征因取值范围大而主导训练。提高模型稳定性与计算效率。标准化归一化6.2数值与向量表示特征标准化(Standardization)将数据转换为均值为0、标准差为1的分布。适合特征服从正态分布或对异常值敏感的场景。6.2数值与向量表示数据归一化(Normalization)通过线性变换将数据缩放到[0,1]范围内。用于消除量纲影响,使不同尺度的特征在距离敏感算法中具有可比性。6.2数值与向量表示标准化vs.归一化
对比共同作用:消除特征间的量纲和尺度差异。标准化:更通用的方法,适合分布接近正态、对异常值不敏感的场景。归一化:适合特征范围差异大、对距离敏感的算法,但对异常值较敏感。6.3.1独热编码独热编码(One-HotEncoding)给每个类别一个唯一的"数字身份证"独热编码是处理分类数据最基础的方法,它将离散的类别转化为机器学习模型可以理解的二进制向量。在这个二进制向量"身份证"中,只在对应的位置打上1,其他位置全是0。向量的长度等于所有类别的总数。6.3.1独热编码独热编码的局限性维度膨胀:类别越多,向量越稀疏主要问题当类别数量过多时,会导致"维度膨胀"(CurseofDimensionality)。向量中绝大多数元素都是0,这种数据被称为高维稀疏数据,会极大消耗计算资源。极端例子:如果我们要用独热编码表示一本包含100,000个单词的字典,那么每个单词都会变成一个长度为100,000的向量,其中只有一个1,剩下99,999个全是0。更严重的是,这种表示方法完全丢失了词与词之间的语义关联(比如"苹果"和"梨"的向量距离,与"苹果"和"汽车"的向量距离是一样的)。6.3.2词袋模型词袋模型(BagofWords,BoW)将文本看作"词的无序集合"忽略语法和词序,只关注词频。统计每个词出现的次数。我喜欢JNU=JNU喜欢我6.3.3词频-逆文档频率TF-IDF词频-逆文档频率
TF-IDF算法衡量词语在文本中重要性的统计方法词袋模型虽然简单,但存在一个致命缺陷:它认为所有词同等重要。TF-IDF(TermFrequency-InverseDocumentFrequency)算法通过结合两个维度来解决这个问题:TF(词频)TermFrequency衡量一个词在当前文档中出现的频率。核心逻辑:一个词在文章中出现的次数越多,它对这篇文章就越重要。IDF(逆文档频率)InverseDocumentFrequency衡量一个词在整个语料库中的普遍程度。核心逻辑:如果一个词在很多文章中都出现(如"的"、"是"),那它就不具备区分度,重要性应该被降低。6.3.3词频-逆文档频率TF-IDFTF与IDF的数学定义TF-IDF的数学公式词频(TF)t:目标词语d:当前文档n:词语t在文档d中出现的次数N:文档d中的总词数逆文档频率(IDF)D:整个语料库M:语料库中的文档总数m:包含词语t的文档数量注:使用对数是为了防止IDF值过大最终的TF-IDF权重6.3.3词频-逆文档频率TF-IDFTF-IDF实例演算:蜜蜂与花蜜计算"蜜蜂"对文档1的重要度文档一:“蜜蜂喜欢采集花蜜。”
文档二:“蚂蚁喜欢搬运食物。”
文档三:“蜜蜂也喜欢花粉。”计算过程1.计算TF(词频)“蜜蜂”在文档一中出现了1次。TF=1/5=0.22.计算IDF(逆文档频率)包含“蜜蜂”的文档有文档一和文档三IDF=log(3/2)=log(1.5)=0.1763.计算最终TF-IDFTF-IDF=0.2×0.176=0.03526.3.3词频-逆文档频率TF-IDFTF-IDF实例演算:蜜蜂与花蜜计算"喜欢"对文档1的重要度文档一:“蜜蜂喜欢采集花蜜。”
文档二:“蚂蚁喜欢搬运食物。”
文档三:“蜜蜂也喜欢花粉。”计算过程1.计算TF(词频)“喜欢”在文档一中出现了1次。TF=1/5=0.22.计算IDF(逆文档频率)包含“喜欢”的文档有文档一二三IDF=log(3/3)=log(1)=03.计算最终TF-IDFTF-IDF=0.2×0=06.3.3词频-逆文档频率TF-IDF常见TF-IDF变种及应用6.3.4词嵌入词嵌入(WordEmbedding)将词语映射为低维稠密实数向量降维:将维度从几十万降到几百(如300维)。稠密:向量中不再是大量的0,而是包含丰富信息的实数。语义相似度:意思相近的词,在向量空间中的距离也相近。6.3.4词嵌入Word2Vec——捕捉局部上下文采用轻量级神经网络,通过两种训练机制学习词向量CBOW(连续词袋模型)模式:基于上下文单词预测目标词;Skip-Gram(跳字模型)模式:基于目标词预测其周围上下文模型优势:能高效捕捉局部上下文信息,使得训练得到的向量在常见“语义类比”任务中表现出色。Word2Vec是轻量级的神经网络6.3.4词嵌入Word2Vec——捕捉局部上下文采用轻量级神经网络,通过两种训练机制学习词向量CBOW模式:CBOW的方式是在知道词wt的上下文wt-2,wt-1,wt+1,wt+2的情况下预测当前词wt
。Skip-Gram模式:在知道了词wt的情况下,对词wt的上下文wt-2,wt-1,wt+1,wt+2进行预测。Word2Vec是轻量级的神经网络6.3.4词嵌入GloVe——提取全局语义关系核心机制:
基于全局词的共现统计。统计构建:
扫描大规模语料库,构建所有词对的“共现矩阵”。降维映射:
通过矩阵分解技术,将共现概率精准映射到低维向量空间。模型优势:
能够利用全局统计信息,从整体语料分布中提取更丰富的语义关系向量“国王-男人+女人”导致向量非常接近“女王”6.3.4词嵌入FastText——增强词形表示与泛化性在Word2Vec的基础上,将完整的词拆分为若干“字符级子词”并对其进行建模,以此组合生成最终的词向量。FastText的模型结构6.3.4词嵌入常见词嵌入算法详解四大经典词嵌入算法对比6.3.4词嵌入Word2Vec神奇的类比计算实例验证:安卓-谷歌+苹果=?假设我们的二维空间,X轴代表“公司归属”(正值为谷歌系,负值为苹果系),Y轴代表“产品类型”。谷歌[8,0];安卓[8,6];苹果[-8,0];iOS[-8,6]。6.3.4词嵌入Word2Vec神奇的类比计算实例验证:安卓-谷歌+苹果=?向量计算:[8,6]-[8,0]+[-8,0]=[-8,6]。结果[-8,6]正是“iOS”的坐标,精准捕捉了“公司与操作系统”的语义关系。6.3.4词嵌入更多趣味词向量加减法6.3.5BERTBERT预训练模型介绍从静态词向量到动态上下文表示动态词向量的崛起
预训练语言模型(如BERT,GPT)通过深度神经网络(Transformer),根据词语所在的上下文动态生成词向量。传统方法是静态的,即一个词无论在什么句子中,其向量都是固定的。这无法解决“一词多义”的问题。解决一词多义:以"苹果"为例句子A:Appleisagreatcompany.句子B:Iateanappleforlunch.在BERT模型中,句子A中的"apple"(公司)和句子B中的"苹果"(水果)会得到完全不同的向量表示。5.1.1人工智能核心驱动力BERT的输入符号与标记将句子拆分成“标记”(Token),并添加特殊符号:[CLS]分类标记(Classification)用于分类任务(如判断情感是正面/负面),[CLS]是整个输入的起点表示,需要放在句子最前面。[SEP]分隔标记(Separator)分隔不同句子(如问答中的问题和答案),[SEP]是句子的结束标记,必须放在每个句子末尾。[MASK]掩码标记(Mask)在训练时遮挡部分单词,让BERT猜缺失的词。这是MLM预训练任务的核心机制。原始输入:"Appleisagreatcompany.IloveApple"[CLS]
Appleisagreatcompany
[SEP]
IloveApple
[SEP]6.3.5BERTBERT的输入符号与标记BERT通过一种被称为"三重编码"的机制,为文本中的每个词或句子生成独特的"身份证"。词嵌入(TokenEmbedding)作用/FUNCTION捕捉词语的基本语义信息,将每个词映射为固定维度的向量。类比/ANALOGY词的"本体特征"段嵌入(SegmentEmbedding)作用/FUNCTION区分输入中的不同句子,帮助模型理解句子间的逻辑关系。类比/ANALOGY句子的"身份"位置嵌入(PositionEmbedding)作用/FUNCTION记录词语在序列中的位置信息,确保模型知道词的顺序。类比/ANALOGY词的"座位号"最终,每个Token的输入表示=词嵌入+段嵌入+位置嵌入6.3.5BERTBERT的输入符号与标记BERT的预训练任务主要包括MLM和NSP,这两个任务共同为模型提供了丰富的语言学习目标MLM(掩码语言模型)通过随机遮蔽输入序列中15%的Token(用[MASK]替代),要求模型预测被遮蔽的词。核心目的:从而强制模型学习双向上下文关系,提升其对语义的深度理解能力。屏蔽词(MASK)的表示是基于注意力的6.3.5BERTBERT的输入符号与标记BERT的预训练任务主要包括MLM和NSP,这两个任务共同为模型提供了丰富的语言学习目标NSP(下一句预测)通过输入两句话,要求模型判断它们是否在原文中连续。核心目的:旨在训练模型捕捉句子间的逻辑关联(如连贯性、因果性),增强对文本结构的建模能力。6.3.5BERTTransformer架构BERT基于TransformerEncoder构建,核心依赖自注意力机制(Self-Attention)。BERT-baseTransformer层数12层参数规模约1.1亿BERT-largeTransformer层数24层参数规模约3.4亿6.3.5BERT三重编码—以"Apple"为例6.3.5BERT三重编码—以"Apple"为例6.4多媒体表示多媒体表示概览图像、视频和音频数据需被转换为数值化的张量(Tensor)。
这是深度学习模型进行训练与推理的基础步骤。6.4.1音频的频谱与特征声音的物理本质物理形态:声音是一种以波的形式存在的物理现象。数据特征:它是一维的、连续的。数字化需求:要让计算机处理声音,第一步必须将其数字化。6.4.1音频的频谱与特征音频数字化的步骤:采样采样定义:在声波的曲线上每隔一个时间间隔就测量一次它的振幅并记录。数据结构:经过采样后,连续的声波就被转换成了一个由离散数值构成的一维长序列
。6.4.1音频的频谱与特征时域(TimeDomain)数据的局限性原始波形没有直观地反映出声音的“内容”,如音高、音色等
。人类听觉系统对频率的变化比对振幅的变化更敏感
。原始波形做AI任务效果不好6.4.1音频的频谱与特征核心数学工具:傅里叶变换傅里叶变换能将信号从时间域(原始波形)转换到频率域6.4.1音频的频谱与特征傅里叶变换的通俗理解傅里叶变换能把复杂的声音信号分解成一组组简单的正弦波每组正弦波代表一种特定的频率和强度。分离完清楚地显示声音中包含了哪些频率(如低音、中音和高音),以及每种频率有多强6.4.1音频的频谱与特征构建音频频谱图时间变化处理:声音频率随时间变化,因此不能只做一次傅里叶变换。滑动窗口:将音频切成很多个极短且有重叠的“窗口”,对每个窗口分别进行变换。图像生成:将所有窗口的分析结果按时间顺序拼起来,得到频谱图。6.4.1音频的频谱与特征频谱图在AI任务中的革命性应用巧妙地将一个一维的音频序列问题,转化为了一个二维的图像识别问题
。语音识别"形状"识别模型在频谱图上学习识别元音和辅音的独特形状特征,从而将声音转化为对应的文字。音乐分类纹理与结构模型学习不同音乐流派(如古典、摇滚、爵士)在频谱图上的纹理和结构差异,实现自动分类。声纹识别声带"指纹"模型学习每个人独特的声带振动模式在频谱图上留下的专属指纹,用于身份验证和识别。6.4.2图像的像素矩阵图像的像素矩阵图像是由像素组成的二维网格,每个像素点包含颜色信息。在数字图像处理中,图像通常以矩阵的形式表示,数字越大亮度越高。6.4.2图像的像素矩阵彩色图像的三维张量表示彩色图片在计算机中表示为三维矩阵,张量形状为3x3x3。一个三维张量(高度×宽度×通道数)6.4.2图像的像素矩阵图像特征提取与CNN数字矩阵就是AI模型的输入基础
卷积神经网络(CNN)通过特殊的卷积核结构自动学习图像中的空间特征。如边缘、纹理和形状最终实现图像分类、目标检测等任务。6.4.3视频帧序列表示视频的本质与静态帧视频的本质在于展现“运动”和“时间”的变化
。
它是由一系列连续排列的静态图像——即“帧”(Frame)构成的
。当帧以较高速度(如每秒24或30帧)依次播放时,会产生连续性的错觉。6.4.3视频帧序列表示视频的数据结构:四维张量如果彩色图片是三维张量,视频则扩展为四维张量
。张量形状为(帧数,高度,宽度,通道数),其中“帧数”对应时间维度
。6.5本章小节
02词嵌入(WordEmbedding):突破了独热编码“高维稀疏”和无法表达语义的局限,将词语映射为低维稠密向量。重点理解它是如何通过向量空间距离(如Word2Vec)捕捉复杂语义关系的(例如经典公式:安卓-谷歌+苹果=iOS)。
03数据预处理的数学基础:标准化(Standardization)与归一化(Normalization):这两者的共同目的是消除不同特征间的量纲影响。01词袋模型与TF-IDF:词袋模型只关注词频,完全忽略语法和顺序。TF-IDF是其进阶版,重点在于通过公式TF-IDF(t,d)=TF(t,d)*IDF(t)提取具有代表性的关键词。你需要理解它的数学思想:一个词在当前文章出现越多(TF高),但在全局文档中出现越少(IDF高),它的权重就越大。
04多媒体数据的张量转换:难点在于理解“傅里叶变换”的作用。它将一维的、随时间连续变化的声波(时域),转换成能够展示频率组合的二维频谱图(频域),从而可以直接套用处理图像的卷积神经网络(CNN)来进行声音识别。谢谢!1.在机器学习数据预处理中,独热编码是一种将类别变量转换为二进制向量的常用方法,对于包含苹果、梨、香蕉三个类别的集合,苹果对应的独热编码应为(),这一编码形式确保了每个类别具有唯一的标识。[1,0,0]A[0,1,0]B[0,0,1]C[0,0,0]D提交单选题1分2.在文本挖掘和信息检索中,TF-IDF是一种常用的特征加权技术,其核心思想是衡量一个词对文档的重要程度,即一个词在特定文档中出现频率越高,且在其他文档中出现频率越低,则该词(),从而能够有效突出文档的关键词。只考虑词在文档中出现的频率A只考虑词的逆文档频率B一个词在一段文本中出现次数越多,在其他文本中出现次数越少,越能代表该文本C不考虑词的出现频率和逆文档频率D提交单选题1分单选题1分3.在词嵌入技术中,Word2Vec的CBOW(A连续词袋)模式是一种重要的训练方式,其核心思想是(),即利用上下文词汇来预测当前目标词。基于上下文单词预测目标词A以目标词预测其周围上下文B构建大规模语料库中所有词对的共现矩阵C将词进一步拆分为若干字符级n-gramD提交单选题1分4.FastText算法是对Word2Vec的改进,其显著特点是(),从而能够更好地处理词形变化和生僻词。采用多层双向语言模型A基于上下文单词预测目标词B将词进一步拆分为若干字符级n-gramC构建大规模语料库中所有词对的共现矩阵D提交单选题1分5.BERT作为预训练语言模型的里程碑,其在预训练阶段采用的方法是(),这使得模型能够生成深度的双向语言表征。掩码语言模型(MaskedLanguageModel,MLM)A传统的单向语言模型B把两个单向语言模型进行浅层拼接C以上都不是D提交单选题1分6.在BERT模型中,位置嵌入(CPositionEmbedding)的作用是(),确保模型能够感知词语在句子中的顺序信息。标记词的本体特征A区分输入中的不同句子(或段落)B记录词语在序列中的位置信息C生成深度的双向语言表征D提交此题未设置答案,请点击右侧设置按钮单选题1分7.BERT的另一预训练任务NextSentencePrediction()通过输入两句话让模型判断它们是否连续,其主要作用是(),增强模型对文本结构的建模能力。强制模型学习双向上下文关系,提升其对语义的理解能力A训练模型捕捉句子间的逻辑关联,增强对文本结构的建模能力B将文本中的每个词映射为一个固定维度的向量C区分输入中的不同句子(或段落)D提交单选题1分8.在音频处理中,傅里叶变换是一种重要的数学工具,其主要作用是将信号从(),从而分析声音的频率组成,为后续特征提取奠定基础。将音频转换为原始波形A对音频进行采样与量化B直接用于AI任务C将信号从时间域转换到频率域,分析声音是由哪些频率的声波叠加而成的D提交单选题1分9.在计算机视觉中,视频数据可以看作是一系列图像的连续集合,其数据结构通常表示为(),其中包含了时间维度和空间维度信息。一个二维矩阵A图像序列的集合,用四维张量(帧数,高度,宽度,通道数)表示B一个三维张量(Height×Width×Channels)C一个一维长序列D提交单选题1分10.虽然数据驱动范式在人工智能中取得巨大成功,但它也存在明显的缺点,主要表现为(),同时模型内部决策过程往往缺乏透明度。能捕捉复杂非线性关系A对数据量和质量要求极高B可自动学习特征C有一定泛化能力D提交单选题1分11.在数据收集过程中,常见的来源包括(),这些来源提供了原始数据以支持模型训练和应用开发。数据库表AJSON文件B文本C传感器D提交单选题1分12.在AI项目的数据处理流程中,数据建模阶段涉及多个子任务,其中包括(),这是构建有效模型的基础。数据收集A特征提取B数据清洗C标签校验D提交单选题1分13.数据质量在机器学习中至关重要,它直接影响(),即模型从数据中学习到的规律是否可靠和有效。知识发现的可靠性A模型知识覆盖的广度B模型的泛化能力C模型内部决策的透明度D提交单选题1分14.在数据类型分类中,结构化数据具有严格的格式和组织形式,常见如(),便于检索和分析。JSON文件A文本B数据库表C图像D提交单选题1分15.非结构化数据没有固定的组织形式,常见如(),它们占数据总量的大部分,处理难度较高。数据库表AXML文件BCSV文件C新闻D提交单选题1分16.向量是一维的有序数值集合,既有大小又有方向,例如(),它可以表示空间中的点或特征。温度A二维空间中的点(x,y)B图像的像素阵列C特征值D提交单选题1分17.在人工智能中,用于描述对象属性的一组数值被称为(),它可以表示图片、文本、用户等各种实体的特征。标量A向量B矩阵C特征向量D提交单选题1分18.在数据预处理中,将数据缩放到0到1范围内的技术称为(),常用于特征范围差异较大且对距离敏感的算法。标准化A归一化B特征提取C特征选择D提交1.在人工智能领域,数据对模型性能有着至关重要的影响,以下关于数据作用的说法中正确的有(),这些观点揭示了数据规模、质量和多样性的重要性。数据规模的扩展能提升AI模型在复杂环境下的泛化能力与鲁棒性A高质量的数据是AI模型学习有效规律的基础B数据的准确性对模型泛化能力起决定性作用CAI项目中的数据处理主要包括收集、存储、建模三个阶段D数据类型与模型的性能没有关联E提交多选题1分多选题1分2.在数学和机器学习中,标量、向量和矩阵是基本的数据结构,以下关于它们的描述中正确的有(),这有助于理解数据的维度特性。标量有大小和方向A向量是一维的,有大小和方向B矩阵是二维的,由多个向量或标量组成C矩阵和向量都没有方向D标量是二维的E提交人工智能素养导论暨南大学第7章人工智能的主要技术目录01概述与引言02感知技术03语言与知识处理04智能决策05生成式智能章节导图7概述与引言人工智能的演进:从预设规则到自主学习核心突破现代AI的关键在于赋予机器“学习”的能力,而非仅仅执行预设指令。传统编程传统机器本身不具备学习能力,其“学习”功能是由科学家与工程师通过算法、模型与数据框架构建而赋予的。机器学习机器具备学习能力,工程师无需预设所有具体行为,只需设计不同场景下的学习方法,机器即可通过自主学习获得新能力,实现持续提升。人工智能技术体系核心研究领域机器学习与深度学习自然语言处理(NLP)计算机视觉与生物特征识别知识图谱与专家系统人机交互与AR/VR应用影响正通过多元化应用深刻改变人类生活:智能家居无人驾驶机器人智慧医疗7概述与引言7.1感知技术感知技术概述核心定义感知技术是机器感知和理解物理世界的起点,相当于人工智能的“眼睛”和“耳朵”。主要构成计算机视觉(CV)语音识别(ASR)多模态感知7.1.1计算机视觉定义与目标计算机视觉是研究如何让计算机模仿人类视觉系统的科学。其核心目标是使计算机具备类似人类的图像/图像序列的提取、处理、理解和分析能力。计算机视觉类型计算成像学图像理解三维视觉动态视觉视频编解码计算机视觉定义
7.1.1计算机视觉计算机视觉类型
计算成像学三维视觉动态视觉视频编解码自动驾驶/机器人实现环境感知、障碍物检测与路径规划,是无人驾驶的核心技术支撑。智能医疗医疗影像分析(CT/MRI),辅助医生进行疾病预测、早期诊断和精准治疗。7.1.1计算机视觉计算机视觉的应用
7.1.2语音识别语音识别技术原理
原理旨在让智能设备“听懂”人类的语音,是实现自然人机交互的关键技术。基于语音特征参数的模式识别系统。本质7.1.2语音识别语音识别应用场景
车载语音助手与豆包对话7.1.3多模态感知多模态的概念
多模态是指多种感官信息(如视、听、文、嗅等)的集合。研究多模态问题,是实现人工智能深度理解与认知现实世界的关键。7.1.3多模态感知多模态感知的价值7.1.3多模态感知数据级融合
技术特点数据级融合是最底层的融合方式。它直接将来自不同模态的原始数据(如图像、音频)进行对齐与合并,形成新数据表示。核心要求与应用要求数据在时空上严格对齐,确保不同模态描述的是同一物理实体的同一时刻。RGB-D图像融合:将彩色图与深度图在像素级叠加,广泛应用于3D场景理解。7.1.3多模态感知特征级融合
技术特点不同模态的数据首先转化为高层次的特征向量(如图像的纹理特征、文本的语义特征),随后将这些特征在模型的中段进行拼接、相加等操作技术优点允许模型学习模态间复杂的非线性关联,广泛应用于图像描述生成、视频情感分析等需要深度理解多源信息的任务中。7.1.3多模态感知目标级融合
技术特点目标级融合是一种“分而治之”的后端融合策略。每个模态都配备一个独立的处理模型,并各自做出初步决策(如分类结果、检测框)。系统通过投票、加权平均等,来整合以形成最终输出。技术优点灵活性强,对模态间异步或异构数据兼容性好,常见于多传感器系统中的目标识别或多专家意见综合等场景。决策融合中心投票法/加权法多专家意见综合视觉模型猫:0.9/狗:0.1语音模型猫:0.8/狗:0.2语音模型猫:0.7/狗:0.37.1.3多模态感知模态对齐
模态对齐是通过各种技术手段,实现不同模态数据(如图像、文本、音频等)在特征、语义或表示层面上的匹配与对应。
跨模态对齐主要分为显式对齐和隐式对齐。7.1.3多模态感知显示模态对齐
直接建立模态间的对应关系。例如,将图像中的特定区域与文本中的特定单词进行明确关联。其中包含无监督学习和监督学习技术特点技术详解无监督对齐利用数据统计特性,如CCA(典型相关分析)、自编码器,寻找模态间的潜在关联。监督对齐利用额外标签指导,如多模态嵌入模型、多任务学习,强制对齐语义空间。学习共享的权重矩阵进行矩阵对齐(CCA)7.1.3多模态感知隐式模态对齐
通过模型内部机制(如注意力机制)隐式实现。在处理过程中动态学习不同模态间的语义匹配权重。技术特点技术详解注意力对齐通过注意力机制动态生成跨模态权重,实现软对齐,如图像区域与文本单词的关注度匹配语义对齐在更深语义层面实现对齐,如利用图神经网络(GNN)建模模态间的复杂关系。基于图的方法对齐7.2.1自然语言处理自然语言处理是什么
NLP是计算机科学与AI的重要领域,融合语言学、计算机科学和数学,旨在分析、理解和生成自然语言,以促进人机、人人交流。人类输入语音、文本、手势NLP“黑盒”分析、理解、生成机器输出回答、动作、翻译7.2.1自然语言处理自然语言处理层次化架构
NLP核心技术分为基础技术,核心技术和NLP+7.2.2知识图谱知识图谱(KG)定义知识图谱是一种用图模型来描述知识和建模世界万物之间的关联关系的技术方法。它本质上是是一种由节点和边组成的图数据结构。每个节点表示现实世界的“实体”,每条边为实体与实体之间的“关系”7.3智能决策智能决策定义
智能决策是指人工智能系统在复杂的环境中,通过对信息的加工、建模与推理,自动选择最优行动方案以达成特定目标的过程。7.3.1专家系统专家系统定义
专家系统(ExpertSystems)是旨在模拟人类专家的决策过程,通过将专家的知识和经验编码到计算机系统中,提供高效、可靠的解决方案。有以下四个部分组成
知识库:存储领域专家积累的规则、事实和经验
推理机:执行知识库中的规则,结合输入信息得出结论。
解释器:解释系统的推理过程,,提高系统的可解释性。
用户界面:用于接收用户输入和展示系统结果7.3.1专家系统概率图定义
概率图模型,就是在概率模型的基础之上,用基于图的方式来表示概率分布,其中,图中的节点表示变量,节点之间边表示相应的概率关系。7.3.2概率图模型
贝叶斯网络
贝叶斯网络(BayesianNetworks)是一种用图结构表示变量间概率依赖关系的决策模型。
它通过有向无环图(DAG)来刻画因果关系,使得计算机能够在证据不足的情况下,计算出某种结果发生的概率。7.3.2概率图模型
贝叶斯脏话分类算法流程
7.3.2概率图模型
马尔可夫模型
马尔可夫模型(MarkovModels)是一种特殊的概率图模型,假设当前状态仅依赖于前一状态,而与更早的状态无关,主要有两种形式:马尔科夫链状态A状态B状态C隐藏S1隐藏S2观测O2观测O1隐马尔可夫模型(HMM)所有状态均可直接观测。如市场预测、网页排名。系统包含不可观察的隐藏状态,通过观测值推断。应用于机器人路径规划、语音识别。7.3.2概率图模型
隐马尔可夫模型的作用这一模型成为了后来强化学习(ReinforcementLearning)的理论基石,广泛应用于机器人路径规划和物流调度。7.3.3智能体技术智能体技术(Agent)是什么智能体(Agent)是指能够自主感知环境、做出决策并执行行动的系统。它具备自主性、交互性、反应性和适应性等基本特征,能够在复杂多变的环境中独立完成任务。7.3.3智能体技术智能体技术的组成
7.4.1生成技术生成技术是什么生成式人工智能是指能够学习数据内在规律并生成全新、原创内容的机器学习系统。它不仅能分类和预测,更能复用知识解决新问题。使用大模型生成的一张照片7.4.1生成技术生成技术工作原理
生成式AI通过理解训练数据,使用神经网络来识别现有数据中的模式和结构,以生成新的原创内容。7.4.1生成技术生成对抗网络(GAN)
生成器生成新的数据VS判别器判断生成数据与真实数据的相似程度通过不断的训练,生成器能够生成越来越逼真的数据。7.4.1生成技术变分自编码器(VAE)编码器将输入数据映射到潜在空间中VS解码器从潜在空间中的分布采样数据并生成新的数据VAE是一种基于概率的生成模型,通过在潜在空间中采样,实现对新数据的重构与生成。7.4生成式智能循环神经网络(RNN)和Transformer模型7.4.1生成技术成功生成式模型的三大要求高质量:拥有高质量的生成输出是关键多样性:好的生成式模型能够在不影响生成质量的情况下捕捉到数据分布中的少数模式,有助于减少学习模型中的不良偏差。高速度:许多交互式应用需要快速生成7.4.2生成式技术应用文本生成技术
文本生成技术可以生成逼真的自然语言文本,可以编写文章、故事、诗歌等。同时,它还可以用于智能对话系统,提高用户与AI的交流体验。Gemini腾讯元宝7.4.2生成式技术应用图像与视频生成技术用户通过输入自然语言描述、草图或现有图片,AI可借助扩散模型等深度学习技术,生成高质量、高分辨率的图像图像生成技术视频生成技术7.4.2生成式技术应用代码生成技术代码自动生成器通常采用模板和元数据的方式,根据用户输入的信息生成相应的代码。腾讯元宝字节旗下的trae7.4.3风险与挑战数据质量瓶颈与AI幻觉难题
7.4.3风险与挑战伦理与安全风险
生成式AI的使用可能引发数据泄露、知识产权侵权、偏见放大和社交工程攻击等问题。这些风险会对组织安全与公众信任造成实质性威胁。7.5本章小节
02自然语言处理和知识图谱构成了AI理解人类语言与知识的双翼。重点是建立NLP的分层技术体系:基础技术(词法、句法、语义、语用分析)→核心技术(机器翻译、对话系统、自动问答)→NLP+(搜索引擎、智能客服等应用),以及从CNN/RNN/LSTM到Transformer/Attention机制的模型演进脉络。
03智能决策是AI从感知走向行动的核心环节,本章呈现了一条清晰的技术演进路径。重点是三个递进层次:(1)专家系统通过知识库+推理机+解释器+用户界面的架构,将人类专家的领域知识编码为可推理的规则系统;(2)概率图模型引入不确定性推理。难点在于智能体(Agent)技术的核心架构理解:以LLM为"大脑"进行推理决策,配合记忆模组、规划模组和工具集成,实现从简单规则匹配到自主智能的跃迁。01本章首先从感知层切入,梳理了计算机视觉、语音识别和多模态感知三大技术。重点是理解每种技术的核心范式变迁难点集中在多模态感知部分——需清晰区分模态融合的三个层级:数据级融合、特征级融合和目标级融合,以及模态对齐中显式对齐与隐式对齐的技术路线差异。
04生成式AI是本章最具前沿性的内容。重点是理解生成式AI与判别式AI的本质区别,同时需掌握成功生成式模型的三个关键要求,理解生成式技术的风险与挑战谢谢!单选题1分1.在人工智能领域中,计算机视觉主要依赖()推动了图像识别、目标检测等技术的突破,这体现了连接主义在视觉处理中的应用。连接主义A符号主义B统计学派C行为主义D提交单选题1分2.在模态融合技术中,发生在原始信息层面的最底层融合方式是(),它直接对原始数据进行整合。数据级融合A特征级融合B目标级融合C语义级融合D提交单选题1分3.从本质上看,知识图谱是一种(),它通过图模型描述事物之间的关联关系。关系数据库A文本数据库B图像数据库C结构化的语义知识库D提交单选题1分4.贝叶斯网络通过()来刻画变量之间的因果关系,从而在证据不足时计算事件发生的概率。无向图A有向无环图(DAG)B树状图C网状图D提交单选题1分5.智能体的核心能力主要体现在()方面,这使其能够适应环境并解决复杂问题。学习和决策能力A感知能力B交互能力C反应能力D提交单选题1分6.在生成对抗网络()中,负责生成新数据的组件是(),它与判别器相互博弈以提升生成质量。生成器A判别器B编码器C解码器D提交单选题1分7.在神经网络中,具有记忆功能并能够捕捉序列数据中时序信息的模型是(),常用于自然语言处理等任务。卷积神经网络(CNN)A生成对抗网络(GAN)B循环神经网络(RNN)C变分自编码器(VAE)D提交单选题1分8.成功的生成式AI模型通常需要满足高质量、多样性和高速度等关键要求,但()并不属于这些关键要求之一。低成本A高质量B多样性C高速度D提交单选题1分9.图片生成AI的核心功能通常包括文生图、图生图和图像编辑与扩展,但()不属于图片生成AI的核心功能范畴。文生图A图生图B视频生成C图像编辑与扩展D提交单选题1分10.在电商应用中,基于用户上传的商品图像实现虚拟试穿并自动生成商品营销文案,这属于()技术的典型应用,它结合了多种信息形式。多模态生成A文本生成B图像生成C视频生成D提交单选题1分11.生成式AI的“幻觉”问题指的是模型(),即输出看似合理但实际上错误的信息,这是由于依赖统计模式而非因果理解。模型无法生成内容A生成内容质量低B条理清晰地输出错误信息C模型不稳定D提交单选题1分12.计算机视觉的终极目标是实现(),即让计算机能够像人一样深入理解图像内容,而不仅仅是识别。实现图像理解A图像识别B目标检测C视频编解码D提交单选题1分13.在模态融合技术中,发生在中间抽象层次的融合方式是(),它将不同模态数据转化为特征向量后进行整合。数据级融合A目标级融合B特征级融合C语义级融合D提交14.知识图谱的构建涉及关系抽取、图存储、实体融合等技术,但()通常不属于知识图谱构建的直接技术范畴。图像识别A关系抽取B图存储C实体融合D提交单选题1分15.在马尔可夫模型中,用于表示所有状态均可直接观察的系统的模型是(),它展示了状态之间的转移概率。隐马尔可夫模型A强化学习模型B马尔可夫链C贝叶斯网络D提交单选题1分1.在人工智能技术中,以连接主义为主导的技术包括()等,它们通过模拟神经网络实现突破。计算机视觉A语音识别B自然语言处理C专家系统D知识图谱E提交多选题1分多选题1分2.在机器学习中,属于概率图模型的有(),它们通过图结构表示变量间的概率依赖关系。生成对抗网络A贝叶斯网络B专家系统C马尔可夫模型D智能体E提交人工智能素养导论暨南大学第8章
机器学习与深度学习目录01机器学习的过程于概念02机器学习分类03深度学习技术04典型案例概述与引言8.1.1机器学习的定义机器学习的定义核心领域:机器学习作为人工智能的核心研究领域,融合了统计学、神经网络、优化理论等学科。学科特征:呈现出显著的交叉学科特性。应用赋能:旨在探究计算机模拟或实现人类学习行为的机制,以获取新知识或技能。8.1.1机器学习的定义机器学习理论:连接主义模拟人脑:侧重于通过神经网络技术来模拟人脑的日常学习。数据驱动:借助神经网络实现完全数据驱动的特征学习。应用领域:该范式广泛应用于图像分类以及自然语言处理等热门领域。8.1.1机器学习的定义机器学习理论:贝叶斯学派推理基础:该学派主要基于严谨的概率图模型进行逻辑推理。处理未知:依托先进的概率模型专门处理各种不确定性问题。序列应用:例如利用隐马尔可夫模型在序列预测中进行深度应用。贝叶斯网络图8.1.1机器学习的定义TomMitchell的三要素定义精准定义:每个机器学习问题都可以被精准地定义为三个核心要素。三大要素:这三大要素分别是任务T(Task)、经验E(Experience)和性能P(performance)。过程表述:学习过程即为了实现任务,通过经验使模型性能逐步提升。8.1.2机器学习过程数据挖掘与机器学习广泛应用:数据挖掘在决策辅助、流程优化与精准营销等商务智能领域有广泛应用。技术融合:运用了机器学习、前沿统计学以及海量数据库技术。发掘模式:旨在从大规模数据集中精准发掘潜在模式与知识。8.1.2机器学习过程机器学习的完整过程流程概念:指从数据出发,通过算法构建模型并使其具备泛化能力的完整流程。关键环节:包含数据预处理、模型选择、模型训练、模型评估与部署等环节。核心目标:构建出具备对未知数据良好适应性(泛化能力)的智能模型。8.1.2机器学习过程机器学习的完整过程8.1.2机器学习过程机器学习过程:数据准备基础处理:项目开始前,需对数据进行收集、清洗、处理和转换。特征工程:特征工程极为重要,模型质量很大程度取决于输入数据质量。预测目标:提取标签作为监督学习中模型最终试图精准预测的目标。8.1.2机器学习过程数据预处理方法:中心化方法依据:根据训练数据的实际特点,选择合适的预处理方法。减去均值:中心化是指减去均值,使数据范围围绕数字0进行波动。减少偏移:这种处理方式可以有效减少数据偏移带来的不良影响。beforeafter8.1.2机器学习过程数据预处理方法:标准化算法公式:将数据减去均值之后,再统一除以标准差。正态分布:将其缩放到均值为0、标准差为1的标准正态分布区间。beforeafter8.1.2机器学习过程数据预处理方法:归一化缩放范围:将原始收集的数据缩放到特定的范围之内(如[0,1])。消除量纲:其核心目的在于消除不同特征之间的量纲(单位)差异。8.1.2机器学习过程机器学习过程:模型选择问题性质:根据回归、分类等不同的问题性质来进行针对性选择。算法架构:需要选择最为合适的数学算法或网络模型架构。工作原理:需深入理解不同模型如何工作及其最适合解决何种问题。8.1.2机器学习过程机器学习过程:模型训练数据驱动:一旦选择了特定模型,接下来使用训练数据集来训练模型。最小损失:核心操作是不断调整模型参数以求最小化损失函数。优化算法:整个优化过程中必然会用到如梯度下降及其各种变种算法。epochs=100#设定让模型对这份数据学习100轮forepochinrange(epochs):
#第一步:模型基于当前参数,对训练数据X_train进行预测
predictions=model(X_train)
#第二步:计算当前预测值与真实标签y_train之间的损失(误差有多大)
loss=criterion(predictions,y_train)
#第三步:清空优化器中上一步残留的梯度数据
optimizer.zero_grad()
#第四步:反向传播。计算损失函数相对于每一个模型参数的梯度(即下山的方向)
loss.backward()
#第五步:优化算法发力。根据刚才算出的梯度,正式更新/调整一次模型参数
optimizer.step()
#每隔20轮打印一次当前的损失情况,观察损失是否在“最小化”
if(epoch+1)%20==0:
print(f'训练轮数[{epoch+1}/{epochs}],当前损失(Loss):{loss.item():.4f}')8.1.2机器学习过程机器学习过程:评估与优化模型评估:训练完成后,必须对模型性能进行全面、科学的评估。泛化能力:不仅要在训练数据表现好,还要能泛化到未见过的新数据。8.1.2机器学习过程机器学习过程:部署与维护实际应用:当模型经过充分训练和验证后,将其部署到实际工作环境中。持续监控:部署之后还需要对模型的实际预测表现进行持续监控。调整更新:根据实际收集到的反馈信息,进行必要的算法调整和更新。8.1.3机器学习核心概念数据样本对象描述:样本是对某一个特定对象和独立事件的具体描述。训练数据:在机器学习中,样本主要被用作投喂给算法的训练数据。数据来源:样本广泛来自传感器、关系型数据库、图像以及文本等。8.1.3机器学习核心概念数据特征属性指标:特征专门用来描述数据样本的本质属性或具体指标。多维刻画:一列数据代表一个特征,一般从多个不同维度出发刻画样本。数据类型:特征既可以是连续的数据,也可以是有限取值的离散数据。数据特征8.1.3机器学习核心概念数据标签目标变量:标签明确表示了数据样本的所属类别或预期目标变量。预测对象:在有监督的学习模式中,它是模型最核心的需要预测的量。实际案例:例如在预测房价任务中房价本身即标签,疾病诊断中患病与否为标签。数据标签8.1.3机器学习核心概念模型本质数学函数:模型本质上为一个复杂的数学函数或计算演进过程。权重参数:具体而言,任何模型都可视为一组权重参数的集合体。预测输出:通过对输入特征进行数学运算进而预测并生成最终输出。8.1.3机器学习核心概念大模型的概念界定庞大参数:大模型通常指代参数量极为庞大、结构异常复杂的机器学习模型。深层网络:尤指目前深度学习研究领域中的大规模深层人工神经网络。复杂模式:能够学习并表征海量数据中蕴含的极其复杂的模式与关联关系。大规模深层人工神经网络8.1.3机器学习核心概念大模型的硬件要求海量训练:此类大模型的训练往往依赖极其海量的数据进行长时间训练。算力支撑:大模型的训练过程通常需要极为强大的底层计算资源作为支持。硬件集群:例如需要用到GPU或TPU等专用硬件集群以及高效的并行框架。8.1.3机器学习核心概念模型训练学习规律:通过算法调整参数,使模型从数据中学习特定知识或规律的过程。迭代优化:其核心机制在于不断地进行迭代优化,反复执行前向及反向传播。泛化目标:不论何种学习范式,训练的最终目标均是具备对未知数据的泛化力。8.1.3机器学习核心概念不同范式的训练差异有监训练:有监督学习严格使用带标签的样本数据来学习映射关系。无监训练:无监督学习旨在自动发现数据中原本隐藏的内在结构。自监训练:自监督学习则能够从数据自身直接构造出用于学习的监督信号。有监训练8.1.3机器学习核心概念内部参数内部变项:参数是指模型内部可以根据计算结果改变数值的可变项。自动学习:其值通过训练过程从海量数据中自动学习并固定下来。映射关系:神经网络中的权重和偏置决定了输入与输出的映射关系。defsgd(params,lr,batch_size):
#@save
"""小批量随机梯度下降"""
withtorch.no_grad():
forparaminparams:
param-=lr*param.grad/batch_size
param.grad.zero_()
lr=0.03num_epochs=3net=linregloss=squared_lossforepochinrange(num_epochs):
forX,yindata_iter(batch_size,features,labels):
l=loss(net(X,w,b),y)
#X和y的小批量损失
#因为l形状是(batch_size,1),而不是一个标量。l中的所有元素被加到一起,
#并以此计算关于[w,b]的梯度
l.sum().backward()
sgd([w,b],lr,batch_size)
#使用参数的梯度更新参数
withtorch.no_grad():
train_l=loss(net(features,w,b),labels)
print(f'epoch{epoch+1},loss{float(train_l.mean()):f}')利用梯度下降来更新W与b8.1.3机器学习核心概念超参数人工设定:在模型训练开始前,必须由工程师或人工提前设定的配置。高层控制:它们是控制整个学习过程的高层变量,如学习率、网络层数。调优实验:无法自动学习,需通过经验或网格搜索等调优实验来确定组合。defsgd(params,lr,batch_size):
#@save
"""小批量随机梯度下降"""
withtorch.no_grad():
forparaminparams:
param-=lr*param.grad/batch_size
param.grad.zero_()
lr=0.03num_epochs=3net=linregloss=squared_lossforepochinrange(num_epochs):
forX,yindata_iter(batch_size,features,labels):
l=loss(net(X,w,b),y)
#X和y的小批量损失
#因为l形状是(batch_size,1),而不是一个标量。l中的所有元素被加到一起,
#并以此计算关于[w,b]的梯度
l.sum().backward()
sgd([w,b],lr,batch_size)
#使用参数的梯度更新参数
withtorch.no_grad():
train_l=loss(net(features,w,b),labels)
print(f'epoch{epoch+1},loss{float(train_l.mean()):f}')在训练前提前设置训练次数和学习率8.1.3机器学习核心概念损失函数代价评估:也称代价函数,用于衡量模型预测结果与真实标签之间的差异。越小越优:损失函数算出的值越小,说明模型的预测越接近于客观真实值。优化方向:为优化算法提供方向,通过调整参数不断降低损失提升准确性。defsgd(params,lr,batch_size):
#@save
"""小批量随机梯度下降"""
withtorch.no_grad():
forparaminparams:
param-=lr*param.grad/batch_size
param.grad.zero_()
lr=0.03num_epochs=3net=linregloss=squared_lossforepochinrange(num_epochs):
forX,yindata_iter(batch_size,features,labels):
l=loss(net(X,w,b),y)
#X和y的小批量损失
#因为l形状是(batch_size,1),而不是一个标量。l中的所有元素被加到一起,
#并以此计算关于[w,b]的梯度
l.sum().backward()
sgd([w,b],lr,batch_size)
#使用参数的梯度更新参数
withtorch.no_grad():
train_l=loss(net(features,w,b),labels)
print(f'epoch{epoch+1},loss{float(train_l.mean()):f}')损失函数计算8.1.3机器学习核心概念模型泛化与过拟合训练优异:过拟合指模型在原本的训练数据集上表现得异常优异。性能下降:但当面临全新的、未见过的数据时,模型性能出现严重下降。拟合噪声:源于模型复杂度过高,不仅学习了规律,还拟合了无用的噪声。训练集的error一直下降,但是验证集的error不减反增8.1.3机器学习核心概念模型评估与交叉验证评估方法:交叉验证是一种极为重要的模型性能可靠评估方法。子集轮换:将数据划分若干子集,确保分布一致并轮流用作测试集。降低风险:其主要目的在于检验模型在未见数据上的表现以降低过拟合风险。8.1.3机器学习核心概念过拟合与欠拟合对比过拟表现:模型过于复杂,捕捉了噪声,在测试集上表现极差。欠拟表现:模型过于简单,无法捕捉训练数据模式,训练测试误差双高。本质区别:过拟合学到了错误规律,欠拟合既没学好规律也无法泛化。欠拟合良好拟合过拟合8.2机器学习分类机器学习任务分类范式分类:根据学习范式分为有监督学习、无监督学习和强化的学习。复杂分类:根据模型复杂度分为传统机器学习与先进的深度学习。特征差异:传统方法依赖人工特征,深度网络通过多层网络自动提取。8.2.1监督学习监督学习的定义带标数据:核心在于利用大量带标签的数据集去训练计算机模型。映射关系:主要目的是学习从输入特征到输出标签之间的映射关系。阶段流程:其基本流程主要涵盖模型训练阶段以及结果预测两大阶段。8.2.1监督学习监督学习的两大类别类别划分:依据应用场景与数据类型,算法可分为分类和回归两大类。分类输出:分类任务最终的输出结果为明确且有限的离散值(类别)。回归输出:回归问题的最终输出结果为可以无限细分的连续值(如房价)。回归分类8.2.1监督学习监督学习:分类任务划分类别:目标是通过学习模型,将输入样本划分至预先定义的类别中。任务案例:例如猫狗识别任务,或判定垃圾属于“可回收”或“不可回收”。分类类型:常见的分类操作包括二分类、多分类以及更复杂的多标签分类。8.2.1监督学习常见分类算法枚举逻辑回归:一种用于二分类问题的广义线性模型,通过估计样本属于某一类的概率进行分类。8.2.1监督学习常见分类算法枚举决策树:通过递归地分割数据来形成决策路径,每个节点代表一个属性的决策。8.2.1监督学习分类算法详解:逻辑回归广义模型:一种专门用于解决二分类问题的经典广义线性数据模型。概率预测:通过估计样本属于某一类别的概率来进行最终的分类判断。取值范围:由于其结果直接为概率值,因变量取值范围严格介于0和1之间。epochs=1000
forepochinrange(epochs):
#1.前向传播:获取预测概率
predictions=model(X)
#2.计算损失(误差)
loss=criterion(predictions,Y)
#3.反向传播与参数更新
optimizer.zero_grad()
#清空上一步的残余梯度
loss.backward()
#自动计算梯度(Gradient_W,Gradient_b)
optimizer.step()
#更新权重和偏置参数
#每100轮打印一次训练进度
if(epoch+1)%100==0:
print(f'Epoch[{epoch+1}/{epochs}],Loss:{loss.item():.4f}')8.2.1监督学习监督学习:回归任务连续预测:一种对数值型连续随机变量进行科学预测和建模的算法。构建模型:核心是构建数学模型,根据输入特征预测出连续型的输出。应用案例:常见的使用案例包括房价的涨跌预测、股票走势或成绩预测等。股票走势预测8.2.1监督学习常见回归算法枚举算法列举:线性回归、多项式回归、支持向量回归以及随机森林回归等。线性回归:通过最小化实际输出和预测输出之间的均方误差确定最佳线性关系。正则处理:岭回归引入L2正则化处理共线问题,套索回归引入L1促进稀疏解。8.2.1监督学习分类与回归的对比8.2.2无监督学习无监督学习定义无标数据:强制利用无任何标签的训练数据来进行自主的学习和分析。自动挖掘:自动挖掘数据的内在结构、隐藏分布规律或潜在生成机制。发现结构:无需明确输入输出关系,仅靠分析相似性来揭示底层的潜在结构。将数据分为三个组8.2.2无监督学习无监督学习的主要任务应用广泛:在自然语言处理、计算机前沿视觉等多领域具有极广泛应用。主要任务:主要任务板块包括数据聚类、维度降维以及复杂的密度估计。获得机制:核心目标是获得事物内在联系,获取有意义的数据生成机制。8.2.2无监督学习无
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年黑龙江省肇东市高三数学下册期末考试模拟试卷含完整答案【各地真题】
- 2026年黑龙江省虎林市高三数学下册期末考试模拟测试卷附答案【预热题】
- 保险经纪人从业资格考试保险服务模拟试卷
- 保险法律法规与保险业务管理模拟试题
- 保险代理人资格考试保险营销技巧知识点巩固习题
- 物业社区活动策划评估预算方案
- 药品上市工作方案模板
- 具身智能+教育领域互动教学机器人实践方案
- 中药种植示范基地项目可行性研究报告
- 2026年春国开电大《形势与政策》大作业题目及参考答案(二)
- GB/T 47840-2026电气绝缘液体与结构材料相容性试验方法
- 肺炎的种类及其预防措施
- 汇编mips考试试题及答案
- 杭州社区工作者招考真题及答案2025
- 箱涵预制、安装、现浇施工方案
- CNAS-TRC-002-2009 管理体系两阶段审核的合理性安排和实施
- 索尼微单相机A7 II(ILCE-7M2)使用说明书
- 调取监控申请书
- 人工智能训练师理论知识考核要素细目表一级
- GB/T 9799-2024金属及其他无机覆盖层钢铁上经过处理的锌电镀层
- 第1课 社会主义在中国的确立与探索 教案-2023-2024学年中职高教版(2023)中国特色社会主义
评论
0/150
提交评论