模式识别与数据挖掘 课件 -第3章-特征工程_第1页
模式识别与数据挖掘 课件 -第3章-特征工程_第2页
模式识别与数据挖掘 课件 -第3章-特征工程_第3页
模式识别与数据挖掘 课件 -第3章-特征工程_第4页
模式识别与数据挖掘 课件 -第3章-特征工程_第5页
已阅读5页,还剩44页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第三章

特征工程主讲人:某某某PatternRecognitionandDataMining模式识别与数据挖掘目录Contents特征提取FeatureExtraction特征变换与降维FeatureTransformationandDimensionalityReduction特征选择FeatureSelection小结与讨论ConclusionandDiscussion01020304特征提取是指从原始数据中提取出具有代表性和区分性的特征,用于数据分析和模式识别的过程。经典的特征提取方法:统计特征提取2.频域特征提取3.几何特征提取4.文本特征提取5.图像特征提取6.图数据特征提取特征提取基本概念与方法概述通过计算数据集中的各种统计量(如均值、方差、偏度、峰度等)来捕捉数据的分布特性。这些特征可以有效地用于数据分析、建模以及进一步的机器学习任务。常用统计特征有:均值(Mean):数据集的平均值,反映了数据的集中趋势方差(Variance):数据偏离均值的程度,衡量数据的分散程度标准差(StandardDeviation):方差的平方根,也是衡量数据波动性的常用指标。协方差(Covariance):描述两个变量之间的线性关系。皮尔逊相关系数(PearsonCorrelationCoefficient):衡量两个变量之间的相关程度。特征提取统计特征提取频域特征提取是将数据从时域转换为频域的方法。它通过应用傅立叶变换或小波变换等算法,将数据从时域转换为频域表示,从而提取出频域上的特征。常用频域特征有:傅里叶变换(FFT):傅里叶变换将信号从时域转换为频域,使得每个频率分量的幅度和相位可以被提取出来其中,是信号在频域的表示,是信号在时域的样本,N是样本数功率谱密度(PSD):功率谱密度表示信号在不同频率上的功率分布

其中,x(t)是信号在时域上的表示,通常为一个连续时间信号或离散时间信号的函数。是一个复指数函数,表示信号中的频率成分,其中f是频率,t是时间。P(f)是频率f处的功率谱密度。T是信号观察的时间窗口。

特征提取频域特征提取几何特征提取是从图像和三维模型等几何对象中提取特征的方法。它通过计算几何属性,如形状、尺寸、角度和曲率等,来表示对象的特征。几何特征能够反映对象的形状、结构等空间属性,可用于图像识别、目标跟踪、三维重建、机器人导航等任务。常用几何特征有:形状因子(ShapeFactor):形状因子是一种用于描述物体形状的度量,常用于分析物体是否接近某种理想的几何形状,如圆形。形状因子通常通过物体的面积A和周长P来计算:曲率(Curvature):曲率是衡量曲线或表面在某一点处弯曲程度的度量。在二维平面上的曲线y=f

(x)

的曲率

通过以下公式计算特征提取几何特征提取文本特征提取文本特征提取是将文本数据转换为可以用于机器学习算法的向量表示的方法。将文本数据转换为稠密或稀疏向量,以表示词语的出现频率、重要性和语义关联性,可用于文本分类、情感分析和信息检索等任务。常用方法:词袋模型:将文本表示为单词的集合的方法。不考虑单词的顺序,仅仅统计文本中各个单词出现的频率。

词袋模型示例假设有三个文档:文档1:“Ilovemachinelearning”文档2:“Ilovedeeplearning”文档3:“Ihatemachinelearning”词汇表为:{I,love,machine,learning,deep,hate}基本概念文本特征提取常用方法:TF-IDF(TermFrequency-InverseDocumentFrequency):TF-IDF是一种加权的词频方法,通过考虑单词在文档中的出现频率(TF)以及该单词在整个语料库中的重要性(IDF),来衡量单词在文本中的重要性。词频(TF):单词在文档中出现的频率,通常计算为某个单词在文档中出现的次数与文档中总词数的比值:其中,nij表示词条

ti在文档

dj出现的次数,TFij表示词条

ti在文档

dj出现的频率。逆文档频率(IDF):单词在文档集合中的重要性,计算为总文档数与包含该单词的文档数的比值的对数:其中,D表示总文档数,

表示包含该词条的文档数。基本概念文本特征提取常用方法:TF-IDF(TermFrequency-InverseDocumentFrequency):TF-IDF是一种加权的词频方法,通过考虑单词在文档中的出现频率(TF)以及该单词在整个语料库中的重要性(IDF),来衡量单词在文本中的重要性。TF-IDF计算公式:基本概念图像特征提取是从图像中提取有代表性的特征的方法。这些特征可以提取出图像的颜色、纹理、形状和局部结构等信息,可用于图像分类、目标检测和人脸识别等任务。常用图像特征提取方法有:颜色直方图:通过统计图像中每个颜色的出现频率来表示图像的颜色分布。假设颜色直方图有

n个区间(bins),Pi为第i个区间的像素数量。即Hi

表示第i个区间的频率值。图像的颜色直方图可以表示为特征提取图像特征提取局部二值模式(LocalBinaryPattern,LBP):一种用于纹理特征提取的有效方法。LBP是基于图像局部区域的灰度值变化来计算的。计算每个像素的LBP值:对于一个中心像素c和其周围P个邻域像素pi,i=0,1,...,P-1,计算每个邻域像素与中心像素的灰度值比较结果。如果,则si

=1,否则si

=0,其中si为二值结果。然后,LBP值为:构建LBP图像统计LBP的直方图特征提取图像特征提取①

度中心性节点的度中心由节点的度(即直接相连的边数)来定义。度越大,意味着该节点与更多的节点直接连接,可能是信息传播的核心节点,因此度中心性越高。对于一个节点v,其度中心性可以表示为:其中,deg(v)是节点v的度,即与其相连的边的数量。同时,可以对其度中心性值进行标准化处理:节点的度中心性是一个需要考虑的基本统计量。度值代表了一个节点在图结构中的局部重要性。但节点度值只是表示一个节点有多少个邻居,这并不足以衡量一个节点在整个图中的重要性。图数据的特征提取节点特征提取

图数据的特征提取节点特征提取②

中介中心性如图所示,对于节点B而言,从A出发的最短路径有:A-B-C,A-B-D,A-B-D-E或A-B-C-E,A-B-D-F。因此,从节点A出发对节点B贡献的中介中心性值为1/1+1/1+2/2+1/1=4,再判断其他最短路径例如C-D、E-F都不经过节点B,即B贡献的中介中心性值为0,最终得到节点B的中介中心性为4。图数据的特征提取节点特征提取

图数据的特征提取节点特征提取

图数据的特征提取节点特征提取

图数据的特征提取节点特征提取①

最短路径距离最短路径距离即两个节点之间的最短路径的长度,它反映的是从一个节点到另一个节点的最小跳数。如下图中,可提取出从A出发的最短路径长度为1(A一B)、2(A一B一C)、2(A一B一D)、4(A一B一D一E)、4(A一B一D一F)。图数据的特征提取边特征提取

图数据的特征提取边特征提取其中,

分别为节点u和节点v的邻居节点集合的交集并集。图数据的特征提取边特征提取

图数据的特征提取图特征提取①Graphlet图向量Graphlet图向量是基于图中节点邻域的局部拓扑结构,通过统计节点周围不同类型子图的频率来生成图的特征表示。Graphlet是一种小型的无向子图,它包含固定数量的节点和边,且图中的节点是完全连接或部分连接的。在图中以每个节点为中心枚举所有可能的Graphlet,统计不同Graphlet在图中出现的次数。如下图给出了节点数为3的Graphlet集合。图数据的特征提取图特征提取

图数据的特征提取图特征提取

图数据的特征提取如图所示,图G和图G'通过汇聚自身节点和邻居节点的标签,通过哈希映射生成新的标签,最终统计所有更新后的标签频率,得到两个图的图向量特征变换与降维

“维数灾难”问题特征变换与降维特征降维方法线性降维方法非线性降维方法线性判别分析主成分分析奇异值分解核化线性降维流形学习特征变换与降维主成分分析基本原理:通过将原始数据从原来的坐标系转换到一个新的坐标系,使得新坐标系中的:第一个坐标轴对应于原始数据中方差最大的方向第二个坐标轴对应于次大的方差方向,以此类推这个过程一直进行,直到覆盖大部分的方差。该算法的基本步骤如下:以数据的中心为坐标轴的中心,并旋转坐标轴,使得数据在X1轴上的方差最大。这样可以尽量多地保留信息,从而使X1成为第一主成分。寻找第二主成分:找一个X2轴,使得X2与X1的相关系数为0,以避免X2与X1信息重叠,并使数据在该方向的方差尽量最大。以此类推,找到第三主成分、第四主成分,直到第

n

个主成分。一般地,n

个随机变量可以有

n

个主成分。两个特性:最近重构性:样本点到这个超平面的距离都足够用近;最大可分性:样本点在这个超平面的投影尽可能分开。特征变换与降维主成分分析优化目标:基本计算步骤:通过一个实例来展示PCA的降维效果。如右图所示,以蓝色显示的两个向量是这个分布的协方差矩阵的特征向量,其长度按对应的特征值之平方根为比例,并以原分布的平均值为原点。拉格朗日乘子法求解特征变换与降维核化线性降维动机:在现实情况中,往往很难找到一个线性函数映射,使样本从高维空间映射到低维空间后仍能保持良好的低维嵌入核主成分分析原理:引入一个非线性映射函数(通常称为核函数),将原始数据点映射到一个高维(甚至是无限维)特征空间中,原本复杂的非线性关系可能变为线性可分的或更容易处理具体推导在主成分分析问题中,需要求解方程:

其中,z(i)

是样本点

x(i)在高维特征空间中的像,假设

z(i)由

x(i)通过映射

产生,即上式可转化为:一般并不需要

的具体形式,于是引入核函数:特征变换与降维核化线性降维示例:考虑如下图所示的三组同心点云,试图使用核PCA对其进行识别。图中各片的颜色并不是算法的一部分,仅用于展示各组数据点在变换前后的位置同心点云数据示例图特征变换与降维流形学习“流形”是指在局部具有欧氏空间性质的一个空间,即可以在这个局部空间中使用欧氏距离进行计算。假设数据采样于一个高维欧氏空间中的低维流形,流形学习就是从高维采样数据中恢复低维流形结构,即找到高维空间中的低维流形,并求出相应的嵌入映射,以实现维数约简。流形学习线性流形学习算法非线性流形学习算法等距映射/等度量映射(isomap)拉普拉斯特征映射(Laplacianeigenmaps,LE)局部线性嵌入(locallylinearembedding,LLE)主成分分析(PCA)多维尺度变换(multidimensionalscaling,MDS)特征变换与降维等度量映射该算法以MDS为计算工具,创新性地采用微分几何中的测地距离来计算高维流形上数据点间的距离,而非传统的欧氏距离,并且找到了一种用实际输入数据估计其测地距离的算法,如采用最短路径算法中的Dijkstra算法或Floyd算法。特征变换与降维局部线性嵌入Isomap算法是全局的,它要找到所有样本的全局最优解,当数据量很大或者样本维度很高时,耗时将大幅增长。因此更常用的算法是局部线性嵌入(LLE),LLE放弃所有样本全局最优的降维,仅通过保证局部最优来降维。局部线性嵌入(LLE)的基本思想是保持邻域内样本之间的关系。如下图所示,样本从高维空间映射到低维空间后,各个邻域内的样本之间的线性关系不变。特征变换与降维局部线性嵌入

特征选择特征选择是一类可有效解决数据“维数灾难”问题的重要算法,在考虑特征间复杂交互关系的前提下从原始特征空间中寻找一组影响某一事物信息量最大、最有用的特征集合常见的特征选择方法包括过滤式(filter)、包裹式(wrapper)、嵌入式(embedded)三种。过滤式特征选择通过评估每个备选特征与目标变量的相关关系来确定每个特征的重要性,并按照某种规则来选取一组与目标变量相关性较高的特征子集。包裹式特征选择直接利用机器学习模型的性能来评估特征子集的优劣程度。根据评估指标(如准确率、精确率、召回率等)的变化,选择具有最佳性能的特征子集作为最终的特征组合。嵌入式特征选择将特征选择过程嵌入到模型的训练过程中,通过在模型训练过程中对特征的重要性或权重因子进行评估和调整,选择出对模型性能影响最大的特征子集。特征选择基于互信息的特征选择算法信息熵和互信息的基本概念①信息熵:对可能性的一种度量。一个事件的不确定性越大,我们从该事件的发生中获得的信息就越多。信息熵的数学定义为:

特征选择基于互信息的特征选择算法

特征选择基于互信息的特征选择算法

特征选择基于互信息的特征选择算法联合熵的性质如下:(1)大于每个独立的熵:一集变量的联合熵大于或等于这集变量中任一个的独立熵。即

特征选择基于互信息的特征选择算法③

互信息定义:用于衡量两个随机变量之间的相互依赖程度。在特征选择中,互信息可用来衡量特征与目标变量之间的相关性。两个随机变量X和Y的互信息的计算方式为:其中,H(X)是随机变量X的熵,表示X的不确定性;

H(X|Y)

是在已知Y的情况下X的条件熵,表示在Y已知后X的不确定性。互信息可以理解为在知道Y后,X的不确定性减少的量。互信息和信息熵的关系如下图所示:特征选择基于互信息的特征选择算法③互信息给定两个离散随机变量X和Y,它们的联合概率分布为P(X,Y),各自的边缘概率分布为P(X)和P(Y),互信息I(X;Y)定义为:对于连续随机变量,上述求和变为积分:特征选择互信息的性质如下:

(1)

非负性:互信息总是非负的,即:这表示知道随机变量Y的值不会增加关于随机变量X的不确定性。(2)

对称性:互信息是对称的,即:这表示X和Y之间的互信息量是相同的,不论先知道哪一个变量的值。(3)

与熵的关系:互信息可以表示为两个随机变量的联合熵与它们各自熵的差,即:这表示互信息衡量了通过知道Y的值可以减少多少关于X的不确定性(或反之亦然),以及联合熵与各自熵之间的关系。特征选择互信息最大特征选择算法(MIM):选择那些能够最大化与目标变量互信息的特征。在特征选择过程中,算法会计算每个特征与目标变量之间的互信息,并根据互信息值的大小对特征进行排序。然后,算法会选择互信息值最大的前k个特征作为最优特征子集。基于互信息的特征选择算法(MIFS):通过最大化特征与类别之间的互信息,最小化特征之间的互信息来选择特征最大相关最小冗余算法(mRMR):从高维数据中选择最优的特征子集,使得选定特征与目标变量的相关性最大化(即“最大相关”)以及选定特征之间的冗余性最小化(即“最小冗余”)。基于互信息的特征选择算法特征选择稀疏正则化的概念稀疏正则化(SparseRegularization)是一种在模型训练过程中通过添加正则化项,促使模型参数变得稀疏的方法。通过稀疏正则化,可以自动地从数据中筛选出重要的特征或参数,减少模型的复杂度,防止过拟合,提高模型的泛化能力和可解释性正则化的基本思想是在损失函数中加入一个惩罚项,限制模型参数的大小或分布。稀疏正则化具体通过限制参数的数量或使得许多参数趋近于零,实现参数的稀疏化常见的正则化方法包括:套索模型(Lasso)、弹性网正则化(ElasticNet)、融合Lasso(FusedLasso)、组Lasso(GroupLasso)等稀疏正则化特征选择算法特征选择套索模型(Lasso)

稀疏正则化特征选择算法线性模型:套索模型(Lasso):岭回归正则模型:不具备显式解,使用坐标下降算法不断迭代,更新公式为:特征选择弹性网模型(ElasticNet)是将Lasso和岭回归结合的一种正则化方法

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论