版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大数据技术在会计与财务中的应用2026/9/7《大数据技术在会计与财务中的应用》配套课件第3章·3.1机器学习概述目录3.1.1机器学习概念及分类3.1.2机器学习的任务3.1.3训练集、验证集及测试集3.1.4机器学习的流程3.1机器学习概述3.1机器学习概述|02/16机器学习概念及分类
机器学习指让计算机系统学习数据中的模式和规律,从而完成预测或分类等任务。具体而言,机器学习算法通过对大量的数据进行学习,能够自动发现数据中的模式,并对新的数据进行泛化。在财会领域,机器学习有着广泛的应用价值。它可以用来检测财务欺诈行为、预估企业绩效以及预测股票市场的走势等。3.1机器学习概述|03/16机器学习概念及分类根据学习任务中是否使用标注数据,机器学习可以分为有监督学习、无监督学习以及半监督学习。有监督学习算法是基于预先标注的数据集来训练模型的一种方法,旨在预测新数据的输出。通过分析包含输入特征及其对应输出标签的训练样本,学习到输入与输出之间的映射关系。预测企业财务舞弊:是否舞弊的历史数据预测公司股价走势:历史的股票市场表现预测客户违约概率:历史的违约情形2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|04/16机器学习概念及分类不同于有监督学习,无监督学习算法无需依赖标注的数据,自动发现和解析数据中的隐藏模式或内在结构。将公司的财务报表进行聚类分析,聚类之前,并不知道这些公司将如何分类将客户进行聚类分析,分析之前,并不知道这些客户有哪些类型半监督学习算法是介于监督学习和非监督学习之间的一种算法。半监督学习算法结合了少量的标记数据和大量的未标记数据来进行训练。仅有少数企业的数据被标记为“正常”或“异常”,而其余大部分数据则没有这样的标注。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|05/16机器学习概念及分类在标注数据充足的情况下,我们通常会优先选择有监督学习算法,因为它能够直接从标注数据中学到精确的映射关系,模型的准确性较高。当我们不了解数据的分布与特征,或者缺少有标注的数据时,无监督机器学习可以帮助探索数据中的隐藏结构或模式。而半监督学习则是在标注数据有限的情况下提供了一种平衡,其允许我们利用未标注数据来扩充训练集。值得注意的是,不同算法有各自的优缺点和适用场景,选择哪个算法取决于具体的研究情境和数据。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|06/16机器学习的任务机器学习的任务主要包括分类、回归以及聚类。下图展示了机器学习分类及其相应任务之间的关联。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|07/16机器学习的任务分类是一种有监督学习任务,其目标是将数据划分为预先定义好的类别。机器学习算法基于有标签的训练数据进行学习,并在新的未标注数据上进行分类。回归也是一种有监督学习任务,其目标是预测一个连续的输出变量。与分类不同,回归的输出是一个实数值而不是一个类别标签。聚类是一种无监督学习任务,其目标是将数据分为具有相似特征的簇,使得同一组内的数据相似度较高,而不同组之间的相似度较低。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|08/16机器学习的任务垃圾邮件分类是经典的分类问题。通过给定的邮件数据,机器学习了普通邮件与垃圾邮件两类邮件的模式与差异。在预测时,它可以根据学到的模式将新的电子邮件分类为普通或垃圾邮件。在会计学研究中,预测财务舞弊同样是一个典型的分类任务,即利用历史数据中的舞弊与非舞弊案例来训练模型,进而检测未来可能发生的舞弊行为。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|09/16机器学习的任务房价预测是一个典型的回归问题,模型会根据房屋的各种属性(如面积、位置等)来估计其市场价值。会计学领域常见的回归问题是预测股票市场,即通过分析影响股价的一系列因素,预测企业股票在未来一段时间内的走势。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|10/16机器学习的任务在处理大量客户数据时,聚类分析可以有效地识别出不同的客户群组,每个群组内的成员共享某些共同特征或行为模式。这为个性化营销、客户服务优化等提供了重要的决策支持。会计学研究中,学者们常使用聚类技术(如LDA主题模型)对公司的年报等文本进行聚类,将这些文本分成不同的类别,从而刻画文本的主题分布和内容特征。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|11/16训练集、验证集及测试集在进行机器学习任务时,我们通常将数据集分成以下三部分:训练集、验证集与测试集。以我们的上学和考试为例,训练集可以类比为我们学习的过程,验证集相当于考前的模拟测试,而测试集就是最终的期末考试。训练集是模型学习和拟合的基础数据集合。它为模型提供了必要的信息,使模型能够从中学习模式并做出预测。训练集通常占据整个样本的70%到80%。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|12/16训练集、验证集及测试集验证集是用于调整模型超参数的数据集。通过验证集,我们可以调整模型以达到最佳表现,同时确保其具备良好的泛化能力。验证集在训练过程中不参与模型参数的更新,通常占数据集的10%到20%。测试集是用于评估最终模型性能的数据集。测试集的使用仅限于模型开发的最后阶段,用来衡量模型的真实预测能力。测试集通常占据整个数据集的剩余部分,即未被分配给训练集和验证集的部分。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|13/16机器学习的流程机器学习通常包括以下步骤:数据收集与预处理、特征工程、模型选择与训练、模型评估等。(1)数据收集指的是收集与研究问题相关的数据集。在会计实务中,常见的数据集既包括结构化数据,还包括一系列非结构数据。(2)数据预处理指的是对收集到的数据进行清理和整理。不同数据的预处理方法不同。(3)特征工程指选择、转换或创建合适的特征,以提高机器学习模型的性能。特征的选取是模型有效的重要基础。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|14/16机器学习的流程(4)模型选择指根据任务的性质和数据的特点选择合适的算法。(5)模型的训练指使用训练数据对选择的模型进行训练,使其能够从数据中学习模式和规律。具体而言,我们将数据集划分为训练集、验证集和测试集,定义模型的初始化参数,通过优化算法对模型进行调整,并基于验证集调整模型的超参数。(6)模型评估是指通过一系列指标和方法,使用测试数据集评估已训练模型的性能。其目的是了解模型在未见过的数据的泛化效果。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.1机器学习概述|15/162026/9/7《大数据技术在会计与财务中的应用》配套课件谢谢观赏!3.1机器学习概述|16/16大数据技术在会计与财务中的应用作者:张敏等2026/9/7《大数据技术在会计与财务中的应用》配套课件第3章·3.2模型与算法目录3.2.1模型的概念3.2.2算法的概念3.2.3迭代与梯度下降3.2.4机器学习模型的评价指标3.2.5欠拟合与过度拟合3.2模型与算法3.2模型与算法|02/26模型的概念在机器学习中,模型刻画了变量之间的关系,它是对未知数据进行预测的数学表达式或规则集。模型的任务是捕捉训练数据中的模式和规律,以便能够泛化到新的、未见过的数据。我们通过公司的业绩预测公司股价时,可以构建如下一元线性回归模型为例。y=α0
+α1x+ε3.2模型与算法|03/26模型的概念y=α0+α1x+ε一元线性回归模型就是一个简单的机器学习模型。其中,x是特征,y是预测的标签,α1是权重,α0是截距项,ε是误差项。模型预测值与真实值之间的差异被称为误差。训练模型的过程就是获得误差最小时的权重与偏差。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|04/26算法的概念机器学习的算法是指用于训练模型的一系列步骤或规则。具体而言,算法是指从输入数据中提取信息、构建模型、进行学习、以及基于该模型做出预测或决策的具体方法。简而言之,模型是机器学习的输出,而算法是如何生成这个输出的工具。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|05/26迭代与梯度下降一个模型可以基于多个算法训练获得,例如上述的一元线性模型可以通过最小二乘法或者极大似然估计获得。在机器学习中,它还可以通过反复迭代进行估计。迭代是机器学习的常见思路,它指在计算过程中通过多次重复执行相似的步骤来逐渐接近或达到预期结果的过程。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|06/26迭代与梯度下降如何理解迭代呢?我们可以把它想象成自己修改论文的过程,为了达到理想的目标,我们不断在上一轮的基础上进行调整,进而向目标靠近。迭代的基本思想就是重复计算或操作,在执行完一组参数以后,继续换下一组参数,逐渐接近某个目标或收敛到某个状态。在上述的一元线性模型中,机器会设定一个初始参数,然后通过执行一系列计算或操作,更新下一组参数。这个过程会一直进行,直到获得误差最小时的α0与α1的值。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|07/26迭代与梯度下降在这个迭代过程中,下一组的参数是如何确定的呢,梯度下降是一个常见的方法,它帮助我们调整模型参数,逐步优化模型,使其更好地拟合数据。想象我们站在一座山上,我们无法看到山的面貌,想走到山脚,只能通过走路的感觉来确定下山的方向。为了提高下山的效率,我们每一步都朝着脚下最陡峭的方向走,这样一直走下去,直到最后已经到了山脚。梯度下降就是这样的思想。我们把找到最低点的过程类比为调整模型参数以最小化损失函数的过程。其中,山坡的陡峭程度就是梯度,我们的每一步走多远是步长,我们朝哪个方向走是负梯度方向。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|08/26迭代与梯度下降在梯度下降过程中,步长是一个重要的超参数。与参数相比,超参数无法训练,需要人为先设定。算法的步长设定是一个不断调整的过程。当步长较小时,迭代时间长,模型的训练需要花费较长的时间;而当步长较大时,可能会错过真正的最优值。因此步长的确定是一个权衡的过程。梯度下降算法有多种具体的算法,包括批量梯度下降(BatchGradientDescent)、随机梯度下降(StochasticGradientDescent)和小批量梯度下降(Mini-BatchGradientDescent)等。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|09/26机器学习模型的评价指标2026/9/7《大数据技术在会计与财务中的应用》配套课件1.分类任务评价指标常见的分类任务评价指标包括以下两类:基于混淆矩阵的评价指标和基于ROC曲线的评价指标。(1)基于混淆矩阵的评价指标。我们首先介绍基于混淆矩阵的评价指标。以0、1分类问题为例,预测的结果与真实结果可能存在四种情形,
真实值:1真实值:0预测值:1TP(TruePositive)FP(FalsePositive)预测值:0FN(FalseNegative)TN(TrueNegative)3.2模型与算法|10/26机器学习模型的评价指标准确度(Accuracy),即分类正确的样本数占总样本数的比例,等于(TP+TN)/(TP+FP+FN+TN),它是分类任务最常用和基本的评价指标。与准确率相对应的还有误分率(MisclassificationRate),其等于1-准确率。精确度(Precision),即正确预测为正类别的样本数占所有预测为正类别的样本数的比例,等于TP/(TP+FP),用于衡量模型对正类别的分类准确性。召回率(Recall),即正确预测为正类别的样本数占实际正类别的样本数的比例,等于TP/(TP+FN),用于衡量模型发现正类别的能力。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|11/26机器学习模型的评价指标精确率与召回率虽然公式相似,但是所代表的含义以及运用场景有很大的差异。在量化投资中,如果我们制定一个模型用于进行买入或卖出决策,那么我们应当选择高精确率,虽然可能会漏掉一些交易决策,但是这样可以减少错误决策的风险,进而降低损失。审计师在检测异常交易时,高召回率可以帮助及早发现潜在的异常情况,虽然可能会增加审计成本的情形,但是为了降低审计风险,也可以增加一定的成本。病人去医院就诊,癌症确诊的精确率非常重要,如果诊断错误,可能会让患者接受不必要的治疗,如手术、放疗等,带来严重后果。而在疾病早期筛查中,高召回率更合适,即使增加一些成本(需要进一步检查),也希望尽量覆盖所有潜在的疾病。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|12/26机器学习模型的评价指标
2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|13/26机器学习模型的评价指标(2)基于ROC曲线的评价指标。基于ROC曲线的指标,具体包括ROC曲线和AUC,也是分类任务的常见评价标准。ROC曲线,即以假正例率为横轴(等于FP/(TN+FP))、真正例率(等于TP/(TP+FN))为纵轴的曲线。ROC曲线越靠近左上角,模型的准确性就越高。最靠近左上角的ROC曲线上的点是分类错误最少的阈值,其假正例和假反例总数最少。AUC,指ROC曲线下的面积,用于度量模型的分类性能。AUC的取值范围在0.5和1之间,取值接近1时,模型更加可靠;如果取值接近0.5,则意味着其接近一个随机分类器。。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|14/26机器学习模型的评价指标2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|15/26机器学习模型的评价指标2.回归任务评价指标回归模型的评价指标主要有以下几个:(1)均方误差(MSE):预测值与真实值之间差异的平方和的均值;(2)均方根误差(RMSE):MSE的平方根;(3)平均绝对误差(MAE):预测值与真实值之间差异的绝对值的均值;(4)R平方(R-squared):表示模型解释变量的方差所占比例,取值范围在0到1之间,越接近1表示模型拟合越好。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|16/26机器学习模型的评价指标3.聚类任务评价指标评价聚类任务的指标主要有以下几个:(1)轮廓系数(SilhouetteCoefficient):衡量聚类的紧密度和分离度,取值范围在[-1,1]之间,越接近1表示聚类效果越好;(2)互信息(MutualInformation):衡量两个分布的相似性,用于评估聚类结果与真实标签的一致性,常用的指标是归一化互信息,取值范围在[0,1]之间,越接近1表示聚类效果越好;(3)调整兰德指数(AdjustedRandIndex):衡量聚类结果与真实标签的一致性,取值范围在[-1,1]之间,越接近1表示聚类效果越好。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|17/26欠拟合与过度拟合模型的欠拟合与过度拟合是我们需要考虑的重要问题。模型的欠拟合问题指的是模型无法在训练数据上学到足够的信息,导致在测试数据上表现不佳。过度拟合指的是机器学习模型在训练阶段,过度学习了训练集数据的各种细节和噪声,导致在面对未见过的新数据时性能下降,理想的情况下,模型不仅能够精确捕捉训练数据中的规律,同时还具备良好的泛化能力。这意味着模型在处理未见过的数据时,也能保持较高的准确性和稳定性2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|18/26欠拟合与过度拟合2026/9/7《大数据技术在会计与财务中的应用》配套课件模型的欠拟合常见原因包括:(1)模型过于简单,不足以捕捉数据中的复杂关系。(2)特征选择不足,选择的特征不足以描述数据的复杂性。(3)训练数据量太小,模型可能无法学到够的信息。3.2模型与算法|19/26欠拟合与过度拟合造成模型过度拟合的常见原因包括:(1)模型高度复杂,例如复杂的深度神经网络具有大量参数,其能够灵活地拟合训练数据中的各种特征,但也可能同时拟合数据的噪音。(2)样本较小或特征较多,当数据量较小或选取的特征过多时,模型可能会过度拟合训练数据中的特定关系,造成过拟合问题。(3)数据本身噪音较大,导致训练的模型包含了很多噪音或异常值。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|20/26欠拟合与过度拟合在实践中,我们更加重视模型的过拟合问题,这是因为欠拟合问题可以通过一些直接的方法缓解,例如:(1)增加模型的复杂度,例如尝试增加神经网络的层数、节点数或者使用更复杂的模型。(2)提取更有信息的特征,在模型中添加更多的特征。(3)扩充数据集,增加数据量等。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|21/26欠拟合与过度拟合以下是一些常见的缓解过拟合的思路:(1)增加训练数据量。扩大样本量可以帮助模型更好地学习数据的真实分布,减少过拟合的可能性。(2)简化模型的复杂性。减少模型的复杂度可以降低过度拟合的风险,在实践中可以减少神经网络的层数及节点数,或者使用更简单的机器学习模型。(3)正则化。在模型的损失函数中添加正则化项(如L1正则化、L2正则化),进而惩罚模型的复杂性,防止过拟合。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|22/26欠拟合与过度拟合(4)筛选特征。筛选有用的特征,避免使用过多无关的特征。(5)集成方法。使用集成学习方法,如随机森林或梯度提升树等,通过结合多个模型的预测效果,降低过度拟合的风险。(6)早停法。在训练过程中监测模型在验证集上的性能,当性能没有明显提升时停止训练,防止模型过度拟合训练数据以至于记住样本的全部内容。(7)进行更干净的数据清洗。减少训练数据中的异常值或噪声,使机器更容易学习真实的数据分布。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|23/26模型的可解释性模型的可解释性同样是学者们选取模型时重要的考量因素。可解释性指的是人类能够理解机器进行预测或决策过程的程度。鉴于机器学习尤其是深度学习模型常被视为“黑箱”,其内部运作机制不透明,因此模型的可解释性显得尤为重要。对于会计学者而言,这一点尤为关键,因为他们可能需要对模型的决策提供合理的解释,或者基于机器学习的结果来揭示变量之间的关系。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|24/26模型的可解释性我们可以通过以下方法提高模型的可解释性:(1)选择模型时充分考虑模型的可解释性,相比较于复杂的深度学习,一些简单的模型如决策树等,通常更容易解释。(2)对模型中每个特征的重要性进行分析,例如在树模型中,可以通过查看特征的分裂程度或信息增益来获取特征的重要性。(3)对于一些复杂的模型,可以通过删减重要特征,看模型拟合力度下降的幅度,来展示特征的重要性。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.2模型与算法|25/262026/9/7《大数据技术在会计与财务中的应用》配套课件谢谢观赏!3.2模型与算法|26/26大数据技术在会计与财务中的应用作者:张敏等2026/9/7《大数据技术在会计与财务中的应用》配套课件第3章·3.3回归模型目录3.3.1线性回归3.3.2逻辑回归3.3.3线性判别分析3.3.4Lasso回归与岭回归3.3回归模型3.3回归模型|02/37线性回归线性回归是机器学习、统计学以及计量经济学中最基本、也是应用最广的算法之一。当被解释变量为连续变量时,传统的实证会计学研究大多是基于线性回归展开的。线性回归的目标是找到一条直线,使这条直线最理想地拟合观察到的数据点。其方式是利用最小化残差平方和来找到最佳直线,通常使用最小二乘法、梯度下降优化算法等技术。3.3回归模型|03/37模型的概念y=α0+α1x+ε一元线性回归模型就是一个简单的机器学习模型。其中,x是特征,y是预测的标签,α1是权重,α0是截距项,ε是误差项。模型预测值与真实值之间的差异被称为误差。训练模型的过程就是获得误差最小时的权重与偏差。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|04/37线性回归下面我们介绍如何在python中实现线性回归。我们将通过股吧的讨论热度预测公司股票收益这一简单示例,展示一元线性回归模型。示例数据中,Return为公司当日的股票收益,Tpostnum表示当日股吧的帖子数,数据源自CNRDS数据库。我们将使用Python中的scikit-learn库实现线性回归。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|05/37线性回归我们首先确保已经安装了scikit-learn库,如果没有,可以使用以下命令安装。pipinstallscikit-learn(1)导入必要的库。importpandasaspdimportnumpyasnpfromsklearn.model_selectionimporttrain_test_splitfromsklearn.linear_modelimportLinearRegressionfromsklearn.metricsimportmean_squared_error2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|06/37线性回归2026/9/7《大数据技术在会计与财务中的应用》配套课件(2)导入示例数据,定义关键变量,并将数据集分为训练集和测试集。df=pd.read_excel(r'StockPrice.xlsx')x=np.log(df[['Tpostnum']])y=df[['Return']]x_train,x_test,y_train,y_test=train_test_split(x,y,test_size=0.2,random_state=42)(3)创建线性回归模型。model=LinearRegression()(4)在训练集上训练模型。model.fit(x_train,y_train)(5)打印回归系数和截距。print("回归系数(斜率):",model.coef_)print("截距:",ercept_)3.3回归模型|07/37线性回归(6)分别在训练集与测试集上进行预测。y_train_pred=model.predict(x_train)y_test_pred=model.predict(x_test)(7)分别计算训练集和测试集的均方误差,并打印。mse_train=mean_squared_error(y_train,y_train_pred)mse_test=mean_squared_error(y_test,y_test_pred)print("训练集均方误差:",mse_train)print("测试集均方误差:",mse_test)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|08/37线性回归为了更直观的展示拟合效果,我们通过matplotlib库绘制训练数据和拟合直线。importmatplotlib.pyplotasplt#用来正常显示中文标签plt.rcParams['font.sans-serif']=['SimHei']#用来正常显示负号plt.rcParams['axes.unicode_minus']=Falseplt.scatter(x_train,y_train,color='blue',label='训练数据')plt.plot(x_train,y_train_pred,color='red',linewidth=2,label='拟合直线')plt.xlabel('自变量')plt.ylabel('因变量')plt.title('线性回归示例')plt.legend()plt.show()2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|09/37线性回归上述示例是一元线性回归,如果是多元线性回归,只需在上述代码中调整变量的定义即可。假设我们在帖子总数的基础上,加入了表示帖子被阅读的次数以及被评论的次数两个变量,分别为Readnum与Commentnum。那么我们需要对x的定义进行修改,具体如下:x=df[['Tpostnum','Readnum','Commentnum']]这里只需要调整变量的定义,其他部分的代码完全保持一致。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|10/37线性回归线性回归是一种简单而强大的统计方法,由于以下几个优点,它在学术研究和实践中被广泛应用:(1)线性回归是一种简单而高效的回归算法,易于理解和实现。(2)模型的解释性较强,认为因变量与自变量之间存在线性关系。(3)运行速度快,计算效率高。(4)适合可以作为其他更复杂模型的基准,用于比较其他模型的性能。(5)适用范围较广。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|11/37线性回归与此同时,它也存在如下的缺点:(1)对非线性关系拟合较差,线性回归假设因变量与自变量之间的关系是线性的,对于非线性关系的数据拟合效果较差。(2)对异常值敏感,线性回归对异常值较为敏感,异常值可能对模型的拟合产生较大影响,因此在实际应用中,需要注意异常值的处理。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|12/37逻辑回归逻辑回归是广义线性模型中的分类模型,也是分类任务中最常见的统计模型之一。在实务与学术研究中,逻辑回归被广泛用于预测各类常见问题,如识别企业内控缺陷(Doyle等,2007)与诉讼风险(Kim和Skinner,2012)、预测商誉减值(Ramanna和Watts,2012)、预测审计意见以及审计师选择等(Lawrence等,2011;Gerakos等,2016)。尽管近年来许多复杂的机器学习模型不断涌现,逻辑回归仍然表现出良好的预测效果。因此,逻辑回归也常被用作衡量模型预测效果的基准(Bao等,2020;Bertomeu,2020)。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|13/37逻辑回归根据因变量的分布,逻辑回归可分为二分类与多分类的回归模型。以二分类回归模型为例,逻辑回归假设事件发生的概率为p,不发生的概率为1-p,可得两者的概率之比为p/1-p,这一概率比被称为事件的优势比(Odds)。Logistics的原理就是对优势比取自然对数(ln(p/1-p),将其转化成0到1之间的数,进而把分类问题转化为优势比与输入变量之间的线性关系。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|14/37逻辑回归我们仍然以上述的数据展示逻辑回归的实现过程。为了便于展示,我们直接在原数据中生成一个表示公司股票收益是否为正的虚拟变量,我们通过如下代码构建一个虚拟变量Return_dummy,当公司股票收益大于等于0时取值为1,反之则为0。df['Return_dummy']=df['Return'].apply(lambdax:1ifx>=0else0)此时,原始数据新增了一个虚拟变量Return_dummy,即我们所关注的因变量。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|15/37逻辑回归(1)导入逻辑回归必要的库。importpandasaspdimportnumpyasnpfromsklearn.model_selectionimporttrain_test_splitfromsklearn.linear_modelimportLogisticRegressionfromsklearn.metricsimportaccuracy_score,confusion_matrix,recall_score,roc_curve,auc2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|16/37逻辑回归(2)定义变量与样本。df=pd.read_excel(r'StockPrice.xlsx')df['Tpostnum_log']=np.log(df['Tpostnum']+1)df['Readnum_log']=np.log(df['Readnum']+1)df['Commentnum_log']=np.log(df['Commentnum']+1)df['Return_dummy']=df['Return'].apply(lambdax:1ifx>=0else0)
x=df[['Tpostnum_log','Readnum_log','Commentnum_log']]y=df['Return_dummy']x_train,x_test,y_train,y_test=train_test_split(x,y,test_size=0.2,random_state=42)真实标签的一致性,取值范围在[-1,1]之间,越接近1表示聚类效果越好。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|17/37逻辑回归(3)创建逻辑回归模型并进行训练与预测。model=LogisticRegression()model.fit(x_train,y_train)y_test_pred=model.predict(x_test)(4)计算准确度、召回率、混淆矩阵指标,对拟合效果进行评价。accuracy_test=accuracy_score(y_test,y_test_pred)recall_test=recall_score(y_test,y_test_pred)confusion_test=confusion_matrix(y_test,y_test_pred)print("准确率:",accuracy_test)print("测试集召回率:",recall_test)print("混淆矩阵:\n",confusion_test)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|18/37逻辑回归2026/9/7《大数据技术在会计与财务中的应用》配套课件(5)生成roc曲线。fpr,tpr,thresholds=roc_curve(y_test,model.predict_proba(x_test)[:,1])roc_auc=auc(fpr,tpr)
plt.figure(figsize=(8,6))plt.plot(fpr,tpr,color='darkorange',lw=2,label='ROC曲线(面积={:.2f})'.format(roc_auc))plt.plot([0,1],[0,1],color='navy',lw=2,linestyle='--')plt.xlabel('假正率')plt.ylabel('真正率')plt.title('ROC曲线')plt.legend()plt.show()3.3回归模型|19/37逻辑回归在该图中,当ROC曲线靠近左上角时,即真正率接近1,真正率接近0时,表明分类效果较理想。这意味着正类几乎全部被正确识别,负类几乎没有被误判为正类。蓝色直线为对角线,此时真正率=假正率,标志着随机猜测的情况。如果模型的表现与这条对角线相吻合,则说明其性能等同于随机猜测,无法有效区分正类和负类样本。ROC曲线下面积是AUC值。AUC值越接近。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|20/37逻辑回归逻辑回归的优缺点与线性回归基本一致。它具有如下优势:(1)逻辑回归简单且高效,易于理解和实现,且计算成本较低。(2)逻辑回归的可解释性强,回归系数的符号和大小可以提供关于特征对结果的影响程度的信息。(3)逻辑回归的适用性较广,在很多领域都表现良好,特别是在二分类问题上,因此通常被当作其他复杂算法的基准组。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|21/37逻辑回归然而,它也具有以下不足:(1)逻辑回归假设特征之间存在线性关系,对于非线性关系的建模效果较差。(2)逻辑回归对异常值敏感,异常值可能对模型的参数估计产生较大影响。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|22/37线性判别分析线性判别分析(LinearDiscriminantAnalysis,简称LDA)是一种有监督的线性算法。它可以将一个样本映射到一条直线上,从而实现对样本的降维与分类。具体而言,该算法的目标是找到一个投影轴,经过投影后,两类样本之间的距离最大,而同一类样本之间的距离最小。为了更好地理解,我们可以设想一个场景:我们希望基于一系列特征预测一家公司能否偿还债务。这些特征包括公司的利润水平、现金流状况以及市场发展潜力等指标。我们收集了一些已知能否偿还的数据(即有标注的数据),并希望通过这些数据训练一个模型,以便在未来预测其他公司的偿债可能性。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|23/37线性判别分析在这个背景下,线性判别分析(LDA)的作用就是把高维数据(如利润、现金流、市场潜力等特征)投影到一条一维直线上,在一条数轴上,不同类别的公司各自聚集在某些区段。这时候,我们就可以在这个一维空间上选一个阈值(分界点)。这个分界点旨在最大限度地区分那些能够偿还债务的公司与那些无力偿还的公司。位于分界点一侧的公司更倾向于拥有良好的偿债能力,而位于另一侧的公司更有可能在偿还债务时出现困难。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|24/37线性判别分析通过python实现线性判别分析的代码与前文相似。只要通过如下代码导入相应的库。fromsklearn.discriminant_analysisimportLinearDiscriminantAnalysis在定义特征、训练集与测试集的基础上,创建线性判别分析模型并进行训练。lda=LinearDiscriminantAnalysis(n_components=1)lda.fit(x_train,y_train)其中,n_components表示降维后的维度。利用transform()函数将原始特征转换为降维后的新特征。x_test_lda=lda.transform(x_test)使用线性判别分析模型进行分类。y_pred=lda.predict(x_test)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|25/37线性判别分析现行判别分析的优点如下:(1)线性判别分析操作简单、易于理解,其不仅是一种分类方法,而且是一种降维技术,因而被广泛应用。(2)该模型假设数据服从正态分布,而正态分布对于离群值的敏感性相对较低。因此相比较于逻辑回归等,该模型受异常值的影响较小。然而线性判别分析也存在一些不足:(1)该模型对数据的分布假设较为敏感,其假设数据是正态分布的。如果数据的实际分布与这一假设不符,其性能会受到较大影响。(2)它是一种线性方法,在处理非线性问题时表现不佳。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|26/37Lasso回归与岭回归Lasso回归与岭回归是基本的机器学习方法。想象我们有一些数据,并计划使用线性模型进行预测,但是数据中一些特征之间有很强的相关性,例如一个特征是另一个特征的线性组合。此时,模型会将它们作为独立的变量,导致模型复杂度过高。由于特征之间的强相关性,回归模型还可能会对这些特征的微小变动非常敏感,造成回归系数的不稳定性。因此,我们会在普通的线性回归的损失函数中,添加一个正则化项(Regularization),以限制模型参数的增长。
2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|27/37Lasso回归与岭回归在机器学习中,正则化是一种常用的技术。正则化技术指的是通过在目标函数中增加一个惩罚项,降低模型的复杂度,缓解过拟合问题。常见的正则化项包括L1正则化与L2正则化两种。L1正则化是在损失函数中添加参数权重的绝对值之和。损失函数为:L1
Loss=Loss+λ∑|θ|式中,Loss为损失函数,用于衡量预测值与实际值之间的差异;λ是正则化系数,用于控制正则化的影响;θ是模型的参数。L1正则化可以使一部分特征的系数变为零,实现筛选特征的效果。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|28/37Lasso回归与岭回归L2正则化是在损失函数中添加参数权重的平方和。损失函数为:L2
Loss=Loss+λ∑θ2类似地,Loss为损失函数,λ是正则化系数,θ是模型的参数。L2正则化使模型学习到较小的参数值,这有助于提高模型的泛化能力。两者的主要区别在于:L1正则化会导致部分参数变为零,这意味着它能够进行特征选择,自动地剔除不重要的特征;L2正则化通常不会使参数完全为零,而是将它们的值压缩到较小的值,这使得所有特征都有某种程度的贡献。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|29/37Lasso回归与岭回归在线性回归的基础上引入L1正则化项就是LASSO(LeastAbsoluteShrinkageandSelectionOperator)回归。LASSO回归通过对回归系数的绝对值进行惩罚,来实现特征选择和模型简化。在线性回归的基础上引入L2正则化项就是岭回归(RidgeRegression)。岭回归通过对回归系数的平方和进行惩罚,以防止过拟合。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|30/37Lasso回归与岭回归
L1正则化L2正则化正则化方式参数的绝对值之和参数的平方和特征选择能够产生稀疏解,自动选择特征不会产生稀疏解,所有特征都有贡献(系数较小但不为零)适用场景特征选择,维度较高的模型特征关系较复杂,或不希望剔除特征计算复杂度较高(需求解绝对值)较低(仅需求解平方和)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|31/37Lasso回归与岭回归使用scikit-learn自带的加利福尼亚房价数据集来展示Lasso回归的实现方法。(1)首先导入必要的库。fromsklearn.datasetsimportfetch_california_housingfromsklearn.metricsimportmean_squared_error,r2_scorefromsklearn.linear_modelimportLassofromsklearn.model_selectionimporttrain_test_split(2)导入数据,定义变量,并将数据集拆分为训练集与测试集。#加载Californiahousing数据集california=fetch_california_housing()x,y=california.data,california.targetx_train,x_test,y_train,y_test=train_test_split(x,y,test_size=0.2,random_state=42)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|32/37Lasso回归与岭回归(3)初始化LASSO回归模型,并设定超参数。alpha=0.1lasso_reg=Lasso(alpha=alpha)(4)在训练集上拟合模型,并在测试集上进行预测。lasso_reg.fit(x_train,y_train)y_pred=lasso_reg.predict(x_test)(5)输出模型的性能指标。print("MeanSquaredError:",mean_squared_error(y_test,y_pred))print("R-squared:",r2_score(y_test,y_pred))在进行Lasso回归时,由于L1正则化项的存在,模型的部分特征系数可能被压缩为零。我们可以查看是否有特征被删减以及每个特征的系数。print("Lasso回归的特征系数:")forfeature,coefinzip(california.feature_names,lasso_reg.coef_):print(feature,':',coef)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|33/37Lasso回归与岭回归类似地,实现岭回归的方法类似,具体代码如下:fromsklearn.datasetsimportfetch_california_housingfromsklearn.metricsimportmean_squared_error,r2_scorefromsklearn.linear_modelimportRidgefromsklearn.model_selectionimporttrain_test_split(1)导入数据,定义变量,将数据集拆分为训练集与测试集。之后,定义模型并进行训练。#加载California房价数据集california=fetch_california_housing()x,y=california.data,california.target
#划分训练集和测试集x_train,x_test,y_train,y_test=train_test_split(x,y,test_size=0.2,random_state=42)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|34/37Lasso回归与岭回归#初始化并训练Ridge回归模型alpha=0.1#超参数,控制正则化强度ridge_reg=Ridge(alpha=alpha)ridge_reg.fit(x_train,y_train)#预测y_pred=ridge_reg.predict(x_test)(2)输出拟合效果与系数。print("MeanSquaredError:",mean_squared_error(y_test,y_pred))print("R-squared:",r2_score(y_test,y_pred))
print("岭回归的特征系数:")forfeature,coefinzip(california.feature_names,ridge_reg.coef_):print(feature,':',coef)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|35/37Lasso回归与岭回归LASSO和岭回归具有许多共同点,两者都有如下优点:第一,它们都通过引入正则化项,缓解模型的过度拟合问题。第二,两者一定程度上都能筛选特征。具体而言,LASSO通过L1正则化将一些特征的系数压缩为零;岭回归的L2正则化也可以通过对系数进行惩罚,使得某些特征系数趋于较小的值。然而,二者有如下缺点:第一,它们都假设输入特征与目标变量之间是线性关系,不能捕捉非线性关系。第二,正则化强度等参数需要手动调整,不易确定最优值。第三,两者都对特征缩放敏感,特征值范围不一致会影响惩罚效果,因此在使用前必须标准化。如果特征之间存在较强的相关性,LASSO可能只选择其中的一个特征,此时使用岭回归更加合适;而如果希望通过稀疏性进行特征选择,则LASSO更加适用。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.3回归模型|36/372026/9/7《大数据技术在会计与财务中的应用》配套课件谢谢观赏!3.3回归模型|37/37大数据技术在会计与财务中的应用作者:张敏等2026/9/7《大数据技术在会计与财务中的应用》配套课件第3章·3.4支持向量机与支持向量回归目录3.4.1支持向量机3.4.2支持向量回归3.4支持向量机与支持向量回归3.4支持向量机与支持向量回归|02/17支持向量机支持向量机(SupportVectorMachine,SVM)是最常用且最基础的机器学习算法之一。在大数据会计领域,SVM作为一种常用的机器学习模型,被广泛应用于识别企业财务舞弊等问题。SVM是一种二分类模型,基本原理为将数据映射为特征空间中的点,在特征空间中寻找划分一个超平面,使这些观测分成两类。其中,划分超平面应该使两类样本中距离它最近的观测间距离最大。3.4支持向量机与支持向量回归|03/17支持向量机2026/9/7《大数据技术在会计与财务中的应用》配套课件在二维空间中,如果两类点能被一条直线完全分开,那么我们称这两类点线性可分,如左侧图为例;如果两类点不能被一条直线完全分开,那么我们称这两类点线性不可分,如右侧图为例。3.4支持向量机与支持向量回归|04/17支持向量机如果数据不是线性可分的,那么SVM会使用一种叫做“核技巧”的方法。SVM通过构建一个核函数,将原始特征映射到一个更高维特征的空间中,以解决原始空间的线性不可分问题。常用的核函数包括线性核、多项式核、径向基函数(RBF)核以及Sigmoid核等。线性核函数适用于数据线性可分的情况,即类别之间可以通过一条直线进行分割;多项式核函数适用于数据有一定的非线性特征,但仍然可以通过多项式进行拟合的情形;径向基函数核适用于数据的分布不规则或者难以通过直线或多项式进行分割的情况;Sigmoid核函数适用于数据分布较为复杂,不规则,并且不容易用其他核函数描述的情况。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|05/17支持向量机在三维空间中,需要一个平面把观测切成两半。拓展到多维空间时,我们寻找一个最佳超平面,使其以最大间隔把两类样本分开然而,这样的超平面可能存在很多个,那我们应当如何选择呢?SVM要求两类样本应分别位于超平面的两侧;且两侧距离超平面最近的样本到超平面的距离最大。这些距离超平面最近的点,即支持向量。例如下图中,距离超平面最近的点,就是支持向量。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|06/17支持向量机2026/9/7《大数据技术在会计与财务中的应用》配套课件我们使用sklearn自带的乳腺癌数据集展示如何通过python实现支持向量机分类。(1)导入必要的库。fromsklearn.datasetsimportload_breast_cancerfromsklearn.model_selectionimporttrain_test_splitfromsklearn.svmimportSVCfromsklearn.metricsimportaccuracy_score,classification_report,confusion_matrix3.4支持向量机与支持向量回归|07/17支持向量机(2)导入示例数据集并划分训练与测试集。cancer=load_breast_cancer()x=cancer.datay=cancer.targetx_train,x_test,y_train,y_test=train_test_split(x,y,test_size=0.2,random_state=42)(3)创建SVM分类器对象,并训练模型。svm_classifier=SVC(kernel='linear',C=1.0)svm_classifier.fit(x_train,y_train)C参数是正则化参数,用于控制对误分类的惩罚。较小的C值会导致更大的间隔,同时容忍更多的误分类,而较大的C值会导致更小的间隔,导致更少的误分类。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|08/17支持向量机我们的核函数为线性核,线性核适用于线性可分的情况,如果数据不是线性可分的,则可能需要尝试其他核函数,例如:svm_classifier=SVC(kernel='poly',degree=3,C=1.0)svm_classifier=SVC(kernel='rbf',gamma='scale',C=1.0)svm_sigmoid=SVC(kernel='sigmoid',C=1.0)这里我们使用了分别使用了多项式核、径向基函数核以及Sigmoid核函数。(4)在测试集上进行预测,并输出模型效果。y_pred=svm_classifier.predict(x_test)print("准确率:",accuracy_score(y_test,y_pred))print("分类报告:\n",classification_report(y_test,y_pred))print("混淆矩阵:\n",confusion_matrix(y_test,y_pred))2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|09/17支持向量回归SVM主要用于分类问题,而SVR用于解决回归问题。SVR的核心思想是将数据映射到高维空间中,并寻找一条或多条超平面来拟合数据,使得预测误差最小化。SVM是使到超平面最近的样本点的距离最大,而SVR是使尽可能多的点接近超平面。SVR在线性两侧制造一个“间隔带”,对所有落入到间隔带内的样本不计算损失,只计算位于间隔带以外的样本点(即支持向量)的损失,最终通过最小化总损失与最大化间隔来获得回归模型。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|10/17支持向量回归SVR中超平面的作用可能没有SVM那么直观。我们可以这样理解,假设我们基于公司的业绩来预测公司的股价,且我们的数据点在二维平面上,其中横轴是公司的业绩,纵轴是公司的价格。SVR的目标是找到一条直线,使得大部分数据都位于这条直线附近,并且直线周围有一个带状区域,这个区域内的数据尽可能多。这条直线就是SVR的超平面。如果数据点不能被一条直线很好地拟合,与SVM类似,SVR会使用核技巧将数据映射到更高维的空间中,以便找到一个更复杂的超平面来拟合数据。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|11/17支持向量回归以sklearn自带的加利福尼亚房价数据为例,用python实现SVR的代码如下。#导入必要的库importnumpyasnpimportpandasaspdfromsklearn.datasetsimportfetch_california_housingfromsklearn.model_selectionimporttrain_test_splitfromsklearn.svmimportSVRfromsklearn.preprocessingimportStandardScalerfromsklearn.metricsimportmean_squared_error
#导入示例数据california=fetch_california_housing()x=pd.DataFrame(california.data,columns=california.feature_names)y=pd.Series(california.target,name='MedHouseVal')2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|12/17支持向量回归考虑到该数据集中的特征尺度差异较大,而SVR非常依赖于距离度量,我们对特征进行标准化。#标准化特征scaler=StandardScaler()x_scaled=scaler.fit_transform(x)#将数据集分割为训练集和测试集(70%训练,30%测试)x_train,x_test,y_train,y_test=train_test_split(x_scaled,y,test_size=0.3,random_state=42)
#创建支持向量回归(SVR)模型并训练svr_model=SVR(kernel='rbf',C=1,epsilon=0.1)#用测试集进行预测svr_model.fit(x_train,y_train)y_pred=svr_model.predict(x_test)#计算均方误差(MSE)mse=mean_squared_error(y_test,y_pred)print("均方误差(MSE):",mse)2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|13/17支持向量回归类似地,在SVR中,C是一个正则化参数,它代表了对训练误差的容忍度。较小的C值将增加模型对误差的容忍度,可能导致更大的间隔,可能更容易受到噪声的影响。较大的C值会减小容忍度,使得模型对训练数据更加敏感。epsilon是一个控制模型容忍度的超参数。epsilon的值越大,允许的偏离程度就越大,模型更加容忍一些训练样本的误差。如果对于预测结果的精度较为敏感,选择较小的epsilon值可能更加合适。SVR核参数的选择是一个重要过程。和SVM中的情况类似,常见的核函数包括常用的核函数包括线性核、多项式合、高斯核、拉普拉斯核以及Sigmoid核等。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|14/17支持向量回归SVM与SVR的优点主要有以下几点:(1)在高维空间中表现良好,适用于特征维度较高的问题,比如文本分类和图像识别等。(2)可以使用不同的核函数,如线性核、多项式核、径向基函数核等,使其适用于不同类型的数据。(3)具有较好的鲁棒性,相比线性模型不容易被极端异常值严重影响,可以有效地避免异常点对分类结果的影响。(4)SVM算法的分类结果具有较好的可解释性,能够清晰地描述不同类别之间的区别。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|15/17支持向量回归SVM与SVR的缺点如下:(1)不适用于一些非线性可分问题,虽然SVM和SVR可以通过核函数应对非线性可分问题,但无法完全适用所有的非线性可分情况。(2)对参数敏感,需要调整的参数较多,包括惩罚参数、核函数的参数等,调参相对复杂。(3)算法对噪声数据敏感,如果数据中存在噪声数据,可能会导致分类结果的偏差。因此,在使用SVM算法进行分类之前,需要对数据进行预处理,去除噪声数据。(4)当使用非线性核函数时,模型就像一个“黑箱”,可解释性较差。2026/9/7《大数据技术在会计与财务中的应用》配套课件3.4支持向量机与支持向量回归|16/172026/9/7《大数据技术在会计与财务中的应用》配套课件谢谢观赏!3.4支持向量机与支持向量回归|17/17大数据技术在会计与财务中的应用作者:张敏等2026/9/7《大数据技术在会计与财务中的应用》配套课件第3章·3.5朴素贝叶斯、K近邻与决策树目录3.5.1朴素贝叶斯3.5.2k近邻3.5.3决策树3.5朴素贝叶斯、k近邻与决策树3.5朴素贝叶斯、K近邻与决策树|02/29朴素贝叶斯朴素贝叶斯(NaiveBayes)是会计学研究中常见的机器学习算法之一。Li(2010)使用朴素贝叶斯分类器探讨管理讨论和分析部分(MD&A)中前瞻性声明的信息含量。Ryans(2020)则运用朴素贝叶斯文本分类方法,将问询函划分为重述问询函和非重述问询函、减值问询函和非减值问询函等几种类型。朴素贝叶斯是一种基于贝叶斯定理和特征条件独立假设的分类算法。朴素贝叶斯算法的原理是贝叶斯定理。该定理描述了在已知某些条件下,事件的发生概率。通俗来说,朴素贝叶斯在预测时考虑了各种可能性,并根据这些可能性的概率来预测新数据的分类。3.5朴素贝叶斯、K近邻与决策树|03/29朴素贝叶斯2026/9/7《大数据技术在会计与财务中的应用》配套课件假设有一个样本x,其中包含n个特征。现在我们要将该样本分到k个类别中的某一个。朴素贝叶斯算法的主要思想是根据训练数据集,计算出每个类别的先验概率,以及每个特征在各个类别中的条件概率。然后,根据贝叶斯定理,计算出该样本属于各个类别的后验概率,选择后验概率最大的类别作为该样本的分类结果。3.5朴素贝叶斯、K近邻与决策树|04/29朴素贝叶斯具体来说,朴素贝叶斯算法中的计算过程如下:(1)
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 艺人管理与演出经纪人资格证试题及答案
- 超高温氧化铝坩埚项目可行性研究报告
- 终止剂项目可行性研究报告
- 高一物理(人教版)教案 必修二 第七章 万有引力与宇宙航行
- 2026年中国航空发动机招聘面试题及答案
- 河南省重点高中2025-2026学年高一年级上册开学检测语文试题(原卷版)
- 2024年普通高等学校招生全国统一考试·全国甲卷 英语
- 山东省烟台市芝罘区2025-2026学年五年级下学期期末 语文试题
- 小学数学四年级下册《三角形三边的关系》
- 会议营销管理系统操作手册
- 第1课 开启物联网之门 课件(内嵌视频)2026-2027学年人教版初中信息科技八年级全一册
- 《农业工程学》教材笔记
- 小班语言活动秋天的颜色
- 更换膨胀节施工方案
- 混凝土强度评定表(GB/T50107-2010)
- 履带吊安拆装方案-天宫庄园站
- 事业编聘用合同
- 认知中心建设方案
- 世界盐产业地理分布与区域特点
- GB/T 41876-2022粘结式实心轮胎技术规范
- 第一章食品罐藏工艺1
评论
0/150
提交评论