准精算师精算模型与数据分析考前速记清单_第1页
准精算师精算模型与数据分析考前速记清单_第2页
准精算师精算模型与数据分析考前速记清单_第3页
准精算师精算模型与数据分析考前速记清单_第4页
准精算师精算模型与数据分析考前速记清单_第5页
已阅读5页,还剩9页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

准精算师精算模型与数据分析考前速记清单核心原则:准精算师《精算模型与数据分析》考试以“精算模型构建、数据处理、定量分析、实务应用”为核心,贴合保险经营中的损失风险、经营风险评估场景,题型包括单项选择题(35道,70分)、分析计算题(5道,26分)、Excel操作题(1道,4分),满分100分,60分及格。本清单聚焦高频考点、必记公式、模型步骤、实操技巧和易错点,摒弃冗余理论,适配考前1-3天快速背诵,重点突出“记模型、会计算、懂实操、避陷阱”,助力精准踩分,高效复盘核心考点,贴合考试大纲要求和精算实务导向。一、基础核心:数据处理与质量控制(必记,占比10%)核心考查数据收集、清洗、预处理及质量控制,是精算模型构建的前提,侧重实操细节和常见问题处理,客观题、Excel操作题均有考查,同时为后续模型分析奠定基础。核心考点及采分点:

数据收集与分类:

精算数据核心类型:保单数据(保额、保费、投保年龄、保险期限)、理赔数据(理赔次数、理赔金额、理赔原因)、暴露数据(暴露单位、暴露时间)、市场数据(利率、费率、行业基准)。数据收集原则:完整性、准确性、一致性、时效性,避免数据缺失、重复、异常,这是后续模型精准度的核心前提。数据预处理(必考,Excel实操高频):

数据清洗:处理缺失值(均值填充、中位数填充、插值法,避免直接删除导致样本偏差)、异常值(箱线图、Z-分数法识别,处理方式:删除、修正、标准化,异常值处理不当会扭曲数据真实分布)、重复值(去重处理,避免重复计算)。数据转换:分类数据编码(哑变量编码、标签编码)、连续数据标准化(Z标准化:Z=X−μ数据整合:多来源数据合并(关联保单数据与理赔数据)、数据筛选(按业务类型、时间范围筛选有效数据),Excel中常用VLOOKUP、数据透视表实现。数据质量控制(高频易错):

常见数据偏差:数据收集偏差、选择偏差、处理偏差,会导致模型分析结果失真,需通过交叉验证、样本对比修正。质量校验方法:描述性统计(均值、方差、中位数、四分位数)、数据可视化(直方图、散点图、箱线图),检验数据分布合理性,识别异常情况。常用工具:Excel(核心,用于数据清洗、透视、图表绘制、回归分析、MSE计算)、R/Python(辅助,用于批量数据处理、复杂模型拟合)、SPSS(统计分析),重点掌握Excel实操技巧。避坑提示:①缺失值直接删除,导致样本量不足、结果偏差;②异常值未处理或处理过度,扭曲数据分布;③数据转换时编码错误,影响模型输入;④忽视数据一致性,多来源数据关联错误;⑤过度依赖历史数据,忽视数据时效性和范式转换期的非连续性。二、核心模块一:风险理论与损失模型(必考,占比30%)核心考查随机过程、理赔额与理赔次数分布、个体/聚合风险模型、破产模型,是精算模型的核心基础,侧重公式应用和模型推导,计算题、客观题高频考查,贴合保险理赔风险评估实务。核心考点、公式及采分点:

随机过程基础:

核心概念:泊松过程(理赔次数常用)、马尔可夫链(状态转移分析,如保单状态变化),重点掌握泊松过程的性质(平稳独立增量、计数过程)。泊松过程关键公式:设N(t)为t时刻前的理赔次数,服从泊松分布Nt∼Pλt,则P理赔次数与理赔额分布(必记):

理赔次数分布(高频):

泊松分布Pλ:EN=λ二项分布Bnp:EN理赔额分布(高频):

指数分布Expλ:密度函数fx=λe−λx对数正态分布:若lnX∼Nμσ帕累托分布:密度函数fx=αθα个体与聚合风险模型(核心,计算题必考):

个体风险模型:单个保单的理赔额Xi,总理赔额S=i=1nXi聚合风险模型(复合分布,必考):总理赔额S=i=1NXi,其中N为理赔次数,Xi核心公式:ES=ENEX破产模型(基础,客观题高频):

核心概念:盈余过程Ut破产概率:ψu核心题型模板(直接套用):

聚合风险模型计算:①确定理赔次数N的分布和单次理赔额X的分布;②计算EN、VarN、EX理赔分布参数计算:①根据已知期望、方差,代入对应分布(指数、对数正态、帕累托)的公式,求解未知参数;②验证参数合理性,结合理赔数据分布特征判断。避坑提示:①聚合风险模型方差公式记错(遗漏交叉项);②混淆个体与聚合风险模型的适用场景;③泊松过程的参数含义混淆(λ为单位时间理赔率,非总理赔率);④对数正态、帕累托分布的期望、方差公式记混;⑤破产模型中盈余过程的变量含义混淆,破产概率的影响因素判断错误。三、核心模块二:生存分析与生命表(必考,占比15%)核心考查生存模型理论、生存函数估计、生命表基础知识及编制原理,侧重寿险精算实务应用,客观题、计算题均有考查,重点是生存函数、生命表相关指标的计算与应用。核心考点及采分点:

生存模型核心概念:

生存函数:Sx=PTxt)=P死亡力(瞬时死亡率):μx=lim生命表相关指标(必记):

死亡率qx=dxl生存人数lx+t=l生存函数估计方法(高频):

Kaplan-Meier乘积限估计(KM估计):适用于右删失数据(如保单持有人未发生理赔、未死亡),核心公式:St=ti≤t1−dini,其中参数估计法:假设生存函数服从特定分布(指数分布、Weibull分布),通过极大似然估计求解分布参数,进而得到生存函数。生命表编制原理(基础):核心步骤:收集人口死亡数据→整理暴露人口→计算死亡率qx→计算生存人数lx、死亡人数常用生命表类型:选择生命表(考虑投保时的健康状况)、综合生命表(不区分投保健康状况),寿险精算中多使用选择生命表。避坑提示:①生存函数与死亡力的关系记反;②KM估计中删失数据处理错误,遗漏ni的调整;③生命表指标公式记错(如qx与lx四、核心模块三:随机模拟(必考,占比10%)核心考查随机数生成、模拟样本容量确定、Bootstrap模拟、MCMC模拟,侧重方法应用和步骤记忆,客观题、计算题均有考查,是精算模型中处理复杂风险的核心工具,贴合风险聚合、参数估计实务。核心考点及采分点:

随机数生成(基础):

均匀随机数(0,1)生成:Excel中用RAND()函数,核心用途:生成其他分布的随机数(如正态、指数、泊松分布)。常用分布随机数生成:

指数分布:利用均匀随机数U,生成X=−1λln正态分布:利用中心极限定理,通过多个均匀随机数叠加生成,Excel中用NORM.INV()函数直接生成。模拟样本容量确定:

核心原则:样本容量越大,模拟结果越接近真实值,但计算量越大;需结合精度要求(如方差、误差范围)确定,常用方法:根据中心极限定理,结合允许误差和置信水平,计算最小样本容量。关键结论:模拟误差与样本容量的平方根成反比,即样本容量增大,误差减小,但边际效益递减。常用模拟方法(必考):

Bootstrap模拟(重点):

核心用途:参数估计(如均值、方差)、误差估计、置信区间构造,适用于样本量较小、分布未知的场景。步骤:①从原始样本中重复抽样(有放回),生成多个Bootstrap样本;②对每个样本计算目标参数(如均值);③利用多个参数估计值,计算参数的均值、方差和置信区间。MCMC模拟(基础):

核心用途:复杂分布的抽样、贝叶斯参数估计,适用于高维、非线性模型。核心思想:通过构建马尔可夫链,使链的平稳分布等于目标分布,进而生成目标分布的样本,重点掌握其核心应用场景,无需深入推导。模拟应用场景:聚合风险模型的总理赔额模拟、生存函数的模拟估计、复杂参数的区间估计,精算中常用于压力测试(如极端场景下的风险评估)。避坑提示:①指数分布随机数生成公式记错;②Bootstrap模拟抽样方式错误(无放回抽样);③样本容量确定忽略精度要求,盲目增大样本容量;④混淆MCMC模拟与Bootstrap模拟的适用场景;⑤模拟结果未进行误差分析,直接用于决策。五、核心模块四:回归分析(必考,占比15%)核心考查线性回归、广义线性模型、惩罚线性回归模型,侧重模型构建、参数估计、拟合度检验,计算题、客观题均有考查,是精算中保费定价、理赔预测的核心工具,Excel实操中也会涉及回归分析。核心考点及采分点:

线性回归(基础,必考):

模型形式:y=β0+β1参数估计:最小二乘法(OLS),核心目标:最小化残差平方和i=1n拟合度检验(必记):

决定系数R2=SSRF检验(整体显著性):检验回归模型整体是否显著,F=SSR/kt检验(单个系数显著性):检验单个回归系数βi是否显著,t=广义线性模型(GLM,重点):

核心用途:解决线性回归不满足正态性、方差齐性的问题(如理赔次数为计数数据、理赔额为非负数据),精算中保费定价、理赔预测高频应用。核心组成:随机部分(响应变量的分布,如泊松分布、伽马分布)、系统部分(解释变量的线性组合η=β0+常见GLM模型:

泊松回归:响应变量为计数数据(如理赔次数),连接函数为对数连接,lnμ伽马回归:响应变量为非负连续数据(如理赔额),连接函数为对数连接,适用于方差与均值相关的场景。惩罚线性回归模型(基础):

核心用途:解决多重共线性、模型过拟合问题,常用方法:Lasso回归(L1惩罚,可进行变量选择)、Ridge回归(L2惩罚,可降低系数方差)。核心思想:在残差平方和的基础上,增加惩罚项(L1或L2),控制回归系数的大小,避免过拟合,提高模型泛化能力。核心题型模板(直接套用):

线性回归实操:①确定响应变量和解释变量;②用OLS估计回归系数;③计算R2广义线性模型应用:①根据响应变量类型,选择合适的分布(泊松、伽马)和连接函数;②估计模型参数;③检验模型拟合效果,结合精算场景(如保费定价)进行预测。避坑提示:①线性回归忽略正态性、方差齐性假设,直接建模;②R2解读错误(认为R六、核心模块五:时间序列基础(必考,占比10%)核心考查时间序列的基本概念、平稳时间序列、滑动平均自回归模型(ARMA)、多维时间序列的协整性,侧重模型识别、参数估计和预测,客观题、计算题均有考查,适用于保费收入、理赔额的趋势预测。核心考点及采分点:

时间序列基本概念:

定义:按时间顺序排列的观测值序列(如每月保费收入、每年理赔额),核心特征:趋势性、季节性、周期性、随机性。分解:时间序列Xt=Tt+St+C平稳时间序列(核心):

定义:均值、方差不随时间变化,自协方差仅与时间间隔有关(不随时间位置变化),是ARMA模型的前提。平稳性检验:直观检验(时序图、自相关图ACF)、单位根检验(ADF检验),若存在单位根,序列非平稳,需进行差分处理(如一阶差分、二阶差分)。ARMA模型(必考):

模型分类:

AR(p)模型(自回归模型):Xt=φMA(q)模型(滑动平均模型):XtARMA(p,q)模型:AR(p)与MA(q)的结合,Xt核心步骤:①序列平稳性检验与处理(差分);②用ACF、PACF确定p、q阶数;③估计模型参数;④模型检验(残差白噪声检验);⑤利用模型进行预测。多维时间序列(基础):

核心概念:多个时间序列的集合(如保费收入、理赔额、利率序列),重点考查协整性(多个非平稳序列的线性组合平稳),协整检验用于判断序列间的长期均衡关系。应用场景:精算中多因素趋势预测(如结合利率、通胀率预测保费收入)。避坑提示:①ARMA模型忽略序列平稳性前提,直接建模;②混淆AR(p)与MA(q)模型的ACF、PACF特征;③模型阶数p、q确定错误;④非平稳序列未进行差分处理;⑤多维时间序列的协整性含义理解错误,混淆长期均衡与短期波动。七、核心模块六:机器学习基础(必考,占比20%)核心考查机器学习方法分类、模型评估与选择、决策树、聚类分析、数据降维,侧重方法应用和场景匹配,客观题、计算题均有考查,贴合精算中大数据分析、风险分类的实务需求,同时涉及模型偏差与方差的控制。核心考点及采分点:

机器学习方法分类:

监督学习:有标签数据训练,用于预测(如保费预测、理赔风险预测),常用方法:线性回归、广义线性模型、决策树、随机森林。无监督学习:无标签数据训练,用于聚类、降维(如保单客户分类),常用方法:聚类分析、主成分分析(PCA)。强化学习:通过与环境交互学习,精算中应用较少,重点掌握前两类。模型评估与选择(核心,必考):

评估指标(必记):

回归模型:均方误差(MSE,Excel实操必考)MSE=1分类模型:准确率、精确率、召回率、F1分数,适用于风险分类(如高/低风险客户分类)。模型选择方法:交叉验证(k折交叉验证,避免过拟合)、AIC准则、BIC准则,核心目标:选择泛化能力最强的模型,平衡偏差与方差(偏差越小,模型拟合越好;方差越小,模型越稳定)。过拟合与欠拟合:

过拟合:模型过于复杂,拟合训练数据过好,但泛化能力差,解决方法:增加样本量、简化模型、惩罚项(Lasso/Ridge)、交叉验证。欠拟合:模型过于简单,无法捕捉数据规律,解决方法:增加模型复杂度、增加特征变量。常用机器学习方法(必考):

决策树:

核心思想:通过递归划分特征空间,构建树状结构(根节点、内部节点、叶节点),每个节点对应一个特征判断,叶节点为预测结果。核心步骤:特征选择(信息增益、Gini系数)、树的构建、剪枝(避免过拟合),精算中用于客户风险分类、理赔欺诈识别。聚类分析:

核心用途:无监督分类(如客户分群、风险分层),常用方法:K-均值聚类(K-means)、层次聚类。K-means核心步骤:确定聚类个数K→随机初始化聚类中心→迭代更新聚类中心→直至收敛,重点掌握聚类个数的确定方法(肘部法则)。数据降维:

核心用途:减少特征变量个数,消除多重共线性,简化模型,常用方法:主成分分析(PCA)、因子分析。PCA核心思想:将多个相关特征转换为少数几个不相关的主成分,保留数据的主要信息,主成分的方差越大,包含的信息越多。模型偏差与控制:精算建模中常见数据偏差(收集偏差、选择偏差、模型偏差),需通过数据校验、交叉验证、样本平衡等方法控制,避免偏差导致决策错误。避坑提示:①混淆监督学习与无监督学习的适用场景;②模型评估指标选择错误(如用准确率评估不平衡数据的分类模型);③K-means聚类中聚类个数K确定错误;④决策树未剪枝,导致过拟合;⑤数据降维时过度降维,丢失关键信息;⑥忽视模型偏差的影响,未进行偏差检验和修正。八、必记采分点汇总(直接背诵,快速踩分)聚焦所有高频考点,摒弃冗余,直接记忆,覆盖真题80%以上采分点,适配考前快速背诵,重点标注易混、易错采分点,贴合准精算师考试的精算实务导向。数据处理与质量控制:

数据清洗:缺失值(均值/中位数填充)、异常值(箱线图/Z-分数识别)、重复值(去重);Excel实操:VLOOKUP、数据透视表、回归分析、MSE计算。数据质量:完整性、准确性、一致性、时效性,避免数据偏差,通过描述性统计和可视化校验。风险理论与损失模型:

泊松过程:Nt∼Pλt聚合风险模型:ES=ENEX常见理赔分布:指数分布EX=1λ;对数正态分布生存分析与生命表:

生存函数:Sx=e−0预期寿命ex=0∞Sxt随机模拟:

指数分布随机数:X=−1样本容量:结合精度要求确定,模拟误差与样本容量平方根成反比。回归分析:

线性回归:OLS估计,R2GLM模型:随机部分(泊松、伽马)、系统部分(线性组合)、连接函数(对数连接);惩罚回归:Lasso(L1,变量选择)、Ridge(L2,降方差)。时间序列:

平稳性检验:ADF检验,非平稳序列需差分;AR(p)(PACF截尾)、MA(q)(ACF截尾)。ARMA模型步骤:平稳性处理→定阶→参数估计→检验→预测。机器学习:

监督学习(预测)、无监督学习(聚类/降维);评估指标:MSE(回归)、准确率(分类)。决策树(特征选择、剪枝);K-means(聚类个数K,肘部法则);PCA(数据降维,保留主信息)。过拟合解决:剪枝、惩罚项、交叉验证;偏差控制:数据校验、样本平衡。九、易错点与避坑指南(提分关键)数据处理类易错:①缺失值、异常值处理错误;②数据转换编码错误;③多来源数据关联错误;④忽视数据偏差和时效性;⑤Excel实操中MSE计算错误、回归分析参数设置错误。风险理论类易错:①聚合风险模型方差公式记错;②理赔分布的期望、方差记混;③泊松过程参数含义混淆;④个体与聚合风险模型适用场景混淆;⑤破产模型变量含义和破产概率影响因素判断错误。生存分析类易错:①生存函数与死亡力关系记反;②KM估计删失数据处理错误;③生命表指标公式记错;④预期寿命积分计算错误;⑤选择生命表与综合生命表

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论