版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
精算师考试数据建模练习题(完整版)1.精算数据建模过程中,识别出的赔付额异常值应直接从样本中删除以避免模型偏差。2.用广义线性模型(GLM)拟合车险赔付频率数据时,通常选用对数连接函数对应泊松分布的响应变量。3.数据建模中训练集拟合优度显著高于测试集,说明模型存在欠拟合问题。4.ARIMA模型要求输入的时间序列数据必须满足平稳性条件,非平稳序列需经差分处理后才可建模。5.拟合财产险损失额分布时,对数正态分布属于右偏分布,适合拟合存在大额长尾赔付的损失数据。6.精算建模中对赔付数据进行分层抽样时,应将赔付额较低的普通赔案赋予更高的抽样权重以保证样本代表性。7.进行特征筛选时,皮尔逊相关系数仅能识别变量间的线性相关关系,无法捕捉非线性关联。8.用链梯法计提未决赔款准备金属于参数类数据建模方法。9.L1正则化(Lasso)可以实现特征的稀疏化选择,适合处理精算数据中高维特征的降维需求。10.拟合优度检验中,卡方检验的原假设为样本分布与理论分布不存在显著差异,若p值小于0.05则拒绝原假设,说明模型拟合效果较差。1.下列分布中,最适合拟合车险第三者责任险的大额长尾损失数据的是A.正态分布B.泊松分布C.帕累托分布D.二项分布2.拟合寿险保单退保率数据(取值为0到1的比例数据),最适合选用的响应变量分布是A.泊松分布B.伽马分布C.伯努利分布D.贝塔分布3.下列哪种方法无法有效缓解精算数据建模中的过拟合问题A.增加训练样本量B.减少正则化参数权重C.引入交叉验证D.减少特征维度4.下列哪种时间序列模型最适合拟合包含季节波动的车险月度赔付次数数据A.AR(p)模型B.MA(q)模型C.SARIMA模型D.ARCH模型5.某财险公司赔付数据中存在部分缺失的驾驶员年龄字段,下列处理方式最符合精算建模要求的是A.直接删除所有含年龄缺失的样本B.将缺失值统一填充为全样本年龄平均值C.按照车型、出险地域分组填充组内年龄中位数D.将缺失值单独作为一个类别纳入特征体系6.下列特征衍生方式属于聚合特征的是A.将保单出险时间衍生为出险月份B.将驾驶员年龄划分为青年、中年、老年三组C.根据保单所属区域统计过去12个月的区域平均赔付率D.将车龄与驾驶员年龄做乘积得到交互项7.下列评估指标中最适合评估赔付额预测模型的误差水平的是A.准确率B.召回率C.平均绝对百分比误差(MAPE)D.F1值8.对于赔付次数数据中少量的高额赔付样本,下列哪种重采样方式更合理A.对高额样本进行过采样B.对普通样本进行过采样C.直接删除高额样本D.对所有样本进行随机欠采样9.某精算师拟合了两款车险定价模型,要判断两款模型的预测误差是否存在显著差异,应选用以下哪种检验方法A.t检验B.F检验C.Wilcoxon符号秩检验D.卡方检验10.下列属于随机准备金模型的是A.确定性链梯法B.案均赔款法C.Bootstrap链梯法D.保费法1.广义线性模型(GLM)的基本组成包括以下哪些部分A.响应变量的指数族分布B.线性预测器C.连接函数D.正则化项2.精算数据建模中常见的非结构化数据类型包括A.车险理赔现场照片B.健康险理赔病历文本C.保单保费数值D.客服通话语音记录3.下列关于过拟合和欠拟合的说法正确的有A.欠拟合模型的训练集和测试集误差都较高B.过拟合模型的训练集误差低,测试集误差高C.增加模型复杂度可以缓解欠拟合D.减少训练样本量可以缓解过拟合4.适合用于分类建模(如判断保单是否出险)的模型包括A.逻辑回归模型B.决策树模型C.泊松回归模型D.支持向量机模型5.精算数据建模中对数据进行标准化处理的作用包括A.消除不同特征量纲差异对模型的影响B.提升梯度下降类算法的收敛速度C.避免数值较大的特征在模型中被赋予过高权重D.提升线性模型的拟合优度6.下列属于时间序列平稳性检验方法的有A.ADF检验B.KPSS检验C.DW检验D.Ljung-Box检验7.拟合健康险重疾赔付数据时,需要考虑的风险特征因子包括A.被保险人年龄B.被保险人职业类别C.保障责任范围D.历史理赔记录8.下列关于正则化的说法正确的有A.L2正则化会使得大部分特征的系数趋近于0但不为0B.L1正则化更容易产生稀疏解C.正则化参数越大,模型越不容易过拟合D.正则化仅适用于线性模型9.精算模型上线前需要进行的验证环节包括A.样本外验证B.跨时间段验证C.压力测试D.敏感性测试10.下列属于数据建模中的伦理风险的有A.模型特征中包含性别、种族等歧视性变量B.对低收入群体的保费定价显著高于其风险水平C.模型训练过程中使用了未脱敏的客户隐私数据D.模型预测误差超出监管规定的阈值1.某财险公司2023年车险业务数据共包含120万张保单,其中出险保单共7.2万张,赔付额样本中超过100万的大额赔案共128件。精算团队拟搭建新车险定价模型,遇到以下问题:(1)本次建模的样本属于典型的不平衡数据(出险样本仅占6%),请列举2种适合处理该不平衡样本的方法。(2)针对128件大额赔案,建模时应采取哪些特殊处理措施?2.某寿险公司拟搭建个险退保预测模型,选用了过去3年的100万张有效保单作为样本,特征变量包括投保人年龄、性别、缴费方式、保费金额、被保险人健康状况、销售渠道共6个基础变量,初步选用逻辑回归模型建模后,发现模型的测试集AUC仅为0.62,拟合效果未达到预期。请指出3种可能提升该模型拟合效果的可行方案并说明理由。3.某财险公司精算师用链梯法计提2023年末未决赔款准备金,已决赔款数据如下(单位:万元):事故年2021年:发展年1已决赔款1200,发展年2已决赔款1800,发展年3已决赔款1980;事故年2022年:发展年1已决赔款1500,发展年2已决赔款2100;事故年2023年:发展年1已决赔款1800。要求:(1)计算各发展年的平均进展因子;(2)计算2023年末应计提的未决赔款准备金总额。1.当前精算领域越来越多使用机器学习模型替代传统广义线性模型(GLM)进行定价和准备金评估,请对比分析机器学习模型与传统GLM模型在精算数据建模中的优缺点,分别说明两类模型的适用场景。2.精算数据建模过程中,“假设合理性”是监管部门重点关注的内容,请结合车险定价建模的全流程,说明需要验证的核心假设包括哪些,以及验证这些假设的常用方法。【标准答案及解析】一、判断题答案及解析1.参考答案:错误。解析:精算数据中的赔付额异常值可能是真实存在的大额赔付事件,直接删除会导致损失分布拟合偏误,需先核实异常值的真实性,若为真实数据应采用加权、单独建模等方式处理,若为录入错误才可修正或删除。2.参考答案:正确。解析:车险赔付频率属于计数类数据,通常服从泊松分布,对数连接函数可以保证线性预测器的取值映射到泊松分布所需的非负区间,是GLM拟合赔付频率的标准配置。3.参考答案:错误。解析:训练集拟合优度显著高于测试集是过拟合的典型特征,说明模型学习到了训练集中的随机噪声,泛化能力差;欠拟合的表现为训练集和测试集的拟合优度均较低。4.参考答案:正确。解析:ARIMA模型的建模前提是序列平稳,非平稳序列会导致参数估计偏差,需通过差分处理转化为平稳序列后再进行建模,差分阶数对应ARIMA模型的d参数。5.参考答案:正确。解析:财产险损失数据通常呈现右偏特征,即小额赔付占比高、大额赔付占比低的长尾分布,对数正态分布属于右偏分布,能够较好拟合大部分常规损失数据的分布特征。6.参考答案:错误。解析:精算建模中分层抽样应提高大额赔案的抽样权重,因为大额赔案对整体赔付成本的影响更高,提高其抽样占比能够提升损失分布拟合的准确性,普通赔案样本量充足无需额外提高权重。7.参考答案:正确。解析:皮尔逊相关系数衡量的是变量间的线性相关程度,对于变量间的非线性关联(如U型关系、指数关系)无法有效识别,需结合互信息、Spearman秩相关系数等方法识别非线性关联。8.参考答案:错误。解析:链梯法是基于历史赔款的进展规律估算未决赔款的非参数建模方法,无需对损失分布进行参数假设,不属于参数类建模方法。9.参考答案:正确。解析:L1正则化会将不重要的特征的系数压缩为0,从而实现特征的自动筛选,得到稀疏的特征集合,非常适合处理精算数据中高维特征的降维需求。10.参考答案:正确。解析:卡方拟合优度检验的原假设为样本实际分布与理论分布无显著差异,若p值小于0.05则拒绝原假设,说明样本分布与理论分布差异显著,模型的拟合效果不符合要求。二、单项选择题答案及解析1.参考答案:C。解析:帕累托分布属于重尾分布,能够较好拟合财产险中存在的大额长尾损失数据;正态分布为对称分布不适合拟合偏态损失数据,泊松分布和二项分布适用于计数类数据而非赔付额这类连续型数据。2.参考答案:D。解析:贝塔分布的取值范围为0到1,专门用于拟合比例类数据;泊松分布适用于计数数据,伽马分布适用于正的连续型数据,伯努利分布适用于二分类数据。3.参考答案:B。解析:正则化参数权重越小,正则化的约束力度越弱,模型越容易过拟合;增加样本量、交叉验证、减少特征维度均是缓解过拟合的常用方法。4.参考答案:C。解析:SARIMA模型即季节性ARIMA模型,专门用于处理包含季节波动的时间序列数据;普通AR、MA模型无法处理季节波动,ARCH模型用于处理异方差的金融时间序列。5.参考答案:D。解析:驾驶员年龄缺失通常不是随机事件,可能与驾驶员的风险偏好、投保信息披露意愿相关,单独作为类别纳入特征可以捕捉这种潜在的风险差异;直接删除样本会损失信息,填充均值或中位数会掩盖缺失本身代表的风险特征。6.参考答案:C。解析:聚合特征是指对样本进行分组后统计得到的组层面特征,区域平均赔付率属于典型的聚合特征;其余选项分别属于时间特征衍生、分箱特征、交互特征。7.参考答案:C。解析:MAPE是衡量回归类模型预测误差的常用指标,其余三个指标均为分类模型的评估指标,不适用于赔付额这类连续变量的预测效果评估。8.参考答案:A。解析:高额赔付样本占比低但对整体赔付成本影响大,对其进行过采样可以提升模型对大额损失的拟合能力;其余选项均会导致模型低估大额损失风险。9.参考答案:C。解析:两款模型的预测误差通常不服从正态分布,适合采用非参数的Wilcoxon符号秩检验判断差异的显著性;t检验和F检验要求数据服从正态分布,卡方检验用于拟合优度或独立性检验。10.参考答案:C。解析:Bootstrap链梯法通过重采样方法得到未决赔款的分布,属于随机准备金模型;其余三个选项均为确定性准备金模型,仅能得到准备金的点估计值。三、多项选择题答案及解析1.参考答案:ABC。解析:广义线性模型的三个基本组成部分为服从指数族分布的响应变量、线性预测器、连接函数,正则化项是为了缓解过拟合额外加入的部分,不属于GLM的基本组成。2.参考答案:ABD。解析:非结构化数据是指没有固定结构的数据,照片、文本、语音均属于非结构化数据;保单保费数值属于结构化的数值型数据。3.参考答案:ABC。解析:减少训练样本量会降低模型的泛化能力,加重过拟合问题,其余选项说法均正确。4.参考答案:ABD。解析:逻辑回归、决策树、支持向量机均是常用的分类模型;泊松回归属于计数类模型,适用于赔付次数这类计数变量的拟合,不适合分类场景。5.参考答案:ABC。解析:标准化处理仅能消除量纲差异、提升算法收敛速度、避免数值大的特征权重过高,不会改变特征与响应变量的关联关系,无法直接提升线性模型的拟合优度。6.参考答案:AB。解析:ADF检验和KPSS检验是常用的平稳性检验方法;DW检验用于检验序列的一阶自相关,Ljung-Box检验用于检验序列是否为白噪声。7.参考答案:ABCD。解析:被保险人年龄、职业类别、保障责任范围、历史理赔记录均是影响重疾赔付风险的核心因子,建模时均需纳入考量。8.参考答案:ABC。解析:正则化不仅适用于线性模型,树类模型的剪枝、神经网络的dropout均属于正则化方法,D选项说法错误,其余选项均正确。9.参考答案:ABCD。解析:精算模型上线前需要完成样本外验证、跨时间段验证确保泛化能力,完成压力测试、敏感性测试确保模型在极端场景下的表现符合预期。10.参考答案:ABC。解析:模型预测误差超出监管阈值属于模型性能风险,不属于伦理风险;其余三个选项均涉及公平性、隐私保护等伦理层面的问题。四、案例分析题答案及评分标准1.参考答案:(1)不平衡样本处理方法:①过采样:采用SMOTE算法合成出险样本或对现有出险样本进行重复采样,提升出险样本的占比;②欠采样:随机减少未出险样本的数量,使两类样本的占比达到平衡;③调整分类阈值:降低模型判断为出险的阈值,提升对出险样本的识别率;④选用对不平衡数据友好的模型:使用XGBoost、LightGBM等模型,设置class_weight参数提升少数类样本的权重。(答出任意2种即可得4分)(2)大额赔案处理措施:①损失分层建模:将大额赔案与普通赔案分开建模,单独拟合大额损失的分布;②提高大额赔案的样本权重,提升模型对大额损失的拟合优先级;③选用帕累托、广义帕累托等重尾分布拟合大额损失部分。(答出任意2种即可得2分)评分标准:方法表述正确、符合精算建模逻辑即可得分,言之有理可酌情给分。2.参考答案:①特征工程优化:在现有基础特征之上衍生更多相关特征,如投保人历史投保时长、保单现金价值、缴费期限、区域经济水平、同类型产品历史退保率等,丰富特征维度,理由是现有特征数量较少,无法覆盖影响退保行为的全部风险因子,增加有效特征可以提升模型的拟合效果。(2分)②更换模型类型:选用非线性模型如随机森林、XGBoost、LightGBM等进行建模,理由是逻辑回归属于线性模型,只能捕捉变量间的线性关系,无法捕捉变量间的非线性关联和交互效应,非线性模型的拟合能力更强。(2分)③样本优化:排除样本中的异常样本(如恶意退保的异常保单、团险等特殊渠道保单),补充近1年的新保单数据提升样本的代表性,理由是样本中的噪声和代表性不足会导致模型拟合效果差,优化样本质量可以提升模型的泛化能力。(2分)评分标准:方案合理、理由充分即可得分,言之有理可酌情给分。3.参考答案:(1)进展因子计算:发展年1到2的进展因子分别为1800/1200=1.5、2100/1500=1.4,平均进展因子为(1.5+1.4)/2=1.45;发展年2到3的进展因子为1980/1800=1.1;发展年3到终极的进展因子为1。(3分)(2)未决赔款准备金计算:2022事故年的终极赔款=21001.1=2310万元,对应的未决赔款=2310-2100=210万元;2023事故年的终极赔款=18001.451.1=2871万元,对应的未决赔款=2871-1800=1071万元;2023年末应计提的未决赔款准备金总额=210+1071=1281万元。(3分)评分标准:计算步骤正确、结果正确即可得分,仅结果正确无计算过程得1分。五、论述题答案及评分标准1.参考答案:(1)优缺点对比:①传统GLM模型的优点:可解释性强,每个特征的系数都有明确的精算含义,符合监管对模型可解释性的要求;假设清晰,参数估计稳定,验证成本低;建模流程标准化,行业接受度高。缺点:拟合能力有限,仅能捕捉线性关系,变量间的交互效应需要手动设置;对高维特征、非线性关联的拟合效果差;需要提前对响应变量的分布进行假设,假设偏差会导致模型效果差。(3分)②机器学习模型的优点:拟合能力强,能够自动捕捉变量间的非线性关联和交互效应,无需手动设置;无需提前对响应变量的分布进行假设,适合复杂风险场景的建模;支持高维特征的自动筛选,特征工程成本低。缺点
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 再生粗骨料针片状含量规准仪监理细则
- 会计师事务所行业现状与发展趋势
- 味精微生物菌种工岗前理论水平考核试卷含答案
- 压电石英晶体切割工岗前前瞻考核试卷含答案
- 紧固件镦锻工安全理论竞赛考核试卷含答案
- 耐火成纤工安全综合模拟考核试卷含答案
- 2026中信红河产业开发限公司招聘工作人员3名易考易错模拟试题(共500题)试卷后附参考答案
- 2026东航合规风控经理助理东方航空产业投资限公司合规风控主办招聘(上海)易考易错模拟试题(共500题)试卷后附参考答案
- 2026下半年黑龙江哈尔滨市事业单位招聘工作人员1186人重点基础提升(共500题)附带参考答案
- 2026下半年陕西安康市事业单位招聘工作人员416人易考易错模拟试题(共500题)试卷后附参考答案
- 晚期肿瘤病人护理
- 员工阀门培训课件图片
- 中医操作安全管理制度
- 极兔快运java面试题及答案
- 原创国内外药用新辅料应用及发展趋势
- 退休医生劳务合同协议
- 设备移机合同协议
- 2022调度自动化主站远方操作一体化防误技术规范
- 桶装水采购合同2025年
- 艺术涂料施工协议
- 医师定期考核(临床医师)-医师定期考核真题
评论
0/150
提交评论