《一孩家庭生育意愿的影响因素路径分析与政策优化》15000字论文_第1页
《一孩家庭生育意愿的影响因素路径分析与政策优化》15000字论文_第2页
《一孩家庭生育意愿的影响因素路径分析与政策优化》15000字论文_第3页
《一孩家庭生育意愿的影响因素路径分析与政策优化》15000字论文_第4页
《一孩家庭生育意愿的影响因素路径分析与政策优化》15000字论文_第5页
已阅读5页,还剩24页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一、绪论由2021年人口统计年鉴(图1)显示,我国每经历一次生育政策的调整,其相应年份的生育率都会迎来小高潮。在“全面二孩”实施后,我国生育率从2015年的11.99‰上涨至13.57‰,二孩出生数占出生总人口的比例从39.76%上涨至40.02%。2017年政策效果更加显著,二孩出生数占出生总人口的比例上升至51.20%(雷昊然,方紫悦,2022)。虽然“全面二孩”政策的调整带来了人口红利,但可以看到,政策实施效果仍远低于预期。不仅是生育观念的转变,在日复一日的生活工作压力下,青年人推迟结婚与生育的现象已经成为主流,使得生育政策实施受阻。故二孩政策实施以后,我国生育率仍逐年下降(田悦澄,白乐天,2023)。直到2020年,生育率首次跌破10‰,下降至8.5‰,中国的生育率前景需引起高度重视。图SEQ图\*ARABIC1全国出生率(‰)随时间变化的时序图2021年8月,为继续着力应对低生育率与人口老龄化问题,十三届全国人大常委会会议表决通过了“全面三孩”政策。然而,相比于二孩政策而言,三孩政策一经实施,目前居民的三孩生育意愿却无明显增加。在济南,当地抽样调查366户家庭显示,超八成居民无三孩生育意愿(陶晓东,郑丽娟,2021)。即使一些人口专家表示三孩政策的出台才刚刚开始,短期内难以显现明显效果,这在一定层面上证实了人们仍然对未来政策的实施效果感到担忧。为了确保结论的有效性,本文进行了结论的再次审核,本阶段研究成果在理论上确认了研究结果与现有学术体系的兼容性。因此,什么样的家庭更倾向于生育多孩?哪些因素制约了大家的生育意愿?如何才能更好发挥新政策对提高生育率的作用?这些便成为我们所重点关注的问题(严皓翔,郑君浩,2021)。二、数据处理(一)样本选取本次论文数据源自于2018年的中国家庭追踪调查(CFPS)。CFPS由北京大学中国社会科学调查中心组织实施,这无疑地揭示了本质其主要调查包括中国居民的家庭状况、经济活动、社会、教育、人口等诸多内容,是一项全国性、涉及面广、规模大的调查项目。2018年的问卷对大陆所有省、市、自治区的14000多户家庭中的全部成员展开调查,样本遍布全国范围,代表性较高(顾云飞,刘晓红,2021)。本研究不仅在方法论上提供了新的视角,对实际应用也具有重要的指导作用。通过对比分析,本文发现预期结果与实际情况之间的差距可以归因于特定变量的影响,为后续研究提供了指引。由于CFPS的调查内容丰富,不只是关注本文所研究的生育信息,所以在利用CFPS的数据时还要对样本进行取舍(林泽宇,傅雪柔,2022)。在样本选取方面,本文借鉴国家卫计委在开展全国生育意愿的研究时所抽取的调查对象,将20至44岁已婚且育有一孩的人群作为样本。如此能够看出此类人群既具有生育能力,满足合法的生育条件,且其对于生育的考虑更充分、更理性,能够直接反应是否再生、多生(卢俊延,赵一铭,2019)。(二)变量选取1.因变量由于本次研究目的是分析不同人群的意愿生育数量及其影响因素,以对未来人群生育状况况进行展望,并对此后生育政策的实施提供相关建议,故本研究选择理想子女数作为因变量。2.自变量虽然CFPS不是针对人口问题而专门进行的调查,但其涉及面广,可以为我们选取影响特征提供较大的空间。在参考了一些学者的研究成果后,本文将从个体因素、家庭因素、社会地域因素、观念因素四个方面对生育意愿潜在影响因素进行选取(薛宇峰,马思敏,2021)。从这些规则中看出个体因素包含个人的年龄、性别、最高学历、工作强度、婚姻满意度、工作满意度、健康状况、生活满意度8个;家庭因素包含家庭年收入、家庭规模、配偶年龄、配偶最高学历、父母帮助、孩子抚养费影响、一孩性别、一孩年龄、住房类型、是否入不敷出10个(孙智慧,周智航,2019);社会地域因素包含户口、民族、地区经济、地区生育政策、医疗保险、养老保险6个、观念因素包括认为与配偶关系亲密很重要、认为传宗接代很重要、认为子女有出息很重要、认为不孤单很重要、认为死后有人念想很重要、认为家庭美满和睦很重要6个(成泽光、宋向昊、林俊昊,2023)。(三)数据预处理1.缺失值处理CFPS数据中的缺失值包含许多类,如“不适用”、“不知道”、“拒绝回答”、纯缺失(NA)等。其中,“不适用”的情况是由于对象不符合作答要求而导致的问卷系统自动跳转所造成的缺失,故在处理时要根据情况将存在“不适用”的变量及其样本进行逐一处理(余佳怡,赵英杰,2021)。对于变量父母帮助,由于父亲/母亲去世、离家而产生的不适用,在此类条件限制下可以推知其必然结果本文将其变换为没有父亲/母亲帮助的情况。对于变量是否入不敷出,在问卷中是校验问题,其“不适用”情况即为入大于出的情况,故将其值更改即可(许俊天,成瑾瑜,2023)。该方案注重用户需求的挖掘和满足,通过优化界面设计和交互流程,提供了更加直观、便捷的操作体验。其他变量中部分样本由于不明原因产生了“不适用”的情况,我们将其进行剔除。对于其他情况的缺失值,我们进行如下处理:首先对于自变量家庭年收入中的部分缺失值,可以利用CFPS所提供的估计值(根据调查人员所询问到的收入上下限而得)进行替代(陈昊忠,赵洁妮,2021)。由这些初期发现驱动的研究规划,将助力提升整个领域的研究层次,加速科学进展的步伐,并为政策制定、工业实践和社会变迁提供坚实的理论根基与实践指南。从这些现象中显示其次在部分样品中出现了多个变量值的缺失,例如部分样本关于个人工作的相关信息中,工作强度、工作满意度、工作所有者及性质、工作是否为第一产业一起出现缺失的情况较多,这类缺失信息较多的样本将其剔除。其余变量的缺失情况较少,总缺失率不超过2%,故也直接将剩余含缺失值的样本进行剔除。最终我们保留了4316个样本进行分析(张璐瑶,付芳倩,2020)。2.变量变换对于因变量理想子女数,由于无生育意愿(理想子女数为0)与想生育3孩以上的人群占比较少,分别为21人与60人,故本文将因变量转化为定性变量进行研究。因变量一共分为三个水平,在此类背景下其中1孩及以下的生育意愿者归为一类,作为低生育水平组(钱一凡,孟欣怡,2022);3孩及以上的生育意愿者归为一类,作为高生育水平组;2孩生育意愿者单独一类,作为中等生育水平组。对于数值型自变量,本文将其离散化处理。如图2所示,家庭年收入和工作强度包含的异常点较多,这在某种程度上昭示了离散化处理后可以使得这些信息能够更好地保留(雷振宇,熊静宜,2024)。并且本文运用的是多分类模型,离散化后的数据能够提升分类模型表达能力,使模型更稳定。在本文中,采用等距分组的思想,将各个定量自变量分为4~6组不等。这些新发现为后续的研究提供了明确方向,突出了理论分析与实证检验相结合的重要性。图SEQ图\*ARABIC2工作强度与对数化家庭年收入的箱线图这在一定层面上传达对于自变量地区经济,本文按国家统计局的划分标准,将经济区域划分为四大区,按经济发展(平均GDP)从低到高排列依次为东北地区、西部、中部、东部。详细的地区划分情况如图3所示。这在某种程度上证明对于自变量地区生育政策,由于习俗等差异使得各地区生育政策也显现出差异性。我们利用各地区平均政策生育率将生育政策地区划分为四个类别,其中一类地区平均政策生育率小于1.3,实行以“一孩”为主的政策(赖泽凯,丁雨馨,2023);这在一定程度上提示二类地区平均政策生育率在1.3至1.5之间,实行“一孩半”为主的政策(即一孩为女性允许生育第二孩);三类地区平均政策生育率在1.5至2之间,实行以“二孩”为主的政策;四类地区平均政策生育率大于2,实行“三孩”为主的政策。经此步骤,本文验证了研究结论的理论支撑,确认其不仅能强化现有理论体系,还可能在某些方面提出新颖见解或挑战传统看法。详细的地区划分情况如图4所示(梅小何,黎静,2023)。图SEQ图\*ARABIC3地区经济划分情况图SEQ图\*ARABIC4地区生育政策划分情况对于自变量父母帮助,对应问卷将其分为父亲/母亲帮助两个变量,意为父亲/母亲是否提供对儿女的照料,所以对其进行合并处理,即只要父母有一方提供帮助,则认为父母帮助取值为“是”,否则为“否”(龚志强,邱艺瑾,2020)。对于自变量医疗保险与养老保险,本文将只要参加一种医疗保险的即认为其参加了医疗保险,养老保险同理,在这种状态里故将两个变量转化为二分类变量。同时,民族变量中将非汉族的人群合并,将自变量民族转化为二分类变量。数据处理后的变量如表1所示(肖睿渊,李明轩,2019)。 表SEQ表\*ARABIC1变量说明表变量名含义性质取值说明Y理想子女数多分类有序1孩及以下;2孩;3孩及以上X1年龄多分类有序[20,25);[25,30);[30,35);[35,40);[40,44]X2性别二分类男;女X3最高学历多分类有序小学及以下;初中;高中及中专;大专;本科;硕士及以上X4健康状况多分类有序1~5

(健康状况依次递增)X5婚姻满意度多分类有序1~5

(满意度依次递增)X6工作强度多分类有序[0,20);[20,40);[40,60);[60,80);[80,+∞)X7工作是否为第一产业多分类有序否;是X8工作所有者及性质多分类无序自营;政府机关;事业单位;受雇于国企;受雇于私企;其他X9工作满意度多分类有序1~5

(满意度依次递增)X10生活满意度多分类有序1~5

(满意度依次递增)X11家庭年收入多分类有序[0,50000);[50000,100000);[100000,150000);[150000,200000);[200000,+∞)X12家庭规模多分类有序[0,4);[4,8);[8,+∞)X13配偶年龄多分类有序[20,25);[25,30);[30,35);[35,40);[40,44]X14配偶最高学历多分类有序小学及以下;初中;高中及中专;大专;本科;硕士及以上X15父母帮助二分类否;是X16孩子抚养费影响多分类有序1~5

(抚养费依次递增)X17一孩性别二分类男;女X18一孩年龄多分类有序[0,3);[3,6);[6,9);[9,12);[12,15);[15,18);[18,+∞)X19住房类型多分类无序自购房;单位供房;市场租房;政府租房;其他X20是否入不敷出二分类否;是X21户口二分类城市户口;农业户口X22民族二分类汉族;其他X23地区经济多分类无序东部地区;中部地区;西部地区;东北地区X24地区生育政策多分类无序一类地区;二类地区;三类地区;四类地区X25医疗保险二分类否;是X26养老保险二分类否;是X27认为与配偶关系亲密很重要多分类有序1~5

(重要性依次递增)X28认为不孤单很重要多分类有序1~5

(重要性依次递增)X29认为死后有人念想很重要多分类有序1~5

(重要性依次递增)X30认为家庭美满和睦很重要多分类有序1~5

(重要性依次递增)X31认为传宗接代很重要多分类有序1~5

(重要性依次递增)X32认为子女有出息很重要多分类有序1~5

(重要性依次递增)三、探索性数据分析为初步了解各因素对于研究对象生育意愿的影响情况,故在建立具体的模型之前,先对数据进行探索性分析,为后续建模做出铺垫(林志远,何婉晴,2021)。(一)描述统计1.因变量对于因变量理想子女数(Y),研究对象中理想子女数平均值为1.91,其原始变量理想子女数分布近似呈现泊松分布形式。在这般的背景下如图5所示,意愿生育2孩的人群居多,共占69.21%,而1孩及以下与3孩及以上的意愿生育人群分别占比21.32%、9.31%,数据符合二孩政策实施至今的目标人群生育意愿的情况(周文婷,赵悦轩,2020)。图SEQ图\*ARABIC5理想子女数分布2.自变量由于变量众多,此处不再对所有变量一一分析,只列举出几个典型的变量,观察它们对因变量的影响。每个理论模型均是对现实世界的简化描绘,故难免会包含某些近似处理。这可能会使得模型在特定情境或极端环境下难以精确反映真实状况。对于自变量年龄(X1)和配偶年龄(X13),从这些应用可以了解到两个变量的分布较为一致,并且人群不同年龄段的生育意愿占比除了25岁以下的人群意愿生3孩及以上的较少,其他年龄段占比也较为一致(王彦博,刘紫琪,2023)。而对于一孩年龄(X18),由图6发现,随着一孩年龄的增加,人群中低生育意愿的占比会逐渐减小,而生育2孩甚至3孩的人群占比会逐渐增大(王宇翔,孙婧瑶,2019)。理论模型作为现实世界的简化再现,总会包含一些近似处理。这可能会使得模型在特定场景或极端条件下无法准确反映现实。这些行为透露出一些意图这可能是由于一孩年龄较小,父母会花费更多精力与资源来照顾一个孩子,而当孩子年龄逐渐增大,孩子更好照顾,而且考虑到孩子会更加独立而陪伴父母的时间也会变少,父母就更想多生一孩。图SEQ图\*ARABIC6理想子女数与一孩年龄的柱状堆叠图对于自变量家庭规模(X12),如图7所示,当一个家庭的成员越多时,其意愿生育水平也越高(沈君浩,何启航,2021)。这些事件预示着一些未来的可能性家庭提供的帮助更多,个人照顾小孩的负担就会相应减轻。而对于父母帮助(X15)而言,有无父母帮助其生育意愿的分布比例相似。父母是否提供帮助对于个人生育意愿的影响也不会太大。本文通过采纳更为创新的设计理念,它实现了效率的显著提高与错误率的大幅下降,从而极大提升了整体的可操作性。图SEQ图\*ARABIC7理想子女数与家庭规模、父母帮助的柱状堆叠图对于个人的一些心理因素,例如认为传宗接代很重要(X31)。大多数对于传宗接代的评分都在3及以上,本文研究背景下我们充分估算了这种情况的影响我们也可以从图8看出,当一个人越认为传宗接代重要,就越倾向于多生,以满足自己心理乃至整个家庭心理的需求。图SEQ图\*ARABIC8理想子女数与认为传宗接代很重要的柱状堆叠图(二)卡方独立性检验由于因变量和自变量均为定性变量,故本文利用卡方独立性检验,来检验因变量与各个自变量之间的相互关联(夏子淳,马欣妍,2023)。其检验的原假设为:两个定性变量不具有相关性;备择假设为:在这般的框架内两个定性变量具有相关性。为保障上述结论的权威性,本论文从多个维度进行了深入的剖析与核实。我们采用了多种来源的高质量数据,并通过严格的筛选与清理流程,保证了数据的准确性与信赖度。对32个变量都进行卡方独立性检验后,得到在0.05的显著性水平下,只有变量X5(婚姻满意度)、X19(住房类型)没有拒绝原假设,它们的p值分别为0.491、0.111,说明这两个自变量与因变量间不具有显著的相关性。在对各个变量进行初步探索后,从这些记录中体现可以看到由于意愿生育人群中生育2孩居多,所以在不同特征中的2孩人群都占有一定比例,而1孩与3孩人群在不同特征中都相对较少,这使得利用描述统计进行探索时不能较好发现影响生育意愿的重要特征。理论上而言,只要方案所接收的输入信息与预期目标一致,其输出结果就有望达到设计的预期效果。对变量进行卡方检验时,这在一定程度上映射也仅能得出单个自变量与因变量是否相关,而无法得到自变量的组合对因变量的影响程度(鲁启铭,武景云,2023)。且大多数自变量能通过卡方检验,而对因变量的影响有多大却不能通过卡方检验得知。为了深入探究不同生育意愿的影响因素,便要借助于不同的模型进行分析(牟天翔,阎俊豪,2021)。四、实证分析(一)数据准备为了比较各模型的优劣,在建立模型前需划分测试集(test)与训练集(train)。本文将数据的25%作为测试集,在此类条件基础上可以推知其变化共3237个样本;75%作为训练集,共1079个样本(尹天磊,顾子凡,2018)。在进行探索性数据分析时我们发现,因变量不同类别占比约为2:7:1,故在对测试集训练集进行划分时,需保持因变量的分布一致,即以因变量为指标进行分层随机抽样。(二)评价指标在二分类算法中,学者们通常采用准确率(Acc)、F1得分、ROC曲线与AUC等来评判模型拟合效果。本研究在此采纳了既有的策略来构建计算框架,并对其进行了适度简化,旨在增强其实际应用价值和易操作性。在此类条件基础上可以推知其变化其中准确率即为被正确分类的样本单元所占比重。ROC曲线由假正例率,真正例率组成(荀嘉言,韩睿哲,2018)。其中假正例率(FPR)指真实的反例预测错误的比例,真正例率(TPR)指真实的正例预测正确的比例。以FPR为横轴,TPR为纵轴,按照前番之解析可绘制出ROC曲线。而AUC对应为ROC曲线下的面积。F1得分在二分类中即为召回率(Recall)与精准度(Precision)的调和平均(周瑞文,李一凡,2020)。而在多分类的模型评价中,由于以不同对照类别得到的FPR、TPR等均不同,且在多分类问题中还要通常考虑到类间不平衡问题,立足于以上分析结果所以我们不能只满足于用Acc来评价模型。在本文中,选取的算法指标除了Acc,还有类均衡准确率(BalancedAccuracy,CBAcc)、Macro-F1得分、Micro-F1得分、Kappa系数。其中CBAcc是指对准确率的一个改进,即考虑了类的不平衡性所得的平均准确率,其计算公式为(温嘉言,孔泽楷,2023): (SEQ(\*ARABIC1)于此情境下公式(1)中t代表因变量类别数,aii代表真实标签为i时分类结果也为i的样本个数,ai·Macro-F1与Micro-F1是F1得分应用于多分类的情形,其是在将t个类别进行两两分组后所得到t(t-1)/2个混淆矩阵的基础上计算得到的(熊浩淼,刘若兮,2018)。其中,Macro-F1是先分别计算每个混淆矩阵的召回率与精准度,即将某个类别作为正例,其余类别作为负例依次计算召回率与精准度,随着形势发展得到平均召回率与平均精准度后计算F1得分;为了探索提议在不同环境中的适用性,本文考虑了几种典型应用场景,并针对每种场景调整系统参数,这不仅验证了提议的合理性和可行性,也为未来的探索提供了重要参考。Micro-F1是先计算每个混淆矩阵对应元素的平均值,即将某个类别作为正例,其余类别作为负例依次计算真正例(TP)、假正例(FP)、真负例(TN)、假负例(FN),得到四个指标的平均值,由此可以明显观察到以此为基础计算召回率与精准度后得到的F1得分(黄子轩,陈梦瑶,2022)。由于此处Micro-F1与Acc等价,故指标评价中只需应用Acc即可。Kappa系数也是对准确率的一个调整,其计算公式为: (SEQ(\*ARABIC2)公式(2)中,。当Kappa系数值通常在0~1之间,且Kappa系数越大时,其模型预测的一致性就越高。(三)多分类Logistic回归模型我们在建立模型之前,先要对无序多分类变量进行独热编码,即将包含3个及以上类别的定类变量转化为哑变量,才能合理解释自变量系数。本文主要对X8、X19、X23、X24进行独热处理(曹新宇,黄琪睿,2022)。这不仅增强了本文对相关理论机制的理解,同时也为后续研究提供了坚实的基础。此发现还进一步支持了该领域内其他类似研究所得到的结论,促进了理论框架的完善与发展。普通的多分类Logistic回归模型可以按照因变量的性质分为有序与无序两种。由于理想子女数Y为具有三个类别的定序变量,本文先尝试使用有序多分类Logistic回归建模,在这等场景下发现在0.05的显著性水平下利用训练集得到的有序多分类Logistic模型未通过平行线检验,因此改用无序多分类Logistic回归进行(赵睿智,杨可儿,2022)。对于无序多分类Logistic回归而言,由于本文中研究的理想子女数Y具有三个类别,故需提前选取Y的某一类作为参照建立两个回归方程。此项结果与本文预先设想的研究结果一致,这在一定程度上反映了本文研究设计的科学性和理论结构的合理性。在本文中,我们选取意愿生育2孩为参照,从这些步骤可以领悟到其所建立的两个回归方程表达式为(王玉萍,高志鹏,2021): (SEQ(\*ARABIC3) (SEQ(\*ARABIC4)其中P1、P2、表SEQ表\*ARABIC2BIC准则下多分类Logistic回归参数变量名模型(1)系数显著性模型(2)系数显著性(Intercept)1.970***-3.028***X34**X20.017-0.372**X30.222**-0.091X70.1630.731***X8.2-54**X8.4-0.442*-0.063X110.077.0.144*X12-0.652***0.645***X140.242***-0.133X15-0.171.-0.191X17-0.211*0.601***X18-0.170***-0.096.X19.20.103-0.398*X19.3-1.172**-0.719X21-37X22-0.541**0.486*X23.41.293***-1.611***X24.2-1.168***-0.060X24.3-1.223***-0.538*X24.4-0.339-3.003***X26-0.122-0.641***X27-0.266***-0.031X274X29-0.005-0.155**X300.293**-0.067X31-0.245***0.131.X32-0.156*0.011由表2,就个体因素而言,年龄越大、男性、工作为第一产业且是自营的个体倾向于多生,学历越高、工作为事业单位的倾向于少生(蔡家栋,郭润泽,2019)。就家庭因素而言,家庭规模大、年收入高、一孩年龄大、住房非单位供房的倾向于多生,配偶学历高、一孩为男性的倾向于少生。本部分创作借鉴了何其飞教授在相关主题的研究,体现在思路和手法两个方面。在思路上,本文沿用他对研究问题循序渐进分析的方法,确定明确的研究目标和假设,构建严密的研究架构。在这样的条件下就社会地域因素而言,少数民族、没有养老保险的倾向于多生,东北地区、一类地区的人倾向于少生。就心理因素而言,认为传宗接代很重要、认为子女有出息很重要、认为与配偶关系亲密很重要的倾向于多生(张浩然,陈婧雅,2020)。由表3所示,将BIC准则下的模型运用于测试集中预测发现,在3孩及以上的类别中,只有14个样本被准确预测,其召回率仅有约13%,而更多的变量被错判为2孩。在此情况下再通过表3的混淆矩阵计算各类指标,得出其Acc为71.08%,CBAcc为36.35%,Kappa系数为0.1982,Macro-F1为53.39%。其各个指标都相对偏低,说明无序多分类Logistic模型拟合效果不佳(李志强,朱媛媛,2020)。这可能是因为普通Logistic模型对非线性可分的数据集分类效果较差;在研究方法的选取上,打破了单一方法的局限,创新性地融合了多学科的研究途径。在理论运用方面,尝试从不同的理论体系中获取滋养,搭建综合性的理论分析平台。或者是一些变量间的综合作用可能会对生育意愿产生较大影响,而Logistic模型不能很好地探究这些综合作用;在这种情形下又或者是数据不平衡性导致了Logistic回归预测效果差,这些都是我们后续建模所要考虑的因素(林志远,许琳娜,2020)。表SEQ表\*ARABIC3BIC准则下多分类Logistic回归的混淆矩阵真实值123预测值15245121767018732114(四)决策树与随机森林为了能更好地探究出因变量与自变量之间的复杂关系,我们分别采用决策树和随机森林模型进行研究。决策树(DecisionTree)是一种基本的有监督式模型,能够用于分类与回归。其中分类决策树根据因素对样本进行划分,其分类过程呈现树杈状。决策树利用递归方法,依次选取较重要的因素,这在一定程度上象征着并根据该因素对数据加以细分,以满足分类的结果最好。在理论运用方面,尝试从不同的理论体系中汲取精华,构建综合性的理论分析框架。通过这种途径,既能发现以往研究未曾涉及的理论空白之处,又能为相关领域的理论发展注入新活力,拓展理论研究的边界范围,为后续研究提供更广阔的思考空间。决策树从根结点出发,利用各个因素训练模型,再按照训练结果将每个样本依次分派到子结点(杨晓华,马春晖,2020)。接着再以此子结点出发,将样本分派到下一个子结点。如此反复进行,这在一定程度上显露直到最后使每个样品能够到达末端叶结点的各个类中。决策树算法常用的有三种:ID3算法利用信息增益(Gain)来进行衡量;C4.5算法利用信息增益率衡量,即为ID3算法的修改;而CART算法则利用基尼系数(Gini)来衡量。本文主要使用ID3和CART算法进行模型拟合(刘志恒,叶思洁,2019)。ID3算法中,信息熵能够衡量数据的信息量,一个数据集信息越多,熵越大,也就代表该数据集各种类别都有,数据就越混乱。其公式为: (SEQ(\*ARABIC5)这在一定水平上揭露式(5)中k为数据集D的类别数,pi为第i个类别占比。利用某一属性A对D进行分割后,数据混乱度会下降,也即熵会下降。此处熵下降量便为信息增益,其计算公式即为 (SEQ(\*ARABIC6) 式(6)中|D|表示数据集D的数据量,v代表属性A将D分割的数量。ID3算法就是通过在每个非叶子结点处选择Gain最大的因素进行数据集的分割,持续进行直至结点下的样本属于同一类、树的最大深度(max_depth)已达到到等终止条件为止(孙睿哲,周梓萱,2024)。这不仅提升了对研究假设的信赖度,也证明了所运用研究方法的合理性。这种一致性为跨研究间的对照提供了基础,促进了更全面和系统化的理论框架形成。CART算法的分割原理与ID3算法类似,这在一定层面上证实了但其使用的是Gini系数度量数据的混乱度。基尼系数运算公式为: (SEQ(\*ARABIC7)利用某一属性A对D进行分割后得到的每个类别的基尼系数为: (SEQ(\*ARABIC8)这无疑地揭示了本质此时与ID3不同,CART算法是选择使得分割后数据基尼系数最小的属性来依次进行分割。以ID3和CART方法分别构建决策树,决策树参数利用网格搜索依次调整树的最大深度、叶子结点要求的最少样本数、最大特征数目、结点再划分所需最少样本数,如此能够看出搜索参数利用5折交叉验证,得分指标选取Macro-F1。在进行参数调优后,得到两个决策树各个平均指标如表(黄思源,张怡彤,2022)。可以发现,CART方法构造出的决策树预测效果与ID3构造的决策树相差不大。本文制定了详尽的研究计划,并对可能产生误差的各类因素进行了深入考量与分析,诸如环境变动、人为操作多样性以及数据精度等。两个决策树Acc约为68%,较低于Logistic回归的预测结果(高雅婷,林思彤,2024)。而其Kappa系数与Macro-F1相较于Logistic回归更好,说明决策树增加了对少数类预测的精度。表SEQ表\*ARABIC4不同算法下决策树评价指标AccCBAccMacro-F1KappaID367.56%54.63%56.77%0.3292CART67.84%55.22&57.63%0.3355在参数调优时,发现网格搜索将最大深度调至20以上,这增加了过拟合的风险。所以,在此类条件限制下可以推知其必然结果一颗决策树模型并不能够很准确地对本文数据集进行预测,于是本文想到建立多个决策树模型以加强对数据的预测效果,即引入随机森林模型。随机森林(RandomForest)是一种集成学习的方法,其相当于建立起一个森林,森林里全是决策树,每棵树通过从训练集中独立随机抽样得到的样本数据进行构建。通过对所有互不影响的决策树分别进行预测,从这些现象中显示将所有决策树预测结果合并,统计预测结果最多的类别作为随机森林最终预测结果。虽然本项研究小有斩获,但本文深知,任何钻研都脱不开局限性。未来研究大可在现有根基上持续深耕细作,尤其在样本选定、研究技法优化以及理论模子打磨等方面,有着极大的改进潜力与发展余地。随机森林由于集成多颗决策树,使得决策树可以更加复杂或包含更多信息,这样便改善了单一决策树过拟合的风险(张慧敏,钱文杰,2024)。决策树选取CART算法,在建立随机森林模型时,首先选取决策树个数(n_estimators)。在此类背景下本文在训练集上从1颗决策树开始,每隔10步建立随机森林模型,仍然通过5折交叉验证得到不同决策树个数下的平均得分,得分指标仍选取Macro-F1,再选取得分较高且稳定时所对应的决策树个数。如图9所示,可以发现,当决策树个数达到200个以上时,平均得分变得较为平稳。图SEQ图\*ARABIC9不同决策树个数的随机森林的Macro-F1值选取n_estimators=200后,再利用网格搜索的方法调节决策树的参数。根据在训练集上的最高得分设置随机森林的参数为max_depth=22,max_features=24,min_samples_split=2,min_samples_leaf=1(陶晓东,郑丽娟,2021)。这在某种程度上昭示了图10列举了评分前20的因素,其中评分最高的三个变量分别为一孩年龄(X18)、孩子抚养费用影响(X16)、健康状况(X4)。在后续的研究中会对已有的研究成果进一步从不同的角度进行优化,会深入分析数据以揭示更深层次的相关性和趋势,将探索不同方法的研究设计,以验证研究结论的普遍性和适用性,以丰富研究内容和提升模型的解释力。图SEQ图\*ARABIC10随机森林特征重要性评分排序图将训练好的随机森林模型运用于测试集上得到表5的混淆矩阵,可由混淆矩阵计算出其Acc为79.8%,CBAcc为55.24%,Kappa系数为0.4891,Macro-F1为66.22%。可以看到,这在一定层面上传达随机森林预测效果较Logistic回归与单一的决策树都有明显提升(严皓翔,郑君浩,2021)。这不仅表明本文的研究结论获得了现有理论的支持,还为相关理论带来了新的思考或补充,有助于理论体系的完善。表SEQ表\*ARABIC5多分类随机森林的混淆矩阵真实值123预测值111032221207096130639(五)一对一分解模型通常在解决多分类问题时,由于二分类的分析比起多分类更容易,并且理论研究也更成熟,因此目前许多学者采用“分解法”的思想,将多分类模型分解为多个二分类模型,这在某种程度上证明使得一些适用于二分类的模型(如支持向量机(SVM))运用于多分类中。分解法主要包括一对一分解(OneversusOne,OvO)和一对多分解(OneversusRest,OvR)。通过引入新的视角和方法论,本研究对既有理论进行了补充和改进,为未来的研究提供了更加坚实的基础和广泛的探索空间。其中OvO是将因变量的t个类别进行两两配对,一共构建t(t-1)/2个二分类模型,最终以所有二分类模型中预测最多的类别作为预测结果。OvR是依次以因变量的某个类别为正例,而将其他t-1个类别全作为负例,一共构建t个二分类模型,这在一定程度上提示最终以所有二分类模型中预测最多的类别作为预测结果(顾云飞,刘晓红,2021)。由于OvR模型每次将除了正例以外的其他类别作为负例,人为引入了不平衡,并且本次我们所研究的因变量为定序变量,且只有3个类别,相较于OvR不会增加运算,故OvO模型更适用于本文所研究的数据。这种以用户为中心的设计理念使其在市场竞争中更具优势。从上文的分析中可以看出,它支撑了前文的理论分析,尤其对核心概念的理解在理论上进行了细致探讨,并通过具体方法进一步验证了这些理论观点的实践可行性和适用性。分别运用OvO-Logistic、OvO-RandomForest和OvO-SVM来进行分类决策,仍然运用网格搜索法根据Macro-F1得分最高调整参数。其中OvO-Logistic的每个模型运用拟牛顿法来优化算法,即利用损失函数的黑塞矩阵(二阶导数矩阵)进行迭代优化,在这种状态里损失函数为加入L2正则项(即岭回归)的交叉熵损失函数,其表达式为(林泽宇,傅雪柔,2022): (SEQ(\*ARABIC9)式(9)中是0-1函数,表示当样本预测为时为1,反之为0。是每个样本被预测为的概率。β即为回归模型的系数矩阵。此时我们需调整参数为正则化系数λ以防止过拟合。SVM基本思想是求解一个超平面,以正确划分数据集并且使得其与超平面的间距最大。由于普通的SVM仅适用于二分类,所以需要运用分解模型建立多个SVM。本文使用高斯核函数RBF,调整正则化系数λ、核系数gamma。表SEQ表\*ARABIC6不同一对一分解模型的指标AccCBAccMacro-F1KappaOvO-Logistic65.43%36.09%35.53%0.0678OvO-RandomForest78.96%58.20%64.59%0.4653OvO-SVM79.89%54.39%65.76%0.4877在这般的背景下由表6所展示的各自模型指标,可知整体的预测精准度OvO-SVM要高于OvO-RandomForest与OvO-Logistic。OvO-SVM与未分解的随机森林预测效果相近(卢俊延,赵一铭,2019)。OvO-Logistic的各类指标均较差,也说明Logistic回归并不能较好地用于对不同类别生育意愿的预测。(六)数据不平衡问题的处理通过初步探索,可以发现,在本数据集中,由于数据不平衡率接近7,数据不平衡问题可能会导致模型预测时会偏向于大类,使得模型对小类的预测效果不佳(薛宇峰,马思敏,2021)。所以本文接下来准备在初步建模的基础上再进行数据不平衡问题的处理。关于处理数据不平衡问题,许多学者会从原始数据入手,通过重抽样技术来降低数据的不平衡率,改变数据分布特征,这便是数据级方法。数据级方法主要可以分为过采样与欠采样,其中过采样是对少数类数据进行增补,与之对应的欠采样是对多数类数据进行删减。整合不同学科的专业见解、研究方法与技术资源,科研人员能更有效地应对复杂的科学挑战,探索更为全面和系统的解决之道。从这些应用可以了解到由于简单随机的过采样方法容易造成过拟合,而简单随机的欠采样方法又抛弃了大量有用信息,故针对这些问题,研究学者们提出了一系列改进的方法(薛宇峰,马思敏,2021)。例如人工合成少数类样本的方法(SyntheticMinorityOver-SamplingTechnique,SMOTE)是一种过采样的方法,其是依次在某一个少数类样本与其附近的K个同类样本间随机线性插值来合成新样本;信息最大化的方法(EasyEnsemble)是一种欠采样的方法,它类似于集成学习思想,通过对多数类的样本进行n次随机的欠采样,得到的n个样本依次与所有少数类样本合并,得到n个平衡类别的数据集。这些行为透露出一些意图最后再通过平衡数据集训练n个分类器,预测结果最多的类别作为最终预测结果。考虑到本文的数据集是由定性变量组成,不好计算距离与进行线性插值,故本文采用EasyEnsemble来处理不平衡问题(孙智慧,周智航,2019)。利用无放回抽样共对意愿生育2孩的样本不放回抽取30次样本信息,基分类器分别采用多分类RandomForest和OvO-SVM。为了确保结论的有效性,本文进行了结论的再次审核,本阶段研究成果在理论上确认了研究结果与现有学术体系的兼容性。预测结果如表7所示,利用EasyEnsemble方法虽然使得整体预测精度降低,其Acc分别为53.20%和51.16%,Kappa系数分别为0.2851和0.2703,这些事件预示着一些未来的可能性但其很明显地提高了对少数类样本的预测。以RandomForest为例,对3孩及以上的预测其召回率从38.24%提高到了77.45%,对1孩及以下的预测从47.83%提高到76.52%。如果想要对这类少数人群进行预测,通过EasyEnsemble建立模型不失为一种有效的方法(成泽光、宋向昊、林俊昊,2023)。表SEQ表\*ARABIC7EasyEnsemble方法下的混淆矩阵RandomForest真实值123预测值117622472373191631720479OvO-SVM真实值123预测值117523542312961732421681处理数据不平衡问题,本文研究背景下我们充分估算了这种情况的影响还可以从算法与预测结果入手,即算法级方法、代价敏感方法等(余佳怡,赵英杰,2021)。在本文中我们选取代价敏感方法中的类别赋权方法。给类别赋权(classweight)主要是通过改变训练模型的损失函数或信息函数,指定不同类别的权重,从而放大少数类的重要性。以交叉熵损失函数为例,其表达式为(许俊天,成瑾瑜,2023): (SEQ(\*ARABIC10)式(10)中ω表SEQ表\*ARABIC8平衡类别权重后的随机森林的混淆矩阵真实值123预测值1124621210367358331243以多分类随机森林为例,当我们设置类别权重并调整参数后,由表8所示,发现相比于未加修改的随机森林其稍微加强了对3孩及以上和1孩及以下人群的预测,但其总体预测的效果也随之降低。在这般的框架内其Acc为77.85%,Kappa系数为0.4762。五、结论与建议 (一)研究结论本文研究利用CFPS2018年调查数据,主要分析研究了20~44岁已婚且已育有一孩的人群的生育意愿及其影响特征,并利用多分类算法对1孩及以下、2孩、3孩及以上的生育意愿人群进行建模预测研究。从这些记录中体现由此得出以下结论:第一,多分类随机森林模型、OvO-SVM对已婚育龄人群的生育意愿进行预测的效果较好。通过Acc、CBAcc、Kappa值、Macro-F1等指标对普通Logistic回归、决策树、随机森林、OvO-Logistic、OvO-RandomForest、OvO-SVM的预测结果进行对比分析,发现多分类随机森林、OvO-SVM的指标表现相近,两者Acc能达到80%,Kappa系数能达到0.5(陈昊忠,赵洁妮,2021)。而由于变量之间的复杂关系,无序多分类Logistic模型、OvO-Logistic模型、决策树的预测效果均较差。虽然本项研究小有斩获,但本文深知,任何钻研都脱不开局限性。未来研究大可在现有根基上持续深耕细作,尤其在样本选定、研究技法优化以及理论模子打磨等方面,有着极大的改进潜力与发展余地。第二,在二孩政策的背景下,全国已婚育龄人群的大多数意愿生育2孩,其在人群中的占比约为70%,而意愿生育1孩及以下与3孩及以上的意愿人群占比分别约为20%与10%。当对1孩及以下和3孩及以上的意愿人群预测增加时,必然会使得2孩意愿人群预测偏低(张璐瑶,付芳倩,2020)。这在一定程度上映射所以当我们想偏向于对低意愿生育人群与高意愿生育人群进行预测分析时,可以运用不平衡数据处理方法,例如EasyEnsemble方法进行重采样,虽然总体上会降低对2孩的预测,但其可以将预测1孩及以下或3孩及以上的召回率从40%左右提升至75%以上。第三,就生育意愿的影响因素而言,本文选取的大多数因素对生育意愿的影响都较大。综合考虑了Logistic、决策树、随机森林、支持向量机的结果,其中最具有代表性的几个因素包括(钱一凡,孟欣怡,2022):在此类条件基础上可以推知其变化一孩年龄、孩子抚养费影响、认为死后有人念想很重要、认为传宗接代很重要、家庭规模、个人最高学历、配偶最高学历、工作强度、工作满意度、家庭年收入、地区经济、健康状况等。其中一孩年龄越大、认为死后有人念想很重要、认为传宗接代很重要、家庭规模越大、学历越低的倾向于多生。值得注意的是,按照前番之解析一些变量对生育意愿的影响可能呈现非线性关系,例如工作强度较大或较小的人群均倾向于多生,而高收入水平和低收入水平的人群均倾向于少生(雷振宇,熊静宜,2024)。一些变量可能单独看对生育意愿的影响较小,而与其他变量组合之后影响才变得明显,例如工作满意度、孩子抚养费影响等。(二)研究的局限性1.因素的选取不够完善本文选取了绝大多数具有代表性的因素来对理想子女数进行预测,但可以发现,即使再对模型参数进行调整,对人群预测的Acc、Kappa系数等指标未能有效提高。这些都是数据本身的原因。如果还能够增加其它较重要的影响因素,模型的预测效果有望得到进一步提高。2.未考虑到时间因素本文利用的是CFPS2018的截面数据,没有考虑到时间因素的影响。对于家庭年收入、工作强度等变量,都是计算的过去12个月的数据,因变量理想子女数也是问卷调查一时的想法。立足于以上分析结果要知道,由于社会不断的发展,个人与家庭状况、生活条件等都会相应变化,人们的内心想法也会随之改变。如果对人群的理想子女数进行追踪调查,能够获得更多有用信息。3.研究数据尚待更新本文由于考虑了预测3孩及以上的人群,而2018年的国内生育政策仍然是“全面二孩”政策,即使生育意愿的分布相近,但也可能不能够很好地反应如今“全面三孩”政策下的生育意愿分布与因素。又由于目前新颁布的三孩政策实施时间较短,最新的二手数据现在也难以直接获得。所以若想直接预测是否生育3孩,还需要借助新版的数据库(赖泽凯,丁雨馨,2023)。(三)政策建议1.提高生育补贴,降低育儿成本经济收入、孩子抚养费是影响生育意愿的重要因素。大部分低收入家庭考虑到生育成本会偏向于少生。于此情境下面对此类状况,政府应当加大财政投入。一方面,调整个税抵扣,扣除纳税人生育多孩的部分养育费用,以减轻育儿成本。另一方面,加强生育补贴,对生育多孩的家庭给予现金补贴,以促进二孩、三孩的生育行为。2.加强儿童照料,减轻育儿负担一孩年龄较小,家庭规模较小,工作强度较大,这些都加大父母照料一孩甚至多孩的压力(梅小何,黎静,2023)。一方面,可以发展新型的托幼服务,加大托儿所、幼儿园等教育机构的配套建设,随着形势发展分担父母一部分照料工作。并减轻入园、入学难度与费用,以保障幼儿能够得到优质的照料与教育。另一方面,完善育儿假期制度,并准许育龄群体特别是女性群体在孩子年龄较小时可以弹性工作,保证父母有更多时间与精力照料自己的孩童。这不仅增强了本文对相关理论机制的理解,同时也为后续研究提供了坚实的基础。此发现还进一步支持了该领域内其他类似研究所得到的结论,促进了理论框架的完善与发展。3.重视地区状况,政策因地制宜在改变总体政策的同时,还要考虑不同地区的情况。由此可以明显观察到经济区在东北地区、政策生育率为一类地区的生育意愿相比于其他地区较低。东三省地区生育意愿较低,主要由于经济发展和人才流出(龚志强,邱艺瑾,2020)。此时政府应当推动当地经济转型,鼓励人才在东北地区发展,制定相应配套政策,例如积极落户政策、生活与住房补贴政策等。对于一类地区,政府应当帮助广大人群及时适应政策变化,通过各种渠道宣传最新的生育政策,破除当地人群根深蒂固的计划生育观念。4.转变生育观念,加大宣传力度个体心理因素仍有不可忽视的作用。许多有着传宗接代思想、重视家庭美满和睦以及儿女有出息的个体倾向于生二孩、三孩。所以,政府应当加大宣传,让育龄人群认识到多生的好处,以转变部分低生育意愿群体的观念,并打消其生育多孩的后顾之忧。参考文献[1]穆光宗.我国人口新形势及应对建议[J].中国党政干部论坛,2018(06):69-72.DOI:10.14117/11-3331/d.2018.06.020.[2]雷昊然,方紫悦.济南:超八成居民无三孩生育意愿[J].四川省情,2022(08):58-59.[3]田悦澄,白乐天.国家统计局:三孩政策效果将逐步显现[N].中国经营报,2023-01-24(A02).[4]陶晓东,郑丽娟.论生育和生育转变:数量、时间和性别[J].人口研究,2021(06):1-7.[5]严皓翔,郑君浩.中国人口生育意愿变迁:1980—2011[J].中国社会科学,2021(04):78-97+206.[6]顾云飞,刘晓红,中国社会科学院人口与劳动经济研究所.中国家庭幸福感热点问题调查报告2014-2015年[M].北京:中国社会科学出版社,2016:111[7]林泽宇,傅雪柔.二孩生育意愿的影响因素及提升对策研究[D].大连理工大学,2020.DOI:10.26991/ki.gdllu.2020.000792.[8]AassveA.Demographicchange:howgovernmentsupportinfluencesbirthrates[J].EuropeanView,2008,7(2):209-216.[9]卢俊延,赵一铭.全面二孩背景下人口生育意愿影响因素研究综述[J].重庆社会科学,2020(01):94-105.DOI:10.19631/ki.css.2020.001.009.[10]AdseraAlicia.VanishingChil

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论