版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
号RecommendationBasedonSemi-一种多方半监督学习的金融产品潜在用户本发明涉及一种多方半监督学习的金融产对金融产品提供方只拥有正样本的己方数据而2S1:建立包含购买金融产品用户信息和其他多方用步骤S1所述的金融产品潜在用户推荐多方数据集包含拥有已购买金融产品用户信息的AC3在步骤S11中,所述冗余数据处理具体包括:通过数据记录中的某些字段判断数据是否重所述缺失值处理具体包括:对数据中的每个特征进行缺失率统所述异常值处理具体包括:根据实际情况,确认异常值的阈值;对数据所述数据标准化处理具体包括:将已有特征按照数据类型分为连本组成负样本数据集Nm;由P和Nm组成训练集U中未被抽取样本组成预测集构建以梯度提升树(GradientBoostingDecisionTree,GBDT)作为基学习器的纵向联邦模组成第m轮负样本数据集N"={(xn",n")},其中分别是第m轮的第i个负样本中B方和C方的特征向量,ynf"ef-1}表示第m轮第i个负样本m(rtr"8,xtr;""),xtr,"8,xtr"f分别表示第m轮的第i个样本中B方和C方的特征向量,被抽取样本组成对应的第m轮预测集其中xte"表示第m轮的第j个样本的特其中T表示第m轮的决策树的总数,f"(xtr")表示第m轮第t棵树的预测结4S221:从B方开始,首先对B方的每个样本xtr"8计算第m轮模型损失函数的一阶梯度和二阶梯度其中i=1,2,...,2和Ih"1,B方将IS"I和In"1发送给C方;S224:C方根据从B方发送的特征编号Kopt和阈值编号行排序,然后将排序后的样本进行分桶划分到q个类别中,得到各个类别的相应特征阈值其中k表示特征编号,表示第m轮编号为k的特征第q个类别的阈值;5S2231:B方对当前节点空间的所有样本的一阶梯度和二阶梯度进行聚合,执行9"=zie1g",h"=zierh",其中I表示当前节点的所有样本;S2232:B方对从C方得到的第m轮和进行解密,得到第m轮解密值和依次对C方的所有特征的所有类别进行如下计算得到9"、h"、g?"和h":其中IL表示分割后左子节点的样本空间,IR表示分割后右子节点的样本空间,表示第m轮中左子节点样本空间的所有样本的损失函数一阶梯度之和,h"=zienh"表示第m轮中左子节点样本空间的所有样本的损失函数二阶梯度之和,表示第m轮中右子节点样本空间的所有样本的损失函数一阶梯度之和,S2234:对于样本的每个特征的所有阈值均能得到一个Bue值,选出其中最大的值,确定该特征阈值为第m轮的全局最佳分割,全局最佳分割用[参与方,特征编号6所述步骤S3中,由U中每个样本xui的M轮预测分数总和及其在M轮预测集中出现次数总和,计算样本xui预测为正样本的概率;按照正样本的概率从大到小对U中所有样本进行排序,其中为指示函数,表示如果U中的样本xu将它们加入到正样本数据集P中,同时将它们从U中删除,其中θ的值是根据先验知识设定78g={(xf,YF)},表示B方第i个样本特征向量,向量维度齐的样本数据,丢弃未对齐样本数据,得到n个样本;对齐后的B方数据集为C方数据集为Dfugn=(xf,YF)},表示对应的标签,yfe{0}表示样本作为正样本,组成正样本数据集P={(xpi,ypi)},其中xp:=(xp",xp",xp),这|P|个未标记样本组成负样本数据集Nm;由P和Nm组成训练集U中未被抽取样本组成预测集构建以梯度提升树(GradientBoos9器的纵向联邦模型,在上进行训练;将输入到训练好的模型中进行预测,得到分别是第m轮的第i个负样本中B方和C方的特征向量,yn"e{-1}表示第m轮m数据集P和第m轮的负样本数据集Nm组成对应的第m轮训练集x⃞in={(xtrf",ytr;")},其中xtr"=(xtr"",xtr;""),xtr"8,xtr"分别表示第m轮的第i个样本中B方和C方的特征向未被抽取样本组成对应的第m轮预测集其中xte"表示第m轮的第j个样本的m成对XHan进行训练,对输入数据xan中每个样本来预测其第m轮输出,"=其中T表示第m轮的决策树的总数,"(xtrf")表示第m轮第t棵树的预测结的梯度直方图找到当前节点的全局最佳分割从而构造出最优决策树;测试集x中每个样本的ID相同的到IS"I和B方将I9"I和发送给C方;[0037]S2231:B方对当前节点空间的所有样本的一阶梯度和二阶梯度进行聚合,执行g"=zierg",h=zierhf",其中I表示当前节点的所有样本;依次对C方的所有特征的所有类别进行如下计算得到gi"、h"、g"和hy:[0040]g"=g"-gf",h=h-hf"[0042]gi"=zieu,gi"表示第m轮中左子节点样本空间的所有样本的损失函数一阶梯度之[0043]表示第m轮中左子节点样本空间的所有样本的损失函数二[0044]表示第m轮中右子节点样本空间的所有样本的损失函数一阶梯度签的权值,从而得到与样本xte"对应的U中样本xui的第m轮预测分数oobf":[0058]S31:由U中每个样本的预测分数总和及其在M轮预测集中出现次数总[0079]S11:对灵活就业人员缴存推荐多方数据集进行数据预处理操作包括冗余数据处理、缺失值处理、异常值处理、数据标准化处理以及标签数据处理,得到A方数据集处理具体操作如下:齐的样本数据,丢弃未对齐样本数据,得到n个样本。对齐后的B方数据集为Dion=到xr中每个样本的分数,作为该样本的预测分数。分别是第m轮的第i个负样本中B方和C方的特征向量据集P和第m轮的负样本数据集Nm组成对应的第m轮训练集XHain={(xtr",ytr:")},其中xtr"=(rtr"的,xtr"s),分别表示第m轮的第i个样本中B方和C方的特征中未被抽取样本组成对应的第m轮预测集其中xte"表示第m轮的第j个样本m集成对XHain进行训练,对输入数据xain中每个样本xtr"来预测其第m轮输出,"=其中T表示第m轮的决策树的总数,可选的,将决策树总数T的值设为40,f"(xtr")表示第m轮第t棵树的预测结果,xtr"表示第m轮第i个样本特征向量,i=1,而构造出最优决策树。值其中k表示特征编号,表示第m轮编号为k的特征第q个类别[0102]S2231:B方对当前节点空间的所有样本的一阶梯度和二阶梯度进行聚合,执行g"=zie1g",h"=zierh",其中I表示当前节点的所有样本。依次对C方的所有特征的所有类别进行如下计算得到lg"、h?"、g"和[0107]g"=zie,gi"表示第m轮中左子节点样本空间的所有样本的损失函数一阶梯度[0108]"=zien"表示第m轮中左子节点样本空间的所有样本的损失函数[0109]g"=zien9"表示第m轮中右子节点样本空间的所有样本的损失函数一阶梯度[0126]
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 高中生物 重点强化练36 基因分离定律“特殊比例”的相关题型
- 高中化学 加练 第三章 微题型16 滴定实验操作分析
- 村级露营应急预案方案(3篇)
- 横梁炉排施工方案(3篇)
- 江苏混凝土修补施工方案(3篇)
- 洞口护坡道施工方案(3篇)
- 清算维稳应急预案(3篇)
- 爆破专项施工应急预案(3篇)
- 白油泄露应急预案(3篇)
- 种业营销方案范文(3篇)
- 重庆石柱县2026年专职社区工作者与后备人员招聘考试试卷-含答案解析
- 城市更新项目策划与实施方案
- 2026年湖南省中考数学真题
- 贝恩 -2026年中国购物者报告系列一 增长承压中国快消品市场显现新格局 消费者追求“质价比”新渠道争夺战打响 202606
- 2026新版生产安全事故应急预案
- 注册安全工程师延续履职证明
- 2026年高考(江西卷)历史试题及答案
- 护理技术操作规范与标准
- 售后三方协议合同范本
- 毒品培训知识总结课件
- 水利工程外观质量检查(测)记录表、评定表、赋分表、赋分统计
评论
0/150
提交评论