版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
所(普通合伙)35264专利代理师吴炳聪GO6N3/0455(2023.01)本发明公开了一种基于词向量的大语言模成微调词向量矩阵,并将微调词向量矩阵输入到大语言模型中,以得到相应的微调输出2获取待处理文本数据,并对所述待处理文本数据进行预处理,以得到所述待处理文本基于词向量模型对所述待处理文本数据进行词向量表示,以基于所述敏感词集合对所述待处理文本数据进行微调,以生根据所述词向量扰动范围对所述待处理文本数据进行扰动,以得到最终大语言模型输如果否,则将当前微调向量所对应的微调操作作为当前微调向量的合规调整值,并判如果合规调整值个数大于预设个数阈值,则结束对于当前微调向量的微调操作,返回计算所述词向量扰动范围中每一词向量与所述基准词向量矩阵中对应基准词向量之构建条件随机场模型,以通过所述条件随机场模型识其中,所述条件随机场模型通过最大化目标函数以确定待3词向量扰动范围对所述待处理文本数据进行扰动,包括:根据所述词向量扰动范围,选择高斯函数作为扰动函数对所述待处理文本数据进行扰其中,所述高斯函数通过以下公式表述:量维度。6.如权利要求1所述的基于词向量的大语言模型输入扰动方法,其特征在于,根据所述词向量扰动范围对所述待处理文本数据进行扰动,包括:对于所述词向量扰动范围内的每一个词向量,计算词向量对应的敏感程度值和文本重要性值;根据所述敏感程度值和所述文本重要性值计算对应的扰动力度值,以确定每一词向量对应的扰动力度。7.如权利要求1所述的基于词向量的大语言模型输入扰动方法,其特征在于,还包括:将所述待处理文本数据输入到大语言模型中,以便所述大语言模型输出所述待处理文本数据对应的原始输出,并获取相应的第一模型性能;将所述最终大语言模型输入输入到大语言模型中,以便所述大语言模型输出所述最终大语言模型输入对应的扰动输出,并获取相应的第二模型性能;比对所述原始输出和所述扰动输出,以计算扰动操作对应的有效保护值;比对所述第一模型性能和所述第二模型性能,以计算扰动操作对应的模型性能影响根据所述有效保护值和所述模型性能影响值对扰动操作进行评估。8.一种计算机可读存储介质,其特征在于,其上存储有基于词向量的大语言模型输入扰动程序,该基于词向量的大语言模型输入扰动程序被处理器执行时实现如权利要求1-7中任一项所述的基于词向量的大语言模型输入扰动方法。9.一种基于词向量的大语言模型输入扰动系统,其特征在于,包括:预处理模块,所述预处理模块用于获取待处理文本数据,并对所述待处理文本数据进行预处理,以得到所述待处理文本数据对应的敏感词集合;词向量表示模块,所述词向量表示模块用于基于词向量模型对所述待处理文本数据进行词向量表示,以得到所述待处理文本数据对应的基准词向量矩阵,并将所述基准词向量矩阵输入到大语言模型中,以得到相应的基准输出;微调模块,所述微调模块用于基于所述敏感词集合对所述待处理文本数据进行微调,以生成微调词向量矩阵,并将所述微调词向量矩阵输入到大语言模型中,以得到相应的微调输出;比对模块,所述比对模块用于比对所述基准输出和所述微调输出,以确定词向量扰动4扰动模块,所述扰动模块用于根据所述词向量扰动范围对所述待处理文本数据进行扰10.如权利要求9所述的基于词向量的大语言模型输入扰动系统,其特征在于,比对所述基准输出和所述微调输出,以确定词向量扰动计算所述基准输出和所述微调输出之间的差异值;判断所述差异值是否大于预设差值阈值;如果是,则返回基于敏感词集合对待处理文本数据进行微调的步骤;如果否,则将当前微调向量所对应的微调操作作为当前微调向量的合规调整值,并判断当前微调向量所对应的合规调整值个数是否大于预设个数阈值;如果合规调整值个数大于预设个数阈值,则结束对于当前微调向量的微调操作,返回基于敏感词集合重新选取当前微调向量。5基于词向量的大语言模型输入扰动方法、介质及系统技术领域[0001]本申请涉及大语言模型应用技术领域,特别涉及一种基于词向量的大语言模型输背景技术[0002]随着大数据与人工智能技术的迅猛发展,数据隐私保护的重要性日益凸显。数据加密、差分隐私等方法作为保障数据隐私的关键技术,在各个领域得到了广泛应用。[0003]相关技术中,在对大语言模型输入进行隐私保护的过程中,为了满足严格的隐私保护要求,往往需要添加大量噪声;而大语言模型通常需要对输入数据进行解析与理解来挖掘数据中的特征和模式,以进行学习与推理。大量噪声的添加使得这些输入难以直接被大语言模型处理,极大地影响了大语言模型输出结果的准确性,同时降低了大语言模型的工作效率。发明内容[0004]本发明旨在至少在一定程度上解决相关技术中的技术问题之一。为此,本发明的一个目的在于提出一种基于词向量的大语言模型输入扰动方法,能够对用户的隐私进行有效保护,同时,降低隐私保护对于大语言模型输出结果的影响。[0005]第一方面,本发明实施例提出了一种基于词向量的大语言模型输入扰动方法,包括以下步骤:获取待处理文本数据,并对所述待处理文本数据进行预处理,以得到所述待处理文本数据对应的敏感词集合;基于词向量模型对所述待处理文本数据进行词向量表示,以得到所述待处理文本数据对应的基准词向量矩阵,并将所述基准词向量矩阵输入到大语言模型中,以得到相应的基准输出;基于所述敏感词集合对所述待处理文本数据进行微调,以生成微调词向量矩阵,并将所述微调词向量矩阵输入到大语言模型中,以得到相应的微调输出;比对所述基准输出和所述微调输出,以确定词向量扰动范围;根据所述词向量扰动范围对所述待处理文本数据进行扰动,以得到最终大语言模型输入。[0006]根据本发明实施例的基于词向量的大语言模型输入扰动方法,首先,获取待处理文本数据,并对所述待处理文本数据进行预处理,以得到所述待处理文本数据对应的敏感词集合;接着,基于词向量模型对所述待处理文本数据进行词向量表示,以得到所述待处理文本数据对应的基准词向量矩阵,并将所述基准词向量矩阵输入到大语言模型中,以得到相应的基准输出;然后,基于所述敏感词集合对所述待处理文本数据进行微调,以生成微调词向量矩阵,并将所述微调词向量矩阵输入到大语言模型中,以得到相应的微调输出;接着,比对所述基准输出和所述微调输出,以确定词向量扰动范围;然后,根据所述词向量扰动范围对所述待处理文本数据进行扰动,以得到最终大语言模型输入,从而实现对用户的隐私进行有效保护,同时,降低隐私保护对于大语言模型输出结果的影响。[0007]在一些实施例中,比对所述基准输出和所述微调输出,以确定词向量扰动范围,包括:计算所述基准输出和所述微调输出之间的差异值;判断所述差异值是否大于预设差值6其中,所述条件随机场模型通过最大化目标函数以确[0010]在一些实施例中,根据所述词向量扰动范围对所述待处理文本数据进行扰动,包便所述大语言模型输出所述待处理文本数据对应的原始输出,并获取相应的第一模型性7对扰动操作进行评估。[0013]第二方面,本发明实施例提出了一种计算机可读存储介质,其上存储有基于词向量的大语言模型输入扰动程序,该基于词向量的大语言模型输入扰动程序被处理器执行时实现如上所述的基于词向量的大语言模型输入扰动方法。[0014]第三方面,本发明实施例提出了一种基于词向量的大语言模型输入扰动系统,包括:预处理模块,所述预处理模块用于获取待处理文本数据,并对所述待处理文本数据进行预处理,以得到所述待处理文本数据对应的敏感词集合;词向量表示模块,所述词向量表示模块用于基于词向量模型对所述待处理文本数据进行词向量表示,以得到所述待处理文本数据对应的基准词向量矩阵,并将所述基准词向量矩阵输入到大语言模型中,以得到相应的基准输出;微调模块,所述微调模块用于基于所述敏感词集合对所述待处理文本数据进行微调,以生成微调词向量矩阵,并将所述微调词向量矩阵输入到大语言模型中,以得到相应的微调输出;比对模块,所述比对模块用于比对所述基准输出和所述微调输出,以确定词向量扰动范围;扰动模块,所述扰动模块用于根据所述词向量扰动范围对所述待处理文本数据进行扰动,以得到最终大语言模型输入。[0015]在一些实施例中,比对所述基准词向量矩阵和所述微调词向量矩阵,以确定词向量扰动范围,包括:计算所述基准词向量矩阵和所述微调词向量矩阵之间的差异值;判断所述差异值是否大于预设差值阈值;如果是,则返回基于敏感词集合对待处理文本数据进行微调的步骤;如果否,则将当前微调向量所对应的微调操作作为当前微调向量的合规调整值,并判断当前微调向量所对应的合规调整值个数是否大于预设个数阈值;如果合规调整值个数大于预设个数阈值,则结束对于当前微调向量的微调操作,返回基于敏感词集合重新选取当前微调向量。[0016]本发明附加的方面和优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实践了解到。附图说明[0017]图1是根据本发明实施例的基于词向量的大语言模型输入扰动方法的流程示意图2是根据本发明实施例的基于词向量的大语言模型输入扰动系统的方框示意具体实施方式[0018]下面详细描述本发明的实施例,所述实施例的示例在附图中示出,其中自始至终相同或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附图描述的实施例是示例性的,旨在用于解释本发明,而不能理解为对本发明的限制。[0019]下面参考附图描述本发明实施例的基于词向量的大语言模型输入扰动方法。[0020]请参阅图1,图1为根据本发明实施例的基于词向量的大语言模型输入扰动方法的流程示意图,如图1所示,该基于词向量的大语言模型输入扰动方法包括以下步骤:S101,获取待处理文本数据,并对待处理文本数据进行预处理,以得到待处理文本数据对应的敏感词集合。8构建条件随机场模型,以通过条件随机场模型识列w1,W₂,,Wn以及模型参数θ的条件下,第i个分词为标签y的概率;y,表示第i个分词的[0023]S102,基于词向量模型对待处理文本数据进行词向量表示,以得到待处理文本数得到每个中心词W对应的词向量。9否大于预设个数阈值;如果合规调整值个数大于预设个数阈值,则结束a其中,a.b表示向量a其中,a.b表示向量a和向量的点积,分别表示向量a和向量b的范[0031]S105,根据词向量扰动范围对待处理文本数据进行扰动,以得到最终大语言模型数通过以下公式表述:表示向量维度。保护强度参数为E,通过实验建立E与σ的关系,如σ=g(ε),其中8是通过实验拟合得算出综合得分,例如:扰动力度值=敏感程度权重×敏感程度值+文本重要性权重×量,代表着扰动的中心围绕原始词向量;σ²是高斯分布的方差,它决定了扰动的幅度大高斯分布的方差σ²,对文本中不同位置的敏感词向量v进行不同程度的扰动,得到理[0044]最后,将准备好的输入张量X输入大语言模型M,模型通过一系列的神经网络息的关注重点与特征提取方向。dk是键矩阵K的维度,用于对QK的计算结果进行缩的输出,该输出融合了不同位置的特征信息,用以帮助模型更好地捕捉序列中的长距离依效保护值和模型性能影响值对扰动操作进行评估。[0046]也就是说,进一步对扰动后数据对于模型性能的影响以及是否对隐私进行有效保护进行分析,以根据分析结果对扰动过程进行调整。[0047]具体地,首先,将待处理文本数据T和扰动后的待处理文本数据T’输入到一个隐私检测模型P中。隐私检测模型通过计算敏感信息泄露指标I来评估隐私风险,通过计算原始文本和扰动后文本中敏感信息的熵差来衡量:其中,H是信息熵,用于衡量文本信息的不确定性或混乱程度。对于文本T,其信息熵的计算公式为H(T)=-∑eP(w)logP(w),这里的P(w)代表单词W在文本T中出现的概率,通过对文本T中每个单词w的P(w)logP(w)求和并取负,得到文本T的信息熵,以此反映文本T的信息混乱程度,进而通过与H(T)作差得出敏感信息泄露指标I。[0048]或者,可以通过人工评估:即言,邀请专业人员对扰动后的文本进行审查,判断敏感信息是否得到有效保护,是否存在潜在的隐私泄露风险。首先,进行指标选择:根据大语言模型的应用场景,选择合适的性能指标。在文本生成任务中,可采用困惑度(PP)指标来评估生成文本的质量,困惑度定义为:其中,n代表生成文本中的单词总数,P(w)是生成第i个单词的概率。困惑度越低,表明模型生成文本质量相对越好。而在文本分类任务中,会选用准确率(Accuracy)、召回率(Recall)、F1值等指标评估性能。[0050]作为本发明的一个具体实施例,该基于词向量的大语言模型输入扰动方法包括以S201,获取待处理文本数据,并对待处理文本数据进行预处理,以得到待处理文本数据对应的敏感词集合。[0051]S202,基于词向量模型对待处理文本数据进行词向量表示,以得到待处理文本数据对应的基准词向量矩阵,并将基准词向量矩阵输入到大语言模型中,以得到相应的基准输出。[0052]S203,基于敏感词集合随机选取一个未完成微调的词向量作为当前微调向量。[0053]S204,对当前微调向量进行随机微调,以生成微调词向量矩阵。[0054]S205,将微调词向量矩阵输入到大语言模型中,以得到相应的微调输出。[0055]S206,计算基准输出与微调输出之间的差异值。[0056]S207,判断差异值是否大于预设差值阈值;如果是,则执行步骤S204;如果否,则执[0057]S208,将当前微调向量所对应的微调操作作为当前微调向量的合规调整值。[0058]S209,判断当前微调向量所对应的合规调整值个数是否大于预设个数阈值;如果[0059]S210,判断敏感词集合中的词向量是否均已微调;如果是,则执行步骤S211;如果[0060]S211,输出预选词向量扰动范围。[0061]S212,随机选取预选词向量扰动范围中的任意词向量作为当前匹配向量。[0062]S213,计算当前匹配向量与基准词向量矩阵中该词向量对应的基准词向量之间的余弦相似度。[0063]S214;判断余弦相似度是否大于预设相似度阈值;如果是,则将当前匹配向量作为[0064]S215,判断预选词向量扰动范围中的词向量是否均已遍历;如果是,则执行步骤[0065]S216,输出最终词向量扰动范围。[0066]S217,对于最终词向量扰动范围中的每一个词向量,计算词向量对应的敏感程度值和文本重要性值。[0067]S218,根据敏感程度值和文本重要性值计算对应的扰动力度值,以确定每一词向量对应的扰动力度。[0068]S219,基于确定的扰动力度对基准词向量进行扰动,以得到最终大语言模型输入。[0069]综上所述,根据本发明实施例的基于词向量的大语言模型输入扰动方法,首先,获取待处理文本数据,并对所述待处理文本数据进行预处理,以得到所述待处理文本数据对应的敏感词集合;接着,基于词向量模型对所述待处理文本数据进行词向量表示,以得到所述待处理文本数据对应的基准词向量矩阵,并将所述基准词向量矩阵输入到大语言模型中,以得到相应的基准输出;然后,基于所述敏感词集合对所述待处理文本数据进行微调,以生成微调词向量矩阵,并将所述微调词向量矩阵输入到大语言模型中,以得到相应的微词向量扰动范围对所述待处理文本数据进行扰动,以得到最终大语言模型输入,从而实现对用户的隐私进行有效保护,同时,降低隐私保护对于大语言模型输出结果的影响。[0070]第二方面,本发明实施例提出了一种计算机可读存储介质,其上存储有基于词向量的大语言模型输入扰动程序,该基于词向量的大语言模型输入扰动程序被处理器执行时实现如上所述的基于词向量的大语言模型输入扰动方法。[0071]第三方面,本发明实施例提出了一种基于词向量的大语言模型输入扰动系统,如图2所示,该基于词向量的大语言模型输入扰动系统包括预处理模块10、词向量表示模块[0072]其中,预处理模块10用于获取待处理文本数据,并对所述待处理文本数据进行预处理,以得到所述待处理文本数据对应的敏感词集合;词向量表示模块20用于基于词向量模型对所述待处理文本数据进行词向量表示,以得到所述待处理文本数据对应的基准词向量矩阵,并将所述基准词向量矩阵输入到大语微调模块30用于基于所述敏感词集合对所述待处理文本数据进行微调,以生成微调词向量矩阵,并将所述微调词向量矩阵输入到大语言模型中,以得到相应的微调输出;比对模块40用于比对所述基准输出和所述微调输出,以确定词向量扰动范围;扰动模块50用于根据所述词向量扰动范围对所述待处理文本数据进行扰动,以得到最终大语言模型输入。[0073]在一些实施例中,比对基准输出和微调输出,以确定词向量扰动范围,包括:计算基准输出和微调输出之间的差异值;判断差异值是否大于预设差值阈值;如果是,则返回基于敏感词集合对待处理文本数据进行微调的步骤;如果否,则将当前微调向量所对应的微调操作作为当前微调向量的合规调整值,并判断当前微调向量所对应的合规调整值个数是否大于预设个数阈值;如果合规调整值个数大于预设个数阈值,则结束对于当前微调向量的微调操作,返回基于敏感词集合重新选取当前微调向量。[0074]需要说明的是,上述关于基于词向量的大语言模型输入扰动方法的描述同样适用于该基于词向量的大语言模型输入扰动系统,在此不做赘述。[0075]需要说明的是,在流程图中表示或在此以其他方式描述的逻辑和/或步骤,例如,可以被认为是用于实现逻辑功能的可执行指令的定序列表,可以具体实现在任何计算机可读介质中,以供指令执行系统、装置或设备(如基于计算机的系统、包括处理器的系统或其他可以从指令执行系统、装置或设备取指令并执行指令的系统)使用,或结合这些指令执行通信、传播或传输程序以供指令执行系统、装置或设备或结合这些指令执行系统、装置或设备而使用的装置。计算机可读介质的更具体的示例(非穷尽性列表)包括以下:具有一个或多个布线的电连接部(电子装置),便携式计算机盘盒(磁装置),随机存取存储器(RAM),只读存储器(ROM),可擦除可编辑只读存储器(EPROM或闪速存储器),光纤装置,以及便携式光盘只读存储器(CDROM)。另外,计算机可读介质甚至可以是可在其上打印所述程序的纸或其他合适的介质,因为可以例如通过对纸或其他介质进行光学扫描,接着进行编辑、解译或必要时以其他合适方式进行处理来以电子方式获得所述程序,然后将其存储在计算机存储器[0076]应当理解,本发明的各部分可以用硬件、软件、固件或它们的组合来实现。在上述实施方式中,多个步骤或方法可以用存储在存储器中且由合适的指令执行系统执行的软件或固件来实现。例如,如果用硬件来实现,和在另一实施方式中一样,可用本领域公知的下列技术中的任一项或他们的组合来实现:具有用于对数据信号实现逻辑功能的逻辑门电路的离散逻辑电路,具有合适的组合逻辑门电路的专用集成电路,可编程门阵列(PGA),现场可编程门阵列(
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 铁合金高炉冶炼工岗前操作管理考核试卷含答案
- 挂面制作工岗前操作安全考核试卷含答案
- 电线电缆金属导体挤制工岗前实操综合知识考核试卷含答案
- 织袜工安全行为考核试卷含答案
- 油母页岩供料工技术改进水平考核试卷含答案
- 原料药精制干燥工岗前事故预防考核试卷含答案
- 地毯整经工变更管理强化考核试卷含答案
- 井下作业工具工岗位技能掌握考核试卷含答案
- 宣纸书画纸制作工操作水平强化考核试卷含答案
- 无人机测绘操控员环保及安全知识考核试卷含答案
- 医院运营管理部职责与考核标准
- 心包穿刺术实施方案及流程
- 2026年中国交流传动控制设备市场调查研究报告
- 2026年秋季新教材统编版九年级上册道德与法治全册知识点背诵提纲精简版
- 电玩城安全工作方案
- 2026年高级机械工程师笔试题
- 2026年上海市助理政工师职称考试(思想政治工作)试题解析及核心考点
- 2026-2030中国SOD技术行业发展前景及发展策略与投资风险研究报告
- 门店消防应急疏散预案
- 华东五校深度解析课件
- 硬质支气管镜临床应用
评论
0/150
提交评论