版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大模型生成文本检测大模型技术深度解析-配套PPT主要内容一、AIGT检测的背景和定义二、AIGT检测方法三、影响可检测性的因素四、挑战和未来方向一、AIGT检测的背景与定义什么是AIGT?AIGT(ArtificialIntelligenceGeneratedText)指人工智能生成文本,是利用人工智能技术自动生成文本内容的技术,近年来在内容创作领域发展迅速,尤其在新闻报道、文学创作、广告营销等多个领域展现出强大的创造力和效率。AIGT主要基于深度学习、自然语言处理(NLP)等人工智能技术。通过训练大规模的文本数据,模型能够学习到语言的语法、语义和上下文关系,从而生成符合语法规则、语义清晰且上下文连贯的文本内容。一、AIGT检测的背景与定义为什么要检测AIGT?AIGT内容真实性难以验证使用AIGT技术能够轻松生成大量看似真实的错误信息,极大增加了辨别内容真伪的难度,可能导致公众误信错误信息,对还可能对新闻真实性、学术诚信以及商业竞争环境造成深远影响。版权纠纷问题AIGT的广泛应用会引起大量的版权纠纷,原创作品的权益需要被界定和保护。加剧信息茧房效应AIGT技术滥用可能会影响公众对多元观点的接纳与理解,对社会舆论健康发展构成威胁。一、AIGT检测的背景与定义AIGT检测任务AIGT检测任务是一个文本分类任务,该任务接收一个文本序列并输出一个离散的预测。该任务经常被视作一个二元分类任务,即当前任务由AI生成还是由人类编写。有些场合可能需要确定AI在当前文本中的影响水平或者确定生成文本的AI模型这时可能涉及多类的区分,即作者归属问题。二元分类任务作者归属问题一、AIGT检测的背景与定义AIGT的分类AIGT这一概念中涵盖了各种文本,其中具有不同程度的人类输入和提示。其中包含包括完全由AI决定内容和结构的文本,还包括如总结和释义这种指定语义内容,但风格和语法由AI确定的文本。最后,AIGT中还应该包括由人类创作但由语言模型进行润色的情况或者由AI生成但是由人类后期编辑的情况,以及文本由AI和人类编写内容组合成的文本。这些不同类型的AIGT在可检测性方面提出了不同的挑战,此外可能有检测特定类别AIGT的需求。一、AIGT检测的背景与定义AIGT的分类任意生成在这种模式下,AI模型几乎不受限制地决定生成文本的内容和结构。尽管用户可能会提供一些提示或方向,但生成内容主要受语言模型训练数据的影响。引导生成引导生成允许用户在生成过程中施加一定的控制,通过提供一般性的信息或意图来指导AI模型生成符合要求的文本。控制生成控制生成是用户对AI文本生成过程施加更高程度控制的类别。在这种模式下,用户已经确定了文本的完整内容,但利用AI模型对文本进行某种形式的修改,如改写、风格转换、摘要生成或翻译等。协作生成协作生成是指人类和机器共同创作文本的过程。这种模式下,文本可能是由人类和AI分别撰写的不同部分组合而成(即“混合案例”),也可能是由AI生成初始内容后,再由人类进行编辑和修正。一、AIGT检测的背景与定义AIGT的分类类别例子任意生成完全任意:请写一个故事。引导生成标题引导:请根据下面的标题写一个故事。标题:瑞辉发布新型冠状病毒疫苗。信息引导:请根据下面的标题写一个故事来描述疫苗的潜在危险。标题:瑞辉发布新型冠状疫苗。控制生成转述:请用不同的文字重写以下内容。风格转换:请使用一个更加正式的语气重写以下内容。总结:请将以下的内容总结为两到三个句子。翻译:请将以下故事翻译为英语。润色:请对以下的内容做一些小的修改以提高可读性,同时保持大部分内容的完整性。协作生成后期编辑:给定一个AIGT,一个人类可以审查和修改其中的错误。混合:一个文档中同时包括人类和AI编写的部分。赛博账户:部分由人类来运营,部分由机器人运营的社交媒体账户。一、AIGT检测的背景与定义AIGT检测场景在AIGT检测时,通常上述的AIGT的类别不会被显式地给出,但是会有不同程度的关于生成文本的模型的信息。如何选择不同的检测方法来以更好的检测取决于对生成模型的了解模型已知该场景下,被检测文本的生成模型是已知的。更可能的现实情况是文本的生成模型的集合是已知的,即文本的生成模型是给定的n个模型之一。模型未知该场景下,生成文本的模型是未知的。该场景是更具有挑战性的,但是同时可能是最真实的在线检测AIGT的场景。白盒访问该场景下,生成模型的模型权重是可以完全访问的,或者至少可以访问输出的概率值。白盒访问的前提是生成模型已知,并且在开放获取的模型中更加常见。黑盒访问该场景下,可以对模型进行提示词的输入并观察相对应的输出,但是关于内部权重和输出的概率是未知的。这意味着在黑盒访问的场景下禁止使用通过概率进行检测的算法。二、AIGT检测方法为了在多种场景检测多种类别的AIGT,研究者们提出了多种方法。这些方法基于LLM生成文本的过程和特点,针对不同的场景和技术挑战,逐步完善了检测方法和检测的效果。从技术原理和应用场景的角度,将AIGT的检测方法主要分为三大类:基于水印的检测方法、基于语义文本统计的检测方法和使用预训练模型的检测方法。基于水印的检测方法基于统计的检测方法使用预训练模型的检测方法二、AIGT检测方法基于水印的检测方法——AIGT中的水印水印是一种隐藏在文本中的标识符,用于传递一些元信息。在AIGT检测的应用背景下,应用水印这一思想的主要目的是通过水印来表示文本是由AI生成的,利用水印提取算法可以验证文本的作者身份。基于原始的需求,也有人提出使用多位的水印来编码附加版权信息这一应用方法。理想情况下,插入的水印不会改变生成文本的含义或质量,且对于不了解水印方法的人应当是“透明的”。如果攻击者检测到文本中出现了水印,其可能会使用释义或删除的方式改变文本以试图破坏水印。因此,一个好的水印添加方法应该对如文本扰动和释义等攻击方式具有鲁棒性。因此
基于水印的检测方法的主要技术难点,是如何在AIGT中插入稳定抗扰动水印且保证生成文本的质量。二、AIGT检测方法基于水印的检测方法——白盒场景下白盒场景下的水印添加方式主要是针对文本的生成过程,通过修改编码策略,改变文本生成过程中某些节点的采样,将水印嵌入。如在生成过程中对词汇表的特定单词进行采样来嵌入水印,该方法构建了两个列表,通过使采样概率偏向其中一个列表的方式来添加水印。该方法在较长的文本序列中较为优秀,但是该方法在面对扰动攻击的鲁棒性较低,单词的简单删除、插入和同义词替换都会明显的削弱水印甚至有完全破坏水印的可能。在此基础上,还有一种基于前一个token动态决定后续列表的水印生成方法,该方法通过前一个生成的内容确定下一个生成内容的采样列表,该方法使得水印难以被仿造,但是对扰动攻击的鲁棒性并没有显著的提升。二、AIGT检测方法基于水印的检测方法——黑盒场景下该场景下,添加水印主要是为了使第三方能在闭源模型生成内容中添加版权信息。早期的方法通常是简单的字符替换等,这些方法添加的水印很容易被检测并移除。最新的方法尝试通过句法结构等信息对原文本进行同义词替换以添加水印,通过该方法重新生成的文本具有质量降低的风险且同样容易收到扰动攻击的影响。另一个方法是将水印集成到文本最重要的特征如专有名词和语义上,一种使用端到端重生成策略的水印添加方法试图将水印添加在语义表示中,该方法可以提高水印的鲁棒性,但需要更多的文本内容来编码水印信息。黑盒场景下添加水印二、AIGT检测方法统计分析方法生成语言模型的原理是从学习到的概率分布中抽取下一个单词进行生成,这个概率分布的计算来需要使用句子中前面的单词。统计方法试图识别上述采样过程中留下的特征,因此这些方法通常涉及模型中的概率分布,也因此大部分统计分析方法都是在白盒访问的场景下提出的。模型生成文本过程二、AIGT检测方法统计分析方法——基于困惑度的检测原理:AIGT的内容的困惑度往往低于人类书写的文本。特点:1、使用阈值进行类别分离的单特征分类。2、零样本分类——不需要训练数据。3、实际使用中阈值的选择需要结合数据或基于先验知识进行校准。困惑度:一种用于评价生成模型好坏的指标。它反映了模型对给定文本的预测能力或不确定性程度。困惑度越低,表示模型对文本的预测越准确,对语言的理解能力越强。二、AIGT检测方法统计分析方法——基于单词级概率和排名原理:直接测量根据特定模型生成一些文本的可能性。通过对可能生成的单词的概率和排名进行平均或计算熵得到一个分数,该分数反映了文本由已知模型生成的可能性二、AIGT检测方法统计分析方法——基于概率函数结构原理:从概率函数结构和特性的角度检测AIGT。方法:1、基于AIGT倾向于占据概率函数的负曲率区域,通过计算文本扰动样本的对数概率平均变化来检测AIGT。2、基于统一信息密度原则,将一个文本区间内单词生成概率的方差等作为检测指标来检测AIGT。二、AIGT检测方法统计分析方法——再生方法原理:使用原始文本的第一部分作为输入,通过比较重新生成的文本和原始文本中输出的单词和概率值进行检测。特点:1、可以在黑盒访问场景下使用。2、对未见的数据域和新兴语言模型有较好的泛化能力。3、对再生次数和截断比(用于再生的原文本量)有较大依赖性。4、适用于检测人类干预程度不高的文本二、AIGT检测方法统计分析方法——本征维度分析方法原理:使用主成分析等降维方法提取潜在维度,人类编写的文本潜在维度普遍高于AIGT。特点:1、对释义攻击(使用同义词代替)具有鲁棒性。2、该方法适用于多个模型。本征维度:指能够充分表示数据所需要的最小变量数,代表导致一些包含噪声和需要使用更多变量来记录训练数据的独立潜在变量的数量。二、AIGT检测方法统计分析方法——基于开源模型的输出概率比较原理:人类书写的文本对于所有模型的置信度区别不大,而AIGT可能在某些模型上具有更高的置信度。方法:1、提取了开源模型对之间的对比概率值作为简单线性分类器的特征。2、使用来自开源模型的概率列表作为小型卷积网络和线性分类器的特征。3、使用一系列弱语言模型计算输入中每个标记的标记概率并提取特征,最后使用特征选择算法获得最佳子集以训练分类器。二、AIGT检测方法文体分析方法文体分析方法基于AIGT和人工编写的文本具有不同的风格或语言属性。其中一些研究是基于早期的自然语言处理(NaturalLanguageProcessing,NLP)的研究之上,如作者归属和广义上文体学(对不同风格的文章进行自动分析)。由于这些方法作用与文本层面,因此适用于黑盒检测场景。但是某些文本风格是特定世代的模型独有或仅出现在特定的领域,因此针对特定的文体进行分析的泛化性可能不高。二、AIGT检测方法文体分析方法——语言特征分析原理:AIGT生成的内容是由LLM的编码策略决定的。如果解码方法总是有限采取概率最高的单词,那么得到的文本会相当流畅,但同时句中的单词会高度重复、缺乏低频或者不寻常的单词。方法:通过缺乏句法和词汇多样性、重复、缺乏连贯性、缺乏目的性和包括字符句子计数等在内的通用特征训练分类器。二、AIGT检测方法文体分析方法——话语结构分析原理:关注文本的“事实结构”,即文本中呈现的事实是否以一致和连贯的方式展开。方法:基于“人类撰写的文本会连贯地回指之前引入的实体,而AIGT则倾向于将相同实体的提及聚集在一起”这一事实,提取为学习的图结构作为对比学习输入分类器。二、AIGT检测方法文体分析方法——风格特征增强的基线方法原理:使用短语学特征(如单词数量、句子数量等)、标点特征和语言多样性特征(包括词汇多样性和可读性)增强基线方法。特点:1、基于短文本检测而提出。2、应用的文本检测环境主要为人类和AI影响参半的内容。旨在定位两者的切换点。二、AIGT检测方法基于语言模型的分类——主要技术原理:通过完整的文本进行训练,使语言模型能够区分AIGT和人类编写文本的能力。主要方法:通过使用预训练模型在大型互联网文本语料库上进行无监督训练以学习单词和句子的高效数值表示,以此为基础添加分类模块并使用特定领域的数据据进行微调以达到分类功能。二、AIGT检测方法基于语言模型的分类——前沿进展使用改进的“正例-未标记”框架(假设训练数据只包括正例即肯定是AI生成的文本和未标记的文本)微调短文本和调整的损失函数对分类器进行微调。训练模型并基于人类编写文本生成文本的样式表示,检测时通过余弦距离衡量测试样本和校准样本的相似性。构建包含改写器和检测器的训练框架,通过对抗训练使两者在竞争中不断优化以提高检测器对改写攻击的鲁棒性。二、AIGT检测方法基于语言模型的分类——特点和挑战二、AIGT检测方法人工检测表现在AIGT检测领域,研究显示人类的表现往往接近随机猜测的水平,即使在特定的领域或情境下,人类的准确度也受多种因素影响。无论检测者是否具有语言学背景或对AIGT有经验,其表现均无显著差异。相较于人类,AIGT检测工具更能分析对人类观察者不直观的文本统计数据,从而超越人类检测者的表现,因此开发高效准确的计算工具进行AIGT的检测十分有必要。三、影响可检测性的因素有许多方面影响AIGT检测任务的难度。这些可以包括生成模型的属性,例如大小和解码方法,文本的属性,例如长度和语言,训练数据的属性,例如域和提示设计,以及人为影响因素,例如混合的人类-AI作者身份和有目的的对抗性逃避。这些发现深入了解了检测方法的局限性,并强调了在构建检测系统时编译训练数据的重要考虑因素。三、影响可检测性的因素生成式LLM的属性模型的大小通常,增加语言模型的尺寸(训练参数的数量)可以提高生成文本的质量。因此更大的语言模型生成的文本往往更难被检测,这是因为更新更大的语言模型在统计特征(困惑度等)越来越接近人类文本的分布。随着模型参数量的指数级增加,检测准确率呈线性下降。解码策略解码策略指在给定可能选择的概率分布下选择下一个生成单词的方法,不同的解码策略会产生具有不同特征的文本,当训练数据与测试数据采取的解码策略不同时,检测准确率会显著下降,同时修改同一解码策略的参数也会显著影响检测性。三、影响可检测性的因素语言训练数据由于大多数研究中涉及的AIGT和训练数据均为英文,因此在使用跨语言的工具进行多语言环境中的AIGT的检测任务仍然一项具有挑战性的任务。在中英文检测任务中,跨语言的检测能力虽然有限但依然表现出了一定的跨语言检测能力。这反映了不同语言间的差异对模型泛化能力的影响,特别是在低资源语言上,AIGT的可检测性受限。三、影响可检测性的因素语言第二语言使用英语作为第二语言的情况也会影响AIGT的可检测性,非英语母语者书写的文本更容易被错误的分类为AI生成,可能是因为第二语言学习者倾向于使用常见词汇和遵循简单语法和风格的特点与模型生成的文本相似,这一相似性导致了检测方法对这类人工编写的文本存在偏见。同样的,通过要求生成模型以特定方式(如“生成更像母语者说的”)更改文本也可以实现对检测的规避。三、影响可检测性的因素文本长度文本长度对检测难度的联系主要体现在文本序列的长度与其能携带的信息数量上,较短的文本序列因为包含更少的信息因此更难被分类。有意图向文本中注入可检测信息的水印技术通常可以在较短的文本序列中携带信息,而基于统计和文体分析的方法需要至少一百个单词才能对文本进行准确分类。五百个单词以上的文本长度基本可以满足所有检测方法的需要。在需要使用训练数据的方法中,训练数据的文本长度也会影响训练出的检测器的性能,如果训练数据没有控制长度,检测器可能会倾向于将较长的人类书写文本误认为AIGT。同样的在缺少短句的训练集上训练的分类器也会难以检测短句。三、影响可检测性的因素分布域外和生成模型分类器的训练数据的类型也会影响检测的效果,当该检测器在不同方向和未见过的数据类型上进行检测的时候,被视作在分布域外。许多测试可检测性的场景都会将是否推广到未见的数据域和未见的生成模型上作为检测鲁棒性的一项指标。现有的检测方法在未见数据领域和混合数据领域方面依然没能取得较好的效果。依靠分析的检测方法在基于以上两种场景搭建的测试数据上的准确率都会有明显的下降。基于模型的检测方法具有一定的泛化能力,但同样受到影响。三、影响可检测性的因素人工干预程度人类对AIGT的影响程度差异巨大,这也极大的影响了可检测性。当AI对人类编写的文本进行润色或改写时,尤其是使用语言模型以不同风格进行改写,可以极大地提高文本的隐蔽性,使得检测工具难以区分其是否为AI生成。同样的,当人类将AI生成的文本进行人性化处理(如添加拼写错误、语法错误等,尽管这些处理可能是通过AI模拟的)时,也会增加检测的难度。现有的统计方法和经过微调的检测方法在面对混合案例(即包含人类和AI共同干预的文本)时,往往表现不佳。特别是当训练过程中没有包含这些混合案例时,检测方法的性能会大幅下降。三、影响可检测性的因素对抗性攻击对抗性攻击通过精心设计的词替换、同义改写或引入打字错误和字符同形异义字等手段,试图使生成的文本在保持原意的同时,能够逃避现有的检测机制。这些方法利用了检测器可能存在的泛化能力不足的问题,通过细微的文本调整来规避检测。统计计分类器等基于概率度量的检测方法在面对对抗性攻击时显得尤为脆弱。同时,对抗性攻击和检测方法之间呈现出一种迭代升级的关系。随着新的攻击方法的出现,检测方法需要不断更新以适应这些变化。四、挑战和未来方向挑战技术复杂度和检测难度AIGT检测面临的主要挑战之一是随着大型语言模型(LLM)规模和复杂性的不断增加,生成的文本越来越难以与传统人类撰写的文本区分开来。LLM生成的文本在语法、语义和风格上日益接近人类创作,使得现有的检测方法效果逐渐减弱。此外,LLM的生成能力在不断进步,而检测技术的发展却相对滞后,这进一步加大了检测的难度。规避策略为了绕过检测,用户可能会采用各种技巧,如微
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 房地产项目销售经理客户满意度及业绩KPI考核表
- AI教育辅助系统功能开发指南
- 个人智能家居设备连接与操作指南
- 教育培训课程大纲模板制作指南
- 确认合作协议细节变更的信件(6篇)
- 关于2026年合同到期后续签的确认函(6篇)范文
- 古籍修复师修复进度与质量考核表
- 中国医科大学2026年6月《老年护理学》作业考核试题及答案
- 物业小区电梯故障应急预案演练脚本
- (完整版)工程公司项目提成及奖金管理制度
- 钢结构工程技术交底(标准范本)
- 审计署审计审理制度
- 滤油机安全使用规定培训课件
- 属地安全监管责任制度
- 高中生政治素养培养教学课件
- 2026届湖北省宜昌市生物高一下期末考试试题含解析
- 熬汤技术培训课件
- 监理举牌验收制度规范
- 2025年医院副院长工作总结及2026年工作计划
- 2024CSCO恶性肿瘤患者营养治疗指南
- 2025年春季学期国开电大行管专科《监督学》期末纸质考试总题库及答案
评论
0/150
提交评论