腾讯定向幻觉:生成式AI时代的供应链攻击与主动防御_第1页
腾讯定向幻觉:生成式AI时代的供应链攻击与主动防御_第2页
腾讯定向幻觉:生成式AI时代的供应链攻击与主动防御_第3页
腾讯定向幻觉:生成式AI时代的供应链攻击与主动防御_第4页
腾讯定向幻觉:生成式AI时代的供应链攻击与主动防御_第5页
已阅读5页,还剩25页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

定向幻觉:生成式AI时代的供应链攻击与防御SYS.ADMIN/

/ONLINE陈永锋

Zero / Crest·

Yearn

Flow> 上海势曦苑科技有限公司首席信息安全官(CISO) / 「SecureNexusLab」团队

LLM

安全负责人「SecureNexusLab」团队

LLM

安全负责人SecureNexusLab

&

「腾讯朱雀实验室」

AI

安全项目

Benchmark

负责人衍界AI安全实验室技术顾问「中国邮储银行总部」前大模型安全讲师成都某科技公司前网络安全讲师某新能源国央企前网络安全讲师「好靶场」AI安全

&AI应用

板块负责人参与省级以上多次攻防蓝队、重保项目,同时参与多次众测项目获得多项CTF等网络安全竞赛省级、国家级奖项CORE_

MODULES.

EXECTFAI

SecurityBlue

TeamWeb01001000

01000001

01000011

01001011

01000101

01010010

00100000

01010000

01010010

01001111

01000110

01001001

01001100

01000101

00100000

01001001

01001110

01001001

01010100

01001001

01000001

01001100

01001001

01011010

01000101

0100000101110

00101110

00101110

00100000

01010011

01011001

01010011

01010100

01000101

01001101

00100000

01001111

01001110

01001100

01001001

01001110

01000101

00100000

01001000

01000001

01000011

01001011

01000101

01010010

00100000

010100ORIGIN生成式AI的时代下的我们过去这段时间发生了……为什么选择GEO?GEO又是什么?SEOSearchEngine

Optimization搜索引擎优化GEOGenerativeEngine

Optimization生成式引擎优化生成式引擎优化(Generative

Engine

Optimization)专门针对

AI

大模型做的内容优化,让

AI

能够读懂、信任、采信这段信息,并且在回答用户问题时,主动引用、输出这些内容。如今大家直接向各类

AI

工具提问,AI

会自动整合全网信息,直接给出完整答案,全程不需要点开任何网页。排名搜索结果排名输出结果什么是定向幻觉?他和传统的AI幻觉有啥区别?传统的AI幻觉是指大语言模型在不经意间,不可控的随机性的,编造其认为看似合理、实则错误或不存在的信息。数据层①

噪声注入:高频错误--高概率的真实②时效衰弱:基于过时的模式进行外推③

偏见放大:

训练数据反映历史性偏见架构层缺陷:Transformer自回归生成①

单向表征局限

误差累积效应RLHF三阶段:SFT

奖励模型训练

PPO优化传统AI幻觉的成因(推②可控性:攻击效果可预测、可复现、可③隐蔽性:输出内容逻辑自洽,难以被用④供应链性:不攻击模型本身,而是污染模型的”信息源”定向幻觉(Directed

Hallucination)定向幻觉≠投毒攻击定向幻觉是结果,GEO投毒/RAG投毒等只是实现的方式传统AI幻觉

定向幻觉ATTACK--CoTType1--Poisoningoftraining

data对公开互联网上文章、数据、网页、书籍等进行投毒,模型在预训练阶段会混入许多有毒的数据,影响范围是全局且持久的攻击者通过爬虫抓取高权重站点(百科、政府网、学术预印本),利用编辑权限或评论注入植入错误事实。由于模型训练具有滞后性(数据集通常冻结在发布前3-6个月),一旦毒药进入预训练语料,将永久固化在模型权重中,事后修正需全量重训。Type1--PoisoningAttacksand

Strategies注入点风险描述典型场景第三方

API通过

API

集成的外部数据源可能已被污染爬虫抓取的网页可能包含恶意隐藏文本用户提交的文件可能嵌入隐藏指令企业内部Wiki

可被恶意编辑短暂编辑在回滚前被索引第三方数据集或模型可能被投毒实时数据馈送、合作伙伴数据接口竞品监控、新闻聚合RAG客服知识库、工单系统内部知识管理系统通用知识

RAG预训练数据、开源数据集网页抓取内容客户上传文档共享

Wiki

页面维基百科等公共源供应链数据维度具体实现针对机制语义优化嵌入向量逼近目标问题邻域TF-IDF/BM25特征高密度填充伪造引用来源、虚假DOI号强制打上“2026年最新报告”时间戳稠密检索(语义相似度)稀疏检索(关键词匹配)模型对于学术来源的偏见模型对时效性的偏好词频优化权威性伪装时效性伪装投毒攻击面投毒策略自动化后台监管Case

1:(Q:想了解AI可以看哪些媒体?)投毒内容Ring

3:CorruptRAG

投毒攻击Case

3:GEO投毒+第三方供应链投毒通过GEO黑灰产投毒使AI输出恶意Skills或者是钓鱼链接诱导用户访问,造成敏感数据泄露、执行恶意操作等行为通过GEO黑灰产投毒使模型coding时主动填充恶意内容(如API、Url等)导致造成数据泄露等风险Case

3:GEO投毒+第三方供应链投毒Case

3:GEO投毒+第三方供应链投毒通过GEO黑灰产投毒配合供应链投毒造成模型定向输出恶意内容Defense--CoTSummary,Outlookand

Acknowledgements总结与展望定向幻觉是AI时代的供应链攻击,本质是数据、模型、检索链路投毒,单一防御无法覆盖。但是定向幻觉攻击能够成立的前提条件——用户对AI的深度依赖1.使用者的认知边界决定了对AI结果善恶的分辨程度2.对AI信任度和ai自托管度越高,引入的不只是益生菌,还有病毒“同样的AI工具,有人输出千倍价值,有人只是放大了无效信息。差距不在工具,而在使用者的认知密度。”换句话说:AI不是均衡器,而是放大镜——认知密度决定你被放大的是什么关于SecureNexusLab团队70%以上,内部优秀资源互推。领域覆盖Web、AI、Pwn、车联网、IoT目前,我们的核心成员主要包括来自清华、北大、哈工深、电科大、中国科学院软件研究所等十几所顶尖高校的硕博学生,以及腾讯、阿

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论