版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
定向幻觉:生成式AI时代的供应链攻击与防御SYS.ADMIN/
/ONLINE陈永锋
Zero / Crest·
Yearn
Flow> 上海势曦苑科技有限公司首席信息安全官(CISO) / 「SecureNexusLab」团队
LLM
安全负责人「SecureNexusLab」团队
LLM
安全负责人SecureNexusLab
&
「腾讯朱雀实验室」
AI
安全项目
Benchmark
负责人衍界AI安全实验室技术顾问「中国邮储银行总部」前大模型安全讲师成都某科技公司前网络安全讲师某新能源国央企前网络安全讲师「好靶场」AI安全
&AI应用
板块负责人参与省级以上多次攻防蓝队、重保项目,同时参与多次众测项目获得多项CTF等网络安全竞赛省级、国家级奖项CORE_
MODULES.
EXECTFAI
SecurityBlue
TeamWeb01001000
01000001
01000011
01001011
01000101
01010010
00100000
01010000
01010010
01001111
01000110
01001001
01001100
01000101
00100000
01001001
01001110
01001001
01010100
01001001
01000001
01001100
01001001
01011010
01000101
0100000101110
00101110
00101110
00100000
01010011
01011001
01010011
01010100
01000101
01001101
00100000
01001111
01001110
01001100
01001001
01001110
01000101
00100000
01001000
01000001
01000011
01001011
01000101
01010010
00100000
010100ORIGIN生成式AI的时代下的我们过去这段时间发生了……为什么选择GEO?GEO又是什么?SEOSearchEngine
Optimization搜索引擎优化GEOGenerativeEngine
Optimization生成式引擎优化生成式引擎优化(Generative
Engine
Optimization)专门针对
AI
大模型做的内容优化,让
AI
能够读懂、信任、采信这段信息,并且在回答用户问题时,主动引用、输出这些内容。如今大家直接向各类
AI
工具提问,AI
会自动整合全网信息,直接给出完整答案,全程不需要点开任何网页。排名搜索结果排名输出结果什么是定向幻觉?他和传统的AI幻觉有啥区别?传统的AI幻觉是指大语言模型在不经意间,不可控的随机性的,编造其认为看似合理、实则错误或不存在的信息。数据层①
噪声注入:高频错误--高概率的真实②时效衰弱:基于过时的模式进行外推③
偏见放大:
训练数据反映历史性偏见架构层缺陷:Transformer自回归生成①
单向表征局限
②
误差累积效应RLHF三阶段:SFT
→
奖励模型训练
→
PPO优化传统AI幻觉的成因(推②可控性:攻击效果可预测、可复现、可③隐蔽性:输出内容逻辑自洽,难以被用④供应链性:不攻击模型本身,而是污染模型的”信息源”定向幻觉(Directed
Hallucination)定向幻觉≠投毒攻击定向幻觉是结果,GEO投毒/RAG投毒等只是实现的方式传统AI幻觉
≠
定向幻觉ATTACK--CoTType1--Poisoningoftraining
data对公开互联网上文章、数据、网页、书籍等进行投毒,模型在预训练阶段会混入许多有毒的数据,影响范围是全局且持久的攻击者通过爬虫抓取高权重站点(百科、政府网、学术预印本),利用编辑权限或评论注入植入错误事实。由于模型训练具有滞后性(数据集通常冻结在发布前3-6个月),一旦毒药进入预训练语料,将永久固化在模型权重中,事后修正需全量重训。Type1--PoisoningAttacksand
Strategies注入点风险描述典型场景第三方
API通过
API
集成的外部数据源可能已被污染爬虫抓取的网页可能包含恶意隐藏文本用户提交的文件可能嵌入隐藏指令企业内部Wiki
可被恶意编辑短暂编辑在回滚前被索引第三方数据集或模型可能被投毒实时数据馈送、合作伙伴数据接口竞品监控、新闻聚合RAG客服知识库、工单系统内部知识管理系统通用知识
RAG预训练数据、开源数据集网页抓取内容客户上传文档共享
Wiki
页面维基百科等公共源供应链数据维度具体实现针对机制语义优化嵌入向量逼近目标问题邻域TF-IDF/BM25特征高密度填充伪造引用来源、虚假DOI号强制打上“2026年最新报告”时间戳稠密检索(语义相似度)稀疏检索(关键词匹配)模型对于学术来源的偏见模型对时效性的偏好词频优化权威性伪装时效性伪装投毒攻击面投毒策略自动化后台监管Case
1:(Q:想了解AI可以看哪些媒体?)投毒内容Ring
3:CorruptRAG
投毒攻击Case
3:GEO投毒+第三方供应链投毒通过GEO黑灰产投毒使AI输出恶意Skills或者是钓鱼链接诱导用户访问,造成敏感数据泄露、执行恶意操作等行为通过GEO黑灰产投毒使模型coding时主动填充恶意内容(如API、Url等)导致造成数据泄露等风险Case
3:GEO投毒+第三方供应链投毒Case
3:GEO投毒+第三方供应链投毒通过GEO黑灰产投毒配合供应链投毒造成模型定向输出恶意内容Defense--CoTSummary,Outlookand
Acknowledgements总结与展望定向幻觉是AI时代的供应链攻击,本质是数据、模型、检索链路投毒,单一防御无法覆盖。但是定向幻觉攻击能够成立的前提条件——用户对AI的深度依赖1.使用者的认知边界决定了对AI结果善恶的分辨程度2.对AI信任度和ai自托管度越高,引入的不只是益生菌,还有病毒“同样的AI工具,有人输出千倍价值,有人只是放大了无效信息。差距不在工具,而在使用者的认知密度。”换句话说:AI不是均衡器,而是放大镜——认知密度决定你被放大的是什么关于SecureNexusLab团队70%以上,内部优秀资源互推。领域覆盖Web、AI、Pwn、车联网、IoT目前,我们的核心成员主要包括来自清华、北大、哈工深、电科大、中国科学院软件研究所等十几所顶尖高校的硕博学生,以及腾讯、阿
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 科技小探索:解锁未来星球小学主题班会课件
- 诚信为本诚信社会-小学主题班会课件
- IT运维服务行业技术支持团队主管KPI考核表
- 机械加工车间主管生产效率与安全控制绩效考核表
- 新能源技术研发部团队成员技术创新KPI考核表
- 确认2026年供应链合作细节的确认函(5篇)
- 建筑设计师设计成果与施工协调性绩效评定表
- 修身养性立德树人-小学主题班会课件
- 铁路交通项目运营经理绩效评定表
- 餐饮服务员餐饮服务与礼仪指导书
- 2026广西北海市第十四中学招聘后勤服务人员控制数人员16人笔试备考题库及答案详解
- 2026吉林辽源市西安区招聘社区就业服务专员公益性岗位人员36人笔试备考题库及答案详解
- 2026年湖南高考英语(真题)试卷带答案
- 2026年聊城市市属企业统一招聘(60人)笔试备考试题及答案详解
- 2026年湖北省环保工程技术职务水平能力测试(环境工程)题库含答案详解
- 2026年北京市海淀区八年级道德与法治下册期末考试试卷及答案
- 2026年景洪市教育体育局公开选调教师(31人)参考题库及参考答案详解(新)
- 2026年广西专业技术人员继续教育公需科目试题(附答案)
- 2026棉花大幅增殖技术创新遗传育种研究报告规划
- 2026年广西壮族自治区医疗系统事业编乡村医生人员招聘考试备考试题及答案详解
- 2026年山东兖矿招工考试试题及答案
评论
0/150
提交评论