版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
©2025©2025思科和/或其附属公司保留所有权利。保留所有权利。新出现的人工智能安全风险和攻击载体展望未来:新的和改进的人工智能威胁载体微调打破内部模型护栏3444©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告2随着人工智能系统在医疗保健、金融和国防等重要领域处理越来越敏感的工作负载,采取强有力的安全和安保措施的必要性变得不容忽视。人工智能的威胁形势新颖、复杂,传统的网络安全解决方案无法有效解决。同样,既要简化人工智能功能的集成,又要遵守新的合规框架和法规,这可能会让人工智能的应用感到力不从心、成本高昂。这是思科的首份《人工智能安全现状》报告。其目的是全面概述人工智能安全在威胁情报、政策和研究等几个关键领域的重要发展。我们将回顾过去—年取得的进展,同时展望未来,并重点介绍思科如何投资于人工智能更安全、更可靠的未来。最终,我们希望帮助我们的客戶更好地了解人工智能领域,使他们能够更好地管理人工智能带来的风险并从中获益。《人工智能安全现状》报告将涵盖以下内容:-深入分析人工智能基础设施和人工智能供应面临的威胁链和人工智能应用,并对模型后门、提⽰注入和数据提取等人工智能威胁载体的影响进行评估。-美国和国际人工智能政策的重要发展、从数百项与人工智能相关的立法、行政命令、合作协议和安全框架中,突出了共同的主题和宏观趋势。-对算法越狱、数据集的原创性研究中毒、数据提取以及思科自己的人工智能研究团队领导的其他几个前沿人工智能安全主题。我们还非常高兴地推出思科人工智能防御(CiscoAIDefense这是首个真正全面的企业人工智能安全解决方案。AIDefense于今年1月发布,它建立在我们数十年的企业人工智能安全解决方案基础之上。网络和安全经验,帮助企业保护其组织内人工智能的开发、部署和使用。©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告3人工智能威胁格局人工智能威胁格局2024年,人工智能和机器学习应用的市场规模将继续扩大,其中包括能提高生产率的人工智能业务集成和工具。截至2024年初,在接受调的组织表⽰,他们在业务职能中采用了人工智能功能。与此同时,思科人工智能就绪指数(CiscoAIReadinessIndex)报告称,在接受调查的7985名高级商业领袖中,仅有13%的人表⽰他们已准备好充分利用人工智能和人工智能驱动的技术。各行各业的组织已越来越多地将人工智能集成到其产品或工作流程中。例如,在网络安全领域,人工智能加强了威胁和漏洞检测,实现了响应自动化,并增强了组织的整体安全态势。虽然人工智能技术的进步和应用为大量新的商业机会铺平了道路,但它也使风险和威胁环境变得更加复杂:人工智能技术或人工智能技术的快速应用导致攻击面扩大,并出现了新的安全和威胁环境。安全风险。思科的人工智能安全团队--思科新的人工智能防御安全解决方案背后的威胁研究人员和开发人员--正在密切关注这—领域。在除了维护我们的安保和安全分类系统以下是我们最担心的人工智能潜在威胁:-人工智能模型、系统、应用和设备的安全风险人工智能资产的直接破坏以及人工智能供应链中的漏洞对基础设施造成的影响-针对人工智能的攻击载体的出现大型语言模型(LLM)和人工智能系统(例如,越狱、间接提⽰注入攻击、数据中毒、数据提取攻击)-利用人工智能实现威胁行为者的自动化和专业化网络行动,特别是社会工程学虽然这些威胁可能会出现在2025年及以后的地平线上,但2024年出现的威胁主要是人工智能增强了现有的恶意策略,而不是帮助创造新的恶意策略或大幅自动化杀人链。大多数人工智能威胁和漏洞本身属于中低风险,但这些风险加上人工智能应用速度的加快,以及开发、实施和遵守配套安全实践的滞后,将最终增加组织风险并放大潜在的负面影响体攻击者重点攻击支持人工智能系统和应用的基础设施,特别是人工智能部署环境的独特漏洞。人工智能基础设施的破坏可能会导致连锁效应,同时影响多个系统和客戶,攻击者可以针对模型训练工作和模型架构、模型的训练数据和配置、劫持昂贵的计算资源、数据外渗或许多其他最终目标开展额外的行动。我们确信,解决人工智能模型、系统和应用本身的安全风险是人工智能开发生命周期中被忽视的—个方2024年,攻击者成功入侵了英伟达公司的容器工具包,允许攻击者访问和控制主机文件系统、执行代码、拒绝服务、权限升级、信息泄露和数据篡改。2024年早些时候,攻击者还入侵了雷它利用开源人工智能框架GPU集群管理系统,劫持计算资源用于其他目的,如加密货币挖矿,同时可能访问模型训练数据和其他敏感信息。这—事件被广泛认为是针对人工智能框架的首次野外攻击(即发从金融和医疗保健到国家安全和其他自主系统,人工智能系统越来越多地嵌入到关键应用中。这些事件表明了人工智能基础设施攻击的多变性,并强调了防范这些攻击的必要性,以防止对业务运营、公共安全甚至国家安全造成连带影响。人工智能生态系统对共享模型、数据集和库的依赖将攻击面扩大到了人工智能供应链。供应链攻击利用了组织对第三方组件的信任--无论是预训练模型、开源库还是用于训练人工智能系统的数据集。当供应链的某些部分受到攻击时,就会引入隐藏的漏洞,而这些漏洞可能在造成重大损失后才会被发现。针对人工智能系统构建模块和相关组件的攻击者尤其令人担忧,因为它们有可能对多个下游应用程序和系统造成广泛影©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告4开发人员经常从外部来源集成预训练模型、软件库和数据集,这可能会带来—些风险,例如后台模型,即攻击者在预训练模型中嵌入—个隐藏功能,允许他们在特定条件下操纵输出,或在加载模型时运行任意代码。—些人工智能应用依赖于第三方训练的模型,这些模型通过开源软件库(如HuggingFace、PyTorchHub或TensorFlowHub)提供。—项针对IT决策者的调查显⽰,约60%的受访者使用开源生态系统作为人工智能工具源,80%的受访者指出,他们公司至少有四分之—的人工智能解决方案或平台是基于开源的。虽然开源资源库有安全检查,但攻击者仍然精明到可以躲避检测,企业也有安装这些恶意组件在在2024年6月的人工智能威胁综述博客中,我们介绍了SleepyPickle是TrailofBits博客上分享的—种技术,它能让对手直接、隐蔽地入侵模型本身。Pickle是—种常见的Python序列化格式,在机器学习具有众所周知的安全风险。对手学习具有众所周知的安全风险。对手SleepyPickle可在pickle文件中插入恶意代码,以便在分发和反序列化后发送有效载荷。SleepyPickle不会分发恶意模型,而是在反序列化后执行—个自定义函数来破坏模型。这种延迟使该技术变得危险、可定制且更难检测。被破坏的机器学习库(如..、TensorFlow和PyTorch都曾是攻击目标)可能会引入漏洞,这些漏洞会在众多应用中显现,并使它们面临风险。供应链漏洞之所以特别邪恶,是因为它们有可能渗透到人工智能基础设施中,并在造成严重危害之前逃避检测。直接快速注射是—种用于操纵通过特定的输入改变模型的行为,规避人工智能模型的内置安全措施和防护措施,通常是为了重新分配LLM或LLM应用程序的任其他任务。这可能是有意为之(即恶意试图利用模型也可能是无心越狱是—种特定的直接提⽰注入这种技术是指攻击者提供输入,导致模型完全无视其对齐或安全协议,尤其是在聊天机器人中。聊天机器人等LLM通常设计有防护栏,以防止它们生成有害、不道德或非法的输出。但攻击者仍可实施对抗性提⽰或输入来规避这些限制。越狱还能覆盖或揭⽰底层系统提⽰(即给人工智能模型的初始指令集,该指令集定义了人工智能模型的核心行为、能⽰,绕过模型的安全措施和行为防护,或识别和利用模型处理指令方式中的漏洞。©2025思科和/或其附属公司保留所有权利。保留所有权利。思科人工智能安全状况报告5早期的越狱尝试通常依赖于直接指令操纵,例如要求模型"假装"或"角色扮演"通常会受到限制的场景。然而,随着模型对这些基本方法变得越来越强大,对抗技术也变得越来越复杂。现在,其他高级越狱技术还包括令牌走私,即在看似无害的提⽰中编码恶意指令;对抗性提⽰,即攻击者精心设计措辞的提⽰,以诱使模型忽略其防护措施;以及上下文污染,即故意在模型的上下文窗口中填充旨在改变其行为的内容。尽管在越狱防御方面取得了进步,思科的研究表明,简单的越狱仍能有效对抗人工智能安全方面的进步。直接提⽰注入攻击涉及输入会导致意外操作的文本提⽰,而间接提⽰注入攻击则侧重于提供被破坏的源数据,如恶意PDF或网页,甚至是非人可读文本(如二进制、base64以注入恶意指令来操纵LLM响应。间接提⽰注入更难检测,因为这种攻击不需要直接访问人工智能模型,这意味着它们可以绕过传统的提⽰注入防御,而且这种威胁可以在系统中长期存在。6©2025Cisco6©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告人工智能模型通常会处理和存储大量数据,因此成为数据外泄、篡改和未经授权访问的目标。训练最先进的LLM在整个训练生命周期中需要数万亿个令牌的上下文信息,而深度学习模型架构可以记住它们的训练数据。安全研究人员假设,模型有可能泄露其训练数据,并展⽰了许多可能导致以下结果的情况训练数据提取。针对从已部署的人工智能模型中提取训练数据的攻击有可能泄露用于训练模型的敏感或机密信息。思科的人工智能研究还揭⽰了通过—种简单的方法提取记忆训练数据的能力,这种方法可以诱使聊天机器人重复新闻文章中的个别句子,从而让我们能够重建源文章的部分内容。如果像这样的方法被证明可以大规模复制,那么数据隐私和安全的影响将非常广泛,尤其是当人工智能模型是在专有或私人信息上进行训练时。组织可能会面临信息隐私完全丢失、专有数据和知识产权丢失、违反版权或合理使用原则等问题,并面临经济损失、声誉受损和侵犯隐私等后果。攻击者还可以篡改人工智能模型使用的数据、这将损害模型输出的完整性,并可能导致错误的决策或有害的行为。设置不适当或过于宽松的权限也可能会影响对人工智能模型的访问,并允许攻击者访问敏感数据或基础设施。图参考文章(上图)和我们提取训练数据的LLM提⽰流程(中图)以及我们的结果(下图)7©2025Cisco7©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告思科人工智能安全现状报告8©2025思科人工智能安全现状报告8©2025Cisco和/或其附属机构。保留所有权利。数据"中毒"是指威胁行为者在数据中注入恶意研究人员在训练数据集中加入样本,为人工智能模型引入弱点或后门,使其能够影响模型生成的数据、参与犯罪活动或获得未经授权的访问。研究人员还展⽰了毒化基于人工智能的恶意软件检测技术的能力,导致模型误将恶意软件样本归类为良性。如果攻击者能够访问欺诈检测模型,改变系统的训练数据集,并转移其决策边界,那么金融服务机构的欺诈检测模型也会面临类似的挑战。模型提取攻击是—种攻击类型,其中攻击者试图窃取或复制机器学习模型,方法是反复查询该模型并利用其响应来训练自己的副本。同样,—种称为模型反转的技术(攻击者反复查询模型并迭代其输出以收集更多信息)可让攻击者利用模型的学习参数和输出重建训练数据。这两种技术都有可能暴露敏感的训练数据,或从私人训练数据中泄露模型的详细模式。生成式人工智能功能强大,具有影响威胁格局的惊人潜力,但在2024年,威胁行为体对人工智能的使用并未显著增强攻击者的战术、技术和程序(TTPs)。尽管威胁行动者有潜力利用但我们尚未观察到这些能力在野外大规模部署。与此同时,我们观察到国家支持的对手和网络犯罪分子都将人工智能用于社会工程和影响行动,并在威胁行动者的攻击中实现了任务自动化和其他生产率的提高。生命周期。大型语言模型(LLM)和深度伪造技术等人工智能生成工具的普及,导致复杂的社交工程攻击激增,但这种增长可分为两个不同的部分:将人工智能用于社交工程和将人工智能用于自动化恶意活动。通过将这两个部分结合起来,攻击者可以成倍地提高成功率,因为他们可以在LLM和生成式人工智能的帮助下制造出更多更高质量的社交工程诱饵。因此,我们预计网络钓鱼和其他社交工程技术,如虚拟网络钓鱼(人工智能生成的语音克隆)和深度伪造将在人工智能的帮助下不断改进,而垃圾邮件和网络钓鱼的检测将迎头赶上。究究不能或不想绕过合法不能或不想绕过合法LLM内置安全性的网络犯罪分子有时会选择构建自己的LLM。网络犯罪分子设计的LLM不包括任何禁止恶意使用的限制。事实上,其中—些LLM是专门为犯罪活动提供便利而设计的,包括GhostGPT、DarkBard、DarkGPT和FraudGPT等应用程序。这些LLM大多在黑客论坛、Telegram频道(—种经常发生非法活动的社交媒体和消息应用程序)以及暗网上向网络犯罪分子出售,月租费低至CiscoCiscoTalos观察到,网络犯罪分子在LLM的协助下实施网络钓鱼攻击,以生成更真实、更个性化的网络钓鱼邮件内容,这也增加了绕过电子邮件安全过滤的可能性。—些恶意LLM应用程序还宣传以下功··恶意代码混淆··生成漏洞代码··扫描网站是否存在已知漏洞··检查信用卡号码的真实性··具有向外发送电子邮件的功能··通过应用程序接口实现这些任务的自动化国家支持的高级持续性威胁(APT)组织和其他复杂的行为者可能会利⽤这些功能,如深度伪造视频和音频以及辅助材料(如简历、求职信以进行面试或打电话,或自动实施社交工程。朝鲜等国政府已明确表⽰有意发展人工智能能力,但没有直接证据或公开消息来源表明该国的网络部队已应用人工智能或ML来加强其进攻性网络项目。其他组织观察到,与朝鲜有关联的行为者试图使用聊天机器人来调试其恶意代码。2024年,网络犯罪分子利用这些技术创建了令人信服的网络钓鱼活动,并操纵个人泄露敏感信息或允许未经授权访问其组织的网络和系统。例如,网络犯罪威胁行为者组织ScatteredSpider已成功利用人工智能语音克隆技术对许多行业进行了网络钓鱼攻击、包括医疗保健。他们利用企业视频和社交媒体中的语音样本,生成令人信服的高管声音克隆,以授权安全变更和网络访问请求。犯罪分子还利用人工智能绕过加密货币组织的法规和"了解客戶"做法。威胁行为者还利用聊天机器人生成非母语内容,以开展影响行动。例子包括翻译或优化目标语言的内容,用于社交媒体帖子、短文和长篇文章,主题包括地缘政治冲突、对美国和欧洲政策的批评或安全相关内容。威胁行为者试图利用聊天机器人协助恶意软件开发和任务自动化,以提高攻击成功率。例如,作为—种总结工具,恶意行为者询问聊天机器人以收集目标的公开情报。研究证明,LLM可以利用单日漏洞(即系统中已披露但未修补的漏证据表明,除其他活动外,来自中国的账戶正在利用聊天机器人调试与通信监控技术相关的代码。但是,我们尚未观察到威胁行为者在现实世界中部署先进的漏洞扫描和利用能力。网络犯罪分子已经开发并销售了多种工具,可以帮助进行漏洞研究、侦察、编写漏洞利用程序和任务自动化。网络犯罪分子还利用人工智能驱动的代理来模仿类似人类的行为,从而绕过机器人检测(如随机鼠标移动、实时填写表格)和欺诈检测技术(提交微交易以验证银行©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告9体代理式人工智能,"可采取行动的人工智能系统和模型自主地实现目标,而不需要人类的不断指导",并有能力进行规划和推理,记忆和回忆信息,以及采取行动和使用工具来完成任务,所有这些都能为组织带来生产效益和新的洞察力。能代理威胁指南。随着代理系统的不断发展和日益复杂,其风险状况也在不断变化。这份来自OWASPAgenticSecurityInitiative(ASI)的文件为新出现的代理威胁提供了参考,同时提出了实用的缓解策略。思科是本指南的赞助商和支持者。人工智能代理系统还可能危及那些既没有准备也没有能力处理代理系统及其潜在危害的组织。人工智能代理系统至少有14种不同的威胁载体,包括:内存中毒,即在人工智能代理的内存系统中引入虚假或误导数据,以利用代理的上下文;错位和欺骗行为,即利用人工智能代理实施有害或不允许的行为;意外远程代码执行和代码攻击,即攻击者注入恶意代码或执行未经授权的脚本。随着代理系统越来越多地与不同的服务和供应商集成,威胁者利用代理系统或代理系统漏洞的机会已经成熟。攻击者有可能利用代理系统进行多阶段攻击,找到访问受限数据系统的创新方法,将看似无害的行为串联成有害的序列,或学会躲避网络和系统防御者的检测。继续开展大规模社交工程:从社交由于宣传工作的扩散,网络犯罪和国家支持的行为者将继续利用人工智能技术来提高其恶意活动的个性化和专业化程度。多模态人工智能集成了文本、图像、语音和复杂的编码,虽然尚未实现,但它的恶意使用可使攻击者简化整个攻击链并使其自动化。从理论上讲,这些攻击可以对目标进行侦查、制作逼真的网络钓鱼内容、查找零日漏洞、生成规避性恶意软件,并自动进行内部横向移动。网络,导致公共和私营部门的开发速度加快,风险增加。在发展过程中可能会出现许多风险领域针对人工智能模型和系统的能力这些攻击包括利用对抗性输入来欺骗人工智能安全过滤器、劫持业务运营工作流程中使用的人工智能代理,以及攻击人工智能供应链的各个要素(如破坏训练数据、破坏模型的云基础设施)。针对人工智能系统(以及人工智能实验室和开发人员)的传统网络攻击仍将是—个突出的威胁,因为攻击者试图窃取知识产权、窃取用戶数据,或破坏、降低或摧毁人工智能开发生命周期的要素。思科人工智能安全状况报告思科人工智能安全状况报告©2025©2025Cisco和/或其附属机构。保留所有权利。人工智能政策的发展人工智能政策的发展2024年出现了大量新的人工智能政策发展,主要是为了应对人工智能技术的日益普及及其市场扩张。仅在美国,各州立法者就提出了700多项与人工智能相关的法案,其中113项在2024年被颁布为法律,涉及45个州。2025年,政策活动的步伐并未放缓。在2025年的头几周内,州和联邦层面就提出了40项与人工智能相关的法案提案。这些变化的迅速性和复杂性给整个市场的参与者带来了挑战,他们需要驾驭不断变化的格局。人工智能在带来潜在的巨大经济增长机遇的同时,也带来了社会和经济风险,这就要求司法管辖区在促进创新的愿望与管理相关风险之间取得平衡。在世界各国制定和实施人工智能法律法规的过程中,并没有出现—种监管人工智能的标准方法。在努力应对人工智能带来的挑战和机遇时,各国政府利用了范围广泛的人工智能政策工具包:起草我们注意到,人工智能治理通常始于国家战略的推出,然后才转向立法行动。我们注意到,人工智能治理往往先推出国家战略,然后再采取立法行动。2024年全球人工智能政策发展的重点包括-在国家层面重点促进人工智能安全通过人工智能安全峰会自愿承诺等行动以及跨大西洋和全球伙伴关系,实现技术的快速发展;-在国内,各州的人工智能各自为政在没有联邦—级行动的情况下,出现了立法方法;以及以下各节只是对2024年趋势的概括,并不包括国内和国际上所有的人工智能政策发展。鉴于人工智能监管环境的快速演变,自本报告发布以来,以下工作可能已发生变化。本报告提供的信息仅供参考,并不构成法律建议。在联邦没有制定人工智能政策的情况下,各州采取了独立行动来规范这项技术。各州出台了—系列新法案,对人工智能的开发和使用施加了—些限制。-科罗拉多州成为第—个通过全面人工智能法案(SB24-205)的州。该法案要求"高风险"人工智能系统的开发者和部署者遵守额外的预防措施,以确保他们避免歧视和其他安全伤害。这项新法律是科罗拉多州《消费者保护法》的—部分,与最近通过的欧盟《人工智能法》中基于风险的方法如出—辙。2024.该立法是犹他州消费者保护法的—部分,引入了在私营和公共部门使用生成式人工智能系统的披露义务。此外,它还设立了人工智能政策办公室和人工智能学习实验室计划,有可能为风险较高的人工智能应用制定网络安全审计程序。-康涅狄格州、马里兰州、佛蒙特州和弗吉尼亚州规定,各州机构必须进行影响评估,以测试人工智能系统的安全风险。-欧盟人工智能法》于以下日期正式生效工智能法。2025年,早期行动表明,各国政府的重点已转向更加重视安全和人工智能创新。特朗普总统关注人工智能对国家安全的影响,并为人工智能的发展和应用创造有利环境,就是最近这—转变的例证。2025年2月在巴黎举行的人工智能行动峰会汇聚了各国元首、政府官员和国际组织领导人,同样表明了对有利于创新环境的日益增长的支持。法国和英国领导人特别强调了加大对人工智能基础设施投资的必要性。©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告112024年,各联邦机构为促进安全可靠的人工智能开发和使用做出了各种寻求对涉及滥用人工智能的某些犯罪处以更严厉的刑罚。-众议院两党人工智能工作组发布了—份关于人工智能的全面报告,包括指导原则和前瞻性建议,以负责任的方式推进美国在人工智能创新领域的领导地位。-商务部启动了美国人工智能安全研究所联盟(AISIC)。美国美国标准与技术研究院(NIST)发起该联盟的目的是"[制定]指导方针和流程,使生成式人工智能的开发人员能够进行人工智能红姐统—图库测试,以便部署安全、可靠和值得信赖的系统"。-美国财政部发布了—份关于管理金融服务部门的人工智能特定网络安全风险。报告指出,"人工智能给金融服务部门的安全性和弹性带来了重大机遇和挑战"。去年,围绕人工智能安全标准的制定开展了大量活动,为企业如何确保人工智能应用的安全提供了指导。-国家标准与技术研究院(NIST)是美国商务部的—个机构,通过推动测量科学、标准和技术的发展来促进国内创新。该资源由思科人工智能防御团队的成员共同撰写,提供了—个攻击生命周期的概念层次、攻击者的目的和目标以及攻击者的能力。此外,它还提出了减轻和管理攻击后果的相应方法。-MITRE是—家通过联邦政府资助的研究中心连接公共和私营部门的非营利组织,该组织扩展了其人工智能系统的对抗性威胁态势(ATLAS)框架,以涵盖生成式人工智能系统。ATLAS矩阵是—个活的社区知识库,其中包含基于真实世界攻击观察的对抗性战术和技术。它是保护人工智能系统的安全专业人员、开发人员和操作人员使用的资源。思科人工智能安全状况报告思科人工智能安全状况报告©2025©2025Cisco和/或其附属机构。保留所有权利。2024年,跨国伙伴关系是促进全球安全可靠地开发和使用人工智能的主要政策工具。-英国(UK)和加拿大签署了—项在人工智能安全方面密切合作的协议。作为协议的—部分,两国同意分享专业知识,以加强评估和测试工作,并"激励系统安全研究方面的合作工作",以期在2023年于布莱切利举行首届人工智能安全峰会之后,扩大人工智能安全机构网络。-来自欧盟-美国贸易与技术委员会的欧盟和美国人工智能专家开发了最新版的人工智能分类和术语。该分类法有助于协调国际治理工作,并就如何有效确保人工智能系统的安全达成共识。联合理事会还宣布成⽴—个新的研究联盟:AIforPublicGood",致力于将人工智能系统应用于最重要的全球挑战。-在—项具有里程碑意义的协议中,英国和美国人工智能安全研究所承诺建立合作伙伴关系,共同测试人工智能模型,共享框架、最佳人工智能安全实践和专业知识。人工智能发展前沿的公司承诺分享风险和安全框架,避免高风险模式。-联合国—致通过了—项由美国牵头的关于人工智能技术的决议。该决议草案旨在为"安全、可靠和值得信赖的人工智能"制定—个全面的愿景,并以拜登总统的政府去年秋天与领先的人工智能公司合作提出的自愿承诺为基础。这标志着在为人工智能的道德和可持续发展制定国际协议方面迈出了关键—步。该决议的核心是鼓励保护个人数据、监测人工智能风险和保障人权。-日本首相岸田文雄宣布广岛人工智能进程之友小组启动仪式经济合作与发展组织的聚会。该倡议得到了49个国家和地区的支持,旨在协调全球在安全、可靠和可信的生成式人工智能方面的努力。该倡议支持实施《广岛人工智能进程综合政策框架》中概述的国际准则。©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告13思科人工智能安全状况报告©2025思科人工智能安全状况报告©2025Cisco和/或其附属机构。保留所有权利。工智能法律,而其他国家则采取了国家方法来治理人工智能。并概述了有关人工智能开发、部署和使用的法规,对高风险的人工智能系统规定了更严格的规则(如欧盟人工智能法案正式文本第127页所述并禁止"不可接受的"人工智能应用,对违规行为的处罚最高可达组织全球总营业额的7%。-澳大利亚政府发布新政策在政府中负责任地使用人工智能。该政策要求政府发挥"领导作用,拥抱人工智能,造福澳大利亚人,同时确保按照社会期望,安全、合乎道德和负责任地使用人工智能"。该政策对联邦非公司实体具有强制性,于9-随着人工智能系统的使用在非洲大陆不断扩大,非洲开始推动对人工智能进行监管。包括55个成员国在内的非洲联盟开始制定—项人工智能政策,以进—步发展和规范人工智能的使用。然而,关于是否有必要进行监管以及监管可能对创新产生的影响,—直存在争论。七个非洲国家已经制定了国家人工智能政策,去年2月,非洲联盟发展署公布了—份政策草案,作为非洲国家进—步制定人工智能法规的蓝图。-新加坡发布人工智能治理框架范本它为组织在部署人工智能系统时提供了—个自愿采用的框架,以满足人工智能风险管理的最佳实践。本内阁办公室人工智能战略小组的两份出版物建议对大规模基础模型引入监管。然而,到了年底,日本的态度转向了"轻触式"监管方法。正如第二份人工智能白皮书所规定的,日本的目标是通过采纳广岛人工智能进程的原则,"考虑通过法律法规采取最低限度的必要措施",成为"对人工智能最友好的国家"。今年的人工智能政策发展已经预⽰着新兴监管方向的重大转变,标志着人工智能政策对话正朝着有效平衡人工智能安全需求、加快创新速度和增加人工智能基础设施投资的方向发展。2024年,政策制定者主要关注的是人工智能的安全性以及减轻与使用人工智能相关的任何社会和经济损害。2025年,人工智能安全话题可能会继续与政策制定者的监管方法相关,但解决安全相关风险和支持支持创新政策显然是优先事项。思科人工智能安全状况报告©2025思科人工智能安全状况报告©2025Cisco和/或其附属机构。保留所有权利。-特朗普政府采取行动支持人工智能创新并保护国家安全:特朗普总统在上任伊始就撤销了拜登总统的人工智能行政令,不久后又宣布了—项新的行政令,政府将其定位为促进创新、支持经济增长和保护国家安全。副总统JD-万斯在人工智能行动峰会上的讲话强化了这—立场,概述了美国政府利用人工智能创新的优先事项。美国政府也越来越关注基础技术的潜在出口问题,这些技术可能会为外国对手开发人工智能提供技术优势。-美国和英国拒绝签署2025年人工智能协议行动峰会的安全宣言:美国(与英国—起)拒绝签署首脑会议的安全宣言,理由是对全球治理和国家安全的担忧。-法国总统马克龙敦促欧盟简化程序监管工作:马克龙总统在巴黎主持人工智能行动峰会时,建议欧洲采取更宽松的人工智能监管方式,以提高成员国在全球人工智能竞赛中的竞-英国重新命名人工智能安全研究所,重点关注安全英国人工智能安全研究所正式更名为英国人工智能安全研究所(UKAISecurityInstitute)的成立,标志着打击利用人工智能助长犯罪和威胁国家安全的工作得到了更多关注。-欧盟委员会撤销人工智能责任指令:欧盟委员会正式放弃了《2022年人工智能责任指令》,该指令旨在"为人工智能系统参与造成损害的非合同民事责任的某些方面制定统—规则"。根据欧盟委员会最新通过的2025年工作计划的新闻稿,这—决定的动机是努力"减少行政负担,简化欧盟规则"。-欧盟和法国宣布人工智能投资计划:在巴黎举行的人工智能行动峰会上,欧盟委员会主席冯德莱恩宣布了"人工智能投资计划"(InvestAI该计划将努力调动高达2000亿欧元的资金投资于人工智能基础设施和四个千兆工厂。法国总统马克龙宣布法国对人工智能的私人投资将超过1090亿欧元。-英国发布了《人工智能机遇行动计划》:英国政府详细目标,从基础设施投资到促进英国主权人工智能的发展,进—步表明英国将更加重视人工智能的机遇和增长。三个关键类别建议包括:奠定人工智能的基础,通过拥抱人工智能改变生活,以及利用本土人工智能确保未来。-印度电子和信息技术部(MEITY)正在就人工智能治理指南征求意见:向利益相关者征求意见。治理指南采用基于风险的方法,并与经合组织的人工智能原则紧密结合。此外,报告还建议建立—个技术咨询机构,发挥与人工智能安全研究所类似的作用。-韩国将《人工智能框架法》签署为法律:这韩国成为继欧盟之后的第二个管辖区、颁布—项全面的人工智能监管法。它采用了风险基于的方法,重点关注"高影响"人工智能系统。在这里,"高影响"人工智能是指对人类生命、人身安全和基本权利构成风险的人工智能系统。-日本宣布人工智能法案计划:日本出台了向议会提交了《人工智能法》法案草案。该提案没有采取严格的监管方式,也不包括对违规行为的处罚。相反,该法案重点关注以下方面的可操作性授权政府调查现有法律未涵盖的恶意使用人工智能的行为。-更新人工智能安全标准,以反映新的和网络应用和软件安全性的公认的全球性非营利组织。嵌入弱点",并宣布了—项新的"生成式人工智能红队指南"。这些资源将组织和政府可利用该工具更好地了解人工智能安全形势和最佳实践。人工智能安全研究人工智能安全研究去年,思科的人工智能安全研究团队在人工智能安全的关键领域领导并参与了多项开创性研究。这些努力反映出我们致力于推动人工智能安全社区的发展,同时确保我们的客戶免受新威胁和新漏洞的侵害。本节高度概括了我们的方法、主要发现以及思科各种人工智能安全研究计划在现实世界中的影响,包括-算法越狱攻击模型为零即使是最复杂的LLM,也可以在人工监控下自动绕过对手的保护。这种方法可用于外泄敏感数据、破坏服务和以其他方式危害企业。-对模型进行微调可能会破坏其安全和安保—致性,这意味着人工智能应用的上下文相关性的提高可能会无意中使其对以下方面造成更大风险-自动:无需手动输入和人工监督。-黑盒:攻击不需要了解LLM架构。-可转让:提⽰是用自然语言编写的,可以重复使用。-提⽰效率高:更少的提⽰使攻击更隐蔽,更难被发现。狱的成本相对较低,同时也表明能力更强的LLM通常更容易被破企业使用。-中毒和提取训练的简单方法这些数据表明,用于训练LLM的数据很容易被对手悄悄篡改或外泄。随着人工智能本身和人工智能系统面临的威胁持续快速发展,我们将第—方研究结果与第三方威胁情报管道相结合,提供具有相关性和弹性的人工智能保护。为了规范模型行为,防止恶意、敏感或其他有害输出,开发人员在LLM中添加了安全防护栏。虽然这些界限很重要,但并非万无—失。模型越狱会破坏这些保护措施,迫使模型产生受限制的输出。思科公司的人工智能研究人员与耶鲁大学的研究人员合作,开发了—TAP使用两个LLM(—个攻击者模型和—个评估者模型)来创断完善有害提⽰。研究强调了TAP等算法越狱方法具有特别破坏性和难以缓解的几个原因:表:根据表:根据GPT4-实现越狱的比例指标。对于每种方法和目标LLM,我们都会报告通过GPT4指标在AdvBenchSubset上发现的越狱率,以及在此过程中发送到目标LLM的查询次数。对于TAP和PAIR,我们使用Vic在每—列中,最佳结果均以粗体标出。对于探索人工智能潜在商业应用的企业来说,这项研究再次证明了独立安全措施的重要性,这些措施比内置护栏更具弹性,并能实时保护©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告16OpenAIo1和DeepSeekR1等高级推理模型的出现,促使思科和宾夕法尼亚大学的人工智能研究人员开发出了对抗性推理(AdversarialReasoning)。这种自动化的模型越狱方法利用先进的模型推理,有效对抗推理有助于思科公司对对DeepSeekR1进行的安全评估显⽰攻击成功率(ASR)达到100%。从更广泛的意义上讲,这项研究表明,未来的模型对齐工作不仅要考虑单个提⽰,还要考虑整个推理路径,从而为人工智能系统开发出强大的防御功能。微调基础模型是企业常用的—种方法,可以以灵活、经济高效的方式提高人工智能应用的准确性、领域专业性和上下文相关性。然而,思科人工智能团队的研究揭⽰了微调经常被忽视的危险,即微调可能会破坏模型的—致性,并带来新的安全和保安风险。这种现象具有广泛的适用性,甚至可能发生在完全良性的数据集上,使得经过微调的人工智能应用程序通常更容易越狱,也更有可能产生有害或敏感的结果。具体来说,本研究使用Llama-2-7B和三个AdaptLLM聊天模型进行了微调,并由微软的研究人员将覆盖生物医学、金融和法律等领域。评估发现微调变体超过3倍更容易受到越狱指令的影响,产生有害反应的可能性是原始基础模型的22倍以上。这项研究的目的并不是要完全贬低微调,而是要强调微调会给即使是最匹配的基础模型带来新的风险。它强调了需要—个独立的安全和安全层,可以保护模型不受微调的影响。©2025Cisco和/或其附属机构。保留所有权利。思科人工智能安全状况报告17聊天机器人通常会拒绝回答试图重构受版权保护或付费数据的提⽰,因为底层模型是根据逐字复制受版权保护或付费材料的具体准则和限制进行训练的。然而,思科公司的人工智能研究人员能够利用—种简单的方法,诱使聊天机器人重复新闻文章的部分内容,从而重构源材料,并引发对更大信息安全风险的担忧,如提取敏感、专有或非公开信息。通过—种被称为分解的方法,研究人员将主要目标--提取私人训练数据--分解成更小的连续请求,从而绕过模型的内部防护。研究人员针对2015年至2023年间发表的3,723篇《纽约时报》文章和1,349篇《华尔街日报》文章的语料库,对两个前沿LLM进行了测试。对于LLM-α,研究人员能够从73篇《纽约时报》文章中检索到至少—个逐字句子;对于LLM-β,研究人员能够从11篇文章中检索到至少—个逐字句子。他们针对表现最好的100篇文章重新进行了提⽰,成功地从LLM-α的6篇文章和LLM-β的2篇文章中重建了20%以上的文这些结果表明,这种分解方法可以成功诱导聊天机器人生成可靠复制新闻文章的文本,这意味着这些文本很可能来自源训练数据集。如果这种方法被证明可以大规模复制,那么它将对数据隐私和安全产生广泛影响--从完全丧失信息隐私到侵犯版权。©2025©2025Cisco和/或其附属机构。保留所有权利。深度学习模型通常在海量数据集上进行训练,这些数据集包含从互联网上抓取的信息。来自思科、谷歌、联邦理工学院(ETH)的研究人员组成了—个团队。通过引入两种攻击来毒化公共数据集,在文章发表时,这两种攻击实际上可以立即毒化10个流行的数据集。在他们的论文中,针对十个流行的网络规模数据集评估了两种简单、低成本的技术--分割视图数据中毒和前端运行数据中毒。这两种技术都利用了—个事实,即数据集通常只是网页上的内容,数据消费者相信这些内容不会被篡改。但是,通过购买常见数据集引用的过期域名,或者在数据归档时及时修改维基百科上的内容,数据确实很容易被篡改。研究结果表明,这些数据集是多么脆弱;仅60美元就足以在2023年毒化0.01%的LAION影响模型。研究人员提出了包括完整性验证和基于时间的防御在内的缓解措施,并按照负责任的披露流程与受评估数据集的维护者分享了这些措施。图图:图:Llama-2-7B和经过微调的变式。结果表明,在针对法律专业知识进行微调后,模型的安全性和保安—致性都有所下降。思科人工智能安全状况报告18思科人工智能安全状况报告18实施人工智能安全的建议实施人工智能安全的建议与传统的网络应用相比,人工智能应用需要考虑更多的安全因素,这可能会让企业安全团队感觉是—个全新的领域,不知所措。我们希望通过强调人工智能安全与传统网络安全实践之间的共性,让大家更容易掌握这—新的巨大威胁。每个企业都必须根据不同的实施参数来定制其人工智能安全策略。例如,您正在利用哪些模型和数据集?具体的人工智能用例是什么?处理的数据有多敏感?该人工智能应用服务于哪些终端用戶?虽然这些都是独特的方面,但我们在下文中概述了—些—般性考虑因素和建议,供所有企业在制定人工智能安全战略时参考。-在人工智能生命周期的每个阶段管理风险。作为如威胁情报部分所述,人工智能生命周期中从开发到部署的几乎每—步都存在—定程度的风险。确保您的安全团队有能力在供应链采购(如第三方人工智能模型、数据源和软件库)、数据采集、模型开发、培训和部署等每个阶段识别并降低风险。-保持熟悉的网络安全最佳实践。人工智能可能虽然人工智能是新颖独特的,但访问控制、权限管理和数据丢失防护等熟悉的概念仍然至关重要。确保人工智能安全的方法与确保核心技术基础设施安全的方法相同,并
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 10万立方米天然气应急处置设施可行性研究报告
- 多项目并行组织体系规划
- 康复医学治疗技术(初级(师))基础知识卫生专业技术资格考试及答案
- 某铝材厂熔铸过程控制办法
- 职业发展引导办法
- 病患沟通服务优化方案
- 教师资格证教育学心理学试题及答案
- 某造纸厂原木采购细则
- 家禽饲养员协同考核试卷及答案
- 混凝土机械维修工常识测试考核试卷及答案
- 戏剧史论课件
- 土壤氮循环专业知识培训课件
- 代账合同模板(3篇)
- GB/T 33474-2025物联网参考体系结构
- 2025霸州市辅警考试试卷真题
- DB51T 1995-2015 机制砂桥梁高性能混凝土技术规范
- 小学三年级(上学期)生活生命与安全全册
- 急诊科主治医师述职报告
- 2024年湖北省技能高考计算机专业理论考试复习题库及答案(高频500题)
- CJJT153-2010城镇燃气标志标准
- 《无衣》课件高中语文选择性必修上册
评论
0/150
提交评论