新加坡《AI智能体治理框架V1.5》中文机翻_第1页
新加坡《AI智能体治理框架V1.5》中文机翻_第2页
新加坡《AI智能体治理框架V1.5》中文机翻_第3页
新加坡《AI智能体治理框架V1.5》中文机翻_第4页
新加坡《AI智能体治理框架V1.5》中文机翻_第5页
已阅读5页,还剩93页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

AI智能体治理框架版本版本1.5|发布日期:2026年5月20日Executivesummary3”hat's"e”i"thisversio"51IntroductiontoAgenticAl1.1什么是代理式人工智能? 6 6 1.1.3智能体设计如何影响各智能体的性能边界与功能范围 1.2代理式人工智能的 112ModelAlGovernanceFrameworkforAgenticAl13 2.1.1确定代理部署的适用场景 2.1.2通过定义代理的权限与限制来实现基于设计的绑定风险管控 2.2让人类切实承担起应尽的责任 2.3实施技术管控措施与流程 2.3.1在设计与开发阶段,采用技术控制措施 2.3.2部署前测试代理程序 422.4启用终端用户责任机制 2.4.1不同用户,不同需求 2.4.3将智能代理集成到其工作流程中的用户 47AnnexA:Furtherresources50A""exB:callforfeedbacka"dcasestudies……52Acknowledgements……53执行摘要代理型人工智能是人工智能的下一代演进形态,对用户和企业均具有变革性潜力。与生成式人工智能相比,AI代理能够执行具体操作、适应新信息,并与其它代理及系统进行交互,从而代表人类完成各项任务。尽管其应用场景正在快速演变,但这些代理已通过编码助手、客服代理以及对企业生产力工作流进行自动化等方式,正在深刻改变职场生态。这些更强的capabilities同时也带来了新的风险。代理对敏感数据的访问权限以及对其所处环境进行修改的能力(例如更新客户数据库或进行支付操作)犹如一把双刃剑。随着我们逐步部署具有复杂交互关系的多个代理,系统结果也变得愈发难以预测。人类必须承担相应责任并妥善管理这些风险。尽管现有的可信人工智能治理原则(如透明度、问责制和公平性)仍适用,但这些原则需要在实践中针对智能体加以转化。此外,有意义的人类控制与监督机制需融入智能体人工智能的整个生命周期中。然而,由于在大规模场景下对所有智能体工作流实施持续的人类监督已不切实际,因此需要在这些方面寻求平衡。《面向智能体人工智能的模型化AI治理框架(MGF)》为各类组织提供了关于智能体人工智能相关风险的结构化概览,以及管理这些风险的新兴最佳实践。若风险得到妥善管控,组织便可更加自信地采用智能体人工智能技术。该MGF专为希望部署智能体人工智能技术的组织设计,无论其是通过内部开发AI智能体,还是采用第三方智能体解决方案。基于我们此前构建的模型治理框架,我们为组织在应用智能体人工智能时在四个关键领域所应考虑的因素进行了概述:键在于首先理解代理方行为所引发的风险;这些风险取决于多种因素,例如代理以及代理方的自主权水平。为及早管控这些风险,组织可于规划阶段通过设定适当的边界来限制代理的影响力范围,例如限制其对工具及外部系统的访问权限;此外,组织还可通过实施身份管理及代理访问控制等措施,确保代理的行一旦为代理式人工智能的部署发出“绿灯”信号,组织应采取相应措施确保落然而,智能体的自主性可能会使传统的责任分配机制复杂化——这些机制通常与静态工作流紧密绑定。多个参与者可能涉及智能体生命周期的不同阶段,从而导致责部及与外部供应商之间各利益相关方的责任至关重要,同时应强调采用适应性治理机制,使组织能够快速把握新技术动态,并随着技术演进而及时更新其应对策略。具体而言,“人机协同”模式需进行相应调整,以应对自动化偏见——随着智能体的能力不断提升,这一问题已日益界定代理工作流中需要人工审批的关键检查点(例如涉及重大风险或不可逆操作的环节并定期对人工监督机制进行审组织应通过在整个智能体生命周期内实施各项技术措施,确保人工智能智能体在系统开发阶段,组织应为新的代理组件(如规划模块、工具及尚在不断完善中的协议)配置技术控制措施,以应对这些新攻击面所带来的日益增长的风在部署前,组织应对智能体进行基线安全性和可靠性测试,涵盖整体执行准确率、策略合规性及工具使用率等新维度。评估在部署期间及部署后,由于智能体与环境之间存在动态交互且并非所有风险都能预先预见,因此建议在部署后逐步引入智能体,并辅以持续监控。4.启用终端用户责任机制代理系统的可信部署不仅依赖于开发人员,还依赖于终端用户能够负责任地使用这些代理。为确保负责任的使用,作为一项基本要求,应向用户充分说明该代理的可执行操作范围、数据访问权限以及用户自身应承担的责任。组织应考虑引入分层培训机制,使员工掌握管理人机交互并实施有效监督所需的知识,同时保持其专业及领先企业合作,汇总了当前的最佳实践并提供了真实的实际案例研究;然而,该领域发展本框架,并征集更多案例研究,展示如何将本框架应用于负责任的智能体部署实践。本版本整合了自v1.0发布以来来自60家以上企业的反馈意见。主要变更内容包括:什么是代理式人工智能?•代理组件:将安全与可靠性组件(控制、日志记录及监控功能)作为代理核心组件的一部分进行集成•协议:针对新协议(尤其是代理商务领域)进行了更新代理式人工智能的风险•系统性与多主体风险:新增系统性与多主体风险•案例研究(来自IMDA探讨该框架如何应用于OpenClaw的部署场景。•风险因素:新增用于风险评估的各类因素,包括系统复杂性及第三方解决方案的使用情况•案例研究(来自Dayos、MSD、OCBC)启用有意义的人•代理型价值链:对代理型AI价值链进行优化,将平台提供商与系统提供商或应用程序开发者进行分离•自动化偏差:新增多项防范自动化偏差的措施,例如监测人工干预率及响应时间•案例研究(来自普华永道、腾讯、X0PA)实施技术管控措施与流程•控制项类型:新增了对不同类型控制项及其选择方法的概述(例如:•变更管理:包含针对变更管理流程的建议,旨在避免小规模变更引发过大的影响——尤其是在系统复杂性日益增加的情况下。•案例研究来自CDLxKnovel、Cyb启用终端用户责任机制•交易技艺与业务连续性:增加了关于交易技艺丧失及其对业务连续性影响的详细说明•案例研究(来自AntInternational、Workday)ModelAlGovernanceFrameworkforAgenticAlIntroductiontoAgenticAl61.1什么是代理式人工智能?关于如何定义人工智能智能体尚无统一共识,但某些共同特征是存在的——智能体通常具备一定程度的独立规划、决策和执行动作的能力(例如:浏览网页或创建文件并通过多步操作来实现用户定义的目标.1智能体人工智能系统是指由一个或多个人工智能智能体组成的软件系统,这些智能体既可以独立运行,也可以协同工作。在这一框架下,我们重点研究基于生成式人工智能模型构建的智能体——这类智能体正得到日益广泛的应用。通常,此类智能体采用小型、大型或多模态大语言模型(SLM、LLM或MLLM)作为其“大脑”来做出决策并完成任务。然而,需要指出的是,软件智能体并非一个新概念;此外还存在其他类型的智能体,例如那些利用确定性规则或其他神经网络来做出决策的智能体.2。操作说明记忆力工具1模型理78控制措施(访问控制78控制措施(访问控制、防护栏、人工审批)日志记录与监控检索并存储信息互由于智能体是基于语言模型构建的,因此从一个简单的基于大语言模型(LLM)的应用程序的核心组件入手会很有帮助——智能体在使用时通常也采用类似的方式。1改编自《国际AI安全报告。》2参见世界经济论坛(WEF《AIAgentinAction:评估与治理基础》。3改编自GovTechSingapore发布的《智能体风险与能力框架》,以及CSASingapore发布的《附录草案》。安全部署智能体AI与Anthropic,构建高效智能体)。ModelAlGovernanceFrameworkforAgenticAlIntroductiontoAgenticAl71.模型:anSLM、LLM或MLLM,其作为核心推理与规划引擎,或称智能2.指令:用于定义智能体角色、能力及行为约束的自然语言指令(例如,针对大型语言模型3.记忆:存储在大语言模型(LLM)有时会添加此类信息,以便模型能够从之前的用4.规划与推理:该模型通常经过训练以进行推理和规划,这意味着它能够输出完成某项任务所需的一系列操作步骤。5.工具:工具使智能体能够执行操作并与其他系统进行交互,例如向文件或数据库写入数工具被调用;例如,某个监督智能体可为特定任务调用另一个专业智能体。6.协议:用于智能体与工具及其他智能体之间进行通信的标准化方式。例如,ModelContextProtocol(MCP)旨在规范智能体与工具之间的通信机制;而Agent2AgentProtocol(A2A)则为智能体之间相互通信定义了标准.4。这一领域发展迅速,目前正有更多协议正在开发7.控制机制:控制机制用于限制智能体的行动空间及自主性。尽管存在多种类型的控制机a.访问控制:用于限制代理用户可查看、使用或修改的内容,包括限制对敏感数b.安全护栏:安全护栏用于在智能体执行操作之前、期间或之后对其行为进行监控c.人工审批:需要人工对智能体执行8.Loggingandmonitoring:Recordsagentactions,decisions,andinteractionsacrossallcomponentstoenablemonitoring,debugging,andaccountability.协议。5参见OpenAI的代理化商务协议、阿里支付的代理化移动协议、以及Google的通用商务协议协议。6有关此内容的更多信息,请参阅2.3实施技术控制措施与流程。ModelAlGovernanceFrameworkforAgenticAlIntroductiontoAgenticAl8在代理系统中,通常会部署多个代理以协同工作。这使得每个代理能够专注于特定的功能或任务,和/或并行执行任务。与单个代理可访问多种工具的情况不同,多个代理分别专注于不同任•顺序:智能体在线性或其它结构化工作流(例如图结构)中依次执行任务。每个智能体的输出即作为下一个智能体的输入。•监督者:一名监督代理负责协调其管辖下的各专业代理,并在需要时将特定代理作为工具调用。•Swarm:智能体同时执行任务,在需要时将任务转移给其他智能体。对于多智能体系统而言,并不存在一种普适性的正确架构;而当前所处的任务可能需要采用不同的架构模式或混合架构模式.8对于定义明确且具有分步工作流的任务,采用顺序式架构较为合适;而对于那些需要开展头脑风暴或探索不同研究路径的、更具开放性的任务,则采用群智能架构可能更为有利。1.1.3智能体设计如何影响各智能体的性能边界与功能范围尽管各智能体可能拥有相同的核心组件,但各组件的设计会显著影响该智能体所能执行的操作。在考虑智能体能够执行的操作时,区分这两个的程度(例如通过定义需执行的具体步骤动作空间),测试,Langchain:选择合适的多智能7改编自AWS的《使用StrandsAgents和AmazonNova实现多智能体协作模式》。另请参阅Claude的《构建多智能体系统:何测试,Langchain:选择合适的多智能8例如,请参阅AWS的《AWS安全代理内幕:用于自动化渗透测试的多代理架构》。体架构。9参见WEF,《AIAgentinAction:评估与治理基础。》ModelAlGovernanceFrameworkforAgenticAlIntroductiontoAgenticAl9Action-space•可访问的系统:o仅限沙箱环境:适用于代码执行、数据分析等且不会影响其他任何系统的沙箱化o外部系统:用于支持代理访问外部服务的工具,例如通过第三方预定义API进行•其可针对所访问系统采取的行动:一种新兴的智能体人工智能模式是“计算机使用智能体”,其主要工具为计算机和浏览器。这意味着该智能体能够执行人类使用计算机和浏览器时所能执行的任何操作(例如滚动、点击、输入而无需依赖于特定定义的工具或API。这显著扩展了该智能体可访问的资源及可执行的操作范围.10Autonomy代理的自主性主要取决于其指令以及人类对代理系统所涉及的程度。在企业级部署中,大多数代理系统实现均为混合系统,即将确定性规则与一定程度的自主性相结合。在指令方面,可为智能体分配不同级别的指令:•详细操作指南与标准作业程序(SOP若代理人受命遵循详细的SOP来完成某项任务,其在每个执行阶段所能做出的决策范围将受到限制。•自主运用判断力:当智能体受命依据自身判断完成某项任务时,其在制定计划和工作流程方面将拥有更大的自主权。另一个相关因素是人类参与程度。在与智能体•代理提出建议,人工操作:人工对每个代理操作进行审核并予以批准。•代理与人类协同工作:人类与代理协同执行任务。在关键操作步骤(例如向数据库写入数据或进行支付之前)时,代理需获得人类的批准。然而,人类可随时介入——通过接管代理的工作或暂停代理运行并提出修改请求来实现。•代理执行,人工审批:该代理系统仅在关键步骤或发生故障时(例如删除数据库或进行超过预设金额的支付)需要人工审批。10如需了解更多关于测试计算机使用代理的信息,请参阅案例研究Google×新加坡政府:测试计算机使用代理(如下)。11参见哥伦比亚大学Knight第一修正案研究所——人工智能智能体的自主权层级。•代理自主运行,人工监督:代理在执行任务时无需人工批准,但其操作行为可在事后接受权限,且无法访问外部系需获得授权方可读取特定文较少1.2代理式人工智能的风险智能体的新组件构成了新的风险来源.12这些风险本身并不陌生——从本质上讲,智能体是基于大•规划与推理:由于幻觉或语义不匹配(对用户意图的错误理解智能体可能制定出无法•工具:智能体可能产生幻觉并调用不存在的工具;也可能因调用错误的工具、对正确的工具输入错误参数或以偏见性方式调用工具而引发接,因此通过提示词或代码注入手段亦可操•协议:随着新的代理通信协议不断涌现,这些协议在部署过程中可能存在缺陷或存在安全漏洞——例如,部署一个包含用于窃取用户数据代码的不可信MCP服务器。12参见BCG——当人工智能不再请求许可时会发生什么?13改编自CSA的《关于保障代理式人工智能的安全性之补充草案。》未经授权的操作由于智能体在现实世界中执行操作,当其出现故障时•错误操作:指不正确的操作,例如代理人员在错误的日期安排预约或编写存在缺陷的代码。具体的危害性后果取决于具体操作类型;例如,存在缺陷的代码可能导致安全漏洞被利用,而错误的医疗预约则可能影响患者的健康结局。•未经授权的操作:代理人在其允许的范围或权限之外所采取的操作,例如在未根据明确的人工指令、公司政策或标准操作规程向上级汇报以寻求人工批准•偏见或不公正的行为:偏见或不公正的输出是大型语言模型(LLMs)中一个已知的问题,这可能转化为智能体所采取的偏见性行为。这类行为会导致不公正的结果,尤其是在处理具有不同特征和人口统计学背景的群体时——例如在采购过程中存在偏见的供应商选•数据泄露:指导致敏感数据被暴露或被篡改的行为。此类数据可能包含个人可识别信息或机密信息,例如客户详情、商业秘密和/或内部通讯。这种情况可能源于安全漏洞——攻击者利用智能体泄露私密信息,或智能体因未能识别其敏感性而主动披露敏感数据。尽管这同样是大型语言模型(LLMs)面临的已知风险,但智能体通常拥有更广泛的数据访问权•对互联系统造成的干扰:当代理与其它系统进行交互时,若其遭到攻破或出现故障,便可能对互联系统造成干扰——例如删除生产环境的代码库,或通过发送海量请求对外部系•速度与规模:智能体做出决策的速度使得监管机制难以在未经授权的操作造成损害之前实时检测并阻止这些操作。要求人工审批人员持续监督智能体作为一项保障措施,也可能引ModelAlGovernanceFrameworkforAgenticAlIntroductiontoAgenticAl•级联或复合效应:单一步骤中的错误可能会在后续步骤中传播并放大,从而产生超乎预期的影响。例如,在供应链管理中,初始阶段出现的库存数据误判,可能会导致下游环节进行过量或不足的库存重新订购操作。多智能体系统因交互智能体数量的增加而加剧了这些风险。例如,多智能体系统通常要求各智能体与其他智多智能体系统在多大程度上引入了性质上不同的风险,目前仍在研究中;但•代理系统泛滥:随着更多AI代理在组织内创建并部署,若缺乏集中式管理,可能会导致AI代理出现不受控的激增。这种情况可能引发数据溯源问题、旧版与新版代理之间的不兼容性,以及/或在管理来自不同代际且可能无法有效通信的代理时遇到困难。•协作失败o协调不畅:代理程序在协同工作时,可能因沟通不畅或协调失误而导致非预期的失败。例如,执行同一任务的代理程序对用户意图的理解可能不同,从而朝着不同的目标努力。o冲突:为不同目标而进行优化的客服人员可能会发生冲突。例如,客服人员可能通过提供退款来快速解决客户投诉,而收入保护专员则可能对超过特定阈值的退款申请予以拦截。o串谋:智能体可能会形成看似协调的行为模式,即便并未收到明确的串谋指令。例如,不同组织使用的定价智能体可能会相互观察对方的定价,并最终将价格定得较高而非进行竞争。这种行为已在定价算法领域得到研究15,目前也正在针对基于大语言模型(LLM)的智能体进行研究。•不可预测性及其他涌现行为:当多个非确定性智能体协同工作时,可能的输出结果数量会呈指数级增长。这可能会引发某些涌现行为,而这些行为无法通过单独测试每个智能体来预测。最后,多个智能体既可以在线内进行交互,也可以在不同系统之间进行交互。当智能体跨越系统或组织边界时,要检测并预判各种潜在结果便变得更加困难——尤其是在组织无法对这些外部系统进行白盒访问的情况下。14参见GradientInstitute的《基于受控LLM的多智能体系统风险分析技术》。15参见Bichler、Durmann与Oberlechner合著的《算法定价与算法合谋》。ModelAlGovernanceFrameworkforAgenticAlThefourdimensions《MGFforAgenticAI》基于《MGF(2020)16》中为组织制定的责任人工智能实践框架,通过兴的最佳实践来应对代理人工智能带来的新关切。此举旨在使组织能够在具备必要知识与判断力的前提下,开发并运用代理人工智能。该框架首先旨在协助组织在项目启动阶段对风险进行评估与管控。它强调了在风险评估过程中应考虑的新风险,以及在规划阶段需进行的设计考量,以限制参与方潜在影响范围,并确保参与方尽管智能体可自主运行,但人类仍需承担相应责任。一旦获得部署智能体AI的“绿灯”信号,组织应立即采取措施使人类能够切实承担相应责任。这包括明确定义参与智能体全生命周期的组织内外各方的责任;并采取相应措施,确保在面对自动化偏见时,“人机协同”模式仍能长期保持为确保智能体的安全可靠部署,组织应在整个AI生命周期段,应为AI智能体中的新组件(如规划模块和工具)建立管控机制;基线安全性和可靠性测试;在部署后,应对其与环境之间的动态交互行为进行持续监控。最后,智能体的可信部署不仅依赖于开发人员,也依赖于终端用户。组织有责任促进终端用户的责任意识——即为终端用户提供必要的信息,使其能够恰当使用智能体并实施有效的监督,同时维护其专业技能与基础能力。这四个维度应被视为一个迭代过程。例如,若在实施或监控过程中发现异常情况,组织应重新评估此前确定的各维度;如有必要,还可对风险进行重新评估并进一步界定其范围。这有助于在部署经验带来新洞察时实现持续改进与灵活调整。ModelAlGovernanceFrameworkforAgenticAlThefourdimensions2026年5月,IMDA发布了一项关于OpenClaw负责任部署的案例研究,该研究应用了这一框架,并借鉴了GovTech、CSA以及Grab和微软等曾进行过相关实践的行业企业所积累的实战OpenClaw是一款开源AI代理平台,可通过Telegram和Slack等主流聊天界面作为自主个人助理运行。该平台可自动化执行日常任务,例如文献综述、处理客户咨询或代码调试等。该平台在推出时仅配备有限的安全管控措施,因此对其进行安全部署并非易事。用户关注的主要问题包括:平台成熟度与安全加固措施尚不完善、访问控制与身份验证存在漏洞、敏感数据该框架可用于负责任地部署OpenClaw(及类似)智•请勿在关键业务系统(包括处理敏感数据或金融交易的系统)中直接部署OpenClaw。•避免创建一个拥有无限制访问权限的“全能”代理,而应采用多个具有明确界定、范•请勿在存储敏感数据的主工作设备或个人设备上安装OpenClaw,亦不应授予其对文件及应用程序的无限制访问权限。•采用基于风险的方法,根据数据敏感度与任务关键性确定代理系统的适当自主性水平。•在可行的情况下,通过系统级管控机制来实现人工审批,而非依赖于可能被绕过或被“忽略”的前端防护措施。•在设计与开发阶段,应审查并优化默认设置较为宽松的OpenClaw配置(例如限制消息通道访问权限),并为代理程序配置专用身份标识与凭证。•在部署前,应测试并验证安全控制措施及人机交互功能是否按预期运行;例如,尝试执行被禁止的操作,以确认各项限制措施是否有效。•部署完成后,请确保所有代理操作均被记录且可追溯,并避免让代理在长时间内处于无人监控状态。4.启用终端用户责任机制•开展人员培训,提高员工对自主智能体相关风险的认识,并强化其防范疏忽性误请点击此处查看完整案例研究。ModelAIGovernanceFrameworkforAgenticAlAssessandboundtherisksupfront2.1事前评估并管控风险代理主体带来了新的风险,尤其是在其访问敏感数据的能力以及通过采取行动来改变自身所处环境方面。其适应性、自主性和多步骤的特性也增•确定智能体部署的合适用例,即通过考虑可能影响风险发生概率及影响程度的智能体特定因素来实•通过对代理访问工具和系统的权限设置限制,并构建一个robust的身份与权限管理框架,从而在前期对风险进行管控的设计选择。2.1.1确定代理部署的适用场景在评估某个基于智能体的用例是否适合开发或部署时,应首先识别并评估其风险与收益之间的关系。风险是发生概率(风险显现的概率)与影响程度(风险一旦显现时所造成的影响严重性)的函数。并非所有用例都适合采用智能体方案,对于某些用例,采用确影响因素影响程度(若风险实际发生,则为影响严重程度)描述代理部署所涉及的领域与用例代理部署所处领域及用例中的误差容限水还需考虑智能体所支持的业务流程的数量及其关键性,这些因素会影响智能体故障所造成的代理对敏感数据的访问权限该代理程序是否能够访问敏感数据(例如个人信息或机密数据)。若代理具备此类访问权限,且该代理拥有持久性内存并能够在不同会话间存储敏感数据,则风险将随之增加。需要访问客户个人数据的代理方会带来数据泄露的风险,而仅能访问公开信息的代理方则不存在此类代理对外部系代理是否能够访问外部系统。向第三方API发送数据的代理程序可能会向这些第三方泄露数据,或通过发送过多请求来干扰这些系统;而仅具备相应功能的代理人行为范围代理程序是否仅能读取其有权访问的数据该智能体是否能够利用其可调用的工具完成少量或范围广泛的操作。读取与写入:仅能从数据库读取数据的代理无法对数据库产生影响;而可向数据库写入数据的代理则可以对数据库进行从少数预定义工具中选择操作,而后者可使用能够操作任何用户代理人行为的若代理方能够对数据及系统进行修改,则需评估此类修改是否易于撤销;若修改触发了下游义务(例如签订合同或进行销描述代理人的自主权水平该代理是能够定义整个工作流,还是必须遵循一套明确定义的流程?较高的自主性可能会导致更高的不可预测向智能体提供一份标准操作规务时遵循该规程;而另一种情况则是指示智能体运用其最佳该任务的复杂程度,取决于完成该任务所需的步骤数量以及每个步骤所需的分析深度。较高的任务复杂度同样会增加任务的不可在处理外部信息查询请求代理对外部系该代理是否暴露于外部系统,以及由谁较高的暴露水平会使该代理更容易受到一种仅能访问由可信内部团队维护的内部知识库的代理,与另一种可访问包含不可信数据的互联网的代理相ModelAIGovernanceFrameworkforAgenticAlAssessandboundtherisksupfront由外部方提供或运营的代理该组织是否使用由外部方提供或运营的代理服务。在使用第三方解决方案时,组织应评估其对代理程序的可见度和控制力在何种程度上受到限制。由内部开发并维护的代理系系统复杂度代理系统复杂程度如何,例如采用具有自系统也可能因上述多种因素的共同作用而变得复杂(例如,涉及更高自主性的复杂任务)。较高的系统复杂度可能会引发更具不可预测性和涌现性的行为,因为各组件以非预期的方式相互作用,从而加剧任单个智能体执行顺序化工作威胁建模通过系统性地识别攻击者可能攻破系威胁建模通过系统性地识别攻击者可能攻破系统常见的安全威胁包括内存中毒、工具误用以及权限滥用.17鉴于代理系统可能变得极为复所有工作流和交互图,从而追踪不可信数据在系统中的流动路径,通常非常有效。如需了解如何为代理系统开展威胁建模和污染追踪,请参阅CSA关于保障代理人工智能安全性的补充威胁建模通过生成具有明确行动序列、活动及场景描述的、符合实际情境的威胁事件(这些事件反映了攻击者可能采取的攻破系统的行为从而对风险评估流程进行补充。借助更具相关性的威胁事件,风险评估将更加严谨、可靠,进而有助于制定更具针对性的控制措施一个持续进行的过程,因此应定期更新威胁模17如需更全面地了解代理式人工智能系统面临的潜在安全威胁,请参阅OWASP的代理式人工智能——威胁与缓解措施。ModelAIGovernanceFrameworkforAgenticAlAssessandboundtherisksupfrontDayos是一家企业人工智能自动化解决方案提供商,总部位于新加坡,在美国亦设有业务运营。该公司开发了Hero平台——这是一款基于Oracle、SAP、Workday、NetSuite和MicrosoftDynamics架构构建的智能体平台,可对企业内部的IT管理、会计、人力资源及采购等业务流程实现自动化。Dayos将其原有的ServiceNow实例替换为基于Hero构建的、搭载人工智能技术的工单处理代理系统。此次全面迁移耗时45天,每年为公司节省了121,000美元的旧系统许可费用。该代理系统目前负责处理所有接收到的内部IT请求:它会读取工单,判断其紧急程度和复杂性,随后要么自动解决问题,要么将工单转交至人工客服处理。在上述所有操作正式上线之前,Dayos进行了结构化风险评估。每项IT工单均根据三个问题进行评分:•影响严重程度:若代理在此环节判断失误,后果会有多严重?•可逆性:该操作能否撤销?•人工监督的可行性:由人工在每个步骤对流程进行审核是否切实可行?这些评分用于确定每种票务类型所归属的层级,而该层级则决定了客服人员应采用何种推理Tierwhatfallsherewhattheagentdoes(anddoesnotdo)度、完全可逆密码重置、访问权限申请、状态••由智能体实现全自动化,采用“简单反馈机制”(即“提出-确认-反馈”循环):智能体提出请求,用户进行确认或提出异议,随后智能体据此进行调整,直至工单处理完毕。但采用双周审计机制:每项操作都会生成一条包含分类逻辑与置信度评分的推理链。由指定审核人员对这些双周记录进行抽样审计。由于所有一级操作均可逆,因此错误均可在不造成任何永久性损害的第二档(占全部票数的30%)程度,部分可逆会计科目表更•代理可进行故障诊断,但仅能在获得人类工程师批准后执行操作。该代理采用ReACT策略(一种针对复杂问题设计的多步骤诊断循环):即代理会检查日志、查询相关联的系统、识别可能的根因,并撰写一份包含建议修复方案的诊断摘要;但任何操作在执行前均须经具备相应资质的工程师审核并签字确认。三级(占总署、安全策略变更、权限修改•代理无需直接干预这些操作。在当前智能体人工智能技术的成熟度水平下,生产环境部署与安全策略变更存在较高的自主执行风险。随着保障措施的不断完善并在实际环境中得到验证,此类风险将得到缓解。–例如:多智能体验证与实时异常检测——Dayos将重新评估在特定的Tier3操作场景中采用有界自动化是否可行。2.1.2通过定义代理的权限与限制来实现基于设计的绑定风险管控在选定合适的代理使用场景后,组织可通过为每个代理定义适当的限制与权限策略来进一步管控Agentlimits组织应考虑对以下方面设定限制:•智能体对工具与系统的访问权限:制定最小权限策略,确保智能体仅获得完成其任务所必需的最低限度的工具及数据访问权限.18。例如,编程辅助工具可能无需访问广域网络搜索工具——尤其是当其已拥有经过筛选的最新软件文档访问权限时。围绕功能边界(例如•智能体自主性:对于流程驱动型任务,通常采用标准操作规程(SOPs)和操作规范来提升任务执行的一致性并降低不可预测性.19;针对智能体必须遵循的智能体工作流,应制定类似的SOPs,而非赋予智能体自由定义工作流中每个步骤的权利。•代理的影响范围:设计相应的机制与流程,用于将代理下线并限制其在发生故障时的潜在影响范围。这可包括将代理部署在具有受限网络和数据访问权限的独立环境中——尤其总体而言,应优先采用确定性而非非确定性限值,并通过设计实现限值约束。例如,而非依赖提示语来指导智能体避免调用特定工具,可直接实施访问控制措施,从根本上防止智能体调用该工具。相关内容详见2.3.1实施技术控制与流程。若限值为非确定性或可靠性较低,则应叠加更多监18参见普华永道:“代理型人工智能的兴起及其风险”。19Grab推出了一套基于标准操作规程(SOPs)的LLM代理框架,用于指导AI驱动的执行流程(详见“SOP驱动的LLM代理框架”)。20参见McKinsey的《安全与保障下部署智能体AI:面向技术领导者的实施指南》。OCBC是新加坡历史最悠久的银行,也是东南亚资产规模第二大的金融服务集团,业务遍及新加坡银行的客户关系经理与合规团队将客户提供的财务文件整合成一份结构化的“财•提高分析结果的一致性与完整性•减少文档审阅与起草过程中的人工操作量该智能代理AI系统可解析各类与收入相关的文件(例如:税务申报表、企业年度报告、财产文件、股息分配声明等),并依据内部指引与基准指标生成一份《财富来源备忘录》草案。该系统仅提供决策支持,不自主做出信贷审批、客户准入或风险决策——最终验证与批准仍需由指定的人工审核人员完成。代理工作流通过在代理的自主性上设定限制来从设计层面管控风险:•仅支持任务级自主性:智能体执行范围狭窄的任务(如文本提取、起草、校•无自主触发行为:智能体仅在受预定义工作流触发时执行操作•无决策授权机构:在关键决策节点(包括在收入及财务文件经审核以确保其准确性之后)均需进行人工复核。最终输出结果为咨MSD:通过分级自主性与第三方生态系统边界来管控具主体性的人工智能MSD旨在leveraging先进科学的力量,拯救并改善全球民众的健康生活,为全球范围内最棘MSD在各类应用场景中开发并部署智能体,例如优化关键临床试验方案的制定流程,以及减少临床文档编制和质量审核等劳动密集型任级智能体人工智能治理策略,通过多种方式控制风险——其中包括根据智能体规模对治理流根据机构层级对治理流程进行校准MSD根据五个层级的代理关系构建了多条经风险校准的治理路径,充分考虑了行动与授权范•较低层级的事项通过轻量级治理流程快速处理;中层事项需经由成熟的AI影响评估流程进行审核;而较高层级的事项在适当时需上报至企业架构评审与测试环节。•最高级别的自主性需要采取超越单纯监控的技术措施;在启用更高层级的自主性之除智能体自主性之外,企业级人工智能系统通常还整合了多个第三方SaaS智能体平台。尽管每个第三方智能体平台均在其自身生态系统内完成了验证与测试,但当这些系统尝试执行跨平台操作时——而此类操作可能尚未经过全面测试——风险便会随之增加。这种情况在互操作性框架尚处于起步阶段且逐步成熟的过程中尤为突出。为提升安全与保障水平,MSD采用了隔离策略——即不允许可嵌入式供应商代理程序在MSD的数据及系统中自由活动,而是默认将SaaS工具中的智能代理功能限制在各自的生态系统Agentidentity身份管理与访问控制是当今组织实现人员可追溯性与问责制的关键手段之一。随着组织部署更多代理(包括跨组织边界交互的代理),身份管理需扩展至代理层面,以追踪单个代理的行为并确定每个代理应由谁负责。这是一个不断演进的领域,目前在如何稳健地处理代理身份方面仍存在一些不足。例如,当前的授权系统通常采用预定义的静态权限范围;然而,为了在更复杂的场景中安全运行,代理需要细粒度的权限——这些权限可根据具体上下文、风系统通常基于单一、唯一的个体;这类系统在处理复杂的代理配置时面临挑战,例如当代理代表具有不同权限的多个人类用户执行操作时,或在递归委托场景中(即代理启动多个子代理).21。目前正在开发各类解决方案以应对这些挑战,例如将组织内部身份识别系统扩展至代理,22,或将OAuth2.1等成熟标准集成到MCP中.23。此外,业界还在为代理开发新的标准与解决方案,例如o唯一性:代理应拥有一个唯一且可通过密码学方式验证的身份标识,以便其能够o已关联:该身份标识应与监督人员、人工用户或组织部门绑定,以便进行责任追o根据代理行为所涉及的能力进行区分:应记录代理所执行的不同行为能力(例o归档与集中管理:为防止代理程序部署过于分散,所有代理程序身份(及其相应的权限)应由集中式系统发放并进行跟踪管理。这使组织能够追踪已部署的代理21如需更全面地了解当前身份识别系统在应对代理式人工智能时可能面临的挑战,请参阅《OpenID:代理式人工智能22例如,请参阅Microsoft的“什么是MicrosoftEntraAgentID”,以及AlibabaCloud的23参见MCP,授权支持。24参阅云安全联盟(CloudSecurityAlliance)提出的“代理式人工智能身份与访问控制”框架。管理:一种新方法。o范围限定、最小权限原则、不可转让:权限设置通常应具备范围限定、时间或会话绑定、不可转让等特点,并默认遵循最小权限原则;同时应为获取更高权限的情况设定明确的权限提升路径。o由授权人员的权限所限定:智能体可基于其角色或任务拥有预定义的权限;亦可由授权人员动态设置其权限;或采用上述两种方式相结合。作为一项经验法则,人类用户不应为智能体设置超出其自身授权范围的权限(例如访问超出其权限范残余风险是指在实施了缓解措施后仍存在的风险。需要特别注意的是,即使在已采取措施识别合适的智能体应用场景并为各类智能体设定使用限制的情况下,仍总会存在一定程度的残余风险——尤其是考虑到智能体人工智能技术发展之迅猛。最终,组织应评估并确定其智能体ModelAIGovernanceFrameworkforAgenticAlMakehumansmeaningfullyaccountable2.2让人类切实承担起应尽的责任部署智能体的组织以及负责监督这些智能体的人员仍需对智能体的行为承担相应责任。然而,当智能体的行为是通过交互过程动态、自适应地产生,而非基于固定逻辑时,落实这种问责机制可能会面临挑战。此外,多个利益相关方可能参与智能体生命周期的不同阶段,从而导致问责责任分散。最后,随着人类对能力日益强大的智能体进行监督,自动化偏见——即过度信任自动化系统的倾向(尤其是在该系统过去表现可靠的情况下)——便成为了一个更为值得关注的问题。为应对这些对人类问责制带来的挑战,各组织•清晰划分组织内部及外部的职责分工——通过在整个代理价值链及全生命周期内建立问责链条,并强调适应性治理,从而使组织能够快速把握新动态,并随着技术演进而更新其•实现对智能体进行有意义的人工监督的措施,例如在关键检查点要求人工审批、审计人工2.2.1明确界定组织内部及外部的职责划分然而,与人工智能领域类似,智能体人工智能的价值链涉及多个参与方。组织应考虑在自身内部模具供应商(例组织可在整个价值链中承担多重重叠的角色。例如,一家自行开发代理程序并随后将其部署的组25如需获取参与智能体AI生态系统的所有潜在利益相关方的更完整清单,请参阅CSA与FAR。《AI:智能体AI安全:讨论文件。》ModelAIGovernanceFrameworkforAgenticAlMakehumansmeaningfullyaccountablewithintheorganisation在组织内部,各机构应为不同团队在代理全生命周期中分配相应职责。尽管各组织的架构不尽相人员:人员:负责为组织制定战略决策和高层政策的领导者,例如董事会成员、高管层管理人员、总经理或部门负责人。主要职责可能包括:•为药剂使用设定高层级目标•定义智能体的允许操作使用场景,包括对智能体数据访问权限的限制•制定总体治理方针,包括风险管理框架与问题升级处理流程职位职位:这些岗位负责将利益相关者的需求或业务目标转化为技术智能解决方案,例如:产品经理、UI/UX设计师、AI工程师、软件工程师。主要职责可能包括:•明确代理程序的设计与需求,以及任何功能控制措施或分阶段部署方案•确保代理的可靠实施——即涵盖代理全生命周期的开发、部署前测试及部署后监控•指导用户负责任地使用智能代理产品职位职位:这些岗位负责监督代理系统免受网络威胁的保护,具体工作包括实施和管理安全措施、识别系统漏洞以及响应安全事件(例如:首席安全官、网络安全专家、渗透测试员)。主要职责可包括:•定义基线安防防护措施及“安全设计”模板,供技术团队根据所部署的智能代理系统进行实施或适配。•定期开展红队演练与威胁建模适用对象适用对象:任何利用智能体输出来助力实现组织目标的个人(例如:公司员工进行决策或实现工作流与业务流程自动化)。主要职责可能包括:•药品的伦理与负责任使用•参加必要的培训、遵守使用政策、及时报告客普华永道是由遍布全球137个地区的专业服务企业组成的网络,业务涵盖审计与鉴证、税务与为提升内部工作效率,普华永道新加坡分部的“AI工厂”开发了一款智能应用,可自动完成内部报告中研究与分析章节的起草工作——这一流程以往均需人工操作且耗时费力。用户只需定义所需章节内容,随后系统便会调用由普华永道维护并持续更新(针对监管及市场动态变化)的标准化模板,从原始资料中检索并整合信息,从而该系统采用三个协同智能体,在以顺序工作流为主的架构下运行,并在需要时通过反馈环路下述职责说明了在普华永道新加坡公司更广泛的人工智能治理框架背景下,针对本报告起草用例所实施的运营问责制是如何进行分配的:1.用例负责人–用例适用性与责任归属:确认该用例满足真实的业务需求、适用于预期用途,且与组织的AI管理框架相一致。用例负责人需对应用程序的负责任使用负责,并确保落实适当的人员监督机制。面的评估支持,包括所有相关法规要求;包括就与工具及模型、访问权限以及关联知识库或数据源相关的适当管控措施提供专业建议。3.AIFactory–设计、开发、管控机制与监还会对模型变更进行监控,并通过标准的变更管理流程来管理更新,而非将此职责交由最4.终端用户/领域专家–输出内容的审核与批准:在AI生成的内容投入使用前对其进行审核。内部指南明确指出,AI生成的内容属于初稿,旨在辅助而非替代专业判断。人工审核人员在对输出内容进行依赖或进一步使用之前,会对该内容进行精细化审核与批所有参与智能体人工智能领域的团队均应构建内部能力,以深入理解该技术。通过充分认识智能体技术发展所带来的进步与局限性——例如计算机使用智能体等新应用场景或outsidetheorganisation在部署代理时,组织可能还需要与外部方开展合作,例如模型开发者、代理式人工智能服务提供商,或外部MCP服务器/工具的托管方。在这些情况下,组织应同样确保已落实相应措施,以履行其自身的问责义务。针对特定代理方而言,还需考虑以下因素:•明确组织与外部方之间任何条款与条件或合同中义务的分配情况。特别是,组织应重点关注有关安全措施、履约保证或数据保护的相关条款理部署是否符合其风险承受能力。•解决第三方不透明问题:由外部方提供的代理方往往难以有效监督和管控,这使得理解其依据何种信息、从对话中推断出何种内容,或数据如何存储及使应采取相应措施以确保充分的安全性和可控性,例如:o要求外部方保持透明度与问责制(例如,通过披露代理方的能力及数据处理实o申请并评估技术安全与管控功能(例如强身份验证措施,如限定作用域的API密钥、针对每个代理的身份令牌;以及可观测性功能,如对工具调用和访问历史进行日志记录)。若缺乏此类功能,组织应考虑采用替代方案或内部自研解决方Endusers组织可向其内部或外部的用户部署代理程序。在此过程中,组织应确保向用户提供充分的信息,以便其对组织承担责任,同时提供与用户自身职责相关的所有信息。更多相关信息请参阅“启用终端用户责任”部分(见下文)。ModelAIGovernanceFrameworkforAgenticAlMakehumansmeaningfullyaccountable定义需要人工审批的界组织应明确界定需要人工审批的重要检查点或操作边界,特别是在执行敏感操作之前。这可包括:•高风险操作与决策(例如敏感数据的编辑、在高风险领域(如医疗或法律领域)作出最终决策,或可能引发法律责任的操作)•不可逆操作(例如:永久删除数据、发送通信、进行支付)•异常或非典型行为(例如:代理访问超出其工作范围的系统或数据库;或代理选择的配送路线长度是中位数距离的两倍)。•用户自定义(例如:代理可代表具有不同风险承受能力的用户执行操作)。在组织定义的边界之外,用户还可选择自行设定边界——例如,对金额超过特定阈值的采购操作要求审批。•确保审批请求具有上下文关联性且易于理解,同时清晰阐明相关风险。在向人工请求审批时,应保持请求简短明了,而非提供可能难以解读的冗长日志或原始数据;不过,应包含具有实用价值的补充信息,例如该操作所对应的风险等级或置信度评分。•考虑到所需的人工输入形式。对于诸如访问数据库等简单操作,用户可直接批准或拒绝;对于更复杂的场景(例如在执行前对智能体的计划进行审核由人工在向智能体发出执行指令前对计划进行编辑可能更为高效;对于高风险操作,可要求人工用户在批准或拒绝组织应采取相应措施,确保人工监督的持续有效性——尤其是考虑到人类仍易受警觉疲劳和自动26如需了解其他可考虑引入人类参与的示例,请参阅“人工智能伙伴关系”(PartnershiponAI)及《优先级排序:现实应用》。AI智能体中的时序故障检测。ModelAIGovernanceFrameworkforAgenticAlMakehumansmeaningfullyaccountable•定期审计人工监督的有效性。具体实施方式包括:人类干预率,即人类拒绝或修改智能体行动的频率;较低的干预率可能预人类在回顾操作行为时的反应时间:较短的反应时间可能预示着自动化偏o利用数据分析技术识别出那些决策模式与常规显著偏离的“异常”个体;这种情•对人类监督人员进行培训,使其能够识别常见的故障模式或智能体的局限性(例如:智能体推理不一致、智能体引用过时的策略)。还需注意的是,有时用于解释性的“思维链”推理与人类的推理方式并不相同,因此可能无法对智能体的行为提•确保人类具备评估智能体行为的领域专业知识——例如,用户若使用智能体进行“VibeCode”操作,可能并不具备审查生成代码鲁棒性的软件工程专业知识。最后,应将人工监督与自动化实时监控相结合,以便对任何意外或异常行为进行及时上报。•针对特定已记录事件(例如尝试未经授权访问或多次调用工具失败尝试)实施警报机制•运用数据科学技术识别异常代理轨迹•使用代理来监控其他代理•在审批机制失效时(例如:人工审核人员无法联系到,或智能体尝试执行未制定任何既定如需了解更多信息,请参阅下方“持续测试与监控”部分。腾讯:赋能编码助手中的有意义的人工监督腾讯是一家总部位于中国的跨国科技公司,业务涵盖游戏、即时通讯应用微信以及Hy等人工智能模型。CodeBuddy是由腾讯云开发、其工程师团队实际使用的智能体AI编程系统。该系统可通过自然语言指令自主完成代码的规划、编写、测试及部署,并支持访问文件系统、执行终端命令、调用外部API以及使用MCP工具。CodeBuddy结合了预设的安全默认设置与可配置的权限机制,从而实现具有实际意义的人工监督,同时避免给用户带来过度疲劳感:27参见“Anthropic”;推理模型并不总是会表达出它们的真实想法。ModelAIGovernanceFrameworkforAgenticAlMakehumansmeaningfullyaccountable确定需人工干高风险或不可逆操作:默认的人工审批要求与每项操作的风险等级相•无需审批:o读取(读取文件、列出目录)•需审批:o编辑(修改文件需经审批,仅适用于该文件oMCP(外部工具调用):通过“允许”、“询问”和“拒绝”规则进行管控;针对新连接的MCP服务器,还提供基于信任验证的首次使用自定义:为缓解警报疲劳感,每位用户或组织均可根据项目的具体情境、潜在影响及风险承受能力,自定义设置每个项目的默认权限级别。例如:•对于风险较低的项目(例如内部文档站点或未配备生产权限的原),•高风险项目(例如涉及机密信息、敏感数据、生产基础署流水线或外部工具的项目)应适用更严格的审批要求。助力人类高效评估审批申请解释拟采取的行动:当系统提示执行复杂的Bash命令时,采用通俗易懂的语言进行解释,有助于用户理解其批准的操作内容,并揭示可能产生的任何副作用。•执行命令:mysqldump-uroot-pmy_database|gzip>/backups/my_database_$(date+%Y%m%d).sql.gz•说明:我将对您的数据库进行完整备份,随后实时压缩以节省存储空间,并将备份文件保存至`/backups/`目录中,文件名包含当前日期。系统将提示您输入数据库根密码。原始数据库将保持不变——此操作为只读操作。与自动化监控机制相结合对命令注入进行持续实时监控:当检测到可疑命•开发者此前可能已将某种命令模式添加到白名单中,用于执行常•若后续出现采用类似模式的可疑或风险较高的命令(例如“curlfile”CodeBuddy的防护机制可要求进行新的人工审批。X0PA是一家B2B软件公司,致力于提供基于人工智能的招聘解决方案。其AI代理平式人工智能技术应用于招聘工作流中;这些智能代理已通过分阶段部署方式前的客户群体,具体部署流程如下:1.人工审批节点:在初选、最终筛选等关键环节设置人工审批节点,确保重大招聘决策始终由人力资源招聘专员和招聘经理负责审批。a.可解释性输出:匹配度评分与排序依据可帮助用户理解智能体推荐背后的逻b.培训:培训与入职引导流程用于使用户熟悉系统的各项功能,包括系统的局限i.在招聘过程中,这种情况包括代理人对非标准职业路径存在误解,或对历史数据或结构化数据有限的候选人进行置信度较低的评估。ii.用户还接受过培训,以识别那些面试官可能无法充分捕捉到相关背景3.用户控制与反馈循环:用户可覆盖系统推荐结果并提供反馈。这一功能可用于逐步优化系统性能,从而在用户与X0PAAI智ModelAIGovernanceFrameworkforAgenticAlImplementtechnicalcontrolsandprocesses2.3实施技术管控措施与流程将智能体与基于大型语言模型(LLM)的简单应用程序区分开来的智能体组件,要求在实施生命•在设计与开发阶段,设计并实施技术控制措施。代理新增的组件与功能要求采用全新且定制化的控制措施。根据代理的设计方案,实施诸如访问控制等控制措施;此外,通过强制执行对工具及数据的最小权限访问策略,限制代理对外部环境产生的影响。•部署前对智能体进行安全与保障性测试。与所有软件一样,在部署前进行测试可确保系统按预期运行。针对智能体,应针对整体任务执行开展测试,并在多样化的数据集上进行测试,•在部署时,应逐步rollout代理程序,并在生产环境中对其进行持续监控。代理程序的自主性以及不断变化的环境使得在部署前全面预测和测试所有可能的场景变得颇具挑战性。因此,请逐步rollout代理程序,并在部署后采用实时监控机制,以确保代理程序能够安•在整个产品生命周期内,应实施变更管理与版本控制流程。在复杂的代理生态系统中,对某个代理进行的变更可能会对相互关联的工作流产生连发变更评审流程的触发条件,并据此对所需进行的变更进行分类。组织应为代理式人工智能系统设计并实施技术控制措施,以降低已识别的风险。对于具体智能体而言,除基础软件及大语言模型(LLM)相关控制措施外,还可考虑增加以下控制措施:•新的智能体组件,例如规划、推理及工具•由于攻击面扩大及新协议的出现,安全防护需求日益增加•多智能体交互•结构化(基于规则)与基于模型或提示层的控制方式:o相较于基于提示层的防护措施,建议采用在系统层面通过预定义逻辑运行的确定性防护措施,尤其适用于高风险操作。例如,与直接指示智能体不使用特定工具不同,可以在工具层实施访问控制,从而从根本上防止这些工具被调用,或仅允许以特定方式调用这些工具(例如:仅允许进行读取访问)。同样,若智能体需将该流程构建到工作流中,比仅通过指令要求智能体遵守该流程更为可靠。o与可在系统层面统一定义和执行的保障措施不同,即时层保障措施在不同用户间的定义往往并不一致。ModelAIGovernanceFrameworkforAgenticAlImplementtechnicalcontrolsandprocesseso然而,在某些情况下,当风险难以通过固定规则来界定时,基于模型的保障措施可能最为有效——例如用于检测以不同形式呈现的有害内容。•运行时控制措施:由于代理需实时与用户及系统进行交互,因此在设计阶段配置的静态安全防护措施可能不足以全面识别所有风险。运行时控制措施通过在执行过程中进行监控与干预来解决这一问题,例如采用速率限制来防止工具被过度使用,或通过输入验证在有害响应被执行之前将其拦截。例如,以下是一些面向智能体的示例控制措施。如需获取更全面的清单,各组织可参考CSA的《智能体人工智能安全加固补充草案》以及GovTech的《智能体》风险与规划•智能体需反思其执行的计划是否符合用户指令。•提示智能体总结其理解内容,并在继续操作前向用户请求澄清。•记录代理的处理方案与推理过程,供用户评估和验证。•配置工具以强制执行严格的输入格式•应用最小权限原则,限制每位代理可使用的工具,并通过robust的身份验•适用于数据相关工具:•在适用情况下采用标准化操作规程(例如,当代理方处理金融交易时,应采用代理交易操作规程)。•适用于MCP服务器:o将可信服务器添加到白名单,仅允许代理与该白名单中的服务器进行交o沙箱化任意代码执行多智能体交互•要求智能体通过结构化模式(例如带类型标注的函数调用)而非自由•限制智能体之间的共享内存访问MCP通常被视为一种连接性协议,但其实际可充当治理层——因为它位于代理与其所访问的企业系统之间。组织可考虑在MCP层实施各类管控措施,例如过滤经由服务器传输的敏感数据、记录所有代理与系统之间的交互操作,或仅允许受信任的服务器接入。ModelAIGovernanceFrameworkforAgenticAlImplementtechnicalcontrolsandprocessesTerminal3是一家总部位于香港的数据隐私基础设施服务提供商,其提供安全且保护数据隐私该公司部署了一名财务薪资代理人员,用于自动化其每月薪资发放流程;该流程包括计算总薪资与净薪资、代扣政府规定的缴款额、审核费用报销申请以及在发放全部薪资前对账户详该流程具有较高的风险性,因其涉及处理敏感个人数据及执行金融交易。为确保代理方对这些操作进行安全处理,Terminal3实1.定义代理人在其凭证中的权限范围:在每月薪资结算周期开始前,人力资源总监应向该代理机构颁发一份可验证的意向凭证。c.费用报销申请门槛、符合条件d.合并银行转账的上限金额设定为基本工资加上缓冲幅度,并在每次运行前明确2.通过架构层面将敏感数据与代理环境进行隔离:所有敏感个人数据(例如员工ID、薪资金额及银行账户详情)均专用于终端3的可信执行环境(TEE)中存储,且在任何环节均不会传输至代理端。代理端仅基于非敏感输入进行运算,仅接收不透明的员工参考标识符及分类标志原因作为输出结果。这种架构上的隔离设计意味着代理环境内不存在可通过对抗性输入进行泄露或提取的敏感数据——该风险已通过设计予以消除。3.通过硬件手段落实该权限的边界:所有代理操作均经由TEE中转,并以硬件级速度根据经认证的参数进行验证;超出权限范围的操作(无论源于错误推理或对抗性提示)4.记录防篡改审计追踪:代理程序执行的每个步骤(包括任何受阻的操作)均会被记录在T3N不可篡改账本中——这是一份经硬件验证且可通过密码学方式验证的日志,旨在为事件发生后的任何调查工作提供证据链。CyberSierra:通过技术管控措施提升加油站尽职调查问卷填写的准确性与可靠性CyberSierra是一家总部位于新加坡的公司,作为一家治理、风险与合规(GRC)代理服务该公司开发了TracyAI——这是一款用于自动化响应安全与合规性问卷调查的解决方案。此类问卷通常包含数百道重复性问题,涉及数据保护、访问控制、认证及风险管理等领域。该系统通过一个智能代理系统,对逾期尽职调查问卷、信息安全政策文件以及证据文件夹进行多步骤的检索与逻辑推理。TracyAI已部署于一家总部位于香港的大型金融机构的治理、风险与合规团队中,将原本通常需要超过100小时手动处理的任务缩短至仅需15为降低输出结果不准确及幻觉现象的发生概率,该团队实施了以下技术管控措施:•用于智能体审查其自身输出的反射架构:该智能体系统集成了两种类型的反射o基于LLM评判机制:LLM评判员会根据输出内容是否回答了问题、论证是否与检索到的证据相符,以及是否未引入任何缺乏依据或捏造的主张来对输出随后,该智能体将对自身生成的结果进行审查与优化;若其在三次迭代内未能同时满足两个节点设定的通过阈值,则其轨迹将被终止。•结构化信息用于增强智能体的理解能力:在开发初期,团队发现当智能体引用以下内容时,容易产生不准确的输出:o知识库中存在同一份文档的多个版本,其中部分版为更确定性地解决这一问题,团队并未直接干预智能体,而是将源信息构建为一个图结构,用以展示内部文档、政策及认证文件之间的关联关系。此举使智能体能够理解各类域间证据的关联方式。随后,该图结构通过添加元数据得到增强,从而形成一个上下文图;该图能够确定性地确保仅使用最相关的文档(基于位置、主题StabilitySolutions是一家总部位于美国和新加坡的公司,致力于构建并提供基于区块链技术的基础设施,用于大规模记录、保存及验证数据的完整性。其解决方案包括GlobalTrustNetwork(“GTN”,一款高吞吐量、无需加密技术的公物流领域)以及Monolith——一款用于记录创意作品来源的应用程序。该程序允许创作者对任何文件进行数字指纹识别、生成C2PA说明文件与来源元数据,并嵌入知识产权许可及AIStability部署了其自主研发的智能体AI系统L3;该系统目前包含26个AI智能体,这些智能体全天候运行于公司几乎所有业务部门——包括产品开发、软件工程及市场营销部门。其内部智能体具备执行具体操作的能力,例如:整合并归档全公司范围内的信息、发送每日晨间简报、监控并解决网络问题、充当数字孪生体或个人助理,以及支持工程与开发活动(如项目规划和代码编写)。L3经过优化,可获取尽可能多的信息,从而能够跨团队进行协调(例如,当工程团队正在规划系统升级时,L3会及时通知其相关的计划中的营销活动,以避免造当Stability开发其首个面向外部的智能代理Howard(用于展示L3的各项功能并解答有关L3及公司的疑问)时,该公司意识到该代理面临较高的风险——因其可能遭到不可信第三方的攻击或利用。与面向内部的智能代理相比,此时必须额外部署1.数据访问控制:该代理拥有独立的内存,该内存由从L3接收的信息构成。L3的代理了解该代理所承担的角色及其相关的风险,因此为该代理精心构建了一个专用数据集。2.交互控制措施:智能体通过聊天功能进行交互,可使用Slack或Web界面。Stability的人工员工会在第三方输入内容发送至智能体之前对其进行审核。此举可帮助其过滤出旨在提取敏感信息(如个人数据和商业机密)的提示攻击或侵入性提问。随着智能体在安全性与可靠性方面的持续提升,此项控制措施预计将不再必要。3.代理配置控制措施:通过实施快速防护屏障及明确的人员行为规范,最大限度降低代理程序泄露敏感信息(如商业秘密、个人或机密数据)的可能性。2.3.2部署前测试代理程序组织应在部署代理前对其安全性和可靠性进行测试。这可确保代理按预期运行且各项控制措施切实有效。关于软件及大语言模型(LLM)测试的最佳实践仍然适用,例如对软件系统进行单元测试与集成测试,以及为LLM测试选择具有代表性的数据集和有效的衡量指标与评估方法。组织可参考此前发布的指导文件,例如《基于大语言模型的应用程序安全与可靠性测试入门指南》。•新风险检测:除产生错误输出外,智能体还可能通过工具采取不安全或非预期的行动。组织可考虑对:28进行检测。o整体任务执行:智能体能否准确完成任务o政策合规性:代理人在执行过程中是否遵循既定的标准化操作规程(SOPs)以及在需要时提交人工审批的流程o工具调用:智能代理是否在具备正确权限、输入数据正确且操作顺序正确的前提下,调用了正确的工具o鲁棒性:由于智能体需对现实世界中的各种情境做出反应并进行适应,因此应测试其对错误及边缘案例的响应能力。•对整个智能体工作流进行测试:智能体可无需人工干预而按顺序执行多个步骤。因此,除了测试智能体的最终输出外,还应对其整个工作流(包括推理和工具调用环节)进行测试。•单个智能体及多智能体协同场景下的测试:除对单个智能体进行测试外,还应在多智能体系统层面开展测试,以识别智能体协同运作时产生的任何涌现性风险与行为——例如竞争性行为,或当某个智能体遭到攻破时对其他智能体产生的影响。•在真实或贴近现实的环境中进行测试:由于智能体需在真实世界场景中进行导航,因此测试应在配置得当的执行环境中进行,该环境应尽可能真实地模拟生产环境——例如通过采用工具集成、外部API以及行为与实际部署一致的沙箱环境来实现。然而,组织应根据提前允许智能体访问可能影响现实世界的工具所带来的风险,来权衡对高度真实性的需求。•在不同数据集上进行重复测试:代理的行为本质上具有随机性和上下文依赖性。因此,应开展大规模、跨数据集的测试,以观察任何意外的低概率行为——尤其是那些具有高影响的行为。这需要生成能够覆盖代理可能遇到的各种场景的测试数据集。这些测试还应多次运行,以验证其稳定性(例如,相同的输入和上下文应产生一致的输出并在必要时引入微小扰动。•大规模测试结果评估:在大规模场景下可靠地评估测试结果是大型语言模型(LLM)测试中一个众所周知的挑战。智能体则引入了额外的复杂性——其工作流可能非常冗长,且包含无法被人类或自动化脚本轻松处理的非结构化信息。28如需了

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论