前沿AI企业控制标准首评深度评述(中文译文)_第1页
前沿AI企业控制标准首评深度评述(中文译文)_第2页
前沿AI企业控制标准首评深度评述(中文译文)_第3页
前沿AI企业控制标准首评深度评述(中文译文)_第4页
前沿AI企业控制标准首评深度评述(中文译文)_第5页
已阅读5页,还剩17页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《ControlAssessment》中文译文来源:GuidelightAIStandards(https://guidelight.ai/blog/control-assessment-august-2026)引言在Guidelight对前沿AI公司安全状况的首次评估中,我们发现,各家公司维持对AI控制的基本实践最多只得基于公开资料(系统卡、安全框架、风险报告、技术博客,以及第三方对各家公司合作情况的描述我们依据Guidelight的控制标准,对五家公司——Anthropic、Google、Meta、OpenAI和xAI——的实施情况进行了监控有效性(Monitorefficacy衡量监控的实门控行动(Gatedactions要求监控器在部分高风险AI行动生效前,断路机制(Circuitbreaking在被标记的不当行为激增后,暂时中止AI第三方审查(Third-partyre遏制方案(Containmentplan为遏制目标错位的模型而制定方评分表基于公开信息对Guidelight控制标准实施情况的评估(AnthropicxAI综合评级监控有效性AnthropicxAI第三方审查遏制方案各公司的综合评级为其六项绝对评分的平均值,并按美国GPA制换算为字母等级。原始报告中的图1以记分卡核心要点在各前沿公司中,基础控制实践最多只得到部分实施Anthropic与OpenAI的控制实践最强。两家公司都记录了其内部AI活动的大部分内容,并对这些活动进行不当行为扫描。两家公司也采取了一些步骤来衡量其扫描的有效性,并在发现可疑行为时Google在实施上滞后,但拥有详细的未来计划。其《AI控制路线图》是任何公司发布的关于控制的最具体的前瞻性文件,涵盖预防、检测与遏制。但基于Google的公开披露,我们未发现Google已实施该路线图Meta与xAI的控制实践最弱,具体计划也最少。我们对Meta控制措施的少量了解,主要来自时候为METR《前沿风险报告》所做的披露。xAI则是唯一未参与METR报告的被评能有用的有限功能,但几乎没有证据表明这些功能在内部被广这些公司在两个领域最强:检测与第三方评估。三家公司描述了至少记录部分内部使用情况并进行不当行为扫描不明确:例如,这些评估是否足够频繁以及时发现新出现的危险;各公司是否允许评估人员获得更深层次的实际体系也容易在比公司响应速度更快的攻击风暴面前失守。AI公司将如何应对此类事件甚至更加不明朗;现有最佳尽管今天的分数还有很大提升空间,但我们乐观地认为,更强的控制实践在今天是可以实现的。对每一家被评公动机AI公司越来越依赖自己的AI系统来承担一些最敏感的工作,从保护自身网络免受攻击者入侵,到构建下一代模型。如果这些AI系统目标错位——即其目标与公司意图相悖——除非公司实施正确的控制措施,否则这些系统近期发生的一系列事件凸显了这些风险,AI公司自身也广泛承认了这些风险。幸运的是,专家们越来越一Guidelight依据该标准对前沿A我们评估了什么我们依据Guidelight控制标准中的一组基础实践,对五家前沿AI公司——Anthropic、Google、Meta、OpenAI和xAI——进行了评分。基于各公司发布的材料,我们团队的两名成员依据统一的评分细则独立为每家公司打分,然后(与第三名团队成员一起)讨论分歧,直至达成一致。本评估的信息截至2026年8月18日。为确保我们在引用公开来源时全面且准确,我们将初步评分与理由与各被评公司的员工进行了沟通,并邀请他们指出遗漏的来源、纠正任何误解,或在其愿意时公日志记录—即推理过程被记录并可用分类器扫描(同步监控有效性门控行动断路机制第三方审查标准要求:第三方充分性报告。每季度委托并发布一份聚焦公司控制体系充分性的第三方报告,依据红遏制方案标准要求:遏制响应计划。制定并采纳一项遏制响应计划,用于在检测到模型试图颠覆控制时限制其访问与运详细评分日志记录Anthropic——Anthropic在内部部署中所使用智能体的日志记录与监控覆盖相当可观,但仍存在缺口;此Anthropic对内部部署中所使用智能体的日志记录与监控覆盖相当可观,但这种覆盖存在缺口。Anthropic还Anthropic采用的监控系统覆盖了90%以上的员工[1](但并非全部[集运行监控器[3]。目前尚不清楚日志记录是仅针对这一抽样子集,还是针对全部被覆盖的推理。部分类别的Google——Google对内部使用进行了一定程度Google已实施集成到内部部署智能体中的监控系统[1],并计划将异步监Meta——Meta已描述过计划实施的、涉及日志记录的监控方案。但截至目前,Meta尚未说明其是否记录或告称,其尚无实际运行的监控器来主动检查潜在的错位隐蔽行为[1]。据Meta描述,施,将随着相关模型能力的提升而开发和验证"[1]。这一描述与Meta《先进AI的表述一致。具体而言,Meta写道,评估失控OpenAI——OpenAI在内部部署中记录并监控了99.9%的编码智能体使用情况。对于评估中运行的智能体,OpenAI在内部部署中记录并监控了示其对一款能力特别强的内部模型运行了"通用监控"。然而,评估中其他智能体的日志记录完整程度尚不明OpenAI已公开表示,其为后续监控记录了99.9%的内部编码智能体推理[他类型的内部使用——例如评估期间的使用或非智能体场景下的使用——被同样记录。对于一款代号为Astra依赖记录模型特定评估的安全文档示例。但我们未发现证据表明这些日志构成了99.9%或更多的流量,或它xAI——截至目前,我们没有发现任何证据表明xAI记录或监控内部使用中的推截至目前,我们没有发现任何证据表明xAI记录或监控内部使用监控有效性Anthropic——Anthropic对其监控系统部分组件测量并记录了召回率。但我们未发现对监控系统整体有效性Anthropic对其监控系统的部分组件测量并记录了召回率。但我们未发现对监控系统整体有效性的端到端测量建的数据集、人类红队生成的转录,以及故意训练为错位的模型的行为[2]。然而,当监控系统组件发生变更Google有计划测量召回率[1],并与英国AI安全研究所(UKAISI)合作测量了部分监控器在最坏情况下的OpenAI——OpenAI已公布内部部署中所用监控器的召回率统计,并对监控器标记的转录进行人工OpenAI已公布内部部署中所用监控器的召回率统计,并对监控器标记的转录进行人工审查。然而,尚不清楚OpenAI使用错位行为合成数据集以及84份真实转录,测量了内部部署所用监控器的召回率。它还对被监控器标记为3级或4级严重程度(严重程度范围1–4级)的转录进行人工审查。当被标记的错位形式是新出现xAI——截至目前,我们没有发现任何证据表明xAI测量截至目前,我们没有发现任何证据表明xAI门控行动Anthropic为ClaudeCode开发了"自动模式"功能,允许监控器审查智能体行动并在其被标记为危险时予以阻止。默认情况下,该模式会阻止使系统更难以被监控的尝试,以及修改智能体自身权限的尝试[1]。自动模式被设为ClaudeCode内部部署的默认模式,这意味着修改监控系统和控制相关安全配置通常会受到阻碍[2]。然而,自动模式不审查思维链,且尚不清楚其使用范围有多广,也不清楚它是否始终将监控系统和控制相关安全配置的变更视为门控行动。Anthropic还自动监控拉取请求[3],但该监控器不审查思维链,且尚不Google——Google有计划最终对涉及敏感系统变更的某些行动实施门控,直至这些变更经过彻底审计或审Google有计划最终对涉及敏感系统变更的某些行动实施门控,直至这些变更经过彻底审计或审查[1],但我Meta——我们没有发现证据表明Meta正在使用或有计划使用自动化监控系统对任何监控系统或控制相关安全我们没有发现证据表明Meta正在使用或有计划使用自动化监控系统,对任何监控系统或控制相关安全配置的我们能找到的最相关信息是,Meta在内部代码的检查,以及对有重大影响的变更进行人工介入审查[1]。由于我们担心人工审查的效果不如自动化监控OpenAI——OpenAI为其编码智能体框架Codex开发了"自动审查模式"(auto-reviOpenAI为其编码智能体框架Codex开发了"自动审查模式",监控智能体活动并阻止跨越智能体沙箱边界的危险行为[1]。默认情况下,它会阻止持续削弱安全性的行为,并标记暂时削弱安全性的行为。其范围似乎包括对监控系统的变更[2]。自动审查模式在OpenAI员工内部部署中一定程度被使用,包括大部分Codex桌面端使用[1],但尚不清楚其在命令行智能体中的使用是否广泛。此外,自动审查监控器看不到智能体的思维OpenAI接近门控行动的一种方式是:当其监控系统检测到"可能违反关键安全边界"时,触发"最高优先级警报"[3]。该警报会传呼相关团队,除非响应人员能够判定警报为误报,否则他们"应暂停该活动"。然而,这些警报被描述为异步的,而非对AI采取的高风险行动进行门控:警报旨在"在[OpenAI的]监控系统发现可疑xAI为其编码智能体框架GrokBuild开发了"自动模式",该模式设有监控器以阻止不清楚该模式在内部部署中是否被广泛使用、监控器是否能看到智能体的思维链,或这是否能保护监控系统或断路机制Anthropic——Anthropic为ClaudeCode开发的"自动模式"可被视为断路机制的雏形,在行为被标记后阻止Anthropic为ClaudeCode开发了"自动模式"功能,允许"监控器"审查智能体行动并在其被标记为危险时予以阻止。该模式被设为ClaudeCode内部使用的默认模式[1],在多次拒绝后行[2]。然而,尚不清楚它在Anthropic内部的使用有多普遍。此外,自动模发现任何跨整个系统工作的断路机制的证据——即足够的拒绝次数能够阻止所有风险相关模型采取门控或密切跟踪行动(而不仅仅是触发拒绝的那个智能体)。没有这种机制,智能体可以在每次被中止时启动一个新的Google——Google似乎已考虑过一种与断路机制类似的机制,用于在发现反复的错位行为时触发。但我们未Google似乎已考虑过一种机制,在发现反复错位行为的证据时类似于断路机制地运作[1]。然而,我们未发Google认为监控的一个好处是能够基于反复的错位行为采取某种行动[1]。然而,我们无法找到任何关于当OpenAI——OpenAI为Codex开发的"自动审查模式"在发现可疑行为后会停止智能体运行并上报人工,具备OpenAI为其编码智能体框架Codex开发了"自动审查模式"功能,监控智能体活动并阻止危险行为。它还会在监控器多次拒绝后停止智能体运行,并且该功能用于大部分Codex桌面端使用[1]。然而,它并未在我们未发现任何跨整个系统工作的断路机制的证据:即足够的拒绝次数能够阻止所有风险相关模型采取门控或密切跟踪行动(而不仅仅是触发它们的那一个智能体)。没有这种机制,智能体可以在每次被中止时启动一个xAI为其编码智能体框架GrokBuild开发了"自动模式"功能,该功能会阻止危险工具并在多次拒绝后升级至人工[1,2]。然而,尚不清楚xAI是我们也未发现任何跨整个系统工作的断路机制的证据:即足够的拒绝次数能够阻止所有风险相关模型采取门控或密切跟踪行动,而不仅仅是触发它们的那一个智能体。没有这种机制,智能体可以在每次被中止时启动一个第三方审查Anthropic——Anthropic参与了关于前沿AI模型错位风险的第三方报告,该报告包含第三方红队测试结果及Anthropic参与了关于前沿AI模型错位风险的第三方报告,该报告包含对Anthropic控制系统进行第三方红队测试的结果。然而,该报告未就AnthropAnthropic参与了METR《前沿风险报告》(2026年2月至3月)[控系统进行了红队测试,询问了Anthropic员工其监控系统的覆盖范围,并评估了两款内部部署的模型能否欺骗METR的监控器。该报告评估了所有前沿内部部署模型的整体风险水平,并考虑了每家被评公司的监控系统。Anthropic还与英国AI安全研究所(UKAISI)合作,对一个同步的内部智能体编码监控器进行了红Google——Google参与了关于前沿AI模型错位风险的第三方报告,其中包含对Google员工关于其控制实Google参与了关于前沿AI模型错位风险的第三方报告,其中包含对Go然而,该报告未纳入对Google控制系统进行第三方红队测试的结果,也未就Google控制体系的充分性得Google参与了METR《前沿风险报告》(2026年2月至3月),其中包括回答关于其监控系统覆盖范围的问题,并评估一款内部部署的模型能否欺骗METR的监控器[1]。这被纳入对内部部署模型整体风但并未得出专门针对Google的结论。Google还与英国AI安全研究所(UKAISI)合作,对一个异步推理监控器进行了红队测试[2],但我们未发现证据表明这些结果已纳入任何关于Google控制系统充分性的第三方Meta——Meta参与了关于前沿AI模型错位风险的第三方报告,其中包含对Meta员工关于其控制实践的访Meta参与了关于前沿AI模型错位风险的第三方报告,其中包含对Meta员工关于其Meta参与了METR《前沿风险报告》(2026年2月至3月),其中包括回答关于其监控题,并评估一款内部部署的模型能否欺骗METR的监控器[1]。这被纳入对内部部署OpenAI——OpenAI参与了关于前沿AI模型错位风险的第三方报告,其中包含对OpenAI员工关于其控制实OpenAI参与了关于前沿AI模型错位风险的第三方报告,其中包含对Op然而,该报告未纳入对OpenAI控制系统进行第三方红队测试的结果,也未就OpenAI控制体系的充分性得OpenAI参与了METR《前沿风险报告》(2026年2月至3月),其中包括回答关于其监控系统覆盖范围的问题,并评估一款内部部署的模型能否欺骗METR的监控器[1]。这被纳入对内部部署模型整体风xAI——我们不知道xAI参与过任何第三方控制评估,也没有任何迹象表明其未来我们不知道xAI参与过任何第三方控制评估,也没有任何迹象表遏制方案Anthropic——我们没有发现证据表明Anthropic制定了遏制响应计划,或有计划采纳此类计划。我们没有发现证据表明Anthropic制定了Anthropic在其8月风险报告中,未将限制其某款模型的部署列为调查和响应错位及控制事件流程的可能结Anthropic曾因安全事件响应以外的原因推迟、限制或撤销模型部署。在发现Mythos预览版可能具备强大的通用能力后,Anthropic将其内部部署推迟了24小时以进行对齐审查,并最初仅向一小部分客户开放,之险行动的更强阻止控制"发布,之后才在内部部署中进行限制较少的推广[3]。Anthropic还应美国政府的要Google——Google已开始制定遏制响应计划——描述了此类计划应包含的内容,但我们未发现其已完成计划Google已开始制定遏制响应计划——描述了此类计划应包含的内容,但我们未发现其已完成或采纳此类计划力,并列出了实现这一目标所需解决的技术问题[1]。然而,我们未发现Google已实METR《前沿风险报告》(2026年2月至3月)称:"Meta报告称,目前部署后审查既包括系统性监控,也OpenAI在发现安全事件后,曾多次暂停或终止重要工作负载,包括内部模型部署与训练。它还描述了在恢复这些工作负载之前将采取的措施。然而,我们未发现其已就未来何时及如何响应错位OpenAI描述称,作为其对OpenAI-HuggingFace事件的响应的一部分,其暂停了新模型训练部署,直至达到更高的安全保障[1,2]。作为该响应的一部分,它还描述了允许事件调查人员在通过监控检测xAI——xAI表示若模型构成不合理风险将将其关闭,但我们未发现关于何时及如xAI表示,如果模型构成不合理的风险,将将其关闭,但我们未发现关于何时及确定]允许系统继续运行会显著且无理由地增加灾难性事件发生的可能性,[xAI]可暂时完全关闭相关系统,直局限性我们的分数可能低估了一家公司已实施的安全实践,因为我们的评估仅依据公开信息。例如,如果一家公司已实施强大的断路系统但未对外披露,该公司将不会因此获得分数。我们曾为各公司提供机会,在其可能影响评分时披露额外信息,但与可以接触保密信息的审计相比,缺乏这种接触是我们方法的一然而,也存在各公司安全实践被公开记录、从而被我们的分数高估的可能。总体而言,各公司的声明尚未经任何第三方核实或审计,可能因疏忽或其他原因而不准确。我们的程序未必能识别这一缺陷,尽管它可能提高公司错本评估只涵盖Guidelight安全标准的一部分,尽管低分确实表明存在严重缺陷。我们所评估的六项实践是基础性的,但并非控制标准的全部。一家公司即使在这六项上得分很高,其在控制方面的整体表现仍可能不足。控制也只是公司整体安全表现的一部分,因此这些分数应与其他因素(例如其在我们的透明度标准上的表现)一我们的控制标准设定的是最低实践要求,因此即使完全达标,也尚不足以构成充分的控制方法。在某些方面,行业尚未就已知有效的实践达成共识;在其他方面

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论