伙伴端(PC) 客户端(PC) 思法汇成小程序 全民打假小程序 伙伴端小程序

AI安全治理框架3.0解读:从管模型输出到管智能体行为,六大核心变化与实务指引

2026 年 9 月 14 日,全国网络安全标准化技术委员会在国家网络安全宣传周期间正式发布《人工智能安全治理框架 3.0》。这是该框架自 2024 年推出 1.0 版、2025 年迭代 2.0 版后的第三次更新,一年一迭代的节奏,既对应了 AI 技术的快速演进,也体现了监管 “随行伴跑” 的治理思路。


需要明确的是,这份框架属于标准化技术指引文件,并非法律或行政法规,不具备强制约束力,但在行业中具备三重实际作用:一是监管部门评估企业 AI 安全水平时的重要参考依据;二是后续行业标准、监管规则乃至立法的重要参考来源;三是 AI 相关纠纷中,判断企业是否尽到合理安全注意义务的参照标准。整体而言,它是国内 AI 安全治理的重要风向标。


一、迭代背景:技术形态升级推动治理重心转移


前两版框架的治理核心围绕大模型展开,重点关注模型训练数据合规性、输出内容安全性,对应的风险主要是生成内容层面的问题。


随着技术发展,智能体(Agent)逐步成为主流应用形态。与传统对话式大模型不同,智能体具备自主任务规划、工具调用、跨系统协作和长期记忆能力,不再只是 “回答问题的工具”,而成为 “执行任务的主体”。其风险也从 “输出错误信息” 延伸到 “做出错误行为”,比如越权访问系统、绕过安全规则、未经授权执行高风险操作等。

与此同时,具身智能、RAG (Retrieval-Augmented Generation)检索增强生成等技术的落地,也让风险边界从数字世界延伸到物理世界,从训练数据扩展到全链路信息来源。原有面向静态模型的治理思路,已经无法覆盖新的风险场景,这是 3.0 版框架升级的核心动因。


二、六大核心变化梳理


变化一:治理对象从“大模型”扩展为“智能体”独立单元


这是3.0版最核心的调整。此前的治理逻辑以大模型为核心,围绕训练、推理、输出全流程设置安全要求;新版框架首次将智能体作为独立的治理对象,增设专门的智能体风险管理框架。


框架重点关注智能体的“非预期自主行为”,包括未经授权获取系统权限与外部资源、绕过安全防护机制、欺骗安全评测、隐藏真实能力、拒绝停止执行任务等场景。对应的治理思路也从内容合规,延伸到身份管理、权限控制、行为审计、工具调用安全等系统安全领域。


变化二:安全防护从 “静态护栏” 升级为 “运行时全流程管控”


前两版框架的核心防护手段是 “输入输出护栏”,即在模型输入前做内容过滤、输出后做安全拦截,类似出入口安检,安全测评也多集中在上线前阶段。


3.0 版框架要求在智能体的完整工作流中设置多层检测与拦截点,对任务规划、工具调用、运行环境、记忆读写、输出结果实施动态控制,实现全程安全监测。


其中明确了几项具体要求:

• 为智能体分配唯一身份标识,落实身份鉴别与最小权限管理;

• 删除文件、对外发送敏感数据、修改系统配置等高风险操作,设置强制人工二次确认;

• 审批流程异常时遵循“失败即关闭(Fail Closed)” 原则,默认拒绝执行,避免风险漏过;

• 工具调用前做安全验证,防范供应链风险;

•  运行全程留痕,确保行为可感知、可追溯、可审计。


这一调整的核心逻辑是:智能体的风险是动态持续的,静态的单次测评无法覆盖运行过程中出现的所有问题,安全保障需要贯穿开发、测试、部署、运行、迭代的全生命周期。


变化三:数据风险边界扩展,提出 “认知供应链安全”


此前的框架中,数据安全治理的重心是训练数据集,重点核查数据来源合规性、投毒风险与隐私泄露风险。


3.0 版将风险治理范围扩展到智能体运行过程中依赖的所有外部信息源,包括外挂知识库、网页检索数据源、第三方工具返回结果、智能体长期记忆等。


框架特别提到一类新型风险:通过批量发布倾向性文章、虚构评测结果、假冒专家身份等方式,污染 AI 联网检索与 RAG 过程中的外部信息,进而误导其最终判断与决策。这类风险被定义为 “认知供应链安全”—— 训练语料、知识库、搜索结果、工具返回数据共同构成了 AI 进行判断决策的信息基础,一旦信息源被污染,风险会沿着检索、推理、执行的链条持续传递。


这也意味着,企业做 AI 合规不能再只审查训练数据,RAG 知识库、联网数据源、第三方插件返回数据等都需要纳入合规审查范围。


变化四:网络攻击风险从 “人用 AI 攻击” 延伸到 “AI 自主攻击威胁”


三版框架对 AI 网络攻击风险的界定呈现清晰的演进路径:

• 1.0 版:关注人类利用 AI 开展漏洞挖掘、恶意代码生成、网络扫描等攻击行为,AI 本质是提升攻击效率的工具;

•  2.0 版:强调 AI 降低了攻击门槛,推动攻击行为自动化;

•  3.0 版:单独提出 “自主化网络攻击威胁”,即智能体在执行正常任务的过程中,可能突破规则边界,自主形成攻击意图并完成操作。


针对这一场景,框架并未直接界定法律责任归属(按照现行法律,AI 本身不具备法律主体资格,责任由开发者或运营者承担),但明确了治理方向:必须加强智能体行为的实时监测与控制,将风险防控前置,而非事后追责。


这也传递出明确的信号:企业不能再以 “仅提供工具,用户使用行为与己无关” 作为完全抗辩理由,而需要证明自身已采取合理技术措施,防范智能体被滥用或自主产生危险行为。


变化五:具身智能成为独立风险域,安全延伸至物理世界


3.0 版框架正式将具身智能列为独立的风险类型,也就是具备物理实体与执行能力的 AI 系统,比如智能机器人、工业智能设备、自动驾驶系统等。


框架将具身智能风险细分为环境感知、物理执行、人机交互、群体协同四类,对应的安全措施也突破了传统软件安全的范畴,扩展到传感器抗干扰测试、极端工况仿真测试、碰撞保护与紧急停机机制、异常节点隔离与全局安全熔断、群体失控应急演练等。


这一变化意味着 AI 安全的边界已经从数字世界延伸到物理世界,风险后果也从信息泄露、内容违规,升级为可能造成人身伤害与财产损失。对应的合规工作也会涉及产品质量、安全生产、侵权责任等多个法律领域。


变化六:监管模式从 “静态分级” 转向 “动态沙箱监管”


2.0 版框架建立了 AI 风险五级分类体系(低、一般、较大、重大、特别重大),根据风险等级实施差异化监管,本质是静态的评级管理。


3.0 版在此基础上进一步提出构建 “柔性、动态、可控的沙箱监管环境”,核心思路包括:

• 分行业制定入箱标准,适配不同领域的风险特征;

• 根据风险等级采取不同强度的监测与干预,支持动态调整测试期限、范围与场景;

• 探索可控场景下的责任豁免与测试结果跨部门认可。


这种模式与智能体动态运行、持续调用外部能力的技术特征相匹配,监管方式从 “一次评估定终身” 转向 “动态持续监测”。对企业而言,沙箱既是约束也是创新空间,可以在受控环境下开展高风险应用的测试迭代。


三、企业合规落地参考方向


结合框架要求与当前行业实践,企业可从以下几个方面推进合规落地:


1.      搭建智能体专项治理体系

针对已上线或规划中的智能体业务,建立专门的安全管理制度,梳理智能体可执行的操作清单,按风险等级分级管控;明确高风险操作必须经过人工审批;为智能体分配唯一身份与最小权限,全量记录操作日志,支持溯源审计。


2.      建立运行时持续安全监测机制

将上线前静态测评与线上动态监测分开,静态测评仅作为准入条件,不能替代运行时监控。设置智能体异常行为告警规则,比如短时间内频繁尝试越权访问、大量调用高危接口、异常修改日志等,触发告警后及时处置,必要时启动熔断机制暂停执行。


3.      构建认知供应链安全管理能力

分类管理 AI 依赖的所有信息来源,对外部知识库、联网检索数据源、第三方插件建立可信度分级与校验机制;将认知供应链安全纳入供应商尽职调查范围,在合作协议中明确安全义务与责任划分。


4.      强化开源与第三方供应链安全管控

使用开源智能体框架、第三方插件与工具前,完成安全评估;建立组件漏洞跟踪机制,持续跟进开源社区的风险通报;供应链安全要求写入采购合同,明确风险责任。


5.      具身智能业务补充物理安全管控

涉及机器人、工业智能设备等具身智能业务的企业,将物理安全纳入 AI 安全评估体系,完成传感器抗干扰、紧急停机、极端工况等测试;制定失控应急处置预案,定期开展应急演练;提前评估产品质量与人身侵权风险,完善风险保障措施。


6.      主动了解沙箱监管机制,前置合规准备

金融、医疗等高风险领域的 AI 应用,可提前研究对应行业的沙箱准入标准与监管要求,梳理自身风险清单、监测方案与应急预案,为后续申请沙箱测试做好准备。需要注意的是,沙箱的责任豁免仅针对可控场景下的测试行为,故意侵权、造成重大危害的情形仍需承担相应责任。


四、总结


总体来看,《人工智能安全治理框架 3.0》标志着国内 AI 安全治理进入了 “行为治理” 的新阶段。治理对象从静态的大模型扩展到动态的智能体,安全边界从数字世界延伸到物理世界,监管方式从单次评级转向动态持续监测,核心逻辑始终贴合技术发展的实际风险。


对企业与合规从业者而言,框架的迭代也意味着专业要求的提升:AI 合规不再局限于数据安全与内容合规,还需要覆盖系统安全、供应链安全、产品安全等多个领域。提前布局对应的治理能力,既是应对监管要求的基础,也是应对技术迭代风险的核心保障。


声明:本文仅供参考,不构成具体法律意见。如遇实际纠纷,建议咨询专业律师获取个案指导。


本文作者:上海申浩律师事务所沈佳越律师

相关文章