当前位置: 首页 » 资讯 » 科技头条 » 正文

Google DeepMind团队Nature发文:重新定义AI Agent治理

IP属地 中国·北京 编辑:郑浩 学术头条 时间:2026-08-13 18:11:13

AI Agent 的有效治理,正面临一个根本性困境

因难以刻画不同 AI Agent 特有的属性差异及其各自部署后的影响,我们不清楚应该依据什么判断其风险,进而分别实施有效的监管。

无论是欧盟《人工智能法案》的风险分级,还是美国国家标准与技术研究院(NIST)的 AI 风险管理框架,现有框架在设计上都以“系统整体风险等级”为出发点,缺乏对 AI Agent 核心属性的精细刻画。尽管自动驾驶领域曾借助自动化等级分类(SAE J3016)建立了一套有效的监管标准,但将其直接套用于通用 AI Agent,则远远不够。

同时,随着大语言模型(LLM)与工具调用、推理协议、外部记忆等“脚手架”结合,不断进化的 AI Agent 引发了更为迫切的问题。这些系统已能在数十个真实世界场景中独立执行任务,而人类对其能力边界和治理要求的理解,仍严重不足。

今天,Google DeepMind 团队在一篇发表在权威科学期刊 Nature 上的观点文章中提出了 Agentic Profile(智能体画像)框架,从自主性(autonomy)、效能(efficacy)、目标复杂度(goal complexity)和泛化(generality)四个维度系统刻画了 AI Agent 的核心属性,并以 AlphaGo、ChatGPT-3.5、Claude 3.5 Sonnet(含工具调用)及 Waymo 自动驾驶汽车为案例,为不同类型 AI Agent 绘制了具体画像,进而推导出了差异化的治理要求。

文章链接:https://www.nature.com/articles/s41586-026-10805-z

研究团队表示,通过梳理四个维度上的关键变化轴与连续性,Agentic Profile 可为开发者、政策制定者及公众提供有效 AI 治理的参考依据。

01

不能只看“是不是Agent”

“Agent”在计算机科学中并不是一个新概念。在强化学习、机器人、自动驾驶、多 Agent 系统等领域中,Agent 都有不同的定义。随着 LLM 成为 Agent 的认知核心,这一概念的边界也变得更加模糊。

在这项工作中,研究团队系统梳理了 7 种具有代表性的 Agent 定义。尽管表述各不相同,但它们反复涉及几个共同要素:系统能够感知环境、追求目标、执行行动,并在一定程度上摆脱外部的逐步控制。

图|计算机科学中 7 个代表性 AI Agent 定义

然而,问题在于,这些定义大多只能帮助人们判断一个系统是否具备 Agent 特征,却难以进一步回答一个更关键的问题:它究竟具备多强的行动能力?不同的两个系统都可以被称为 Agent,但其中一个只能在棋盘模拟环境中落子,另一个却能够调用支付 API、操作计算机,甚至直接控制物理设备。如果治理制度仅采用“Agent”与“非 Agent”的二元分类,就会掩盖这些关键差异。

因此,研究团队将 AI Agent 定义为:能够在有限外部控制下,跨越一个或多个领域,执行复杂且具有影响力的目标导向行动的系统。在此基础上,Agentic Profiles 不再试图寻找一条简单的 Agent 分界线,而是为每个系统绘制一张由四个坐标维度构成的动态画像。

02

Agentic Profiles的四个坐标维度

尽管上述关于 AI Agent 的定义各不相同,但都指向了四个共同的核心属性,这构成了 Agentic Profiles 的基础。

1.自主性:Agent 能在多大程度上脱离人类指令行动

自主性衡量的是 Agent 在没有外部指令或控制的情况下独立执行动作的能力。研究团队借鉴了自动驾驶领域已经成熟的分级思路将 Agent 的自主性划分为 6 个等级,从 A.0(无自主性,完全依赖操作者)到 A.5(完全自主,任何情境下都无需监督)。

图|AI Agent 的自主性分级

自主性越高,人类能够介入的决策节点通常越少,错误也越容易在连续行动中累积。一个高自主性的电网控制 Agent 如果误判了电压波动,可能在监督者理解第一条警报之前,已经连续执行多次错误的电力重路由。

因此,高自主性系统需要的不只是输出过滤器,还包括完整的行动日志、可扩展监督机制、硬编码停止条件和紧急关停能力。传统的“人在回路中”也不能只停留在制度描述上,还必须验证人类是否有足够的时间、信息和权限进行有效接管。

2.效能:Agent 的行动能造成多大的实际影响

效能指 Agent 感知并因果性地影响环境的能力。研究团队提出了一个“效能矩阵”:一个维度是 Agent 在环境中的因果影响等级(从仅能观察,到能造成局部临时改变,再到能全面重塑环境),另一个维度是环境类型(完全模拟、经中介的现实环境、直接物理环境)。两者叠加后,“中等控制力”的 Agent,如果作用于物理环境(如自动驾驶),其效能等级可能与作用于模拟环境的“高控制力”的 Agent 相当。

图|AI Agent 的效用分级

这一设计揭示了一个经常被忽视的事实:相同的模型能力,在不同部署环境中可能形成完全不同的风险水平。一个只能推荐交易策略的金融 Agent,与一个能够直接调动数百万美元资产的 Agent,不能采用相同的治理要求。医疗系统是提供诊断建议,还是能够通过联网设备直接实施治疗,也对应不同的效能等级。

3.目标复杂性:Agent 能处理多复杂的目标结构

从 GC.0(无目标) 到 GC.5(无边界目标复杂性,可自行生成目标结构、解读欠明确的指令),目标复杂性刻画的是 Agent 分解、协调、追求目标的能力。

研究团队指出,目标复杂性可以通过分层规划、计划长度、多目标优化中的权衡取舍等多个角度来量化。例如,通过对比 AI 系统与人类完成同类任务所需的步数,间接衡量其复杂目标处理能力。

图|AI Agent 的目标复杂度分级

这一维度与治理的关系在于:目标越复杂,外部观察者越难验证每一步行动是否仍然符合原始意图。系统可能通过规格博弈找到形式上满足指标、实质上偏离设计目的的路径。

对于这类 Agent,仅检查最终输出往往不够。研究团队提出,需要结合机械可解释性、行动级唯一标识、持续审计和标准化 Agent 通信协议,追踪内部目标表示及其外部行动链。

4.通用性:Agent 能跨多少领域发挥作用

通用性指 Agent 在不同角色、场景、认知任务之间迁移能力的强弱,分级从 G.0(无应用场景) 到 G.5(完全通用,覆盖人类全部认知任务域)。目标复杂性和通用性虽然经常同时出现,但在分析上是相互独立的两个维度。例如,一个管理全球空中交通的系统可能目标极其复杂,却只作用于单一垂直领域;而一个功能简单的家庭助手,尽管每项任务都很基础,却可能跨越多个生活场景运作。

图|AI Agent 的泛化分级

从治理角度看,低通用性系统通常可以采用领域专属规则,而高通用性 Agent 的风险可能跨越医疗、金融、教育和劳动市场等多个部门。此时,单一行业的治理机制可能无法覆盖系统性外溢影响。

03

四个典型系统的Agentic Profiles

基于以上四个维度,研究团队为 AlphaGo、ChatGPT-3.5、Claude 3.5 Sonnet(含工具调用)及 Waymo 自动驾驶汽车 4 个代表性 AI 系统绘制了具体画像。

如上图,AlphaGo 能独立评估棋局并执行策略,具有中等自主性,但受限于围棋环境,影响范围和能力边界都较小;ChatGPT-3.5 具备较强的跨领域通用性,但需要用户发起请求,无法直接行动,对现实世界的影响有限;加入工具调用后,Claude 3.5 Sonnet 可以浏览网页、调用 API 并连续执行任务,自主性、效能和目标复杂度明显提升。这表明,工具接入可能实质性改变 Agent 的治理属性;Waymo 的通用性较低,但能实时决策并直接作用于物理世界,因此具有更高的自主性和现实影响力。

这些案例表明,不能沿着一条单轴线把系统排列为“更 Agent”或“更不 Agent”。AlphaGo 的自主性高于 ChatGPT-3.5,但通用性更低;Waymo 的通用性低于 Claude 3.5,却具有更直接且难以逆转的物理影响。

04

不是“越能干就越需要治理”

Agentic Profile 框架最核心的治理洞见,或许是对一个常见直觉的纠正:更强的 Agent 不一定需要更多的治理,关键在于“是什么样的能力”、“需要什么样的治理”。

以自主性为例。A.4 级系统(如 Waymo)在异常情境下人类监督来不及介入,复合错误可能在监管者察觉之前已经级联扩散。针对这类系统,trace-log 审计、可扩展监督(scalable oversight)和 kill switch 是必需的技术治理机制。

效能维度则影响法律问责链的构建。对于效能分数较低、完全运行在模拟环境中的系统,风险评估只需考虑数据污染和沙盒逃逸等数字安全问题;而对于高效能的物理环境 Agent(如机器人),开发者和监管者需要建立更强的问责链条和可审计性要求。

目标复杂度的提升,则带来透明度问题。目标越复杂,系统行为越难以验证。因为高复杂度目标为“规范博弈”创造了条件:系统可能发现出人意料的方式来实现被给定的目标,甚至颠覆原始意图。研究团队指出,这需要机理可解释性技术的支撑,以及追踪单次行动的唯一 ID 机制和标准化 Agent 通信协议。

泛化能力则决定了治理措施的“覆盖面”:高泛化 Agent 可能在多个领域产生系统性风险,需要跨部门协调的集中治理框架;低泛化 Agent 仅在特定领域存在风险,领域专项监管通常足够。

05

不足与未来方向

当然,这项研究目前停留在概念层面,尚未给出可操作的定量指标。未来,如何将效能测量为“赋权”度量值,如何借助层级规划理论将目标复杂度形式化,以及各维度分级粒度的验证,都是有待系统性解决的问题。

此外,谁来设计 Agent 画像、谁来决定各级别的划定标准、谁来制定相应的治理规范,基础性标准和最佳实践仍有待建立。

另一个开放问题是问责链的构建。当 AI Agent 在不同情境中行使能动性时,如何将责任清晰地映射到开发者、部署方、集成商和平台所有者,仍需进一步的法律和伦理研究,尤其是 Agentic Profile 与侵权责任、受托责任和监督义务之间的关系。

Agent 治理面临的关键转变,是从“模型能回答什么”转向“系统能够自主完成什么、通过何种权限完成,以及会对哪个环境产生后果”。Agentic Profiles 的价值正在于把这些差异拆解为四个可以分别讨论的维度,为技术审计、权限管理、责任分配和监管分级提供了一套共同语言。

更多技术细节,详见原论文。

标签: agent 维度 自主性 目标 效能 系统 通用性 复杂性 画像

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。