【AI原生组织】2-从L0到L6:Agent自治等级与组织成熟度地图
- [从 L0 到 L6:Agent 自治等级与组织成熟度地图](#从 L0 到 L6:Agent 自治等级与组织成熟度地图)
-
- [一、为什么所有框架都收敛到 5-6 级](#一、为什么所有框架都收敛到 5-6 级)
-
- [1.1 一个有趣的一致性](#1.1 一个有趣的一致性)
- [1.2 为什么是 5-6 级而不是 3 级或 10 级](#1.2 为什么是 5-6 级而不是 3 级或 10 级)
- [二、DeepMind 的关键洞见:能力和自治是两回事](#二、DeepMind 的关键洞见:能力和自治是两回事)
- 三、统一自治地图:把主流框架拉齐
-
- [3.1 统一演进表](#3.1 统一演进表)
- [3.2 逐级解读](#3.2 逐级解读)
- [四、大多数企业卡在 L1-L2,鸿沟在 L2→L3](#四、大多数企业卡在 L1-L2,鸿沟在 L2→L3)
-
- [4.1 当前行业位置](#4.1 当前行业位置)
- [4.2 L2→L3 的鸿沟有多大](#4.2 L2→L3 的鸿沟有多大)
- [4.3 跨越鸿沟的三个前置条件](#4.3 跨越鸿沟的三个前置条件)
- [五、Addy Osmani 的双维度补充:单 Agent 自治 × 多 Agent 编排](#五、Addy Osmani 的双维度补充:单 Agent 自治 × 多 Agent 编排)
-
- [5.1 为什么需要第二个维度](#5.1 为什么需要第二个维度)
- [5.2 三个时代的划分](#5.2 三个时代的划分)
- 六、总结
- 下一篇预告
- 参考资料
从 L0 到 L6:Agent 自治等级与组织成熟度地图
上一篇我们厘清了 AI 原生组织的定义和三大支柱。但组织不是一夜之间变原生的------从完全人工到完全自治,中间有一段很长的演进路径。
2026 年,多个权威机构各自给出了 Agent 自治等级框架,虽然细节不同,却惊人地收敛到了相似的结构。本篇把这些框架拉齐,建立一张统一的"自治地图",并回答两个关键问题:大多数企业卡在哪?跨越的鸿沟在哪里?
一、为什么所有框架都收敛到 5-6 级
1.1 一个有趣的一致性
2023 年到 2026 年间,至少六个独立机构提出了 Agent 自治等级框架。它们互不知道对方在做什么,但最后的结果高度相似:
| 框架 | 发布时间 | 级数 | 组织原则 |
|---|---|---|---|
| DeepMind Levels of AGI | 2023 | 5×5 | 能力与自治作为正交轴 |
| Vellum Six Levels | 2025.12 | L0-L5 | 自主推理与独立性递增 |
| CSA Agentic Trust Framework | 2026.01 | L0-L5 | 谁控制行动执行 |
| NIST AI Agent Standards | 2026.02 | 风险模型 | 风险维度的成熟度模型 |
| Addy Osmani Autonomy Levels | 2026.07 | L0-L5 | 单 Agent 自治 × 多 Agent 编排 |
| NVIDIA Agentic Autonomy | 2025.02 | 0-3 | 复杂度与决策能力 |
所有框架都借鉴了自动驾驶的 SAE J3016 分级标准------不是因为偷懒,而是因为自治的演进逻辑是通用的:从辅助到接管到完全自主,中间必须有清晰的"谁负责"边界。
1.2 为什么是 5-6 级而不是 3 级或 10 级
3 级太少,无法区分"AI 建议、人类执行"和"AI 执行、人类审批"这种关键差异。10 级太碎,每级之间的差异不够显著,实操中没人能记住。
5-6 级恰好覆盖了从"完全人工"到"完全自主"之间的关键里程碑,每一级都有明确的控制权转移点------这正是组织治理最关心的。
二、DeepMind 的关键洞见:能力和自治是两回事
在展开具体等级之前,必须先讲一个容易踩的认知坑。
Google DeepMind 在 2023 年的论文《Levels of AGI》中提出了一个影响深远的主张:能力(Capability)和自治(Autonomy)是正交的两个轴 (DeepMind, arXiv:2311.02462, 2023)。
这是什么意思?
高自治
↑
| 专家级 Agent 全自主 Agent
| (能力强+独立执行) (能力强+自设目标)
|
| 工具 顾问
| (能力强+人类控制) (能力强+人类决策)
|
低自治 ←───────────────────────→ 高能力
关键洞见:一个模型可以非常强大(能力轴很高),但仍然只在"工具"或"顾问"级别运行(自治轴很低)。反过来,一个能力一般的模型,也可以被赋予很高的自治权------只是风险会急剧上升。
这个洞见为什么重要?因为它打破了一个常见的错误推理:"模型变强了 → 可以给它更多自主权了"。
模型变强只意味着能力提升,不等于它应该获得更多自治权。自治权的赋予取决于组织是否建好了足够的护栏、审计和升级机制。
DeepMind 的自治轴从低到高分为五级:
| 自治级别 | 人类角色 | AI 角色 |
|---|---|---|
| Tool | 完全控制 | 被调用时才工作 |
| Consultant | 做决策 | 提供建议 |
| Collaborator | 联合决策 | 共同参与 |
| Expert Agent | 审查结果 | 领域内独立执行 |
| Autonomous Agent | 设定目标 | 自主完成全流程 |
三、统一自治地图:把主流框架拉齐
下面把 Vellum、CSA、Addy Osmani 三个最有实操价值的框架拉齐,合成一张实用地图。
3.1 统一演进表
| 等级 | 名称 | 核心特征 | 人类角色 | Vellum | CSA | Addy Osmani |
|---|---|---|---|---|---|---|
| L0 | 规则执行 | 固定规则,无智能 | 操作者 | Reactive | No Autonomy | Assist |
| L1 | 辅助响应 | 能推理建议,不行动 | 决策者 | Context-Aware | Assisted | Supervised action |
| L2 | 有条件代理 | 提出方案,人类批准后执行 | 审批者 | Tool Use / Goal-Oriented | Supervised | Scoped task |
| L3 | 任务高度自治 | 边界内自主多步执行 | 监督者 | Observe-Plan-Act | Conditional | Goal-driven |
| L4 | 岗位级自治 | 完成完整岗位,持续运行 | 目标设定者 | Fully Autonomous | High Autonomy | Multi-agent orchestration |
| L5 | 完全自主/管理 | 自设目标或 Agent 管理 Agent | 战略与治理 | Creative | Full Autonomy | Managed by exception |
3.2 逐级解读
L0:规则执行(追随者)
无智能可言,仅遵循"若满足 A 则执行 B"。类似 Excel 宏或 Zapier 工作流。规则需人工更新,一旦条件变化就失效。传统自动化系统大多在这一级。
L1:辅助响应(执行者)
AI 具备初步自主性,能处理输入、生成响应。但缺乏控制循环------没有记忆、没有迭代推理、不会主动行动。大多数 Copilot(GitHub Copilot 内联补全、ChatGPT 对话)在这一级。
L2:有条件代理(行动者)
AI 不再只是响应,而是能执行------调用工具、获取数据、整合结果。但每一步关键操作都需要人类审批。这是 2026 年大多数企业生产系统的实际位置。 Claude Code 的默认模式、Cursor 的 Agent 模式、GitHub Copilot Edit Mode 都在 L2(Zylos.ai 分析, 2026-03)。
L3:任务高度自治(操作者)
关键跃迁:AI 不再需要每步审批,而是在预设边界内自主完成多步任务。它自己规划步骤、评估输出、调整策略。任务完成后停止。
这是当前工程与治理的最大鸿沟所在。从 L2 到 L3,意味着人类从"审批每一步"变成"只在边界条件触发时介入"。
L4:岗位级自治(探索者)
AI 能完成完整岗位------持续运行、跨会话保留状态、自主触发行动。在 Addy Osmani 的框架中,这一级开始进入多 Agent 编排 :编排者将任务分派给多个子 Agent,各自在独立环境中工作(Addy Osmani, 2026-07-03)。
Devin 2.0 代表了当前 L4 的前沿(Zylos.ai 分析, 2026-03)。
L5:完全自主/管理(创造者)
AI 自设目标、自建工具、管理其他 Agent。人类只在"例外"时介入------Addy Osmani 称之为"按例外管理"(management by exception)。
但 CSA 在框架中明确声明:L5 当前不适合企业部署 (CSA Agentic Trust Framework, 2026-01)。
四、大多数企业卡在 L1-L2,鸿沟在 L2→L3
4.1 当前行业位置
综合多个来源的数据,2026 年中期的行业全景如下:
| 等级 | 典型产品/场景 | 行业占比 |
|---|---|---|
| L0 | 传统自动化(Zapier、脚本) | 大量 |
| L1 | Copilot 类(GitHub Copilot、ChatGPT) | 大多数 |
| L2 | Claude Code 默认模式、Cursor Agent | 企业主流 |
| L3 | 部分垂直场景(客服、数据分析) | 少量 |
| L4 | Devin 2.0、前沿探索 | 极少 |
| L5 | 理论/实验阶段 | 几乎为零 |
Vellum 的判断更加直接:当前多数 AI 应用停留在 L1-L2 。即便 GPT-5 发布,如果未突破"任务完成后自动停止"的局限,仍只能停留在 L2------是高级协调工具,而非自主智能体(Vellum, 2025-12)。
4.2 L2→L3 的鸿沟有多大
为什么从 L2 到 L3 是最大的工程与治理鸿沟?因为这里发生了一个根本性的控制权转移:
L2:人类审批每一步 → 错误可以立即纠正
L3:AI 在边界内自主执行 → 错误可能在多步之后才被发现
这个差异在数学上有多严重?Zylos.ai 的分析给了一组冷酷的数字(Zylos.ai, 2026-03):
每步 85% 的准确率,10 步链路的总成功率只有 20%。
这就是 CSA 特别强调"组织成熟度必须与 Agent 自治等级匹配"的原因。如果组织没有建好可观测性、降级机制和升级路径,直接跳到 L3,风险会急剧上升。
Gartner 的预测更加尖锐:到 2027 年,40% 的智能体项目将因成本超支被取消 (Gartner, 2026)。而 65% 的企业多 Agent 项目因协作失控、状态不一致或死锁而失败。
4.3 跨越鸿沟的三个前置条件
从 L2 到 L3 不是"模型更强就行",而是需要三个前置条件同时满足:
| 前置条件 | 具体要求 | 不满足的后果 |
|---|---|---|
| 可观测性 | 每一步执行可追踪、可审计、可回溯 | 错误发生后无法定位原因 |
| 降级机制 | 边界条件触发时自动回退到人类审批 | Agent 在边界外"硬开"导致事故 |
| 升级路径 | 明确什么情况必须交给人类 | Agent 不知道何时该"求助" |
这三个条件对应了上一篇讲的"有护栏的自治"------权限护栏、审计护栏、升级护栏。组织成熟度和 Agent 自治等级必须匹配,否则就是在没有护栏的高速公路上放手让车自动驾驶。
五、Addy Osmani 的双维度补充:单 Agent 自治 × 多 Agent 编排
5.1 为什么需要第二个维度
前面讲的所有框架都是单维度的------从低到高一条线。但 Addy Osmani 在 2026 年 7 月提出了一个关键补充:自治和编排是两个应该分开的维度 (Addy Osmani, 2026-07-03)。
他的观察是:几乎所有关于自治的讨论都混淆了两个问题:
-
我们让单个 Agent 离开视线多远?(agency 轴)
-
我们协调多个 Agent 的能力如何?(orchestration 轴)
高编排 ↑ | 管理者 Agent 按例外管理 | (调度多个Agent) (Agent管理Agent) | | 单Agent独立工作 多Agent并行 | (自己干完) (各自隔离) | 低编排 ←──────────────→ 高自治
5.2 三个时代的划分
Osmani 把六个等级归纳为三个"时代",每个时代对应一种工作方式:
| 时代 | 等级 | 人类角色 | Agent 角色 |
|---|---|---|---|
| 辅助时代 | L0-L1 | 驾驶员 | 助手,等待指引 |
| 委派时代 | L2-L3 | 监督者 | 负责有限任务,人类验证结果 |
| 编排时代 | L4-L5 | 例外处理者 | 系统自主调度,人类只在失败时介入 |
关键观察:一个正常的工程日里,我们会在多个等级之间来回切换。写关键代码时用 L0(AI 只补全),重构时用 L2(AI 提方案我们审批),跑测试时用 L3(AI 自主执行测试套件)。
自治等级不是"越高越好",而是"什么任务配什么等级"。
六、总结
核心结论:
- 主流框架收敛到 5-6 级:Vellum L0-L5、CSA L0-L5、Addy Osmani L0-L5,都借鉴自动驾驶分级,核心是"控制权何时从人转移到 AI"。
- DeepMind 的正交洞见最关键:能力和自治是两个轴。模型变强不等于应该给它更多自主权------自治权的赋予取决于护栏是否到位。
- 大多数企业卡在 L1-L2:这是企业主流位置。L2→L3 是最大的工程与治理鸿沟,因为控制权从"逐步审批"变成"边界内自治"。
- 跨越鸿沟需要三个前置条件:可观测性、降级机制、升级路径。缺任何一个,L3 就是灾难。
- Addy Osmani 的双维度:单 Agent 自治 × 多 Agent 编排。L4 开始进入编排时代,系统自主调度多个 Agent。
- L5 当前不适合企业部署:CSA 明确声明。Gartner 预测 40% 项目因成本超支被取消,65% 因协作失控失败。
适用边界:
- ✅ 适合:需要评估自身 Agent 部署成熟度的组织,用它做差距分析和路线规划。
- ⚠️ 慎用:不要把等级当"攀爬目标"------不同任务配不同等级才是正确用法。
- ❌ 不适合:期望直接跳到 L5 的组织------护栏、可观测性、治理体系不到位,高自治等于高风险。
下一篇预告
本篇建立了自治等级地图。但等级只是骨架------真正的血肉在于:当 Agent 自治等级提升时,组织结构、岗位分工、管理方式会怎么变?
下一篇:【AI原生组织】3-人机混编:AI 与组织的协同进化方向
- 组织结构从金字塔到网络,中间经历了什么?
- "人 + Agent 混编"的岗位到底怎么设计?
- 管理者的新角色:从"管人做事"到"设计目标与护栏"
- 复合智能怎么落地:让组织越用越聪明
我们下一篇见。
参考资料
- DeepMind: Levels of AGI (arXiv:2311.02462, 2023)
- Vellum: The Six Levels of Agentic Behavior (2025-12-03)
- CSA: Agentic AI Autonomy Levels and Control Framework v2.0 (2026-01)
- Addy Osmani: Agentic Autonomy Levels (2026-07-03)
- Zylos.ai: AI Agent Autonomy Levels --- Taxonomy, Trust Calibration, and the Path to Full Autonomy (2026-03-28)
- NVIDIA: Agentic Autonomy Levels and Security (2025-02-25)
- 新加坡 IMDA/CSA: 智能体 AI 治理示范框架 (2026-01)
- 腾讯云开发者社区: Agentic AI 参考架构深度解读 (2026-05-26)
- Gartner: AI Agent 项目预测 (2026)
本文属于「AI原生组织」系列文章第 2 篇
AI原生组织 系列:
- 1-AI原生组织到底是什么?
- 当前文章(本文)
- 人机混编:AI 与组织的协同进化方向(待发布)
- 个人进化指南:在 AI 原生时代找到自己的位置(待发布)
- 落地路线图:从今天的组织走向 AI 原生(待发布)