本文收录于专栏 agent智能体系列 ------ 专栏系统覆盖 AI Agent 概念、框架与工程实践,点击订阅可跟踪后续更新。本系列共 2 篇,本文是第 2 篇(概念与评估);第 1 篇《智能发展史七十年》讲这条概念链的历史来路。
你需要给产品做定位或选型,却分不清"智能原生""智能体原生""Agent Harness"这组词------接了大模型 API 算不算智能原生?Cursor 和 Devin 差在哪一步?这篇给你移除测试判据、五概念对照表、四组实例对比(Cursor vs Devin、手机两代、国内产品图谱)、四层嵌套图、12 维评估清单和 33 条概念中英对照表,事实全部标注一手出处。读完你能给任何产品定位它在范式迁移中的位置,直接拿评估清单做横向打分。
关键字: 智能原生;智能体原生;Agent Native;Agent Harness;Agent Enable;移除测试;智能体评估;概念中英对照

目录
- §1. 相关教程与核心文献
- §2. 一句话先分清:五个概念各自回答什么
- §3. 智能原生(AI Native):移除测试与五个特征
- §4. 智能体原生(Agent Native):从"能对话"到"能执行"
- §5. 举例说明区别:编程、手机与国内产品图谱
- §6. 两个支撑概念:Agent Enable 与 Agent Harness
- §7. 概念层级:四层嵌套与 12 维评估清单
- §8. 概念中英对照表(33 条)
- §9. 局限与展望
- §10. 结语
§1. 相关教程与核心文献
| 资源 | 链接 | 与本文关系 |
|---|---|---|
| Levels of AGI(Google DeepMind) | arXiv:2311.02462 | §9 AGI 分级与趋势判断参照 |
| Bostrom《Superintelligence》 | 牛津大学出版社 | §9 对齐思想的来路 |
| Anthropic MCP 公告 | anthropic.com | §6 Harness 层工具协议标准 |
| Gartner 2025 十大战略技术趋势 | gartner.com | §9 Agentic AI 趋势与风险预测 |
| Cognition Devin 发布博客 | cognition.com | §5 智能体原生代表产品 |
文中其余事实(Claude Code、STEPX Neo、Kimi Work、vivo 蓝心 Harness 等)的出处统一列在文末"参考来源",正文用〔N〕编号对应。概念的历史来路(为什么此刻出现这组词)见本系列第 1 篇《智能发展史七十年》。
§2. 一句话先分清:五个概念各自回答什么
这组概念经常被混着说,但它们在评估对象 和评估层级上不一样:
| 概念 | 回答的问题 | 典型能力 |
|---|---|---|
| 智能原生(AI Native) | 系统是否以 AI 为核心底座 | 模型推理、自然交互、数据闭环、Agent 能力 |
| 智能体原生(Agent Native) | 系统是否原生支持自主 Agent 运行 | 规划、工具调用、多步闭环、多 Agent 协同 |
| 智能体赋能(Agent Enable) | 如何让某个系统具备 Agent 能力 | 接入工具、记忆、权限、编排、观测 |
| AI 赋能(AI Enable) | AI 有没有真正增强原有系统 | 总结、问答、生成、推荐 |
| 智能体框架(Agent Harness) | Agent 运行时本身好不好用、可不可控 | 工具调用、循环控制、状态管理、安全护栏 |
汽车类比:智能原生是"整车电动化",智能体原生是"整车为自动驾驶设计",Agent Enable 是"给车装上自动驾驶能力"。
层级关系一句话:智能原生是上层大框架,智能体原生是它的高阶子集------智能原生 = AI 是系统底座;智能体原生 = 在智能原生之上,系统原生支持自主循环智能体运行。
§3. 智能原生(AI Native):移除测试与五个特征
3.1 定义与判断标准
智能原生 = AI 是系统底座。 国内官方标准译法为 AI Native / 智能原生,指产品、系统、企业从架构、交互、数据流到业务流程,都以大模型为核心底座构建。
判断标准是移除测试(Removal Test):把 AI 拿掉后------
- 如果产品核心价值崩塌,就是智能原生;
- 如果只是体验降级,通常只是 AI 增强(AI Enabled / AI Enhanced)。
这是最直观的判据:WPS 去掉 AI 还是 WPS(降级),但去掉 AI 的 Devin 就不存在了(崩塌)。
3.2 五个核心特征
| 特征 | 含义 |
|---|---|
| 架构原生 | 大模型推理、向量库、智能调度嵌入核心层 |
| 交互原生 | 以自然语言、意图驱动为主,UI 变轻 |
| 进化原生 | 有数据闭环,越用越聪明 |
| 智能体驱动 | 能规划、调用工具、多步执行 |
| 概率化设计 | 内置校验、重试、护栏和人审(软件从"确定性工程"变为"概率性工程") |
在智能原生系统里,人仍然是最终操作者:AI 深度参与理解、生成、建议,但关键动作(点击、确认、购买、合入、发布)由人完成。
§4. 智能体原生(Agent Native):从"能对话"到"能执行"
4.1 定义
智能体原生 = 在智能原生之上,系统原生支持自主循环智能体运行。
"Agent Native" 一般指以智能体为中心来设计系统、产品和工作流,而不是把 AI 只当作一个对话窗口或插件。它强调应用天然具备感知、规划、工具调用、记忆、协作和自主执行能力。
4.2 和传统应用的区别
| 维度 | 传统应用 | Agent Native 应用 |
|---|---|---|
| 交互方式 | 用户点击、填表、搜索 | 用户给目标,Agent 拆解并执行 |
| 能力边界 | 固定功能 | 可调用工具、API、数据库 |
| 工作模式 | 被动响应 | 主动规划、持续跟进 |
| 状态管理 | 页面/会话状态 | 长期记忆、任务状态、上下文 |
| 可靠性要求 | 功能稳定即可 | 需要可观测、可回滚、可审计 |
4.3 关键组成
- 任务规划(Planning):能把"帮我整理竞品报告"拆成搜索、筛选、总结、输出等步骤。
- 工具使用(Tool Use):可以调用搜索、代码执行、数据库、CRM、文档系统等。
- 记忆系统(Memory):包括短期上下文、长期用户偏好、历史任务状态。
- 多 Agent 协作(Multi-Agent Collaboration):不同角色分工,比如研究 Agent、写作 Agent、审核 Agent。
- 安全与治理(Safety & Governance):权限控制、工具白名单、敏感操作二次确认、执行日志。
- 评估与观测(Evaluation & Observability):不仅看回答质量,还要看任务完成率、成本、延迟、失败恢复能力。
4.4 相比普通智能原生的增量能力
智能体原生回答的不是"系统有没有 AI",而是"系统是否原生支持智能体自主感知、规划、执行、反思和协作"。通常还要具备:
- 循环闭环:支持多轮迭代、自省、快照和失败恢复。
- 标准工具交互:工具、API、系统能力被封装成 Agent 可安全调用的接口。
- 安全门禁:语法校验、预演、输出契约、人工审批等嵌入执行链路。
- 多智能体协同:能动态创建子 Agent、分配任务、仲裁分歧。
- 自进化机制:Agent 能根据反馈调整策略、提示词或执行阈值。
4.5 常见落地形态与开发要点
落地形态:个人助理型(邮件、纪要、日程、检索)、研发/办公型(代码补全、文档生成、数据查询、报告自动化)、业务流程型(客服工单、销售线索、运营报表)、数据智能型(查数、解释指标、图表、异常定位)。
开发时要重点关注:
- 不要只接一个 LLM API,要设计工具层、状态层、评估层。
- 把"能做什么"和"不能做什么"写清楚,避免过度自主。
- 重要操作要有人审、回滚、日志追踪。
- 用真实任务做评估,而不是只看单轮问答效果。
- 成本、延迟、失败重试机制要提前设计。
§5. 举例说明区别:编程、手机与国内产品图谱
5.1 编程领域:Cursor / Claude Code(智能原生) vs Devin(智能体原生)
智能原生例子:Cursor / Claude Code。 核心是:AI 深度嵌入开发工作流,但执行主体仍然是人。
比如你在 Cursor 里说:
把 data_processor.py 里的同步函数改成 async/await,并更新所有调用处。
它会理解项目代码结构、找到相关文件、给出修改建议或直接编辑、帮你运行测试解释报错;但你仍然需要决定改不改、什么时候合入、是否发布。它已经非常"AI 原生":没有大模型这个产品就不成立;但它通常不会自动创建分支、自动合 PR、自动部署生产环境。人仍然是最终操作者。(Claude Code 于 2025-02-24 随 Claude 3.7 Sonnet 以研究预览形式发布〔19〕,Anthropic 自述定位为"第一方 agentic coding 工具"------在本文概念光谱上属智能原生偏智能体一侧,执行主体仍是发起会话的开发者。)
智能体原生例子:Devin。 差异在于:你给一个高层目标,它自己规划、执行、验证、修复,并在沙盒里完成端到端交付。
比如你说:
建一个带用户注册、商品展示和支付功能的网站,并部署到 Netlify。
Devin 会规划技术栈、写前后端代码、运行测试、调试报错、调用浏览器或部署平台,最后交付一个可访问的应用。这里人更像"架构师/验收者",Agent 更像"执行工程师"。(Cognition 2024 年 3 月发布,自称"首个 AI 软件工程师"〔13〕。)
一句话区分:Cursor 帮你更快写代码,Devin 尝试替你完成一个完整开发任务。
5.2 手机领域:系统级 AI 助手(智能原生) vs 智能体手机(智能体原生)
智能原生例子:手机里的 AI 助手。 华为小艺、OPPO 小布、vivo 小 V、三星 Galaxy AI、Apple Intelligence 已经深度嵌入操作系统,能总结通知、润色文字、识别图片、安排日程。但典型工作流是:你问"帮我查一下明天去上海的高铁"→ 它给出方案 → 你再点进去买票、改签、加日历。最终操作仍然由你完成。
智能体原生例子:阶跃星辰 STEPX Neo / 努比亚 AI 智能体手机。 目标不是"多一个 AI 功能",而是让智能体成为系统的执行主体。你说"帮我订一张明天上午去上海的高铁,并把行程加到日历,出发前提醒我",它理解意图、查询车次和价格、调用购票服务、写入日历、设置提醒,只在支付等关键节点让你确认。
事实核对〔20〕:STEPX Neo 于 2026-07-13 在上海发布会亮相,搭载智能体原生操作系统 Step AOS(Step Agentic-native OS)、内置个人智能体 Amoo,官方称"全球首款大模型原生智能体手机",是首款也是当时唯一通过《人工智能终端智能化分级》系列国家标准 L3 级测试的智能体手机(L3 为当时开放测试的最高级别);Step AOS 提出记忆、决策与执行、安全三大核心特征及"可信、可见、可控、可逆"安全框架。
一句话对比:智能原生手机帮你理解信息、给建议,但你要自己点;智能体原生手机跨应用替你完成一整件事,你是任务发起人和最终审批人。
放到开发环境(VSCodium 一类)里也类似:AI 只帮你补全代码、解释报错,是智能原生;它能自动改代码、跑测试、提交 PR、等你审核后再合并,就更接近智能体原生。
5.3 国内产品图谱:智能原生一档
共同点:没有大模型,产品核心价值会明显下降;AI 深度进入交互、数据流和业务流程,但人通常仍是最终操作者。
| 代表 | 为什么算智能原生 |
|---|---|
| WPS AI / WPS 灵犀 | AI 深度进入文档、表格、PPT、合同、数据分析等办公流程 |
| 鸿蒙生态 / HarmonyOS 6 | 大模型、系统服务、原生应用、跨设备协同都围绕 AI 重构 |
| 海尔智家大脑、华为鸿蒙智家 | 用垂域大模型做感知、记忆、决策和主动服务 |
| 联想"AI 原生公司"、词元工厂 | PC、服务器、智能体、云端协同围绕 Token 生成流转消耗重新组织 |
| 阿里云百炼、百度文心千帆、腾讯元器 | 模型、工具、工作流、知识库和企业系统集成的开发平台 |
5.4 国内产品图谱:智能体原生一档
更强调:用户给目标,智能体负责规划、调用工具、跨应用执行、持续跟进并交付结果。
| 代表 | 为什么更接近智能体原生 |
|---|---|
| 智谱 AutoGLM | 远程操作云设备、跨 App 完成任务 |
| Kimi Work | 可挂载本地文件夹、浏览网页、运行代码;K2.6 模型 Agent Swarm 最多 300 个子智能体并行、4000 协作步(上一代 K2.5 为 100 个/1500 步),Kimi Work Beta 2026-06-03 内测〔21〕 |
| MiniMax Agent 2.0 | 面向长程复杂任务,桌面端支持本地文件操作与网页自动化 |
| 阶跃星辰 STEPX Neo | Step AOS + Amoo,《人工智能终端智能化分级》国家标准 L3 级测试唯一获证智能体手机〔20〕 |
| vivo 蓝心小 V Pro / 蓝心 Harness | 6000 多项原子能力转为 Agent 可调用工具(OriginOS 7,2026-09-16 发布),支持超万种任务〔22〕 |
| 腾讯 WorkBuddy、阿里 QoderWork、豆包工作 | 桌面智能体接入本地文件、办公应用和企业系统,从"辅助生成"走向"替用户执行工作流" |
| 实在 Agent、易鑫 Agentic 平台 | 前者无 API 跨系统 RPA 式执行;后者汽车金融场景长链路任务自主交付 |
数据口径说明:表中三家已独立核实的产品参数(STEPX Neo 的 L3 证书、Kimi Work 的 300 子智能体、vivo 的 6000 项原子能力)有公开报道佐证〔20-22〕;其余产品的定性描述属厂商宣传口径,选型时应以实测为准。
场景化参考:办公场景优先看 Kimi Work、QoderWork、WorkBuddy、WPS 灵犀;平台能力看智谱 AutoGLM、阿里百炼、百度千帆、腾讯元器;端侧智能体关注 STEPX Neo、vivo 蓝心 Harness、鸿蒙系统。
§6. 两个支撑概念:Agent Enable 与 Agent Harness
6.1 Agent Enable(智能体使能 / 智能体赋能)
Agent Enable 指"为智能体赋能/使能",核心是把模型、工具、记忆、权限、编排等能力系统性地接入 Agent,让它从"能对话"变成"能执行"。 它通常不是顶层架构范式,而更偏工程动作和能力建设。常见四种语境:
| 语境 | 含义 | 例子 |
|---|---|---|
| 能力使能 | 给 Agent 接入工具、记忆、搜索、代码执行、数据库 | 让 Agent 能查库、调 API、写文件 |
| 治理使能 | 加入安全、权限、审计、校验、恢复机制 | 防止 Agent 越权调用或误操作 |
| 基础设施使能 | 提供运行时、沙箱、工具网关、观测、鉴权 | 让 Agent 可部署、可观测、可扩展 |
| 组织/产品使能 | 让业务系统、团队或平台具备使用 Agent 的能力 | 把 CRM、工单、知识库开放给 Agent 调用 |
和 Agent Native 的关系 :Agent Native 回答"系统是否从底层就围绕智能体设计",Agent Enable 回答"如何让某个模型、系统或平台具备智能体能力"。Agent Native 是架构目标,Agent Enable 是实现路径------要做一个 Agent Native 系统,通常要做大量 Agent Enable 工作。
典型要 "enable" 的六层内容:模型层(模型选择、推理配置、上下文管理)、工具层(搜索、数据库、API、文件、代码执行)、记忆层(短期任务状态、长期知识、用户偏好)、编排层(任务拆解、多步执行、多 Agent 协作)、治理层(权限、沙箱、审计、回滚、成本延迟控制)、观测层(决策链路、工具调用、失败原因追踪)。
6.2 Agent Harness(智能体框架):以 DeepSeek Harness 为例
Agent Harness / Agent 框架,指把模型变成能持续执行任务的智能体的工程底座。DeepSeek Harness 属于这一类。
| 概念 | DeepSeek Harness 的关系 |
|---|---|
| Agent Enable | 最接近这一类,本质是"让模型具备 Agent 能力"的运行时层 |
| 智能原生 | 它本身不是智能原生产品,而是构建智能原生应用的基础设施 |
| 智能体原生 | 它提供智能体原生系统需要的关键能力:工具调用、任务循环、记忆、沙箱、可观测性 |
更具体地说,DeepSeek Harness 不是大模型,也不是聊天产品,而是 Model + Harness = Agent 中的 Harness 层------负责把模型接到真实环境里,让 Agent 能读文件、调工具、规划任务、执行命令、记录轨迹、失败重试和持续工作。它的架构特点是"一切皆插件":模型、工具、会话、沙箱、UI、任务循环都可以作为插件替换和组合,既是可运行的 Agent 桌面/命令行应用,也是可二次开发的 Agent 框架。
§7. 概念层级:四层嵌套与 12 维评估清单
7.1 四层嵌套关系图
┌─────────────────────────────────────────────────────────┐
│ Agent Native (智能体原生) │ ← 终极形态:系统围绕Agent重构
│ ┌───────────────────────────────────────────────────┐ │
│ │ Agent Harness (智能体框架) │ │ ← 工程支撑:安全/观测/状态/工具链
│ │ ┌─────────────────────────────────────────────┐ │ │
│ │ │ Agent Enabled (Agent Enable) │ │ │ ← 能力升级:规划+执行+闭环
│ │ │ ┌───────────────────────────────────────┐ │ │ │
│ │ │ │ AI Enabled (AI Enable) │ │ │ │ ← 基础起点:模型接入+内容生成
│ │ │ └───────────────────────────────────────┘ │ │ │
│ │ └─────────────────────────────────────────────┘ │ │
│ └───────────────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────┘
核心关系解读:
- AI Enabled 是地基:解决"能不能用 AI"的问题,是所有上层建筑的起点。
- Agent Enabled 是能力层:在 AI 基础上增加了"手脚",让系统从"能说会道"变成"能干活"。
- Agent Harness 是承重墙 :它不是业务功能,而是让 Agent 能稳定、安全、可控运行的基础设施。没有 Harness,Agent 就是玩具;有了 Harness,Agent 才能进生产环境。
- Agent Native 是顶层设计 :当以上三层都成熟后,产品不再把 Agent 当"功能"做,而是把整个产品重新设计为以 Agent 为核心的新物种。
7.2 12 维评估清单
| 评估维度 | 关键问题 | 对应概念 |
|---|---|---|
| AI 是否可移除 | 去掉 AI 后,产品是体验降级,还是核心价值崩塌? | AI Enabled vs 智能原生 |
| AI 角色 | AI 是辅助工具、副驾,还是主执行者? | AI Enabled / Copilot / Agent |
| 交互范式 | 用户是点菜单、填表单,还是给目标、验收结果? | 智能原生 / 智能体原生 |
| 执行闭环 | 系统能否自主规划、调用工具、执行、纠错并交付结果? | Agent Enabled / 智能体原生 |
| 工具与系统集成 | 能否稳定调用 API、数据库、文件系统、业务系统? | Agent Enabled / Harness |
| 任务规划能力 | 能否把复杂目标拆成多步,并在失败后重试? | Agent Enabled / 智能体原生 |
| 记忆与状态 | 是否有短期上下文、长期记忆、任务状态和跨会话持久化? | Agent Enabled / Harness |
| 安全与权限 | 是否有沙箱、权限控制、审批节点、审计日志和回滚机制? | Harness / 智能体原生 |
| 可观测性 | 能否追踪 Agent 决策链路、工具调用、成本、延迟和失败原因? | Harness / Agent DevOps |
| 数据闭环 | 交互结果能否回流,用于优化模型、提示词、工具和流程? | 智能原生 / 智能体原生 |
| 多智能体协作 | 是否支持子 Agent、角色分工、任务分发和结果仲裁? | 智能体原生 / Harness |
| 工程成熟度 | 是否具备持久化执行、并发控制、异常恢复、版本管理和 SLO? | Harness / Runtime |
怎么选评估重点:看产品定位 用移除测试最直观;看执行能力 要看能否自主规划、调用工具并交付结果;看工程底座 要看状态管理、安全、可观测、持久化和恢复能力;看系统重构程度 要看是否从底层为智能体设计记忆、权限、接口和协同机制。做内部 Agent 平台选型时,优先横向对比任务完成率、工具调用成功率、失败恢复率、越权拦截率、审计可追溯性、单任务成本和延迟。
技术侧重点:智能原生阶段重点看模型、网关、上下文和评估;智能体原生阶段重点设计 Agent 运行时、工具网关、安全护栏和多 Agent 编排。
§8. 概念中英对照表(33 条)
| 中文 | 英文 | 常用缩写 | 一句话含义 |
|---|---|---|---|
| 智能原生 / AI 原生 | AI Native / AI-Native | --- | AI 是系统底座;移除后核心价值崩塌(国内官方标准译法) |
| 智能体原生 | Agent Native | --- | 系统原生支持智能体自主感知、规划、执行、反思、协作 |
| 智能体使能 / 智能体赋能 | Agent Enable / Agent Enabled | --- | 给模型/系统接入工具、记忆、权限、编排等 Agent 能力的工程动作 |
| 智能体框架 | Agent Harness / Agent Runtime | Harness | 把模型封装成可执行、可观测、可治理 Agent 的工程底座(Model + Harness = Agent) |
| AI 赋能 / AI 使能 | AI Enabled / AI Enablement | --- | 在现有系统上叠加 AI 能力(总结、问答、生成、推荐) |
| AI 增强 | AI Enhanced / AI Powered | --- | 同上语境:AI 是增强项,拿掉只降级不崩塌 |
| 人工智能 | Artificial Intelligence | AI | 让机器执行需要人类智能的任务(1956 达特茅斯会议命名)〔2〕 |
| 专用人工智能 / 窄智能 | Artificial Narrow Intelligence | ANI | 只擅长单一任务的 AI(深蓝、AlphaGo) |
| 通用人工智能 | Artificial General Intelligence | AGI | 在广泛任务域达到人类水平的 AI(DeepMind 分级框架〔12〕) |
| 超级智能 | Superintelligence / Artificial Superintelligence | ASI | 在几乎所有领域全面超越最优秀人类头脑的智能(Bostrom, 2014)〔23〕 |
| 生成式人工智能 | Generative AI | GenAI | 以生成文本/图像/代码为主要能力的 AI(ChatGPT 起) |
| 大语言模型 | Large Language Model | LLM | 以 Transformer 为底座、经大规模预训练的语言模型 |
| 缩放定律 | Scaling Laws | --- | 模型能力随参数/数据/算力可预测提升的经验规律(Kaplan 2020〔8〕;Chinchilla 2022 修正〔9〕) |
| 智能体 / 人工智能体 | AI Agent / Intelligent Agent | Agent | 能感知、规划、调用工具、执行任务的自主 AI 系统 |
| 多智能体系统 / 协作 | Multi-Agent System / Collaboration | MAS | 多个 Agent 角色分工、任务分发、结果仲裁 |
| 智能体编排 | Agent Orchestration | --- | 对多步任务、多 Agent 的调度组织 |
| 工具调用 / 函数调用 | Tool Use / Function Calling | --- | 模型按需调用外部 API、数据库、代码执行等(OpenAI 2023-06 标准化〔11〕) |
| 模型上下文协议 | Model Context Protocol | MCP | Anthropic 2024-11-25 开源的工具/数据接入标准("AI 的 USB-C")〔15〕 |
| 感知---规划---执行---反思 | Perceive--Plan--Act--Reflect | --- | Agent 的基本循环闭环 |
| 自主执行 | Autonomous Execution | --- | Agent 在少人工干预下完成任务并交付结果 |
| 自进化(机制) | Self-Evolution | --- | Agent 根据反馈调整策略、提示词、执行阈值 |
| 递归自我改进 | Recursive Self-Improvement | RSI | AI 改进 AI 的递归加速,ASI 讨论的核心担忧(Bostrom 2014)〔23〕 |
| 对齐 | Alignment | --- | 让 AI 目标与人类意图一致的安全研究 |
| 人机回圈 / 人工审批 | Human-in-the-Loop | HITL | 关键节点由人确认(支付、合入、发布) |
| 数据闭环 | Data Feedback Loop | --- | 交互结果回流优化模型/提示词/工具/流程 |
| 护栏 | Guardrails | --- | 校验、重试、阈值、拦截等安全机制 |
| 沙箱 | Sandbox | --- | 隔离执行环境,限制 Agent 副作用 |
| 可观测性 | Observability | --- | 追踪决策链路、工具调用、成本、延迟 |
| 可审计性 | Auditability | --- | 执行留痕、日志可追溯、可回滚 |
| 短期上下文 / 长期记忆 | Short-term Context / Long-term Memory | --- | 会话内状态与跨会话持久化记忆 |
| 移除测试 | (AI) Removal Test | --- | 判断 AI 原生程度的直观标准:拿掉 AI 看崩塌还是降级 |
| 任务完成率 | Task Completion Rate | --- | Agent 评估的核心指标之一 |
| 越权拦截率 | Unauthorized-Action Interception Rate | --- | Agent 安全治理指标 |
§9. 局限与展望
三点边界,帮你判断这套概念什么时候不管用、该盯什么信号:
- 概念边界是光谱不是开关。 Cursor 2025 年后也在增加自主执行(后台任务、agent 模式),Devin 也要求人频繁验收。工程实践里很少有"纯智能原生"或"纯智能体原生",用 §7.2 的 12 维清单打分比贴标签更有用。
- 自主度受安全与成本双重约束。 Gartner 一边把 Agentic AI 列为趋势之首〔17〕,一边预测 2028 年 25% 的企业安全事件将溯源到 AI agent 滥用〔30〕------自主性越强,Harness 层(权限、审计、回滚)越是瓶颈。评估任何"智能体原生"产品时,安全门禁的完备度比宣传的自主等级更值得看。
- 分级标准还在演进。 《人工智能终端智能化分级》国家标准当前开放测试到 L3〔20〕,DeepMind 的 AGI 六级是研究框架不是产品认证------两者都只是路标。值得跟踪的信号:L4 测试开放、Agent 任务完成率的公开 benchmark、多智能体协同的国标化。
10. 结语
一条完整的逻辑链收尾:范式迁移 ------AI Enabled(外挂功能)→ 智能原生(AI 是底座,人主导操作)→ Agent Enable + Agent Harness(让模型能执行、可治理的工程底座)→ 智能体原生(系统围绕智能体自主执行重构,人是发起人和审批人);实例锚点 ------Cursor vs Devin、手机 AI 助手 vs 智能体手机、国内产品图谱;判断工具------移除测试 + 12 维评估清单。
你下一步可以做的:拿"移除测试"过一遍自己在用的工具栈,标出哪些只是 AI Enabled;选型"智能体原生"产品时直接抄 §7.2 的 12 维清单做横向打分表。这组概念的历史来路(七十年发展史、超级智能缘由、AGI 分级)见本系列第 1 篇《智能发展史七十年》。
参考来源
学术文献:
- McCarthy, J. et al. (1955). A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models . arXiv:2001.08361
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models . arXiv:2203.15556
- Morris, M. R. et al. (2023). Levels of AGI: Operationalizing Progress on the Path to AGI . Google DeepMind. arXiv:2311.02462
- Bostrom, N. (2014). Superintelligence: Paths, Dangers, Strategies. Oxford University Press.
官方公告 / 公司一手来源:
- OpenAI: Function calling and other API updates(2023-06-13)
- Cognition: Introducing Devin(2024-03)
- Anthropic: Introducing the Model Context Protocol(2024-11-25)
- Gartner: Top 10 Strategic Technology Trends for 2025(2024-10-21)
- Gartner: Top Predictions for IT Organizations and Users in 2025 and Beyond(2024-10-22)("By 2028, 25% of enterprise breaches will be traced back to AI agent abuse" 出处)
- Anthropic: Claude 3.7 Sonnet and Claude Code(2025-02-24)
国内产品报道(§5 参数核对):
- 阶跃星辰 STEPX 发布会(2026-07-13,上海):Step AOS、Amoo、STEPX Neo、L3 级测试唯一获证。见快科技、凤凰网评测等报道。
- Kimi Work / Kimi K2.6(2026-04 发布,MoE 约 1T 总参/32B 激活/256K 上下文):Agent Swarm 300 子智能体/4000 协作步;Kimi Work Beta 2026-06-03 内测。
- vivo OriginOS 7 / 蓝心 Harness(2026-09-16 发布):6000+ 项原子能力,支持超万种任务。见 vivo 官网新闻、36氪等。
系列导航 :上一篇 智能发展史70年,从AI到SI,还有哪些? | 专栏全集 agent智能体系列
更多专栏: