直播半小时,我聊了聊 Agent 最常见的 3 个疑问

文章编写于7.28

7月22日晚上8点,"AI泉问"第2期开播。

主持人是我,嘉宾还是我。

没办法,活动还在试运行,我得先把这条路趟顺,把流程跑通,才敢邀请其他嘉宾来参与。

"AI泉问"是 AI·Spring 发起的系列答疑活动。做法很简单:提前收集大家遇到的真实问题,筛选后通过直播集中交流,再把内容整理进社群知识库。

这一期是 Agent 专场,主要聊了三个问题。

Agent到底给人带来了什么?

要回答这个问题,可以先看看一项工作是怎么完成的。

简单拆开,大概有四步:

选择目标、设计过程、执行任务、判断结果

大模型刚出现时,更多是在某一个环节里提供帮助。

你问它一个问题,它帮你分析、生成方案、写一段内容,最后还是需要人继续推动整个任务。

所以,大模型首先提升的是从"问题"到"答案"的效率

Agent 则又往前走了一步。

它不只是回答问题,还会拆解任务、调用工具、执行步骤,并根据结果继续调整。

它开始进入一项工作的中间部分:

设计过程和执行任务。

也就是说,Agent提升的是从"目标"到"结果"的效率

但如果再往下想一层,我感觉Agent真正带来的帮助主要有两个。

第一个是释放注意力

过去做一项工作,人要一直盯着过程,不断切换任务、检查进度、处理异常。现在有些事情,我们只需要提出目标,最后验收结果。

中间那些反复消耗注意力的过程,可以逐渐交给Agent。

第二个是扩大人的能力范围

一个人原来只能完成自己专业范围内的工作,现在可以借助 Agent 完成更多不同类型的任务,甚至推动过去需要一个团队协作才能完成的事情。

这也是为什么AI出现之后,OPC和超级个体越来越受关注。

Agent 不只是让人做得更快,也在让一个人可以做得更多。

什么样的工作适合交给Agent?

这个问题不能简单按照"简单还是复杂 "、"重复还是专业"来划分。

编程以前被认为是非常专业的工作,现在已经是 Agent 落地最成熟的方向之一。

反过来,让 Agent 帮你回复一句看起来很简单的话,它也可能说得完全不对。

所以,真正的判断标准不是工作难不难,而是:

Agent能否稳定完成任务,并且让人真正减少投入

一般来说,一项工作越符合下面几个条件,就越适合交给Agent:

目标可定义、过程可执行、结果可验证、错误可控制

  • 目标说不清楚,Agent只能猜。

  • 信息、工具和权限拿不到,也没有执行的基础。

  • 结果无法验证,Agent做得再完整,我们也不知道对不对。

  • 一旦出错就涉及资金、法律、声誉或者组织承诺,更不能直接放手。

但是,这里面还有一个很容易被忽略的问题:

Agent能做,不等于值得交给Agent做

  • 有些工作高度依赖隐性经验。人几分钟就能判断,但为了让 Agent 理解,需要准备大量背景信息。

  • 有些结果检查起来非常麻烦,验收一遍接近自己重新做一遍。

这种情况下,Agent 虽然可能完成,却没有真正减少人的投入。

所以,把工作交给 Agent 之前,需要算一笔"委托账":

节省了多少执行成本,又增加了多少上下文准备、结果验证、异常处理和失败风险。

值不值,不能只看它能不能做。

而且,把工作交给Agent也不是非黑即白。

可以先让它提供建议,再让它完成部分任务,然后增加人工审核节点,最后才是在明确边界内自主执行

自主权应该一点点放,不用一上来就全部交出去。

为什么Agent演示很惊艳,用起来却不稳定?

说实话,这个问题应该很多人都遇到过。

视频里的 Agent 一条指令完成全部任务,真正轮到自己使用,不是工具调用失败,就是过程跑偏,甚至一本正经地交付一个错误结果。

最直接的原因,是演示过滤掉了真实世界的复杂性。

演示通常有明确的目标、干净的数据、稳定的工具,而且提前调试过很多次。

真实工作里却是模糊的需求、缺失的数据、复杂的权限,以及随时可能失败的外部工具。

演示证明的是"它成功过"。

我们真正需要的却是"它能稳定成功"。

更底层的原因,还是大模型本身存在不确定性。

大模型不是按照固定规则推导出唯一答案,而是基于上下文生成一个概率上最合理的结果。

这意味着误解、遗漏、错误判断和幻觉都无法完全避免。

Agent 又会把一次任务拆成多次模型调用。

假设每一步正确率都是90%,连续执行5步,整体正确率只剩约59%;执行10步,就只剩约35%。

举例有点夸张,但也能解释为什么任务链一长,Agent 更容易跑偏。

所以,现在经常有人说:

Agent = 大模型 + Harness

大模型提供能力,Harness 决定这种能力能不能被稳定使用。

提示词、上下文、记忆、知识库、工具权限、结果校验、失败重试、回退机制和执行门禁,都可以看作 Harness 的一部分。

我们暂时很难改变大模型本身,但可以给 Agent 搭建一个更适合工作的环境。

把目标说清楚,把边界圈起来,把校验和重试机制补上。

这样 Agent 就没那么容易乱跑了。

最后

  • Agent通过承担过程和执行,释放人的注意力、扩大人的能力范围;

  • 一项工作是否适合交出去,要看委托成本和风险;

  • 而Agent能不能稳定完成,则越来越依赖我们为它建立什么样的Harness。

模型能力肯定还会继续提升。

但现阶段,真正决定 Agent 能不能进入工作流程的,可能不只是模型有多强,而是我们能不能把它的工作环境搭好。

好了,"AI泉问"第2期回顾就这样了。

下一期,我争取结束后尽快发出来,每次推到下一期前一天确实有点汗颜!

相关推荐
ggb喔35 分钟前
AI 原生攻防时代:2026 年渗透测试与逆向开发的范式重构
人工智能·重构
宸津-代码粉碎机1 小时前
AI攻防战升级!基于Spring AI构建Java应用自动免疫安全体系
java·大数据·开发语言·人工智能·python·安全·spring
克里斯蒂亚诺更新1 小时前
机器学习库sklearn的主要任务
人工智能·机器学习·sklearn
先跑起来再说1 小时前
Qavor:一个能跑、能观测、能扩展的开源 AI Agent 工作台
人工智能·开源
Mr数据杨2 小时前
从文本特征到回归建模 Syllable Counting Model 实战解析
人工智能·数据分析·kaggle竞赛
HIT_Weston2 小时前
201、【Agent】【OpenCode】JS 语法:setTimeout 七种常用形式
人工智能·agent·opencode
维基框架2 小时前
萨尔瓦多学校免费上Grok 没账单的AI怎么限流
人工智能
敢敢是只喵i2 小时前
给现有业务系统接 AI 助手,入口怎么选?网页聊天、自动化任务与本地 Agent 对比
运维·人工智能·ai·开源·自动化·安全架构
AI行业说2 小时前
誉财自动化YC-18-M8045实测:服装自动化vs人工缝制产能成本对比
大数据·人工智能·自动化·智能模板机