文章编写于7.28
7月22日晚上8点,"AI泉问"第2期开播。
主持人是我,嘉宾还是我。
没办法,活动还在试运行,我得先把这条路趟顺,把流程跑通,才敢邀请其他嘉宾来参与。
"AI泉问"是 AI·Spring 发起的系列答疑活动。做法很简单:提前收集大家遇到的真实问题,筛选后通过直播集中交流,再把内容整理进社群知识库。
这一期是 Agent 专场,主要聊了三个问题。
Agent到底给人带来了什么?
要回答这个问题,可以先看看一项工作是怎么完成的。
简单拆开,大概有四步:
选择目标、设计过程、执行任务、判断结果。
大模型刚出现时,更多是在某一个环节里提供帮助。
你问它一个问题,它帮你分析、生成方案、写一段内容,最后还是需要人继续推动整个任务。
所以,大模型首先提升的是从"问题"到"答案"的效率。
Agent 则又往前走了一步。
它不只是回答问题,还会拆解任务、调用工具、执行步骤,并根据结果继续调整。
它开始进入一项工作的中间部分:
设计过程和执行任务。
也就是说,Agent提升的是从"目标"到"结果"的效率。
但如果再往下想一层,我感觉Agent真正带来的帮助主要有两个。
第一个是释放注意力。
过去做一项工作,人要一直盯着过程,不断切换任务、检查进度、处理异常。现在有些事情,我们只需要提出目标,最后验收结果。
中间那些反复消耗注意力的过程,可以逐渐交给Agent。
第二个是扩大人的能力范围。
一个人原来只能完成自己专业范围内的工作,现在可以借助 Agent 完成更多不同类型的任务,甚至推动过去需要一个团队协作才能完成的事情。
这也是为什么AI出现之后,OPC和超级个体越来越受关注。
Agent 不只是让人做得更快,也在让一个人可以做得更多。
什么样的工作适合交给Agent?
这个问题不能简单按照"简单还是复杂 "、"重复还是专业"来划分。
编程以前被认为是非常专业的工作,现在已经是 Agent 落地最成熟的方向之一。
反过来,让 Agent 帮你回复一句看起来很简单的话,它也可能说得完全不对。
所以,真正的判断标准不是工作难不难,而是:
Agent能否稳定完成任务,并且让人真正减少投入。
一般来说,一项工作越符合下面几个条件,就越适合交给Agent:
目标可定义、过程可执行、结果可验证、错误可控制。
-
目标说不清楚,Agent只能猜。
-
信息、工具和权限拿不到,也没有执行的基础。
-
结果无法验证,Agent做得再完整,我们也不知道对不对。
-
一旦出错就涉及资金、法律、声誉或者组织承诺,更不能直接放手。
但是,这里面还有一个很容易被忽略的问题:
Agent能做,不等于值得交给Agent做。
-
有些工作高度依赖隐性经验。人几分钟就能判断,但为了让 Agent 理解,需要准备大量背景信息。
-
有些结果检查起来非常麻烦,验收一遍接近自己重新做一遍。
这种情况下,Agent 虽然可能完成,却没有真正减少人的投入。
所以,把工作交给 Agent 之前,需要算一笔"委托账":
节省了多少执行成本,又增加了多少上下文准备、结果验证、异常处理和失败风险。
值不值,不能只看它能不能做。
而且,把工作交给Agent也不是非黑即白。
可以先让它提供建议,再让它完成部分任务,然后增加人工审核节点,最后才是在明确边界内自主执行。
自主权应该一点点放,不用一上来就全部交出去。
为什么Agent演示很惊艳,用起来却不稳定?
说实话,这个问题应该很多人都遇到过。
视频里的 Agent 一条指令完成全部任务,真正轮到自己使用,不是工具调用失败,就是过程跑偏,甚至一本正经地交付一个错误结果。
最直接的原因,是演示过滤掉了真实世界的复杂性。
演示通常有明确的目标、干净的数据、稳定的工具,而且提前调试过很多次。
真实工作里却是模糊的需求、缺失的数据、复杂的权限,以及随时可能失败的外部工具。
演示证明的是"它成功过"。
我们真正需要的却是"它能稳定成功"。
更底层的原因,还是大模型本身存在不确定性。
大模型不是按照固定规则推导出唯一答案,而是基于上下文生成一个概率上最合理的结果。
这意味着误解、遗漏、错误判断和幻觉都无法完全避免。
Agent 又会把一次任务拆成多次模型调用。
假设每一步正确率都是90%,连续执行5步,整体正确率只剩约59%;执行10步,就只剩约35%。
举例有点夸张,但也能解释为什么任务链一长,Agent 更容易跑偏。
所以,现在经常有人说:
Agent = 大模型 + Harness。
大模型提供能力,Harness 决定这种能力能不能被稳定使用。
提示词、上下文、记忆、知识库、工具权限、结果校验、失败重试、回退机制和执行门禁,都可以看作 Harness 的一部分。
我们暂时很难改变大模型本身,但可以给 Agent 搭建一个更适合工作的环境。
把目标说清楚,把边界圈起来,把校验和重试机制补上。
这样 Agent 就没那么容易乱跑了。
最后
-
Agent通过承担过程和执行,释放人的注意力、扩大人的能力范围;
-
一项工作是否适合交出去,要看委托成本和风险;
-
而Agent能不能稳定完成,则越来越依赖我们为它建立什么样的Harness。
模型能力肯定还会继续提升。
但现阶段,真正决定 Agent 能不能进入工作流程的,可能不只是模型有多强,而是我们能不能把它的工作环境搭好。
好了,"AI泉问"第2期回顾就这样了。
下一期,我争取结束后尽快发出来,每次推到下一期前一天确实有点汗颜!