很多人问:AI 到底能做什么?
但更准确的问题不是"它聪不聪明",而是:
在什么条件下、多大成功率、多少成本、能否安全可控地完成某件事。
你可以先把 AI 想成一个实习生:
- 他会写邮件、查资料、做表格;
- 但你不能让他直接管公司账户;
- 他有时会编答案,多步任务容易跑偏;
- 给他工具、权限、检查流程后,他能做的事会变多。
所以,边界不是一条固定线,而是一张"能力地图"。
一、LLM 能力边界包括哪些?
至少分这几层:
- 知识边界
训练数据里没有的、太新的、太冷门的,它可能不知道,还可能编。 - 上下文边界
一次能看多少字有限。太长会忘、会漏、会前后矛盾。 - 推理边界
简单推理还行,复杂多步推理、数学、因果、规划容易出错。 - 工具边界
不能自己上网、调 API、操作软件,除非你给它工具。工具本身也会失败。 - 记忆边界
默认没有长期记忆。多轮对话可能忘,跨会话更记不住。 - 可靠性边界
Demo 能跑通一次,不代表能稳定跑一万次。 - 成本与速度边界
有些任务它能做,但太慢、太贵,不值得。 - 安全与权限边界
能生成建议,不等于能直接执行。转账、删库、发合同,必须审批和沙箱。 - 环境边界
Agent 要面对真实世界:网页会变、接口会挂、按钮会移位、数据会脏。
二、Agent 的边界为什么更窄?
因为 Agent 不是单次回答,而是多步执行 。
假设 Agent 每一步成功率 90%,听起来不错。
但做 10 步:
0.9 × 0.9 × ... 十次 ≈ 35%
也就是说,单步小错会累积成大错 。
Agent 还要规划、调工具、记状态、处理异常、恢复错误。
所以它的边界通常比单个大模型更窄:
- 只读、短流程、可验证:边界内。
- 写操作、长流程、不可逆、高代价:边界外,除非有严格护栏。
三、怎么了解 LLM / Agent 的边界?
不要只问"它能不能做",要问五个问题:
- 任务可验证吗?
有明确对错吗?能自动打分吗?写诗难验证,算账、查数据、格式转换容易验证。 - 需要多少步?
一步能完成,还是十步、五十步?步数越多,误差累积越大。 - 需要外部工具和实时数据吗?
需要查库存、调支付、操作网页?工具可靠吗?失败了能重试吗? - 错误代价多大?
写错一句话 vs 转错一笔钱,完全不同。高代价必须人工审批、回滚、权限最小化。 - 能否人工兜底?
能不能先让 AI 出草稿,人确认后再执行?能兜底,边界就宽很多。
四、工程落地规则
边界清楚了,落地时也不能一刀切。任务风险不同,AI 能拿到多少权限、需要人盯到什么程度,也该不一样。
1. 低风险、可验证任务:全 AI 自动化
像文案润色、格式整理、数据统计、信息检索、简单分类这类任务,对错明确、出错代价极低、可自动校验,完全可以交给 AI 全自动执行,无需人工干预,最大化提效。
2. 中风险、多步骤任务:AI 草稿 + 规则校验 + 人工确认
长文本生成、多步数据处理、批量内容修改、Agent 流程执行,必须加两层护栏:
- 机器校验:格式校验、关键词拦截、数据一致性校验、重试兜底机制
- 人工卡点 :关键结果必须人工复核后再落地,只让 AI 做"出力",不让 AI 做"拍板"。
3. 高风险、不可逆任务:坚决锁死 AI 直接执行权限
涉及资金、合同、删改核心数据、对外官方输出、权限变更、客户触达的操作,禁止 AI 直接执行 。
所有高风险动作统一走:AI 生成预案 → 人工审核 → 人工触发执行,全程留痕、可回溯、可回滚。
4. Agent 长流程必备兜底策略
只要是多步执行任务,必须配置:步骤断点、异常重试、失败回滚、状态记录、结果比对。
用"流程可控 + 结果可验",抵消多步推理带来的误差累积。
最后说句实在的
LLM 能不能用,别光看它聊得像不像人。关键看具体活:条件清不清楚、步骤多不多、错了谁发现、代价大不大、人能不能兜住。这些都对得上,它才算在边界内;对不上,再聪明也别硬上。