在电商 AI Agent 的实践中,我们最初很容易产生一个想法:
既然大模型已经具备数据分析、逻辑推理和工具调用能力,是否可以让它独立完成运营分析、市场调研,甚至直接给出经营决策?
理论上似乎可行。但真正进入业务场景后,我们逐渐发现:
Agent 能完成一项任务,与它能稳定、可靠地完成一项任务,是两回事。
一份运营报告,即使 80% 的内容正确,只要剩下 20% 涉及关键指标或决策判断错误,就可能使整份报告失去使用价值。
这促使我们重新思考三个问题:
- 哪些工作应该交给 Agent,哪些应该交给确定性程序?
- 高阶 Agent 与执行型 Agent 应该如何分工?
- 为什么运营分析与产品开发调研,看起来相似,实际却需要不同的工作流?
经过多轮实践与方案调整,我们逐渐形成了两套不同的协作模式。
一、高低阶 Agent:分工比数量更重要
讨论多 Agent 架构时,我们经常关注应该拆分多少个 Agent、采用什么模型、如何相互通信。
但我认为,更重要的是明确不同层级的职责。
高阶 Agent 负责思考方向,执行型 Agent 负责完成明确任务,确定性程序负责保证计算与规则执行的可靠性。
这里的高低阶,不是严格按照模型能力划分,而是按照任务的抽象层次、决策权限和执行职责划分。
| 层级 | 核心职责 | 典型任务 |
|---|---|---|
| 高阶 Agent | 规划、推理、综合判断 | 提出假设、发现机会、设计实验 |
| 执行型 Agent | 数据工作与任务执行 | 调用工具、组织证据、执行调研流程 |
| 确定性程序 | 保证计算和规则执行的一致性 | SQL、Python、指标计算、规则校验 |
| 人 | 商业判断与实际决策 | 确定方向、设计和执行策略、评估结果 |
一个经常被忽视的事实是:不是所有任务都值得使用大模型。
例如销售额汇总、环比增长率、库存周转天数等,只要指标口径明确,就更适合交给程序计算,而不是让模型在上下文中做数学运算。
大模型真正有价值的地方,是在可靠事实的基础上理解经营问题、提出合理假设,并发现原有规则尚未覆盖的机会。
这套分工原则,成为我们设计运营分析与产品调研工作流的基础。
二、运营分析:从数据出发,让机会发现形成业务闭环
运营分析最大的特点,在于它面对的是一个持续运转的经营系统。
销售、广告、转化、库存等数据不断产生,我们不仅需要发现经营问题,更希望从这些数据中寻找潜在机会,并验证这些机会是否真的能够改善经营结果。
因此,我们将运营分析设计为 V1--V5 五个阶段。
V1:基础数据获取
由固定程序完成经营数据采集、清洗、指标计算和结构化整理。
这一阶段不依赖大模型的推理能力,而是尽可能保证数据的准确性、一致性和可追溯性。
例如销售额、广告花费、转化率、库存周转等指标,应该通过标准化程序计算,避免模型重复计算带来的不确定性。
V2:异常分析与初步诊断
同样由固定程序执行,通过预先定义的业务规则、指标阈值和分析方法,识别销量波动、广告异常、库存风险等问题。
例如:
- 某商品转化率连续下降。
- 广告成本上升,但销售贡献没有同步增长。
- 某款畅销商品库存覆盖天数不足。
- 商品退货率明显高于正常水平。
这些判断能够通过确定性逻辑实现,就没有必要全部交给大模型。
V1 和 V2 的核心任务,是为后续机会分析建立可信的数据基础。
V3:Agent 机会分析
从 V3 开始,Agent 正式进入分析流程。
在可靠的经营数据和异常分析结果基础上,Agent 不仅需要解释现有问题,还要主动寻找潜在的增长机会。
例如:
- 某类产品转化率较高,但流量投入不足,是否有扩大曝光的机会?
- 某些商品没有明显经营异常,却可能存在定价优化空间?
- 某个品类近期增长较快,是否值得扩大资源投入?
- 竞品变化是否意味着新的市场机会?
这里特别强调一点:
没有异常,不代表没有机会。
传统运营预警体系主要关注"哪里出了问题",而 Agent 应该进一步关注"哪里还可以做得更好"。
V3 的价值,是从已有经营事实中发现新的可能性,提出值得验证的商业假设,而不是直接将这些假设包装成确定的经营结论。
V4:高阶 Agent 与资深运营共同设计机会对比实验
发现机会只是第一步,更重要的是判断这些机会是否真实、是否值得投入。
因此,在 V4 阶段,由高阶 Agent 与资深运营人员共同评估 V3 提出的机会,并设计对比实验。
假设 V3 发现某款产品转化率较高,但广告投入相对较少,认为它可能存在扩大广告投放的机会。
V4 不应该直接得出"增加预算就能提高利润"的结论,而是共同制定一个可验证的实验方案:
- 实验假设: 适当增加广告投放,是否能够提高该产品的利润贡献?
- 实验方案: 对比现有投放策略与新投放策略。
- 评价指标: 增量销售额、广告成本、利润、转化率等。
- 实验约束: 预算上限、观察周期、风险边界和停止条件。
- 验证方法: 在条件允许时建立对照组,尽可能排除促销、季节性和其他经营因素的干扰。
高阶 Agent 负责辅助假设分析、方案比较与实验设计,资深运营则结合行业经验、企业资源和实际经营情况判断方案的可行性。
V4 的核心不是审核 AI 写出的报告,而是让 AI 发现的机会,变成可以被验证的商业实验。
V5:资深运营执行,推动真实经营结果
到了 V5 阶段,由资深运营人员负责实际执行。
运营人员根据 V4 制定的实验方案,调整投放、价格、商品运营策略或资源配置,并持续观察执行效果。
这些行动会影响真实的经营过程,最终反映到销售、利润、转化率、库存等业务指标中。
而这些指标,恰恰就是下一轮 V1 和 V2 需要重新采集和分析的数据。
至此,我们真正形成了一个完整的数据飞轮:
V1 数据获取 → V2 异常分析 → V3 机会发现 → V4 对比实验设计 → V5 业务执行 → 下一周期 V1/V2。
下一轮分析时,系统不仅获取最新的经营数据,还可以关联上一轮实验的方案与执行记录,对比实验结果,验证原有假设是否成立。
需要注意的是,经营指标改善并不必然意味着实验策略有效,还需要结合对照结果与外部因素评估,尽可能区分真实的策略效果和自然波动。
有效的策略可以成为后续经营决策的参考,无效的假设则被排除或修正,新数据又可能孕育新的机会。
这里的核心不是让模型自动训练自己,也不是简单积累更多历史报告。
而是让 Agent 提出的商业假设,在真实经营活动中接受检验。
数据产生机会,机会驱动实验,实验影响经营,经营产生新数据。
当这个循环能够持续运转,Agent 就不再只是一个生成运营报告的工具,而是成为持续经营优化流程的一部分。
更重要的是,V1--V5 并不是 Agent 能力从低到高的成熟度分级,而是一条完整的业务价值链。
每个阶段都承担不同的职责,共同推动商业机会从发现走向验证和落地。
三、产品调研:为什么工作流需要反过来?
运营分析从已有业务事实出发,而产品开发调研面对的问题截然不同。
在运营分析中,我们知道要分析哪家店铺、哪些商品和哪些经营指标。
但在产品调研中,我们可能连应该进入哪个细分类目、关注哪类消费者、寻找什么差异化机会都还没有确定。
这是两类问题最根本的区别。
如果直接让执行型 Agent 在整个市场中按照几个固定规则大规模搜索,很容易产生大量看似符合条件,却缺乏实际商业价值的候选产品。
例如:
寻找近期上架、有一定销量、竞争集中度不高、差评存在明显痛点的产品。
这些规则可以筛选出符合条件的商品,却无法独立回答:
- 为什么应该进入这个市场?
- 企业是否具备相应的供应链与产品能力?
- 消费者的痛点是否值得解决?
- 即使发现市场空间,我们能否建立竞争优势?
数据能够帮助验证一个方向,但不能自动替代方向选择。
因此,在产品开发调研中,我们采用了几乎相反的工作流。
第一步:人和高阶 Agent 共同确定方向
首先由产品负责人提出业务目标、资源限制与初步判断,再由高阶 Agent 协助分析。
双方共同明确:
- 目标消费者是谁?
- 关注什么使用场景和未满足的需求?
- 目标市场与价格带是什么?
- 企业具备哪些供应链或产品能力?
- 哪些市场机会值得优先验证?
这一阶段的产物,不应是一份堆砌商品数据的表格,而是一组清晰、可以被证伪的商业假设。
第二步:高阶 Agent 将方向拆解为数据任务
确定方向之后,再把抽象判断转化成具体、可执行的调研任务。
例如,要判断一个细分类目是否适合新进入者,就可以拆解为:
- 观察头部产品的销量分布与竞争集中度。
- 分析近一两年新上架产品的市场表现。
- 判断新品牌是否具有取得一定市场份额的可能性。
- 对代表性竞品的差评进行归类,寻找反复出现的用户痛点。
- 评估价格、成本、费用、合规与供应链风险。
这些问题都有明确的数据需求,因此适合交给执行型 Agent、专业数据工具和确定性程序完成。
固定筛选规则此时是有价值的,因为它们服务于已经确定的商业假设,而不是代替商业假设本身。
第三步:执行型 Agent 定向收集与验证证据
执行层依据任务清单完成数据采集、整理和基础分析。
与全市场无差别扫描不同,这种方式强调明确的任务边界:
需要什么数据、覆盖什么样本、采用什么指标口径、如何验证结果,都应当事先明确。
对于缺失的数据,应该直接标识缺失,而不是由模型猜测填补。
对于涉及销量、市场份额、费用、利润等关键计算,则应尽量交给确定性程序处理。
最终交付的不只是分析结论,还应该包括支撑结论的原始数据、计算结果和证据来源。
第四步:高阶 Agent 综合判断,人决定是否推进
当基础调研完成后,高阶 Agent 再根据证据综合评估市场机会、进入障碍、差异化空间和主要风险。
对于证据不足的地方,可以重新提出假设,让执行层进行下一轮定向调研。
最终由产品负责人决定继续验证、调整方向或终止项目。
整个过程可以概括为:
人 + 高阶 Agent 确定方向 → 拆解商业假设 → 执行层定向调研 → 高阶 Agent 综合判断 → 人作出产品决策。
这并不是说产品研究不能从数据中发现机会,而是强调:
在开放空间极大的调研任务中,先缩小问题空间,再投入大规模数据工作,通常更有意义。
四、两种工作流,实际上是两种不同的决策逻辑
把两套方案放在一起,差异就更加明显。
| 对比维度 | 运营分析 | 产品开发调研 |
|---|---|---|
| 任务起点 | 已有经营数据与指标 | 商业目标、方向与假设 |
| 核心问题 | 如何持续改善经营表现 | 哪个产品机会值得投入 |
| 初始流程 | 确定性程序获取与分析数据 | 人与高阶 Agent 共同确定方向 |
| 执行层职责 | V1/V2 固定程序提供经营事实 | 执行型 Agent 定向收集市场证据 |
| Agent 职责 | V3 发现机会,V4 协同设计实验 | 拆解假设、规划调研、综合判断 |
| 人的职责 | V4 共同设计实验,V5 负责执行 | 前期确定方向,后期作出产品决策 |
| 反馈机制 | 经营执行结果进入下一轮数据分析 | 调研和验证结果推动产品方向迭代 |
我们可以用两个相对简洁的表达来概括:
运营分析:从数据中发现机会,再通过实验和真实经营验证判断。
产品调研:从判断中提出问题,再寻找数据验证方向。
运营分析是一种偏自下而上的工作流:
数据 → 异常与机会 → 实验设计 → 运营执行 → 新数据。
产品调研则是一种偏自上而下、再反馈验证的工作流:
方向 → 假设 → 数据调研 → 综合判断 → 产品决策。
两者不是绝对互斥,而是因为任务的确定性、问题空间和决策风险不同,导致工作流的重心不同。
运营分析适合将稳定、重复、可验证的工作沉淀成标准化流程,再利用 Agent 发掘原有规则未能覆盖的机会。
产品调研则应优先利用人和高阶 Agent 的判断力缩小探索空间,再通过定向数据调研提高验证效率。
真正值得关注的不是哪个流程更加先进,而是应该让哪种能力处于工作流的起点。
五、Agent 的价值不只是分析能力,更是可靠性与业务闭环
在实践中,还有一个容易被忽视的问题:工作流设计得再合理,如果基础数据与计算结果不可靠,高阶 Agent 的推理也没有意义。
这也是为什么我们坚持将确定性计算与开放式推理分开。
对于计算结果,应当能够追溯原始数据、指标口径、分析周期和执行过程。
对于 Agent 给出的商业判断,则应明确区分事实、推断与建议,避免把缺乏证据的猜测包装成确定结论。
对于需要投入真实资源的经营决策,还应当由具备业务经验的人参与实验设计与执行。
但可靠性只是基础,真正让 Agent 形成长期业务价值的,是完整的反馈闭环。
在运营分析中,闭环体现为:
Agent 发现机会,人与 Agent 共同设计实验,资深运营执行,再通过新一轮经营数据检验效果。
在产品调研中,闭环体现为:
人和 Agent 提出商业假设,通过定向调研获取证据,再根据验证结果决定是否继续投入或调整方向。
两者都不是单纯追求"让 AI 自动完成更多事情",而是把 AI 的推理能力嵌入真实的商业决策过程。
另外,高阶 Agent 和执行型 Agent 并不意味着必须部署两个不同的模型、两个容器或两套独立服务。
它们可以由同一个模型承担不同职责,也可以由多个专用 Agent 协作完成。
架构应该服务于决策流程,而不是为了多 Agent 而多 Agent。
写在最后
经过这些实践,我逐渐认为,电商 Agent 的核心价值并不是让 AI 独立完成所有经营活动,而是重新组织数据、程序、模型和人的分工。
在运营分析中,从确定性程序提供的经营事实出发,让 Agent 发现机会,再由高阶 Agent 与资深运营共同设计实验,由运营人员执行,并通过真实经营结果验证判断。
在产品开发中,则把人的行业经验与高阶 Agent 的推理能力前置,先找到值得研究的方向,再让执行型 Agent 提供充分、可信的证据。
两者路径不同,却最终指向同一个目标:
让程序保证事实,让 Agent 扩展认知,让人掌握决策,让真实业务结果验证判断。
Agent 系统是否真正成熟,衡量标准不应该只是它能够调用多少工具、部署多少个 Agent,或者独立生成多么完整的报告。
更值得关注的是:
它是否能够提出真正有价值的商业假设?这些假设能否转化为可执行、可验证的行动?行动结果又能否成为下一轮决策的可靠依据?
当数据、推理、实验、执行和反馈真正连接起来时,Agent 才有机会从一个被动响应问题的工具,逐步成为持续创造业务价值的协作系统。
AI 的价值,不在于替人作出所有判断,而在于让每一次判断都有更充分的依据,让每一次行动都有机会转化为下一次进步的基础。