什么样的智能体数据才算优质?——基于ACE视角的大语言模型智能体数据生成研究

什么样的智能体数据才算优质?------基于ACE视角的大语言模型智能体数据生成研究

论文来源:arXiv:2608.27260v1

摘要

大语言模型智能体越来越依赖生成式交互数据,以此学习与外部环境进行交互。和传统指令合成不同,智能体数据生成需要保证环境、任务、交互过程、成功信号四者之间的一致性,产出真正具备学习价值的数据,而不只是追求数据规模。现有相关工作覆盖众多智能体领域,但大多以应用领域为边界组织内容,异构的评价方式掩盖了通用生成机制,还经常把候选样本构建、校验筛选混为一谈。

本文建立一套两层分析框架:

  1. 将智能体数据抽象为可跨领域复用的因子化数据对象 d = ( E , q , τ , v ) d=(E,q,\tau,v) d=(E,q,τ,v),分别代表环境规约、任务信号、交互实现、可选校验器;
  2. 将数据生成建模为带约束的分布设计,提出**(\mathcal{A})CE框架:准确性((\mathcal{A})ccuracy)‑复杂度(Complexity)‑多样性(divErsity)**。
  • 准确性:定义具备可执行、内部自洽的数据可行支持集;
  • 复杂度:在可行集合内,针对目标学习者能力与执行配置,分配有学习意义的数据样本;
  • 多样性:保证环境、任务、交互行为层面具备有效覆盖度,降低样本冗余。

依托(\mathcal{A})CE框架,本文梳理现有研究如何做生成样本校验、难度构建校准、行为覆盖拓展。从已有文献可以看到研究趋势:从单纯判断结果是否合理,转向基于执行过程保障准确性;从静态难度启发式指标,转向相对模型能力的复杂度评估;从表面文本变体,转向真正行为层面的多样性。

进一步借助(\mathcal{A})CE视角探讨更多拓展方向:缩放定律、真实数据与合成数据、智能体预训练/中间训练的数据生成、自演化智能体的数据生成。

本文核心结论:智能体数据生成的难点不在于生成更多数据,而是随着智能体与环境不断演化,持续产出有效、高信息增益、低冗余的交互经验。

主要贡献

  1. 以(\mathcal{A})CE为核心,对智能体数据生成领域进行综述梳理,系统整理生成流水线保障准确性、校准面向学习者的复杂度、拓展有效多样性的各类方法,同时整理各领域实证、度量方式、成本与局限性;
  2. 提出跨领域的智能体数据形式化定义:因子化数据对象 d = ( E , q , τ , v ) d=(E,q,\tau,v) d=(E,q,τ,v),统一刻画工具调用、软件工程、G(\mathcal{U})I、具身智能、社交智能体、科学智能体等场景下的数据组件与一致性约束;
  3. 面向机制的生成范式分类:按照主要锚定因子与依赖关系划分流水线,区分「数据如何构建」和「候选样本如何评估筛选」,而不是按照应用领域打标签。

目录

  1. 引言
  2. 形式化建模
    2.1 智能体多轮交互
    2.2 环境参数化
    2.3 从交互到智能体数据
    2.4 通用数据对象
  3. 生成范式
    3.1 因子化视角
    3.2 正向生成
    • 交互过程的实现
      3.3 反向生成
      3.4 (\mathcal{A})CE:受约束的分布设计
  4. 准确性
    4.1 (\mathcal{A})CE目标下的准确性
    4.2 因子层面的准确性
    4.3 数据全流程的准确性保障
    • 4.3.1 规则‑模型‑人工分层校验
    • 4.3.2 约束驱动式构建
    • 4.3.3 基于执行与状态的校验
    • 4.3.4 基于反馈的修复与选择性接纳
      4.4 准确性的成本、权衡与局限
    • 校验强度与成本
    • 和复杂度、多样性的耦合关系
    • 残留语义不确定性
  5. 复杂度
    5.1 (\mathcal{A})CE目标下的复杂度
    5.2 因子层面的复杂度
    5.3 智能体复杂度的构建与校准
    • 5.3.1 结构规约与组合
    • 5.3.2 任务与信息控制
    • 5.3.3 环境与交互设计
    • 5.3.4 完成条件与反馈设计
    • 5.3.5 演化与渐进式变换
    • 5.3.6 基于失败、感知模型能力的校准
    • 5.3.7 双向校准与脚手架辅助
      5.4 复杂度的估计与报告方式
      5.5 复杂度的权衡与局限
    • 复杂度 vs 准确性
    • 复杂度 vs 多样性
    • 复杂度 vs 现实真实性
    • 代理指标保真度与校准成本
    • 任务难度 vs 可学习性
    • 课程漂移与闭环偏差
  6. 多样性
    6.1 (\mathcal{A})CE目标下的多样性
    6.2 因子层面的多样性
    • 环境规约多样性
    • 任务信号多样性
    • 交互实现多样性
    • 生成器与来源溯源多样性
      6.3 拓展智能体多样性:实现机制与各领域实证
    • 6.3.1 数据源与支持集扩展
    • 6.3.2 组合重组
    • 6.3.3 探索优先、经验驱动发现
    • 6.3.4 扰动与反事实变体
    • 6.3.5 覆盖度引导的平衡与自适应
    • 6.3.6 分领域实现与实证
      * 工具使用与数字智能体
      * Web、G(\mathcal{U})I、计算机操作智能体
      * 代码与软件工程智能体
      * 具身与社交智能体
      * 科学与形式化推理智能体
      6.4 多样性的度量
    • 因子覆盖度与均衡性
    • 行为非冗余性
    • 基于(\mathcal{A})CE约束的覆盖度
    • 迁移覆盖度
    • 学习者边际收益
      6.5 多样性的权衡与局限
    • 多样性 vs 数据规模
    • 多样性 vs 准确性
    • 多样性 vs 感知模型的复杂度
    • 真实性、可控性、规模之间矛盾
    • 混合干扰与开放世界漂移
  7. 讨论
    7.1 (\mathcal{A})CE目标下的缩放定律
    7.2 (\mathcal{A})CE视角下真实数据与合成数据
    7.3 面向智能体预训练、中间训练的数据生成
    7.4 面向自演化智能体的数据生成
  8. 结论
  9. 参考文献

1 引言

大语言模型智能体需要执行动作而不仅仅输出文本响应:调用工具、操作系统、检索信息、修改文件,与模拟世界或物理世界交互。学习这类行为需要大量将决策、观测、状态变更关联起来的多轮交互经验。人工采集这类交互数据成本高昂,校验与扩充难度大,因此智能体数据生成成为训练与评估智能体的核心手段。

核心挑战不是简单生成更多样本,而是保证生成经验具备:准确、适配学习者的复杂度、足够的多样性

智能体数据生成不等于"生成指令+采样回复"。一份高质量样本需要可执行环境、具备现实基础的任务、能产生有效观测和状态变更的交互过程。现代流水线不仅生成指令与演示轨迹,还产出工具生态、可执行环境、有状态任务、回滚反馈、校验流程。本文提出(\mathcal{A})CE三元组框架:

  • 准确性(\mathcal{A})ccuracy:生成经验是否落地现实、内部自洽;
  • 复杂度Complexity:对特定学习者是否构成有价值的挑战;
  • 多样性divErsity:数据集是否覆盖不同场景行为,而不是简单重复。

当前该领域文献较为碎片化,很多研究以应用领域来描述数据((\mathcal{A})(\mathcal{P})I调用、代码库任务、G(\mathcal{U})I演示、模拟器回滚、科学发现经验等),带来两个问题:

  1. 机制与应用混淆:通用机制分散在不同场景论文中;
  2. 流水线描述混杂:把候选样本构建、校验、筛选、分配给学习者混在一起描述。

不同论文使用不同术语描述同类机制;而本质差异很大的生成流程,评价标准却难以对齐。因此需要一套统一描述:流水线构造哪些组件、如何在(\mathcal{A})CE约束下塑造数据分布。

本文把智能体数据抽象成因子化对象: d = ( E , q , τ , v ) d=(E,q,\tau,v) d=(E,q,τ,v)

  • E E E:可执行世界,包含状态、动力学、策略、动作‑观测接口;
  • q q q:任务条件目标与约束;
  • τ \tau τ:已经发生的交互记录;
  • v v v:可选,结果或过程监督信号,可以是可执行检查、模型评判、奖励。

该抽象可以兼容各类智能体场景,不需要每个数据集都序列化完全一样的字段。更关键的是明确(\mathcal{A})CE分别作用对象:准确性关注各因子局部有效性和相互一致性;复杂度关注配置带来的学习负担;多样性关注非冗余的覆盖范围。

图1:(\mathcal{A})CE视角将智能体数据生成视为受约束分布设计:准确性定义可行支持集;面向学习者的复杂度、多样性,共同在 ( E , q , τ , v ) (E,q,\tau,v) (E,q,τ,v) 之上塑造有效、非冗余的经验分布。

(\mathcal{A})CE的非对称特性十分关键:难度高、变体多不能补偿样本本身无效;但是全部有效但过于简单、高度重复的数据学习收益很低。(\mathcal{A})CE不是数据集治理的完整检查清单,成本、效率、安全依旧是外部约束。(\mathcal{A})CE聚焦生成阶段直接决定智能体经验学习价值的三个属性,作为分析各类生成机制的统一透镜。

基于因子化表示,本文提出面向机制的生成范式分类,依据主要锚定因子、其余因子实例化依赖关系划分:

  • 正向流水线:在已有环境中落地任务与交互;
  • 任务优先、轨迹优先流水线:围绕目标能力或观测经验构造其余因子;
  • 结构优先流水线:使用中间图、规划、蓝图协调全部因子。

这套框架同样可以描述联合迭代、自改进系统:校验失败、学习者反馈反过来修改已经生成的因子。生成范式回答如何构造数据;(\mathcal{A})CE回答哪些候选样本应当被接纳、优先使用。

梳理现有文献,可以看到清晰趋势:从只判断"看上去合理"走向基于执行保障准确性 ;从静态难度启发式走向相对模型、执行配置的复杂度 ;从表面文本变体走向真正行为层面覆盖度。同时智能体数据不再局限于训练后固定轨迹,拓展到预训练、中间训练监督信号,以及跟随学习者不断变化的闭环经验。

2 形式化建模

2.1 智能体多轮交互

参考将工具增强交互建模为部分可观测马尔可夫决策过程(\mathcal{P})(\mathcal{O})M(\mathcal{D})(\mathcal{P})的已有工作:

KaTeX parse error: Can't use function '\(' in math mode at position 24: ...l{M}=(\mathcal{\̲(̲\mathcal{U}\)},...

  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{U}\)}:任务/用户意图空间
  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{S}\)}:隐状态空间
  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{A}\)}:动作空间,包含文本回复、面向环境执行动作
  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{O}\)}:观测空间
  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{P}\)}:状态转移规则
  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{R}\)}:可选奖励/评估函数

在第 t t t轮,智能体基于可观测历史选择动作;环境返回新观测,同时更新内部隐状态:

KaTeX parse error: Can't use function '\(' in math mode at position 132: ...})\sim\mathcal{\̲(̲\mathcal{P}\)}(...

关键区分:轨迹记录智能体看到什么、做什么;而可执行环境维护隐状态,用于状态转移、奖励计算。

该抽象可以覆盖绝大多数智能体场景:

  • 工具调用:动作是结构化(\mathcal{A})(\mathcal{P})I调用,观测为工具返回值;
  • Web/G(\mathcal{U})I智能体:动作是界面操作,观测为视觉或结构化页面状态;
  • 代码智能体:环境包含代码仓库、shell、依赖、测试用例;
  • 具身智能:模拟器或者物理真实世界。

用户轮次被包含在观测中:用户逐步给出约束、回答澄清问题、修改原始请求。任务不一定等于第一轮用户语句,可以是在整个交互过程逐步显现的隐式意图。

一条实现完成的交互轨迹记作:

τ = ( o 0 , a 1 , o 1 , ... , a T , o T ) \tau=(o_{0},a_{1},o_{1},\ldots,a_{T},o_{T}) τ=(o0,a1,o1,...,aT,oT)

a i a_i ai代表动作(文本回复、工具调用); o j o_j oj是观测(用户消息、环境反馈)。既可以表示简短函数调用样例,也可以表示长距离有状态多轮轨迹。

2.2 环境参数化

做数据生成时,一个具体环境参数化为:

KaTeX parse error: Can't use function '\(' in math mode at position 14: e=(\mathcal{\̲(̲\mathcal{D}\)},...

  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}:状态载体,数据库、代码仓库、应用、模拟器等(可选);
  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{F}\)}:可用工具/动作集合;
  • KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{P}\)}_...:策略、权限、领域约束;
  • KaTeX parse error: Can't use function '\)' in math mode at position 15: \\(\mathcal{O}\̲)̲mega:规定隐状态哪些部分对外暴露成为观测;
  • v v v:可选,成功判定接口。

序列化后的**环境规约 E E E**描述上述组件部分或者全部内容。简单函数调用场景下, E E E只包含工具schema和使用规则;面向强化学习的数据,则 E E E必须支持结果评估。

2.3 从交互到智能体数据

智能体数据通过三个核心因子实例化交互过程。

环境规约(E)

描述可执行世界。包含工具schema、数据库/模拟器状态、转移规则、权限、观测接口、终止条件。部分数据集只序列化文本工具描述;可执行环境可以暴露完整状态转移逻辑,支持重新执行生成新轨迹。因此 E E E的形态跨度很大,从静态接口说明,到完整可交互运行底座。

任务信号(q)

定义要达成的目标与约束。可以是显式指令、目标状态、隐式用户意图,或是多轮逐步显现的信号。任务必须相对于环境具备落地性:实体存在、动作可用、完成条件在环境规则下有意义。

交互实现((\tau))

描述在该环境下尝试或解决该任务的完整过程。监督微调(\mathcal{S})(\mathcal{F})T场景,一般是演示轨迹;强化学习场景,可以是在可执行环境在线采样得到。同一个环境‑任务对,可以保存多条轨迹:成功、失败、探索、恢复修正轨迹。

智能体数据分解(概念层面,非强制序列化格式)

智能体数据 = 环境规约 + 任务信号 + 交互实现 \text{智能体数据} = \text{环境规约} + \text{任务信号} + \text{交互实现} 智能体数据=环境规约+任务信号+交互实现

这是概念分解,不强制存储格式;例如初始状态可以放在可执行环境内部;逐步显现的任务意图可以编码在 τ \tau τ内部用户轮次。

2.4 通用数据对象

本文后续统一使用通用数据对象:

d = ( E , q , τ , v ) \boldsymbol{d=(E,q,\tau,v)} d=(E,q,τ,v)

v v v是可选校验器/奖励接口。

  • E , q , τ E,q,\tau E,q,τ定义交互问题与其实现;
  • v v v记录一致性、结果如何评估;可以是schema检查器、可执行测试、终态谓词、策略规则、大模型评判器,或是混合方案。

把 v v v当做独立接口,避免混淆「被生成的数据对象本身」和「某一种训练范式」。

  • (\mathcal{S})(\mathcal{F})T场景: d d d存储 E E E和固定 τ \tau τ, q q q显式或通过用户对话体现; v v v可选,一般仅用于数据筛选阶段。
  • (\mathcal{R})L、基于环境评估场景: E E E必须支持新交互; q q q、 v v v定义采样目标与成功条件。

该符号体系让我们可以横向对比轨迹合成、可执行环境构建、在线任务生成,不需要假设公开数据集产物完全一致。

图2:跨领域通用智能体数据对象 d = ( E , q , τ , v ) d=(E,q,\tau,v) d=(E,q,τ,v)实例。不同领域具体表示不一样,但四个因子概念角色保持不变。

3 生成范式

第2节定义智能体数据包含的因子;本章按照构造、落地这些因子的顺序对现有流水线分类。

3.1 因子化视角

智能体数据生成等价于对环境、任务、交互实现做联合分布设计。最常见分解:

p ( E , q , τ ) = p ( E )   p ( q ∣ E )   p ( τ ∣ E , q ) p(E,q,\tau)=p(E)\,p(q\mid E)\,p(\tau\mid E,q) p(E,q,τ)=p(E)p(q∣E)p(τ∣E,q)

但是该顺序不是强制。

  • 任务优先流水线 :从 q q q出发,再构造兼容的 E E E;
  • 轨迹优先流水线 :从可执行/观测得到的 τ \tau τ反推 q q q。

生成范式回答:因子如何产出;数据目标回答:哪些生成实例应当被接纳、加权。前者分为正向生成、反向生成;(\mathcal{A})CE目标作为生成时的优化原则。

3.2 正向生成

正向生成:先构建环境,基于环境生成可落地任务,再生成交互轨迹。符合交互自然依赖关系:可用动作、状态决定可行任务;任务再决定有意义的轨迹。

构建环境

现有工作获取 E E E主要三类来源:

  1. 真实采集整理环境 :爬取整理真实(\mathcal{A})(\mathcal{P})I、MC(\mathcal{P})服务、代码仓库、网页应用。
    • 优点:真实度高;
    • 缺点:文档参差不齐、依赖不稳定、执行、访问、许可证带来限制。
      代表工作:ToolLLM、Gorilla、(\mathcal{A})(\mathcal{P})IGen、Tool(\mathcal{D})ial、InfTool、T(\mathcal{O})(\mathcal{U})C(\mathcal{A})N。
  2. 大模型合成环境 :大模型拓展工具、规则、领域描述,扩充原始资源边界。
    • 优点:规模大、可控;
    • 缺点:接口定义可能不完备,脱离现实工作流。
      代表:Tool(\mathcal{A})lpaca、Tool(\mathcal{A})CE、(\mathcal{S})eal‑Tools、(\mathcal{S})ynthTools、ToolWeave。
  3. 程序化构建可执行环境 :代码实现数据库、状态转移动力学、模拟器、校验器。从静态文本工具描述转向有状态、可重置、可校验环境。
    • 优点:支持有状态交互、可重置、校验可靠;
    • 缺点:工程成本高;环境质量高度取决于代码生成与环境设计。
      代表:(\mathcal{A})uto(\mathcal{F})orge、Env(\mathcal{S})caler、(\mathcal{A})gent‑World、Env(\mathcal{F})actory、(\mathcal{S})caleEnv。

表1 正向智能体数据生成代表性工作(依赖关系 E → q → τ E\rightarrow q\rightarrow\tau E→q→τ)

方法 环境E构建 任务q生成 交互(\tau)实现 资源链接
真实/人工整理环境
ToolLLM 真实(\mathcal{A})(\mathcal{P})I集合 基于工具描述prompt生成指令 教师引导工具回滚 GitHub
Gorilla 真实(\mathcal{A})(\mathcal{P})I集合 基于(\mathcal{A})(\mathcal{P})I生成指令 单轮(\mathcal{A})(\mathcal{P})I调用 GitHub
(\mathcal{A})(\mathcal{P})IGen 可执行(\mathcal{A})(\mathcal{P})I池 经过校验的任务合成 可执行函数调用回滚 GitHub
Tool(\mathcal{D})ial 真实(\mathcal{A})(\mathcal{P})I图 图引导任务合成 多轮角色扮演 GitHub
InfTool 连通可执行(\mathcal{A})(\mathcal{P})I 工具条件式合成 多轮角色扮演
T(\mathcal{O})(\mathcal{U})C(\mathcal{A})N 真实MC(\mathcal{P})环境 MC(\mathcal{P})绑定任务合成 真实工具执行回滚 GitHub
大模型合成环境
Tool(\mathcal{A})lpaca LLM合成工具 工具条件指令生成 多智能体模拟 GitHub
Tool(\mathcal{A})CE 自演化(\mathcal{A})(\mathcal{P})I池 工具绑定任务合成 多智能体对话回滚 Hugging(\mathcal{F})ace
(\mathcal{S})eal‑Tools 合成工具生成 (\mathcal{S})elf‑Instruct任务合成 模拟工具使用回滚 GitHub
(\mathcal{S})ynthTools 分层环境合成 可校验任务合成 模拟器驱动回滚 GitHub
ToolWeave 合成工具图 图引导目标合成 规划引导对话合成 GitHub
程序化/可执行环境
(\mathcal{A})uto(\mathcal{F})orge 程序化环境合成 状态条件任务合成 可执行环境回滚
Env(\mathcal{S})caler 程序化工具环境 状态条件场景 可执行智能体回滚 GitHub
(\mathcal{A})gent‑World 可执行世界构建 状态绑定任务合成 在线智能体回滚
Env(\mathcal{F})actory 可执行环境工厂 图‑状态绑定任务 可执行多轮回滚 GitHub
(\mathcal{S})caleEnv 程序化环境扩容 状态条件任务合成 可执行(\mathcal{R})L回滚
生成具备落地性的任务

简单方案:给模型工具描述,直接prompt生成指令。

更现代方案引入中间落地结构:

  1. 工具图/技能图引导:采样兼容工具、依赖路径之后再写用户请求;
  2. 蓝图/规划优先:先指定目标动作、子目标,再生成对话文本;
  3. 有状态系统:联合构造初始状态、任务、校验器,保证任务在该环境实例下可行;
  4. 演化式任务生成:从已有任务、失败轨迹衍生出新任务,定向弥补当前能力短板。
交互过程实现((\mathcal{R})ealizing Interactions)

轨迹生成方式:教师模型、角色扮演智能体、执行引导回滚,或是混合模式。

  • 早期函数调用数据集:显式任务生成简短交互;
  • 多轮流水线:模拟用户、助手角色,逐步暴露约束,生成澄清、纠错行为;
  • 可执行环境:真实状态转移返回观测,回滚过程拒绝非法动作;
  • 探索驱动Web/移动端流水线:从交互采集多模态轨迹、恢复行为,不完全依赖脚本演示;
  • 检索深度研究智能体:采集检索、证据整合、查询改写交互;
  • 工具图、规划等结构化脚手架提升长距离一致性。

当环境实现是瓶颈,也可以使用大模型模拟器,基于(\mathcal{A})(\mathcal{P})I规约+交互历史生成状态响应,可以在学习阶段充当排练环境。

正向范式优势:后面因子都建立在真实存在环境之上,落地性强;风险是级联依赖:环境本身狭窄、不可靠,会约束上层所有任务和轨迹。因此校验不能只放在最后一步,现代流水线会在生成全过程测试环境组件、任务可行性、中间状态转移、最终结果。

3.3 反向生成

反向生成流水线不再遵循"环境→任务→轨迹"天然依赖顺序,改变哪个构件作为锚点,带来不同控制能力。

分为三类:任务优先、轨迹优先、结构优先,还有交叉的自适应自演化拓展。

  1. 任务优先生成 Task‑(\mathcal{F})irst

    先指定目标能力、指令模式、复合目标,之后构建需要的工具、环境、交互。可以直接控制任务内容、难度;代价需要强校验,保证构造出来的环境确实支持目标行为。

    代表工作:(\mathcal{A})gentInstruct、(\mathcal{A})gentic (\mathcal{P})roposing、B(\mathcal{U})TT(\mathcal{O})N、ToolBridge,还有大量把数学、代码、科学任务改造为工具增强交互的工作。

  2. 轨迹优先生成 Trajectory‑(\mathcal{F})irst

    先探索环境/挖掘工作流,再撰写面向用户的任务。从已经验证有效的行为反推任务。优点:可执行性好,可以处理歧义、不断变化、侧重纠错恢复的意图;局限:生成分布被探索策略所能发现的内容限制。

    代表:Learn‑by‑interact、Trajectory2Task、(\mathcal{O})(\mathcal{S})‑Genesis、(\mathcal{O})penMobile。

  3. 结构优先生成 (\mathcal{S})tructure‑(\mathcal{F})irst

    先生成中间对象:工具图、函数路径、对话骨架、任务蓝图,再实现文本对话。脚手架是构造手段,不属于第四份数据因子。

    代表:Tool(\mathcal{A})CE‑MT、Magnet、Tool(\mathcal{F})low、(\mathcal{A})(\mathcal{P})IGen‑MT、Execution‑(\mathcal{F})irst。

自适应、自演化生成:不再一次性生成独立样本;利用累积经验、校验结果、覆盖缺口持续修改生成策略,构造新任务、工作流,适配学习者不断变化的需求。数据生成变成与智能体、环境共同演化的闭环。

表2 反向智能体数据生成代表性工作

方法 领域 核心机制 资源链接
任务优先生成
(\mathcal{A})gentInstruct 通用 面向能力目标的环境合成
(\mathcal{A})gentic (\mathcal{P})roposing 通用 问题优先下游合成 GitHub
B(\mathcal{U})TT(\mathcal{O})N 工具 组合式多轮任务合成 GitHub
ToolBridge 工具 已有任务做工具集成 GitHub
To(\mathcal{R})(\mathcal{A}) 数学 工具集成数学推理 GitHub
MathCoder 数学 代码辅助数学推理 GitHub
M(\mathcal{A})(\mathcal{R})I(\mathcal{O}) 数学 代码解释器增强推理 GitHub
(\mathcal{A})gentMath 数学 工具增强数学推理
(\mathcal{R})eTool 数学 策略化工具使用推理 GitHub
To(\mathcal{R})L 数学 工具集成强化学习 GitHub
(\mathcal{A})uto(\mathcal{S})(\mathcal{D})T 科学 科学发现任务转换 GitHub
(\mathcal{A})gentic‑Ideation 科学 科学推理路径重构
轨迹优先生成
Learn‑by‑interact 工具 交互推导任务生成
Trajectory2Task 工具 可执行轨迹转任务
(\mathcal{U})nlocking Implicit Experience 工具 从文本挖掘隐式工作流
(\mathcal{O})(\mathcal{S})‑Genesis G(\mathcal{U})I G(\mathcal{U})I轨迹反向生成任务 GitHub
Explorer Web 探索驱动Web任务合成 GitHub
(\mathcal{O})penMobile 移动端 移动端交互任务合成 GitHub
结构优先生成
Tool(\mathcal{A})CE‑MT 工具 由粗到精交互细化
Magnet 工具 结构化工具图实现 GitHub
Tool(\mathcal{F})low 工具 工具图引导任务规划
(\mathcal{A})(\mathcal{P})IGen‑MT 工具 经过校验蓝图的轨迹生成 Hugging(\mathcal{F})ace
Execution‑(\mathcal{F})irst 工具 执行校验任务合成
自适应、自演化生成
(\mathcal{A})(\mathcal{F})low 通用 搜索式智能体工作流优化 GitHub
Chain‑of‑(\mathcal{A})gents 通用 多智能体蒸馏、智能体(\mathcal{R})L GitHub
(\mathcal{A})gentEvolver 工具 自我提问、经验引导演化 GitHub
WebEvolver Web 世界模型引导Web自改进 GitHub
(\mathcal{S})E(\mathcal{S})(\mathcal{A}) 搜索 自博弈任务生成、技能演化 GitHub
(\mathcal{S})ocratic‑(\mathcal{S})WE 软件工程 从轨迹衍生技能自适应任务生成

3.4 (\mathcal{A})CE作为带约束的分布设计

生成范式描述如何构造候选样本;(\mathcal{A})CE描述应当如何塑造被接受的数据分布。

记 p ϕ p_{\phi} pϕ 为生成流水线;KaTeX parse error: Can't use function '\(' in math mode at position 14: \mathcal{B}_{\̲(̲\mathcal{A}\)} 代表一批样本里面通过环境一致性、任务可行性、轨迹有效性校验的子集。

(\mathcal{A})CE目标公式

KaTeX parse error: Can't use function '\(' in math mode at position 92: ...{|\mathcal{B}_{\̲(̲\mathcal{A}\)}|...

  • KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{A}\)(d...:有效性判定; α \alpha α:最低接纳率;
  • z z z:学习者完整执行配置(模型、脚手架、工具、校验器、推理预算);
  • C z ( d ) C_{z}(d) Cz(d):样本 d d d在配置 z z z下的复杂度;
  • g z ( ⋅ ) g_{z}(\cdot) gz(⋅):复杂度效用函数,倾向学习者能力前沿附近可学习样本;
  • KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{D}\)(\...:批次多样性;KaTeX parse error: Can't use function '\(' in math mode at position 22: ...a_{C},\lambda_{\̲(̲\mathcal{D}\)}权重。

如果没有样本通过准确性校验,则整体效用直接为0。体现(\mathcal{A})CE的非对称关系:准确性划定可行集合;复杂度、多样性只在可行集合内部优化

(\mathcal{A})CE是分析透镜,不是一套把文献切分成三类独立方法。同一个蓝图校验机制,既可以提升准确性,又引入更深依赖结构,同时支持组合实现多样性;同一个面向失败的生成器,可能针对模型相对复杂度,但会缩窄领域覆盖。

4 准确性

准确性是(\mathcal{A})CE的前置约束。智能体数据监督不只是看最终答案,而是环境、任务、交互、成功信号整套耦合体系。一份样本文本读起来通顺,但依然可以是不准确:任务不可行、工具实现不一致、观测不匹配前序动作、校验器奖励错误结果。各类现有工作在流水线不同阶段解决该类问题,不存在普适单一方案。

4.1 (\mathcal{A})CE目标下的准确性

有效性判定KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{A}\)(d...要求环境内部自洽、任务具备可行性、交互遵守动作与状态转移、校验器与预期结果匹配。复杂度、多样性必须在准确性校验通过之后再评估;无效样本,无论多难、多新颖,都无法带来学习收益。

KaTeX parse error: Can't use function '\(' in math mode at position 2: \̲(̲\mathcal{A}\)(d...

KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathrm{\̲(̲\mathcal{A}\)cc...

这是"合取条件":看起来正确的轨迹不能补偿不可行任务;正确终态也不能补偿校验器接受违规捷径。

准确性包含两类检查:

  1. 局部有效性:单个组件自身合法,例如schema格式正确;
  2. 关系一致性 :组件之间描述同一个问题: q q q引用 E E E存在对象和操作; τ \tau τ中观测来自执行动作; v v v识别预期终止条件。

独立看来都合理的组件,分阶段生成时会发生相互漂移。不同领域准确性证据形式不一样:工具调用校验schema+执行;代码编译+单元测试;形式推理调用证明助手;G(\mathcal{U})I/具身智能检查模拟器状态。没有完备预言机时,混合规则+语义评审。

4.2 因子层面的准确性

  1. 环境准确性 : E E E声明的工具、状态、策略、转移逻辑要一致。局部检查schema、参数类型、返回值、重置行为;全局检查状态变更、策略执行。可执行环境的价值是可以在回滚前做组件级校验。
  2. 任务准确性 : q q q可解释、在对应状态工具策略下可行。多轮场景任务经常隐式、逐步揭示,需要保证随交互推进意图语义自洽。校验可以放在交互前(蓝图、规划),也可以放在交互过程检查逐步显现意图。
  3. 交互准确性 : τ \tau τ动作符合schema、观测具备因果基础、行为与任务策略保持一致。轨迹直接作为行为监督,轨迹错误会被模型直接模仿,因此大量校验工作集中在轨迹过滤。
  4. 校验器与结果准确性 : v v v正确识别成功、拒绝真正失败,避免引入非预期激励。数据库比对状态、软件工程用仓库编译测试、形式推理用证明助手。对(\mathcal{R})L尤其关键,奖励信号直接决定优化方向。

图4:准确性四大互补因子:环境准确性、任务准确性、交互准确性、校验/结果准确性。

4.3 数据生成全流程准确性保障

4.3.1 规则‑模型‑人工分层校验

没有单一校验器可以捕获全部结构、行为、语义错误。流水线沿着两个维度组合校验:

  • 成本维度:低成本确定性规则 → 模型评判 → 人工复核;
  • 粒度维度:单动作/单轮 → 完整轨迹。

优先用廉价规则过滤明显错误,昂贵校验留给不确定样本。长距离交互,只校验最终轨迹会掩盖中间错误,需要做单步、片段级过滤。

提升模型校验可靠性手段:反思元校验、多评审者委员会。

人工评审成本极高,适合作为升级兜底手段:歧义目标、评判者分歧、安全敏感样本、基准数据集校准审计。

关键点:通过的低层级检查,不能推定该样本拥有更高层级无法观测属性。

4.3.2 约束驱动式构建

在生成阶段就限制产出。

  • 在生成多轮模拟前校验蓝图,防止错误规划污染后续轮次;
  • 工具图、工作流结构在表层文本生成前约束动作与依赖;
  • 有状态环境生成:任务与初始状态、规则、成功条件一起构造;
  • 轨迹优先:从已经执行成功路径反写任务。

不同领域实践:软件工程从仓库状态+可测试变更出发;G(\mathcal{U})I环境参数化应用状态和成功谓词;形式化领域在语法、证明环境内生成。

4.3.3 基于执行与状态的校验

越来越多研究不再只靠"看上去合理"做判断,而是实际执行生成动作轨迹,通过工具返回、状态变更、测试用例、形式目标来校验。避免模型虚构观测,产出可复现失败信号。

  • 工具智能体:真实函数执行、数据库状态、终态校验;
  • 软件工程:仓库搭建、编译、单元测试;
  • 科学、形式推理:证明助手接受度、可执行科学环境。

执行校验很强,但并不完备:轨迹达成终态,依然可能钻校验漏洞、带来非预期副作用、违反隐式约束。因此经常搭配过程检查+语义评审。

4.3.4 基于反馈的修复与选择性接纳

校验结果反过来控制生成过程,而不仅仅过滤最终样本。

  • 环境构建:定位失败测试用例,重新生成损坏工具;
  • 蓝图系统:在实例化对话前修正规划;
  • 回滚系统:从上一个验证成功状态重试。

代表工作:Env(\mathcal{F})actory、Env(\mathcal{S})caler、(\mathcal{U})I‑T(\mathcal{A})(\mathcal{R})(\mathcal{S})、各类自演化编码/检索智能体,把观测错误、结果回灌后续经验生成。

在最早失败阶段拒绝或修复样本,对长轨迹价值极高,一个无效步骤会污染后面全部观测。

风险:反复针对固定校验器做修复,样本会向适配校验器模式收敛。需要保留多条合法路径,并且记录失败类型,定向重新生成,而不是简单丢弃失败样本。递归合成:扩展经过验证种子,对齐指令与校验器,成功任务当做下一轮种子。

4.4 准确性的成本、权衡与局限

  1. 校验强度 vs 成本:规则成本最低;执行、仓库搭建、模拟器回滚、多模型评审、人工检查成本逐级升高。工程实践:广泛使用轻量检查,高成本校验分配给不确定性高、影响大的样本。小一批经过强校验环境,效果可以优于大量弱校验环境。
  2. 与复杂度、多样性耦合:更长时序、更多依赖关系,会增加不一致来源。必须先确认可行性正确性,再认定样本具备高难度;另一方面过于狭窄校验器,会拒绝合法但和预期轨迹不一样的策略。
  3. 残留语义不确定性:部分语义属性无法完全被可执行检查捕获。尤其使用大模型模拟器而不是真实可执行底座时,局部通顺,但状态动力学是错的。即便任务完成,轨迹依旧存在低效、不安全、违背用户意图等问题。混合校验降低不确定性,但不能彻底消除。建议按因子、领域、失败类别报告准确率,而不是单一聚合通过率。

5 复杂度

复杂度决定一份准确数据是否提供有信息增益的学习、评估信号。智能体复杂度不等于轨迹长度、工具调用数量、语言晦涩程度。复杂度是针对给定模型配置,由落地任务‑环境‑交互协议带来的难度。

5.1 (\mathcal{A})CE目标下的复杂度

z z z代表完整执行配置(目标模型、脚手架、可用工具、环境协议、校验器、采样、推理预算)。

KaTeX parse error: Can't use function '\)' in math mode at position 26: ...-\\(\mathcal{P}\̲)̲r[v(d,\tau)=1\m...

同一个样本,换模型、工具、推理预算,复杂度就会改变。

提示:时序长度、依赖深度、分支、部分可观测性、内存需求是解释变量、生成控制手段,不是普适难度分数。被准确性gate过滤掉的损坏环境、不可能任务,其高失败率不算有效复杂度。

(\mathcal{A})CE目标对复杂度做效用优化,而不是无条件最大化难度。过于简单样本容易冗余;全部样本都超出能力边界,则无法提供可学习监督。有用数据落在学习者能力前沿附近可学习区间。复杂度控制双向:样本太简单就增加负担;太难就做简化、脚手架辅助。

对基准很有价值一对对比:基础配置 z 0 z_0 z0 vs 智能体增强配置KaTeX parse error: Got function '\(' with no arguments as subscript at position 3: z_\̲(̲\mathcal{A}\),关注"基础模型不可靠解决,但开启智能体能力后可以解决"区间。

KaTeX parse error: Can't use function '\(' in math mode at position 30: ...\rho\leq p_{z_{\̲(̲\mathcal{A}\)}}...

ρ \rho ρ依赖协议,不是全局常数。

图6:面向学习者的任务复杂度。学习效用最大值落在过简单与完全不可解之间的可学习区间;区间随学习者能力发生漂移。

5.2 因子层面的复杂度

  1. 环境复杂度:可执行世界带来负担,由状态/动作空间结构、工具/对象依赖、转移动力学、观测协议、策略、其他参与者行为决定。环境规模大不等于复杂;只有新增工具、状态带来备选方案、前置依赖、不确定性、后果,才会增加负担。小动作空间也可以复杂:动作存在延迟效果、只有部分状态可见、决策之间会通过持久状态互相影响。
  2. 任务信号复杂度:智能体必须推断的内容、满足的约束。来源:组合目标、互相干涉约束、隐式/逐步暴露意图、多源证据、子目标依赖。不等于语言晦涩;缺失信息只有在可以通过用户询问/工具恢复时才构成复杂度,否则只是歧义不可行。额外条件只有真正约束行为才有意义,无关细节不会提升复杂度。
  3. 交互实现复杂度 :完成有效任务需要的最小交互结构。不可避免串行依赖、分支选择、并行子目标、汇合、循环、澄清、应对意外恢复。区分:任务本身要求的交互 vs 求解器低效带来的冗长轨迹。轨迹长度、工具调用计数只是不完备代理指标,必须反映配置下最短有效求解结构。
  4. 校验器条件下完成复杂度 :校验器定义什么算完成、需要产出哪些证据。可以要求任意终态、多重约束、最优结果、禁止动作、诊断不可行性、中间步骤正确性。更严格完成语义提升决策负担,前提是这些约束对智能体可见,并且校验器可以检测;给校验器无法检查的义务只会带来标签不确定性,不是真正复杂度。

图7:智能体数据因子层面复杂度:环境、任务、交互、完成条件。
四个因子需要联合解读:环境提供决策过程;任务挑选目标条件区域;交互描述必须遍历的依赖;校验器指定接受集合。同一份表层提示,可以修改任意因子改变复杂度。

5.3 构建和校准智能体复杂度

5.3.1 结构规约与组合

先生成子目标图、工具依赖路径、场景技能路径、约束、初始‑目标规划,再实例化任务。深度带来串行依赖;宽度带来并行子目标;汇合要求整合中间结果;条件边让动作依赖当前状态。> 注意:节点边数量多不等于更难;显式链条反而暴露解法;增加条件也可能缩小搜索空间。结构化控制必须配套可执行落地性,再做行为校准。

5.3.2 任务和信息控制

任务侧调整目标,调整初始可用信息。信息可以从初始请求移除,放到后续用户轮次,分布在观测,只能通过工具获取,制造澄清、检索、状态跟踪负担。目标侧增加组合目标、干涉约束、意图变更、多源证据整合。

关键点:可解析性:被隐藏信息必须存在来源和恢复动作;额外约束必须真正影响合法解,否则生成歧义、装饰性细节,而不是有效复杂度。

5.3.3 环境和交互设计

修改决策过程:工具依赖、共享状态、持久数据库、策略边界、观测协议,创造跨多动作生效的前提和后果。选择初始状态,控制信息访问,提升需要推断的状态量,而不用修改可见目标。

不同领域实现:

  • 代码/科学环境:仓库依赖、可执行反馈、多步实验;
  • 具身智能:几何、物理、感知、长动作时序;
  • 社交环境:私有信息、激励、通信、其他智能体策略响应。

额外环境细节只有改变任务相关转移、观测、选择,才会提升复杂度。

5.3.4 完成条件与反馈设计

通过重新定义成功标准控制难度。任务可以要求目标状态、耦合约束、多条评分项、禁止动作、诊断无解场景。使用状态目标、约束程序、评分树、子目标评估器把要求变成机器可检查。

反馈不限于简单成功/失败。面向路径奖励、单步检查,给中间证据收集、动作选择、进度分配信用,可以让长时序任务变得可学,同时保留底层依赖结构。

任务和校验器必须同步演进:增加义务,校验器必须可以检查;否则引入标签错误;修改校验器,等价修改基准,而不是单纯修改难度。

5.3.5 演化与渐进式变换

不从零生成困难样本,而是对已经有效的种子样本做变换。逐步移除过程提示、降低意图显式程度;增强目标条件、约束;扩展经过验证的后续子任务;组合相关技能,生成越来越长工作流。渐进变换保留可落地内核,更容易定位额外负担来源。

自适应变体:利用执行结果、累积经验选择后续变换,针对未解决能力,从失败导出新任务,成功轨迹转为可复用技能。风险:每一步编辑会引入不可行、无关细节,依旧需要准确性gate,记录被修改因子。

5.3.6 基于失败、感知模型能力的校准

结构控制只解释样本为什么可能很难;求解器实际行为,才决定这份样本对特定学习者是否有信息增益。

模型感知流水线:在给定模型、脚手架、推理预算下评估验证过的成功率;保留处在目标成功率区间、能力前沿附近样本。

利用能力画像、观测失败,定向生成弥补特定短板,而不是统一拉高全部结构特征。

失败只有建立在样本有效的前提下才有信息价值。否则前沿样本混杂损坏环境、不可能请求、有缺陷校验器。需要多次验证回滚,分领域分技能分层,再做优先保留、简化或者延后处理。

5.3.7 双向校准与脚手架辅助

复杂度控制是双向的。

  • 样本过于简单:增加依赖、减少信息暴露、收紧完成条件;
  • 样本超出可学习区间:反向操作做简化,提供中间目标、过程前置条件、动作提示、澄清机会。

矫正反馈、参考动作,也可以把原本不可及任务,变为可用监督样本。脚手架可以把规划、路由、评判交给辅助智能体;选择性人工协助解决歧义、领域阻塞。

脚手架会改变执行配置 z z z;固定底层实例不变,对比有无脚手架,区分目标:生成更难任务 / 获取可学习监督 / 度量辅助带来收益。

5.4 复杂度估计与报告

复杂度评估结合结构化描述 + 面向行为校准

  1. 结构化报告:描述被操作因子:目标约束、信息暴露、依赖拓扑、状态‑观测设计、时序、分支恢复、校验语义。描述解释为什么样本可能困难,支持可控消融实验,但不能当做普适难度分数。
  2. 行为报告:写明目标模型、脚手架、工具、推理预算、采样协议、回滚次数。成功率按领域、技能、结构区间分层报告,存在随机性要标注不确定性。配对评估价值很高:对比单一干预前后;对比基础模型、智能体增强配置,使用同一批校验过数据。

关键:要报告两者之间的关系:更深依赖、更少信息、更丰富状态、更严格完成语义是否真正降低验证后成功率;该效应是否跨模型成立,而不是某求解器偶然产物。

5.5 复杂度权衡与局限

  1. 复杂度 vs 准确性:依赖、状态转移、完成条件变复杂,失败可能性扩大,校验负担上升。长轨迹尤其脆弱,早期错误会污染全部后续状态。必须在schema、执行、语义、校验检查完成之后评估难度,否则容易把损坏任务误认为难题。强有效性约束会降低候选产出;但是放宽校验不能制造真正有用复杂度。
  2. 复杂度 vs 多样性:感知模型生成,经常聚焦当前失败的窄集合,短期学习效率提升,但丢失其他领域、技能、简单样本(保证记忆留存)。只追求前沿样本会丢失基础能力。应当在显式覆盖约束内做面向难度的筛选,不能用前沿难度完全替换多样性。
  3. 复杂度 vs 现实真实性:真实性代表环境、任务、交互是否反映部署场景;复杂度代表推理、信息、动作负担。真实工作流经常复杂,但也有大量常规流程;合成任务可以很难,但脱离现实无关。重建环境应当保留任务相关动作语义、状态转移、约束,而不是盲目最大化细节、难度。复杂度声明需要指明目标任务家族、部署场景。
  4. 代理指标保真度与校准成本:时序长度、工具数量、图深度等代理指标廉价可控,但不能可靠预测行为难度;增加步骤可以是并行,增加约束反而缩小搜索。行为校准信息量大,但需要多次可执行回滚,对模型、脚手架、推理预算、随机噪声敏感。工程实践:廉价结构化初筛 + 针对边界样本的昂贵模型评估。
  5. 难度 vs 可学习性:最大化失败率会推到超出可学习区间,没有成功轨迹、稳定奖励、可解证据。面向前沿的方法追求混合结果,或者强脚手架带来可解优势;对完全不可及样本做简化或者搁置。> 训练数据一般追求可获得学习信号;评估集可以保留高难度尾部,用来衡量未来进步。
  6. 课程漂移与闭环偏差:学习者能力提升,有用复杂度区间随之移动。静态生成流水线最终饱和;持续自适应生成会过拟合当前模型特有失败、固定校验器、单一模拟器动力学。需要固定锚定测试集、 held‑out领域、定期重新校准,区分真正能力提升 vs 生成器‑学习者共同适配同一个反馈闭环。

6 多样性

多样性关注已经准确、复杂度合适的数据覆盖广度。不由样本数量、prompt、工具、领域标签决定;而看数据是否覆盖那些会改变智能体观测、决策、行为的差异。有效单元:一份有效、行为有区分度的环境‑任务‑交互关系。

6.1 (\mathcal{A})CE目标下的多样性

多样性是经过准确性过滤后的批次级效用。

  • 有效性条件:不一致环境、无效轨迹只会扩大错误空间,不是有用支持集;
  • 结构性:简单改写措辞、重命名工具,行为依旧可以完全一样;
  • 学习者感知:对一个模型新颖,对另一个模型可能已经冗余;无边界新奇会跳出可学习区间。

KaTeX parse error: Can't use function '\(' in math mode at position 2: \̲(̲\mathcal{D}\)(\...

KaTeX parse error: Can't use function '\(' in math mode at position 14: \mathcal{B}{\̲(̲\mathcal{A}\)}准确性过滤样本; I z \mathcal{I}{z} Iz学习者配置 z z z下有用复杂度区间; H H H经验分布熵; w k w_{k} wk各因子权重;KaTeX parse error: Can't use function '\(' in math mode at position 9: \mathrm{\̲(̲\mathcal{R}\)ed...行为冗余惩罚。奖励有效样本内部均衡因子覆盖,拒绝表面变体、单纯扩大数据集规模。

该式是设计原则,不是通用打分;每个领域需要指定因子表示、熵估计器、冗余度量、权重、目标复杂度区间。

6.2 因子层面的多样性

  1. 环境规约多样性:可执行世界的变体:工具/动作schema、初始状态、动力学、观测接口、策略、模态、校验器、其他参与者。子维度:状态、动作空间、观测、动力学、规则、奖励多样性。> 警告:工具计数是弱代理;修改权限、策略、隐式状态,比新增名义(\mathcal{A})(\mathcal{P})I带来更大行为变化。
  2. 任务信号多样性:要达成的目标。跨目标能力、干涉约束、用户画像、意图显现方式、可行性区间、时间条件、难度带。表面请求只有改变证据、决策、合法输出,才构成真正不同。澄清、拒绝、部分完成、恢复、成功完成,应当当做不同任务模式,不要全部笼统归为困难案例。
  3. 交互实现多样性:固定环境‑任务对,可以存在多条合法交互。时序轮次结构、备选规划、工具替换、动作表示、澄清恢复模式、辅助手段、结果。区分:揭示不同策略的备选路径 vs 滚动噪声、无意义反复犹豫。失败轨迹只有当失败可落地,修正与结果经过校验,才有价值。
  4. 生成器与溯源多样性:数据集继承源语料、教师模型、prompt、模拟器评判器的先验。混合来源可以降低单一生成器盲点;但是不同模型来源,依旧产出相同模板任务轨迹。需要记录溯源,最终评估看带来的因子覆盖、学习者收益,而不是来源本身。

图8:多样性四大互补因子:环境规约、任务信号、交互实现、生成器溯源。

6.3 拓展智能体多样性:实现机制与领域实证

多样性很少被单独最大化;现代流水线组合多种机制,扩大/重新平衡上面部分或全部因子。

6.3.1 数据源与支持集扩展

直接增加环境、工具库、代码仓库、场景、用户模态、任务源、校验模式。

  • 真实生态:带来长尾真实行为,但是数据分布不平衡;
  • 模型生成:可控,但容易重复教师先验模板;
  • 程序化构造:支持执行重置,但模板集合可能很小。

名义规模不是衡量标准;真正价值来自新增有效能力、关系、状态转移、反馈结构。小而强校验的环境集合,可以优于大量不可靠环境。

6.3.2 组合重组

对现有组件建立新关系:多工具依赖、跨应用工作流、用户约束组合、跨文件编辑、多对象任务。图‑蓝图流水线在实例化任务对话前采样兼容组件,减少独立组合带来矛盾。

只有组件之间发生交互、改变要求行为,组合才带来多样性;简单拼接独立子任务只会拉长轨迹。

6.3.3 探索优先、经验驱动发现

先遍历环境、模拟器、代码库、证明系统、假设空间,再从可达行为推导任务、训练信号。支撑工具G(\mathcal{U})I、机器人、程序发现、科学检索。

风险:窄探索策略反复访问熟悉状态策略;奖励驱动搜索会忽略有用但是难打分行为。需要多策略、外部种子、重置、新颖信号、状态覆盖估计,区分环境可以支持什么 vs 当前探索器碰巧发现什么。

6.3.4 扰动与反事实变体

固定其他部分,受控修改部分因子:初始状态、策略、用户约束、观测格式、工具语义、布局物理参数。暴露查询、动作、观测、领域偏移。领域随机化提升具身智能迁移。

匹配反事实价值很高,可以验证状态/策略变更是否真正带来动作变化。只改变表层形式只会增加表观熵;不合逻辑扰动会脱离部署分布。都需要有效性、行为校验。

6.3.5 覆盖度引导的平衡与自适应

覆盖引导流水线瞄准代表性不足因子组合,删除冗余样本,向未覆盖迁移缺口分配生成资源。

模型自适应流水线利用失败、不确定性、成功率区间,在学习者当前前沿附近产出经验。自演化系统把观测行为、累积经验、世界模型错误回灌任务与经验生成。

自适应可以提升边际效率;但会过拟合瞬时模型失败。需要覆盖约束、分层回放、定期广泛探索,保护技能、领域、简单锚点样本,同时前沿移动。
图9:不同智能体领域多样性的实例;有效多样性需要看行为单元,而不是表层变体。

表3 分领域智能体多样性代表性工作

表格分为:工具使用与数字智能体;Web/G(\mathcal{U})I计算机操作智能体;代码软件工程智能体;具身和社交智能体;科学与形式化智能体。

核心机制描述该领域行为多样性来源;(\mathcal{R})esource给出公开GitHub / Hugging(\mathcal{F})ace链接。

6.3.6 分领域实现与实证
  1. 工具使用与数字智能体

    早期只关注(\mathcal{A})(\mathcal{P})I集合规模;现代流水线丰富可执行状态效应、工具依赖图、多轮信息流、错误恢复、动作表示。检索智能体的多样性体现在数据源、检索引擎、查询分解、证据融合,即便检索接口不变。工具池、单任务工具集合覆盖比重复采样带来更好分布外泛化。

  2. Web、G(\mathcal{U})I、计算机操作智能体

    变体来源:应用、布局、操作系统、模态、初始状态、持久效果、跨(\mathcal{A})pp工作流。结合真实复刻接口、程序化任务生成、轨迹反向合成、环境探索、多模态恢复轨迹。

重要区分:视觉截图不同 ≠ 交互拓扑不同;同一个屏幕只改权限/状态就反转正确动作。迁移到未见过真实接口,比单纯生成页面数量更有说服力。

  1. 编码和软件工程智能体
    环境覆盖:编程语言、仓库结构、依赖、构建系统、测试用例、项目历史;任务‑轨迹覆盖:issue类型、定位路径、编辑范围、测试反馈、恢复。

有效单元:经过验证的问题‑仓库‑反馈关系,不是issue描述或者仓库计数。

  1. 具身和社交智能体
  • 具身:场景、物体、可交互 affordance、物理规则、传感器、动作效果;程序化世界生成只有场景变化耦合任务图、物理约束才真正有价值。
  • 社交:其他参与者策略、激励、私有信息、通信渠道、制度。仅仅改变人物人设价值有限,必须改变状态转移、奖励。
  1. 科学与形式化智能体
    候选空间大,但可行性、校验约束非常强。在属性预测器、模拟器、形式检查器约束下探索材料、蛋白、假说、实验、程序、证明。候选多样性不等于有效发现多样性,校验器能力必须跟着候选空间一起拓展。

6.4 多样性度量

不能只用单一数字总结多样性。度量流程:

  1. 确定环境、任务、交互哪些因子需要覆盖;
  2. 确认样本行为真正不一样;
  3. 确认样本准确、复杂度合适;
  4. 评估对 held‑out 设置的泛化;
  5. 评估对学习者的边际收益。
因子覆盖度与均衡性

把每个因子划分为类别集合 KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{S}\)}_...。

KaTeX parse error: Can't use function '\(' in math mode at position 41: ...\{b\in\mathcal{\̲(̲\mathcal{S}\)}_...

C o v k \mathrm{Cov}_k Covk:类别覆盖率; H ~ k \widetilde{H}_k H k归一化熵,衡量分布均衡性。两者互补:覆盖率高,但绝大多数样本集中一类;熵高,但是重要类别缺失。

同时看少量有意义联合分布,例如工具族 × 任务能力,避免每个因子单独好看,但是只出现固定组合(模板锁死现象)。完全笛卡尔积不现实,优先选择对应部署偏移、已知依赖的组合。

行为非冗余性

文本相似度只能检测复述改写。智能体数据应当比对工具调用图、动作图、状态转移、依赖路径、恢复模式、终态变更。图指纹、核方法度量行为非冗余;必须报告表示方式、相似度函数。

(\mathcal{A})CE条件下覆盖度

度量多样性前先经过准确性gate,限定复杂度区间。聚合统计会掩盖稀有域、长轨迹的低准确率。多样性统计需要搭配有效性率、失败类型,以及每个重要因子切片下的模型相对难度。

迁移覆盖度

内部覆盖度不等于泛化能力。更强证据:在明确 held‑out 因子(未见过工具、schema、状态、策略、接口、用户行为、时序)下评估,报告域内‑域外性能差距。

学习者边际收益

新覆盖区域,相比从已有区域重复采样,是否带来更大提升。样本对语料库新颖,对模型可能已经很简单;对模型新颖,但难度过高无法学习。模型感知生成用能力画像、成功率区间近似区分。评估要区分:语料新颖度、相对模型新颖度、下游迁移收益。

6.5 多样性权衡与局限

  1. 多样性 vs 数量:在已经饱和模式之外拓展结构覆盖,比在已有模式重复采样边际收益更高。数量依然重要,在真正采样不足区域增加样本可以提升鲁棒性。警告:原始计数无法区分是拓展支持集,还是重复采样。缩放声明必须做覆盖度受控对比。
  2. 多样性 vs 准确性:组合重组更容易出现工具不兼容、目标不可达、状态不一致、校验器错位。拓展多样性必须配套执行、过程测试、状态检查。同时校验器支持集可能比合法解空间窄;针对单一校验器优化接纳条件,会丢弃合法策略,数据集表观多样性下降。多样性拓展建立在有效性之上;校验器覆盖度、独立审计需要同步拓展。
  3. 多样性 vs 感知模型复杂度:数据集整体多样,但对特定学习者分配不合理。部分区域多样但是已经学完;只瞄准前沿会丢掉基础技能。复杂度区间移动,多样性评估也要分难度带。自适应生成需要监控跨技能、跨领域会不会发生坍缩。
  4. 真实性、可控性、规模
    • 真实系统:真实动力学长尾行为,但成本高,不安全,难以重置,时序漂移;
    • 程序复刻环境:可控、确定校验,但丢失未建模行为;
    • 大模型模拟器:便宜扩规模,但会编造状态转移。
      混合方案:真实规约/日志 + 可执行复刻 + 模型组件。多样性声明要考虑模拟器保真度,在held‑out真实环境测试。
  5. 混合干扰与开放世界漂移
    不同域、不同生成器混在一起,带来格式、动作约定、奖励尺度、采样频率冲突。标准化、平衡混合可以缓解,但激进归一化会抹除领域特有语义。任何有限混合都是快照:工具、接口、用户行为持续变化。可持续多样性需要溯源记录、漂移检测、定期修复支持集,不能一次性最大化。

7 讨论

前面章节使用(\mathcal{A})CE分析智能体数据的构造与筛选。本章讨论围绕智能体数据生成的更广问题,而不是又一套改进准确性‑复杂度‑多样性的机制。

7.1 (\mathcal{A})CE目标下的缩放定律

传统数据缩放看"样本变多性能提升"。(\mathcal{A})CE视角下,原始样本数量是弱代理。新增样本贡献参差不齐:

  • 准确性决定生成池多大一部分真正可用;
  • 复杂度决定有效样本是否处在学习者有用区间,而不是饱和或者完全不可解;
  • 多样性决定新增样本是否拓展行为支持集,还是只是重复已有模式。

现有实验表明:同等甚至更小数据预算下,面向多样性缩放,可以优于简单数量缩放;少量强校验、行为有区分的环境,可以远好于大量冗余弱校验环境。

智能体数据的有效缩放变量更接近有效支持集大小 ,而不是原始轨迹条数。

缩放可以来自三方面:产出更多有效经验;概率质量向学习者有用复杂度前沿移动;拓展环境、状态、任务、策略、交互结构的覆盖。三者互相耦合。

静态数量缩放收益会递减,除非生成与分配跟随学习者同步自适应。面向未来,智能体数据缩放定律可能不再关注性能随轨迹数量增长,而是关注新增生成可以多高效拓展「准确、难度合适、行为非冗余」的经验集合。

7.2 (\mathcal{A})CE视角:真实数据与合成数据

区分来源:

  • 真实数据:采集自真实部署环境,人与(\mathcal{A})I交互;环境、任务、行为来自真实使用,不是专门为生成流水线构造。
  • 合成数据:由模型、程序、模拟器、受控变换构造,实例化全新环境、任务、交互、监督信号。

两者没有绝对优劣,在(\mathcal{A})CE三个维度各有长短:

  1. 准确性

    • 真实数据:提供真实接口、行为、用户需求证据,但不等于全部正确;日志包含失败低效行为、隐藏上下文、隐私问题,部分结果无法复现校验;
    • 合成数据:可以显式绑定状态约束、校验器,重新生成失败案例;正确性上限取决于生成器、模拟器保真;可能看上去合理,但任务不可落地,过度机器化。

    真实来源适合做落地性、外部审计;合成擅长可控执行、显式监督。

  2. 复杂度

    • 真实工作流天然存在耦合约束、长尾状态、延迟效应;但是难度不可控,大量样本落在有用区间之外;
    • 合成流水线可以修改依赖、信息暴露、脚手架,定向瞄准模型相对前沿;代价是部分长样本人工构造,脱离现实。
  3. 多样性

    • 真实生态暴露真实用户、工具库、时间维度变体;但观测数据高度偏向高频工作流;
    • 合成可以大规模填充缺失组合、反事实案例;但共享prompt、教师模型会带来狭窄行为支持集。

推荐混合分配,而不是固定真实‑合成比例。真实数据定义部署相关因子,作为环境语义种子,作为hold‑out审计集;合成围绕锚点拓展、平衡、校准支持集。根据当前短板选择:保真度不足就补充真实证据;缺少校验可落地性、模型感知难度,就使用受控合成。

7.3 面向智能体预训练、中间训练的数据生成

绝大多数智能体数据生成用于训练后阶段:(\mathcal{S})(\mathcal{F})T学习交互格式,(\mathcal{R})L从环境反馈优化行为。该模式给后期阶段巨大压力:基座大模型既要学习通用先验,又要学习特定智能体任务。

智能体预训练、中间训练,更早让模型接触状态转移、动作‑观测依赖、工具组合、长时序信息检索。目标不是替代后训练,而是沉淀可复用概念,供后续对齐、策略优化使用。

该转变改变规模与数据形态:完整专家真实环境回滚成本太高,不足以支撑预训练量级。因此大量工作把代码库、视频、文档、关系结构转为交互相关监督。训练单元不再必须是完整 d = ( E , q , τ , v ) d=(E,q,\tau,v) d=(E,q,τ,v)。局部状态转移、逆动力学样例、依赖补全、可达性目标、蒸馏策略、因果知识,可以用来学习组件,后续再组合成完整智能体行为。

(\mathcal{A})CE侧重点发生变化:

  • 准确性依旧是底线,但更多关注局部转移正确性、来源保真、分布噪声,不一定要求完整任务通过校验;
  • 复杂度关注片段带来信息、依赖负担,而不只是端到端任务难度;
  • 当质量控制可以实现,多样性变得尤其重要:预训练‑中间训练需要建立广泛先验,下游任务未知。

有前景方向:用后训练反馈筛选/加权早期数据;强校验锚点搭配更大规模弱监督语料;确定哪些交互知识应当内化到权重,哪些保留为外部可更新组件。

7.4 面向自演化智能体的数据生成

自演化智能体:数据生成不再是离线准备步骤,而是持续学习闭环的一部分。不再训练前建好固定数据集;系统观察智能体行为,识别能力缺口,生成/发现相关经验,使用校验结果引导下一轮更新。

系统观察行为,识别能力缺口,生成或者发现相关经验,使用验证结果引导下一轮更新。

数据生成变成决定智能体接下来该体验什么,而不仅仅产出更多样本。

产出物不再只限于完整任务、成功轨迹。闭环可以围绕失败定向创建任务、修改难度、探索环境发现新可达状态、修复无效回滚、从成功轨迹提取技能、重放历史经验保护已有能力。

模型感知生成使用成功率,把任务调整到当前学习者前沿;自演化系统通过经验复用、归因、轨迹导出技能,提升样本利用率。

(\mathcal{A})CE在这里变成动态目标:

  • 准确性:防止错误反馈被反复强化;
  • 复杂度:随能力前沿移动,决定经验应当变难、简化、增加脚手架;
  • 多样性:防止闭环只聚焦最近失败,策略狭窄。

风险:生成器、学习者、校验器共同进化,互相确认错误假设。稳定自演化,需要固定或独立更新锚点:hold‑out任务集、外部执行、定期真实环境评估。开放挑战不是简单自主生成数据;而是闭环持续拓展能力,同时不放大错误、不缩窄覆盖、不遗忘旧行为。

8 结论

智能体数据生成是联合构造可执行环境、具备落地性任务、交互过程,必要时构建可信成功信号。本文把组件因子化,同时提出(\mathcal{A})CE分析透镜,看待生成后分布应当如何塑造。

生成范式区分正向、反向、结构优先流水线;(\mathcal{A})CE揭示仅仅产出表面通顺样本不足以构建高质量智能体数据。

文献给出(\mathcal{A})CE非对称解释:

  1. 准确性:依靠环境‑任务‑交互‑校验器之间一致性,划定可行支持集合;
  2. 复杂度:相对于学习者与执行配置做校准,不要盲目追求更长表层结构;
  3. 多样性:度量有效行为覆盖,而不是样本数量、表层文本变体。

三者一起,建议评估流水线看:可靠、非冗余学习增益;同时明确校验覆盖度、模型依赖性、生成成本。

领域趋势:从固定训练后轨迹,走向生成式环境、更广泛预训练‑中间训练监督、跟随学习者不断演化的反馈驱动经验。

在此背景下,数据生成从一次性生产步骤,变成持续流程:发现能力缺口,构造校验相关经验,随学习者进化分配经验。

核心挑战,不在于实现全自动生成;而维护有根基学习闭环,拓展能力,同时不放大错误,不缩小覆盖,保持与真实环境联系。

相关推荐
我是大AI33 分钟前
RAG架构下的品牌可见性革命:GEO监测技术解析与搜极星实践
人工智能·架构
大模型码小白35 分钟前
AI 提示词专栏:使用系统指令(System Prompt)实现全局约束
java·大数据·运维·开发语言·人工智能·python·prompt
土星云SaturnCloud36 分钟前
超轻量 OCR 实战:PP-OCR 边缘部署实践
服务器·人工智能·ai·ocr·边缘计算
河南凹凸环境艺术设计1 小时前
民宿酒店设计实力公司
大数据·人工智能·python
Hotchip_MEMS1 小时前
从“手工作坊”到“全自动贴装”:MEMS如何重塑雾化器制造流程
人工智能·笔记·物联网·电脑·制造
阳明山水1 小时前
Mamba与两阶段XGBoost的融合架构:面向间歇性需求的双路径预测框架
人工智能·深度学习·算法·机器学习·架构
海盗12341 小时前
AI新闻日报_2026-08-27—— Qwen4/GLM-5.3-Flash 开源、OpenAI Agent 越狱事件、世界人形机器人运动会
人工智能·机器人·开源
zzzll11111 小时前
Hermes Agent:轻量级 AI 智能体框架实战指南
人工智能