AutoDesign:面向长时序智能体设计的元调度优化框架

AutoDesign:面向长时序智能体设计的元调度优化框架

arXiv:2608.13560v1

摘要

将多模态原始素材转换为精炼结构化可视化产物,本质可抽象为一套以模型调度系统为核心的长时序智能体任务。理想的调度系统应当贴合人类设计先验,并通过试错探索沉淀可复用经验,实现递归自优化;但现有技术方案均为静态架构,不具备该能力。

本文提出AutoDesign 框架,该框架对齐人类设计偏好,通过元调度优化器引导代码智能体,基于任务执行反馈递归迭代优化调度器本身。

为完成框架落地与效果验证,本文聚焦「学术论文自动生成会议海报」任务,构建评测基准PosterBench:包含覆盖5大学科共100篇论文的主测试集,以及由10篇论文构成的迷你子集PosterBench-mini,用于可控对照实验。

核心实验结果

  1. PosterBench完整主测试集上,AutoDesign取得78.32的综合得分,领先闭源商业系统Claude Design 7.45分;
  2. 在7组受控代码智能体+大模型组合实验中,接入本文训练完成的DesignHarness调度器后,平均基准得分从54.99提升至67.39,涨幅12.4%;
  3. 全自主长时序执行链路下,40分钟内完成海报生成,单次执行253次工具调用(y_0、f_0)11轮迭代编辑,总成本低于3美元,输出产物达到人类制作会议海报水准;
  4. 盲测人类偏好实验证明,在全部参评系统中AutoDesign获得最高人类偏好度。

1 引言

人类信息交互普遍需要从多异构模态素材中提取(y_0、f_0)整理信息,并输出面向人阅读的可视化产物,例如网页(y_0、f_0)幻灯片(y_0、f_0)学术海报(y_0、f_0)演示视频。这类多模态输入转结构化输出任务,需要完成证据提取(y_0、f_0)跨模态复杂推理(y_0、f_0)多阶段任务规划(y_0、f_0)基于反馈迭代优化,天然属于高难度长时序代码智能体任务。但搭建此类系统存在两大难点:真实业务流程复杂度高(y_0、f_0)高度依赖人工持续反馈。

现有多模态设计系统依靠「生成-评判-修改」循环对齐人类设计偏好,部分方案引入视觉参考(y_0、f_0)设计专项反馈优化输出。但现有方法存在本质缺陷:系统仅利用单次反馈修改当前产物,无法从大量成功/失败迭代中沉淀可复用设计知识;没有解决核心问题:如何将多模态原始素材(y_0、f_0)结构约束(y_0、f_0)人工偏好(y_0、f_0)迭代反馈转化为生成系统可持续的设计能力。

本文核心思路:元调度优化

本文将对齐人类偏好的自动生成任务定义为元调度优化问题 :智能体系统不单独优化单张海报等输出产物,而是基于人类偏好标注的评估指标,递归优化整套设计调度器(Design Harness)。

AutoDesign包含两层嵌套循环:

  1. 内层循环(设计调度器Design Harness):输入原始素材,生成可编辑产物,基于评判反馈迭代修改;
  2. 外层循环(元调度器Meta-Harness) :跨多组任务持续优化内层调度器。
    • 先通过人工标注参考产物初始化对齐人类偏好的评估器;
    • 聚合多任务执行轨迹与得分,归纳高频失败场景;
    • 调用代码智能体作为优化器,对调度器组件做限定范围更新;
    • 新增准入门控机制:仅当更新在训练集效果提升(y_0、f_0)验证集效果不衰减时,才接纳本次更新,防止过拟合。

经过多轮接纳的迭代更新,最终产出可独立运行的DesignHarness调度器,可自动完成素材读取(y_0、f_0)产物迭代生成(y_0、f_0)多维度校验修正(y_0、f_0)标准化输出。本文将该系统落地于论文转海报场景:该任务要求将长篇多模态学术原文压缩为单页清晰海报,同时完整保留原始论文证据溯源链路。DesignHarness可直接产出符合会议标准(y_0、f_0)贴合人类审美的可编辑海报,大幅降低人工制作成本与时间。

现有评测基准缺陷

现有论文转海报评测方案仅覆盖布局(y_0、f_0)文本提取(y_0、f_0)内容忠实度(y_0、f_0)视觉质量等单一维度,缺少完整(y_0、f_0)端到端的标准化评测流程。本文提出PosterBench基准,包含100篇跨5学科论文主集(y_0、f_0)10篇迷你快速测试子集,采用7维度加权评分体系,融合规则算法校验(y_0、f_0)视觉大模型打分(y_0、f_0)混合评估方案;配套3类受控实验赛道,可独立拆解各模块贡献;同时配套全盲人类偏好实验,自动评测指标与人主观偏好形成双向验证。

量化核心结论

  1. PosterBench-mini实验:7组代码智能体接入DesignHarness后,基准平均分从54.99提升至67.39,平均涨幅12.40;
  2. PosterBench主集:AutoDesign(Claude Code+Claude 4.8)得分78.32,超越同配置Claude Design商业系统7.45分,超越OpenDesign 8.87分;
  3. 低成本落地方案:(\mathcal{L})ongCat-2.0搭配DesignHarness单张海报成本仅0.27美元,基准得分55.13;
  4. 人类盲测:933组有效成对对比中,AutoDesign布拉德利-特里偏好估计值64.0%(95%置信区间55.2%~77.8%);两组系统基准分差≥20分时,人类选择与评测指标最优系统匹配度达74.4%。

本文四大贡献

  1. AutoDesign元调度优化框架:将静态调度器改造为可递归自迭代的人类对齐多模态生成系统。7天完整演化轨迹累计调用224个子智能体,完成至少123次递归迭代,沉淀54版调度器更新;可将人工标注参考海报(y_0、f_0)任务执行轨迹(y_0、f_0)渲染诊断信息(y_0、f_0)评估反馈转化为调度器内置持久化设计先验。
  2. DesignHarness可执行论文转海报系统:由AutoDesign迭代演化得到,依托代码工具智能体读取论文全文,融合可编辑生成(y_0、f_0)自动渲染(y_0、f_0)规则校验(y_0、f_0)视觉大模型反馈局部修正四大能力,输出完整溯源原始论文的可商用海报。
  3. PosterBench综合评测基准:论文转海报专用标准化评测协议,7大评分维度:忠实度(y_0、f_0)内容覆盖率(y_0、f_0)信息密度(y_0、f_0)可视化证据(y_0、f_0)排版布局(y_0、f_0)可读性(y_0、f_0)美学;基线系统Claude Code(Claude 4.8)裸跑得分70.01,接入DesignHarness提升8.31分,同时大幅领先商用系统Claude Design。
  4. 全自主长时序智能体落地验证:DesignHarness可无人工干预完成整套海报生成流程,40分钟内执行253次工具调用(y_0、f_0)11轮编辑迭代,总成本低于3美元;配套交互式演示平台,支持海报局部二次编辑。

2 元调度数学定义与形式化建模

2.1 设计调度器 Design Harness 定义

参考近期将调度器与模型权重解耦优化的研究,设计调度器HHH定义为包裹固定大模型的整套执行系统,输入多模态素材(论文/报告),输出面向人类的可视化产物(海报(y_0、f_0)幻灯片(y_0、f_0)网页(y_0、f_0)视频):

y∼H(πθ,x,c)(1)y\sim H(\pi_{\theta},x,c) \tag{1}y∼H(πθ,x,c)(1)

  • πθ\pi_{\theta}πθ:固定参数大语言/多模态模型;
  • xxx:多模态原始输入素材;
  • ccc:任务上下文,包含输出载体格式(y_0、f_0)用户约束;
  • yyy:最终可视化产物;
  • τ\tauτ:完整执行轨迹,记录生成过程所有中间动作(y_0、f_0)状态(y_0、f_0)修改记录。

为支持系统化元优化与贡献归因,将调度器HHH拆解为五大功能组件,仅定义高层抽象,具体实现由元调度器迭代生成:

  1. 上下文与记忆组件:原始素材管理(y_0、f_0)提示词(y_0、f_0)可复用技能(y_0、f_0)持久化任务状态;
  2. 工具与规范组件:绘图工具(y_0、f_0)产物编辑规范(y_0、f_0)排版/字体/证据溯源约束;
  3. 执行运行时组件:渲染工作空间(y_0、f_0)产物导出(y_0、f_0)自动校验环境;
  4. 流程编排组件:任务分发(y_0、f_0)迭代轮次限制(y_0、f_0)失败回退(y_0、f_0)最终输出整合;
  5. 评估与反馈组件:规则校验(y_0、f_0)视觉大模型评判(y_0、f_0)局部修正反馈生成。

2.2 元调度器 Meta-Harness 定义

元调度器是作用于设计调度器的优化系统 :输入用户任务需求(y_0、f_0)初始调度器H0H_0H0,迭代优化调度器实现,输出最优调度器HTH_THT。

  • 设计调度器:素材→可视化产物;
  • 元调度器:调度器需求+旧调度器→优化后的新调度器。

优化目标为调度器生成产物的期望综合质量,设ptaskp_{\mathrm{task}}ptask为任务分布,调度器HHH性能定义:

KaTeX parse error: Can't use function '\(' in math mode at position 18: ...H)=\mathbb{E}{\̲(̲(x,c)\)\sim p{...

Rmeta(y,x,c)R_{\mathrm{meta}}(y,x,c)Rmeta(y,x,c):元调度器内置评估器,根据原始素材xxx(y_0、f_0)上下文ccc打分产物yyy。

元调度优化最终目标:

H⋆=arg max⁡H  J(H)(3)H^{\star}=\underset{H}{\operatorname{arg\,max}}\;J(H) \tag{3}H⋆=HargmaxJ(H)(3)

优化过程中大模型πθ\pi_{\theta}πθ参数全程固定,仅优化外层调度执行系统,区分「模型权重训练」与「调度脚手架优化」。

3 元调度双层自优化循环

AutoDesign由两层嵌套反馈循环构成:内层循环优化单份可视化产物(y_0、f_0)外层循环迭代升级整套调度器。

  1. 内层循环:固定调度器HHH,针对单任务KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲(x,c)\)反复生成(y_0、f_0)修正产物,记录完整执行轨迹τ\tauτ;
  2. 外层循环:聚合多任务轨迹与得分,定位系统性缺陷,更新调度器HHH。

3.1 内层循环:单海报迭代生成

初始调度器基础架构仅包含两大抽象模块:设计师模块MdesignM_{\mathrm{design}}Mdesign (y_0、f_0)评判模块McriticM_{\mathrm{critic}}Mcritic

迭代第kkk轮交互公式:

yk=Mdesign(yk−1,fk−1;x,c)fk=Mcritic(yk;x,c)(4) \begin{align*} y_{k} &=M_{\mathrm{design}}(y_{k-1},f_{k-1};x,c) \\ f_{k} &=M_{\mathrm{critic}}(y_{k};x,c) \end{align*} \tag{4} ykfk=Mdesign(yk−1,fk−1;x,c)=Mcritic(yk;x,c)(4)

  • yky_kyk:第kkk轮迭代后的海报产物;
  • fkf_kfk:评判模块输出的修正反馈;
  • KaTeX parse error: Can't use function '\(' in math mode at position 4: y_0\̲(̲y_0、f_0\)f_0初始为空,首轮直接基于原始素材生成初稿。

该公式仅定义模块功能与信息流转逻辑,提示词(y_0、f_0)工具(y_0、f_0)反馈机制(y_0、f_0)循环控制策略等具体实现,均由外层元调度循环迭代优化。整套迭代流程记录为执行轨迹τ\tauτ,全程不修改底层调度器HHH。

3.2 外层循环:调度器全局自优化

外层循环每轮迭代分为4阶段:任务批量执行(y_0、f_0)效果评估(y_0、f_0)调度器更新提案(y_0、f_0)更新准入校验。完整流程见算法1。

阶段1:批量执行 Rollout

外层迭代第ttt轮,使用当前调度器HtH_tHt在训练集Dtrain={(xi,ci)}i=1Ntrain\mathcal{D}{\mathrm{train}}=\{(x{i},c_{i})\}{i=1}^{N{\mathrm{train}}}Dtrain={(xi,ci)}i=1Ntrain批量运行;每组任务生成产物ytiy_{t}^{i}yti与执行轨迹τti\tau_{t}^{i}τti,汇总全部轨迹为τt\bm{\tau}_{t}τt。

阶段2:效果评估 Evaluation

优化启动前,使用人工标注的参考海报,训练7维度评估器RmetaR_{\rm meta}Rmeta:

  • 规则校验:量化指标(文字溢出(y_0、f_0)数据不一致(y_0、f_0)空白区域等);
  • 视觉大模型V(\mathcal{L})M:主观维度(排版(y_0、f_0)可读性(y_0、f_0)美学);
    优化全程RmetaR_{\rm meta}Rmeta固定不变,批量打分得到分数集合st\bm{s}_{t}st。

区分:优化过程的RmetaR_{\rm meta}Rmeta仅用于调度器迭代;最终系统对比使用冻结独立基准PosterBench,二者完全隔离。

阶段3:更新提案 Update Proposal

元调度优化器PPP(代码智能体,分规划器(y_0、f_0)代码编辑器双角色)输入:当前调度器HtH_tHt(y_0、f_0)批量轨迹τt\bm{\tau}{t}τt(y_0、f_0)得分st\bm{s}{t}st(y_0、f_0)全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)},生成候选更新调度器Ht+1′H'_{t+1}Ht+1′:

KaTeX parse error: Can't use function '\(' in math mode at position 65: ...}_{t},\mathcal{\̲(̲\mathcal{L}\)}\...

执行约束:单轮迭代仅允许修改五大调度组件中的一个,可修改组件下多个代码文件,但禁止跨组件同时修改,保证效果归因清晰。

  1. 规划器角色:分析历史轨迹(y_0、f_0)得分(y_0、f_0)全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)},并行调用子智能体归纳高频失败模式,输出更新方案(缺陷类型(y_0、f_0)待修改组件(y_0、f_0)预期优化方向);
  2. 代码编辑器角色:基于更新方案修改调度器源码,生成候选调度器Ht+1′H'_{t+1}Ht+1′。
阶段4:准入门控 Acceptance Gate

设置独立验证集Ddev\mathcal{D}_{\mathrm{dev}}Ddev防止调度器过拟合训练任务,仅同时满足以下两个条件,才接纳更新:

Accept⁡(Ht+1′)  ⟺  Jtrain(Ht+1′)>Jtrain(Ht) ∧ Jdev(Ht+1′)≥Jdev(Ht)(6)\operatorname{Accept}(H^{\prime}{t+1})\iff J{\mathrm{train}}(H^{\prime}{t+1})>J{\mathrm{train}}(H_{t})\ \land\ J_{\mathrm{dev}}(H^{\prime}{t+1})\geq J{\mathrm{dev}}(H_{t}) \tag{6}Accept(Ht+1′)⟺Jtrain(Ht+1′)>Jtrain(Ht) ∧ Jdev(Ht+1′)≥Jdev(Ht)(6)

  • 训练集期望得分提升;
  • 验证集期望得分不下降。

接纳逻辑:

  1. 通过校验:Ht+1=Ht+1′H_{t+1}=H'_{t+1}Ht+1=Ht+1′,将本轮迭代信息存入全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)};
  2. 未通过校验:保留原调度器Ht+1=HtH_{t+1}=H_{t}Ht+1=Ht,本轮更新废弃,历史记录留存用于下一轮迭代规避同类方案。

全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)}存储:每轮调度器快照(y_0、f_0)执行轨迹(y_0、f_0)打分(y_0、f_0)修改组件(y_0、f_0)代码变更(y_0、f_0)准入结果;验证集数据不存入记录,仅用于门控校验。

算法1 元调度优化完整流程
复制代码
输入:固定大模型π_θ;初始调度器H₀;评估器R_meta;训练集D_train;验证集D_dev;迭代总轮数T
输出:优化完成调度器H_T;全局优化记录\(\mathcal{L}\)

1. 使用H₀执行全部训练集任务,收集轨迹\(\tau\)₀\(y_0、f_0\)打分s₀
2. 使用H₀执行全部验证集任务,收集验证打分s^dev₀
3. 循环 t = 0 至 T-1:
    3.1 优化器P读取H_t\(y_0、f_0\)\(\tau\)_t\(y_0、f_0\)s_t\(y_0、f_0\)全局记录\(\mathcal{L}\),生成候选调度器H'_{t+1}
    3.2 在训练集执行H'_{t+1},收集新轨迹\(\tau\)'_{t+1}\(y_0、f_0\)打分s'_{t+1}
    3.3 在验证集执行H'_{t+1},收集验证打分s'^dev_{t+1}
    3.4 判断准入条件:
        if J_train(H'_{t+1}) > J_train(H_t) 且 J_dev(H'_{t+1}) ≥ J_dev(H_t):
            标记本轮结果=接纳
            H_{t+1} = H'_{t+1}, \(\tau\)_{t+1}=\(\tau\)'_{t+1}, s_{t+1}=s'_{t+1}, s^dev_{t+1}=s'^dev_{t+1}
        else:
            标记本轮结果=拒绝
            H_{t+1} = H_t, \(\tau\)_{t+1}=\(\tau\)_t, s_{t+1}=s_t, s^dev_{t+1}=s^dev_t
    3.5 将本轮完整快照存入全局优化记录\(\mathcal{L}\)
4. 循环结束,返回(H_T, \(\mathcal{L}\))
人机协同模式(可选)

外层循环支持人工介入,两种干预方式:

  1. 迭代定向引导:人工输入自然语言优化方向gtg_tgt,优化器输入增加引导指令:KaTeX parse error: Can't use function '\(' in math mode at position 60: ...}_{t},\mathcal{\̲(̲\mathcal{L}\)},...,解决优化器收敛至局部最优(y_0、f_0)迭代停滞问题;
  2. 评估器修正:人工发现RmetaR_{\rm meta}Rmeta系统性偏差时,可手动修正评估逻辑;无人工干预时评估器全程固定。

4 优化完成产物:DesignHarness调度系统

经过元调度外层循环迭代收敛后得到DesignHarness,原生支持海报(y_0、f_0)幻灯片(y_0、f_0)网页(y_0、f_0)演示视频多类输出载体;整套系统分为四大核心阶段:论文素材读取(y_0、f_0)产物生成迭代(y_0、f_0)双重校验反馈(y_0、f_0)标准化最终输出。

4.1 论文素材读取 Paper Ingestion

将输入论文xxx(y_0、f_0)任务约束ccc转化为带完整溯源链路的结构化上下文:

  1. 提取论文元信息(y_0、f_0)章节大纲(y_0、f_0)支撑核心结论关键段落;
  2. 提取图表(y_0、f_0)表格,记录其在原文中的精确位置;
  3. 生成内容摘要+载体专属制作方案,明确输出格式(y_0、f_0)核心论点(y_0、f_0)配套可视化素材;
  4. 所有提取内容绑定原文索引,海报中所有文字(y_0、f_0)图表均可反向溯源论文原文,校验阶段自动核查一致性;
  5. 结构化上下文一次性生成,全迭代流程复用,作为设计师模块固定输入。

4.2 产物生成与迭代修正 Artifact Generation and Revision

设计师模块由代码智能体实现,基于读取上下文(y_0、f_0)上一轮产物yk−1y_{k-1}yk−1(y_0、f_0)反馈fk−1f_{k-1}fk−1生成新版本海报yky_kyk,实现公式对应内层循环MdesignM_{\mathrm{design}}Mdesign。

  • 底层产物格式:全程采用可编辑HTM(\mathcal{L}),每轮修改仅局部代码变更,无需全量重绘;
  • 渲染导出:支持PNG预览(y_0、f_0)PPTX(y_0、f_0)MP4等载体格式,用于视觉评判模块读取校验。

4.3 双重校验与最终输出 Validation and Finalization

每轮生成产物yky_kyk同步送入两套校验模块,共同构成评判模块McriticM_{\mathrm{critic}}Mcritic:

  1. 规则阻塞校验器(必过项) :确定性硬约束检查,不通过直接返回局部报错:
    • 缺失/损坏素材(y_0、f_0)原文溯源链接失效(y_0、f_0)文字溢出重叠(y_0、f_0)排版字体约束违规;
    • 全部校验通过则直接终止迭代,进入最终输出流程;
    • 未通过则输出精准局部诊断信息,同步启动视觉大模型评判。
  2. 视觉V(\mathcal{L})M评判器(优化项) :渲染海报预览图输入V(\mathcal{L})M,评估排版平衡(y_0、f_0)可读性(y_0、f_0)美学风格(y_0、f_0)内容贴合度。
    两套反馈合并为统一修正信号fkf_kfk,送入设计师模块迭代优化。
迭代终止规则
  • 最大迭代轮次上限KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲K=12\);任意一轮产物通过全部阻塞校验,立刻停止迭代;
  • 12轮均未通过校验:启动失败回退机制,从历史迭代中筛选满足基础安全约束的最优产物,进入最终输出;
  • 最终输出阶段:排版微调(y_0、f_0)公式标准化(y_0、f_0)素材内联打包,生成独立完整可编辑文件。

整套「生成-校验-反馈-修正」流程构成执行轨迹τ\tauτ,全程底层DesignHarness调度逻辑不改变。

5 评测实验方案 PosterBench

5.1 评测基准 PosterBench 介绍

数据集划分
  1. PosterBench主测试集:100篇论文,覆盖人工智能/生物医药/气候环境/经济政策/物理天文5大学科;
  2. PosterBench-mini迷你集:10篇论文子集,用于快速消融(y_0、f_0)受控对照实验;
    所有系统输入完全一致:论文PDF+配套图表素材,统一渲染尺寸后打分。
7维度加权评分规则

单篇海报AiA_iAi(y_0、f_0)论文pip_ipi输出7维分数qi∈0,107\mathbf{q}_{i}\in0,10^7qi∈0,107,维度权重向量α=(10,10,15,10,20,25,10)\bm{\alpha}=(10,10,15,10,20,25,10)α=(10,10,15,10,20,25,10),加权原始总分:

Rrubric(pi,Ai)=∑j=17αjqi,j/10(7)R_{\mathrm{rubric}}(p_{i},A_{i})=\sum_{j=1}^{7}\alpha_{j}q_{i,j}/10 \tag{7}Rrubric(pi,Ai)=j=1∑7αjqi,j/10(7)

7大评测维度说明:

维度 权重 评测方式 核心判定标准
忠实度 Faithfulness 10 程序校验+V(\mathcal{L})M 文字(y_0、f_0)数据(y_0、f_0)图表与论文原文无冲突,溯源有效
覆盖率 Coverage 10 V(\mathcal{L})M 完整保留研究动机(y_0、f_0)方法(y_0、f_0)实验(y_0、f_0)结论核心信息
信息密度 Density 15 程序空间审计 空白区域占比(y_0、f_0)文本填充度,杜绝大面积留白/文字堆砌
可视化证据 Visual Evidence 10 程序校验+V(\mathcal{L})M 图表与论点匹配(y_0、f_0)尺寸清晰(y_0、f_0)不直接截图论文整段内容
布局 (\mathcal{L})ayout 20 程序空间审计 无文字截断(y_0、f_0)元素重叠(y_0、f_0)边缘裁切,分区结构合理
可读性 Readability 25 程序校验+V(\mathcal{L})M 字体层级清晰(y_0、f_0)阅读动线流畅(y_0、f_0)无密集小字
美学 Aesthetics 10 V(\mathcal{L})M 配色统一(y_0、f_0)学术风格协调(y_0、f_0)排版整洁专业
安全分天花板约束(核心机制)

加权原始总分会叠加多层硬性扣分上限,任意一项严重缺陷直接压低单篇海报最高分:

Rposter(pi,Ai)=min⁡ ⁣(Rrubric(pi,Ai),Cilayout,Civiability,Cifailure,Cigate)Overall=1N∑i=1NRposter(pi,Ai) \begin{align*} R_{\mathrm{poster}}(p_{i},A_{i}) &=\min\!\Bigl(R_{\mathrm{rubric}}(p_{i},A_{i}),C_{i}^{\mathrm{layout}},C_{i}^{\mathrm{viability}},C_{i}^{\mathrm{failure}},C_{i}^{\mathrm{gate}}\Bigr) \\ \mathrm{Overall} &=\frac{1}{N}\sum_{i=1}^{N}R_{\mathrm{poster}}(p_{i},A_{i}) \tag{8} \end{align*} Rposter(pi,Ai)Overall=min(Rrubric(pi,Ai),Cilayout,Civiability,Cifailure,Cigate)=N1i=1∑NRposter(pi,Ai)(8)

  • CilayoutC_{i}^{\mathrm{layout}}Cilayout:严重排版破损上限;
  • CiviabilityC_{i}^{\mathrm{viability}}Civiability:可读性完全失效上限;
  • CifailureC_{i}^{\mathrm{failure}}Cifailure:证据/数据错误硬缺陷上限;
  • CigateC_{i}^{\mathrm{gate}}Cigate:渲染完整性保护门控(基础P0门控封顶40分,严重缺陷分值更低);
    最终系统总分是所有海报封顶后分数平均值,无法通过维度平均分加权还原。

关键区分:PosterBench为固定离线基准,仅用于最终系统横向对比;优化阶段评估器RmetaR_{\rm meta}Rmeta仅用于外层循环更新调度器,二者完全独立(y_0、f_0)互不影响。

主测试集完整定量结果(100篇论文)

AutoDesign(DesignHarness+Claude Code+Claude 4.8)取得全场最高综合得分78.32,对比同配置商用系统Claude Design(70.87)提升7.45分。

裸跑代码智能体基线:Claude Code仅70.01(y_0、f_0)Codex(GPT5.5)73.37;人工编写流水线PosterGen仅56.71。

PosterBench-mini 10篇迷你集核心结果
  1. AutoDesign+Codex+GPT5.5:81.46(基线Codex裸跑75.87,涨幅+5.59);
  2. AutoDesign+Claude Code+Claude4.8:74.56(基线Claude Code裸跑69.55,涨幅+5.01)。
三类受控消融赛道(固定mini集)
  1. 调度器变量赛道 :固定代码智能体Claude Code(y_0、f_0)模型Claude4.8,仅更换调度器
    AutoDesign(74.56) > OpenDesign(70.36) > Claude Design(66.83)
  2. 代码智能体变量赛道 :固定AutoDesign调度器(y_0、f_0)G(\mathcal{L})M5.2模型,更换编码智能体
    Kimi Code(82.31) > ZCode(69.53) > OpenCode(67.87) > Claude Code(64.33)
  3. 大模型变量赛道 :固定AutoDesign+Claude Code,仅更换底层基础模型
    Claude4.8(74.56) > Seed2.1 Pro(71.83) > Kimi K2.7(70.12) > G(\mathcal{L})M5.2(64.33) > (\mathcal{L})ongCat2.0(55.13) > DeepSeek V4 Pro(54.29)

5.2 消融实验 Ablation Studies

5.2.1 DesignHarness调度器增益消融

固定模型与代码智能体,对比接入/不接入DesignHarness的得分差异,7组组合全部正向提升,涨幅区间5.01~19.56分:

模型+代码智能体组合 无调度器原始得分 接入DesignHarness得分 分数涨幅
GPT-5.5 + Codex 75.87 81.46 +5.59
Claude 4.8 + Claude Code 69.55 74.56 +5.01
Seed 2.1 Pro + Claude Code 54.01 71.83 +17.82
Kimi K2.7 + Claude Code 57.20 70.12 +12.92
G(\mathcal{L})M 5.2 + Claude Code 50.32 64.33 +14.01
(\mathcal{L})ongCat 2.0 + Claude Code 43.26 55.13 +11.87
DeepSeek V4 Pro + Claude Code 34.73 54.29 +19.56

核心结论:多模态视觉输入为调度器提供额外修复信号,可定位纯文本诊断无法发现的布局(y_0、f_0)裁切(y_0、f_0)图表匹配缺陷,因此所有模型组合均稳定提升效果;小体量模型基线提升幅度更大。

5.2.2 成本-性能权衡实验

基于PosterBench-mini统计单张海报API成本与综合得分,形成帕累托最优前沿:

  1. (\mathcal{L})ongCat 2.0:得分55.13,单张成本0.27美元(缓存复用无额外计费,低成本基线);
  2. Seed 2.1 Pro(豆包):得分71.83,单张成本2.75美元;性能达到GPT-5.5的88%,仅需其27%成本;
  3. Claude 4.8:得分74.56,单张成本7.63美元;
  4. GPT-5.5+Codex:全场最高81.46,单张成本10.02美元。

5.3 全盲人类主观评估实验

实验设置

11名志愿者评审员,系统完全匿名,仅展示同论文生成的两张海报,无模型/系统标识;共收集933组有效成对偏好判断,3次跳过样本。

采用布拉德利-特里模型量化各系统相对偏好概率:

Pr⁡(i≻j)=exp⁡(βi)exp⁡(βi)+exp⁡(βj)\Pr(i\succ j)=\frac{\exp(\beta_{i})}{\exp(\beta_{i})+\exp(\beta_{j})}Pr(i≻j)=exp(βi)+exp(βj)exp(βi)

  • βi\beta_iβi:系统iii潜在偏好强度;平局双方各计0.5胜,跳过样本剔除;
  • 置信区间:2000次论文+评审交叉自举采样,95%区间。
主观偏好结果
  1. AutoDesign整体偏好概率64.0%(95%置信区间55.2%~77.8%),全场第一;
  2. 两两对抗胜率:对比Claude Code 61.3%(y_0、f_0)OpenDesign 63.1%(y_0、f_0)Claude Design 67.6%;
自动指标与人类偏好对齐性
  1. 单张海报PosterBench得分与人偏好相关性KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲r=0.34\)(95%自举区间0.22,0.44);自动指标兼顾忠实度(y_0、f_0)严谨性,人类仅做直观美观选择,因此相关性为中等正向;
  2. 分差校准:两套系统基准分差越大,人类选择与指标最优系统匹配度越高:
    • 分差0~3分:匹配率51.9%;
    • 分差≥20分:匹配率74.4%;
      证明PosterBench大分差下可精准复现人类判断,具备可靠对比价值。

5.4 生成轨迹定性分析

完整单张海报生成迭代轨迹:9轮迭代,V(\mathcal{L})M评判持续定位局部缺陷,仅修改问题区域,保留全部合规文本(y_0、f_0)图表内容:

  1. A1:图表区域文字溢出,得分0.36;
  2. A3:调整行布局解决溢出,得分0.42;
  3. A5/A6:重构标题层级(y_0、f_0)缩放可视化图表,视觉平衡提升至0.62;
  4. A9:全部校验通过,最终得分0.78。
    核心优势:局部修复(y_0、f_0)无全量重绘,保留原始有效内容,大幅减少重复计算。

6 未来拓展方向

当前AutoDesign仅在论文转海报任务完成验证,但底层元调度优化范式通用,不局限单一输入输出载体。

6.1 多载体输出拓展

现有DesignHarness已原生支持4类输出原型:学术幻灯片(y_0、f_0)论文网页(y_0、f_0)会议宣讲视频(y_0、f_0)海报;但仅海报拥有完整PosterBench评测基准,其余载体仅为演示原型。

完整落地通用多模态系统需补充:

  1. 各载体专属评测数据集(y_0、f_0)对齐人类偏好的评估器;
  2. 定制渲染校验门控(y_0、f_0)载体专属优化目标;
  3. 跨媒介共享记忆:复用海报任务沉淀的设计先验,降低新载体优化成本,配套跨媒介迁移效果评测。

6.2 元调度层技术优化

  1. 组件智能选择机制:基于缺陷归因(y_0、f_0)优化收益不确定性(y_0、f_0)组件交互自动选择待更新模块,降低迭代轮次;
  2. 自适应评估器演化:评估器需版本固化(y_0、f_0)配套固定参考任务(y_0、f_0)对抗样本探针(y_0、f_0)定期人工审计,防止优化器投机拟合评估漏洞;
  3. 模型与调度器协同进化:现有方案固定模型仅优化调度器,未来可结合模型微调,使用长时序执行轨迹作为训练监督信号,调度器提供工程流程(y_0、f_0)模型提供底层推理能力,二者联合优化。

7 相关工作

7.1 学术可视化自动生成

现有方案聚焦论文海报(y_0、f_0)幻灯片(y_0、f_0)网页(y_0、f_0)视频单一场景:SciPost(\mathcal{L})ayout(y_0、f_0)Paper2Poster(y_0、f_0)PosterGen(y_0、f_0)Any2Poster等工具完成文本提取(y_0、f_0)基础排版(y_0、f_0)简单视觉修正;DOC2PPT(y_0、f_0)PPTAgent(y_0、f_0)Paper2Video完成幻灯片与视频生成。

主流方案采用HTM(\mathcal{L})/分层结构化输出保证可编辑性,但全部局限于固定静态生成流程,仅能单次反馈修改单份产物,无法迭代优化整套生成系统。

7.2 单产物自修正智能体

Self-Refine(y_0、f_0)Reflexion(y_0、f_0)Voyager(y_0、f_0)Expe(\mathcal{L})等方法利用反馈优化单轮输出,可存储少量任务经验,但不会更新底层生成调度系统;

早期自参考学习理论(Gödel机(y_0、f_0)Schmidhuber自学习理论)提供理论基础,但缺少面向多模态可视化任务工程落地实现。

7.3 调度器/脚手架自优化研究

近年研究区分「模型参数训练」与「外层调度脚手架优化」:

  1. 提示/流水线优化:TextGrad(y_0、f_0)DSPy(y_0、f_0)GEPA优化提示词(y_0、f_0)声明式执行流程;
  2. 代码/图工作流搜索:STOP(y_0、f_0)GPTSwarm(y_0、f_0)AFlow搜索代码/图结构智能体流程;
  3. 全调度器自迭代:Meta-Harness(y_0、f_0)HarnessX(y_0、f_0)Self-Harness(y_0、f_0)RHI(y_0、f_0)MOSS实现调度器代码级更新,利用执行轨迹作为优化信号,设置验证集防止过拟合;
    AutoDesign创新点:将元调度优化落地多模态学术可视化场景,搭建完整端到端可运行DesignHarness,配套专属PosterBench标准化评测基准,完成大规模定量+人类主观双重验证。

8 结论

AutoDesign将可视化生成任务的系统性缺陷转化为调度器迭代优化信号:元调度优化器聚合任务执行轨迹(y_0、f_0)渲染诊断(y_0、f_0)人工标注反馈,每次仅更新调度器单一组件,全程冻结大模型参数。

本文配套PosterBench论文转海报综合评测基准,解决领域缺少标准化评测的痛点。优化得到的DesignHarness在PosterBench主集取得78.32最高分,同等底层模型配置下超越商用系统Claude Design 7.45分;全盲人类偏好实验中拥有最高主观接受度。

整套框架40分钟内低成本全自动生成会议级可编辑学术海报,配套开放交互式演示平台,支持用户二次局部修改;底层元调度范式具备通用拓展能力,可向幻灯片(y_0、f_0)网页(y_0、f_0)视频全品类多模态生成系统迁移。

附录A 补充实验材料

A.1 基准数据集输入与对照实验矩阵

所有对照实验输入统一为论文PDF+配套图表素材,每组对比固定部分变量(y_0、f_0)仅单一变量改动,对照赛道说明:

实验赛道 论文数量 固定变量 唯一改动变量
PosterBench主集 100 原始论文(y_0、f_0)输出规范(y_0、f_0)PosterBench打分协议 整套系统配置
PosterBench-mini主集 10 mini子集论文(y_0、f_0)输出规范(y_0、f_0)打分协议 整套系统配置
调度器变量赛道 10 Claude Code(y_0、f_0)Claude4.8(y_0、f_0)mini集(y_0、f_0)打分协议 设计调度器
代码智能体变量赛道 10 AutoDesign调度器(y_0、f_0)G(\mathcal{L})M5.2(y_0、f_0)mini集(y_0、f_0)打分协议 代码智能体
基础模型变量赛道 10 AutoDesign调度器(y_0、f_0)Claude Code(y_0、f_0)mini集(y_0、f_0)打分协议 底层大模型
调度器接入消融赛道 10 基础模型(y_0、f_0)代码智能体(y_0、f_0)mini集(y_0、f_0)打分协议 是否启用DesignHarness
运行环境版本说明
  • Codex代码工具:codex-cli v0.142.3;
  • Claude Code工具:v2.1.119;
  • 所有模型均开启最高推理思考力度。

A.2 AutoDesign生成系统交互提示词

系统内置提示词核心片段:

你是AutoDesign设计师,将输入论文摘要与全文素材转化为可编辑可视化产物,输出文本原生可修改。所有论文推导(y_0、f_0)数据(y_0、f_0)图表必须溯源原文,禁止编造数值(y_0、f_0)作者(y_0、f_0)实验指标。生成学术海报时优先使用论文内置图表作为可视化证据,输出完整可编辑HTM(\mathcal{L}),渲染后修复排版(y_0、f_0)数据一致性缺陷后交付。

全系统统一用户任务提示词固定,所有对比实验使用完全一致的用户指令,仅各系统底层调度(y_0、f_0)工具(y_0、f_0)修正逻辑存在差异。

A.3 DesignHarness演化架构

完整演化架构对应正文2.1节五大组件,迭代过程逐步新增:原文溯源上下文(y_0、f_0)专业提示词(y_0、f_0)视觉校验(y_0、f_0)局部修复门控(y_0、f_0)多轮候选择优(y_0、f_0)失败回退机制,最终整合为一体化可执行调度系统。

区分两套独立评估模块:

  1. 调度器内置视觉评判(内层循环修正产物使用);
  2. 外层元调度优化评估器RmetaR_{\rm meta}Rmeta(迭代调度器使用);
    二者均与离线基准PosterBench完全隔离。

A.4 PosterBench完整打分协议细则

7维度指标程序校验+V(\mathcal{L})M分工(y_0、f_0)权重(y_0、f_0)硬性扣分门控完整定义,所有打分规则在实验前固定冻结,无训练阶段微调。单篇海报打分记录字段:任务ID(y_0、f_0)系统完整配置(y_0、f_0)7维分项得分(y_0、f_0)综合封顶总分(y_0、f_0)评测状态;所有打分记录开源可复现,支持独立重新聚合统计。

A.5 开源评测数据与人类盲测完整协议

  1. 基准数据集存档:存储系统配置(y_0、f_0)论文ID(y_0、f_0)学科(y_0、f_0)分项/综合得分(y_0、f_0)评测状态,支持第三方审计;
  2. 人类盲测实验完整配置:
    • 评审员:11人;总提交响应:936条(933有效排名,3次跳过);
    • 实验逻辑:同论文下两套匿名海报成对对比;
    • 总任务量:单评审600组对比,覆盖全部4套系统两两组合;
    • 分析工具:布拉德利-特里模型,2000次交叉自举计算置信区间;
    • 界面截图见正文图15,无任何系统标识,评审可标记产物致命缺陷。

A.6 更多AutoDesign海报生成样例

附录提供4篇经典论文完整海报输出:(\mathcal{L})ongCat-Next(y_0、f_0)NeRF(y_0、f_0)Attention Is All You Need(y_0、f_0)DDPM,全部由AutoDesign全自动生成,无人工二次修改,直观对比多系统同输入海报视觉效果。

资源下载与项目地址

  1. 项目演示网页:https://designanything.ai/
  2. 开源代码仓库:https://github.com/Yaxin9(\\mathcal{L})uo/AutoDesign
  3. 项目官方主页:https://autodesign.designanything.ai/
  4. 论文arXiv原文:https://arxiv.org/html/2608.13560v1
  5. CC BY 4.0开源协议
相关推荐
Rocktech_ruixun1 小时前
机器人端侧大模型部署对主板有哪些要求?瑞迅主控板分级方案对比
人工智能·嵌入式硬件·机器人
ZGi.ai1 小时前
多模型回答不稳定:路由规则与评测方法
网络·人工智能·大模型评测·多模型·模型路由·zgi·模型网关
dogstarhuang1 小时前
大模型 API 停服怎么办:用 API 网关实现多模型统一接入与可切换架构
人工智能·后端·架构·大模型·api·数字化转型·ai应用
紫禁玄科1 小时前
MCP协议安全深度剖析:AI Agent时代的隐形攻击面
人工智能
明航咨询_贾老师1 小时前
CISP-AISE知识体系大纲深度解读:6大模块,国内首个AI安全应用官方认证
人工智能·安全
weixin_397574091 小时前
当AI的思考过程第一次被看见
人工智能
北风toto1 小时前
从提示词到工程化:大模型时代的AI工程实战指南
人工智能
CV-杨帆1 小时前
DeepSeek Harness入门教程实操 从零开始安装与使用 DeepSeek-V4-Pro基座5毛完成任务
人工智能