AutoDesign:面向长时序智能体设计的元调度优化框架
arXiv:2608.13560v1
摘要
将多模态原始素材转换为精炼结构化可视化产物,本质可抽象为一套以模型调度系统为核心的长时序智能体任务。理想的调度系统应当贴合人类设计先验,并通过试错探索沉淀可复用经验,实现递归自优化;但现有技术方案均为静态架构,不具备该能力。
本文提出AutoDesign 框架,该框架对齐人类设计偏好,通过元调度优化器引导代码智能体,基于任务执行反馈递归迭代优化调度器本身。
为完成框架落地与效果验证,本文聚焦「学术论文自动生成会议海报」任务,构建评测基准PosterBench:包含覆盖5大学科共100篇论文的主测试集,以及由10篇论文构成的迷你子集PosterBench-mini,用于可控对照实验。

核心实验结果
- PosterBench完整主测试集上,AutoDesign取得78.32的综合得分,领先闭源商业系统Claude Design 7.45分;
- 在7组受控代码智能体+大模型组合实验中,接入本文训练完成的DesignHarness调度器后,平均基准得分从54.99提升至67.39,涨幅12.4%;
- 全自主长时序执行链路下,40分钟内完成海报生成,单次执行253次工具调用(y_0、f_0)11轮迭代编辑,总成本低于3美元,输出产物达到人类制作会议海报水准;
- 盲测人类偏好实验证明,在全部参评系统中AutoDesign获得最高人类偏好度。
1 引言
人类信息交互普遍需要从多异构模态素材中提取(y_0、f_0)整理信息,并输出面向人阅读的可视化产物,例如网页(y_0、f_0)幻灯片(y_0、f_0)学术海报(y_0、f_0)演示视频。这类多模态输入转结构化输出任务,需要完成证据提取(y_0、f_0)跨模态复杂推理(y_0、f_0)多阶段任务规划(y_0、f_0)基于反馈迭代优化,天然属于高难度长时序代码智能体任务。但搭建此类系统存在两大难点:真实业务流程复杂度高(y_0、f_0)高度依赖人工持续反馈。
现有多模态设计系统依靠「生成-评判-修改」循环对齐人类设计偏好,部分方案引入视觉参考(y_0、f_0)设计专项反馈优化输出。但现有方法存在本质缺陷:系统仅利用单次反馈修改当前产物,无法从大量成功/失败迭代中沉淀可复用设计知识;没有解决核心问题:如何将多模态原始素材(y_0、f_0)结构约束(y_0、f_0)人工偏好(y_0、f_0)迭代反馈转化为生成系统可持续的设计能力。

本文核心思路:元调度优化
本文将对齐人类偏好的自动生成任务定义为元调度优化问题 :智能体系统不单独优化单张海报等输出产物,而是基于人类偏好标注的评估指标,递归优化整套设计调度器(Design Harness)。
AutoDesign包含两层嵌套循环:
- 内层循环(设计调度器Design Harness):输入原始素材,生成可编辑产物,基于评判反馈迭代修改;
- 外层循环(元调度器Meta-Harness) :跨多组任务持续优化内层调度器。
- 先通过人工标注参考产物初始化对齐人类偏好的评估器;
- 聚合多任务执行轨迹与得分,归纳高频失败场景;
- 调用代码智能体作为优化器,对调度器组件做限定范围更新;
- 新增准入门控机制:仅当更新在训练集效果提升(y_0、f_0)验证集效果不衰减时,才接纳本次更新,防止过拟合。
经过多轮接纳的迭代更新,最终产出可独立运行的DesignHarness调度器,可自动完成素材读取(y_0、f_0)产物迭代生成(y_0、f_0)多维度校验修正(y_0、f_0)标准化输出。本文将该系统落地于论文转海报场景:该任务要求将长篇多模态学术原文压缩为单页清晰海报,同时完整保留原始论文证据溯源链路。DesignHarness可直接产出符合会议标准(y_0、f_0)贴合人类审美的可编辑海报,大幅降低人工制作成本与时间。
现有评测基准缺陷
现有论文转海报评测方案仅覆盖布局(y_0、f_0)文本提取(y_0、f_0)内容忠实度(y_0、f_0)视觉质量等单一维度,缺少完整(y_0、f_0)端到端的标准化评测流程。本文提出PosterBench基准,包含100篇跨5学科论文主集(y_0、f_0)10篇迷你快速测试子集,采用7维度加权评分体系,融合规则算法校验(y_0、f_0)视觉大模型打分(y_0、f_0)混合评估方案;配套3类受控实验赛道,可独立拆解各模块贡献;同时配套全盲人类偏好实验,自动评测指标与人主观偏好形成双向验证。
量化核心结论
- PosterBench-mini实验:7组代码智能体接入DesignHarness后,基准平均分从54.99提升至67.39,平均涨幅12.40;
- PosterBench主集:AutoDesign(Claude Code+Claude 4.8)得分78.32,超越同配置Claude Design商业系统7.45分,超越OpenDesign 8.87分;
- 低成本落地方案:(\mathcal{L})ongCat-2.0搭配DesignHarness单张海报成本仅0.27美元,基准得分55.13;
- 人类盲测:933组有效成对对比中,AutoDesign布拉德利-特里偏好估计值64.0%(95%置信区间55.2%~77.8%);两组系统基准分差≥20分时,人类选择与评测指标最优系统匹配度达74.4%。
本文四大贡献
- AutoDesign元调度优化框架:将静态调度器改造为可递归自迭代的人类对齐多模态生成系统。7天完整演化轨迹累计调用224个子智能体,完成至少123次递归迭代,沉淀54版调度器更新;可将人工标注参考海报(y_0、f_0)任务执行轨迹(y_0、f_0)渲染诊断信息(y_0、f_0)评估反馈转化为调度器内置持久化设计先验。
- DesignHarness可执行论文转海报系统:由AutoDesign迭代演化得到,依托代码工具智能体读取论文全文,融合可编辑生成(y_0、f_0)自动渲染(y_0、f_0)规则校验(y_0、f_0)视觉大模型反馈局部修正四大能力,输出完整溯源原始论文的可商用海报。
- PosterBench综合评测基准:论文转海报专用标准化评测协议,7大评分维度:忠实度(y_0、f_0)内容覆盖率(y_0、f_0)信息密度(y_0、f_0)可视化证据(y_0、f_0)排版布局(y_0、f_0)可读性(y_0、f_0)美学;基线系统Claude Code(Claude 4.8)裸跑得分70.01,接入DesignHarness提升8.31分,同时大幅领先商用系统Claude Design。
- 全自主长时序智能体落地验证:DesignHarness可无人工干预完成整套海报生成流程,40分钟内执行253次工具调用(y_0、f_0)11轮编辑迭代,总成本低于3美元;配套交互式演示平台,支持海报局部二次编辑。
2 元调度数学定义与形式化建模
2.1 设计调度器 Design Harness 定义
参考近期将调度器与模型权重解耦优化的研究,设计调度器HHH定义为包裹固定大模型的整套执行系统,输入多模态素材(论文/报告),输出面向人类的可视化产物(海报(y_0、f_0)幻灯片(y_0、f_0)网页(y_0、f_0)视频):
y∼H(πθ,x,c)(1)y\sim H(\pi_{\theta},x,c) \tag{1}y∼H(πθ,x,c)(1)
- πθ\pi_{\theta}πθ:固定参数大语言/多模态模型;
- xxx:多模态原始输入素材;
- ccc:任务上下文,包含输出载体格式(y_0、f_0)用户约束;
- yyy:最终可视化产物;
- τ\tauτ:完整执行轨迹,记录生成过程所有中间动作(y_0、f_0)状态(y_0、f_0)修改记录。
为支持系统化元优化与贡献归因,将调度器HHH拆解为五大功能组件,仅定义高层抽象,具体实现由元调度器迭代生成:
- 上下文与记忆组件:原始素材管理(y_0、f_0)提示词(y_0、f_0)可复用技能(y_0、f_0)持久化任务状态;
- 工具与规范组件:绘图工具(y_0、f_0)产物编辑规范(y_0、f_0)排版/字体/证据溯源约束;
- 执行运行时组件:渲染工作空间(y_0、f_0)产物导出(y_0、f_0)自动校验环境;
- 流程编排组件:任务分发(y_0、f_0)迭代轮次限制(y_0、f_0)失败回退(y_0、f_0)最终输出整合;
- 评估与反馈组件:规则校验(y_0、f_0)视觉大模型评判(y_0、f_0)局部修正反馈生成。
2.2 元调度器 Meta-Harness 定义
元调度器是作用于设计调度器的优化系统 :输入用户任务需求(y_0、f_0)初始调度器H0H_0H0,迭代优化调度器实现,输出最优调度器HTH_THT。
- 设计调度器:素材→可视化产物;
- 元调度器:调度器需求+旧调度器→优化后的新调度器。
优化目标为调度器生成产物的期望综合质量,设ptaskp_{\mathrm{task}}ptask为任务分布,调度器HHH性能定义:
KaTeX parse error: Can't use function '\(' in math mode at position 18: ...H)=\mathbb{E}{\̲(̲(x,c)\)\sim p{...
Rmeta(y,x,c)R_{\mathrm{meta}}(y,x,c)Rmeta(y,x,c):元调度器内置评估器,根据原始素材xxx(y_0、f_0)上下文ccc打分产物yyy。
元调度优化最终目标:
H⋆=arg maxH J(H)(3)H^{\star}=\underset{H}{\operatorname{arg\,max}}\;J(H) \tag{3}H⋆=HargmaxJ(H)(3)
优化过程中大模型πθ\pi_{\theta}πθ参数全程固定,仅优化外层调度执行系统,区分「模型权重训练」与「调度脚手架优化」。
3 元调度双层自优化循环
AutoDesign由两层嵌套反馈循环构成:内层循环优化单份可视化产物(y_0、f_0)外层循环迭代升级整套调度器。
- 内层循环:固定调度器HHH,针对单任务KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲(x,c)\)反复生成(y_0、f_0)修正产物,记录完整执行轨迹τ\tauτ;
- 外层循环:聚合多任务轨迹与得分,定位系统性缺陷,更新调度器HHH。
3.1 内层循环:单海报迭代生成
初始调度器基础架构仅包含两大抽象模块:设计师模块MdesignM_{\mathrm{design}}Mdesign (y_0、f_0)评判模块McriticM_{\mathrm{critic}}Mcritic
迭代第kkk轮交互公式:
yk=Mdesign(yk−1,fk−1;x,c)fk=Mcritic(yk;x,c)(4) \begin{align*} y_{k} &=M_{\mathrm{design}}(y_{k-1},f_{k-1};x,c) \\ f_{k} &=M_{\mathrm{critic}}(y_{k};x,c) \end{align*} \tag{4} ykfk=Mdesign(yk−1,fk−1;x,c)=Mcritic(yk;x,c)(4)
- yky_kyk:第kkk轮迭代后的海报产物;
- fkf_kfk:评判模块输出的修正反馈;
- KaTeX parse error: Can't use function '\(' in math mode at position 4: y_0\̲(̲y_0、f_0\)f_0初始为空,首轮直接基于原始素材生成初稿。
该公式仅定义模块功能与信息流转逻辑,提示词(y_0、f_0)工具(y_0、f_0)反馈机制(y_0、f_0)循环控制策略等具体实现,均由外层元调度循环迭代优化。整套迭代流程记录为执行轨迹τ\tauτ,全程不修改底层调度器HHH。
3.2 外层循环:调度器全局自优化
外层循环每轮迭代分为4阶段:任务批量执行(y_0、f_0)效果评估(y_0、f_0)调度器更新提案(y_0、f_0)更新准入校验。完整流程见算法1。
阶段1:批量执行 Rollout
外层迭代第ttt轮,使用当前调度器HtH_tHt在训练集Dtrain={(xi,ci)}i=1Ntrain\mathcal{D}{\mathrm{train}}=\{(x{i},c_{i})\}{i=1}^{N{\mathrm{train}}}Dtrain={(xi,ci)}i=1Ntrain批量运行;每组任务生成产物ytiy_{t}^{i}yti与执行轨迹τti\tau_{t}^{i}τti,汇总全部轨迹为τt\bm{\tau}_{t}τt。
阶段2:效果评估 Evaluation
优化启动前,使用人工标注的参考海报,训练7维度评估器RmetaR_{\rm meta}Rmeta:
- 规则校验:量化指标(文字溢出(y_0、f_0)数据不一致(y_0、f_0)空白区域等);
- 视觉大模型V(\mathcal{L})M:主观维度(排版(y_0、f_0)可读性(y_0、f_0)美学);
优化全程RmetaR_{\rm meta}Rmeta固定不变,批量打分得到分数集合st\bm{s}_{t}st。
区分:优化过程的RmetaR_{\rm meta}Rmeta仅用于调度器迭代;最终系统对比使用冻结独立基准PosterBench,二者完全隔离。
阶段3:更新提案 Update Proposal
元调度优化器PPP(代码智能体,分规划器(y_0、f_0)代码编辑器双角色)输入:当前调度器HtH_tHt(y_0、f_0)批量轨迹τt\bm{\tau}{t}τt(y_0、f_0)得分st\bm{s}{t}st(y_0、f_0)全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)},生成候选更新调度器Ht+1′H'_{t+1}Ht+1′:
KaTeX parse error: Can't use function '\(' in math mode at position 65: ...}_{t},\mathcal{\̲(̲\mathcal{L}\)}\...
执行约束:单轮迭代仅允许修改五大调度组件中的一个,可修改组件下多个代码文件,但禁止跨组件同时修改,保证效果归因清晰。
- 规划器角色:分析历史轨迹(y_0、f_0)得分(y_0、f_0)全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)},并行调用子智能体归纳高频失败模式,输出更新方案(缺陷类型(y_0、f_0)待修改组件(y_0、f_0)预期优化方向);
- 代码编辑器角色:基于更新方案修改调度器源码,生成候选调度器Ht+1′H'_{t+1}Ht+1′。
阶段4:准入门控 Acceptance Gate
设置独立验证集Ddev\mathcal{D}_{\mathrm{dev}}Ddev防止调度器过拟合训练任务,仅同时满足以下两个条件,才接纳更新:
Accept(Ht+1′) ⟺ Jtrain(Ht+1′)>Jtrain(Ht) ∧ Jdev(Ht+1′)≥Jdev(Ht)(6)\operatorname{Accept}(H^{\prime}{t+1})\iff J{\mathrm{train}}(H^{\prime}{t+1})>J{\mathrm{train}}(H_{t})\ \land\ J_{\mathrm{dev}}(H^{\prime}{t+1})\geq J{\mathrm{dev}}(H_{t}) \tag{6}Accept(Ht+1′)⟺Jtrain(Ht+1′)>Jtrain(Ht) ∧ Jdev(Ht+1′)≥Jdev(Ht)(6)
- 训练集期望得分提升;
- 验证集期望得分不下降。
接纳逻辑:
- 通过校验:Ht+1=Ht+1′H_{t+1}=H'_{t+1}Ht+1=Ht+1′,将本轮迭代信息存入全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)};
- 未通过校验:保留原调度器Ht+1=HtH_{t+1}=H_{t}Ht+1=Ht,本轮更新废弃,历史记录留存用于下一轮迭代规避同类方案。
全局优化记录KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{L}\)}存储:每轮调度器快照(y_0、f_0)执行轨迹(y_0、f_0)打分(y_0、f_0)修改组件(y_0、f_0)代码变更(y_0、f_0)准入结果;验证集数据不存入记录,仅用于门控校验。
算法1 元调度优化完整流程
输入:固定大模型π_θ;初始调度器H₀;评估器R_meta;训练集D_train;验证集D_dev;迭代总轮数T
输出:优化完成调度器H_T;全局优化记录\(\mathcal{L}\)
1. 使用H₀执行全部训练集任务,收集轨迹\(\tau\)₀\(y_0、f_0\)打分s₀
2. 使用H₀执行全部验证集任务,收集验证打分s^dev₀
3. 循环 t = 0 至 T-1:
3.1 优化器P读取H_t\(y_0、f_0\)\(\tau\)_t\(y_0、f_0\)s_t\(y_0、f_0\)全局记录\(\mathcal{L}\),生成候选调度器H'_{t+1}
3.2 在训练集执行H'_{t+1},收集新轨迹\(\tau\)'_{t+1}\(y_0、f_0\)打分s'_{t+1}
3.3 在验证集执行H'_{t+1},收集验证打分s'^dev_{t+1}
3.4 判断准入条件:
if J_train(H'_{t+1}) > J_train(H_t) 且 J_dev(H'_{t+1}) ≥ J_dev(H_t):
标记本轮结果=接纳
H_{t+1} = H'_{t+1}, \(\tau\)_{t+1}=\(\tau\)'_{t+1}, s_{t+1}=s'_{t+1}, s^dev_{t+1}=s'^dev_{t+1}
else:
标记本轮结果=拒绝
H_{t+1} = H_t, \(\tau\)_{t+1}=\(\tau\)_t, s_{t+1}=s_t, s^dev_{t+1}=s^dev_t
3.5 将本轮完整快照存入全局优化记录\(\mathcal{L}\)
4. 循环结束,返回(H_T, \(\mathcal{L}\))
人机协同模式(可选)
外层循环支持人工介入,两种干预方式:
- 迭代定向引导:人工输入自然语言优化方向gtg_tgt,优化器输入增加引导指令:KaTeX parse error: Can't use function '\(' in math mode at position 60: ...}_{t},\mathcal{\̲(̲\mathcal{L}\)},...,解决优化器收敛至局部最优(y_0、f_0)迭代停滞问题;
- 评估器修正:人工发现RmetaR_{\rm meta}Rmeta系统性偏差时,可手动修正评估逻辑;无人工干预时评估器全程固定。
4 优化完成产物:DesignHarness调度系统
经过元调度外层循环迭代收敛后得到DesignHarness,原生支持海报(y_0、f_0)幻灯片(y_0、f_0)网页(y_0、f_0)演示视频多类输出载体;整套系统分为四大核心阶段:论文素材读取(y_0、f_0)产物生成迭代(y_0、f_0)双重校验反馈(y_0、f_0)标准化最终输出。
4.1 论文素材读取 Paper Ingestion
将输入论文xxx(y_0、f_0)任务约束ccc转化为带完整溯源链路的结构化上下文:
- 提取论文元信息(y_0、f_0)章节大纲(y_0、f_0)支撑核心结论关键段落;
- 提取图表(y_0、f_0)表格,记录其在原文中的精确位置;
- 生成内容摘要+载体专属制作方案,明确输出格式(y_0、f_0)核心论点(y_0、f_0)配套可视化素材;
- 所有提取内容绑定原文索引,海报中所有文字(y_0、f_0)图表均可反向溯源论文原文,校验阶段自动核查一致性;
- 结构化上下文一次性生成,全迭代流程复用,作为设计师模块固定输入。
4.2 产物生成与迭代修正 Artifact Generation and Revision
设计师模块由代码智能体实现,基于读取上下文(y_0、f_0)上一轮产物yk−1y_{k-1}yk−1(y_0、f_0)反馈fk−1f_{k-1}fk−1生成新版本海报yky_kyk,实现公式对应内层循环MdesignM_{\mathrm{design}}Mdesign。
- 底层产物格式:全程采用可编辑HTM(\mathcal{L}),每轮修改仅局部代码变更,无需全量重绘;
- 渲染导出:支持PNG预览(y_0、f_0)PPTX(y_0、f_0)MP4等载体格式,用于视觉评判模块读取校验。
4.3 双重校验与最终输出 Validation and Finalization
每轮生成产物yky_kyk同步送入两套校验模块,共同构成评判模块McriticM_{\mathrm{critic}}Mcritic:
- 规则阻塞校验器(必过项) :确定性硬约束检查,不通过直接返回局部报错:
- 缺失/损坏素材(y_0、f_0)原文溯源链接失效(y_0、f_0)文字溢出重叠(y_0、f_0)排版字体约束违规;
- 全部校验通过则直接终止迭代,进入最终输出流程;
- 未通过则输出精准局部诊断信息,同步启动视觉大模型评判。
- 视觉V(\mathcal{L})M评判器(优化项) :渲染海报预览图输入V(\mathcal{L})M,评估排版平衡(y_0、f_0)可读性(y_0、f_0)美学风格(y_0、f_0)内容贴合度。
两套反馈合并为统一修正信号fkf_kfk,送入设计师模块迭代优化。
迭代终止规则
- 最大迭代轮次上限KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲K=12\);任意一轮产物通过全部阻塞校验,立刻停止迭代;
- 12轮均未通过校验:启动失败回退机制,从历史迭代中筛选满足基础安全约束的最优产物,进入最终输出;
- 最终输出阶段:排版微调(y_0、f_0)公式标准化(y_0、f_0)素材内联打包,生成独立完整可编辑文件。
整套「生成-校验-反馈-修正」流程构成执行轨迹τ\tauτ,全程底层DesignHarness调度逻辑不改变。
5 评测实验方案 PosterBench
5.1 评测基准 PosterBench 介绍
数据集划分
- PosterBench主测试集:100篇论文,覆盖人工智能/生物医药/气候环境/经济政策/物理天文5大学科;
- PosterBench-mini迷你集:10篇论文子集,用于快速消融(y_0、f_0)受控对照实验;
所有系统输入完全一致:论文PDF+配套图表素材,统一渲染尺寸后打分。
7维度加权评分规则
单篇海报AiA_iAi(y_0、f_0)论文pip_ipi输出7维分数qi∈0,107\mathbf{q}_{i}\in0,10^7qi∈0,107,维度权重向量α=(10,10,15,10,20,25,10)\bm{\alpha}=(10,10,15,10,20,25,10)α=(10,10,15,10,20,25,10),加权原始总分:
Rrubric(pi,Ai)=∑j=17αjqi,j/10(7)R_{\mathrm{rubric}}(p_{i},A_{i})=\sum_{j=1}^{7}\alpha_{j}q_{i,j}/10 \tag{7}Rrubric(pi,Ai)=j=1∑7αjqi,j/10(7)
7大评测维度说明:
| 维度 | 权重 | 评测方式 | 核心判定标准 |
|---|---|---|---|
| 忠实度 Faithfulness | 10 | 程序校验+V(\mathcal{L})M | 文字(y_0、f_0)数据(y_0、f_0)图表与论文原文无冲突,溯源有效 |
| 覆盖率 Coverage | 10 | V(\mathcal{L})M | 完整保留研究动机(y_0、f_0)方法(y_0、f_0)实验(y_0、f_0)结论核心信息 |
| 信息密度 Density | 15 | 程序空间审计 | 空白区域占比(y_0、f_0)文本填充度,杜绝大面积留白/文字堆砌 |
| 可视化证据 Visual Evidence | 10 | 程序校验+V(\mathcal{L})M | 图表与论点匹配(y_0、f_0)尺寸清晰(y_0、f_0)不直接截图论文整段内容 |
| 布局 (\mathcal{L})ayout | 20 | 程序空间审计 | 无文字截断(y_0、f_0)元素重叠(y_0、f_0)边缘裁切,分区结构合理 |
| 可读性 Readability | 25 | 程序校验+V(\mathcal{L})M | 字体层级清晰(y_0、f_0)阅读动线流畅(y_0、f_0)无密集小字 |
| 美学 Aesthetics | 10 | V(\mathcal{L})M | 配色统一(y_0、f_0)学术风格协调(y_0、f_0)排版整洁专业 |
安全分天花板约束(核心机制)
加权原始总分会叠加多层硬性扣分上限,任意一项严重缺陷直接压低单篇海报最高分:
Rposter(pi,Ai)=min (Rrubric(pi,Ai),Cilayout,Civiability,Cifailure,Cigate)Overall=1N∑i=1NRposter(pi,Ai) \begin{align*} R_{\mathrm{poster}}(p_{i},A_{i}) &=\min\!\Bigl(R_{\mathrm{rubric}}(p_{i},A_{i}),C_{i}^{\mathrm{layout}},C_{i}^{\mathrm{viability}},C_{i}^{\mathrm{failure}},C_{i}^{\mathrm{gate}}\Bigr) \\ \mathrm{Overall} &=\frac{1}{N}\sum_{i=1}^{N}R_{\mathrm{poster}}(p_{i},A_{i}) \tag{8} \end{align*} Rposter(pi,Ai)Overall=min(Rrubric(pi,Ai),Cilayout,Civiability,Cifailure,Cigate)=N1i=1∑NRposter(pi,Ai)(8)
- CilayoutC_{i}^{\mathrm{layout}}Cilayout:严重排版破损上限;
- CiviabilityC_{i}^{\mathrm{viability}}Civiability:可读性完全失效上限;
- CifailureC_{i}^{\mathrm{failure}}Cifailure:证据/数据错误硬缺陷上限;
- CigateC_{i}^{\mathrm{gate}}Cigate:渲染完整性保护门控(基础P0门控封顶40分,严重缺陷分值更低);
最终系统总分是所有海报封顶后分数平均值,无法通过维度平均分加权还原。
关键区分:PosterBench为固定离线基准,仅用于最终系统横向对比;优化阶段评估器RmetaR_{\rm meta}Rmeta仅用于外层循环更新调度器,二者完全独立(y_0、f_0)互不影响。
主测试集完整定量结果(100篇论文)
AutoDesign(DesignHarness+Claude Code+Claude 4.8)取得全场最高综合得分78.32,对比同配置商用系统Claude Design(70.87)提升7.45分。
裸跑代码智能体基线:Claude Code仅70.01(y_0、f_0)Codex(GPT5.5)73.37;人工编写流水线PosterGen仅56.71。
PosterBench-mini 10篇迷你集核心结果
- AutoDesign+Codex+GPT5.5:81.46(基线Codex裸跑75.87,涨幅+5.59);
- AutoDesign+Claude Code+Claude4.8:74.56(基线Claude Code裸跑69.55,涨幅+5.01)。
三类受控消融赛道(固定mini集)
- 调度器变量赛道 :固定代码智能体Claude Code(y_0、f_0)模型Claude4.8,仅更换调度器
AutoDesign(74.56) > OpenDesign(70.36) > Claude Design(66.83) - 代码智能体变量赛道 :固定AutoDesign调度器(y_0、f_0)G(\mathcal{L})M5.2模型,更换编码智能体
Kimi Code(82.31) > ZCode(69.53) > OpenCode(67.87) > Claude Code(64.33) - 大模型变量赛道 :固定AutoDesign+Claude Code,仅更换底层基础模型
Claude4.8(74.56) > Seed2.1 Pro(71.83) > Kimi K2.7(70.12) > G(\mathcal{L})M5.2(64.33) > (\mathcal{L})ongCat2.0(55.13) > DeepSeek V4 Pro(54.29)
5.2 消融实验 Ablation Studies
5.2.1 DesignHarness调度器增益消融
固定模型与代码智能体,对比接入/不接入DesignHarness的得分差异,7组组合全部正向提升,涨幅区间5.01~19.56分:
| 模型+代码智能体组合 | 无调度器原始得分 | 接入DesignHarness得分 | 分数涨幅 |
|---|---|---|---|
| GPT-5.5 + Codex | 75.87 | 81.46 | +5.59 |
| Claude 4.8 + Claude Code | 69.55 | 74.56 | +5.01 |
| Seed 2.1 Pro + Claude Code | 54.01 | 71.83 | +17.82 |
| Kimi K2.7 + Claude Code | 57.20 | 70.12 | +12.92 |
| G(\mathcal{L})M 5.2 + Claude Code | 50.32 | 64.33 | +14.01 |
| (\mathcal{L})ongCat 2.0 + Claude Code | 43.26 | 55.13 | +11.87 |
| DeepSeek V4 Pro + Claude Code | 34.73 | 54.29 | +19.56 |
核心结论:多模态视觉输入为调度器提供额外修复信号,可定位纯文本诊断无法发现的布局(y_0、f_0)裁切(y_0、f_0)图表匹配缺陷,因此所有模型组合均稳定提升效果;小体量模型基线提升幅度更大。
5.2.2 成本-性能权衡实验
基于PosterBench-mini统计单张海报API成本与综合得分,形成帕累托最优前沿:
- (\mathcal{L})ongCat 2.0:得分55.13,单张成本0.27美元(缓存复用无额外计费,低成本基线);
- Seed 2.1 Pro(豆包):得分71.83,单张成本2.75美元;性能达到GPT-5.5的88%,仅需其27%成本;
- Claude 4.8:得分74.56,单张成本7.63美元;
- GPT-5.5+Codex:全场最高81.46,单张成本10.02美元。
5.3 全盲人类主观评估实验
实验设置
11名志愿者评审员,系统完全匿名,仅展示同论文生成的两张海报,无模型/系统标识;共收集933组有效成对偏好判断,3次跳过样本。
采用布拉德利-特里模型量化各系统相对偏好概率:
Pr(i≻j)=exp(βi)exp(βi)+exp(βj)\Pr(i\succ j)=\frac{\exp(\beta_{i})}{\exp(\beta_{i})+\exp(\beta_{j})}Pr(i≻j)=exp(βi)+exp(βj)exp(βi)
- βi\beta_iβi:系统iii潜在偏好强度;平局双方各计0.5胜,跳过样本剔除;
- 置信区间:2000次论文+评审交叉自举采样,95%区间。
主观偏好结果
- AutoDesign整体偏好概率64.0%(95%置信区间55.2%~77.8%),全场第一;
- 两两对抗胜率:对比Claude Code 61.3%(y_0、f_0)OpenDesign 63.1%(y_0、f_0)Claude Design 67.6%;
自动指标与人类偏好对齐性
- 单张海报PosterBench得分与人偏好相关性KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲r=0.34\)(95%自举区间0.22,0.44);自动指标兼顾忠实度(y_0、f_0)严谨性,人类仅做直观美观选择,因此相关性为中等正向;
- 分差校准:两套系统基准分差越大,人类选择与指标最优系统匹配度越高:
- 分差0~3分:匹配率51.9%;
- 分差≥20分:匹配率74.4%;
证明PosterBench大分差下可精准复现人类判断,具备可靠对比价值。
5.4 生成轨迹定性分析
完整单张海报生成迭代轨迹:9轮迭代,V(\mathcal{L})M评判持续定位局部缺陷,仅修改问题区域,保留全部合规文本(y_0、f_0)图表内容:
- A1:图表区域文字溢出,得分0.36;
- A3:调整行布局解决溢出,得分0.42;
- A5/A6:重构标题层级(y_0、f_0)缩放可视化图表,视觉平衡提升至0.62;
- A9:全部校验通过,最终得分0.78。
核心优势:局部修复(y_0、f_0)无全量重绘,保留原始有效内容,大幅减少重复计算。
6 未来拓展方向
当前AutoDesign仅在论文转海报任务完成验证,但底层元调度优化范式通用,不局限单一输入输出载体。
6.1 多载体输出拓展
现有DesignHarness已原生支持4类输出原型:学术幻灯片(y_0、f_0)论文网页(y_0、f_0)会议宣讲视频(y_0、f_0)海报;但仅海报拥有完整PosterBench评测基准,其余载体仅为演示原型。
完整落地通用多模态系统需补充:
- 各载体专属评测数据集(y_0、f_0)对齐人类偏好的评估器;
- 定制渲染校验门控(y_0、f_0)载体专属优化目标;
- 跨媒介共享记忆:复用海报任务沉淀的设计先验,降低新载体优化成本,配套跨媒介迁移效果评测。
6.2 元调度层技术优化
- 组件智能选择机制:基于缺陷归因(y_0、f_0)优化收益不确定性(y_0、f_0)组件交互自动选择待更新模块,降低迭代轮次;
- 自适应评估器演化:评估器需版本固化(y_0、f_0)配套固定参考任务(y_0、f_0)对抗样本探针(y_0、f_0)定期人工审计,防止优化器投机拟合评估漏洞;
- 模型与调度器协同进化:现有方案固定模型仅优化调度器,未来可结合模型微调,使用长时序执行轨迹作为训练监督信号,调度器提供工程流程(y_0、f_0)模型提供底层推理能力,二者联合优化。
7 相关工作
7.1 学术可视化自动生成
现有方案聚焦论文海报(y_0、f_0)幻灯片(y_0、f_0)网页(y_0、f_0)视频单一场景:SciPost(\mathcal{L})ayout(y_0、f_0)Paper2Poster(y_0、f_0)PosterGen(y_0、f_0)Any2Poster等工具完成文本提取(y_0、f_0)基础排版(y_0、f_0)简单视觉修正;DOC2PPT(y_0、f_0)PPTAgent(y_0、f_0)Paper2Video完成幻灯片与视频生成。
主流方案采用HTM(\mathcal{L})/分层结构化输出保证可编辑性,但全部局限于固定静态生成流程,仅能单次反馈修改单份产物,无法迭代优化整套生成系统。
7.2 单产物自修正智能体
Self-Refine(y_0、f_0)Reflexion(y_0、f_0)Voyager(y_0、f_0)Expe(\mathcal{L})等方法利用反馈优化单轮输出,可存储少量任务经验,但不会更新底层生成调度系统;
早期自参考学习理论(Gödel机(y_0、f_0)Schmidhuber自学习理论)提供理论基础,但缺少面向多模态可视化任务工程落地实现。
7.3 调度器/脚手架自优化研究
近年研究区分「模型参数训练」与「外层调度脚手架优化」:
- 提示/流水线优化:TextGrad(y_0、f_0)DSPy(y_0、f_0)GEPA优化提示词(y_0、f_0)声明式执行流程;
- 代码/图工作流搜索:STOP(y_0、f_0)GPTSwarm(y_0、f_0)AFlow搜索代码/图结构智能体流程;
- 全调度器自迭代:Meta-Harness(y_0、f_0)HarnessX(y_0、f_0)Self-Harness(y_0、f_0)RHI(y_0、f_0)MOSS实现调度器代码级更新,利用执行轨迹作为优化信号,设置验证集防止过拟合;
AutoDesign创新点:将元调度优化落地多模态学术可视化场景,搭建完整端到端可运行DesignHarness,配套专属PosterBench标准化评测基准,完成大规模定量+人类主观双重验证。
8 结论
AutoDesign将可视化生成任务的系统性缺陷转化为调度器迭代优化信号:元调度优化器聚合任务执行轨迹(y_0、f_0)渲染诊断(y_0、f_0)人工标注反馈,每次仅更新调度器单一组件,全程冻结大模型参数。
本文配套PosterBench论文转海报综合评测基准,解决领域缺少标准化评测的痛点。优化得到的DesignHarness在PosterBench主集取得78.32最高分,同等底层模型配置下超越商用系统Claude Design 7.45分;全盲人类偏好实验中拥有最高主观接受度。
整套框架40分钟内低成本全自动生成会议级可编辑学术海报,配套开放交互式演示平台,支持用户二次局部修改;底层元调度范式具备通用拓展能力,可向幻灯片(y_0、f_0)网页(y_0、f_0)视频全品类多模态生成系统迁移。
附录A 补充实验材料
A.1 基准数据集输入与对照实验矩阵
所有对照实验输入统一为论文PDF+配套图表素材,每组对比固定部分变量(y_0、f_0)仅单一变量改动,对照赛道说明:
| 实验赛道 | 论文数量 | 固定变量 | 唯一改动变量 |
|---|---|---|---|
| PosterBench主集 | 100 | 原始论文(y_0、f_0)输出规范(y_0、f_0)PosterBench打分协议 | 整套系统配置 |
| PosterBench-mini主集 | 10 | mini子集论文(y_0、f_0)输出规范(y_0、f_0)打分协议 | 整套系统配置 |
| 调度器变量赛道 | 10 | Claude Code(y_0、f_0)Claude4.8(y_0、f_0)mini集(y_0、f_0)打分协议 | 设计调度器 |
| 代码智能体变量赛道 | 10 | AutoDesign调度器(y_0、f_0)G(\mathcal{L})M5.2(y_0、f_0)mini集(y_0、f_0)打分协议 | 代码智能体 |
| 基础模型变量赛道 | 10 | AutoDesign调度器(y_0、f_0)Claude Code(y_0、f_0)mini集(y_0、f_0)打分协议 | 底层大模型 |
| 调度器接入消融赛道 | 10 | 基础模型(y_0、f_0)代码智能体(y_0、f_0)mini集(y_0、f_0)打分协议 | 是否启用DesignHarness |
运行环境版本说明
- Codex代码工具:codex-cli v0.142.3;
- Claude Code工具:v2.1.119;
- 所有模型均开启最高推理思考力度。
A.2 AutoDesign生成系统交互提示词
系统内置提示词核心片段:
你是AutoDesign设计师,将输入论文摘要与全文素材转化为可编辑可视化产物,输出文本原生可修改。所有论文推导(y_0、f_0)数据(y_0、f_0)图表必须溯源原文,禁止编造数值(y_0、f_0)作者(y_0、f_0)实验指标。生成学术海报时优先使用论文内置图表作为可视化证据,输出完整可编辑HTM(\mathcal{L}),渲染后修复排版(y_0、f_0)数据一致性缺陷后交付。
全系统统一用户任务提示词固定,所有对比实验使用完全一致的用户指令,仅各系统底层调度(y_0、f_0)工具(y_0、f_0)修正逻辑存在差异。
A.3 DesignHarness演化架构
完整演化架构对应正文2.1节五大组件,迭代过程逐步新增:原文溯源上下文(y_0、f_0)专业提示词(y_0、f_0)视觉校验(y_0、f_0)局部修复门控(y_0、f_0)多轮候选择优(y_0、f_0)失败回退机制,最终整合为一体化可执行调度系统。
区分两套独立评估模块:
- 调度器内置视觉评判(内层循环修正产物使用);
- 外层元调度优化评估器RmetaR_{\rm meta}Rmeta(迭代调度器使用);
二者均与离线基准PosterBench完全隔离。
A.4 PosterBench完整打分协议细则
7维度指标程序校验+V(\mathcal{L})M分工(y_0、f_0)权重(y_0、f_0)硬性扣分门控完整定义,所有打分规则在实验前固定冻结,无训练阶段微调。单篇海报打分记录字段:任务ID(y_0、f_0)系统完整配置(y_0、f_0)7维分项得分(y_0、f_0)综合封顶总分(y_0、f_0)评测状态;所有打分记录开源可复现,支持独立重新聚合统计。
A.5 开源评测数据与人类盲测完整协议
- 基准数据集存档:存储系统配置(y_0、f_0)论文ID(y_0、f_0)学科(y_0、f_0)分项/综合得分(y_0、f_0)评测状态,支持第三方审计;
- 人类盲测实验完整配置:
- 评审员:11人;总提交响应:936条(933有效排名,3次跳过);
- 实验逻辑:同论文下两套匿名海报成对对比;
- 总任务量:单评审600组对比,覆盖全部4套系统两两组合;
- 分析工具:布拉德利-特里模型,2000次交叉自举计算置信区间;
- 界面截图见正文图15,无任何系统标识,评审可标记产物致命缺陷。
A.6 更多AutoDesign海报生成样例
附录提供4篇经典论文完整海报输出:(\mathcal{L})ongCat-Next(y_0、f_0)NeRF(y_0、f_0)Attention Is All You Need(y_0、f_0)DDPM,全部由AutoDesign全自动生成,无人工二次修改,直观对比多系统同输入海报视觉效果。
资源下载与项目地址
- 项目演示网页:https://designanything.ai/
- 开源代码仓库:https://github.com/Yaxin9(\\mathcal{L})uo/AutoDesign
- 项目官方主页:https://autodesign.designanything.ai/
- 论文arXiv原文:https://arxiv.org/html/2608.13560v1
- CC BY 4.0开源协议