【MLLM】GraphWalker:Deepresearch用于图像生成

note

  • 思路是用于图像生成的多模态深度搜索智能体,进行多跳推理与搜索,以获取图像生成所需的文本知识和参考图像,结论是在KnowGen上使Qwen-Image性能提高约16分,在WISE上提高约15分。
  • 这也是一种应用型的工作,本质还是在做图片生成方向的上下文扩充,优化prompt和参考图片。

文章目录

一、GraphWalker:Deepresearch用于图像生成

【Deepresearch用于图像生成思路】思路是用于图像生成的多模态深度搜索智能体,进行多跳推理与搜索,以获取图像生成所需的文本知识和参考图像,结论是在KnowGen上使Qwen-Image性能提高约16分,在WISE上提高约15分。GraphWalker: Agentic Knowledge Graph Question Answer-ing via Synthetic Trajectory Curriculum,https://arxiv.org/pdf/2603.28533,https://gen-searcher.verce,

1)实现思路:

  • 三类工具:
    • search【网络文本搜索,获取事实信息】
    • image_search【图像检索,获取视觉特征参考】
    • browse【网页精读,提取深层证据】;
  • 两阶段训练:
    • SFT监督微调【在Gen‑Searcher‑SFT‑10k训练,掌握基础工具使用】
    • AgenticRL强化学习【用GRPO优化搜索轨迹,仅用图像奖励受生成器能力与随机性影响,方差大、不稳定,仅用文本奖励忽略信息对图像生成的实际价值,所以用双奖励机制:最终奖励R=(1−α)R_image+αR_text,α=0.5。
      • 文本奖励评估信息完整性
      • 图像奖励用K‑Score加权评分(忠实度0.1+视觉正确性0.4+文本准确性0.4+美学0.1)】;

2)数据合成思路:

Agent轨迹合成【search用于从网络中检索文本信息,image_search用于通过文本查询搜索相关图像,以及browse用于阅读和分析已检索网页的详细内容。在此过程中,智能体持续分析来自环境的文本和视觉反馈,识别出有用的证据和参考图像,并据此规划下一步动作。通过这一多轮推理与搜索流程,智能体逐步从多个来源聚合信息,最终生成一个基于证据的提示以及一组适用于图像合成的相关参考图像】

->图像生成【在获得最终的有根据提示和视觉参考后,使用专有的图像生成模型NanoBananaPro合成相应的图像】;

->数据过滤【使用Seed1.8从多个角度对生成的样本进行评分,包括提示是否真正需要搜索、生成内容的正确性、与提示的一致性、视觉美感、文本渲染清晰度以及安全考虑。与基于规则的过滤相结合,例如移除token长度过长或搜索结果不一致的提示】。

Reference

1 GraphWalker: Agentic Knowledge Graph Question Answer-ing via Synthetic Trajectory Curriculum,https://arxiv.org/pdf/2603.28533,https://gen-searcher.verce,

相关推荐
tachibana28 小时前
复杂任务怎么做的任务拆分?
人工智能·ai·大模型·llm·agent
tachibana28 小时前
ReAct、Plan-and-Execute、Reflection 三种范式有什么核心区别
人工智能·ai·大模型·llm·agent
绵满12 小时前
"Mem2Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation" 论文笔记
大模型·智能体记忆
夫唯不争,故无尤也14 小时前
RL强化学习常见问题
强化学习·rl
Web3&Basketball14 小时前
从0到1落地多模态表格/发票结构化识别:踩坑全记录
深度学习·大模型·ai技术
深圳市爱派派智能科技有限公司15 小时前
从英伟达 GPU 到 RK3566 实机:Microduck 25 厘米强化学习机器人部署手记
机器人·边缘计算·强化学习·rk3566·机器人英伟达
爱听歌的周童鞋16 小时前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 3 | Part 1 | 贝尔曼最优公式(例子-如何改进策略)
强化学习·贝尔曼最优公式·optimal policy·action value
thesky12345617 小时前
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性
大模型·抢占·连续批处理·推理调度·请求优先级·弹性扩缩容·chunked prefill
爱听歌的周童鞋18 小时前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 3 | Part 2 | 贝尔曼最优公式(最优策略和公式推导)
强化学习·贝尔曼最优公式·optimal policy·action value·maximization