如何设计一个小而可靠的 Follow-up Idea:从论文局限到可执行选题

系列 :AI 论文精读与复现训练营
日期 :2026-07-31
适合读者 :研究生、科研新人、有工程背景的 AI 读者
关键词:follow-up idea、research proposal、论文局限、可证伪假设、最小实验
目录
- 为什么 follow-up idea 比"大方向"更适合训练
- 从论文局限到研究问题:五类入口
- 小而可靠的 idea 应该长什么样
- 代表论文路线图:AI 如何辅助科研构思
- 关键论文精读:把 idea 当成可评估对象
- 方法/实验对比表
- 最小复现实验与 proposal 模板
- 常见误区
- 适合研究生继续做的选题
- 参考资料
为什么这个主题重要
科研新人最容易低估的能力,不是读论文,也不是跑代码,而是"把一个模糊启发压缩成一个可执行问题"。读论文时你会看到很多可能方向:作者说未来要扩展到多语言、长上下文、更多模态、更大模型、更真实环境、更强 benchmark;审稿意见里会说 baseline 不够、统计不充分、消融不足、数据集太窄;复现时你会发现代码缺参数、结果对 seed 敏感、某个模块实际没贡献。这些都可能成为 follow-up,但大多数还不是研究问题。
原因在于,研究问题必须能被证据支持或推翻。比如"让 agent 更可靠"太大;"在 WebArena 类任务中,引入额外 verifier 是否能减少工具调用后的状态误读"才接近一个问题。前者无法决定数据、baseline 和 metric,后者可以设计最小实验:固定 agent 框架,比较 no-verifier、rule-verifier、LLM-verifier,分析失败类型和额外 token 成本。
对研究生来说,follow-up idea 的价值不只是发论文。它更像一套训练装置:
- 训练你判断一篇论文的核心 claim 到底是什么。
- 训练你把 limitation 写成假设,而不是写成愿望。
- 训练你在资源有限时设计最小实验。
- 训练你面对负结果时仍然提炼机制和边界条件。
- 训练你把"读过十篇论文"变成"知道下一步该测什么"。
2026 年的科研环境也让这件事更重要。ICLR 2026 作者指南要求如果 LLM 在研究构思或写作中起到重要作用,作者需要说明其具体角色,并强调作者仍对内容、事实和科研诚信负责。换句话说,AI 可以帮你发散 idea、检索文献、检查 novelty,但不能替你承担研究判断。一个成熟研究者必须能回答:这个 idea 为什么值得做,最小证据是什么,风险在哪里,失败后学到什么。
从论文局限到研究问题:五类入口
1. 明示 limitation:作者自己承认的边界
论文的 limitation section 是最直接的入口,但不要照抄"未来工作"。作者写"只在英文数据上评估",并不等于你的 follow-up 就是"扩展到中文"。你要继续追问:跨语言后哪个机制可能失效?是 tokenizer、训练数据、文化常识、检索库覆盖率,还是 evaluation rubric?如果不能指出机制,扩展数据集往往只是工程补充。
一个更好的写法是:原方法在英文 instruction-following 上依赖高质量人工偏好数据;假设迁移到低资源语言时,偏好模型更容易奖励流畅性而不是事实正确性;最小实验是在两个语言子集上固定模型和任务,比较偏好评分与人工 factuality 标注的一致性。
2. Failure case:错误样例里的规律
很多论文会展示失败案例,但读者常常只把它当成附录。真正有用的做法是把 failure case 重新编码:错误发生在长输入、稀有实体、多跳推理、工具返回冲突、视觉遮挡、分布外格式,还是 benchmark 指令歧义?如果你能把错误分成三到五类,并找到其中一类稳定出现,就已经接近 follow-up。
注意,failure case 不是"挑一个失败例子讲故事"。你至少要验证它不是偶然样本。可以抽取 50-100 个错误样例,手动标注错误类型,或用模型辅助标注后人工复核。小规模但清楚的错误分类,常常比盲目跑一个更大 benchmark 更有研究价值。
3. Ablation 空白:该测但没测的变量
上一篇讲过 ablation study。对 follow-up 来说,最常见机会来自"论文声称 A 有用,但没有排除 B 的解释"。比如作者引入复杂 planner 后性能提升,但没有控制 test-time token 预算;引入新数据合成流程后提升,但没有和同等规模随机采样数据比较;提出 memory 模块后变好,但没有检查模型是否只是从更长上下文获益。
这类 follow-up 的优点是小而硬:你不需要提出全新系统,只需要设计一个更公平的对照,验证原 claim 的边界。缺点是要非常严谨,否则容易变成"复现实验没跑齐"。你的目标不是拆台,而是回答一个可重复的问题:在控制变量后,原方法的哪一部分仍然成立?
4. Benchmark 偏差:任务定义和指标不匹配
AI 论文里很多争议来自 benchmark。一个方法可能在 leaderboard 上提升,但提升来自数据泄漏、格式适配、prompt tuning、judge 偏差、长答案偏好或测试集过窄。follow-up 可以从 benchmark 的测量对象入手:当前指标到底测的是能力、风格、成本,还是对数据集分布的适配?
例如,开放式评测中 LLM-as-a-judge 可能偏好更长、更自信或更像参考答案的输出。一个小 follow-up 可以固定候选答案内容,系统扰动长度、语气和引用格式,测试 judge 排名是否变化。这样的研究不一定需要训练模型,但能直接影响后续论文的证据质量。
5. 机制解释不足:分数上涨但原因不明
很多方法论文会给出直觉:检索增强减少幻觉,process supervision 改善推理,self-consistency 提升可靠性,tool use 扩展能力边界。但直觉不是机制。follow-up 可以把"为什么有效"变成可测信号:检索是否提高了证据覆盖率?process supervision 是否减少中间步骤错误?self-consistency 是否只是在多数投票里过滤随机噪声?工具调用是否真的解决了知识缺口,还是只是提供了更长上下文?
机制型 follow-up 通常更适合研究训练,因为它不依赖大规模 compute,而依赖实验设计。你可以用小模型、小数据、小任务做清楚的诊断,只要问题定义足够锋利。

小而可靠的 idea 应该长什么样
一个可执行 follow-up idea 可以写成一句话:
针对论文 P 中 claim C 在条件 S 下证据不足的问题,我假设机制 M 是关键瓶颈;在固定 A、B、C 变量后,通过最小实验 E 比较 baseline 和 variant,并用指标 Y 与诊断信号 Z 判断假设是否成立。
这句话里有六个要素:
- 来源:idea 来自哪篇论文、哪张表、哪个失败样例或哪条审稿意见。
- 缺口:原论文证据缺了什么,不是泛泛说"还有提升空间"。
- 假设:你相信什么机制导致问题,且这个机制可能被推翻。
- 最小实验:两到四周内可以完成的实验,不依赖未知资源。
- 判据:成功和失败分别意味着什么。
- 退出条件:如果跑不出预期,怎样判断是实现问题、假设问题还是数据问题。
这里的"小"不是指没有野心,而是指变量少。一个可靠的 follow-up 最好只改变一个主变量,最多带一个辅助变量。比如:
| 不可靠写法 | 更可靠写法 |
|---|---|
| 做一个更强的 RAG agent | 固定生成器和检索库,只比较 reranker 是否改善冲突证据场景下的 factuality |
| 把方法扩展到多模态 | 先测原方法在视觉遮挡、OCR 噪声、跨图指代三类失败上的退化曲线 |
| 用强化学习提升推理 | 先验证 process reward 是否比 outcome reward 更能定位中间步骤错误 |
| 设计新 benchmark | 先构造 200 个反事实样例,证明现有 benchmark 无法区分两类能力 |
| 用 AI 自动生成研究 idea | 先评估生成 idea 的 novelty、feasibility 和 expected effectiveness 是否能被专家稳定区分 |
一个实用标准是"最小可发表单元"。它不一定能独立成为顶会长文,但应该可以成为 workshop paper、reproduction report、短博客、附录实验或 proposal 的核心。更重要的是,它应该能让你学到某个确定结论:原 claim 的边界、某个机制的证据、某个 benchmark 的缺陷,或某类负结果的解释。
代表论文路线图:AI 如何辅助科研构思
近两年关于科研构思的论文越来越多,它们本身也提供了 follow-up 训练的参照系。可以按四条线阅读:
| 方向 | 代表资料 | 关注问题 | 对研究生的启发 |
|---|---|---|---|
| 人类 vs LLM idea generation | Can LLMs Generate Novel Research Ideas?(arXiv 2024) | LLM 生成 idea 是否新颖、可行、多样 | 不要把 novelty 和 feasibility 混为一谈 |
| 文献结构化生成 | Chain of Ideas(arXiv 2024) | 用文献发展链帮助 LLM 构思 | idea 应来自研究脉络,而不是孤立 prompt |
| 研究任务 benchmark | AAAR-1.0(arXiv 2024,2025 修订;ICML 2025 注释见 arXiv) | 方程判断、实验设计、论文弱点评估、review critique | 实验设计和找弱点本身可以被评估 |
| idea evaluation | GraphEval (arXiv 2025)、Literature-Grounded Novelty Assessment(arXiv 2025) | 如何评估 idea 质量和 novelty | novelty 需要文献证据,不能只靠模型自评 |
| empirical outcome prediction | Predicting Empirical AI Research Outcomes with Language Models(NeurIPS 2025) | 预测两个研究 idea 哪个会在 benchmark 上更好 | idea 可行性可以转化为"可预测结果"的问题 |
| scientific forecasting | PreScience (arXiv 2026)、Future-Aligned Research Proposals(arXiv 2026) | 用时间切片预测未来论文贡献 | 好 proposal 应能连接已有证据和未来发展 |
| 自动化科研流水线 | The AI Scientist / Towards end-to-end automation of AI research(Nature 2026) | 从 idea 到实验、论文、评审的端到端自动化 | 自动化能放大效率,也会放大错误假设 |
这条路线的共同点是:它们都不再把 research idea 当作无法分析的灵感,而是把它拆成 novelty、feasibility、significance、expected effectiveness、experimental design、weakness detection 和 future alignment 等可讨论维度。对科研新人来说,这比"让 LLM 给我十个创新点"有用得多。
关键论文精读:把 idea 当成可评估对象
Can LLMs Generate Novel Research Ideas?
这篇 2024 年 arXiv 论文招募 100 多位 NLP 研究者,比较专家 idea 和 LLM ideation agent 生成 idea 的盲审评价。它的关键不在于"LLM 是否赢过人类"这个单点结论,而在于它把 idea 评价拆成了 novelty、feasibility 等维度,并指出 LLM 自评、多样性和最终研究结果验证仍是开放问题。读这篇时要重点看实验设计:如何控制作者身份、如何组织 blind review、如何处理主观评价。
对 follow-up 训练的启发是:不要只问"我的 idea 新不新",还要问"专家会不会认为它可行""它是否只是换了术语""它是否和已有论文重复"。如果 novelty 高但 feasibility 低,你得到的不是好选题,而是一个需要继续压缩的假设。
Chain of Ideas
Chain-of-Ideas 的核心思想是把相关文献组织成发展链,再让 LLM 基于链条生成 idea 和实验设计。它提醒我们,很多 idea 的质量取决于文献结构:你是否知道这个方向从哪个限制走到哪个改进,哪些方法被证明无效,哪些任务定义发生过变化。对人类读者来说,这等价于 Related Work 地图的实践版。
做 follow-up 时,可以借鉴这种链式方法:选一篇目标论文,往前追三篇被它解决的工作,往后看三篇引用或同主题新论文,然后写出"旧限制 -> 当前方法 -> 新限制"的链条。如果链条写不出来,说明 idea 还停留在孤立灵感。
AAAR-1.0
AAAR-1.0 把研究者日常任务做成 benchmark,包括 ExperimentDesign 和 PaperWeakness。项目页说明数据构建中有资深 AI 研究者参与标注,并通过多轮检查过滤;它也显示,即使强模型在研究弱点识别、实验设计等任务上仍有明显局限。这里不要只看模型分数,而要看任务定义:什么样的输出才算好的实验设计,什么样的 weakness 不是泛泛而谈。
这对研究生非常实用。你可以把自己的 follow-up idea 当作 AAAR 风格任务来检查:如果让另一位同学只看论文和你的 idea,他能否写出同样的实验计划?如果不能,说明你的问题定义还不够清楚。
GraphEval 与 Literature-Grounded Novelty Assessment
GraphEval 把复杂 idea 拆成 viewpoint graph,用图结构辅助评价;Literature-Grounded Novelty Assessment 则提出基于检索和 rerank 的 novelty checker,强调 novelty 判断必须 grounded in literature。两者共同指出一个问题:idea 评价不是一句"看起来很新",而是要分解观点、找相关论文、比较差异,并给出基于文献的理由。
实践上,你可以为每个候选 idea 写一张 novelty card:最近三篇最相近论文是什么?你的差异是任务、数据、方法、理论解释、评测协议,还是应用场景?如果差异只能写成"我们也试一下 X",novelty 很弱;如果差异能写成"已有工作没有控制变量 V,因此无法区分机制 M1/M2",就更像研究问题。
Predicting Empirical AI Research Outcomes
NeurIPS 2025 的这篇论文把 idea 评价转化为 pairwise prediction:给定两个研究 idea,预测哪个会在 benchmark 上表现更好。论文报告了由会议论文中抽取的 idea pair 和实验结果,并比较模型系统与专家判断。它的意义不是让我们盲信模型预测,而是提出一个很好的训练问题:在真正跑实验前,你能否说清楚哪个 idea 更可能成功,理由是什么?
做 follow-up 时,可以把候选 idea 两两比较:A 更有 novelty,但实验风险高;B novelty 较低,但能验证关键机制;C 需要额外数据,不适合当前周期。用 pairwise ranking 逼自己取舍,比让模型生成十个方向更有效。
PreScience 与 Future-Aligned Research Proposals
2026 年的 PreScience 把科学预测做成时间切片 benchmark,围绕近年 AI 论文和引用信息构造任务;Future-Aligned Research Proposals 则把 proposal 质量与未来论文方向对齐起来,用 cutoff 前资料生成 proposal,再看它是否预示 cutoff 后出现的研究贡献。这些工作给 follow-up idea 一个新视角:好 idea 不只是和过去不同,还应该能解释"为什么下一步可能发生在这里"。
对训练营读者来说,不需要复现完整 benchmark,但可以借鉴时间切片思路:读论文时只使用某个时间点之前的资料,写出当时合理的 follow-up,再用之后半年或一年的论文检查它是否被别人做了、哪里判断错了。这个练习能快速提高研究嗅觉。
方法/实验对比表
下面是一张可直接用于选题筛选的对比表。每个候选 follow-up 都应至少填一行。
| 维度 | 低质量候选 | 高质量候选 | 检查问题 |
|---|---|---|---|
| 来源 | "我觉得可以改进" | 来自具体论文表格、failure case、limitation 或 reviewer concern | 能定位到哪一页、哪张表、哪段 claim 吗 |
| 缺口 | 论文没做 X | 论文缺少能区分 M1/M2 的证据 | 原论文为什么无法回答这个问题 |
| 假设 | X 会更好 | 在条件 S 下,机制 M 会影响指标 Y 和诊断信号 Z | 什么结果会推翻假设 |
| 实验 | 训练一个更大模型 | 固定主系统,只改变一个变量 | 两到四周能完成吗 |
| baseline | 只和原论文比 | 包含简单替代、强 baseline、随机或预算控制 | 是否排除便宜解释 |
| 指标 | 只看 leaderboard 分数 | 主指标 + 成本 + 错误类型 + 方差 | 是否能解释为什么 |
| 风险 | 没有风险 | 明确数据、算力、代码、评估偏差风险 | 卡住后有什么降级方案 |
| 产出 | 必须正结果 | 正负结果都能写出边界或机制 | 失败后是否仍有信息 |
最小复现实验与 proposal 模板
一个适合训练营的 follow-up idea,最好先写成一页 proposal,再开始跑实验。模板如下:
1. 目标论文
写清楚论文标题、版本、链接、核心 claim、你依赖的表格或段落。不要只写"某篇 RAG 论文"。
2. 缺口定义
用两到三句话说明原论文没有回答什么。建议用这种格式:
原论文证明了 A 在 benchmark B 上提升,但没有控制变量 C,因此无法判断提升来自机制 M1 还是 M2。
3. 可证伪假设
写出正反两种结果的解释:
如果 M1 成立,则在控制 token budget 后,variant V 应仍提升 factuality,并减少错误类型 Z;如果提升消失,则原增益可能主要来自更长上下文或解码预算。
4. 最小实验设计
列出数据、模型、baseline、变量、指标、seed、日志字段。这里要具体到能开 issue 的程度:
- 数据:使用哪个公开数据集、哪个 split、是否抽样、抽样 seed。
- 模型:base checkpoint、推理框架、是否量化。
- 变量:只改一个主变量,例如 retriever、verifier、prompt step、reranker、top-k。
- baseline:原方法、简单替代、no-op 或预算匹配版本。
- 指标:主指标、成本指标、错误分类、置信区间或至少多 seed 均值。
- 日志:保存输入、输出、中间证据、随机 seed、版本 hash、失败原因。
5. 预期贡献
不要写"提升性能"。写你要贡献什么类型的知识:
- 证明某模块在控制预算后仍有效。
- 找到原方法只在某类数据上有效。
- 给出一个 benchmark 偏差诊断。
- 说明某个直觉机制不成立。
- 提供可复现的负结果和错误分析。
6. 停止条件
给自己设定退出线:两周内无法复现主结果,转为 reproduction report;三组 seed 方差过大,优先做稳定性分析;数据构建成本超出预期,缩小到诊断子集;核心假设失败,写边界条件而不是继续堆模块。
常见误区
误区一:把 future work 当成题目
论文说 future work 可以扩展到多模态,你就写"我要做多模态版本"。这只是任务扩展,不是研究问题。你需要指出多模态引入了什么新矛盾:视觉证据和文本证据冲突?图像编码器冻结导致细粒度 grounding 不足?评测指标无法区分视觉理解和语言先验?
误区二:idea 太大,导致没有第一步
"构建一个自动科研 agent"很吸引人,但第一步是什么?如果第一步都说不清,说明题目太大。把它压缩成一个模块问题:agent 生成的实验设计是否覆盖必要 baseline?LLM self-review 是否能发现缺失消融?idea ranking 是否受论文热度偏置影响?
误区三:只追 novelty,不追 feasibility
2024 年的人类研究已经提醒我们,LLM idea 可能被认为更 novel,但 feasibility 较弱。研究生选题不能只看新颖度,因为你还要把实验跑出来。可行性不是保守,而是把风险显式化:数据是否能拿到,代码是否能跑,GPU 是否够,评估是否可信。
误区四:把 AI 生成结果当成证据
LLM 可以帮你列 limitation、找相关论文、生成实验计划,但它的输出不是 novelty 证明,也不是实验结果。ICLR 2026 对重要 LLM 使用要求披露,正说明科研责任仍在作者。使用 AI 辅助构思时,至少要记录 prompt、检索来源、人工筛选标准和最终人工判断。
误区五:失败后继续加模块
如果最小实验失败,最差的反应是继续加复杂模块,直到某个 benchmark 上涨。更好的做法是回到假设:是机制错了,变量没控制好,数据太小,还是 metric 不敏感?一个清楚的负结果,往往比一个解释不了的正结果更能训练研究能力。
适合研究生继续做的选题
1. Follow-up idea rubric 的小规模人类一致性研究
收集 30-50 个来自近期 LLM 论文的候选 follow-up idea,请 3-5 位研究生按 novelty、feasibility、significance、evidence strength 打分,分析一致性和分歧原因。目标不是训练模型,而是建立本组的选题评审标准。
2. LLM 辅助 limitation mining 的可靠性评估
给定论文全文,让 LLM 抽取 limitation、missing ablation、benchmark risk,再由人工核验。比较不同提示方式:直接抽取、先构建 claim table、先做 related work map、先做 reviewer-style critique。指标可以是人工确认率、具体性和可执行性。
3. 从 ablation 空白生成最小实验计划
选取一个方向的 10 篇论文,人工标出缺失消融,再让模型生成最小实验计划。分析模型是否能控制变量、是否遗漏 baseline、是否提出不可执行实验。这个题目可以和 AAAR-1.0 的 ExperimentDesign 思路呼应。
4. Novelty checker 在中文 AI 论文阅读中的适配
基于 Literature-Grounded Novelty Assessment 的思路,做一个轻量流程:中文问题描述 -> 英文关键词扩展 -> arXiv / Semantic Scholar 检索 -> 相似工作分面比较 -> novelty card。重点评估它能否帮助中文读者避免重复造题。
5. Research proposal 的时间切片复盘
选 2024 年某个方向的论文,只允许使用当时之前的文献写 follow-up proposal,再用 2025-2026 年论文检查 proposal 是否命中真实趋势。这个练习可以借鉴 PreScience 和 Future-Aligned Proposal 的时间切片思想,但规模可以很小。
总结
设计 follow-up idea 的关键,不是想一个宏大方向,而是把论文里未被充分证明的地方,压缩成一个可证伪、可复现、可解释的小问题。读论文时,你要从 limitation、failure case、ablation 空白、benchmark 偏差和机制解释不足里找入口;写 proposal 时,你要明确来源、缺口、假设、最小实验、判据和停止条件;跑实验时,你要保证即使结果为负,也能回答"我们学到了什么"。
这一篇可以作为后续 050"如何从 10 篇论文形成一个 research proposal"的前置训练。031 关注单篇论文后的最小 follow-up;050 会进一步讨论如何把多个 follow-up 串成完整 proposal。真正的科研阅读系统,就是从一篇论文的一处缝隙开始,逐步建立自己的问题地图。
参考资料
检索日期:2026-07-31。
- Chenglei Si, Diyi Yang, Tatsunori Hashimoto. Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers. arXiv:2409.04109, submitted 2024-09-06. https://arxiv.org/abs/2409.04109
- Long Li et al. Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents. arXiv:2410.13185, submitted 2024-10-17, v5 2024-10-30. https://arxiv.org/abs/2410.13185
- Renze Lou et al. AAAR-1.0: Assessing AI's Potential to Assist Research. arXiv:2410.22394, submitted 2024-10-29, v4 2025-05-25; arXiv comments note ICML 2025. https://arxiv.org/abs/2410.22394
- AAAR-1.0 project page. https://renzelou.github.io/AAAR-1.0/
- Tao Feng, Yihang Sun, Jiaxuan You. GraphEval: A Lightweight Graph-Based LLM Framework for Idea Evaluation. arXiv:2503.12600, submitted 2025-03-16, v2 2025-05-28. https://arxiv.org/abs/2503.12600
- Simra Shahid et al. Literature-Grounded Novelty Assessment of Scientific Ideas. arXiv:2506.22026, submitted 2025-06-27. https://arxiv.org/abs/2506.22026
- Jiaxin Wen, Chenglei Si, Yueh-Han Chen, He He, Shi Feng. Predicting Empirical AI Research Outcomes with Language Models. NeurIPS 2025 Main Conference Track; arXiv:2506.00794 submitted 2025-06-01. https://proceedings.neurips.cc/paper_files/paper/2025/hash/03f99ca79b87c513d0b502e737a41a41-Abstract-Conference.html
- Anirudh Ajith et al. PreScience: A Dataset and Benchmark for Scientific Forecasting. arXiv:2602.20459, submitted 2026-02-24, v2 2026-07-02. https://arxiv.org/abs/2602.20459
- Heng Wang et al. Learning to Predict Future-Aligned Research Proposals with Language Models. arXiv:2603.27146, submitted 2026-03-28, v3 2026-05-26. https://arxiv.org/abs/2603.27146
- Chris Lu et al. Towards end-to-end automation of AI research. Nature 651, 914-919, 2026. https://ideas.repec.org/a/nat/nature/v651y2026i8107d10.1038_s41586-026-10265-5.html
- DARPA. The Heilmeier Catechism. https://www.darpa.mil/about/heilmeier-catechism
- ICLR 2026 Author Guide. https://iclr.cc/Conferences/2026/AuthorGuide
- NeurIPS 2026 Main Track Handbook. https://neurips.cc/Conferences/2026/MainTrackHandbook
- Papers with Code. Tips for Publishing Research Code. https://github.com/paperswithcode/releasing-research-code