千笔-AIWritePaper · https://www.aiwritepaper.com
Tom Hope FirstPrinciples 讲座里把「用 LLM 做科学发现」收束到一条硬约束:想法必须扎根文献,而不是无约束空想。三条工对应三工程形态---SciMON(文献启发 + 新颖度迭代)Scideator(人共创 + facet 重组)、CHIMERA(组样例知识库)。本文按讲座主题写成独立验收文:怎么选型、当天最小实验怎么跑,不视频摘要扩写。
频:https://www.youtube.com/watch?v=cYxxOCXtIko
:SciMON / Scideator / CHIMERA 的「何时用「验收核」;底部为锁 5 篇 OA ×「假说---文献持---反例缺口」对照表。
目标说明
读完应能独完成五件事:
- 用一句话分 SciMON、Scideator、CHIMERA 各自解决的问题形态。
-
- 对照选型表,判断课题该先上「自动抬新颖度 / 人机 facet / 重组 KB」,而不是默认「再喂一篇 PDF 给聊天框。
-
- 说出每条路径的验核:灵感可源、facet 可选、重组可计到摘要。
-
- 当天 5 篇开放获取论,填「假说---文献支持---反例---缺口」表,人工开 2 个 DOI 抽检。
-
- 列出至少三条踩坑:把 LLM 句子当发、只报关键词命中、用简介腔代替可核验用。
适用边界
适合
- 组里要上「文启发假说 / 跨域组 / 新性检查」,需要先写验收协议。
-
- 传 LBD(文献驱动发现)二值链路预太干,要自然语言假说与背上下文。
-
- 评测 ideation 系统时,要对照学搜索引 + 裸 LLM」这类基线,而不是自嗨 demo。
-
- 需要重监督数据或元科学分析(谁从哪一域借了机制)时,问有没有可抽的重组边。
不适合
- 把座金成「AI 做诺奖发现站队文。
-
- 无人工 DOI 抽检就把统输出写成「已证明新颖」。
-
- 只有窗口、没有检索/对比/facet 记录,却宣称已现 SciMON 或 Scideator。
-
- 编造未出现在公论文中的精成或用户研究数字。
风险
座是公开口述;机制以已发表/预印本。SciMON 开估强调 GPT-4 类模型常偏浅、新颖度不足,方法只部分缓解;Scideator 用研究结论限于其设定基线;CHIMERA 研究者觉得启发」≠湿实验或临定论。数字只引开可核项( ACL 收录、arXiv 编号>28K 重组样例量),勿自行注
机制要点(独立述)
1. SciMON背景上下文 → 文献灵感 → 迭代抬新颖
统 LBD 常把假说压成概念对路预测,表达力弱,也不门化新颖度。SciMON(Wang, Downey, Ji, Hope;ACL 2024)换成另一设定:输入问(目标、设定、约束),输出扎根文的自言想法 。框架先检 past papers / 知识图上下文作「inspirations再把生成想法与已有工对比;叠强则更新想法,直到新颖度达标。公论径:GPT-4 倾向深度新颖度偏低,SciMON 类方法部分善但仍是「迈向文派生 ideation」步,是终点。代码与见公开仓库 eaglew/clbd。验核:背景可复感可源、度代比比。
2. Scideator:purpose / mechanism / evaluation 的人机重
Scideator(Radensky 等;arXiv:2409.14634)是混合主动mixed-initiative)具:从户给定论文集出发,取并扩展 purpose(的)、mechanism(机制、evaluation(评测) 等 facet,允许交互重生想法,并用文献检索 + 自动新颖性评估说明潜在重叠。公开面与预印描类 RAG 模块( Analogous Paper Facet Finder、Faceted Idea Generator、Idea Novelty Checker / Iterator用户研究照「科学搜索 + LLM」基线,报告在兴度/造力持尤其探索)上更好---验时复述究设与基线 ,勿扩成「面碾压切搜索。验收核:facet 可勾选、重组可放、新颖性明可打对应文献。
3. CHIMERA从要里挖「真实重」知识库
CHIMERA(Sternlicht & Hope;arXiv:2505.20779)把创新中的 recombination 概/机制融或跨启发)做成可取任人工标注摘要 → 微调模型 → 大规模挖 AI 相关 arXiv( 2019--2024)到 逾 28K 组 KB,示跨域析与启发方向预测等用途;代码/据见 noy-sternlicht/CHIMERA-KB 与配套 Hugging Face 集它解决的是「监督信号从哪来」:真实作者自述重组,而不是只无监督类比检索。验收核:能回到摘要上下文、型注、向可人工抽检是否启而非幻觉
五条可执行的机制检查
署前用这五句自问,答不上准备好验:
- 假是背景上文,还是只有几个关键词?缺上下文就易滑回口号生成。
-
- 每灵感能否指回具体论文/段落,是「究明」?
-
- 新颖与检到重叠工作对比后更新,还是生成结束?
-
- 若人机共facet(至少 purpose/mechanism)是落盘可选?
-
- 若用重 KB,边是作者自抽 还是模型凭空连边?有没有抽样人工复核比例?
这五句把讲座里的系统名,压成程门禁。答完再填型表。
- 若用重 KB,边是作者自抽 还是模型凭空连边?有没有抽样人工复核比例?
选型与验收
| 路 | 何时优用 | 必须留下的证据 | 失败义 |
|---|---|---|---|
| SciMON | 要自然言说、文献启发、迭代抬新颖度 | 背景上文、灵感溯源、新颖度对比迭代日志 | 一次成、无检索对,等于 LLM |
| Scideator | 要机共创、facet 重组探索法空间 | facet 勾选记录、重组放、新颖性索说明 | 聊天,没 purpose/mechanism 结构 |
| CHIMERA | 要重组样例 KB、跨域启发监督/析 | 边→摘可审计、类型标注、预测检表 | 把「觉得启发成已验证科学发现 |
路由诀:要动新颖度 走 SciMON;要人机 facet 探索 走 Scideator;要重组 KB / 监督数据走 CHIMERA
当天最小实验(非观后感)
协议(约 60--90 分钟,必复现完整系)
- 日期:2026-09-08Asia/Shanghai)
-
- 语料:自选主题锁定 5 篇 OA(PDF/HTML 可打开;下 DOI 或 arXiv id)
-
- 两条路径对比:
-
- 键词检索路径:用 3--5 主题词检索,挑 Top 命中写 2 条「假说」。
-
- 文献启发路径:读 5 摘要/引言,强制用背景题 + 借 A 的机制 B」写 2 条假说。
-
- 每条假说填四列表;人工开 2 个 DOI ,判定支持 / 支持 / 支持。
记录表
- 每条假说填四列表;人工开 2 个 DOI ,判定支持 / 支持 / 支持。
| 假说 ID | 路径 | 假说一句 | 文献支持(DOI) | 反例/重文 | 口 | 抽检判定 |
|---|---|---|---|---|---|---|
| H1 | 关键词 | |||||
| H2 | 关键词 | |||||
| H3 | 文献启发 | |||||
| H4 | 文献启发 |
伪代码骨
text
papers = lock_five_oa(topic) # 固定清单,止事后换
for path in [keyword_search, literature_inspired]:
hyps = make_two_hypotheses(papers, path)
for h in hyps:
support = cite_doi(h)
counter = find_overlap_or_counter(h, papers_or_search)
gap = what_is_not_covered(h)
write_row(h, support, counter, gap)
sample = pick_two_dois(rows)
for doi in sample:
open_fulltext(doi)
label(support_level) # 支持 / 部分 / 不持
write("键路径漏的一条跨域启发:...")
```
**验收勾选**
- [ ] 五篇锁定清单复述(标题 + DOI/arXiv)。
- [ ] - [ ] 至四条假说填齐四列表;文启发路径必须出现「借 A 改 B」结构。
- [ ] - [ ] 人工打开 2 个 DOI,下支持级别;出现「支不得删行。
- [ ] - [ ] 写下:「关键词路,会漏掉条跨域启发。
- [ ] - [ ] 表进仓库文件名含日期;未抽检不得宣称做文献发现系统」。
若四条说的支持 DOI 全部部支持」,把反列补强后再谈上线;验目的是暴露**可验性**,不是刷满「新颖」。
## 可验证清单(团队制度)
- [ ] ideation 系统写明:检索语料边界对比迭代次数人工抽比例。
- [ ] - [ ] SciMON 类止无背景上文一次性生成」冒充框架完成。
- [ ] - [ ] Scideator 类:facet 至少 purpose + mechanism 落;新颖说明附可开文献。
- [ ] - [ ] CHIMERA 类:重边抽样复核对外区分「启发分」「实验验证。
- [ ] - [ ] 对外料双栏:栏打开的 DOI/摘要摘录,右栏型叙述;缺左栏不得发。
- [ ] - [ ] 换底座模型跑烟雾项(同一 5 篇、同一四列表),验收协不改。
## 踩坑
- 把一次 LLM 输出当科学发现;溯与反例。
- - 只用关键词检索,传跨域重组」------组要机制级对齐,不是主题词并集。
- - 新颖性检查只跑嵌入度,不打开重叠论文读方法节。
- - 引用 DOI 打不摘要不支仍写「已证实」。
- - Scideator 用户研究的「更有趣/更好探」夸成领通用 SOTA
- - 把 CHIMERA 的启发方测写成已成湿实验临床结论。
- - 用未出现在公开论文中的精确百分比注水。
## 从「聊找灵感」迁到文献验收」的两周节奏
第 1--3 天:只锁篇 + 四列表 + 2 DOI 抽检,禁止上完 agent。
第 4--7 天:加检索日志与「重叠文对比」一列;若要人,先 purpose/mechanism 两列。
第 8--10 天:若要 KB先人工标 30--50 条重组句再谈自动抽取;对照 CHIMERA 公开 schema 做字段齐
第 11--14 天:对外摘要强制双栏可引用录 | 统叙述);左栏不得。
两奏的目标防止一上来复制讲座的最系统事可验是门禁,规模是结果。
## 成与工备材料口径)
文献驱 ideation 的账单主要在:**检索索引、长上下文对比迭、机标注/抽检**,而不是提示词长度。SciMON 强调检索灵感 + 新度循环;Scideator 强调 facet RAG 户时间;CHIMERA 强调取与大模挖时把「工打 DOI 的比例」写成硬行,承诺自现」更可审计。源锚点(`clbd`、`CHIMERA-KB`用于复现烟雾项,不应用作营销话术
## 总结
Hope 讲座给出的不是又一波「AI 写想法」demo,而是三条可分开验收文献发工程:SciMON 用景 + 灵感检 + 新颖度迭代证明假说可抬新;Scideator 用 facet 人机重组证明探索可结构;CHIMERA 用实重组 KB 证明监督号可审计。填选表,再跑当天五篇 OA 四列表与 2 DOI 抽;能勾选的才算署,能打引用的才算文发现。把 LLM 当发现擎,提是假可溯源、新颖度可对比引用可人工否决------缺门禁「灵成」,只更流畅的空。
## 引用
- 讲座视频:https://www.youtube.com/watch?v=cYxxOCXtIko
- - SciMON(ACL 2024)https://aclanthology.org/2024.acl-long.18/ ;arXiv: https://arxiv.org/abs/2305.14259 ;代码 https://github.com/eaglew/clbd
- - Scideator(印本:https://arxiv.org/abs/2409.14634
- - CHIMERA(arXiv:2505.20779):https://arxiv.org/abs/2505.20779 代码 https://github.com/noy-sternlicht/CHIMERA-KB
- - Tom Hope 研究页(AI Inspiration)https://tomhoper.github.io/research/boosting/