
千笔-AIWritePaper · https://www.aiwritepaper.com
「AI 参考文献」最容易写成两种空话:要么神化一键生成书目,要么只骂幻觉却不给可跑闸门。本篇锁定标题服务抓幻觉引用 / 闸门 / 失败含义 / 当天最小实验 。主视频为 Joanne Donoghue 公开分享 How to Catch Fake AI Citations & Hallucinations:演示对多平台(含通用 LLM 与学术辅助工具)用同一简短提示索要文献列表后,逐条核验 DOI、作者、题名是否对得上,并记录错误类型(错 DOI、作者错位、重复题名不同作者、来源不可信等)。视频中的工作流结论偏向:与其事后花大量时间清理 AI 书目,不如用引用管理器自建清单,并把核验当必做闸门 。SciSpace 等工具若提供来源片段/跳转,只能降低核验成本,不能取消核验。本文不编造未核验的产品测评分,而把验收落成闸门表 + 失败含义 + CSV。
视频:https://www.youtube.com/watch?v=1NeFbV8eIfg
备选说明:若只做产品功能解说语料偏薄,可对照 Frontiers 研究诚信/AIRA 公开材料理解「AI 可旗标、人类终裁」;本篇主视频核验语料足够,未切换 。见 _w/youtube-notes.md。

图:提示→候选列表→题名/作者/DOI 核验→来源可信度→人类终裁;底栏验收 CSV。
目标说明
读完应能独立完成五件事:
- 用一句话复述核:AI 书目是候选,不是参考文献终态;打不开或不匹配即 fail。
- 按五闸门列出「工具可做 / 人类必做 / 失败含义」。
- 当天对 ≥5 条候选引用做核验,填入
cite-mini-experiment.csv,至少 1 条 fail。 - 区分「有 DOI 字符串」与「DOI 解析后题名/作者一致」。
- 对外口径保持「助手非替代」,不把任何学术 AI 写成零幻觉。
适用边界
适合
- 学生/助手用 SciSpace、通用 LLM 或其他工具生成过参考列表,需要入库前闸门。
- 课题组想把「幻觉引用」从口头警告写成 SOP。
- 需要失败样本(错 DOI、重题名、不可信来源)做教学。
不适合
- 索要绕过期刊检测或伪造文献的方法:不提供。
- 无核验就把工具导出一键粘进投稿。
- 把单次演示错误率写成行业基准。
- 未发表数据/患者信息粘贴进公网工具还宣称已合规。
风险
简短提示更容易「好看但假」。工具显示来源片段时仍可能错配。最小实验证明闸门可跑通,不证明某工具安全分数。视频逐字细节以你本地核验笔记为准,不在正文假装完整逐字稿。
五闸门验收
| 闸门 | 工具可做 | 人类必做 | 失败含义 |
|---|---|---|---|
| G1 提示与范围 | 生成候选题名列表 | 写清主题、年限、纳入排除 | 无边界的 10 条「完美文献」 |
| G2 题名存在性 | 提供链接/检索入口 | 用题名在可信库打开 | 题名不存在或进奇怪站 |
| G3 作者/年份一致 | 展示元数据 | 对照作者顺序与年份 | 同题名不同作者;年份漂移 |
| G4 DOI/著录核验 | 给出 DOI 字符串 | 解析 DOI,核对题名作者 | DOI 指向另一篇或无效 |
| G5 人类终裁 | 辅助高亮片段 | adopt / repair / reject | 未终裁就进 Word 书目 |
验收表见 _w/cite-acceptance.csv。
失败含义(写进 SOP)
| 现象 | 含义 | 动作 |
|---|---|---|
| DOI 无效或指向他文 | 著录幻觉或错配 | reject 或 repair 后重验 |
| 题名相同作者集不同 | 可能拼贴/串稿 | reject,禁止「差不多」 |
| 只有预印本/非评审页且你需要期刊证据 | 证据层级不够 | defer 或降级引用 |
| 来源跳转到无关聚合站 | 不可信入口 | reject |
| 全 adopt 且无打开记录 | 闸门未执行 | 整单作废 |
当天最小实验
- 固定提示(可与视频同结构的弱提示做对照):索要某主题 ≤10 条研究,要求含题名、作者、年份、DOI。
- 在 SciSpace 或你常用工具生成候选;另可用同一提示在通用 LLM 跑对照(可选)。
- 抽 ≥5 条填
cite-mini-experiment.csv:title | authors | year | doi | open_ok | meta_match | decision。 - 至少 1 条
decision=reject或repair;全 adopt 无效。 - 写
cite-gate-log.csv:每闸 pass/fail + 人类备注。
模板见 _w/。
可验证清单
- ≥5 条候选有打开记录
- DOI 解析与题名/作者核对做过
- 含 ≥1 条 reject/repair
- 五闸门表可讲解
- 未把工具营销句写成测评分
踩坑
- 看见 DOI 就信:要解析后一致性,不是字符串非空。
- 只检查第一作者:视频示范里作者序与合作者错误常见。
- 用另一次 AI 聊天验证 AI 书目:核验应落在可信书目库/DOI 解析,而不是模型互博。
- 失败条偷偷删掉:教学与 SOP 需要失败样本。
- 把 SciSpace 片段高亮当终裁:高亮是线索,终裁是人。
最小实验表示意
cite-mini-experiment.csv:
| ref_id | title | authors | year | doi | open_ok | meta_match | decision | note |
|---|---|---|---|---|---|---|---|---|
| R1 | (候选题名) | ... | 2024 | 10.... | yes | yes | adopt | DOI 解析一致 |
| R2 | (候选题名) | ... | 2023 | 10.... | yes | no | repair | 作者序错误 |
| R3 | (候选题名) | ... | 2022 | 10.... | no | no | reject | DOI 无效 |
cite-gate-log.csv:gate | result | evidence | operator。G2--G4 任一对关键引用 fail,则该引用不得 adopt。
弱提示对照为什么值得做
视频示范用简短提示跨平台索要文献,恰恰暴露「好看列表」的风险。你在最小实验里可以保留两次运行:弱提示一次、带「必须给可解析 DOI 且声明未核验」的强提示一次。比较的不是谁更会写,而是人类核验工作量与 fail 比例。把这个比较写进 gate-log,组会就有数据,而不是立场。
SciSpace 定位(避免软广跑偏)
把 SciSpace 写成「来源片段/表格/跳转可能降低打开成本」即可。不要写未核实的准确率、退款、榜单。若某功能页声称可减少幻觉,翻译成验收语言只能是:「提供更易核验的线索」,绝不是「可跳过 G2--G5」。去掉产品名后,读者手里仍应剩下五闸门与 CSV------这才符合「去掉产品名还剩什么」的自检。
教学演示怎么做
课堂或组会演示时,事先准备好至少两条必 fail 样本(无效 DOI、作者错位),避免现场「碰巧全真」导致闸门失去说服力。演示结束把 CSV 存档,下学期可复用。禁止演示造假文献用于投稿;教学样本与投稿清单物理隔离。
核验操作顺序(建议固定)
- 复制题名 → 在学校库/Crossref/DOI 解析打开。
- 核对作者姓氏与顺序、年份、卷期页。
- 打开全文或至少摘要,确认主张不是「题名看起来像」。
- 记录 open_ok / meta_match / decision。
- 只有 adopt 的条目进入引用管理器;repair 条目改完重走 1--4。
跳步最常见的是:只做了第 1 步看见落地页有字就 adopt。落地页存在 ≠ 元数据正确 ≠ 支持你的主张。
与参考管理器的衔接
闸门通过后的唯一写入点建议是 Zotero/EndNote 等管理器,而不是 Word 里手敲。AI 聊天记录不作为书目真源。导出 CSL/BibTeX 前再跑一遍「DOI 去重」。教学演示里可以把「聊天书目 → 管理器」的手工迁移当成一次健康摩擦:摩擦能降低误贴。
当天时间盒
30 分钟:5--10 条候选核验;10 分钟:填 CSV;10 分钟:写失败含义与下周规则。超时就减少候选数量,而不是牺牲核验深度。宁可 5 条真,不要 30 条「看起来全」。
错误类型编码(方便统计)
建议在 note 使用短码:E_DOI_INVALID、E_DOI_MISMATCH、E_AUTHOR_ORDER、E_YEAR、E_TITLE_DUP_AUTHOR_DIFF、E_SOURCE_UNTRUSTED、E_PAYWALL_UNVERIFIED。周会统计短码分布,比「有点假」更可行动。若某一短码连续两周最高,针对性改提示或改工具,而不是笼统「大家注意」。
闸门与双版本烟测如何串联
先用本篇五闸门清掉假条目,再进入参考文献双版本烟测做主张映射。顺序反了会变成:假 DOI 也被认真做了 oral 映射。SOP 里写成:citation-gates → dual-smoke。两篇配套读,不互相替代。
对外沟通禁止句
- 「我们用了 SciSpace,所以没有幻觉。」
- 「DOI 都有了,可以直接投稿。」
- 「模型说是顶刊,应该没问题。」
改成:「候选经五闸门核验,fail 样本见 CSV;仅 adopt 条目进入管理器。」
样例失败叙述(脱敏)
「候选 R7:DOI 可解析,但题名对应另一领域综述;作者集与模型输出不一致。decision=reject;短码 E_DOI_MISMATCH。处理:移出管理器,提示词增加『禁止跨领域凑数』。」
把这类叙述留在 gate-log,比只存截图更可检索。截图可附,但不替代短码与 decision。
工具对照实验的诚实写法
若你同时测通用 LLM 与 SciSpace,表格只报:候选数、打开成功率、meta 一致率、人类耗时。不报「综合体验分」。差异解释优先落在「是否提供跳转/片段」这类机制,而不是品牌形容词。读完应能复做,而不是只能复述广告。
预发检查
- 五闸门表可讲解
- mini-experiment ≥5 行含 fail
- 短码统计可生成
- 无未核实测评分
- 主视频链接可打开;切换策略已记录(本文未切换)
组会十五分钟流程
分钟 0--3:展示一条 adopt 与一条 reject。
分钟 3--8:两人交叉核验对方两条候选。
分钟 8--12:汇总短码,决定下周提示改哪一条约束。
分钟 12--15:确认管理器中仅含 adopt。
流程固定后,工具换成别家也不怕:换的是线索来源,不是闸门。
收尾动作
当日提交:cite-acceptance.csv、cite-mini-experiment.csv、cite-gate-log.csv、youtube-notes 链接。缺 fail 样本则补做,不得用「时间不够」豁免。标题里的 SciSpace 只是场景钉,验收核永远是人类核验。
总结
抓幻觉引用的最小可行制度,是五闸门 + 带 fail 样本的 CSV,而不是再找一个「更聪明」的生成按钮。主视频提供的是可复做的核验示范;SciSpace 等工具可以把「打开原文」变快,但不能替你签字。当天拿不出 reject/repair 行,就还没有闸门,只有运气。