受 Karpathy ASD-STE100的启发,我把论文讲解做成了一个开源 Skill

你把一篇论文交给 AI,它很快给出一份总结:研究背景、方法创新、实验结果、主要贡献。

每句话都像是懂了。

但合上回答,试着自己讲一遍:这个方法的输入是什么?中间做了什么?为什么要多这一步?实验究竟支持了哪个结论?

你可能又得回到原文。

我想做一个更适合这个过程的工具:先帮人看清论文主线,再把关键机制、论证和证据展开。遇到难点,还能沿着同一篇论文继续讨论。

于是有了 PaperUnfold,一个面向跨学科研究人员的开源项目。

知道论文提出了什么,还需要理解它如何得到结果,以及证据支持到哪里。此图为阅读结构示意。

灵感来自一个很简单的问题:解释能不能换一种形式?

此前看到 Karpathy 关于清晰表达和定制讲解产物的讨论,我对其中一个方向很感兴趣:模型可以为眼前的问题生成图示、网页等产物,让人更容易理解已经完成的工作。

读论文恰好需要这件事。

文字适合交代背景,流程图适合展示步骤关系,公式需要逐项解释,实验结果需要连回作者的判断。把这些都塞进一段连续文字,读者就要自己在脑中重新组织一遍。

PaperUnfold 因此把清晰表达落实到具体的阅读结构:术语前后一致,每一步有明确作用,重要结论带着条件和原文位置。

它也参考了 asd-ste100-skill 的清晰表达思路。这里的目标是保留论文含义,并把关系讲明白。

两个 Skill,分别处理"看清全局"和"拆开难点"

PaperUnfold 目前包含两个可以独立使用的 Skill。Skill 可以理解为交给 Agent 的一套工作说明,配合必要的辅助工具,约束它如何阅读、解释和保存结果。

paper-guide 生成可视化 HTML 导读。

先交代论文想解决什么、核心思路是什么、主要结论成立在什么条件下,再展开关键机制或论证。相关流程、公式、结果和证据放在对应的解释旁边。

paper-tutor 在对话中处理一个具体难点。

比如"这一层为什么要做聚合",或者"这组实验能支持因果结论吗"。它围绕选定的问题推进,结合你的回答给反馈,也支持直接讲解、提示、跳过和暂停。

两者可以连着用,也可以直接把论文交给 paper-tutor。从导读进入教学时,页面提供可复制的提示词,教学发生在 Agent 对话中。

paper-guide 帮你定位主线和难点,paper-tutor 沿着具体问题继续讲解;两个 Skill 也能独立使用。

导读要讲到哪一层?用 FOCUS 举个例子

我们曾用 FOCUS:Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering 做实际导读测试。

这篇论文研究细粒度视觉问答:图像中某个对象较小、细节较多时,怎样找到值得进一步查看的区域,并让模型回答问题。

如果只写"利用模型内部表示定位目标区域,再进行视觉问答",你能记住方法的大意,却很难解释它怎么工作。

导读需要继续展开:

  • 从问题中识别要寻找的对象。
  • 读取模型内部的文本和视觉 value 表示,计算对象相关性图。
  • 根据相关性图提出候选区域。
  • 对候选区域进行目标存在性验证和重排。
  • 按问题组织区域,再交给底座模型完成问答。

读到这里,一个容易混淆的区别就清楚了:相关性图帮助提出候选区域;目标存在性验证进一步筛选候选;最终问答再处理问题本身。

这几个步骤承担不同任务。导读还需要交代它们的输入、输出、连接关系和适用条件。

流程图也要把这些关系画出来:箭头上标注传递的内容,每个节点对应可核查的原文位置。公式放在相关步骤旁边,说明符号含义和它在流程中的作用。

FOCUS 导读把候选区域生成、目标验证和最终问答分开解释。流程为依据原文整理的教学图,公式在 HTML 中渲染显示。

通用的是阅读方法,呈现方式跟着论文走

PaperUnfold 面向全球各类学科的研究人员,讲解跟随对话语言,并保留论文原始术语,方便回到原文查找。

我认为这里有一套通用方法:找到研究问题,追踪作者怎样推进,检查证据与结论之间的关系。

但不同论文需要不同的展开方式。

算法论文适合追踪数据和步骤。实证论文要看研究设计、变量、比较方式和结果。理论或论证型论文则要明确前提、推导关系和结论边界。

因此,用户不必先选一个学科模板。导读根据论文内容组织解释:该画 pipeline 时画 pipeline,该画证据关系或论证结构时,就采用对应的图。

仓库已经提供算法、实证和理论论证三类示例。不过,这些示例展示的是方法如何适配不同研究结构,尚不能证明它在所有学科中的质量。

看懂一页,不等于已经掌握

读论文时,最值得继续讨论的往往是一个很小的推断。

比如一篇研究心理学可重复性的论文中,"样本量在某个模型里不显著",能否推出"增加样本量没有用"?这涉及跨研究的统计关联与改变同一研究条件之间的区别。

paper-tutor 会围绕这样的区别展开。你可以先回答一个问题,让它判断哪些部分已有依据,哪些推断还需要修正。遇到陌生概念,再补充相关背景。

如果你只想让它直接解释,也可以明确提出。教学不需要每一步都变成测验。

暂停时,可以保存学习进度。下次把进度文件和可读论文一起提供,它便能从已记录的位置继续。进度会区分讲过的内容、回答中体现出的理解,以及仍未解决的问题。

围绕一个具体推断展开讲解和反馈,再记录尚未解决的问题。对话内容为教学示意,进度文件用于继续学习,不代表掌握认证。

解释旁边,要留一条回到原文的路

AI 讲得顺畅,很容易让人忘记检查。

PaperUnfold 的导读保留原文位置和证据摘录,并说明实际读到了哪些材料、哪些内容没有覆盖。重要判断可以沿引用回到对应的证据。

为了让正文保持易读,证据默认折叠,需要核查时再展开。摘录帮助定位,判断仍应结合原文上下文。

这也是项目的一条边界:有 DOI 或摘要,不代表已经读到全文;提取了 PDF 文字,不代表核查了每张图。扫描件、复杂公式和图表仍可能需要额外检查。

保存的 HTML 导读可以离线打开和分享。继续生成讲解或进行教学,则需要你的 Agent 和相应的论文材料。

先保持正文阅读连贯,需要核查时再展开原文位置和摘录。证据入口帮助定位,不能替代对原文上下文的判断。

带一篇你正在读的论文试试

项目已经开源:Kstheme/PaperUnfold。

在目标项目目录安装两个 Skill,以 Codex 为例:

powershell 复制代码
npx skills add Kstheme/PaperUnfold --skill paper-guide paper-tutor --agent codex --copy --yes

如果要读取 PDF,再安装提取依赖:

powershell 复制代码
python -m pip install -r .agents/skills/paper-guide/requirements.txt

然后在 Agent 对话里输入:

text 复制代码
读取 .agents/skills/paper-guide/SKILL.md 并按其执行。
用中文解读 inputs/paper.pdf,讲清核心机制或论证、可视化结构、关键证据和局限。
将 HTML 导读保存到 outputs/guide.html。

选中一个难点后,可以继续:

text 复制代码
读取 .agents/skills/paper-tutor/SKILL.md 并按其执行。
基于 inputs/paper.pdf,帮助我理解主要证据如何支持论文结论。
每轮推进一个问题,等待我的回答后继续。

安装需要 Node.js/npm,辅助工具需要 Python 3.10+。目前已验证的是 Windows 上 Codex 桌面的显式调用;其他 Agent 和平台的兼容性还需要进一步验证。

你也可以先看仓库里的 导读示例及来源说明,感受它怎样组织机制、证据和结论。

如果觉得这个方向有用,欢迎给项目一个 Star。更欢迎带着具体论文来提 Issue:指出哪一步讲不清、哪张图缺关系、哪条证据需要核查。这些反馈会直接帮助改进阅读体验。

读论文时,最卡住你的,是公式、方法流程,还是实验结论?

相关推荐
EatFan1 小时前
MCP 从概念到落地:Java(Spring AI Alibaba)与 .NET 双栈接入实操对比
java·人工智能·后端·spring·.net·java后端·mcp
ZzT1 小时前
Agent-Reach 是什么:一句话让 AI agent 读推特、Reddit、B 站和小红书
人工智能·ai编程·claude
aixingkong9211 小时前
Agentic AI时代的处理器算力需求和Nvidia、ARM、AMD等大厂的回答
arm开发·人工智能
why-geo1 小时前
从“会聊天”到“能办事”:Meta Muse与国内个人AI智能体的竞速赛
大数据·人工智能
秦先生在广东2 小时前
重构开发团队:深度解析 Agency Agents 多智能体协作系统的架构与落地
人工智能
howdoyoudo2026062 小时前
当新案例冲击旧框架:分类系统的宿命与修正路径
大数据·网络·数据库·人工智能·安全·ai·分类
秦先生在广东2 小时前
Agency Agents:跨平台 AI 编程智能体生态的架构解析与工程实践
人工智能
袖清暮雨2 小时前
机器学习之逻辑回归
人工智能·机器学习·ai
二川bro2 小时前
Firecracker
人工智能