论文撰写SKILLS实测三|PaperSpine:每个阶段都是带硬关卡的 gate,审计能直接 BLOCK 你

一句话定位:一个"研究写作工作流"而非"润色补丁"的端到端论文编排器 ------它先逼你确认研究动机,再逐行设计论文,最后才动笔;全程由确定性 Python 护栏脚本把守,缺一个产物就直接判 FAIL。

本篇把它的两个守卫脚本真跑了一遍 ,结果很有戏剧性:在一个空输出目录上,完整性审计直接给出 LaTeX gate: BLOCKED + 13 条 finding。这恰恰是它"反偷懒"设计的最佳佐证。


1. 它是什么

  • 来源 :GitHub WUBING2023/paper-spine,当前 V4 单一编排器 paper-spine + 12 个分支技能(-intake / -research / -citation / -rewrite / -build / -latex / -translate / -humanize / -audit / -update / -ui / -citation)。本机副本在 .trae-cn/skills/paper-spine/paper-spine-*
  • 核心三原则(硬关卡)
    • Contribution-First:先定贡献,再写一切;
    • Results-as-Validation:用结果验证,而非空谈;
    • Reviewer-Aware:从审稿人视角反向设计。
  • 形态 :大量确定性 Python 护栏脚本artifact_check.py / integrity_audit.py / humanize_check.py / material_inventory.py ...),这是它和前两个"纯提示词"技能最大的工程差异。

它的 Operating Principle 写得很硬:"PaperSpine 是研究写作工作流,不是润色补丁。绝不为这篇论文编造数据、指标、p 值、数据集、引用、图或实验结论。"


2. 核心架构:12 阶段编排

图3 PaperSpine:12 阶段编排(每阶段都是带硬关卡的 gate) 01 Intake 02 Research 03 Citation 04 Motivation (BLOCKED) 05 Humanize 06 Writing 07 Audit 08 LaTeX 09 Word 10 Translate 11 Update 12 Re-audit

关键不在"12 步",而在**"没有用户确认的动机(confirmed_motivation.md)就绝不进入写作"**------这是 04 Motivation 那个 BLOCKED 关卡的意义。


3. 怎么安装

PaperSpine 作为一组 Agent Skill 安装,本机已放好:

text 复制代码
D:/1-document/16-AI-writer/.trae-cn/skills/
├── paper-spine/        # 主编排器(SKILL.md + references + scripts)
├── paper-spine-intake/ -research/ -citation/ -rewrite/ -build/
├── paper-spine-latex/  -translate/ -humanize/ -audit/ -update/ -ui/ -citation/
└── ...(共 12 个分支技能)

让宿主识别:

bash 复制代码
# 以 Claude Code 为例,把所有 paper-spine* 软链进项目 skills 目录
for d in D:/1-document/16-AI-writer/.trae-cn/skills/paper-spine*; do
  name=$(basename "$d")
  ln -s "$d" my-paper/.claude/skills/"$name"
done

它的"非协商路由"第一步就是:配置缺失时,先跑终端向导 paper-spine-intake(或 /paperspine 入口),不要让用户手搓 JSON 。配置存为 paper_rewriting_output/paper_spine_config.json

一个最小配置示例(本机实测用的):

json 复制代码
{
  "workflow": "rewrite_existing",
  "scene": "journal",
  "tier": "flash",
  "output_language": "en",
  "target_name": "Multimodal LLM for Rare Disease Diagnosis",
  "draft_path": "draft.md",
  "reference_mode": "local_first",
  "reference_paths": ["."],
  "citation_target_count": 20
}

4. 真实测试(深度版):空目录判死 + 把没用过的守卫脚本全跑一遍

先用空目录演示"最严一档",再把 material_inventory / intake_wizard / humanize_check / structured_review 四个之前没用过的 CLI 真正跑起来,看它们在真实输入下的产出。

4.1 空目录直接判 FAIL / BLOCKED(最严基线)

这是本篇最精彩的部分------不靠嘴说"它很严",而是真跑脚本看它怎么拦你

4.1 artifact_check.py --help(确认脚本可独立运行)

text 复制代码
usage: artifact_check.py [-h]
                         [--workflow {rewrite_existing,build_from_materials}]
                         [--tier {flash,pro}]
                         [--pdf-policy {auto,always,never}]
                         [--word-policy {auto,always,never}] [--markdown]
                         [--json] [--write]
                         [output_dir]

Check PaperSpine artifacts.

脚本完整可跑,参数清晰:能按 workflow/tier 检查产物清单,可选 markdown/json 输出、写回 artifact_check.md

4.2 对一个空输出目录跑 artifact_check.py

我在 paper_rewriting_output/(只放了一个 config.json,没有任何写作产物)上跑了检查,真实输出:

text 复制代码
# PaperSpine Artifact Check
- Output directory: `...\paper_rewriting_output`
- Workflow: `rewrite_existing`
- Tier: `flash`
- TeX engine: `not found`
- Status: FAIL

## Missing
- paper_spine_config.md
- source_map.md
- reference_materials/source_index.md
- research_dossier.md
- exemplar_learning_dossier.md
- style_profile.md
- sota_gap_map.md
- motivation_options_after_research.md
- citation_support_bank.md
- confirmed_motivation.md
- section_blueprints.md
- writing_rationale_matrix.md
- original_logic_map.md
- evidence_bank.md
- rewrite_matrix.md
- logic_transfer_audit.md
- latex_report.md
- final_artifact_manifest.md
- final_paper/main.tex

## Content Issues
- None

实测解读 :一个空目录,脚本毫不留情地列出 19 个缺失产物并判 FAIL。这正是"工作流"而非"补丁"的体现------它把每一篇论文拆成十几个必须产出的中间物(研究档案、范例学习档案、动机、章节蓝图、写作理由矩阵、证据库......),少一个都不让你进 LaTeX 汇编。

4.3 integrity_audit.py(完整性审计,教学式报告)

再跑 integrity_audit.py paper_rewriting_output --markdown --write,真实输出摘要:

text 复制代码
# Integrity Audit
- Total findings: 13
- LaTeX gate: BLOCKED

## Summary
| Dimension        | Status   | Findings |
|------------------|----------|----------|
| Artifact Chain   | BLOCKED  | 10       |
| Reasoning Depth  | BLOCKED  | 1        |
| Evidence Chain   | CLEAN    | 1        |
| Integrity Patterns | WARNINGS | 1       |

## Artifact Chain(节选)
### 🚫 ART-002 --- BLOCKER
**What was found:** Required artifact `research_dossier.md` is missing
**Root cause:** `paper-spine-research` did not produce it --- 要么被跳过,要么静默失败
**Fix:** 回到 `paper-spine-research` 重新生成,不要手写这个文件
**Downstream impact:** 没有 research_dossier.md,下游写作阶段就拿不到输入
**Why this matters:** 每个 PaperSpine 产物都是检查点;缺失通常意味着上游被跳过。修步骤,不是修缺口。

实测解读(这是它最值钱的设计):

  1. LaTeX gate: BLOCKED ------ 在 13 条 finding 清零前,根本不允许编译 PDF。把"质量门"做成了可机器判定的硬开关。
  2. 教学式报告 :每条 finding 都带 Root cause / Fix / Downstream impact / Why this matters------它不只告诉你"缺了啥",还告诉你"为什么缺、该回哪步补、不补会怎样"。这是 anti-捷径设计:逼你回到对应分支技能重做,而不是在终稿上打补丁。
  3. Evidence Chain 是 CLEAN 的------因为还没有手写的"假文本"可扫,所以它诚实地标 WARNING 而非编造问题,符合它"绝不伪造"的原则。

4.2 material_inventory:真实材料清点

material_inventory.py 扫描素材目录,按类型(data/pdf/code/word_text)分类并推断角色(draft/material)------对应它"用户素材是这篇论文的权威依据"的原则。我造了一个含 4 个文件的样例目录:

text 复制代码
$ python scripts/material_inventory.py sample_materials --markdown

# Source Inventory
- Materials directory: `sample_materials`
- Files found: 4

| Path | Type | Role Hint | Size Bytes |
|---|---|---|---:|
| `data.csv` | data | material | 41 |
| `notes.md` | word_text | material | 48 |
| `paper.pdf` | pdf | draft | 81 |
| `train.py` | code | material | 35 |

实测解读:类型识别(.csv→data.pdf→pdf.py→code.md→word_text)和角色推断(pdf 判为 draft、其余为 material)都准确------它确实在把"你的素材"结构化,而不是空谈。

4.3 intake_wizard:真实生成配置 + 门控立即响应

intake_wizard.py 支持 --no-interactive 非交互生成配置。生成后立刻重跑 artifact_check

text 复制代码
$ python scripts/intake_wizard.py --output-dir ps_deep --no-interactive \
    --workflow rewrite_existing --scene journal --tier pro --output-language en \
    --target-name "Multimodal LLM for Rare Disease Diagnosis" \
    --materials-dir sample_materials --reference-mode local_first
已写入 ps_deep\paper_spine_config.json
已写入 ps_deep\paper_spine_config.md

$ python scripts/artifact_check.py ps_deep
- Status: FAIL
## Missing
- source_map.md
- research_dossier.md
- ... (共 17 项,比空目录的 19 项少了 paper_spine_config.json / .md 两项)

实测解读:配置向导产出的两个文件立刻被门控识别(缺失项从 19 降到 17)。这不是装饰------它证明"工作流产物"与"门控检查"是同一套契约:向导每写出一样东西,检查器就少报一项。你跑的每一步都在被机器验证。

4.4 humanize_check:真实 AI 文风检测

humanize_check.py 读取 humanize_matrix.md + 手稿(final_paper/*.tex),用多个维度(句子结构、连接词密度、长破折号等)判定是否"AI 味过重"。我故意在样例手稿里放了一行长破折号 ------------

text 复制代码
# Humanize Check Report
- Matrix rows: 5
- Manuscript paragraphs: 4
- Coverage: 125%
- Sentence length stddev: 10.54
- Connector density: 0.0/1k chars
- Status: FAIL

## Findings
- Long dash separators detected (e.g. '------------'). These are a strong AI-generation signal
  --- replace with section headings or blank lines.

实测解读:矩阵本身填得规范(5 行覆盖全部 5 个维度、125% 覆盖率),但手稿里的长破折号被精准抓出并标为强 AI 信号。这正是它"反 AI 味"的硬手段------不靠模型自觉,靠可执行的样式规则。

4.5 structured_review:真实结构化审稿

structured_review.pyfinal_paper/main.tex 抽取章节,生成多角色审稿报告(方法可复现 / 贡献新颖性 / 结构清晰 三个审稿人视角 + 评分量规):

text 复制代码
# Structured Peer Review
- Manuscript: `ps_deep\final_paper\main.tex`
- Sections: 3
- Total findings: 2 (0 critical)

## Methods & Reproducibility Reviewer
### Scoring Rubric (1-5)
- Method description completeness (1=insufficient detail to replicate, 5=fully replicable)
- Assumption justification (1=unstated, 5=explicit with rationale)
- Experimental design (1=flawed, 5=rigorous)
- Limitations acknowledgment (1=none, 5=thorough with impact analysis)

## Contribution & Novelty Reviewer
...

## Structure & Clarity Reviewer
...

实测解读:脚本真实解析了手稿的 3 个 \section,并按三个审稿人视角产出带评分量规的报告。把它接在 integrity_audit 之后,就形成"先卡质量门、再出审稿意见"的完整闭环------这正是它被定位为"重"的原因:每一步都产出可被下一关消费、被机器核验的产物。


5. 特色功能

  1. 确定性护栏脚本artifact_check / integrity_audit / humanize_check / material_inventory 是真正能跑的 Python,把"质量"变成可机器判定的门控,不靠模型自觉。
  2. 写作理由矩阵(writing_rationale_matrix):要求动笔前先填一张"每一段为什么这么写"的表,浅矩阵直接判失败------专治"AI 流水账"。
  3. 动机硬关卡confirmed_motivation.md 不确认,绝不动笔。
  4. 多产物工作流:从研究档案到终稿 LaTeX/Word/中文翻译包,全链路产物化,可审计、可复现。
  5. 反伪造铁律:明确禁止编造数据/指标/p 值/引用/图。

6. 适用场景与局限

维度 说明
✅ 最适合 想要"过程可控、产物可审计"的严肃论文写作;导师/团队要追每一步依据;需要 LaTeX 终稿
⚠️ 局限 产物多、流程重,轻量润色用它杀鸡用牛刀;需要宿主(Claude/Codex/Trae)驱动编排
❌ 不适合 只想"丢一段中文进去吐出英文"的极简需求(那用 nature-skills)

7. 实测结论

PaperSpine 是四个里最"重"也最"严"的一个。它不信任模型的自觉,而是用可执行的 Python 门控 + 教学式审计 把"严谨"固化成流程。对一个空目录它直接 BLOCKED------这看似严厉,实则是它最大的价值:在你浪费时间写下一堆可能逻辑断裂的文字之前,先拦住你

下一篇:④ fund-*(NSFC 基金本子)------ 中文基金写作的专用技能,禁语清单比前三个都硬。

相关推荐
badhope1 小时前
用RAG做了个智能客服,上线第一天就被用户骂了——我的7天实战复盘
人工智能·langchain
dunge20261 小时前
2026年8月更新:ChatGPT与Codex开发实践——从工具使用到AI工程工作流,开发者如何建立长期生产力体系(GPT-5.6技术分享)
人工智能·gpt·chatgpt
硅基流动1 小时前
OPC 南川:超级个体的疯狂探索|开发者说
人工智能
147API1 小时前
AI 图片编辑接口报 400 怎么排查?先读错误体,再查参数、图片与 mask
网络·人工智能
xiaoxiaoxiaolll1 小时前
AI-有限元融合的复合材料多尺度建模与性能
人工智能
zyplayer-doc2 小时前
同一份制度别复制到多个知识库:用zyplayer-doc引用文档解决重复维护
javascript·人工智能·智能手机·开源·ocr
ASKED_20192 小时前
从 Chat Completions 到 Agent Runtime:主流大模型接口协议全景与设计对比
人工智能
站长工具箱2 小时前
讯飞Loomy测评:整合飞书钉钉QQ消息的AI自动办公工具深度体验
人工智能·钉钉·飞书
小刘快学习2 小时前
广告素材生产,直连模型还是走聚合网关
人工智能