AI网文写作实验笔记(十三):系列总结——12 篇实验、8 条核心结论,把“AI 写小说“每一步拆开验证

文章目录

    • 为什么写这一篇
    • 30秒极简版
    • [一、 这条路的起点:为什么 AI 写小说"看着对、读着假"](#一、 这条路的起点:为什么 AI 写小说"看着对、读着假")
    • [二、 中段:真正管用的三样------蓝图、校准、结构](#二、 中段:真正管用的三样——蓝图、校准、结构)
      • [1. 蓝图定"戏"(Part 6-7)](#1. 蓝图定"戏"(Part 6-7))
      • [2. 校准去"味"(Part 5)](#2. 校准去"味"(Part 5))
      • [3. 情绪曲线部分可编程(Part 9-11)](#3. 情绪曲线部分可编程(Part 9-11))
    • [三、 后期:长文的问题不是记忆,是远期资产(Part 12)](#三、 后期:长文的问题不是记忆,是远期资产(Part 12))
    • [四、 收尾实验(人参与梯度):人到底该在哪介入?](#四、 收尾实验(人参与梯度):人到底该在哪介入?)
    • [五、 8 条核心结论覆盖情况(这些是本系列的 8 个实验主题)](#五、 8 条核心结论覆盖情况(这些是本系列的 8 个实验主题))
    • [六、 最终结论:AI 写网文,怎么做](#六、 最终结论:AI 写网文,怎么做)
    • [七、 没做完的、和可以继续的](#七、 没做完的、和可以继续的)
    • [八、 数据与样本](#八、 数据与样本)
    • [九、 系列索引](#九、 系列索引)
    • [十、 一句话总结](#十、 一句话总结)

为什么写这一篇

这是系列的最后一篇。前面 12 篇做了几十个实验,这篇把它们串起来:我们到底验证了什么、哪些结论稳、哪些还没做、最终怎么用。

没空看完全部 12 篇的话,读这一篇就够------前面是过程,这里是答案。

写给谁: 想一口气看完"AI 写小说到底能不能、怎么才能"的人。


30秒极简版

12 篇实验、几十次测量,把"AI 写小说"拆成 8 条核心结论逐条验证。结论浓缩成几句话:

  • AI 能搭出"戏"------人给蓝图,它就能执行
  • 能部分控制"情绪曲线"------压抑释放、载体能指定;峰值位置只有趋势
  • 但"文风"和"长文伏笔"必须靠人------校准去 AI 味、伏笔要专门管理

工程化的正确答案不是"全自动",是"人给结构、AI 填血肉、校准去味、工具管长线"。


一、 这条路的起点:为什么 AI 写小说"看着对、读着假"

系列一开始(Part 1-4)解决的是最基础的问题:AI 写网文到底行不行?结论是**"行,但很多人卡在错误的地方"**------问题往往不在提示词本身,而在一些"大家以为的关键"上:

你以为的关键 实测结论
提示词写得更长更细 约束越多,事实错误越多(Part 3)
多轮追问出奇迹 追 1 轮就够,3 轮白花钱(Part 8)
禁词表去 AI 味 禁词是摆设(Part 3),换词不换味(Part 10)

这四篇的价值在"证伪":把"提示词玄学"里大家最信的误区,用实验一个个证伪,留下的才是真正管用的。


二、 中段:真正管用的三样------蓝图、校准、结构

从 Part 5 开始,系列进入"什么真正管用"的建设阶段,结论可以归成三样:

1. 蓝图定"戏"(Part 6-7)

核心发现:约束管不住剧情设计,蓝图管得住。

  • Part 6:只有写作约束 + 剧本格式、没有剧情蓝图时,提示词救不了剧情(有戏四要素 0/20 达标)
  • Part 7:人先填"戏蓝图"(谁打谁/谁失控/怎么绝杀/什么反转),AI 照蓝图执行------从 0/20 到 20/20 达标

一句话:戏是设计出来的,不是提示词挤出来的。 人定结构,AI 照做。

2. 校准去"味"(Part 5)

核心发现:AI 腔是模型思维烙印,写的时候拦不住,写完用独立模型校准才能洗掉。

  • 标杆放生成端无效(盲测全不及格)
  • 独立强模型写后校准,比喻密度 7.2→0.2/千字(降 97%)
  • 但校准也会带新 AI 味,需要"白描铁律"压住

一句话:文风是最后一公里,得靠"独立模型 + 白描铁律"的事后校准,不是 prompt 能解决的。

3. 情绪曲线部分可编程(Part 9-11)

核心发现:AI 的情绪表达可以测量、部分可以控制。

  • Part 9:词表扫描测情绪方向是反的(AI 情绪词 11 倍反而更假),要用 LLM 语义标注(强度+载体)
  • Part 10:AI 载体能力不均------对话相对最不烂,一离开对话就 AI 味
  • Part 11:压抑释放能控(强度差 1.0→1.7,统计显著)、峰值位置只有趋势(三组不显著),载体能指定

一句话:情绪曲线的"骨架"部分可编程(载体、压抑释放可靠;峰值位置只有趋势),"血肉"(压得多深)还得靠校准。


三、 后期:长文的问题不是记忆,是远期资产(Part 12)

测短场景看不到的问题,在一本完整写完的 80 章 AI 长书里暴露了:

  • 短期记忆强:主角当前状态逐章连贯、角色一致性零 OOC
  • 长期记忆弱:69 条伏笔只收 35%,书完结了还大量烂尾

而且挖出三条反直觉规则(不是"记忆要管理"这种空话,是可判定的具体规则):

  1. 伏笔标"接近兑现"后 0% 真兑现(状态机缺限期兑现)
  2. 全书 60-75% 位置埋的伏笔回收率最低(14%)
  3. 转折章一次埋 3-7 条容易烂尾

一句话:AI 长文的问题不是"记不住",是"远期资产没有专门管理"------伏笔要限期兑现、埋设要守位置、单章要限数量。


四、 收尾实验(人参与梯度):人到底该在哪介入?

最后一个实验测"人参与梯度"------人介入程度从 0 到全面:

人介入 阅读意愿 AI腔/千字
A 全AI 0 3.5 1.4
B 人写大纲 大纲 4.0 0.0
C 逐章审校 大纲+审校 4.2 2.2
D 传统分工 详细大纲(对照组) 4.0 0.6

(B 和 D 都是"人写大纲 + AI 正文",区别是:B 用系列验证过的"戏蓝图"作骨架,D 是传统写法,只给大纲、不给蓝图。主线是 B、D 都对比 A(全自动)和 C(工程化)------看"人介入多少"和"怎么介入"各值不值。)

三条结论:

  1. 人参与值得,但边际收益递减(3.5→4.2,从 0 到参与提升最大)
  2. 人写大纲是性价比最高的介入点(AI 腔 0.0 最低、意愿 4.0)
  3. 逐章审校提意愿最多但引入新 AI 腔------审查模型会把套话通过修改意见带进正文,需要"去套话"约束

一句话:工程化的正确答案不是"全自动"或"全人工",是"人写大纲 + AI 填血肉 + 校准去味 + 工具管长线"。


五、 8 条核心结论覆盖情况(这些是本系列的 8 个实验主题)

主题 内容 结论 出处
幻觉防控 五规则三防线 规则冗余,自检+修复有效 Part 4
上下文 正文脱钩 摘要+上一章最优 Part 2
认知负荷 约束数量 约束越多越差,≤6条 Part 3
百万字不崩 记忆/DNA/伏笔 短期强长期弱,伏笔需专门管理 Part 12
文风 标杆+校准 生成端无效,写后独立校准有效 Part 5
情绪曲线 蓝图+追问 蓝图定戏、追问1轮够、情绪曲线部分可编程 Part 7/8/11
SOP边界 工程化程度 人写大纲性价比最高 人参与梯度实验
工程化认知 工程化>单prompt 贯穿全系列 全部

这 8 条核心结论全部有实测数据撑着。

关键数据速查(一表看完系列最有用的数字):

环节 关键数据
约束数量 ≤6 条;再多,事实错误不降反升(Part 3)
剧情蓝图 有戏四要素 0/20 → 20/20(Part 7)
文风校准 比喻密度 7.2→0.2/千字,降 97%(Part 5)
追问轮数 1 轮就够,3 轮白花钱(Part 8)
情绪测量 AI 情绪词是真人 11 倍,方向是反的(Part 9)
载体蓝图 遵守率 80%,直述情绪词 3%→15%(Part 10)
情绪曲线 压抑释放强度差 1.0→1.7 显著;峰值位置只有趋势(Part 11)
长文伏笔 69 条只收 35%;60-75% 进度处埋的回收率最低 14%(Part 12)
人参与梯度 阅读意愿 3.5→4.2;人写大纲 AI 腔降到 0.0(收尾实验)

六、 最终结论:AI 写网文,怎么做

把系列所有结论收成一份"正稿流程":

text 复制代码
【人】写戏蓝图(谁打谁/谁失控/怎么绝杀/什么反转)
   ↓
【人】写大纲(关键节点 + 情绪曲线 + 载体序列)   ← 性价比最高,AI腔降为0
   ↓
【AI】照蓝图+大纲生成初稿(doubao)
   ↓
【独立模型】校准去 AI 味(deepseek + 白描铁律)   ← 比喻密度 -97%
   ↓
【AI】追问优化 1 轮(别追 3 轮,白花钱)
   ↓
【工具】管长线(伏笔限期兑现/埋设守位置/单章限数量)
   ↓
【人】终审剧情

(注:人参与梯度实验里"逐章审校"提意愿最多(4.2),但它会引入审查模型的套话(AI 腔 2.2),所以正稿流程用的是"校准去味"而非"逐章审校"------校准只改文风不查剧情,副作用更小。若要加剧情审校,需配"去套话"约束。)


七、 没做完的、和可以继续的

诚实交代还没验证的:

  1. 跨题材、跨模型:全部实验用攻心戏 + doubao/deepseek;打斗/权谋/感情戏、Claude/GPT 都没验证
  2. 真人读者大规模盲评:只在早期的一个实验里做过一次(结论不乐观),后续评估以 LLM 双评者为主
  3. "百万字不崩"那条(记忆管理):用的是"千金归来"那一套工具做观测,不是我们自己搭的对照实验
  4. 样本量:多数实验 20 篇/组,方向可靠、精度有限

可以继续的方向:把上面的"正稿流程"真正跑完一本 30 万字以上的书,看它能不能在真实长篇里稳住------这是最有价值的下一个实验,但它需要时间。


八、 数据与样本

全部实验数据、脚本、报告都散落在各篇的"数据与样本"一节------评论区或私信找作者要,注明要哪一篇的。


九、 系列索引

主题 核心结论
Part 1 实验框架 为什么"改一百次提示词"没用
Part 2 上下文量 摘要+上一章最优
Part 3 约束数量 约束越多事实错误越多
Part 4 幻觉防控 规则冗余,自检修复有效
Part 5 文风标杆 生成端无效,写后独立校准有效
Part 6 剧情设计上限 无蓝图时提示词救不了剧情
Part 7 剧情蓝图 蓝图定戏,0/20→20/20
Part 8 追问优化 1轮就够,3轮白花钱
Part 9 情绪测量 词表扫描方向反,用LLM语义标注
Part 10 载体蓝图 AI载体能力不均,对话相对最不烂
Part 11 情绪曲线 压抑释放/载体可编程,峰值位置只有趋势
Part 12 长文伏笔 短期强长期弱,伏笔需专门管理
Part 13 系列总结 本篇

十、 一句话总结

AI 写小说这条路能走通,但关键不在"提示词",在"结构"。人给蓝图和结构(戏蓝图、大纲、情绪曲线、伏笔规则),AI 填血肉,独立模型去 AI 味,工具管长线。12 篇实验把这条路每一步都用数据验证过,没有玄学,只有可复现的结论。 系列完结,感谢读到这里的你。


本系列完结。 Part 1-13 全部发布。

相关推荐
2601_9670972217 分钟前
白光干涉仪品牌众多怎么筛选靠谱厂家?选购要点及优可测等品牌参考
人工智能
manongdashu18818 分钟前
本地静态建站工具自带页面自适应功能,良好适配手机移动端浏览。
经验分享·seo·独立站·静态站·静态网站
zandy101121 分钟前
claude code用不了?国内外AI 编程工具的演进与三类路径选择
人工智能
武汉海翎光电24 分钟前
从零开始了解数据采集——工业数据采集新趋势:边缘计算与云计算的强强联合
人工智能·云计算·边缘计算
AI产品测评官28 分钟前
AI智能体在招聘场景的工程实践:屏幕语义理解与风控规避
人工智能·求职招聘
TechEdu20260630 分钟前
[人工智能]GPT(OpenAI):模型体系、智能体与企业工程实践
人工智能·ai
大力财经31 分钟前
抖音生活服务推动直播合规经营,消费者人脸保护功能覆盖超10万个直播间
大数据·人工智能·生活
M78佐菲33 分钟前
Linux多线程:创建、回收与互斥同步
linux·笔记·学习·算法
liukuang11041 分钟前
从匹配到交付,BOSS直聘AI招聘打开增长空间
人工智能