AI 味为什么改词改不掉?把 61,608 篇小说拆开之后

AI 味为什么改词改不掉?把 61,608 篇小说拆开之后

先做一个思想实验。

找一段你认定为 AI 写的文字。把里面的"值得注意的是""综上所述"全部删掉,把三点式排比打散,换掉那些过度礼貌的收尾句。再读一遍。

你大概还是能认出来。

这种"说不上哪里不对,但就是不对"的直觉,这两周在社区里被推到了台面上。Hacker News 把"不要发布由 AI 生成或 AI 编辑过的评论"写进了官方指南(HN Guidelines · Generated),相关讨论帖拿到 4229 分、1628 条评论(讨论帖)。评论区问得最多的还是同一句:怎么执行?谁来验证?

也就是说,现在判案靠的仍然是人的感觉。而感觉恰好是可以被量化的一件东西。

先把"AI 味"从词换到结构

今年 4 月的一篇论文给出了一个相当干净的答案。

StoryScope(arXiv:2604.03136,Jenna Russell 等)建了一个 10,272 条写作提示的平行语料:每条提示由一位人类作者和五个前沿模型各写一篇,合计 61,608 篇故事,每篇约 5,000 词,每篇抽出 304 个特征。

这套特征的设计是整个工作的关键:它刻意不看风格。不用词汇、不用句式、不用标点,只取 discourse level 的叙事选择,比如角色的能动性、时间线是否连续。

结果是:只用叙事特征,人 vs AI 的二分类做到 macro-F1 93.2%,六类作者归属 68.4%,并且保住了"包含风格线索的模型"97% 以上的性能。换句话说,风格线索几乎是冗余的。30 个核心特征就能撑起大部分信号。

论文点名的几个特征,读起来像是每个用过模型写作的人都见过的清单:

  • 主题被反复解释,而不是被演示出来;
  • 情节偏好单一轨道,因果链条过于干净;
  • 情绪只被写成身体感受;
  • 缺少现实世界的具体指涉;
  • 时间线严格线性;
  • 结局靠主角的成长与接纳来收束。

最有说服力的是 LAMP 那组对照。研究者请人类编辑把故事表面风格全文重写一遍------也就是大多数人理解的"去 AI 味"。检测率从 95.5% 只掉到 93.9%。

掉了一个多点。

所以"改词"错在哪一层

不是没用,是作用在错误的层。

按上面那组数字,表面风格确实带着一点信息------95.5% 到 93.9% 那 1.6 个点就是它。但它不是主要矛盾。这就解释了为什么很多人改了半天词,读起来还是"AI 味很重":改的是最薄的那一层。

GitHub 上最近涨得最快的一批工具,正好在做这件事的分层。De-AI 写作技能 sepia(仓库,2,544 star,MIT)把修订拆成三段:第一段动叙事架构(停止解释主题、放松因果链、把关键揭示后置、混合情绪模式、给真实事物命名),第二段动话语流(去掉模板化的"段落---提问"序列、修中段塌陷、让节奏和位置变化起来),第三段才是传统的表面风格。

更有意思的是它对"量化"的处理方式。

在它能被测量的句法指标里,只有一项被多项研究一致确认:句长分布的离散程度。人写的东西在同一个段落内部句长起伏更大,英文如此,中文也如此;而平均句长、标点数量、段落长度这些看起来很"客观"的指标,在测量里方向互相矛盾,因此不能当信号使用。中文这一支另用 HC3 语料(2023)做了单独校准。

然后是整份文档里最反直觉的一条约束:向人类的分布校准,不要把 AI 的特征反过来拉满。

人类的分布落在中间值上。如果一条条规则全部拉到底,得到的不是"人味",而是一个新的、同样容易被识别的指纹。所以 sepia 每篇只挑 3 到 5 个动作执行,剩下的留松。

同一套逻辑,在 agent 干活时也成立

这套"表面 vs 结构"的区分不只适用于文字。

判断一段文字好不好认,是看结构特征;判断一个 agent 有没有真的把活干完,是看有没有可执行的验收。GitHub 上另一个同期热门项目 unlazy(仓库,3,231 star,MIT)把后者做成了一份"验收账本"。

它的机制很朴素:动手之前先写出 GATES.md,每条 gate 对应一个可观测的结果,并配一条 CHECK 命令和一条 EXPECT 期望字符串。只有进程退出码为 0、且 EXPECT 能在合并输出里匹配上,这条 gate 才算 met。自动证据里带一段基于 CHECK、EXPECT 和 CWD 计算出的 SHA-256 定义摘要------防止账本被改动之后,旧证据还被算作有效。返工回来要跑 --reverify 重新执行,不能拿只读的 --status 冒充重跑。

这套纪律不是凭空加的。它引用的研究里有两组数字很扎眼:Quantifying Laziness 报告即使把提示写得非常细,被测模型依然只能做到部分遵从、并提前截断;SlopCodeBench 报告没有一个被测 agent 端到端解完题目,表现最好的那个只通过了 14.8% 的 checkpoint。

把这两件事放在一起看,结论其实一样:模型说"我写好了"和"它写好了",模型说"我做完了"和"它做完了",是两件不同的事。自信的语气、工整的格式,都是表面信号。

今日观点

这两个方向看起来不相关,做的事却是同一件:把"感觉"换成"可以从外部独立重跑的观测"。

判断一篇文章像不像 AI 写的,靠的是它的因果结构、情绪写法、结局方式;判断一次任务是否完成,靠的是一个退出码和一个能被重放的断言。都不是靠被评价者的自述。

对做 agent 的人,这件事落到两个具体动作上。

第一,把验收条件在动手之前写成可执行的断言,而不是在报告里补一段自我评价。

第二,把"风格问题"当作分布校准问题处理------先看人类分布的方差在哪里,再决定要不要动,而不是把每个特征都拉满。

AI 味的根源,其实是默认输出分布太窄。不管是文字,还是"完成度"。


参考资料

相关推荐
行走的领路人43 分钟前
FlyEnv 本地开发环境与 AI 协同能力深度评测
人工智能
汇智信科1 小时前
基于 Jmis 框架的制度与流程管控系统设计与应用|项目全生命周期管理
大数据·人工智能·微服务·云原生·汇智信科
王红臣同学1 小时前
在 Windows 上复现 Microduck 机器鸭仿真
人工智能·ai
AI人工智能集结号1 小时前
AI推荐优化服务有哪些?不同服务类型适合什么需求?
人工智能
IT_陈寒1 小时前
Vue的computed属性竟然坑了我一把
前端·人工智能·后端
DO_Community1 小时前
Omarchy 将研发基础设施迁移至 DigitalOcean 云平台
linux·人工智能·llm·agent·omarchy
威斯软科的老司机1 小时前
通俗讲解 CNN 图像识别、向量 Embedding、Softmax 概率计算这三块的简化原理
前端·人工智能·ui·数字孪生
AIGC小尼1 小时前
最新万相 Wan Animate ComfyUI 整合包详解|低显存 8G 可用、动作迁移 + 角色替换全流程本地化部署
人工智能·comfyui·ai漫剧
新知图书1 小时前
第10章 大模型开发框架
人工智能·智能体