Claude 已经给文本加水印了吗?真正缺的不是声明,而是逐模型状态

Anthropic 已经公开确认:支持标记的 Claude 模型会把不可见水印嵌入生成文本。这个变化覆盖 Claude API、Claude、Claude Code、Claude Cowork、Claude Tag,以及 AWS、Google Cloud 和 Microsoft Foundry 等入口。
如果只读到这里,很容易把结论写成"Claude 现在生成的文本都有水印"。但官方页面真正使用的是另一个主语:supported Claude models,支持标记的 Claude 模型。
这个限定词决定了工程判断能不能成立。
截至 2026 年 8 月 26 日,Anthropic 公开的主力阵容是 Fable 5、Opus 5、Sonnet 5 和 Haiku 4.5。官方模型页显示,它们分别发布于 2026 年 6 月 9 日、7 月 24 日、6 月 30 日和 2025 年 10 月 15 日,全都早于 2026 年 8 月 2 日。
而 Anthropic 对 8 月 2 日的承诺是:此后在欧盟发布的新模型从发布日起支持标记;此前发布的旧模型仍在逐步加入支持。帮助页没有逐模型完成清单,模型目录里也没有 watermark_supported 一类可查询字段。
所以,当前最准确的答案不是简单的"有"或"没有":
Claude 文本水印已经进入正式产品制度,但现有主力模型的逐项覆盖状态仍无法从公开资料审计。
一份声明里其实有三种状态

第一种状态是制度已经启动。
Anthropic 已签署欧盟《AI 生成内容透明度实践准则》,并明确了新模型发布日期、产品入口、云渠道和全球适用范围。这不是学术研究方向,也不是一句"未来可能支持"的路线图,而是已经对外公布的产品与合规承诺。
第二种状态是某个模型已经支持。
官方把 2026 年 8 月 2 日作为分界:此后发布的新模型应从第一天支持;此前的模型进入过渡补齐。要判断一个具体 API 请求,至少需要模型 ID 和该模型的支持状态。现在后一个字段并未公开。
第三种状态是某段文本能够被可靠检测。
即使模型已经支持,也不能保证任意片段都能得到可靠结果。Anthropic 明确列出了短文本、重度编辑、释义、后续外部翻译、与其他内容混写等失效情形。Claude 自己生成的翻译会带水印,因为译文中的词仍由 Claude 选择;已有文本再交给其他流程翻译,则可能破坏原信号。公开检测 API、阈值、语言覆盖和误报率仍未发布。
把这三种状态压成一个布尔值,就会产生两种相反的误判:一边把所有 Claude 输出都标成"已检测";另一边因为没有公众检测器,就说 Anthropic 根本没有部署水印。两者都超出了证据。
覆盖入口,不等于覆盖所有模型



Anthropic 的页面确认水印位于模型层。只要底层模型已经支持,换成 Claude Code、API 或云平台,并不会因为产品表面变化而自动失去文本标记。
这个设计解决的是入口一致性,却没有解决模型迁移透明度。
假设一个团队在 Claude Code 和自建 API 服务中使用相同的 Opus 5。模型层设计意味着两条路径原则上遵循同一标记能力;但在 Anthropic 公布 Opus 5 的支持状态之前,团队仍不能把"原则上覆盖"写成"当前每次输出均已带标"。
文件还要再分一层。Anthropic 对文本使用嵌入水印,对 .svg、.png、.jpg 等支持文件使用 C2PA 签名来源元数据。文本水印随复制粘贴移动,文件元数据可能在截图、转码或重新保存时丢失。它们是互补信号,不是同一个开关。
算法族已经公开,检测接口还没有


8 月 14 日,Anthropic 进一步说明 Claude 使用的是 Google DeepMind SynthID-Text 方法的一个版本。它不是向文本塞入零宽字符,也不是额外生成一段隐藏 token。
模型生成下一个词时,通常会在多个同样合理的候选中做随机选择。水印利用密钥和前文词元改变这部分随机性的来源,让一长串选择形成可核对的统计模式。持有密钥的一方可以判断这段文本与 Claude 按该密钥生成时的选择是否一致,并给出 Claude 参与写作的可能性。
这个机制也解释了为什么事实密集文本、校对和代码更难检测:正确候选越少,水印可以介入的低风险选择越少。代码注释可能有选择空间,但精确语法、常量和固定答案不应为了水印改变。
已公开的是算法族与基本机制,尚未公开的是 Claude 的精确实现、密钥设计、检测阈值、语言覆盖和误报漏报数据。Anthropic 只表示将很快提供检测 API,不能把"soon"写成已经可调用。
检出水印,也不能证明 Claude 写了整篇内容


官方对检测结果的表述非常克制:找到支持的 Claude 标记,说明内容可能经过 Claude 处理。
"经过处理"可以是生成,也可以是校对、翻译、摘要或格式转换。原始观点和数据可能来自人类或其他来源;标记后的内容也可能继续被摘录、修改和混写。
因此,检测结果不能独自回答以下问题:
- 谁是作者;
- Claude 生成了全文还是只修改了局部;
- 内容是否真实;
- 内容是否侵权或作弊;
- 检测后的文本是否仍保持原始版本。
反过来也一样:没有检测到标记,不能证明内容由人撰写。它可能来自尚未支持标记的旧模型,也可能太短,或者已经经过翻译、释义和混写。
来源信号很有价值,但它不是作者身份证,也不是事实核验器。
现在能落地的不是"水印裁决",而是请求证据

在公开模型矩阵和检测文档出现之前,开发团队不必停下来等待,但应该把水印从自动裁决条件降级为辅助来源信号。
每次进入生产内容链时,至少保存:
| 记录项 | 现在为什么需要 |
|---|---|
| 精确模型 ID 或固定快照 | 判断请求属于哪个模型,而不是只写"Claude" |
| 请求与响应时间 | 对齐未来公布的支持起点和模型迁移时间 |
| 使用入口与云渠道 | 区分模型层文本水印与平台文件元数据能力 |
| 受控原文或可验证日志,以及对应哈希 | 在原文仍可取回、日志可信时校验版本一致性;哈希单独不能证明调用来源或时间 |
| 人工编辑与外部来源记录 | 解释最终内容由谁贡献、改了什么,补足水印无法证明的作者关系 |
这套记录不能替代将来的官方检测器,却能回答更实际的问题:团队当时调用了什么、收到什么、后来改了什么。
等 Anthropic 发布逐模型状态和检测接口后,再增加检测结果、工具版本、阈值、置信度和人工复核。不要在此之前接入第三方"Claude 水印扫描器"做自动处罚,也不要从奇怪空格、常见句式或 thinking.signature 推断来源。
事实边界表

| 可以确认 | 当前仍未知 | 不能据此推出 |
|---|---|---|
| Anthropic 已建立 Claude 机器可读标记制度 | 四个当前主力模型分别何时完成支持 | 所有 Claude 历史与当前输出均有可检测水印 |
| 2026-08-02 后发布的新模型应从发布日起支持 | 精确实现、密钥设计、阈值、误报率和语言覆盖 | 使用零宽字符,或与 Google 服务端实现完全相同 |
Claude 使用 SynthID-Text 方法的一个版本,不增加隐藏字符或额外 token |
公共检测 API 的确切开放时间 | 已经可以用公开 API 验证任意 Claude 文本 |
| 支持模型跨 Claude API、Code 和主要云入口适用 | 代码、严格 JSON、短文本的实际检测表现 | thinking.signature 就是最终文本水印 |
| 文本水印和文件 C2PA 是两条互补信号 | 公共检测器/API 的开放时间和数据政策 | 检出即可证明作者、真实性、作弊或版权归属 |
| 检出只说明内容可能经过 Claude 处理 | 某段现有文本是否可被可靠检测 | 未检出即可证明是人写的 |
Anthropic 的变化是真实的:

但真正成熟的工程结论也必须保留那个限定词------"支持模型"。在逐模型状态、检测文档和性能数据公开之前,最可靠的做法是保存请求证据与编辑记录,把水印当辅助来源信号,而不是把一项仍缺少可审计接口的能力升级成自动裁决。
主要来源
- Anthropic 帮助页:How Claude marks AI-generated content(2026-08-26 检查) support.claude.com/en/articles...
- Anthropic 方法说明:How Claude's text watermarking works(2026-08-26 检查) www.anthropic.com/news/claude...
- Claude Models overview 与四个当前模型详情页(2026-08-26 检查)
- 欧盟委员会:Code of Practice on Transparency of AI-generated Content(2026-08-26 检查) digital-strategy.ec.europa.eu/en/policies...