
Anthropic 于 2026 年 8 月 14 日公布,未来 Claude 模型生成的文字会加入水印,让检测者可以估计 Claude 是否曾参与一段内容。Anthropic 表示,这项改动是为了配合 EU AI Act 对 AI 生成内容标记的要求,并计划在全球推出。重点不是在文字上加一个读者看得到的标签,而是在生成过程中留下可用密钥检查的统计模式。
方法利用的是模型在低风险选字上的随机选择。当一句话有两个都合理的词,水印机制会用密钥和前文决定随机性的来源,让一连串选字带有可检测的模式。文字本身不会增加字符,没有隐藏字符,也不会把水印直接显示给读者。这种设计与图片上的可见标志不同,检测需要知道相应的 key 和足够长的文字样本。
Anthropic 表示水印不会实际改变 Claude 输出的质量、内容或可读性,并引用自己的测试和 Google DeepMind 的 SynthID-Text 研究作为支持。这些是供应商和相关研究方的结果,不能直接当成所有模型、语言和工作流的独立保证。对于企业而言,更重要的是要在自己的模型版本、提示词、语言和输出长度上测试误判及漏判。
水印的能力边界也很清楚。它只能回答「这段文字有多大可能曾由 Claude 写出或处理」,不能证明文字一定由 AI 创作,也不能判断是否由另一个模型生成。短文字的选字太少,检测信心会较弱;文字越长,统计证据通常越多。如果 Claude 只是替人校对少量标点或语法,能够承载水印的词语也可能不足。
代码的情况更特别。当输出必须精确,例如算式结果或不能改变的语法,模型没有多个同样合理的选项,水印就不会刻意改变选择。Anthropic 认为代码通常比一般散文含有更少水印;不过代码注释或其他有自由表达空间的文字仍可能留下模式。这使水印更像来源线索,而不是完整的内容分类器。
对于用户来说,Anthropic 表示水印不需要额外 token,对速度和价格的影响可以忽略,也不会包含个人、组织或对话身份信息。Anthropic 计划稍后提供水印 detection API;对于支持的图片、文档或 SVG,则会在 metadata 附加 C2PA content credential,表示 Claude 曾参与制作或处理。文字水印和 C2PA 都是来源讯号,但不应被解读为作者身份或责任归属。
这次更新把 AI 内容治理由「相信某个 detector 的风格判断」推向「由模型供应商提供可验证的生成线索」。企业若要采用,应把水印检测当成内容 provenance 流程的一部分,与人工审核、版本记录、文档来源、权限和保留政策一起设计。Anthropic 的方案仍有短文本、改写、翻译和跨模型内容等限制,因此最可靠的用途是增加证据,而不是单独作出封禁、追责或作者判定。



