
Anthropic 在 2026 年 8 月 14 日公布,未來 Claude 模型生成的文字會加入水印,讓檢測者可以估計 Claude 是否曾參與一段內容。Anthropic 表示,這項改動是為了配合 EU AI Act 對 AI 生成內容標記的要求,並計劃在全球推出。重點不是在文字上加一個讀者看得到的標籤,而是在生成過程中留下可用密鑰檢查的統計模式。
方法利用的是模型在低風險選字上的隨機選擇。當一句話有兩個都合理的詞,水印機制會用密鑰和前文決定隨機性的來源,讓一連串選字帶有可檢測的模式。文字本身不會增加字元,沒有隱藏字符,也不會把水印直接顯示給讀者。這種設計與圖片上的可見標誌不同,檢測需要知道相應的 key 和足夠長的文字樣本。
Anthropic 表示水印不會實際改變 Claude 輸出的質量、內容或可讀性,並引用自己的測試和 Google DeepMind 的 SynthID-Text 研究作為支持。這些是供應商和相關研究方的結果,不能直接當成所有模型、語言和工作流的獨立保證。對企業而言,更重要的是要在自己的模型版本、提示詞、語言和輸出長度上測試誤判及漏判。
水印的能力邊界也很清楚。它只能回答「這段文字有多大可能曾由 Claude 寫出或處理」,不能證明文字一定由 AI 創作,也不能判斷是否由另一個模型生成。短文字的選字太少,檢測信心會較弱;文字越長,統計證據通常越多。若 Claude 只是替人校對少量標點或語法,能夠承載水印的字詞也可能不足。
程式碼的情況更特別。當輸出必須精準,例如算式結果或不能改變的語法,模型沒有多個同樣合理的選項,水印就不會刻意改動選擇。Anthropic 認為程式碼通常比一般散文含有更少水印;不過程式碼註解或其他有自由表達空間的文字仍可能留下模式。這使水印更像來源線索,而不是完整的內容分類器。
對使用者來說,Anthropic 表示水印不需要額外 token,對速度和價格的影響可以忽略,也不會包含個人、組織或對話身份資訊。Anthropic 計劃稍後提供水印 detection API;對於支援的圖片、文件或 SVG,則會在 metadata 附加 C2PA content credential,表示 Claude 曾參與製作或處理。文字水印和 C2PA 都是來源訊號,但不應被解讀為作者身份或責任歸屬。
這次更新把 AI 內容治理由「相信某個 detector 的風格判斷」推向「由模型供應商提供可驗證的生成線索」。企業若要採用,應把水印檢測當成內容 provenance 流程的一部分,與人工審核、版本紀錄、文件來源、權限和保留政策一起設計。Anthropic 的方案仍有短文本、改寫、翻譯和跨模型內容等限制,因此最可靠的用途是增加證據,而不是單獨作出封禁、追責或作者判定。



