Anthropic於周五發布了一篇部落格文章,就其旗下聊天機器人Claude的文本水印
機制回答了若干基本問題:水印究竟如何運作?經過編輯後水印是否會消失?水印對代碼又會產生怎樣的影響?
自Anthropic本周早些時候宣布將通過水印技術遵守歐盟《AI法案》透明度規範以來,Claude用戶之間的爭論從未停止。該規範要求AI公司部署相應系統,以便識別AI生成的內容。
在Reddit上,有用戶將此舉定性為"針對無辜Claude用戶的陰謀",也有人反駁稱:"唯一不想要這個功能的理由,就是想欺騙別人。"據Business Insider報道,已有"數十名"X平台用戶聲稱因此取消了Claude訂閱。
Anthropic的新文章首先對水印概念進行了概述。文章解釋道,當Claude在做"低風險選擇"時——例如在用"陰雲密布"還是"灰濛濛"來描述天氣之間做選擇——它可以在回覆中形成一種特定規律,"讀者無法察覺,但持有編碼密鑰的人可以檢測到"。
"水印不會影響Claude的輸出質量,"該公司表示,"對於讀者而言,帶水印的回覆與不帶水印的回覆毫無區別。"
在技術細節上,Anthropic表示將採用谷歌DeepMind團隊於2024年提出的SynthID
-Text方案,並計劃發布水印檢測API。Anthropic還特別指出,水印技術與Pangram等公司提供的AI檢測方式有本質區別——後者通過識別寫作中的"特徵標誌"(例如"這不是X,而是Y"這類句式結構)來判斷是否使用了AI。"識別這些規律與檢測水印,在本質上是兩種不同的方法。"
針對"通過改寫來抹除水印"的疑慮,Anthropic表示這種情況確實存在,但"輕度編輯可能不會完全消除水印",而"完全重寫、逐字替換則可以"。
"在後一種情況下,這段文字是否還能被稱為'AI生成內容',本身就值得商榷,"該公司補充道。
對於僅經過Claude校對或潤色的文本,Anthropic表示是否會攜帶水印取決於"文本長度以及Claude的編輯程度"。如果只是輕度潤色,"幾乎所有文字"仍出自人類作者之手,"幾乎沒有(甚至完全沒有)供水印附著的空間"。
在代碼方面,由於模型需要生成可運行的代碼,沒有太多空間在同等有效的選項之間自由選擇,因此代碼中的水印痕跡會比其他文本少。
"話雖如此,在代碼中某些詞語或術語存在任意選擇空間的地方,水印仍可發揮作用,例如代碼中的注釋部分,"Anthropic表示,"但從定義上講,水印對實際生成的代碼影響微乎其微。"
Anthropic還表示,Claude不會是唯一生成帶水印文本的AI聊天機器人,因為"其他主要模型開發商也簽署了同一份行為準則,並將實施各自的水印方案"。
Q&A
Q1:Claude的文本水印技術是如何運作的?
A:Claude在生成文本時,會在措辭選擇等"低風險決策"環節中嵌入特定規律,這種規律對普通讀者不可見,但持有對應密鑰的人可以檢測出來。Anthropic採用的是谷歌DeepMind於2024年提出的SynthID-Text方案,並計劃發布專用的水印檢測API。整個過程不會影響文本質量,帶水印的回覆與不帶水印的回覆對讀者而言沒有任何區別。
Q2:對Claude的回覆進行編輯或改寫,能消除水印嗎?
A:輕度編輯通常無法完全去除水印,但如果對全文進行逐字替換式的徹底重寫,水印則會消失。對於僅經Claude校對潤色的文本,是否含有水印取決於文本長度和Claude的編輯程度——如果只是輕微潤色,文本主體仍由人類撰寫,水印幾乎無從附著。
Q3:Claude的水印對代碼有什麼影響?
A:代碼中的水印痕跡比普通文本少,因為生成可運行代碼需要遵循嚴格的語法規則,模型沒有太多空間在同等有效的選項之間自由選擇。水印可能出現在代碼注釋等存在任意選詞空間的地方,但對實際生成的功能性代碼影響微乎其微。






