就在刚刚,Anthropic 正式发文解释了 Claude 文本水印的工作方式。

按照官方说法,为了满足欧盟对 AI 生成内容机器可读标记的要求,Anthropic 最终选择了 Google DeepMind 的 SynthID-Text 路线。由于目前还缺少可靠的区域区分方案,这套水印上线后还会直接应用到全球 Claude 用户。

至于水印咋加、能不能洗掉、拿 Claude 润色人类文章算不算、代码有没有中招、翻译咋办、未来咋检测…… 好家伙,大家关心的这些雷点,Anthropic 这波倒是基本全回答了一遍。

Anthropic 试图向大家疯狂暗示:放宽心,水印对 Claude 几乎没有实际影响。

但通篇看下来,比较难评的是博客描述文字水印的影响时疯狂叠 Buff 的几个限定词: 「大体相同」、「没有统计学显著差异」、「影响可以忽略」、「速度影响可以忽略」……

几乎没有影响终究不等于完全没有影响。就算眼下的跑分评测很难观察到明显的质量差异,也很难据此断言这种影响在所有任务、所有文本长度和长期使用中,都可以完全忽略。

尤其当水印真正进入 Claude 的日常生成以后,它是否会在某些场景中牺牲一点生成质量,最终影响用户体验,恐怕还需要打一个大大的问号

最后附上原文翻译,enjoy it~

Claude 的文本水印是如何工作的

未来的 Claude 模型生成的文本将包含水印。

这种机制可以用来判断 Claude 参与撰写某段文本的可能性。为了遵守《欧盟人工智能法案》,我们正与其他几家主要 AI 提供商一起实施这一改变。

在本文中,我们会回答一些收到较多的问题,包括我们选择的水印方法如何工作、它是否会影响 Claude 的输出,以及我们为什么要做出这一改变。

简单概括如下:

我们使用的水印方法,在实际使用中不会对 Claude 输出的质量或内容产生影响;

对读者来说,带水印和不带水印的文本无法区分;

文本中不会添加任何额外内容,也不存在隐藏字符;

水印不需要额外消耗 Token,因此也不会增加使用成本;

水印不携带任何身份信息,无法追溯到某个具体的人、组织或聊天记录;

水印也不会是 Claude 独有的机制。自 8 月 2 日起,欧盟要求面向其市场提供服务的 AI 提供商对 AI 生成内容进行标记。其他主要模型开发商也签署了同一份《行为准则》,并将实施各自的水印方案。

什么是水印?

像 Claude 这样的大语言模型,是通过一次生成一个词来工作的。

模型每次决定下一个词时,都会从一组可能的候选词中进行选择,最终根据前面的文本,选出最合理或概率最高的那个。

比如一句话:「今天天气很冷,而且……」

下一个词几乎不可能是「甜的」。

但很可能是「阴沉」或者「灰蒙蒙」。

在大多数情况下,模型最终选了后面这两个词中的哪一个,对读者来说其实没太大区别,因为句子的整体意思基本一样。

遇到这种情况时,具体选择通常由一个随机数决定。

水印利用的正是这种无关紧要的选择。

一段生成文本中会反复出现很多这样的选择,水印借此在 Claude 的回答中留下某种模式。

读者无法察觉这种模式,但任何拥有对应密钥的人都可以检测出来。

启用水印以后,模型做出的选择依然具有随机性,但随机性的来源发生了变化。

模型不会再使用任意的随机数生成器来选择下一个词,而是利用密钥和前面的几个词,决定应该选择哪个词。

换句话说,Claude 选择的词依然是随机的,但现在人们可以检查这一系列词语,判断它是否符合 Claude 在使用该密钥时会做出的选择。

如果符合,就可以计算出这段文本由 Claude 生成的概率。

需要强调的是,这并不意味着模型从此会一直偏向选择「阴沉」或「灰蒙蒙」。

和没有水印时一样,根据前面的词,一句话里可能选「阴沉」,下一句话又可能选「灰蒙蒙」。

水印机制也不会迫使 Claude 选择原本根本不会考虑的词。

比如,它不会让 Claude 突然选用 「nubilous」 这样的词。这是一个非常生僻的「阴沉、灰蒙蒙」的同义词,正常情况下 Claude 几乎肯定不会使用它。

水印会如何影响 Claude 的输出?

水印不会影响 Claude 输出的质量。

对读者来说,带有水印的回答和没有水印的回答无法区分。

从这一点来看,AI 水印和钞票、其他实体物品以及某些数字文档上的传统水印有很大区别,因为后者通常可以直接用肉眼看到。

在内部测试中,我们没有发现水印会影响 Claude 文本的内容、创造力水平或可读性。

介绍我们所使用技术的 SynthID-Text 论文 中,Google DeepMind 曾经专门测试过这种影响。

🔗 4

🔗 4

他们让一部分 Gemini 用户使用开启水印的模型,然后比较用户给出的点赞和点踩评分。

结果显示,与未添加水印的模型相比,两者之间不存在统计学上的显著差异。

在另一项受控研究中,人类评分者将带水印和不带水印的回答并排比较,也没有发现质量上的差异。

可以用玩《大富翁》这样的游戏来类比。

每一回合,玩家都会根据掷骰子的结果,在棋盘上随机前进若干格。

假设我们不再通过掷骰子获得随机性,而是改用一本记录圆周率 π 各位数字的书。

我们先随机选择其中一位数字作为起点。

比如从小数点后的第 1,012,845 位开始,而这一位恰好是 6。

从这里开始,每名玩家接下来就依次使用 π 后面的数字,作为自己每一回合的「掷骰结果」。

从实际效果来看,这些移动依然是随机的。

对玩家而言,甚至对整场游戏的结果而言,随机性究竟来自 π,还是来自每一回合真正掷出的骰子,并没有什么区别。

但如果游戏结束以后,我们能够看到所有移动组成的完整序列,并且知道 π 的具体数值,那么就可以判断这场游戏是否很可能是利用 π 来决定移动方式的。

从某种意义上说,这场使用 π 的游戏就被「加上了水印」。

Claude 生成的文本也是同样的道理。

水印不会改变文本本身的含义,也不会改变读者阅读它时的体验。

但如果事后想判断一段文本是否很可能由 Claude 生成,水印就可以帮助完成这种检测。

你们具体使用哪一种水印方法?

Claude 的文本水印采用了 Google DeepMind 在 2024 年发表于《Nature》论文 中的 SynthID-Text 方法的一个版本。

它属于一系列相关方法中的一种。

这一系列方法最早可以追溯到 Scott Aaronson 在 2022 年提出的一项方案。

它们都遵循前面介绍过的同一个设计原则:水印只改变模型在多个候选词之间进行选择时,所使用的随机性来源。

水印的有效性也存在一些限制。

使用我们的密钥,能够回答的只有一个问题:「这段文本有多大可能部分由 Claude 撰写?」

它无法确认文本是否由人类撰写。

也无法判断文本是不是由另一个 AI 写的。

即便另一个 AI 同样使用了水印,它也会拥有不同的密钥,而且甚至可能采用完全不同的水印技术。

在文本样本很短时,水印检测的效果也不太好。

因为短文本中的词语选择次数更少,因此可供判断的信息也更少。

随着文本长度增加,我们判断 Claude 是否参与其中的置信度也会提高。

在事实性较强的文本中,水印通常会更加稀疏。

因为这类文本可自由选择的词更少,如果强行改变选择,就可能降低事实准确性。

例如这句话:「艾萨克·牛顿最著名的著作叫做《自然哲学的数学原理》……」

如果已经写到 「Principia」,接下来是不是 「Mathematica」 非常重要,因为这是唯一正确的答案。

因此,在这种位置上,水印没有可以发挥作用的空间。

校对也是同样的道理。

如果你把一段文章交给 Claude,要求它只修改语法和标点,除此之外什么都不要动,那么水印只能存在于少量被修改的地方。

这些修改可能少到不足以被检测出来。

如果 Claude 只是校对或编辑人类写的文本呢?

水印只会作用于 Claude 自己选择的词。

当 Claude 校对一段由人类写成的文本时,它返回的内容通常只会经过轻度编辑。

由于其中几乎所有词都来自原作者,水印基本没有多少可以附着的地方,甚至可能完全没有。

具体能否检测到 Claude 的参与,要看文本有多长,以及 Claude 对它进行了多大程度的修改。

这些改动有时可能不足以让 Claude 的参与被检测出来。

Claude 写得越多,它需要做出的词语选择就越多,水印能够存在的空间也就越大。

代码怎么办?

前面提到,AI 水印利用的是这样一些选择:两个不同的词都同样合适,模型可以在它们之间进行选择。

如果某个位置要求的是一个精确输出,也就是没有选择余地,换一个词就会导致事实错误,或者让代码无法运行,那么这里不会应用水印。

例如,当模型已经写出 「2 + 2 =」 以后,下一个 Token 有一个非常明确的最佳选择。

如果模型是在完成这道算术题,就不存在一个和「4」同样正确的答案。

因此,水印在这里不会施加任何「轻微推动」。

出于同样的原因,代码在很多情况下都必须保持精确,因此通常比其他类型的文本包含更少的水印。

不过,在代码内部某些确实存在任意选择空间的地方,水印仍然可以发挥作用。

例如代码注释中的措辞。

但按照定义,这种机制对实际生成代码本身产生的影响将微乎其微。

这对用户意味着什么?

水印会让模型变慢,或者变得更贵吗?

不会。

水印对模型速度的影响可以忽略不计。

由于它不会生成额外的 Token,因此模型的服务成本和用户使用价格都不会发生变化。

水印能够追溯到我或者我的组织吗?

不能。

水印针对的是 Claude 及其输出。

不会识别任何与具体用户有关的信息。

无论水印本身还是对应密钥,都不存在可以让任何人还原用户身份、用户所在组织或用户与 Claude 聊天记录的信息。

为什么要给 Claude 的输出添加水印?

我们实施水印,是为了遵守《欧盟人工智能法案》。

2026 年 7 月,Anthropic 与其他几家主要 AI 模型提供商,以及总计约 190 个签署方,共同签署了欧盟《AI 生成内容透明度行为准则》。

该准则要求 AI 系统提供商使用某种方法,对 AI 生成的文本进行「标记」。

水印上线时,我们会在全球范围内统一应用。

原因是目前我们还没有一种足够持久、可靠的方式,按不同地区限制水印的使用范围。

不过,我们会继续评估不同方案,并在有新进展时公布更新。

其他问题

我该如何检查一段文本是不是 Claude 写的?

我们很快会推出一个水印检测 API。

目前仍在确定具体的实现细节。

图片和其他文件怎么办?

当 Claude 生成受支持格式的文件时,例如 .png、.jpg 或 .svg,它会在文件的元数据中附加一个内容凭证。

它的形式是一小段经过加密签名的信息,用来说明该文件曾由 Claude 创建或处理。

这采用的是一个开放的行业标准,叫做 C2PA。

相机制造商和图片编辑软件也使用同一套标准,用来记录图片的来源。

任何支持 C2PA 的工具都可以读取这些信息。

我们也会提供自己的检测工具,用户可以直接把文件放进去进行检查。

这种元数据标签和水印有很大区别。

文件本身的内容不会发生任何变化,信息也不会嵌入或隐藏在内容之中。

和文本水印一样,这个凭证只表示 Claude 曾参与生成或处理这个文件,不包含任何身份识别信息。

别人难道不能通过修改文本来绕过水印吗?

在一定程度上,可以。

轻度编辑可能无法彻底去除水印。

如果把每一个词都替换掉,完整重写一遍,那么水印就会被去除。

当然,在后一种情况下,这段文本是否还能被称为「AI 生成」,本身也存在讨论空间。

水印究竟能证明什么?

水印只能判断 Claude 在某个阶段是否很可能参与过这段内容。

它无法区分「这段内容是 Claude 写的」和「这段内容被 Claude 大幅编辑过」。

翻译也会带水印吗?

会。

由 Claude 生成的翻译会包含水印,因为在这种情况下,每一个词都是由 Claude 选择的。

旧版 Claude 模型怎么办?

欧盟法律针对 2026 年 8 月 2 日之前发布的 Anthropic 模型设置了一个过渡期。

我们也正在为这些模型加入水印。

相关功能将在未来几个月陆续推出。

它和 Pangram 这样的 AI 检测软件有什么区别?

AI 检测软件使用的是另一套方法,因为提供这些服务的公司并不拥有我们的密钥。

除此之外,这些服务还会分析文本中的一些特征,比如 AI 措辞里经常出现的各种细微,或者并不那么细微的「痕迹」。

例如,AI 模型似乎非常喜欢使用 「this isn’t [X], it’s [Y]」 这种句式,也就是「这不是 X,而是 Y」。

它们使用 「quietly」 这个词的频率,也比你想象中高得多。

识别这些语言模式,与检查文本里是否存在水印,从原理上就是两种完全不同的方法。

水印会改变某段输出的所有权,或者改变谁需要为它承担法律责任吗?

不会。

水印只用于帮助判断某段内容是否可能由 Claude 生成或处理过。

它不会说明任何有关所有权或作者身份的问题,也不会改变用户根据我们的服务条款所拥有的权利。

只有在 Claude 确实参与处理某段内容或某个文件时,我们才会应用水印。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8vbXUuWHqrF