8月2日起,欧盟要求面向其市场的AI提供商标记AI生成内容。Anthropic在8月14日公布了一个细节:未来的Claude模型生成的文本将包含水印。Google、OpenAI等190个签署方加入了同一份《欧盟AI生成内容透明度实践准则》。

这意味着AI写的东西,以后自带"身份戳"了。但这个戳不是你想的那种——它不在文字表面,藏在选词的概率里。

AI文本水印的原理示意:文字背后隐藏着概率密码

图注:AI生成的文字背后,每个词的选择都携带着可被检测的概率模式

水印不改变文字

大语言模型生成文本时,每个词都是从一组候选词里选出来的。以"今天的天气很冷,而且……"为例,下一个词几乎不可能是"甜腻的",但很可能是"阴沉的"或"灰蒙蒙的"。多数情况下,选哪个对读者来说差别不大,句意基本相同。

水印正是利用了这类低风险选择。当多个候选词都合理时,模型选哪个词变得可检测。这不是在文本里塞隐藏字符,也不产生额外token,不增加费用。对读者来说,水印文本和普通文本无法区分。

Anthropic在内部测试中未观察到水印对内容、创造性或可读性有任何影响。Google DeepMind在SynthID-Text论文中通过对比水印和非水印模型的用户点赞数据,发现两者没有统计上的显著差异。

用圆周率掷骰子

理解水印原理,可以用一个类比。想象你在玩大富翁,每轮掷骰子决定走几步。现在不掷骰子了,改用圆周率数字手册——从一个随机选定的位置开始,此后每个玩家用序列中的下一个数字作为"掷骰"结果。

从实际效果看,移动仍然是随机的:随机性来自圆周率还是骰子,对玩家和游戏结果没有区别。但如果事后能看到所有移动的序列,并且知道圆周率的值,就可以推断这盘棋是不是用圆周率决定移动的。

Claude的水印用的是Google DeepMind于2024年在《自然》期刊上发表的SynthID-Text方法的变体。这种方法可追溯到Scott Aaronson 2022年的提案,共享同一设计原则:水印只改变选词的随机性来源。用密钥和前文来决定该选哪个词,而不是用任意随机数生成器。

水印也有盲区

水印不是万能的。短文本上检测效果不理想,因为词的选择少,可用信息不足。随着段落长度增加,检测信心才提高。在事实性段落中水印更稀疏,因为不降低准确性的选择更少——比如"牛顿最著名的著作叫《自然哲学的数学原理》",下一个词必须是"Mathematica",水印无从介入。

代码也类似。代码中很多地方必须精确输出,换了词就会出错,水印在这里不适用。只在代码注释等可以任意选择用词的地方,水印才有空间。

还有个有趣的边界:如果让Claude校对人类写的文本,它只改了语法和标点,那水印几乎不存在——因为几乎所有词都是原作者的,水印可附着的地方太少。Claude写得越多,要做的决定越多,水印可存在的空间才越大。

水印检测的有效性随文本长度和创造性变化的关系

图注:水印检测置信度随文本长度增加而上升,事实性内容中水印更稀疏

不只Claude在加水印

水印不是Anthropic一家的动作。190个签署方加入了《欧盟AI生成内容透明度实践准则》,包括Google、OpenAI、Microsoft等主要模型提供商。每家用的水印方案不同,密钥也不同——Google用的是原版SynthID-Text,OpenAI宣布在2025年加入C2PA内容凭证体系。

这意味着同一段文本可能被多家厂商各自的水印检测工具识别。但跨厂商检测存在一个盲区:A厂商的水印检测工具读不出B厂商的水印,因为密钥不通用。要判断"这段文字是不是AI写的",你得把同一段文本分别送进每家厂商的检测API。

图片和文件走的是另一条路。Claude生成.png、.jpg或.svg文件时,会在文件元数据里附加C2PA内容凭证——一条加密签名的说明,记录该文件由Claude制作或处理。C2PA是开放行业标准,相机厂商和照片编辑软件也用它记录图片来源。任何支持C2PA的工具都能读取这个标签,不需要密钥。

文本水印和C2PA文件凭证是两套互补机制。文本靠概率统计隐写,文件靠元数据签名。前者隐蔽但需要密钥,后者显式但可被擦除——删掉文件元数据就能去掉C2PA标签,但文本水印删不掉。

源势AI怎么看

水印这件事,对AI内容产业的影响比想象中大。

我们帮企业做内容生产时,已经遇到客户问"用AI写的文案会不会被检测出来"。以前这个问题没法回答,因为AI检测软件用的是统计特征——比如AI偏爱"这不是X,而是Y"这种句式,"悄悄地"一词用得比人类多。但这些特征可被绕过,误判率也高。

水印改变了这个局面。它是密码学级别的检测,不是统计猜测。持有密钥的人可以给出"Claude参与写作的概率",而且这个概率有数学保证。

对企业来说有两层含义。第一,合规层面。欧盟已经立法要求标记AI生成内容,以后中国市场大概率跟进。现在用AI写的东西,未来可能被追溯检测。第二,信任层面。水印不能区分"Claude写了这段"和"Claude做了大量编辑"——这个模糊地带恰好是当前企业用AI辅助内容生产的常态。水印API即将开放,企业需要提前想清楚自己的内容哪些有AI参与、参与程度如何,而不是等检测报告来了再被动解释。

Anthropic明确说水印不携带身份信息,无法追溯到特定个人或组织。这个设计是合理的——如果水印能识别用户,没有人会用带水印的模型。但这也意味着检测只能告诉你"这是AI写的",不能告诉你"是谁让它写的"。责任归属的问题,水印解决不了。