我重生了,回到了那个为了降重,把中文翻成英文,英文翻成罗马尼亚语,再兜兜转转翻回中文的年代。
只不过这一次,我的对手不是知网。
而是 Claude。
就在昨天,Anthropic 更新了一则官方说明:8 月 2 日之后发布的 Claude 新模型,会支持一种机器可读的内容标记,生成的文本会被嵌入水印。(8 月 2 号之前发布的旧模型,会有一段过渡期)
以后 Claude 生成的每一段文字,都会带着一个你肉眼看不见的水印。
这事儿本来是 Anthropic 为了应付欧盟的招儿,但没想到,全世界的 Claude 用户都因此被无差别对待了。
而且,但凡你用上了 Claude 的地方,从 Claude、Claude Platform (API)、Claude Code、Cowork,到 AWS、Google Cloud、Microsoft Foundry 上调用的 Claude,都在水印的覆盖范围里。
反正消息一出,网上立马就炸锅了。
外国老哥直接开嘲讽,暗骂 Anthropic 不要脸。
还有人已经在考虑咱们的国产模型了。
当然也有人觉得这个水印能推动 AI 治理,是好事一桩。
至于乐子人,不表态纯玩梗,说所谓的水印可能压根就没什么高科技,而是Claude的那些口癖。
都不用检测器查,多看两眼都能闻到味儿了。
但更有意思的还是咱们务实的国内网友,水印有没有意义先放一边,当务之急是先琢磨怎么去掉。
复制粘贴行不行?截图呢?丢给另一个模型改写一遍?实在不行,翻译成七八种语言再倒腾回来?
先说一点,那些觉得复制粘贴出去,又或者截个图识别文字就可以去除水印的哥们,可以洗洗睡了。
虽然具体的技术原理 Anthropic 暂时还没公布,但基本的作用方式还是给咱们透露了一二。主要就两种,文本,用嵌入式水印;文件,则是用带数字签名的出处元数据。
先说大家比较关心的文本。
按照 Anthropic 的说法,当支持水印的 Claude 在生成文字的时候,会直接把一个人眼无法察觉的水印融到文本里。
这个水印,不会改变文字的意思、质量和可读性。
因为水印本身就是文本的一部分,所以你把文字复制到 Word、公众号后台,又或者发给别人,水印也会跟着一起过去,即便是经过一些编辑之后,还有可能继续存在。
而且水印是在模型那一层就打上了,甭管哪个产品,只要背后跑的是支持水印的模型,那理论上都会留下水印。
所以网友支的那些招,别说什么复制粘贴、截图识别,你就是原封不动手打一遍,也还是甩不掉。
至于 Claude 到底是怎么把一串看不见的东西塞进文本里的,Anthropic 目前嘴很严,不过类似给文本打水印的手法,在学术界倒不是什么新鲜玩意儿。
过去几年,研究者已经想出了不少给大模型输出的文字偷偷做记号的办法,一条比较经典的路子,就是动模型选词的手脚。
大模型每往外蹦一个 token,背后其实都有一堆候选项。
2023 年发表在 ICML 的一篇论文《A Watermark for Large Language Models》,就提出过一种办法:每生成下一个 token 之前,按照一套秘密规则,把候选 token 临时分成两拨,可以简单理解成“绿名单”和“红名单”,然后在模型生成的时候,稍微偏爱一下绿名单里的词。
单看一两个词当然看不出来,但文本如果写得够长,模型一路下来都更容易选中绿名单里的词,那统计规律就慢慢出来了。
检测器照着这套规则查一遍,看看绿名单里的 token,是不是出现得明显多于正常情况,就能从看似正常的遣词造句里,把水印识别出来。
换句话说,如果“不是...而是...”这种句式,是咱们对 AI 味儿的判断,那统计规律,就是机器才能看得懂的暗号。
像用在 Gemini 上的 SynthID-Text,思路其实也有点类似。
而且,Google DeepMind 后来发表在 Nature 上的论文显示,他们拿 SynthID-Text 做过接近 2000 万次真实交互的线上实验,结果发现水印没有对回复质量产生明显影响。
对咱们来说,模型该怎么说话还是怎么说话,但水印早就已经打上去了。
除此之外,还有一拨研究是把水印往语义层藏。
比如 ICLR 2024 的一项研究,就不再只盯着前面几个 token,而是把前文整体的语义信息也考虑进来。近两年还有研究直接在 embedding 空间、句子语义甚至不同 paraphraser 的表达偏好里编码信号。
说人话就是,不再盯着具体用哪个词,而是用整句话的语义和不同改写方式来藏水印,这种思路,你用简单的同义词替换,一时半会儿还去不掉水印。
所以现在社区里有人猜 Claude 会不会是在 token 概率上做手脚,有人猜是不是通过特定措辞、句式甚至更复杂的语义结构来编码,其实都不是完全没来由。
只是目前没有任何一种猜测得到 Anthropic 的确认,这个文本水印到底是怎么打上的,还得等它自己揭晓。
当然,除了给文字塞水印,Anthropic 还准备了另外一种标记方式。
如果 Claude 生成的是 SVG、PNG、JPG 这类文件,它会在文件里加入带数字签名的“出处元数据”。
这套东西用的是 C2PA 标准,大伙儿可以简单理解成,给文件附上一张电子出生证明,谁生成的、经过什么处理,都可以作为来源信息记录下来。
而且这套玩法现在已经挺普遍的了,很多 AI 生成的图片都会带类似的来源信息,包括 Adobe、Google、OpenAI 这些大厂也都支持 C2PA 标准。
不过看到这里,大伙儿可能在琢磨了,既然水印靠的是文字里某种特定的规律,那我把这个规律打乱,不就完事儿了?
你还真别说,怎么打乱这个规律已经写在明面上了。
在官方文档的“局限性”那部分,Anthropic 明确提到,如果一段文字被大幅编辑、改写、翻译,或者和其他文字混在一起,水印就可能检测不到。
文本太短不行,文件元数据被删除不行,文本是由不支持文本标记模型生成的也不行。
我说白了,古法降重即将迎来文艺复兴。
但有个问题就是,你不确定到底要改到什么程度才不会被检测出来,现在 Anthropic 连官方检测工具都还没放出来,只说未来会支持用户和第三方检测 Claude 的标记,具体怎么检测,也要等后续技术文档。
原本世超还想给大伙儿来一次 Claude 降重实测,看看手改 10%、手改 30%、GPT 改写、中英互译。。。这些挨个试下来水印能撑到第几轮。
现在看来,只能先欠着了。
不过,就算真的检测到了,又能说明什么呢?
Anthropic 自己也特意强调,检测到 Claude 水印,只能作为这份内容可能被 Claude 处理过的一个信号,并不能证明整篇东西就是 Claude 从头到尾写的。
世超这篇稿子吭哧吭哧写了 2000 多字,最后扔给 Claude 改了几句话,最后还带上了它的水印。
那么我请问,这篇东西到底算我写的,还是 Claude 写的? 我找谁说理去?
反过来也一样。
你的论文没检测到水印,不能证明跟 Claude 没关系,可能是水印被改没了,也可能压根就不是在支持水印的时候生成的。
查到了,不能直接锤死是 Claude 写的,查不到,也不能证明 Claude 没写。
不过大伙儿也别觉得,这水印搞了半天纯属脱裤子放屁。
AI 生成的内容越来越多,怎么区分人写的和机器写的,本来就是一个很现实的问题。
往大了说,虚假新闻、诈骗、批量生成的垃圾内容,都需要一些靠谱的溯源方式。往小了说,学校想知道论文是不是 AI 代写的,平台想判断一篇内容到底从哪儿来的,也都有检测需求。
水印至少提供了一种,比空口鉴 AI 更靠谱的技术手段。
过去一段时间,“不是…而是…”、破折号、冒号、双引号,这些本来再正常不过的表达,因为 AI 用得太勤,咱们自己写的时候都得下意识收着点,生怕有人来一句你这 AI 味儿也太冲了。。。
想想还挺荒诞的,AI 一开始模仿人类怎么写东西,结果学着学着,把人类逼得要证明自己不像 AI,这不能写,那也不能用。
这次 Claude 的水印之所以会引起这么大的反应,多少也夹杂着这种情绪。
很多人真正介意的,可能不是文字里多了一个看不见的记号,而是以后又多了一些要自证清白的时候。
撰文:西西
编辑:江江&面线
美编:焕妍
图片、资料来源:
X、Reddit
Claude,How Claude marks AI-generated content
部分图源网络