我重生了,回到了那个为了降低查重率,把中文转英文、再转罗马尼亚语、最后转回中文的荒诞年代。不过这一次,我的对手不再是知网,而是 Anthropic 的 Claude。就在昨天,Anthropic 官方发布了一则更新说明:8 月 2 日之后发布的 Claude 新模型将支持一种机器可读的内容标记,生成的文本会被嵌入水印(8 月 2 日前的旧模型会有过渡期)。从此以后,Claude 生成的每一行文字,都会携带一个肉眼无法察觉的水印。这项技术原本是 Anthropic 为了应付欧盟监管而准备的,却没想到让全球所有 Claude 用户都受到了无差别的波及。从 Claude、Claude Platform(API)、Claude Code、Cowork,到调用 Claude 的 AWS、Google Cloud 和 Microsoft Foundry,所有使用该服务的场景都在水印的覆盖范围内。
消息一出,网上顿时炸开了锅。国外用户直言嘲讽,暗骂 Anthropic 缺德,还有人开始考虑转投国产大模型阵营。当然也有人认为,这能推动 AI 治理,是件好事。至于看热闹的网友,则选择玩梗,调侃所谓的“高科技”水印可能根本不存在,只是 Claude 那些洗不掉的口癖。不用检测器,多看几眼就能闻出 AI 味儿。不过最有趣的还是咱们国内的务实网友,既然水印有没有意义先不论,当务之急是琢磨怎么把它去掉。复制粘贴行不行?截个图行不行?丢给另一个模型改写?实在不行翻译成七八种语言再倒腾回来?
先告诉大家一个坏消息,那些觉得复制粘贴出去,或者截个图识别文字就能去除水印的朋友,可以洗洗睡了。虽然 Anthropic 暂时还没公布具体技术原理,但基本机制已经透露了一二。主要分为文本水印和文件元数据两种方式。先说大家最关心的文本水印。Anthropic 表示,支持水印的 Claude 在生成文字时,会直接将一个肉眼不可见的水印融入文本之中。这个过程不会改变文字的意思、质量和可读性。因为水印本身就是文本的一部分,所以你把文字复制到 Word、公众号后台,或者直接发给朋友,水印都会跟着一起走。即便经过编辑,水印也可能依然存在。而且水印是在模型生成阶段就打上的,只要后台跑的是支持水印的模型,理论上都会留下痕迹。所以,无论你用什么招数——复制粘贴、截图 OCR,甚至是原封不动地手打一遍,都很难甩掉水印。
至于 Anthropic 具体是如何将隐形信号塞进文本的,目前官方守口如瓶。不过,这种技术在学术界并不新鲜。过去几年,研究者们已经想出了不少给大模型输出文字做记号的方法。其中一条经典路径,就是操纵模型的选词机制。大模型每生成一个 token,背后其实都有一堆候选项。2023 年发表在 ICML 的一篇论文就提出了一种方法:每生成下一个 token 之前,按照一套秘密规则,把候选 token 临时分成“绿名单”和“红名单”,然后在生成时稍微偏爱绿名单里的词。单看一两个词看不出端倪,但文本写长了,模型一路选词会更容易命中绿名单,从而形成统计规律。检测器只需对照规则检查绿名单 token 的数量,就能从看似正常的遣词造句中识别出水印。换句话说,如果“不是…而是…”这种句式是 AI 味儿的标志,那么统计规律就是机器能读懂的暗号。Google 的 SynthID-Text 思路类似,DeepMind 的实验也证明,这种水印对回复质量影响甚微。除了这种基于 token 的方法,还有研究将水印藏在语义层。比如 ICLR 2024 的一项研究,不再只盯着前几个 token,而是考虑前文整体的语义信息。甚至有研究在 embedding 空间、句子语义或不同改写方式的偏好里编码信号。简单说,不再盯着具体用哪个词,而是用整句话的语义和改写方式来藏水印。这种情况下,简单的同义词替换一时半会儿是去不掉的。所以社区里的猜测并非空穴来风,有人猜是 token 概率问题,有人猜是特定措辞或句式,但 Anthropic 尚未确认具体方案。
除了给文字打水印,Anthropic 还准备了另一种标记方式。如果 Claude 生成的是 SVG、PNG、JPG 等文件,它会在文件中加入带数字签名的“出处元数据”。这套东西基于 C2PA 标准,可以简单理解为给文件附上一张电子出生证明,记录生成者及处理过程。这种玩法现在很普遍,Adobe、Google、OpenAI 等大厂都支持 C2PA 标准。
看到这里,大家可能会想,既然水印靠的是文本中的特定规律,那我把它打乱不就行了?其实,如何打乱这个规律的方法 Anthropic 已经写在官方文档的“局限性”部分了。如果一段文字被大幅编辑、改写、翻译,或者和其他文字混在一起,水印就可能检测不到。文本太短不行,文件元数据被删除也不行,由不支持标记的模型生成的文本也不行。说白了,古法降重(翻译法)即将迎来文艺复兴。但问题是,你不确定到底要改到什么程度才安全。目前 Anthropic 还没放出官方检测工具,只说未来会支持用户和第三方检测,具体怎么测也要等后续技术文档。
原本我还想做个实测,看看手改 10%、30%,或者用 GPT 改写、中英互译,水印能撑到第几轮,现在看来只能先欠着了。不过,就算真的检测到了,又能说明什么呢?Anthropic 强调,检测到水印只能作为内容可能被 Claude 处理过的信号,并不能证明整篇文章就是 Claude 从头到尾写的。比如我写了一篇 2000 多字的稿子,最后扔给 Claude 改了几句话,结果带上了水印。那么这篇稿子到底算我写的,还是 Claude 写的?我找谁说理去?反过来也一样,没检测到水印不代表跟 Claude 无关,可能是水印被改没了,也可能根本就不是在支持水印的模型下生成的。查到了不能定罪,查不到也不能洗清嫌疑。
不过大家也别觉得这水印纯属脱裤子放屁。AI 生成内容泛滥,区分人写和机写是个现实问题。从防范虚假新闻、诈骗到批量垃圾内容,再到学校查论文、平台溯源,都需要靠谱的手段。水印至少提供了一种比空口鉴 AI 更靠谱的技术支持。过去,“不是…而是…”、破折号、冒号这些表达,因为 AI 用得太勤,咱们自己写时都得收着点,生怕被说成 AI 味儿太冲。想想还挺荒诞:AI 一开始模仿人类怎么写,结果学着学着,把人类逼得要证明自己不像 AI。这次 Claude 水印之所以引起这么大反应,多少夹杂着这种情绪。很多人真正介意的,可能不是文字里多了一个看不见的记号,而是以后又多了一些要自证清白的时候。
