2026 年 8 月 2 日,欧盟 AI 法案第 50 条生效:生成式 AI 提供商必须让系统输出「以机器可读的格式标记,并可被检测为人工生成或操纵」(条文原文)。8 月 11 日,Anthropic 宣布给 Claude 的文本输出嵌入不可见水印;8 月 14 日的技术说明交代了方案:用的是 Google DeepMind 的 SynthID-Text;因为「还没有可靠的办法按地区区分」,水印全球生效,不管你离布鲁塞尔有多远;默认开启,说明页没有提供关闭选项。Google 走得更早:2024 年 5 月就宣布在 Gemini 应用和网页版给文本打 SynthID 水印,同年 10 月的 Nature 论文记录了生产环境的集成。

用户的反应来得又快又乱。上线后头几天那波「被抓包」的恐慌,我在上一篇水印文章里拆过,当时的结论是:水印筛出的不是最想作弊的人,而是最不设防的人,「用 AI 算不算违规」的边界得由学校和雇主自己补上。一个月过去,争吵没有降温,焦点倒是变了。9 月 9 日挂出的一篇 arXiv 论文(arXiv:2609.09604,Alexander Nemecek 等人)把这一个月公开争论里的几类代表性说法归拢到一起——论文自己注明这是示例性梳理,不是系统调查,不主张哪种观点占多数:有人说水印毁了输出质量,尤其是代码;有人说水印里藏着能追踪到个人的信息;据论文记录,GitHub 上一个号称能去除水印的工具一周收了上万星标,商业媒体报道有用户因此退订。论文指出一个别扭的事实:这些抱怨互相打架——水印如果轻易就能去掉,它就很难同时是甩不掉的追踪器。

但这篇论文真正的论点不在评理。它说的是:吵架双方,没有一方的说法能被验证。Anthropic 说「内部测试中没有看到水印对内容、创造力或可读性的影响」「水印不携带任何身份信息」;用户说质量掉了、隐私没了。双方都未必撒谎,只是验证的基础设施根本不存在,谁也拿不出对方能复核的证据。

机制:为什么没有密钥就什么都验不了

这类水印的一般原理,上一篇里已经拆过,一句话复述:语言模型每写一个词,都在一堆说得通的候选词里挑,水印算法用一把秘密密钥悄悄给部分候选词加分,单看任何一句话都毫无异常,攒够长度后拿同一把密钥重新统计,选词的整体偏向才会显出来。写那篇时 Anthropic 还没公开算法,我只能从公开特性推断它属于这一族;这份技术说明证实了推断,还给出了具体做法:SynthID-Text 用刚写下的最近几个词(公开配置里是 4 个 token 的滑动窗口)加上密钥,算出一个伪随机的「口味偏好」,让模型在意思相近的候选词里稍稍偏向合口味的那个(Nature 论文,2024 年 10 月)。一段文字攒下的偏向越多,判定就越有把握;文本越长、选词余地越大,信号越强(arXiv:2609.09604)。

这个设计有两个直接推论。第一,检测不需要访问模型本身,只需要密钥和文本,所以检测很便宜,能规模化。第二,也是全部问题的来源:没有密钥,什么都验不了。密钥在谁手里,验证权就在谁手里。目前,外界拿不到生产系统的密钥,检测入口也由厂商把着。

嵌入了水印,为什么仍然「不可验证」

落差一:质量之争没法裁决。 Google 在 Nature 论文里报告过约 2000 万次 Gemini 真实交互的对照实验:有无水印,点赞率差 0.01%,点踩率差 0.02%。Anthropic 说内测无影响。但外部研究者测不了线上的 Claude 或 Gemini,只能测开源实现。这篇 arXiv 论文用开源 SynthID-Text 配上 Gemma-2-9B 和 Llama-3.1-8B 两个开放权重模型自己跑了一遍:散文任务(500 个开放式问题)上,水印的影响不超过「重新生成一次」的正常波动(即只换随机种子的对照组),裁判模型对比胜率约五五开;代码任务(364 道编程题,每题采样 10 次)上,Llama 的通过率从 63.8% 降到 60.7%,Gemma 几乎没变。问题在于:这只是开源复现。线上部署用什么强度、什么参数,厂商不公开,所以真正跑在生产环境里的那个水印,从来没有被独立测过。用户说代码变糟,拿不出证据;厂商说没影响,同样没有第三方背书。

落差二:「不含身份信息」没法证伪。 Anthropic 的原话是,水印「不携带身份信息,无法追溯到具体的个人、组织或对话」。从机制看这句话可以是真的:水印偏好由密钥决定,不需要往文本里写入任何 ID。但论文点出了关键:如果厂商给每个客户分配不同的密钥,那么检测时把密钥挨个试一遍、看哪把匹配,就知道这段文字出自哪个账户。文本一个字不用改,追踪能力完全由密钥的分配方式产生。全局一把密钥,还是一个客户一把?外部无法区分,而「不含身份信息」在两种情况下字面上都成立。用户的恐惧恰恰落在这个盲区里。

落差三:检出能力没人担保。 第 50 条要求输出「可被检测」,论文的实测泼了冷水:在允许 1% 误报(每 100 段人写的文字错认 1 段)的设定下,散文在 200 个 token 时只能识别出 39% 的水印文本,到 400 个 token(粗略折算约三百个英文词)才升到 56%–59%;代码上检测能力接近乱猜(AUROC 0.55–0.57,这个指标 0.5 等于抛硬币,1 是完美区分)。原因是代码的「熵」低:熵可以理解为「下一个词有多少种合理选法」,写代码时每一步说得通的写法本来就少,语法和正确性把选择锁死了,水印没有空间藏进去。Anthropic 自己也承认「事实性内容上水印更稀疏,因为不损失准确性的选择更少」。于是,在大家最担心 AI 代笔的场景,比如作业代码和事实陈述,水印恰好最弱。

把三个落差对回条文,就能看到错位在哪。第 50 条要求标记方案「有效、可互操作、稳健、可靠」(同一句话还带着「在技术可行的范围内」的限定),却没有规定由谁来验证这四个词:没有为水印密钥和检测配置指定专门的审计机构,没有统一评测协议,没有要求各家检测接口互通。AI 法案本身有一般性的市场监督和投诉机制,但第 50 条没有安排任何审计者去查水印,所以某个水印是否配得上这四个词,最终落在厂商的自我声明上。Anthropic 的检测 API 目前只对「欧盟法律要求下符合条件的组织」开放;据论文记录,现有接口在内部算出分数,却只返回判定(Google 的开源检测器至少会给出「有水印/无水印/不确定」三档),分数本身从不给出。上一篇里我提醒过,检测能力若只发放给平台和机构,检测者与被检测者之间的信息差比水印本身更值得盯;一个月后再看,这个信息差成了产品的默认设计。按厂商的自我声明,条文可以算全部满足,公众「能识别 AI 内容」的立法目标依然落空。

这件事已经在影响谁

平台治理上,内容平台很难拿水印做规模化筛查:检测权限由各家厂商把关(Anthropic 的 API 是需要申请的非公开预览,各家之间也没有互通的接口),判定不带分数、误判了无从复核,被冤枉的用户也只能走厂商自己的渠道申诉——论文正是因为目前不存在独立申诉渠道,才呼吁建立一个。纠纷场景更别扭:学生被指控论文由 AI 代写,自由撰稿人被怀疑交了机器稿,唯一能给出判定的是厂商的检测器,而它是个黑箱,等于厂商既当证人又当法官。虚假信息治理则面对一个根本的不对称:有意造谣的人可以用不带水印的开源模型,或者整段改写——论文综述的已有研究显示,完整释义能大幅削弱乃至去除统计水印,Anthropic 自己也说「逐词替换的完整重写会去掉水印」;水印真正覆盖的,是守规矩厂商的守规矩用户的日常输出。

论文开出的方子有五条:发布水印开/关的配对样本、披露部署配置、引入有密钥访问权的认证审计、建立统一评测协议、打通各家检测接口。方向都对,核心就一件事:把「厂商说」升级成「可查证」。

我自己的判断有两条。第一,在验证机制出现之前,任何 AI 文本检测结论,无论阳性阴性,都不该作为高风险决定(学术处分、用工争议、法律证据)的唯一依据。无水印的检测器已有前车之鉴:OpenAI 2023 年就因准确率太低下线了自家的 AI 文本分类器;水印检测原理上更扎实,但生产配置同样没被独立测过。它现在的可靠边界是善意场景下的溯源辅助,比如厂商自查和研究统计。第二,下一轮监管值得盯的问题不在水印算法,在密钥治理:一共几把密钥、按什么粒度分配、谁有权拿文本去查询、查询记录归谁。这些问题决定水印到底是内容溯源工具,还是一套没写进任何条款的用户指纹系统。第 50 条要求的其实只是「机器可读的标记」,水印是厂商自己选的实现方式;如今 Anthropic 和 Google 都选了它:Claude 的水印默认开启,Gemini 的水印从 2024 年底起就跑在消费级产品里。真正的考题,从打上那一刻才开始。

参考来源