9 月 30 日,Google DeepMind 发布 SynthID Bio,给 AI 设计的蛋白质打水印(DeepMind 博客,配套论文发在 Nature)。已经经过验证的是蛋白质序列和预测结构;给基因序列打水印目前还只是噬菌体上的早期实验,技术论文未发布。实验室在三个靶点上做了验证——血管内皮生长因子 VEGF-A、新冠病毒刺突蛋白的受体结合域、免疫检查点蛋白 PD-L1:用 AlphaProteo 和 ProteinMPNN 设计的蛋白质结合体(binder,指一段能特异性抓住目标蛋白的序列),加了水印之后,命中率、结合亲和力、序列多样性都和没加水印的版本一样。

先说清这东西给谁用。会去设计全新蛋白质的,是做药物、酶、抗体这类研究的人——AlphaProteo、ProteinMPNN 这些模型能按需求「算」出一段能结合特定靶点的序列,省掉过去在实验室里反复筛选的大量工作。他们自己并不想要水印。想要水印的是另一头:同一套设计能力也能用来造毒素或病原体组件,于是 DNA 合成商在接单合成前要做生物安全筛查,水印是给这道筛查加的一个溯源信号。所以这不是「AI for science 的产出都该打水印」——被单拎出来的是蛋白质和核酸,因为它们能被合成成真实的生物制剂,这层双重用途风险是绝大多数科学产出没有的。

任何水印都在两个互相拧着的目标之间找平衡:一边要让水印尽量看不见、别伤到东西本身的质量,另一边要让水印足够强、事后拿得出来验。打得越重越好检测,质量就越容易受损——这道取舍在文本、图像、音频上都躲不开,文本水印偏置选词会动到行文的流畅度和多样性,图像水印在「不可见」和「抗得住压缩裁剪」之间反复权衡。蛋白质不是没有这道取舍,而是它的质量代价特别不留情面:序列要折叠成特定形状、结合到特定位置才起作用,换掉一个氨基酸就可能让活性大幅下降、甚至彻底失活——换在哪个位置、换成什么,后果天差地别。DeepMind 证明在这种质量代价格外苛刻的约束下仍能把水印嵌进序列而不破坏功能,做出了「第一个既带水印又有生物活性的蛋白质结合体」。这是实打实的工程进展。

但读完整份材料,我上个月拆文本水印时的三个结论,在生物场景一个都没被解决,其中两个反而更尖锐。

照旧的问题:谁拿着密钥,谁就是验证者

SynthID Bio 的序列水印和 Claude(Anthropic 2026 年 8 月确认采用)、Gemini 用的 SynthID-Text 是同一族做法:模型每选一个氨基酸时,用一把秘密密钥给各个候选残基算一个伪随机分数,悄悄偏向分高的那个;单看任何一段序列都正常,攒够长度后拿同一把密钥重新统计,选择上的整体偏向才显出来。所以检测这件事,本质是「拿密钥重算一遍」:能检测的只有拿到对应密钥的人——Nature 论文描述的正是这套机制,检测端用的是生成时的同一把秘密密钥(是双方共享的秘密密钥,不是非对称密码学意义上的私钥)。

这就把上一篇里那个推论原样搬了过来:没有密钥,什么都验不了;密钥在谁手里,验证权就在谁手里。文本水印里悬而未决的治理问题,到了蛋白质这里一字不改:一共几把密钥?按模型分、按机构分,还是全局一把?DeepMind 设想的用途之一,是给蛋白质数据库(PDB、UniProt、GenBank)里的 AI 生成条目打标——可谁来跑这个检测、谁来维护密钥,博客没有答案。开源了方法,不等于开源了「谁来验」。

误判复核的落差也照旧。据 Nature 论文,只有先把序列集筛到「越过某个强度阈值」,检测才能在 0.1% 的误报率下达到 100% 的真阳性率;不做这层筛选,真阳性率并不稳定。原因和文本里低熵代码检测不灵是同一个:序列越短、每一步能换的氨基酸越少,水印能藏进去的统计空间就越小。DeepMind 用来校准这个误报率的无水印结合体序列长度在 40 到 140 个残基之间——很短,正落在信号最弱的那一端。换句话说,底层虽是一个连续的 g-value 统计量,但对外只按预设误报率卡出一个是非结论;官方材料也没有交代被误判的一方能去哪儿复核。

更尖锐的问题:最该拦的序列,恰好不会带水印

真正的错位在生物安全这个用途上。DeepMind 把水印定位成 DNA 合成筛查的一个溯源信号:合成商收到一条订单,能自动确认它「来自一个可信的、带安全防护的模型」,从而把精力集中到那些来历不明的序列上。

问题是,水印只能证明「在场」,没法证明「不在场就等于危险」。一个想造危险序列的人,用一个没打水印的开源蛋白质设计模型就行了——没有水印可去除,自然也不会留下。DeepMind 自己把「让水印更能抵抗蓄意篡改」列为尚未解决的难题(博客原文);但篡改还得先有水印可改,而对手根本不必走到那一步。

这正是文本水印里「守规矩厂商的守规矩用户才被覆盖」那句话,但代价换了量级。在文本场景,用无水印模型逃掉的是代笔检测,后果是一篇作业蒙混过关;在生物场景,逃掉的恰恰是生物安全筛查,而会去逃的,正是最该被拦下的那批人。水印因此只给良性来源发了一张快速通行证,对恶意来源完全失明。

还得分清一件事:蛋白质和文字、图像、音频不一样。一张假图能直接发到网上传播,中间没有任何关卡,事后想追责——这东西是不是 AI 生成的、是谁生成的——除了拿水印倒推别无抓手。蛋白质没有这种「直接发布」的通道:一段数字序列要变成真实分子,通常要经过 DNA 合成这道工序(也有多肽化学合成等其他途径),而合成商本来就要做客户审查,知道是谁下的单、谁付的钱。「这条序列是谁下的单、谁付的钱」,合成链条本来就答得上,这点水印并不能加分。所以在蛋白质这里,连「追责」这点增量都很有限——水印真正能加的只有一件:让合成商从序列本身确认它「出自一个带安全防护的模型」,而这是下单客户的身份回答不了的(客户可能完全合规,却用了个没防护的模型)。

把它说清楚:provenance(溯源)不等于 threat detection(威胁识别)。水印能加速对可信来源的放行、省下人工复核,这是它正向的价值。但「不带水印」的那一大堆序列里,既有良性的天然序列、AI 出现之前就存在的旧设计,也有恶意用无水印模型现造的东西,水印帮不了区分这两者。它替代不了真正的拦截手段——后者仍然得靠比对危险序列数据库、预测序列功能这些直接针对「这东西能干什么」的方法。

我的判断

第一,SynthID Bio 真正推进的是「功能保全」这个工程问题,做得漂亮,值得认可;但把它当成生物安全的拦截闸门是误读。它是溯源辅助,不是威胁探测。合成商筛查的主力仍得是基于危险性本身的判断,水印只负责给可信来源提速。

第二,和文本水印一模一样,下一轮真正的考题在治理层,不在算法层:密钥归谁、按什么粒度分配、谁有权拿一条序列去查询、PDB 和 UniProt 这些数据库接不接入检测、接了之后谁来维护。DeepMind 这次开源了代码、公开了体外实验数据、把模型权重放给研究界——这比文本水印当初的黑箱透明得多,是好事,但开源的是方法,不是这些问题的答案。

第三,顺着上一篇往前推一层:水印让「这条序列是谁造的」变得可查,恰恰让另一件事更要紧——去发现那些不带水印、却值得盯住的序列。AI 让设计新蛋白质变得更容易,可以预期,该被盯住的危险序列也会随之变多。SynthID Bio 把溯源这一侧的工具备齐了,而真正吃劲的地方,从来在「不在场」的那一边。

参考来源

  • Introducing SynthID Bio(Google DeepMind 博客,2026-09-30) — 两种方法(序列水印引导氨基酸选择、结构水印微调 AlphaFold 3 扩散网络)、三个靶点 VEGF-A/新冠刺突 RBD/PD-L1 的实验室验证、「命中率/结合亲和力/序列多样性与无水印版本一致」「第一个有活性的带水印结合体」、噬菌体在菌培养中仍有功能(早期实验)、「抵抗蓄意篡改」为未解决难题、DNA 合成筛查与数据库标注的设想用途、开源代码与权重
  • Function-preserving watermarking of AI-generated proteins(Nature,2026-09-30) — 配套论文(正文需订阅);基于密钥的水印与检测机制(检测端用生成时的同一把秘密密钥重算)、筛选到越过强度阈值的序列后在 0.1% 误报率下达到 100% 真阳性率、不筛选则真阳性率不稳定、短序列检出更弱、用于校准误报率的无水印序列长度在 40–140 残基
  • Claude 采用 SynthID-Text 文本水印(Anthropic,2026-08) — Claude 使用 SynthID-Text 的一个版本;不同提供商用不同密钥,检测器识别不了其他 AI 的水印,且「检测不到水印」不代表内容由人类创作或安全
  • 水印检测只给判定不给分数(本站,2026-09-10) — 文本水印的密钥机制、「没有密钥什么都验不了」、只给判定不给分数的检测接口、低熵文本检测弱、守规矩用户才被覆盖的不对称