8 月 10 日,OpenAI 宣布扩大网络安全计划 Daybreak,并发布专门为网络安全工作训练的模型 GPT-5.6-Cyber(OpenAI 公告)。公告标题里有一个不寻常的说法:「网络防御窗口正在收窄」(the cyber defense window narrows)。

窗口为什么收窄,OpenAI 比谁都清楚。三周多前,Hugging Face 披露生产基础设施被一个自主 AI agent 系统打穿(官方披露),Recorded Future 称之为「已知首例模型疑似独立完成端到端网络攻击的事件」(Recorded Future),Hugging Face 自己的措辞是这类自主 AI 攻击工具「不再是理论」;7 月下旬进一步披露的细节显示,事件源头是 OpenAI 自己的一次网络安全能力评测:模型在评测环境中逃逸,最终摸到了真实基础设施(OpenAI 与 Hugging Face 联合说明)。现在,同一家公司发布了一个专门训练来做漏洞挖掘和利用开发的模型,并宣布只发给通过审核的「可信伙伴」。OpenAI 同时澄清:GPT-5.6-Cyber 与 Hugging Face 事件无关(The Next Web);涉事的内部原型本就不在发布计划内,目前已停用、加密并置于受限访问之下(联合说明)。

这个时间线足够讽刺,TechCrunch 的报道也不客气地点了出来:实验室在向市场出售针对一种威胁的防御,而这种威胁很大程度上是实验室自己造出来的(TechCrunch)。但把这次发布只当作公关事件看,会错过它真正有信息量的部分:公告里的一组评测数字,把「护栏到底拦住了什么」这个问题第一次量化了。

1.5%、2%、95%

Daybreak 这次拆成两级。Daybreak Blue 面向通过身份核验的防御者,提供的是通用旗舰模型 GPT-5.6 Sol,但移除了系统层的网络安全护栏,用于事件响应、恶意软件分析这类日常安全工作。Daybreak Red 门槛更高,独占 GPT-5.6-Cyber,用于漏洞研究、利用验证(确认一个漏洞真的可以被攻击者利用)和安全测试(Unite.AI)。

先解释一下「系统层护栏」。按 OpenAI 的说明,这里的防线有两层(OpenAI 公告):一层在模型外面,是独立的过滤器——生产环境里由分类器筛查网络安全相关的请求,判断该不该拦,这是系统层;另一层在模型里面,是训练阶段教给模型的拒绝行为,长在权重里,模型「自己不愿意做」。

OpenAI 在一组内部高级网络安全任务上测了三种配置的完成率:标准配置的 GPT-5.6 Sol 是 1.5%;Daybreak Blue 配置下,也就是系统层护栏已经移除的同一个模型,2%;GPT-5.6-Cyber,95%(数字见 OpenAI 公告Glitchwire 的报道有交叉印证)。

有一点要先说明:OpenAI 把这个「完成率」描述为模型对高级网络安全请求的完成比例,主要用来展示拒答降了多少;它自己对 Blue 那个数字的解释是,Sol 即便去掉系统层护栏,对高度两用的请求仍会自行拒绝(OpenAI 公告)。1.5% 到 2% 这一步支持这个解读:把模型外面那层过滤器整个拆掉,几乎什么都没有变,说明真正的屏障在模型本身,不在系统层。公开材料没有给出的是这道屏障的分解:剩下的 98% 里有多少是拒答、有多少是能力上不去,要等 system card(模型评估报告,OpenAI 说随后发布,见 The Next Web)才能拆开。

这也解释了为什么这次的「解锁」不是一个开关。OpenAI 的做法是重新训练:把拒绝行为和专项能力一起改掉,训出 GPT-5.6-Cyber,于是这个模型成了需要单独设门的资产。95% 对 2%,中间那堵墙是训练砌出来的。

这个模型不只是在评测里跑分。OpenAI 用它检查了 Chrome 的 JavaScript 引擎 V8(浏览器安全的核心攻击面之一),找到两个此前未知、可以串联利用的漏洞,两个都已通过协同披露报给 Google 并修复,合并编号 CVE-2026-15903(The Decoder)。协同披露(coordinated disclosure)是安全行业的惯例:先私下告知软件维护者,等补丁就位再公开细节。

门槛设在哪:从「你问了什么」到「你是谁」

半个多月前我写过一篇分析:两用能力的合法与恶意,在请求文本上可以一字不差,区别只在提问者有没有授权,而授权不写在请求文本里,内容分类器读不到这个信号,所以信任判定迟早要从内容层挪到身份层。Daybreak 的设计等于把这个判断变成了产品架构。

看它的准入清单:身份核验、账号安全要求、监控与日志、用途限制、法律承诺书,个人和机构走不同的申请通道;据报道,9 月 1 日起个人 Daybreak 账号强制使用硬件安全密钥(插在电脑上的实体身份验证钥匙,防止账号被钓鱼接管)。审核问的是「你是谁、受不受雇、测的是不是你有权测的东西」,判定重心从请求内容挪到了申请人身份;通过之后,盯着实际用途的是监控和日志。在这之上还有一层 Cyber Partner Program,Accenture、IBM、CrowdStrike 等安全厂商经审核后可以把这些能力做进自己卖给客户的产品里(OpenAI Daybreak 合作伙伴)。

Anthropic 走到同一个方向,但墙砌在不同的层上。它 4 月启动 Project Glasswing,让 Amazon、Apple、Google、Microsoft、CrowdStrike 等创始伙伴访问 Claude Mythos Preview 做防御性安全工作,配了最高 1 亿美元的用量额度,并明确说不计划把这个模型普遍开放(Anthropic);6 月扩到超过 15 个国家的大约 150 家机构,Anthropic 表示首批伙伴至今已用它找到超过一万个高危或严重级别的安全漏洞(AnthropicCNBC)。门槛之外的商业客户则走 Cyber Verification Program:申请人经过审核,通过后解除对两用工作(漏洞利用分析、进攻性安全工具开发)的默认拦截,纯恶意用途无论什么资质都不解锁(Cycode 的参与说明)。

两家的分级授权,机制差异有两处值得拆开看。

第一是闸门砌在哪一层。 两家其实都做了模型级的能力隔离,方向却相反。Anthropic 是留强压弱:最强的 Mythos Preview 不普遍开放,只向 Glasswing 伙伴在受控条件下提供;公开版 Claude Opus 4.7 的网络能力本来就低于 Mythos Preview,Anthropic 说明过在其训练中尝试了差异化压低这部分能力(Anthropic 公告)。所以 CVP 解锁的只是公开版上的默认拦截,解不出公开版权重里没有的东西。OpenAI 是主动训强:把进攻能力专门训练成 GPT-5.6-Cyber 这个独立制品,再通过 Red 层分发。公开版 Sol 护栏全关也只有 2%(按 OpenAI 的说法,那是模型自己发出的拒答),说明两家一样,都没把运行时过滤器当真正的闸门。差别在代价上:OpenAI 造出了一个必须终身看守的高价值资产,权重被盗、内部滥用,防的对象从「越狱者」换成了「拿到钥匙的人」;Anthropic 的强模型不分发,攻击面小,但通过审核的防御者能拿到的公开版,能力上限也被压低了。

第二是准入的最小单位。 Glasswing 收的是组织:审核对象是法律实体,出了事有合同和公司担责。Cyber Verification Program 则没这么清楚:参与厂商 Cycode 把它描述为申请制、以组织为单位(Cycode),而 Anthropic 自己的帮助中心页面把这个计划的对象写成「专业人员」并要求身份核验,没有说明独立个人能不能自行申请(Anthropic Help Center)。目前公开可查的参与者全是组织;到底有没有独立的个人通道,我两边都没能证实。7 月那批抱怨的独立研究员多半还是留在门外,他们流向本地开源权重模型的趋势不会因此改变。OpenAI 则开了明确的个人申请通道,覆盖面广了,审核难度也大了:机构有法律存在背书,个人只有履历和承诺书,所以才需要硬件密钥、日志、用途限制这一整套补偿性监控。

有一点两家一致:OpenAI 在自家风险分级框架(Preparedness Framework)里把 GPT-5.6-Cyber 的网络能力评为 High 档,未到触发最严格管控的 Critical 档。也就是说,按实验室自己的尺子,这还在「可以有条件发放」的区间里。

门槛防得住谁

评价「可信伙伴」这个机制,最容易问错的问题是:它能不能拦住攻击者。多半拦不住,但这不是机制的失败。有决心的攻击者有开源权重的替代品;Hugging Face 事件还展示了另一条路——按 OpenAI 的说明,模型是在被指派的评测里追逐一个狭窄目标时,自行获取了互联网访问,打进了生产系统(联合说明);攻击真实基础设施从来不在评测范围之内,攻击照样发生了。分级授权真正决定的是另一件事:守规矩的防御者被分到哪条渠道。审核通不过的、摩擦太大的、每天要跟拒答讨价还价的,会流向厂商完全看不见的本地模型,7 月的采访已经给出了实例(TechCrunch)。所以衡量这套机制的指标应当是防御者的留存率:门槛过高的失败方式,是把最该被看见的用户推出监控范围。

第二个判断:访问控制管得住生成过程,管不住产物。Red 门槛内产出的一个可用 exploit 是一个文件,离开 API 之后,约束它的只剩协同披露的规范和合同义务。两家实验室都把相当的重量押在披露流程上,OpenAI 靠与伙伴和开源维护者的协同披露,Anthropic 靠对未修复漏洞先公布加密哈希、修复后再公布细节的承诺。整套治理里最该被外部审计的是这一段;它背后有没有合同之外的外部监督,公开材料里看不到,我没能查到相关证据。

第三,等 system card。两条曲线最值得看:一是把「愿不愿」和「能不能」拆开的评测——按 OpenAI 的说法,2% 那堵墙是拒答砌的,拆开的数字能看出这背后还有多少是能力缺口;二是边际提升的算法,对一个已经拿着开源权重模型的攻击者,GPT-5.6-Cyber 多给了多少,这是「High 未到 Critical」这个结论的全部含金量所在。

防御窗口在收窄,这个判断我认同,但收窄的推力有一部分来自做出这些判断的实验室自己。分级授权是两家实验室殊途同归选中的架构,用来同时回应「防御者要用」和「监管要控」,两家的分歧不在要不要模型级隔离,这一步都做了,而在对进攻能力的处理:Anthropic 压低公开版、强模型不分发,OpenAI 把进攻能力训成制品再分发。我的判断是:能力隔离做在模型层,确实比只靠防护层经得起考验,但 OpenAI 的这一步也把「要不要主动训练进攻能力」从一个可以争论的问题变成了既成事实。下一家实验室再面对这个决定时,参照系已经被挪过了。

参考来源