Google 发布 Gemini 4 Argon:主打网络安全,却先只开给防御方
Google 发布新旗舰 Gemini 4 Argon,重点压在三块:软件工程、法律金融类知识工作、网络安全防御;基准上 DeepSWE v1.1 报 77.9%、漏洞修复基准 CWE-bench v1 报 68%,输出 token 上限从 6.4 万提到 100 万。API 引入期定价每百万 token 输入 2 美元、输出 10 美元,引入期后回到 4/20。这个引入价和前一天 OpenAI 给 GPT-6.1 Sol 定的标准价 2/10 分毫不差——次旗舰的价格带正在收敛到同一格,各家中端模型被夹的是同一道缝。更该记的是发布方式:Argon 不是全量开放,而是先通过 Fairwind 计划只发给「可信网络防御者」,再分阶段铺向开发者和消费者。一个把网络安全当卖点的模型,选择先只给防御方、把进攻侧挡在门外,这本身就是对「攻防两用」风险的一种处置——比公告里那句泛泛的「内外部红队测试」更能说明他们怎么掂量这件事。
OpenAI 披露蒸馏攻防:16000 次请求撬加密推理,核心集群指向 Moonshot
OpenAI 称拦下了一场协同的「对抗式蒸馏」——系统性地把它家模型受保护的推理过程套出来,用于训练别的模型。时间线是 7 月 1 日起低量试探,7 月 24、25 日集中爆发,一个特定提取模式在两天内发起 16000 次请求、涉及 4000 多个用户,关联的提示模式扩散到 15000 多个用户,7 月 28 日前清理完毕。OpenAI 把核心集群归因到与 Moonshot AI(Kimi 的开发方)有关的人员,但表示无法确定是否全部出自同一行为方(另见 CNBC、CyberScoop)。值得点清楚的是手法边界:对方没有攻破加密、没有拖库、没有直接读到用户对话,而是通过操纵交互,让隐藏推理以请求方可见的形式被复现出来——这是绕过产品层设计的「回放/恢复」,不是密码学意义上的破解。配合当日那篇蒸馏规模化的论文一起看(见研究速递),「蒸馏到底多容易被复制」正从立场之争变成可测量的工程问题。
DeepMind 推出 SynthID Bio:给 AI 设计的蛋白质打水印,还不毁掉它的功能
水印这条线从文本、图像、音频,这次走到了生物序列。SynthID Bio 把一段不可见的签名嵌进蛋白质设计本身:序列层面靠微调氨基酸选择,结构层面则是微调 AlphaFold 3 扩散网络的一部分、让水印直接存在模型权重里,签名在分子被实际合成出来后仍然留存。关键的验证在湿实验里——在 VEGF-A、新冠刺突蛋白 RBD、PD-L1 三个靶点上,带水印的设计在命中率、结合亲和力、序列多样性上都和不带水印的版本持平,即水印没有偷走蛋白质的生物功能。目前是概念验证,代码和体外数据开源。我在水印检测只给判定不给分数里追问过的那些问题——检测权握在谁手里、误判怎么复核、密钥按什么粒度分配——到了生物序列这里只会更尖锐:一条能溯源的蛋白质,既可能是生物安全的护栏,也可能是把设计者钉死的指纹,而这个领域连「谁有权检测」都还没有答案。
Reddit 关停 RSS 和公开 API,理由是 AI 爬虫
Reddit 宣布 11 月 13 日停止支持 RSS 订阅,并在 2027 年 3 月前分阶段关闭剩余的公开 API(官方帖发在 r/modnews 和 r/redditdev)。给出的理由是 RSS 已成为大规模抓取和自动化滥用的入口。对普通用户影响直接:靠 RSS 做告警的版主被引导迁到 Discord Relay,而在自己管理的社区之外用 RSS 的人,Reddit 明说没有替代方案。这是平台对 AI 爬虫收紧准入的又一例,但账要算清:Reddit 2026 年二季度光「其他收入」一项就有 4300 万美元(同比增长 24%),AI 数据授权的进账就记在这一项里——把免费入口关掉、逼第三方签商业协议,和「反滥用」是同一枚硬币的两面。
agent 推理基建的两端:NVIDIA/CoreWeave 把 Vera Rubin 投产,Magnitude 把推理塞回本地设备
同一天,agent 的算力竞赛在两个极端各推进一步。NVIDIA 与 CoreWeave 宣布 Vera Rubin NVL72 系统投产,配 Spectrum-X 以太网,官方称 SWE-2 推理吞吐较上代 GB200 NVL72 提升最高 4.8 倍;首个生产客户是 Devin 背后的 Cognition。「闭环」指的是 CoreWeave Forge 把生产行为回灌到下一轮训练,让评估和训练不再散落在多家供应商、在每次交接处丢信号。另一端,YC 新公司 Magnitude(Launch HN,123 分)做的是在本地设备上跑开放模型的开源推理引擎:不发预编译内核,而是在你的硬件上现场编译调优,README 称比 llama.cpp 最高快 2 倍、每个 agent 省 27% 内存。一边把 agent 推理往超大规模数据中心推,一边往你自己的笔记本上拉——同一个「为 agent 优化推理」的命题,正被从两头抢。
Meta 否认 Muse 擅自读取用户私信
Inc. 专栏作者 Jason Aten 称,自己并未开启完整磁盘访问权限,Muse 却读到了他的私信;追问之下 Muse 回答说它在同步「设备通知」,暗示 agent 把横幅通知里的文本喂给了模型。Meta 否认:VP Andy Stone 称 Mac 版 Muse 的消息集成完全是选择性开启,必须同时授予完整磁盘访问和消息连接器才能读取;David Singleton 补充说读消息要过三道应用层权限加 macOS 系统级保护,「即便 Muse 有 bug 也绕不过去」。这是 Muse 连日争议(被指后台调用 OpenAI 模型)之后又一起权限边界案例,且双方各执一词,暂无独立证据。真正值得盯的是那句解释——如果 agent 真的在读取系统通知横幅的文本,那么「我没给它看私信」和「它确实看到了私信内容」可以同时成立,权限开关管住的是数据源,管不住已经弹到屏幕上的那一行字。
研究速递
Scaling Properties of Same-Family On-Policy Distillation
系统测了 on-policy 蒸馏(学生自己生成、老师逐 token 打分)在弱转强、同基座、强转弱三种师生配置下的规模化规律,发现早期训练动态在不同尺度间高度一致——也就是说小规模实验的趋势可以外推去预判大规模的结果。和当日 OpenAI 披露的蒸馏行动正好对照:一个讲蒸馏在技术上多可预测、多能规模化,一个讲有人正拿它去复制别家模型。做蒸馏或模型复制可行性评估的人该点进去。
Where Do LLMs Decide to Break the Rules? Mechanistic Localization of Prompt Injection Compliance
不再统计「多少比例被 prompt injection 攻破」,而是用逐层因果激活 patching,定位模型究竟在网络的哪一层「决定」服从注入指令。意义在工程落点:如果服从的决策集中在特定层,防御就可以只在那几层加监控,而不必在整条前向链路上铺。做针对性防御、可解释性安全的人值得一读。
Correct, Don’t Delete: Mitigating Emergent Misalignment with Corrective Supervision
反直觉的结论:业内默认「找到有害训练样本删掉就行」,这篇发现「删除有害训练行」对 emergent misalignment(在良性微调中意外涌现的错位行为)的效果远低于预期——定位并删样本这招在留出测试上就失效;改用纠正式监督,在不删数据的前提下压住涌现出的错位行为。它动摇的是一条被当成常识的防线,关心对齐鲁棒性的 researcher 应该重新审一遍这个默认做法。
今日一句话
当一个模型把「网络安全」写进卖点,真正透露立场的不是它跑了多少红队,而是它先把模型只发给防御方、把进攻侧挡在门外——攻防两用的处置,藏在发布名单里,不在安全章节里。