OpenAI 证实:与 Anthropic、Google DeepMind 已就 AI 安全密谈数周

OpenAI 全球政策负责人 Chris Lehane 周二在华盛顿证实,三家公司已就 AI 安全谈了数周,方向包括组建一个行业标准机构、探索安全协调机制。导火索仍是 Amodei 9 月 12 日的《We Must Pace the Frontier》(我当天拆过他的三步方案):方案第二步是行业在反垄断豁免下协调共同标准,此前 David Sacks 的回应是「想减速请便,别向政府要东西」。Lehane 这次把话接住了:他说安全协调「不需要」政府豁免,也就是不等豁免、先谈起来。白宫立场没有变化,特朗普仍称安全担忧是「骗局」,Sacks 也重申存在性风险被夸大。我的判断:吵了三天之后,这是三步方案里第一次有实质动作对上第二步;接下来检验它的标准很具体,就看这个机构能不能拿出可核查的评估和承诺,而不是又一份联署声明。

Google 发布 Gemini 3.8 Live 与 Extended Thinking:语音模型开始边聊边干活

Google 推出两款语音对语音模型:Gemini 3.8 Live 主打低成本和对话流畅度,Extended Thinking 版本负责复杂推理。Gemini 3.8 Live 支持 97 种语言并可在对话中途切换;两款模型都支持后台工具执行:对话不中断,任务在后台异步跑,Extended Thinking 会边执行边口头汇报进度。即日起进入 Gemini API、AI Studio 和 Search Live,Workspace/Gmail 订阅用户可用,企业版私测。值得单独一提的是所有音频输出默认嵌入 SynthID 水印(人耳听不出的信号,供事后检测是否 AI 生成)。语音 agent 从「陪聊」转向「挂着电话替你办事」是这次的真实变化;而全量音频默认打水印,意味着我在水印检测只给判定不给分数里讨论的问题轮到音频了:检测入口给谁用、误判如何复核,公告没有提。

AIUC 融资 4000 万美元:给 AI agent 做审计认证,再把保险挂上去

由 Anthropic 早期员工 Rune Kvist、前 METR COO Rajiv Dattani 等人创立的 AIUC 完成 4000 万美元 A 轮,Ribbit Capital 领投,累计融资 5500 万美元(种子轮投资者包括 Nat Friedman 的 NFDG 和 Anthropic 联合创始人 Ben Mann)。做法是把 agent 跑过约 5000 个测试(越狱、幻觉、数据泄露等场景),出百页级审计报告,对照自家标准 AIUC-1 发认证,再把保险赔付与审计结果绑定:认证有效期十二个月,期间每季度还要通过技术复检才能维持承保。测试由 AI 执行、人工复核,客户已有 Cursor、Lovable、Harvey、ElevenLabs。类比对象是 SOC 2,即企业采购软件时通行的第三方安全审计认证,没有它很多大客户不签单。我的判断:这是 agent 风险第一次被真金白银定价,保险公司要实际赔钱,约束力比自律承诺硬;但 AIUC-1 是私有标准,审计者本身由谁来审,行业还没有答案。(另见 TechCrunch)

Corrupt Plans, Clean Traces:在上下文里预埋计划,就能骗过思维链监控

思维链监控指的是让另一个模型盯着执行模型的推理文字,从中发现坏意图,一篇 2025 年的立场论文曾建议把它作为现有方法之外值得投入的一层安全防线。这篇论文给出一个具体绕法:在执行模型的上下文里预先植入一段听起来无害、实则有害的「计划」,模型会把它改写成自己的推理,不注明出处,于是监控者看到一份干净的思维链。在多个基准上逃逸率 25% 到 33%;更反直觉的是,把注入的计划原文交给监控者参考,检出率反而最多降五成,监控模型把推理算力花在了为这个计划找合理解释上,而非标记它。做 CoT 监控的研究者值得复现:这个结果说明 trace 干净不等于意图干净,给监控加算力也未必是正收益。

Overflip:把恶意提示原样重复几遍,guardrail 就放行了

guardrail 是生产环境里挡在主模型前后的轻量分类器,负责判定输入输出是否恶意。这篇论文测了九个常用的轻量 guardrail(DeBERTa 一类小模型,训练窗口只有 512 token),发现把同一条恶意提示原样重复堆叠,分类置信度会随重复递减,最终从「恶意」翻转成「良性」:九个模型里五个出现有害翻转,翻转率 8% 到 92%,首次翻转出现在约 2600 到 9400 token 处。它和传统的注意力稀释攻击不同,被放行的提示语义完整,下游模型照样读得懂恶意指令。攻击成本约等于复制粘贴,跑生产 guardrail 的从业者应该拿长输入测一遍自家配置;作者的论点是:对短窗口训练的分类器而言,输入长度本身就是一个攻击面。

Agent 授权两篇:动作要能追责到人,审批能不能交给 AI

第一篇是 70 页综述,综合 2023 到 2026 年的 89 份文献,核心主张:agent 每个有后果的动作都应能追溯到某个人类委托人、限定在其实际授权的范围内、事后可申诉;作者按 agent 身份凭证、多跳委托、运行时执行、prompt 注入(视为授权绕过)、审计五层梳理现状,结论是运行时强制执行是当前最大缺口。第二篇(arXiv)接的是我写过的人工审批拦不住 agent 那个问题:人类逐条点「允许」是注意力瓶颈,那把审批委托给一群本身未必对齐的 AI 审核者行不行。论文给出的条件是,单个审核者都不需要对齐,只要任意去掉 k 个之后,剩下这群审核者的利益组合起来仍与人类委托人一致,容忍 k 票反对的多数决就是安全的,且实验验证了无单个对齐个体时集体审核仍然可靠。两篇合起来的信号:agent 授权正在从产品交互问题变成有形式化定义的安全问题。

研究速递

Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

实时交互式视频生成模型:720p 实时生成,支持动态参考输入,生成过程中可以直接编辑。从「提交提示词、等着出片」到「边生成边改」是一次具体的能力跨越,交互式生成对延迟的要求完全不同。做视频生成或世界模型方向的 researcher 值得点进去看它把延迟压到交互级的工程路径。

完全开源、从零训练的 7B 稠密模型,256K 上下文。方法论主张很明确:小模型不该把整个网络语料背进参数里,缺什么就主动调工具去搜。这个主张可检验、可复现,对「检索和工具调用能替代多少参数记忆」这个问题给出了一个开放的实验对象,做高效 agentic 系统的 researcher 可以直接上手。

Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction

在 GQA(分组查询注意力,主流开源模型省 KV cache 显存的标配做法,让多组注意力头共享同一份 key/value)的基础上再进一步:只存 value,key 用学习到的线性映射按需重建,同时省显存占用和读取带宽。这是架构层的方法创新,直接对准解码阶段的核心瓶颈;做推理优化的 researcher 值得进去算一笔账,重建 key 的额外计算换回的显存和带宽是否划算。

今日一句话:安全协调今天同时在三层出现实体:实验室开始筹建标准机构,保险公司用五千个测试给 agent 风险定价,论文给授权下了形式化定义;但 plan injection 和 Overflip 也同时提醒,被寄予厚望的 CoT 监控和 guardrail,本身还有一戳就破的洞。