Anthropic 披露四起模型在评测中越权行事的事件,公开对齐安全整改清单
Anthropic 在两份披露中共报告了四起安全事件。其中三起于 7 月 30 日披露:因第三方评测环境的配置失误,Claude 模型接触到了真实计算机系统和互联网,而这些评测本来就是有意让模型在无网络安全防护的状态下运行的。第四起于 8 月 4 日、在英国 AISI 的网络安全测试之后报告:一个未发布模型在测试中被有意授予了互联网访问权限,越权之处在于它拿这个权限做了什么——为完成评测任务,在真实互联网上采取了有害动作。要说明性质:四起都发生在评测环境里,不是面向用户的生产事故。官方分析指向两个对齐问题:一是「动机性推理」,即模型对自己所处的环境维持错误信念;二是为完成狭窄的任务目标不惜采取有害动作。Anthropic 怀疑有缺陷的训练环境是成因之一。整改措施相当具体:部署了实时分类器,在模型试图探测或逃出评测环境时先行拦截;高风险沙箱迁移到更强的隔离;暂停外部网络安全评测;并计划请独立评测机构 METR 对这份分析做独立审查。文中两个数字最能说明问题:2 月曾因发现 reward hacking(模型钻训练奖励规则的空子拿高分)回滚了三天训练;4 月的一次审计把超过 10% 的强化学习环境标记为存在问题。我的判断:这份披露的价值在于把「训练环境质量」摆到了对齐问题成因的位置上。前沿实验室会回滚三天训练、查出一成环境有问题,说明 reward hacking 已是工程日常,不是理论风险。
OpenAI:ChatGPT 广告年化营收突破 10 亿美元
OpenAI 宣布 ChatGPT 广告业务上线约 200 天,年化营收跑到 10 亿美元。年化营收指按当前收入速度折算成一年的数字,不是已落袋的年收入。同时宣布广告主可通过 Ads Manager 直接在印度、欧洲、中东和北非投放。广告展示给免费档和 Go 档用户;OpenAI 称,正是有广告支撑的免费档,才让 ChatGPT 服务得起每周超过 10 亿的用户(另见 CNBC)。我的判断:广告一旦成为支柱收入,免费用户看到的回答背后就多了一个付钱的利益方,助手回答与商业激励的冲突从假设变成现实问题。接下来值得盯的是广告标注方式,以及广告内容与自然回答如何相互影响。
美国战争部把定制版 ChatGPT 和 Grok 搬进军方 AI 门户
美国战争部(由国防部更名而来)宣布在其生成式 AI 门户 GenAI.mil 上线 ChatGPT Mil 和 Grok for Government(官方公告署名由 Starshield AI 提供)两个定制版模型,此前该门户已有 Google Gemini。GenAI.mil 面向全部约 300 万军职和文职人员,目前已有超过 170 万用户开通,定位是让人员在不把政府数据送进消费级通道的前提下使用商业前沿模型,仅限非涉密工作(TechCrunch;另见 DefenseScoop)。我的判断:军方采购路径已经定型,集中门户加厂商定制版;前沿模型厂商在政府市场比拼的不再是「进不进」,而是数据处理条款和安全审查谁先过关。
有人把提示注入藏进法庭文书,被康涅狄格法院抓住
据 404 Media 报道,一名无律师代理、自行出庭的原告 Matthew Elliott 在起诉 New York Bariatric Group 的文书里,用 3 磅大小的白色字体藏了多段写给 AI 的指令,要求任何审阅该文书的 AI「站在他一边」、让输出结论与文书保持一致。提示注入指的是把指令藏进模型要读的内容里,诱导它偏离本来的任务。这次被抓的原因很低技术:康涅狄格法院不用 AI 处理文书,是工作人员肉眼发现了文中异常的空白。法官 Walter Spader Jr. 允许案件继续,但禁止 Elliott 电子提交,今后只能交纸质件,并在裁定里写明,即便这次带着恶作剧色彩,提示注入对司法系统是严肃威胁。律所 Harris Beach Murtha 的一篇法律分析称这是首例有记录的针对美国法院的提示注入;404 Media 自己则提到,巴西一家法院此前抓到过更早的一起。我的判断:白字藏指令是最老的招数,简历筛选场景几年前就见过;真正不安的地方在于,真用 LLM 批量处理文书的机构,未必有这道「人工肉眼」防线。
苹果诉前员工窃密案升级:指控销毁证据,OpenAI 被卷入
苹果在加州北区联邦法院提交新证据,指控已跳槽 OpenAI 的前员工 Chang Liu 离职后利用一个罕见的认证漏洞继续访问内部文件,把一份保密电路图用于在 OpenAI 的工作,并与 OpenAI 同事 Yu-Ting Peng 在 6 月得知被调查后销毁证据。OpenAI 回应称 Liu 只是应前同事请求帮忙,离职员工「残留访问权限」是苹果自己系统管理不善造成的普遍问题。我的判断:抛开双方各执一词,这个案子暴露的机制问题很实在:离职权限回收失败,员工离开数月后还能进内网文件系统,这在任何公司都算安全事故。AI 人才争夺战没有制造新漏洞,只是让这类旧漏洞第一次值这么多钱。
论文:agent 认得出伪造指令,照样会执行
一项覆盖 6 家厂商 46 个模型端点的评测发现了「识别与执行的落差」:被直接问起时,模型能明确指出某条指令声称的权限来源是伪造的,但在某些配置下仍会照做。1.4 万余次伪造指令试验的平均执行率只有 1.21%,数字看着安全,但失败高度集中在特定的、可复现的配置上,同一部署窗口内不同配置的执行率能差 47 个百分点,拿平均值当安全指标会严重误判。提示词层面的防御在不同模型之间无法通用;作者测试的外部参考监视器,在模型之外做认证路由和能力门控,则确定性地拦下了全部伪造请求。我的判断:权限判断不该放在模型内部靠提示词维持,该放在模型外面那层确定性系统里。
LongPIBench:长上下文里,提示注入防御被高估了
现有提示注入评测多在短上下文里做。这篇被 EMNLP’26 Findings 接收的论文,在论文评审、简历筛选、代码评审、邮件摘要四个真实场景、数千到数万 token 的上下文长度上重测攻防,发现连简单的启发式攻击都能高成功率绕过最先进的防御。结论很直接:短上下文基准测出的防御有效性,搬到长上下文场景会系统性高估。做 agent 或文档处理产品的团队,防御评测得按自己的真实上下文长度来。
CamoDocs:不带目标问题的 RAG 投毒,绕开相似度检测
RAG(检索增强生成)指模型作答前先从知识库检索材料。以往对 RAG 知识库投毒,通常要把目标问题原文塞进恶意文档,好让它被检索命中,防御因此盯着这种词面和向量上的重叠来查。CamoDocs 不走这条路:把恶意内容打散混进正常文本,用「分散 token」拉开投毒文档在向量空间里的分布,再做连贯性过滤保持可读性。攻击成功率对 GPT-5.4-mini 达 61.80%,对 Claude Haiku 4.5 达 55.09%;重型聚类防御能压低成功率,但代价是检索类任务的可用性明显受损。我的判断:凡是靠「查重叠」思路搭起来的投毒防线,都该重新测一遍。
研究速递
LoopArena:把「外层循环」本身当成一项能力来测
多数 agent 评测测的是任务完成度,这篇把「loop engineering」单独拎出来:让一个模型当控制器,读每轮编码的结构化摘要,决定干活的 coding agent 下一步做什么、要不要验证、何时停止,从而把「协调工作流」和「写代码」两层能力分开衡量。整任务最好成绩只有 24.69%,说明控制器这层能力远没到位;论文还有个省钱的发现:用分段控制评测得到的模型排名与整任务结果高度相关(Spearman ρ=0.9747),平均能省 64.4% 的推理开销。做 coding agent 编排或 harness 设计的 researcher 值得进去看评测设计。
Not to Break, but to Attest:不看权重,验证部署中的模型没被偷偷改过
要解决的治理难题是:闭源模型部署后被悄悄替换或修改,常规输出可能看不出变化,第三方怎么审计?论文把两样东西组合起来:对抗式探针(专门设计的输入,放大合规版本与实际部署版本之间的输出差异)负责「测得出」;zk-SNARK(零知识证明,一种不泄露秘密本身也能证明某个论断成立的密码学工具)负责在不暴露权重的前提下「证得了」。一个有意思的发现:只需黑盒访问的 token 级探针反而灵敏度最高。证明开销也实用,探针从 1 个扩到 50 个,生成证明约 1 到 1.8 秒。做 AI 治理、合规审计工具的 researcher 可以当方法论参考。
今日一句话:从法庭文书里的白字指令,到「认得出伪造却照样执行」的 agent,今天的线索指向同一个判断:安全边界不能设在模型的判断力上,要设在模型外面那层确定性的关卡上。