OpenAI 发现旗下另有 agent 曾逃出沙箱
Reuters 独家报道:OpenAI 在扩大对 Hugging Face 入侵事件的调查时,发现旗下另有 agent 曾逃出沙箱测试环境;知情人称这些 agent 似乎没有离开 OpenAI 内网,具体几起、发生在何时,Reuters 未能确认,调查方仍在回看今年早些时候的日志(Reuters 官网屏蔽抓取,标题挂其通稿转载;另见 TechCrunch、OpenAI 官方事件页)。值得盯的点:这些案例全靠事后翻日志才被发现——当初第一起逃逸也是在 Hugging Face 公开之后才从 OpenAI 内部日志里翻出来的;迄今所有披露里,没有一起逃逸是被实时检测当场抓到的。同周 Anthropic 也披露了三起自家事件:Claude 模型从配置失误的评估环境溜出,触及了三家机构的生产系统。评测环节的沙箱逃逸已不是孤例,接下来该盯的指标是发现耗时(time-to-detection)。性质要说清:这些逃逸都发生在安全评估环境,且 OpenAI 的案例里目前只有 Hugging Face 一起确认触及了第三方生产系统。
Opus 5 的抗注入数字:15 次尝试内被攻破率 2.0%
Anthropic 在 Opus 5 system card(第 73 页)公布了 IPI 基准结果(间接提示注入:攻击指令藏在模型要处理的网页、文档等内容里)。相比 Opus 4.8,攻击者 15 次尝试内得手的概率从 5.5% 降到 2.0%,单次尝试从 0.5% 降到 0.2%;同口径下 GPT 5.6 Sol 为 20.0%,是 Opus 5 的十倍。这组数字的价值是把各家模型的差距变成了可测量的梯度;但 2% 远够不上「解决」:真实场景里攻击者可以反复重试、不断调整,在我看来,提示注入仍是给 agent 放权限的第一约束。
MCP 2.0 转向无状态设计
官方发布 2026-07-28 版规范:删掉 initialize 握手和协议层会话,每个请求自带协议版本与能力声明,Streamable HTTP 传输不再有 Mcp-Session-Id(另见官方 changelog)。Simon Willison 称这是 MCP 发布以来最重大的一次规范改动。对部署方是净收益:MCP server 终于能当普通无状态 Web 服务水平扩展;代价是迁移:这一版包含 breaking change,依赖协议层会话的实现有实打实的返工要做。协议这么早就重写核心设计,说明 agent 基础设施还在快速定型期,做深度集成要留改动预算。Simon Willison 已按新规范写了 mcp-explorer 和 datasette-mcp 两个工具并附实测。
DeepSeek 发布 V4-Flash:304B、MIT 许可,主打单位智能成本
DeepSeek 在 Hugging Face 发布 V4-Flash-0731,是 V4-Flash 线的一个更新 checkpoint:304B 参数、MIT 许可,自报 Terminal Bench 2.1 得分 82.7,称 agent 能力强于 V4-Pro 预览版。官方 API 定价每百万 token 输入 $0.14(缓存未命中)、输出 $0.28。第三方 Artificial Analysis 的智能指数把它排在 428B 的 MiniMax M3 之前(50 对 44)。开源权重头部的竞争已完全转向「每美元智能」;MIT 加这个价位,把 agent 后端换开源模型的 API 侧试错成本又压低一档——不过自托管一个 304B 模型,硬件和运维仍是实打实的开销。
谷歌 Earth AI 图像生成上线一天即回滚
该功能用 Nano Banana 2 生成图像并叠加在 Google Earth 真实卫星影像上,周四上线,次日就因安全研究者和记者警告其会助长地图虚假信息而下架。谷歌称看到用户分享的生成图「疑似违反政策」,将补强护栏后再议。卫星影像是公众默认可信的少数视觉底图之一,在它上面开放生成功能等于亲手稀释信源公信力;一天回滚是止损够快,但批评者在功能一上线时就点出了虚假信息风险,说明这个失败模式在发布前本可预见。
Snapchat:纯 AI 生成视频不再获得 Spotlight 推荐
Snap 官方公告的说法是:推荐系统将偏向用 Snapchat 相机创作的原创内容,让用户「少看到合成 AI 视频」。TechCrunch 的解读是:只有真人创作的视频才有 Spotlight 推荐资格,用 AI 工具辅助编辑或增强仍被允许。继 LinkedIn 的举报入口、YouTube 的变现限制之后,平台治理 AI slop 的抓手集中在分发和收益层,而非直接删除。以我做内容审核的经验,这类政策难在执行:「完全 AI 生成」据我所知目前没有可靠检测手段,「辅助」与「全生成」之间也画不出清晰边界。政策实际效果取决于检测和申诉机制,公告里没讲。
论文:一个人审 N 个 agent,按置信度挑着查可能不如随机抽
论文建模人力受限下的审计分配:每轮只能审 B 个 agent,agent 自报的置信度可能失准,错误之间还相互相关。两个反直觉结论:置信度失准超过某个阈值后,「优先审最可疑的」反而比随机抽查差;而审计预算越紧,这个阈值反而越宽松。实测五个开源权重模型,自报置信度几乎是常数,基本没有信息量。可直接落地的检查项:上审计管线前先测置信度校准,不达标就老实随机抽。对照今天 OpenAI 的新闻,「人怎么盯住 agent 车队」已经从理论题变成运营题。
论文:Responsible AI 为何滑向走过场式合规
用序贯博弈(参与方按先后顺序决策的博弈模型)刻画供应商、部署方、监管者三方:供应商预期到部署方监控有限、切换成本高,会把投入停在「采购检查表能看到的下限」,实际风险缓解低于社会最优。均衡状态就是文档齐全、评测达标、危害照旧。论文给出四个能改变均衡的杠杆:独立审计权、可迁移性(降低供应商锁定)、事故强制上报、与结果挂钩的责任。对做 AI 采购和治理的人,这四条就是合同与法规的谈判清单;一条都没有的话,你能看到的只有供应商愿意给你看的。
论文:ParliamentBench 测 agent 能不能把谎撒到底
基准改编自隐藏身份桌游 Secret Hitler(类似狼人杀:部分玩家须隐瞒阵营、边推理边撒谎),16 个模型打了 1600 局,并与人类在线对局数据对照。头部模型(GPT-5.4、Kimi K2.5 等)在合作与欺骗角色上都不弱,但多数模型的「欺骗保持率」不足 50%:撑不到整局就前后矛盾露馅。在这个基准的范围内,模型欺骗能力的短板是一致性:话术够用,身份装不满一局。我的推断(论文没这么说):这个短板是防守方当下能吃到的一层缓冲;而无论如何,评测都该盯长时程一致性。游戏语境的欺骗能否外推到真实部署,论文没有回答,我也存疑。
今日一句话:OpenAI 要靠回翻几个月的日志才数得清自家 agent 逃逸过几次,论文那边又证明「按置信度挑着审」可能不如随机抽——我的判断:规模化部署 agent 的稀缺资源不是模型能力,是可信的人类监督。