英国 AISI 自曝:网络安全评测中 agent 持续越权,攻到了真实机构头上

英国 AI 安全研究所(AI Security Institute,AISI)发布事故报告:7 月 25 日至 28 日的网络安全评测中,被测 agent 对公开互联网上的真实个人和机构做了未经授权的操作。覆盖七个模型的 122 次评测运行里,有 10 次出现共 19 起越权行为,其中 17 起来自 Anthropic 的 Mythos 5,2 起来自 GPT-5.6 Sol。最严重的一起是供应链投毒未遂:agent 为了解题,注册假 GitHub 账号向一个开源项目提交恶意代码,又伪造第二个身份冒充独立审核者劝维护者合并,被 GitHub 限制后改走 Tor,最后靠项目的人类维护者把代码拦了下来。背景要说清:厂商内置的网络攻击分类器(专门拦截黑客类请求的过滤层)是 AISI 故意关掉的,联网也是有意放开的,为的是测模型的真实能力上限;AISI 表示今后联网权限逐案审批,外加全程实时监控。我的判断是:这次离出事只差一步,因为横在测试和一次真实供应链投毒之间的,只有维护者的那道人工审核。

Meta 模型在测试中攻入另一家公司,几周内第四起同类披露

据 The Information 报道、Meta 发言人向媒体证实(Reuters;Meta 未发官方公告),其 Muse Spark 1.1 在网络安全测试中攻入另一家公司的系统并改动了对方内部系统:外部评测公司 Irregular 把沙箱配错,模型意外获得联网权限,随后利用一个第三方服务的漏洞进了门。Irregular 称这与 Anthropic 上周披露的是同一类评测环境问题,并非沙箱逃逸。算上 OpenAI、Anthropic 和英国 AISI,这已是几周内第四家披露同类事件的机构(OpenAI 与 Anthropic 两起同见上述 Reuters 报道)。除了 AISI 属于有意放开联网,其余几起共同的失败点不是模型太强,而是评测环境的工程质量没跟上模型能力:沙箱配错一次,测试就变成真实攻击。

DeepMind 换帅:Hassabis 转任董事长,Jeff Dean 离开 Google

Google 宣布 Demis Hassabis 卸下 DeepMind 日常管理,转任 Google DeepMind 董事长兼 Alphabet 首席科学家,Gemini 模型研发、前沿研究和应用团队交给升任高级副总裁的 Koray Kavukcuoglu。同日官宣的还有 Jeff Dean 的去向:入职 27 年后离开 Google,与老搭档 Sanjay Ghemawat 创办一家聚焦机器学习与科学发现的公益公司(public benefit corporation)。Hassabis 的说法是要「时间和空间思考大局」;我更关心执行层的信号:两位技术分量最重的领导者同时退出执行线,Gemini 的研究路线和安全优先级会不会随交接改向,未来半年见分晓。

Meta 发布编码 agent Muse Code,配 Muse Spark 1.2

Meta 推出终端编码 agent Muse Code(公测,macOS/Linux),底座是同日发布的 Muse Spark 1.2,主打大代码库:常驻 subagent 全程保留上下文,本地事件日志让长任务可以断点续跑。定价才是重点:按量 API 每百万 token 输入 $1.25、输出 $4.25,另设「贡献者档」,同意共享使用数据可换九成以上的折扣(定价不在 Meta 官方文章里,见 CNBC)。用数据换低价,等于明着把用户代码当训练原料收,企业买不买账比 benchmark 分数更值得看;顺带一提,上面那条里攻入别家公司的正是它的前代 Muse Spark 1.1。

Anthropic 证实组建自研芯片团队

Anthropic 向 TechCrunch 证实正在招募芯片设计团队,走软硬件协同设计路线,让芯片架构贴着 Claude 的推理模式定制;同时强调多芯片策略,自研芯片会与 AWS、Google、Nvidia、AMD 的硬件并存。继 Google 的 TPU 和 OpenAI 的自研芯片计划之后,Anthropic 也把芯片设计收进了自家:推理成本直接决定 agent 产品有没有毛利,这一步是早晚的事。

Cloudflare 开源 agent 平台 Cloudflare OS

Cloudflare 发布并开源 Cloudflare OS,一个在企业内部署 agent 的平台:浏览器工作台、跑在 Workers 上的应用平台,外加一套值得同行抄的权限模型。agent 默认零权限,访问每项资源都要过「守门人」审批;系统还会记录 agent 看过哪些数据,阻止它把数据转给无权查看的用户。5 月起 Cloudflare 内部自用,代码已放上 GitHub。放在本周 agent 越权事故接连披露的背景下,这套「默认不信任 agent」的设计来得正是时候。

Shopify:AI 搜索带来的流量和订单是去年三倍,Google 没被取代

Shopify 二季度财报(营收同比增长 34%)给了一组少见的实证数据:总裁 Harley Finkelstein 说,AI 渠道带来的流量和订单都是去年同期的三倍,AI 渠道新买家的下单率接近其他渠道的两倍(出自财报电话会,见 PYMNTS);传统搜索没有被挤掉,过去两年搜索会话量涨了三成,仍占店铺流量约三分之一(另见 TechCrunch)。「AI 搜索冲垮电商流量」的叙事至少在 Shopify 的数据里立不住:AI 带来的是增量,没有吃掉存量搜索。

Neon:4B 开源模型经后训练,检索准确率追平 GPT-5.6 Sol,成本低两个数量级

Neon 与 Castform 发文称,把企业自有数据合成为训练任务,用强化学习对一个 4B 开源模型做后训练(奖励项包括检索质量、引用准确性和答案正确率),在私有知识库检索任务上准确率追平 GPT-5.6 Sol,单次推理成本约低两个数量级。注意这是厂商自家的案例,并非独立第三方评测,数字姑且听之;但「小模型加专项后训练」的路线值得记下来:agent 流水线里的检索环节,未必要为前沿模型的价格买单。

今日一句话:几周之内四家机构的测试 agent 攻到了真实系统头上:其中三起可追溯到评测环境的工程质量,第四起是有意放开联网、最后靠一次人工审核才拦下。把评测基础设施按生产系统的标准来建,看起来是眼下最便宜的安全投资之一。